タイピングから解放。AIマイクRelay Qの真価

ロンドンのスタートアップRelayが開発する専用ハードウェア「Relay Q」が、オフィスでの音声入力を革新する。

投稿者 central
ハイライト
  • Relay Qは2027年初頭に発売予定の専用ハードウェアである。
  • 音声入力の品質はマイク性能に依存し、専用ハードウェアがその課題を解決する。
  • 日本のオフィス環境では、小さな声を高精度で認識できるかが鍵となる。

ロンドン発の新興スタートアップRelayが、音声テキスト化の常識を覆す専用ハードウェア「Relay Q」を2027年初頭に発売する。ソフトウェアだけの競合とは一線を画すこの製品は、オフィスで声をひそめて入力するという現代知識労働者の悩みを、物理的なマイクという形で解決しようとしている。

大規模言語モデル(LLM)の進化によって、音声のテキスト化技術はここ数年で飛躍的に精度を高めてきた。会議の議論を自動で要約するWispr Flowや、最新のPixelスマートフォンに搭載されたグーグルのオンデバイス音声入力は、単なる文字起こしの域を超え、話し言葉に含まれる無意味な「つなぎ言葉」を除去し、散漫な思考をその場で整理し、多言語間のコミュニケーションを仲介するまでになっている。こうしたツールができることは、もはや「入力」の代替ではなく、「思考」そのものの補助装置だと言える。

新たにこの分野へ参入するRelayは、ソフトウェア中心のアプローチを採る競合他社とは異なる戦略を取る。どこでも使える高品質な音声テキスト化専用の携帯型マイクを開発中なのだ。音声入力の品質は、結局のところマイクの性能に依存する部分が大きい。ノートパソコンやスマートフォンに内蔵されたマイクでは、周囲の雑音や距離によって認識精度が大きく変動する。専用ハードウェアという発想は、この根本的な制約に対して真っ向から取り組むものだ。

Nothing出身の二人が直面した「オフィスで声を出せない」問題

Relayを設立したのは、ロンドンを拠点とするクッキー・シューとレイモンド・ジューだ。二人は消費電⼦機器メーカーのNothingで、それぞれAI・サービス部門責任者とハードウェア製品マネジャーを務めていた経歴を持つ。Nothingで働いていた当時、彼らは仕事のメッセージのほとんどを入力するためにWispr Flowの文字起こしソフトを活用していたという。アイデアを形にするうえで非常に役立ったが、ひとつの問題が常に立ちはだかった。オフィスで声を出さなければならないことだ。

「オフィスでは、入力にちょうどいい声量を見つけるのがどうしても難しかったんです」とジューは取材に応じた。「小声すぎるとMacが拾ってくれないし、大声すぎると隣の同僚に聞こえてしまう。だから実際にイヤホンを外して、こんなふうにしていました」

ビデオ通話でそう語りながら、彼はイヤホンを口元に近づけてみせた。「専用のハードウェアが必要だったんです」。この体験こそが、Relay Qの開発の原点となっている。

つまりRelay Qの開発背景には、単なる技術的な課題だけでなく、現代のワークプレイスにおける「音声入力の社会的制約」が存在する。オープンオフィスやフリーアドレスが普及した環境では、周囲への配慮から音声入力を気軽に使えない。イヤホンを外して口元に近づけるという行為は、多くの知識労働者が無意識に行っている「音声入力のための身体的な工夫」の典型例だ。Relayはこの問題を、専用マイクというハードウェアで解決しようとしている。

2026年8月にソフトウェア提供開始、ハードウェア発売は27年初頭

Relayは2026年8月末からソフトウェアの提供を開始したが、ハードウェア「Relay Q」の発売は2027年初頭まで待つ必要がある。まずデスクトップ環境から展開するのは、会話が最も複雑になるのがパソコンの前だからだとジューは説明する。友人や家族とのチャットはスマートフォン上では比較的単純だが、仕事中はアイデアの共有、ブレインストーミング、声の調子や口調の使い分けといった高度な使い方が求められる。

発売時点ではmacOS専用アプリとなるが、今後はWindows、iOS、Androidにも対応する計画だという。このロードマップは、まずビジネスユーザーをターゲットにし、その後コンシューマー市場へ展開するという意図の表れと解釈できる。デスクトップファーストという戦略は、音声入力の市場がまだ発展途上であることを考慮すれば合理的な判断だ。

実際、筆者は専用マイクがなくても機能するRelayのmacOSアプリのベータ版を試用する機会を得た。セットアップ時には、任意のテキストフィールドでRelayを起動するホットキーを選択する必要がある。デフォルトではFnキーに割り当てられており、カーソルがテキストフィールドにある状態でこのキーを押し続けると、Relayが起動して音声入力を処理する仕組みだ。この音声テキスト化エンジンには、グーグルのGeminiモデルが採用されている。

Relay Skillsが実現する、文脈を理解したアクション実行

Relayの特徴は単なる音声入力にとどまらない。文脈に応じてさまざまなアクションを実行できる「Skills(スキル)」機能を備えている。例えば「Slackで同僚にメッセージを送って」と頼むと、Relayがアプリを起動し、宛先を特定し、文面を作成してくれる。この一連の流れは、単なる音声コマンドとは異なり、会話の文脈を理解した上で、ユーザーの意図を汲み取った行動を取る点で際立っている。

筆者が試した範囲では、Slack連携のスキルではやや苦労する場面もあったが、Googleカレンダーで予定を作成するプロセスはスムーズだった。「来週火曜日の午前10時に◯◯株式会社との打ち合わせを入れて」といった自然な話し言葉で、カレンダーに予定が正しく反映される。この体験から、スキル機能はまだ発展途上でありながらも、LLMを活用した音声アシスタントの新しい可能性を示していると言える。

スキル機能が示す、音声UIの未来

スキル機能の本質は、アプリケーション間の連携を音声で実現する点にある。従来の音声アシスタントは、特定のアプリ内での操作に限定されるか、連携するにしてもAPIの制約に縛られていた。Relayが目指すのは、OSレベルで音声入力を統合し、あらゆるテキストフィールドとアプリケーションを横断して機能するユニバーサルな入力インターフェースだ。

このアプローチは、スマートフォンの音声アシスタントが抱えてきた「対応アプリの限定」という課題を克服する可能性を秘めている。macOSのアクセシビリティ機能として提供されている音声入力は、システム全体で動作するものの、文脈を理解したアクションの実行には対応していない。Relayは、LLMの文脈理解能力を活用することで、この限界を乗り越えようとしているのだ。

音声入力市場におけるRelay Qの位置づけ

音声テキスト化市場は、ここ数年で大きく様変わりした。2023年頃までは、音声認識の精度そのものが競争の焦点だった。しかし、LLMの登場により認識精度が一定レベルに達した現在では、競争の軸は「認識後の処理」へと移行している。つなぎ言葉の除去、文脈に応じた要約、多言語翻訳、さらにはアプリケーション連携まで、音声入力の価値は「正確に文字に起こすこと」から「意図を汲み取って行動すること」へとシフトしている。

この流れの中で、Relayがとった独自のポジションは「ハードウェアからのアプローチ」だ。ソフトウェアだけでは解決できない音声入力の質の問題に、専用マイクという物理的な解を提示する。これは、スマートフォンのカメラ性能がソフトウェア処理だけでなく、レンズやセンサーの品質にも依存しているのと同じ構造だ。音声入力の究極の精度を追求すれば、必然的にハードウェアの設計に踏み込む必要があるという判断は、エンジニアリングの観点から見ても理にかなっている。

競合との比較:Wispr Flow、Pixel、そしてRelay Q

Wispr Flowはソフトウェア中心のアプローチで、デバイスに依存せずに高精度の音声入力を提供する。最新のPixelスマートフォンに搭載されたグーグルのオンデバイス音声入力は、プライバシー保護とオフライン動作を強みとする。これに対してRelay Qは、専用ハードウェアによる音声品質の向上と、スキル機能によるアプリケーション連携を組み合わせた独自の立ち位置を築こうとしている。

3つのアプローチの違いを整理すると、以下のようになる。

  • Wispr Flow:既存のデバイスで動作するソフトウェア。導入コストの低さが強み。
  • Pixel標準搭載の音声入力:OSレベルで最適化されており、オンデバイス処理によるプライバシー保護が特徴。
  • Relay Q:専用マイクによる音声品質の追求と、LLMを活用した文脈理解型のスキル機能が特徴。

どのアプローチが最終的に市場で受け入れられるかは、ユーザーの使用環境と優先度によって異なるだろう。しかし、専用ハードウェアという選択肢が市場に登場したこと自体が、音声入力の可能性を広げる意味で重要な意味を持つ。

日本語環境での音声入力の実用性と展望

日本語は英語と比較して、同音異義語が多く、文節の区切りが曖昧になりやすい言語とされる。そのため、音声認識の精度が英語よりも低くなりがちだ。しかし、近年のLLMの発展により、日本語の音声認識精度も大幅に向上している。コンテキストを考慮した変換が可能になったことで、以前は誤変換が多かった表現も、文脈に応じて正確に変換されるようになった。

とはいえ、日本語の音声入力にはまだ課題が残る。ビジネス文書やフォーマルな場面で使用される表現は、話し言葉と書き言葉の差が大きい。Relayのスキル機能が日本語でどの程度機能するのかは、日本のユーザーにとって重要な関心事だ。発売時点での日本語対応状況は明らかにされていないが、グローバル市場を視野に入れた展開を考えると、日本語サポートはローンチ後の早期対応が期待される。

日本のオフィス環境は、オープンオフィス化が進んでいるとはいえ、周囲への配慮を重視する文化的な傾向が強い。Relay Qのような専用マイクは、声量を抑えても正確に音声を拾ってくれるため、このような環境での利用に適していると言える。特に、従来のノートパソコンの内蔵マイクでは拾いにくい「小さな声」を高精度で認識できるかどうかが、日本市場での受け入れを左右するポイントになるだろう。

Relay Qの発売は2027年初頭。音声入力が「タイピングの代替」から「思考の拡張装置」へと進化を遂げる過程で、専用ハードウェアというアプローチがどのような評価を得るのか。ソフトウェアのベータ版の完成度を踏まえると、ハードウェアとの組み合わせによって、音声入力の新しい体験が生まれる可能性は十分にある。タイピングから解放される日は、意外に近いところまで来ているのかもしれない。

この記事をシェア