Metaは9日、音声認識分野における新たなモデル「Muse Voice Transcribe」を発表した。このモデルは、リアルタイムの文字起こし、発話の終端検出、そして20名以上の話者識別(ダイアライゼーション)を、1時間あたりわずか0.18ドルという低価格で実現する。開発元はMeta Superintelligence Labs。単なる音声認識の性能競争ではなく、コストと機能を一体化した新たな選択肢として、企業向け音声AI市場に大きな波紋を投じている。
20人超の話者識別を内包した統合アーキテクチャ
Muse Voice Transcribeの最大の特徴は、音声処理の各機能を個別のパイプラインとしてではなく、単一のAR(自己回帰型)マルチモーダルアーキテクチャ内で統合した点にある。音声は80ミリ秒(1秒間に12.5個)のチャンクとして処理され、それぞれがソフトトークンに変換される。モデルは各ステップで、さらなる音声を取り込むか、テキストを出力するかを自律的に判断する。
この仕組みをMetaは「アダプティブディレイ」と呼ぶ。従来のモデルのように全ての単語に一律のレイテンシを課すのではなく、発話が曖昧な場合にはより長く待ち、十分なコンテキストが得られた時点で即座に出力する。この行動は強化学習によって訓練され、単語誤り率(WER)と遅延の両方を報酬として最適化されているという。
話者識別もこのトークンシーケンスに組み込まれている。<|start_of_turn|>トークンが新たな話者の開始を示し、<|speaker_A|>のようなトークンで話者を特定。さらに発話の開始と終了を示すトークンが追加される。Metaは、ASR(音声認識)、ダイアライゼーション、エンドポインティングを別々の後処理としてではなく、一体として訓練した点を強調している。
話者識別の性能比較と現実的なポジショニング
Museが対応する20名以上の話者識別は、業界最高水準ではない。主要競合のスペックを確認すると、Speechmaticsはリアルタイムの話者識別においてデフォルトで50名、上限を引き上げれば最大100名の識別が可能と明記している。Amazon Transcribeは最大30名の話者識別を、ストリーミング転写も含めてサポートする。
一方で、Sonioxは最大15名、AssemblyAIは1から10名の間で設定可能としており、Museの20名以上という数字は市場のハイエンドに位置する。xAIのSpeech-to-Text APIもストリーミングでの話者識別をサポートするが、現時点では最大数を公開していないため、直接比較はできない。
ただし、Metaはローンチ資料において、20名以上の同時参加者を実際にデモしたわけではない。公開されている主なデモは8名の話者によるもの、長時間の録音デモでも11名のラベル付き参加者にとどまっており、20名以上はあくまでモデルの対応能力としての表明である点には注意が必要だ。
0.18ドル/時間の攻勢的価格
Museの価格設定は競争力を大幅に高めている。API利用料金は1000分あたり3ドル、すなわち1時間あたり0.18ドル。ストリーミングと非ストリーミングで同一料金であり、データ保持ゼロの処理も標準料金と同額。課金は実際に処理された音声の秒単位で、切り捨てられる。
主要競合の1時間あたりの料金を比較すると、Sonioxが最も安いレートを公表しているものの、Museは話者識別が込みである点で特に有利だ。DeepgramのNova-3 Multilingualストリーミングは約0.35ドルだが、話者識別には1分あたり0.002ドルが追加され、合計約0.47ドルとなる。AssemblyAIはUniversal-3.5 Pro Realtimeで0.45ドル、ストリーミングダイアライゼーションにさらに0.12ドルが加わる。
1000時間の音声処理を行った場合、Museの料金は約180ドル。話者識別を別途課金するサービスと比較すると、そのコスト差は顕著だ。
ベンチマークで示すトップクラスの精度
低価格が精度の犠牲を伴うものではないことも、Metaの公表データは示している。Artificial AnalysisのAA-WERストリーミングインデックスにおいて、Museは最終的な文字起こしの単語誤り率(WER)3.1%を記録。Cartesia Ink-2の3.4%、ElevenLabs Scribe v2 Realtimeの3.6%、Qwen3 ASR Flash Realtimeの3.7%を抑え、首位を獲得した。
さらに、話者識別の性能を示すダイアライゼーションエラー率(DER)でも、MuseはAMI-IHM、AMI-SDM、VoxConverseの各データセットで平均17.5%と、競合を下回る結果を示している。ただし、このベンチマークはMuseの最大話者数である20名以上でテストされたものではなく、各競合もその公称最大話者数で測定されたわけではない点は理解しておく必要がある。
エンタープライズ向け機能の実用性と制約
Museは現在、ターンレベルのタイムスタンプを提供するが、単語レベルのタイムスタンプや単語レベルの信頼度スコアはサポートされていない。また、サウンドイベント検出や感情認識も現時点では提供されない。APIのデフォルトでは1テナントあたり8つの同時ストリーム、リアルタイムセッションは60分で再接続が必要となるなど、導入にあたってはいくつかの制約がある。
それでも、会議システム、コール分析、ライブアシスタント、アンビエントAIなど、複雑なリアルワールドの会話を処理する必要があるエンタープライズ開発者にとって、Museの提供する「20名以上の話者識別」「低レイテンシ」「多言語コードスイッチング」「低価格」の組み合わせは、極めて現実的な選択肢となる。
Metaは、単なる音声認識モデルの性能競争ではなく、話者識別を含めた総合的なコストパフォーマンスと実運用での精度で市場に挑む。競合他社は、生の音声認識の精度だけでなく、話者を正確に特定しながらの運用コストという新たな競争軸に直面することになるだろう。