マイクロソフト(Microsofta)は、音声認識モデル「MAI-Transcribe-2」を正式公開した。同社はこれを「世界最速、最高精度、そして最安値の音声認識モデル」と位置づけ、その価格は1時間あたりわずか0.10ドル(約15円)に設定された。この価格は、OpenAIやGoogle、ElevenLabsが提供する既存の競合製品を大幅に下回るものであり、エンタープライズ向け音声認識市場に大きな変革をもたらす可能性を秘めている。
MAI-Transcribe-2の最大の特徴は、その圧倒的なコストパフォーマンスにある。例えば、コールセンターの音声分析などで年間10万時間の文字起こしを処理する大企業の場合、従来の価格(1時間0.36ドル)で計算すると年間36,000ドル(約540万円)のコストがかかるところを、MAI-Transcribe-2では年間10,000ドル(約150万円)にまで削減できる。これは、マイクロソフト自身がわずか5カ月前にリリースした前世代モデル「MAI-Transcribe-1」と比較しても、約72%もの値下げを実現したことになる。
MAI-Transcribe-2とは?──60言語対応、基本機能を標準搭載した音声認識モデル
MAI-Transcribe-2は、マイクロソフトが自社開発した音声認識モデルであり、Azure AI FoundryおよびMAI Playgroundを通じて提供される。対応言語数は60言語で、前世代モデルの43言語から大幅に拡大された。特に注目すべきは、競合他社が追加料金を設定しているような高度な機能が、標準でバンドルされている点だ。
具体的な機能としては、複数話者の発話を識別する「話者ダイアライゼーション」、各単語にタイムスタンプを付与する「ワードレベルタイムスタンプ」、特定の専門用語の認識精度を向上させる「キーワードバイアシング」、言語を自動判別する「自動言語識別」などが挙げられる。さらに、言い間違いや言い直しまで忠実に記録する「逐語モード」と、不要な語句を除去して読みやすくする「クリーンモード」を選択可能な出力形式や、ヒングリッシュやスパングリッシュといった言語混合に対応する「コードスイッチング」も、実務上の利便性を高める機能として評価できる。
ベンチマーク結果の真の意味──FLEURSとArtificial Analysisの読み解き方
マイクロソフトは、MAI-Transcribe-2の性能について「FLEURSベンチマークで60言語平均ワードエラーレート(WER)5.2%を記録し、首位を獲得した」と主張する。しかし、この数字は前世代モデルが記録した3.7%から上昇している。これは性能が後退したわけではなく、評価対象となる言語数が増え、低リソース言語が含まれたことで平均値が押し上げられたものと解釈すべきだ。実際のユースケースに照らせば、主要言語における精度はより高いと見込まれる。
もう一つの指標として、独立系ベンチマーク企業「Artificial Analysis」のWERリーダーボードで2位、かつ「精度-レイテンシーのパレート最適」を達成した点も重要だ。これは、同モデルが精度と速度の両面で優れたバランスを実現していることを示す。具体的には、OpenAIの「GPT-Transcribe」と比較して10倍、ElevenLabsの「Scribe v2」と比較して7倍、Googleの「Gemini 3.5 Transcribe」と比較して5倍の高速処理を実現している。この高速性は、バッチ処理におけるGPU消費時間の削減に直結し、低価格を支える基盤となっている。
5カ月で3モデル──マイクロソフトAIの驚異的な開発ペース
MAI-Transcribe-2のリリースは、マイクロソフトAIチームの驚異的な開発スピードを如実に示している。4月にMAI-Transcribe-1(25言語、0.36ドル/時間)、6月にMAI-Transcribe-1.5(43言語)、そして今回のMAI-Transcribe-2(60言語、0.10ドル/時間)と、わずか5カ月の間に3回のメジャーアップデートを実施した。このペースは、モデルアーキテクチャが安定し、データとスケールの最適化フェーズに入ったことを示唆する。マイクロソフトは、音声認識分野を「コモディティ」化する戦略を明確に打ち出していると見て間違いないだろう。
この開発速度の背景には、ムスタファ・スレイマン(Mustafa Suleyman)氏が率いる「少人数精鋭チーム」の存在がある。彼は以前、このプロジェクトを「官僚主義から解放された、わずか10人程度のフォーカスされたチーム」と評しており、その組織構造が俊敏な意思決定と迅速な成果を可能にしている。
なぜマイクロソフトは13億ドルを投じたOpenAIに頼らず、自前のモデルを開発するのか
マイクロソフトは、OpenAIにこれまで130億ドル(約1.9兆円)以上を投資し、AzureやOffice、CopilotにOpenAIのモデルを統合してきた。しかし、同社が自社モデルを開発する動機は、その依存関係からの脱却とコスト削減の2点に集約される。
2025年10月のパートナーシップ再編により、マイクロソフトは「AGI(汎用人工知能)を単独、または第三者と協力して追求する権利」を獲得した。さらに2026年4月には、OpenAIモデルへの独占的アクセス権を放棄し、収益分配契約も解消されている。これらの動きは、マイクロソフトが「AIの工場を所有し、生成物を販売する」という戦略へと舵を切ったことを明確にしている。MAI-Transcribe-2は、この戦略の成功を証明する最初の具体的な成果と言える。
また、コスト面でも大きなメリットがある。Teams、Word、Excelといった自社製品の音声関連機能を、OpenAIのモデルではなく自社モデルに置き換えることで、ライセンスコストを大幅に削減できる。Bloombergは2026年7月、マイクロソフトがすでにWordやExcelの一部プロンプト処理を自社モデルに切り替え始めたと報じている。
競合比較と実務上の注意点──専門家が問うべき5つの質問
MAI-Transcribe-2は、OpenAI、Google、ElevenLabsといったフロンティアラボを直接の競合と位置づけている。一方で、DeepgramやAssemblyAIといった音声認識専門ベンダーは、価格面で大きな圧力を受けることになる。しかし、実務導入を検討する技術責任者は、以下の5つのポイントを慎重に確認する必要がある。
第1に、0.10ドル/時間という価格は「ローンチオファー」であり、通常価格や契約期間が明示されていない点だ。第2に、リアルタイム文字起こし(ストリーミング)への対応が発表されていないこと。第3に、言語ごとの精度にはばらつきがある可能性が高いこと。第4に、話者ダイアライゼーションの品質指標(DER)が公表されていないこと。第5に、医療や法務など規制産業にとって重要な、データの保存場所やトレーニングデータへの利用方針が不明瞭なことだ。これらの課題は、リーダーボード上の順位と実際のプロダクション導入の間にあるギャップを埋めるための、実務上の重要な検討事項となる。
音声認識は「コモディティ」へ──マイクロソフトの戦略が示すAIの未来
MAI-Transcribe-2のリリースは、単なる一製品の発表以上の意味を持つ。マイクロソフトは、画像、音声、コード、推論、サイバーセキュリティといった各モダリティに特化したモデルをポートフォリオとして構築し、それらを自社製品に順次組み込む戦略を進めている。これは、すべての領域でOpenAIやGoogleに匹敵する単一の汎用モデルを目指すのではなく、各分野で最適化された専門モデル群を保有し、コスト競争力で優位に立つという現実的なアプローチだ。
音声認識は、その戦略が最初に結実した分野に過ぎない。スレイマン氏が語る「人間中心の超知能」という壮大なビジョンは、その裏側で緻密なコスト計算と実行力によって支えられている。5カ月前には36セントだった音声認識の価格が、今や10セントになった。この流れは、AI業界全体の価格破壊と、プラットフォーム支配を巡る新たな競争の幕開けを告げている。MAI-Transcribe-2は、その先鋒として、今後も業界に大きな影響を与え続けるだろう。