Googleは、音声認識モデル「Gemini 3.5 Transcribe」をパブリックプレビューとして公開しました。非ストリーミングで誤認識率2.6%、ストリーミングで4.0%を記録し、85以上の言語とコードスイッチングに自動対応するのが特徴です。録音済み音声向けのInteractions APIと、リアルタイム双方向ストリーミング向けのLive APIという2系統のAPIで構成されており、同じモデルでも利用シーンによって提供機能が大きく異なります。
Gemini 3.5 Transcribeとは?
Gemini 3.5 Transcribeは、Googleが開発した音声認識モデルです。録音済み音声向けのInteractions APIとライブ向けのLive APIの2系統があり、85以上の言語とコードスイッチングに自動対応します。非ストリーミングで誤認識率2.6%、ストリーミングで4.0%です。
従来の音声認識モデルが「聞き取る」ことに集中してきたのに対し、Gemini 3.5 Transcribeは「そのままの文字起こし」と「読みやすい文字起こし」をモードで切り替えられる点が新しい。たとえば、会議の録音をそのまま議事録用に整形するのか、コンプライアンス監査用にすべての発言を残すのかという使い分けが、1つのモデルで実現できます。
本番投入できるか:API専用、セルフホストは不可
デプロイ方法は、明確なマネージドサービス一本です。オープンウェイトは公開されておらず、セルフホストの道は用意されていません。「社内のGPUクラスタで動かす」のではなく、「GoogleのAPIを自社システムに組み込む」前提で設計されています。
利用規模に応じた選択肢は次の3つです。
- 個人・スタートアップ:Google AI Studioの無料枠から開始可能。まずはプロトタイプを最短で試すのに適しています。
- 中規模チーム:有料プランでレート上限を引き上げます。有料プランでは、コンテンツがGoogleの製品改善に使用されないことも保証されます。
- 規制業種・エンタープライズ:Gemini Enterprise Agent Platformを経由すると、プロビジョニング済みスループット、コンプライアンス管理、ボリュームディスカウントを利用できます。
ただし、開発者向け・エンタープライズ向けの双方がパブリックプレビューです。本番システムへ組み込む場合、仕様変更やSLA条件を確認したうえで判断するのが現実的です。
想定されるユースケースも幅広い。コンタクトセンター/CXプラットフォーム、臨床文書化、メディアの字幕制作とローカライズ、法務・保険の初動受付、会議ツール、音声駆動の開発者ツールなどです。リアルタイム音声エージェント、ライブ字幕、通話後分析パイプライン、話者別の議事録生成、ディクテーション、音声操作インターフェースといった応用が想定されています。
2つのAPIは「別製品」——Live APIとInteractions API
本モデルの設計上、もっとも重要なのが2つのエンドポイントは同じ機能を持つわけではないという点です。リアルタイム性を重視すると分析機能が削られ、分析機能を重視するとリアルタイム性が失われる。このトレードオフを理解せずにAPIを選ぶと、思わぬ制約にぶつかります。
Live API:サブ秒の連続文字起こし、10分セッション上限
gemini-3.5-transcribe-liveは、Live APIで双方向ストリーミングを実現します。1秒未満のレイテンシで連続文字起こしができ、話している最中の暫定テキストとしてinterim_input_transcriptionを、ターンが確定した時点のテキストとしてinput_transcriptionを返します。
音声入力は16kHzモノラル、16bit PCM、100msチャンクです。音声区間検出(VAD)は自動・ハイブリッド・手動の3モードに対応し、モバイルアプリやWebクライアントでは、APIキーを保持せずにストリーミングできるエフェメラル・トークンも利用できます。
一方で、制約も明確です。連続ストリーミングのセッションは10分間が上限で、話者分離と単語タイムスタンプには対応していません。
Interactions API:話者分離・単語タイムスタンプ対応
gemini-3.5-transcribeは、録音済み音声ファイルをInteractions APIに渡して処理します。こちらは、最大8ラベルの話者分離(ダイアライゼーション)、単語単位の開始・終了オフセット、カスタム語彙バイアスに対応。カスタム語彙は最大1,000語まで登録でき、100語以下で最も効果が高くなります。
制約として、標準リクエストの音声は1時間まで。話者分離または単語タイムスタンプを有効にすると30分に短縮されます。2話者を超える話者帰属は実験的な扱いです。リアルタイム処理には向かないため、文字起こしをすぐに返す用途ではLive APIとの組み合わせが必要です。
verbatimとsmart:読みやすさと検証可能性のトレードオフ
もう1つの設計判断は、verbatim(逐語)とsmart(整形)という2つの出力モードです。両方のAPIエンドポイントで共通して使えます。
verbatimはデフォルトで、フィラー、言い直し、繰り返し、誤った文の始まりまで含めてすべてを出力します。監査や事後確認の用途にはこちらが適しています。
smartは、不要な言い回しを取り除き、話し手が途中で言い直した部分を補正したうえで、構造化されたフォーマットで出力します。Googleのドキュメントにある例では、「Um, so for the meeting, I think we should, uh, invite Alice and, wait no, Bob and Carol.」を、smartモードで「For the meeting, I think we should invite Bob and Carol.」に整形します。
ここで注意したいのが、smartモードは単語タイムスタンプや話者分離と組み合わせられない点です。読みやすい要約と、検証可能な完全な記録は、同じAPI呼び出しで同時には得られません。要件に応じて2つのAPIを呼び分ける設計が必要になります。
性能:WER 4.0% / 2.6%、Chirp 3比で最終化まで70%高速化
認識精度の主要指標である平均語誤り率(WER)は、GoogleはArtificial Analysisによる測定で、ストリーミング4.0%、非ストリーミング2.6%だったとしています。多言語ベンチマークのFLEURSでは、主要な言語・ロケール群において、ストリーミング5.50%、非ストリーミング5.04%となっています。
また、従来モデルのChirp 3と比較して、最終的な文字起こしが得られるまでの時間が70%短縮されました。85以上のロケールを自動検出し、文の途中で言語が切り替わるコードスイッチングも設定なしで処理します。
この性能数値はあくまでモデル単体の測定値であり、実際の業務音声や会議音声ではノイズ、遠隔話者、専門用語、複数話者の重なりなどの影響を受けます。導入時には実データでの評価が欠かせません。
価格はトークン基準、推計で1分あたり0.005ドル〜0.009ドル
料金は分単位ではなくトークン単位で計算されます。Googleが示す従量構成の推計では、音声入力が毎秒25トークン、文字起こしテキスト出力が毎分175トークンとして、バッチ処理のgemini-3.5-transcribeで1分あたり約0.005ドル、リアルタイム処理のgemini-3.5-transcribe-liveで1分あたり約0.009ドルというブレンド単価になります。
実際のコストは、話速や沈黙の長さ、文字起こしのボリュームに左右されます。音声認識の利用時間だけでなく、出力テキスト量も見積もりに含めておく必要があります。
エコシステム:LiveKit、Pipecat、Agoraなどが先行対応
リアルタイム音声AIをアプリに組み込むための周辺環境も整備が進んでいます。Live APIはすでにLiveKit、Pipecat、Agora、Fishjam、Vercel、Vision Agentsと連携しています。
コンシューマー向けでは、Android版のRambler、macOS版Geminiアプリ、Google Antigravityが本モデルを採用。Chromeへの対応も予定されています。
開発者が押さえるべき5つの制約
- API専用:オープンウェイトなし、セルフホスト不可。マネージドサービス前提。
- Live API:連続10分まで。話者分離と単語タイムスタンプは非対応。
- Interactions API:標準1時間、話者分離またはタイムスタンプ有効時は30分。
- smartモード:単語タイムスタンプ・話者分離との併用不可。
- パブリックプレビュー:開発者向け・エンタープライズ向けの両トラックが対象。
加えて、2話者を超える話者帰属は実験的扱いです。要件が高度になればなるほど、APIの選定と出力モードの設計が重要になります。
リアルタイム音声AIの選択肢をどう変えるか
Gemini 3.5 Transcribeの最大の特徴は、1つのモデルでありながら、ストリーミング用とバッチ用でAPIと機能を明確に分けたことです。レイテンシと分析機能、読みやすさと検証可能性というトレードオフを、開発者が最初の設計判断として向き合うことを求めています。
これまで音声認識モデルは「精度の高さ」が最優先でした。しかし、実運用では、リアルタイム性、話者分離、語彙制御、コスト、データガバナンスが同時に問われます。Gemini 3.5 Transcribeは、これらの要求をAPIの役割分担として整理した点で、今後の音声AI選定の基準になる可能性があります。
パブリックプレビュー期間中にどの程度の安定性とスループットを確保できるのか、実際の業務音声でどの程度の精度が出るのか。開発者による実地検証が、次の採用判断を左右しそうです。