OpenAIは2026年9月、音声対話モデル「GPT-Live-1」を開発者向けAPIとして公開した。このモデルは「フルデュプレックス(全二重通信)」と呼ばれる、聞きながら同時に話す機能を備えており、すでにChatGPT内で動作している。APIを通じて、開発者はタスクに応じて異なるバックエンドモデルと組み合わせることができ、推論の深さ、速度、コストを柔軟に調整可能だ。
GPT-Live-1の概要とAPI提供の背景
GPT-Live-1は、従来の音声モデルが抱えていた「話している間は聞き取れない」という制約を解消した。ユーザーが発話している最中でもモデルが割り込んだり、相槌を打ったりできるため、人間同士の会話に近い自然な対話が実現する。APIの料金は1分あたり0.05ドル(約7円)で、決して安くはないが、その価値は性能向上に見合うとOpenAIは主張している。
性能ベンチマーク:前世代からの大幅な飛躍
OpenAIが公表したベンチマークでは、GPT-Live-1は前世代の「GPT-Realtime-2.1」と比較して顕著な改善を示している。フルデュプレックス対話テストのスコアは80.1%(対45.4%)、ターンテイキングのレイテンシは0.8秒(対1.4秒)に短縮。ツール呼び出しの精度は87%(対60%)に向上した。また、銀行向け音声サポートベンチマークでは通過率32%を記録し、前モデルの12.4%から約2.6倍の進化を遂げている。
Yelpによる実証:予約処理の効率化
米国のレビュー・予約プラットフォームYelpは、電話によるレストラン予約処理にGPT-Live-1を導入。CTOのAlex Levy氏によると、通話の応対品質が改善し、よりスムーズな予約受付が可能になったという。Yelpの事例は、本モデルが実用シーンで即戦力となることを示している。
12種類の新ボイスとASR・応答テキスト出力
GPT-Live-1は、さまざまなアクセントや方言、言語に対応した12種類の新しい音声を搭載。さらに、自動音声認識(ASR)による文字起こしと応答テキストを標準で出力する。これらの詳細はOpenAIのAPIドキュメントで確認できる。
開発者にとっての利点と今後の展望
このAPIにより、開発者は独自のバックエンドモデルを選択しながら、リアルタイム音声対話機能をアプリケーションに組み込める。例えば、顧客サポートでは高速・低コストのモデルを、複雑な質問応答では高精度モデルを使い分けるといった戦略が可能だ。OpenAIはGPT-Live-1を「音声対話AIの新たな基盤」と位置づけており、今後さらにエコシステムが拡大するとみられる。日本の開発者や企業にとっても、カスタマーサービス、ヘルスケア、教育など多岐にわたる分野での応用が期待される。