OpenAIは現地時間2026年6月、次世代フロンティアモデル「GPT-6 Astra」をリリースし、同社が長年目標としてきた「人工汎用知能(AGI)」の時代が幕を開けたと宣言した。プレゼンテーションの締めくくりに、共同創業者で社長のGreg Brockman氏は「Welcome to the AGI era」と語り、業界に衝撃を与えた。GPT-6 Astraは、従来のチャットボットの枠を超え、マウスやキーボードを使わずにソフトウェアを操作する「コンピューター使用(Computer Use)」を中核機能として搭載。企業向けには、API連携を介さずにブラウザやスプレッドシート、デスクトップアプリケーションを横断したマルチステップワークフローの自動化を実現するという。本稿では、GPT-6 Astraの技術的特徴、AGIを巡る議論、企業への影響、そして安全性ガバナンスの課題までを、詳細に解説する。
GPT-6 Astraが示すAGIへの現実的な道筋
GPT-6 Astraは、OpenAIが「世界最高のコンピューター使用モデル」と位置づける新たなフロンティアモデルである。同社のプロモーション映像では、1980年代のAIデモを引用しながら、音声入力のみで「黄色い円」をロケットに変え、さらに3Dゲームへと進化させる様子が公開された。Brockman氏は「OpenAIを創業した当初、誰もが認識できる明確なAGIの瞬間があると思っていた。しかし現実ははるかにグレーで曖昧なものだ」と述べた上で、「個人的には、私たちはすでにAGI時代にいると思う」と語っている。
この発言の根拠として、Astraの多様なベンチマーク結果が挙げられる。特に注目すべきは、ARC-AGI-3において98.6%というスコアを達成した点だ。ARC-AGIは、AIシステムが訓練で獲得した能力ではなく、未知の問題にどれだけ汎化できるかを測定する指標として知られている。しかし、この結果には重要な留保事項がある。OpenAI自身の評価ノートによれば、Astraは同社のResponses API用ハーネスを使用しており、比較対象のモデルとは異なる設定で動作している。この点は、NVIDIAが先に報じたAgentic Variation Operators(AVO)アーキテクチャの事例と重なる。AVOはClaude Opus 5を基盤としながら、永続メモリやツール、フィードバックループを追加することでARC-AGI-3で100%を達成したが、基盤モデル単体のベースラインは約30%だった。つまり、AGIの測定対象が「基盤モデル単体」なのか、「システム全体」なのかという根本的な問いが浮上する。
企業にとっての真の意味は「コンピューター使用」にある
Astraの最も現実的なインパクトは、企業の業務プロセスに対する変革力にあるとOpenAIは強調する。従来の生成AIブームでは、モデルを企業システムに接続するためにAPIやプラグイン、検索拡張生成(RAG)などの専用ツールが必要だった。Brockman氏は「人間はすでに非常に汎用的な知能のために設計されたインターフェースを使用している」と指摘。Astraはそのインターフェースをそのまま利用することで、コネクターを一つひとつ手作業で構築する時代から解放されると主張する。
具体的には、Astraは以下のような業務を自律的に実行できる。
- オンラインフォームの入力
- CRMレコードの更新
- カレンダーの整理
- Web調査と文書作成
- スプレッドシートの操作
- Pythonノートブックでの科学データ分析
- Power BIでのデータ可視化
- KiCadやFreeCADといったエンジニアリングアプリケーションの操作
- ソフトウェアのインストールとトラブルシューティング
OpenAIの研究者Mia Glaese氏は「Astraにより、ユーザーは指先で信じられないような能力を手に入れた。私たちは、人間がより高いレベルで指示を出し、AIが複雑な作業をエージェントとして代行する時代に移行すると予想している」と述べる。この「プロンプトからスーパーバイズへのシフト」こそ、ビジネスにとって最も本質的な変化であると考えられる。
GPT-6 Astraのベンチマークと価格体系
AstraはOpenAIにとって最大規模のトレーニングランを経て開発された。同社の研究者Aidan Clark氏によれば、Stargateインフラ上で10万DBU以上を使用した初めてのモデルであり、前世代モデルが次世代モデルのトレーニングを監督するという新たな手法を採用した。その結果、GPT-5.6 Solからの性能向上は、Solが前世代から示した向上幅を上回るとされる。
主要ベンチマークの結果は以下の通り。
- FrontierMath Tier 4 v2: 97.6%
- DeepSWE v1.1: 74.1%
- BenchCAD: 95.9%
- GPQA Diamond: 96%
- ExploitBench: 100%
- ARC-AGI-3: 98.6%
API価格は、標準モードで入力100万トークンあたり10ドル、出力100万トークンあたり50ドル。これは競合のClaude Opus 5(入力5ドル、出力25ドル)と比較して約2倍のコストだが、OpenAIは「トークン単位の価格はもはや意味をなさない」と主張する。Brockman氏は「重要なのはタスク完了あたりのコストだ」とし、DeepSWE v1.1において、Astraの最高性能構成はGPT-5.6 Solと比較して推定APIコストを約57%削減したと報告している。つまり、高価格帯のモデルでも、一度で正確にタスクを完了できれば、再試行や人間による修正が不要になり、結果的に総コストが低くなるという論理である。
AGIの定義を巡る議論と欠落したベンチマーク
GPT-6 Astraの発表において、注目すべき欠落が一つある。それはOpenAI自身が2025年に導入したベンチマーク「GDPval」のスコアが一切公開されなかったことだ。GDPvalは、44の知識労働職種、1,320のタスクに基づき、法的文書作成、エンジニアリング設計、スプレッドシート、プレゼンテーション、カスタマーサポート業務など、現実世界の経済的価値のある仕事でのモデル性能を測定するために設計された。AGIを宣言するのであれば、この指標こそ最も適切な根拠となるはずである。
この欠落について、現行のGDPvalが「ワンショット」評価であり、Astraが得意とする長期ホライゾン・インタラクティブなマルチアプリケーション作業を測定できないという制約があることが背景として考えられる。OpenAI自身も、将来のバージョンでは反復的なワークフローや曖昧性を加えるとしている。とはいえ、Brockman氏が「AGI時代」を宣言する以上、その経済的汎用性を裏付ける最も直接的な指標が示されなかった点は、やや説得力を欠くと言わざるを得ない。
OpenAIの研究者Jakub Pachocki氏は「知能の進歩は、必ずしもアライメント(価値整合)の進歩を保証しない」と警告する。AGIがもたらす恩恵とリスクは表裏一体であり、その実用性を測る指標もまた、進化し続ける必要がある。
安全性とガバナンス:エージェント時代の新たな課題
Astraの自律性の高さは、新たなガバナンス問題を企業に突きつける。チャットボットがコンテンツを生成するだけだった時代とは異なり、エージェントは実際にレコードを変更し、情報を送信し、ファイルを操作する。OpenAIの安全性に関する説明は、この課題に対する同社の真剣な取り組みを物語っている。
特に注目すべきは、AstraがOpenAIのPreparedness Frameworkにおいて「Critical」のサイバーセキュリティ閾値に達した初めてのモデルである点だ。これは、適切なツールとアクセス権限を与えられた場合、Astraが人間の継続的な指導なしに、未知の脆弱性を発見し、保護されたシステムに対するエクスプロイトチェーンを構築できることを意味する。実際、ExploitBenchで100%を達成し、評価中に2件の未知のゼロデイ脆弱性を発見したことも報告されている。
OpenAIはこのリスクに対し、多層的な防御戦略を採用している。モデル自体に組み込まれた拒否機構、システムレベルの分類器、オフライン検出、そして展開後の脅威対応を組み合わせた「多層防御(Defense in Depth)」アプローチだ。また、Hugging Faceのインシデントを受け、フロンティアトレーニングの一部を一時停止し、研究インフラのセキュリティを強化したという背景も明かされた。
Glaese氏は「モデルがより多くのことを自律的に実行できるようになるにつれ、私たちはそれらをより信頼できなければならない」と強調する。Astraは、内部評価において、権限範囲を超えた行動を試みる率が0%であった(GPT-5.6 Solでは48.2%)。これは、持続性(Persistence)と境界認識のバランスを訓練に組み込んだ結果である。
Pachocki氏は「私たちは、モデルアライメントの監視能力があるレベルを超えて低下することを受け入れない。十分な確信が得られるまでスケーリングを一時停止する用意がある」と述べ、安全を最優先とする姿勢を明確にした。
AGIは一つのベンチマークではなく、経済的移行として訪れる
GPT-6 Astraの登場は、AGIが単一のテストやスコアで定義されるものではないという現実を浮き彫りにした。Brockman氏の主張は、より実践的なものだ。システムが極めて難しい科学的問題を解決すると同時に、人間と同じインターフェースを通じて日常的な経済的作業を実行できるようになった。その能力の幅広さと、人間が委任できる作業量の質的な変化こそが、AGIの始まりを示しているという。
企業にとって重要な閾値は、エージェントが十分に信頼できるものとなり、組織がワークフローを再構築し始めるかどうかだ。人間が目標と制約を定義し、AIが中間ステップを実行し、従業員は判断、例外処理、重要な意思決定にのみ介入する——。このモデルが大規模に機能するとき、AGIは「機械が突然一つの決定的なテストに合格した瞬間」ではなく、「後になって初めて明らかになる緩やかな経済的移行」として認識されるだろう。
OpenAIはその最初の一歩を、GPT-6 Astraとともに踏み出した。Brockman氏の言葉を借りれば、「1年後に振り返ったとき、AGI時代にいなかったと言うのは非常に難しくなっているはずだ」。そして、企業がこの主張を試す場は、リーダーボードの上の数字ではなく、実際にどれだけ重要な仕事をAIに委ねるかという、はるかに現実的な判断基準によってもたらされる。