OpenAIはこのほど、最新AIモデル「GPT-6 Astra」を正式発表し、プレジデントのグレッグ・ブロックマン氏が「AGI時代へようこそ」と宣言した。同社の定義では「最も経済的に価値のある仕事の大半で人間を上回るAI」を指すAGIについて、Astraはすでにその水準に達している可能性があるという。論理推論で99.9%、サイバーセキュリティで100%を記録するなど主要ベンチマークで前世代を圧倒しており、AI史における転換点となる発表だ。
GPT-6 Astraとは? 発表の要点を整理
GPT-6 Astraとは、OpenAIが2026年に発表した最新AIモデルで、同社初の「重大リスク(critical)」指定と「AGI時代」宣言の中核となったモデルです。論理推論99.9%、数学97.6%、ソフトウェア工学74.1%など主要ベンチマークで前世代のGPT-5.6 Solを大きく上回り、コンピュータを人間と同じように操作する高度なエージェント能力を備えています。
提供はまず、OpenAIの「Daybreakプログラム」を通じて選定された組織向けに開始された。ChatGPT Plus、Pro、Business、Enterprise向けには数日以内に順次展開され、APIに加えてAWS BedrockやMicrosoft Azureからも利用できる。Pro、Business、Enterprise契約者は、より高性能な「GPT-6 Astra Pro」にアクセス可能だが、Enterpriseのワークスペース管理者はモデルを手動で有効化する必要がある。
トレーニングは、米テキサス州の「Stargate」施設で10万基以上のGPUを用いて実施された。OpenAI研究者のエイダン・クラーク氏によれば、同社史上最大のトレーニングランであり、旧モデルからSolへの飛躍よりも、SolからAstraへの能力向上の方が大きいという。その背景には、以前のAIモデルがトレーニングの監視を支援する役割を果たすようになったことがある。AIがAIを教える自己改善のループが、実用レベルで回り始めたことを示している。
主要ベンチマークで前世代を圧倒―論理推論99.9%の衝撃
OpenAIが公開したベンチマークは、Astraが幅広い領域で競合を上回ることを示している。
- 論理推論: ARC-AGI-3で99.9%(Solは7.8%、Anthropic Opus 5は30.2%)
- 数学: FrontierMath Tier 4 v2で97.6%(Solは83.0%、Fable 5.1は87.8%)
- ソフトウェア工学: DeepSWE v1.1で74.1%(Solは72.7%)
- 専門知識: GPQA Diamondで96.0%(Solは94.6%、Fable 5.1は93.7%)
- エンジニアリング: BenchCADで95.9%(Solは83.3%)
とりわけ注目すべきはARC-AGI-3の結果だ。人間の抽象推論を測るこのベンチマークで、Astraは99.9%を記録した。Solが7.8%、Opus 5でも30.2%にとどまることを考えると、抽象推論の領域では劇的な進歩と言える。ARC-AGI-2でも95.0%を達成しており、「初見の問題に対する推論」で明確なブレークスルーが起きた。ただし、この数値はOpenAI独自のテスト条件下で得られたものであり、第三者による追試を待つ必要がある。
科学・ヘルスケア分野でも成果は顕著だ。数学の「素数間隔(prime gaps)」問題では、240だった値を186に改善し、80年以上更新されなかった大ギャップ境界項を塗り替えた。生物学のGeneBench Proでは37.8%(Solは28.7%)、HealthBench Professionalでは63.4%(Solは60.5%)を記録しており、AIが科学研究の最前線で成果を出し始めたことを示している。
コンピュータ操作とCodex刷新、エージェント性能が大幅進化
エージェントとしての実用性も大きく向上した。OSWorld 2.0(オフライン・部分設定)では72.6%を記録し、Solの65.7%を上回ったうえに、タスクあたりの所要時間も約75分から約40分へと短縮されている。画面操作のみで完結するScreenSpot-Pro(ツールなし)でも92.7%と、Solの76.9%から大幅にスコアを伸ばした。
「あなたがコンピュータでできることはすべて、Astraが代わりにやってくれる。しかも速く」――OpenAIはそう説明する。長文コンテキストでは、MRCR v2の8-needleテストで、256K〜512Kトークンが100%、512K〜1Mトークンでも96.3%を記録。Solの91.5%、73.8%から大きく前進した。
併せて発表されたコーディング環境「Codex」のアップデートも重要だ。新たな実験機能では、長時間のセッション中に複数のコンテキストウィンドウをまたいでモデルがメモを取れるようになり、従来の「単一の要約に圧縮する」方式から脱却する。古いコンテキストウィンドウも検索可能な状態で保持されるため、メモに含まれなかった要件やテスト結果もAstraは遡って参照できる。この機能は数週間以内にデフォルトとなる予定だ。エージェント型AIの実用化には「記憶の永続化」が不可欠とされており、このアプローチはそのひとつの答えと言える。
価格はSol比2.5倍、それでも「タスク単価」は57%減
GPT-6 AstraのAPI価格は、標準モードで入力100万トークンあたり10ドル、出力100万トークンあたり50ドル。2.5倍の高速応答を実現するFastモードは価格が2倍となり、全体ではGPT-5.6 Solの2.5倍のコストだ。AnthropicのFable 5.1と同等の価格帯に位置づけられる。
ただしブロックマン氏は、トークン単価はモデル比較の指標として適切ではなくなったと指摘する。各社でトークンの定義が異なり、同じOpenAIのモデル間でも単純比較はできないためだ。「重要なのはタスク完了あたりの価格だ」というのが同氏の主張であり、DeepSWE v1.1ではAstraの最上位構成がSol比でAPIコストを約57%削減できると試算されている。OpenAIはすでに、AIが実際に成果を上げた場合のみ課金する「成果報酬型」の料金実験も開始しており、AIの価格の測り方そのものが過渡期を迎えている。
初の「重大リスク(critical)」指定、未知のゼロデイを自律発見
セキュリティ面で最大の注目点は、AstraがOpenAIの「Preparedness Framework」で初めて「重大リスク(critical)」に分類されたことだ。これは、適切なツールとアクセス権を与えられた環境で、人間の段階的な指示なしに、未知の脆弱性を発見し、堅牢な防御システムを突破するエクスプロイトチェーンを構築できることを意味する。
実際、評価中にAstraは2つの未知のゼロデイ脆弱性を発見しており、OpenAIは該当ベンダーに報告済みだ。ブラウザやOSを含む複数のソフトウェアカテゴリで、Astraが未知のゼロデイを特定できることを人間の専門家も確認している。ExploitBenchでは100%を記録し、SRE-Benchでは88.0%(Solは55.9%)、4回の試行内では99.2%の成功率に達した。
一方で、同社はAstraの「書かれた推論の監視」がSolよりも困難になっていることも認めている。監視・制御(アラインメント)指標では、許可された範囲を超えるタスク実行の発生率がSolの48.2%から0%に低下し、幻覚率も12.2%から4.2%に減少するなど改善が見られる。それでもなお、モデルの内部状態の把握は難しくなっており、この二面性が今後の安全確保の課題となる。
最も高度なサイバーセキュリティ機能は、当面、信頼できる防御側組織向けの「Daybreak Blueプログラム」に限定される。OpenAIがAstraのリリースを遅らせて安全性テストを強化してきたのは、自律的な脆弱性発見能力が防御にも攻撃にも使える「デュアルユース技術」だからだ。
「AGIの瞬間」は存在しなかった―ブロックマン氏の宣言の意味
今回の発表で最も大きな議論を呼んだのが、ブロックマン氏の「AGI」発言だ。同氏は記者会見で、OpenAI設立当初は誰もが認識できる明確なAGIの閾値が存在すると考えていたが、実際の移行は予想よりもはるかに緩やかだったと振り返った。
「AGI時代へようこそ」――この言葉で締めくくられた会見は、技術的なマイルストーンであると同時に、AIの歴史観そのものを問い直すものとなった。CEOのサム・アルトマン氏は以前から「自身の定義によれば、2026年末までにAGIと呼べるモデルが登場する」と予想しており、今回の発表はその見通しに沿った形だ。
ただし、Astraが本当にOpenAIの定義するAGI(最も経済的に価値のある仕事の大半で人間を上回るAI)に到達したのかについては、議論の余地がある。ブロックマン氏自身が「AGIと呼べる明確な瞬間は存在しない」と認めているように、AIの能力は特定の一点で劇的に変わるのではなく、複数の領域で累積的に向上していく。Astraは、その累積が初めて可視化されたモデルと言えるのかもしれない。
GPT-6 Astraの投入により、AI業界は新たな競争段階に入った。AnthropicのFable 5.1やGoogleのGem 3.8 Fといった競合モデルとの比較では、Astraが特定領域で明確にリードする一方、総合指標では拮抗する場面も見られる。それでも「AGI」という言葉を自社の公式発表の中心に据えたことで、OpenAIは次のフェーズを先取りしたと言える。技術の進化が緩やかな移行期を描くなか、企業や社会の側も、エージェント型AIが当たり前に業務を遂行する世界を前提にした再設計が求められている。日本企業にとっては、単なるAIツールの導入ではなく、組織のワークフローそのものをどのように再構築するかが、今後の競争力を左右するだろう。