OpenAIが2026年9月に投入した新モデル「GPT-6 Astra」は、ハルシネーション(事実誤認)の大幅な低減と、プロンプトインジェクション攻撃に対する防御性能の向上を実現した。しかし、同社が公開したシステムカードや外部セキュリティ企業による検証結果は、AIエージェントの本格的な業務活用に求められる「絶対的な信頼性」にはなお届いていない実態を浮き彫りにしている。
GPT-6 Astraのハルシネーション率、前世代比で顕著な改善
OpenAIが公開したシステムカードによれば、GPT-6 Astraは前世代モデル「GPT-5.6 Sol」と比較して、事実誤認を起こす頻度が明らかに低下している。評価には、ユーザーが実際にChatGPT上で「回答が誤っていた」と報告した会話データが用いられており、通常の利用シーンよりもエラー率が高いケースを意図的に抽出した厳しめのテスト条件下での検証となっている。
このテストにおいて、Astraは先行モデルが再現した誤回答を再現する頻度が大幅に低下。特に低レイテンシー設定や低い推論レベルでの改善幅が最も大きかった。システムカードが示すグラフでは、GPT-6 Astra(ピンク色)が全レイテンシー設定においてGPT-5系統のモデルを下回る hallucination率を記録している。
直接攻撃には99.99%の防御率、しかし適応型攻撃には課題
ユーザーが自身のプロンプトを通じてモデルを操作しようとする直接プロンプトインジェクションに対する防御性能は、なんと99.99%に達する。OpenAIはこの成果について、自動攻撃システムを用いてモデルを訓練中に強化する自社開発の「GPT-Red」手法によるものだと説明している。
既知の攻撃手法データセットを用いたジェイルブレイク耐性の評価では、生物学、暴力、サイバーセキュリティに関する有害な回答を引き出そうとする攻撃に対して、91.5%から98.3%のケースで防御に成功した。
しかし、攻撃者が複数の会話ターンにわたって戦略を適応させるマルチターン適応型攻撃に対しては、防御率が約67%に低下する。つまり、執拗な攻撃者に対しては、約3回に1回の割合で問題のある回答を引き出される可能性があるということだ。なお、前世代モデルでは同じテストで防御率が50%を下回っていた。OpenAIは、これらのテストは製品版に搭載される分類器などの追加セーフティレイヤーを外したベアモデルの状態で実施されたものだと注記している。
隠れプロンプトインジェクション——セキュリティチームが警戒すべき死角
さらに深刻なのは、AIが読み込むドキュメント内部に攻撃コードを埋め込む間接プロンプトインジェクション(Hidden Prompt Injection)への対応状況だ。セキュリティ企業Gray Swanが実施した外部検証では、1,810件の厳選された攻撃パターンを用い、1シナリオあたり15回の試行で評価が行われた。
その結果、GPT-6 Astraは少なくとも1回は突破される確率が8.5%にのぼった。比較対象として、GPT-5.6 Solは27%、AnthropicのClaude Opus 5は4.8%と、いずれも完全には防御できていない。Opus 5がやや良好な数値を示しているものの、約21回に1回は突破される計算になる。
Gray Swanの評価はQ1(第1四半期)とQ2(第2四半期)のテストを統合した結果であり、Q1のみの単純なテストと比較すると攻撃成功率は上昇している。Anthropicが以前報告した「攻撃成功率わずか2%」という結果は、難易度の低いQ1テストのみに基づくものであり、かつ全モデルに拡張推論を有効化した状態での評価だった。テスト範囲の拡大と推論設定の差異が、数値の開きを生んでいる可能性がある。
厳選された攻撃セットとはいえ、約12シナリオに1回の割合でインジェクションが成功するという数値は、エンタープライズのセキュリティチームにとって看過できないリスクである。
AIエージェント時代のリスク——自律動作が拡大するほど攻撃面も拡大
この問題の本質的な危険度は、AIの利用形態の変化によって急速に高まっている。現代のAIエージェントは、コードの記述、ツールの操作、コンピュータの自律制御などを担い、24時間体制でのスケール動作を前提に設計されている。ドキュメントの読み込みと処理は、そうしたエージェントの中核的なタスクのひとつだ。
Gray Swanのテストが評価したのはまさにこの領域であり、外部から取り込んだ文書に仕込まれた悪意ある命令によって、エージェントの行動が乗っ取られるリスクを測定している。Astraが依然として約12シナリオに1回の頻度で突破されるという事実は、金融取引の自動実行、社内システムへのアクセス、コード生成パイプラインといった高リスク領域へのAIエージェントの無防備な導入が、現時点では推奨できないことを示唆している。
OpenAIはシステムカードの中で、GPT-Redのような自動防衛手法の継続的な強化や、製品版に追加のセーフティレイヤーを搭載する方針を明らかにしている。しかし、攻撃手法もまた進化を続けており、防御と攻撃のいたちごっこは当面終わりそうにない。AIエージェントの社会実装を本格化させるためには、モデル単体の安全性向上に加えて、入出力の監視、実行環境の分離、人的承認プロセスとの連携といったシステム全体でのリスク管理体制の構築が不可欠である。