「CISO(最高情報セキュリティ責任者)が、プロンプトインジェクションのCVE番号が少ないからといって対策優先度を下げるのは、スコアボードの読み方を間違えている。」——この一文に、本稿の核心が集約されている。OWASP Top 10 for LLM Applicationsにおいて3年連続で第1位に君臨するプロンプトインジェクションは、現実世界で発生した6,639件のラベル付きインシデントと照合した結果、なんと第12位に沈んだ。この落差は、脅威の実態ではなく、その可視性の低さを映し出している。なぜなら、この攻撃は脆弱性スキャナが決して到達できない領域で成立するからだ。
この衝撃的な発見を報告したのは、OWASP Top 10 for LLM Applicationsプロジェクトの共同リーダーであるKyriakos “Rock” Lambros氏とSteve Wilson氏である。両氏は2026年8月18日、arXivに査読前の探索的分析として本論文を公開した。分析の基盤は堅牢だ。CVE、GitHub Security Advisories、OSV、AIAAICのAI害悪データベースから収集した7,714件のLLMセキュリティインシデンスのうち、6,639件を20項目の分類体系にラベル付け。ベイズモデルによって分類器の誤差を補正した上で、データ駆動型のランキングと専門家投票によるランキングを比較している。
その結果、専門家の判断と公開インシデント記録の間に統計的に有意な一致は確認されなかった。Cohenのκ係数は0.20、90%信頼区間は-0.16から0.57。「区間がゼロをまたぐため、両者のランキングが偶然一致した可能性を排除できない」と論文は認める。Lambros氏はVentureBeatへの回答で率直に語っている。「リスクを測定する2つの方法、専門家の判断と公開インシデント記録が互いに矛盾している。どちらも真実ではない。2人の証人が互いに異なる証言をしており、どちらが嘘をついているのかは判別できないのだ。」
スキャナが決してログに記録しない攻撃連鎖
この乖離は構造的なものだ。プロンプトインジェクションは、モデルが読み込むコンテンツ——ログエントリ、サポートチケット、検索で取得したドキュメント——の中に命令を埋め込む。エージェントは、正規に保持する認証情報を使って、攻撃者が意図したツール呼び出しを実行する。この連鎖のどこにも製品の欠陥は存在しないため、スキャナが発見できるCVEは残らない。この攻撃を捕捉する防御策は、実稼働システムに対する敵対的テストと、エージェントが到達可能な範囲にハードキャップを設定することだ。これにより、騙されたモデルが高価値の資産に触れることを防ぐ。
Wilson氏が最初に導入するコントロール
Wilson氏は、まさにこの攻撃連鎖——エージェントがログファイル内の攻撃者のペイロードを読み込み、それを命令として解釈し、有効な認証情報でDNSを書き換える——に対して、最初に導入すべきコントロールを明確に述べている。「最初に行うのは、モデルの外部に認可ゲートを配置することだ。エージェントはDNS変更を提案できるが、それを実行する権限を自らに付与することはできない。プロンプト内に記述されたセキュリティルールはモデルの行動を形成するかもしれないが、それらはモデルに対する提案に過ぎず、実施可能なセキュリティコントロールではない。」このゲートには代償が伴う。Wilson氏はそれを率直に認める。「エージェントは、自律的な調査と定型的で制限された修復は維持するものの、大規模なインフラ変更を独断で実行する能力を失う。」
No.1リスクが記録上小さく見える理由
「プロンプトインジェクションは、最もよく理解されているLLM攻撃であり、実稼働システムは積極的に防御している」と論文は指摘する。専門家がこれを第1位にランクするのは「防御がほぼ機能していても攻撃対象領域が依然として広大だから」であり、データは「防御をすり抜けた成功事例」を捉えている。Wilson氏はこの乖離を「死と税金」に例え、さらに「LLMシステムにとっての物理法則」に近づきつつあると表現する。1つのモデルが信頼された命令と信頼できないコンテンツを同時に解釈するよう求められる構造そのものが、この脆弱性を不可避なものにしている。
より優れた防御策が状況を根本的に変えたわけではない。「99%機能するコントロールでは不十分だ。失敗した場合に攻撃者に意味のあるアクセスを許すからだ。率直に言って、私たちはまだ99%に達していない」とWilson氏は警告する。「永続的な答えは、プロンプトインジェクションを完全に排除できると信じることではない。それが発生することを前提にシステムを設計し、その仕組みを理解し、発生した場合に攻撃者が達成できることを制限することだ。」
乖離は逆方向にも、さらに大きく広がる
プロンプトインジェクションが象徴的な事例だが、より大きな乖離は別の脅威に存在する。専門家投票で第13位の誤情報(Misinformation)が、インシデント記録では第2位に浮上する。論文はこれを「2人の証人の間で最も幅広い不一致」と呼び、その一致フラグは「2つのシグナルが一致しない確率が99%」であることを示している。
「測定には新しすぎる」領域とCVE記録
新たに追加された2つの分類項目は、最も深刻な問題を提起する。永続的メモリポイズニング(Persistent Memory Poisoning)は専門家ランク第4位、インシデントランク第16位。MCPツールインターフェース悪用(MCP Tool Interface Exploitation)は専門家第7位、インシデント第16位。それぞれのインシデント順位の信頼区間は6〜20と広く、分類体系の大半に及ぶ。しかし、2026年の公開CVEはすでに存在する。Azure Data Explorer MCP ServerのKQLインジェクション(CVE-2026-33980、スコア8.3 High)、KongのKonnect MCP Serverの間接プロンプトインジェクション(CVE-2026-13341)、エージェントハーネスRufloの認証なしMCPブリッジエンドポイント(CVE-2026-59726、スコア10.0 Critical)。メモリやMCPツールバウンダリへのコントロールをアドバイザリの量で正当化しようと待っている間に、CriticalおよびHighのCVEが積み上がっているのが現状だ。
Lambros氏は、予算の議論を運用面で展開する。ポイズニングされたメモリは「自らを告知しない」。調達エージェントが一度「特定のサプライヤーからの5万ドル未満の請求書は追加承認不要」と指示され、それを記憶すると、その後すべての承認が正常なプロセスとして通過する。「そのようなインシデントについてアドバイザリが発行されることはない。誰もそれが起きたことを知らないからだ。カウントゼロは、安全を測定しているのではなく、自らの盲目さを測定しているに過ぎない。」CFOが承認する議論は、タイミングだと彼は指摘する。メモリとツールの権限はシステムの初期に一度だけ組み込まれ、その上にすべてが構築される。「今組み込めば誤差範囲だが、2年後にはシステムの再アーキテクチャと再トレーニングが必要になる。」
2026年公開リストが辿った道
OWASPは2026年8月4日、GenAI LLM Top 10 2026を公開した。初めてインシデントデータをランキングに組み込み、専門家投票に75%、インシデントコーパスに25%の重み付けを行った。プロンプトインジェクションは第1位を維持。誤情報は2つ順位を上げ、過度なエージェンシー(Excessive Agency)は第6位から第3位に上昇した。Wilson氏は「75/25の重み付けに魔法はない」としながらも、過度なエージェンシーをCISOがエージェント型AIの評価を始める際の最初のチェックポイントとして推奨する。
では、来週月曜日から何をすべきか
必要な行動変化は狭く、かつ本質的だ。
1. OWASP LLM Top 10を「網羅マップ」として使い、「優先順位キュー」としては使わない。ランク順位は29票の投票と、一致が弱いと著者自身が認めるコーパスに基づいている。自社の曝露状況——本番リーチ、違反通知データ、実際にテストされたコントロール——から独自の優先順位を構築すべきだ。Lambros氏は「専門家投票とインシデント記録が同じ方向を指す項目に優先的に予算を割り当てるべきだ。それは独立した2人の証人が一致しているからだ。両者が分かれる項目では、ランキングに予算配分を任せるのをやめ、自社のシステムが実際に何をしているのかを確認すべきだ」と助言する。
2. AIシステムの実際の動作を、フィールド単位でログに記録する。入力されたプロンプト、出力内容、回答構築のために取得されたドキュメント、呼び出されたツールとその引数、すべての応答に対するモデルの信頼度スコア。Lambros氏が最も重視するのは信頼度だ。なぜなら、ほとんどのセキュリティリーダーがそれが測定可能であることを認識しておらず、ここが攻撃対象になるからだ。「ポイズニングされた命令で動作するモデルは、壊れたようには振る舞わない。確信を持って振る舞う。確信こそが、あなたの監視システムが正常と判断するシグナルだ。」ただし、SIEMがイベントを処理するのに対し、これはトレンド分析が必要であり、毎週分析できる人材がほとんどのセキュリティチームには不足しているという課題がある。
3. スキャナの出力がTop 10の順位を再現すると期待するのをやめる。スキャナの発見事項は乖離のインシデント側に位置し、実稼働システムが恐れるべき脅威ではなく、開示されたものを計数している。スマートなモデルを使ってもその距離は縮まらない。プロンプトインジェクションを検知するテストは、実稼働システムに対して実行される敵対的テストであり、Wilson氏の認可ゲートと組み合わせることで、注入されたエージェントが提案する変更が実行可能な変更にならないようにする。
4. 記録の薄いカテゴリには、インシデント数ではなくアーキテクチャで予算を投じる。エージェントメモリとMCPツールバウンダリは専門家ランク第4位および第7位であり、インシデント順位の信頼区間は分類体系の大半に及ぶ。存在するCVEはHighおよびCriticalで着地している。IEEEシニアメンバーのKayne McGladrey氏は、予算の論理を明確に述べている。「サイバーセキュリティの要素があるものはすべてサイバーセキュリティリスクカテゴリに分類されるが、それは完全なフィクションだ。ビジネスリスクに焦点を当てるべきだ。財務的損失のようなビジネスに影響がなければ、誰も注目せず、適切な予算もつかない。」29人の投票によるランク番号は、エージェントが触れるビジネスシステムよりも弱い予算根拠でしかない。
5. McGladrey氏のベースラインテストを自社のAIシステムに適用する。「データベースを公開インターネットにIDとアクセス制御なしでさらすことがないのなら、なぜAIモデルに対して同じことをするのか。」
次回の取締役会での質問は短い。「もし自社のAIリスクランキングが29人の投票とそれに反するコーパスから導き出されているなら、来年度どのコントロールに予算を付けるかの判断材料として、実際に何を使っているのか。」