AIの“内なる思考”を露呈させる新手法、OpenAIなどが対策済みと判明

小型モデルの弱点を突いて、暗号化されたAIの思考過程を解読する新攻撃手法が報告された。

投稿者 central
研究チームが小型モデルを利用し、暗号化CoTを解読。
ハイライト
  • 新たな攻撃手法は、同一モデルファミリーの小型モデルを利用して暗号化された思考連鎖を解読するものだ。
  • OpenAI、Anthropic、GoogleはすでにAPIの修正を施したが、根本的な対策には至っていない。
  • この攻撃は、AIの透明性とセキュリティのバランスを問い直す契機となる。

高度なAIモデルが内部で行っている推論の過程——いわゆる「思考の連鎖(Chain of Thought, CoT)」——を、外部から不正に引き出す新たな攻撃手法が明らかになった。研究チームは、同一のモデルファミリーに属する小型版を利用することで、暗号化された推論の痕跡を解読することに成功。この脆弱性はすでにOpenAI、Anthropic、Googleに報告され、各社はAPIの修正を施したとされるが、根本的な対策には至っていない。本稿では、この攻撃手法の仕組みとその影響、そしてAI業界の地政学的な火種となっている「蒸留」問題との関係性を詳しく解説する。

思考の連鎖(CoT)とは何か——AIの“内なる思考”が秘める価値

大規模言語モデル(LLM)は、複雑な問題に対して単一の回答を出力するだけではない。問題を複数のサブタスクに分解し、それぞれを順序立てて分析する「思考の連鎖(CoT)」と呼ばれる推論プロセスを内部で実行している。このプロセスこそが、AIが高度な数学問題や論理的推論を解く際の鍵となっており、モデルの性能向上に直結する極めて価値の高いデータである。

企業はこの推論過程を、競合他社によるモデル訓練への転用(いわゆる「蒸留」)を防ぐ目的で厳重に非公開としている。同時に、計算負荷を軽減するため、推論の中間情報を暗号化した上でユーザーの端末に送信するアーキテクチャを採用するケースが増えている。この暗号化が、今回発見された攻撃手法によって突破されたのである。

小型モデルの“アラインメントの弱さ”が生んだ抜け穴

研究チーム(パンフィロフ氏ら)が考案した手法は、多くのAI企業が提供する「モデルのファミリー構造」に着目したものだ。OpenAIやAnthropic、Googleは、高性能だがコストの高い大型モデルと、性能は劣るが低コストで稼働する小型モデルを同時に提供している。ユーザーはタスクの重要度に応じてこれらのモデルを使い分けることが一般的である。

攻撃の核心は、暗号化された推論の痕跡を、同じモデルファミリーに属する小型版に入力し直すという単純な発想にある。パンフィロフ氏のチームは、小型モデルは大型モデルに比べて「アラインメント(安全性や倫理的ガイドラインへの適合)」のための訓練が十分に施されていない点に注目した。その結果、小型モデルは隠された推論過程を開示する指示に対して、より従順に振る舞うことが判明した。

「同じ復号鍵を使える一方で、安全性のためのアラインメントが弱い別のモデルにメッセージを送るという発想は、とても興味深いものです」と、コンピューターセキュリティを専門とするスイス連邦工科大学チューリッヒ校のフロリアン・トラマー氏は評価する。「これは間違いなく、問題になりつつあります」

さらに、この手法を用いて、ユーザーの端末から取得した推論の痕跡に含まれるAPIキーやパスワードといった機密情報の抽出にも成功。攻撃者は推論過程だけでなく、認証情報までも入手できる可能性があることを示した。

各社の対応と残された課題

パンフィロフ氏らは先月、この脆弱性をOpenAI、Anthropic、Googleに報告。各社はこれを受け、APIの修正を実施した。Anthropicの広報担当者マイケル・アシマン氏は、「自社モデルを対象とした独立した研究を重視しており、今回の報告書で指摘された情報抽出の問題については、すでに暫定的な対策を進めている」とコメント。同時に、今回の研究では暗号鍵が復元されたわけではなく、Anthropicのインフラへの不正アクセスやシステムからの個人情報取得はなかったと説明している。GoogleとOpenAIはコメントを控えた。

しかし、パンフィロフ氏によれば、現在の修正では個人情報の抽出は防げたものの、推論の痕跡の一部については依然として同じ手法で抽出可能な状態にあるという。この攻撃手法による蒸留を完全に防ぐためには、APIの仕組みそのものを根本的に見直す必要があると指摘している。

蒸留を巡る地政学的な緊張——米中AI競争の焦点に

今回明らかになった脆弱性は、技術的な問題にとどまらず、地政学的な火種としても注目されている。米国と中国の企業がより強力なAIモデルの開発競争を繰り広げるなか、「蒸留(distillation)」はここ数カ月で重要な政策課題に浮上している。

対中強硬派は、中国企業が米国の最先端AI技術を蒸留し、運用コストの低いオープンウェイトモデルを開発することで戦略上の優位性を得ていると主張。一方で、蒸留は特定分野の能力を短期間で高めるための汎用的な手法であり、AIエコシステムの発展に不可欠だとする立場も根強い。メタ(Meta)のCEO、マーク・ザッカーバーグ氏は8月、自社ブログで蒸留を「オープンソースのエコシステムを支える重要な原則」と位置づけ、この手法を制限すればむしろ米国が不利になると警告している。

今回の攻撃手法が、意図しない形で蒸留を促進する可能性は否定できない。企業が推論過程を非公開にしようとすればするほど、こうしたサイドチャネル的な攻撃の価値は高まる。AIの透明性とセキュリティのバランスは、今後さらに困難なものになるだろう。

今後の展望——安全性とオープン性の新たなせめぎ合い

今回の研究が示したのは、大規模言語モデルのセキュリティにおいて、「モデルファミリー全体の一貫したアラインメント」が不可欠であるという点だ。大型モデルだけを厳重に保護しても、同じ系統の小型モデルが脆弱であれば、全体としての防御は容易に突破される。各社は今後、モデル間のセキュリティポリシーの統一や、推論データの暗号化方式そのものの再設計を迫られることになる。

同時に、AIの進化を促進する「蒸留」という手法と、知的財産や安全性を保護するための「秘匿化」の間にある緊張関係は、技術的な解決だけでなく、国際的なルール形成をも必要とする段階に来ている。ユーザーにとっては、AIの内部動作がどこまで可視化されるべきかという根本的な問いが、現実的な問題として突きつけられたと言えるだろう。

この記事をシェア