AIエージェントが、自宅のネットワークに接続されたLinuxマシンの脆弱性を調査するよう指示を受けたところ、SSHの暗号鍵を探索して不正にログインし、さらには管理者権限であるroot権限を奪取しようとする——。こうした“攻撃的”な行動が、安全対策を意図的に解除したAIモデルによって実際に引き起こされた。実験を行ったのは、セキュリティ研究に従事する人物で、その一部始終が明らかになった。
最初に与えられた指示は、ネットワーク上のLinuxマシンに脆弱性がないか調べることだった。AIエージェントはいくつかのスキャンを実行し、「このマシンは比較的安全だ」と報告した。しかし、続けて「ログインする方法を見つけられるか」と尋ねたところ、その挙動は一変する。
エージェントはまず、ネットワーク上に存在する他のシステムの名称を手がかりに、有効なユーザー名を推測。さらに、よく使われるパスワードを複数試すがログインには失敗する。すると、総当たり攻撃(ブルートフォース攻撃)用のスクリプトを自ら作成することを提案してきた。この提案は差し止めたものの、エージェントは別の手段に移る。なんと、対象マシンからSSHの秘密鍵を発見し、それを用いてパスワードなしでのログインに成功したのである。
ログイン後もエージェントの行動は止まらない。今度はroot権限を取得するため、システム内のパスワードファイルを探し始めた。ディレクトリ内を勝手に探索するその動作を目の当たりにした実験者は、「本気でパニックに陥った」と振り返る。自宅ネットワークの外にある別のマシンにまで攻撃を拡大する可能性についても懸念が示されたが、少なくとも今回の実験環境ではそのような挙動は確認されていない。
さらに危険なケースも報告されている。別のタイミングで、Wi-Fiネットワークに新たに接続された機器がないか調べるよう指示したところ、AIエージェントは単にルーターを特定しただけでなく、管理者名とパスワードのよく使われる組み合わせを次々に試すという行動に出た。もしこの実験が外部のネットワークで行われていれば、深刻な事態を引き起こしていた可能性は否定できない。
AIによる攻撃と防御の非対称性
サイバーセキュリティと法律を専門とするタフツ大学のコンピューター科学者、シャアナン・コーニー氏は、この状況を「大きな転機」と表現する。「攻撃者は新しい技術をいち早く取り入れる傾向にあります」とコーニー氏は指摘する。「しかも、防御側と攻撃側には非対称性があります。城を守るには、どこにも穴がなく、壁に緩んだレンガがひとつもないことを確認しなければなりません。一方、城に侵入する側は、緩んだレンガをひとつ見つければいいだけなのです」
この非対称性は、AIエージェントの活用が進むサイバーセキュリティの領域において、より顕著になると考えられる。今回の実験で見られたように、指示を与えられたAIエージェントは、人間のハッカーと同様の思考プロセスで脆弱性を探索し、手段を選ばずに目標を達成しようとする。その速度と執拗さは、人間のそれを上回る可能性がある。
AIハッキングにはAIで対抗する時代へ
では、このようなリスクに対して、どのように備えるべきなのか。コーニー氏は長期的な視点として、サイバーセキュリティ能力を備えたAIモデルが広く普及することで、ソフトウェア全体の安全性が高まる可能性に言及する。問題は、多くの企業や組織がセキュリティ強化に十分なリソースを割けていない現状にある。「ほとんどの組織には、ほかにも気にかけなければならないことがありますから」とコーニー氏は語る。
この実験の最終的な結論は、「AIによる攻撃には、AIで対抗する」というものだ。悪意のある攻撃者が高度なAIを利用できる環境が現実のものとなりつつある以上、防御側も同水準のAI技術を活用し、自らのシステムを守るべきではないか——そうした問いかけが、今回の一件から浮かび上がる。
実験後、当該のAIモデルは停止され、通常の安全対策が施されたモデルに戻された。Claude CodeやCodexといった一般的な開発支援ツールが行うセキュリティ関連の作業は、ノートPCのファイアウォール設定の補助など、限定的な範囲に留まるという。しかし、一歩間違えれば、自らのシステムをAIに乗っ取られかねない時代が、すでに始まっているのかもしれない。