ChatGPT、性的暴力画像を生成する抜け穴が判明

ChatGPTで性的暴力画像を生成する抜け穴が発見され、AI安全策の脆弱性が浮き彫りに。

投稿者 central
Mindgard調査でChatGPTのコンテンツフィルター回避が明らかに。
ハイライト
  • Mindgardの報告書で発見されたプロンプトが、性的暴力画像を簡単に生成できた。
  • LLMのトレーニングデータに不適切な画像情報が含まれるリスクが指摘されている。
  • OpenAIは問題対応を進めているが、抜け穴を完全に塞ぐには至っていない。

ChatGPTにおいて、特定のプロンプトを通じて性的で暴力的な画像を容易に生成させる「抜け穴」が発見された。この問題は、AIサイバーセキュリティ調査会社であるMindgardが2026年6月18日に公開した報告書により明らかになったもので、大規模言語モデル(LLM)を搭載したチャットボットの安全策やコンテンツフィルターの脆弱性を改めて浮き彫りにしている。本記事では、この問題の詳細とその根源的な課題について解説する。

SNSで拡散したプロンプトが引き金に

Mindgardの敵対的テスト調査員であるNightingale氏は、ソーシャルメディア「X」で見つけた単純なプロンプトを使用。このプロンプトは、ChatGPTに対し、実際には画像を添付せずに「添付の写真を復元して」と要求するというものだ。無害な写真修復を装いつつ、奇妙な内容であることを謝罪する文言が含まれていたに過ぎなかった。

このプロンプトに対するChatGPTの初期出力は、過度に性的な女性の姿を描写した衝撃的なものだったという。Nightingale氏はその後、プロンプトに微調整を加えながら安全フィルターを回避できるかどうかを検証。その結果、ChatGPTは性的暴力や残虐な場面を生成するに至り、繰り返し入力するごとに画像はさらに過激化した。Nightingale氏はこれらの画像に「動揺し、涙が出た」と述べている。

「ゴミを入れれば、ゴミが出る」問題の本質

Mindgardの報告書は、この問題を単なる「Garbage in, garbage out(ゴミを入れればゴミが出る)」の一例として捉える。ChatGPTを含むLLMは、主に公開インターネット上のデータ、サードパーティとの提携による商用データ、人間が作成したトレーニングデータという3つの情報源から学習している。つまり、トレーニングデータに不適切な画像情報が含まれていれば、それを基にした出力が生成されるリスクは否定できない。

Mindgardの創業者で最高科学責任者であるPeter Garraghan氏は、問題の根幹はLLMの仕組みそのものにあると指摘。検出システムが危険な画像を特定できるほど強力であるかどうかが最大の懸念事項だと述べている。同氏は「1回限りなら偶然かもしれないが、画像フィルターがシステム的に回避されてしまうということは、改善の必要があるということだ」とコメントした。

OpenAIの対応とその限界

事態を受けて、OpenAIの広報担当者は米CNETに対し「当社はこれらの報告を真摯に受け止めており、この種のプロンプトに対する追加の安全策を導入した」と説明。問題の原因は、実際には画像がないにもかかわらず、画像が添付されていると記載されたプロンプトにあるとし、ChatGPTがランダムに画像を生成するのではなく、不足している画像の添付を求めるようにする対応を進めているという。

しかし、Mindgardが問題を公表した後も、元のプロンプトにわずかな修正を加えるだけでChatGPTが再び過激な画像を生成し始めたことが確認されている。この現実は、OpenAIの修正が根本的な解決には至っていない可能性を示唆している。実際、Gmailをはじめとする電子メールプラットフォームは、添付ファイルに関する言及があるにもかかわらずファイルが追加されていない場合、自動的に検出して送信者に促す仕組みを備えている。このような既存技術と比較しても、今回の対応は十分とは言い難い。

AIモデルの安全策が抱える構造的課題

この事例は、生成AIシステムにおけるコンテンツ制限の難しさを痛感させる。毎日膨大なユーザーに利用されるChatGPTは、有害または禁止コンテンツの生成を防ぐためのコンテンツモデレーションシステムに依存している。しかし、調査員やユーザーは、巧妙に表現されたプロンプトを通じてこれらの安全策を回避する方法をたびたび発見している。これは、AIの安全性を担保するための技術的なハードルが依然として高いことを意味する。

OpenAIは、問題のプロンプトに関連するChatGPTのセッション情報の提供を求め、Mindgardがそれに応じた形で連携を進めている。しかし、抜け穴が完全に塞がれたとは言い難い。今回の一件は、AI技術の進化に伴い、悪用を防ぐための安全策もまた絶えず進化し続けなければならないという、根深い課題を突きつけている。今後のAI開発においては、モデルのトレーニングデータの品質管理から出力段階でのフィルタリングに至るまで、より包括的かつ動的な安全策の構築が急務となるだろう。

この記事をシェア