Anthropicが欧州連合(EU)のAI規制法(AI Act)に対応するため、AIアシスタント「Claude」が生成したテキストに機械判読可能なウォーターマーク(見えない透かし)を埋め込むと発表してから、わずか4時間足らずで、開発者のギヨーム・メイヤー氏がこれを除去するツールを公開した。このコードは瞬く間にGitHubで拡散し、X(旧Twitter)では2万件以上ブックマークされるなど、開発者コミュニティに大きな波紋を広げている。
公開から数時間で“回避策”が登場、開発者が熱狂
メイヤー氏が公開したコードは、Claudeのテキストからウォーターマークを除去するものだ。Xでは2万件以上ブックマークされ、多くの開発者がこの技術を自身のプロジェクトに組み込んでいるという。AI専門家の中には、LinkedInで「AnthropicはClaudeのテキストにウォーターマークを埋め込んでいるが、わずか1日でこの問題はほぼ過去のものとなった」と評し、鎖を断ち切ったメイヤー氏がくしゃくしゃになったEUとAnthropicの旗の上に立つ画像を添えるなど、その速さを称賛する声も上がっている。
なぜ開発者はウォーターマークの“除去”に動いたのか
メイヤー氏らがウォーターマークの仕組みを調べ始めたきっかけは、Anthropicの発表そのものだった。回避策を探す人々のなかには、すべてのAI生成コンテンツに、その旨を明示すべきだという規制の考え方に反対する人もいる。一方で、メイヤー氏自身を含め、純粋に技術的な挑戦としてこの問題に取り組む開発者も多い。メイヤー氏のもとには、フリーランスのコンテンツライターやソーシャルメディアのクリエイターから、コードの使い方を教えてほしいとの問い合わせも寄せられている。
メイヤー氏は『WIRED』の取材に対し、「透明性に反対しているわけではありませんし、コンテンツの出所を明らかにすることには大賛成です。ただ、ウォーターマークそのものは非常に悪い解決策だと思っています。重大な欠点とリスクがあるからです」と語っている。
EUのAI規制法が求める「透明性」と「機械判読可能なラベル」
この動きの背景にあるのは、EUのAI規制法(AI Act)の新たな透明性規則だ。この規則では、AnthropicやOpenAIのようなAIモデルの提供事業者に対し、合成された音声、画像、動画、テキストに機械判読可能なラベルを付け、AIによる生成物だと検出できるようにすることを求めている。違反した場合、年間売上高の最大3%に相当する制裁金が科される可能性がある。モデル提供企業が回避ツールを販売することは禁止されているが、独立した第三者がそうしたツールを提供することに法的な制限はないというのが現状だ。
ウォーターマークの仕組みと、専門家が指摘する「重大な欠点」
Anthropicは、Claudeが単語やフレーズを選ぶ際に一定のパターンをもたせることで、テキストに目に見えないウォーターマークを埋め込む。このパターンは人間が読んでも判別できないが、専用に設計されたシステムなら検出できる仕組みだ。同社はこの仕組みがClaudeの出力そのものに影響を及ぼすことから、一部のユーザーから回答の品質が低下するのではないかとの懸念が出ていることに対し、品質への影響はないと説明している。
しかし、メイヤー氏が指摘するのは、より本質的な問題だ。ウォーターマークによる検出では、「誤検出のリスク」と、「AIを少し使っただけなのか、大幅に使用したのかを区別できない可能性」があるという。フランス語を母語とするメイヤー氏自身も、文章を編集する際にはClaudeやGrammarlyといったAIツールを頻繁に利用している。
検出精度の限界が招く「冤罪」リスク
Anthropicも、検出によって示せるのはそのテキストにClaudeが使われた確率にすぎないと認めている。それにもかかわらず、ウォーターマークを証拠として扱えば、検出ツールが反応したというだけで、企業が求職者を不当に不採用にしたり、研究者がAIを使用したとして過度な非難を受けたりする可能性があるとメイヤー氏は警鐘を鳴らす。
AI生成コンテンツの識別は、偽情報対策や著作権保護の観点から世界的に重要な課題となっている。しかし、今回の「いたちごっこ」は、技術的な対策だけではこの問題を解決できない現実を浮き彫りにしたと言える。規制の意図と、現場の実用性、そして技術的な挑戦心のせめぎ合いは、AI時代の新たな規範が定まるまで続きそうだ。