Anthropic kennzeichnet Claude-Texte weltweit mit unsichtbaren Wasserzeichen

Anthropic kennzeichnet Claude-Texte weltweit mit unsichtbaren Wasserzeichen, basierend auf Googles SynthID-Technologie, zur Erfüllung des EU AI Acts.

Die neue Wasserzeichen-Technik von Anthropic für Claude verändert die Wortauswahl unsichtbar und bleibt ohne Qualitätseinbußen.
Highlights
  • Anthropic führt weltweit unsichtbare Wasserzeichen für Claude-Texte ein, die auf Googles SynthID-Ansatz basieren.
  • Die Wasserzeichen-Technik hat keine negativen Auswirkungen auf Länge, Geschwindigkeit oder Kosten der Texterstellung.
  • Leichte Bearbeitungen wie Grammatikkorrekturen können die statistische Signatur des Wasserzeichens bereits deutlich schwächen.

Die Kennzeichnung KI-generierter Inhalte nimmt konkrete Formen an. Anthropic, einer der führenden Anbieter im Bereich künstlicher Intelligenz, führt weltweit ein unsichtbares Wasserzeichen für Texte seines Sprachmodells Claude ein. Das Unternehmen reagiert damit auf regulatorische Vorgaben der Europäischen Union, die im Rahmen des EU AI Acts von allen Anbietern eine eindeutige Markierung synthetischer Inhalte verlangt.

Anders als bei Bildern, wo Wasserzeichen oder Metadaten bereits gängige Praxis sind, steht die textbasierte Kennzeichnung vor besonderen Herausforderungen. Anthropic hat sich für ein Verfahren entschieden, das auf Googles SynthIDa-Text-Ansatz basiert und ohne sichtbare oder versteckte Zeichen im Text auskommt. Die Technik verändert den Erstellungsprozess selbst, ohne die Qualität oder Kreativität der Ausgabe zu beeinträchtigen.

Wie das unsichtbare Wasserzeichen von Claude funktioniert

Sprachmodelle wie Claude generieren Text, indem sie aus einer Liste wahrscheinlicher Folgewörter eines auswählen. Genau an diesem Punkt setzt das Wasserzeichen an: Es modifiziert die Quelle der Zufälligkeit, die bei diesen Entscheidungen verwendet wird. Statt eines beliebigen Zufallsgenerators kommt ein geheimer Schlüssel in Kombination mit vorangegangenen Wörtern zum Einsatz.

Anthropic erklärt diesen Prozess präzise: „Die Wörter, die Claude auswählt, sind immer noch zufällig – aber nun kann man die Sequenz der Wörter überprüfen und sehen, ob sie mit den Entscheidungen übereinstimmt, die Claude mit dem Schlüssel treffen würde.“ Diese statistische Signatur bleibt für den Leser unsichtbar, lässt sich aber mit dem entsprechenden Detektionsschlüssel nachweisen. Wichtig ist, dass die Methode nicht bei jeder einzelnen Wortwahl greift, sondern nur bei Entscheidungen, bei denen mehrere sinnvolle Optionen existieren.

Keine Auswirkungen auf Länge, Geschwindigkeit oder Kosten

Die Wasserzeichen-Technologie hat nach Angaben von Anthropic keinerlei negative Effekte auf den laufenden Betrieb. Es werden keine zusätzlichen Tokens benötigt, die Generierungsgeschwindigkeit bleibt nahezu unverändert, und es entstehen keine Mehrkosten. Nichts wird dem Text hinzugefügt – weder versteckte Zeichen noch Metadaten im Dokument selbst. Die eigentliche Markierung existiert nur im statistischen Muster der Wortwahl.

Ausnahmen: Fakten und Code bleiben weitgehend unberührt

Es gibt jedoch wichtige Ausnahmen von der Wasserzeichen-Technik. Bei faktischen Aussagen, bei denen nur eine Antwort korrekt ist, greift der Mechanismus nicht. Ein klassisches Beispiel: Nach „2 + 2 =“ gibt es nur eine richtige Fortsetzung („4“). Ebenso verhält es sich mit Code, bei dem ein falscher Begriff das Programm zum Absturz bringen würde.

Anthropic betont, dass Code generell weniger Wasserzeichen enthält als andere Textformen. „Die ‚Beeinflussung‘ des Wasserzeichens würde hier nicht angewendet werden“, so das Unternehmen. Ausnahmen bilden Kommentare im Code, wo willkürliche Entscheidungen möglich sind. Dies deckt sich mit den Forschungsergebnissen von Google DeepMind, wonach das Verfahren bei geringer Entropie in der Verteilung – also bei vorhersehbaren Antworten – weniger effektiv ist.

Grenzen der Detektion bei leichter Bearbeitung

Eine wesentliche Einschränkung betrifft die Bearbeitung von Texten. Leichte Korrekturen von Grammatik oder Zeichensetzung können die statistische Signatur bereits deutlich schwächen. Eine vollständige inhaltliche Neufassung, bei der jedes Wort ausgetauscht wird, entfernt das Wasserzeichen vollständig. Auch Übersetzungen, die Claude komplett selbst erstellt, weisen das Wasserzeichen auf, da jedes Wort von der KI gewählt wird.

Anthropic plant öffentliche API zur Erkennung

Um die Detektion der Wasserzeichen praktikabel zu machen, entwickelt Anthropic eine spezielle API. Diese kann die Wahrscheinlichkeit einschätzen, mit der Claude an der Erstellung eines Textes beteiligt war. Das Unternehmen stellt jedoch klar, dass dies kein Beweis für die Urheberschaft ist. „Ein Wasserzeichen kann nur feststellen, dass Claude wahrscheinlich an dem Inhalt beteiligt war. Es kann nicht unterscheiden zwischen ‚Claude hat das geschrieben‘ und ‚Claude hat das stark bearbeitet‘“, heißt es dazu.

Die Erkennung wird bei kurzen Textabschnitten unzuverlässiger, da weniger statistisches Material zur Analyse zur Verfügung steht. Zudem ist die Technik modellspezifisch: Ein Claude-Wasserzeichen sagt nichts darüber aus, ob ein Text von einem anderen KI-Modell wie GPT-4 oder Gemini stammt, da diese andere Schlüssel und Verfahren verwenden.

Ausblick: Globale Einführung und C2PA für Bilder

Anthropic führt das Wasserzeichen weltweit und nicht nur in der EU ein. Grund ist die fehlende technische Möglichkeit, die Markierung regional zu begrenzen. Zukünftige Claude-Modelle werden wasserzeichenfähig sein; für Modelle, die vor dem 2. August 2026 veröffentlicht wurden, gilt eine Übergangsfrist. Für generierte PNG-, JPG- und SVG-Dateien setzt Anthropic auf einen anderen Ansatz: Hier kommen kryptografisch signierte C2PA-Provenienz-Metadaten zum Einsatz, die die Erstellung mit Claude dokumentieren, ohne die Datei selbst zu verändern.

Diese Entwicklung markiert einen wichtigen Schritt hin zu mehr Transparenz im Umgang mit KI-generierten Inhalten. Während das System keine vollständige Sicherheit bietet – eine motivierte Person kann das Wasserzeichen durch eine komplette Neufassung entfernen –, schafft es eine robuste technische Grundlage für die Nachverfolgbarkeit. Die Kombination aus regulatorischem Druck und technischer Innovation könnte langfristig zu einem Standard für die Kennzeichnung synthetischer Texte werden, der über einzelne Anbieter hinausreicht.

Diesen Artikel teilen