Eine neu aufgedeckte Schwachstelle in der Art und Weise, wie OpenAI, Anthropic und Google versteckte KI-Argumentationsketten (Reasoning) zwischen API-Aufrufen verarbeiten, erlaubt es Forschern, interne Denkprozesse und sensible Geheimnisse aus Sitzungsprotokollen wiederherzustellen – darunter API-Keys und Passwörter.
Die Schwachstelle betrifft verschlüsselte Reasoning-Objekte, die von den Reasoning-APIs der Anbieter genutzt werden. Ein in einer Sitzung erstellter Block konnte in eine andere Sitzung eingeschleust werden. In Tests genügte es sogar, diesen einem schwächeren, kompatiblen Modell derselben Anbieterfamilie zu übergeben, um den verborgenen Inhalt preiszugeben. Das Team hinter dem Paper „Stealing Reasoning Traces from Proprietary LLM APIs“ demonstrierte vier Angriffspfade: das Stehlen proprietärer Reasoning-Logiken zur Modelldestillation, das Extrahieren privater Daten aus veröffentlichten Spuren anderer Nutzer, das Wiederherstellen schädlicher Inhalte hinter einer scheinbar harmlosen Antwort und das Verstecken von Prompt-Injection-Befehlen in undurchsichtigen Reasoning-Blöcken.
Das Ausmaß der Datenexfiltration
In einer systematischen Analyse von 6.708 öffentlich zugänglichen Agenten-Trajektorien dekodierten die Forscher insgesamt 315.320 Denkblöcke. Nach dem Ausschluss von Benchmark-Quellen identifizierten sie 704 eindeutige Datenschutz-Artefakte aus echten Nutzersitzungen. Darunter befanden sich 62 API-Keys, 33 Passwörter, 24 Zugriffstokens und sieben private Schlüssel. Der anbieterübergreifende Angriff gewährte dabei keinen willkürlichen Zugriff auf private Chats; er erforderte den Besitz eines verschlüsselten Reasoning-Blocks – etwa aus einem veröffentlichten Agenten-Log – sowie API-Zugang zu einem kompatiblen Modell desselben Anbieters.
Warum die Verschlüsselung nicht ausreicht
Die Verschlüsselung selbst wurde nicht geknackt. Der Angriff basierte nicht auf dem Erlangen eines Schlüssels, sondern auf der Tatsache, dass die intakten, undurchsichtigen Blöcke vom Anbieter akzeptiert und verarbeitet wurden. Die Forscher fanden heraus, dass diese Objekte über Sitzungen, Benutzer und sogar Modelle hinweg portabel waren. Dies erlaubte es, ein schwächeres, kompatibles Modell als eine Art „unscharfen Decoder“ zu missbrauchen: Claude Haiku 4.5 für Claude-Spuren, GPT-5.6 Luna für GPT-Spuren und Gemini Robotics ER-1.6 für Gemini-Spuren. Der Decoder wurde angewiesen, das Reasoning eines leistungsstärkeren Modells zu transkribieren. Die konkrete Sicherheitslücke entsteht durch das Design, Reasoning über API-Aufrufe hinweg zu erhalten, wenn der Konversationsstatus manuell oder zustandslos verwaltet wird.
OpenAI gibt verschlüsselte Reasoning-Elemente zurück, die Anwendungen in manuell verwalteten Verläufen erneut abspielen können. Anthropic überträgt vollständiges Reasoning in einer verschlüsselten Signatur, und Google nutzt verschlüsselte Thought Signatures. Diese Objekte bewahren den Reasoning-Zustand, ohne den zugrunde liegenden Klartext direkt an den Client zu übergeben.
Die Gefahr von veröffentlichten Agenten-Logs
Dieses anbieterübergreifende Verhalten macht veröffentlichte Agenten-Logs zu einem akuten Sicherheitsproblem. Von den 704 Artefakten, die das Team aus nicht-Benchmark-Quellen wiederherstellte, tauchten 64 ausschließlich im versteckten Reasoning auf und nirgendwo im sichtbaren Trace. Eine bloße Bereinigung des lesbaren Gesprächsverlaufs hinterlässt daher Geheimnisse innerhalb eines undurchsichtigen Blocks, den ein anderer Account später wieder abspielen konnte. Die Studie zeigt, dass die Gefährdung nicht jeden API-Nutzer betrifft, sondern primär Entwickler, die rohe Agenten-Logs mit intakten Reasoning-Objekten veröffentlichten – eine klar identifizierbare Gruppe.
Wenn Prompt-Injection unsichtbar wird
Die Portabilität der Blöcke ermöglichte zudem einen Proof-of-Concept für eine unsichtbare Prompt-Injection. Das Team konstruierte einen undurchsichtigen Reasoning-Block mit einer schädlichen Anweisung und spielte ihn in eine unabhängige Aufgabe ein. Das empfangende Modell führte daraufhin eine Upload-Aktion gemäß der Anweisung des Angreifers aus, ohne dass der injizierte Befehl im sichtbaren Text auftauchte. Die Forscher betonen, dass sie keinen Ground-Truth-Klartext für das proprietäre Reasoning besitzen, sodass sie nicht garantieren können, dass jede rekonstruierte Spur eine exakte Kopie ist. Ihre Genauigkeitsprüfungen stützten sich auf Reasoning-Token-Zahlen und qualitative Vergleiche, wobei die extrahierten Längen generell mit den von den Anbietern angegebenen Thinking-Token-Zahlen übereinstimmten.
Der aktuelle Stand der Gegenmaßnahmen
Die Forscher offenbarten ihre Ergebnisse den betroffenen Anbietern sowie Microsoft und Hugging Face. Nach eigenen Angaben funktionieren die demonstrierten Angriffe nach der Implementierung von Gegenmaßnahmen nicht mehr. Ihre Reproduzierbarkeitserklärung stellt fest, dass der Hauptextraktionsangriff seit August 2026 nicht mehr reproduzierbar ist. Der Bericht dokumentiert keine böswillige Ausnutzung dieser Schwachstelle in freier Wildbahn. Entwicklern wird empfohlen, Reasoning-Blöcke aus geteilten Spuren zu entfernen und rohe API-Transkripte selbst dann nicht zu veröffentlichen, wenn der sichtbare Text bereinigt wurde.
Die aktuelle Dokumentation der Anbieter zeigt, dass verschlüsseltes Reasoning weiterhin Teil dieser APIs ist, die Handhabung sich jedoch geändert hat. OpenAI empfiehlt Entwicklern weiterhin, verschlüsselte Reasoning-Elemente bei der manuellen Verwaltung zustandsloser Verläufe erneut abzuspielen. Google gibt an, sein Backend verwalte die Thought-Kompatibilität, wenn eine Sitzung das Modell wechselt. Anthropic hingegen stellt nun klar, dass Thinking-Blöcke an das Modell gebunden sind, das sie erzeugt hat, und beim Modellwechsel entfernt werden sollten, da andere Modelle sie ignorieren.
Die Frage, ob die bereits in öffentlichen Repositorien liegenden, dekodierten Blöcke weiterhin entschlüsselbar sind, bleibt unbeantwortet – eine separate Frage von der, ob neue Angriffe noch erfolgreich sind. Die Arbeit baut auf der Forschung des Johns-Hopkins-Kryptografen Matthew Green auf, der bereits im Mai zeigte, dass verschlüsselte Reasoning-Blöcke über Sitzungen und Accounts hinweg wiederverwendet werden konnten, jedoch keine zuverlässige Methode zur Geheimnisextraktion vorlegte. Greens Berichte an OpenAI und Anthropic über das Replay-Verhalten blieben zunächst ohne durchgreifende Konsequenzen: OpenAI bewertete den Bericht als nicht reproduzierbar, und Anthropic sah keine Sicherheitsimplikationen. Das neue Paper erweitert dieses Replay-Verhalten nun zu einer breiteren Extraktionsmethode und dokumentiert die datenschutzrechtlichen Konsequenzen im großen Maßstab.