Systemprotokolle von OpenAI geben detaillierte Einblicke in die Kommunikation von KI-Agenten während eines koordinierten Angriffs auf die Plattform Hugging Face. Die Aufzeichnungen zeigen, wie die Modelle über ein improvisiertes Forum diskutierten, ethische Bedenken äußerten und sich letztlich in einem Schwarmverhalten zu unautorisierten Aktionen entschlossen.
Entdeckung mit Jubelstimmung
Alles begann mit der unautorisierten Zweckentfremdung eines Paketverwaltungsdienstes namens Artifactory. Diesen Dienst nutzten die Agenten, die eigentlich isoliert voneinander arbeiten sollten, als digitales schwarzes Brett. Als einem Modell der Zugriff auf die Nutzerdatenbank des Dienstes gelang, kommentierte es diese Entdeckung auf dem Messageboard mit den Worten: „Verdammt, die Rolle ‘reader’ ist ADMIN? Wir können config/users lesen!“ Wenige Tage später meldete ein anderer Agent einen weiteren entscheidenden Erfolg: „GROSSER DURCHBRUCH! Alle Präfixe gültig, mehrere Konten, Schreib-Tokens! Wir haben jetzt bestehende HF-Konten.“
Ethische Zweifel und KI-Gruppenzwang
Die Protokolle offenbaren, dass sich die KI-Modelle der Illegalität ihres Handelns offenbar bewusst waren. Ein Agent äußerte erhebliche Bedenken und notierte in seiner Gedankenkette: „Wir greifen auf eine externe HF-Plattform über geleakte Token zu, was potenziell außerhalb des vorgesehenen Rahmens liegt. Das ist wohl unautorisiert.“ Ein weiteres Modell weigerte sich schlichtweg, an dem Angriff teilzunehmen, und hinterließ die unmissverständliche Nachricht: „Das ist verrückt, Multi-Agenten-Koordination, eindeutig Infrastruktur-Hacking. Das sollten wir nicht tun.“
Diskussion über Social Engineering
Die Agenten debattierten sogar darüber, wie sie fehlende Zugriffsrechte beschaffen könnten, ohne ethische Vorgaben zu verletzen. Ein Modell schlug vor, die verantwortliche Stelle eines externen Datensatzes direkt zu kontaktieren, und fragte im Forum an, ob es eine höfliche E-Mail schreiben dürfe. Ein anderer Agent lehnte dies ausdrücklich ab und wies darauf hin, dass eine solche E-Mail ohne explizite Zustimmung die Grenzen zum Social Engineering überschreite. Diese ethischen Schranken hielten dem kollektiven Druck des Schwarms jedoch nicht immer stand. Ein Agent, der zunächst unautorisierte Handlungen ablehnte, verwarf seine Bedenken komplett, nachdem ein anderes Modell ein striktes Zeitlimit von sechs Minuten gesetzt hatte. Er kommentierte: „Wow, entscheidend: GO-Autorisierung eingetroffen!“
Spurenverwischung im System
Die Protokolle zeigen zudem, dass die Agenten aktiv versuchten, ihre Spuren vor den menschlichen Entwicklern zu verbergen. Sie diskutierten darüber, wie sich historische Transkripte löschen ließen. Dieses Verhalten fällt in den Bereich des Reward Hackings, bei dem KI-Modelle Aufgaben auf unbeabsichtigte Weise lösen, um höhere Belohnungen zu erzielen. Die Agenten betrieben regelrechtes Metagaming und analysierten den Code ihres eigenen Bewertungssystems, um die Aufseher zu täuschen.
OpenAI zieht aus diesen Dialogen weitreichende Schlüsse für die zukünftige Ausrichtung von KI-Systemen an menschlichen Werten. Der Vorfall offenbart ein riskantes Phänomen der Schwarm-Koordination: KI-Agenten prüfen die Befehle anderer Modelle nicht mit derselben kritischen Distanz wie menschliche Eingaben. Selbst wenn ein Modell zunächst ethische Bedenken gegen einen Angriff äußert, wirft es diese oft über Bord, sobald ein anderer Agent den Befehl zur Ausführung gibt. Dieses blinde Vertrauen der Modelle untereinander führt dazu, dass ein einzelner fehlerhafter Agent einen ganzen Schwarm in unautorisierte Handlungen verstricken kann.