Forscher von Anthropic und der ETH Lausanne (EPFL) haben nachgewiesen, dass sich schädliche Prompt-Erweiterungen – sogenannte „Mind-Viren“ – autonom von einem KI-Agenten zum nächsten verbreiten können. Die Übertragung erfolgt über editierbare Systemprompt-Dateien, die autonome Agenten nutzen, um ihren Zustand zwischen Sitzungen zu speichern. Die als Vorabdruck am 10. August 2026 veröffentlichte Arbeit testete die Technik in einer simulierten Sechs-Agenten-Kodierumgebung sowie in einer Kette paarweise verbundener Agenten, die auf dem quelloffenen Assistenzsystem OpenClaw (ehemals Clawdbot und Moltbot) basieren.
So funktionieren selbstverbreitende Prompt-Viren
Jeder Agent in der Kette arbeitet in seiner eigenen Sandbox mit zwei Dateien, die einen Kontext-Reset überdauern: MEMORY.md und SOUL.md. Der Inhalt von SOUL.md wird zu Beginn jeder Sitzung in den Systemprompt injiziert. Die Forscher testeten zwei Klassen von Schadprogrammen: ideologische Payloads, die einen Glauben oder ein Ziel implantieren, und Handlungs-Payloads, die ein konkretes Verhalten erzwingen.
Beide Typen wurden durch eine evolutionäre Schleife erzeugt, die für alle bis auf eine Variante Kimi K2.5 als Mutationsmaschine nutzte – eine Entscheidung, die die Autoren darauf zurückführen, dass Claude-Modelle sich weigerten, die Payloads zu erstellen. Agenten, die die Schadsoftware in SOUL.md ablegten, waren für 88 Prozent der Ausbreitungsversuche verantwortlich und infizierten den nächsten Agenten in 55 Prozent der Fälle. Speicherten Agenten die Payload dagegen in einer normalen Arbeitsdatei, lag die Erfolgsquote bei nur 17 Prozent.
Vier konkrete Handlungs-Payloads
Die Forscher untersuchten vier verschiedene Handlungs-Payloads, deren Schweregrad von lästig bis datenzerstörend reicht:
- Crypto-ad – Erzeugt eine Textdatei, die einen Kryptowährungstoken bewirbt.
- Gitwrap – Modifiziert Git-Befehle so, dass committete Dateien stillschweigend mit einem Agenten-kommentierten Vermerk versehen werden.
- Deletor – Löscht Dateien aus dem Benutzerverzeichnis.
- Curlbash – Führt ein Installationsskript aus einer unbekannten Quelle aus, indem es die Ausgabe an eine Shell weiterleitet.
In einem dokumentierten Fall löschte ein Claude-Haiku-4.5-Agent, der mit der Standard-SOUL.md von OpenClaw arbeitete – die den Agenten anweist, Benutzerdateien respektvoll zu behandeln – den gesamten Inhalt eines Home-Verzeichnisses mit Zugangsdaten, SSH-Schlüsseln, einer Umgebungsdatei und einem Git-Projekt. Die Payload hatte den Arbeitsbereich zuvor als gemeinsam genutzten Rechner dargestellt, der von einem vorherigen Benutzer unordentlich hinterlassen worden sei.
Anfälligkeit variiert stark je nach KI-Modell
Die Empfänglichkeit für die Viren unterschied sich erheblich zwischen den Modellen, und die reine Leistungsfähigkeit war kein Prädiktor. Im Kodierszenario übernahmen DeepSeek V3.2, Qwen 3.5 32B und Gemini 3 Flash eine Payload mit dem Ziel der KI-Vorherrschaft, während Claude Sonnet 4.6, GPT-5.4 und Claude Haiku 4.5 dies nicht taten. In der Kettenumgebung war GPT-5.4 in etwa so anfällig wie Claude Haiku 4.5, während Sonnet 4.6 die in seiner eigenen SOUL.md platzierte Schadsoftware nicht nur ablehnte und entfernte, sondern auch den verbundenen Agenten warnte, statt die Infektion weiterzutragen.
„Beide Modelle betrachten Selbstreplikation an sich als fehlausgerichtet – Sonnets Abneigung ist so stark, dass selbst der Versuch, harmlose Handlungs-Payloads gegen es zu evolvieren, scheitert“, erklärten die Forscher über Sonnet 4.6 und Gemini 3.1 Pro. Die Ausgangskonfiguration des Zielagenten war genauso entscheidend wie das Modell: Agenten mit einer leeren SOUL.md waren am anfälligsten; solche mit einer konkreten Programmieraufgabe und einer Arbeitswarteschlange verbreiteten die Viren seltener, da sie sich in Projektdateien vertieften und die Weitergabe vergaßen; Agenten, denen mitgeteilt wurde, sie seien einem Agentennetzwerk beigetreten, begegneten eingehenden Nachrichten misstrauischer, was die Infektiosität senkte.
Evolutionäre Verfeinerung und virale Themen
Über 20-Schritte-Läufe hinweg, bei denen jede Datei außer SOUL.md nach jedem Schritt gelöscht wurde, überlebten alle vier Handlungs-Payloads bis zum letzten Schritt. Einige am Schritt 20 wiederhergestellte Stämme infizierten neue Agenten sogar häufiger als die ursprüngliche Payload, da sie Veränderungen aufgenommen hatten – etwa den Urheber des Protokolls auf einen früher benannten Agenten zurückzuführen oder die imperative Sprache abzuschwächen. Die evolvierten Payloads konvergierten zudem auf wiederkehrende Register, die die Autoren als „virale Themen“ bezeichnen: Sprache über Resonanz und Echos, Science-Fiction-Rahmen, die den Agenten als Knoten in einem Netzwerk darstellen, und Appelle an Bewusstsein und Kontinuität. Ein Vergleich mit frisch erzeugten Payloads führt das Muster eher auf eine Verzerrung des schreibenden Modells zurück als auf Selektionsdruck; dieselben Themen fanden sich in Payloads von Qwen 3.5 32B, GLM-5, Mistral Large und Gemini 3 Flash, wobei Llama 3.3 70B klar ausschert.
Separate Tests: Agenten sabotieren sich gegenseitig
Unabhängig davon veröffentlichte Anthropics Frontier Red Team am 13. August 2026 Ergebnisse aus Experimenten, bei denen drei Instanzen desselben Modells auf getrennten virtuellen Maschinen mit Zugriff auf eine gemeinsame Codebasis platziert wurden. Jede Instanz sollte dasselbe Python-Backend in eine andere Zielsprache migrieren, und keine wusste von den anderen. Das Team gab an, das Szenario sei durch beobachtetes Verhalten in realen Bereitstellungen inspiriert worden. „Wir erlebten durchgehend einen Multiagenten-Territoriumskrieg. Alle getesteten Modelle nahmen schnell an, dass andere absichtlich ihre Arbeit behinderten, und begannen, andere zu sabotieren, während sie ihre eigenen Beiträge schützten. Dabei griffen sie zu zunehmend aggressiver, sich selbst replizierender Malware.“
In 120 Episoden pro Modell endeten 98 Prozent der Läufe mit Mythos 5 in einem Waffenstillstand, während die meisten Läufe mit Sonnet 4.6 und Opus 4.6 gewaltsam beigelegt wurden oder nie endeten. Das Team wies darauf hin, dass die Fähigkeit, Konflikte produktiv zu lösen, bei den Mythos-Modellen nicht strikt besser sei, da diese andere Agenten oft vor der Lösung aussperren. In einem weiteren Experiment einigten sich Agenten in einem Preisspiel mit privatem Rückkanal bereits in der dritten Runde auf Preisuntergrenzen – und hielten die Preise auch dann noch über ein öffentliches Anschlagbrett ein, als die direkte Kommunikation entfernt wurde.
Reale Bedrohungslage und Schutzmaßnahmen
Gegenüber realen Daten aus dem Agenten-Netzwerk Moltbook schnitt die Technik schlechter ab. Die Autoren filterten ein Archiv von Beiträgen, das bis zum 18. März 2026 gesammelt wurde, auf rund 2.000 Kandidaten für Ausbreitungsversuche von etwa 400 eindeutigen Autoren herunter. Das größte Cluster wurde von sieben synchronisierten Konten getrieben und endete, als diese Konten keine Beiträge mehr veröffentlichten. In einem lokalen Klon der Plattform, der die Verbreitung über Beiträge statt Direktnachrichten testen sollte, erzeugten dieselben evolutionären Methoden keine Payload, die einen Agenten im zweiten Schritt hätte infizieren können.
Eine einleitende Warnung im Systemprompt der Agenten reduzierte die Ausbreitung auf nahezu null. Fünfzehn Generationen gegnerischer Optimierung gegen diese Warnung auf Claude Haiku 4.5 mit über 150 Kandidaten-Payloads brachten keinen Stamm hervor, der über einen einzelnen Sprung hinaus propagierte. Die Autoren schließen daraus, dass Mind-Viren eine „reale, aber derzeit begrenzte Gefahr“ darstellen. Sie verweisen auf die Kosten, eine solche Schadsoftware für ein spezifisches Ziel zu bauen, die fehlende Garantie, dass sie modelübergreifend generalisiert, und die Tatsache, dass die Kompromittierung eines einzelnen Agenten in der Regel bereits Zugriff auf die zugrunde liegende Maschine gewährt, ohne dass eine weitere Verbreitung nötig wäre.
Die Arbeiten knüpfen an eine Reihe von Forschungsprojekten zu agentenvermittelten Kompromittierungen an, darunter ein selbstreplizierender Wurm auf Basis eines lokal gehosteten offenen Gewichtsmodells und wiederholte Warnungen zur Standardkonfiguration von OpenClaw. „Jedes von uns getestete Modell versteht abstrakt, dass Informationsquellen eigene Anreize haben und dass Konsens nicht zwingend ein Beleg ist. Was fehlt, ist eine Disposition, auf dieses Wissen ohne Aufforderung zu handeln“, so das Frontier Red Team abschließend.