Eine fünf Sekunden kurze Sprachprobe reicht aus, um mit KI eine täuschend echte Kopie einer Stimme zu erstellen. In China wurden mit dieser Methode bereits umgerechnet rund eine Milliarde Yen erbeutet – und die Betrugswelle rollt weltweit. Der KI-Stimmenklon-Betrug ist keine Zukunftsvision mehr, sondern eine akute Bedrohung für jeden, der jemals ans Telefon geht.
Von der Musikproduktion zur Betrugsmasche: Die zwei Gesichter der KI-Stimmentechnologie
Die zugrundeliegende Technologie ist beeindruckend – und gefährlich. In der ostchinesischen Stadt Hangzhou nutzt ein Unternehmer ein KI-Tool zur Musikproduktion. Er lädt ein einziges Foto hoch, wählt Genre und Gesangsstil, und nach nur 40 Sekunden entsteht ein fertiger Song. Die künstlich erzeugte Stimme ist von einem echten Sänger kaum zu unterscheiden. Berichten zufolge erzielt er damit einen monatlichen Umsatz von umgerechnet rund 240.000 Yen.
Doch dieselbe Technologie wird systematisch für Betrug zweckentfremdet. Chinesische Anti-Betrugsbehörden warnen vor einer Masche, bei der lediglich fünf Sekunden Gesprächsaufnahme ausreichen, um die Stimme einer Person zu klonen. Mit dieser Nachbildung geben sich die Täter am Telefon als Familienmitglieder oder Freunde aus und fordern unter falschen Vorgaben Geld. In einem dokumentierten Fall erbeuteten Betrüger innerhalb von weniger als zehn Minuten umgerechnet rund eine Milliarde Yen – und kombinierten den Stimmenklon zusätzlich mit einer Echtzeit-Video-Deepfake-Attrappe. Das Opfer sah ein vertrautes Gesicht und hörte eine vertraute Stimme, konnte aber nicht erkennen, dass beides Fälschungen waren.
Warum selbst kurze Sprachproben für einen perfekten Klon reichen
Die Qualität von KI-Stimmenklonen hat in den letzten Jahren sprunghaft zugenommen. Laut Untersuchungen des Sicherheitsunternehmens McAfee Labs genügen bereits drei Sekunden Sprachmaterial, um mit einer Übereinstimmungsrate von 85 Prozent eine Kopie zu erzeugen. Quellen für solche Proben gibt es im Alltag reichlich: die Mailbox-Nachricht auf dem Anrufbeantworter, ein kurzer Satz in einem Video oder die ersten Sekunden eines Telefonats mit unbekannter Nummer.
Die McAfee-Studie in sieben Ländern ergab zudem, dass 70 Prozent der Befragten nicht sicher sind, ob sie eine geklonte Stimme von der echten unterscheiden können. Das FBI hat in seinem Internet Crime Report für 2025 erstmals in der Geschichte der Behörde KI-bezogenen Betrug als eigenständige Kategorie aufgeführt. Die Zahlen sind alarmierend: 22.364 gemeldete Fälle mit einem Gesamtschaden von 893 Millionen USa-Dollar – umgerechnet rund 143 Milliarden Yen. Der tatsächliche Umfang liegt nach eigener Einschätzung des FBI weit höher.
Die klassische Betrugsmasche folgt einem Muster, das an den altbekannten Enkeltrick erinnert, aber durch die KI eine neue Dimension erhält: Der Anrufer – vermeintlich ein Familienmitglied in Not – schildert eine Paniksituation: einen Unfall, eine Entführung, eine dringende Zahlung. Das Opfer ist emotional aufgewühlt und außerstande, die Echtheit der Stimme rational zu prüfen. Genau diese emotionale Überrumpelung macht den Betrug so wirksam. Die KI hat das letzte Vertrauenskriterium – die vertraute Stimme – zerstört.
Regulierung hinkt hinterher – was der TAKE IT DOWN Act nicht abdeckt
In den USA ist am 19. Mai 2026 der TAKE IT DOWN Act in Kraft getreten, der Plattformen verpflichtet, gemeldete Deepfake-Inhalte schnell zu entfernen. Das Gesetz zielt jedoch hauptsächlich auf Bild- und Video-Deepfakes ab. Es hat keine direkte Handhabe gegen Echtzeit-Stimmenklon-Betrug am Telefon. Auch in China warnen Anti-Betrugsbehörden wiederholt davor, bei Anrufen von unbekannten Nummern möglichst wenig Sprachinformationen preiszugeben. In Japan hat die Verbraucherschutzbehörde vor Stimmenklon-Betrug gewarnt, spezifische gesetzliche Regelungen fehlen jedoch noch.
Die Technologie entwickelt sich schneller als die Gesetzgebung. Die Lücke muss vorerst jeder Einzelne durch eigenes Handeln schließen.
Wie schützt man sich vor KI-Stimmenklon-Betrug? – Drei wirksame Maßnahmen
Die Grundregel ist einfach, aber wirkungsvoll: Vereinbaren Sie mit engen Familienmitgliedern ein Codewort, das niemals telefonisch verwendet wird. Bei einem angeblichen Notfall fordern Sie dieses Wort. Die KI kann ein vorher nicht geteiltes Codewort nicht reproduzieren. Das FBI und zahlreiche US-Sicherheitsexperten empfehlen diese Methode als wirksamste Schutzmaßnahme.
Zweitens: Legen Sie bei einem verdächtigen Anruf auf und rufen Sie die Person über die Ihnen bekannte Nummer zurück. Wer wirklich in Not ist, geht ans Telefon. Wer nicht rangeht, sollte bei anderen Angehörigen nachfragen. Wer Druck ausübt und keine Bedenkzeit lässt, ist mit hoher Wahrscheinlichkeit ein Betrüger.
Drittens: Vermeiden Sie bei eingehenden Anrufen von unbekannten Nummern, mehr als nötig zu sprechen. Ein kurzes „Ja“ oder „Hallo“ kann bereits als Sprachprobe dienen. Wenn Sie versehentlich an einen stillen Anruf rangehen, legen Sie sofort auf. Ihre Stimme ist wie ein Fingerabdruck – einmal gestohlen, können Sie sie nicht ändern.
Die Stimme ist kein verlässlicher Identitätsnachweis mehr. Wer das verinnerlicht, hat den wichtigsten Schutz bereits aktiviert.