Deepfake-Betrug: 25 Mio. Dollar nach einem Videocall

Redaktion
Deepfake-Betrug: 25 Mio. Dollar nach einem Videocall

Im Januar 2024 überwies ein Mitarbeiter der Hongkonger Niederlassung des britischen Ingenieurkonzerns Arup umgerechnet 25 Millionen US-Dollar auf mehrere Konten. Er folgte damit Anweisungen, die er in einem Videocall erhalten hatte. Das Problem: Alle anderen Teilnehmer des Calls waren gefälscht. CFO, Kollegen, Vorgesetzte. Niemand von ihnen saß tatsächlich vor einer Kamera.

Was in Hongkong passierte

Der Ablauf war nicht improvisiert. Der betroffene Mitarbeiter hatte zunächst eine E-Mail erhalten, die angeblich vom Finanzvorstand des Unternehmens stammte. Darin wurde er zu einem dringenden geheimen Transfervorgang aufgefordert. Die Nachricht weckte Misstrauen. Er nahm an einem Videocall teil, um sich zu vergewissern.

In diesem Call sah er bekannte Gesichter: den CFO, mehrere Kollegen, Menschen, deren Stimmen und Aussehen er kannte. Alle wirkten überzeugend. Alle bestätigten den Auftrag. Alle waren KI-generierte Echtzeitfälschungen, zusammengesetzt aus öffentlich verfügbaren Video- und Audiomaterial der echten Personen. Nach dem Call führte der Mitarbeiter 15 separate Überweisungen auf fünf verschiedene Bankkonten durch.

Die Hongkonger Polizei bestätigte den Fall im Februar 2024. Arup selbst äußerte sich zunächst nicht öffentlich, bestätigte den Vorfall aber später gegenüber Medien. Festnahmen gab es bis zum Zeitpunkt der ersten Berichterstattung keine.

Deepfakes sind kein Zukunftsszenario mehr

Was diesen Fall von früheren Betrugsversuchen unterscheidet, ist nicht allein die Schadenshöhe. Es ist die Qualität der Täuschung. Deepfake-Technologie war lange ein Nischenwerkzeug für spezialisierte Akteure mit erheblichem technischem Aufwand. Das hat sich geändert.

Kommerzielle Tools erlauben es heute, aus wenigen Minuten Videomaterial ein überzeugendes Echtzeit-Faceswap zu erzeugen. Stimmenklonen funktioniert mit drei bis fünf Sekunden Audioaufnahme. Beides ist für einen dreistelligen Dollarbetrag im Monat zugänglich, manche Basis-Varianten sogar kostenlos. Wer genug öffentliches Material einer Zielperson findet, hat die wichtigsten Zutaten bereits beisammen.

Der dokumentierte Deepfake-Betrug bei Arup ist damit kein Einzelfall einer hochspezialisierten Hackergruppe, sondern ein Vorbote einer Angriffsmethode, die zunehmend skalierbar wird.

Warum klassische Sicherheitsmaßnahmen hier versagen

Unternehmen schützen sich seit Jahren gegen Phishing, CEO-Fraud und Social Engineering. Schulungen sensibilisieren Mitarbeiter dafür, verdächtige E-Mails zu erkennen, Absenderadressen zu prüfen und Überweisungsanfragen gegenzuzeichnen. Der Arup-Fall zeigt, wo diese Maßnahmen an ihre Grenzen stoßen.

Der Mitarbeiter hatte Zweifel. Er hat nicht blind einer E-Mail vertraut. Er hat nachgefragt, auf die einzig logische Art: Er hat sich die Menschen angesehen und gehört. Genau dieser Instinkt, nämlich visuelle und akustische Bestätigung als letzte Sicherheitsebene zu nutzen, wurde ausgenutzt.

  • Vier-Augen-Prinzip per Video: Reicht nicht mehr, wenn Videoteilnehmer gefälscht sein können.
  • Verhaltensbasierte Erkennung: Wird schwieriger, wenn Sprache und Mimik der Zielperson sauber imitiert werden.
  • Rückrufverfahren über bekannte Nummern: Helfen nur, wenn das Verfahren konsequent eingehalten wird und nicht durch soziale Dringlichkeit umgangen wird.

Sicherheitskonzepte, die auf menschlicher Wahrnehmung beruhen, verlieren an Verlässlichkeit, wenn Wahrnehmung technisch manipuliert werden kann.

Was Unternehmen konkret ändern müssen

Es gibt keine Einzellösung, die Deepfake-Angriffe dieser Art vollständig verhindert. Aber es gibt Maßnahmen, die den Aufwand für Angreifer deutlich erhöhen und die Fehlerrate senken.

Transaktionsgenehmigung entkoppeln: Großüberweisungen ab einem definierten Schwellenwert, etwa 50.000 Euro, sollten nie durch einen einzigen Kommunikationskanal autorisiert werden. Videocall plus schriftliche Freigabe über ein internes Ticket-System plus physische Unterschrift oder Hardware-Token. Wer alle drei Kanäle gleichzeitig kompromittiert, hat einen erheblich höheren Aufwand.

Codewörter und Geheimfragen: Einige Finanzinstitute nutzen bereits sogenannte Safe-Word-Protokolle für sensible Transaktionen. Ein vorab vereinbartes Codewort, das nur intern bekannt ist und in keinem öffentlichen Material vorkommt, lässt sich von einem Deepfake nicht replizieren.

Technische Deepfake-Erkennung: Software wie Intel FakeCatcher oder Lösungen von Pindrop analysieren Videostreams auf Artefakte, die für synthetische Generierung typisch sind: unnatürliche Blinkfrequenzen, Inkonsistenzen im Lichteinfall, Kompressionsanomalien. Diese Tools sind nicht unfehlbar, erhöhen aber die Erkennungswahrscheinlichkeit signifikant.

Schulung auf das Szenario: Mitarbeiter in Finanzfunktionen müssen explizit mit dem Szenario “gefälschter Videocall” konfrontiert werden. Nicht abstrakt, sondern mit simulierten Angriffen, die zeigen, wie überzeugend solche Fälschungen wirken können.

Das Haftungsproblem

Eine Frage, die in der Berichterstattung zum Arup-Fall kaum gestellt wurde: Wer trägt den Schaden? Der Mitarbeiter handelte nicht fahrlässig im klassischen Sinne. Er hat versucht, den Vorgang zu verifizieren. Er wurde durch eine technisch hochwertige Täuschung überwältigt.

Das wirft Fragen auf, die Gerichte in den nächsten Jahren beschäftigen werden. Haftet das Unternehmen für fehlende technische Schutzmaßnahmen? Haftet der Mitarbeiter für nicht befolgte Prozesse, die möglicherweise gar nicht für dieses Szenario ausgelegt waren? Wie weit reicht die Sorgfaltspflicht bei einer Angriffsmethode, gegen die es noch keine etablierten Branchenstandards gibt?

Versicherungsunternehmen beginnen, Cyberpolicen auf genau diese Fragen hin zu überarbeiten. Einige schließen Schäden durch KI-generierte Identitätstäuschung bereits explizit aus oder machen deren Absicherung von nachgewiesenen Präventionsmaßnahmen abhängig.

Was der Fall langfristig verändert

Der Arup-Fall ist nicht das Ende einer Entwicklung, sondern der Anfang einer Normalisierung. Deepfake-Angriffe auf Unternehmen werden häufiger werden, weil die Technologie günstiger und zugänglicher wird, weil öffentlich verfügbares Material von Führungskräften und Mitarbeitern wächst und weil die Methode nachweislich funktioniert.

Für Sicherheitsverantwortliche bedeutet das einen grundlegenden Perspektivwechsel: Visuelle und akustische Bestätigung sind keine verlässlichen Authentifizierungsmerkmale mehr. Wer Sicherheitsprozesse auf der Annahme aufbaut, dass ein bekanntes Gesicht und eine bekannte Stimme Echtheit belegen, baut auf einem Fundament, das gerade wegbricht.

25 Millionen Dollar sind eine hohe Lehrgeldrechnung. Für andere Unternehmen kann sie kostenlos sein, wenn die richtigen Schlüsse jetzt gezogen werden.

Share This Article