Andersons Blickwinkel
Deepfake-Stimme ermöglichte 35-Millionen-Dollar-Bankraub im Jahr 2020

Eine Untersuchung zur betrügerischen Abhebung von 35 Millionen US-Dollar von einer Bank in den Vereinigten Arabischen Emiraten im Januar 2020 hat ergeben, dass Deepfake-Stimmen-Technologie verwendet wurde, um die Stimme eines Unternehmensdirektors zu imitieren, der einem Bankfilialleiter bekannt war, der dann die Transaktionen autorisierte.
Das Verbrechen fand am 15. Januar des letzten Jahres statt und wird in einem Antrag (PDF) der Vereinigten Arabischen Emirate an die amerikanischen Behörden zur Unterstützung bei der Verfolgung eines Teils der abgezweigten Mittel, die in die Vereinigten Staaten gesendet wurden, beschrieben.
Der Antrag besagt, dass der Filialleiter einer namenlosen Opferbank in den Vereinigten Arabischen Emiraten einen Anruf von einer vertrauten Stimme erhielt, der zusammen mit begleitenden E-Mails von einem Anwalt namens Martin Zelner den Manager überzeugte, die Mittel freizugeben, die offensichtlich für den Kauf eines Unternehmens bestimmt waren.
Der Antrag besagt:
‘Laut den emiratischen Behörden erhielt der Filialleiter der Opfergesellschaft am 15. Januar 2020 einen Anruf, der angeblich von der Unternehmenszentrale kam. Der Anrufer klang wie der Direktor des Unternehmens, so dass der Filialleiter glaubte, der Anruf sei legitim.
‘Der Filialleiter erhielt auch mehrere E-Mails, die er für echt hielt und die mit dem Anruf zusammenhingen. Der Anrufer sagte dem Filialleiter am Telefon und per E-Mail, dass die Opfergesellschaft ein anderes Unternehmen kaufen würde und dass ein Anwalt namens Martin Zelner (Zelner) autorisiert worden war, die Verfahren für den Kauf zu koordinieren.’
Der Filialleiter erhielt dann die E-Mails von Zelner, zusammen mit einem Autorisationsbrief des (vermeintlichen) Direktors, dessen Stimme dem Opfer bekannt war.
Deepfake-Stimmenbetrug identifiziert
Die emiratischen Ermittler stellten dann fest, dass Deepfake-Stimmenklon-Technologie verwendet worden war, um die Stimme des Unternehmensdirektors zu imitieren:
‘Die emiratische Untersuchung ergab, dass die Angeklagten “Deep-Voice”-Technologie verwendet hatten, um die Stimme des Direktors zu simulieren. Im Januar 2020 wurden Mittel von der Opfergesellschaft auf mehrere Bankkonten in anderen Ländern in einem komplexen Schema mit mindestens 17 bekannten und unbekannten Angeklagten überwiesen. Die emiratischen Behörden verfolgten den Mitteltransfer durch zahlreiche Konten und identifizierten zwei Transaktionen in die Vereinigten Staaten.
‘Am 22. Januar 2020 wurden zwei Überweisungen in Höhe von 199.987,75 US-Dollar und 215.985,75 US-Dollar von zwei der Angeklagten an die Kontonummern xxxxx7682 und xxxxx7885 der Centennial Bank in den Vereinigten Staaten gesendet.’
Es sind keine weiteren Details über das Verbrechen bekannt, das nur der zweite bekannte Fall von Stimmen-basiertem Deepfake-Finanzbetrug ist. Der erste Fall ereignete sich neun Monate zuvor, im März 2020, als ein leitender Angestellter eines britischen Energieunternehmens von jemandem, der wie sein Vorgesetzter klang, auf dem Telefon bedrängt wurde, der dringend 220.000 Euro (243.000 US-Dollar) überweisen sollte, was der Angestellte dann tatsächlich tat.
Stimmenklon-Entwicklung
Deepfake-Stimmenklon-Technologie beinhaltet das Training eines maschinellen Lernalgorithmus mit Hunderten oder Tausenden von Proben der “Ziel”-Stimme (der Stimme, die imitiert werden soll). Die genaueste Übereinstimmung kann durch das direkte Training der Ziel-Stimme gegen die Stimme der Person erzielt werden, die in der vorgeschlagenen Szene sprechen wird, obwohl das Modell “überangepasst” an die Person wird, die die Ziel-Stimme imitieren wird.
Die aktivste legale Online-Community für Stimmenklon-Entwickler ist der Audio Fakes-Discord-Server, der Foren für viele Deepfake-Stimmenklon-Algorithmen wie Google’s Tacotron-2, Talknet, ForwardTacotron, Coqui-ai-TTS und Glow-TTS bietet, unter anderem.
Echtzeit-Deepfakes
Da ein Telefongespräch notwendigerweise interaktiv ist, kann Stimmenklon-Betrug nicht vernünftigerweise durch “gebackene” hochwertige Audio-Clips bewirkt werden, und in beiden Fällen von Stimmenklon-Betrug können wir vernünftigerweise annehmen, dass der Sprecher ein live, echtzeitiges Deepfake-Framework verwendet.
Echtzeit-Deepfakes sind aufgrund des Aufkommens von DeepFaceLive, einer Echtzeit-Implementierung des beliebten Deepfake-Pakets DeepFaceLab, in den Fokus gerückt, das celebrity- oder andere Identitäten auf Live-Webcam-Footage überlagern kann. Obwohl die Benutzer auf dem Audio Fakes Discord und dem DeepFaceLab Discord sehr daran interessiert sind, die beiden Technologien in eine einzige Video- und Stimme-Live-Deepfake-Architektur zu kombinieren, ist bisher kein solches Produkt öffentlich aufgetaucht.












