Andersons vinkel
Deepfaked röst aktiverade $35 miljoner bankrånet 2020

En utredning av bedrägeriet där 35 miljoner USD stulits från en bank i Förenade Arabemiraten i januari 2020 har visat att deepfake-röstteknologi användes för att imitera en företagsdirektörs röst, som var känd för en bankfilialchef, som sedan godkände transaktionerna.
Brottet ägde rum den 15 januari förra året och beskrivs i en begäran (PDF) från Förenade Arabemiraten till amerikanska myndigheter om hjälp med att spåra en del av de stulna medlen som skickades till USA.
Begäran anger att filialchefen för en namnlös offerbank i Förenade Arabemiraten fick ett telefonsamtal från en välbekant röst, som tillsammans med åtföljande e-postmeddelanden från en advokat vid namn Martin Zelner, övertygade chefen att utföra transaktionerna, som tydligen var avsedda för förvärv av ett företag.
Begäran anger:
‘Enligt emiratiska myndigheter fick den 15 januari 2020 filialchefen för det drabbade företaget ett telefonsamtal som påstods komma från företagets huvudkontor. Uppringaren lät som företagets direktör, så filialchefen trodde att samtalet var legitimt.
‘Filialchefen fick också flera e-postmeddelanden som han trodde kom från direktören och som var relaterade till telefonsamtalet. Uppringaren sa till filialchefen via telefon och e-post att det drabbade företaget skulle förvärva ett annat företag, och att en advokat vid namn Martin Zelner (Zelner) hade fått i uppdrag att samordna procedurerna för förvärvet.’
Filialchefen fick sedan e-postmeddelanden från Zelner, tillsammans med ett fullmaktsbrev från den (påstådda) direktören, vars röst var välbekant för offret.
Deepfake-röstbedrägeri identifierat
Emiratiska utredare fastställde sedan att deepfake-röstklonningsteknologi hade använts för att imitera företagsdirektörens röst:
‘Den emiratiska utredningen visade att de misstänkta hade använt “djup röst” -teknologi för att simulera direktörens röst. I januari 2020 överfördes medel från det drabbade företaget till flera bankkonton i andra länder i en komplicerad schema som involverade minst 17 kända och okända misstänkta. Emiratiska myndigheter spårade medlens rörelse genom flera konton och identifierade två transaktioner till USA.
‘Den 22 januari 2020 skickades två överföringar på 199 987,75 USD och 215 985,75 USD från två av de misstänkta till Centennial Bank-konton med nummer xxxxx7682 och xxxxx7885, båda belägna i USA.’
Inga ytterligare uppgifter är tillgängliga om brottet, som endast är den andra kända incidenten med röstbaserat deepfake-finansbedrägeri. Den första inträffade nio månader tidigare, i mars 2020, när en chef på ett brittiskt energiföretag blev uppringd av någon som lät som chefens chef, som krävde en brådskande överföring av 220 000 euro (243 000 USD), vilket chefen då genomförde.
Röstkloningsutveckling
Deepfake-röstklonning innebär att man tränar en maskinlärningsmodell på hundratals eller tusentals exempel på den “mål”-röst (den röst som ska imiteras). Den mest exakta matchen kan erhållas genom att träna den mål-rösten direkt mot den röst som ska användas i den föreslagna scenariot, även om modellen kommer att “överanpassas” till den person som ska imitera den mål-rösten.
Den mest aktiva legitima online-gemenskapen för röstkloningsutvecklare är Audio Fakes Discord-servern, som har forum för många deepfake-röstkloningsalgoritmer som Google’s Tacotron-2, Talknet, ForwardTacotron, Coqui-ai-TTS och Glow-TTS, bland andra.
Real-tidsdeepfakes
Eftersom ett telefonsamtal nödvändigtvis är interaktivt, kan röstkloningsbedrägeri inte rimligen utföras med “bakade” högkvalitativa röstklipp, och i båda fallen av röstkloningsbedrägeri kan vi rimligen anta att talaren använder en live, real-tids deepfake-ram.
Real-tidsdeepfakes har kommit i fokus nyligen på grund av DeepFaceLive, en real-tidsimplementering av den populära deepfake-paketet DeepFaceLab, som kan superimponera kändisar eller andra identiteter på live-webbkamerabild. Även om användare på Audio Fakes Discord och DeepFaceLab Discord är mycket intresserade av att kombinera de två teknologierna till en enda video+ röst live deepfake-arkitektur, har ingen sådan produkt ännu offentliggjorts.












