Modely a platformy AI
Vijay Balasubramaniyan, spoluzakladatel a CEO společnosti Pindrop – rozhovor

Vijay Balasubramaniyan je spoluzakladatel a CEO společnosti Pindrop. Působil v různých inženýrských a výzkumných rolích ve společnostech Google (GOOGL ), Siemens, IBM Research a Intel.
Pindrop‘s řešení jsou na cestě k budoucnosti hlasu tím, že stanovují standard pro identitu, zabezpečení a důvěru pro každou hlasovou interakci. Řešení Pindrop chrání některé z největších bank, pojišťoven a maloobchodníků pomocí patentované technologie, která extrahuje inteligenci z každého hovoru a hlasu. Řešení Pindrop pomáhají detekovat podvodníky a ověřovat skutečné zákazníky, snižují podvod a provozní náklady a zároveň zlepšují zákaznickou zkušenost a chrání reputaci značky. Pindrop, soukromá společnost se sídlem v Atlanta, GA, byla založena v roce 2011 Dr. Vijayem Balasubramaniyanem, Dr. Paulem Judgem a Dr. Mustaque Ahamadem a je financována firmami Andreessen Horowitz, Citi Ventures, Felicis Ventures, CapitalG, GV, IVP a Vitruvian Partners. Další informace naleznete na adrese pindrop.com.
Jaké jsou hlavní poznatky z Pindrop’s 2024 Voice Intelligence and Security Report týkající se současného stavu hlasového podvodu a zabezpečení?
Zpráva poskytuje hluboký vhled do naléhavých bezpečnostních problémů a budoucích trendů, zejména v kontaktních centrech, která slouží finančním a nefinančním institucím. Mezi hlavní zjištění zprávy patří:
- Signifikantní nárůst podvodu v kontaktních centrech: Podvod v kontaktních centrech vzrostl o 60 % za poslední dva roky a dosáhl nejvyšší úrovně od roku 2019. Do konce tohoto roku se očekává, že jeden z každých 730 hovorů do kontaktního centra bude podvodný.
- Zvyšující se sofistikovanost útočníků pomocí Deepfake: Útoky Deepfake, včetně sofistikovaných syntetických hlasových klonů, se zvyšují a představují odhadovaný podvodný rizikový potenciál 5 miliard dolarů pro kontaktní centra v USA. Tato technologie je využívána k vylepšení podvodných taktik, jako je automatizované a rozsáhlé účetní průzkumné činnosti, hlasová imitace, cílené smishing a sociální inženýrství.
- Tradiční metody detekce a ověření podvodu nejsou účinné: Společnosti stále spoléhají na manuální ověření spotřebitelů, které je časově náročné, drahé a neúčinné při zastavení podvodu. 350 milionů obětí úniků dat, 12 miliard dolarů ročně vynaložených na ověření a 10 miliard dolarů ztracených na podvod jsou důkazem toho, že současné bezpečnostní metody nejsou účinné.
- Nové přístupy a technologie jsou vyžadovány: Detekce živosti je zásadní pro boj proti špatnému AI a zlepšení zabezpečení. Analýza hlasu je stále důležitá, ale musí být kombinována s detekcí živosti a multifaktorovým ověřením.
Podle zprávy se 67,5 % spotřebitelů v USA obává o hluboké podvody v bankovním sektoru. Můžete vysvětlit typy hlubokých podvodných hrozeb, kterým čelí finanční instituce?
Bankovní podvod prostřednictvím telefonních kanálů se zvyšuje kvůli několika faktorům. Protože finanční instituce silně spoléhají na zákazníky, aby potvrdili podezřelou činnost, mohou kontaktní centra stát se primárním cílem pro podvodníky. Podvodníci používají sociální inženýrství k oklamání zástupců zákaznické podpory, aby je přesvědčili k odstranění omezení nebo pomoci resetovat online bankovní přihlašovací údaje. Podle jednoho zákazníka Pindrop v bankovnictví se 36 % identifikovaných podvodných hovorů pokusilo odstranit držitele uložené fraud kontrol. Další zákazník Pindrop v bankovnictví uvádí, že 19 % podvodných hovorů se pokusilo získat přístup k online bankovnictví. S růstem generativní AI a hlubokých podvodů se tyto typy útoků staly více potenciálními a škálovatelnými. Nyní mohou jeden nebo dva podvodníci v garáži vytvořit libovolný počet syntetických hlasů a spustit simultánní útoky na několik finančních institucí a zvýšit své taktiky. To vytvořilo zvýšenou úroveň rizika a obav mezi spotřebiteli, zda je bankovní sektor připraven odrazit tyto sofistikované útoky.
Jak přispěly pokroky v generativní AI k růstu hlubokých podvodů a jaké konkrétní výzvy představují pro bezpečnostní systémy?
Hluboké podvody nejsou nové, ale pokroky v generativní AI je učinily během posledního roku mnohem přesvědčivější a škálovatelnější. Pokroky v generativní AI umožnily velkým jazykovým modelům vytvářet přesvědčivější řeč a jazyk. Nyní lze vytvořit přirozeně znějící syntetický (falešný) hlas velmi levně a ve velkém měřítku. Tyto vývojové trendy učinily hluboké podvody dostupné pro každého, včetně podvodníků. Tyto hluboké podvody ohrožují bezpečnostní systémy tím, že umožňují vysoce přesvědčivé phishingové útoky, šíření dezinformací a usnadňují finanční podvod prostřednictvím realistických imitací. Podkopávají tradiční metody ověření, vytvářejí významná rizika pro reputaci a vyžadují pokročilé detekční technologie, aby zůstaly v souladu s jejich rychlým vývojem a škálovatelností.
Jak přispěl Pindrop Pulse k identifikaci TTS engine použitým v útocích na prezidenta Bidena a jaké jsou implikace pro budoucí detekci hlubokých podvodů?
Pindrop Pulse sehrál kritickou roli při identifikaci ElevenLabs, TTS engine použitým v útocích na prezidenta Bidena. Pomocí naší pokročilé technologie detekce hlubokých podvodů jsme implementovali čtyřfázový analytický proces, který zahrnoval filtrování a čištění audio signálu, extrakci nízkoúrovňových spektrálních a temporálních funkcí a kontinuální hodnocení. Tento proces nám umožnil filtrovat nespeechové rámce, downsamplovat audio pro replikaci typických telefonních podmínek a extrahovat nízkoúrovňové spektrální a temporální funkce.
Rozdělili jsme audio na 155 segmentů a přiřazovali jim skóre živosti, abychom určili, že audio bylo konzistentně umělým. Pomocí “fakeprints” jsme porovnali audio se 122 TTS systémy a identifikovali s 99% jistotou, že ElevenLabs nebo podobný systém byl použit. Tento výsledek byl ověřen s 84% jistotou pomocí ElevenLabs SpeechAI Classifier. Naše podrobná analýza odhalila artefakty hlubokých podvodů, zejména ve frázích s bohatými frikativy a neobvyklými výrazy pro prezidenta Bidena.
Tento případ zdůrazňuje důležitost našich škálovatelných a vysvětlitelných systémů detekce hlubokých podvodů, které zvyšují přesnost, budují důvěru a přizpůsobují se novým technologiím. Také zdůrazňuje potřebu zajistit, aby generativní AI systémy zahrnovaly bezpečnostní opatření proti zneužití, aby se zajistilo, že hlasové klony budou souhlasit s opravdovými osobami. Naše přístup stanoví standard pro řešení syntetických mediálních hrozeb, zdůrazňujících pokračující monitoring a výzkum, aby zůstaly před novými metodami hlubokých podvodů.
Zpráva zmiňuje významné obavy o hluboké podvody, které ovlivňují média a politické instituce. Můžete poskytnout příklady takových incidentů a jejich potenciální dopad?
Naše výzkumy ukázaly, že spotřebitelé v USA jsou nejvíce znepokojeni rizikem hlubokých podvodů a hlasových klonů v bankovním a finančním sektoru. Ale kromě toho, hrozba hlubokých podvodů pro naši média a politické instituce představuje stejně významnou výzvu. Mimo USA byl pozorován použití hlubokých podvodů v Indonésii (Suharto hluboký podvod) a na Slovensku (Michal Šimečka a Monika Tódová hlasový hluboký podvod).
Rok 2024 je významným rokem voleb v USA a Indii. S 4 miliardami lidí ve 40 zemích, kteří se chystají volit, činí technologická pokroka v oblasti umělé inteligence snadnější, aby oklamali lidi na internetu. Očekáváme nárůst cílených hlubokých podvodných útoků na vládní instituce, společnosti sociálních médií, další zpravodajské agentury a obecnou populaci, které jsou určeny k vytvoření nedůvěry v našich institucích a šíření dezinformací ve veřejné diskusi.
Můžete vysvětlit technologie a metodologie, které Pindrop používá k detekci hlubokých podvodů a syntetických hlasů v reálném čase?
Pindrop používá řadu pokročilých technologií a metodologií k detekci hlubokých podvodů a syntetických hlasů v reálném čase, včetně:
-
- Detekce živosti: Pindrop používá velké strojové učení k analýze nespeechových rámců (například ticha, šumu, hudby) a extrahuje nízkoúrovňové spektrální a temporální funkce, které rozlišují mezi strojově generovaným a lidským hlasem.
- Audio Fingerprinting: Toto zahrnuje vytvoření digitálního podpisu pro každý hlas na základě jeho akustických vlastností, jako je tón, barva a kadence. Tyto podpisy jsou pak použity k porovnání a shodě hlasů napříč různými hovory a interakcemi.
- Analýza chování: Používá se k analýze vzorců chování, které se zdají být mimořádné, včetně anomálního přístupu k různým účtům, rychlé bot aktivity, účetního průzkumu, datového hornictví a robotického vytáčení.
- Analýza hlasu: Analýzou hlasových funkcí, jako jsou charakteristiky hlasové dráhy, fonetické variace a styl mluvení, může Pindrop vytvořit hlasový otisk pro každou osobu. Jakékoli odchylky od očekávaného hlasového otisku mohou spustit upozornění.
- Vícevrstevný bezpečnostní přístup: Tento přístup zahrnuje kombinaci různých detekčních metod, aby se ověřily výsledky a zvýšila přesnost detekce. Například výsledky audio fingerprintingu mohou být zkříženě ověřeny s biometrickou analýzou, aby se potvrdila podezření.
- Průběžné zlepšování a adaptace: Pindrop průběžně aktualizuje své modely a algoritmy. To zahrnuje začlenění nových dat, jemné úpravy detekčních technik a udržování se před novými hrozbami. Průběžné zlepšování zajišťuje, že detekční schopnosti Pindrop se zlepšují s časem a přizpůsobují se novým typům syntetických hlasových útoků.
Co je Pulse Deepfake Warranty a jak zvyšuje důvěru zákazníků v schopnosti Pindrop řešit hrozby hlubokých podvodů?
Pulse Deepfake Warranty je první záruka, která nabízí náhradu za syntetický hlasový podvod v call centru. Když stojíme na pokraji významné změny v kybernetickém útočném krajině, potenciální finanční ztráty se očekávají, že dosáhnou 10,5 bilionu dolarů do roku 2025, Pulse Deepfake Warranty zvyšuje důvěru zákazníků nabídkou několika klíčových výhod:
- Zvýšená důvěra: Pulse Deepfake Warranty demonstruje důvěru Pindrop ve svých produktech a technologiích, nabízející zákazníkům důvěryhodné bezpečnostní řešení při obsluze jejich účtů.
- Náhrada ztrát: Zákazníci Pindrop mohou obdržet náhradu za události syntetického hlasového podvodu, které nebyly detekovány produktem Pindrop.
- Průběžné zlepšování: Žádosti zákazníků Pindrop obdržené v rámci programu záruky pomáhají Pindrop zůstat před novými taktikami syntetického hlasového podvodu.
Jsou nějaké pozoruhodné případové studie, kde technologie Pindrop úspěšně odstranily hrozby hlubokých podvodů? Jaké byly výsledky?
Incident na střední škole Pikesville: Dne 16. ledna 2024 se na Instagramu objevil záznam, který údajně pocházel od ředitele střední školy Pikesville v Baltimoru, Marylandu. Záznam obsahoval urážlivé poznámky o černých studentech a učitelích, což vyvolalo vlnu veřejného rozhořčení a vážných obav.
V souvislosti s těmito událostmi provedl Pindrop komplexní vyšetřování, provedl tři nezávislé analýzy, aby odhalil pravdu. Výsledky našeho vyšetřování vedly k jemnému závěru: ačkoli byl lednový záznam upraven, postrádal definitivní rysy synteticky generovaného hlasu. Naše jistota v tomto zjištění je podporována 97% jistotou na základě našich analytických metrik. Tento zásadní výsledek zdůrazňuje důležitost provedení podrobných a objektivních analýz, než budou učiněna veřejná prohlášení o povaze potenciálně upravených médií.
V jedné velké americké bance Pindrop odhalil, že podvodník používal syntetický hlas k obejití ověření v IVR. Zjistili jsme, že podvodník používal strojově generovaný hlas k obejití ověření v IVR pro cílené účty, poskytoval správné odpovědi na bezpečnostní otázky a v jednom případě dokonce prošel jednorázovým heslem (OTP). Boti, kteří se úspěšně ověřili v IVR, identifikovali účty, které stojí za to cílit, pomocí základních dotazů na zůstatek. Následující hovory do těchto účtů byly od skutečných lidí, aby spáchali podvod. Pindrop upozornil banku na tento podvod v reálném čase pomocí technologie Pulse a podařilo se zastavit podvodníka.
V jiné finanční instituci Pindrop zjistil, že někteří podvodníci trénovali své vlastní hlasové boty, aby napodobovaly automatické odpovědi banky. V tom, co znělo jako podivuhodný první hovor, hlasový bot zavolal do bankovního IVR, ne aby provedl účetní průzkum, ale aby zopakoval IVR výzvy. Více hovorů přišlo do různých větví IVR konverzačního stromu a každých 2 sekundy bot opakoval, co slyšel. O týden později se objevily další hovory, které dělaly totéž, ale tentokrát bot opakoval fráze přesně ve stejném hlase a manérech jako IVR banky. Domníváme se, že podvodník trénoval hlasový bot, aby napodoboval IVR banky jako výchozí bod smishingového útoku. Díky pomoci Pindrop Pulse se finanční instituci podařilo tento útok odvrátit, než byla způsobena jakákoli škoda.
Nezávislý experiment s audio hlubokými podvody od NPR: Digitální bezpečnost je neustále se vyvíjející závod mezi podvodníky a poskytovateli bezpečnostních technologií. Existuje několik poskytovatelů, včetně Pindrop, kteří tvrdí, že detekují audio hluboké podvody konzistentně – NPR otestoval tyto nároky, aby zhodnotil, zda současné technologie jsou schopny detekovat AI-generované audio hluboké podvody konzistentně.
Pindrop Pulse správně detekoval 81 z 84 audio vzorků, což odpovídá 96,4% přesnosti. Kromě toho Pindrop Pulse detekoval 100% všech hlubokých podvodných vzorků. Zatímco byli vyhodnoceni i další poskytovatelé v rámci studie, Pindrop se ukázal jako lídr, prokázal, že jeho technologie může spolehlivě a přesně detekovat jak hluboké podvody, tak skutečné audio.
Jaké budou budoucí trendy v hlasovém podvodu a zabezpečení, zejména s rychlým rozvojem AI technologií? Jak se Pindrop připravuje na řešení těchto problémů?
Očekáváme, že podvod v kontaktních centrech bude pokračovat v růstu v roce 2024. Na základě analýzy úrovní podvodu napříč odvětvími odhadujeme, že míra podvodu dosáhne 1 z každých 730 hovorů, což představuje 4-5% nárůst oproti současným úrovním.
Většina zvýšeného podvodu se pravděpodobně dotkne bankovního sektoru, zatímco pojištění, makléřství a další finanční segmenty by měly zůstat kolem současných úrovní. Odhadujeme, že tyto míry podvodu představují podvodné riziko ve výši 7 miliard dolarů pro finanční instituce ve Spojených státech, které je třeba zabezpečit. Nicméně očekáváme významnou změnu, zejména s podvodníky, kteří využívají IVR jako testovací půdu. Nedávno jsme pozorovali nárůst podvodníků, kteří manuálně zadávají osobní identifikační informace (PII), aby ověřili účetní detaily.
Abychom pomohli bojovat proti tomu, budeme pokračovat v rozvoji stávajících řešení Pindrop a spuštění nových a inovativních nástrojů, jako je Pindrop Pulse, které chrání naše zákazníky.
Mimo současné technologie, jaké nové nástroje a techniky se vyvíjejí pro zlepšení prevence hlasového podvodu a ověření?
Techniky prevence hlasového podvodu a ověření se neustále vyvíjejí, aby držely krok s pokroky v technologiích a sofistikovaností podvodných aktivit. Některé vznikající nástroje a techniky zahrnují:
- Průběžná detekce a vyšetřování podvodu: Poskytuje historický “zpětný” pohled na případy podvodu s novými informacemi, které jsou nyní k dispozici. S tímto přístupem mohou analytici podvodu “poslouchat” nové signály podvodu, prohledávat historické hovory, které mohou být související, a opětovně je ohodnotit. To poskytuje společnostem komplexní perspektivu na podvod v reálném čase.
- Inteligentní analýza hlasu: Tradiční systémy biometrického rozpoznávání hlasu jsou zranitelné vůči útokům hlubokých podvodů. Pro zlepšení své obrany jsou zapotřebí nové technologie, jako je Voice Mismatch a Negative Voice Matching. Tyto technologie poskytují další vrstvu obrany rozpoznáním a rozlišením více hlasů, opakujících se volajících a identifikací, zda jiný znějící hlas může představovat hrozbu.
- Brzká detekce podvodu: Technologie detekce podvodu, které poskytují rychlý a spolehlivý signál podvodu na počátku hovoru, jsou nepostradatelné. Kromě detekce živosti technologie, jako je analýza metadat operátorů, detekce podvodu ID a audio-založená detekce podvodu, poskytují ochranu proti útokům podvodu na počátku konverzace, kdy jsou obrany nejzranitelnější.
Děkuji za skvělý rozhovor, pro více informací si přečtěte Pindrop’s 2024 Voice Intelligence and Security Report nebo navštivte Pindrop.












