AI-modeller og platforme

Vijay Balasubramaniyan, Co-Founder & CEO of Pindrop – Interview Series

mm
Føj Unite.AI til dine foretrukne kilder på Google

Vijay Balasubramaniyan er Co-Founder & CEO of Pindrop. Han har haft forskellige ingeniør- og forskningsroller hos Google (GOOGL ), Siemens, IBM Research og Intel.

Vijay har patenter i VoIP-sikkerhed og skalerbarhed, og han taler ofte om telefonsvindelstrusler på tekniske konferencer, herunder RSA, Black Hat, FS-ISAC, CCS og ICDCS. Vijay har en ph.d. i datalogi fra Georgia Institute of Technology. Hans ph.d.-afhandling handlede om telekommunikationssikkerhed.

Pindrop‘s løsninger er med til at forme fremtiden for stemmeinteraktioner ved at etablere standarden for identitet, sikkerhed og tillid til hver stemmeinteraktion. Pindrop’s løsninger beskytter nogle af verdens største banker, forsikringsselskaber og detailhandlere ved hjælp af patenteret teknologi, der udvinder intelligens fra hver opkald og stemme, der mødes. Pindrop-løsninger hjælper med at opdage svindlere og autentificere ægte kunder, reducerer svindel og driftsomkostninger, mens de forbedrer kundeoplevelsen og beskytter virksomhedsrygte. Pindrop, et privat ejet selskab med hovedsæde i Atlanta, GA, blev grundlagt i 2011 af Dr. Vijay Balasubramaniyan, Dr. Paul Judge og Dr. Mustaque Ahamad og er venture-finansieret af Andreessen Horowitz, Citi Ventures, Felicis Ventures, CapitalG, GV, IVP og Vitruvian Partners. For mere information, besøg venligst pindrop.com.

Hvad er de vigtigste punkter i Pindrop’s 2024 Voice Intelligence and Security Report om den nuværende tilstand af stemme-baseret svindel og sikkerhed?

Rapporten giver en dybdeindblik i presserende sikkerhedsproblemer og fremtidige trends, særligt inden for kontaktcenter, der betjener finansielle og ikke-finansielle institutioner. Nøglefund i rapporten omfatter:

  • Betydelig stigning i kontaktcenter-svindel: Kontaktcenter-svindel er steget med 60% de seneste to år og har nået det højeste niveau siden 2019. Ved årets udgang forventes det, at en af hver 730 opkald til et kontaktcenter vil være svindel.
  • Øget sofistikation af angribere, der bruger Deepfake: Deepfake-angreb, herunder avancerede syntetiske stemmekloner, er stigende og udgør en estimeret svindelrisiko på 5 milliarder dollars for amerikanske kontaktcenter. Denne teknologi bruges til at forbedre svindeltaktikker som automatiseret og storstilede konto-reconnaissance, stemme-imitation, målrettede smishing- og social engineering-angreb.
  • Traditionelle metoder til svindeldetektion og autentificering virker ikke: Virksomheder afhænger stadig af manuel autentificering af forbrugere, som er tidskrævende, dyrt og ineffektivt til at stoppe svindel. 350 millioner ofre for dataudtræninger. 12 milliarder dollars brugt årligt på autentificering og 10 milliarder dollars tabt til svindel er beviser på, at nuværende sikkerhedsmetoder ikke fungerer.
  • Nye tilgange og teknologier er nødvendige: Liveness-detektion er afgørende for at bekæmpe dårlig AI og forbedre sikkerheden. Stemmeanalyse er stadig vigtig, men skal kombineres med liveness-detektion og multifaktor-autentificering.

Ifølge rapporten er 67,5% af amerikanske forbrugere bekymret over deepfakes i banksektoren. Kan du uddybe de typer af deepfake-trusler, som finansielle institutioner står over for?

Banksvindel via telefonkanaler stiger på grund af flere faktorer. Da finansielle institutioner afhænger stærkt af, at kunder bekræfter mistænkelige transaktioner, kan kontaktcenter blive primære mål for svindlere. Svindlere bruger social engineering-taktikker til at narre kundeservice-repræsentanter til at fjerne restriktioner eller hjælpe med at nulstille online-banklegitimationsoplysninger. Ifølge en Pindrop-bankkunde var 36% af identificerede svindelopkald primært rettet mod at fjerne hold, der var pålagt af svindelkontroller. En anden Pindrop-bankkunde rapporterer, at 19% af svindelopkald var rettet mod at få adgang til online-banking. Med opblomstringen af generativ AI og deepfakes er disse angreb blevet mere potente og skalerbare. Nu kan en eller to svindlere i en garage oprette enhver mængde syntetiske stemmer og lancerer samtidige angreb på multiple finansielle institutioner og forstærker deres taktikker. Dette har skabt en forhøjet niveau af risiko og bekymring blandt forbrugere om, hvorvidt banksektoren er parat til at afvise disse avancerede angreb.

Hvordan har fremskridt i generativ AI bidraget til opblomstringen af deepfakes, og hvilke specifikke udfordringer stiller disse for sikkerhedssystemer?

Selv om deepfakes ikke er nye, har fremskridt i generativ AI gjort dem til en potent vektor over de seneste år, da de har kunnet blive mere overbevisende i større målestok. Fremskridt i GenAI har gjort store sprogmodeller mere dygtige til at skabe overbevisende tale og sprog. Nu kan naturligt lydende syntetisk (falsk) tale oprettes meget billigt og i stor målestok. Disse udviklinger har gjort deepfakes tilgængelige for alle, herunder svindlere. Disse deepfakes udfordrer sikkerhedssystemer ved at muliggøre meget overbevisende phishing-angreb, sprede misinformationskampagner og faciliterer finansielt svindel gennem realistiske imitationer. De undergraver traditionelle autentificeringsmetoder, skaber betydelige reputationsrisici og kræver avancerede detektionsteknologier for at følge med deres hurtige udvikling og skalerbarhed.

Hvordan bidrog Pindrop Pulse til at identificere TTS-motoren, der blev brugt i præsident Biden-robocall-angrebet, og hvilke implikationer har dette for fremtidig deepfake-detektion?

Pindrop Pulse spillede en afgørende rolle i at identificere ElevenLabs, TTS-motoren, der blev brugt i præsident Biden-robocall-angrebet. Ved hjælp af vores avancerede deepfake-detektionsteknologi implementerede vi en firetrinsanalyseproces, der omfattede audio-filtrering og rensning, feature-ekstraktion, segmentanalyse og kontinuerlig scoring. Denne proces tillod os at filtrere nonspeech-rammer ud, nedsample lyden til at replikere typiske telefonforhold og ekstrahere lavniveauspektro-temporale funktioner.

Ved at opdele lyden i 155 segmenter og tildele liveness-scores, fastslog vi, at lyden konsekvent var kunstig. Ved hjælp af “fakeprints” sammenlignede vi lyden med 122 TTS-systemer og identificerede med 99% sandsynlighed, at ElevenLabs eller et lignende system blev brugt. Denne fund var valideret med en 84% sandsynlighed gennem ElevenLabs SpeechAI-klassifikator. Vores detaljerede analyse afslørede deepfake-artefakter, særligt i fraser med rige fricativer og usædvanlige udtryk for præsident Biden.

Dette tilfælde understreger vigtigheden af vores skalerbare og forklarelige deepfake-detektionssystemer, der forbedrer nøjagtighed, opbygger tillid og tilpasser sig nye teknologier. Det understreger også behovet for, at generative AI-systemer inkorporerer sikkerhedsforanstaltninger mod misbrug, sådan at stemmekloning kun kan ske med samtykke fra virkelige personer. Vores tilgang sætter en standard for at tackle syntetiske medietrusler, hvilket understreger behovet for kontinuerlig overvågning og forskning for at følge med udviklingen af deepfake-metoder.

Rapporten nævner betydelige bekymringer om deepfakes, der påvirker medier og politiske institutioner. Kan du give eksempler på sådanne episoder og deres potentielle indvirkning?

Vores forskning har fundet, at amerikanske forbrugere er mest bekymret over risikoen for deepfakes og stemmekloner i bank- og finansielle sektorer. Men ud over det udgør truslen fra deepfakes mod vores medier og politiske institutioner en lige så betydelig udfordring. Uden for USA er brugen af deepfakes også observeret i Indonesien (Suharto-deepfake) og Slovakiet (Michal Šimečka og Monika Tódová-voice-deepfake).

2024 er et betydeligt valgår i USA og Indien. Med 4 milliarder mennesker over 40 lande forventes at stemme, gør kunstig intelligens-teknologi det lettere end nogensinde at bedrage mennesker på internettet. Vi forventer en stigning i målrettede deepfake-angreb på regeringsinstitutioner, sociale medie-selskaber, andre mediehus og den generelle befolkning, der er designet til at skabe mistillid til vores institutioner og sprede misinformationskampagner i den offentlige diskurs.

Kan du forklare de teknologier og metoder, Pindrop bruger til at detektere deepfakes og syntetiske stemmer i realtid?

Pindrop bruger en række avancerede teknologier og metoder til at detektere deepfakes og syntetiske stemmer i realtid, herunder:

    • Liveness-detektion: Pindrop bruger storstilede maskinlæringsalgoritmer til at analysere nonspeech-rammer (f.eks. stilhed, støj, musik) og ekstrahere lavniveauspektro-temporale funktioner, der kan skelne mellem maskin-genereret og generisk menneskesprog.
    • Audio-fingerprinting: Dette indebærer at oprette en digital signatur for hver stemme baseret på dets akustiske egenskaber, såsom tone, tonehøjde og kadence. Disse signaturer bruges derefter til at sammenligne og matche stemmer på tværs af forskellige opkald og interaktioner.
    • Adfærdsanalyse: Bruges til at analysere mønstre af adfærd, der synes usædvanlige, herunder anomal access til forskellige konti, hurtig bot-aktivitet, konto-reconnaissance, data-mining og robot-til-ringning.
  • Stemmeanalyse: Ved at analysere stemmefunktioner såsom vokaltrakt-egenskaber, fonetiske variationer og talestil, kan Pindrop oprette en stemmefingerprint for hver enkelt. Enhver afvigelse fra den forventede stemmefingerprint kan udløse en alarm.
  • Flere-lag-sikkerheds-tilgang: Dette indebærer at kombinere forskellige detektionsmetoder til at krydskontrollere resultater og øge nøjagtigheden af detektion. F.eks. kan audio-fingerprinting-resultater være krydskontrolleret med biometrisk analyse for at bekræfte en formodning.
  • Kontinuerlig læring og tilpasning: Pindrop opdaterer kontinuerligt sine modeller og algoritmer. Dette indebærer at inkorporere nye data, forfine detektions-teknikker og følge med udviklingen af nye trusler. Kontinuerlig læring sikrer, at deres detektionsfunktioner forbedres over tid og tilpasser sig nye typer syntetiske stemmeangreb.

Hvad er Pulse Deepfake-garanti, og hvordan forbedrer den kunde-tillid til Pindrops evne til at tackle deepfake-trusler?

Pulse Deepfake-garanti er en første-af-dens-art-garanti, der tilbyder erstatning mod syntetisk stemme-svindel i kontaktcenter. Da vi står på kanten af en seismisk ændring i cyberangrebs-landskabet, forventede finansielle tab forventes at stige til 10,5 billioner dollars i 2025, Pulse Deepfake-garanti forbedrer kunde-tillid ved at tilbyde flere nøglefordele:

  • Forbedret tillid: Pulse Deepfake-garanti demonstrerer Pindrops tillid til sine produkter og teknologi, og tilbyder kunderne en pålidelig sikkerheds-løsning, når de betjener deres kunder.
  • Erstatning for tab: Pindrop-kunder kan modtage erstatning for syntetisk stemme-svindel, der ikke er detekteret af Pindrop Product Suite.
  • Kontinuerlig forbedring: Pindrop-kundeanmodninger, der modtages under garantiprogrammet, hjælper Pindrop med at følge med udviklingen af nye syntetiske stemme-svindel-taktikker.

Er der nogle bemærkelsesværdige case-studies, hvor Pindrops teknologier har succesfuldt reduceret deepfake-trusler? Hvad var resultaterne?

Pikesville High School-episoden: Den 16. januar 2024 dukkede en optagelse op på Instagram, der angiveligt indeholdt skolens inspektør på Pikesville High School i Baltimore, Maryland. Lyden indeholdt nedsættende udtalelser om sorte studerende og lærere, og udløste en storm af offentlig fordømmelse og alvorlig bekymring.

I lyset af disse udviklinger gennemførte Pindrop en omfattende undersøgelse, hvor vi gennemførte tre uafhængige analyser for at afsløre sandheden. Resultaterne af vores grundige undersøgelse førte til en nuanceret konklusion: selv om januar-lyden var ændret, manglede den de definitive kendetegn ved AI-genereret syntetisk tale. Vores tillid til denne bestemmelse støttes af en 97% sandsynlighed baseret på vores analyse-metrik. Denne afgørende fund understreger vigtigheden af at gennemføre detaljerede og objektive analyser, før man offentliggør udtalelser om naturen af muligvis manipuleret medie.

I en stor amerikansk bank opdagede Pindrop, at en svindler brugte syntetisk stemme til at omgå autentificering i IVR. Vi fandt, at svindleren brugte maskin-genereret stemme til at omgå IVR-autentificering for målrettede konti, og gav de rigtige svar på sikkerhedsspørgsmål, og i ét tilfælde endda gennemførte en-gangs-adgangskoder (OTP). Bots, der succesfuldt autentificerede i IVR, identificerede konti, der var værd at målrette via grundlæggende saldo-forhør. Følgende opkald til disse konti var fra en rigtig person for at udøve svindel. Pindrop advarede banken om dette svindel i realtid ved hjælp af Pulse-teknologi og kunne stoppe svindleren.

I en anden finansielle institution fandt Pindrop, at nogle svindlere trænede deres egne stemme-bots til at imitere bank-automatiserede svar-systemer. I hvad der lød som et bizart første-opkald, ringede en stemme-bot ind i bankens IVR ikke for at gøre konto-reconnaissance, men for at gentage IVR-prompter. Flere opkald kom ind i forskellige grene af IVR-samtale-træet, og hver anden sekund gentog bot’en, hvad den hørte. En uge senere blev flere opkald observeret, der gjorde det samme, men denne gang gentog stemme-bot’en fraserne i præcis samme stemme og manerer som bankens IVR. Vi mener, at en svindler trænede en stemme-bot til at spejle bankens IVR som et udgangspunkt for et smishing-angreb. Med hjælp fra Pindrop Pulse kunne den finansielle institution forhindre dette angreb, før nogen skade var sket.

Uafhængig NPR Audio Deepfake-eksperiment: Digital sikkerhed er en konstant udviklende kapløb mellem svindlere og sikkerhedsteknologi-leverandører. Der er flere leverandører, herunder Pindrop, der har påstået at detektere audio-deepfakes konsekvent – NPR satte disse påstande på prøve for at vurdere, om nuværende teknologiløsninger er i stand til at detektere AI-genererede audio-deepfakes på en konsekvent basis.

Pindrop Pulse detekterede korrekt 81 af de 84 audio-eksempler, hvilket svarer til en nøjagtighed på 96,4%. Desuden detekterede Pindrop Pulse 100% af alle deepfake-eksempler som sådanne. Selv om andre leverandører også blev evaluering i studiet, opnåede Pindrop at demonstrere, at deres teknologi kan pålideligt og korrekt detektere både deepfake og ægte audio.

Hvad er de fremtidige trends i stemme-baseret svindel og sikkerhed, som du forudser, særligt med den hurtige udvikling af AI-teknologier? Hvordan forbereder Pindrop sig på at tackle disse?

Vi forventer, at kontaktcenter-svindel vil fortsætte med at stige i 2024. Basert på år-til-dato-analyse af svindel-rater på tværs af vertikaler, estimerer vi konservativt, at svindel-raten vil nå 1 af hver 730 opkald, hvilket repræsenterer en stigning på 4-5% i forhold til nuværende niveauer.

Det meste af den øgede svindel forventes at ramme banksektoren, da forsikring, brokerage og andre finansielle sektorer forventes at forblive på nuværende niveauer. Vi estimerer, at disse svindel-rater repræsenterer en svindel-exponering på 7 milliarder dollars for finansielle institutioner i USA, som skal sikres. Imidlertid forventer vi en betydelig ændring, særligt med svindlere, der bruger IVR som en testgrund. Nyligt har vi observeret en stigning i svindlere, der manuelt indtaster personlige identifikationsoplysninger for at verificere konto-oplysninger.

For at bekæmpe dette vil vi fortsætte med at udvikle Pindrops nuværende løsninger og lancere nye og innovative værktøjer, som Pindrop Pulse, der beskytter vores kunder.

Ud over nuværende teknologier, hvilke nye værktøjer og teknikker udvikles til at forbedre stemme-svindel-forhindring og autentificering?

Stemme-svindel-forhindring og autentificeringsteknikker udvikles kontinuerligt for at følge med udviklingen i teknologi og sofistikationen af svindelaktiviteter. Nogle fremvoksende værktøjer og teknikker omfatter:

  • Kontinuerlig svindel-detektion og -undersøgelse: Tilbyder en historisk “tilbageblik” på svindel-episoder med nye oplysninger, der nu er tilgængelige. Med denne tilgang kan svindel-analytikere “lytte” efter nye svindel-signaler, scanne efter historiske opkald, der kan være relaterede, og genscore disse opkald. Dette giver virksomhederne en kontinuerlig og omfattende perspektiv på svindel i realtid.
  • Intelligent stemme-analyse: Traditionelle stemme-biometriske systemer er sårbare over for deepfake-angreb. For at forbedre deres forsvar kræves nye teknologier såsom Voice Mismatch og Negative Voice Matching. Disse teknologier tilbyder en ekstra forsvarslag ved at genkende og differentiere multiple stemmer, gentagne opkald og identificere, hvor en anden lydende stemme kan udgøre en trussel.
  • Tidlig svindel-detektion: Svindel-detektionsteknologier, der giver en hurtig og pålidelig svindel-signal tidligt i opkaldsprocessen, er uvurderlige. Ud over liveness-detektion giver teknologier såsom carrier-metadata-analyse, caller-ID-spoof-detektion og audio-baseret spoof-detektion beskyttelse mod svindel-angreb i begyndelsen af en samtale, hvor forsvaret er mest sårbart.

Tak for det gode interview, for at lære mere læs Pindrop’s 2024 Voice Intelligence and Security Report eller besøg Pindrop.

Antoine er en visionær leder og medstifter af Unite.AI, drevet af en urokkelig passion for at forme og fremme fremtiden for AI og robotteknologi. En serieiværksætter, han tror, at AI vil være lige så omvæltende for samfundet som elektricitet, og han bliver ofte fanget i at tale om potentialet for omvæltende teknologier og AGI.

Som en futurist, er han dedikeret til at udforske, hvordan disse innovationer vil forme vores verden. Derudover er han grundlægger af Securities.io, en platform, der fokuserer på at investere i skarp teknologi, der gendefinerer fremtiden og omformer hele sektorer.