Modelli e piattaforme di IA

Vijay Balasubramaniyan, Co-Fondatore & Amministratore Delegato di Pindrop – Serie di Interviste

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Vijay Balasubramaniyan è Co-Fondatore & Amministratore Delegato di Pindrop. Ha ricoperto vari ruoli di ingegneria e ricerca presso Google (GOOGL ), Siemens, IBM Research e Intel.

Vijay detiene brevetti sulla sicurezza VoIP e sulla scalabilità e parla frequentemente sulle minacce di frode telefonica alle conferenze tecniche, tra cui RSA, Black Hat, FS-ISAC, CCS e ICDCS. Vijay ha conseguito un dottorato in Informatica presso il Georgia Institute of Technology. La sua tesi di dottorato era sulla sicurezza delle telecomunicazioni.

Pindrop‘s soluzioni stanno guidando il futuro della voce stabilendo lo standard per l’identità, la sicurezza e la fiducia per ogni interazione vocale. Le soluzioni di Pindrop proteggono alcune delle più grandi banche, compagnie assicurative e retailer del mondo utilizzando tecnologie brevettate che estraggono informazioni da ogni chiamata e voce incontrata. Le soluzioni di Pindrop aiutano a rilevare i truffatori e ad autenticare i clienti genuini, riducendo la frode e i costi operativi mentre migliorano l’esperienza del cliente e proteggono la reputazione del marchio. Pindrop, un’azienda privata con sede ad Atlanta, GA, è stata fondata nel 2011 da Dr. Vijay Balasubramaniyan, Dr. Paul Judge e Dr. Mustaque Ahamad e è finanziata da Andreessen Horowitz, Citi Ventures, Felicis Ventures, CapitalG, GV, IVP e Vitruvian Partners. Per ulteriori informazioni, visitare il sito web di Pindrop.

Quali sono i principali punti chiave del Rapporto di Intelligenza e Sicurezza della Voce di Pindrop 2024 riguardo l’attuale stato della frode e della sicurezza basata sulla voce?

Il rapporto fornisce un’analisi approfondita dei problemi di sicurezza più urgenti e delle tendenze future, in particolare all’interno dei centri di contatto che servono istituzioni finanziarie e non finanziarie. I principali risultati del rapporto includono:

  • Aumento Significativo della Frode nel Centro di Contatto: la frode nel centro di contatto è aumentata del 60% negli ultimi due anni, raggiungendo i livelli più alti dal 2019. Entro la fine di quest’anno, si prevede che una chiamata su 730 al centro di contatto sarà fraudolenta.
  • Aumento della Sophisticazione degli Attaccanti che Utilizzano Deepfake: gli attacchi Deepfake, inclusi cloni vocali sintetici sofisticati, stanno aumentando, rappresentando un rischio di frode stimato di 5 miliardi di dollari per i centri di contatto degli Stati Uniti. Questa tecnologia viene utilizzata per migliorare le tattiche di frode come la ricognizione dei conti automatizzata e ad alta scala, l’impersonificazione vocale, il phishing mirato e l’ingegneria sociale.
  • I Metodi Tradizionali di Rilevamento e Autenticazione della Frode non Funzionano: le aziende si affidano ancora all’autenticazione manuale dei consumatori, che è lunga, costosa e inefficace nel fermare la frode. 350 milioni di vittime di violazioni dei dati, 12 miliardi di dollari spesi ogni anno per l’autenticazione e 10 miliardi di dollari persi a causa della frode sono la prova che i metodi di sicurezza attuali non funzionano.
  • Nuovi Approcci e Tecnologie sono Necessari: la rilevazione della vitalità è cruciale per combattere il cattivo uso dell’AI e migliorare la sicurezza. L’analisi vocale è ancora importante, ma deve essere abbinata alla rilevazione della vitalità e all’autenticazione a più fattori.

Secondo il rapporto, il 67,5% dei consumatori statunitensi è preoccupato per i deepfake nel settore bancario. Può spiegare i tipi di minacce di deepfake che le istituzioni finanziarie stanno affrontando?

La frode bancaria attraverso canali telefonici sta aumentando a causa di diversi fattori. Poiché le istituzioni finanziarie si affidano fortemente ai clienti per confermare l’attività sospetta, i centri di contatto possono diventare obiettivi primari per i truffatori. I truffatori utilizzano tattiche di ingegneria sociale per ingannare i rappresentanti del servizio clienti, convincendoli a rimuovere le restrizioni o a reimpostare le credenziali di accesso online. Secondo un cliente bancario di Pindrop, il 36% delle chiamate di frode identificate aveva come obiettivo principale la rimozione delle restrizioni imposte dai controlli di frode. Un altro cliente bancario di Pindrop segnala che il 19% delle chiamate di frode aveva come obiettivo l’accesso all’online banking. Con l’aumento dell’AI generativa e dei deepfake, questi tipi di attacchi sono diventati più potenti e scalabili. Ora, uno o due truffatori in un garage possono creare qualsiasi numero di voci sintetiche e lanciare attacchi simultanei su più istituzioni finanziarie e amplificare le loro tattiche. Ciò ha creato un livello elevato di rischio e preoccupazione tra i consumatori sulla capacità del settore bancario di respingere questi attacchi sofisticati.

Come gli avanzamenti nell’AI generativa hanno contribuito all’aumento dei deepfake e quali sfide specifiche pongono per i sistemi di sicurezza?

Sebbene i deepfake non siano nuovi, gli avanzamenti nell’AI generativa li hanno resi un vettore potente nell’ultimo anno, poiché sono stati in grado di diventare più credibili su larga scala. Gli avanzamenti nell’AI generativa hanno reso i modelli linguistici più grandi più abili nella creazione di discorsi e linguaggi credibili. Ora, è possibile creare discorsi sintetici naturali a basso costo e su larga scala. Questi sviluppi hanno reso i deepfake accessibili a tutti, compresi i truffatori. Questi deepfake sfidano i sistemi di sicurezza, consentendo attacchi di phishing molto convincenti, diffondendo informazioni false e facilitando la frode finanziaria attraverso impersonificazioni realistiche. Sottovalutano i metodi di autenticazione tradizionali, creano rischi di reputazione significativi e richiedono tecnologie di rilevamento avanzate per stare al passo con la loro rapida evoluzione e scalabilità.

Come Pindrop Pulse ha contribuito all’identificazione del motore TTS utilizzato nell’attacco di robocall al Presidente Biden e quali implicazioni ha per la rilevazione futura dei deepfake?

Pindrop Pulse ha svolto un ruolo critico nell’identificazione di ElevenLabs, il motore TTS utilizzato nell’attacco di robocall al Presidente Biden. Utilizzando la nostra tecnologia di rilevamento dei deepfake avanzata, abbiamo implementato un processo di analisi a quattro fasi che include la filtrazione del nonspeech, l’estrazione di caratteristiche spettro-temporali a basso livello e l’analisi dei segmenti. Questo processo ci ha permesso di filtrare i frame di nonspeech, di campionare l’audio per replicare le condizioni tipiche della telefonata e di estrarre caratteristiche spettro-temporali a basso livello.

Dividendo l’audio in 155 segmenti e assegnando punteggi di vitalità, abbiamo determinato che l’audio era costantemente artificiale. Utilizzando “impronte di falsificazione”, abbiamo confrontato l’audio con 122 sistemi TTS e identificato con una probabilità del 99% che ElevenLabs o un sistema simile era stato utilizzato. Questo risultato è stato convalidato con una probabilità dell’84% attraverso il classificatore di ElevenLabs SpeechAI. La nostra analisi dettagliata ha rivelato artefatti di deepfake, in particolare nelle frasi con fricative ricche e espressioni insolite per il Presidente Biden.

Il rapporto menziona preoccupazioni significative sui deepfake che colpiscono i media e le istituzioni politiche. Può fornire esempi di tali incidenti e del loro potenziale impatto?

La nostra ricerca ha scoperto che i consumatori statunitensi sono più preoccupati per il rischio di deepfake e cloni vocali nel settore bancario e finanziario. Tuttavia, oltre a questo, la minaccia dei deepfake per danneggiare i media e le istituzioni politiche rappresenta una sfida altrettanto significativa. Al di fuori degli Stati Uniti, l’uso di deepfake è stato osservato anche in Indonesia (deepfake di Suharto) e in Slovacchia (deepfake vocale di Michal Šimečka e Monika Tódová).

Il 2024 è un anno elettorale significativo negli Stati Uniti e in India. Con 4 miliardi di persone che voteranno in 40 paesi, la proliferazione della tecnologia di intelligenza artificiale rende più facile ingannare le persone su Internet. Ci aspettiamo un aumento degli attacchi di deepfake mirati alle istituzioni governative, alle società di media e alla popolazione in generale, finalizzati a creare sfiducia nelle istituzioni e a diffondere disinformazione nel discorso pubblico.

Può spiegare le tecnologie e le metodologie che Pindrop utilizza per rilevare i deepfake e le voci sintetiche in tempo reale?

Pindrop utilizza una gamma di tecnologie e metodologie avanzate per rilevare i deepfake e le voci sintetiche in tempo reale, tra cui:

    • Rilevamento della vitalità: Pindrop utilizza l’apprendimento automatico su larga scala per analizzare i frame di nonspeech (ad esempio, silenzio, rumore, musica) e estrarre caratteristiche spettro-temporali a basso livello che distinguono tra discorsi generati da macchine e discorsi umani generici.
    • Impronta digitale audio: si tratta di creare una firma digitale per ogni voce in base alle sue proprietà acustiche, come il pitch, il tono e il ritmo. Queste firme vengono utilizzate per confrontare e abbinare voci tra chiamate e interazioni diverse.
    • Analisi del comportamento: viene utilizzata per analizzare i modelli di comportamento che sembrano insoliti, inclusi l’accesso anomalo a vari account, l’attività dei bot a rapida scala, la ricognizione dei conti e la raccolta di dati.
  • Analisi vocale: analizzando le caratteristiche vocali come le caratteristiche del tratto vocale, le variazioni fonetiche e lo stile di parlato, Pindrop può creare un’impronta vocale per ogni individuo. Qualsiasi deviazione dall’impronta vocale attesa può scatenare un allarme.
  • Approccio di sicurezza a più livelli: si tratta di combinare diversi metodi di rilevamento per verificare i risultati incrociati e aumentare l’accuratezza della rilevazione. Ad esempio, i risultati dell’impronta digitale audio potrebbero essere verificati incrociati con l’analisi biometrica per confermare un sospetto.
  • Miglioramento continuo e adattamento: Pindrop aggiorna continuamente i suoi modelli e algoritmi, incorporando nuovi dati, raffinando le tecniche di rilevamento e rimanendo al passo con le minacce emergenti. Il miglioramento continuo garantisce che le capacità di rilevamento di Pindrop migliorino nel tempo e si adattino a nuovi tipi di attacchi di voci sintetiche.

Cosa è la Garanzia Deepfake Pulse e come aumenta la fiducia dei clienti nelle capacità di Pindrop di gestire le minacce di deepfake?

La Garanzia Deepfake Pulse è una garanzia senza precedenti che offre un rimborso contro la frode vocale sintetica nel centro di contatto. Mentre ci troviamo sull’orlo di un cambiamento significativo nel panorama degli attacchi informatici, i danni finanziari potenziali sono previsti aumentare a 10,5 trilioni di dollari entro il 2025, la Garanzia Deepfake Pulse aumenta la fiducia dei clienti offrendo diversi vantaggi chiave:

  • Fiducia aumentata: la Garanzia Deepfake Pulse dimostra la fiducia di Pindrop nei propri prodotti e tecnologie, offrendo ai clienti una soluzione di sicurezza affidabile per la gestione dei loro account.
  • Rimborso per perdite: i clienti di Pindrop possono ricevere un rimborso per gli eventi di frode vocale sintetica non rilevati dalla Suite di prodotti di Pindrop.
  • Miglioramento continuo: le richieste dei clienti di Pindrop ricevute nell’ambito del programma di garanzia aiutano Pindrop a rimanere al passo con le tattiche di frode vocale sintetica in evoluzione.

Ci sono casi notevoli in cui le tecnologie di Pindrop hanno mitigato con successo le minacce di deepfake? Quali sono stati gli esiti?

L’Incidente della Scuola Superiore di Pikesville: il 16 gennaio 2024, è emersa una registrazione su Instagram che sembrava contenere il preside della Scuola Superiore di Pikesville a Baltimore, nel Maryland. L’audio conteneva commenti denigratori sui docenti e gli studenti afroamericani, scatenando un putiferio di proteste pubbliche e gravi preoccupazioni.

Alla luce di questi sviluppi, Pindrop ha condotto un’indagine approfondita, conducendo tre analisi indipendenti per scoprire la verità. I risultati della nostra indagine approfondita hanno portato a una conclusione sfumata: sebbene l’audio del 16 gennaio fosse stato alterato, mancava delle caratteristiche definitive del discorso sintetico generato dall’AI. La nostra fiducia in questa determinazione è supportata da una certezza del 97% in base ai nostri metrici di analisi. Questo risultato cruciale sottolinea l’importanza di condurre analisi dettagliate e obiettive prima di fare dichiarazioni pubbliche sulla natura dei media potenzialmente manipolati.

In una grande banca statunitense, Pindrop ha scoperto che un truffatore stava utilizzando una voce sintetica per bypassare l’autenticazione nell’IVR. Abbiamo scoperto che il truffatore stava utilizzando una voce generata da macchina per bypassare l’autenticazione dell’IVR per account mirati, fornendo le risposte corrette alle domande di sicurezza e, in un caso, anche superando i codici di accesso a tempo (OTP). I bot che si sono autenticati con successo nell’IVR hanno identificato gli account da prendere di mira attraverso semplici richieste di saldo. Le chiamate successive a questi account provenivano da un essere umano per perpetrare la frode. Pindrop ha allertato la banca di questa frode in tempo reale utilizzando la tecnologia Pulse e ha potuto fermare il truffatore.

Esperimento Indipendente di Deepfake Audio di NPR: la sicurezza digitale è una corsa agli armamenti in continua evoluzione tra i truffatori e i fornitori di tecnologie di sicurezza. Ci sono diversi fornitori, tra cui Pindrop, che hanno affermato di rilevare costantemente i deepfake audio – NPR ha messo alla prova queste affermazioni per valutare se le attuali soluzioni tecnologiche sono in grado di rilevare i deepfake audio in modo coerente.

Pindrop Pulse ha rilevato con precisione 81 campioni audio su 84, raggiungendo un tasso di accuratezza del 96,4%. Inoltre, Pindrop Pulse ha rilevato il 100% dei campioni di deepfake come tali. Sebbene altri fornitori siano stati valutati nello studio, Pindrop è emerso come leader, dimostrando che la sua tecnologia può rilevare in modo affidabile e accurato sia i deepfake che i discorsi genuini.

Quali tendenze future nella frode e nella sicurezza basate sulla voce si prevede, in particolare con lo sviluppo rapido delle tecnologie di intelligenza artificiale? Come Pindrop si sta preparando ad affrontare queste sfide?

Ci aspettiamo che la frode nel centro di contatto continui a salire nel 2024. Sulla base dell’analisi dei tassi di frode anno per anno nei vari settori, prevediamo che il tasso di frode raggiunga 1 caso su 730 chiamate, rappresentando un aumento del 4-5% rispetto ai livelli attuali.

La maggior parte dell’aumento della frode colpirà il settore bancario, poiché assicurazioni, brokeraggio e altri segmenti finanziari sono previsti rimanere ai livelli attuali. Stimmiamo che questi tassi di frode rappresentino un’esposizione alla frode di 7 miliardi di dollari per le istituzioni finanziarie statunitensi, che deve essere protetta. Tuttavia, ci aspettiamo un cambiamento significativo, in particolare con i truffatori che utilizzano gli IVR come terreno di prova. Di recente, abbiamo osservato un aumento dei truffatori che inseriscono manualmente le informazioni di identificazione personale (PII) per verificare i dettagli dell’account.

Oltre alle tecnologie attuali, quali nuovi strumenti e tecniche sono in fase di sviluppo per migliorare la prevenzione della frode vocale e l’autenticazione?

Le tecniche di prevenzione della frode vocale e di autenticazione sono in continua evoluzione per stare al passo con gli avanzamenti tecnologici e la sofisticazione delle attività fraudolente. Alcuni strumenti e tecniche emergenti includono:

  • Rilevamento della frode e indagine continua: fornisce una prospettiva storica sugli eventi di frode con nuove informazioni ora disponibili. Con questo approccio, gli analisti di frode possono “ascoltare” nuovi segnali di frode, scansionare le chiamate storiche che potrebbero essere correlate e riscoreggiare quelle chiamate.
  • Analisi vocale intelligente: i sistemi di biometria vocale tradizionali sono vulnerabili agli attacchi di deepfake. Per migliorare le loro difese, sono necessarie nuove tecnologie come la “mancanza di corrispondenza vocale” e l’abbinamento vocale negativo. Queste tecnologie forniscono un ulteriore livello di difesa, riconoscendo e differenziando più voci, richiamanti ripetuti e identificando dove una voce dal suono diverso potrebbe rappresentare una minaccia.
  • Rilevamento precoce della frode: le tecnologie di rilevamento della frode che forniscono un segnale di frode rapido e affidabile all’inizio del processo di chiamata sono inestimabili. Oltre al rilevamento della vitalità, tecnologie come l’analisi dei metadati del carrier, il rilevamento dello spoofing dell’ID del chiamante e il rilevamento basato sull’audio dello spoofing forniscono protezione contro gli attacchi di frode all’inizio di una conversazione, quando le difese sono più vulnerabili.

Grazie per la grande intervista, per saperne di più leggi il Rapporto di Intelligenza e Sicurezza della Voce di Pindrop 2024 o visita Pindrop.

Antoine è un leader visionario e socio fondatore di Unite.AI, guidato da una passione incrollabile per plasmare e promuovere il futuro dell'AI e della robotica. Un imprenditore seriale, crede che l'AI sarà così disruptiva per la società come l'elettricità, e spesso si lascia trasportare dall'entusiasmo per il potenziale delle tecnologie disruptive e dell'AGI.

Come futurista, è dedicato a esplorare come queste innovazioni plasmeranno il nostro mondo. Inoltre, è il fondatore di Securities.io, una piattaforma focalizzata sugli investimenti in tecnologie all'avanguardia che stanno ridefinendo il futuro e riplasmando interi settori.