Modele i platformy AI

Vijay Balasubramaniyan, współzałożyciel i CEO Pindrop – seria wywiadów

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Vijay Balasubramaniyan jest współzałożycielem i CEO Pindrop. Pełnił różne role inżynierskie i badawcze w Google (GOOGL ), Siemens, IBM Research i Intel.

Vijay posiada patenty w dziedzinie bezpieczeństwa i skalowalności VoIP, a także często występuje na konferencjach technicznych, w tym RSA, Black Hat, FS-ISAC, CCS i ICDCS, mówiąc o zagrożeniach związanych z oszustwami telefonicznymi. Vijay uzyskał tytuł doktora w dziedzinie informatyki na Georgia Institute of Technology. Jego praca doktorska dotyczyła bezpieczeństwa telekomunikacji.

Pindrop‘s rozwiązania są liderem w kierunku przyszłości głosu, ustanawiając standard dla tożsamości, bezpieczeństwa i zaufania dla każdej interakcji głosowej. Rozwiązania Pindrop chronią niektóre z największych banków, ubezpieczycieli i detalistów, wykorzystując opatentowaną technologię, która wyodrębnia inteligencję z każdego połączenia i głosu. Rozwiązania Pindrop pomagają wykrywać oszustów i uwierzytelniać prawdziwych klientów, redukując oszustwa i koszty operacyjne, a także poprawiając doświadczenie klienta i chroniąc reputację marki. Pindrop, prywatna spółka z siedzibą w Atlanta, GA, została założona w 2011 roku przez dr. Vijay Balasubramaniyan, dr. Paul Judge i dr. Mustaque Ahamad i jest wspierana przez Andreessen Horowitz, Citi Ventures, Felicis Ventures, CapitalG, GV, IVP i Vitruvian Partners. Więcej informacji można znaleźć na stronie pindrop.com.

Jakie są kluczowe wnioski z Raportu Pindrop o inteligencji głosowej i bezpieczeństwie 2024 dotyczące bieżącego stanu oszustw i bezpieczeństwa opartych na głosie?

Raport zapewnia głęboką analizę palących problemów bezpieczeństwa i przyszłych trendów, szczególnie w centrach kontaktowych obsługujących instytucje finansowe i niefinansowe. Kluczowe ustalenia w raporcie obejmują:

  • Znaczny wzrost oszustw w centrach kontaktowych: Oszustwa w centrach kontaktowych wzrosły o 60% w ciągu ostatnich dwóch lat, osiągając najwyższy poziom od 2019 roku. Do końca tego roku jeden na każde 730 połączeń do centrum kontaktowego ma być oszustwem.
  • Zwiększona złożoność ataków wykorzystujących Deepfake: Ataki Deepfake, w tym zaawansowane syntetyczne klony głosowe, są coraz bardziej powszechne, stanowiąc szacowany ryzyko oszustw na kwotę 5 miliardów dolarów dla centrów kontaktowych w Stanach Zjednoczonych. Ta technologia jest wykorzystywana do zwiększenia taktyk oszustw, takich jak automatyczne i wyskalowane rozpoznanie kont, naśladownictwo głosu, celowe smishing i inżynieria społeczna.
  • Tradycyjne metody wykrywania i uwierzytelniania oszustw nie działają: Firmy nadal polegają na ręcznym uwierzytelnianiu konsumentów, co jest czasochłonne, drogie i nieskuteczne w powstrzymywaniu oszustw. 350 milionów ofiar naruszeń danych. 12 miliardów dolarów wydanych rocznie na uwierzytelnianie i 10 miliardów dolarów straconych na oszustwa są dowodem, że obecne metody bezpieczeństwa nie działają.
  • Wymagane są nowe podejścia i technologie: Wykrywanie żywotności jest kluczowe w walce z złym AI i poprawie bezpieczeństwa. Analiza głosu nadal jest ważna, ale musi być połączona z wykrywaniem żywotności i uwierzytelnianiem wieloczynnikowym.

Zgodnie z raportem, 67,5% konsumentów w Stanach Zjednoczonych obawia się Deepfake w sektorze bankowym. Czy możesz wyjaśnić rodzaje zagrożeń Deepfake, z którymi mierzą się instytucje finansowe?

Oszustwa bankowe za pośrednictwem kanałów telefonicznych rosną z powodu kilku czynników. Ponieważ instytucje finansowe opierają się głównie na klientach w celu potwierdzenia podejrzanych działań, centra kontaktowe mogą stać się głównymi celami oszustw. Oszustowie wykorzystują taktyki inżynierii społecznej, aby oszukać przedstawicieli obsługi klienta, namawiając ich do usunięcia ograniczeń lub pomocy w resetowaniu poświadczeń online. Zgodnie z jednym z klientów bankowych Pindrop, 36% zidentyfikowanych połączeń oszustw miało na celu usunięcie blokad nałożonych przez kontrole oszustw. Inny klient bankowy Pindrop zgłosił, że 19% połączeń oszustw miało na celu uzyskanie dostępu do bankowości online. Wraz ze wzrostem generatywnej sztucznej inteligencji i Deepfake, tego rodzaju ataki stały się bardziej potężne i skalowalne. Teraz jeden lub dwóch oszustów w garażu może utworzyć dowolną liczbę syntetycznych głosów i rozpocząć jednoczesne ataki na wiele instytucji finansowych i zwiększyć swoje taktyki. To stworzyło podniesiony poziom ryzyka i obaw wśród konsumentów, czy sektor bankowy jest przygotowany do odparcia tych zaawansowanych ataków.

Jak postępy w generatywnej sztucznej inteligencji przyczyniły się do wzrostu Deepfake, a jakie konkretnie wyzwania stawiają one systemom bezpieczeństwa?

Chociaż Deepfake nie są nowe, postępy w generatywnej sztucznej inteligencji uczyniły je potężnym wektorem w ciągu ostatniego roku, ponieważ stały się bardziej wiarygodne w dużo większej skali. Postępy w GenAI sprawiły, że duże modele językowe stały się bardziej zdolne do tworzenia wiarygodnej mowy i języka. Teraz naturalnie brzmiące syntetyczne głosy (fałszywa mowa) mogą być tworzone bardzo tanio i w dużych ilościach. Te rozwoje sprawiły, że Deepfake są dostępne dla wszystkich, w tym także oszustów. Deepfake stawiają systemom bezpieczeństwa wyzwania, umożliwiając bardzo przekonywujące ataki phishingowe, rozpowszechnianie dezinformacji i ułatwiając oszustwa finansowe za pomocą realistycznych naśladownictw. Podważają one tradycyjne metody uwierzytelniania, tworzą znaczne ryzyko reputacyjne i wymagają zaawansowanych technologii wykrywania, aby nadążyć za ich szybkim rozwojem i skalowalnością.

Jak Pindrop Pulse przyczynił się do identyfikacji silnika TTS wykorzystanego w ataku na prezydenta Bidena, a jakie ma to implikacje dla przyszłego wykrywania Deepfake?

Pindrop Pulse odegrał kluczową rolę w identyfikacji ElevenLabs, silnika TTS wykorzystanego w ataku na prezydenta Bidena. Wykorzystując naszą zaawansowaną technologię wykrywania Deepfake, wdrożyliśmy czterostopniowy proces analizy, obejmujący filtrowanie audio, ekstrakcję cech, analizę segmentów i ciągłe ocenianie. Ten proces pozwolił nam wyodrębnić niskopoziomowe cechy spektro-temporalne, które odróżniają mowę generowaną przez maszynę od ogólnej mowy ludzkiej.

Dzięki podzieleniu audio na 155 segmentów i przypisaniu im ocen żywotności, ustaliliśmy, że audio było stale sztuczne. Wykorzystując “słabe odciski palców”, porównaliśmy audio z 122 systemami TTS i zidentyfikowaliśmy z 99% prawdopodobieństwem, że ElevenLabs lub podobny system został wykorzystany. To odkrycie zostało potwierdzone z 84% prawdopodobieństwem za pomocą klasyfikatora ElevenLabs SpeechAI. Nasza szczegółowa analiza ujawniła artefakty Deepfake, szczególnie w frazach z bogatymi frikatami i niezwykłymi wyrażeniami prezydenta Bidena.

Raport wspomina o znacznych obawach dotyczących Deepfake wpływających na media i instytucje polityczne. Czy możesz podać przykłady takich incydentów i ich potencjalny wpływ?

Nasze badania wykazały, że konsumentów w Stanach Zjednoczonych najbardziej martwi ryzyko Deepfake i klonów głosowych w sektorze bankowym. Ale poza tym, zagrożenie Deepfake dla naszych instytucji medialnych i politycznych stanowi równie znaczne wyzwanie. Poza Stanami Zjednoczonymi, wykorzystanie Deepfake zostało również zaobserwowane w Indonezji (Suharto Deepfake) i na Słowacji (głosowy Deepfake Michala Šimečki i Moniki Tódovej).

2024 to znaczący rok wyborczy w Stanach Zjednoczonych i Indiach. Z 4 miliardami ludzi w 40 krajach, którzy mają głosować, rozwój technologii sztucznej inteligencji sprawił, że łatwiej niż kiedykolwiek wcześniej oszukać ludzi w internecie. Spodziewamy się wzrostu celowych ataków Deepfake na instytucje rządowe, firmy medialne, inne media i ogół społeczeństwa, mających na celu stworzenie nieufności wobec naszych instytucji i szerzenie dezinformacji w dyskursie publicznym.

Czy możesz wyjaśnić technologie i metody, których Pindrop używa do wykrywania Deepfake i syntetycznych głosów w czasie rzeczywistym?

Pindrop wykorzystuje szereg zaawansowanych technologii i metod do wykrywania Deepfake i syntetycznych głosów w czasie rzeczywistym, w tym:

    • Wykrywanie żywotności: Pindrop wykorzystuje duże maszyny sztucznej inteligencji do analizy ram niespeech (np. cisza, hałas, muzyka) i wyodrębniania niskopoziomowych cech spektro-temporalnych, które odróżniają mowę generowaną przez maszynę od ogólnej mowy ludzkiej
    • Odciski palców audio – Obejmuje tworzenie cyfrowego podpisu dla każdego głosu na podstawie jego właściwości akustycznych, takich jak pitch, ton i cadencja. Te podpisy są następnie wykorzystywane do porównania i dopasowania głosów w różnych połączeniach i interakcjach.
    • Analiza zachowania – Wykorzystywana do analizy wzorców zachowania, które wydają się niezwykłe, w tym anomalne dostępy do różnych kont, szybka aktywność botów, rozpoznanie kont i robotyczne wybieranie numerów.
  • Analiza głosu – Poprzez analizę cech głosu, takich jak charakterystyka toru głosowego, wariacje fonetyczne i styl mówienia, Pindrop może utworzyć odcisk głosowy dla każdej osoby. Jakakolwiek odchyłka od oczekiwanego odcisku głosowego może spowodować alarm.
  • Wielowarstwowe podejście do bezpieczeństwa – Obejmuje łączenie różnych metod wykrywania w celu wzajemnego potwierdzenia wyników i zwiększenia dokładności wykrywania. Na przykład, wyniki odcisków palców audio mogą być skorelowane z analizą biometryczną w celu potwierdzenia podejrzenia.
  • Ciągłe uczenie i adaptacja – Pindrop ciągle aktualizuje swoje modele i algorytmy. Obejmuje to włączanie nowych danych, doskonalenie technik wykrywania i pozostawanie na czele ewoluujących zagrożeń Deepfake. Ciągłe uczenie zapewnia, że możliwości wykrywania Pindrop są poprawiane z czasem i dostosowują się do nowych rodzajów ataków głosowych syntetycznych.

Czym jest Gwarancja Deepfake Pulse, a jak zwiększa zaufanie klientów do możliwości Pindrop w zakresie radzenia sobie z zagrożeniami Deepfake?

Gwarancja Deepfake Pulse to pierwsza na świecie gwarancja, która oferuje zwrot kosztów w przypadku oszustw głosowych w centrum kontaktowym. Ponieważ stoimy na progu znaczącej zmiany w krajobrazie ataków cybernetycznych, potencjalne straty finansowe mają wzrosnąć do 10,5 biliona dolarów do 2025 roku, Gwarancja Deepfake Pulse zwiększa zaufanie klientów, oferując kilka kluczowych korzyści:

  • Zwiększone zaufanie: Gwarancja Deepfake Pulse demonstruje zaufanie Pindrop do swoich produktów i technologii, oferując klientom godne zaufania rozwiązanie bezpieczeństwa podczas obsługi ich kont.
  • Zwrot kosztów: Klienci Pindrop mogą otrzymać zwrot kosztów w przypadku zdarzeń oszustw głosowych, które nie zostały wykryte przez Pakiet Produktów Pindrop.
  • Ciągła poprawa: Żądania klientów Pindrop otrzymane w ramach programu gwarancyjnego pomagają Pindrop pozostać na czele ewoluujących taktyk oszustw głosowych syntetycznych.

Czy istnieją jakieś godne uwagi studia przypadków, w których technologie Pindrop skutecznie przeciwdziałały zagrożeniom Deepfake? Jakie były wyniki?

Incident w Pikesville High School: 16 stycznia 2024 roku na Instagram pojawiło się nagranie, które rzekomo przedstawiało dyrektora Pikesville High School w Baltimore, w stanie Maryland. Nagranie zawierało obraźliwe uwagi o uczniach i nauczycielach czarnoskórych, wywołując burzę publicznego oburzenia i poważnych obaw.

W związku z tymi wydarzeniami, Pindrop przeprowadził kompleksowe śledztwo, prowadząc trzy niezależne analizy, aby ustalić prawdę. Wyniki naszego szczegółowego śledztwa doprowadziły do nuansowanego wniosku: chociaż nagranie z 16 stycznia zostało zmienione, nie posiadało definitywnych cech sztucznie generowanego mówienia. Nasza pewność w tym zakresie jest wspierana przez 97% pewności na podstawie naszych wskaźników analizy. To przełomowe odkrycie podkreśla wagę przeprowadzania szczegółowych i obiektywnych analiz przed publicznymi oświadczeniami dotyczącymi natury potencjalnie zmodyfikowanych mediów.

W dużym banku amerykańskim, Pindrop odkrył, że oszust wykorzystywał syntetyczny głos, aby ominąć uwierzytelnianie w IVR. Stwierdziliśmy, że oszust wykorzystywał głos generowany przez maszynę, aby ominąć uwierzytelnianie w IVR dla celowych kont, podając prawidłowe odpowiedzi na pytania bezpieczeństwa i w jednym przypadku nawet przekazując hasła jednorazowe (OTP). Bots, które pomyślnie uwierzytelniono w IVR, identyfikowały konta wartosciowe za pomocą podstawowych zapytań o saldo. Późniejsze połączenia do tych kont były od prawdziwych ludzi, którzy popełniali oszustwa. Pindrop powiadomił bank o tym oszustwie w czasie rzeczywistym za pomocą technologii Pulse i był w stanie powstrzymać oszustów.

W innej instytucji finansowej, Pindrop odkrył, że niektórzy oszustowie szkolili własne voiceboty, aby naśladować systemy odpowiedzi automatycznej banku. W tym, co brzmiało jak pierwsze połączenie, voicebot dzwonił do systemu IVR banku nie po to, aby przeprowadzić rozpoznanie konta, ale po to, aby powtórzyć polecenia IVR. Wiele połączeń przychodziło do różnych gałęzi drzewa rozmowy IVR, a co dwie sekundy bot powtarzał to, co usłyszał. Tydzień później obserwowano więcej połączeń, które to robiły, ale tym razem bot powtarzał frazy w dokładnie tym samym głosie i manierach, co system IVR banku. Uważamy, że oszust szkolił voicebota, aby odtworzyć system IVR banku jako punkt wyjścia ataku smishingowego. Dzięki pomocy Pindrop Pulse, instytucja finansowa była w stanie udaremnić ten atak, zanim została wyrządzona jakakolwiek szkoda.

Niezależny eksperyment audio Deepfake NPR: Bezpieczeństwo cyfrowe jest ciągle ewoluującą walką między oszustami a dostawcami technologii bezpieczeństwa. Istnieje kilku dostawców, w tym Pindrop, którzy twierdzą, że mogą wykrywać audio Deepfake w sposób ciągły – NPR poddał te twierdzenia testowi, aby ocenić, czy obecne rozwiązania technologiczne są w stanie wykrywać audio Deepfake w sposób ciągły.

Pindrop Pulse dokładnie wykrył 81 z 84 próbek audio, co przekłada się na 96,4% wskaźnik dokładności. Ponadto, Pindrop Pulse wykrył 100% próbek Deepfake. Podczas gdy inne dostawcy również zostali ocenieni w badaniu, Pindrop wyłonił się jako lider, demonstrując, że jego technologia może niezawodnie i dokładnie wykrywać zarówno Deepfake, jak i autentyczne audio.

Jakie trendy przyszłościowe w oszustwach i bezpieczeństwie głosowym przewidujesz, zwłaszcza w kontekście szybkiego rozwoju technologii sztucznej inteligencji? Jak Pindrop przygotowuje się do radzenia sobie z tymi wyzwaniami?

Spodziewamy się, że oszustwa w centrach kontaktowych będą nadal rosły w 2024 roku. Na podstawie analizy wskaźników oszustw w różnych sektorach, szacujemy, że wskaźnik oszustw osiągnie 1 na każde 730 połączeń, co stanowi 4-5% wzrost w porównaniu z obecnymi poziomami.

Większość zwiększonych oszustw ma wpływ na sektor bankowy, ponieważ ubezpieczenia, maklerstwo i inne sektory finansowe mają pozostać na obecnym poziomie. Szacujemy, że te wskaźniki oszustw reprezentują ryzyko oszustw na kwotę 7 miliardów dolarów dla instytucji finansowych w Stanach Zjednoczonych, które muszą być zabezpieczone. Jednak spodziewamy się znaczącej zmiany, zwłaszcza w przypadku oszustów, którzy wykorzystują IVR jako pole testowe. Ostatnio zaobserwowaliśmy wzrost oszustów, którzy ręcznie wprowadzają informacje osobiste (PII), aby zweryfikować szczegóły konta.

Poza obecnie dostępnymi technologiami, jakie nowe narzędzia i techniki są rozwijane w celu poprawy zapobiegania oszustwom głosowym i uwierzytelniania?

Techniki zapobiegania oszustwom głosowym i uwierzytelniania są ciągle ewoluujące, aby nadążyć za postępami technologicznymi i złożonością oszustw. Niektóre pojawiające się narzędzia i techniki obejmują:

  • Ciągłe wykrywanie i śledztwo w sprawie oszustw: Zapewnia historyczne “spojrzenie wstecz” na przypadki oszustw z nowymi informacjami, które są teraz dostępne. Z tego podejścia, analitycy oszustw mogą “słuchać” nowych sygnałów oszustw, skanować historyczne połączenia, które mogą być powiązane, i ponownie oceniać te połączenia. Zapewnia to firmom ciągłą i kompleksową perspektywę oszustw w czasie rzeczywistym.
  • Inteligentna analiza głosu: Tradycyjne systemy biometryczne głosowe są podatne na ataki Deepfake. Aby wzmocnić ich obronę, potrzebne są nowe technologie, takie jak Voice Mismatch i Negative Voice Matching. Te technologie zapewniają dodatkową warstwę obrony, rozpoznając i różnicując wiele głosów, powtarzających się rozmówców i identyfikując, gdzie inny brzmiący głos może stanowić zagrożenie.
  • Wczesne wykrywanie oszustw: Technologie wykrywania oszustw, które zapewniają szybki i niezawodny sygnał oszustwa na początku procesu połączenia, są niezwykle cenne. Oprócz wykrywania żywotności, technologie takie jak analiza metadanych operatora, wykrywanie oszustw caller ID i wykrywanie oszustw opartych na dźwięku zapewniają ochronę przed atakami oszustw na początku rozmowy, gdy obrony są najbardziej podatne.

Dziękujemy za wspaniały wywiad, aby dowiedzieć się więcej, przeczytaj Raport Pindrop o inteligencji głosowej i bezpieczeństwie 2024 lub odwiedź Pindrop.

Antoine jest wizjonerskim liderem i współzałożycielem Unite.AI, który jest zmotywowany niezachwianą pasją do kształtowania i promowania przyszłości sztucznej inteligencji i robotyki. Jako serialowy przedsiębiorca, wierzy, że sztuczna inteligencja będzie tak samo przełomowa dla społeczeństwa, jak elektryczność, i często jest złapany na tym, że zachwala potencjał przełomowych technologii i AGI.

Jako futurysta, jest poświęcony badaniu, jak te innowacje ukształtują nasz świat. Ponadto, jest założycielem Securities.io, platformy skupiającej się na inwestowaniu w najnowocześniejsze technologie, które zmieniają przyszłość i przebudowują całe sektory.