KI-Modelle und Plattformen

Vijay Balasubramaniyan, Mitbegründer & CEO von Pindrop – Interviewreihe

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Vijay Balasubramaniyan ist Mitbegründer und CEO von Pindrop. Er hatte verschiedene Ingenieur- und Forschungspositionen bei Google (GOOGL ), Siemens, IBM Research und Intel (INTC ) inne.

Vijay hält Patente im Bereich VoIP-Sicherheit und Skalierbarkeit und spricht häufig auf technischen Konferenzen über Telefonbetrugsgefahren, einschließlich RSA, Black Hat, FS-ISAC, CCS und ICDCS. Vijay erhielt einen PhD in Informatik von der Georgia Institute of Technology. Seine Dissertation behandelte das Thema Telekommunikationssicherheit.

Pindrop‘s Lösungen sind Vorreiter auf dem Weg in die Zukunft der Sprache und etablieren den Standard für Identität, Sicherheit und Vertrauen für jede Sprachinteraktion. Pindrops Lösungen schützen einige der größten Banken, Versicherungen und Einzelhändler der Welt mit patentierter Technologie, die Intelligenz aus jedem Anruf und jeder Stimme extrahiert. Pindrop-Lösungen helfen dabei, Betrüger zu erkennen und echte Kunden zu authentifizieren, wodurch der Betrug und die operativen Kosten reduziert und die Kundenerfahrung verbessert werden. Pindrop, ein privat gehaltenes Unternehmen mit Sitz in Atlanta, GA, wurde 2011 von Dr. Vijay Balasubramaniyan, Dr. Paul Judge und Dr. Mustaque Ahamad gegründet und wird von Andreessen Horowitz, Citi Ventures, Felicis Ventures, CapitalG, GV, IVP und Vitruvian Partners unterstützt. Für weitere Informationen besuchen Sie bitte pindrop.com.

Was sind die wichtigsten Erkenntnisse aus Pindrops 2024 Voice Intelligence and Security Report bezüglich des aktuellen Zustands von sprachbasiertem Betrug und Sicherheit?

Der Bericht bietet eine tiefere Analyse der dringenden Sicherheitsprobleme und zukünftigen Trends, insbesondere im Bereich der Kontaktcenter für Finanz- und Nicht-Finanzinstitute. Zu den wichtigsten Erkenntnissen des Berichts gehören:

  • Erheblicher Anstieg von Kontaktcenter-Betrug: Der Kontaktcenter-Betrug ist in den letzten zwei Jahren um 60% gestiegen und hat damit das höchste Niveau seit 2019 erreicht. Bis zum Ende des Jahres wird erwartet, dass jeder 730. Anruf bei einem Kontaktcenter betrügerisch ist.
  • Zunehmende Sophistikation von Angreifern mit Deepfake: Deepfake-Angriffe, einschließlich hochentwickelter synthetischer Sprachklone, nehmen zu und bergen ein geschätztes Betrugsrisiko von 5 Milliarden US-Dollar für US-Kontaktcenter. Diese Technologie wird genutzt, um Betrugstaktiken wie automatisierte und groß angelegte Kontenrecherche, Sprachimitation, gezielte Smishing und soziale Ingenieurskunst zu verstärken.
  • Traditionelle Methoden der Betrugsbekämpfung und Authentifizierung funktionieren nicht: Unternehmen verlassen sich immer noch auf manuelle Authentifizierung von Verbrauchern, die zeitaufwändig, teuer und unwirksam bei der Bekämpfung von Betrug sind. 350 Millionen Opfer von Datenlecks, 12 Milliarden US-Dollar, die jährlich für Authentifizierung ausgegeben werden, und 10 Milliarden US-Dollar, die durch Betrug verloren gehen, sind Beweise dafür, dass die aktuellen Sicherheitsmethoden nicht funktionieren.
  • Neue Ansätze und Technologien sind erforderlich: Liveness-Erkennung ist entscheidend, um schlechten KI-Angriffe zu bekämpfen und die Sicherheit zu verbessern. Sprachanalyse ist immer noch wichtig, muss aber mit Liveness-Erkennung und multifaktorieller Authentifizierung kombiniert werden.

Laut dem Bericht sind 67,5% der US-Verbraucher besorgt über Deepfakes im Bankensektor. Können Sie die Arten von Deepfake-Bedrohungen erläutern, mit denen Finanzinstitute konfrontiert sind?

Bankenbetrug über Telefonkanäle steigt aufgrund mehrerer Faktoren. Da Finanzinstitute stark auf Kunden angewiesen sind, um verdächtige Aktivitäten zu bestätigen, können Callcenter zu primären Zielen für Betrüger werden. Betrüger nutzen soziale Ingenieurskunst, um Kundenberater zu täuschen und sie dazu zu bringen, Einschränkungen zu entfernen oder Online-Banking-Zugangsdaten zurückzusetzen. Laut einem Pindrop-Bankkunden zielen 36% der identifizierten Betrugsanrufe hauptsächlich darauf ab, die von den Betrugskontrollen auferlegten Halte zu entfernen. Ein weiterer Pindrop-Bankkunde berichtet, dass 19% der Betrugsanrufe darauf abzielen, Zugang zu Online-Banking zu erhalten. Mit dem Aufkommen von generativer KI und Deepfakes sind diese Arten von Angriffen potenter und skalierbarer geworden. Jetzt können ein oder zwei Betrüger in einer Garage beliebig viele synthetische Stimmen erstellen und gleichzeitige Angriffe auf mehrere Finanzinstitute starten und ihre Taktiken verstärken. Dies hat ein erhöhtes Risiko und eine erhöhte Besorgnis unter den Verbrauchern darüber geschaffen, ob der Bankensektor bereit ist, diese hochentwickelten Angriffe abzuwehren.

Wie haben Fortschritte in der generativen KI zum Anstieg von Deepfakes beigetragen, und welche spezifischen Herausforderungen stellen diese für Sicherheitssysteme dar?

Deepfakes sind nicht neu, aber Fortschritte in der generativen KI haben sie in den letzten Jahren zu einem potenziellen Vektor gemacht, da sie glaubwürdiger und in größeren Mengen erstellt werden können. Fortschritte in der generativen KI haben große Sprachmodelle befähigt, glaubwürdige Sprache und Sprachmuster zu erstellen. Jetzt kann natürliche, künstliche Sprache sehr billig und in großen Mengen erstellt werden. Diese Entwicklungen haben Deepfakes für jeden zugänglich gemacht, einschließlich Betrügern. Diese Deepfakes stellen Sicherheitssysteme vor Herausforderungen, indem sie überzeugende Phishing-Angriffe, Desinformation und finanziellen Betrug durch realistische Imitationen ermöglichen. Sie untergraben traditionelle Authentifizierungsmethoden, bergen erhebliche Reputationsrisiken und erfordern fortschrittliche Erkennungstechnologien, um mit ihrer schnellen Evolution und Skalierbarkeit Schritt zu halten.

Wie hat Pindrop Pulse dazu beigetragen, den TTS-Engine zu identifizieren, der im Präsidenten-Biden-Robocall-Angriff verwendet wurde, und welche Auswirkungen hat dies auf die zukünftige Erkennung von Deepfakes?

Pindrop Pulse spielte eine entscheidende Rolle bei der Identifizierung von ElevenLabs, dem TTS-Engine, der im Präsidenten-Biden-Robocall-Angriff verwendet wurde. Mit unserer fortschrittlichen Deepfake-Erkennungstechnologie implementierten wir einen vierstufigen Analyseprozess, der Audio-Filterung und Reinigung, Feature-Extraktion, Segmentanalyse und kontinuierliche Bewertung umfasste. Dieser Prozess ermöglichte es uns, nicht-sprachliche Frames auszufiltern, das Audio auf typische Telefonbedingungen herunterzusamples und low-level-spectro-temporale Features zu extrahieren, die zwischen maschinengenerierter und generischer menschlicher Sprache unterscheiden.

Indem wir das Audio in 155 Segmente unterteilten und Liveness-Scores zuwiesen, konnten wir feststellen, dass das Audio konsistent künstlich war. Mit “Fakeprints” verglichen wir das Audio mit 122 TTS-Systemen und identifizierten mit 99% Wahrscheinlichkeit, dass ElevenLabs oder ein ähnliches System verwendet wurde. Diese Erkenntnis wurde mit 84% Wahrscheinlichkeit durch den ElevenLabs-SpeechAI-Klassifizierer bestätigt. Unsere detaillierte Analyse enthüllte Deepfake-Artefakte, insbesondere in Phrasen mit reichen Frikativen und ungewöhnlichen Ausdrücken für Präsident Biden.

Der Bericht erwähnt erhebliche Bedenken hinsichtlich Deepfakes, die Medien und politische Institutionen betreffen. Können Sie Beispiele für solche Vorfälle und ihre möglichen Auswirkungen nennen?

Unsere Forschung hat ergeben, dass US-Verbraucher am meisten besorgt über das Risiko von Deepfakes und Sprachklonen im Banken- und Finanzsektor sind. Aber darüber hinaus stellt die Bedrohung von Deepfakes für unsere Medien und politischen Institutionen eine ebenso große Herausforderung dar. Außerhalb der USA wurde die Verwendung von Deepfakes in Indonesien (Suharto-Deepfake) und in der Slowakei (Michal Šimečka und Monika Tódová-Voice-Deepfake) beobachtet.

2024 ist ein wichtiges Wahljahr in den USA und Indien. Mit 4 Milliarden Menschen in 40 Ländern, die erwartet werden, zu wählen, macht die Verbreitung von künstlicher Intelligenz-Technologie es leichter, Menschen im Internet zu täuschen. Wir erwarten einen Anstieg gezielter Deepfake-Angriffe auf Regierungsbehörden, soziale Medien, andere Nachrichtenmedien und die allgemeine Bevölkerung, die darauf abzielen, Misstrauen in unsere Institutionen zu schaffen und Desinformation in der öffentlichen Diskussion zu verbreiten.

Können Sie die Technologien und Methoden erklären, die Pindrop verwendet, um Deepfakes und synthetische Stimmen in Echtzeit zu erkennen?

Pindrop verwendet eine Reihe von fortschrittlichen Technologien und Methoden, um Deepfakes und synthetische Stimmen in Echtzeit zu erkennen, einschließlich:

    • Liveness-Erkennung: Pindrop verwendet groß angelegte maschinelle Lernverfahren, um nicht-sprachliche Frames (z.B. Stille, Rauschen, Musik) zu analysieren und low-level-spectro-temporale Features zu extrahieren, die zwischen maschinengenerierter und generischer menschlicher Sprache unterscheiden.
    • Audio-Fingerprinting – Dies beinhaltet die Erstellung einer digitalen Signatur für jede Stimme auf der Grundlage ihrer akustischen Eigenschaften, wie Tonhöhe, Klang und Rhythmus. Diese Signaturen werden dann verwendet, um Stimmen über verschiedene Anrufe und Interaktionen hinweg zu vergleichen und abzugleichen.
    • Verhaltensanalyse – Diese wird verwendet, um Muster von Verhalten zu analysieren, die außerhalb des Üblichen liegen, einschließlich anomalem Zugriff auf verschiedene Konten, schneller Bot-Aktivität, Kontenrecherche, Datenmining und roboterbasierter Anrufe.
  • Stimmanalyse – Durch die Analyse von Stimmmerkmalen wie Stimmtrakt-Charakteristika, phonetischen Variationen und Sprechstil kann Pindrop eine Stimmzeichnung für jeden Einzelnen erstellen. Jede Abweichung von der erwarteten Stimmzeichnung kann einen Alarm auslösen.
  • Mehrschichtiger Sicherheitsansatz – Dies beinhaltet die Kombination verschiedener Erkennungsmethoden, um Ergebnisse zu überprüfen und die Erkennungsgenauigkeit zu erhöhen. Zum Beispiel können Audio-Fingerprinting-Ergebnisse mit biometrischer Analyse abgeglichen werden, um einen Verdacht zu bestätigen.
  • Ständige Verbesserung und Anpassung – Pindrop aktualisiert kontinuierlich seine Modelle und Algorithmen. Dies beinhaltet die Integration neuer Daten, die Verfeinerung von Erkennungstechniken und die Anpassung an neue Bedrohungen. Durch ständige Verbesserung können die Erkennungsfähigkeiten von Pindrop über die Zeit hinweg verbessert und an neue Arten von synthetischen Stimmen-Angriffen angepasst werden.

Was ist die Pulse-Deepfake-Garantie, und wie verbessert sie das Vertrauen der Kunden in Pindrops Fähigkeit, Deepfake-Bedrohungen zu bewältigen?

Die Pulse-Deepfake-Garantie ist eine einzigartige Garantie, die eine Erstattung gegen synthetischen Stimmen-Betrug im Callcenter anbietet. Da wir an der Schwelle zu einem seismischen Wandel im Cybersicherheits-Landschaft stehen, potenzielle finanzielle Verluste werden voraussichtlich auf 10,5 Billionen US-Dollar im Jahr 2025 ansteigen, verbessert die Pulse-Deepfake-Garantie das Vertrauen der Kunden, indem sie mehrere wichtige Vorteile bietet:

  • Erhöhtes Vertrauen: Die Pulse-Deepfake-Garantie zeigt Pindrops Vertrauen in seine Produkte und Technologie, indem sie den Kunden eine vertrauenswürdige Sicherheitslösung für die Authentifizierung ihrer Kontoinhaber bietet.
  • Erstattung von Verlusten: Pindrop-Kunden können Erstattungen für synthetischen Stimmen-Betrug erhalten, der nicht vom Pindrop-Produkt-Paket erkannt wurde.
  • Ständige Verbesserung: Pindrop-Kundenanfragen, die im Rahmen des Garantieprogramms eingereicht werden, helfen Pindrop, vorne zu bleiben und sich an neue synthetische Stimmen-Betrugstaktiken anzupassen.

Gibt es bemerkenswerte Fallstudien, in denen Pindrops Technologien erfolgreich Deepfake-Bedrohungen abgewehrt haben? Was waren die Ergebnisse?

Der Pikesville-High-School-Vorfall: Am 16. Januar 2024 tauchte auf Instagram eine Aufnahme auf, die angeblich den Schulleiter der Pikesville High School in Baltimore, Maryland, zeigte. Die Aufnahme enthielt herabwürdigende Bemerkungen über schwarze Schüler und Lehrer, was zu einem Sturm der Empörung und ernsthaften Bedenken führte.

Im Licht dieser Entwicklungen führte Pindrop eine umfassende Untersuchung durch und führte drei unabhängige Analysen durch, um die Wahrheit aufzudecken. Die Ergebnisse unserer gründlichen Untersuchung führten zu einer nuancierten Schlussfolgerung: Obwohl die Januar-Aufnahme verändert worden war, fehlten ihr die definitiven Merkmale von KI-generierter synthetischer Sprache. Unsere Zuversicht in diese Feststellung wird durch eine 97%ige Sicherheit auf der Grundlage unserer Analysemetriken unterstützt. Diese wichtige Erkenntnis unterstreicht die Bedeutung, detaillierte und objektive Analysen durchzuführen, bevor öffentliche Erklärungen über die Natur möglicherweise manipulierter Medien abgegeben werden.

In einer großen US-Bank entdeckte Pindrop, dass ein Betrüger synthetische Stimme nutzte, um die Authentifizierung im IVR zu umgehen. Wir fanden heraus, dass der Betrüger maschinengenerierte Stimme nutzte, um die IVR-Authentifizierung für bestimmte Konten zu umgehen, und dabei die richtigen Antworten auf die Sicherheitsfragen gab und in einem Fall sogar ein One-Time-Password (OTP) übermittelte. Bots, die sich erfolgreich im IVR authentifizierten, identifizierten Konten, die für das Ziel ausreichend waren, und führten anschließend Anrufe bei diesen Konten durch, um den Betrug zu begehen. Pindrop alarmierte die Bank in Echtzeit mithilfe der Pulse-Technologie und konnte den Betrüger stoppen.

In einer anderen Finanzinstitution fand Pindrop heraus, dass einige Betrüger ihre eigenen Voice-Bots trainierten, um die automatisierten Antwortsysteme der Bank nachzuahmen. In einem, was wie ein merkwürdiger erster Anruf klang, rief ein Voice-Bot das IVR-System der Bank an, nicht, um Kontenrecherche durchzuführen, sondern um die IVR-Prompts zu wiederholen. Mehrere Anrufe kamen in verschiedene Zweige des IVR-Gesprächsbaums und wiederholten jede zwei Sekunden, was sie hörten. Eine Woche später wurden weitere Anrufe beobachtet, die das Gleiche taten, aber diesmal wiederholten die Voice-Bots die Phrasen in genau der gleichen Stimme und mit den gleichen Manierismen wie das IVR-System der Bank. Wir glauben, dass ein Betrüger einen Voice-Bot trainierte, um das IVR-System der Bank nachzuahmen, um einen Smishing-Angriff zu starten. Mit Hilfe von Pindrop Pulse konnte die Finanzinstitution diesen Angriff abwehren, bevor er Schaden anrichten konnte.

Unabhängiges NPR-Audio-Deepfake-Experiment: Die digitale Sicherheit ist ein ständiger Wettlauf zwischen Betrügern und Sicherheitstechnologie-Anbietern. Es gibt mehrere Anbieter, darunter Pindrop, die behaupten, Audio-Deepfakes konsistent zu erkennen – NPR hat diese Behauptungen getestet, um zu bewerten, ob aktuelle Technologielösungen in der Lage sind, KI-generierte Audio-Deepfakes konsistent zu erkennen.

Pindrop Pulse erkannte 81 von 84 Audio-Proben korrekt, was einer Genauigkeitsrate von 96,4% entspricht. Darüber hinaus erkannte Pindrop Pulse 100% aller Deepfake-Proben als solche. Während andere Anbieter im Rahmen der Studie ebenfalls bewertet wurden, stellte sich Pindrop als führender Anbieter heraus, indem es demonstrierte, dass seine Technologie in der Lage ist, sowohl Deepfakes als auch echte Audio-Proben zuverlässig und genau zu erkennen.

Welche zukünftigen Trends im Bereich sprachbasierter Betrug und Sicherheit sehen Sie voraus, insbesondere im Hinblick auf die schnelle Entwicklung von KI-Technologien? Wie bereitet sich Pindrop darauf vor, diese Herausforderungen zu meistern?

Wir erwarten, dass der Kontaktcenter-Betrug im Jahr 2024 weiter ansteigen wird. Basierend auf der Analyse der Betrugsraten über verschiedene Branchen hinweg schätzen wir, dass die Betrugsrate voraussichtlich 1 von 730 Anrufen erreichen wird, was einem Anstieg von 4-5% gegenüber dem aktuellen Niveau entspricht.

Der größte Teil des erhöhten Betrugs wird voraussichtlich den Bankensektor betreffen, während die Versicherungs-, Brokerage- und anderen Finanzsegmente voraussichtlich auf dem aktuellen Niveau bleiben werden. Wir schätzen, dass diese Betrugsraten ein Betrugsrisiko von 7 Milliarden US-Dollar für Finanzinstitute in den USA darstellen, das gesichert werden muss. Wir erwarten jedoch eine erhebliche Veränderung, insbesondere da Betrüger IVR-Systeme als Testgelände nutzen. Kürzlich haben wir eine Zunahme von Betrügern beobachtet, die persönliche Identifikationsinformationen (PII) manuell eingeben, um Kontodetails zu überprüfen.

Um dies zu bekämpfen, werden wir weiterhin Pindrops aktuelle Lösungen verbessern und neue, innovative Tools wie Pindrop Pulse einsetzen, um unsere Kunden zu schützen.

Was sind die neuen Werkzeuge und Techniken, die entwickelt werden, um die Verhinderung von Sprachbetrug und Authentifizierung zu verbessern?

Die Techniken zur Verhinderung von Sprachbetrug und Authentifizierung entwickeln sich ständig weiter, um mit den Fortschritten in der Technologie und der Sophistikation von Betrugsaktivitäten Schritt zu halten. Einige neue Werkzeuge und Techniken umfassen:

  • Kontinuierliche Betrugsbekämpfung und Untersuchung: Bietet eine historische “Rückblick”-Perspektive auf Betrugsfälle mit neuen Informationen, die jetzt verfügbar sind. Mit diesem Ansatz können Betrugsanalysten nach neuen Betrugs-Signalen “lauschen”, nach historischen Anrufen suchen, die möglicherweise damit in Verbindung stehen, und diese Anrufe neu bewerten. Dies bietet Unternehmen eine kontinuierliche und umfassende Perspektive auf Betrug in Echtzeit.
  • Intelligente Sprachanalyse: Traditionelle Sprachbiometrie-Systeme sind anfällig für Deepfake-Angriffe. Um ihre Verteidigung zu verbessern, sind neue Technologien wie Voice Mismatch und Negative Voice Matching erforderlich. Diese Technologien bieten eine zusätzliche Verteidigungsschicht, indem sie mehrere Stimmen, wiederkehrende Anrufer und potenzielle Bedrohungen erkennen.
  • Frühzeitige Betrugsbekämpfung: Betrugsbekämpfungstechnologien, die ein schnelles und zuverlässiges Betrugs-Signal am Anfang des Anrufs liefern, sind unschätzbar wertvoll. Neben Liveness-Erkennung bieten Technologien wie Carrier-Metadaten-Analyse, Anrufer-ID-Spoofing-Erkennung und audio-basierte Spoofing-Erkennung Schutz gegen Betrugsangriffe am Anfang eines Gesprächs, wenn die Verteidigung am verwundbarsten ist.

Vielen Dank für das großartige Interview. Um mehr zu erfahren, lesen Sie den Pindrop-Bericht 2024 zur Voice Intelligence und Sicherheit oder besuchen Sie Pindrop.

Antoine ist ein visionärer Leiter und Gründungspartner von Unite.AI, getrieben von einer unerschütterlichen Leidenschaft für die Gestaltung und Förderung der Zukunft von KI und Robotik. Als Serienunternehmer glaubt er, dass KI für die Gesellschaft so disruptiv sein wird wie Elektrizität, und er wird oft dabei erwischt, wie er über das Potenzial disruptiver Technologien und AGI schwärmt.

Als Futurist ist er darauf bedacht, zu erforschen, wie diese Innovationen unsere Welt prägen werden. Darüber hinaus ist er der Gründer von Securities.io, einer Plattform, die sich auf Investitionen in bahnbrechende Technologien konzentriert, die die Zukunft neu definieren und ganze Branchen umgestalten.