Моделі та платформи ШІ

Віджай Баласубраманіян, співзасновник та CEO компанії Pindrop – Інтерв’ю

mm
Додайте Unite.AI до бажаних джерел у Google

Віджай Баласубраманіян є співзасновником та CEO компанії Pindrop. Він займав різні інженерні та дослідницькі посади в компаніях Google (GOOGL ), Siemens, IBM Research та Intel.

Віджай володіє патентами у сфері безпеки та масштабування VoIP і часто виступає на технічних конференціях щодо загроз телефонного шахрайства, включаючи RSA, Black Hat, FS-ISAC, CCS та ICDCS. Віджай отримав ступінь доктора філософії з комп’ютерних наук у Джорджійському технологічному інституті. Його дисертація була присвячена безпеці телекомунікацій.

Pindrop‘s розв’язання ведуть шлях до майбутнього голосу, встановлюючи стандарт ідентифікації, безпеки та довіри для кожного голосового взаємодії. Розв’язання Pindrop захищають деякі з найбільших банків, страхових компаній та рітейлерів, використовуючи патентовану технологію, яка витягує інтелект з кожного дзвінка та голосу. Розв’язання Pindrop допомагають виявляти шахраїв та автентифікувати справжніх клієнтів, знижуючи шахрайство та операційні витрати, а також покращуючи досвід клієнтів та захищаючи репутацію бренду. Pindrop, приватна компанія з головним офісом у Атланті, Джорджія, була заснована у 2011 році докторами Віджаєм Баласубраманієном, Полом Джаджем та Мустаке Ахамадом та фінансується компаніями Andreessen Horowitz, Citi Ventures, Felicis Ventures, CapitalG, GV, IVP та Vitruvian Partners. Для отримання більшої інформації, будь ласка, відвідайте pindrop.com.

Які ключові висновки з Звіту Pindrop про голосову інтелектуальність та безпеку 2024 року щодо поточного стану голосового шахрайства та безпеки?

Звіт надає глибокий аналіз пресING безпеки та майбутніх тенденцій, особливо у контакт-центрах, які обслуговують фінансові та нефінансові установи. Ключові висновки у звіті включають:

  • Значне збільшення шахрайства у контакт-центрах: Шахрайство у контакт-центрах зросло на 60% за останні два роки, досягнувши найвищого рівня з 2019 року. До кінця цього року кожен 730 дзвінок до контакт-центру очікується бути шахрайським.
  • Збільшення складності атак шахраїв, які використовують Deepfake: Атаки Deepfake, включаючи складні синтетичні голосові клони, зростають, становлячи оцінені 5 мільярдів доларів ризику шахрайства для контакт-центрів США. Ця технологія використовується для посилення тактик шахрайства, таких як автоматизоване та високомасштабне рекогносцирування рахунків, голосова імперсонація, націлена смс-інг та соціальна інженерія.
  • Традиційні методи виявлення шахрайства та автентифікації не працюють: Компанії все ще покладаються на ручну автентифікацію споживачів, яка є тривалою, дорогою та неефективною у зупиненні шахрайства. 350 мільйонів жертв порушень даних. 12 мільярдів доларів витрачаються щорічно на автентифікацію та 10 мільярдів доларів втрачено через шахрайство – це свідчить про те, що поточні методи безпеки не працюють
  • Нові підходи та технології потрібні: Виявлення живих голосів є важливим для боротьби з поганим AI та посилення безпеки. Аналіз голосу все ще важливий, але потрібно поєднувати його з виявленням живих голосів та багатофакторною автентифікацією.

За звітом, 67,5% споживачів США стурбовані Deepfake у банківському секторі. Чи можете ви розповісти про типи загроз Deepfake, з якими стикаються фінансові установи?

Шахрайство у банківському секторі через телефонні канали зростає через кілька факторів. Оскільки фінансові установи сильно покладаються на клієнтів для підтвердження підозрілої діяльності, контакт-центри можуть стати основними цілями для шахраїв. Шахраї використовують тактику соціальної інженерії, щоб обманути представників служби клієнтів, переконуючи їх зняти обмеження або допомогти відновити онлайн-банківські дані. За даними одного клієнта Pindrop, 36% визначених шахрайських дзвінків мали на меті зняти утримання, встановлені засобами боротьби з шахрайством. Інший клієнт Pindrop повідомляє, що 19% шахрайських дзвінків мали на меті отримати доступ до онлайн-банківських даних. З ростом генерації AI та Deepfake ці види атак стали більш потужними та масштабними. Тепер один чи два шахраї в гаражі можуть створити будь-яку кількість синтетичних голосів та запустити одночасні атаки на кілька фінансових установ та посилити свої тактики. Це створило підвищений рівень ризику та стурбованість серед споживачів щодо того, чи готова банківська сфера відбити ці складні атаки.

Як вдосконалення генерації AI сприяли зростанню Deepfake, і які конкретні виклики ці технології становлять для систем безпеки?

Хоча Deepfake не нові, вдосконалення генерації AI зробили їх потужним вектором за останні рік, оскільки вони змогли стати більш переконливими у великому масштабі. Вдосконалення генерації AI зробили великі мовні моделі більш придатними для створення переконливої мови та мови. Тепер природно звучні синтетичні (фальшиві) голоси можна створити дуже дешево та у великому масштабі. Ці розробки зробили Deepfake доступними для всіх, включаючи шахраїв. Ці Deepfake виклики для систем безпеки полягають у тому, що вони дозволяють здійснювати високо переконливі фішингові атаки, поширення дезінформації та фінансове шахрайство через реалістичні імперсонації. Вони підважують традиційні методи автентифікації, створюють значні репутаційні ризики та вимагають просунутих технологій виявлення, щоб跟увати їх швидку еволюцію та масштабованість.

Як Pindrop Pulse допоміг ідентифікувати двигун TTS, використаний у атаці на Президента Байдена, і які наслідки це має для майбутнього виявлення Deepfake?

Pindrop Pulse відіграв критичну роль у ідентифікації ElevenLabs, двигуна TTS, використаного у атаці на Президента Байдена. Використовуючи нашу просунуту технологію виявлення Deepfake, ми реалізували чотириступеневий процес аналізу, який включав фільтрацію аудіо, витягування функцій, аналіз сегментів та безперервне оцінювання. Цей процес дозволив нам відфільтрувати несpeech-фрейми, розібрати аудіо до рівня типових телефонних умов та витягнути низькорівневі спектро-часові функції.

Роздівши аудіо на 155 сегментів та призначивши їм оцінки живих голосів, ми визначили, що аудіо було послідовно штучним. Використовуючи “фальшиві відбитки”, ми порівняли аудіо з 122 системами TTS та ідентифікували з 99% ймовірністю, що ElevenLabs або подібна система була використана. Це відкриття було підтверджено з 84% ймовірністю за допомогою класифікатора ElevenLabs SpeechAI. Наш детальний аналіз виявив артефакти Deepfake, особливо у фразах з багатими фрикативами та незвичайними виразами для Президента Байдена.

Цей випадок підкреслює важливість наших масштабних та пояснюваних систем виявлення Deepfake, які підвищують точність, будують довіру та адаптуються до нових технологій. Це також підкреслює необхідність для систем генерації AI включення засобів захисту проти зловживання, забезпечення того, щоб голосове клонування було погоджено з реальними особами. Наш підхід встановлює стандарт для боротьби з синтетичними медіа-загрозами, підкреслюючи постійний моніторинг та дослідження для того, щоб залишатися попереду еволюціонуючих методів Deepfake.

Звіт згадує значні стурбованість щодо Deepfake, які впливають на ЗМІ та політичні установи. Чи можете ви надати приклади таких інцидентів та їх потенційного впливу?

Наше дослідження показало, що споживачі США найбільш стурбовані ризиком Deepfake та голосових клонів у банківському секторі. Але окрім цього, загроза Deepfake нашим ЗМІ та політичним установам становить однаково значний виклик. За межами США використання Deepfake також спостерігалося в Індонезії (Deepfake Сухарто) та Словаччині (голосові Deepfake Міхала Шимечки та Моніки Тодової).

2024 рік є значним роком виборів у США та Індії. З 4 мільярдами людей у 40 країнах, які очікують голосування, поширення технологій штучного інтелекту робить його легшим, ніж будь-коли, обманути людей в інтернеті. Ми очікуємо зростання націлених атак Deepfake на урядові установи, компанії соціальних медіа, інші ЗМІ та загальну публіку, які мають на меті створити недовіру до наших установ та поширити дезінформацію в публічному дискурсі.

Чи можете ви пояснити технології та методи, які використовує Pindrop для виявлення Deepfake та синтетичних голосів у реальному часі?

Pindrop використовує ряд просунутих технологій та методів для виявлення Deepfake та синтетичних голосів у реальному часі, включаючи:

    • Виявлення живих голосів: Pindrop використовує великомасштабне машинне навчання для аналізу несpeech-фреймів (наприклад, тиші, шуму, музики) та витягування низькорівневих спектро-часових функцій, які відрізняють машинно-генерований голос від загального людського голосу
    • Аудіо-фінгерпринт: Це включає створення цифрового підпису для кожного голосу на основі його акустичних властивостей, таких як висота, тон та каданс. Ці підписи потім використовуються для порівняння та зіставлення голосів у різних дзвінках та взаємодіях.
    • Аналіз поведінки: Використовується для аналізу моделей поведінки, які видаються поза звичайним, включаючи аномальне доступ до різних рахунків, швидку діяльність ботів, рекогносцирування рахунків, добування даних та роботизоване дзвоніння.
  • Аналіз голосу: Використовується для аналізу функцій голосу, таких як характеристики голосового тракту, фонетичні варіації та стиль мови. Pindrop може створити голосовий відбиток для кожного індивіда. Будь-яке відхилення від очікуваного відбитка голосу може спровокувати сповіщення.
  • Багаторівневий підхід до безпеки: Це включає поєднання різних методів виявлення для перехресної перевірки результатів та підвищення точності виявлення. Наприклад, результати аудіо-фінгерпринта можуть бути зіставлені з біометричним аналізом для підтвердження підозри.
  • Постійне покращення та адаптація: Pindrop постійно оновлює свої моделі та алгоритми. Це включає включення нових даних, уточнення методів виявлення та залишання попереду нових загроз. Постійне покращення забезпечує, що можливості виявлення Pindrop покращуються з часом та адаптуються до нових видів синтетичних атак на голос.

Що таке Pulse Deepfake Warranty, і як вона підвищує довіру клієнтів до можливостей Pindrop щодо боротьби з загрозами Deepfake?

Pulse Deepfake Warranty – це перший у своєму роді гарантійний продукт, який пропонує компенсацію за синтетичне голосове шахрайство у контакт-центрі.既然 ми стоїмо на порозі значної зміни у ландшафті кібератак, потенційні фінансові втрати очікується зростуть до 10,5 трильйонів доларів до 2025 року, Pulse Deepfake Warranty підвищує довіру клієнтів, пропонуючи кілька ключових переваг:

  • Повышення довіри: Гарантія Pindrop демонструє нашу впевненість у наших продуктах та технологіях, пропонуючи клієнтам надійне рішення безпеки під час обслуговування їхніх клієнтів.
  • Компенсація втрат: Клієнти Pindrop можуть отримати компенсацію за події синтетичного голосового шахрайства, які не були виявлені Пакетом продуктів Pindrop.
  • Постійне покращення: Запити клієнтів, отримані у рамках програми гарантії, допомагають Pindrop залишатися попереду еволюціонуючих тактик синтетичного голосового шахрайства.

Чи є відомі випадки, коли технології Pindrop успішно мінімізували загрози Deepfake? Які були результати?

Інцидент у середній школі Пайксвілла: 16 січня 2024 року у мережі Instagram з’явився запис, який нібито містить голос директора середньої школи Пайксвілла у Балтиморі, штат Меріленд. У цьому аудіо містяться образливі висловлювання щодо чорношкірих учнів та вчителів, що викликало бурю громадської обурення та серйозну стурбованість.

У світлі цих подій Pindrop провів повний розслідування, провівши три незалежні аналізи для розкриття правди. Результати нашого детального розслідування привели до нюансового висновку: хоча аудіо січня було змінено, воно не мало виразних ознак AI-генерованої синтетичної мови. Наша впевненість у цьому висновку підтримується 97% впевненості на основі наших метрик аналізу. Це важливий висновок підкреслює необхідність проведення детальних та об’єктивних аналізів перед публічними заявами щодо характеру потенційно змінених медіа.

У одному з великих банків США Pindrop виявив, що шахрай використовував синтетичний голос для обходу автентифікації у системі IVR. Ми виявили, що шахрай використовував машинно-генерований голос для обходу автентифікації у системі IVR для цілевих рахунків, надавши правильні відповіді на питання безпеки та навіть пройшовши одноразові паролі (OTP). Боти, які успішно автентифікувалися у системі IVR, ідентифікували рахунки, які можна було цілевим чином атакувати, шляхом базових запитів про баланс. Подальші дзвінки на ці рахунки були від справжньої людини для здійснення шахрайства. Pindrop повідомив банку про це шахрайство в реальному часі за допомогою технології Pulse та зміг зупинити шахрая.

У іншій фінансовій установі Pindrop виявив, що деякі шахраї тренували свої власні голосові боти для імітування автоматизованих систем банківських відповідей. У тому, що звучало як дивний перший дзвінок, голосовий бот дзвонив до банківської системи IVR не для проведення рекогносцирування рахунку, а для повторення промптів системи IVR. Було здійснено кілька дзвінків до різних гілок дерева діалогу IVR, і кожні дві секунди бот повторював те, що він чув. Через тиждень були зафіксовані подібні дзвінки, але цього разу голосовий бот повторював фрази точно так само, як і система IVR банку. Ми вважаємо, що шахрай тренував голосовий бот для імітування системи IVR банку як початкової точки атаки смс-інг. За допомогою технології Pindrop Pulse фінансовій установі вдалося зупинити цю атаку до того, як було завдано будь-якої шкоди.

Незалежний аудіо-експеримент Deepfake від NPR: Цифрова безпека – це постійно еволююjící гонка озброєнь між шахраями та постачальниками технологій безпеки. Є кілька постачальників, включаючи Pindrop, які заявили про здатність виявляти аудіо-Deepfake послідовно – NPR перевірив ці заяви, щоб оцінити, чи здатні поточні технологічні рішення виявляти AI-генероване аудіо-Deepfake послідовно.

Pindrop Pulse точно виявив 81 із 84 аудіозразків правильно, що відповідає точності 96,4%. Крім того, Pindrop Pulse виявив 100% усіх зразків Deepfake. Хоча інші постачальники також були оцінені в дослідженні, Pindrop виділився як лідер, продемонструвавши, що його технологія може надійно та точно виявляти як Deepfake, так і справжнє аудіо.

Які майбутні тенденції у сфері голосового шахрайства та безпеки ви бачите, особливо з урахуванням швидкого розвитку технологій AI? Як Pindrop готується до боротьби з цими загрозами?

Ми очікуємо, що шахрайство у контакт-центрах продовжить зростання у 2024 році. На основі аналізу рівня шахрайства за останні місяці ми консервативно оцінюємо рівень шахрайства на рівні одного шахрайського дзвінка на кожні 730 дзвінків, що представляє зростання на 4-5% порівняно з поточними рівнями.

Більшість зростання шахрайства очікується у банківському секторі, оскільки страхові, брокерські та інші фінансові сегменти, як очікується, залишаться на поточному рівні. Ми оцінюємо, що ці рівні шахрайства представляють ризик шахрайства у розмірі 7 мільярдів доларів для фінансових установ у США, який потрібно захистити. Однак ми очікуємо значної зміни, особливо з того, що шахраї будуть використовувати системи IVR як полігон для тестування. Недавно ми спостерігали зростання кількості шахраїв, які вручну вводять особисту інформацію (PII) для підтвердження даних про рахунки.

Щоб допомогти боротися з цим, ми продовжимо вдосконалювати поточні розв’язання Pindrop та запускати нові інноваційні інструменти, такі як Pindrop Pulse, які захищають наших клієнтів.

Поза поточними технологіями, які нові інструменти та техніки розробляються для підвищення запобігання шахрайству з голосом та автентифікації?

Технології та техніки запобігання шахрайству з голосом та автентифікації постійно еволюціонують, щоб跟ати за вдосконаленнями технологій та складністю шахрайських дій. Деякі нові інструменти та техніки включають:

  • Постійне виявлення шахрайства та розслідування: Надає історичний “огляд” шахрайських випадків з новою інформацією, яка зараз доступна. З цим підходом аналітики шахрайства можуть “слухати” нові сигнали шахрайства, сканувати історичні дзвінки, які можуть бути пов’язані, та переоцінювати ці дзвінки. Це надає компаніям постійний та комплексний погляд на шахрайство в реальному часі.
  • Інтелектуальний аналіз голосу: Традиційні системи біометрії голосу вразливі до атак Deepfake. Для посилення їхньої оборони потрібні нові технології, такі як Voice Mismatch та Negative Voice Matching. Ці технології забезпечують додатковий рівень захисту, розпізнаючи та відрізняючи кілька голосів, повторювані дзвінки та ідентифікуючи, де інший голос може становити загрозу.
  • Раннє виявлення шахрайства: Технології виявлення шахрайства, які забезпечують швидкий та надійний сигнал шахрайства на початку процесу дзвінка, є надзвичайно цінними. Окрім виявлення живих голосів, технології, такі як аналіз метаданих оператора, виявлення підміни ідентифікатора дзвінка та аудіо-основане виявлення підміни, забезпечують захист проти шахрайських атак на початку розмови, коли оборона є найбільш уразливою.

Дякуємо за велике інтерв’ю. Щоб дізнатися більше, прочитайте Звіт Pindrop про голосову інтелектуальність та безпеку 2024 року або відвідайте Pindrop.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.