Mô hình và nền tảng AI
Vijay Balasubramaniyan, Đồng sáng lập & CEO của Pindrop – Loạt phỏng vấn

Vijay Balasubramaniyan là Đồng sáng lập & CEO của Pindrop. Ông đã từng giữ các vị trí kỹ sư và nghiên cứu tại Google (GOOGL ), Siemens, IBM Research và Intel.
Pindrop‘s các giải pháp đang dẫn đầu trong việc định hình tương lai của giọng nói bằng cách thiết lập tiêu chuẩn cho danh tính, bảo mật và niềm tin cho mọi tương tác giọng nói. Các giải pháp của Pindrop bảo vệ một số ngân hàng, công ty bảo hiểm và nhà bán lẻ lớn nhất thế giới bằng cách sử dụng công nghệ được cấp bằng sáng chế để trích xuất thông tin từ mọi cuộc gọi và giọng nói. Các giải pháp của Pindrop giúp phát hiện kẻ lừa đảo và xác thực khách hàng hợp pháp, giảm lừa đảo và chi phí hoạt động trong khi cải thiện trải nghiệm khách hàng và bảo vệ uy tín thương hiệu. Pindrop, một công ty tư nhân có trụ sở tại Atlanta, GA, được thành lập vào năm 2011 bởi Dr. Vijay Balasubramaniyan, Dr. Paul Judge và Dr. Mustaque Ahamad và được hỗ trợ bởi Andreessen Horowitz, Citi Ventures, Felicis Ventures, CapitalG, GV, IVP và Vitruvian Partners. Để biết thêm thông tin, vui lòng truy cập pindrop.com.
Những điểm chính từ Báo cáo Trí tuệ và Bảo mật Giọng nói 2024 của Pindrop về tình trạng hiện tại của lừa đảo và bảo mật dựa trên giọng nói là gì?
Báo cáo cung cấp một phân tích sâu về các vấn đề bảo mật đang diễn ra và các xu hướng tương lai, đặc biệt là trong các trung tâm liên hệ phục vụ các tổ chức tài chính và phi tài chính. Các phát hiện chính trong báo cáo bao gồm:
- Tăng đáng kể trong Lừa đảo Trung tâm Liên hệ: Lừa đảo trung tâm liên hệ đã tăng vọt 60% trong hai năm qua, đạt mức cao nhất kể từ năm 2019. Đến cuối năm nay, cứ 730 cuộc gọi đến trung tâm liên hệ thì có 1 cuộc gọi là lừa đảo.
- Tăng trưởng về Sự tinh vi của Kẻ tấn công Sử dụng Deepfake: Các cuộc tấn công Deepfake, bao gồm cả các bản sao giọng nói tổng hợp tinh vi, đang gia tăng, tạo ra một rủi ro lừa đảo ước tính 5 tỷ USD cho các trung tâm liên hệ tại Mỹ. Công nghệ này đang được tận dụng để tăng cường các chiến thuật lừa đảo như tự động hóa và thu thập thông tin quy mô lớn, giả mạo giọng nói, nhắm mục tiêu vào các cuộc gọi lừa đảo và kỹ thuật xã hội.
- Các phương pháp truyền thống để phát hiện và xác thực lừa đảo không hiệu quả: Các công ty vẫn phụ thuộc vào việc xác thực thủ công của người tiêu dùng, điều này tốn thời gian, tốn kém và không hiệu quả trong việc ngăn chặn lừa đảo. 350 triệu nạn nhân của vi phạm dữ liệu. 12 tỷ USD được chi hàng năm cho xác thực và 10 tỷ USD bị mất do lừa đảo là bằng chứng cho thấy các phương pháp bảo mật hiện tại không hiệu quả.
- Cần có các phương pháp và công nghệ mới: Phát hiện sự sống là điều cần thiết để chống lại AI xấu và tăng cường bảo mật. Phân tích giọng nói vẫn quan trọng nhưng cần được kết hợp với phát hiện sự sống và xác thực đa yếu tố.
Theo báo cáo, 67,5% người tiêu dùng Mỹ lo ngại về Deepfake trong lĩnh vực ngân hàng. Bạn có thể giải thích về các loại mối đe dọa Deepfake mà các tổ chức tài chính đang đối mặt?
Lừa đảo ngân hàng qua các kênh điện thoại đang gia tăng do một số yếu tố. Vì các tổ chức tài chính phụ thuộc nặng vào khách hàng để xác nhận hoạt động đáng ngờ, các trung tâm liên hệ có thể trở thành mục tiêu chính cho kẻ lừa đảo. Kẻ lừa đảo sử dụng các chiến thuật kỹ thuật xã hội để lừa dối đại diện dịch vụ khách hàng, thuyết phục họ loại bỏ các hạn chế hoặc giúp đặt lại thông tin đăng nhập trực tuyến. Theo một khách hàng ngân hàng của Pindrop, 36% cuộc gọi lừa đảo được xác định chủ yếu nhằm loại bỏ các lệnh giữ do các biện pháp chống lừa đảo. Một khách hàng ngân hàng khác của Pindrop báo cáo rằng 19% cuộc gọi lừa đảo nhằm mục đích truy cập vào ngân hàng trực tuyến. Với sự gia tăng của trí tuệ nhân tạo và Deepfake, các cuộc tấn công này đã trở nên mạnh mẽ và có thể mở rộng quy mô hơn. Bây giờ một hoặc hai kẻ lừa đảo trong một gara có thể tạo ra bất kỳ số lượng giọng nói tổng hợp nào và đồng thời tấn công nhiều tổ chức tài chính và tăng cường các chiến thuật của chúng. Điều này đã tạo ra một mức độ rủi ro và lo ngại cao hơn trong số người tiêu dùng về việc liệu lĩnh vực ngân hàng có sẵn sàng để ngăn chặn các cuộc tấn công tinh vi này hay không.
Làm thế nào các tiến bộ trong trí tuệ nhân tạo đã góp phần vào sự gia tăng của Deepfake và những thách thức cụ thể nào mà chúng đặt ra cho các hệ thống bảo mật?
Mặc dù Deepfake không phải là mới, nhưng các tiến bộ trong trí tuệ nhân tạo đã làm cho chúng trở thành một vector mạnh mẽ trong năm qua vì chúng đã có thể trở nên thuyết phục hơn ở quy mô lớn hơn. Các tiến bộ trong GenAI đã làm cho các mô hình ngôn ngữ lớn trở nên thành thạo hơn trong việc tạo ra giọng nói và ngôn ngữ thuyết phục. Giờ đây, giọng nói tổng hợp tự nhiên có thể được tạo ra rất rẻ và ở quy mô lớn. Những phát triển này đã làm cho Deepfake trở nên dễ tiếp cận với mọi người, bao gồm cả kẻ lừa đảo. Những Deepfake này thách thức các hệ thống bảo mật bằng cách cho phép các cuộc tấn công lừa đảo thuyết phục, lan truyền thông tin sai lệch và tạo điều kiện cho lừa đảo tài chính thông qua việc giả mạo thực tế. Chúng làm suy yếu các phương pháp xác thực truyền thống, tạo ra rủi ro danh tiếng đáng kể và đòi hỏi các công nghệ phát hiện tiên tiến để theo kịp sự tiến hóa nhanh chóng và khả năng mở rộng của chúng.
Làm thế nào Pindrop Pulse đã góp phần vào việc xác định TTS engine được sử dụng trong cuộc tấn công robocall của Tổng thống Biden và những ý nghĩa nào mà điều này có cho việc phát hiện Deepfake trong tương lai?
Pindrop Pulse đã đóng một vai trò quan trọng trong việc xác định ElevenLabs, TTS engine được sử dụng trong cuộc tấn công robocall của Tổng thống Biden. Sử dụng công nghệ phát hiện Deepfake tiên tiến của chúng tôi, chúng tôi đã thực hiện một quá trình phân tích bốn giai đoạn liên quan đến việc lọc và làm sạch âm thanh, trích xuất các tính năng phổ thời gian thấp, phân tích phân khúc và đánh giá liên tục. Quá trình này cho phép chúng tôi lọc ra các khung không phải giọng nói, lấy mẫu âm thanh để tái tạo các điều kiện điện thoại điển hình và trích xuất các tính năng phổ thời gian thấp.
Bằng cách chia âm thanh thành 155 phân khúc và gán các điểm số sống, chúng tôi đã xác định rằng âm thanh là nhân tạo một cách nhất quán. Sử dụng “dấu vân tay giả”, chúng tôi đã so sánh âm thanh với 122 hệ thống TTS và xác định với khả năng 99% rằng ElevenLabs hoặc một hệ thống tương tự đã được sử dụng. Phát hiện này đã được xác nhận với khả năng 84% thông qua Bộ phân loại SpeechAI của ElevenLabs. Phân tích chi tiết của chúng tôi đã tiết lộ các dấu hiệu Deepfake, đặc biệt là trong các cụm từ có fricatives phong phú và các biểu thức không phổ biến của Tổng thống Biden.
Báo cáo đề cập đến các mối quan ngại đáng kể về Deepfake ảnh hưởng đến các tổ chức truyền thông và chính trị. Bạn có thể cung cấp các ví dụ về các sự kiện như vậy và tác động tiềm tàng của chúng?
Nghiên cứu của chúng tôi đã tìm thấy rằng người tiêu dùng Mỹ quan tâm nhất về rủi ro của Deepfake và bản sao giọng nói trong lĩnh vực ngân hàng và tài chính. Nhưng ngoài ra, mối đe dọa của Deepfake đối với các tổ chức truyền thông và chính trị đặt ra một thách thức đáng kể không kém. Ngoài Mỹ, việc sử dụng Deepfake cũng đã được quan sát ở Indonesia (Deepfake Suharto) và Slovakia (giọng nói Deepfake của Michal Šimečka và Monika Tódová).
Năm 2024 là một năm bầu cử quan trọng ở Mỹ và Ấn Độ. Với 4 tỷ người trên 40 quốc gia dự kiến sẽ bỏ phiếu, sự phát triển của công nghệ trí tuệ nhân tạo khiến việc lừa dối mọi người trên internet trở nên dễ dàng hơn bao giờ hết. Chúng tôi dự kiến sẽ có sự gia tăng trong các cuộc tấn công Deepfake có mục tiêu vào các tổ chức chính phủ, công ty truyền thông xã hội, các phương tiện truyền thông khác và dân chúng, nhằm tạo ra sự mất lòng tin vào các tổ chức của chúng tôi và gieo rắc thông tin sai lệch trong diễn ngôn công cộng.
Bạn có thể giải thích các công nghệ và phương pháp mà Pindrop sử dụng để phát hiện Deepfake và giọng nói tổng hợp trong thời gian thực?
Pindrop sử dụng một loạt các công nghệ và phương pháp tiên tiến để phát hiện Deepfake và giọng nói tổng hợp trong thời gian thực, bao gồm:
-
- Phát hiện sự sống: Pindrop sử dụng học máy quy mô lớn để phân tích các khung không phải giọng nói và trích xuất các tính năng phổ thời gian thấp để phân biệt giữa giọng nói do máy tạo ra và giọng nói của con người.
- Dấu vân tay âm thanh: Điều này liên quan đến việc tạo ra một chữ ký số cho mỗi giọng nói dựa trên các thuộc tính âm thanh, chẳng hạn như âm cao, âm sắc và nhịp điệu. Những chữ ký này sau đó được sử dụng để so sánh và khớp giọng nói trên các cuộc gọi và tương tác khác nhau.
- Phân tích hành vi: Được sử dụng để phân tích các mẫu hành vi có vẻ ngoài thường lệ, bao gồm cả việc truy cập tài khoản bất thường, hoạt động bot nhanh, thu thập thông tin và gọi điện tự động.
- Phân tích giọng nói: Bằng cách phân tích các tính năng giọng nói như đặc điểm đường âm, biến thể ngữ âm và phong cách nói, Pindrop có thể tạo ra một bản in giọng nói cho từng cá nhân. Bất kỳ sự sai lệch nào so với bản in giọng nói dự kiến có thể kích hoạt một cảnh báo.
- Cách tiếp cận bảo mật nhiều lớp: Điều này liên quan đến việc kết hợp các phương pháp phát hiện khác nhau để xác minh chéo kết quả và tăng độ chính xác của phát hiện. Ví dụ, kết quả dấu vân tay âm thanh có thể được tham chiếu chéo với phân tích sinh trắc học để xác nhận một nghi ngờ.
- Học hỏi và thích nghi liên tục: Pindrop liên tục cập nhật các mô hình và thuật toán của mình. Điều này liên quan đến việc kết hợp dữ liệu mới, tinh chỉnh các kỹ thuật phát hiện và ở phía trước của các mối đe dọa mới. Học hỏi liên tục đảm bảo rằng khả năng phát hiện của họ được cải thiện theo thời gian và thích nghi với các cuộc tấn công giọng nói tổng hợp mới.
Điều gì là Bảo hành Deepfake Pulse và làm thế nào nó tăng cường sự tự tin của khách hàng vào khả năng của Pindrop trong việc xử lý các mối đe dọa Deepfake?
Bảo hành Deepfake Pulse là một bảo hành đầu tiên trong loại hình này cung cấp bồi thường cho lừa đảo giọng nói tổng hợp trong trung tâm liên hệ. Khi chúng ta đứng trên ngưỡng của một sự thay đổi lớn trong phong cảnh tấn công mạng, tổn thất tài chính tiềm năng dự kiến sẽ tăng vọt lên 10,5 nghìn tỷ USD vào năm 2025, Bảo hành Deepfake Pulse tăng cường sự tự tin của khách hàng bằng cách cung cấp một số lợi thế chính:
- Tăng cường niềm tin: Bảo hành Deepfake Pulse thể hiện sự tự tin của Pindrop vào sản phẩm và công nghệ của mình, cung cấp cho khách hàng một giải pháp bảo mật đáng tin cậy khi phục vụ khách hàng của họ.
- Bồi thường tổn thất: Khách hàng của Pindrop có thể nhận được bồi thường cho các sự kiện lừa đảo giọng nói tổng hợp không được phát hiện bởi Bộ sản phẩm Pindrop.
- Cải thiện liên tục: Các yêu cầu của khách hàng Pindrop nhận được trong chương trình bảo hành giúp Pindrop ở phía trước của các chiến thuật lừa đảo giọng nói tổng hợp đang phát triển.
Có những nghiên cứu trường hợp đáng chú ý nào về công nghệ của Pindrop đã thành công trong việc giảm thiểu các mối đe dọa Deepfake? Kết quả là gì?
Sự kiện Trường trung học Pikesville: Vào ngày 16 tháng 1 năm 2024, một bản ghi âm đã xuất hiện trên Instagram được cho là của hiệu trưởng Trường trung học Pikesville ở Baltimore, Maryland. Âm thanh chứa các nhận xét miệt thị về học sinh và giáo viên da đen, gây ra một cơn bão của sự phẫn nộ công khai và lo ngại nghiêm trọng.
Trước những sự phát triển này, Pindrop đã tiến hành một cuộc điều tra toàn diện, thực hiện ba phân tích độc lập để tiết lộ sự thật. Kết quả của cuộc điều tra kỹ lưỡng của chúng tôi đã dẫn đến một kết luận tinh vi: mặc dù âm thanh tháng 1 đã được thay đổi, nhưng nó thiếu các đặc điểm xác định của giọng nói tổng hợp do AI tạo ra. Sự tự tin của chúng tôi trong việc xác định này được hỗ trợ bởi sự chắc chắn 97% dựa trên các chỉ số phân tích của chúng tôi. Phát hiện quan trọng này nhấn mạnh tầm quan trọng của việc tiến hành các phân tích chi tiết và khách quan trước khi đưa ra các tuyên bố công khai về bản chất của các phương tiện truyền thông có thể bị thao túng.
Tại một ngân hàng lớn của Mỹ, Pindrop đã phát hiện ra rằng một kẻ lừa đảo đang sử dụng giọng nói tổng hợp để vượt qua quá trình xác thực trong IVR. Chúng tôi đã phát hiện ra rằng kẻ lừa đảo đang sử dụng giọng nói do máy tạo ra để vượt qua quá trình xác thực IVR cho các tài khoản được nhắm mục tiêu, cung cấp các câu trả lời chính xác cho các câu hỏi bảo mật và, trong một trường hợp, thậm chí vượt qua cả mật khẩu một lần (OTP). Các bot đã xác thực thành công trong IVR đã xác định các tài khoản đáng nhắm mục tiêu thông qua các truy vấn số dư cơ bản. Các cuộc gọi tiếp theo vào các tài khoản này là từ một người thật để thực hiện lừa đảo. Pindrop đã cảnh báo ngân hàng về lừa đảo này trong thời gian thực bằng cách sử dụng công nghệ Pulse và đã có thể ngăn chặn kẻ lừa đảo.
Tại một tổ chức tài chính khác, Pindrop đã phát hiện ra rằng một số kẻ lừa đảo đang đào tạo các bot giọng nói của riêng họ để bắt chước hệ thống phản hồi tự động của ngân hàng. Trong những gì nghe giống như một cuộc gọi đầu tiên kỳ lạ, một bot giọng nói đã gọi đến IVR của ngân hàng không phải để thực hiện thu thập thông tin tài khoản mà để lặp lại các提示 IVR. Nhiều cuộc gọi đã được thực hiện đến các nhánh khác nhau của cây đối话 IVR, và mỗi hai giây, bot sẽ lặp lại những gì nó đã nghe. Một tuần sau, nhiều cuộc gọi đã được quan sát đang làm điều tương tự, nhưng lần này, bot đã lặp lại các cụm từ bằng chính xác giọng nói và cách phát âm của IVR của ngân hàng. Chúng tôi tin rằng một kẻ lừa đảo đang đào tạo một bot giọng nói để bắt chước IVR của ngân hàng như một điểm xuất phát cho một cuộc tấn công lừa đảo. Với sự giúp đỡ của Pindrop Pulse, tổ chức tài chính đã có thể ngăn chặn cuộc tấn công này trước khi gây ra bất kỳ thiệt hại nào.
Thử nghiệm Deepfake âm thanh độc lập của NPR: Bảo mật kỹ thuật số là một cuộc đua vũ trang liên tục giữa kẻ lừa đảo và nhà cung cấp công nghệ bảo mật. Có một số nhà cung cấp, bao gồm Pindrop, đã tuyên bố phát hiện Deepfake âm thanh một cách nhất quán – NPR đã đưa những tuyên bố này ra thử nghiệm để đánh giá xem các giải pháp công nghệ hiện tại có thể phát hiện âm thanh Deepfake do AI tạo ra một cách nhất quán hay không.
Pindrop Pulse đã phát hiện chính xác 81 trong số 84 mẫu âm thanh, tương đương với tỷ lệ chính xác 96,4%. Ngoài ra, Pindrop Pulse đã phát hiện 100% mẫu Deepfake là Deepfake. Mặc dù các nhà cung cấp khác cũng được đánh giá trong nghiên cứu, Pindrop đã nổi lên như một nhà lãnh đạo bằng cách chứng minh rằng công nghệ của họ có thể phát hiện đáng tin cậy và chính xác cả Deepfake và âm thanh thực.
Những xu hướng tương lai trong lừa đảo và bảo mật dựa trên giọng nói bạn dự đoán, đặc biệt là với sự phát triển nhanh chóng của công nghệ AI? Pindrop đang chuẩn bị như thế nào để đối phó với những thách thức này?
Chúng tôi dự đoán rằng lừa đảo trung tâm liên hệ sẽ tiếp tục gia tăng vào năm 2024. Dựa trên phân tích tỷ lệ lừa đảo hàng năm trên các lĩnh vực, chúng tôi ước tính tỷ lệ lừa đảo sẽ đạt 1 trong mỗi 730 cuộc gọi, đại diện cho mức tăng 4-5% so với mức hiện tại.
Hầu hết sự gia tăng lừa đảo này dự kiến sẽ ảnh hưởng đến lĩnh vực ngân hàng vì các lĩnh vực bảo hiểm, môi giới và tài chính khác dự kiến sẽ vẫn ở mức hiện tại. Chúng tôi ước tính rằng những tỷ lệ lừa đảo này đại diện cho sự phơi nhiễm lừa đảo 7 tỷ USD cho các tổ chức tài chính ở Mỹ, điều này cần được bảo vệ. Tuy nhiên, chúng tôi dự đoán sẽ có một sự thay đổi đáng kể, đặc biệt là với việc kẻ lừa đảo sử dụng IVR như một môi trường thử nghiệm. Gần đây, chúng tôi đã quan sát thấy sự gia tăng của kẻ lừa đảo nhập thủ công thông tin nhận dạng cá nhân (PII) để xác minh chi tiết tài khoản. Để giúp chống lại điều này, chúng tôi sẽ tiếp tục phát triển các giải pháp hiện tại của Pindrop và ra mắt các công cụ và công nghệ mới, như Pindrop Pulse, để bảo vệ khách hàng của chúng tôi.
Bên cạnh các công nghệ hiện tại, những công cụ và kỹ thuật mới nào đang được phát triển để tăng cường phòng ngừa và xác thực lừa đảo giọng nói?
Các kỹ thuật phòng ngừa và xác thực lừa đảo giọng nói đang liên tục phát triển để theo kịp sự tiến bộ của công nghệ và sự tinh vi của các hoạt động lừa đảo. Một số công cụ và kỹ thuật mới nổi bao gồm:
- Phát hiện và điều tra lừa đảo liên tục: Cung cấp một cái nhìn “nhìn lại” về các trường hợp lừa đảo với thông tin mới hiện có. Với cách tiếp cận này, các nhà phân tích lừa đảo có thể “nghe” các tín hiệu lừa đảo mới, quét các cuộc gọi lịch sử có thể liên quan và đánh giá lại các cuộc gọi đó.
- Phân tích giọng nói thông minh: Các hệ thống sinh trắc học giọng nói truyền thống dễ bị tấn công bởi Deepfake. Để tăng cường bảo vệ của chúng, các công nghệ mới như Voice Mismatch và Negative Voice Matching là cần thiết. Những công nghệ này cung cấp một lớp bảo vệ bổ sung bằng cách nhận ra và phân biệt nhiều giọng nói, người gọi lại và xác định nơi một giọng nói nghe khác có thể tạo ra mối đe dọa.
- Phát hiện lừa đảo sớm: Các công nghệ phát hiện lừa đảo cung cấp tín hiệu lừa đảo nhanh chóng và đáng tin cậy ngay từ đầu quá trình cuộc gọi là vô giá. Ngoài phát hiện sự sống, các công nghệ như phân tích siêu dữ liệu của nhà cung cấp, phát hiện giả mạo ID người gọi và phát hiện dựa trên âm thanh cung cấp sự bảo vệ chống lại các cuộc tấn công lừa đảo tại điểm bắt đầu của cuộc trò chuyện khi các biện pháp phòng vệ dễ bị tổn thương nhất.
Cảm ơn vì cuộc phỏng vấn tuyệt vời, để tìm hiểu thêm, hãy đọc Báo cáo Trí tuệ và Bảo mật Giọng nói 2024 của Pindrop hoặc truy cập Pindrop.












