Modelos e plataformas de IA
Vijay Balasubramaniyan, Co-Fundador e CEO da Pindrop – Série de Entrevistas

Vijay Balasubramaniyan é Co-Fundador e CEO da Pindrop. Ele ocupou vários cargos de engenharia e pesquisa na Google (GOOGL ), Siemens, IBM Research e Intel.
Pindrop‘s soluções estão liderando o caminho para o futuro da voz, estabelecendo o padrão para identidade, segurança e confiança para cada interação de voz. As soluções da Pindrop protegem alguns dos maiores bancos, seguradoras e varejistas do mundo, utilizando tecnologia patenteada que extrai inteligência de cada chamada e voz encontrada. As soluções da Pindrop ajudam a detectar fraudadores e autenticar clientes legítimos, reduzindo a fraude e os custos operacionais, enquanto melhoram a experiência do cliente e protegem a reputação da marca. A Pindrop, uma empresa privada com sede em Atlanta, GA, foi fundada em 2011 por Dr. Vijay Balasubramaniyan, Dr. Paul Judge e Dr. Mustaque Ahamad e é apoiada por investidores de capital de risco, incluindo Andreessen Horowitz, Citi Ventures, Felicis Ventures, CapitalG, GV, IVP e Vitruvian Partners. Para obter mais informações, visite pindrop.com.
Quais são as principais conclusões do Relatório de Inteligência e Segurança de Voz da Pindrop de 2024 sobre o estado atual da fraude e segurança baseada em voz?
O relatório fornece uma análise aprofundada de questões de segurança importantes e tendências futuras, particularmente dentro de centros de contato que atendem instituições financeiras e não financeiras. As principais descobertas do relatório incluem:
- Aumento Significativo na Fraude de Centro de Contato: A fraude de centro de contato aumentou 60% nos últimos dois anos, atingindo os níveis mais altos desde 2019. Até o final deste ano, uma em cada 730 chamadas para um centro de contato é esperada para ser fraudulenta.
- Aumento da Sofisticação dos Atacantes que Usam Deepfake: Os ataques de deepfake, incluindo clones de voz sintéticos sofisticados, estão aumentando, representando um risco de fraude estimado em US$ 5 bilhões para os centros de contato nos EUA. Essa tecnologia está sendo utilizada para melhorar táticas de fraude, como reconhecimento de conta automatizado e em grande escala, impersonação de voz, smishing direcionado e engenharia social.
- Métodos Tradicionais de Detecção e Autenticação de Fraude não Estão Funcionando: As empresas ainda dependem da autenticação manual dos consumidores, que é demorada, cara e ineficaz para parar a fraude. 350 milhões de vítimas de violações de dados, US$ 12 bilhões gastos anualmente em autenticação e US$ 10 bilhões perdidos para a fraude são evidências de que os métodos de segurança atuais não estão funcionando.
- Novas Abordagens e Tecnologias São Necessárias: A detecção de liveness é crucial para combater o mau uso da IA e melhorar a segurança. A análise de voz ainda é importante, mas precisa ser combinada com detecção de liveness e autenticação multifator.
De acordo com o relatório, 67,5% dos consumidores nos EUA estão preocupados com deepfakes no setor bancário. Pode explicar os tipos de ameaças de deepfake que as instituições financeiras estão enfrentando?
A fraude bancária via canais de telefone está aumentando devido a vários fatores. Como as instituições financeiras dependem fortemente dos clientes para confirmar atividades suspeitas, os centros de contato podem se tornar alvos principais para fraudadores. Os fraudadores usam táticas de engenharia social para enganar os representantes de serviço ao cliente, persuadindo-os a remover restrições ou ajudar a redefinir credenciais de banco online. De acordo com um cliente bancário da Pindrop, 36% das chamadas de fraude identificadas visavam principalmente remover holds impostos por controles de fraude. Outro cliente bancário da Pindrop relata que 19% das chamadas de fraude visavam obter acesso ao banco online. Com o aumento da IA geradora e dos deepfakes, esses tipos de ataques se tornaram mais potentes e escaláveis. Agora, um ou dois fraudadores em uma garagem podem criar qualquer número de vozes sintéticas e lançar ataques simultâneos em múltiplas instituições financeiras e ampliar suas táticas. Isso criou um nível elevado de risco e preocupação entre os consumidores sobre se o setor bancário está preparado para repelir esses ataques sofisticados.
Como os avanços em IA contribuíram para o aumento dos deepfakes e quais desafios específicos eles representam para os sistemas de segurança?
Embora os deepfakes não sejam novos, os avanços em IA os tornaram um vetor potente nos últimos anos, pois se tornaram mais convincentes em uma escala maior. Os avanços em IA fizeram com que os modelos de linguagem se tornassem mais habilidosos em criar discurso e linguagem convincentes. Agora, é possível criar voz sintética natural soando muito barata e em grande escala. Esses desenvolvimentos tornaram os deepfakes acessíveis a todos, incluindo fraudadores. Esses deepfakes desafiam os sistemas de segurança, permitindo ataques de phishing altamente convincentes, espalhando desinformação e facilitando a fraude financeira por meio de impersonações realistas. Eles minam os métodos tradicionais de autenticação, criam riscos de reputação significativos e exigem tecnologias de detecção avançadas para acompanhar sua evolução rápida e escalabilidade.
Como o Pindrop Pulse contribuiu para identificar o motor TTS usado no ataque de robocall do Presidente Biden e quais implicações isso tem para a detecção futura de deepfakes?
O Pindrop Pulse desempenhou um papel crítico na identificação do ElevenLabs, o motor TTS usado no ataque de robocall do Presidente Biden. Usando nossa tecnologia de detecção de deepfakes avançada, implementamos um processo de análise em quatro etapas, envolvendo filtragem e limpeza de áudio, extração de recursos, análise de segmentos e pontuação contínua. Esse processo permitiu que filtrássemos os quadros de não-fala, reduzíssemos a amostragem do áudio para replicar condições de telefone típicas e extrair recursos espectro-temporais de baixo nível.
Ao dividir o áudio em 155 segmentos e atribuir pontuações de liveness, determinamos que o áudio era consistentemente artificial. Usando “impressões digitais”, comparamos o áudio contra 122 sistemas TTS e identificamos com 99% de probabilidade que o ElevenLabs ou um sistema semelhante foi usado. Essa descoberta foi validada com 84% de probabilidade por meio do Classificador de SpeechAI do ElevenLabs. Nossa análise detalhada revelou artefatos de deepfake, particularmente em frases com fricativas ricas e expressões incomuns para o Presidente Biden.
Esse caso destaca a importância de nossos sistemas de detecção de deepfakes escaláveis e explicáveis, que melhoram a precisão, construímos confiança e se adaptam a novas tecnologias. Ele também destaca a necessidade de sistemas de IA geradora incorporarem salvaguardas contra o mau uso, garantindo que a clonagem de voz seja consentida por indivíduos reais. Nossa abordagem estabelece um padrão para lidar com ameaças de mídia sintética, enfatizando a monitorização contínua e a pesquisa para permanecer à frente dos métodos de deepfake em evolução.
O relatório menciona preocupações significativas sobre deepfakes afetando a mídia e as instituições políticas. Pode fornecer exemplos de tais incidentes e seu impacto potencial?
Nossa pesquisa encontrou que os consumidores nos EUA estão mais preocupados com o risco de deepfakes e clones de voz no setor bancário e financeiro. Mas além disso, a ameaça de deepfakes às instituições de mídia e políticas representa um desafio igualmente significativo. Fora dos EUA, o uso de deepfakes também foi observado na Indonésia (deepfake de Suharto) e na Eslováquia (deepfake de voz de Michal Šimečka e Monika Tódová).
Em 2024, é um ano de eleições importantes nos EUA e na Índia. Com 4 bilhões de pessoas em 40 países esperados para votar, a proliferação da tecnologia de IA torna mais fácil do que nunca enganar as pessoas na internet. Esperamos um aumento nos ataques de deepfakes direcionados a instituições governamentais, empresas de mídia social, outras empresas de mídia e a população em geral, que visam criar desconfiança nas instituições e espalhar desinformação no discurso público.
Pode explicar as tecnologias e metodologias que a Pindrop usa para detectar deepfakes e vozes sintéticas em tempo real?
A Pindrop usa uma variedade de tecnologias e metodologias avançadas para detectar deepfakes e vozes sintéticas em tempo real, incluindo:
-
- Detecção de Liveness: A Pindrop usa aprendizado de máquina em larga escala para analisar quadros de não-fala (por exemplo, silêncio, ruído, música) e extrair recursos espectro-temporais de baixo nível que distinguem entre fala gerada por máquina e fala humana genérica.
- Impressão Digital de Áudio: Isso envolve criar uma assinatura digital para cada voz com base em suas propriedades acústicas, como tom, entonação e cadência. Essas assinaturas são usadas para comparar e corresponder vozes em diferentes chamadas e interações.
- Análise de Comportamento: Usada para analisar padrões de comportamento que parecem fora do comum, incluindo acesso anormal a várias contas, atividade de bot rápida, reconhecimento de conta e mineração de dados.
- Análise de Voz: Ao analisar recursos de voz, como características do trato vocal, variações fonéticas e estilo de fala, a Pindrop pode criar uma impressão digital de voz para cada indivíduo. Qualquer desvio da impressão digital de voz esperada pode acionar um alerta.
- Abordagem de Segurança em Camadas: Isso envolve combinar diferentes métodos de detecção para verificar os resultados e aumentar a precisão da detecção. Por exemplo, os resultados da impressão digital de áudio podem ser cruzados com a análise biométrica para confirmar uma suspeita.
- Aprendizado Contínuo e Adaptação: A Pindrop atualiza continuamente seus modelos e algoritmos, incorporando novos dados, refinando técnicas de detecção e permanecendo à frente das ameaças emergentes. O aprendizado contínuo garante que as capacidades de detecção da Pindrop melhorem com o tempo e se adaptem a novos tipos de ataques de voz sintética.
O que é a Garantia de Deepfake do Pulse e como ela melhora a confiança do cliente na capacidade da Pindrop de lidar com ameaças de deepfake?
A Garantia de Deepfake do Pulse é uma garantia inovadora que oferece reembolso contra fraude de voz sintética no centro de contato. À medida que nos aproximamos de uma mudança sísmica no cenário de ataques cibernéticos, as perdas financeiras potenciais esperadas para atingir US$ 10,5 trilhões até 2025, a Garantia de Deepfake do Pulse melhora a confiança do cliente, oferecendo várias vantagens importantes:
- Confiança Aumentada: A Garantia de Deepfake do Pulse demonstra a confiança da Pindrop em seus produtos e tecnologia, oferecendo aos clientes uma solução de segurança confiável ao atender seus clientes.
- Reembolso de Perdas: Os clientes da Pindrop podem receber reembolsos por eventos de fraude de voz sintética não detectados pela Suíte de Produtos da Pindrop.
- Melhoria Contínua: Os pedidos de clientes da Pindrop recebidos por meio do programa de garantia ajudam a Pindrop a permanecer à frente das táticas de fraude de voz sintética em evolução.
Há algum estudo de caso notável em que as tecnologias da Pindrop tenham mitigado com sucesso ameaças de deepfake? Quais foram os resultados?
O Incidente da Escola Secundária Pikesville: Em 16 de janeiro de 2024, uma gravação surgiu no Instagram, supostamente com o diretor da Escola Secundária Pikesville, em Baltimore, Maryland. O áudio continha comentários depreciativos sobre estudantes e professores negros, desencadeando uma tempestade de indignação pública e preocupação séria.
Em face desses desenvolvimentos, a Pindrop realizou uma investigação abrangente, conduzindo três análises independentes para descobrir a verdade. Os resultados de nossa investigação minuciosa levaram a uma conclusão matizada: embora o áudio de janeiro tivesse sido alterado, ele carecia das características definitivas de discurso sintético gerado por IA. Nossa confiança nessa determinação é apoiada por uma certeza de 97% com base em nossas métricas de análise. Essa descoberta crucial destaca a importância de realizar análises detalhadas e objetivas antes de fazer declarações públicas sobre a natureza de mídia potencialmente manipulada.
Em um grande banco dos EUA, a Pindrop descobriu que um fraudador estava usando voz sintética para contornar a autenticação no IVR. Descobriu-se que o fraudador estava usando voz gerada por máquina para contornar a autenticação do IVR para contas específicas, fornecendo as respostas certas para as perguntas de segurança e, em um caso, até passando senhas de uso único (OTP). Os bots que autenticaram com sucesso no IVR identificaram contas dignas de serem visadas por meio de consultas básicas de saldo. Chamadas subsequentes para essas contas eram de um ser humano real para cometer a fraude. A Pindrop alertou o banco sobre essa fraude em tempo real, usando a tecnologia Pulse, e conseguiu parar o fraudador.
Em outra instituição financeira, a Pindrop descobriu que alguns fraudadores estavam treinando seus próprios robôs de voz para imitar sistemas de resposta automatizados de bancos. Em uma chamada que soou como uma estranha primeira chamada, um robô de voz ligou para o sistema de resposta automatizada do banco, não para fazer reconhecimento de conta, mas para repetir os prompts do sistema de resposta automatizada. Múltiplas chamadas chegaram a diferentes ramificações da árvore de conversa do sistema de resposta automatizada, e a cada dois segundos, o robô repetia o que ouviu. Uma semana depois, mais chamadas foram observadas fazendo o mesmo, mas desta vez, o robô de voz repetia as frases com exatamente a mesma voz e maneirismos do sistema de resposta automatizada do banco. Acreditamos que um fraudador estava treinando um robô de voz para espelhar o sistema de resposta automatizada do banco como um ponto de partida para um ataque de smishing. Com a ajuda da tecnologia Pulse da Pindrop, a instituição financeira conseguiu frustrar esse ataque antes que qualquer dano fosse causado.
Experimento Independente de Áudio Deepfake da NPR: A segurança digital é uma corrida armamentista constante entre fraudadores e provedores de tecnologia de segurança. Existem vários provedores, incluindo Pindrop, que afirmam detectar áudio deepfake consistentemente – a NPR testou essas alegações para avaliar se as soluções de tecnologia atuais são capazes de detectar áudio deepfake gerado por IA de forma consistente.
A Pindrop Pulse detectou corretamente 81 das 84 amostras de áudio, o que representa uma taxa de precisão de 96,4%. Além disso, a Pindrop Pulse detectou 100% das amostras de deepfake como tal. Embora outros provedores também tenham sido avaliados no estudo, a Pindrop se destacou como líder, demonstrando que sua tecnologia pode detectar de forma confiável e precisa tanto áudio deepfake quanto áudio legítimo.
Quais tendências futuras em fraude e segurança baseada em voz você prevê, especialmente com o desenvolvimento rápido de tecnologias de IA? Como a Pindrop está se preparando para lidar com essas?
Esperamos que a fraude de centro de contato continue a aumentar em 2024. Com base na análise dos índices de fraude até o ano, estimamos que a taxa de fraude atingirá 1 em cada 730 chamadas, representando um aumento de 4 a 5% em relação aos níveis atuais.
A maioria do aumento da fraude deve afetar o setor bancário, pois seguros, corretoras e outros segmentos financeiros devem permanecer em torno dos níveis atuais. Estimamos que essas taxas de fraude representam uma exposição à fraude de US$ 7 bilhões para as instituições financeiras nos EUA, que precisam ser protegidas. No entanto, antecipamos uma mudança significativa, particularmente com fraudadores utilizando os IVRs como um terreno de teste. Recentemente, observamos um aumento nos fraudadores que inserem manualmente informações de identificação pessoal (PII) para verificar detalhes de conta.
Para ajudar a combater isso, continuaremos a avançar com as soluções atuais da Pindrop e lançar novas e inovadoras ferramentas, como a Pindrop Pulse, que protegem nossos clientes.
Além das tecnologias atuais, quais novas ferramentas e técnicas estão sendo desenvolvidas para melhorar a prevenção e autenticação de fraude de voz?
As técnicas de prevenção e autenticação de fraude de voz estão em constante evolução para acompanhar os avanços tecnológicos e a sofisticação das atividades fraudulentas. Algumas ferramentas e técnicas emergentes incluem:
- Detecção e investigação de fraude contínua: Fornece uma perspectiva histórica sobre instâncias de fraude com novas informações agora disponíveis. Com essa abordagem, analistas de fraude podem “ouvir” novos sinais de fraude, varrer chamadas históricas que possam estar relacionadas e reavaliar essas chamadas.
- Análise de voz inteligente: Os sistemas de biometria de voz tradicionais são vulneráveis a ataques de deepfake. Para melhorar suas defesas, novas tecnologias, como Voice Mismatch e Negative Voice Matching, são necessárias. Essas tecnologias fornecem uma camada adicional de defesa, reconhecendo e diferenciando múltiplas vozes, chamadas repetidas e identificando onde uma voz com som diferente pode representar uma ameaça.
- Detecção precoce de fraude: Tecnologias de detecção de fraude que fornecem um sinal de fraude rápido e confiável no início do processo de chamada são inestimáveis. Além da detecção de liveness, tecnologias como análise de metadados do carrier, detecção de spoofing de ID do chamador e detecção de spoofing baseada em áudio fornecem proteção contra ataques de fraude no início de uma conversa, quando as defesas estão mais vulneráveis.
Obrigado pela grande entrevista, para saber mais, leia o Relatório de Inteligência e Segurança de Voz da Pindrop de 2024 ou visite Pindrop.












