Financiamento
Modulate arrecada $25M para construir a camada de inteligência para IA de voz

Modulate arrecadou $25 million em novo financiamento enquanto a empresa de Boston busca capitalizar um desafio crescente em inteligência artificial: ensinar máquinas a entender não apenas o que as pessoas dizem, mas como elas dizem.
Future Ventures liderou a rodada, com participação da Hyperplane e da Lakestar. O financiamento eleva o total de recursos da Modulate para $60 million e será usado para expandir sua pesquisa em IA, equipes de engenharia, ferramentas para desenvolvedores, parcerias e opções de implantação.
O investimento ocorre à medida que a voz se torna cada vez mais uma interface para agentes de IA, plataformas de atendimento ao cliente, ambientes de jogos e sistemas de segurança. Embora a tecnologia de transcrição de fala tenha melhorado drasticamente, a Modulate aposta que os transcritos, por si só, deixam de fora grande parte das informações contidas na fala humana.
Sua tecnologia, em vez disso, analisa o áudio subjacente em busca de sinais como emoção, tom, intenção, pausas, fala sintética e comportamento conversacional.
Além da Transcrição de Fala
Grande parte da pilha de IA de voz atual segue uma arquitetura relativamente simples: converter a fala em texto e, em seguida, enviar a transcrição resultante para um grande modelo de linguagem (LLM).
Isso funciona bem quando as próprias palavras contêm a maior parte das informações relevantes. Torna‑se mais limitante quando o significado depende de sarcasmo, frustração, hesitação, estresse, interrupções ou mudanças de tom.
A Modulate construiu sua plataforma principal Velma em torno da ideia de que esses sinais devem ser analisados diretamente a partir do áudio, em vez de serem reconstruídos posteriormente a partir de uma transcrição.
A empresa descreve a Velma como um sistema de inteligência de conversação nativo de áudio capaz de produzir transcrições enquanto identifica simultaneamente falantes, emoções, tópicos de conversa, sentimento e mais de 150 comportamentos. Os desenvolvedores também podem definir comportamentos personalizados usando descrições em linguagem natural.
Isso abre a tecnologia para aplicações que vão desde a identificação de um cliente frustrado antes que a chamada se deteriore até a detecção de comportamento suspeito durante uma transação financeira ou a identificação de quando um agente de voz de IA está se comportando de maneira inesperada.
Em junho, a Modulate disponibilizou a Velma diretamente aos desenvolvedores por meio de uma API, ampliando o acesso além de suas implantações corporativas anteriores.
Modulate adota uma abordagem de conjunto para IA de áudio
A arquitetura por trás da Velma é o que a Modulate chama de Modelo de Escuta em Conjunto, ou ELM.
Em vez de usar um único modelo enorme para executar todas as tarefas, o ELM coordena mais de 100 modelos especializados, com componentes individuais analisando diferentes características de um fluxo de áudio.
Esses modelos podem examinar propriedades básicas, como mudanças de falante e pausas, juntamente com sinais de nível superior, como emoção, intenção percebida, marcadores de voz sintética, confusão ou padrões comportamentais. Uma camada de orquestração então combina essas observações em uma interpretação mais ampla da conversa.
É uma filosofia notavelmente diferente da estratégia cada vez mais comum de aplicar modelos de base multimodais cada vez maiores ao áudio.
A Modulate argumenta que a especialização permite que sua arquitetura ofereça resultados mais transparentes ao mesmo tempo em que reduz a quantidade de computação necessária. Para aplicações corporativas, como detecção de fraude e conformidade, a capacidade de entender por que um sistema gerou um alerta pode ser quase tão importante quanto o próprio alerta.
Segundo a empresa, a abordagem pode ser até 1.000 vezes mais eficiente computacionalmente do que usar um único modelo grande para algumas cargas de trabalho de análise de áudio.
IA de Voz Cria um Novo Problema de Monitoramento
O momento do financiamento também reflete uma mudança mais ampla que ocorre em toda a IA corporativa.
Os sistemas de IA estão cada vez mais capazes de conduzir conversas de voz completas com clientes. Isso significa que as empresas agora precisam monitorar interações que envolvem não apenas funcionários humanos, mas também agentes autônomos operando em milhares ou potencialmente milhões de conversas.
Um agente de voz pode tecnicamente seguir um roteiro enquanto ainda interrompe repetidamente os clientes, não reconhece a frustração, interpreta erroneamente a intenção ou responde inadequadamente a situações emocionais.
A Modulate vê uma oportunidade de se tornar uma camada de escuta independente ao lado desses agentes.
Sua tecnologia de agente de voz foi projetada para identificar sinais como interrupções, pausas, emoções, sotaques e outras características difíceis de capturar apenas a partir do texto, permitindo que os desenvolvedores ajustem o comportamento de um agente enquanto as conversas ainda estão ocorrendo.
Essa mesma infraestrutura pode ser aplicada a conversas humanas onde as organizações precisam identificar fraudes, riscos de conformidade, assédio ou outros eventos potencialmente significativos em tempo real.
Da Moderação de Jogos à Inteligência de Voz Mais Ampla
As ambições atuais da Modulate representam uma expansão significativa em relação ao seu foco anterior em jogos online.
Um de seus produtos mais conhecidos, ToxMod, foi desenvolvido para analisar comunicações de voz ao vivo em plataformas de jogos e sociais e identificar assédio, ameaças, grooming e outros comportamentos nocivos.
Isso continua sendo uma parte importante do negócio. A Modulate afirma que o ToxMod pode integrar-se diretamente à infraestrutura de voz existente, ao mesmo tempo em que encaminha interações potencialmente problemáticas para sistemas de moderação ou revisores humanos.
A empresa trabalhou com grandes companhias de jogos, incluindo Activision, Riot Games, Rockstar Games e Rec Room.
Mas a tecnologia subjacente necessária para entender a toxicidade em um jogo multijogador também pode ser adaptada a outros ambientes onde o contexto importa.
A Modulate agora posiciona sua tecnologia em prevenção de fraude, centros de contato, supervisão de agentes de IA, detecção de deepfake, experiência do cliente e confiança e segurança.
Sua plataforma de desenvolvedor oferece atualmente múltiplas famílias de modelos que abrangem transcrição, detecção de deepfake, redação de áudio, inteligência de conversação e outras capacidades de análise de áudio.
Deepfakes adicionam outra razão para entender o áudio diretamente
fala sintética está se tornando outra parte importante dessa oportunidade.
À medida que a clonagem de voz cada vez mais convincente se torna disponível, organizações que lidam com transações financeiras ou informações sensíveis precisam determinar não apenas o que o interlocutor está dizendo, mas se a própria voz é autêntica.
Consequentemente, a Modulate expandiu-se para a detecção de deepfakes, combinando a análise de voz sintética com as informações contextuais mais amplas disponíveis por meio de seus modelos de áudio.
A empresa afirma que sua tecnologia atualmente analisa mais de 10 milhões de horas de áudio por mês e já processou mais de 600 milhões de horas no total.
Sua expansão para áreas como a detecção de música gerada por IA também ilustra quão amplamente a arquitetura de conjunto subjacente poderia ser aplicada. O sistema de detecção de música da Modulate, por exemplo, avalia separadamente a presença de música, vocais gerados por IA e instrumentação gerada por IA antes de combinar os sinais em um resultado interpretável.
O próximo desafio para a IA de voz é compreender, não falar
O investimento de US$ 25 milhões dá à Modulate recursos adicionais para expandir sua pesquisa, engenharia, ferramentas para desenvolvedores e parcerias. De forma mais ampla, reflete um desafio crescente para a IA de voz: falar naturalmente é apenas metade de uma conversa.
À medida que agentes de voz avançam para atendimento ao cliente, saúde, serviços financeiros e outros campos, os sistemas precisarão entender sinais que as transcrições frequentemente não capturam, incluindo frustração, hesitação, ênfase, tom e possível fala sintética.
Isso poderia criar uma nova camada de inteligência em torno das interações de voz, ajudando os sistemas a detectar fraudes, reconhecer quando os clientes estão insatisfeitos ou identificar quando um agente de IA está interpretando mal ou manejando inadequadamente uma conversa.
Mas a tecnologia também levanta questões sobre privacidade, precisão e viés. Inferir emoção ou intenção a partir da fala é mais subjetivo do que transcrever palavras, particularmente entre diferentes sotaques, idiomas e culturas.
À medida que a IA se torna cada vez mais capaz de falar como uma pessoa, a próxima fronteira pode ser determinar quão bem as máquinas realmente escutam — e quão responsavelmente essas capacidades são usadas.












