Financiación

Modulate recauda 25 millones de dólares para construir la capa de inteligencia para la IA de voz

mm
Añade Unite.AI a tus fuentes preferidas en Google

Modulate ha recaudado 25 millones de dólares en nueva financiación mientras la empresa con sede en Boston busca capitalizar un desafío creciente en la inteligencia artificial: enseñar a las máquinas a comprender no solo lo que la gente dice, sino cómo lo dice.

Future Ventures lideró la ronda, con la participación de Hyperplane y Lakestar. La financiación eleva el total de fondos de Modulate a 60 millones de dólares y se utilizará para ampliar sus equipos de investigación y desarrollo de IA, herramientas para desarrolladores, asociaciones y opciones de despliegue.

La inversión llega en un momento en que la voz se está convirtiendo cada vez más en una interfaz para agentes de IA, plataformas de atención al cliente, entornos de juegos y sistemas de seguridad. Aunque la tecnología de reconocimiento de voz ha mejorado drásticamente, Modulate apuesta a que los transcritos por sí solos omiten gran parte de la información contenida en el habla humana.

Su tecnología, en cambio, analiza el audio subyacente en busca de señales como emoción, tono, intención, pausas, voz sintética y comportamiento conversacional.

Más allá del reconocimiento de voz

Gran parte de la pila de IA de voz actual sigue una arquitectura relativamente sencilla: convertir el habla en texto y luego enviar el transcrito resultante a un modelo de lenguaje extenso (LLM).

Eso funciona bien cuando las palabras mismas contienen la mayor parte de la información relevante. Resulta más limitante cuando el significado depende del sarcasmo, la frustración, la vacilación, el estrés, las interrupciones o los cambios de tono.

Modulate ha construido su plataforma insignia Velma alrededor de la idea de que estas señales deben analizarse directamente desde el audio en lugar de reconstruirse después a partir de un transcrito.

La empresa describe a Velma como un sistema de inteligencia conversacional nativo de audio capaz de producir transcripciones mientras identifica simultáneamente a los hablantes, emociones, temas de conversación, sentimientos y más de 150 comportamientos. Los desarrolladores también pueden definir comportamientos personalizados mediante descripciones en lenguaje natural.

Eso abre la tecnología a aplicaciones que van desde identificar a un cliente frustrado antes de que una llamada se deteriore, hasta detectar comportamientos sospechosos durante una transacción financiera o reconocer cuándo un agente de voz de IA se está comportando de forma inesperada.

En junio, Modulate abrió Velma directamente a los desarrolladores a través de una API, ampliando el acceso más allá de sus despliegues empresariales anteriores.

Modulate adopta un enfoque de conjunto para la IA de audio

La arquitectura subyacente a Velma es lo que Modulate denomina un Ensemble Listening Model, o ELM.

En lugar de usar un modelo enorme para realizar todas las tareas, ELM coordina más de 100 modelos especializados, con componentes individuales que analizan diferentes características de una corriente de audio.

Esos modelos pueden examinar propiedades básicas como cambios de hablante y pausas, junto con señales de nivel superior como emoción, intención percibida, marcadores de voz sintética, confusión o patrones de comportamiento. Una capa de orquestación combina esas observaciones en una interpretación más amplia de la conversación.

Es una filosofía notablemente distinta de la estrategia cada vez más común de aplicar modelos fundacionales multimodales cada vez más grandes al audio.

Modulate sostiene que la especialización permite que su arquitectura ofrezca resultados más transparentes al tiempo que reduce la cantidad de cómputo requerido. Para aplicaciones empresariales como la detección de fraude y el cumplimiento normativo, la capacidad de entender por qué un sistema generó una alerta puede ser casi tan importante como la propia alerta.

Según la empresa, el enfoque puede ser hasta 1 000 veces más eficiente computacionalmente que usar un solo modelo grande para algunas cargas de trabajo de análisis de audio.

La IA de voz crea un nuevo problema de monitoreo

El momento de la financiación también refleja un cambio más amplio que se está produciendo en la IA empresarial.

Los sistemas de IA son cada vez más capaces de conducir conversaciones de voz completas con los clientes. Eso significa que las empresas ahora deben monitorear interacciones que involucran no solo a empleados humanos, sino también a agentes autónomos que operan en miles o potencialmente millones de conversaciones.

Un agente de voz puede seguir técnicamente un guion mientras interrumpe repetidamente a los clientes, no reconoce la frustración, malinterpreta la intención o responde de forma deficiente a situaciones emocionales.

Modulate ve una oportunidad para convertirse en una capa de escucha independiente que se sitúe junto a esos agentes.

Su tecnología para agentes de voz está diseñada para identificar señales como interrupciones, pausas, emociones, acentos y otras características que son difíciles de capturar solo a partir del texto, lo que permite a los desarrolladores ajustar el comportamiento de un agente mientras la conversación sigue en curso.

Esa misma infraestructura puede aplicarse a conversaciones humanas donde las organizaciones necesitan identificar fraude, riesgos de cumplimiento, acoso u otros eventos potencialmente significativos en tiempo real.

De la moderación de juegos a una inteligencia de voz más amplia

Las actuales ambiciones de Modulate representan una expansión significativa respecto a su enfoque anterior en los juegos en línea.

Uno de sus productos más conocidos, ToxMod, fue desarrollado para analizar comunicaciones de voz en tiempo real en plataformas de juegos y sociales e identificar acoso, amenazas, grooming y otros comportamientos nocivos.

Eso sigue siendo una parte importante del negocio. Modulate afirma que ToxMod puede integrarse directamente con la infraestructura de voz existente mientras dirige interacciones potencialmente problemáticas a sistemas de moderación o revisores humanos.

La empresa ha colaborado con importantes compañías de videojuegos, entre ellas Activision, Riot Games, Rockstar Games y Rec Room.

Sin embargo, la tecnología subyacente necesaria para comprender la toxicidad en un juego multijugador también puede adaptarse a otros entornos donde el contexto es relevante.

Modulate ahora posiciona su tecnología en la prevención de fraudes, centros de contacto, supervisión de agentes de IA, detección de deepfakes, experiencia del cliente y confianza y seguridad.

Su plataforma para desarrolladores ofrece actualmente múltiples familias de modelos que abarcan transcripción, detección de deepfakes, redacción de audio, inteligencia de conversación y otras capacidades de análisis de audio.

Los deepfakes añaden otra razón para comprender el audio directamente

Voz sintética se está convirtiendo en otra parte importante de esa oportunidad.

A medida que la clonación de voz cada vez más convincente se vuelve disponible, las organizaciones que manejan transacciones financieras o información sensible necesitan determinar no solo lo que el interlocutor está diciendo, sino si la propia voz es auténtica.

Consecuentemente, Modulate se ha expandido a la detección de deepfakes, combinando el análisis de voces sintéticas con la información contextual más amplia disponible a través de sus modelos de audio.

La empresa afirma que su tecnología analiza actualmente más de 10 millones de horas de audio al mes y ha procesado más de 600 millones de horas en total.

Su expansión a áreas como la detección de música generada por IA también ilustra cuán ampliamente podría aplicarse la arquitectura de conjunto subyacente. El sistema de detección de música de Modulate, por ejemplo, evalúa por separado la presencia de música, voces generadas por IA e instrumentación generada por IA antes de combinar las señales en un resultado interpretable.

El próximo desafío para la IA de voz es comprender, no hablar

La inversión de 25 millones de dólares brinda a Modulate recursos adicionales para ampliar su investigación, ingeniería, herramientas para desarrolladores y alianzas. En un sentido más amplio, refleja un desafío creciente para la IA de voz: hablar de forma natural es solo la mitad de una conversación.

A medida que los agentes de voz se incorporan al servicio al cliente, la salud, los servicios financieros y otros campos, los sistemas necesitarán comprender señales que las transcripciones a menudo omiten, como la frustración, la vacilación, el énfasis, el tono y la posible voz sintética.

Eso podría crear una nueva capa de inteligencia alrededor de las interacciones de voz, ayudando a los sistemas a detectar fraudes, reconocer cuando los clientes están insatisfechos o identificar cuando un agente de IA está malinterpretando o gestionando incorrectamente una conversación.

Pero la tecnología también plantea preguntas sobre privacidad, precisión y sesgo. Inferir emociones o intenciones a partir del habla es más subjetivo que transcribir palabras, particularmente entre diferentes acentos, idiomas y culturas.

A medida que la IA se vuelve cada vez más capaz de hablar como una persona, la próxima frontera podría ser determinar qué tan bien pueden realmente escuchar las máquinas, y cuán responsablemente se utilizan esas capacidades.

Antoine es un líder visionario y socio fundador de Unite.AI, impulsado por una pasión inquebrantable por dar forma y promover el futuro de la IA y la robótica. Como empresario serial, cree que la IA será tan disruptiva para la sociedad como la electricidad, y a menudo se le escucha hablando con entusiasmo sobre el potencial de las tecnologías disruptivas y la AGI.

Como futurista, está dedicado a explorar cómo estas innovaciones darán forma a nuestro mundo. Además, es el fundador de Securities.io, una plataforma enfocada en invertir en tecnologías de vanguardia que están redefiniendo el futuro y remodelando sectores enteros.