Financement
Modulate lève $25M pour construire la couche d’intelligence pour l’IA vocale

Modulate a levé $25 million dans un nouveau financement alors que l’entreprise basée à Boston cherche à tirer parti d’un défi croissant en intelligence artificielle : apprendre aux machines à comprendre non seulement ce que les gens disent, mais aussi comment ils le disent.
Future Ventures a mené le tour, avec la participation de Hyperplane et Lakestar. Ce financement porte le total des fonds de Modulate à $60 million et sera utilisé pour élargir ses recherches en IA, ses équipes d’ingénierie, ses outils pour développeurs, ses partenariats et ses options de déploiement.
Cet investissement intervient alors que la voix devient de plus en plus une interface pour les agents d’IA, les plateformes de service client, les environnements de jeu et les systèmes de sécurité.
Sa technologie analyse plutôt l’audio sous‑jacent à la recherche de signaux tels que l’émotion, le ton, l’intention, les pauses, la parole synthétique et le comportement conversationnel.
Au‑delà de la transcription vocale
La majeure partie de la pile d’IA vocale actuelle suit une architecture relativement simple : convertir la parole en texte, puis envoyer la transcription ainsi obtenue à un grand modèle de langage (LLM).
Cela fonctionne bien lorsque les mots eux‑mêmes contiennent la plupart des informations pertinentes. Cela devient plus limitatif lorsque le sens dépend du sarcasme, de la frustration, de l’hésitation, du stress, des interruptions ou des variations de ton.
Modulate a construit sa plateforme phare Velma autour de l’idée que ces signaux doivent être analysés directement à partir de l’audio plutôt que d’être reconstruits ultérieurement à partir d’une transcription.
L’entreprise décrit Velma comme un système d’intelligence conversationnelle natif audio capable de produire des transcriptions tout en identifiant simultanément les locuteurs, les émotions, les sujets de conversation, le sentiment et plus de 150 comportements. Les développeurs peuvent également définir des comportements personnalisés à l’aide de descriptions en langage naturel.
Cela ouvre la technologie à des applications allant de l’identification d’un client frustré avant qu’un appel ne se détériore à la détection d’un comportement suspect lors d’une transaction financière, ou à la reconnaissance d’un agent vocal IA qui se comporte de manière inattendue.
En juin, Modulate a ouvert Velma directement aux développeurs via une API, élargissant l’accès au‑delà de ses déploiements d’entreprise antérieurs.
Modulate adopte une approche ensembliste de l’IA audio
L’architecture sous‑jacent à Velma est ce que Modulate appelle un Ensemble Listening Model, ou ELM.
Plutôt que d’utiliser un seul modèle gigantesque pour chaque tâche, l’ELM coordonne plus de 100 modèles spécialisés, chaque composant analysant différentes caractéristiques d’un flux audio.
Ces modèles peuvent examiner des propriétés de base comme les changements d’orateur et les pauses, ainsi que des signaux de niveau supérieur tels que l’émotion, l’intention perçue, les marqueurs de voix synthétique, la confusion ou les schémas comportementaux. Une couche d’orchestration combine ensuite ces observations en une interprétation plus globale de la conversation.
Il s’agit d’une philosophie nettement différente de la stratégie de plus en plus courante consistant à appliquer des modèles de fondation multimodaux toujours plus grands à l’audio.
Modulate soutient que la spécialisation permet à son architecture de fournir des résultats plus transparents tout en réduisant la quantité de calcul nécessaire. Pour les applications d’entreprise telles que la détection de fraude et la conformité, la capacité à comprendre pourquoi un système a déclenché une alerte peut être presque aussi importante que l’alerte elle‑même.
Selon l’entreprise, cette approche peut être jusqu’à 1 000 fois plus efficace sur le plan computationnel que l’utilisation d’un seul grand modèle pour certaines charges de travail d’analyse audio.
L’IA vocale crée un nouveau problème de surveillance
Le moment du financement reflète également un changement plus large qui se produit dans l’IA d’entreprise.
Les systèmes d’IA sont de plus en plus capables de mener des conversations vocales complètes avec les clients. Cela signifie que les entreprises doivent désormais surveiller des interactions impliquant non seulement des employés humains, mais aussi des agents autonomes opérant sur des milliers, voire potentiellement des millions, de conversations.
Un agent vocal peut techniquement suivre un script tout en interrompant à plusieurs reprises les clients, en ne reconnaissant pas la frustration, en mal interprétant l’intention ou en répondant mal aux situations émotionnelles.
Modulate voit une opportunité de devenir une couche d’écoute indépendante placée aux côtés de ces agents.
Sa technologie d’agent vocal est conçue pour identifier des signaux tels que les interruptions, les pauses, les émotions, les accents et d’autres caractéristiques difficiles à capturer à partir du texte seul, permettant aux développeurs d’ajuster le comportement d’un agent pendant que les conversations sont encore en cours.
Cette même infrastructure peut être appliquée aux conversations humaines où les organisations doivent identifier en temps réel la fraude, les risques de conformité, le harcèlement ou d’autres événements potentiellement importants.
De la modération de jeux à une intelligence vocale plus large
Les ambitions actuelles de Modulate représentent une expansion importante par rapport à son focus antérieur sur les jeux en ligne.
L’un de ses produits les plus connus, ToxMod, a été développé pour analyser les communications vocales en temps réel sur les plateformes de jeu et sociales et identifier le harcèlement, les menaces, le grooming et d’autres comportements nuisibles.
Cela demeure une partie importante de l’activité. Modulate indique que ToxMod peut s’intégrer directement à l’infrastructure vocale existante tout en acheminant les interactions potentiellement problématiques vers des systèmes de modération ou des examinateurs humains.
L’entreprise a collaboré avec d’importantes sociétés de jeux, dont Activision, Riot Games, Rockstar Games et Rec Room.
Cependant, la technologie sous-jacente nécessaire pour comprendre la toxicité dans un jeu multijoueur peut également être adaptée à d’autres environnements où le contexte est crucial.
Modulate positionne désormais sa technologie dans la prévention de la fraude, les centres de contact, la supervision des agents IA, la détection de deepfakes, l’expérience client ainsi que la confiance et la sécurité.
Sa plateforme développeur propose actuellement plusieurs familles de modèles couvrant la transcription, la détection de deepfakes, la rédaction audio, l’intelligence conversationnelle et d’autres capacités d’analyse audio.
Les deepfakes offrent une raison supplémentaire de comprendre l’audio directement
Synthèse vocale devient une autre partie importante de cette opportunité.
À mesure que le clonage vocal de plus en plus convaincant devient disponible, les organisations traitant des transactions financières ou des informations sensibles doivent déterminer non seulement ce que l’appelant dit, mais aussi si la voix elle‑même est authentique.
Modulate s’est donc élargi à la détection de deepfakes, combinant l’analyse de voix synthétique avec les informations contextuelles plus larges disponibles via ses modèles audio.
L’entreprise indique que sa technologie analyse actuellement plus de 10 millions d’heures d’audio par mois et a traité plus de 600 millions d’heures au total.
Son expansion vers des domaines tels que la détection de musique générée par IA illustre également la large applicabilité potentielle de l’architecture d’ensemble sous‑jacente. Le système de détection musicale de Modulate, par exemple, évalue séparément la présence de musique, de voix générées par IA et d’instrumentation générée par IA avant de combiner les signaux en un résultat interprétable.
Le prochain défi pour l’IA vocale est la compréhension, pas la parole
L’investissement de 25 millions de dollars offre à Modulate des ressources supplémentaires pour étendre ses recherches, son ingénierie, ses outils développeur et ses partenariats. Plus largement, il reflète un défi croissant pour l’IA vocale : parler naturellement ne représente que la moitié d’une conversation.
À mesure que les agents vocaux s’infiltrent dans le service client, la santé, les services financiers et d’autres secteurs, les systèmes devront comprendre des signaux que les transcriptions manquent souvent, tels que la frustration, l’hésitation, l’emphase, le ton et d’éventuelles voix synthétiques.
Cela pourrait créer une nouvelle couche d’intelligence autour des interactions vocales, aidant les systèmes à détecter la fraude, à reconnaître quand les clients sont insatisfaits ou à identifier lorsqu’un agent IA mal comprend ou gère mal une conversation.
Cependant, la technologie soulève également des questions de confidentialité, de précision et de biais. Inférer l’émotion ou l’intention à partir de la parole est plus subjectif que de transcrire les mots, notamment à travers différents accents, langues et cultures.
À mesure que l’IA devient de plus en plus capable de parler comme une personne, la prochaine frontière pourrait être de déterminer à quel point les machines peuvent réellement écouter — et à quel point ces capacités sont utilisées de manière responsable.












