Finanziamenti
Modulate raccoglie $25 milioni per costruire il livello di intelligenza per l’IA vocale

Modulate ha raccolto $25 milioni in nuovi finanziamenti mentre l’azienda con sede a Boston cerca di capitalizzare su una sfida crescente nell’intelligenza artificiale: insegnare alle macchine a comprendere non solo ciò che le persone dicono, ma come lo dicono.
Future Ventures ha guidato il round, con la partecipazione di Hyperplane e Lakestar. Il finanziamento porta il totale dei fondi di Modulate a $60 milioni e sarà utilizzato per espandere la sua ricerca IA, i team di ingegneria, gli strumenti per sviluppatori, le partnership e le opzioni di distribuzione.
L’investimento arriva mentre la voce sta diventando sempre più un’interfaccia per agenti IA, piattaforme di assistenza clienti, ambienti di gioco e sistemi di sicurezza. Sebbene la tecnologia di riconoscimento vocale sia migliorata notevolmente, Modulate scommette che le trascrizioni da sole tralasciano gran parte delle informazioni contenute nella voce umana.
La sua tecnologia, invece, analizza l’audio sottostante alla ricerca di segnali come emozione, tono, intento, pause, voce sintetica e comportamento conversazionale.
Andare oltre il riconoscimento vocale
Gran parte dello stack di IA vocale odierno segue un’architettura relativamente semplice: converte la voce in testo e poi invia la trascrizione risultante a un modello di linguaggio di grandi dimensioni (LLM).
Questo funziona bene quando le parole stesse contengono la maggior parte delle informazioni rilevanti. Diventa più limitante quando il significato dipende da sarcasmo, frustrazione, esitazione, stress, interruzioni o variazioni di tono.
Modulate ha costruito la sua piattaforma di punta Velma attorno all’idea che questi segnali debbano essere analizzati direttamente dall’audio piuttosto che ricostruiti successivamente da una trascrizione.
L’azienda descrive Velma come un sistema di intelligenza conversazionale nativo audio, in grado di produrre trascrizioni identificando simultaneamente speaker, emozioni, argomenti di conversazione, sentiment e oltre 150 comportamenti. Gli sviluppatori possono anche definire comportamenti personalizzati usando descrizioni in linguaggio naturale.
Ciò apre la tecnologia a applicazioni che vanno dall’identificazione di un cliente frustrato prima che la chiamata peggiori, alla rilevazione di comportamenti sospetti durante una transazione finanziaria, o all’individuazione di quando un agente vocale IA si comporta in modo inatteso.
A giugno, Modulate ha aperto Velma direttamente agli sviluppatori tramite un’API, ampliando l’accesso oltre le precedenti implementazioni aziendali.
Modulate adotta un approccio ensemble all’IA audio
L’architettura alla base di Velma è ciò che Modulate chiama Ensemble Listening Model, o ELM.
Piuttosto che utilizzare un unico modello enorme per eseguire ogni compito, ELM coordina più di 100 modelli specializzati, con componenti individuali che analizzano diverse caratteristiche di un flusso audio.
Questi modelli possono esaminare proprietà di base come i cambi di speaker e le pause insieme a segnali di livello superiore come emozione, intento percepito, marcatori di voce sintetica, confusione o pattern comportamentali. Uno strato di orchestrazione combina poi queste osservazioni in un’interpretazione più ampia della conversazione.
È una filosofia notevolmente diversa dalla strategia sempre più comune di applicare modelli di base multimodali sempre più grandi all’audio.
Modulate sostiene che la specializzazione consente alla sua architettura di fornire output più trasparenti riducendo la quantità di calcolo necessaria. Per le applicazioni aziendali come la rilevazione di frodi e la conformità, la capacità di capire perché un sistema ha generato un avviso può essere quasi importante quanto l’avviso stesso.
Secondo l’azienda, l’approccio può essere fino a 1.000 volte più efficiente dal punto di vista computazionale rispetto all’uso di un unico modello grande per alcuni carichi di lavoro di analisi audio.
L’IA vocale crea un nuovo problema di monitoraggio
Il tempismo del finanziamento riflette anche un cambiamento più ampio che si sta verificando nell’IA aziendale.
I sistemi IA sono sempre più capaci di condurre conversazioni vocali complete con i clienti. Ciò significa che le aziende devono ora monitorare interazioni che coinvolgono non solo dipendenti umani, ma anche agenti autonomi che operano in migliaia, o potenzialmente milioni, di conversazioni.
Un agente vocale potrebbe tecnicamente seguire uno script, ma continuare a interrompere ripetutamente i clienti, non riconoscere la frustrazione, fraintendere l’intento o rispondere in modo inadeguato a situazioni emotive.
Modulate vede un’opportunità per diventare uno strato di ascolto indipendente che si affianca a quegli agenti.
La sua tecnologia per agenti vocali è progettata per identificare segnali come interruzioni, pause, emozioni, accenti e altre caratteristiche difficili da catturare solo dal testo, consentendo agli sviluppatori di regolare il comportamento di un agente mentre le conversazioni sono ancora in corso.
La stessa infrastruttura può essere applicata alle conversazioni umane in cui le organizzazioni devono identificare frodi, rischi di conformità, molestie o altri eventi potenzialmente significativi in tempo reale.
Dalla moderazione dei giochi a un’intelligenza vocale più ampia
Le attuali ambizioni di Modulate rappresentano un’espansione significativa rispetto al suo precedente focus sul gaming online.
Uno dei suoi prodotti più noti, ToxMod, è stato sviluppato per analizzare le comunicazioni vocali in tempo reale su piattaforme di gioco e social e identificare molestie, minacce, grooming e altri comportamenti dannosi.
Questo rimane una parte importante del business. Modulate afferma che ToxMod può integrarsi direttamente con l’infrastruttura vocale esistente, indirizzando le interazioni potenzialmente problematiche verso sistemi di moderazione o revisori umani.
L’azienda ha collaborato con importanti società di gaming tra cui Activision, Riot Games, Rockstar Games e Rec Room.
Tuttavia, la tecnologia di base necessaria per comprendere la tossicità in un gioco multigiocatore può essere adattata anche ad altri contesti in cui il contesto è fondamentale.
Modulate ora posiziona la sua tecnologia in ambiti quali prevenzione delle frodi, centri di contatto, supervisione di agenti IA, rilevamento di deepfake, esperienza cliente e trust & safety.
La sua piattaforma per sviluppatori offre attualmente più famiglie di modelli che coprono trascrizione, rilevamento di deepfake, redazione audio, intelligenza conversazionale e altre capacità di analisi audio.
I deepfake aggiungono un ulteriore motivo per comprendere direttamente l’audio
Synthetic speech sta diventando un’altra parte importante di questa opportunità.
Man mano che il clonaggio vocale sempre più convincente diventa disponibile, le organizzazioni che gestiscono transazioni finanziarie o informazioni sensibili devono determinare non solo cosa dice un chiamante, ma se la voce stessa è autentica.
Modulate ha quindi ampliato il proprio operato al rilevamento di deepfake, combinando l’analisi della voce sintetica con le informazioni contestuali più ampie disponibili attraverso i suoi modelli audio.
L’azienda afferma che la sua tecnologia analizza attualmente più di 10 milioni di ore di audio al mese e ha elaborato complessivamente oltre 600 milioni di ore.
La sua espansione in settori come il rilevamento di musica generata da IA dimostra anche quanto ampiamente l’architettura di base dell’ensemble possa potenzialmente essere applicata. Il sistema di rilevamento musicale di Modulate, ad esempio, valuta separatamente la presenza di musica, vocali generati da IA e strumentazione generata da IA prima di combinare i segnali in un risultato interpretabile.
La prossima sfida per la Voice AI è comprendere, non parlare
L’investimento da 25 milioni di dollari fornisce a Modulate risorse aggiuntive per espandere la ricerca, l’ingegneria, gli strumenti per sviluppatori e le partnership. In senso più ampio, riflette una crescente sfida per la Voice AI: parlare in modo naturale è solo metà di una conversazione.
Man mano che gli agenti vocali si spostano verso il servizio clienti, la sanità, i servizi finanziari e altri settori, i sistemi dovranno comprendere segnali che le trascrizioni spesso non colgono, inclusi frustrazione, esitazione, enfasi, tono e possibile sintesi vocale.
Ciò potrebbe creare un nuovo strato di intelligenza attorno alle interazioni vocali, aiutando i sistemi a rilevare frodi, riconoscere quando i clienti sono insoddisfatti o identificare quando un agente IA fraintende o gestisce in modo errato una conversazione.
Tuttavia, la tecnologia solleva anche interrogativi riguardo privacy, accuratezza e bias. Inferire emozioni o intenzioni dal parlato è più soggettivo rispetto alla trascrizione delle parole, soprattutto tra diversi accenti, lingue e culture.
Man mano che l’IA diventa sempre più capace di parlare come una persona, la prossima frontiera potrebbe essere determinare quanto bene le macchine possano realmente ascoltare — e quanto responsabilmente vengano utilizzate tali capacità.












