Finanțare
Modulate strânge $25M pentru a construi stratul de inteligență pentru Voice AI

Modulate a strâns 25 de milioane de dolari în finanțare nouă, în timp ce compania cu sediul în Boston caută să profite de o provocare în creștere în inteligența artificială: să învețe mașinile să înțeleagă nu doar ce spun oamenii, ci și cum îl spun.
Future Ventures a condus runda, cu participarea Hyperplane și Lakestar. Finanțarea aduce totalul de finanțare al Modulate la 60 de milioane de dolari și va fi folosită pentru a extinde cercetarea AI, echipele de inginerie, instrumentele pentru dezvoltatori, parteneriatele și opțiunile de implementare.
Investiția apare în momentul în care vocea devine din ce în ce mai mult o interfață pentru agenții AI, platforme de servicii pentru clienți, medii de jocuri și sisteme de securitate. Deși tehnologia de recunoaștere a vorbirii a evoluat dramatic, Modulate consideră că transcrierile singure omite o mare parte a informațiilor conținute în vorbirea umană.
Tehnologia sa analizează în schimb audio-ul de bază pentru semnale precum emoția, tonul, intenția, pauzele, vorbirea sintetică și comportamentul conversațional.
Dincolo de Speech-to-Text
Marea parte a stivei de voice AI de astăzi urmează o arhitectură relativ simplă: convertește vorbirea în text și apoi trimite transcrierea rezultată unui model lingvistic mare (LLM).
Aceasta funcționează bine atunci când cuvintele în sine conțin cea mai mare parte a informațiilor relevante. Devine însă limitativă când sensul depinde de sarcasm, frustrare, ezitare, stres, întreruperi sau schimbări de ton.
Modulate și-a construit platforma sa emblematică Velma în jurul ideii că aceste semnale ar trebui analizate direct din audio, în loc să fie reconstruite ulterior dintr-o transcriere.
Compania descrie Velma ca un sistem de inteligență conversațională nativ audio, capabil să producă transcrieri în timp ce identifică simultan vorbitorii, emoțiile, subiectele conversaționale, sentimentul și peste 150 de comportamente. Dezvoltatorii pot, de asemenea, să definească comportamente personalizate folosind descrieri în limbaj natural.
Aceasta deschide tehnologia către aplicații care variază de la identificarea unui client frustrat înainte ca apelul să se deterioreze, la detectarea unui comportament suspect în timpul unei tranzacții financiare sau la identificarea momentului în care un agent vocal AI se comportă neașteptat.
În iunie, Modulate a deschis Velma direct dezvoltatorilor printr-un API, extinzând accesul dincolo de implementările sale anterioare pentru întreprinderi.
Modulate adoptă o abordare de tip ansamblu pentru Audio AI
Arhitectura de sub Velma este ceea ce Modulate numește un Ensemble Listening Model, sau ELM.
În loc să folosească un singur model enorm pentru a îndeplini fiecare sarcină, ELM coordonează peste 100 de modele specializate, cu componente individuale care analizează diferite caracteristici ale unui flux audio.
Aceste modele pot examina proprietăți de bază, cum ar fi schimbările de vorbitor și pauzele, alături de semnale de nivel superior, cum ar fi emoția, intenția percepută, marcatorii de voce sintetică, confuzia sau tiparele comportamentale. Un strat de orchestrare combină apoi acele observații într-o interpretare mai largă a conversației.
Este o filosofie remarcabil diferită de strategia din ce în ce mai comună de a aplica modele de bază multimodale tot mai mari asupra audio-ului.
Modulate susține că specializarea permite arhitecturii sale să ofere rezultate mai transparente, reducând în același timp cantitatea de calcul necesară. Pentru aplicații enterprise, cum ar fi detectarea fraudei și conformitatea, capacitatea de a înțelege de ce un sistem a generat o alertă poate fi aproape la fel de importantă ca alerta în sine.
Conform companiei, abordarea poate fi până la 1.000 de ori mai eficientă din punct de vedere computațional decât utilizarea unui singur model mare pentru unele sarcini de analiză audio.
Voice AI creează o nouă problemă de monitorizare
Momentul finanțării reflectă, de asemenea, o schimbare mai amplă care are loc în AI pentru întreprinderi.
Sistemele AI devin din ce în ce mai capabile să desfășoare conversații vocale complete cu clienții. Aceasta înseamnă că firmele trebuie acum să monitorizeze interacțiunile care implică nu doar angajați umani, ci și agenți autonomi care operează în mii sau potențial milioane de conversații.
Un agent vocal ar putea, din punct de vedere tehnic, să urmeze un scenariu, dar să întrerupă în mod repetat clienții, să nu recunoască frustrarea, să înțeleagă greșit intenția sau să răspundă neadecvat la situații emoționale.
Modulate vede o oportunitate de a deveni un strat independent de ascultare, situat alături de acei agenți.
Tehnologia sa de agenți vocali este concepută pentru a identifica semnale precum întreruperi, pauze, emoții, accente și alte caracteristici dificil de capturat doar din text, permițând dezvoltatorilor să ajusteze comportamentul unui agent în timp ce conversațiile sunt în desfășurare.
Aceeași infrastructură poate fi aplicată conversațiilor umane în care organizațiile trebuie să identifice fraude, riscuri de conformitate, hărțuire sau alte evenimente potențial semnificative în timp real.
De la moderarea jocurilor la inteligență vocală mai largă
Ambițiile actuale ale Modulate reprezintă o extindere semnificativă față de concentrarea sa anterioară pe jocurile online.
Unul dintre cele mai cunoscute produse ale sale, ToxMod, a fost dezvoltat pentru a analiza comunicațiile vocale în timp real pe platforme de jocuri și sociale și pentru a identifica hărțuirea, amenințările, grooming-ul și alte comportamente dăunătoare.
Acesta rămâne o parte importantă a afacerii. Modulate afirmă că ToxMod poate fi integrat direct în infrastructura vocală existentă, redirecționând interacțiunile potențial problematice către sistemele de moderare sau către recenzori umani.
Compania a colaborat cu mari companii de jocuri, inclusiv Activision, Riot Games, Rockstar Games și Rec Room.
Însă tehnologia de bază necesară pentru a înțelege toxicitatea într-un joc multiplayer poate fi, de asemenea, adaptată la alte medii în care contextul contează.
Modulate își poziționează acum tehnologia în domenii precum prevenirea fraudei, centrele de contact, supravegherea agenților AI, detectarea deepfake-urilor, experiența clienților și încrederea și siguranța.
Platforma sa pentru dezvoltatori oferă în prezent mai multe familii de modele care acoperă transcrierea, detectarea deepfake-urilor, redactarea audio, inteligența conversațională și alte capabilități de analiză audio.
Deepfake-urile adaugă un alt motiv pentru a înțelege direct audio-ul
Vorbire sintetică devine o altă parte importantă a acestei oportunități.
Pe măsură ce clonarea vocală devine din ce în ce mai convingătoare, organizațiile care gestionează tranzacții financiare sau informații sensibile trebuie să determine nu doar ce spune apelantul, ci și dacă vocea în sine este autentică.
Modulate a extins, prin urmare, în domeniul detectării deepfake-urilor, combinând analiza vocii sintetice cu informațiile contextuale mai ample disponibile prin modelele sale audio.
Compania afirmă că tehnologia sa analizează în prezent peste 10 milioane de ore de audio pe lună și a procesat peste 600 de milioane de ore în total.
Extinderea sa în domenii precum detectarea muzicii generate de AI ilustrează, de asemenea, cât de larg ar putea fi aplicată arhitectura de ansamblu de bază. Sistemul de detectare a muzicii al Modulate, de exemplu, evaluează separat prezența muzicii, a vocalelor generate de AI și a instrumentației generate de AI înainte de a combina semnalele într-un rezultat interpretabil.
Următoarea provocare pentru AI-ul vocal este înțelegerea, nu vorbirea
Investiția de 25 de milioane de dolari oferă Modulate resurse suplimentare pentru a-și extinde cercetarea, ingineria, instrumentele pentru dezvoltatori și parteneriatele. Într-un sens mai larg, aceasta reflectă o provocare în creștere pentru AI-ul vocal: vorbirea naturală reprezintă doar jumătate dintr-o conversație.
Pe măsură ce agenții vocali pătrund în serviciul clienți, sănătate, servicii financiare și alte domenii, sistemele vor trebui să înțeleagă semnale pe care transcrierile le omite adesea, inclusiv frustrarea, ezitarea, accentuarea, tonul și eventualele voci sintetice.
Acest lucru ar putea crea un nou strat de inteligență în jurul interacțiunilor vocale, ajutând sistemele să detecteze fraude, să recunoască când clienții sunt nemulțumiți sau să identifice când un agent AI înțelege greșit sau gestionează incorect o conversație.
Însă tehnologia ridică și întrebări legate de confidențialitate, acuratețe și părtinire. Inferența emoțiilor sau a intențiilor din vorbire este mai subiectivă decât transcrierea cuvintelor, în special în contextul diferitelor accente, limbi și culturi.
Pe măsură ce AI devine din ce în ce mai capabil să vorbească ca o persoană, următoarea frontieră ar putea fi determinarea cât de bine pot mașinile să asculte cu adevărat — și cât de responsabil sunt utilizate aceste capabilități.












