Finansiering

Modulate henter 25 million dollar for å bygge intelligenslaget for stemme‑AI

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Modulate har hentet 25 millioner dollar i ny finansiering mens selskapet i Boston ser etter å utnytte en økende utfordring innen kunstig intelligens: å lære maskiner å forstå ikke bare hva folk sier, men også hvordan de sier det.

Future Ventures ledet runden, med deltakelse fra Hyperplane og Lakestar. Finansieringen bringer Modulates totale kapital til 60 millioner dollar og vil bli brukt til å utvide AI‑forsknings‑ og ingeniørteamene, utviklerverktøy, partnerskap og distribusjonsalternativer.

Investeringen kommer i en tid da stemmen i økende grad blir et grensesnitt for AI‑agenter, kundeserviceløsninger, spillmiljøer og sikkerhetssystemer. Selv om tale‑til‑tekst‑teknologien har forbedret seg dramatisk, satser Modulate på at kun transkripsjoner etterlater mye av informasjonen som ligger i menneskelig tale.

Teknologien analyserer i stedet den underliggende lyden for signaler som følelser, tone, intensjon, pauser, syntetisk tale og samtaleatferd.

Gå utover tale‑til‑tekst

Mye av dagens stemme‑AI‑stabel følger en relativt enkel arkitektur: konverter tale til tekst og send deretter den resulterende transkripsjonen til en stor språkmodell (LLM).

Det fungerer bra når ordene i seg selv inneholder mesteparten av den relevante informasjonen. Det blir mer begrensende når meningen avhenger av sarkasme, frustrasjon, nøling, stress, avbrytelser eller toneendringer.

Modulate har bygget sin flaggskipplattform Velma rundt ideen om at disse signalene bør analyseres direkte fra lyden i stedet for å rekonstrueres etterpå fra en transkripsjon.

Selskapet beskriver Velma som et lyd‑native samtale‑intelligenssystem som kan produsere transkripsjoner samtidig som det identifiserer talere, følelser, samtaleemner, sentiment og mer enn 150 atferdsmønstre. Utviklere kan også definere egendefinerte atferder ved hjelp av naturlige språkbeskrivelser.

Det åpner teknologien for applikasjoner som å identifisere en frustrert kunde før en samtale forverres, oppdage mistenkelig atferd under en finansiell transaksjon eller oppdage når en AI‑stemmeagent oppfører seg uventet.

I juni åpnet Modulate Velma direkte for utviklere via et API, og utvidet tilgangen utover sine tidligere bedrifts‑implementeringer.

Modulate tar en ensemble‑tilnærming til lyd‑AI

Arkitekturen under Velma er det Modulate kaller en Ensemble Listening Model, eller ELM.

I stedet for å bruke én enorm modell til å utføre alle oppgaver, koordinerer ELM mer enn 100 spesialiserte modeller, hvor hver komponent analyserer ulike egenskaper ved en lydstrøm.

Disse modellene kan undersøke grunnleggende egenskaper som talerbytter og pauser sammen med høyere‑nivå‑signal som følelser, oppfattet intensjon, syntetiske stemmemarkører, forvirring eller atferdsmønstre. Et orkestreringslag kombinerer deretter disse observasjonene til en bredere tolkning av samtalen.

Dette er en merkbart annen filosofi enn den stadig mer vanlige strategien med å anvende stadig større multimodale grunnmodeller på lyd.

Modulate hevder at spesialisering gjør at arkitekturen kan levere mer transparente resultater samtidig som den reduserer mengden beregning som kreves. For bedriftsapplikasjoner som svindeldeteksjon og etterlevelse kan evnen til å forstå hvorfor et system har utløst en alarm være nesten like viktig som selve alarmen.

Ifølge selskapet kan tilnærmingen være opptil 1 000 ganger mer beregningsmessig effektiv enn å bruke én stor modell for enkelte lyd‑analyse‑arbeidsbelastninger.

Stemme‑AI skaper et nytt overvåkningsproblem

Tidspunktet for finansieringen gjenspeiler også et bredere skifte som skjer innen bedrifts‑AI.

AI‑systemer blir i økende grad i stand til å gjennomføre komplette stemmesamtaler med kunder. Det betyr at selskaper nå må overvåke interaksjoner som involverer både menneskelige ansatte og autonome agenter som opererer på tusenvis, eller potensielt millioner, av samtaler.

En stemmeagent kan teknisk sett følge et manus, men likevel gjentatte ganger avbryte kunder, unnlate å gjenkjenne frustrasjon, misforstå intensjon eller svare dårlig på emosjonelle situasjoner.

Modulate ser en mulighet til å bli et uavhengig lyttelag som sitter ved siden av disse agentene.

Deres stemme‑agent‑teknologi er designet for å identifisere signaler som avbrytelser, pauser, følelser, aksenter og andre egenskaper som er vanskelige å fange fra kun tekst, slik at utviklere kan justere en agents oppførsel mens samtalen pågår.

Den samme infrastrukturen kan brukes på menneskelige samtaler der organisasjoner trenger å identifisere svindel, etterlevelsesrisiko, trakassering eller andre potensielt betydningsfulle hendelser i sanntid.

Fra spillmoderering til bredere stemme‑intelligens

Modulates nåværende ambisjoner representerer en betydelig utvidelse fra deres tidligere fokus på nettspill.

Et av deres mest kjente produkter, ToxMod, ble utviklet for å analysere direkte talekommunikasjon på spill- og sosiale plattformer og identifisere trakassering, trusler, grooming og annen skadelig atferd.

Det forblir en viktig del av virksomheten. Modulate sier at ToxMod kan integreres direkte med eksisterende taleinfrastruktur samtidig som potensielt problematiske interaksjoner kan rutes til moderasjonsystemer eller menneskelige vurderere.

Selskapet har samarbeidet med store spillbedrifter, inkludert Activision, Riot Games, Rockstar Games og Rec Room.

Men den underliggende teknologien som kreves for å forstå giftighet i et flerspillerspill, kan også tilpasses andre miljøer der kontekst er viktig.

Modulate posisjonerer nå sin teknologi innen svindelforebygging, kontaktsentre, AI-agentovervåking, deepfake-deteksjon, kundeopplevelse samt tillit og sikkerhet.

Utviklerplattformen tilbyr for tiden flere modellfamilier som dekker transkripsjon, deepfake-deteksjon, lydredigering, samtaleintelligens og andre lydanalysefunksjoner.

Deepfakes gir en ekstra grunn til å forstå lyd direkte

syntetisk tale blir en annen viktig del av den muligheten.

Ettersom stadig mer overbevisende stemmekloning blir tilgjengelig, må organisasjoner som håndterer finansielle transaksjoner eller sensitiv informasjon kunne fastslå ikke bare hva en innringer sier, men også om stemmen i seg selv er ekte.

Modulate har derfor utvidet seg til deepfake-deteksjon, ved å kombinere analyse av syntetisk stemme med den bredere kontekstuelle informasjonen som er tilgjengelig gjennom deres lydmodeller.

Selskapet sier at teknologien for tiden analyserer mer enn 10 millioner timer med lyd per måned og har behandlet over 600 millioner timer totalt.

Utvidelsen til områder som AI-generert musikkdeteksjon viser også hvor bredt den underliggende ensemble-arkitekturen potensielt kan brukes. Modulates musikkdeteksjonssystem evaluerer for eksempel separat tilstedeværelsen av musikk, AI-genererte vokaler og AI-generert instrumentering før signalene kombineres til et tolkningsbart resultat.

Den neste utfordringen for stemme‑AI er forståelse, ikke tale

$25 million investering gir Modulate ekstra ressurser til å utvide sin forskning, ingeniørvirksomhet, utviklerverktøy og partnerskap. På et bredere plan reflekterer den en økende utfordring for stemme‑AI: å snakke naturlig er bare halve samtalen.

Etter hvert som stemmeagenter beveger seg inn i kundeservice, helsevesen, finansielle tjenester og andre felt, vil systemene måtte forstå signaler som transkripsjoner ofte overser, inkludert frustrasjon, nøling, vektlegging, tone og mulig syntetisk tale.

Dette kan skape et nytt intelligenslag rundt stemmeinteraksjoner, som hjelper systemer med å oppdage svindel, gjenkjenne når kunder er misfornøyde, eller identifisere når en AI-agent misforstår eller håndterer en samtale feil.

Men teknologien reiser også spørsmål om personvern, nøyaktighet og skjevhet. Å tolke følelser eller intensjon fra tale er mer subjektivt enn å transkribere ord, spesielt på tvers av ulike aksenter, språk og kulturer.

Etter hvert som AI blir stadig mer i stand til å snakke som et menneske, kan neste grense være å fastslå hvor godt maskiner faktisk kan lytte – og hvor ansvarlig disse evnene blir brukt.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.