Finansiering
Modulate rejser $25M for at bygge intelligenslaget til Voice AI

Modulate har rejst $25 million i ny finansiering, mens det Boston-baserede firma ser en mulighed i en voksende udfordring inden for kunstig intelligens: at lære maskiner at forstå ikke kun hvad folk siger, men også hvordan de siger det.
Future Ventures ledte runden, med deltagelse fra Hyperplane og Lakestar. Finansieringen bringer Modulates samlede kapital til $60 million og vil blive brugt til at udvide deres AI-forskning, ingeniørteams, udviklerværktøjer, partnerskaber og implementeringsmuligheder.
Investeringen kommer på et tidspunkt, hvor stemme i stigende grad bliver en grænseflade for AI‑agenter, kundeserviceplatforme, spilmiljøer og sikkerhedssystemer. Selvom tale‑til‑tekst‑teknologien er forbedret markant, satser Modulate på, at transskriptioner alene udelader meget af den information, der er indeholdt i menneskelig tale.
Dens teknologi analyserer i stedet den underliggende lyd for signaler såsom følelser, tone, intention, pauser, syntetisk tale og samtalemønstre.
Udover tale‑til‑tekst
Mere end halvdelen af nutidens voice‑AI‑stack følger en relativt enkel arkitektur: konvertere tale til tekst og derefter sende den resulterende transskription til en stor sprogmodel (LLM).
Det fungerer godt, når ordene selv indeholder det meste af den relevante information. Det bliver mere begrænsende, når betydningen afhænger af sarkasme, frustration, tøven, stress, afbrydelser eller toneændringer.
Modulate har bygget sin flagskibsplatform Velma omkring idéen om, at disse signaler bør analyseres direkte fra lyden i stedet for at blive rekonstrueret bagefter fra en transskription.
Firmaet beskriver Velma som et lyd‑native samtale‑intelligenssystem, der kan producere transskriptioner, mens det samtidig identificerer talere, følelser, samtaleemner, sentiment og over 150 adfærdsmønstre. Udviklere kan også definere brugerdefinerede adfærdsmønstre ved hjælp af naturlige sprog‑beskrivelser.
Det åbner teknologien for anvendelser, der spænder fra at identificere en frustreret kunde, før et opkald forværres, til at opdage mistænkelig adfærd under en finansiel transaktion eller at identificere, hvornår en AI‑stemmeagent opfører sig uventet.
I juni åbnede Modulate Velma direkte for udviklere via et API, hvilket udvidede adgangen ud over de tidligere enterprise‑implementeringer.
Modulate anvender en ensemble‑tilgang til lyd‑AI
Arkitekturen under Velma er det, Modulate kalder en Ensemble Listening Model, eller ELM.
I stedet for at bruge én enorm model til at udføre alle opgaver, koordinerer ELM mere end 100 specialiserede modeller, hvor enkelte komponenter analyserer forskellige egenskaber ved en lydstrøm.
Disse modeller kan undersøge grundlæggende egenskaber såsom taler‑skift og pauser samt højere‑niveau signaler som følelser, opfattet intention, syntetiske stemmemarkører, forvirring eller adfærdsmønstre. Et orkestreringslag kombinerer derefter disse observationer til en bredere fortolkning af samtalen.
Det er en markant anderledes filosofi end den stadig mere udbredte strategi om at anvende stadigt større multimodale grundmodeller på lyd.
Modulate argumenterer for, at specialisering gør det muligt for deres arkitektur at levere mere gennemsigtige resultater, samtidig med at den reducerer den nødvendige beregning. For enterprise‑applikationer som svindelopsporing og overholdelse kan evnen til at forstå, hvorfor et system udløste en alarm, være næsten lige så vigtig som selve alarmen.
Ifølge virksomheden kan tilgangen være op til 1.000 gange mere beregningseffektiv end at bruge en enkelt stor model til visse lyd‑analyse‑arbejdsbelastninger.
Voice AI skaber et nyt overvågningsproblem
Tidsrammen for finansieringen afspejler også en bredere forandring, der finder sted inden for enterprise‑AI.
AI‑systemer er i stigende grad i stand til at føre komplette stemme‑samtaler med kunder. Det betyder, at virksomheder nu skal overvåge interaktioner, der involverer ikke kun menneskelige medarbejdere, men også autonome agenter, der opererer på tværs af tusinder eller potentielt millioner af samtaler.
En stemmeagent kan teknisk set følge et manuskript, mens den stadig gentagne gange afbryder kunder, ikke genkender frustration, misforstår intention eller reagerer dårligt på følelsesmæssige situationer.
Modulate ser en mulighed for at blive et uafhængigt lytte‑lag, der sidder ved siden af disse agenter.
Dens stemme‑agent‑teknologi er designet til at identificere signaler såsom afbrydelser, pauser, følelser, accenter og andre karakteristika, der er svære at indfange udelukkende fra tekst, så udviklere kan justere en agents adfærd, mens samtalerne stadig foregår.
Den samme infrastruktur kan anvendes på menneskelige samtaler, hvor organisationer har brug for at identificere svindel, overholdelsesrisici, chikane eller andre potentielt betydningsfulde begivenheder i realtid.
Fra spilmoderation til bredere stemme‑intelligens
Modulates nuværende ambitioner udgør en betydelig udvidelse fra deres tidligere fokus på online gaming.
Et af deres mest kendte produkter, ToxMod, blev udviklet til at analysere live stemmekommunikation på gaming‑ og sociale platforme og identificere chikane, trusler, grooming og anden skadelig adfærd.
Det forbliver en vigtig del af forretningen. Modulate siger, at ToxMod kan integreres direkte med eksisterende stemme‑infrastruktur, mens potentielt problematiske interaktioner dirigeres til moderationssystemer eller menneskelige gennemgangere.
Virksomheden har arbejdet med store gaming‑firmaer, herunder Activision, Riot Games, Rockstar Games og Rec Room.
Men den underliggende teknologi, der kræves for at forstå toksicitet i et multiplayer‑spil, kan også tilpasses andre miljøer, hvor kontekst er afgørende.
Modulate placerer nu sin teknologi inden for svindelforebyggelse, kontaktcentre, AI‑agent‑overvågning, deepfake‑detektion, kundeoplevelse samt tillid og sikkerhed.
Deres udviklerplatform tilbyder i øjeblikket flere modelfamilier, der dækker transskription, deepfake‑detektion, lydredigering, samtaleintelligens og andre lydanalyse‑funktioner.
Deepfakes giver endnu en grund til at forstå lyd direkte
Syntetisk tale bliver en anden vigtig del af denne mulighed.
Efterhånden som stadig mere overbevisende stemmekloning bliver tilgængelig, skal organisationer, der håndterer finansielle transaktioner eller følsomme oplysninger, afgøre ikke kun, hvad en opkalder siger, men også om stemmen selv er autentisk.
Modulate har derfor udvidet til deepfake‑detektion, hvor syntetisk stemmeanalyse kombineres med den bredere kontekstuelle information, der er tilgængelig gennem deres lydmodeller.
Virksomheden siger, at deres teknologi i øjeblikket analyserer mere end 10 millioner timers lyd pr. måned og har behandlet over 600 millioner timers lyd samlet set.
Dens udvidelse til områder som AI‑genereret musikdetektion illustrerer også, hvor bredt den underliggende ensemble‑arkitektur potentielt kan anvendes. Modulates musikdetektionssystem evaluerer for eksempel separat tilstedeværelsen af musik, AI‑genererede vokaler og AI‑genereret instrumentering, før signalerne kombineres til et fortolkeligt resultat.
Den næste udfordring for stemme‑AI er forståelse, ikke tale
Den $25 millioners investering giver Modulate yderligere ressourcer til at udvide deres forskning, ingeniørarbejde, udviklerværktøjer og partnerskaber. Mere overordnet afspejler den en voksende udfordring for stemme‑AI: at tale naturligt er kun halvdelen af en samtale.
Efterhånden som stemme‑agenter bevæger sig ind i kundeservice, sundhedssektoren, finansielle tjenester og andre områder, vil systemerne skulle forstå signaler, som transskriptioner ofte overser, herunder frustration, tøven, betoning, tone og mulig syntetisk tale.
Det kan skabe et nyt intelligenslag omkring stemmeinteraktioner, som hjælper systemer med at opdage svindel, genkende når kunder er utilfredse, eller identificere når en AI‑agent misforstår eller håndterer en samtale forkert.
Men teknologien rejser også spørgsmål om privatliv, nøjagtighed og bias. At udlede følelser eller intentioner fra tale er mere subjektivt end at transskribere ord, især på tværs af forskellige accenter, sprog og kulturer.
Efterhånden som AI bliver i stigende grad i stand til at tale som et menneske, kan den næste frontlinje være at afgøre, hvor godt maskiner faktisk kan lytte — og hvor ansvarligt disse evner anvendes.












