Finansiering

Modulate samlar in $25M för att bygga intelligenslagret för röst‑AI

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Modulate har samlat in $25 million i ny finansiering då det i Boston baserade företaget vill dra nytta av en växande utmaning inom artificiell intelligens: att lära maskiner att förstå inte bara vad människor säger, utan hur de säger det.

Future Ventures ledde rundan, med deltagande från Hyperplane och Lakestar. Finansieringen tar Modulates totala kapital till $60 million och kommer att användas för att expandera dess AI‑forskning, ingenjörsteam, utvecklarverktyg, partnerskap och distributionsalternativ.

Investeringen kommer i ett skede då röst alltmer blir ett gränssnitt för AI‑agenter, kundtjänstplattformar, spelmiljöer och säkerhetssystem. Även om tal‑till‑text‑tekniken har förbättrats dramatiskt, satsar Modulate på att enbart transkript missar en stor del av den information som finns i mänskligt tal.

Dess teknik analyserar istället den underliggande ljudfilen för signaler som känsla, ton, avsikt, pauser, syntetiskt tal och samtalsbeteende.

Att gå bortom tal‑till‑text

En stor del av dagens röst‑AI‑stack följer en relativt enkel arkitektur: konvertera tal till text och sedan skicka det resulterande transkriptet till en stor språkmodell (LLM).

Det fungerar bra när orden själva innehåller det mesta av den relevanta informationen. Det blir mer begränsande när betydelsen beror på sarkasm, frustration, tvekan, stress, avbrott eller förändringar i ton.

Modulate har byggt sin flaggskeppsplattform Velma kring idén att dessa signaler bör analyseras direkt från ljudet snarare än att rekonstrueras i efterhand från ett transkript.

Företaget beskriver Velma som ett ljud‑inbyggt konversationsintelligenssystem som kan producera transkript samtidigt som det identifierar talare, känslor, samtalsämnen, sentiment och mer än 150 beteenden. Utvecklare kan också definiera anpassade beteenden med hjälp av naturliga språkbeskrivningar.

Det öppnar tekniken för tillämpningar som sträcker sig från att identifiera en frustrerad kund innan ett samtal försämras till att upptäcka misstänkt beteende under en finansiell transaktion eller att identifiera när en AI‑röstagent beter sig oväntat.

I juni öppnade Modulate Velma direkt för utvecklare via ett API, vilket breddade åtkomsten bortom dess tidigare företagsdistributioner.

Modulate använder ett ensemble‑tillvägagångssätt för ljud‑AI

Arkitekturen under Velma är vad Modulate kallar en Ensemblelyssningsmodell, eller ELM.

Istället för att använda en enorm modell för att utföra alla uppgifter, koordinerar ELM mer än 100 specialiserade modeller, där enskilda komponenter analyserar olika egenskaper i ett ljudflöde.

Dessa modeller kan undersöka grundläggande egenskaper som talarförändringar och pauser tillsammans med högre nivå‑signaler som känsla, uppfattad avsikt, syntetiska röstmarkörer, förvirring eller beteendemönster. Ett orkestreringslager kombinerar sedan dessa observationer till en bredare tolkning av samtalet.

Det är en påtagligt annorlunda filosofi jämfört med den allt vanligare strategin att applicera allt större multimodala grundmodeller på ljud.

Modulate hävdar att specialisering gör det möjligt för deras arkitektur att leverera mer transparenta resultat samtidigt som den minskar den nödvändiga beräkningsmängden. För företagsapplikationer som bedrägeridetektion och efterlevnad kan förmågan att förstå varför ett system har gett en varning vara nästan lika viktig som själva varningen.

Enligt företaget kan tillvägagångssättet vara upp till 1 000 gånger mer beräkningsmässigt effektivt än att använda en enda stor modell för vissa ljudanalysuppgifter.

Röst‑AI skapar ett nytt övervakningsproblem

Tidpunkten för finansieringen speglar också en bredare förändring som sker inom företags‑AI.

AI‑system blir alltmer kapabla att föra kompletta röstkonversationer med kunder. Det innebär att företag nu måste övervaka interaktioner som involverar inte bara mänskliga anställda utan även autonoma agenter som hanterar tusentals eller potentiellt miljontals samtal.

En röstagent kan tekniskt sett följa ett manus men ändå upprepade gånger avbryta kunder, misslyckas med att upptäcka frustration, missförstå avsikt eller svara dåligt på känslomässiga situationer.

Modulate ser en möjlighet att bli ett oberoende lyssningslager som sitter bredvid dessa agenter.

Dess röst‑agentteknik är utformad för att identifiera signaler som avbrott, pauser, känslor, accenter och andra egenskaper som är svåra att fånga enbart från text, vilket gör det möjligt för utvecklare att justera en agents beteende medan samtalen pågår.

Samma infrastruktur kan tillämpas på mänskliga samtal där organisationer behöver identifiera bedrägerier, efterlevnadsrisker, trakasserier eller andra potentiellt betydelsefulla händelser i realtid.

Från spelmoderering till bredare röstintelligens

Modulates nuvarande ambitioner representerar en betydande expansion från dess tidigare fokus på onlinespel.

En av dess mest kända produkter, ToxMod, utvecklades för att analysera live röstkommunikation på spel- och sociala plattformar och identifiera trakasserier, hot, grooming och annat skadligt beteende.

Det förblir en viktig del av verksamheten. Modulate säger att ToxMod kan integreras direkt med befintlig röstinfrastruktur samtidigt som potentiellt problematiska interaktioner dirigeras till modereringssystem eller mänskliga granskare.

Företaget har samarbetat med stora spelbolag inklusive Activision, Riot Games, Rockstar Games och Rec Room.

Men den underliggande tekniken som krävs för att förstå toxicitet i ett multiplayer‑spel kan också anpassas till andra miljöer där sammanhang är viktigt.

Modulate placerar nu sin teknik inom bedrägeriförebyggande, kontaktcenter, AI‑agentövervakning, deepfake‑detektion, kundupplevelse samt förtroende och säkerhet.

Dess utvecklarplattform erbjuder för närvarande flera modellfamiljer som omfattar transkription, deepfake‑detektion, ljudredigering, konversationsintelligens och andra ljudanalysfunktioner.

Deepfakes ger ytterligare en anledning att förstå ljud direkt

Syntetiskt tal blir en annan viktig del av den möjligheten.

När allt mer övertygande röstkloning blir tillgänglig måste organisationer som hanterar finansiella transaktioner eller känslig information avgöra inte bara vad en uppringare säger utan även om rösten i sig är autentisk.

Modulate har därför expanderat till deepfake‑detektion, genom att kombinera syntetisk röstanalys med den bredare kontextinformation som finns tillgänglig via dess ljudmodeller.

Företaget säger att dess teknik för närvarande analyserar mer än 10 miljoner timmars ljud per månad och har bearbetat över 600 miljoner timmar totalt.

Dess expansion till områden som AI‑genererad musikdetektering visar också hur brett den underliggande ensemblearkitekturen potentiellt kan tillämpas. Modulates musikdetekteringssystem utvärderar till exempel separat förekomsten av musik, AI‑genererade sångpartier och AI‑genererade instrument innan signalerna kombineras till ett tolkningsbart resultat.

Nästa utmaning för röst‑AI är att förstå, inte att tala

Den $25 miljoner stora investeringen ger Modulate ytterligare resurser för att expandera sin forskning, ingenjörskonst, utvecklarverktyg och partnerskap. På ett bredare plan speglar den en växande utmaning för röst‑AI: att tala naturligt är bara hälften av en konversation.

När röstagenter går in i kundservice, sjukvård, finansiella tjänster och andra områden kommer systemen behöva förstå signaler som transkript ofta missar, inklusive frustration, tvekan, betoning, ton och möjlig syntetisk tal.

Det kan skapa ett nytt intelligenslager kring röstinteraktioner, vilket hjälper system att upptäcka bedrägerier, känna igen när kunder är missnöjda eller identifiera när en AI‑agent missförstår eller hanterar en konversation felaktigt.

Men tekniken väcker också frågor kring integritet, noggrannhet och bias. Att härleda känslor eller avsikter från tal är mer subjektivt än att transkribera ord, särskilt över olika accenter, språk och kulturer.

När AI blir alltmer kapabel att tala som en människa kan nästa gräns vara att avgöra hur väl maskiner faktiskt kan lyssna – och hur ansvarsfullt dessa förmågor används.

Antoine är en visionär ledare och medgrundare av Unite.AI, driven av en outtröttlig passion för att forma och främja framtidens AI och robotik. En serieentreprenör, han tror att AI kommer att vara lika störande för samhället som elektricitet, och han fångas ofta i att prata om potentialen för störande teknologier och AGI.

Som en futurist är han dedikerad till att utforska hur dessa innovationer kommer att forma vår värld. Dessutom är han grundare av Securities.io, en plattform som fokuserar på att investera i banbrytande teknologier som omdefinierar framtiden och omformar hela sektorer.