Financiering

Modulate haalt $25M op om de intelligentielaag voor Voice AI te bouwen

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Modulate heeft $25 miljoen aan nieuwe financiering opgehaald terwijl het in Boston gevestigde bedrijf wil profiteren van een groeiende uitdaging in kunstmatige intelligentie: machines leren begrijpen niet alleen wat mensen zeggen, maar ook hoe ze het zeggen.

Future Ventures leidde de ronde, met deelname van Hyperplane en Lakestar. De financiering brengt de totale fondsen van Modulate op $60 miljoen en zal worden gebruikt om haar AI-onderzoek, engineeringteams, ontwikkelaarstools, partnerschappen en inzetopties uit te breiden.

De investering komt op een moment dat spraak steeds vaker een interface wordt voor AI‑agents, klantenserviceplatformen, game‑omgevingen en beveiligingssystemen. Terwijl spraak‑naar‑tekst‑technologie dramatisch is verbeterd, wedt Modulate erop dat alleen transcripties een groot deel van de informatie in menselijke spraak missen.

De technologie analyseert in plaats daarvan de onderliggende audio op signalen zoals emotie, toon, intentie, pauzes, synthetische spraak en gespreksgedrag.

Voorbij spraak‑naar‑tekst gaan

Een groot deel van de hedendaagse voice‑AI‑stack volgt een relatief eenvoudige architectuur: spraak omzetten in tekst en vervolgens het resulterende transcript naar een groot taalmodel (LLM) sturen.

Dat werkt goed wanneer de woorden zelf het grootste deel van de relevante informatie bevatten. Het wordt beperkter wanneer de betekenis afhankelijk is van sarcasme, frustratie, aarzeling, stress, onderbrekingen of toonveranderingen.

Modulate heeft haar vlaggenschipplatform Velma gebouwd rond het idee dat deze signalen rechtstreeks uit de audio moeten worden geanalyseerd in plaats van achteraf uit een transcript te reconstrueren.

Het bedrijf beschrijft Velma als een audio‑native gesprek‑intelligentiesysteem dat in staat is transcripties te produceren terwijl het tegelijkertijd sprekers, emoties, gespreksonderwerpen, sentiment en meer dan 150 gedragingen identificeert. Ontwikkelaars kunnen ook aangepaste gedragingen definiëren met behulp van beschrijvingen in natuurlijke taal.

Dat opent de technologie voor toepassingen variërend van het identificeren van een gefrustreerde klant voordat een gesprek verslechtert tot het detecteren van verdacht gedrag tijdens een financiële transactie of het herkennen wanneer een AI‑spraakagent zich onverwacht gedraagt.

In juni heeft Modulate Velma rechtstreeks voor ontwikkelaars beschikbaar gesteld via een API, waardoor de toegang verder wordt uitgebreid dan de eerdere enterprise‑implementaties.

Modulate hanteert een ensemble‑benadering voor audio‑AI

De architectuur onder Velma noemt Modulate een Ensemble Listening Model, of ELM.

In plaats van één enorm model te gebruiken voor elke taak, coördineert ELM meer dan 100 gespecialiseerde modellen, waarbij individuele componenten verschillende kenmerken van een audiostream analyseren.

Die modellen kunnen basiskenmerken zoals sprekerswisselingen en pauzes onderzoeken, naast hogere‑niveau signalen zoals emotie, waargenomen intentie, synthetische stemmarkeringen, verwarring of gedrags‑patronen. Een orkestratielaag combineert vervolgens die observaties tot een bredere interpretatie van het gesprek.

Het is een duidelijk andere filosofie dan de steeds vaker voorkomende strategie om steeds grotere multimodale funderingsmodellen op audio toe te passen.

Modulate betoogt dat specialisatie haar architectuur in staat stelt transparantere resultaten te leveren terwijl de benodigde rekencapaciteit wordt verminderd. Voor enterprise‑toepassingen zoals fraude‑detectie en compliance kan het vermogen om te begrijpen waarom een systeem een waarschuwing heeft gegenereerd bijna net zo belangrijk zijn als de waarschuwing zelf.

Volgens het bedrijf kan de aanpak tot 1.000 keer efficiënter zijn in termen van rekencapaciteit dan het gebruik van één groot model voor bepaalde audio‑analyse‑werkbelastingen.

Voice AI creëert een nieuw monitoringsprobleem

De timing van de financiering weerspiegelt ook een bredere verschuiving die plaatsvindt binnen enterprise‑AI.

AI‑systemen zijn steeds beter in staat volledige spraakgesprekken met klanten te voeren. Dat betekent dat bedrijven nu interacties moeten monitoren waarbij niet alleen menselijke medewerkers betrokken zijn, maar ook autonome agents die opereren over duizenden of mogelijk miljoenen gesprekken.

Een spraakagent kan technisch gezien een script volgen, maar toch herhaaldelijk klanten onderbreken, geen frustratie herkennen, de intentie verkeerd interpreteren of slecht reageren op emotionele situaties.

Modulate ziet een kans om een onafhankelijke luisterlaag te worden die naast die agents zit.

De voice‑agent‑technologie is ontworpen om signalen zoals onderbrekingen, pauzes, emoties, accenten en andere kenmerken te identificeren die moeilijk alleen uit tekst te halen zijn, waardoor ontwikkelaars het gedrag van een agent kunnen aanpassen terwijl gesprekken nog gaande zijn.

Diezelfde infrastructuur kan worden toegepast op menselijke gesprekken waarbij organisaties in realtime fraude, compliance‑risico’s, intimidatie of andere potentieel belangrijke gebeurtenissen moeten identificeren.

Van game‑moderatie naar bredere spraak‑intelligentie

De huidige ambities van Modulate vormen een aanzienlijke uitbreiding ten opzichte van de eerdere focus op online gaming.

Een van de bekendste producten, ToxMod, is ontwikkeld om live spraakcommunicatie op gaming- en sociale platforms te analyseren en intimidatie, bedreigingen, grooming en ander schadelijk gedrag te identificeren.

Dat blijft een belangrijk onderdeel van de business. Modulate zegt dat ToxMod direct kan integreren met bestaande spraakinfrastructuur, terwijl potentieel problematische interacties worden doorgestuurd naar moderatiesystemen of menselijke beoordelaars.

Het bedrijf heeft samengewerkt met grote gamingbedrijven, waaronder Activision, Riot Games, Rockstar Games en Rec Room.

Maar de onderliggende technologie die nodig is om toxiciteit in een multiplayergame te begrijpen, kan ook worden aangepast aan andere omgevingen waar context van belang is.

Modulate positioneert zijn technologie nu op het gebied van fraudepreventie, contactcentra, toezicht op AI‑agenten, deepfake-detectie, klantbeleving en vertrouwen en veiligheid.

Het ontwikkelaarsplatform biedt momenteel meerdere modelfamilies die transcriptie, deepfake-detectie, audio‑redactie, gesprek‑intelligentie en andere audio‑analysecapaciteiten omvatten.

Deepfakes vormen een extra reden om audio direct te begrijpen

Synthetic speech wordt een ander belangrijk onderdeel van die kans.

Naarmate steeds overtuigender stemkloning beschikbaar komt, moeten organisaties die financiële transacties of gevoelige informatie verwerken niet alleen bepalen wat een beller zegt, maar ook of de stem zelf authentiek is.

Modulate is daardoor uitgebreid naar deepfake-detectie, waarbij synthetische stemanalyse wordt gecombineerd met de bredere contextuele informatie die beschikbaar is via zijn audiomodellen.

Het bedrijf zegt dat zijn technologie momenteel meer dan 10 miljoen uur audio per maand analyseert en in totaal meer dan 600 miljoen uur heeft verwerkt.

De uitbreiding naar gebieden zoals AI‑gegenereerde muziekdetectie laat ook zien hoe breed de onderliggende ensemble‑architectuur potentieel kan worden toegepast. Het muziekdetectiesysteem van Modulate evalueert bijvoorbeeld afzonderlijk de aanwezigheid van muziek, AI‑gegenereerde vocalen en AI‑gegenereerde instrumentatie, voordat de signalen worden gecombineerd tot een interpreteerbaar resultaat.

De volgende uitdaging voor voice‑AI is begrijpen, niet spreken

De investering van $25 miljoen geeft Modulate extra middelen om zijn onderzoek, engineering, ontwikkelaarstools en partnerschappen uit te breiden. In bredere zin weerspiegelt dit een groeiende uitdaging voor voice‑AI: natuurlijk spreken is slechts de helft van een gesprek.

Naarmate voice‑agenten zich uitbreiden naar klantenservice, gezondheidszorg, financiële diensten en andere sectoren, moeten systemen signalen begrijpen die transcripties vaak missen, zoals frustratie, aarzeling, nadruk, toon en mogelijke synthetische spraak.

Dat zou een nieuwe intelligentielaag rond spraakinteracties kunnen creëren, waardoor systemen fraude kunnen detecteren, herkennen wanneer klanten ontevreden zijn, of identificeren wanneer een AI‑agent een gesprek verkeerd begrijpt of afhandelt.

Maar de technologie roept ook vragen op over privacy, nauwkeurigheid en bias. Het afleiden van emotie of intentie uit spraak is subjectiever dan het transcriberen van woorden, vooral over verschillende accenten, talen en culturen.

Naarmate AI steeds beter wordt in spreken als een mens, kan de volgende grens liggen in het bepalen hoe goed machines daadwerkelijk kunnen luisteren — en hoe verantwoord die mogelijkheden worden ingezet.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.