AI-modellen en platforms

Modulate Introduceert Ensemble Listening Models, waarmee de manier waarop AI de menselijke stem begrijpt wordt herdefinieerd

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Kunstmatige intelligentie heeft snel vooruitgang geboekt, maar één gebied is consistent moeilijk gebleven: het echt begrijpen van de menselijke stem. Niet alleen de woorden die worden gesproken, maar de emotie erachter, de intentie die wordt gevormd door toon en timing, en de subtiele signalen die vriendelijke spot van frustratie, bedrog of kwaad onderscheiden. Vandaag heeft Modulate een belangrijke doorbraak aangekondigd met de introductie van de Ensemble Listening Model (ELM), een nieuwe AI-architectuur die specifiek is ontworpen voor het begrijpen van de menselijke stem in de praktijk.

Naast de onderzoeksannonce, heeft Modulate Velma 2.0 onthuld, de eerste productie-implementatie van een Ensemble Listening Model. Het bedrijf meldt dat Velma 2.0 de leidende foundation models in conversatie-accuraatheid overtreft, terwijl het op een fractie van de kosten werkt, een opmerkelijke claim op een moment waarop ondernemingen de duurzaamheid van grootschalige AI-implementaties opnieuw beoordelen.

Waarom Stem voor AI Moeilijk is Geweest

De meeste AI-systemen die spraak analyseren, volgen een vertrouwde aanpak. Audio wordt omgezet in tekst, en die transcriptie wordt vervolgens verwerkt door een groot taalmodel. Hoewel effectief voor transcriptie en samenvatting, verwijdert dit proces veel van wat de stem betekenisvol maakt.

Toon, emotionele inflexie, aarzeling, sarcasme, overlappende spraak en achtergrondruis dragen alle belangrijke context. Wanneer spraak wordt platgedrukt in tekst, gaan die dimensies verloren, vaak resulterend in verkeerde interpretatie van intentie of sentiment. Dit wordt vooral problematisch in omgevingen zoals klantenservice, fraude-opsporing, online gaming en AI-gedreven communicatie, waar nuance rechtstreeks van invloed is op resultaten.

Volgens Modulate is deze beperking architectonisch en niet data-gedreven. Grote taalmodellen zijn geoptimaliseerd voor tekstvoorspelling, niet voor het integreren van meerdere akoestische en gedragsignalen in real-time. Ensemble Listening Models zijn gemaakt om die kloof te dichten.

Wat is een Ensemble Listening Model?

Een Ensemble Listening Model is geen enkel neuronaal netwerk dat alles tegelijk doet. In plaats daarvan is het een gecoördineerd systeem dat bestaat uit veel gespecialiseerde modellen, elk verantwoordelijk voor het analyseren van een andere dimensie van een steminteractie.

Binnen een ELM onderzoeken afzonderlijke modellen emotie, stress, bedrogindicatoren, sprekeridentiteit, timing, prosodie, achtergrondruis en potentieel synthetische of geïmiteerde stemmen. Deze signalen worden gesynchroniseerd via een tijd-gelijnde orkestratielaag die een verenigde en verklarende interpretatie produceert van wat er gebeurt in een conversatie.

Deze expliciete verdeling van arbeid is centraal in de ELM-aanpak. In plaats van te vertrouwen op een enkel massief model om impliciet betekenis af te leiden, combineren Ensemble Listening Models meerdere gerichte perspectieven, waardoor zowel nauwkeurigheid als transparantie worden verbeterd.

Binnen Velma 2.0

Velma 2.0 is een aanzienlijke evolutie van Modulate’s eerdere ensemble-gebaseerde systemen. Het gebruikt meer dan 100 componentmodellen die samenwerken in real-time, gestructureerd over vijf analytische lagen.

De eerste laag richt zich op basisaudioverwerking, waarbij het aantal sprekers, spraaktiming en pauzes wordt bepaald. Vervolgens komt akoestische signaalextractie, die emotionele staten, stressniveaus, bedrogindicatoren, synthetische stemmarkeringen en omgevingsruis identificeert.

De derde laag beoordeelt de waargenomen intentie, waarbij het onderscheidt tussen oprechte lof en sarcastische of vijandige opmerkingen. Gedragsmodellering volgt vervolgens de conversatiedynamiek over tijd, waarbij het signaleert frustratie, verwarring, geënsceneerde spraak of pogingen tot sociale manipulatie. De laatste laag, conversatieanalyse, vertaalt deze inzichten in ondernemingsrelevante gebeurtenissen zoals ontevreden klanten, beleidsinbreuken, potentieel fraude of defecte AI-agents.

Modulate meldt dat Velma 2.0 de conversatiebetekenis en intentie ongeveer 30 procent nauwkeuriger begrijpt dan LLM-gebaseerde benaderingen, terwijl het tussen de 10 en 100 keer kostenefficiënter is op grote schaal.

Van Gaming Moderatie naar Ondernemingsintelligentie

De oorsprong van Ensemble Listening Models ligt in Modulate’s vroege werk met online games. Populaire titels zoals Call of Duty en Grand Theft Auto Online genereren enkele van de meest uitdagende stemomgevingen denkbaar. Conversaties zijn snel, lawaaierig, emotioneel geladen en vol met slang en contextuele verwijzingen.

Het onderscheiden van speelse spot van echte pesterijen in real-time vereist veel meer dan transcriptie. Terwijl Modulate zijn stemmoderatiesysteem, ToxMod, exploiteerde, bouwde het geleidelijk aan steeds complexere ensembles van modellen om deze nuances te vangen. Het coördineren van tientallen gespecialiseerde modellen werd essentieel om de vereiste nauwkeurigheid te bereiken, wat uiteindelijk leidde tot de formalisering van de aanpak in een nieuwe architectuur.

Velma 2.0 generaliseert die architectuur voorbij gaming. Vandaag de dag drijft het Modulate’s ondernemingsplatform aan, waarbij het honderden miljoenen conversaties in verschillende branches analyseert om fraude, misbruik, klantontevredenheid en abnormale AI-activiteit te identificeren.

Een Uitdaging voor Foundation Models

De aankondiging komt op een moment waarop ondernemingen hun AI-strategieën opnieuw beoordelen. Ondanks massale investeringen, een groot percentage van de AI-initiatieven bereikt geen productie of levert geen duurzame waarde. Gewone obstakels omvatten hallucinaties, stijgende inferentiekosten, ondoorzichtige besluitvorming en moeilijkheden bij het integreren van AI-inzichten in operationele workflows.

Ensemble Listening Models lossen deze problemen rechtstreeks op. Door te vertrouwen op meerdere kleinere, doelgerichte modellen in plaats van één monolithisch systeem, zijn ELM’s minder duur om te exploiteren, gemakkelijker te controleren en meer interpreteerbaar. Elk uitvoer kan worden teruggespoord naar specifieke signalen, waardoor organisaties kunnen begrijpen waarom een conclusie werd bereikt.

Dit niveau van transparantie is vooral belangrijk in gereguleerde of hoge-risico-omgevingen waar black-box-beslissingen onaanvaardbaar zijn. Modulate positioneert ELM’s niet als vervanging voor grote taalmodellen, maar als een meer geschikte architectuur voor ondernemingsklasse-stemintelligentie.

Voorbij Spraak-naar-tekst

Een van de meest vooruitstrevende aspecten van Velma 2.0 is zijn vermogen om te analyseren hoe iets wordt gezegd, niet alleen wat wordt gezegd. Dit omvat het detecteren van synthetische of geïmiteerde stemmen, een groeiende zorg nu stemgeneratietechnologie toegankelijker wordt.

Terwijl stemkloon-technologie verbetert, lopen ondernemingen steeds grotere risico’s met betrekking tot fraude, identiteitsinbreuken en sociale manipulatie. Door synthetische stemdetectie rechtstreeks in zijn ensemble in te bedden, behandelt Velma 2.0 authenticiteit als een kernsignaal in plaats van een optionele toevoeging.

Het gedragsmodelleren van het systeem maakt ook proactieve inzichten mogelijk. Het kan identificeren wanneer een spreker van een script leest, wanneer frustratie toeneemt of wanneer een interactie naar conflict neigt. Deze mogelijkheden stellen organisaties in staat om eerder en effectiever in te grijpen.

Een Nieuwe Richting voor Ondernemings-AI

Modulate beschrijft de Ensemble Listening Model als een nieuwe categorie van AI-architectuur, distinct van zowel traditionele signaalverwerkingspijplijnen als grote foundation modellen. De onderliggende inzicht is dat complexe menselijke interacties beter worden begrepen door gecoördineerde specialisatie in plaats van brute-force schaling.

Terwijl ondernemingen AI-systemen eisen die verantwoordelijk, efficiënt en afgestemd zijn op echte operationele behoeften, wijzen Ensemble Listening Models naar een toekomst waarin intelligentie wordt samengesteld uit veel gefocuste componenten. Met Velma 2.0 nu live in productieomgevingen, wedt Modulate dat deze architectonische verschuiving verder zal reiken dan stemmoderatie en klantenservice.

In een industrie die op zoek is naar alternatieven voor steeds grotere black boxes, suggereren Ensemble Listening Models dat de volgende grote vooruitgang in AI kan komen van het luisteren naar signalen, niet van het agressiever berekenen.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.