Thought leaders

AI-gepoweredde stemgebaseerde agenten voor ondernemingen: Twee belangrijke uitdagingen

mm mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Nu meer dan ooit is het tijd voor AI-gepoweredde stemgebaseerde systemen. Denk aan een telefoontje naar de klantenservice. Al snel zullen alle stijfheid en inflexibiliteit verdwenen zijn – de stijve robotstemmen, de “druk op 1 voor verkoop”-stijl beperkende menu’s, de irritante ervaringen die ons allemaal hebben doen wanhopig op de nul-toets drukken in de hoop om in plaats daarvan met een menselijke agent te praten. (Of, gezien de lange wachttijden die het overdragen aan een menselijke agent kunnen inhouden, hebben ons doen opgeven van het telefoontje helemaal.)

Niet meer. Vooruitgang niet alleen in transformer-gebaseerde grote taalmodellen (LLM’s) maar in automatische spraakherkenning (ASR) en tekst-naar-spraak (TTS) systemen betekent dat “next-generation” stemgebaseerde agenten er zijn – als je weet hoe je ze moet bouwen.

Vandaag kijken we naar de uitdagingen waarmee iedereen die zo’n state-of-the-art stemgebaseerde conversatieagent wilt bouwen, wordt geconfronteerd.

Waarom stem?

Voordat we erin duiken, laten we eerst een snel kijken nemen naar de algemene aantrekkelijkheid en relevantie van stemgebaseerde agenten (in tegenstelling tot tekstgebaseerde interacties). Er zijn veel redenen waarom een steminteractie meer geschikt kan zijn dan een tekstgebaseerde – deze kunnen onder andere omvatten, in toenemende volgorde van ernst:

  • Voorkeur of gewoonte – spreken gaat vooraf aan schrijfontwikkeling en historisch

  • Langzame tekst invoeren – veel mensen kunnen sneller spreken dan typen

  • Handen-vrij situaties – zoals rijden, sporten of de afwas doen

  • Analfabetisme – ten minste in de taal(en) die de agent begrijpt

  • Gehandicapt – zoals blindheid of het ontbreken van non-vocale motorcontrole

In een tijdperk dat ogenschijnlijk wordt gedomineerd door website-gemedieerde transacties, blijft stem een krachtige verbinding voor handel. Zo vond een recente studie van JD Power naar klanttevredenheid in de hotelsector dat gasten die hun kamer hadden geboekt via de telefoon, meer tevreden waren met hun verblijf dan degene die hadden geboekt via een online reisbureau (OTA) of rechtstreeks via de website van het hotel.

Maar interactieve stemantwoorden, of IVR’s, zijn niet genoeg. Een studie uit 2023 door Zippia vond dat 88% van de klanten de voorkeur geeft aan stemgesprekken met een live agent in plaats van het navigeren door een geautomatiseerd telefoonmenu. De studie vond ook dat de belangrijkste dingen die mensen het meest irriteren aan telefoonmenu’s, onder andere zijn: luisteren naar irrelevante opties (69%), het onvermogen om het probleem volledig te beschrijven (67%), inefficiënte service (33%) en verwarrende opties (15%).

En er is een openheid om stemgebaseerde assistenten te gebruiken. Volgens een studie van Accenture zijn ongeveer 47% van de consumenten al comfortabel met het gebruik van stemassistenten om met bedrijven te communiceren en ongeveer 31% van de consumenten hebben al een stemassistent gebruikt om met een bedrijf te communiceren.

Wat de reden ook is, voor veel mensen is er een voorkeur en vraag naar gesproken interactie – zolang het maar natuurlijk en comfortabel is.

Wat maakt een goede stemgebaseerde agent?

Ongeveer gesproken, een goede stemgebaseerde agent moet op een manier reageren die:

  • Relevant is: Gebaseerd op een correcte begrip van wat de gebruiker heeft gezegd/wil. Let op dat in sommige gevallen de reactie van de agent niet alleen een gesproken antwoord is, maar ook een vorm van actie door integratie met een backend (bijv. een hotelkamer boeken wanneer de beller zegt “Ga door en boek het”).

  • Accuraat is: Gebaseerd op feiten (bijv. zeg alleen dat er een kamer beschikbaar is in het hotel op 19 januari als dat zo is)

  • Duidelijk is: De reactie moet begrijpelijk zijn

  • Tijdig is: Met de soort latentie die men van een mens zou verwachten

  • Veilig is: Geen aanstootgevende of ongepaste taal, onthulling van beschermde informatie, enz.

Het probleem

Huidige stemgebaseerde geautomatiseerde systemen proberen de bovenstaande criteria te vervullen ten koste van a) zeer beperkt en b) zeer frustrerend om te gebruiken. Een deel hiervan is het gevolg van de hoge verwachtingen die een stemgebaseerde conversatiecontext schept, met dergelijke verwachtingen die alleen maar hoger worden naarmate de stemkwaliteit in TTS-systemen ononderscheidbaar wordt van menselijke stemmen. Maar deze verwachtingen worden de grond in geboord in de systemen die op dit moment breed worden ingezet. Waarom?

In een woord – inflexibiliteit:

  • Beperkte spraak – de gebruiker wordt meestal gedwongen om dingen onnatuurlijk te zeggen: in korte zinnen, in een bepaalde volgorde, zonder spurious informatie, enz. Dit biedt weinig of geen vooruitgang ten opzichte van het oude nummer-gebaseerde menu-systeem

  • Smalle, niet-inclusieve notie van “acceptabele” spraak – lage tolerantie voor slang, uhms en ahs, enz.

  • Geen terugkoppeling: Als er iets misgaat, kan er weinig kans zijn om het probleem te “repareren” of te corrigeren, maar in plaats daarvan moet je opnieuw beginnen of wachten op een overdracht aan een mens.

  • Strikte beurtrol – geen mogelijkheid om de agent te onderbreken of te spreken

Het spreekt voor zich dat mensen deze beperkingen irritant of frustrerend vinden.

De oplossing:

Het goede nieuws is dat moderne AI-systemen krachtig en snel genoeg zijn om de bovenstaande soorten ervaringen aanzienlijk te verbeteren, in plaats van (of zelfs te overtreffen!) menselijke klantenservicestandaarden. Dit is te danken aan een verscheidenheid aan factoren:

  • Snellere, krachtigere hardware

  • Verbeteringen in ASR (hoger nauwkeurigheid, overwinnen van ruis, accenten, enz.)

  • Verbeteringen in TTS (natuurlijk klinkende of zelfs gekloonde stemmen)

  • De komst van generatieve LLM’s (natuurlijk klinkende conversaties)

Dat laatste punt is een game-changer. De sleutelinzicht was dat een goed voorspellend model ook een goed generatief model kan zijn. Een kunstmatige agent kan dicht bij menselijke conversatieprestaties komen als hij zegt wat een voldoende goed LLM voorspelt als het meest waarschijnlijke ding dat een goede menselijke klantenservicemedewerker zou zeggen in de gegeven conversatiecontext.

De komst van tientallen AI-startups die hopen het stemgebaseerde conversatieagentprobleem op te lossen door simpelweg off-the-shelf ASR- en TTS-modules te selecteren en te verbinden met een LLM-kern. Op deze manier is de oplossing alleen een kwestie van het selecteren van een combinatie die latentie en kosten minimaliseert. En natuurlijk is dat belangrijk. Maar is het genoeg?

Niet zo snel

Er zijn verschillende specifieke redenen waarom die eenvoudige aanpak niet zal werken, maar ze zijn afgeleid van twee algemene punten:

  1. LLM’s kunnen op zichzelf geen goede feitgebaseerde tekstconversaties leveren van het soort dat vereist is voor ondernemingsapplicaties zoals klantenservice. Dus kunnen ze dat ook niet voor stemgebaseerde conversaties.

  2. Zelfs als je LLM’s aanvult met wat nodig is om een goede tekstgebaseerde conversatieagent te maken, vereist het omzetten van die agent in een goede stemgebaseerde conversatieagent meer dan alleen het aansluiten op de beste ASR- en TTS-modules die je je kunt veroorloven.

Laten we een specifiek voorbeeld van elk van deze uitdagingen bekijken.

Uitdaging 1: Het behoud van realisme

Zoals nu algemeen bekend is, produceren LLM’s soms onnauwkeurige of ‘gehallucineerde’ informatie. Dit is rampzalig in de context van veel commerciële toepassingen, zelfs als het misschien een goed entertainment-toepassing kan zijn waarbij nauwkeurigheid niet het punt is.

Dat LLM’s soms hallucineren is alleen te verwachten, bij nader inzien. Het is een direct gevolg van het gebruik van modellen die zijn getraind op gegevens van een jaar (of meer) geleden om antwoorden te genereren op vragen over feiten die geen deel uitmaken van, of geïmpliceerd worden door, een gegevensset (hoe groot ook) die een jaar of meer oud kan zijn. Wanneer de beller vraagt “Wat is mijn lidmaatschapsnummer?”, kan een eenvoudig voorgetraind LLM alleen een plausibele antwoord genereren, niet een nauwkeurig antwoord.

De meest voorkomende manieren om dit probleem aan te pakken zijn:

  • Fijnafstemming: Train de voorgetrainde LLM verder, deze keer op alle domeinspecifieke gegevens die je wilt dat het correct kan beantwoorden.

  • Prompt-engineering: Voeg de extra gegevens/instructies toe als invoer voor de LLM, naast de conversatiegeschiedenis

  • Retrieval Augmented Generation (RAG): Net als prompt-engineering, behalve dat de gegevens die aan de prompt worden toegevoegd, op het moment worden bepaald door de huidige conversatiecontext (bijv. de klant heeft gevraagd “Heeft uw hotel een zwembad?”) te matchen met een ingebedde index van uw domeinspecifieke gegevens (die bijv. een bestand bevat dat zegt: “Hier zijn de faciliteiten beschikbaar in het hotel: zwembad, sauna, EV-lader”).

  • Regelgebaseerde controle: Net als RAG, maar wat aan de prompt moet worden toegevoegd (of onttrokken) wordt niet opgehaald door een neurale geheugen, maar wordt bepaald door harde, handmatig geschreven regels.

Let op dat één maat niet voor alle gevallen past. Welke van deze methoden geschikt zal zijn, hangt af van, bijvoorbeeld, de domeinspecifieke gegevens die het antwoord van de agent informeren. In het bijzonder hangt het af van of die gegevens vaak veranderen (van telefoontje tot telefoontje, bijv. – klantnaam) of nauwelijks (bijv. de initiële begroeting: “Hallo, bedankt voor het bellen naar Hotel Boedapest. Hoe kan ik u vandaag helpen?”). Fijnafstemming zou niet geschikt zijn voor het eerste, en RAG zou een onhandige oplossing zijn voor het laatste. Dus elk werkend systeem moet een verscheidenheid aan deze methoden gebruiken.

Bovendien vereist het integreren van deze methoden met de LLM en met elkaar op een manier die latentie en kosten minimaliseert, zorgvuldige engineering. Bijvoorbeeld, de RAG-prestaties van uw model kunnen verbeteren als u het fine-tuned om die methode te faciliteren.

Het mag geen verrassing zijn dat elk van deze methoden op zijn beurt zijn eigen uitdagingen introduceert. Neem bijvoorbeeld fijnafstemming. Fijnafstemming van uw voorgetrainde LLM op uw domeinspecifieke gegevens zal de prestaties ervan op die gegevens verbeteren, ja. Maar fijnafstemming wijzigt de parameters (gewichten) die de basis vormen van de prestaties van het voorgetrainde model (vermoedelijk redelijk goed) in het algemeen. Deze wijziging veroorzaakt een onleren (of “catastrofale vergetelheid”) van sommige van de kennis van het model. Dit kan ertoe leiden dat het model onjuiste of ongepaste (zelfs onveilige) antwoorden geeft. Als u wilt dat uw agent blijft reageren op een manier die accuraat en veilig is, hebt u een fijnafstemmethode nodig die catastrofale vergetelheid mitigeert.

Uitdaging 2: Endpointing

Het bepalen wanneer een klant klaar is met praten is cruciaal voor een natuurlijke conversatie. Bovendien moet het systeem interrupties op een elegante manier afhandelen, zodat de conversatie coherent en responsief blijft voor de behoeften van de klant. Het bereiken van dit niveau, vergelijkbaar met menselijke interactie, is een complexe taak, maar essentieel voor het creëren van natuurlijke en aangename conversatie-ervaringen.

Een oplossing die werkt, vereist dat de ontwerpers vragen overwegen zoals:

  • Hoe lang moet de agent wachten na het stoppen van de klant met praten voordat hij besluit dat de klant klaar is met praten?

  • Hangt dit af van of de klant een complete zin heeft voltooid?

  • Wat moet er gebeuren als de klant de agent onderbreekt?

  • In het bijzonder, moet de agent aannemen dat wat hij zei niet door de klant is gehoord?

Deze kwesties, die grotendeels te maken hebben met timing, vereisen zorgvuldige engineering bovenop die welke nodig is om een LLM een correct antwoord te laten geven.

Conclusie

De evolutie van AI-gepoweredde stemgebaseerde systemen belooft een revolutionaire verschuiving in klantenservicedynamiek, waarbij verouderde telefoonsystemen worden vervangen door geavanceerde LLM’s, ASR- en TTS-technologieën. Echter, het overwinnen van uitdagingen in gehallucineerde informatie en naadloze endpointing zal van cruciaal belang zijn voor het leveren van natuurlijke en efficiënte steminteracties.

Het automatiseren van klantenservice heeft het potentieel om een echte game-changer te worden voor ondernemingen, maar alleen als het correct wordt gedaan. In 2024, met name met al deze nieuwe technologieën, kunnen we eindelijk systemen bouwen die natuurlijk en soepel kunnen communiceren en ons robuust kunnen begrijpen. Het netto-effect zal wachttijden verminderen en de huidige ervaring die we hebben met stemrobots verbeteren, waarmee een transformatieve periode in klantbetrokkenheid en serviciekwaliteit wordt gemarkeerd.

Dr. Itamar Arel, momenteel de CEO bij Tenyx, combineert zijn academische achtergrond als voormalig professor aan de University of Tennessee en Stanford University's AI-lab met ondernemerssucces, door het co-founding van baanbrekende bedrijven Binatix, Appendre (overgenomen door McDonald's en IBM) en Tenyx. Itamar bekleedde onlangs de positie van corporate VP en hoofd van McD Tech Labs bij McDonald's Corporation en hoofd van conversational AI bij IBM Watson Orders.

Dr. Ron Chrisley is currently Chief Scientific Advisor at Tenyx, which he co-founded in 2021. He received a BS in Symbolic Systems from Stanford, holds a doctorate from the University of Oxford, and is Professor of Cognitive Science and Artificial Intelligence at the University of Sussex. From 2019 to 2020, he was Visiting Scholar at Stanford’s Institute for Human-Centered AI.