Tankeledere

AI-drevne talebaserede agenter til virksomheder: To nøgleudfordringer

mm mm
Føj Unite.AI til dine foretrukne kilder på Google

Nu, mere end nogensinde før, er det tid for AI-drevne talebaserede systemer. Tænk på et opkald til kundeservice. Snart vil alle de stive, robotiske stemmer, de “tryk 1 for salg”-lignende begrænsende menuer, de irriterende oplevelser, der har fået os alle til at trykke desperat på 0 i håb om at tale med en menneskelig agent, være væk. (Eller, givet de lange ventetider, der kan følge med at blive overført til en menneskelig agent, har vi opgivet opkaldet helt.)

Ikke mere. Fremskridt ikke kun i transformer-baserede store sprogmodeller (LLM’er), men også i automatisk talegenkendelse (ASR) og tekst-til-tale (TTS)-systemer betyder, at “næste generations” talebaserede agenter er her – hvis du ved, hvordan du bygger dem.

I dag kigger vi på udfordringerne for enhver, der håber at bygge en sådan state-of-the-art talebaseret konversationsagent.

Hvorfor tale?

Før vi dykker ind, lad os kaste et hurtigt blik på de generelle attraktioner og relevans af talebaserede agenter (i modsætning til tekstbaserede interaktioner). Der er mange grunde til, at en taleinteraktion kan være mere passende end en tekstbaseret – disse kan inkludere, i stigende rækkefølge:

  • Præference eller vane – tale kommer før skrivning udviklingsmæssigt og historisk

  • Langsom tekstindtastning – mange kan tale hurtigere end de kan skrive

  • Håndfri situationer – såsom kørsel, træning eller vaske op

  • Analfabetisme – i hvert fald i det sprog, agenten forstår

  • Handicaps – såsom blindhed eller mangel på non-vokal motor kontrol

I en æra, der synes at være domineret af webbaserede transaktioner, er tale stadig en kraftfuld kanal for handel. For eksempel fandt en ny studie af JD Power af kundetilfredshed i hotelbranchen, at gæster, der bookede deres værelse over telefonen, var mere tilfredse med deres ophold end de, der bookede gennem en online rejsebureau (OTA) eller direkte gennem hotellets website.

Men interaktive talebesvarer, eller IVR’er for kort, er ikke nok. En studie fra 2023 af Zippia fandt, at 88% af kunder foretrækker taleopkald med en live-agent frem for at navigere i en automatiseret telefonmenu. Studiet fandt også, at de øverste ting, der irriterer folk mest om telefonmenuer, inkluderer at lytte til irrelevante muligheder (69%), evnen til fuldt ud at beskrive problemet (67%), ineffektiv service (33%) og forvirrende muligheder (15%).

Og der er en åbning for at bruge talebaserede assistenter. Ifølge en studie af Accenture er omkring 47% af forbrugerne allerede komfortable med at bruge taleassistenter til at interagere med virksomheder, og omkring 31% af forbrugerne har allerede brugt en taleassistant til at interagere med en virksomhed.

Uanset årsagen er der en præference og efterspørgsel efter taleinteraktion – så længe det er naturligt og komfortabelt.

Hvad gør en god talebaseret agent?

Omtrent sagt skal en god talebaseret agent svare på brugeren på en måde, der er:

  • Relevant: Baseret på en korrekt forståelse af, hvad brugeren sagde/ønskede. Bemærk, at i nogle tilfælde vil agentens svar ikke kun være et talt svar, men en form for handling gennem integration med en backend (f.eks. faktisk at booke et hotelværelse, når kalderen siger “Gå videre og book det”).

  • Præcis: Baseret på fakta (f.eks. kun sige, at der er et værelse ledigt på hotellet den 19. januar, hvis der er)

  • Klar: Svaret skal være forståeligt

  • Tidligt: Med den slags latency, man ville forvente fra en menneskelig

  • Sikker: Ingen krænkelser eller upassende sprog, afsløring af beskyttet information osv.

Problemet

Nuværende talebaserede automatiserede systemer forsøger at opfylde ovennævnte kriterier på bekostning af a) at være a) meget begrænsede og b) meget frustrerende at bruge. En del af dette skyldes de høje forventninger, der sættes af en talebaseret konversationskontekst, med sådanne forventninger, der kun bliver højere, jo mere talekvaliteten i TTS-systemer bliver uløseligt fra menneskelige stemmer. Men disse forventninger bliver knust i de systemer, der er bredt udbredt lige nu. Hvorfor?

I ét ord – inflexibilitet:

  • Begrænset tale – brugeren er typisk tvunget til at sige ting på en unaturlig måde: i korte fraser, i en bestemt rækkefølge, uden spurious information osv. Dette tilbyder lidt eller intet fremgang i forhold til det gamle nummerbaserede menusystem

  • Smal, ikke-inklusiv opfattelse af “acceptabel” tale – lav tolerance for slang, uhms og ahs osv.

  • Ingen baglæns – hvis noget går galt, kan der være lidt chance for at “reparere” eller korrigere det problematiske stykke information, men i stedet må starte forfra eller vente på en overføring til en menneskelig.

  • Streng turtagning – ingen mulighed for at afbryde eller tale en agent

Det er ikke nødvendigt at sige, at mennesker finder disse begrænsninger irriterende eller frustrerende.

Løsningen:

De gode nyheder er, at moderne AI-systemer er kraftfulde og hurtige nok til at væsentligt forbedre ovennævnte slags oplevelser, i stedet for at nærme sig (eller overgå!) menneskebaserede kundeservice-standarder. Dette skyldes en række faktorer:

  • Hurtigere, mere kraftfulde hardware

  • Forbedringer i ASR (højere nøjagtighed, overvindelse af støj, accenter osv.)

  • Forbedringer i TTS (naturlig lydende eller endda klonede stemmer)

  • Ankomsten af generative LLM’er (naturlig lydende konversationer)

Det sidste punkt er en game-changer. Den vigtigste indsigt var, at en god prædikativ model kan fungere som en god generativ model. En kunstig agent kan komme tæt på menneske-niveau konversationspræstation, hvis den siger, hvad en tilstrækkeligt god LLM forudser at være det mest sandsynlige, en god menneskelig kundeservice-agent ville sige i den givne konversationskontekst.

Kald på ankomsten af dusinvis af AI-startups, der håber at løse talebaseret konversationsagent-problemet ved blot at vælge og derefter forbinde færdige ASR- og TTS-moduler til en LLM-kernel. Ifølge denne opfattelse er løsningen blot et spørgsmål om at vælge en kombination, der minimiserer latency og omkostninger. Og det er selvfølgelig vigtigt. Men er det nok?

Ikke så hurtigt

Der er flere specifikke grunde til, at denne simple tilgang ikke vil virke, men de stammer fra to generelle punkter:

  1. LLM’er kan faktisk ikke på egen hånd levere gode faktabaserede tekstkonversationer af den type, der kræves for virksomhedsapplikationer som kundeservice. Så de kan ikke på egen hånd gøre det for talebaserede konversationer heller. Noget andet er nødvendigt.

  2. Selv hvis du supplerer LLM’er med, hvad der er nødvendigt for at lave en god tekstbaseret konversationsagent, kræver det at omdanne dette til en god talebaseret konversationsagent mere end blot at forbinde det til de bedste ASR- og TTS-moduler, du kan betale for.

Lad os kaste et blik på et specifikt eksempel på hver af disse udfordringer.

Udfordring 1: At holde det ægte

Som nu er bredt kendt, producerer LLM’er undertiden ukorrekte eller ‘hallucinerede’ oplysninger. Dette er katastrofalt i konteksten af mange kommercielle applikationer, selvom det måske kan fungere i underholdningsapplikationer, hvor nøjagtighed ikke er målet.

At LLM’er undertiden hallucinerer er kun at forvente, når man tænker over det. Det er en direkte konsekvens af at bruge modeller, der er trænet på data fra et år (eller mere) siden til at generere svar på spørgsmål om fakta, der ikke er en del af eller følger af en datamængde (uanset hvor stor), der kan være et år eller mere gammel. Når kalderen spørger “Hvad er mit medlemsnummer?”, kan en simpel forudtrænet LLM kun generere et plausibelt lydende svar, ikke et nøjagtigt.

De mest almindelige måder at tackle dette problem på er:

  • Finjustering: Træn den forudtrænede LLM yderligere, denne gang på alle de domænespecifikke data, du ønsker, den skal kunne svare korrekt på.

  • Prompt-teknik: Tilføj den ekstra data/instruktioner som input til LLM’en, ud over konversationshistorien

  • Retrieval Augmented Generation (RAG): Lignende prompt-teknik, bortset fra at data, der tilføjes til prompten, bestemmes på bagsiden af en neural memori til en indkodet indeks af dine domænespecifikke data (der inkluderer f.eks. en fil, der siger: “Her er de faciliteter, der er tilgængelige på hotellet: pool, sauna, el-bil-ladestation.”)

  • Regelbaseret kontrol: Lignende RAG, men hvad der skal tilføjes (eller trækkes fra) prompten, bestemmes ikke ved at matche en neural memori, men ved håndkodede (og håndskrevne) regler.

Bemærk, at én størrelse ikke passer alle. Hvilken af disse metoder, der vil være passende, afhænger af f.eks. de domænespecifikke data, der informerer agentens svar. I særdeleshed afhænger det af, om disse data ændrer sig ofte (opkald for opkald, f.eks. – f.eks. kundenavn) eller næsten aldrig (f.eks. den indledende hilsen: “Hej, tak for at ringe til Hotel Budapest. Hvordan kan jeg hjælpe dig i dag?”). Finjustering ville ikke være passende for det første, og RAG ville være en klodset løsning for det sidste. Så enhver fungerende system vil være nødt til at bruge en variation af disse metoder.

Hvad mere er, integration af disse metoder med LLM’en og hinanden på en måde, der minimiserer latency og omkostninger, kræver omhyggelig ingeniørarbejde. For eksempel kan din models RAG-præstation forbedres, hvis du finjusterer den for at lette denne metode.

Det kan komme som ingen overraskelse, at hver af disse metoder introducerer deres egne udfordringer. For eksempel tag finjustering. Finjustering af din forudtrænede LLM på dine domænespecifikke data vil forbedre dens præstation på disse data, ja. Men finjustering ændrer parametrene (vægtene), der er grundlaget for den forudtrænedes (formodentlig ret gode) generelle præstation. Denne ændring forårsager en “glemsomhed” (eller “katastrofisk glemme”) af nogle af modellens tidligere viden. Dette kan resultere i, at modellen giver forkerte eller upassende (selv farlige) svar. Hvis du ønsker, at din agent skal fortsætte med at svare korrekt og sikkert, har du brug for en finjusteringsmetode, der mildner denne katastrofiske glemme.

Udfordring 2: Endpointing

At bestemme, hvornår en kunde er færdig med at tale, er afgørende for en naturlig konversationsflow. Ligeledes skal systemet håndtere afbrydelser smukt, så konversationen forbliver koherent og responsiv over for kundens behov. At opnå dette til en standard, der kan sammenlignes med menneskelig interaktion, er en kompleks opgave, men det er essentiel for at skabe naturlige og behagelige konversationsoplevelser.

En løsning, der virker, kræver, at designerne overvejer spørgsmål som:

  • Hvor lang tid efter, at kunden har stoppet med at tale, skal agenten vente, før den beslutter, at kunden er stoppet med at tale?

  • Afhænger ovennævnte af, om kunden har afsluttet en fuld sætning?

  • Hvad skal gøres, hvis kunden afbryder agenten?

  • I særdeleshed, skal agenten antage, at det, den sagde, ikke blev hørt af kunden?

Disse problemer, der hovedsageligt handler om timing, kræver omhyggelig ingeniørarbejde ud over det, der er involveret i at få en LLM til at give et korrekt svar.

Konklusion

Udviklingen af AI-drevne talebaserede systemer lover en revolutionerende ændring i kundeservicedynamikken, hvorforældede telefonsystemer erstattes af avancerede LLM’er, ASR og TTS-teknologier. Men overvindelse af udfordringer i hallucinerede oplysninger og smidig endpointing vil være afgørende for at levere naturlige og effektive taleinteraktioner.

Automatisering af kundeservice har potentialet til at blive en sand game-changer for virksomheder, men kun hvis det gøres korrekt. I 2024, især med alle disse nye teknologier, kan vi endelig bygge systemer, der kan føles naturlige og flydende og robustt forstå os. Den samlede effekt vil reducere ventetider og forbedre den nuværende oplevelse, vi har med tale-robotter, og markerer en transformationel æra i kundeengagement og servicekvalitet.

Dr. Itamar Arel, der i øjeblikket er CEO hos Tenyx, kombinerer sin akademiske baggrund som tidligere professor ved University of Tennessee og Stanford University's AI-lab med iværksættersuccess, idet han var medstifter af pionerfirmaerne Binatix, Apprente (opkøbt af McDonald's og IBM) og Tenyx. Itamar har nylig haft stillingen som corporate VP og leder af McD Tech Labs hos McDonald's Corporation og leder af conversational AI hos IBM Watson Orders.

Dr. Ron Chrisley is currently Chief Scientific Advisor at Tenyx, which he co-founded in 2021. He received a BS in Symbolic Systems from Stanford, holds a doctorate from the University of Oxford, and is Professor of Cognitive Science and Artificial Intelligence at the University of Sussex. From 2019 to 2020, he was Visiting Scholar at Stanford’s Institute for Human-Centered AI.