Lideri de opinie
Agenți vocali bazati pe inteligență artificială pentru întreprinderi: Două provocări cheie

Acum, mai mult ca oricând, este momentul pentru sistemele vocale bazate pe inteligență artificială. Luați în considerare un apel către serviciul clienți. Curând, toată rigiditatea și inflexibilitatea vor dispărea – vocile robotice rigide, meniurile de tip “apăsați 1 pentru vânzări”, experiențele enervante care ne-au făcut pe toți să apăsăm frenetic butonul 0 în speranța de a vorbi cu un agent uman. (Sau, dată fiind perioada lungă de așteptare pe care o implică transferul către un agent uman, ne-am dat seama că renunțăm la apel în totalitate.)
Nu mai. Progresele nu numai în modelele de limbaj mari bazate pe transformatori (LLM), ci și în recunoașterea automată a vorbirii (ASR) și sistemele de text-la-vorbire (TTS) înseamnă că “agenții vocali de nouă generație” sunt aici – dacă știți cum să îi construiți.
Astăzi, vom arunca o privire asupra provocărilor cu care se confruntă oricine speră să construiască un astfel de agent conversațional vocal de ultimă generație.
De ce voce?
Înainte de a intra în detalii, să aruncăm o privire rapidă asupra atractivității și relevanței generale a agenților vocali (în contrast cu interacțiunile bazate pe text). Există multe motive pentru care o interacțiune vocală ar putea fi mai potrivită decât una bazată pe text – acestea pot include, în ordine crescătoare de gravitate:
-
Preferință sau obișnuință – vorbirea precede dezvoltarea scrisă din punct de vedere istoric și evolutiv
-
Introducere lentă a textului – mulți pot vorbi mai repede decât pot introduce text
-
Situații fără mâini libere – cum ar fi condusul, antrenamentul sau spălatul vaselor
-
Analfabetism – cel puțin în limba (limbile) pe care le înțelege agentul
-
Dizabilități – cum ar fi orbirea sau lipsa controlului motor non-vocal
Într-o epocă care pare dominată de tranzacții mediate de site-uri web, vocea rămâne un canal puternic pentru comerț. De exemplu, un studiu recent realizat de JD Power cu privire la satisfacția clienților în industria hotelieră a constatat că oaspeții care și-au rezervat camera telefonic au fost mai mulțumiți de șederea lor decât cei care și-au rezervat prin intermediul unei agenții de turism online (OTA) sau direct prin site-ul web al hotelului.
Dar răspunsurile interactive vocale, sau IVR, nu sunt suficiente. Un studiu din 2023 realizat de Zippia a constatat că 88% dintre clienți preferă apeluri vocale cu un agent live în loc de navigarea prin meniuri telefonice automate. Studiul a constatat, de asemenea, că principalele lucruri care enervează oamenii cel mai mult despre meniurile telefonice includ ascultarea opțiunilor irelevante (69%), imposibilitatea de a descrie pe deplin problema (67%), serviciul ineficient (33%) și opțiunile confuze (15%).
Și există o deschidere pentru utilizarea asistenților vocali. Conform unui studiu realizat de Accenture, aproximativ 47% dintre consumatori sunt deja confortabili cu utilizarea asistenților vocali pentru a interacționa cu întreprinderile, iar aproximativ 31% dintre consumatori au folosit deja un asistent vocal pentru a interacționa cu o întreprindere.
Indiferent de motiv, pentru mulți, există o preferință și o cerere pentru interacțiunea vorbită – atâta timp cât este naturală și confortabilă.
Ce un agent vocal bun?
Vorbind în general, un agent vocal bun ar trebui să răspundă utilizatorului într-un mod care este:
-
Relevant: Bazat pe o înțelegere corectă a ceea ce a spus utilizatorul / a dorit. Notă că, în unele cazuri, răspunsul agentului nu va fi doar un răspuns vorbit, ci o formă de acțiune prin integrare cu un backend (de exemplu, efectuarea unei rezervări la hotel atunci când apelantul spune “Rezervă-o”).
-
Exact: Bazat pe fapte (de exemplu, spuneți doar că există o cameră disponibilă la hotel pe 19 ianuarie, dacă este așa)
-
Clar: Răspunsul ar trebui să fie inteligibil
-
La timp: Cu latența pe care ați aștepta-o de la un om
-
Sigur: Fără limbaj ofensator sau inadecvat, dezvăluirea informațiilor protejate, etc.
Problema
Sistemele automate vocale actuale încearcă să îndeplinească criteriile de mai sus, dar cu prețul unei limitări și a unei frustrări în utilizare. Parte din aceasta este o consecință a așteptărilor ridicate pe care un context conversațional vocal le stabilește, cu așteptări care nu fac decât să crească pe măsură ce calitatea vocilor în sistemele TTS devine indistinctă de vocile umane. Dar aceste așteptări sunt zdrobite în sistemele care sunt larg răspândite în prezent. De ce?
Într-un cuvânt – inflexibilitate:
-
Vorbire limitată – utilizatorul este de obicei forțat să spună lucruri în mod nenatural: în fraze scurte, într-o anumită ordine, fără informații suplimentare, etc. Acest lucru oferă puțin sau deloc avantaje față de vechile sisteme de meniu bazate pe numere
-
Noțiune îngustă și neincluzivă a “vorbirii acceptabile” – toleranță scăzută la slang, “uhm” și “ah”, etc.
-
Fără posibilitatea de a reveni – dacă ceva merge prost, poate exista puțină șansă de “reparare” sau corectare a informației problematice, ci în schimb, trebuie să începeți din nou sau să așteptați transferul la un agent uman.
-
Schimbarea strictă a tururilor – fără posibilitatea de a întrerupe sau a vorbi cu un agent
Este de la sine înțeles că oamenii găsesc aceste constrângeri enervante sau frustrante.
Soluția:
Vestea bună este că sistemele moderne de inteligență artificială sunt suficient de puternice și rapide pentru a îmbunătăți semnificativ experiențele de mai sus, în loc de a aborda (sau depăși!) standardele de serviciu clienți bazate pe oameni. Acest lucru se datorează unei varietăți de factori:
-
Hardware mai rapid și mai puternic
-
Îmbunătățiri ale ASR (acuratețe mai mare, depășirea zgomotului, accentelor, etc.)
-
Îmbunătățiri ale TTS (voci care sună natural sau chiar clonate)
-
Sosirea LLM generative (conversații care sună natural)
Acest ultim punct este un joc schimbător. Ideea cheie a fost că un model predictiv bun poate servi ca un model generativ bun. Un agent artificial poate ajunge la performanțe conversaționale la nivel uman dacă spune ceea ce un LLM suficient de bun prezice a fi cel mai probabil lucru pe care un bun agent de serviciu clienți uman l-ar spune în contextul conversațional dat.
Apare astfel zecile de startup-uri de IA care speră să rezolve problema agenților conversaționali vocali prin selectarea și conectarea modulelor ASR și TTS standard la un nucleu LLM. Pe această vedere, soluția este doar o chestiune de alegere a unei combinații care minimizează latența și costul. Și, desigur, acesta este important. Dar este suficient?
Nu așa de repede
Există mai multe motive specifice pentru care abordarea simplă nu va funcționa, dar acestea decurg din două puncte generale:
-
LLM-urile nu pot, singure, să ofere conversații textuale bazate pe fapte de calitate, așa cum sunt necesare pentru aplicații enterprise, cum ar fi serviciul clienți. Așadar, nu pot face acest lucru nici pentru conversații vocale.
-
Chiar și dacă suplimentați LLM-urile cu ceea ce este necesar pentru a face un agent conversațional text bazat bun, transformarea acestuia într-un agent conversațional vocal bun necesită mai mult decât doar conectarea la cele mai bune module ASR și TTS pe care le puteți permite.
Să aruncăm o privire asupra unui exemplu specific pentru fiecare dintre aceste provocări.
Provocarea 1: Păstrarea autenticității
Așa cum se știe acum pe scară largă, LLM-urile produc uneori informații inexacte sau “halucinate”. Acest lucru este dezastruos în contextul multor aplicații comerciale, chiar dacă ar putea fi potrivit pentru o aplicație de divertisment în care acuratețea nu este punctul central.
Că LLM-urile halucinează uneori nu este de mirare, la o analiză mai atentă. Acesta este o consecință directă a utilizării modelelor antrenate pe date dintr-un an (sau mai mult) pentru a genera răspunsuri la întrebări despre fapte care nu fac parte din, sau nu sunt implicate de, un set de date (orât de mare) care ar putea fi în vârstă de un an sau mai mult. Când apelantul întreabă “Care este numărul meu de membru?”, un LLM simplu antrenat poate genera doar un răspuns care sună plauzibil, nu unul exact.
Cele mai comune modalități de a face față acestei probleme sunt:
-
Reglare fină: Antrenați LLM-ul preantrenat mai departe, de data aceasta pe toate datele specifice domeniului pe care doriți să le poată răspunde corect.
-
Ingineria promptului: Adăugați datele/instrucțiunile suplimentare ca intrare pentru LLM, în plus față de istoricul conversației
-
Generare augmentată de recuperare (RAG): Asemănător cu ingineria promptului, dar datele adăugate la prompt sunt determinate în timp real prin asocierea contextului conversațional curent (de exemplu, clientul a întrebat “Are hotelul un piscină?”) cu un indice de codare încorporat al datelor dvs. specifice domeniului (care include, de exemplu, un fișier care spune: “Aici sunt facilitățile disponibile la hotel: piscină, saună, stație de încărcare EV”).
-
Control bazat pe reguli: Asemănător cu RAG, dar ceea ce trebuie adăugat (sau scos) din prompt nu este recuperat prin asocierea unei memorii neuronale, ci este determinat prin reguli codificate dur și manual.
Notă că nu există o soluție care să se potrivească tuturor. Care dintre aceste metode va fi adecvată va depinde, de exemplu, de datele specifice domeniului care informează răspunsul agentului. În special, va depinde de faptul dacă datele respective se schimbă frecvent (de la apel la apel, de exemplu – de exemplu, numele clientului) sau aproape deloc (de exemplu, salutul inițial: “Bună ziua, vă mulțumim că ați sunat la Hotelul Budapesta. Cum vă pot ajuta astăzi?”). Reglarea fină nu ar fi adecvată pentru primul, iar RAG ar fi o soluție încărcată pentru al doilea. Așadar, orice sistem care funcționează va trebui să utilizeze o varietate de aceste metode.
Mai mult, integrarea acestor metode cu LLM și una cu alta într-un mod care minimizează latența și costul necesită o inginerie atentă. De exemplu, performanța RAG a modelului dvs. poate fi îmbunătățită dacă îl reglați fin pentru a facilita această metodă.
Nu este de mirare că fiecare dintre aceste metode introduce, la rândul său, propriile provocări. De exemplu, luați reglarea fină. Reglarea fină a LLM-ului dvs. preantrenat pe datele dvs. specifice domeniului va îmbunătăți performanța sa pe aceste date, da. Dar reglarea fină modifică parametrii (greutățile) care sunt baza performanței generale (presupus a fi destul de bune) a modelului preantrenat. Această modificare cauzează, prin urmare, o uitare (sau “uitare catastrofică”) a unora dintre cunoștințele anterioare ale modelului. Acest lucru poate duce la faptul că modelul oferă răspunsuri inexacte sau inadecvate (chiar periculoase). Dacă doriți ca agentul dvs. să continue să răspundă corect și în siguranță, aveți nevoie de o metodă de reglare fină care să atenueze uitarea catastrofică.
Provocarea 2: Punctul final
Determinarea momentului în care un client a terminat de vorbit este critică pentru fluxul natural al conversației. În mod similar, sistemul trebuie să gestioneze întreruperile în mod elegant, asigurându-se că conversația rămâne coerentă și răspunde nevoilor clientului. Realizarea acestui lucru la un standard comparabil cu interacțiunea umană este o sarcină complexă, dar este esențială pentru crearea unor experiențe conversaționale naturale și plăcute.
O soluție care funcționează necesită ca designerii să ia în considerare întrebări de genul:
-
Cât timp ar trebui să aștepte agentul după ce clientul a încetat să vorbească, înainte de a decide că clientul a terminat de vorbit?
-
Depinde aceasta de faptul că clientul a terminat o propoziție completă?
-
Ce ar trebui să se facă dacă clientul întrerupe agentul?
-
În special, ar trebui agentul să presupună că ceea ce spunea nu a fost auzit de client?
Aceste probleme, care au în mare parte de-a face cu timpul, necesită o inginerie atentă, dincolo de ceea ce este implicat în obținerea unui răspuns corect de la un LLM.
Concluzie
Evoluția sistemelor vocale bazate pe inteligență artificială promite o schimbare revoluționară în dinamica serviciului clienți, înlocuind sistemele telefonice învechite cu tehnologii LLM, ASR și TTS avansate. Cu toate acestea, depășirea provocărilor legate de informații halucinate și puncte finale fluente va fi crucială pentru furnizarea unor interacțiuni vocale naturale și eficiente.
Automatizarea serviciului clienți are puterea de a deveni un adevărat joc schimbător pentru întreprinderi, dar numai dacă se face corect. În 2024, în special cu toate aceste tehnologii noi, putem, în sfârșit, construi sisteme care pot simți natural și fluent și pot înțelege în mod robust. Efectul net va reduce timpul de așteptare și va îmbunătăți experiența actuală pe care o avem cu roboții vocali, marcând o eră transformativă în angajamentul clienților și calitatea serviciului.













