Liderzy opinii
Agenci głosowi opartych na AI dla przedsiębiorstw: Dwa kluczowe wyzwania

Teraz, bardziej niż kiedykolwiek wcześniej, jest czas na systemy głosowe oparte na AI. Rozważmy połączenie z działem obsługi klienta. Wkrótce wszystkie sztywność i nieelastyczność znikną – sztywne, robotyczne głosy, “naciśnij jeden dla sprzedaży”-styl ograniczających menu, irytujące doświadczenia, które miały nas wszystkich desperacko naciskających zero w nadziei na rozmowę z żywym agentem. (Lub, biorąc pod uwagę długie czasy oczekiwania, które mogą wynikać z przeniesienia do żywego agenta, zrezygnowaliśmy z połączenia).
Nie więcej. Postępy nie tylko w opartych na transformatorach dużych modelach językowych (LLM), ale także w automatycznym rozpoznawaniu mowy (ASR) i systemach tekst-głos (TTS) oznaczają, że “następna generacja” agentów głosowych jest tu – jeśli wiesz, jak je zbudować.
Dziś przyjrzymy się wyzwaniom, które stoją przed każdym, kto chce zbudować taki nowoczesny agent głosowy.
Dlaczego głos?
Zanim zaczniemy, przyjrzyjmy się ogólnym atrakcjom i istotności agentów głosowych (w przeciwieństwie do interakcji opartych na tekście). Istnieje wiele powodów, dla których interakcja głosowa może być bardziej odpowiednia niż interakcja oparta na tekście – mogą to być:
-
Preferencja lub nawyk – mówienie poprzedza rozwój pisarski i historyczny
-
Wolne wprowadzanie tekstu – wiele osób może mówić szybciej niż pisać
-
Sytuacje bez użycia rąk – takie jak prowadzenie samochodu, ćwiczenia lub mycie naczyń
-
Analfabetyzm – przynajmniej w języku (językach), których agent rozumie
-
Niepełnosprawność – taka jak ślepota lub brak nie-głosowej kontroli motorycznej
W erze, która zdaje się być zdominowana przez transakcje za pośrednictwem stron internetowych, głos pozostaje potężnym kanałem dla handlu. Na przykład, niedawne badanie przeprowadzone przez JD Power na temat satysfakcji klientów w branży hotelarskiej wykazało, że goście, którzy zarezerwowali pokój przez telefon, byli bardziej zadowoleni ze swojego pobytu niż ci, którzy zarezerwowali przez agencję turystyczną (OTA) lub bezpośrednio na stronie hotelu.
Ale interaktywne odpowiedzi głosowe, czyli IVR, nie są wystarczające. Badanie z 2023 r. przeprowadzone przez Zippia wykazało, że 88% klientów preferuje rozmowy głosowe z żywym agentem zamiast nawigowania po automatycznym menu telefonicznym. Badanie wykazało również, że najbardziej irytujące rzeczy w menu telefonicznym to:
Istnieje otwartość na korzystanie z asystentów głosowych. Według badania przeprowadzonego przez Accenture, około 47% konsumentów jest już komfortowo korzysta z asystentów głosowych, aby wchodzić w interakcje z firmami, a około 31% konsumentów już korzystało z asystenta głosowego, aby wchodzić w interakcje z firmą.
Niezależnie od powodu, dla wielu osób istnieje preferencja i popyt na interakcje głosowe – o ile są one naturalne i komfortowe.
Co sprawia, że agent głosowy jest dobry?
Mówiąc ogólnie, dobry agent głosowy powinien odpowiadać użytkownikowi w sposób, który jest:
-
Odpowiedni: Opiera się na poprawnym zrozumieniu tego, co użytkownik powiedział/chciał. Należy zauważyć, że w niektórych przypadkach odpowiedź agenta nie będzie tylko odpowiedzią mówioną, ale pewną formą działania poprzez integrację z backendem (np. faktyczne zarezerwowanie pokoju hotelowego, gdy klient mówi “Przejdź do rezerwacji”).
-
Dokładny: Opiera się na faktach (np. tylko mów, że jest dostępny pokój w hotelu 19 stycznia, jeśli jest)
-
Jasny: Odpowiedź powinna być zrozumiała
-
Terminowy: Z opóźnieniem, jakiego można oczekiwać od człowieka
-
Bezpieczny: Nie ma obraźliwego lub nieodpowiedniego języka, ujawniania chronionych informacji itp.
Problem
Obecne systemy automatyczne oparte na głosie próbują spełnić powyższe kryteria, ale za cenę a) bycia a) bardzo ograniczonymi i b) bardzo frustrującymi w użyciu. Część tego wynika z wysokich oczekiwań, jakie kontekst konwersacyjny głosowy nakłada, a te oczekiwania rosną, im jakość głosu w systemach TTS staje się nieodróżnialna od głosu ludzkiego. Ale te oczekiwania są zniszczone w systemach, które są powszechnie wdrożone w tym momencie. Dlaczego?
W słowie – nieelastyczność:
-
Ograniczona mowa – użytkownik jest zwykle zmuszony mówić nienaturalnie: krótkie frazy, w określonej kolejności, bez zbędnych informacji itp. To oferuje niewielką lub żadną przewagę nad starym systemem menu opartym na numerach
-
Wąska, nieinkluzywna koncepcja “akceptowalnej” mowy – niska tolerancja na slang, “uhm” i “ahh” itp.
-
Brak możliwości cofnięcia: Jeśli coś pójdzie nie tak, może być mała szansa na “naprawienie” lub skorygowanie problematycznej informacji, ale zamiast tego trzeba zacząć od nowa lub czekać na transfer do żywego agenta.
-
Ścisłe przekazywanie – brak możliwości przerwania lub mówienia agentowi
Nie trzeba dodawać, że ludzie uważają te ograniczenia za irytujące lub frustrujące.
Rozwiązanie:
Dobra wiadomość jest taka, że nowoczesne systemy AI są wystarczająco potężne i szybkie, aby znacznie poprawić powyższe rodzaje doświadczeń, zamiast tego zbliżać się do (lub przekraczać!) standardy obsługi klienta opartej na ludziach. Wynika to z różnych czynników:
-
Szybsze, bardziej wydajne urządzenia
-
Ulepszenia w ASR (wyższa dokładność, pokonywanie hałasu, akcentów itp.)
-
Ulepszenia w TTS (brzmiące naturalnie lub nawet sklonowane głosy)
-
Pojawienie się generatywnych LLM (rozmowy brzmiące naturalnie)
Ostatni punkt to przełom. Kluczowym spostrzeżeniem było to, że dobry model predykcyjny może służyć jako dobry model generatywny. Sztuczny agent może zbliżyć się do ludzkiej wydajności konwersacyjnej, jeśli powie to, co wystarczająco dobry LLM przewiduje jako najbardziej prawdopodobną rzecz, jaką dobry agent obsługi klienta powiedziałby w danym kontekście konwersacyjnym.
Sygnał do przybycia dziesiątek startupów AI, które mają nadzieję rozwiązać problem agenta konwersacyjnego głosowego, po prostu wybierając i łącząc moduły ASR i TTS z rdzeniem LLM. Z tego punktu widzenia rozwiązanie jest po prostu kwestią wyboru kombinacji, która minimalizuje opóźnienia i koszty. I oczywiście, to jest ważne. Ale czy to wystarczy?
Nie tak szybko
Istnieją kilka konkretnych powodów, dla których ten prosty podejście nie zadziała, ale wynikają one z dwóch ogólnych punktów:
-
LLM nie mogą samodzielnie zapewnić dobrej, opartej na faktach konwersacji tekstowej, takiej jakiej wymagają aplikacje przedsiębiorstw, takie jak obsługa klienta. Nie mogą więc samodzielnie zrobić tego samego dla konwersacji głosowych. Coś więcej jest potrzebne.
-
Nawet jeśli uzupełnisz LLM o to, co jest potrzebne do stworzenia dobrego agenta konwersacyjnego opartego na tekście, przekształcenie go w dobrego agenta konwersacyjnego głosowego wymaga więcej niż tylko podłączenie go do najlepszych modułów ASR i TTS, jakie możesz kupić.
Przyjrzyjmy się konkretnemu przykładowi każdego z tych wyzwań.
Wyzwanie 1: Utrzymanie realizmu
Jak jest powszechnie wiadome, LLM czasami produkują nieprecyzyjne lub “halucynowane” informacje. Jest to katastrofalne w kontekście wielu aplikacji komercyjnych, nawet jeśli mogłoby to stanowić dobrą aplikację rozrywkową, w której dokładność nie jest punktem.
To, że LLM czasami halucynują, nie jest zaskoczeniem, gdy się nad tym zastanowimy. Jest to bezpośrednią konsekwencją korzystania z modeli szkolonych na danych z roku (lub więcej) temu, aby wygenerować odpowiedzi na pytania o fakty, które nie są częścią (lub wynikają z) zestawu danych (nawet ogromnego), który może być rok lub więcej stary. Gdy klient pyta “Jaki jest mój numer członkowski?”, prosty wstępnie wytrenowany LLM może wygenerować tylko brzmiącą prawdopodobnie odpowiedź, a nie dokładną.
Najczęstsze sposoby radzenia sobie z tym problemem to:
-
Dostosowanie: Ucz LLM dalej, tym razem na wszystkich danych specyficznych dla domeny, które chcesz, aby mógł odpowiedzieć poprawnie.
-
Inżynieria podpowiedzi: Dodaj dodatkowe dane/instrukcje jako dane wejściowe do LLM, oprócz historii konwersacyjnej
-
Retrieval Augmented Generation (RAG): Podobnie jak inżynieria podpowiedzi, z tym że dane dodane do podpowiedzi są określane na bieżąco przez dopasowanie bieżącego kontekstu konwersacyjnego (np. klient spytał “Czy wasz hotel ma basen?”) do indeksu zakodowanego w postaci osadzonej Twoich danych specyficznych dla domeny (który zawiera np. plik, który mówi: “Oto udogodnienia dostępne w hotelu: basen, sauna, stacja ładowania EV”).
-
Kontrola oparta na regułach: Podobnie jak RAG, ale to, co ma być dodane (lub odjęte) od podpowiedzi, nie jest określone przez dopasowanie pamięci neuronowej, ale jest określone przez zasady zakodowane na sztywno (i napisane ręcznie).
Należy zauważyć, że rozmiar nie pasuje do wszystkiego. To, który z tych metod będzie odpowiedni, zależy od przykładu danych specyficznych dla domeny, które informują odpowiedź agenta. W szczególności zależy to od tego, czy dane te zmieniają się często (np. od połączenia do połączenia – np. nazwa klienta) czy prawie w ogóle (np. początkowe powitanie: “Witaj, dziękujemy za połączenie z Hotelem Budapeszt. Jak mogę Ci dzisiaj pomóc?”). Dostosowanie nie byłoby odpowiednie dla pierwszego, a RAG byłby nieporęcznym rozwiązaniem dla drugiego. Więc każdy działający system musi korzystać z kombinacji tych metod.
Co więcej, integracja tych metod z LLM i wzajemnie w sposób, który minimalizuje opóźnienia i koszty, wymaga starannego inżynierii. Na przykład, wydajność Twojego modelu RAG może się poprawić, jeśli dostosujesz go do ułatwienia tej metody.
Może nie być zaskoczeniem, że każda z tych metod wprowadza własne wyzwania. Na przykład, weźmy dostosowanie. Dostosowanie Twojego wstępnie wytrenowanego LLM na Twoich danych specyficznych dla domeny poprawi jego wydajność na tych danych, tak. Ale dostosowanie modyfikuje parametry (wagi), które są podstawą dobrej ogólnej wydajności wstępnie wytrenowanego modelu. Ta modyfikacja powoduje więc “zapomnienie” (lub “katastrofalne zapomnienie”) niektórych wcześniejszych wiadomości modelu. Może to skutkować tym, że model daje niepoprawne lub nieodpowiednie (nawet niebezpieczne) odpowiedzi. Jeśli chcesz, aby Twój agent nadal odpowiadał dokładnie i bezpiecznie, potrzebujesz metody dostosowania, która łagodzi zapomnienie katastrofalne.
Wyzwanie 2: Punkty końcowe
Określenie, kiedy klient skończył mówić, jest kluczowe dla naturalnego przepływu konwersacji. Podobnie, system musi obsługiwać przerwania w sposób, który zapewnia, że konwersacja pozostaje spójna i odpowiada na potrzeby klienta. Osiągnięcie tego na poziomie porównywalnym z interakcją człowieka jest złożonym zadaniem, ale jest niezbędne do tworzenia naturalnych i przyjemnych doświadczeń konwersacyjnych.
Rozwiązanie, które działa, wymaga od projektantów, aby rozważyć pytania takie jak:
-
Jak długo po tym, jak klient przestaje mówić, agent powinien czekać, zanim zdecyduje, że klient przestał mówić?
-
Czy powyższe zależy od tego, czy klient ukończył pełne zdanie?
-
Co należy zrobić, jeśli klient przerwie agenta?
-
W szczególności, czy agent powinien założyć, że to, co mówił, nie zostało usłyszane przez klienta?
Te kwestie, które mają głównie do czynienia z czasem, wymagają starannego inżynierii, poza tym, co jest zaangażowane w uzyskanie odpowiedzi LLM.
Podsumowanie
Ewolucja systemów głosowych opartych na AI obiecuje rewolucyjną zmianę w dynamice obsługi klienta, zastępując przestarzałe systemy telefoniczne zaawansowanymi LLM, ASR i TTS. Jednakże, pokonanie wyzwań związanych z halucynowanymi informacjami i płynnymi punktami końcowymi będzie kluczowe dla dostarczania naturalnych i efektywnych interakcji głosowych.
Automatyzacja obsługi klienta ma możliwość stać się prawdziwym przełomem dla przedsiębiorstw, ale tylko wtedy, gdy zostanie wykonana poprawnie. W 2024 r., zwłaszcza z tymi nowymi technologiami, możemy wreszcie zbudować systemy, które mogą czuć się naturalne i płynne, i które mogą nas dobrze zrozumieć. Efekt sieciowy zmniejszy czasy oczekiwania i poprawi obecne doświadczenie, które mamy z botami głosowymi, oznaczając przełomową erę w zaangażowaniu klienta i jakości obsługi.













