Wywiady
Nikola Mrksic, współzałożyciel i CEO PolyAI – seria wywiadów

Nikola Mrksic jest współzałożycielem i CEO PolyAI, wiodącym dostawcą gotowych do użycia w przedsiębiorstwach asystentów głosowych do automatycznego obsługiwanie klientów.
Czym pierwotnie zainteresował Cię się AI?
Od bardzo wczesnego wieku interesowałem się matematyką i informatyką. Podczas studiów w Cambridge miałem okazję pracować z kilkoma wiodącymi naukowcami z dziedziny machine learningu, w tym z Steve’em Youngiem i Zoubinem Ghahramanim. Steve przekonał mnie do dołączenia do jego startupu, VocalIQ, aby pracować nad systemami dialogowymi. Później zrobiłem doktorat z Steve’em, pracując nad budowaniem modeli zrozumienia języka opartych na danych, które działają w różnych przypadkach użycia i językach. Sztuczna inteligencja konwersacyjna to bardzo trudna i złożona dziedzina pracy, z wieloma jeszcze nie rozwiązanymi problemami naukowymi i inżynierskimi, i zajmuje mnie od tego czasu.
W 2017 roku założyłeś PolyAI, firmę zajmującą się sztuczną inteligencją konwersacyjną, możesz opowiedzieć o historii powstania PolyAI?
Moi współzałożyciele, Shawn Wen, Eddy Su i ja robiliśmy doktoraty w Cambridge w tym samym czasie. Pracowaliśmy nad systemami dialogowymi przez lata, ale wkrótce zrealizowaliśmy, że rodzaje zaawansowanych systemów, nad którymi pracowaliśmy, miały bardzo niewiele komercyjnych zastosowań. Więc połączyliśmy się, aby stworzyć rozwiązanie sztucznej inteligencji konwersacyjnej, które będzie przydatne w prawdziwym świecie. Zobaczyliśmy możliwość stworzenia prawdziwie konwersacyjnych, wieloetapowych, transakcyjnych systemów dialogowych, które mogą wchodzić w interakcje z prawdziwymi ludźmi w codziennym życiu.
Skoncentrowaliśmy się na obsłudze klienta, ponieważ uważaliśmy, że bieżące możliwości technologiczne i wymagania klientów były dobrze dopasowane.
Czy możesz opowiedzieć o niektórych technologiach machine learningu i przetwarzania języka naturalnego, które są używane?
Naszym głównym sekretem są nasze różne modele encjera, które są własnością PolyAI. Wstępnie trenowaliśmy je na miliardach naturalnych rozmów, aby mogły wyodrębnić intencje, nawet gdy wejściowy tekst mówiony używa slangów lub idiomy. Jest to niezwykle ważne dla komunikacji przez telefon. Klienci nie mówią w kluczowych słowach; opowiadają historie, przerywają, zadają pytania i generalnie chcą kontrolować rozmowę.
Ostatnio ogłosiliśmy nasz model ConVEx, który jest niezwykle wydajnym wyodrębnianiem encji, co pozwala nam dokładnie wyodrębnić wartości z rozmów.
Nasze ASR (Automated Speech Recognition) obejmuje użycie platformy rozpoznawania mowy, aby zneutralizować hałas spowodowany różnymi akcentami, a także dostosowanie do różnych kontekstów.
Stworzyliśmy również dość solidną bibliotekę polityki dialogowej z predefiniowanymi przypadkami użycia, które obejmują wszystkie powszechne transakcje obsługi klienta, abyśmy mogli szybko uruchomić nowego asystenta głosowego dla klientów.
Twoim zdaniem, co różni dobry produkt sztucznej inteligencji konwersacyjnej od złego?
Dobry produkt będzie stale rozumiał, co użytkownicy mają na myśli i nigdy nie zmusi użytkowników do powtarzania się. Rozmowy często odbywają się w hałaśliwych środowiskach, więc produkty muszą być odporne na zaburzenia wejścia. Ponieważ marki docierają do dużych rynków, produkty muszą rozumieć różne akcenty i sposoby formułowania intencji. Obie te rzeczy wymagają, aby produkty gwarantowały solidne możliwości rozpoznawania mowy, odporne klasyfikowanie intencji i wyodrębnianie encji.
Wspaniały produkt będzie aktywnie angażował użytkowników. Będzie on śledził tok myśli użytkownika i będzie w stanie obsłużyć złożone, codzienne przypadki, w których użytkownicy mogą udostępniać wiele intencji i informacji jednocześnie, i mogą przechodzić między różnymi kontekstami. Wymaga to solidnej klasyfikacji wieloetykietowej i zarządzania kontekstem.
Angażujący produkt będzie wykazywał cechy ludzkie, nie będąc nieprzyjemnie sztuczny. Oznacza to interakcje w czasie rzeczywistym, autentyczne głosy, ciągłe sygnały zwrotne i pewien stopień losowości i niedoskonałości.
Wreszcie, wspaniały produkt sztucznej inteligencji konwersacyjnej będzie angażował się z użytkownikami, gdziekolwiek się znajdują, i oferował będzie spójne, specyficzne dla platformy doświadczenie, które może obejmować głos, SMS, czat lub platformy mediów społecznościowych. Paradigma interakcji powinna przyjmować specyfikę każdej platformy komunikacyjnej.
Jakie są niektóre zalety korzystania przez firmy z sztucznej inteligencji konwersacyjnej zamiast kierowania zapytań do botów czatu?
Doświadczenie klienta jest kluczowe i stało się kluczowym czynnikiem retencji. Najwyższym priorytetem powinno być ułatwienie klientom wykonania tego, co muszą zrobić.
Telefon jest nadal najbardziej preferowanym kanałem kontaktu z firmą przez większość klientów. Do 65% wszystkich interakcji z klientami nadal odbywa się przez telefon. Podczas pandemii COVID-19 centra kontaktowe były narażone na ekstremalne obciążenia, z większą liczbą klientów niż kiedykolwiek wcześniej, którzy dzwonili w celu uzyskania wsparcia.
Oczywiście, wspaniałe doświadczenie pozwala klientom komunikować się w dowolny sposób, więc dla tych, którzy preferują komunikację asynchroniczną, ułatwiamy firmom oferowanie tego samego poziomu doświadczenia w kanałach tekstowych.
Jak duże jest wyzwanie w wykrywaniu intencji tego, co klient próbuje powiedzieć?
Istnieje wiele wyzwań związanych z zrozumieniem klientów przez kanały głosowe. Dokładne i ciągłe zrozumienie znaczenia użytkownika wymaga, aby wiele składników działało dobrze razem.
Pierwszym wyzwaniem jest trudność w rozpoznawaniu mowy, zwłaszcza gdy ludzie dzwonią z hałaśliwych środowisk, takich jak gdy są na głośniku lub gdy jadą przez ruch lub tunele. Rozpoznawanie mowy może być również trudne w regionach z różnymi akcentami i dialektami. Rozwinęliśmy skuteczny sposób, aby obciążyć modele rozpoznawania mowy dla danego kontekstu, aby zoptymalizować rozpoznawanie mowy.
Ponieważ nasz model ConveRT został wstępnie trenowany na tak ogromnej ilości danych konwersacyjnych, jest w stanie wykryć intencje na słabych sygnałach, tak jak ludzie zwykle rozumieją, co ktoś mówi, nawet jeśli przegapią słowo lub dwa.
Kolejnym rozważaniem jest zrozumienie, kiedy użytkownicy chcą wykonać kilka akcji jednocześnie. Na przykład, ktoś może powiedzieć: “Zgubiłem kartę. Czy możesz mi powiedzieć, czy została użyta i zablokować ją?”. W tym przypadku model musi rozpoznać dwie intencje i działać na nich w sposób, który ma sens.
Model musi również być w stanie wyodrębnić i zrozumieć encje, które są udostępniane przez klientów. Na przykład: “Czy macie stolik na sobotni lunch dla mnie, mojej żony i naszych 2 dzieci?”. Na powierzchni intencja jest sprawdzeniem dostępności stolika, ale model musi wyodrębnić datę (sobota) i liczbę osób (4) oraz wszelkie inne potencjalnie istotne informacje (może dzieci są dozwolone tylko w obszarze restauracji i nie mogą być obsłużone w barze).
Wreszcie, rozmowa nie zawsze jest liniowa. Klienci mogą przerywać z pytaniami niezwiązanymi z monologiem asystenta głosowego, więc asystent musi być w stanie “słuchać” jednego rodzaju wejścia, przy jednoczesnym pozostawaniu otwartym na różne wyzwania, takie jak często zadawane pytania lub zmiany informacji wcześniej dostarczonych przez użytkownika.
Jaki jest proces i harmonogram wymagany dla firmy, która chce uruchomić asystenta głosowego z PolyAI?
Jesteśmy tutaj, aby zapewnić asystentów głosowych, które mają wymierne wpływ biznesowy. Zaczynamy każde zaangażowanie od odkrycia, w którym pomagamy klientom identyfikować i artykułować ich cele CX, kluczowe metryki i procesy wsparcia. To jest tam, gdzie określamy trasy, którymi asystent głosowy musi kierować klientów. To, plus nasz wstępnie wytrenowany model ConveRT, oznacza, że nie potrzebujemy ogromnych ilości danych konwersacyjnych od klientów.
Po tym możemy opracować asystenta głosowego z bardzo małym wkładem wymaganym od klienta, więc nie jest to wcale wymagające dla wewnętrznych zespołów IT.
W zależności od złożoności, możemy uruchomić dowód wartości w ciągu zaledwie 2 tygodni, a w pełni rozwinięte wdrożenie w 2 miesiące.
Dziękujemy za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić PolyAI.












