Rozhovory
Nikola Mrksic, spoluzakladatel a CEO PolyAI – rozhovor

Nikola Mrksic je spoluzakladatel a CEO PolyAI, předního dodavatele podnikových hlasových asistentů pro automatizovanou zákaznickou službu.
Co vás最初 přitáhlo k umělým inteligencím?
Již od velmi mladého věku jsem se zajímal o matematiku a počítačové vědy. Během svých studií na Cambridgi jsem měl možnost pracovat s několika předními výzkumníky v oblasti strojového učení, včetně Steva Younga a Zoubina Ghahramaniho. Steve mě přesvědčil, abych se připojil k jeho startupu, VocalIQ, a pracoval na vývoji systémů pro mluvené dialogy. Později jsem dokončil doktorát u Steva a pracoval na vývoji datově řízených modelů pro pochopení jazyka, které fungují napříč různými použitími a jazyky. Konverzační AI je velmi obtížné a komplexní obor, který stále čeká na mnoho vědeckých a inženýrských průlomů, a od té doby mě udržuje zaměstnaným.
V roce 2017 jste spustil PolyAI, společnost pro konverzační AI, můžete diskutovat o příběhu vzniku PolyAI?
Mojí spoluzakladatelé, Shawn Wen, Eddy Su a já jsme dokončili své doktoráty na Cambridgi ve stejnou dobu. Pracovali jsme na systémech pro dialogy po mnoho let, ale brzy jsme si uvědomili, že typy sofistikovaných systémů, na kterých jsme pracovali, měly velmi málo komerčních aplikací. Proto jsme se rozhodli vytvořit řešení pro konverzační AI, které by bylo prospěšné ve skutečném světě. Viděli jsme příležitost pro skutečně konverzační, víceoborové, transakční dialogové systémy, které by mohly interagovat s skutečnými lidmi v každodenním životě.
Soustředili jsme se na zákaznickou službu, protože jsme cítili, že současné technologické schopnosti a požadavky zákazníků byly dobře sladěny.
Můžete diskutovat o některých technologiích strojového učení a zpracování přirozeného jazyka, které se používají?
Naše hlavní tajemství je naše sada různých proprietárních encoderových modelů. Tyto modely jsme předtrénovali na miliardách přirozených konverzací, takže mohou extrahovat intent i v případě, že vstupní řeč používá slang nebo idiomy. To je nesmírně důležité pro komunikaci po telefonu. Zákazníci nemluví v klíčových slovech; vyprávějí příběhy, přerušují, kladou otázky a obecně chtějí převzít kontrolu nad konverzací.
Nedávno jsme oznámili náš model ConVEx, který je extrémně datově efektivní extraktor entit, což nám umožňuje přesně extrahovat hodnoty z konverzací.
Naše proces ASR orchestrace zahrnuje použití fine-tuning speech recognition platforem pro neutralizaci šumu způsobeného různými akcenty, stejně jako fine-tuning pro různé kontexty.
Také jsme vyvinuli poměrně robustní knihovnu dialogových politik s předem navržených use case, které zahrnují všechny běžné transakce zákaznické služby, takže můžeme velmi rychle spustit nový hlasový asistent pro klienty.
Co podle vašeho názoru odlišuje dobrý produkt konverzační AI od špatného?
Dobrý produkt bude konzistentně rozumět tomu, co uživatelé myslí, a nikdy je nebude nutit opakovat se. Hovory často probíhají v hlučném prostředí, takže produkty potřebují být odolné vůči šumu. Když značky oslovují velké trhy, produkty potřebují rozumět různým akcentům a způsobům formulace intentů. Oba tyto požadavky vyžadují, aby produkty zajišťovaly robustní rozpoznávání řeči, odolné klasifikace intentu a extrakci entit.
Vynikající produkt bude aktivně zapojovat uživatele. Bude sledovat myšlenkový proces uživatele a bude schopen zvládnout komplexní, každodenní případy, kdy uživatelé mohou sdílet více intentů a kusů informací současně, a mohou přecházet mezi různými kontexty. To vyžaduje robustní multi-label klasifikaci a správu kontextu.
Zapojivý produkt bude vykazovat lidské charakteristiky bez toho, aby byl nehezký nebo příliš robotický. To znamená rychlé interakce, autentické hlasy, kontinuální zpětné vazby a určitou míru náhodnosti a nedokonalostí.
Nakonec, vynikající produkt konverzační AI bude interagovat s uživateli kdekoliv a bude nabízet bezproblémový, platformově specifický zážitek, který může zahrnovat hlas, SMS, chat nebo sociální messaging platformy. Interakční paradigma by mělo vycházet z konkrétnosti každé komunikační platformy.
Co jsou některé výhody použití konverzační AI místo pokusu o směrování dotazů na chatboty?
Zákaznický zážitek je kritický a stal se klíčovým faktorem pro udržení zákazníků. Hlavním cílem by mělo být usnadnění zákazníkům to, co potřebují udělat.
Telefon je stále nejpreferovanějším kanálem pro kontakt se společností. Až 65 % všech interakcí se zákazníky stále probíhá po telefonu. Během pandemie COVID-19 byly kontaktní centra vytlačena na hranice s více zákazníky než kdykoli předtím, kteří hledají podporu.
Samozřejmě, že skvělé zkušenosti umožňují zákazníkům komunikovat jakýmkoli způsobem, takže pro ty, kteří preferují asynchronní komunikaci, děláme to snadné pro značky, aby nabízely stejnou úroveň zkušeností napříč textovými kanály.
Jak velkou výzvou je detekovat intent toho, co se zákazník snaží říci?
Existuje řada výzev spojených s porozuměním zákazníkům prostřednictvím hlasových kanálů. Přesné a konzistentní porozumění uživatelům vyžaduje, aby mnoho komponent fungovalo dobře společně.
Prvním výzvou je rozpoznávání řeči, které je obtížné, zejména když lidé volají z hlučného prostředí, jako je například když jsou na handsfree nebo když jedou autem. Rozpoznávání řeči může být také obtížné v regionech s různými akcenty a dialekty. Vyvinuli jsme účinný způsob, jak předpojovat modely rozpoznávání řeči pro daný kontext, aby se optimalizovalo rozpoznávání řeči.
Protože náš model ConveRT byl trénován na tak obrovském množství konverzačních dat, je schopen detekovat intent i na slabých signálech, stejně jako lidé obecně rozumějí tomu, co někdo říká, i když jim chybí slovo nebo dvě.
Další úvahou je porozumění tomu, kdy uživatelé chtějí provést několik akcí najednou. Například někdo může říci: „Ztratil jsem kartu. Můžete mi říci, zda byla použita a zablokovat ji?“ V tomto případě model potřebuje rozpoznat dva intenty a jednat na nich v pořadí, které dává smysl.
Model také potřebuje být schopen extrahovat a porozumět entitám, které zákazníci poskytují. Například „Máte stůl na sobotní oběd pro mě, mou manželku a naše 2 děti?“ Povrchový intent zde je zkontrolovat dostupnost stolu, ale model potřebuje vybrat datum (sobota) a počet lidí (4) a jakékoli další potenciálně relevantní informace (například děti jsou pouze dovoleny v restaurační části a nemohou být usazeny v baru).
Nakonec konverzace není vždy lineární. Zákazníci mohou přerušit s otázkami nesouvisejícími s promptem hlasového asistenta, takže asistent potřebuje být schopen „naslouchat“ jedné typu vstupu, zatímco je otevřený pro různé spouštěče, jako jsou FAQs nebo změny informací dříve poskytnutých uživatelem.
Jaký je proces a časový rámec pro společnost, která chce spustit konverzační AI bot s PolyAI?
<p Jsme zde, abychom poskytli hlasové asistenty, které mají skutečný obchodní dopad. Proto začínáme každý projekt s objevováním, kde pomáháme klientům identifikovat a formulovat jejich cíle zákaznické zkušenosti, klíčové metriky a procesy podpory. To je místo, kde definujeme cesty, kterými bude hlasový asistent vést zákazníky. To, spolu s našimi předtrénovanými modely ConveRT, znamená, že nepotřebujeme velké množství konverzačních dat od klientů.
Od té doby jsme schopni vyvinout hlasového asistenta s velmi malým vstupem potřebným od klienta, takže to není vůbec náročné na interní IT týmy.
Podle složitosti můžeme spustit proof of value za pouhé 2 týdny a plně funkční nasazení za 2 měsíce.
Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit PolyAI.












