Interviuri
Nikola Mrksic, Co-fondator și CEO al PolyAI – Seria de interviuri

Nikola Mrksic este co-fondator și CEO al PolyAI, un important furnizor de asistenți vocali pentru servicii de asistență clienți automate.
Ce v-a atras inițial spre inteligența artificială?
Am fost atras de matematică și informatică de la o vârstă foarte fragedă. În timpul studiilor mele la Cambridge, am avut ocazia să lucrez cu mai mulți cercetători de vârf în domeniul învățării automate, printre care Steve Young și Zoubin Ghahramani. Steve m-a convins să mă alătur startup-ului său, VocalIQ, pentru a lucra la sisteme de dialog vocal. Mai târziu, am făcut și un doctorat cu Steve, lucrând la modele de înțelegere a limbajului bazate pe date care funcționează în diferite cazuri de utilizare și limbi. Inteligența conversațională este un domeniu foarte dificil și complex, cu multe descoperiri științifice și inginerești încă înainte, și m-a ținut ocupat de atunci.
În 2017, ați lansat PolyAI, o companie de inteligență conversațională. Puteți discuta despre povestea de fond a PolyAI?
Co-fondatorii mei, Shawn Wen, Eddy Su și eu am făcut doctoratele la Cambridge în același timp. Am lucrat la sisteme de dialog timp de ani, dar am realizat curând că sistemele sofisticate la care lucram aveau foarte puține aplicații comerciale. Așa că ne-am unit pentru a crea o soluție de inteligență conversațională care să fie benefică în lumea reală. Am văzut o oportunitate pentru sisteme de dialog conversațional, multi-turn, tranzacțional care să poată interacționa cu oameni reali în viața de zi cu zi.
Ne-am concentrat pe serviciile de asistență clienți, deoarece am simțit că capacitățile tehnologice actuale și cerințele clienților erau bine potrivite.
Puteți discuta despre unele dintre tehnologiile de învățare automată și prelucrare a limbajului natural utilizate?
Secretul nostru principal este setul nostru de modele de codificare proprietare. Le-am pre-antrenat pe miliarde de conversații naturale, astfel încât pot extrage intenția chiar și atunci când vorbirea de intrare utilizează slang sau idiome, de exemplu. Acest lucru este incredibil de important pentru comunicarea telefonică. Clienții nu vorbesc în cuvinte cheie; spun povești, întrerup, pun întrebări și, în general, doresc să preia controlul conversației.
Am anunțat recent modelul nostru ConVEx, un extractor de entități extrem de eficient din punct de vedere al datelor, care ne permite să extragem valori din conversații cu acuratețe.
Procesul nostru de orchestrare a recunoașterii vorbirii implică utilizarea platformelor de recunoaștere a vorbirii pentru a neutraliza zgomotul cauzat de diferite accente, precum și pentru a ajusta pentru diferite contexte.
Am dezvoltat, de asemenea, o bibliotecă de politici de dialog foarte robustă, cu cazuri de utilizare pre-proiectate care includ toate tranzacțiile obișnuite de servicii de asistență clienți, astfel încât putem crea un asistent vocal pentru clienți extrem de rapid.
În opinia dvs., ce diferențiază un produs de inteligență conversațională bun de unul slab?
Un produs bun va înțelege în mod constant ceea ce doresc utilizatorii și nu va face niciodată să repete utilizatorii. Apelurile telefonică se pot face în medii zgomotoase, astfel încât produsele trebuie să fie rezistente la intrări murdare. Pe măsură ce brandurile se adresează unor piețe mari, produsele trebuie să înțeleagă o varietate de accente și moduri de exprimare a intențiilor. Ambele acestea necesită ca produsele să garanteze capacități robuste de recunoaștere a vorbirii, clasificare a intenției și extragere a entităților.
Un produs excelent va fi activ implicat pentru utilizatori. Va urma gândurile utilizatorului și va putea gestiona cazuri complexe, de zi cu zi, în care utilizatorii pot împărtăși multiple intenții și piese de informații simultan și pot sări între diferite contexte. Acest lucru necesită clasificare multi-etichetă robustă și gestionare a contextului.
Un produs implicat va afișa caracteristici umane fără a fi neplăcut sau prea robotic. Acest lucru înseamnă interacțiuni rapide, voci autentice, semnale de feedback continue și un anumit grad de aleatoriu și imperfecțiuni.
În cele din urmă, un produs excelent de inteligență conversațională va interacționa cu utilizatorii în orice loc și va oferi o experiență fără întrerupere, specifică platformei, care poate cuprinde voce, SMS, chat sau platforme de mesagerie socială. Paradigma de interacțiune trebuie să îmbrățișeze specificitatea fiecărei platforme de comunicare.
Care sunt unele dintre avantajele pe care le au companiile care utilizează inteligența conversațională în loc de a încerca să direcționeze întrebările către boturile de chat?
Experiența clienților este critică și a devenit un factor cheie pentru retenție. Prioritatea principală ar trebui să fie facilitarea clienților să facă ceea ce au nevoie să facă.
Telefonul este încă canalul preferat al majorității clienților pentru contactarea unei companii. Până la 65% din toate interacțiunile clienților au loc încă telefonic. În timpul pandemiei COVID-19, centrele de contact au fost împinse la extreme, cu mai mulți clienți decât oricând care solicită suport.
Desigur, o experiență excelentă permite clienților să comunice în orice mod doresc, astfel încât pentru oricine preferă comunicațiile asincrone, facem ca brandurile să ofere același nivel de experiență pe canalele textuale.
Cât de dificil este detectarea intenției a ceea ce încearcă un client să spună?
Există o serie de provocări în înțelegerea clienților prin canalele vocale. Înțelegerea în mod exact și constant a înțelesului utilizatorilor necesită numeroase componente care funcționează bine împreună.
În primul rând, recunoașterea vorbirii este dificilă, mai ales atunci când oamenii sună de la medii zgomotoase, cum ar fi atunci când sunt la volan sau în tuneluri. Recunoașterea vorbirii poate fi, de asemenea, dificilă în regiuni cu accente și dialecte diferite. Am dezvoltat o modalitate eficientă de a ajusta modelele de recunoaștere a vorbirii pentru contextul dat, pentru a optimiza recunoașterea vorbirii.
Deoarece modelul nostru ConveRT a fost antrenat pe o cantitate atât de mare de date conversaționale, poate detecta intenția pe semnale slabe, la fel ca și oamenii, care pot, în general, să înțeleagă ceea ce spune cineva, chiar dacă pierd un cuvânt sau două.
O altă considerație este înțelegerea atunci când utilizatorii doresc să efectueze mai multe acțiuni simultan. De exemplu, cineva ar putea spune: “Am pierdut cardul meu. Puteți să-mi spuneți dacă a fost utilizat și să-l blocați?”. În acest caz, modelul trebuie să recunoască două intenții și să le acționeze într-o ordine care are sens.
Modelul trebuie, de asemenea, să poată extrage și înțelege entitățile oferite de clienți. De exemplu, “aveți o masă sâmbătă pentru mine, soția mea și cei doi copii ai mei?”. La nivelul suprafeței, intenția aici este verificarea disponibilității unei mese, dar modelul trebuie să extragă data (sâmbătă) și numărul de persoane (4) și orice altă informație relevantă care poate fi importantă (poate copiii nu sunt admis în zona restaurantului și nu pot fi așezați la bar).
În cele din urmă, conversația nu este întotdeauna liniară. Clienții pot întrerupe cu întrebări nelegate de promptul asistentului vocal, astfel încât asistentul trebuie să “asculte” pentru un anumit tip de intrare, în timp ce este deschis pentru declanșatoare diferite, cum ar fi întrebări frecvente sau modificări ale informațiilor furnizate anterior de utilizator.
Care este procesul și cronologia necesare pentru o companie care dorește să lanseze un bot de inteligență conversațională cu PolyAI?
Suntem aici pentru a oferi asistenți vocali care au un impact tangibil asupra afacerilor. Așa că începem fiecare angajament cu o descoperire în care ajutăm clienții să identifice și să articuleze obiectivele lor de experiență a clienților, metrici cheie și procese de suport. Acesta este locul în care definim călătoriile pe care asistentul vocal trebuie să le ghideze clienții. Acest lucru, împreună cu modelul nostru pre-antrenat ConveRT, înseamnă că nu avem nevoie de cantități mari de date conversaționale de la clienți.
De acolo, putem dezvolta un asistent vocal cu foarte puțin input necesar de la client, astfel încât nu este deloc solicitant pentru echipele de IT interne.
În funcție de complexitate, putem crea o dovadă a valorii în cel mult 2 săptămâni și o implementare completă în 2 luni.
Mulțumim pentru acest interviu minunat, cititorii care doresc să afle mai multe despre PolyAI ar trebui să viziteze PolyAI.












