Interviews
Nikola Mrksic, medstifter og administrerende direktør i PolyAI – Intervju-serie

Nikola Mrksic er medstifter og administrerende direktør i PolyAI, en førende leverandør af virksomhedsklare taleassistenter til automatiseret kundeservice.
Hvad var det, der oprindeligt tiltrak dig til AI?
Jeg har været interesseret i matematik og datalogi fra en meget tidlig alder. Under mine studier på Cambridge fik jeg chancen for at arbejde med flere førende maskinlæringsforskere, herunder Steve Young og Zoubin Ghahramani. Steve overbeviste mig om at joinde hans startup, VocalIQ, for at arbejde på at bygge talebaserede dialogsystemer. Senere endte jeg med at gøre en ph.d. med Steve, hvor jeg arbejdede på at bygge data-drevne sprogforståelsesmodeller, der fungerer på tværs af forskellige brugsområder og sprog. Konversations-AI er et rigtig hårdt og komplekst arbejdsområde med mange videnskabelige og tekniske gennembrud endnu foran os, og det har holdt mig beskæftiget lige siden.
I 2017 lancerede du PolyAI, et konversations-AI-selskab. Kan du diskutere historien bag PolyAI?
Mine medstiftere, Shawn Wen, Eddy Su og jeg gjorde vores ph.d.’er på Cambridge på samme tid. Vi havde arbejdet på dialogsystemer i år, men vi indså snart, at de sofistikerede systemer, vi var vant til at arbejde med, havde meget få kommercielle anvendelser. Så vi kom sammen for at skabe en konversations-AI-løsning, der ville være nyttig i den virkelige verden. Vi så en mulighed for rigtig konversationsbaserede, multi-turn, transaktionsbaserede dialogsystemer, der kunne interagere med rigtige mennesker i hverdagslivet.
Vi fokuserede på kundeservice, da vi følte, at den nuværende teknologiske kapacitet og kundernes krav var godt matchet.
Kan du diskutere nogle af de maskinlærings- og sprogbehandlings-teknologier, der anvendes?
Vores hovedhemmelighed er vores sæt af forskellige proprietære encoder-modeller. Vi har forudtrænet dem på milliarder af naturlige samtaler, så de kan udtrække intention selv, når inputtalen bruger slang eller idiomer f.eks. Dette er utrolig vigtigt for kommunikation over telefonen. Kunder taler ikke i nøgleord; de fortæller historier, afbryder, stiller spørgsmål og vil generelt bare tage kontrol over samtalen.
Vi har nyligt annonceret vores ConVEx-model, en ekstremt data-effektiv enheds-ekstraktor, der tillader os at udtrække værdier fra samtaler.
Vores ASR-koordineringsproces indebærer at bruge finjustering af talegenkendelsesplatforme til at neutralisere støjen forårsaget af forskellige accenter samt finjustering for forskellige kontekster.
Vi har også udviklet en ret robust dialogpolitik-bibliotek med foruddefinerede brugsområder, der inkluderer alle almindelige kundeservice-transaktioner, så vi kan starte en ny taleassistent for kunder ekstremt hurtigt.
I din mening, hvad adskiller et godt konversations-AI-produkt fra et dårligt?
Et godt produkt vil konsekvent forstå, hvad brugerne mener, og vil aldrig få brugerne til at gentage sig. Opkald sker ofte i støjende omgivelser, så produkterne skal være robuste over for beskidte input. Da mærker når ud til store markeder, skal produkterne forstå en variation af accenter og måder at udtrykke intentioner på. Begge disse kræver, at produkterne kan garantere robust talegenkendelse, robust intentionsklassificering og enheds-ekstraktion.
Et fantastisk produkt vil være aktivt engagerende for brugerne. Det vil følge brugernes tankegang og kan håndtere komplekse, hverdagslige tilfælde, hvor brugerne måske deler flere intentioner og stykker af information samtidigt, og de måske hopper mellem forskellige kontekster. Dette kræver robust multi-label-klassificering og kontekststyring.
Et engagerende produkt vil vise menneskelige karaktertræk uden at være unaturligt eller for robotisk. Dette indebærer hurtige interaktioner, ægte stemmer, kontinuerlig feedback og en vis grad af tilfældighed og fejl.
Til sidst vil et fantastisk konversations-AI-produkt engagere sig med brugerne, hvor de end måtte være, og tilbyde en sammentænkt, platform-specifik oplevelse, der kan omfatte tale, SMS, chat eller sociale meddelelser. Interaktionsparadigmet skal omfavne hver kommunikationsplatforms specifikke karakter.
Hvad er nogle af fordelene ved, at virksomheder bruger konversations-AI i stedet for at forsøge at kanalisere forespørgsler til chatbots?
Kundeservice er kritisk og er blevet en nøgle-driver for kundehold. Det øverste prioritet skal være at gøre det let for kunder at gøre, hvad de har brug for at gøre.
Telefonen er stadig de fleste kunders foretrukne kanal for at kontakte en virksomhed. Op til 65% af alle kundesamtaler sker stadig over telefonen. Under COVID-19-pandemien er kontaktsentrene blevet presset til det yderste med flere kunder end nogensinde, der ringer for at få support.
Selvfølgelig tillader en god oplevelse kunderne at kommunikere, som de vil. For alle, der foretrækker asynkrone kommunikation, gør vi det nemt for mærker at tilbyde det samme niveau af oplevelse på tværs af tekstuelle kanaler.
Hvor stort et udfordring er det at opdage intentionen bag, hvad en kunde forsøger at sige?
Der er en række udfordringer med at forstå kunder gennem talekanaler. At forstå kundernes mening korrekt og konsekvent kræver, at mange komponenter fungerer godt sammen.
Først og fremmest er talegenkendelse svært, især når folk ringer fra støjende omgivelser, som f.eks. når de er på højttaler, eller når de kører gennem trafik eller tunneller. Talegenkendelse kan også være svært i regioner med forskellige accenter og dialekter. Vi har udviklet en effektiv måde at bias talegenkendelsesmodeller for den givne kontekst for at optimere talegenkendelse.
Fordi vores ConveRT-model er trænet på så mange konversationsdata, kan den opdage intention på svage signaler, ligesom vi mennesker generelt kan forstå, hvad nogen siger, selv hvis vi misser et par ord.
En anden overvejelse er at forstå, når brugere vil udføre flere handlinger på én gang. F.eks. kunne nogen sige: “Jeg har tabt min kort. Kan du fortælle mig, om det er blevet brugt, og blokere det?” I dette tilfælde skal modellen genkende to intentioner og handle på dem i en orden, der giver mening.
Modellen skal også kunne udtrække og forstå de enheder, der tilbydes af kunderne. F.eks. “Har du en tabel på lørdag til frokost til mig, min kone og vores 2 børn?” Overfladens intention her er at tjekke tilgængelighed for en tabel, men modellen skal udtrække dato (lørdag) og antallet af personer (4) og eventuelt anden relevant information (f.eks. børn måske kun er tilladt i restaurantområdet og ikke på baren).
Til sidst er samtale ikke altid lineær. Kunder kan afbryde med spørgsmål, der ikke er relateret til taleassistentens prompt, så assistenten skal kunne “lytte ud” efter en type input, mens den er åben for forskellige udløsere som f.eks. ofte stillede spørgsmål eller ændringer i information, der tidligere er blevet leveret af brugeren.
Hvad er processen og tidsrammen for en virksomhed, der ønsker at lancere en konversations-AI-bot med PolyAI?
Vi er her for at levere taleassistenter, der har en konkrete forretningsimpact. Så vi starter hver engagement med en opdagelse, hvor vi hjælper kunderne med at identificere og formulere deres CX-mål, nøglemetrik og supportprocesser. Dette er, hvor vi afgrænser de rejser, taleassistenten skal guide kunderne gennem. Dette, plus vores forudtrænede ConveRT-model, betyder, at vi ikke har brug for enorme mængder af konversationsdata fra kunderne.
Herefter kan vi udvikle en taleassistent med meget lidt input fra kunden, så det er ikke særdeles krævende for interne IT-teams.
Afhængigt af kompleksiteten kan vi starte en bevis for værdi på så lidt som 2 uger og en fuldt udbygget implementering på 2 måneder.
Tak for det gode interview. Læsere, der ønsker at lære mere, skal besøge PolyAI.












