Interviews
Thuy Le, Head of Product hos Speechmatics – Interviewserie

Thuy Le er Head of Product hos Speechmatics, Thuy har mere end to årtiers værd af erfaring inden for teknologi og udvikling af innovative ideer, samt en BS i mekanisk ingeniørvidenskab fra MIT og en MS i produkt-design fra Stanford. Thuy har en bred erfaring på tværs af produktledelse, design og udvikling samt R&D, ingeniørvidenskab, medieudvikling og forretningsstrategi. Hos Speechmatics er hun ansvarlig for at lancere innovative produkter og tjenester for at sikre, at virksomheden forbliver markedsledende i alt, hvad den gør.
Du tiltrådte Speechmatics i november 2019 efter at have arbejdet i en bred vifte af brancher, herunder selvstyrende køretøjer og B2B-analysesoftware. Hvad tiltrak dig til at arbejde med talegenkendelse?
Jeg er altid blevet tiltrukket af anvendelsen af ny teknologi til interessante brugsområder og meningsfuld indvirkning. Talegenkendelse, især hos Speechmatics, opfylder disse kriterier. Det har været fantastisk at hjælpe vores kunder med at udnytte værdien af tale-til-tekst i deres egne varierede produkttilbud.
Som Head of Product hos Speechmatics, hvad består din daglige arbejde af?
Speechmatics er en scale-up, og vores produktteam er småt (og vokser!), så ingen to dage er ens, og alle bidrager, hvor og når det er nødvendigt. Som Head of Product er alt fra højere niveau selskabs- og produktstrategi til typiske produktopgaver som vejledning af produktplan og kundeinteraktioner til detaljeret håndtering af problemer ved levering alle en del af jobbet. Selvfølgelig er opbygning af relationer på tværs af de forskellige funktioner i organisationen og rekruttering også en vigtig del af rollen.
Kan du diskutere udfordringerne ved at få adgang til datasæt med forskellige dialekter og accenter?
Inden for taleteknologi er motoren normalt bygget ved at træne den på en dialekt af et sprog, hvilket gør, at denne dialekt er den, den genkender og transkriberer mest præcist. På engelsk er det amerikansk engelsk, og fejlratene er typisk højere for australske accenter, britiske accenter, jamaicanske accenter og så videre. For virksomheder, der udnytter teknologien til at interagere med en global kundebase, repræsenterer dette en enorm udfordring. For tre år siden, i 2018, lancerede vi Global English, vores brancheledende sprogpakke, der forstår hver enkelt engelsk accent og dialekt, og sidste år fortsatte vi denne mission med lanceringsaf Global Spanish. Vi mener, at taleteknologien for at nå sin højeste potentiale skal forstå enhver, den interagerer med. Vi ser frem til at yderligere lukke den kunstig intelligens-“accent-lucke” med flere innovationer, der kommer senere i år.
Hvad er nogle af de maskinlæringsmetoder, der anvendes til at træne fra disse datasæt?
Vi anvender velkendte supervised deep learning-teknikker og neurale netværk i vores motor. Vi forsker også kontinuerligt i nye tilgange, især hvordan vi kan reducere mængden af markeret data, der er nødvendig i ASR-modeller. Data er kongen, når det kommer til at bygge talegenkendelsesteknologi, så det er essentiel at fremme forskning, der tillader os at udvide vores dataområde. Anvendelsen af neurale netværk i vores motor giver os mulighed for bedre at generalisere på tværs af forskellige kontekster og sprog.
Speechmatics er i øjeblikket en brancheleder med test, der viser, at Global Spanish er 3-20% mere præcis end Googles tilbud og 4-13% mere præcis end Microsofts tilsvarende produkt. Hvad tilskriver du denne succes til?
Som jeg nævnte tidligere, skal taleteknologien virkelig være en aktiv for virksomheder for at hjælpe dem med at forstå deres samlede kundebase, uanset hvilket sprog de taler, eller hvilken dialekt de bruger. Dette er kernen i Speechmatics’ innovationer, og vi er dedikeret til at løse disse komplekse udfordringer. Og vi har et fantastisk team, der er passioneret, drevet og investeret i at bruge de seneste dybe lærings-teknikker til at tilbyde vores kunder den bedste teknologi på markedet.
Hvilke sprog tilbyder I i øjeblikket, og hvilke sprog forskes der i for at blive tilføjet?
Vi tilbyder i øjeblikket over 30 kommercielle sprog, fra arabisk til mandarin, polsk til portugisisk og mange flere. Men det er vores engelske og spanske sprogpakker, der er globale. Fremover ser vi på nye teknikker, der ikke kun vil tillade os at tilføje nye sprog hurtigere, men også forbedre vores eksisterende sprog mere regelmæssigt.
Hvad er dine synspunkter på en taleaktiveret fremtid, hvor stemme er den primære form for kommunikation?
Virksomheder ser stadig mere værdi i talegenkendelsesteknologi: I 2020 så vi en markant stigning i antallet af virksomheder, der har en stemme-teknologi-strategi — 68% af respondenterne rapporterede, at deres virksomhed havde en stemme-teknologi-strategi, en stigning på 18% fra året før. Men for at nå maksimal værdi skal teknologien opgraderes. En samtale består af mere end bare ord – det handler også om kontekstuelle hints som sentiment, kadence, punktum, baggrundsstøj, tone, skift af taler og mere. Mens tekst fra talegenkendelsesteknologi alene giver mulighed for en del værdi i sig selv, kan den, når det kommer til lydfiler eller endda video-filer, udvide sig ud over bare ord. Fremtiden for talegenkendelsesteknologi vil tage alle disse andre faktorer i betragtning. Først da vil det ikke blot handle om at omdanne tale til tekst, men om at omdanne tale til værdi og virkelig forstå hver enkelt stemme.
Er der noget andet, du gerne vil dele om Speechmatics?
Vi har nogle rigtig spændende fremskridt, der kommer senere i år, som vi glæder os til at dele, så hold øje på dem!
Tak for det gode interview, læsere, der ønsker at lære mere, skal besøge Speechmatics.












