Intervjuer
Thuy Le, produktansvarlig i Speechmatics – Intervju-serie

Thuy Le er produktansvarlig i Speechmatics, Thuy har over to tiår med erfaring innen teknologi og utvikling av innovative ideer, samt en bachelorgrad i maskinteknikk fra MIT og en mastergrad i produktutvikling fra Stanford. Thuy har en bred erfaring innen produktledelse, design og utvikling, samt R&D, ingeniørarbeid, medieutvikling og forretningsstrategi. Hos Speechmatics er hun ansvarlig for å lansere innovative produkter og tjenester for å sikre at bedriften forblir markedets ledende i alt de gjør.
Du ble med i Speechmatics i november 2019 etter å ha arbeidet i en rekke ulike bransjer, inkludert selvkjørende kjøretøy og B2B-analyseprogramvare. Hva var det som tiltalte deg til å arbeide med talegjenkjenning?
Jeg har alltid vært tiltrukket av å bruke ny teknologi for interessante bruksområder og meningsfull innvirkning. Talegjenkjenning, spesielt hos Speechmatics, møter disse kriteriene. Det har vært fantastisk å hjelpe våre kunder med å utnytte verdien av tale-til-tekst i sine egne produkter.
Som produktansvarlig i Speechmatics, hva består din daglige arbeid av?
Speechmatics er en skalerbar bedrift, og vårt produktteam er lite (og vokser!), så ingen to dager er like, og alle bidrar hvor og når det er nødvendig. Som produktansvarlig, omfatter arbeidet alt fra overordnet selskaps- og produktstrategi til vanlige produktoppgaver som veikartprioritering og kundeinteraksjoner til detaljerte, hånd-til-hånd-løsninger for levering. Det er også viktig å bygge relasjoner over ulike funksjoner i organisasjonen og rekruttere.
Kan du diskutere utfordringene med å få tilgang til datasett med ulike dialekter og aksenter?
I taleteknologi er motoren vanligvis bygget ved å trene den på en dialekt av et språk, noe som gjør at den dialekten er den som den mest nøyaktig gjenkjenner og transkriberer. For engelsk er det amerikansk engelsk, og feilraten er vanligvis høyere for australske aksenter, britiske aksenter, jamaicanske aksenter og så videre. For bedrifter som benytter teknologien for å interagere med en global kundebase, presenterer dette en massiv utfordring. For tre år siden, i 2018, lanserte vi Global English, vårt bransjeledende språkpakke som forstår hver engelsk aksent og dialekt, og i fjor fortsatte vi denne misjonen med lanseringen av Global Spanish. Vi tror at taleteknologien må forstå alle den interagerer med for å nå sitt høyeste potensiale. Vi ser frem til å lukke AI-aksentgapet med flere innovasjoner som kommer senere i år.
Hva er noen av maskinlæringsmetodene som brukes for å trene fra disse datasettene?
Vi bruker kjente overvåkede dyptelærings-teknikker og neurale nettverk i vår motor. Vi forsker også kontinuerlig på nye tilnærminger, spesielt hvordan vi kan redusere mengden merket data som trengs i talegjenkjenningmodeller. Data er kongen når det gjelder å bygge talegjenkjenningsteknologi, så å fremme forskning som lar oss utvide vårt datatilbud er essensielt. Bruken av neurale nettverk i vår motor lar oss generalisere bedre over ulike kontekster og språk.
Speechmatics er for tiden en bransjeleder, med testing som viser at Global Spanish er 3-20% mer nøyaktig enn Googles tilbud og 4-13% mer nøyaktig enn Microsofts sammenlignbare produkt. Hva tilskriver du denne suksessen til?
Som jeg nevnte tidligere, må taleteknologien virkelig være en ressurs for bedrifter for å hjelpe dem med å forstå hele kundebasen, uansett hvilket språk de snakker eller hvilken dialekt de bruker. Dette er kjernen i Speechmatics’ innovasjoner, og vi er dedikert til å løse disse komplekse utfordringene. Og vi har et fantastisk team som er lidenskapelig, motivert og investert i å bruke de siste dyptelærings-teknikkene for å tilby kundene vår beste teknologi på markedet.
Hvilke språk tilbys det for tiden, og hvilke språk forskes det på for å bli lagt til?
Vi tilbyr over 30 kommersielle språk, fra arabisk til mandarin, polsk til portugisisk og mange flere. Men det er våre engelske og spanske språkpakker som er globale. Fremover ser vi på nye teknikker som vil lar oss ikke bare legge til nye språk raskere, men også forbedre våre eksisterende språk mer jevnlig.
Hva er dine synspunkter på en tale-aktivert fremtid hvor stemmen er den primære kommunikasjonsformen?
Bedrifter ser stadig mer verdi i talegjenkjenningsteknologi: I 2020 så vi en markant økning i adopsjonen av teknologien blant bedrifter, med 68% av respondentene som rapporterte at deres selskap har en taleteknologistrategi — en økning på 18% fra året før. Men for å nå maksimal verdi, må teknologien oppgraderes. En samtale er mer enn bare ord – det er også kontekstuelle hint som sentiment, rytme, punktering, bakgrunnsstøy, tone, endringer i taler og mer. Mens tekst fra talegjenkjenningsteknologi alene muliggjør mye verdi i seg selv, når det gjelder lyd- eller video-filer, kan den faktiske tale som er innspilt nå gå ut over bare ord. Fremtiden for talegjenkjenningsteknologi vil ta alle disse faktorene i betraktning. Først da vil det ikke bare være om å omdanne tale til tekst, men om å omdanne tale til verdi og virkelig forstå hver stemme.
Er det noe annet du ønsker å dele om Speechmatics?
Vi har noen virkelig spennende fremgang som kommer senere i år som vi gleder oss til å dele, så hold øye på dem!
Takk for det flotte intervjuet, lesere som ønsker å lære mer, kan besøke Speechmatics.












