Rozhovory

Thuy Le, Head of Product ve Speechmatics – Interview Series

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Thuy Le je Head of Product ve Speechmatics, Thuy má přes dvě desetiletí zkušeností v technologii a rozvoji inovativních nápadů, stejně jako BS v oboru mechanického inženýrství z MIT a MS v oboru produktového designu ze Stanfordu. Thuy má široký rozsah zkušeností v oblasti produktového managementu, designu a vývoje, stejně jako výzkumu a vývoje, inženýrství, mediálního rozvoje a obchodních strategií. Ve Speechmatics je jeho úkolem spuštění inovativních produktů a služeb, aby zajistil, že podnik zůstane lídrem na trhu ve všem, co dělá.

Připojil jste se k Speechmatics v listopadu 2019 po práci v různých odvětvích, včetně samořízených vozidel a softwaru pro B2B analýzu. Co vás přitáhlo k práci ve speech recognition?

Jsem vždy byl přitahován k aplikaci nové technologie pro zajímavé použití a významný dopad. Speech recognition, zejména ve Speechmatics, splňuje tato kritéria. Skutečně, bylo skvělé pomoci našim zákazníkům využít hodnotu speech-to-text ve svých vlastních rozmanitých produktových nabídkách.

Jako Head of Product ve Speechmatics, co tvoří váš denní režim?

Speechmatics je scale-up a náš produktový tým je malý (a rostoucí!), takže žádný dva dny nejsou podobné a každý přispívá tam, kde je třeba. Jako Head of Product, vše od vyšších firemních a produktových strategií až po typické produktové povinnosti, jako je prioritizace roadmap a interakce se zákazníky, až po detailní řešení problémů při dodávce, jsou všechny relevantní. Samozřejmě, budování vztahů napříč různými funkcemi v organizaci a nábor jsou také důležitou součástí role.

Můžete diskutovat o výzvách přístupu k datovým sadám s různými dialekty a akcenty?

V speech technologii je engine obvykle postaven tak, aby byl trénován na jeden dialekt jazyka, což dělá ten dialekt tím, který je nejpřesněji rozpoznán a přepisován. V angličtině je to americká angličtina, a chybové sazby jsou obvykle vyšší pro australské akcenty, britské akcenty, jamajské akcenty a tak dále. Pro společnosti, které využívají technologii k interakci s globální zákaznickou základnou, představuje to obrovskou výzvu. Před třemi lety, v roce 2018, jsme spustili Global English, náš průmyslový vůdčí balíček jazyka, který rozumí každému anglickému akcentu a dialektu, a loni jsme pokračovali v této misi spuštěním Global Spanish. Věříme, že pro speech technologii, aby dosáhla svého nejvyššího potenciálu, musí rozumět každému, s kým interaguje. Těšíme se na další uzavření AI “akcentové mezery” s dalšími inovacemi, které budou představeny později tohoto roku.

Jaké jsou některé z metod machine learningu, které se používají k trénování z těchto datových sad?

Používáme známé supervizované hluboké učení techniky a neuronové sítě v našem engine. Také neustále zkoumáme nové přístupy, zejména, jak snížit množství označených dat potřebných v ASR modelech. Data jsou králem při budování speech recognition technologie, takže pokročilý výzkum, který umožňuje našim datům dosáhnout širšího dosahu, je nezbytný. Použití neuronových sítí v našem engine nám umožňuje lépe generalizovat napříč různými kontexty a jazyky.

Speechmatics je目前 průmyslovým lídrem s testováním, které zjistilo, že Global Spanish je o 3-20 % přesnější než nabídka Google (GOOGL ) a o 4-13 % přesnější než srovnatelný produkt Microsoftu. Čemu přisuzujete tento úspěch?

(MSFT )

Jako jsem již zmínil, pro speech technologii, aby byla skutečným aktivem pro podniky, musí pomoci podnikům pochopit jejich celou zákaznickou základnu, bez ohledu na to, jaký jazyk mluví, nebo jaký dialekt používají. To je jádrem inovací Speechmatics, a jsme zavázáni řešit tyto komplexní výzvy. A máme úžasný tým, který je vášnivý, odhodlaný a investovaný do používání nejnovějších hlubokých učení technik, aby našim zákazníkům nabídl nejlepší technologii na trhu.

Jaké jsou současné jazyky, které jsou nabízeny, a které jazyky jsou aktuálně zkoumány, aby byly přidány?

Nabízíme více než 30 komerčních jazyků, od arabštiny po mandarínštinu, polštinu po portugalštinu a mnoho dalších. Ale naše anglické a španělské jazykové balíčky jsou Globální. Když se díváme dopředu, zkoumáme nové techniky, které nám umožní nejen přidat nové jazyky rychleji, ale také zlepšit naše stávající jazyky pravidelněji.

Jaké jsou vaše názory na budoucnost, kde je hlas primární formou komunikace?

Podniky stále více vidí hodnotu ve speech recognition technologii: v roce 2020 došlo k výraznému nárůstu přijetí této technologie mezi podniky, s 68 % respondentů, kteří uvádějí, že jejich společnost má strategii hlasové technologie – o 18 % více než loni. Ale aby dosáhla svého maximálního potenciálu, technologie musí být dále vylepšena. Konverzace se skládá nejen ze slov, ale také z kontextových podnětů, jako je sentiment, kadence, interpunkce, pozadí, tón, změny mluvčího a mnoho dalších. Zatímco text ze speech recognition technologie sám o sobě umožňuje mnoho hodnot, když se jedná o audio soubory nebo dokonce video soubory, skutečný projev, který je zaznamenán, může nyní překročit pouze slova. Budoucnost speech recognition technologie bude zohledňovat všechny tyto další faktory. Teprve tehdy nebude pouze o převodu řeči na text, ale o převodu řeči na hodnotu a skutečném pochopení každého hlasu.

Je něco jiného, co byste rádi sdíleli o Speechmatics?

Máme opravdu zajímavé pokroky, které budou představeny později tohoto roku, takže se na ně těšte!

Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit Speechmatics.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.