Wywiady
Thuy Le, Dyrektor Produktu w Speechmatics – Seria Wywiadów

Thuy Le jest Dyrektorem Produktu w Speechmatics, Thuy ma ponad dwie dekady doświadczenia w technologiach i rozwoju innowacyjnych pomysłów, a także tytuł licencjata w dziedzinie inżynierii mechanicznej z MIT oraz tytuł magistra w dziedzinie projektowania produktu ze Stanfordu. Thuy ma szerokie doświadczenie w zarządzaniu produktem, projektowaniu i rozwoju, a także w badaniach i rozwoju, inżynierii, rozwoju mediów i strategii biznesowej. W Speechmatics, jest odpowiedzialna za wprowadzanie innowacyjnych produktów i usług, aby zapewnić, że firma pozostaje liderem rynku we wszystkim, co robi.
Dołączyłaś do Speechmatics w listopadzie 2019 roku, po pracy w różnych branżach, w tym w pojazdach samochodowych i oprogramowaniu analitycznym B2B. Co skłoniło Cię do pracy w rozpoznawaniu mowy?
Zawsze byłem przyciągany przez zastosowanie nowych technologii w ciekawych przypadkach i mających znaczenie. Rozpoznawanie mowy, zwłaszcza w Speechmatics, spełnia te kryteria. Oczywiście, było wspaniale pomóc naszym klientom w wykorzystaniu wartości technologii rozpoznawania mowy w ich własnych różnorodnych ofertach produktowych.
Jako Dyrektor Produktu w Speechmatics, jak wygląda Twój dzień?
Speechmatics to firma w fazie rozwoju, a nasz zespół produktowy jest mały (i rośnie!), więc nie ma dwóch podobnych dni i każdy wkłada się tam, gdzie i kiedy jest to potrzebne. Jako Dyrektor Produktu, wszystko, od strategii firmy i produktu po typowe obowiązki produktowe, takie jak ustalanie priorytetów i interakcje z klientami, a także szczegółowe rozwiązywanie problemów, jest równie ważne. Oczywiście, budowanie relacji z różnymi działami w organizacji i rekrutacja są również ważną częścią roli.
Czy mogłabyś omówić wyzwania związane z dostępem do zestawów danych z różnymi dialektami i akcentami?
W technologiach mowy, silnik jest zwykle budowany poprzez szkolenie go na jednym dialekcie języka, co sprawia, że ten dialekt jest tym, który najbardziej dokładnie rozpoznaje i transkrybuje. W języku angielskim jest to amerykański angielski, a wskaźniki błędów są zwykle wyższe dla akcentów australijskich, brytyjskich, jamajskich itd. Dla firm wykorzystujących tę technologię do interakcji z globalną bazą klientów, jest to ogromne wyzwanie. Trzy lata temu, w 2018 roku, wprowadziliśmy Global English, nasz wiodący pakiet językowy, który rozumie każdy akcent i dialekt angielski, a w zeszłym roku kontynuowaliśmy tę misję z wprowadzeniem Global Spanish. Wierzymy, że technologia rozpoznawania mowy musi zrozumieć każdego, z kim wchodzi w interakcję, aby osiągnąć swój najwyższy potencjał. Spodziewamy się dalszych innowacji w tym zakresie w tym roku.
Jakie metody uczenia maszynowego są stosowane do szkolenia z tych zestawów danych?
Używamy znanych technik głębokiego uczenia i sieci neuronowych w naszym silniku. Uczymy się również nowych podejść, zwłaszcza jak zmniejszyć ilość oznaczonych danych potrzebnych w modelach ASR. Dane są królem przy budowaniu technologii rozpoznawania mowy, więc rozwijanie badań, które pozwalają nam poszerzyć nasz zasięg danych, jest niezwykle ważne. Użycie sieci neuronowych w naszym silniku pozwala nam lepiej uogólniać w różnych kontekstach i językach.
Speechmatics jest obecnie liderem branży, a testy wykazały, że Global Spanish jest o 3-20% bardziej dokładny niż oferta Google (GOOGL ) i o 4-13% bardziej dokładny niż produkt Microsoftu. Co przypisujesz temu sukcesowi?
(MSFT )Jak wspomniałem wcześniej, technologia rozpoznawania mowy musi pomóc firmom zrozumieć całą swoją bazę klientów, niezależnie od języka, którym mówią, czy dialektu, którym używają. To jest rdzeń innowacji Speechmatics, i jesteśmy zaangażowani w rozwiązywanie tych złożonych wyzwań. I mamy niesamowity zespół, który jest pasjonowany, zmotywowany i zaangażowany w wykorzystywanie najnowszych technik głębokiego uczenia, aby oferować naszym klientom najlepszą technologię na rynku.
Jakie języki są obecnie oferowane i jakie języki są obecnie badane, aby je dodać?
Obecnie oferujemy ponad 30 języków komercyjnych, od arabskiego do chińskiego, polskiego do portugalskiego i wielu innych. Ale to nasze pakiety językowe angielskiego i hiszpańskiego są globalne. Spójrzmy w przyszłość, szukamy nowych technik, które pozwolą nam nie tylko dodać nowe języki szybciej, ale także poprawić nasze istniejące języki regularnie.
Jakie są Twoje poglądy na przyszłość, w której mowa jest główną formą komunikacji?
Firmy coraz częściej widzą wartość w technologiach rozpoznawania mowy: w 2020 roku odnotowano znaczny wzrost przyjęcia tej technologii wśród przedsiębiorstw, a 68% respondentów zgłosiło, że ich firma ma strategię technologii głosowej – o 18% więcej niż w zeszłym roku. Ale aby osiągnąć maksymalny potencjał, technologia wymaga podniesienia na wyższy poziom. Rozmowa to nie tylko słowa – składa się również z kontekstowych wskazówek, takich jak sentyment, kadencja, interpunkcja, hałas tła, ton, zmiany głosu i wiele innych. Chociaż tekst z technologii rozpoznawania mowy umożliwia wiele wartości, gdy chodzi o pliki audio lub wideo, zarejestrowana mowa może teraz wykraczać poza same słowa. Przyszłość technologii rozpoznawania mowy weźmie pod uwagę wszystkie te czynniki. Dopiero wtedy nie będzie to tylko kwestia zamiany mowy na tekst, ale przekształcenia mowy w wartość i prawdziwego zrozumienia każdego głosu.
Czy jest coś jeszcze, co chciałabyś podzielić się o Speechmatics?
Mamy naprawdę ekscytujące innowacje, które zostaną wprowadzone w tym roku, więc trzymajcie się za oko!
Dziękuję za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić Speechmatics.












