Modele i platformy AI
Vikrant Tomar, CTO i założyciel Fluent.ai – seria wywiadów

Vikrant Tomar jest CTO i założycielem Fluent.ai, oprogramowania do rozpoznawania mowy i interfejsu głosowego dla producentów urządzeń i dostawców usług.
Czym było to, co pierwotnie przyciągnęło Twoją uwagę do studiowania modelowania akustycznego w rozpoznawaniu mowy?
Rzeczywiście, możliwość rozmawiania z urządzeniami w taki sam sposób, w jaki rozmawiamy z innymi ludźmi. Ta wizja była dla mnie fascynująca. Zacząłem studiować rozpoznawanie mowy w ostatnim roku studiów licencjackich. To było także wtedy, kiedy zacząłem interesować się badaniami, więc zdecydowałem się na kurs rozpoznawania mowy i powiązany projekt badawczy. Udało mi się opublikować artykuł badawczy na konferencji InterSpeech, jednej z największych i najbardziej renomowanych konferencji rozpoznawania mowy, dzięki tej pracy. Wszystko to skłoniło mnie do wyboru badań nad rozpoznawaniem mowy jako długoterminowego celu, stąd doktorat.
W 2015 roku założyłeś Fluent.ai, możesz opowiedzieć o historii powstania tego startupu?
Miałem długotrwałą skłonność do przedsiębiorczości. Ja i dwóch innych przyjaciół próbowaliśmy założyć firmę po ukończeniu studiów licencjackich, jednak z kilku powodów ten wysiłek nie powiódł się. Podczas mojego doktoratu na Uniwersytecie McGill, obserwowałem scenę startupową w Montrealu. W tym czasie skontaktowałem się również z ludźmi z TandemLaunch – startupową foundry, gdzie założyłem Fluent.ai. Byłem wtedy bliżej końca mojego doktoratu i poważnie rozważałem podjęcie się przedsiębiorczości ponownie. Dzięki mojemu doświadczeniu, badaniom i współpracy z innymi grupami badawczymi, zrozumiałem, że większość tych doświadczeń koncentrowała się na rozpoznawaniu mowy w określony sposób: od mowy do transkrypcji tekstu, a następnie przetwarzanie języka naturalnego. Jednakże, pozostawiło to lukę w użyteczności. Duża część populacji nie może skorzystać z rozwiązań rozpoznawania mowy opracowanych w ten sposób. Ilość danych wymaganych do takich metod jest tak duża, że nie miałoby to sensu ekonomicznego, aby opracować oddzielne modele dla języków z mniejszą liczbą użytkowników. Ponadto, wiele dialektów i języków nie ma odrębnej formy pisanej. Nawet moja własna rodzina nie mogła korzystać z narzędzi opracowanych przeze mnie (mówią w dialekcie hindi). Biorąc to wszystko pod uwagę, zacząłem myśleć o innych sposobach tworzenia modeli mowy, gdzie ilość wymaganych danych byłaby mniejsza, a użytkownik końcowy mógłby samodzielnie szkolić lub aktualizować modele. Byłem świadomy pracy wykonanej na Uniwersytecie KU Leuven (KUL), która mogłaby spełnić niektóre z tych wymagań. Z częścią technologii pochodzącej z KUL, byliśmy w stanie podjąć pierwsze kroki w kierunku tego, czym jest Fluent.ai dzisiaj.
Możesz wyjaśnić intuicyjne rozwiązania Fluent.ai do zrozumienia mowy?
Rozwiązania rozpoznawania mowy Fluent.ai są inspirowane tym, jak ludzie nabywają i rozpoznają języki. Konwencjonalne systemy rozpoznawania mowy najpierw transkrybują wejściową mowę do tekstu, a następnie wyodrębniają znaczenie z tego tekstu. Nie jest to sposób, w jaki ludzie rozpoznają mowę. Weźmy przykład dzieci przed tym, jak nauczą się czytać i pisać: pomimo nieznajomości żadnej wiedzy o pisemnej reprezentacji języków, są w stanie prowadzić rozmowę z łatwością. W podobny sposób, modele oparte na głębokich sieciach neuronowych Fluent.ai są w stanie bezpośrednio wyodrębnić znaczenie z dźwięków mowy bez konieczności ich wcześniejszej transkrypcji do tekstu. Technicznie jest to prawdziwe zrozumienie mowy. Istnieją liczne zalety tego podejścia. Tradycyjne rozpoznawanie mowy jest nużącym podejściem, w którym kilka modułów szkolonych oddzielnie jest łączonych, aby zapewnić ostateczną odpowiedź. To skutkuje nieoptymalnym rozwiązaniem, które cierpi na zmiany wyników dla akcentów, hałasu, warunków tła itp. System automatycznego rozpoznawania intencji (AIR) Fluent.ai jest zoptymalizowany na końcu; jest to całkowicie architektura oparta na sieciach neuronowych, w której wszystkie moduły są szkolone wspólnie, aby zapewnić najbardziej optymalne rozwiązanie. Ponadto, jesteśmy w stanie usunąć kilka obciążających obliczeniowo modułów powszechnie występujących w konwencjonalnych systemach rozpoznawania mowy. To pozwala nam tworzyć systemy rozpoznawania mowy o niskim zużyciu pamięci, które mogą działać w tak małej ilości jak 40 KB pamięci RAM na niskim mikrokontrolerze działającym z częstotliwością 50 MHz. Wreszcie, nasze systemy zrozumienia mowy oparte na AIR są w stanie wykorzystać podobieństwa między różnymi językami w unikalny sposób, aby zapewnić niezrównane funkcje, takie jak możliwość rozpoznawania wielu języków w tym samym modelu.
Jakie są niektóre wyzwania związane z rozpoznawaniem mowy w hałasie?
Hałas jest jednym z największych wyzwań dla rozpoznawania mowy. To, co sprawia, że jest to naprawdę trudny problem, to fakt, że istnieje wiele różnych typów hałasu i wpływają one na widmo mowy w różny sposób. Czasami hałas może również wpłynąć na odpowiedź mikrofonu. W wielu przypadkach nie jest możliwe oddzielenie źródeł mowy od źródeł hałasu. W niektórych przypadkach hałas powoduje maskowanie informacji dostępnych w widmie mowy, podczas gdy w innych może całkowicie usunąć użyteczne informacje. Oba skutkują niską dokładnością. Podczas gdy jest łatwo usunąć spójne typy hałasu, takie jak hałas wentylatora, niektóre typy hałasu, takie jak szum tłumu lub muzyka, są bardzo trudne do usunięcia, ponieważ wpływają one na widmo mowy w różny sposób.
Czym jest Edge AI i jak Fluent.ai wykorzystuje ten typ AI?
Edge AI jest pojęciem obejmującym kilka różnych sposobów, w jakie aplikacje AI mogą być przeniesione na urządzenia niskiej mocy. Coraz częściej ten termin jest używany w przypadkach, w których urządzenia krawędziowe wykonują pewne inteligentne obliczenia same. W Fluent.ai koncentrujemy się na wprowadzeniu wysokiej jakości zrozumienia mowy na krawędź. Opracowaliśmy wydajne algorytmy, które pozwalają urządzeniom niskiej mocy samodzielnie rozpoznawać mowę wejściową bez konieczności wysyłania danych do chmury do przetwarzania. Zalety są podwójne: po pierwsze, prywatność użytkownika nie jest zagrożona przez przesyłanie i przechowywanie danych głosowych w chmurze. Po drugie, taki podejście zmniejsza opóźnienia, ponieważ dane mowy i odpowiedzi nie muszą podróżować między serwerem chmury a urządzeniem.
Jakie inne typy technologii machine learning są wykorzystywane?
Naszym głównym celem są podejścia oparte na głębokim uczeniu maszynowym do rozpoznawania mowy. Wykorzystujemy metody RL (uczenie wzmocnienia), np. NASIL[1], do odkrywania nowych, wcześniej nieznanych architektur modeli AI (w pewnym sensie AI tworzące AI). I wykorzystujemy AutoML do dostrojenia naszych wcześniej ustalonych modeli AI, aby osiągnąć niezawodne wyniki dla różnych aplikacji, co zwiększa niezawodność i powtarzalność. Kompresja modelu i inne podejścia matematyczne pomagają dalej zoptymalizować wydajność modelu.
Co się wydarzy w ciągu najbliższych 5 lat dla zarówno zrozumienia języka naturalnego, jak i przetwarzania języka naturalnego?
Myślę, że systemy będą ewoluować, aby zapewnić bardziej naturalne interakcje. Pomimo postępów w ostatnich latach, większość obecnych systemów może odpowiedzieć tylko na proste zapytania lub wykonać głosową wyszukiwarkę internetu. Zobaczymy więcej rozwiązań, które mogą rozumować i odpowiedzieć na pełne zapytanie dla osoby, zamiast funkcjonować jako uwielbiany głosowy silnik wyszukiwarki.
Inny interesujący aspekt to prywatność. Obecne popularne rozwiązania są głównie urządzeniami podłączonymi do internetu, które przesyłają wszystkie dane głosowe użytkownika do serwera chmury. Jednakże, prywatność takich rozwiązań staje się problemem. Zaczynamy również widzieć aplikacje interfejsu głosowego poza elektroniką konsumencką w środowiskach przemysłowych, w profesjonalnej przestrzeni audio, a także w hotelach i salach konferencyjnych. Kluczowym wymogiem dla tych aplikacji jest prywatność, dlatego obecne rozwiązania podłączone do chmury nie wystarczają – zobaczymy więc znacznie więcej rozwiązań AI na krawędzi lub na urządzeniu.
Jak wcześniej wspomniałem, rozwiązania mowy i języka naturalnego pozostają niedostępne dla dużej części światowej populacji. Trwa wiele pracy nad tworzeniem nowych typów modeli AI, które mogą być szkolone na małej ilości danych, co skutkuje zmniejszeniem kosztów rozwoju i umożliwia tworzenie modeli w językach z mniejszą liczbą użytkowników. W tym samym kierunku, zobaczymy rozwiązania, które mogą uczyć się rozpoznawać wiele języków w tym samym modelu. Ogólnie, zobaczymy coraz więcej wdrożeń modeli AI wielojęzycznych, które mogą odpowiedzieć na zapytanie użytkownika w jego ojczystym języku.
Czy jest coś jeszcze, co chciałbyś podzielić się na temat Fluent.ai?
Technologia mowy przeszła długą drogę w ciągu ostatnich kilku lat i ma ogromny potencjał wzrostu na drodze przed nami. W Fluent.ai zawsze szukamy nowych przypadków użycia naszej istniejącej technologii, jednocześnie nieustannie innowując wewnętrznie. Pandemia COVID-19 spowodowała zwiększoną wrażliwość na obszary o wysokim poziomie dotyku, takie jak przyciski windy, kioski w restauracjach i więcej, co wywołało nowy popyt na technologie głosowe. Fluent.ai chce pomóc wypełnić te luki, ponieważ nasze rozwiązania są wielojęzyczne i tym samym bardziej inkluzywne, oraz działają offline, oferując dodatkową warstwę prywatności. Te funkcje, jak wcześniej wspomniano, prawdopodobnie będą przyszłością technologii mowy.
Dziękuję za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić stronę Fluent.ai.
[1] https://www.researchgate.net/profile/Farzaneh_Sheikhnezhad_Fard/publication/341083699_Nasil_Neural_Archit












