Modely a platformy AI

Vikrant Tomar, CTO a zakladatel Fluent.ai – rozhovor

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Vikrant Tomar je CTO a zakladatel Fluent.ai, softwaru pro porozumění řeči a hlasového uživatelského rozhraní pro zařízení OEM a poskytovatele služeb.

Co vás původně přitáhlo ke studiu akustického modelování pro rozpoznávání řeči?

Skutečně, být schopný mluvit s zařízeními stejným způsobem, jako mluvíme s jiným člověkem. Toto vidění mě fascinuje. Začal jsem studovat rozpoznávání řeči během posledního roku svého bakalářského studia. To bylo také tehdy, kdy jsem začal být intéressován výzkumem, takže jsem absolvoval kurz rozpoznávání řeči a související výzkumný projekt. Byl jsem schopen publikovat výzkumnou práci na konferenci InterSpeech, jedné z největších a nejuznávanějších konferencí o rozpoznávání řeči. Všechno tohle mě motivovalo k tomu, abych si zvolil výzkum v oblasti rozpoznávání řeči jako dlouhodobý cíl, a proto jsem se rozhodl pro doktorát.

V roce 2015 jste spustil Fluent.ai, můžete sdílet příběh o vzniku této společnosti?

Měl jsem vždy v sobě touhu po podnikání. Já a dva další přátelé jsme se pokusili založit společnost po dokončení bakalářského studia, ale z několika důvodů se to nepodařilo. Během svého doktorátu na McGillu jsem sledoval startup scénu v Montrealu. V té době jsem také přišel do kontaktu s lidmi z TandemLaunch – startup foundry, kde jsem vytvořil Fluent.ai. V té době jsem byl již gần konci svého doktorátu a vážně zvažoval možnost podnikání. Prostřednictvím své pracovní zkušenosti, výzkumu a asociace s jinými skupinami pro výzkum řeči jsem si uvědomil, že většina z těchto zkušeností se soustředila na provádění rozpoznávání řeči určitým způsobem: přechod od řeči k přepisu textu a poté zpracování přirozeného jazyka. To však zanechalo mezery v uživatelském rozhraní. Velká část populace nemůže využít řečových řešení vyvinutých tímto způsobem. Množství dat vyžadovaných pro tyto metody je tak velké, že by nebylo finančně smysluplné vyvinout samostatné modely pro jazyky s menším počtem mluvčích. Kromě toho mnoho dialektů a jazyků nemá samostatnou písemnou formu. Ani moji vlastní rodina nemohla využít nástroje, které jsem vyvinul (mluví dialektem hindštiny). S ohledem na to jsem začal uvažovat o různých způsobech vytváření řečových modelů, kde by bylo vyžadováno méně dat, a/nebo kde by mohl koncový uživatel sám trénovat nebo aktualizovat modely. Byl jsem si vědom práce provedené na KU Leuven University (KUL), která by mohla splňovat některé z těchto požadavků. S částí technologie pocházející z KUL jsme byli schopni učinit první kroky směrem k tomu, co je Fluent dnes.

Můžete vysvětlit intuitivní řešení pro porozumění řeči od Fluent.ai?

Rozpoznávání řeči od Fluent.ai je inspirováno tím, jak lidé získávají a rozpoznávají jazyky. Konvenční systémy rozpoznávání řeči nejprve přepisují vstupní řeč do textu a poté extrahují význam z tohoto textu. To není způsob, jakým lidé rozpoznávají řeč. Vzít například děti předtím, než se naučí číst a psát: přestože neví nic o písemné podobě jazyků, jsou schopni vést mluvený rozhovor s lehkostí. Podobně jsou hluboké neuronové sítě založené modely Fluent schopny přímo extrahovat význam z řečových zvuků bez nutnosti nejprve přepisovat je do textu. Technicky se jedná o skutečné porozumění mluvenému jazyku. Existuje několik výhod tohoto přístupu. Tradiční rozpoznávání řeči je zdlouhavý proces, kde několik modulů, které jsou trénovány odděleně, jsou spojeny dohromady, aby poskytly konečnou odpověď. To vede k suboptimálnímu řešení, které trpí variacemi výsledků pro akcenty, hluk, pozadí apod. Systém automatického rozpoznávání záměrů (AIR) od Fluent je optimalizován koncovým uživatelem; je to zcela neuronová síťová architektura, kde jsou všechny moduly trénovány společně, aby poskytly nejoptimálnější řešení. Kromě toho jsme schopni odstranit několik výpočetně náročných modulů, které jsou běžně přítomny v konvenčních systémech rozpoznávání řeči. To nám umožňuje vytvářet systémy rozpoznávání řeči s nízkou stopou, které mohou běžet v pouhých 40 KB RAM na nízkoenergetickém mikrokontroléru běžícím na 50 MHz. Naše systémy porozumění mluvenému jazyku založené na AIR jsou navíc schopny využít podobnosti mezi různými jazyky jedinečným způsobem, aby poskytly bezprecedentní funkce, jako je schopnost rozpoznat více jazyků v témže modelu.

Jaké jsou některé z výzev umělé inteligence při překonávání problému okolního hluku?

Hluk je jednou z největších výzev pro rozpoznávání řeči. Co z něj činí opravdu náročný problém, je to, že existuje mnoho různých typů hluku a ovlivňují spektrum řeči různými způsoby. Někdy může hluk také mít dopad na mikrofonovou odpověď. V mnoha případech není možné oddělit zdroje řeči od zdrojů hluku. V některých případech může hluk maskovat informace dostupné ve spektru řeči, zatímco v jiných případech může zcela odstranit užitečné informace. Oba výsledky vedou k nízké přesnosti. Zatímco je snadné odstranit konzistentní typy hluku, jako je hluk ventilátoru, některé typy hluku, jako je šum nebo lidé mluvení na pozadí nebo hudba, jsou velmi obtížné odstranit, protože ovlivňují spektrum řeči.

Můžete definovat, co je Edge AI a jak Fluent.ai využívá tento typ AI?

Edge AI je pojem, který pokrývá několik různých způsobů, jakými lze aplikaci umělé inteligence přesunout na zařízení s nízkou spotřebou energie. Často se tento pojem používá pro případy, kdy zařízení na okraji (edge) provádějí určité inteligentní výpočty samy o sobě. V Fluent.ai se soustředíme na přinášení vysoce kvalitního porozumění mluvenému jazyku na okraj. Vyvinuli jsme efektivní algoritmy, které umožňují zařízením s nízkou spotřebou energie rozpoznávat vstupní řeč samy o sobě bez nutnosti odesílat data do cloudového serveru pro zpracování. Výhody jsou dvojí: první, uživatelova soukromí není ohroženo přenosem a uložením jeho hlasových dat do cloudu. Druhé, takový přístup snižuje latenci, protože hlasová data a odpověď nemusí cestovat mezi cloudovým serverem a zařízením.

Jaké další typy technologií strojového učení se používají?

Naším hlavním zaměřením jsou hluboko-založené přístupy pro rozpoznávání řeči. Používáme metody RL (učení s posilováním), jako je NASIL[1], k objevování nových, dosud neznámých architektur modelů AI (v některých případech AI vytváří AI). A používáme AutoML k doladění našich předem určených modelů AI, abychom dosáhli spolehlivých výsledků pro různé aplikace, a tím zvýšili spolehlivost a reprodukovatelnost. Kompresní modely a další matematické přístupy dále pomáhají optimalizovat výkon modelu.

Co se bude dít v příštích 5 letech pro porozumění přirozenému jazyku a zpracování přirozeného jazyka?

Doomyslím, že systémy se budou vyvíjet, aby poskytly více přirozené interakce. Navzdory pokroku v posledních letech mohou většina současných systémů pouze odpovědět na jednoduché dotazy nebo provést hlasově aktivovaný internetový vyhledávání. Uvidíme více a více řešení, která mohou rozumně odpovědět na kompletní dotaz pro osobu, místo aby fungovaly pouze jako zveličený hlasový vyhledávač.

Dalším zajímavým aspektem je soukromí. Současné populární řešení jsou primárně internetově propojená zařízení, která streamují všechna uživatelská hlasová data do cloudového serveru. Avšak soukromí těchto řešení se stává problémem. Začínáme také vidět aplikace hlasového uživatelského rozhraní za hranicemi spotřební elektroniky v průmyslových prostředích, profesionálním audio prostoru, jakož i v pohostinství a konferenčních místnostech. Klíčovým požadavkem pro tyto aplikace je soukromí, a proto současné propojené řešení nejsou dostatečná – uvidíme mnohem více edge AI nebo řešení pro zpracování přirozeného jazyka na zařízení.

Jako jsem již zmínil, řečová a přirozená jazyková řešení zůstávají nedostupná pro velkou část světové populace. Existuje značné množství práce na vytvoření nových typů modelů AI, které mohou být trénovány s malým množstvím dat, což vede ke snížení nákladů na vývoj, a tím umožní vývoj modelů v jazycích s menším počtem mluvčích. Podél stejné linie uvidíme řešení, která mohou rozpoznat více jazyků v témže modelu. Celkově uvidíme více a více nasazení multijazyčných modelů AI, které mohou odpovědět na uživatelský dotaz v jeho rodném jazyce.

Je něco jiného, co byste chtěli sdílet o Fluent.ai?

Technologie řeči ušla dlouhou cestu v posledních letech a má před sebou velkou růstový potenciál. V Fluent.ai neustále hledáme nové použití našich stávajících technologií a současně inovujeme interně. Pandemie COVID-19 vytvořila zvýšenou citlivost na místa s vysokým dotykem, jako jsou tlačítka výtahů, kiosky v restauracích a další, což vyvolalo novou poptávku po hlasovém rozhraní. Fluent.ai doufá, že pomůže zaplnit tyto mezery, protože naše řešení jsou multijazyčná a tudíž více inkluzivní, a fungují offline, což nabízí další vrstvu soukromí. Tyto funkce, jak jsem již zmínil, budou pravděpodobně budoucností technologie řeči.

Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit stránky Fluent.ai.

[1] https://www.researchgate.net/profile/Farzaneh_Sheikhnezhad_Fard/publication/341083699_Nasil_Neural_Archit

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.