AI-modeller och plattformar

Vikrant Tomar, CTO och grundare av Fluent.ai – Intervjuserie

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Vikrant Tomar är CTO och grundare av Fluent.ai, ett programvaruföretag som utvecklar taligenkänning och röstgränssnitt för enhets-tillverkare och tjänsteleverantörer.

Vad var det som initialt drog dig till att studera akustisk modellering för taligenkänning?

Jag har alltid varit fascinerad av möjligheten att prata med enheter på samma sätt som vi pratar med varandra. Jag började studera taligenkänning under min sista termin på min kandidatexamen. Jag blev också intresserad av forskning och valde att gå en kurs i taligenkänning och ett relaterat forskningsprojekt. Jag kunde publicera en forskningsartikel i InterSpeech-konferensen, en av de största och mest ansedda taligenkänningskonferenserna, baserat på det arbetet. Allt detta motiverade mig att välja taligenkänning som mitt långsiktiga forskningsområde, och därmed också min doktorsexamen.

År 2015 lanserade du Fluent.ai, kan du berätta om historien bakom det här företaget?

Jag har alltid haft en entreprenöriell ådra i mig. Jag och två andra vänner försökte starta ett företag efter vår kandidatexamen, men det fungerade inte av olika skäl. Under min doktorsexamen vid McGill höll jag ett öga på startup-scenen i Montreal. Under den tiden kom jag också i kontakt med personer från TandemLaunch, startup-fabriken där jag skapade Fluent.ai. Vid den tidpunkten var jag nära slutet av min doktorsexamen och funderade på att prova entreprenörskap igen. Genom mina erfarenheter, forskning och samarbete med andra taligenkänningsgrupper insåg jag att de flesta av dessa erfarenheter hade fokuserat på att göra taligenkänning på ett visst sätt: att gå från tal till texttranskription och sedan naturlig språkbehandling. Men detta lämnade ett gap i användbarheten. En stor del av befolkningen kan inte dra nytta av taligenkänningslösningar som utvecklats på detta sätt. Mängden data som krävs för sådana metoder är så stor att det inte skulle vara ekonomiskt rationellt att utveckla separata modeller för språk med färre talare. Dessutom har många dialekter och språk ingen tydlig skriftlig form. Till och med min egen familj kunde inte använda verktyg som jag utvecklat (de talar en dialekt av hindi). Med tanke på allt detta började jag fundera på olika sätt att skapa talmodeller, där mängden data som krävdes var mindre, och/eller där slutanvändaren kunde själv träna eller uppdatera modellerna. Jag var medveten om arbetet som utförts vid KU Leuven University (KUL) som kunde uppfylla några av dessa krav. Med en del av tekniken från KUL kunde vi ta de första stegen mot vad Fluent är idag.

Kan du förklara Fluent.ai:s intuitiva taligenkänningslösningar?

Fluent.ai:s taligenkänningslösningar är inspirerade av hur människor förvärvar och känner igen språk. Konventionella taligenkänningsystem transkriberar först indata-talet till text och extraherar sedan mening från den texten. Det är inte så människor känner igen tal. Ta till exempel barn som inte kan läsa och skriva: trots att de inte känner till den skriftliga representationen av språk kan de ha en talad konversation med lätthet. På samma sätt kan Fluent:s djupa neurala nätverksbaserade modeller direkt extrahera mening från talsignaler utan att först transkribera dem till text. Tekniskt sett är detta sant talat språkförståelse. Det finns flera fördelar med detta tillvägagångssätt. Traditionell taligenkänning är ett omständligt tillvägagångssätt, där flera moduler som tränats separat vävs samman för att ge ett slutgiltigt svar. Detta resulterar i en icke-optimal lösning som lider av variationer i resultat för accenter, brus, bakgrundsförhållanden etc. Fluent:s automatiska avsiktserkänning (AIR) är slutgiltigt optimerad; det är en helt neurala nätverksbaserad arkitektur, där alla moduler tränas gemensamt för att ge den mest optimala lösningen. Dessutom kan vi ta bort ett antal beräkningsmässigt tunga moduler som vanligtvis finns i konventionella taligenkänningsystem. Detta gör att vi kan skapa lågavtrycks-taligenkänningsystem som kan köras i så lite som 40 KB RAM på en lågeffekts-mikrokontroller som kör på 50 MHz. Slutligen kan våra talat språkförståelse-baserade AIR-system utnyttja likheter mellan olika språk på ett unikt sätt för att ge oöverträffade funktioner som möjligheten att känna igen flera språk i samma modell.

Vilka är några av de AI-utmaningarna bakom att övervinna problemet med bakgrundsbrus?

Brus är en av de största utmaningarna för taligenkänning. Det som gör det till ett verkligt svårt problem är att det finns många olika typer av brus och de påverkar tal-spektrum på olika sätt. Ibland kan brus också påverka mikrofonens respons. I många fall är det inte möjligt att separera talsignaler från brus-signaler. I vissa fall kan brus resultera i att informationen i tal-spektrum maskeras, medan i andra fall kan det helt ta bort den användbara informationen. Båda resultaten leder till låg noggrannhet. Medan det är lätt att ta bort konsekvent brus, som fläktbrus, är vissa brus, som sorl eller människor som pratar i bakgrunden eller musik, mycket svåra att ta bort eftersom de påverkar tal-spektrum på olika sätt.

Kan du definiera vad Edge AI är och hur Fluent.ai använder den här typen av AI?

Edge AI är ett paraplybegrepp som används för att täcka en mängd olika sätt som AI-applikationer kan flyttas till lågeffektsenheter. Alltmer används detta begrepp för de fall där edge-enheterna utför vissa intelligenta beräkningar själva. På Fluent fokuserar vi på att bringa högkvalitativ talat språkförståelse till edge. Vi har utvecklat effektiva algoritmer som tillåter lågeffektsberäkningsenheter att känna igen indata-talet själva utan att behöva skicka data till en molnbaserad server för bearbetning. Fördelarna är dubbla: först, komprometteras inte användarens integritet genom att strömma och lagra deras röstdata i molnet. För det andra minskar detta tillvägagångssätt latency eftersom taldata och svaret inte behöver resa mellan molnservern och enheten.

Vilka andra typer av maskinlärningstekniker används?

Vår primära fokus ligger på djupinlärningsbaserade tillvägagångssätt för taligenkänning. Vi använder RL (förstärkt inlärning) metoder, t.ex. NASIL[1], för att upptäcka nya, tidigare okända AI-modellarkitekturer (så att AI skapar AI i någon mening). Och vi använder AutoML för att justera våra förbestämda AI-modeller för att uppnå tillförlitliga resultat för olika applikationer, vilket ökar tillförlitlighet och reproducerbarhet. Modellkomprimering och andra matematiska tillvägagångssätt hjälper också till att optimera modellens prestanda.

Vad ser du hända under de närmaste 5 åren för både naturlig språkförståelse och naturlig språkbehandling?

Jag tror att systemen kommer att utvecklas för att ge mer naturliga interaktioner. Trots framstegen under de senaste åren kan de flesta nuvarande system antingen bara svara på enkla frågor eller utföra en röstaktiverad internet-sökning. Vi kommer att se fler och fler lösningar som kan resonera och svara på en komplett fråga för en person, snarare än att bara fungera som en förhärligad röstbaserad sökmotor.

En annan intressant aspekt är integritet. Nuvarande populära lösningar är primärt internetanslutna enheter som strömmar all användar-röstdata till en molnserver. Men integriteten för dessa lösningar blir ett problem. Vi börjar också se tillämpningarna av röstgränssnitt bortom konsumentelektronik i industriella miljöer, i professionell ljudmiljö, samt i gästfrihet och konferensrum. En nyckelkrav för dessa tillämpningar är integritet, så nuvarande anslutna lösningar räcker inte till – så vi kommer att se mycket mer Edge AI eller enhetsbaserad naturlig språkförståelse.

Som jag nämnde tidigare förblir tal- och språklösningar otillgängliga för en stor del av världens befolkning. Det pågår ett betydande arbete med att skapa nya typer av AI-modeller som kan tränas med en liten mängd data, vilket resulterar i minskade utvecklingskostnader och möjliggör utveckling av modeller på språk med färre talare. På samma sätt kommer vi att se lösningar som kan lära sig att känna igen flera språk i samma modell. Sammanfattningsvis kommer vi att se allt mer distribution av flerspråkiga AI-modeller som kan svara på en användares fråga på deras modersmål.

Finns det något annat du vill dela om Fluent.ai?

Tal-teknik har kommit långt under de senaste åren och har en stor potential för tillväxt på vägen framåt. På Fluent.ai söker vi alltid efter nya användningsområden för vår befintliga teknik samtidigt som vi kontinuerligt innovativa internt. Covid-19-pandemin har skapat en ökad känslighet för hög-beröringsområden, såsom hissknappar, kiosker i restauranger och mer, vilket har gett upphov till en ny efterfrågan på röstaktiverad teknik. Fluent.ai hoppas på att fylla dessa luckor, eftersom våra lösningar är flerspråkiga och därmed mer inkluderande, och fungerar offline, vilket erbjuder en extra lager av integritet. Dessa funktioner, som nämndes tidigare, kommer sannolikt att vara framtiden för tal-teknik.

Tack för den underbara intervjun, läsare som vill lära sig mer kan besöka Fluent.ai.

[1] https://www.researchgate.net/profile/Farzaneh_Sheikhnezhad_Fard/publication/341083699_Nasil_Neural_Archit

Antoine är en visionär ledare och medgrundare av Unite.AI, driven av en outtröttlig passion för att forma och främja framtidens AI och robotik. En serieentreprenör, han tror att AI kommer att vara lika störande för samhället som elektricitet, och han fångas ofta i att prata om potentialen för störande teknologier och AGI.

Som en futurist är han dedikerad till att utforska hur dessa innovationer kommer att forma vår värld. Dessutom är han grundare av Securities.io, en plattform som fokuserar på att investera i banbrytande teknologier som omdefinierar framtiden och omformar hela sektorer.