AI-modellen en platforms
Vikrant Tomar, CTO en oprichter van Fluent.ai – Interviewreeks

Vikrant Tomar is de CTO en oprichter van Fluent.ai, een software voor spraakherkenning en spraakgebruikersinterface voor apparaatfabrikanten en dienstverleners.
Wat trok je aanvankelijk aan om akoestische modellering voor spraakherkenning te bestuderen?
Echt waar, het feit dat we met apparaten kunnen praten op dezelfde manier als we met een andere mens praten. Deze visie is voor mij fascinerend. Ik begon spraakherkenning te bestuderen tijdens mijn laatste jaar van mijn bacheloropleiding. Dit was ook het moment waarop ik geïnteresseerd raakte in onderzoek, dus ik volgde een cursus over spraakherkenning en een gerelateerd onderzoeksproject. Ik kon een onderzoeksartikel publiceren op de InterSpeech-conferentie, een van de grootste en meest gerespecteerde conferenties over spraakherkenning, op basis van dit werk. Alles bij elkaar zorgde ervoor dat ik koos voor onderzoek naar spraakherkenning als mijn langetermijndoel, en dus mijn PhD.
In 2015 lanceerde je Fluent.ai, kun je het verhaal achter deze startup delen?
Ik had al lang een ondernemersgeest in me. Ik, samen met twee andere vrienden, had eerder een bedrijf proberen op te richten na onze bacheloropleiding, maar dat lukte niet vanwege een aantal redenen. Tijdens mijn PhD aan de McGill University hield ik een oogje op de startup-scene in Montreal. Tijdens die periode kwam ik ook in contact met mensen van TandemLaunch – de startup-foundry waar ik Fluent.ai creëerde. Op dat moment was ik bijna klaar met mijn PhD, en ik overwoog serieus om het weer te proberen als ondernemer. Door mijn werkervaring, onderzoek en associatie met andere spraakonderzoeksgroepen, realiseerde ik me dat de meeste van deze ervaringen gericht waren op het doen van spraakherkenning op een bepaalde manier: van spraak naar teksttranscriptie en vervolgens natuurlijke taalverwerking. Echter, dit liet een gat in de bruikbaarheid. Een groot deel van de bevolking kan niet profiteren van spraakoplossingen die op deze manier zijn ontwikkeld. De hoeveelheid gegevens die nodig is voor dergelijke methoden is zo groot dat het financieel niet haalbaar zou zijn om separate modellen te ontwikkelen voor talen met minder sprekers. Bovendien hebben veel dialecten en talen geen duidelijke geschreven vorm. Zelfs mijn eigen familie kon niet gebruikmaken van de tools die ik had ontwikkeld (ze spreken een dialect van Hindi). Hierdoor begon ik na te denken over andere manieren om spraakmodellen te creëren, waarbij de hoeveelheid benodigde gegevens minder was, en/of de eindgebruiker zelf de modellen kon trainen of updaten. Ik was op de hoogte van het werk dat was gedaan aan de KU Leuven University (KUL) dat aan sommige van deze eisen kon voldoen. Met een deel van de technologie afkomstig van KUL, konden we de eerste stappen zetten naar wat Fluent.ai vandaag is.
Kun je meer vertellen over de intuïtieve spraakherkenningoplossingen van Fluent.ai?
De spraakherkenningoplossingen van Fluent.ai zijn geïnspireerd door hoe mensen talen verwerven en herkennen. Conventionele spraakherkenningssystemen transcriberen eerst de invoerspraak in tekst en halen dan de betekenis uit die tekst. Dit is niet hoe mensen spraak herkennen. Neem bijvoorbeeld kinderen voordat ze leren lezen en schrijven: ondanks dat ze niets weten over de geschreven vorm van talen, kunnen ze gemakkelijk een gesprek voeren. Op een soortgelijke manier zijn de diepe neurale netwerken van Fluent.ai in staat om direct de betekenis uit spraakgeluiden te halen zonder eerst een teksttranscriptie te maken. Technisch gezien is dit echte gesproken taalbegrip. Er zijn meerdere voordelen aan deze benadering. Traditionele spraakherkenning is een omslachtige aanpak, waarbij meerdere modules die afzonderlijk zijn getraind, worden samengevoegd om een eindresultaat te geven. Dit resulteert in een niet-optimale oplossing die lijdt onder variaties in resultaten voor accenten, ruis, achtergrondcondities enz. Het automatische intentieherkenningssysteem (AIR) van Fluent.ai is eind-tot-eind geoptimaliseerd; het is een volledig neurale netwerken-architectuur, waarbij alle modules samen worden getraind om de meest optimale oplossing te geven. Bovendien kunnen we een aantal computationeel zware modules verwijderen die gewoonlijk aanwezig zijn in conventionele spraakherkenningssystemen. Dit stelt ons in staat om lage-voetafdruk spraakherkenningssystemen te creëren die kunnen draaien op slechts 40KB RAM op een lage-vermogen microcontroller die draait op 50 MHz. Ten slotte kunnen onze gesproken taalbegripsystemen op basis van AIR unieke manieren exploiteren om gelijkenissen tussen verschillende talen te benutten, waardoor we ongeëvenaarde functies zoals het herkennen van meerdere talen in hetzelfde model kunnen bieden.
Wat zijn enkele van de AI-uitdagingen achter het overwinnen van het omgevingslawaai-probleem?
Ruis is een van de grootste uitdagingen voor spraakherkenning. Wat het een echt uitdagend probleem maakt, is dat er veel verschillende soorten ruis zijn en dat ze het spectrum van spraak op verschillende manieren beïnvloeden. Soms kan ruis ook een invloed hebben op de microfoonrespons. In veel gevallen is het niet mogelijk om de spraakbronnen te scheiden van de ruisbronnen. In sommige gevallen kan ruis leiden tot het maskeren van de informatie die beschikbaar is in het spraakspectrum, terwijl het in andere gevallen de nuttige informatie volledig kan verwijderen. Beide resultaten leiden tot lage nauwkeurigheid. Terwijl het gemakkelijk is om consistent ruis te verwijderen, zoals ventilatorruis, zijn sommige ruissoorten, zoals gebabbel of mensen die op de achtergrond praten of muziek, moeilijk te verwijderen vanwege de manier waarop ze het spraakspectrum beïnvloeden.
Kun je uitleggen wat Edge AI is en hoe Fluent.ai deze soort AI gebruikt?
Edge AI is een overkoepelende term die wordt gebruikt om een aantal verschillende manieren te beschrijven waarop AI-toepassingen naar lage-vermogen apparaten kunnen worden verplaatst. Steeds vaker wordt deze term gebruikt voor gevallen waarin de edge-apparaten bepaalde intelligente berekeningen zelf uitvoeren. Bij Fluent.ai zijn we gericht op het brengen van hoge kwaliteit gesproken taalbegrip naar de edge. We hebben efficiënte algoritmes ontwikkeld die lage-vermogen compute-apparaten in staat stellen om de invoerspraak zelf te herkennen zonder de gegevens naar een cloud-gebaseerde server te hoeven sturen voor verwerking. De voordelen zijn tweeledig: ten eerste wordt de privacy van de gebruiker niet geschonden door het streamen en opslaan van hun spraakgegevens in de cloud. Ten tweede vermindert deze aanpak de latentie, omdat de spraakgegevens en het antwoord niet tussen de cloudserver en het apparaat hoeven te reizen.
Welke andere soorten machine learning-technologieën worden gebruikt?
Ons primaire focus ligt op diepe leerbenaderingen voor spraakherkenning. We gebruiken RL (versterkte leer)-methoden, zoals NASIL[1], om nieuwe, eerder onbekende AI-modelarchitecturen te ontdekken (in zekere zin AI die AI creëert). En we gebruiken AutoML om onze vooraf bepaalde AI-modellen af te stemmen om betrouwbare resultaten te behalen voor verschillende toepassingen, waardoor de betrouwbaarheid en reproduceerbaarheid toenemen. Modelcompressie en andere wiskundige benaderingen helpen ook om de modelprestaties te optimaliseren.
Wat zie je gebeuren in de komende 5 jaar voor zowel natuurlijke taalbegrip als natuurlijke taalverwerking?
Ik denk dat de systemen zullen evolueren om meer natuurlijke interacties te bieden. Ondanks de vooruitgang in de afgelopen jaren, kunnen de meeste huidige systemen alleen maar eenvoudige vragen beantwoorden of een spraakgeactiveerde internetzoekopdracht uitvoeren. We zullen meer en meer oplossingen zien die kunnen redeneren en een complete vraag voor een persoon kunnen beantwoorden in plaats van alleen maar te functioneren als een verheerlijkt spraakgebaseerd zoekprogramma.
Het andere interessante aspect is privacy. Huidige populaire oplossingen zijn voornamelijk internetverbonden apparaten die alle spraakgegevens van een gebruiker naar een cloudserver streamen. Echter, de privacy van dergelijke oplossingen wordt een probleem. We zien ook de toepassingen van spraak-gebaseerde gebruikersinterfaces buiten consumentenelektronica in industriële omgevingen, in professionele audio-ruimtes, evenals in hospitality en conferentiezalen. Een belangrijke vereiste voor deze toepassingen is privacy, dus huidige verbonden oplossingen voldoen niet – dus we zullen veel meer Edge AI of on-device natuurlijke taaloplossingen zien.
Zoals ik eerder vermeldde, blijven spraak- en natuurlijke taaloplossingen ontoegankelijk voor een groot deel van de wereldbevolking. Er is een aanzienlijke hoeveelheid werk gaande om nieuwe soorten AI-modellen te creëren die kunnen trainen met een kleine hoeveelheid gegevens, waardoor de ontwikkelingskosten worden verlaagd en het mogelijk wordt om modellen te ontwikkelen in talen met minder sprekers. In dezelfde lijn zullen we oplossingen zien die kunnen leren om meerdere talen in hetzelfde model te herkennen. Over het algemeen zullen we meer en meer implementaties zien van meertalige AI-modellen die een gebruikersvraag in hun moedertaal kunnen beantwoorden.
Is er nog iets anders dat je wilt delen over Fluent.ai?
Spraaktechnologie is de afgelopen jaren ver komen, en heeft een groot potentieel voor groei op de weg die voor ons ligt. Bij Fluent.ai zijn we altijd op zoek naar nieuwe toepassingen van onze bestaande technologie, terwijl we intern blijven innoveren. De COVID-19-pandemie heeft een verhoogde gevoeligheid voor hoog-aanraakoppervlakken zoals liftknoppen, kiosken in restaurants en meer, gecreëerd, wat een nieuwe vraag naar spraakgeactiveerde technologie veroorzaakte. Fluent.ai hoopt om deze lacunes te helpen vullen, aangezien onze oplossingen meertalig zijn en dus meer inclusief, en offline werken, waardoor een extra laag van privacy wordt geboden. Deze functies, zoals eerder vermeld, zullen waarschijnlijk de toekomst van spraaktechnologie zijn.
Bedankt voor het geweldige interview, lezers die meer willen leren, moeten bezoeken r van Fluent.ai.
[1] https://www.researchgate.net/profile/Farzaneh_Sheikhnezhad_Fard/publication/341083699_Nasil_Neural_Archit












