Modele și platforme AI
Vikrant Tomar, CTO și fondator al Fluent.ai – Seria de interviuri

Vikrant Tomar este CTO și fondator al Fluent.ai, o soluție de înțelegere a vorbirii și interfață de utilizator vocală pentru producătorii de dispozitive și furnizorii de servicii.
Ce v-a atras inițial să studiați modelarea acustică pentru recunoașterea vorbirii?
Într-adevăr, capacitatea de a vorbi cu dispozitivele în același mod în care vorbim cu o altă ființă umană. Această viziune a fost fascinantă pentru mine. Am început să studiez recunoașterea vorbirii în ultimul an al studiilor mele de licență. Acesta a fost și momentul în care am început să mă interesez de cercetare, așa că am urmat un curs de recunoaștere a vorbirii și un proiect de cercetare legat de aceasta. Am reușit să public o lucrare de cercetare la conferința InterSpeech, una dintre cele mai mari și mai reputate conferințe de recunoaștere a vorbirii, din această lucrare. Toate acestea m-au motivat să aleg cercetarea în recunoașterea vorbirii ca obiectiv pe termen lung, deci am ales doctoratul.
În 2015 ați lansat Fluent.ai, puteți să ne spuneți povestea din spatele acestui startup?
Am avut o dorință antreprenorială în mine de mult timp. Eu, împreună cu doi prieteni, am încercat să înființăm o companie după absolvirea studiilor de licență, dar din diverse motive, acea încercare nu a reușit. În timpul doctoratului meu la McGill, am urmărit scena startup-urilor din Montreal. În același timp, am reușit să intru în contact cu oameni de la TandemLaunch – incubatorul de startup-uri unde am creat Fluent.ai. La acea vreme, eram spre sfârșitul doctoratului meu și îmi dădeam seama că experiența mea, cercetarea și asocierea cu alte grupuri de cercetare a vorbirii m-au făcut să realizez că majoritatea acestor experiențe s-au concentrat pe a face recunoașterea vorbirii într-un anumit mod: de la vorbire la transcriere text și apoi procesare a limbajului natural. Cu toate acestea, acest lucru a lăsat o lacună în ceea ce privește utilizabilitatea. O parte semnificativă a populației nu poate beneficia de soluțiile de vorbire dezvoltate în acest mod. Cantitatea de date necesară pentru astfel de metode este atât de mare încât nu ar fi fezabil din punct de vedere financiar să se dezvolte modele separate pentru limbi cu mai puțini vorbitori. Mai mult, multe dialecte și limbi nu au o formă scrisă distinctă. Chiar și familia mea nu a putut utiliza uneltele dezvoltate de mine (ei vorbesc un dialect al limbii hindi). Luând în considerare toate acestea, am început să mă gândesc la modalități diferite de a crea modele de vorbire, în care cantitatea de date necesară să fie mai mică și/sau utilizatorul final să poată să își antreneze sau să își actualizeze singur modelele. Eram conștient de lucrările efectuate la Universitatea KU Leuven (KUL) care ar fi putut să îndeplinească unele dintre aceste cerințe. Cu o parte din tehnologia provenind de la KUL, am reușit să facem primii pași către ceea ce este Fluent.ai astăzi.
Puteți să ne explicați soluțiile de înțelegere a vorbirii intuitive ale Fluent.ai?
Soluțiile de recunoaștere a vorbirii ale Fluent.ai sunt inspirate de modul în care oamenii dobândesc și recunosc limbile. Sistemele convenționale de recunoaștere a vorbirii transcriu mai întâi vorbirea de intrare în text și apoi extrag sensul din acel text. Acesta nu este modul în care oamenii recunosc vorbirea. Luați exemplul copiilor înainte de a învăța să citească și să scrie: în ciuda faptului că nu știu nimic despre reprezentarea scrisă a limbilor, ei sunt capabili să aibă o conversație vorbită cu ușurință. În mod similar, modelele bazate pe rețele neuronale profunde ale Fluent.ai sunt capabile să extragă direct sensul din sunetele vorbirii fără a fi nevoie să le transcrie mai întâi în text. Tehnic, acesta este un adevărat înțelegere a limbajului vorbit. Există multiple avantaje ale acestei abordări. Recunoașterea vorbirii convențională este o abordare complicată, în care mai multe module care sunt antrenate separat sunt împletite pentru a oferi un răspuns final. Acest lucru duce la o soluție suboptimală care suferă de variații în rezultate pentru accente, zgomot, condiții de fundal etc. Sistemul nostru de recunoaștere automată a intenției (AIR) este optimizat de la capăt la coadă; este o arhitectură bazată în întregime pe rețele neuronale, în care toate modulele sunt antrenate împreună pentru a oferi cea mai bună soluție. În plus, suntem capabili să înlăturăm o serie de module grele din punct de vedere computațional care sunt prezente în mod obișnuit în sistemele de recunoaștere a vorbirii. Acest lucru ne permite să creăm sisteme de recunoaștere a vorbirii cu o amprentă mică care pot rula în doar 40KB de RAM pe un microcontroler cu putere redusă care rulează la 50 MHz. În cele din urmă, sistemele noastre de înțelegere a limbajului vorbit bazate pe AIR pot să exploateze asemănările dintre diferite limbi într-un mod unic pentru a oferi funcții fără precedent, cum ar fi capacitatea de a recunoaște multiple limbi în același model.
Care sunt unele dintre provocările legate de inteligența artificială pentru a depăși problema zgomotului ambiental?
Zgomotul este una dintre cele mai mari provocări pentru recunoașterea vorbirii. Ceea ce face ca acesta să fie un adevărat provocator este faptul că există multe tipuri diferite de zgomot și ele afectează spectrul vorbirii în moduri diferite. Uneori, zgomotul poate avea și un impact asupra răspunsului microfonului. În multe cazuri, nu este posibil să separe sursele de vorbire de sursele de zgomot. În unele cazuri, zgomotul poate masca informațiile disponibile în spectrul vorbirii, în timp ce în altele, poate elimina complet informațiile utile. Ambele duc la o acuratețe scăzută. În timp ce este ușor să se elimine tipurile de zgomot constante, cum ar fi zgomotul ventilatorului, anumite tipuri de zgomot, cum ar fi zgomotul de vorbire sau muzică, sunt foarte greu de eliminat, deoarece afectează spectrul vorbirii în moduri diferite.
Puteți să definiți ce este Edge AI și cum folosește Fluent.ai acest tip de inteligență artificială?
Edge AI este un termen generic folosit pentru a acoperi o serie de moduri diferite în care aplicațiile de inteligență artificială pot fi mutate pe dispozitive cu putere redusă. Mai mult și mai mult, acest termen este folosit pentru cazurile în care dispozitivele de margine efectuează anumite calcule inteligente ele însele. La Fluent, ne concentrăm pe aducerea înțelegerii vorbirii de înaltă calitate la margine. Am dezvoltat algoritmi eficienți care permit dispozitivelor cu putere redusă să recunoască vorbirea de intrare ele însele, fără a fi nevoie să trimită datele la un server cloud pentru procesare. Avantajele sunt duble: în primul rând, confidențialitatea utilizatorului nu este compromisă prin transmiterea și stocarea datelor vocale în cloud. În al doilea rând, această abordare reduce latența, deoarece datele vorbirii și răspunsul nu trebuie să călătorească între serverul cloud și dispozitiv.
Care sunt alte tipuri de tehnologii de învățare automată folosite?
Focusul nostru principal este pe abordări bazate pe învățarea profundă pentru recunoașterea vorbirii. Folosim metode de învățare prin întărire (RL), de exemplu, NASIL[1], pentru a descoperi arhitecturi de modele AI noi și necunoscute (într-un anumit sens, AI care creează AI). Și folosim AutoML pentru a ajusta modelele noastre predefinite de IA pentru a obține rezultate fiabile pentru diferite aplicații, ceea ce crește fiabilitatea și reproductibilitatea. Compresia modelului și alte abordări matematice ajută, de asemenea, la optimizarea performanței modelului.
Ce se va întâmpla în următorii 5 ani pentru înțelegerea limbajului natural și procesarea limbajului natural?
Cred că sistemele vor evolua pentru a oferi interacțiuni mai naturale. În ciuda progresului din ultimii ani, majoritatea sistemelor actuale pot doar să răspundă la întrebări simple sau să efectueze o căutare vocală pe internet. Vom vedea mai multe soluții care pot raționa și răspunde la o întrebare completă pentru o persoană, în loc să funcționeze doar ca un motor de căutare vocală glorificat.
Alt aspect interesant este confidențialitatea. Soluțiile actuale populare sunt în principal dispozitive conectate la internet care transmit toate datele vocale ale utilizatorului către un server cloud. Cu toate acestea, confidențialitatea acestor soluții devine o problemă. Suntem, de asemenea, martorii aplicațiilor interfeței vocale dincolo de electronica de consum, în mediile industriale, în spațiul audio profesional, precum și în hoteluri și săli de conferințe. O cerință cheie pentru aceste aplicații este confidențialitatea, așa că soluțiile actuale conectate nu sunt suficiente – vom vedea mult mai multe soluții de inteligență artificială de margine sau pe dispozitiv.
După cum am menționat anterior, soluțiile de vorbire și limbaj rămân inaccesibile pentru o parte semnificativă a populației mondiale. Există o cantitate semnificativă de muncă pentru a crea noi tipuri de modele de inteligență artificială care pot fi antrenate cu o cantitate mică de date, ceea ce duce la costuri reduse de dezvoltare și, în consecință, permite dezvoltarea de modele în limbi cu mai puțini vorbitori. Pe aceeași linie, vom vedea soluții care pot învăța să recunoască multiple limbi în același model. În general, vom vedea mai multe implementări de modele de inteligență artificială multilingve care pot răspunde la întrebarea unui utilizator în limba sa maternă.
Există altceva pe care ați dori să-l împărtășiți despre Fluent.ai?
Tehnologia vorbirii a evoluat mult în ultimii ani și are un potențial enorm de creștere pe drumul de ahead. La Fluent.ai, suntem întotdeauna în căutarea de noi cazuri de utilizare pentru tehnologia noastră existentă, în timp ce inovăm în mod constant intern. Pandemia COVID-19 a creat o sensibilitate crescută față de zonele cu atingere ridicată, cum ar fi butoanele de lift, chioșcurile din restaurante și multe altele, ceea ce a declanșat o nouă cerere pentru tehnologia vocală. Fluent.ai speră să ajute la umplerea acestor goluri, deoarece soluțiile noastre sunt multilingve și, prin urmare, mai incluzive, și funcționează offline, oferind un strat suplimentar de confidențialitate. Aceste funcții, așa cum s-a menționat, sunt probabil să fie viitorul tehnologiei vorbirii.
Mulțumim pentru acest interviu minunat, cititorilor care doresc să afle mai multe despre Fluent.ai.
[1] https://www.researchgate.net/profile/Farzaneh_Sheikhnezhad_Fard/publication/341083699_Nasil_Neural_Archit












