Interviuri

Amr Nour-Eldin, Vicepreședinte Tehnologie la LXT – Seria de interviuri

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Amr Nour-Eldin este Vicepreședintele Tehnologie la LXT. Amr este un cercetător științific cu doctorat, cu peste 16 ani de experiență profesională în domeniile prelucrării vorbirii și audio, precum și a învățării automate în contextul recunoașterii automate a vorbirii (ASR), cu o atenție specială și experiență practică în ultimii ani asupra tehnicilor de învățare profundă pentru recunoașterea vorbirii în timp real.

LXT este un lider emergent în domeniul datelor de antrenament AI pentru a alimenta tehnologia inteligentă pentru organizații globale. În parteneriat cu o rețea internațională de contribuitori, LXT colectează și anotează date din multiple modalități, cu viteza, scala și agilitatea necesare de către întreprinderi. Expertiza lor globală acoperă peste 145 de țări și peste 1000 de locuri lingvistice.

Ce v-a atras inițial spre acest domeniu, având în vedere că ați urmat un doctorat în Prelucrarea Semnalelor la Universitatea McGill?

Am vrut întotdeauna să studiez ingineria și mi-a plăcut științele naturale în general, dar am fost atras mai specific de matematică și fizică. M-am găsit întotdeauna încercând să înțeleg cum funcționează natura și cum pot aplica această înțelegere pentru a crea tehnologie. După liceu, am avut oportunitatea de a intra în medicină și alte profesii, dar am ales specific ingineria, deoarece reprezintă combinația perfectă, în opinia mea, a teoriei și aplicării în cele două domenii care îmi sunt cele mai apropiate: matematica și fizica. Și apoi, odată ce am ales-o, au existat multe căi posibile – mecanică, civilă și așa mai departe. Dar am ales specific ingineria electrică, deoarece este cea mai apropiată și, în opinia mea, cea mai dificilă dintre problemele de matematică și fizică pe care le-am găsit întotdeauna provocatoare și, prin urmare, mai plăcute, precum și fiind baza tehnologiei moderne, care m-a condus întotdeauna.

În cadrul ingineriei electrice, există specializări diverse de ales, care, în general, cad sub două umbrele: telecomunicații și prelucrarea semnalelor, și cea a energiei și ingineriei electrice. Când a venit timpul să aleg între acestea, am ales telecomunicațiile și prelucrarea semnalelor, deoarece este mai aproape de modul în care descriem natura prin fizică și ecuații. Vorbești despre semnale, fie că este vorbire, imagini sau video; înțelegi cum comunicăm și ce percep simțurile noastre și cum putem reprezenta matematic această informație într-un mod care ne permite să folosim această cunoaștere pentru a crea și îmbunătăți tehnologia.

Puteți discuta despre cercetarea dvs. la Universitatea McGill pe aspectul informațional al extinderii benzii artificiale (BWE)?

După ce am terminat licența, am vrut să continuu să urmez domeniul Prelucrării Semnalelor din punct de vedere academic. După un an de studiu al fizicii, am decis să mă întorc la inginerie pentru a urma masteratul în Prelucrarea Semnalelor Audio și Vorbire, concentrându-mă pe recunoașterea vorbirii. Când a venit timpul să fac doctoratul, am vrut să îmi lărgesc câmpul de studiu puțin, în direcția generală a prelucrării audio și a vorbirii, precum și a domeniilor înrudite, cum ar fi Învățarea Automată și Teoria Informației, mai degrabă decât să mă concentrez doar pe aplicația recunoașterii vorbirii.

Vehicle pentru doctoratul meu a fost extinderea benzii de frecvență a vorbirii cu bandă îngustă. Vorbirea cu bandă îngustă se referă la vorbirea telefonică convențională. Conținutul de frecvență al vorbirii se extinde până la aproximativ 20 de kilohertzi, dar majoritatea conținutului informațional este concentrat până la aproximativ 4 kilohertzi. Extinderea benzii se referă la extinderea artificială a conținutului vorbirii de la 3,4 kilohertzi, care este limita superioară de frecvență în telefonia convențională, la peste această limită, până la opt kilohertzi sau mai mult. Pentru a reconstrui mai bine conținutul de frecvență înaltă lipsă, dată doar conținutul disponibil în bandă îngustă, trebuie mai întâi să cuantificăm informația mutuală dintre conținutul vorbirii în cele două benzi de frecvență, apoi să folosim această informație pentru a antrena un model care învață această informație partajată; un model care, odată antrenat, poate fi folosit pentru a genera conținut de bandă largă dată doar vorbire în bandă îngustă și ceea ce modelul a învățat despre relația dintre vorbirea disponibilă în bandă îngustă și conținutul de bandă largă lipsă. Cuantificarea și reprezentarea acestei informații mutuală “partajate” este unde intervine teoria informației. Teoria informației este studiul cuantificării și reprezentării informației în orice semnal. Prin urmare, cercetarea mea a fost despre încorporarea teoriei informației pentru a îmbunătăți extinderea benzii artificiale a vorbirii. Astfel, doctoratul meu a fost mai degrabă o activitate de cercetare interdisciplinară în care am combinat prelucrarea semnalelor cu teoria informației și învățarea automată.

Ați fost Științifician Principal al Vorbirii la Nuance Communications, acum parte a Microsoft (MSFT ), timp de peste 16 ani. Care au fost câteva dintre principalele concluzii pe care le-ați tras din această experiență?

Din perspectiva mea, cel mai important beneficiu a fost acela că am lucrat întotdeauna la tehnici de ultimă generație, de avangardă, în prelucrarea semnalelor și învățarea automată și am aplicat această tehnologie la aplicații din lumea reală. Am avut ocazia să aplic aceste tehnici la produse de Inteligență Conversațională în multiple domenii. Aceste domenii variază de la întreprinderi la sănătate, automotive și mobilitate, printre altele. Unele dintre aplicațiile specifice au inclus asistenți virtuali, răspunsuri interactiv vocal, voicemail la text și altele în care reprezentarea și transcrierea corectă este critică, cum ar fi în sănătate, cu interacțiuni doctor-pacient. De-a lungul acestor 16 ani, am avut norocul să fiu martor direct și să fiu parte din evoluția inteligenței conversaționale, de la zilele modelării statistice folosind Modele Markov Ascunse, prin preluarea treptată a Învățării Profunde, până în prezent, când învățarea profundă proliferează și domină aproape toate aspectele inteligenței artificiale, inclusiv Inteligența Generativă, precum și inteligența predictivă sau discriminativă tradițională. O altă concluzie importantă din această experiență este rolul crucial pe care îl joacă datele, atât cantitativ, cât și calitativ, ca factor cheie al capacităților și performanței modelului de inteligență artificială.

Ați publicat o duzină de articole, inclusiv în publicații de renume, cum ar fi IEEE. În opinia dvs., care este cel mai revoluționar articol pe care l-ați publicat și de ce a fost important?

Cel mai impactant, după numărul de citări conform Google (GOOGL ) Scholar, ar fi un articol din 2008, intitulat “Mel-Frequency Cepstral Coefficient-Based Bandwidth Extension of Narrowband Speech“. La un nivel înalt, accentul acestui articol este despre cum se poate reconstrui conținutul vorbirii folosind o reprezentare a caracteristicilor care este larg utilizată în domeniul recunoașterii automate a vorbirii (ASR), coeficienții cepstrali de frecvență Mel.

Însă, articolul mai inovator, în opinia mea, este un articol cu cea de-a doua citare ca număr, un articol din 2011, intitulat “Memory-Based Approximation of the Gaussian Mixture Model Framework for Bandwidth Extension of Narrowband Speech“. În această lucrare, am propus o nouă tehnică de modelare statistică care incorporează informații temporale în vorbire. Avantajul acestei tehnici este că permite modelarea informațiilor pe termen lung în vorbire, cu o complexitate minimă și într-un mod care permite, de asemenea, generarea vorbirii în bandă largă într-un mod de flux sau în timp real.

În iunie 2023, ați fost recrutat ca Vicepreședinte Tehnologie la LXT. Ce v-a atras spre această poziție?

De-a lungul experienței mele academice și profesionale anterioare LXT, am lucrat întotdeauna direct cu date. Într-adevăr, așa cum am menționat anterior, una dintre concluziile importante pe care le-am tras din munca mea cu știința vorbirii și învățarea automată a fost rolul crucial pe care îl joacă datele în ciclul de viață al modelului de inteligență artificială. Având suficiente date de calitate în formatul potrivit a fost și rămâne vital pentru succesul tehnologiilor de inteligență artificială de ultimă generație bazate pe învățarea profundă. Prin urmare, când am ajuns la un moment al carierei mele în care căutam un mediu de tip startup în care să pot învăța, să îmi lărgesc abilitățile, precum și să folosesc experiența mea în vorbire și inteligență artificială pentru a avea cel mai mare impact, am avut norocul de a avea oportunitatea de a mă alătura LXT. A fost potrivit perfect. Nu numai că LXT este un furnizor de date de inteligență artificială care crește cu un ritm impresionant și constant, dar am văzut-o și ca fiind la stadiul potrivit de creștere în ceea ce privește cunoașterea inteligenței artificiale, precum și în ceea ce privește dimensiunea și diversitatea clienților, și, prin urmare, în ceea ce privește tipurile de date de inteligență artificială. M-am bucurat de oportunitatea de a mă alătura și de a contribui la drumul de creștere; de a avea un impact semnificativ prin aducerea perspectivei unui utilizator final de date, după ce am fost utilizator de date științifice de inteligență artificială timp de atâtea ani.

Ce arată o zi obișnuită pentru dvs. la LXT?

Ziua mea obișnuită începe cu citirea ultimelor cercetări pe un subiect sau altul, care în ultima vreme s-a concentrat pe inteligența generativă și cum putem aplica aceasta pentru a răspunde nevoilor clienților noștri. Sunt norocos să am o echipă excelentă care este foarte pricepută în crearea și personalizarea soluțiilor pentru nevoile specifice de date de inteligență artificială ale clienților noștri. Prin urmare, lucrez îndeaproape cu ei pentru a stabili această agendă.

Există, desigur, și planificarea strategică anuală și trimestrială, și descompunerea obiectivelor strategice în obiective individuale pentru echipă și menținerea la curent cu evoluțiile de-a lungul acestor planuri. În ceea ce privește dezvoltarea noastră de funcționalități, de obicei avem două direcții tehnologice. Una este să ne asigurăm că avem toate piesele necesare pentru a livra cele mai bune rezultate pentru proiectele noastre actuale și noi. Cealaltă direcție este îmbunătățirea și extinderea capacităților noastre tehnologice, cu accent pe încorporarea învățării automate în ele.

Puteți discuta despre tipurile de algoritmi de învățare automată cu care lucrați la LXT?

Soluțiile de inteligență artificială transformă afaceri din toate industriile, și noi, la LXT, suntem onorați să furnizăm datele de calitate necesare pentru a antrena algoritmii de învățare automată care le alimentează. Clienții noștri lucrează la o gamă largă de aplicații, inclusiv realitate augmentată și virtuală, viziune computerizată, inteligență conversațională, inteligență generativă, relevanță de căutare și prelucrare a vorbirii și limbajului natural (NLP), printre altele. Ne angajăm să alimentăm algoritmii și tehnologiile de inteligență artificială ale viitorului prin generarea și îmbunătățirea datelor în fiecare limbă, cultură și modalitate.

Intern, încorporăm și noi învățarea automată pentru a îmbunătăți și optimiza procesele noastre interne, de la validarea automată a calității datelor până la facilitarea unui model de etichetare umană în buclă pentru toate modalitățile de date pe care le lucrăm.

Vorbirea și prelucrarea audio sunt pe punctul de a atinge aproape perfecțiunea în ceea ce privește limba engleză și, în special, bărbații albi. Cât timp credeți că va dura până când va fi un teren de joc egal pentru toate limbile, genurile și etniile?

Aceasta este o întrebare complicată și depinde de o serie de factori, inclusiv economici, politici, sociali și tehnologici, printre alții. Dar ceea ce este clar este că prevalența limbii engleze a condus inteligența artificială unde suntem acum. Deci, pentru a ajunge la un loc în care este un teren de joc egal, depinde realmente de viteza cu care reprezentarea datelor din diferite etnii și populații crește online, și ritmul în care crește este ceea ce va determina când vom ajunge acolo.

Însă, LXT și companii similare pot avea un rol important în conducerea noastră spre un teren de joc mai egal. Atâta timp cât datele pentru limbile și etniile mai puțin reprezentate sunt greu de accesat sau pur și simplu nu sunt disponibile, schimbarea va veni mai lent. Dar noi încercăm să facem partea noastră. Cu acoperire pentru peste 1.000 de locuri lingvistice și experiență în 145 de țări, LXT ajută la facilitarea accesului la mai multe date lingvistice.

Care este viziunea dvs. asupra modului în care LXT poate accelera eforturile de inteligență artificială pentru diferiți clienți?

Scopul nostru la LXT este să furnizăm soluțiile de date care permit dezvoltarea eficientă, precisă și rapidă a inteligenței artificiale. Prin cei 12 ani de experiență în domeniul datelor de inteligență artificială, nu numai că am acumulat o expertiză vastă despre nevoile clienților noștri în ceea ce privește toate aspectele legate de date, dar am și rafinat continuu procesele noastre pentru a livra cele mai înalte calități de date la cel mai rapid ritm și la cele mai bune puncte de preț. Prin urmare, ca urmare a angajamentului nostru ferm de a oferi clienților noștri combinația optimă de calitate a datelor de inteligență artificială, eficiență și preț, ne-am consolidat poziția de partener de încredere de date de inteligență artificială, așa cum este evident din clienții noștri care ne revin constant pentru nevoile lor de date de inteligență artificială în creștere și evoluție. Viziunea mea este să consolidăm, să îmbunătățim și să extindem “modul de operare” LXT pentru toate modalitățile de date pe care le lucrăm, precum și pentru toate tipurile de dezvoltare a inteligenței artificiale pe care le servim în prezent, inclusiv inteligența generativă. Realizarea acestui obiectiv se învârte în jurul extinderii strategice a capacităților noastre de învățare automată și știință a datelor, atât din punct de vedere tehnologic, cât și din punct de vedere al resurselor.

Mulțumim pentru acest interviu minunat; cititorii care doresc să afle mai multe pot vizita LXT.

Antoine este un lider vizionar și partener fondator al Unite.AI, condus de o pasiune neclintită pentru modelarea și promovarea viitorului inteligenței artificiale și roboticii. Un întreprinzător serial, el crede că inteligența artificială va fi la fel de disruptivă pentru societate ca și electricitatea și este adesea prins vorbind entuziast despre potențialul tehnologiilor disruptive și AGI.

Ca futurist, el este dedicat explorării modului în care aceste inovații vor modela lumea noastră. În plus, el este fondatorul Securities.io, o platformă axată pe investiții în tehnologii de ultimă generație care redefinesc viitorul și reshapă întregi sectoare.