Haastattelut
Amr Nour-Eldin, LXT:n teknologian varapuheenjohtaja – Haastattelusarja

Amr Nour-Eldin on LXT:n teknologian varapuheenjohtaja. Amr on tutkijatohtori, jolla on yli 16 vuoden ammatti kokemus puheen ja äänen prosessoinnista sekä koneoppimisesta automaattisen puheentunnistuksen (ASR) yhteydessä, erityisesti syventäen viime vuosina deep learning -tekniikoita virtauspuheentunnistukseen.
LXT on nousussa johtavaksi tekoälykoulutusdatan toimittajaksi globaaleille organisaatioille. Kansainvälisen avustajaverkoston kanssa LXT kerää ja annotoi dataa useista modaliteeteista nopeasti, suurten mittakaavojen ja joustavasti, jotta se vastaisi yritysten tarpeita. Heidän globaali asiantuntemus kattaa yli 145 maata ja yli 1000 kielen sijaintia.
Mitä sinua alun perin kiinnosti tässä alalla, kun valitsit signalin prosessoinnin tutkinnon McGill-yliopistosta?
Olin aina halunnut opiskella insinööritieteitä ja pidin luonnontieteistä yleensä, mutta olin erityisesti kiinnostunut matematiikasta ja fysiikasta. Yritin aina ymmärtää, miten luonto toimii ja miten soveltaa sitä ymmärrystä teknologian luomiseen. Kun valitsin insinööritieteet, tiesin, että se edustaisi täydellistä yhdistelmää teorian ja soveltamisen välillä, lähinnä matematiikan ja fysiikan parissa. Ja kun olin valinnut sen, oli monia mahdollisia polkuja – mekaaninen, sähköinen jne. Mutta valitsin erityisesti sähköinsinööritieteitä, koska se on lähinnä ja haasteellisin matematiikan ja fysiikan ongelmien ratkaisemisessa, jotka olen aina pitänyt hauskempina ja mielenkiintoisempina, sekä modernin teknologian perustana, joka on aina ohjannut minua.
Sähköinsinööritieteissä on useita erikoistumisalueita, jotka jakautuvat kahteen pääryhmään: tietoliikenne ja signaalin prosessointi, sekä sähkö- ja voimainsinööritieteet. Kun tuli aika valita näiden välillä, valitsin tietoliikenteen ja signaalin prosessoinnin, koska se on lähempänä luonnon kuvaamista fysiikan ja matematiikan avulla. Puhumme signaaleista, joita ovat ääni, kuvat tai video; ymmärtämme, miten viestimme ja miten aistimme, sekä miten voimme edustaa tietoa matemaattisesti siten, että voimme hyödyntää sitä tietoa teknologian kehittämiseen.
Voitko keskustella tutkimuksestasi McGill-yliopistossa tekoälyllisen bändin laajennuksen informaatio-teoreettisesta näkökulmasta?
Kun olin valmistunut kandidaatin tutkinnosta, halusin jatkaa signalin prosessoinnin alalla akateemisesti. Kun olin opiskellut fysiikkaa yhden vuoden ajan osana maisterin tutkintoa, päättelin palata insinööritieteisiin ja suorittaa maisterin tutkinnon äänen ja puheen signaalin prosessoinnista, keskittyen puheentunnistukseen. Kun tuli aika tehdä väitöskirjaa, halusin laajentaa alaani hieman yleisemmäksi äänen ja puheen prosessoinniksi, sekä läheisesti liittyviin koneoppimisen ja informaatio-teorian aloihin, eikä ainoastaan keskittyä puheentunnistuksen sovellukseen.
Olitte pääasiallinen puheen tutkija Nuance Communicationsissa, joka on nyt osa Microsoftia, yli 16 vuoden ajan. Mitkä olivat joitain tärkeimpiä havaintoja sinun kokemuksesi aikana?
Minun näkökulmastani tärkein hyöty oli, että olin aina työskennellyt viimeisimmän tekniikan ja koneoppimisen parissa, sekä soveltanut sitä teknologiaa todellisiin sovelluksiin. Sain mahdollisuuden soveltaa noita tekniikoita Conversational AI -tuotteisiin useilla eri aloilla, kuten yrityksissä, terveydenhuollossa, autoteollisuudessa ja liikenteessä. Joitain näistä sovelluksista olivat virtuaaliset avustajat, interaktiiviset äänivastaukset, ääni-teksti ja muut, joissa oikea edustus ja transkriptio on kriittistä, kuten terveydenhuollossa lääkäri-potilas vuorovaikutuksissa. Noiden 16 vuoden aikana olin onnekas todistamaan ja olla mukana konversaatio-älytekniikan kehityksessä, alkaen tilastollisista malleista piilotilamalleilla, aina deep learningin vallankumoukseen, jossa se nyt hallitsee lähes kaikki älytekniikan osa-alueet, mukaan lukien generatiivinen äly ja perinteinen ennustava tai diskriminointi äly.
Mitä on tärkeintä, mitä sinun on julkaistu kymmenkuntaa artikkeleita, mukaan lukien sellaisissa arvostetuissa julkaisuissa kuin IEEE. Miten sinä näet tärkeimmän julkaisun, jonka olet julkaissut, ja miksi se oli tärkeä?
Tärkein vaikutus, joka on saanut eniten viittauksia Google (GOOGL ) Scholarin mukaan, on vuoden 2008 artikkeli, joka käsitteli “Mel-Frequency Cepstral Coefficient -pohjaista kaistanlevennystä kapeakaistaiselle puheelle”. Korkealla tasolla tämä artikkeli keskittyy siihen, miten voidaan rekonstruoida puheen sisältöä käyttäen laajasti käytettyä ominaisuus edustusta automaattisessa puheentunnistuksessa.
Heinäkuussa 2023 sinut palkattiin LXT:n teknologian varapuheenjohtajaksi, mitä sinä pidit houkuttelevana tässä asemassa?
Koko urani ajan ennen LXT:ää olen työskennellyt suoraan datan parissa. Totesin, että yksi tärkein opetus, jonka sain työstäni puheen tieteestä ja koneoppimisesta, oli datan rooli älymallien elinkaarella. Koska minulla oli kokemus siitä, miten tärkeää on oikea laatuinen ja oikeassa muodossa oleva data, kun halutaan kehittää älyteknologiaa, LXT oli täydellinen sopimus. Se oli kasvava yritys, joka tarjosi minulle mahdollisuuden oppia, laajentaa taitojani ja hyödyntää kokemustani puheen ja älytekniikan parissa vaikuttaaksesi merkittävästi.
Miten sinun keskivertopäiväsi näyttää LXT:ssä?
Keskivertopäiväni alkaa tarkastelemalla viimeisintä tutkimusta jostakin aiheesta, joka on viime aikoina keskittynyt generatiiviseen älyyn ja miten voimme soveltaa sitä asiakkaiden tarpeisiin. Onneksi minulla on erinomainen tiimi, joka on hyvin taitava luomaan ja räätälöimään ratkaisuja asiakkaiden erityisiin älydatan tarpeisiin. Työskentelen heidän kanssaan asettaaksesi tämän agendan.
Voitko keskustella koneoppimisalgoritmeista, joilla työskentelet LXT:ssä?
Teollisuuden älyratkaisut muuttavat liiketoimintaa kaikilla aloilla, ja me LXT:ssä olemme kunnianosoittuneita voidessamme tarjota korkealaatuisen datan, joka kouluttaa koneoppimisalgoritmeja, jotka voimittavat niitä. Asiakkaamme työskentelevät laajalla valikoimalla sovelluksia, kuten lisätystä ja virtuaalisesta todellisuudesta, tietokoneen näöstä, konversaatio älystä, generatiivisesta älystä, hakurelevanssista ja puheen ja luonnollisen kielen prosessoinnista. Olemme omistautuneita voimittamaan tulevaisuuden koneoppimisalgoritmeja ja -teknologioita datan luomalla ja parantamalla kaikilla kielillä, kulttuureilla ja modaliteeteilla.
Puheen ja äänen prosessointi lähestyy nopeasti täydellisyyttä, kun on kyse englannista ja erityisesti valkoisista miehistä. Kuinka kauan aikaa arvioit kuluvaan, ennen kuin se on tasa-arvoinen kenttä kaikille kielille, sukupuolille ja etnisille ryhmille?
Tämä on monimutkainen kysymys, ja riippuu useista tekijöistä, kuten taloudellisista, poliittisista, sosiaalisista ja teknologisista tekijöistä. Mutta mitä on selvää, on se, että englannin kielen valtakausi on ajanut älytekniikan nykyiseen tilaan. Jotta päästäisiin tasapuoliseen kenttään, riippuu siitä, kuinka nopeasti eri etnisten ryhmien ja väestöjen edustus kasvaa verkossa, ja kuinka nopeasti se kasvaa, määrää, milloin pääsemme sinne.
Mikä on visiosi siitä, miten LXT voi kiihdyttää älyponnisteluita eri asiakkaiden kanssa?
Meidän tavoitteemme LXT:ssä on tarjota dataratkaisuja, jotka mahdollistavat tehokkaan, tarkan ja nopean älykehykkeen kehittämisen. 12 vuoden kokemuksella älydatan alalla olemme kerryttäneet laajan osaamisen asiakkaiden tarpeista kaikilla datan osa-alueilla ja jatkuvasti hienontaneet prosessejamme toimittamaan korkealaatuisinta dataa nopeimmalla tahdilla ja parhaimmilla hinnoilla. Seurauksena olemme tulleet luotettavaksi älydatan kumppaniksi, kuten näkyy toistuvista asiakkaista, jotka jatkuvasti palaavat LXT:hen kasvaviin ja kehittyviin älydatan tarpeisiinsa. Visioani on vahvistaa, parantaa ja laajentaa sitä “LXT:n tapaa” kaikkiin dataan liittyviin modaliteetteihin, sekä kaikkiin älykehykkeen kehittämiseen, mukaan lukien generatiivinen äly. Tämän tavoitteen saavuttaminen vaatii strategista laajentamista omassa koneoppimisen ja data-tieteen osaamisessa, sekä teknologisesti että resursseiltaan.
Kiitos haastattelusta, lukijat, jotka haluavat oppia lisää, voivat vierailla LXT:ssä.












