Rozhovory
Amr Nour-Eldin, Viceprezident pro technologii ve společnosti LXT – Interview Series

Amr Nour-Eldin je Viceprezident pro technologii ve společnosti LXT. Amr je výzkumný vědec s titulem Ph.D. s více než 16 lety profesionální zkušenosti v oborech zpracování řeči a zvuku a strojového učení v kontextu automatického rozpoznávání řeči (ASR), se zvláštním zaměřením a praktickými zkušenostmi v posledních letech na techniky hlubokého učení pro streamované rozpoznávání řeči.
LXT je vznikající lídr v oblasti školení umělých inteligencí pro globální organizace. Ve spolupráci s mezinárodní sítí přispěvatelů shromažďuje a anotuje data napříč několika modality s rychlostí, rozsahem a pružností požadovanou podniky. Jejich globální odbornost zahrnuje více než 145 zemí a přes 1000 jazykových lokalit.
Vystudoval jste doktorát z zpracování signálů na McGill University, co vás zpočátku zajímalo v tomto oboru?
Vždy jsem chtěl studovat inženýrství a opravdu se mi líbily přírodní vědy obecně, ale byl jsem více přitahován matematikou a fyzikou. Snažil jsem se vždy pochopit, jak funguje příroda a jak aplikovat toto pochopení na vytváření technologií. Po střední škole jsem měl možnost jít do medicíny a dalších profesí, ale specificky jsem si vybral inženýrství, protože to představovalo pro mě ideální kombinaci teorie a aplikace v obou oborech, které jsem měl nejblíže k srdci: matematice a fyzice. A poté, co jsem si to vybral, byly tam mnoho možných cest – mechanika, stavebnictví a tak dále. Ale specificky jsem si vybral elektrotechniku, protože to je nejbližší a nejtěžší, podle mého názoru, k typům matematických a fyzikálních problémů, které jsem vždy považoval za výzvu a tudíž jsem je více užíval, stejně jako je to základ moderní technologie, která mě vždy poháněla.
V rámci elektrotechniky existuje několik specializací, z nichž většina spadá do dvou kategorií: telekomunikace a zpracování signálů a té, která se týká energie a elektrotechniky. Když přišla chvíle zvolit mezi nimi, zvolil jsem telekomunikace a zpracování signálů, protože to je bližší tomu, jak popisujeme přírodu prostřednictvím fyziky a rovnic. Mluvíme o signálech, ať už se jedná o audio, obrázky nebo video; chápeme, jak komunikujeme a co naše smysly vnímají, a jak matematicky reprezentovat tu informaci tak, aby nám to umožnilo využít toho poznání k vytváření a zlepšování technologií.
Můžete diskutovat o své výzkumu na McGill University na téma informačně-teoretického aspektu umělé rozšíření pásma (BWE)?
Po dokončení bakalářského studia jsem chtěl dále pokračovat ve studiu oboru zpracování signálů akademicky. Po roce studia fotoniky jako součásti magisterského studia fyziky jsem se rozhodl vrátit se k inženýrství, aby jsem mohl dokončit magisterské studium v oblasti zpracování audio a řečového signálu se zaměřením na rozpoznávání řeči. Když přišla chvíle na doktorát, chtěl jsem rozšířit své pole trochu do obecného zpracování audio a řečového signálu, stejně jako do úzce souvisejících oborů strojového učení a informační teorie, spíše než se soustředit pouze na aplikaci rozpoznávání řeči.
Vozidlo pro můj doktorát byla problematika umělého rozšíření pásma úzkopásmové řeči. Úzkopásmová řeč se vztahuje na konvenční telefonii. Frekvenční obsah řeči sahá až k 20 kilohertz, ale většina informačního obsahu je koncentrována do 4 kilohertz. Rozšíření pásma se vztahuje na umělé rozšíření obsahu řeči z 3,4 kilohertz, což je horní frekvenční hranice v konvenční telefonii, nad tuto hranici, až k 8 kilohertz nebo více. Pro lepší rekonstrukci toho chybějícího vyššího frekvenčního obsahu, daného pouze úzkopásmovým obsahem, je třeba nejprve kvantifikovat vzájemnou informaci mezi obsahem řeči ve dvou frekvenčních pásmech, a poté použít tu informaci k výcviku modelu, který se učí tu sdílenou informaci; model, který, jednou vyškolen, může poté být použit k generování širokopásmového obsahu, daného pouze úzkopásmovou řečí a tím, co model naučil o vztahu mezi dostupnou úzkopásmovou řečí a chybějícím širokopásmovým obsahem. Kvantifikace a reprezentace té sdílené “vzájemné informace” je tam, kde informační teorie přichází. Informační teorie je studium kvantifikace a reprezentace informace v jakémkoli signálu. Můj výzkum se tedy týkal začlenění informační teorie ke zlepšení umělého rozšíření pásma řeči. Jako takový, můj doktorát byl více mezioborovou výzkumnou činností, kde jsem kombinoval zpracování signálů s informační teorií a strojovým učením.
Byl jste hlavní vědecký pracovník ve společnosti Nuance Communications, nyní součásti Microsoftu, po dobu více než 16 let, co byly některé z vašich hlavních poznatků z této zkušenosti?
Z mé perspektivy byl nejvýznamnější benefit v tom, že jsem vždy pracoval na nejnovějších, špičkových technikách zpracování signálů a strojového učení a aplikoval ty technologie na reálné aplikace. Dostal jsem šanci aplikovat ty techniky na produkty konverzační umělé inteligence napříč několika doménami. Tyto domény sahaly od podnikání, zdravotnictví, automobilového průmyslu a mobility, mezi jinými. Některé z konkrétních aplikací zahrnovaly virtuální asistenty, interaktivní hlasové odpovědi, přepis hlasové pošty do textu a další, kde je správná reprezentace a přepis kriticky důležitý, jako je tomu ve zdravotnictví s interakcemi mezi lékaři a pacienty. Během těch 16 let jsem měl štěstí být svědkem a součástí evoluce konverzační umělé inteligence, od dnů statistického modelování pomocí skrytých Markovových modelů, přes postupné převzetí hlubokého učení, až po současnost, kde hluboké učení dominuje téměř všechny aspekty umělé inteligence, včetně generativní umělé inteligence, stejně jako tradiční prediktivní nebo diskriminační umělé inteligence. Další z hlavních poznatků z této zkušenosti je kritická role, kterou hraje data, jak z hlediska množství, tak kvality, jako klíčový hnací činitel schopností a výkonu modelů umělé inteligence.
Můžete diskutovat o typech algoritmů strojového učení, na kterých pracujete ve společnosti LXT?
Řešení umělé inteligence transformují podniky napříč všemi průmyslovými odvětvími, a my ve společnosti LXT jsme poctěni tím, že poskytujeme vysokokvalitní data pro výcvik algoritmů strojového učení, které je pohánějí. Naši zákazníci pracují na široké škále aplikací, včetně rozšířené a virtuální reality, počítačového vidění, konverzační umělé inteligence, generativní umělé inteligence, relevance vyhledávání a zpracování řeči a přirozeného jazyka (NLP), mezi jinými. Jsme oddáni tomu, abychom poháněli algoritmy strojového učení a technologie budoucnosti prostřednictvím generování a vylepšování dat napříč všemi jazyky, kulturami a modality.
Proč jste se rozhodl připojit k LXT jako Viceprezident pro technologii?
Po celou dobu své akademické a profesionální kariéry před LXT jsem vždy pracoval přímo s daty. Ve skutečnosti, jak jsem zmínil dříve, jeden z hlavních poznatků, které jsem získal ze své práce se speech science a strojovým učením, byla kritická role, kterou hraje data v životním cyklu modelu umělé inteligence. Mít dostatečná kvalitní data ve správném formátu bylo, a stále je, zásadní pro úspěch špičkových technik hlubokého učení založených na umělé inteligenci. Jako takový, když jsem se nacházel v okamžiku své kariéry, kdy jsem hledal prostředí podobné startupu, kde bych se mohl učit, rozšiřovat své dovednosti, stejně jako využívat své zkušenosti se speech a umělou inteligencí, aby měl největší dopad, měl jsem štěstí, že jsem měl možnost připojit se k LXT. Bylo to ideální shoda. LXT není pouze poskytovatelem dat pro umělou inteligenci, který roste rychlým a konzistentním tempem, ale viděl jsem v něm také společnost, která je na ideálním stupni růstu co se týče znalostí umělé inteligence, stejně jako velikosti a rozmanitosti klientů, a tudíž i typů a rozmanitosti dat pro umělou inteligenci. Rád bych využil této příležitosti, aby jsem se připojil a pomohl v jejím růstovém procesu; aby měl velký dopad tím, že bych přinesl perspektivu uživatele dat po všech těch letech, kdy jsem byl vědcem a uživatelem dat pro umělou inteligenci.
Co je váš denní režim ve společnosti LXT?
Můj denní režim začíná tím, že se dívám na nejnovější výzkum na jednu nebo druhou téma, který se poslední dobou soustředil na generativní umělou inteligenci, a na to, jak můžeme aplikovat to na potřeby našich zákazníků. Naštěstí mám vynikající tým, který je velmi způsobilý vytvářet a přizpůsobovat řešení našim klientům, kteří mají často specializované potřeby dat pro umělou inteligenci. Pracuji tedy úzce s nimi, abychom nastavili tu agendu.
Můžete diskutovat o vizi, jak LXT může urychlit úsilí o umělou inteligenci pro různé klienty?
Naším cílem ve společnosti LXT je poskytnout datové řešení, která umožňují efektivní, přesné a rychlejší vývoj umělé inteligence. Prostřednictvím našich 12 let zkušeností v oblasti dat pro umělou inteligenci jsme nejen získali rozsáhlé znalosti o potřebách klientů ve všech aspektech souvisejících s daty, ale také jsme neustále jemně ladili naše procesy, abychom mohli dodávat nejvyšší kvalitní data v nejkratším čase a za nejlepší ceny. Jako výsledek našeho pevného závazku poskytovat našim klientům optimální kombinaci kvality, efektivity a ceny dat pro umělou inteligenci, jsme se stali důvěryhodným partnerem pro data pro umělou inteligenci, jak je patrné z našich opakujících se klientů, kteří se k nám vracejí pro své stále rostoucí a se vyvíjející potřeby dat pro umělou inteligenci. Moje vize je upevnit, zlepšit a rozšířit ten “modus operandi” LXT na všechny modality dat, se kterými pracujeme, stejně jako na všechny typy vývoje umělé inteligence, které nyní sloužíme, včetně generativní umělé inteligence. Dosažení tohoto cíle se točí kolem strategického rozšíření našich vlastních schopností strojového učení a datové vědy, både z hlediska technologií, tak zdrojů.
Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit LXT.












