Wywiady
Amr Nour-Eldin, Wiceprezes ds. Technologii w LXT – Seria wywiadów

Amr Nour-Eldin jest Wiceprezesem ds. Technologii w firmie LXT. Amr jest doktorem nauk z ponad 16-letnim doświadczeniem zawodowym w dziedzinie przetwarzania mowy i dźwięku oraz uczenia maszynowego w kontekście rozpoznawania mowy, ze szczególnym uwzględnieniem technik głębokiego uczenia się do rozpoznawania mowy w czasie rzeczywistym.
LXT to firma, która jest liderem w dziedzinie danych szkoleniowych do zasilania inteligentnych technologii dla organizacji na całym świecie. W partnerstwie z międzynarodową siecią współpracowników, LXT gromadzi i opatruje danymi różne typy danych z szybkością, skalą i elastycznością wymaganą przez przedsiębiorstwa. Ich globalna ekspertyza obejmuje ponad 145 krajów i ponad 1000 lokalizacji językowych.
Czy mógłbyś opowiedzieć, co Cię zainteresowało w dziedzinie przetwarzania sygnałów, którą studiowałeś na Uniwersytecie McGill?
Zawsze chciałem studiować inżynierię i lubiłem nauki przyrodnicze, ale bardziej interesowałem się matematyką i fizyką. Starałem się zrozumieć, jak działa natura i jak można tę wiedzę wykorzystać do tworzenia technologii. Po ukończeniu szkoły średniej miałem możliwość studiowania medycyny i innych zawodów, ale wybrałem inżynierię, ponieważ reprezentowała dla mnie idealne połączenie teorii i aplikacji w dwóch dziedzinach, które są mi najbliższe: matematyce i fizyce. A potem, kiedy już ją wybrałem, były różne możliwości – inżynieria mechaniczna, inżynieria lądowa itd. Ale wybrałem inżynierię elektryczną, ponieważ jest to najbliższa i najtrudniejsza, moim zdaniem, matematyka i fizyka, oraz podstawa nowoczesnej technologii, która zawsze mnie pociągała.
W ramach inżynierii elektrycznej są różne specjalizacje do wyboru, które ogólnie dzielą się na dwie kategorie: telekomunikację i przetwarzanie sygnałów oraz inżynierię elektryczną i energetykę. Kiedy nadszedł czas, aby wybrać między tymi dwoma, wybrałem telekomunikację i przetwarzanie sygnałów, ponieważ jest to bliższe opisowi natury przez fizykę i równania. Mówimy o sygnałach, czy to audio, obrazy czy wideo; rozumienie, jak komunikujemy się i co nasze zmysły postrzegają, oraz jak matematycznie reprezentować tę informację w taki sposób, abyśmy mogli wykorzystać tę wiedzę do tworzenia i udoskonalania technologii.
Czy mógłbyś omówić swoje badania na Uniwersytecie McGill na temat informacyjnego aspektu sztucznej rozszerzalności pasma (BWE)?
Po ukończeniu studiów licencjackich chciałem kontynuować studia w dziedzinie przetwarzania sygnałów. Po roku studiów magisterskich z dziedziny fizyki, zdecydowałem się wrócić do inżynierii i studiować magisterium z dziedziny audio i przetwarzania mowy, koncentrując się na rozpoznawaniu mowy. Kiedy nadszedł czas, aby rozpocząć studia doktoranckie, chciałem rozszerzyć swoją dziedzinę nieco bardziej w kierunku ogólnego przetwarzania audio i mowy, a także pokrewnych dziedzin, takich jak uczenie maszynowe i teoria informacji, zamiast koncentrować się tylko na aplikacji rozpoznawania mowy.
Pojazdem moich badań doktoranckich była rozszerzalność pasma wąskopasmowej mowy. Wąskopasmowa mowa odnosi się do konwencjonalnej telefoni. Zawartość częstotliwości mowy sięga do około 20 kiloherców, ale większość zawartości informacyjnej jest skoncentrowana do 4 kiloherców. Rozszerzalność pasma odnosi się do sztucznego rozszerzania zawartości mowy z 3,4 kiloherców, które jest górną granicą częstotliwości w konwencjonalnej telefoni, do powyżej 8 kiloherców lub więcej. Aby lepiej odtworzyć tę brakującą wyższą zawartość częstotliwości, należy najpierw zmierzyć wzajemną informację między zawartością mowy w obu pasmach częstotliwości, a następnie wykorzystać tę informację do trenowania modelu, który nauczy się tej wspólnej informacji; model, który, po trenowaniu, może być wykorzystany do generowania wyższej zawartości częstotliwości na podstawie tylko wąskopasmowej mowy i tego, czego model nauczył się o relacji między dostępną wąskopasmową mową a brakującą wyższą zawartością częstotliwości. Mierzenie i reprezentowanie tej wspólnej “wzajemnej informacji” to miejsce, w którym pojawia się teoria informacji. Teoria informacji jest badaniem ilościowym i reprezentacją informacji w dowolnym sygnale. Moje badania dotyczyły więc włączania teorii informacji w celu poprawy sztucznej rozszerzalności pasma mowy. Moje badania doktoranckie były więc bardziej interdyscyplinarnym badaniem, w którym łączyłem przetwarzanie sygnałów z teorią informacji i uczeniem maszynowym.
Byłeś głównym naukowcem ds. mowy w firmie Nuance Communications, obecnie części Microsoftu, przez ponad 16 lat. Jakie były Twoje najważniejsze wnioski z tego doświadczenia?
Z mojego punktu widzenia najważniejszą korzyścią było to, że zawsze pracowałem nad najnowocześniejszymi, najbardziej zaawansowanymi technikami w dziedzinie przetwarzania sygnałów i uczenia maszynowego oraz stosowałem te technologie do rzeczywistych aplikacji. Miałem okazję stosować te techniki do produktów Conversational AI w różnych dziedzinach. Te dziedziny obejmowały przedsiębiorstwa, opiekę zdrowotną, motoryzację i mobilność, między innymi. Niektóre z konkretnych aplikacji obejmowały asystentów wirtualnych, interaktywne odpowiedzi głosowe, konwersję wiadomości głosowych na tekst i inne, w których właściwa reprezentacja i transkrypcja są kluczowe, takie jak w opiece zdrowotnej z interakcjami lekarz-pacjent. W ciągu tych 16 lat miałem szczęście być świadkiem i uczestniczyć w ewolucji sztucznej inteligencji konwersacyjnej, od czasów modelowania statystycznego z wykorzystaniem ukrytych modeli Markowa, poprzez stopniowe przejęcie przez głębokie uczenie się, do czasów, w których głębokie uczenie się dominuje niemal wszystkie aspekty sztucznej inteligencji, w tym sztucznej inteligencji generatywnej, a także tradycyjnej predykcyjnej lub dyskryminacyjnej sztucznej inteligencji. Innym ważnym wnioskiem z tego doświadczenia jest kluczowa rola, jaką odgrywają dane, zarówno pod względem ilości, jak i jakości, jako kluczowy czynnik wpływający na możliwości i wydajność modeli sztucznej inteligencji.
Opublikowałeś ponad tuzin artykułów, w tym w tak renomowanych czasopismach, jak IEEE. Jakie, Twoim zdaniem, było najbardziej przełomowe badanie, które opublikowałeś, i dlaczego było ono ważne?
Najbardziej wpływowe, według liczby cytowań w Google (GOOGL ) Scholar, byłby artykuł z 2008 roku zatytułowany „Mel-Frequency Cepstral Coefficient-Based Bandwidth Extension of Narrowband Speech”. Na wysokim poziomie, celem tego artykułu jest to, jak odtworzyć zawartość mowy przy użyciu reprezentacji cech, które są powszechnie stosowane w dziedzinie automatycznego rozpoznawania mowy (ASR), mel-frequency cepstral coefficients.
Jednak bardziej innowacyjny, moim zdaniem, jest artykuł z 2011 roku zatytułowany “Memory-Based Approximation of the Gaussian Mixture Model Framework for Bandwidth Extension of Narrowband Speech“. W tym artykule zaproponowałem nową technikę modelowania statystycznego, która uwzględnia informację czasową w mowie. Zaletą tej techniki jest to, że pozwala na modelowanie długoterminowych informacji w mowie z minimalnym dodatkowym złożeniem i w taki sposób, który pozwala również na generowanie szerokopasmowej mowy w czasie rzeczywistym.
We wrześniu 2023 roku zostałeś zatrudniony na stanowisku Wiceprezesa ds. Technologii w LXT, co Cię skłoniło do przyjęcia tego stanowiska?
Przez całe moje doświadczenie akademickie i zawodowe przed LXT zawsze pracowałem bezpośrednio z danymi. W rzeczywistości, jak wcześniej wspomniałem, jednym z kluczowych wniosków z mojej pracy z nauką o mowie i uczeniem maszynowym było kluczowe znaczenie danych w cyklu życia modelu sztucznej inteligencji. Posiadanie wystarczających danych jakościowych w odpowiednim formacie było i nadal jest niezbędne do sukcesu najnowocześniejszych, opartych na głębokim uczeniu się, modeli sztucznej inteligencji. Dlatego, kiedy znalazłem się na etapie swojej kariery, w którym szukałem środowiska typu startup, w którym mógłbym się uczyć, poszerzać swoje umiejętności, a także wykorzystywać swoje doświadczenie w dziedzinie mowy i sztucznej inteligencji, aby mieć największy wpływ, miałem szczęście znaleźć okazję do dołączenia do LXT. Było to idealne dopasowanie. LXT nie tylko jest dostawcą danych sztucznej inteligencji, który rozwija się w imponującym i stabilnym tempie, ale także widziałem go jako firmę w idealnym stadium rozwoju pod względem wiedzy na temat sztucznej inteligencji, a także pod względem wielkości i różnorodności klientów, a tym samym pod względem typów danych sztucznej inteligencji. Cieszyłem się z okazji dołączenia do niej i pomocy w jej rozwoju; aby mieć duży wpływ, wprowadzając perspektywę użytkownika danych po tym, jak przez tyle lat byłem naukowcem danych sztucznej inteligencji.
Jak wygląda Twój przeciętny dzień w LXT?
Mój przeciętny dzień zaczyna się od przeglądania najnowszych badań na jeden temat lub inny, które ostatnio koncentrowały się wokół sztucznej inteligencji generatywnej, oraz jak możemy ją zastosować do potrzeb naszych klientów. Mam szczęście mieć doskonały zespół, który jest bardzo zdolny do tworzenia i dostosowywania rozwiązań do specyficznych potrzeb danych sztucznej inteligencji naszych klientów. Dlatego pracuję ściśle z nimi, aby ustalić ten plan.
Istnieje również, oczywiście, strategiczne planowanie roczne i kwartalne, oraz rozkładanie strategicznych celów na poszczególne cele zespołu i monitorowanie postępów w realizacji tych planów. Co do rozwoju funkcji, których się zajmujemy, zwykle mamy dwa ścieżki technologiczne. Jedna z nich polega na upewnieniu się, że mamy odpowiednie elementy w miejscu, aby dostarczyć najlepsze wyniki w naszych bieżących i nowych projektach. Druga ścieżka polega na poprawie i rozwijaniu naszych możliwości technologicznych, ze szczególnym uwzględnieniem włączania uczenia maszynowego w nie.
Czy mógłbyś omówić rodzaje algorytmów uczenia maszynowego, nad którymi pracujesz w LXT?
Rozwiązania sztucznej inteligencji przekształcają firmy we wszystkich branżach, a my w LXT jesteśmy zaszczytowani dostarczać wysokiej jakości dane do trenowania algorytmów uczenia maszynowego, które je napędzają. Nasi klienci pracują nad szerokim zakresem aplikacji, w tym rzeczywistości rozszerzonej i wirtualnej, przetwarzania wizji komputerowej, sztucznej inteligencji konwersacyjnej, sztucznej inteligencji generatywnej, wyszukiwania i przetwarzania języka naturalnego, między innymi. Jesteśmy zaangażowani w dostarczanie danych do szkolenia algorytmów uczenia maszynowego i technologii przyszłości we wszystkich językach, kulturach i modalnościach.
Wewnętrznie również włączamy uczenie maszynowe, aby poprawić i zoptymalizować nasze wewnętrzne procesy, od automatyzacji naszej walidacji jakości danych po włączanie modelu etykietowania z udziałem człowieka we wszystkich modalnościach danych, nad którymi pracujemy.
Przetwarzanie mowy i dźwięku zbliża się szybko do ideału, jeśli chodzi o język angielski i konkretnie białych mężczyzn. Jak długo, Twoim zdaniem, zajmie równy podział pomiędzy wszystkimi językami, płciami i etnicznościami?
To jest skomplikowane pytanie i zależy od wielu czynników, w tym ekonomicznych, politycznych, społecznych i technologicznych, między innymi. Ale co jest jasne, to to, że dominacja języka angielskiego jest tym, co napędza sztuczną inteligencję do tego, gdzie jesteśmy teraz. Więc aby dojść do miejsca, w którym będzie to równy podział, zależy to od tempa, w jakim reprezentacja danych z różnych etniczności i populacji rośnie w sieci, a tempo, w jakim rośnie, determinuje, kiedy dojdziemy do tego miejsca.
Jednak LXT i podobne firmy mogą odegrać dużą rolę w napędzaniu nas w kierunku bardziej równego podziału. Dopóki dane dla mniej reprezentowanych języków, płci i etniczności będą trudne do uzyskania lub po prostu niedostępne, ta zmiana nastąpi wolniej. Ale staramy się zrobić naszą część. Z pokryciem ponad 1000 lokalizacji językowych i doświadczeniem w 145 krajach, LXT pomaga uczynić dostęp do większej ilości danych językowych możliwym.
Jakie jest Twoje wizjonerskie spojrzenie na to, jak LXT może przyspieszyć wysiłki w dziedzinie sztucznej inteligencji dla różnych klientów?
Naszym celem w LXT jest dostarczanie rozwiązań danych, które umożliwiają efektywne, dokładne i szybsze rozwijanie sztucznej inteligencji. Przez 12 lat doświadczenia w dziedzinie danych sztucznej inteligencji nie tylko zgromadziliśmy obszerną wiedzę na temat potrzeb klientów w zakresie wszystkich aspektów związanych z danymi, ale także stale doskonaliliśmy nasze procesy, aby dostarczyć najwyższej jakości dane w najkrótszym czasie i przy najlepszych punktach cenowych. W związku z tym, jako wynik naszego niezachwianego zaangażowania w dostarczanie naszym klientom optymalnej kombinacji jakości danych sztucznej inteligencji, wydajności i ceny, staliśmy się godnym zaufania partnerem danych sztucznej inteligencji, co jest widoczne w naszych powtarzających się klientach, którzy wracają do LXT ze swoimi rosnącymi i ewoluującymi potrzebami w zakresie danych sztucznej inteligencji. Moje wizjonerskie spojrzenie jest takie, aby umocnić, poprawić i rozszerzyć ten “sposób robienia rzeczy” w LXT na wszystkie modalności danych, nad którymi pracujemy, a także na wszystkie typy rozwoju sztucznej inteligencji, które obsługujemy, w tym sztuczną inteligencję generatywną. Osiągnięcie tego celu wiąże się z strategicznym rozwijaniem naszych własnych możliwości w dziedzinie uczenia maszynowego i nauki o danych, zarówno pod względem technologii, jak i zasobów.
Dziękujemy za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić LXT.












