Інтерв’ю

Амр Нур-Елдін, віце-президент з технологій у LXT – Серія інтерв’ю

mm
Додайте Unite.AI до бажаних джерел у Google

Амр Нур-Елдін є віце-президентом з технологій у LXT. Амр – доктор філософії у галузі обробки сигналів та аудіо, з понад 16-річним професійним досвідом у сфері обробки сигналів та машинного навчання в контексті автоматичного розпізнавання мови (ASR), з особливим акцентом та практичним досвідом у останні роки на техніках глибокого навчання для стрімінгового розпізнавання мови.

LXT – це новий лідер у сфері підготовки даних для навчання штучного інтелекту для глобальних організацій. У партнерстві з міжнародною мережею учасників, LXT збирає та анотує дані у різних модальностях з швидкістю, масштабом та гнучкістю, необхідними для підприємств. Їхній глобальний досвід охоплює понад 145 країн та понад 1000 мовних локалізацій.

Ви здобули ступінь доктора філософії з обробки сигналів у Університеті Макгілла, що спочатку вас цікавило в цій галузі?

Я завжди хотів вивчати інженерію, і мені подобалися природничі науки загалом, але мене приваблювала конкретно математика та фізика. Я намагався зрозуміти, як працює природа, і як застосовувати це розуміння для створення технологій. Після школи я мав можливість вступити до медичного університету та інших професій, але обрав інженерію, оскільки вона представляла для мене ідеальне поєднання теорії та застосування у двох найближчих мені галузях: математиці та фізиці. А потім, коли я обрав її, переді мною були різні можливості – механічна, цивільна інженерія тощо. Але я обрав саме електротехніку, оскільки вона найближча до тих математичних та фізичних проблем, які я завжди вважав складними та цікавими, а також є основою сучасних технологій, які завжди мене приваблювали.

У рамках електротехніки є різні спеціалізації, які загалом поділяються на дві категорії: телекомунікації та обробка сигналів, а також електротехніка та енергетика. Коли прийшов час обирати між цими двома напрямами, я обрав телекомунікації та обробку сигналів, оскільки вони ближчі до того, як ми описуємо природу через фізику та рівняння. Ви говорите про сигнали, чи то аудіо, зображення чи відео; розумієте, як ми спілкуємося та що сприймають наші органи чуття, і як математично представити цю інформацію таким чином, щоб ми могли використовувати це знання для створення та вдосконалення технологій.

Можете розповісти про свою роботу в Університеті Макгілла щодо інформаційно-теоретичних аспектів штучного розширення смуги (BWE)?

Після закінчення бакалаврату я хотів продовжувати вивчати обробку сигналів у галузі аудіо та мовлення, зосередившись на розпізнаванні мови. Коли прийшов час робити докторську дисертацію, я хотів розширити свою сферу діяльності трохи далі у галузі обробки сигналів, а також у галузі машинного навчання та інформаційної теорії, а не тільки зосереджуватися на застосуванні розпізнавання мови.

Транспортною темою для моєї докторської дисертації було штучне розширення смуги частот мови. Вузька смуга частот мови відноситься до звичайної телефонної мови. Частотний зміст мови розширюється до близько 20 кілогерц, але більша частина інформації зосереджена до 4 кілогерц. Розширення смуги частот означає штучне розширення змісту мови з 3,4 кілогерца, який є верхньою межею частоти у звичайній телефонії, до вище цієї межі, до 8 кілогерц або більше. Для кращого відновлення цього відсутнього високочастотного змісту, маючи лише вузьку смугу частот, потрібно спочатку кількісно оцінити взаємну інформацію між змістом мови у двох смугах частот, а потім використовувати цю інформацію для навчання моделі, яка вивчає цю спільну інформацію; моделі, яка, після навчання, може генерувати високочастотний зміст, маючи лише вузьку смугу частот мови та те, що модель вивчила про взаємозв’язок між наявною вузькою смугою частот мови та відсутнім високочастотним змістом. Кількісна оцінка та представлення цієї спільної “взаємної інформації” – це те, де інформаційна теорія вступає у гру. Інформаційна теорія – це вивчення кількісної оцінки та представлення інформації у будь-якому сигналі. Тому моя робота була присвячена включенню інформаційної теорії для покращення штучного розширення смуги частот мови. Отже, моя докторська дисертація була більше інтердисциплінарною науковою діяльністю, у якій я поєднав обробку сигналів з інформаційною теорією та машинним навчанням.

Ви були головним науковцем зі мови у Nuance Communications, яке тепер є частиною Microsoft (MSFT ), понад 16 років, які були вашими основними висновками з цього досвіду?

З моєї точки зору, найбільш важливим було те, що я завжди працював над державними, передовими техніками у сфері обробки сигналів та машинного навчання та застосовував ці технології до реальних застосунків. Я мав можливість застосовувати ці техніки до продуктів Конверсаційного Штучного Інтелекту у різних галузях. Ці галузі включали підприємства, охорону здоров’я, автомобільну промисловість, мобільність тощо. Деякі з конкретних застосунків включали віртуальних помічників, інтерактивну систему голосових відповідей, голосову пошту у текстовому форматі тощо, де правильне представлення та транскрипція мають критичне значення, наприклад, у сфері охорони здоров’я з взаємодією лікаря та пацієнта. Протягом цих 16 років я мав можливість стати свідком та взяти участь у еволюції Конверсаційного Штучного Інтелекту, від днів статистичних моделей, які використовували приховані марковські моделі, до поступового переходу до Глибокого Навчання, і тепер, коли глибоке навчання домінує майже у всіх аспектах Штучного Інтелекту, включаючи Генеративний Штучний Інтелект, а також традиційний передбачувальний або дискримінативний Штучний Інтелект. Іншим важливим висновком з цього досвіду є критична роль даних, як за кількістю, так і за якістю, як ключового фактору можливостей та продуктивності моделей Штучного Інтелекту.

Ви опублікували понад десяток робіт, у тому числі у таких відомих виданнях, як IEEE. На вашу думку, яка з ваших робіт була найбільш революційною, і чому вона була важливою?

Найбільш впливова робота, згідно з цитатами у Google (GOOGL ) Scholar, була роботою 2008 року під назвою “Мел-частотна цепstralна коэффіцієнт-базована розширення вузької смуги частот мови“. На високому рівні, фокус цієї роботи полягає у тому, як відновити зміст мови, використовуючи представлення функції, яке широко використовується у галузі автоматичного розпізнавання мови (ASR), мел-частотні цепстральні коефіцієнти.

Однак, більш інноваційна робота, на мою думку, – це робота з другою за кількістю цитат, 2011 року, під назвою “Пам’ять-базована апроксимація рамки гаусовських сумішей для розширення вузької смуги частот мови“. У цій роботі я запропонував нову статистичну модель, яка включає тимчасову інформацію у мові. Перевага цієї техніки полягає у тому, що вона дозволяє моделювати довгочасну інформацію у мові з мінімальною додатковою складністю та у такому вигляді, який дозволяє генерацію широкої смуги частот мови у стрімінговому або реальному часі.

У червні 2023 року вас було призначено віце-президентом з технологій у LXT, що вас привабило до цієї посади?

На всьому своєму академічному та професійному шляху до LXT я завжди працював безпосередньо з даними. Насправді, як я зазначив раніше, одним з ключових висновків для мене з моєї роботи зі мовою та машинним навчанням було критичне значення даних у життєвому циклі моделі Штучного Інтелекту. Мати достатньо якісних даних у потрібному форматі було, і залишається, життєво важливим для успіху сучасних глибоких моделей Штучного Інтелекту. Отже, коли я був на етапі своєї кар’єри, коли шукав середовище, подібне до стартапу, де я міг би вчитися, розширювати свої навички, а також використовувати свій досвід зі мови та Штучного Інтелекту для максимального впливу, я мав можливість приєднатися до LXT. Це було ідеальне поєднання. LXT не тільки є постачальником даних для Штучного Інтелекту, який росте з вражаючою та стабільною швидкістю, але я також бачив його на ідеальному етапі зростання у сфері знань про Штучний Інтелект, а також у клієнтській базі та різноманітності, і, відповідно, у типах даних для Штучного Інтелекту. Я був радий приєднатися та допомогти у його зростанні; мати великий вплив, привносячи перспективу користувача даних після того, як протягом усіх цих років був користувачем даних для Штучного Інтелекту.

Як виглядає ваш звичайний день у LXT?

Мій звичайний день починається з ознайомлення з останніми дослідженнями на одну чи іншу тему, які останнім часом зосереджувалися навколо Генеративного Штучного Інтелекту, та того, як ми можемо застосувати це до потреб наших клієнтів. На моєму боці є відмінна команда, яка дуже вміло створює та налаштовує рішення для спеціалізованих потреб наших клієнтів щодо даних для Штучного Інтелекту. Отже, я працюю у тісній співпраці з ними, щоб встановити цей порядок денний.

Є також, звичайно, стратегічне планування на рік та квартал, а також розбивка стратегічних цілей на індивідуальні завдання команди та підтримання курсу розвитку згідно з цими планами. Що стосується розробки функцій, яку ми здійснюємо, у нас загалом є два технологічні напрямки. Один з них полягає у тому, щоб мати правильні складові для надання найкращих результатів у наших поточних та нових проектах. Інший напрямок полягає у покращенні та розширенні наших технологічних можливостей, з особливим акцентом на включенні машинного навчання у них.

Можете розповісти про типи алгоритмів машинного навчання, над якими ви працюєте у LXT?

Рішення Штучного Інтелекту трансформують підприємства у всіх галузях, і ми у LXT маємо честь постачати високоякісні дані для навчання алгоритмів машинного навчання, які їх підтримують. Наші клієнти працюють над широким спектром застосунків, включаючи доповнену та віртуальну реальність, комп’ютерний зір, Конверсаційний Штучний Інтелект, Генеративний Штучний Інтелект, пошукову актуальність та обробку природної мови (NLP), серед інших. Ми присвячені підтримці алгоритмів машинного навчання та технологій майбутнього через генерацію та покращення даних у всіх мовах, культурах та модальностях.

Внутрішньо, ми також включаємо машинне навчання для покращення та оптимізації наших внутрішніх процесів, починаючи від автоматизації перевірки якості даних та закінчуючи моделлю маркування з людським втручанням у всіх модальностях даних, над якими ми працюємо.

Обробка мови та аудіо швидко наближається до досконалості щодо англійської мови та конкретно білих чоловіків. Як довго, на вашу думку, буде тривати, поки це не стане рівним полем для всіх мов, статей та етнічних груп?

Це складне питання, яке залежить від багатьох факторів, включаючи економічні, політичні, соціальні та технологічні, серед інших. Але те, що зрозуміло, полягає у тому, що поширеність англійської мови привела Штучний Інтелект до того стану, у якому він зараз перебуває. Отже, досягнення рівного поля залежить від швидкості, з якою представлення даних з різних етнічних груп та населення зростає в Інтернеті, а темп цього зростання визначатиме, коли ми досягнемо цього.

Однак, LXT та подібні компанії можуть відіграти велику роль у сприянні рівному полю. До тих пір, поки дані для менш представлених мов, статей та етнічних груп будуть важко доступні або просто недоступні, ці зміни відбуватимуться повільніше. Але ми намагаємося зробити свою частку роботи. З підтримкою понад 1000 мовних локалізацій та досвідом у 145 країнах, LXT допомагає зробити доступ до мовних даних можливим.

Яка ваша візія щодо того, як LXT може прискорити зусилля з Штучним Інтелектом для різних клієнтів?

Наша мета у LXT полягає у тому, щоб надавати рішення з даних, які дозволяють ефективне, точне та швидке розроблення Штучного Інтелекту. Через наші 12 років досвіду у сфері даних для Штучного Інтелекту, ми не тільки накопичили широкі знання про потреби клієнтів у всіх аспектах даних, але також постійно вдосконалювали свої процеси, щоб доставляти найвищу якість даних за найкращими темпами та ціновими пропозиціями. Отже, як результат нашої постійної відданості забезпеченню клієнтам оптимальної комбінації якості даних для Штучного Інтелекту, ефективності та цінових пропозицій, ми стали довіреним партнером з даних для Штучного Інтелекту, як свідчать наші повторювані клієнти, які продовжують повертатися до LXT за своїми зростаючими та еволюціонуючими потребами у даних для Штучного Інтелекту. Моя візія полягає у тому, щоб закріпити, покращити та розширити цю “фірмову марку” LXT для всіх модальностей даних, над якими ми працюємо, а також для всіх типів розроблення Штучного Інтелекту, яких ми зараз обслуговуємо, включаючи Генеративний Штучний Інтелект. Досягнення цієї мети полягає у стратегічному розширенні наших власних можливостей машинного навчання та науки про дані, як у технологічному, так і у ресурсному плані.

Дякуємо за велике інтерв’ю, читачам, які бажають дізнатися більше, рекомендуємо відвідати LXT.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.