Интервью

Амр Нур-Эльдин, Вице-президент по технологиям в LXT – Интервью

mm
Добавьте Unite.AI в избранные источники в Google

Амр Нур-Эльдин является Вице-президентом по технологиям в LXT. Амр – исследователь-ученый с докторской степенью, имеющий более 16 лет профессионального опыта в области обработки речи и аудио, а также машинного обучения в контексте автоматического распознавания речи (ASR), с особым акцентом и практическим опытом в последние годы на методах глубокого обучения для потокового распознавания речи.

LXT – это развивающийся лидер в области обучающих данных для ИИ, которые позволяют создавать интеллектуальные технологии для глобальных организаций. В партнерстве с международной сетью контрибьюторов LXT собирает и аннотирует данные по нескольким модальностям с той скоростью, масштабом и гибкостью, которые требуются предприятиями. Их глобальный опыт охватывает более 145 стран и более 1000 языковых локалей.

Вы получили степень доктора философии в области обработки сигналов в Университете Макгилла, что первоначально привлекло вас к этой области?

Я всегда хотел изучать инженерию и действительно любил естественные науки в целом, но был привлечен более конкретно к математике и физике. Я всегда пытался понять, как работает природа, и как применить это понимание для создания технологий. После школы у меня была возможность поступить в медицинский вуз и другие профессии, но я специально выбрал инженерию, поскольку она представляла собой идеальное сочетание теории и применения в двух областях, которые были мне ближе всего: математике и физике. И тогда, когда я выбрал эту область, были многие потенциальные пути – механическая, гражданская и т. д. Но я специально выбрал электротехнику, поскольку она была ближе всего к типу математических и физических проблем, которые я всегда считал сложными и, следовательно, более интересными, а также являлась основой современных технологий, которые всегда меня привлекали.

В рамках электротехники есть различные специализации, которые можно выбрать, и которые обычно делятся на две категории: телекоммуникации и обработка сигналов, а также электротехника и энергетика. Когда пришло время выбирать между ними, я выбрал телекоммуникации и обработку сигналов, поскольку это было ближе к тому, как мы описываем природу через физику и уравнения. Мы говорим о сигналах, будь то аудио, изображения или видео; понимании того, как мы общаемся и что наши чувства воспринимают, и как математически представить эту информацию так, чтобы мы могли использовать это знание для создания и улучшения технологий.

Можете ли вы обсудить свою исследовательскую работу в Университете Макгилла на тему информационно-теоретического аспекта искусственного расширения полосы частот (BWE)?

После окончания бакалавриата я хотел продолжить изучать область обработки сигналов в академической среде. После года изучения фотоники в рамках магистерской программы по физике я решил вернуться к инженерии, чтобы получить степень магистра в области аудио- и речевой обработки сигналов, сосредоточившись на распознавании речи. Когда пришло время делать докторскую диссертацию, я хотел расширить свою область немного в сторону общей обработки аудио и речи, а также смежных областей машинного обучения и информационной теории, а не просто сосредоточиться на применении распознавания речи.

Вехой моей докторской диссертации было искусственное расширение полосы частот узкополосной речи. Узкополосная речь относится к обычной телефонной связи. Частотный состав речи распространяется до 20 килогерц, но большинство информационного содержания концентрируется до 4 килогерц. Расширение полосы частот означает искусственное расширение содержания речи от 3,4 килогерца, который является верхней частотной границей в обычной телефонии, до выше 8 килогерц или более. Чтобы лучше реконструировать это пропавшее высокочастотное содержание, учитывая только доступное узкополосное содержание, необходимо сначала количественно оценить взаимную информацию между содержанием речи в двух частотных диапазонах, а затем использовать эту информацию для обучения модели, которая учит эту общую информацию; модели, которая, после обучения, может затем быть использована для генерации высокочастотного содержания, учитывая только узкополосную речь и то, что модель узнала о взаимосвязи между доступной узкополосной речью и пропавшим высокочастотным содержанием. Количественная оценка и представление этой общей “взаимной информации” – это то, где информационная теория вступает в игру. Информационная теория – это изучение количественной оценки и представления информации в любом сигнале. Итак, моя исследовательская работа была посвящена включению информационной теории для улучшения искусственного расширения полосы частот речи. Таким образом, моя докторская диссертация была больше междисциплинарной исследовательской деятельностью, где я объединил обработку сигналов с информационной теорией и машинным обучением.

Вы были старшим научным сотрудником по речи в Nuance Communications, которая теперь является частью Microsoft (MSFT ), более 16 лет, какие были некоторые из ваших ключевых выводов из этого опыта?

С моей точки зрения, наиболее важным преимуществом было то, что я всегда работал над передовыми, инновационными методами в области обработки сигналов и машинного обучения и применял эту технологию к реальным приложениям. Я получил возможность применить эти методы к продуктам Conversational AI в различных доменах. Эти домены варьировались от корпоративного до здравоохранения, автомобильной и мобильной промышленности, среди прочих. Некоторые из конкретных приложений включали виртуальных помощников, интерактивные голосовые ответы, голосовую почту в текст и другие, где правильное представление и транскрипция имеют решающее значение, например, в здравоохранении при взаимодействии врача и пациента. На протяжении этих 16 лет я был удачлив, став свидетелем и участником эволюции Conversational AI, от дней статистического моделирования с использованием скрытых марковских моделей до постепенного перехода к глубокому обучению, и теперь, когда глубокое обучение проникает и доминирует почти во все аспекты ИИ, включая генеративный ИИ, а также традиционный прогностический или дискриминационный ИИ. Другим ключевым выводом из этого опыта является важная роль, которую играют данные, как по количеству, так и по качеству, в качестве ключевого драйвера возможностей и производительности моделей ИИ.

Вы опубликовали более десятка статей, включая в таких известных изданиях, как IEEE. По вашему мнению, какая из ваших опубликованных работ является наиболее революционной и почему она была важна?

Самая влиятельная, по количеству цитирований в Google (GOOGL ) Scholar, будет статья 2008 года под названием “Мел-частотные цепstralные коэффициенты на основе расширения полосы частот узкополосной речи”. На высоком уровне, фокус этой статьи заключается в том, как реконструировать содержание речи, используя представление функций, которое широко используется в области автоматического распознавания речи (ASR), мел-частотные цепstralные коэффициенты.

Однако более инновационной, по моему мнению, является статья с вторым по количеству цитирований, опубликованная в 2011 году под названием “Память-ориентированное приближение рамки смеси гауссовских моделей для расширения полосы частот узкополосной речи“. В этой работе я предложил новый статистический метод моделирования, который включает временную информацию в речи. Преимущество этого метода заключается в том, что он позволяет моделировать долгосрочную информацию в речи с минимальной дополнительной сложностью и в форме, которая все еще позволяет генерировать широкополосную речь в потоковом или реальном времени.

В июне 2023 года вы были наняты в качестве Вице-президента по технологиям в LXT, что привлекло вас к этой должности?

На протяжении моего академического и профессионального опыта до LXT я всегда работал напрямую с данными. Фактически, как я отметил ранее, одним из ключевых выводов для меня из работы со спич-наукой и машинным обучением было важное значение, которое играют данные в жизненном цикле модели ИИ. Иметь достаточно качественных данных в нужном формате было, и продолжает быть, важным для успеха передовых методов глубокого обучения, основанных на ИИ. Таким образом, когда я оказался на этапе своей карьеры, когда я искал стартап-среду, где я мог учиться, расширять свои навыки, а также использовать свой опыт в области речи и ИИ, чтобы иметь максимальное влияние, я был удачлив, что имел возможность присоединиться к LXT. Это было идеальное совпадение. LXT не только является поставщиком данных для ИИ, который растет с впечатляющей и последовательной скоростью, но я также увидел его как идеальную стадию роста в плане роста знаний об ИИ, а также в плане размера и разнообразия клиентов, и, следовательно, в плане типов данных для ИИ. Мне понравилась возможность присоединиться и помочь в его путешествии роста; иметь большое влияние, привнося перспективу пользователя данных для ИИ после того, как я был пользователем данных для ИИ на протяжении всех этих лет.

Что такое ваш типичный день в LXT?

Мой типичный день начинается с изучения последних исследований на одну тему или другую, которая в последнее время сосредоточена вокруг генеративного ИИ, и того, как мы можем применить это к потребностям наших клиентов. К счастью, у меня есть отличная команда, которая очень умело создает и адаптирует решения для часто специфических потребностей наших клиентов в данных для ИИ. Итак, я тесно работаю с ними, чтобы установить эту программу.

Также, конечно, есть стратегическое планирование на год и квартал, и разбиение стратегических целей на индивидуальные цели команды и поддержание темпа с развитием по этим планам. Что касается разработки функций, которые мы делаем, у нас обычно есть два технологических направления. Одно – это обеспечение того, что у нас есть правильные компоненты, чтобы доставить лучшие результаты на наших текущих и новых проектах. Другое направление – улучшение и расширение наших технологических возможностей, с фокусом на включении машинного обучения в них.

Можете ли вы обсудить типы алгоритмов машинного обучения, над которыми вы работаете в LXT?

Решения на основе искусственного интеллекта трансформируют бизнес во всех отраслях, и мы в LXT гордимся тем, что предоставляем высококачественные данные для обучения алгоритмов машинного обучения, которые их кормят. Наши клиенты работают над широким спектром приложений, включая дополненную и виртуальную реальность, компьютерное зрение, Conversational AI, генеративный ИИ, поиск релевантности и обработку речи и естественного языка (NLP), среди прочих. Мы посвящены тому, чтобы питать алгоритмы машинного обучения и технологии будущего через генерацию и улучшение данных во всех языках, культурах и модальностях.

Внутри нашей компании мы также включаем машинное обучение для улучшения и оптимизации наших внутренних процессов, от автоматизации нашей проверки качества данных до включения модели标注 с human-in-the-loop для всех модальностей данных, с которыми мы работаем.

Обработка речи и аудио быстро приближается к почти идеальному состоянию, когда речь идет об английском языке и, в частности, о белых мужчинах. Как долго, по вашему мнению, пройдет времени, прежде чем это станет равной игровой площадкой для всех языков, полов и этнических групп?

Это сложный вопрос, и зависит от многих факторов, включая экономические, политические, социальные и технологические, среди прочих. Но что rõчно, что распространение английского языка – это то, что привело ИИ к тому, где мы сейчас находимся. Итак, чтобы добраться до точки, где это равная игра, действительно зависит от скорости, с которой представление данных из разных этнических групп и популяций растет в Интернете, и темпа, с которым оно растет, – это то, что определит, когда мы доберемся туда.

Однако LXT и подобные компании могут сыграть большую роль в продвижении нас к более равной игровой площадке. Пока данные для менее представленных языков, полов и этнических групп трудно доступны или просто не доступны, это изменение будет происходить медленнее. Но мы пытаемся сделать свою часть. С покрытием более 1000 языковых локалей и опытом в 145 странах, LXT помогает сделать доступ к более языковым данным возможным.

Каково ваше видение того, как LXT может ускорить усилия по ИИ для разных клиентов?

Наша цель в LXT – предоставить решения по данным, которые позволяют эффективно, точно и быстро разрабатывать ИИ. Благодаря нашему 12-летнему опыту в области данных для ИИ мы не только накопили обширные знания о потребностях клиентов в отношении всех аспектов, связанных с данными, но также постоянно совершенствовали наши процессы, чтобы доставить данные самого высокого качества с наибольшей скоростью и по лучшим ценам. Следовательно, в результате нашей непоколебимой приверженности предоставлению нашим клиентам оптимальной комбинации качества, эффективности и цен на данные для ИИ мы стали надежным партнером по данным для ИИ, как это очевидно из наших постоянных клиентов, которые продолжают возвращаться в LXT для своих все более растущих и эволюционирующих потребностей в данных для ИИ. Мое видение – укрепить, улучшить и расширить эту “модель” LXT ко всем модальностям данных, с которыми мы работаем, а также ко всем типам разработки ИИ, которым мы сейчас служим, включая генеративный ИИ. Достижение этой цели заключается в стратегическом расширении наших собственных возможностей машинного обучения и науки о данных, как в плане технологий, так и в плане ресурсов. Благодарим за отличное интервью, читатели, которые хотят узнать больше, должны посетить LXT.

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.