Интервью

Фил Холл, главный директор по росту в LXT – Интервью

mm
Добавьте Unite.AI в избранные источники в Google

Главный директор по росту LXT Фил Холл – бывший исполнительный директор Appen и член Совета технологий Forbes. На своей руководящей должности в Appen он руководил отделением из более 1000 сотрудников и сыграл ключевую роль в достижении 17 последовательных лет роста выручки с постоянно высокой прибыльностью. В своей текущей роли в LXT он работает с командой экспертов, чтобы достичь амбициозных целей роста.

LXT – это компания, занимающая лидирующее положение в области обучающих данных для ИИ, которые обеспечивают работу интеллектуальных технологий для глобальных организаций, включая крупнейшие технологические компании мира. В партнерстве с международной сетью контрибьюторов LXT собирает и аннотирует данные в различных модальностях с необходимой скоростью, масштабом и гибкостью для крупных корпораций. У них есть глобальный опыт, охватывающий более 115 стран и 750 языковых локализаций. Основанная в 2010 году, LXT имеет штаб-квартиру в Торонто, Канада, и присутствует в США, Австралии, Египте, Великобритании и Турции. Компания обслуживает клиентов в Северной Америке, Европе, Азии и на Ближнем Востоке.

Когда вы впервые открыли для себя свою страсть к языку?

Я всегда был заинтересован в языке, но в плане моего прямого участия в языке и лингвистике, был один значительный поворотный момент для меня. Мы поняли, что одна из наших детей страдает дислексией, и когда мы поговорили с ее школой о дополнительной поддержке, они сказали, что, хотя есть программы, которые они могут использовать, есть также вещи, которые я могу сделать как волонтер в школе, чтобы помочь нашей дочери и другим детям. Все прошло хорошо, и оттуда я пошел изучать лингвистику и в итоге стал преподавать в двух университетах здесь в Сиднее.

Вы преподавали лингвистику, прежде чем перешли в область речевых данных, что вдохновило вас сменить фокус?

Сиднейская компания Appen только что переходила от работы в спальне к полноценной коммерческой операции. Мне сказали, что они ищут лингвистов (может быть, более точно, лингвиста!), и меня представили основателям Джули и Крису Вонвиллерам. Переход был постепенным и занял около двух лет. Я был неохотен уйти из преподавания – работать с высокоодаренными студентами было и вдохновляющим, и очень весело. Но особенно в те пионерские годы я решал сложные проблемы вместе с ведущими мировыми экспертами в области языковой технологии, и уровень волнения был высоким. Многое из того, что сейчас считается само собой разумеющимся, было очень сложным в то время.

Вы вышли на пенсию, чтобы присоединиться к LXT. Что мотивировало вас сделать это?

Это интересный вопрос, поскольку я действительно наслаждался собой на пенсии. Фактически, наш сооснователь и генеральный директор Мохаммад Омар обратился ко мне за несколько месяцев до того, как я ответил на его первоначальный запрос, поскольку я жил расслабленной жизнью и не особенно размышлял о возвращении к полноценной работе. После согласия на первый звонок, где Мо спросил о возможности присоединения к LXT, я ожидал просто вежливо выслушать и отказаться.

Но в конце концов, возможность была просто слишком хороша, чтобы ее упустить.

Поговорив с Мохаммадом и другими членами команды LXT, я сразу же признал общую страсть к языку. Команда, которую собрал Мохаммад, была наполнена творческими мыслителями с безграничной энергией, которые были полностью посвящены миссии компании.

Когда я узнал больше об возможности с LXT, я понял, что это была возможность, которую я не хотел упустить. Вот компания с огромным потенциалом для расширения и роста в области, которую я уважаю. И поскольку рынок ИИ продолжает расти экспоненциально, возможность помочь большему количеству организаций перейти от экспериментов к производству – это захватывающая возможность, частью которой я очень рад быть.

Каковы некоторые из текущих проблем, связанных с получением данных в крупном масштабе?

Проблемы так же разнообразны, как и применения, которые их стимулируют.

С практической точки зрения проблемы включают аутентичность, надежность, точность, безопасность и обеспечение того, что данные подходят для цели – и это без учета растущего числа юридических и этических проблем, присущих сбору данных.

Например, разработка технологий в поддержку автономных транспортных средств требует сбора огромных объемов данных в различных сценариях, чтобы автомобиль понимал, как реагировать на реальные ситуации. Есть бесчисленное количество краевых случаев, которые можно встретить при вождении, поэтому алгоритмы, которые управляют этими транспортными средствами, нуждаются в наборах данных, которые охватывают все – от улиц до знаков остановки до падающих объектов. И если вы умножите это на количество погодных событий, которые могут произойти, необходимый объем обучающих данных увеличивается экспоненциально. Автомобильным компаниям, которые входят в автономное пространство, необходимо установить надежную трубу данных, и сделать это самостоятельно потребует огромного количества ресурсов.

Другим вариантом использования является расширение существующего голосового продукта ИИ на новые рынки для захвата доли рынка и новых клиентов. Это неизбежно требует языковых данных, и для достижения точности крайне важно получить речевые данные от носителей языка из различных демографических профилей. После сбора данных аудиофайлы необходимо транскрибировать для обучения алгоритмов обработки естественного языка продукта. Делать это для нескольких языков и в объемах, необходимых для эффективности, чрезвычайно сложно для компаний сделать самостоятельно, особенно если у них нет внутренней экспертизы в этой области.

Это лишь два примера многих проблем, которые существуют с сбором данных для ИИ в крупном масштабе, но как вы можете себе представить, домашняя автоматизация, мобильные устройства и биометрические сборы данных имеют свои собственные конкретные проблемы.

Каковы текущие способы, которыми LXT получает и аннотирует данные?

В LXT мы собираем и аннотируем данные по-разному для каждого клиента, поскольку все наши взаимодействия адаптированы для удовлетворения спецификаций наших клиентов. Мы работаем с различными типами данных, включая аудио, изображения, речь, текст и видео. Для сбора данных мы работаем с глобальной сетью подрядчиков, чтобы собрать данные в этих различных модальностях. Сборы могут варьироваться от сбора данных в реальных условиях, таких как дома, офисы или в машине, до работы в студии с опытными инженерами в случае определенных проектов сбора речевых данных.

Наши возможности аннотации данных также охватывают несколько модальностей. Наш опыт начался в области речи, и за последние 12 лет мы расширили свою деятельность более чем на 115 стран и более 750 языковых локализаций. Это означает, что компании всех размеров могут полагаться на LXT, чтобы помочь им проникнуть на широкий спектр рынков и захватить новые сегменты клиентов. Более недавно мы расширили свою деятельность в области текста, изображений и видео, и наша внутренняя платформа используется для предоставления высококачественных данных нашим клиентам.

Другой интересной областью роста для нас стала наша безопасная работа по аннотации. Только в этом году мы расширили нашу безопасную инфраструктуру с двух до пяти мест по всему миру. Мы разработали книгу рецептов, которая позволяет нам создавать новые объекты в течение нескольких месяцев. Услуги, на которые мы сейчас фокусируемся в этих безопасных объектах, в настоящее время включают аннотацию и транскрипцию речевых данных, но они могут быть использованы для аннотации различных типов данных.

Почему получение данных таким образом является лучшей альтернативой синтетическим данным?

Синтетические данные – это интересное развитие в области ИИ и хорошо подходят для определенных случаев использования, особенно краевых случаев, которые трудно захватить в реальном мире. Использование синтетических данных растет, особенно на ранних этапах зрелости ИИ, когда компании все еще находятся в экспериментальном режиме. Однако наше собственное исследование показывает, что по мере того, как организации совершенствуют свои стратегии ИИ и продвигают больше моделей в производство, они с большей вероятностью используют методы машинного обучения с учителем или полуучителем, которые полагаются на данные, аннотированные человеком.

Люди просто лучше компьютеров в понимании нюансов для создания необходимых данных для обучения моделей машинного обучения с высокой точностью, и человеческий надзор также имеет решающее значение для снижения предвзятости.

Почему эти данные так важны для речи и обработки естественного языка?

Для того, чтобы алгоритмы речи и обработки естественного языка работали эффективно на своих целевых рынках, им необходимо обучать большими объемами данных, полученными от носителей языка, которые имеют культурный контекст конечных пользователей, которых они представляют. Без этих данных внедрение голосового ИИ будет иметь серьезные ограничения.

Кроме того, при сборе речевых данных необходимо учитывать окружающую среду. Если решение голосового ИИ, которое обучается, будет использоваться в машине, например, есть разные дорожные и погодные условия, которые влияют на речь и должны быть приняты во внимание. Это сложные сценарии, где опытный партнер по данным может помочь.

Есть ли что-то еще, что вы хотели бы поделиться о LXT?

Прежде всего, я хотел бы поблагодарить вас за возможность поделиться нашей историей! Я хотел бы подчеркнуть, что наша компания посвящена помощи организациям всех размеров в успехе их инициатив ИИ. Мы были сосредоточены на предоставлении высококастомизированных данных ИИ компаниям по всему миру более 12 лет и были бы рады связаться с кем-либо, кто хочет создать надежную трубу данных для поддержки своих проектов ИИ.

Спасибо за отличное интервью, читателям, которые хотят узнать больше, следует посетить LXT.

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.