Інтерв’ю

Філ Голл, начальник відділу зростання LXT – Інтерв’ю серія

mm
Додайте Unite.AI до бажаних джерел у Google

Філ Голл, начальник відділу зростання LXT, є колишнім виконавчим директором Appen і членом Ради технологій Forbes. Під час свого керівництва в Appen він керував підрозділом із понад 1000 співробітників і відіграв ключову роль у досягненні 17 років поспіль зростання доходів із високою прибутковістю. На своїй поточній посаді в LXT він працює з командою експертів, щоб досягти амбіційних цілей зростання.

LXT є новим лідером у сфері підготовки даних для штучного інтелекту для глобальних організацій, включаючи найбільші технологічні компанії світу. У партнерстві з міжнародною мережею учасників LXT збирає та анотує дані у різних модальностях із швидкістю, масштабом та гнучкістю, необхідними для підприємств. Вони мають глобальний досвід, який охоплює понад 115 країн та 750 мовних локалізацій. Заснована у 2010 році, LXT має штаб-квартиру в Торонто, Канада, з присутністю в США, Австралії, Єгипті, Великій Британії та Туреччині. Компанія обслуговує клієнтів у Північній Америці, Європі, Азії та на Близькому Сході.

Коли ви вперше зрозуміли, що ви пристрасно ставитесь до мови?

Я завжди був зацікавлений мовою, але якщо говорити про мою безпосередню участь у мовознавстві, то був один значний момент, коли я зрозумів свою пристрасність до мови. Ми зрозуміли, що одна з наших дітей має дислексію, і коли ми говорили з її школою про додаткову підтримку, вони сказали, що хоча є програми, які вони можуть використовувати, є також речі, які я міг зробити як волонтер у школі, щоб допомогти нашій дочці та іншим дітям. Все пройшло добре, і після цього я почав вивчати мовознавство та викладати у двох університетах у Сіднеї.

Ви викладали мовознавство, перш ніж перейшли у сфері даних мовлення, що спонукало вас змінити напрямок?

Сіднейська компанія Appen тільки переходила від роботи у приватній кімнаті до повноцінної комерційної діяльності. Мене сказали, що їм потрібен мовознавець (можливо, точніше, мовознавці!), і мене познайомили з засновниками Джулі та Крісом Вонвіллерами. Перехід був поступовим і тривав близько двох років. Я був неохоче залишати викладання – робота з високодостижними студентами була як надихаючою, так і дуже приємною. Але особливо під час тих піонерських років я вирішував складні проблеми разом з світовими лідерами у сфері мовної технології, і рівень збудження був високим. Багато того, що зараз вважається очевидним, було дуже складним у той час.

Ви вийшли на пенсію, але потім повернулися, щоб приєднатися до LXT. Що мотивувало вас зробити це?

Це цікаве питання, оскільки я справді насолоджувався собою на пенсії. Насправді наш співзасновник і генеральний директор Мохаммад Омар звернувся до мене за кілька місяців до того, як я відповів на його перше запитання, оскільки я жив спокійним життям і не думав про повернення до повноцінної роботи. Після згоди на перший дзвінок, де Мо запитав про можливість приєднатися до LXT, я очікував просто слухати ввічливо і відмовитися.

Але в підсумку можливість була просто занадто хороша, щоб її відкинути.

Під час розмови з Мохаммадом та іншими членами команди LXT я одразу ж визнав спільну пристрасність до мови. Команда, яку зібрав Мохаммад, була наповнена творчими мислителями з безмежною енергією, які були повністю віддані місії компанії.

Як я дізнавався більше про можливість приєднатися до LXT, я зрозумів, що це можливість, яку я не хочу пропустити. Це була компанія з величезним потенціалом для зростання та розширення у сфері, яку я пристрасно люблю. І оскільки ринок штучного інтелекту продовжує зростати експоненційно, можливість допомогти більшій кількості організацій перейти від експериментів до виробництва є цікавою можливістю, якої я дуже радий бути частиною.

Які зараз існують деякі з поточних проблем з придбанням даних у великих масштабах?

Проблеми такі ж різноманітні, як і застосування, які їх спричиняють.

З практичної точки зору проблеми включають автентичність, надійність, точність, безпеку та забезпечення того, що дані придатні для мети – і це без урахування зростаючої кількості юридичних та етичних проблем, пов’язаних з придбанням даних.

Наприклад, розробка технологій для підтримки автономних транспортних засобів вимагає збору величезних обсягів даних у різних сценаріях, щоб машина могла зрозуміти, як реагувати на реальні ситуації. Є безліч країв, з якими можна зіткнутися під час їзди, тому алгоритми, які керують цими транспортними засобами, потребують наборів даних, які покривають все, від вулиць до знаків зупинки до падаючих об’єктів. І якщо ви помножите це на кількість погодних умов, які можуть виникнути, кількість навчальних даних, необхідних для цього, зростає експоненційно. Автомобільним компаніям, які входять у сферу автономного руху, потрібно створити надійний канал даних, а зробити це самостійно вимагатиме величезних ресурсів.

Інший випадок використання – розширення існуючого продукту голосового штучного інтелекту на нові ринки для захоплення частки ринку та нових клієнтів. Це завжди вимагає мовних даних, і для досягнення точності критично важливо джерелом даних стати від носіїв мови різних демографічних профілів. Після збору даних мовні файли потрібно транскрибувати для навчання алгоритмів обробки природної мови продукту. Робити це для кількох мов та у необхідних для ефективності обсягах даних дуже складно для компаній самостійно, особливо якщо вони не мають внутрішнього досвіду у цій сфері.

Це лише два приклади багатьох проблем, які існують із збором даних для штучного інтелекту у великих масштабах, але, як ви можете уявити, домашня автоматизація, мобільні пристрої та біометричні збори даних мають свої особливі проблеми.

Які зараз існують способи, якими LXT джерелом та анотує дані?

У LXT ми збираємо та анотуємо дані по-різному для кожного клієнта, оскільки всі наші угоди підлаштовані під специфікації клієнтів. Ми працюємо з різними типами даних, включаючи аудіо, зображення, мовлення, текст та відео. Для збору даних ми співпрацюємо з глобальною мережею підрядників для збору даних у цих різних модальностях. Збори можуть варіюватися від отримання даних у реальних умовах, таких як будинки, офіси чи автомобілі, до роботи в студії з досвідченими інженерами у разі певних проектів збору мовних даних.

Наші можливості анотації даних також охоплюють кілька модальностей. Наш досвід почався у сфері мовлення, і за останні 12 років ми розширили свою діяльність до понад 115 країн та понад 750 мовних локалізацій. Це означає, що компанії будь-якого розміру можуть покладатися на LXT, щоб допомогти їм проникнути на широкий спектр ринків та захопити нові сегменти клієнтів. Нещодавно ми розширили свою діяльність на текстові, зображенні та відеодані, а наша внутрішня платформа використовується для доставки високоякісних даних клієнтам.

Іншою цікавою сферою зростання для нас стала робота з безпечною анотацією. Цього року ми розширили свою мережу безпечних об’єктів з двома до п’яти місць у світі. Ми розробили план, який дозволяє нам створювати нові об’єкти за кілька місяців. Сервіс, на який ми зараз зосереджуємося у цих безпечних об’єктах, зараз включає анотацію та транскрипцію мовних даних, але їх можна використовувати для анотації багатьох типів даних.

Чому джерелом даних таким чином є кращою альтернативою синтетичним даним?

Синтетичні дані – це цікавий розвиток у сфері штучного інтелекту та добре підходять для конкретних випадків використання, особливо для країв, які важко захопити у реальному світі. Використання синтетичних даних зростає, особливо на ранніх стадіях зрілості штучного інтелекту, коли компанії ще перебувають у стадії експериментів. Однак наші власні дослідження показують, що коли організації дозрівають свою стратегію штучного інтелекту та просувають більше моделей у виробництво, вони значно частіше використовують нагляді та напівнагляді методи машинного навчання, які покладаються на дані, анотовані людьми.

Люди просто краще розуміють нюанси для створення даних, необхідних для навчання моделей машинного навчання для виконання з високою точністю, і нагляд людини також критично важливий для зменшення упередженості.

Чому ці дані такі важливі для мовлення та обробки природної мови?

Для ефективної роботи алгоритмів мовлення та обробки природної мови їм потрібно бути навчені великими обсягами даних, джерелом яких є носії мови, які мають культурний контекст кінцевих користувачів, яких вони представляють. Без цих даних采用 голосового штучного інтелекту буде мати серйозні обмеження.

Крім того, при зборі мовних даних потрібно враховувати середовище. Якщо голосовий штучний інтелект буде використовуватися в автомобілі, наприклад, існують різні дорожні та погодні умови, які впливають на мовлення та потрібно враховувати. Це складні сценарії, у яких досвідчений партнер з даних може допомогти.

Чи є ще щось, що ви хотіли б поділитися про LXT?

По-перше, я хочу подякувати вам за можливість поділитися нашою історією! Я хотів би підкреслити, що наша компанія присвячена допомозі організаціям усіх розмірів у їхніх ініціативах штучного інтелекту. Ми зосередилися на доставці висококастомізованих даних штучного інтелекту компаніям усього світу протягом понад 12 років і були б раді зв’язатися з будь-ким, хто хоче створити надійний канал даних для підтримки своїх проектів штучного інтелекту.

Дякую за велике інтерв’ю, читачам, які бажають дізнатися більше, слід відвідати LXT

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.