Интервью
Мохаммад Омар, сооснователь и генеральный директор LXT – Интервью

Мохаммад Омар является сооснователем и генеральным директором LXT, компанией, которая является лидером в области обучающих данных для искусственного интеллекта для глобальных организаций, включая крупнейшие технологические компании мира. В партнерстве с международной сетью контрибьюторов LXT собирает и аннотирует данные в различных форматах с той скоростью, масштабом и гибкостью, которые требуются предприятиями. Основанная в 2010 году, LXT имеет штаб-квартиру в Торонто, Канада, и присутствует в США, Австралии, Индии, Турции, Великобритании и Египте.
Не могли бы вы рассказать историю создания LXT?
LXT была основана в ответ на острую потребность в данных, с которой столкнулась моя компания 12 лет назад. В то время компания нуждалась в арабских данных, но не имела подходящих поставщиков. Будучи рисковым предпринимателем, я решил уволиться с работы, создать новую компанию и предложить свои услуги бывшему работодателю. Сразу же мы получили некоторые из самых сложных проектов, которые успешно реализовали, и все начало развиваться оттуда. Теперь, спустя более 12 лет, мы построили прочные отношения с этой компанией, став основным поставщиком высококачественных языковых данных.
Какие из самых больших проблем стоят перед внедрением искусственного интеллекта в крупном масштабе?
Это отличный вопрос, и мы фактически включили его в наш последний исследовательский отчет, Путь к зрелости ИИ. Главной проблемой, которую назвали респонденты, было интеграция существующих или устаревших систем в решения ИИ. Это имеет смысл, учитывая тот факт, что мы провели опрос среди более крупных компаний, которые, скорее всего, имеют ряд технологических систем по всей организации, которые необходимо рационализировать в стратегию цифровой трансформации. Другие проблемы, которые респонденты поставили на высокие места, – это отсутствие квалифицированных специалистов, отсутствие обучения или ресурсов и поиск качественных данных. Меня не удивили эти ответы, поскольку они часто упоминаются, и, конечно, потому что проблема с данными является причиной существования нашей организации.

Когда речь идет о проблемах с данными, LXT может как собирать данные, так и аннотировать их, чтобы алгоритмы машинного обучения могли их понять. Мы способны делать это в крупном масштабе и с гибкостью, то есть мы быстро доставляем высококачественные данные. Клиенты часто обращаются к нам, когда готовятся к запуску и хотят убедиться, что их продукт хорошо принят клиентами,
Сотрудничая с нами для сбора и аннотирования данных, компании могут решить проблемы с ресурсами и талантами, позволяя их командам сосредоточиться на создании инновационных решений.
LXT предлагает поддержку более 750 языков, но существуют проблемы с переводом и локализацией, которые выходят за рамки структуры языка. Не могли бы вы рассказать, как LXT решает эти проблемы?
Конечно, существуют проблемы с переводом и локализацией – особенно когда вы выходите за рамки наиболее распространенных языков, которые, как правило, имеют официальный статус и уровень стандартизации, связанный с этим. Многие языков, с которыми мы работаем, не имеют официальной орфографии, поэтому управление последовательностью в команде становится проблемой. Мы решаем эти и другие проблемы – например, обнаружение мошеннического поведения – за счет строгих процессов обеспечения качества. Опять же, это было очень очевидно в отчете о зрелости ИИ, что для большинства организаций, работающих с данными ИИ, качество стоит на первом месте в списке приоритетов. И большинство организаций, опрошенных, выразили готовность платить больше, чтобы получить это.
Для компаний, которым требуются сбор и аннотирование данных, насколько рано в процессе разработки приложения они должны начать собирать эти данные?
Мы рекомендуем организациям создать стратегию данных как можно скорее после определения случая использования ИИ. Если подождать, пока приложение будет разрабатываться, это может привести к ненужной переработке, поскольку ИИ может научиться неправильным вещам и потребовать повторной тренировки с помощью качественных данных, что может занять время на сбор и интеграцию в процесс разработки.
Какой порядок действий для определения частоты обновления данных?
Это действительно зависит от типа приложения, которое вы разрабатываете, и того, как часто меняются данные, которые его поддерживают, в значительной степени. Это означает, что данные являются представлением реальной жизни, и со временем данные должны быть обновлены, чтобы точно отражать, что происходит в мире. Мы называем это явление смещением модели, из которых есть два типа, каждый из которых требует повторной тренировки алгоритмов.
- Смещение концепции происходит, когда существует значительная разница между обучающими данными и выходными данными ИИ, что может произойти внезапно или более постепенно. Например, ритейлер может использовать исторические данные о клиентах для тренировки приложения ИИ. Но когда происходит значительный сдвиг в реальности потребителей, алгоритм потребует повторной тренировки, чтобы отразить это.
- Смещение данных происходит, когда данные, использованные для тренировки приложения, больше не отражают фактические данные, с которыми оно столкнется при запуске. Это может быть вызвано рядом факторов, включая демографические сдвиги, сезонность или ситуацию приложения в новом географическом регионе.
LXT недавно представила отчет под названием “Путь к зрелости ИИ 2023“. Какие были некоторые выводы из этого отчета, которые вас удивили?
Вероятно, это не должно было удивить, но то, что действительно выделилось, – это разнообразие применений. Вы могли ожидать, что два или три домена деятельности будут доминировать, но когда мы спросили, где респонденты планируют сосредоточить свои усилия по ИИ и где они планируют развернуть свои решения ИИ, изначально это выглядело как хаос – отсутствие любой тенденции. Но после анализа данных и изучения качественных ответов стало ясно, что отсутствие тенденции есть тенденция. По крайней мере, через глаза наших респондентов, если у вас есть проблема, то есть реальная возможность, что кто-то работает над решением ИИ для нее.
Генеративный ИИ захватывает мир, какой ваш взгляд на то, как далеко языковые генеративные модели могут привести отрасль?
Мой личный взгляд на это заключается в том, что центральным моментом真正щей силы Генеративного Искусственного Интеллекта – я выбираю использовать эти слова вместо аббревиатуры для подчеркивания – является Понимание Естественного Языка. “Интеллект” ИИ обучается через язык; способность решать сложные проблемы обусловлена итеративными и кумулятивными взаимодействиями естественного языка. Учитывая это, я считаю, что языковые генеративные модели будут идти в ногу с другими элементами ИИ все время.
Каково ваше видение будущего ИИ и будущего LXT?
Я оптимист по природе, и это будет влиять на мой ответ, но мое видение будущего ИИ заключается в том, чтобы увидеть, как он улучшает качество жизни для всех; чтобы он сделал наш мир более безопасным, лучше для будущих поколений. На микроуровне мое видение LXT заключается в том, чтобы увидеть, как организация продолжает строить на своих сильных сторонах, расти и стать работодателем по выбору, и силой добра для глобального сообщества, которое делает наш бизнес возможным. На макроуровне мое видение LXT заключается в том, чтобы внести значительный, осмысленный вклад в реализацию моего оптимистически окрашенного видения будущего ИИ.
Спасибо за отличное интервью, читателям, которые хотят узнать больше, следует посетить LXT.












