Интервью

Кэролин Харви, операционный директор LXT – Интервью

mm
Добавьте Unite.AI в избранные источники в Google

Кэролин Харви имеет обширный опыт руководства и развития глобальных операций в области поисковой релевантности и аннотации данных для машинного обучения. Кэролин в настоящее время является операционным директором (COO) LXT, где она руководит глобальным операционным подразделением компании, обеспечивая последовательную доставку всех программ и проектов по данным ИИ. Она фокусируется на высококачественных данных в масштабе, создании эффективности в долгосрочных программах и масштабировании на большое количество глобальных локаций.

Как операционный директор LXT, Кэролин делится своим богатым опытом, чтобы создать лучшую организацию.

Можете ли вы кратко описать, что делает LXT, и вашу роль как операционного директора?

Искусственный интеллект полагается на данные, чтобы существовать, и LXT является лидером в области доставки точных, этически полученных данных, которые стимулируют инновации ИИ. Как операционный директор, моя роль заключается в том, чтобы контролировать, руководить и расширять наши глобальные операции через стратегии, структуру и процессы, которые позволяют нам доставлять данные ИИ высшего качества нашим клиентам. Я обеспечиваю, чтобы мы доставляли результаты вовремя по широкому спектру случаев использования, от генеративного ИИ до поисковой релевантности и самоходных автомобилей, среди многих других.

Как миссия LXT эволюционировала с момента ее основания в 2010 году? 

Наша миссия – стимулировать технологии будущего посредством генерации и улучшения данных во всех языках, культурах и модальностях. Наша цель – помочь компаниям всех размеров использовать невероятные преимущества, которые предоставляет ИИ, стимулируя их модели высококачественными данными. По мере эволюции миссии компании наш спектр услуг расширился от языковой транскрипции и сбора речи до включения широкого спектра решений, включая сбор и аннотацию данных для текста, изображений и видео, услуги генеративного ИИ и многое другое. Мы также расширили наш глобальный след ISO 27001-сертифицированных объектов, чтобы удовлетворить растущие потребности наших клиентов в безопасных услугах данных.

Какие были ключевыми факторами роста LXT в секторе обучающих данных ИИ?

Продолженные инвестиции в ИИ со стороны организаций всех размеров стимулировали наш рост. Компании теперь знают, что ИИ является необходимым условием для их конкурентоспособности, и данные стимулируют ИИ. Но не все данные равны, и компании, которые успешно используют ИИ, знают, что высококачественные данные имеют решающее значение для создания более точного ИИ.

Теперь, когда генеративный ИИ находится на слуху у всех, эта тенденция открыла еще больше возможностей для роста LXT. Люди являются важными для обеспечения того, чтобы эти решения были точными, этическими и ответственными. Мы предоставляем ряд услуг генеративного ИИ в таких областях, как тонкая настройка крупных языковых моделей, создание подсказок и многое другое. Наши клиенты знают, что для построения доверия с конечными пользователями выход генеративных продуктов ИИ должен быть фактическим, представлять разнообразную аудиторию и быть свободным от токсичного языка. Мы можем помочь им достичь этих целей с помощью наших услуг “человек в цикле”.

Как взрыв генеративного ИИ повлиял на LXT и ее клиентов?

LXT увидел растущий спрос на обучающие данные ИИ из-за генеративного ИИ, как для основной языково-ориентированной данных, так и для новых аспектов, связанных с анализом, творчеством и критическим мышлением. Мы также видим рост спроса на знания в области и специализированные профили для работников проектов.

Запросы клиентов все чаще выходят за рамки микро-задач машинного обучения прошлого в сторону более крупных языковых моделей и более сложных наборов данных, необходимых для приложений, таких как ChatGPT, Gemini и многих других. Мы в настоящее время участвуем в нескольких инновационных проектах, где мы пишем подсказки, направленные на запутывание генеративного ИИ, чтобы увидеть, как он реагирует, и затем создаем правильный ответ.

В будущем это может эволюционировать дальше в искусственный общий интеллект (ИОИ), где наборы данных будут соответствовать еще более сложным и изощренным действиям.

У вас есть годы опыта работы в поиске и персонализации, чтобы улучшить эти алгоритмы. Какие некоторые из способов, которыми ведущие компании улучшают свою поисковую релевантность, чтобы предоставить лучший пользовательский опыт?

В мире, где время драгоценно, а информация повсюду, улучшение поисковой релевантности может укрепить лояльность, увеличить коэффициент конверсии и сделать пользователей более продуктивными.

Поисковая релевантность начинается с очистки и организации данных наших клиентов, удаления всего, что может сгенерировать ложные положительные результаты, и создания дополнительных полей данных, через которые поисковые и рекомендательные двигатели могут искать, чтобы сгенерировать более точные результаты. С помощью машинного обучения и обработки естественного языка клиенты могут наделить свой поисковый двигатель более интуитивным пониманием намерений пользователя и изучением их предпочтений со временем. Результатом является более быстрый поисковый опыт, который приводит к более персонализированным результатам.

Достижение этой цели требует больших объемов обучающих данных, с особым акцентом на обучении алгоритмов, как распознавать, ранжировать и возвращать релевантные сущности, и как обрабатывать опечатки, грамматические ошибки и другие аномалии данных. Мы также рекомендуем подход “человек в цикле” (HITL), чтобы обеспечить точные данные, уменьшить предвзятость и предоставить лучший поисковый опыт для конечного пользователя. С учетом достижений в области машинного обучения за последние 10 лет HITL имеет усиленный фокус на процессах контроля качества, что стимулирует необходимость более глубокого опыта у поставщиков данных.

Можете ли вы подробнее рассказать об подходе LXT к аннотации данных и том, как она обеспечивает качество и точность обучающих данных ИИ?

Как команда операций, мы должны сначала понять, как клиенты используют данные, которые мы предоставляем, в разработке своих продуктов и услуг, чтобы обеспечить, что они будут соответствовать их потребностям. Чтобы сделать это, нам нужно найти экспертов как в управлении проектами, так и в аннотации, имеющих опыт работы с типом данных, необходимым для проекта.

Оттуда это в основном подготовка и поиск правильных ресурсов в начале каждого проекта. Это включает в себя согласование с клиентами на факторах успеха на этапе планирования, а также глубокую квалификацию и проверку аннотаторов проекта, учитывающих такие важные детали, как образовательный фон, специальные интересы, демографические данные и опыт. Мы также разрабатываем подробные учебные и справочные материалы в качестве руководства, адаптированные для каждого проекта. Мы применяем зрелые методы управления качеством и процессами на протяжении всего жизненного цикла проекта. Подход, который мы используем, соответствует и информирует лучшие практики отрасли, обеспечивая, что результаты соответствуют ожиданиям клиентов.

И все эти методологии служат нашей гарантии качества данных.

Как LXT справляется с задачей аннотации неструктурированных данных, которые составляют более 80% всех данных?

LXT построил внутреннюю платформу аннотации, которая автоматизирует многие части процесса аннотации и обеспечивает структуру и последовательный интерфейс для работников. На этапе предобработки мы фокусируемся на подготовке данных, форматировании входных файлов и удалении дубликатов, среди прочего, а на этапе постобработки – на упаковке данных, сборе и форматировании для доставки клиенту.

До начала проекта мы создаем руководства, которые рассматриваются с клиентом и итерируются на протяжении всего жизненного цикла проекта по мере изменений. Мы можем разбить процесс аннотации данных на несколько задач, чтобы сосредоточиться на каждом элементе проекта должным образом. Кроме того, методологии контроля качества реализуются для исключения ошибок в масштабе.

Наконец, наша команда операционного совершенства отвечает за продвинутый менеджмент процессов, чтобы обеспечить высокую эффективность и масштабируемость наших проектов во всем мире.

Какие некоторые из самых больших проблем, с которыми сталкивается LXT при сборе данных в масштабе глобально, и как вы их преодолеваете?

Разнообразие и предвзятость в участниках и в результирующих коллекциях данных часто являются одними из самых больших проблем, с которыми сталкиваются LXT и любой поставщик обучающих данных ИИ. Другими проблемами являются недавний спрос на знания в области и быстро меняющийся ландшафт с переходом к более крупным языковым моделям и генеративным данным ИИ.

Мы преодолеваем эти проблемы посредством высоко активного подхода к поиску нашего пула кандидатов, где мы рассматриваем опыт, предыдущие роли, интересы и демографические данные, чтобы сформировать правильное разнообразие среди команд по гендеру или другим аспектам, таким как аналитическое мышление или творческое письмо, образовательный фон и многое другое.

Как только мы нашли правильных кандидатов, мы уделяем большое внимание вовлечению работников на регулярной основе, чтобы построить более опытную, лояльную и удовлетворенную рабочую силу в долгосрочной перспективе.

В плане оценки ИИ, как LXT работает над смягчением предвзятости и обеспечением этических выходов в системах ИИ, которые она помогает обучать?

Как упоминалось ранее, обеспечение разнообразия является проблемой, которую многие поставщики обучающих данных ИИ должны решить, и это пойдет далеко в смягчении предвзятости и обеспечении этических выходов.

Я снова обращаюсь к нашим лучшим практикам вовлечения, которые включают поиск разнообразных и представительных аннотаторов и тщательное отношение к руководствам и мерам контроля качества. У нас есть стратегия воздействия, которая позволяет нам привнести работу в новые и разнообразные группы аннотаторов, такие как в регионах с длинным хвостом языка.

Мы нацеливаемся на этические выходы посредством использования лучших практик отрасли, согласования ожиданий с нашими клиентами и стимулирования более высоких стандартов для наших менеджеров проектов и аннотаторов. Связь имеет решающее значение, а также аудиты соответствия, анализ предвзятости и приверженность требованиям регулирования данных и конфиденциальности.

Каково долгосрочное видение LXT, и как вы видите эволюцию компании в течение следующих пяти лет?

 Наше видение – предоставить точные, этически полученные данные, чтобы стимулировать внедрение ИИ и технологий будущего, которые улучшат опыт людей во всем мире.

Хотя автоматизация и технологии важны в ИИ, есть также важный человеческий компонент, который дополняет технологию. По мере того, как мы переходим от простых автоматизированных задач к более крупным языковым моделям и от генеративного ИИ к общему искусственному интеллекту, будет важно, чтобы продукты ИИ верно представляли людей, как тех, кто генерирует данные, так и наши глобальные сообщества в целом.

В LXT мы стремимся обеспечить, чтобы ИИ использовался положительным и трансформирующим образом, отражающим эти ценности.

Спасибо за отличное интервью, читателям, которые хотят узнать больше, следует посетить LXT.

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.