Інтерв’ю

Каролін Гарві, головний операційний директор LXT – Серія інтерв’ю

mm
Додайте Unite.AI до бажаних джерел у Google

Каролін Гарві має великий досвід керівництва та зростання глобальних операцій у сфері пошукової релевантності рейтингу та анотації для даних ML. Каролін зараз є головним операційним директором (COO) LXT, де вона керує глобальним оперативним підрозділом компанії, забезпечуючи постійну доставку всіх програм і проектів даних AI. Вона зосереджена на високоякісних даних у масштабі, створюючи ефективність у довгострокових програмах і масштабуванні на велику кількість глобальних локалей.

Як COO LXT, Каролін надає свій великий досвід для створення організації найвищого рівня.

Ви можете коротко описати, чим займається LXT, і вашу роль як COO?

Штучний інтелект залежить від даних для існування, і LXT є новим лідером у сфері доставки точних, етично джерелених даних, які підтримують інновації AI. Як головний операційний директор, моя роль полягає у нагляді, керівництві та розширенні наших глобальних операцій через стратегії, структуру та процеси, які дозволяють нам доставляти найвищої якості дані AI нашим клієнтам. Я забезпечую, щоб ми доставляли дані вчасно у широкому спектрі випадків використання, від генерації AI до пошукової релевантності та самохідних автомобілів, серед інших.

Як змінилася місія LXT з моменту її заснування у 2010 році? 

Наша місія полягає у підтримці технологій майбутнього через генерацію даних і покращення даних у кожній мові, культурі та модальності. Наша мета полягає у допомозі компаніям усіх розмірів скористатися неймовірними перевагами, які надає AI, забезпечуючи їхні моделі високоякісними даними. З моменту заснування компанії наша сфера послуг розширилася від мовної транскрипції та збору мовлення до включення широкого спектра рішень, включаючи збір даних та анотацію для тексту, зображень та відео, послуги генерації AI та інше. Ми також розширили наш глобальний слід із сертифікованих об’єктів ISO 27001, щоб задовольнити зростаючі потреби наших клієнтів у безпечних даних.

Які були основними драйверами зростання компанії у сфері навчальних даних AI?

Постійні інвестиції в AI з боку організацій усіх розмірів сприяли нашому зростанню. Компанії тепер знають, що AI є необхідним для того, щоб залишитися конкурентоспроможними, і дані підтримують AI. Але не всі дані рівні, і компанії, які успішно використовують AI, знають, що високоякісні дані є критичними для створення більш точного AI.

Тепер, коли генерація AI є у центрі уваги всіх, цей тренд відкрив ще більше можливостей для зростання LXT. Люди є критичними для забезпечення того, щоб ці рішення були точними, етичними та відповідальними. Ми пропонуємо ряд послуг генерації AI у сфері настройки великих мовних моделей, створення запитів та інше. Наші клієнти знають, що для того, щоб побудувати довіру з кінцевими користувачами, висновок їхніх продуктів генерації AI повинен бути фактичним, представляти різноманітну аудиторію та бути вільним від токсичного мовлення. Ми можемо допомогти їм досягти цих цілей за допомогою наших послуг “людина у циклі”.

Як вибух генерації AI вплинув на LXT та її клієнтів?

LXT побачила зростаючий попит на навчальні дані AI через генерацію AI, як для основних мовних даних, так і для нових аспектів, пов’язаних з аналізом, творчістю та критичним мисленням. Ми також бачимо зростаючий попит на знання домену та спеціалізовані профільні дані для працівників проекту.

Запити клієнтів все частіше виходять за рамки мікрозадач машинного навчання минулого до LLM та більш складних наборів даних, необхідних для застосунків, таких як ChatGPT, Gemini та багатьох інших. Ми зараз беремо участь у кількох інноваційних проектах, де ми пишемо запити, спрямовані на плутання генерації AI, щоб побачити, як вона реагує, а потім створюємо правильну відповідь.

У майбутньому це може розвинутися далі у штучний загальний інтелект (AGI), де набори даних будуть відображати ще більш складні та складні дії.

Ви маєте роки досвіду роботи у сфері пошуку та персоналізації, щоб допомогти поліпшити ці алгоритми. Які деякі зі способів, якими провідні компанії покращують пошукову релевантність, щоб забезпечити кращий досвід користувача?

У світі, де час є дорогоцінним, а інформація є всюди, покращення пошукової релевантності може зміцнити лояльність, збільшити рівень конверсії та зробити користувачів більш продуктивними.

Пошукова релевантність починається з очищення та організації даних наших клієнтів, вилучення всього, що може генерувати хибні позитиви, та створення додаткових даних, через які пошукові та рекомендаційні двигуни можуть шукати, щоб генерувати більш точні результати. За допомогою машинного навчання та обробки природної мови клієнти можуть наділити свій пошуковий двигун більш інтуїтивним розумінням намірів користувача та вивчити про їхні вподобання з часом. Результатом є швидший пошуковий досвід, який веде до більш персоналізованих результатів.

Досягнення цієї мети вимагає великих обсягів навчальних даних, з особливим акцентом на навчанні алгоритмів, як розпізнавати, ранжувати та повертати релевантні сутності, та як обробляти друкарські помилки, граматичні помилки та інші аномалії даних. Ми також рекомендуємо підхід “людина у циклі” (HITL), щоб забезпечити точні дані, зменшити упередженість та забезпечити кращий пошуковий досвід для кінцевого користувача. З прогресом у сфері машинного навчання за останні 10 років, HITL має інтенсифікований акцент на процесах якості огляду, які спонукають до більш глибокого досвіду від постачальників даних.

Ви можете роз’яснити підхід LXT до анотації даних та те, як вона забезпечує якість та точність навчальних даних AI?

Як операційна команда, ми повинні спочатку зрозуміти, як клієнти використовують дані, які ми надаємо, для розробки своїх продуктів та послуг, щоб забезпечити, що вони відповідають їхнім потребам. Для цього нам потрібно знайти експертів у сфері проектного менеджменту та анотації, які мають досвід роботи з необхідними даними.

Відтоді це в основному питання підготовки та пошуку правильних ресурсів на початку кожного проекту. Це включає в себе узгодження з клієнтами щодо факторів успіху під час фази планування, а також глибоку кваліфікацію та перевірку процесів для анотаторів проекту, які розглядають важливі деталі, такі як освітній рівень, спеціальні інтереси, демографія та досвід. Ми також розробляємо детальні навчальні та довідкові матеріали як керівництво, адаптоване для кожного проекту. Ми застосовуємо зрілі методи управління якістю та процесами протягом усього життєвого циклу проекту. Підхід, який ми використовуємо, узгоджується з індустріальними найкращими практиками та інформує їх, забезпечуючи, що результати відповідають очікуванням клієнтів.

І всі ці методи знаходяться на службі нашої гарантованої обіцянки якості даних.

Як LXT впорується з викликом анотації неструктурованих даних, які складають понад 80% усіх даних?

LXT створила внутрішню платформу анотації, яка автоматизує багато частин процесу анотації та забезпечує структуру та послідовний інтерфейс для працівників. На стадії попередньої обробки ми зосереджуємося на підготовці даних, форматуванні вхідних файлів та видаленні дублікатів, серед іншого, а на стадії після обробки – на пакуванні даних, зборі та форматуванні для доставки клієнту.

Перед початком проекту ми створюємо керівництва, які переглядаються з клієнтом та ітеративно вдосконалюються протягом усього життєвого циклу проекту. Ми можемо розбити процес маркування даних на кілька завдань, щоб правильно звернутися до кожного елемента проекту. Крім того, методи контролю якості реалізуються для видалення помилок у масштабі.

Нарешті, наша команда операційного досконалості відповідає за просунуте управління процесами, щоб забезпечити високу ефективність та масштабованість наших проектів у всьому світі.

Які деякі з найбільших викликів, з якими стикається LXT при зборі даних у масштабі глобально, і як ви їх подолаєте?

Різноманітність та упередженість у учасниках та у результуючих наборах даних часто є деякими з найбільших викликів, з якими стикається LXT, як і будь-який інший постачальник навчальних даних AI. Інші виклики включають недавній попит на знання домену та швидко змінюється ландшафт з переходом до LLM та генерації AI даних.

Ми подолаємо ці виклики завдяки високопротиативному підходу до джерел нашого пулу кандидатів, де ми переглядаємо досвід, попередні ролі, інтереси та демографію, щоб сформувати правильну різноманітність серед команд за такими аспектами, як аналітичне мислення чи творче письмо, освітній рівень та інше.

Як тільки ми знайдемо правильних кандидатів, ми докладаємо великих зусиль, щоб залучити працівників на регулярній основі, щоб побудувати більш досвідчений, лояльний та задоволений персонал у довгостроковій перспективі.

У сфері оцінки AI, як LXT працює над пом’якшенням упередженості та забезпечення етичних виходів у системах AI, які вона допомагає тренувати?

Як згадувалося раніше, забезпечення різноманітності є викликом, який багато постачальників навчальних даних AI повинні вирішити, і це буде великим кроком у напрямку пом’якшення упередженості та забезпечення етичних виходів.

Я знову звернусь до наших найкращих практик взаємодії, які включають пошуки різноманітних та представницьких анотаторів та ретельність щодо керівництв та заходів контролю якості. У нас є стратегія впливу джерел, яка дозволяє нам привезти роботу до нових та різноманітних груп анотаторів, таких як регіони з довгими хвостами мови.

Ми націлюємося на етичні виходи через використання індустріальних найкращих практик, узгодження очікувань з нашими клієнтами та забезпечення вищого рівня вимог для наших менеджерів проекту та анотаторів. Комунікація є суттєвою, а також аудити з метою дотримання вимог, аналіз упередженості та зобов’язання щодо вимог регулювання даних та конфіденційності.

Яка довгострокова візія для LXT, і як ви бачите розвиток компанії у наступні п’ять років?

 Наша візія полягає у забезпеченні точних, етично джерелених даних, щоб підтримати розгортання AI та технологій майбутнього, які покращать досвід людей у всьому світі.

Хоча автоматизація та технології є важливими у сфері AI, існує також важливий людський компонент, який доповнює технологію. Коли ми переходимо від простих автоматизованих завдань до великих мовних моделей (LLM) та від генерації AI до загального штучного інтелекту (GAI), буде критично важливо, щоб продукти AI вірно представляли людей, як тих, хто генерує дані, так і наших глобальних спільнот у цілому.

У LXT ми прагнемо забезпечити, щоб AI використовувався позитивним та трансформаційним способом, який відображає ці цінності.

Дякуємо за велике інтерв’ю, читачам, які бажають дізнатися більше, слід відвідати LXT.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.