Лідери думок

Правда про синтетичні дані: чому людська експертиза критична для успіху LLM

mm
Додайте Unite.AI до бажаних джерел у Google

Розробники LLM все частіше використовують синтетичні дані, щоб прискорити розробку та зменшити витрати. Дослідники, що стоять за кількома топовими моделями, такими як LLama 3, Qwen 2 і DeepSeek R1, згадували про використання синтетичних даних для навчання своїх моделей у дослідницьких роботах. З зовні це виглядає як ідеальне рішення: безкінечний джерело інформації для прискорення розробки та зменшення витрат. Але це рішення має прихований витрат, який керівники бізнесу не можуть ігнорувати.

У простих словах, синтетичні дані генеруються моделями штучного інтелекту для створення штучних наборів даних для навчання, донастройки та оцінки LLM та агентів штучного інтелекту. У порівнянні з традиційною анотацією людьми, це дозволяє швидко масштабувати потік даних, що є важливим у швидкозмінному та конкурентному ландшафті розробки штучного інтелекту.

Крім того, підприємства можуть мати інші причини використовувати “фальшиві” дані, наприклад, захист конфіденційних даних у сфері фінансів або охорони здоров’я шляхом генерації анонімних версій. Синтетичні дані також є хорошою заміною, коли пропрієтарні дані недоступні, наприклад, перед запуском продукту або коли дані належать зовнішнім клієнтам.

Але чи революціонізують синтетичні дані розробку штучного інтелекту? Коротка відповідь – це限定не “так”: вони мають великий потенціал, але також можуть виставити LLM та агентів до критичних уразливостей без суворого контролю людиною. Виробники LLM та розробники агентів штучного інтелекту можуть виявити, що моделі, навчені на недостатньо перевірених синтетичних даних, можуть генерувати неточну або упереджену інформацію, створювати репутаційні кризи та призводити до невідповідності з галузевими та етичними стандартами. Інвестиції у контроль людиною для доопрацювання синтетичних даних є прямими інвестиціями у захист дна лінії, підтримку довіри учасників та забезпечення відповідальної реалізації штучного інтелекту.

З допомогою людського внеску синтетичні дані можуть бути перетворені на високоякісні навчальні дані. Є три критичні причини для доопрацювання згенерованих даних перед тим, як використовувати їх для навчання штучного інтелекту: заповнити прогалини у знаннях джерельної моделі, покращити якість даних та зменшити розмір вибірки, та вирівняти з людськими цінностями.

Нам потрібно захопити унікальні знання

Синтетичні дані в основному генеруються LLM, які навчені на публічно доступних інтернет-джерелах, створюючи вбудовану обмеження. Публічний контент рідко захоплює практичне, практичне знання, яке використовується у реальній роботі. Діяльності, такі як розробка маркетингової кампанії, підготовка фінансового прогнозу чи проведення ринку аналізу, зазвичай є приватними та не задокументованими в інтернеті. Крім того, джерела tendенсії відображають мову та культуру США, обмежуючи глобальне представництво.

Щоб подолати ці обмеження, ми можемо залучити експертів для створення даних у тих областях, де ми підозрюємо, що модель генерації синтетичних даних не може охопити. Повернувшись до корпоративного прикладу, якщо ми хочемо, щоб наш остаточний модель ефективно обробляв фінансові прогнози та аналіз ринку, навчальні дані повинні містити реалістичні завдання з цих областей. Важливо визначити ці прогалини та доповнити синтетичні дані зразками, створеними експертами.

Експерти часто залучені на ранній стадії проекту для визначення обсягу роботи. Це включає створення таксономії, яка описує конкретні області знань, де модель повинна виконувати. Наприклад, у сфері охорони здоров’я загальна медицина може бути розділена на підtemи, такі як харчування, серцево-судинне здоров’я, алергії та ін. Модель, орієнтована на охорону здоров’я, повинна бути навчена у всіх підобластях, які вона повинна охоплювати. Після визначення таксономії експертами з охорони здоров’я LLM можуть бути використані для генерації даних з типовими питаннями та відповідями швидко та у великих масштабах. Людські експерти все ще потрібні для перевірки, виправлення та покращення цього контенту, щоб забезпечити його точність, безпеку та контекстну відповідність. Цей процес забезпечення якості необхідний у високоризикових застосуваннях, таких як охорона здоров’я, для забезпечення точності даних та мінімізації потенційної шкоди.

Якість над кількістю: забезпечення ефективності моделі за допомогою менших, кращих вибірок

Коли експерти з конкретної галузі створюють дані для навчання LLM та агентів штучного інтелекту, вони створюють таксономії для наборів даних, пишуть промпти, створюють ідеальні відповіді чи симулюють конкретне завдання. Усі ці кроки ретельно розроблені для відповідності меті моделі, а якість забезпечується експертами у відповідних галузях.

Генерація синтетичних даних не повністю реплікує цей процес. Вона покладається на сильні сторони моделі, використовуваної для створення даних, а отримана якість часто не дорівнює людським кураторським даним. Це означає, що синтетичні дані часто вимагають значно більших об’ємів для досягнення задовільних результатів, що збільшує обчислювальні витрати та час розробки.

У складних областях існують нюанси, які можуть помітити лише людські експерти, особливо з аутліерами чи краєвими випадками. Людські кураторські дані надійно забезпечують кращу продуктивність моделі, навіть з значно меншими наборами даних. Стратегічно інтегруючи людську експертизу у процес створення даних, ми можемо зменшити кількість зразків, необхідних для ефективної роботи моделі.

Наш досвід показує, що найкращий спосіб подолати цю проблему – залучити експертів до будівництва синтетичних наборів даних. Коли експерти проектують правила генерації даних, визначають таксономію даних та перевіряють чи виправляють згенеровані дані, остаточна якість даних значно вища. Цей підхід дозволив нашим клієнтам досягти сильних результатів, використовуючи менше даних, що призвело до швидшого та більш ефективного шляху до виробництва.

Будування довіри: незамінна роль людей у безпеці штучного інтелекту та вирівнянні

Автоматизовані системи не можуть передбачити всі уразливості чи забезпечити вирівняння з людськими цінностями, особливо у краєвих випадках та двозначних сценаріях. Людські експерти відіграють критичну роль у визначенні нових ризиків та забезпечення етичних результатів до розгортання. Це є шаром захисту, який штучний інтелект, принаймні зараз, не може повністю забезпечити самостійно.

Отже, для побудови сильної бази даних для тестування не достатньо лише синтетичних даних. Важливо залучити експертів з безпеки на ранній стадії процесу. Вони можуть допомогти відобразити потенційні атаки та структуру набору даних. LLM можуть бути використані для генерації великої кількості прикладів. Після цього експерти потрібні для верифікації та доопрацювання даних, щоб забезпечити їх реалістичність, високу якість та корисність для тестування систем штучного інтелекту. Наприклад, LLM можуть згенерувати тисячі стандартних хакерських промптів, але людський експерт з безпеки може створити нові “соціальні інженерні” атаки, які використовують нюансировані психологічні упередження – творчу загрозу, яку автоматизовані системи важко винайти самостійно.

Було досягнуто значного прогресу у вирівнянні LLM за допомогою автоматичної зворотної зв’язку. У роботі RLAIF vs. RLHF: Масштабування навчання з людською зворотною зв’язку з допомогою зворотної зв’язку штучного інтелекту,” дослідники показують, що зворотна зв’язка штучного інтелекту може виконувати порівняно з людською зворотною зв’язку у багатьох випадках. Однак, хоча зворотна зв’язка штучного інтелекту покращується з покращенням моделей, наш досвід показує, що RLAIF все ще бореться у складних областях та з краєвими випадками чи аутліерами, областями, де продуктивність може бути критичною залежно від застосування. Людські експерти більш ефективні у xửленні нюансів завдань та контексту, що робить їх більш надійними для вирівняння.

Агенти штучного інтелекту також користуються автоматизованим тестуванням для подолання широкого спектра ризиків безпеки. Віртуальні середовища тестування використовують згенеровані дані для симуляції поведінки агентів, таких як взаємодія з онлайн-інструментами та виконання дій на веб-сайтах. Щоб максимізувати тестування у реалістичних сценаріях, людська експертиза є інтегральною для проектування тестових випадків, верифікації результатів автоматичних оцінок та звітування про уразливості.

Майбутнє синтетичних даних

Синтетичні дані є дуже цінним інструментом для розробки великих мовних моделей, особливо коли масштабування та швидке розгортання є критичними у сучасному швидкозмінному ландшафті. Хоча немає фундаментальних недоліків у самих синтетичних даних, їм потрібно доопрацювання, щоб досягти повного потенціалу та забезпечити найбільшу цінність. Гібридний підхід, який поєднує автоматичну генерацію даних з людською експертизою, є дуже ефективним методом для розробки здатних та надійних моделей, оскільки остаточна продуктивність моделі залежить більше від якості даних, ніж від загального обсягу. Цей інтегрований процес, який використовує штучний інтелект для масштабу та людських експертів для верифікації, створює більш здатні моделі з покращеним вирівнянням безпеки, що є важливим для побудови довіри користувачів та забезпечення відповідального розгортання.

Ілля Кочік є віце-президентом з розвитку бізнесу в Toloka, партнером з людських даних для провідних лабораторій досліджень GenAI, де він спеціалізується на передових завданнях для моделей передового рівня та агентних систем. Живе в Лондоні, його досвід включає керівні та технічні ролі в Google, QuantumBlack (AI by McKinsey) та Bain & Company.