Лідери думок
Підйом синтетичних даних та чому вони доповнюватимуть, а не замінять реальні дані

Ілон Маск недавно заявив, що ми вичерпали людські дані для навчання моделей штучного інтелекту. Його попередження є останнім коментарем щодо необхідності нових джерел даних для подальшого розвитку штучного інтелекту. У галузях, таких як охорона здоров’я та фінанси, суворі правила конфіденційності роблять нестачу даних ще більш гострою.
Хоча синтетичні дані – можливе рішення цієї нестачі – не нові, їхнє значення продовжує зростати, як свідчать недавні злиття та інвестиції в цій галузі. Однак існує деяка невизначеність щодо використання синтетичних даних, особливо ризик колапсу моделі, коли якість виходу багатофункціональної великомасштабної мови (LLM) погіршується без реальних даних для навчання. Чи вдасться вирішити цю проблему чи ні, може суттєво вплинути на майбутнє генерації штучного інтелекту (Gen AI).
Що таке синтетичні дані та як вони створюються?
Синтетичні дані створюються штучно, а не збираються з реальних подій. Синтетичні дані, створені штучним інтелектом, зараз є найбільш поширеним видом, який涉ляє навчання моделей на реальних даних для виявлення закономірностей і кореляцій, а потім генерація нових даних, які імітують ці статистичні властивості.
LLM використовуються для генерації різних типів синтетичних даних, включаючи структуровані дані, такі як таблиці, і неструктуровані дані, як вільні тексти, відео та зображення. Використовуються різні методи, залежно від типу даних, які створюються.
Наприклад, два поширених методи, які використовуються для генерації синтетичних зображень, – це GANs і дифузійні моделі. GANs використовують дві нейронні мережі: генератор створює штучні версії реальних даних, а дискримінатор визначає, які дані реальні, а які згенеровані. Працюючи разом безперервно, генератор намагається “обманути” дискримінатор, постійно покращуючи реалізм і різноманітність штучних даних. Дифузійні моделі використовують інший підхід, навчаючись спотворювати реальні дані, а потім повертаючи цей процес для “денойзингу” їх. Як тільки вони ефективно навчаються, вони можуть створювати високоякісні синтетичні аудіо- та відеодані.
Ріст значення синтетичних даних
Є тривалий інтерес до синтетичних даних. Однак за останні 5 років швидкий розвиток LLM не тільки збільшив попит на синтетичні дані, але й створив ще більш ефективний засіб їх генерації у великих масштабах. Як наслідок, використання синтетичних даних стрімко зросло.
Gartner прогнозує, що синтетичні дані складатимуть 60% усіх даних, використовуваних для навчання LLM, до 2024 року, у порівнянні з лише 1% у 2021 році. Є всі підстави вважати, що ця оцінка є загалом точною. Наприклад, модель Microsoft Phi-4, яка перевершує інші LLM,尽管 її розмір значно менший, успішно пройшла навчання на здебільшого синтетичних даних. Тим часом інженери Alexa від Amazon досліджують використання моделі “вчитель/учень”, де модель “вчитель” генерує синтетичні дані, які потім використовуються для донастройки меншої моделі “учень”.
Цей широкий прийом супроводжується великими кроками на ринку. Сектор синтетичних даних пережив бум інвестицій у 2021-2022 роках. Gretel AI і Tonic.ai отримали 50 мільйонів і 35 мільйонів доларів відповідно у рамках серії B. За ними пішли MOSTLY AI, який закрив серію B на 25 мільйонів доларів, і Synthesis AI, який отримав 17 мільйонів доларів у рамках серії A.
Недавно тренд пішов у бік великомасштабних придбань. Придбання NVIDIA компанії Gretel цієї весни підтримає роботу технологічного гіганта в цій галузі. Аналогічно, компанія з рішень штучного інтелекту SAS придбала стартап з синтетичних даних Hazy у листопаді 2024 року.
Аналітична фірма Cognilytica оцінила ринок генерації синтетичних даних у 2021 році у розмірі близько 110 мільйонів доларів. Компанія очікує, що він досягне 1,15 мільярда доларів до 2027 року. Інші прогнози передбачають темп зростання цього сектора на рівні 31% до досягнення вартості у 2,33 мільярда доларів до 2030 року.
Колапс моделі
Однак потенціал синтетичних даних супроводжується суттєвою негативною стороною: колапсом моделі. Це явище, при якому LLM, навчені виключно на синтетичних даних, починають виробляти менш точні або менш різноманітні виходи.
Хоча реальні дані мають високу складність, синтетичні дані часто спрощуються та конденсуються моделями. Наприклад, дослідники виявили, що точність моделі, навченої виявляти ракові бородавки на фотографіях, була обернено пропорційна кількості синтетичних навчальних даних. Недавнє дослідження академіків з Оксфорду, Кембриджу, Імперського коледжу та Університету Торонто показало, що використання модельно-генерованих даних бездумно призводить до “незворотних дефектів у отриманій моделі”.
Ще гірше, більшість LLM є “чорними скриньками”, що робить важким зрозуміти, як вони відгукнуться на синтетичні дані. Дослідники з Райсського університету та Стенфорду дійшли висновку, що без деяких свіжих реальних даних “майбутні генераційні моделі приречені на поступове зниження якості (точності) або різноманітності (пам’яті)”.
Триває потреба у реальних даних
Очевидно, що навіть з ростом попиту на синтетичні дані потреба у реальних даних залишається. Насправді попит на високоякісні реальні дані може навіть збільшитися. Причина цього двоїста. По-перше, реальні дані завжди будуть потрібні для навчання моделей штучного інтелекту, які потім генерують синтетичні дані. І по-друге, для уникнення колапсу моделі необхідно постійно синхронізувати синтетичні дані з реальними даними.
Реальні дані для навчання моделей штучного інтелекту, які створюють синтетичні дані
Як вже згадувалося, більшість синтетичних даних сьогодні створюється за допомогою генерації штучного інтелекту. І ці моделі генерації штучного інтелекту повинні бути навчені на реальних даних, щоб створювати придатні синтетичні дані. Це відбувається тому, що вони можуть створювати синтетичні дані лише шляхом реплікації закономірностей і статистичних властивостей реальної бази даних.
Розгляньте недавній приклад страхової компанії, яка змогла використовувати синтетичні дані для тестування різних постачальників без компрометації своїх чутливих даних клієнтів. Для генерації цієї синтетичної бази даних, яка точно імітувала реальність, їм довелося використовувати свої реальні дані для навчання моделі штучного інтелекту, яка потім генерувала синтетичні дані.
Реальні дані для мінімізації колапсу моделі
Існують різні стратегії для мінімізації ризику колапсу моделі. До них належать валідация та регулярний огляд синтетичних баз даних, а також перевірка якості синтетичних даних до їх використання у генераційних моделях. Однак найпоширеніший підхід полягає у різноманітті даних шляхом поєднання синтетичних даних з людськими даними. Опитування Gartner показало, що 63% респондентів віддають перевагу використанню частково синтетичних баз даних, тоді як лише 13% заявили про використання повністю синтетичних даних.
Додання навіть невеликих кількостей реальних даних може суттєво покращити продуктивність моделі. Дослідники з Університету Південної Каліфорнії виявили, що компанії можуть замінити до 90% своїх реальних даних синтетичними без суттєвого зниження продуктивності. Однак заміна останніх 10% людських даних призводить до суттєвого зниження.
Якість також має значення, як це видно на прикладі успіху Microsoft з Phi-4. Ця LLM була навчена здебільшого на синтетичних даних, згенерованих GPT-4o. Однак більша частина попередніх навчальних даних – загальної бази даних, використовуваної на першому етапі навчання перед донастройкою моделі – була ретельно відібрана, високоякісна реальна база даних, включаючи книги та наукові статті.
Потенційні переваги синтетичних даних
Коли синтетичні дані використовуються розумно та ефективно поєднуються з реальними даними, вони мають потенціал вирішити шість конкретних проблем при навчанні моделей штучного інтелекту: нестачу, доступність, однорідність, упередженість, проблеми конфіденційності та вартість.
Нестача даних
Під час того, як компанії штучного інтелекту конкурують за ринок і досягнення нових вершин, нестача даних для навчання їхніх LLM зростає. Синтетичні дані мають потенціал заповнити цю прогалину, принаймні згідно з дослідженням Gartner. Однак слід зазначити, що використання великих кількостей реальних даних у попередніх навчальних базах даних і для синхронізації для уникнення колапсу моделі все ще буде потрібно.
Доступність даних
Дедалі більше великих технологічних компаній діють як охоронці даних, створюючи бар’єр для входу менших гравців. Синтетичні дані мають потенціал демократизувати генерацію штучного інтелекту, роблячи великі об’єми навчальних даних доступними та доступними. Однак це не позбавить великих технологічних компаній відповідальності за поліпшення доступу до реальних даних, оскільки вони все ще потрібні для навчання моделей, які створюють синтетичні дані.
Однорідність даних
У деяких спеціальних випадках використання, таких як навчання штучного інтелекту для автономного водіння, реальні бази даних надто однорідні. У випадку з водінням розробники можуть генерувати синтетичні дані для заповнення прогалин у даних для незвичайних ситуацій. Це дозволяє моделям навчатися на рідкісних випадках на дорозі.
Упередженість
Деякі реальні бази даних містять вбудовані упередженості, тому синтетичні дані можуть бути згенеровані для забезпечення більш балансированої картини для моделей штучного інтелекту. Наприклад, у сфері фінансів британський фінансовий регулятор (FCA) стверджує, що синтетичні дані мають потенціал протидіяти потенційним упередженостям, викликаним тим, що певні групи недопредставлені у людських базах даних.
Конфіденційність
У галузях, таких як охорона здоров’я та фінанси, вимоги конфіденційності роблять нестачу даних ще більш гострою. З синтетичними даними компанії можуть створювати навчальні бази даних для своїх моделей, включаючи спеціальні дані, без компрометації конфіденційності клієнтів. Однак, як звіт, замовлений британським Королівським товариством, вказує з посиланням на синтетичні дані у медичних дослідженнях, існує припущення, що синтетичні дані “внутрішньо приватні”. Це “міф”. Як дослідники вказують, синтетичні дані можуть витікати інформацію про дані, з яких вони були отримані.
Конкретно, моделі, навчені на чутливих даних, вразливі до атак на інверсію моделі, де хакери можуть відновити частини оригінальної бази даних.
Вартість
Загалом синтетичні дані генеруються за нижчою вартістю, ніж реальні дані. Вони також надходять із мітками, що економить час і кошти. У деяких проектах навчання штучного інтелекту до 80% часу проекту витрачається на підготовку даних, включаючи міткування. Це пояснює, чому відповідні компанії з’явилися спеціально для джерел низьковартісної праці для задоволення потреб обробки даних гігантів Кремнієвої долини.
Доповнення реальних даних, а не їх заміна
Ці переваги синтетичних даних можуть бути реалізовані, якщо їх не вважати заміною реальних даних. Натомість їхня роль повинна полягати у доповненні реальних баз даних, забезпечуючи засоби для збільшення масштабу доступних даних.
Для контексту майбутня LLM Meta, LLAMA Behemoth, навчається на 30 триліонах даних. Очевидно, що пошук реальних даних у цьому масштабі є складним, якщо не неможливим. Однак, як вже зазначалося, використання реальних даних все ще є обов’язковим, як для навчання моделей, які створюють синтетичні дані, так і для синхронізації з синтетичними даними для забезпечення точності та уникнення колапсу моделі. На рівні, на якому LLM працюють зараз, навіть якщо синтетичні дані складатимуть суттєву частку використовуваних навчальних даних, все одно залишатиметься суттєвий попит на реальні дані. І це означатиме, що залишаються складні питання щодо охоронців даних, доступу, упередженості, вартості та часу.












