Лидеры мнений
Возрождение синтетических данных и почему они дополнят, а не заменят реальные данные

Илон Маск недавно заявил, что мы исчерпали человеческие данные, доступные для обучения моделей ИИ. Его предупреждение является последним комментарием к необходимости новых источников данных, если ИИ продолжит свой быстрый прогресс. В отраслях, таких как здравоохранение и финансы, строгие правила конфиденциальности делают нехватку данных еще более острой.
Хотя синтетические данные – возможное решение этой нехватки – не являются новыми, их важность продолжает расти, как свидетельствуют недавние слияния и инвестиции в этой области. Однако существуют определенные неопределенности вокруг использования синтетических данных, особенно риск коллапса модели, когда качество вывода многомодальной модели большого языка (LLM) ухудшается без реальных данных для обучения. Будет ли эта проблема непреодолимой или решаемой, может иметь существенное влияние на будущее генеративного ИИ (Gen AI).
Что такое синтетические данные и как они создаются?
Синтетические данные создаются искусственно, а не собираются из реальных событий. Сегодня наиболее распространенным видом синтетических данных являются данные, генерируемые с помощью ИИ, которые включают обучение моделей на реальных данных для обнаружения закономерностей и корреляций, а затем генерирование новых данных, имитирующих эти статистические свойства.
Модели LLM используются для генерации различных типов синтетических данных, включая структурированные данные, такие как табличные данные, и неструктурированные данные, такие как свободные тексты, видео и изображения. Для генерации синтетических данных используются различные методы, в зависимости от типа генерируемых данных.
Например, два наиболее распространенных метода, используемых для генерации синтетических изображений, – это GAN и диффузионные модели. GAN используют две нейронные сети: генератор создает искусственные версии реальных данных, а дискриминатор определяет, какие данные реальные, а какие сгенерированные. Работая вместе непрерывно, генератор пытается “обмануть” дискриминатор,不断 улучшая реализм и разнообразие искусственных данных. Диффузионные модели используют другой подход, обучаясь искажать реальные данные, а затем обратить этот процесс, чтобы “очистить” их. Как только они обучены эффективно, они могут производить высококачественные синтетические аудио- и видеоданные.
Растущая важность синтетических данных
Интерес к синтетическим данным существует уже давно. Однако за последние 5 лет быстрое развитие моделей LLM не только увеличило спрос на синтетические данные, но и создало более эффективный способ их генерации в крупном масштабе. В результате использование синтетических данных резко возросло.
По прогнозу Gartner, синтетические данные составят 60% всех данных, используемых для обучения моделей LLM, к 2024 году, по сравнению с 1% в 2021 году. Есть все основания полагать, что этот прогноз является в целом точным. Например, модель Phi-4 от Microsoft, которая превосходит другие модели LLM, несмотря на то, что она намного меньше, была успешно обучена на основном синтетических данных. Тем временем инженеры Alexa от Amazon изучают возможность использования модели “учитель-ученик”, где модель “учитель” генерирует синтетические данные, которые затем используются для дообучения меньшей модели “ученика”.
Это широкое внедрение отражается в крупных движениях на рынке. Сектор синтетических данных пережил инвестиционный бум в 2021-2022 годах. Gretel AI и Tonic.ai привлекли 50 миллионов и 35 миллионов долларов соответственно в раундах серии B. За ними последовал MOSTLY AI, который закрыл раунд серии B на 25 миллионов долларов, и Synthesis AI, который привлек 17 миллионов долларов в раунде серии A.
Более недавно тенденция сместилась в сторону крупномасштабных приобретений. Приобретение Gretel компанией NVIDIA этой весной поддержит работу технологического гиганта в этой области. Аналогично, компания SAS, предоставляющая решения для ИИ, приобрела стартап Hazy, занимающийся синтетическими данными, в ноябре 2024 года.
Аналитическая фирма Cognilytica оценила рынок генерации синтетических данных в 2021 году в 110 миллионов долларов. Компания ожидает, что он достигнет 1,15 миллиарда долларов к 2027 году. Другие прогнозы предполагают темп роста 31% для сектора, который вырастет до 2,33 миллиарда долларов к 2030 году.
Коллапс модели
Однако синтетические данные имеют существенный недостаток – коллапс модели. Это явление, при котором модели LLM, обученные исключительно на синтетических данных, начинают производить менее точные или менее разнообразные выводы.
В то время как реальные данные обычно имеют высокую сложность, синтетические данные часто упрощаются и конденсируются моделями. Например, исследователи обнаружили, что точность модели, обученной для обнаружения раковых родинок на фотографиях, обратно пропорциональна количеству синтетических данных, использованных для обучения. Недавнее исследование академиков из Оксфорда, Кембриджа, Имперского колледжа и Университета Торонто показало, что использование сгенерированных моделями данных бездискриминационно приводит к “необратимым дефектам в результирующей модели”.
Хуже того, большинство моделей LLM являются “черными ящиками”, что делает трудным понимание, как они будут реагировать на синтетические данные. Исследователи из Университета Райса и Стэнфорда заключили, что без некоторых свежих реальных данных “будущие генеративные модели обречены иметь прогрессивно снижающееся качество или разнообразие”.
Необходимость реальных данных
Очевидно, что даже с ростом спроса на синтетические данные необходимость реальных данных остается. Фактически, спрос на высококачественные реальные данные может даже увеличиться. Причина этого двойная. Во-первых, реальные данные всегда будут нужны для обучения моделей ИИ, которые затем генерируют синтетические данные. И, во-вторых, для избежания коллапса модели необходимо постоянно синхронизировать синтетические данные с реальными данными.
Реальные данные для обучения моделей, производящих синтетические данные
Как упоминалось ранее, большинство синтетических данных сегодня создаются с помощью генеративного ИИ. И эти модели генеративного ИИ должны быть обучены на реальных данных, чтобы создать пригодные для использования синтетические данные. Это связано с тем, что они могут создавать синтетические данные, только повторяя закономерности и статистические свойства реального набора данных.
Рассмотрим недавний пример страховой компании, которая смогла использовать синтетические данные для тестирования различных поставщиков без компрометации своих чувствительных данных клиентов. Для генерации этого набора синтетических данных, который точно имитировал реальность, им пришлось использовать свои собственные реальные данные для обучения модели ИИ, которая затем генерировала синтетические данные.
Реальные данные для смягчения коллапса модели
Существуют несколько стратегий для смягчения риска коллапса модели. Они включают проверку и регулярный обзор синтетических наборов данных, а также проверку качества синтетических данных перед их использованием в генеративных моделях. Однако самый распространенный подход заключается в диверсификации данных путем комбинации синтетических данных с человеческими данными. Опрос Gartner показал, что 63% респондентов предпочитают использовать частично синтетический набор данных, при этом только 13% заявили, что используют полностью синтетические данные.
Даже добавление скромных количеств реальных данных может существенно улучшить производительность модели. Исследователи из Университета Южной Калифорнии обнаружили, что компании могут заменить до 90% своих реальных данных синтетическими данными без значительного снижения производительности. Однако замена последних 10% человеческих данных приводит к значительному снижению.
Качество также имеет значение, как показано в случае успеха Microsoft с Phi-4. Эта модель LLM была обучена в основном на синтетических данных, сгенерированных GPT-4o. Однако большая часть предварительных данных – общего набора данных, используемого на первой стадии обучения перед дообучением модели, – была тщательно отобрана, высококачественными реальными данными, включая книги и исследовательские статьи.
Потенциальные выгоды от синтетических данных
Когда синтетические данные используются разумно и комбинируются эффективно с реальными данными, они имеют потенциал решить шесть конкретных проблем, связанных с данными для обучения ИИ: нехватку, доступность, однородность, предвзятость, проблемы конфиденциальности и стоимость.
Нехватка данных
Когда компании ИИ борются за долю рынка и достижение новых высот, неутолимый спрос на данные для обучения их моделей LLM увеличивается. Синтетические данные имеют потенциал заполнить этот пробел, по крайней мере, согласно исследованиям Gartner. Однако следует отметить, что использование значительных количеств реальных данных в предварительных наборах данных и для синхронизации для избежания коллапса модели все еще будет необходимо.
Доступность данных
Крупные технологические компании все чаще выступают в качестве хранителей данных, создавая барьер для входа на рынок для более мелких игроков. Синтетические данные имеют потенциал демократизировать генеративный ИИ, делая большие объемы обучающих данных доступными и доступными. Однако это не снимет с крупных технологических компаний ответственность за улучшение доступа к реальным данным, поскольку они все еще необходимы для обучения моделей, создающих синтетические данные.
Однородность данных
В некоторых нишевых случаях, таких как обучение ИИ для автономного вождения, реальные наборы данных слишком однородны. В случае вождения разработчики могут генерировать синтетические данные для заполнения пробелов в данных для необычных ситуаций. Это позволяет моделям обучаться на редких событиях на дороге.
Предвзятость
Некоторые реальные наборы данных содержат врожденные предвзятости, поэтому синтетические данные могут быть сгенерированы для обеспечения более сбалансированной картины для моделей ИИ. Например, в финансах Управление по финансовому регулированию Великобритании (FCA) утверждало, что синтетические данные имеют потенциал противодействовать потенциальным предвзятостям, вызванным тем, что определенные группы недопредставлены в человеческих наборах данных.
Конфиденциальность
В секторах, таких как здравоохранение и финансы, требования конфиденциальности делают нехватку данных еще более острой. С помощью синтетических данных компании могут создавать наборы данных для обучения своих моделей, содержащие нишевые данные, не компрометируя конфиденциальность клиентов. Однако, как отчет, заказанный Королевским обществом Великобритании, указал, что существует предположение, что синтетические данные “внутренне приватны”. Это “заблуждение”. Как исследователи отмечают, синтетические данные могут просачивать информацию о данных, из которых они были получены.
Конкретно, модели, обученные на чувствительных данных, уязвимы для атак на обращение модели, где хакеры могут восстановить части исходного набора данных.
Стоимость
В целом синтетические данные генерируются по более низкой стоимости, чем реальные данные. Они также поставляются с метками, что экономит время и снижает затраты. На некоторых проектах по обучению ИИ до 80% проекта занимает подготовка данных, включая маркировку. Это объясняет, почему специализированные компании появились для обеспечения доступного труда для удовлетворения потребностей в обработке данных гигантов Кремниевой долины.
Дополнение реальных данных, а не их замена
Эти выгоды от синтетических данных могут быть реализованы, если они не рассматриваются как замена реальным данным. Вместо этого их роль должна заключаться в дополнении реальных наборов данных, предоставляя способы увеличения масштаба доступных точек данных.
Для контекста предстоящая модель LLM от Meta, LLAMA Behemoth, обучается на 30 триллионах точек данных. Очевидно, что найти реальные данные в этом масштабе является сложной задачей, если не невозможной. Однако, как было отмечено, использование реальных данных все еще необходимо, будь то для обучения моделей, создающих синтетические данные, или для синхронизации с синтетическими данными для обеспечения точности и избежания коллапса модели. На уровне, на котором сейчас работают модели LLM, даже если синтетические данные составляют значительную часть используемых данных, все равно будет существовать значительный спрос на реальные данные. И это означает, что останутся сложные проблемы, связанные с хранением, доступом, предвзятостью, стоимостью и временем.












