Лидеры мнений

Правда о синтетических данных: почему человеческая экспертиза критически важна для успеха LLM

mm
Добавьте Unite.AI в избранные источники в Google

Разработчики LLM все чаще используют синтетические данные, чтобы ускорить разработку и снизить затраты. Исследователи, стоящие за несколькими топовыми моделями, такими как LLama 3, Qwen 2 и DeepSeek R1, упоминали использование синтетических данных для обучения своих моделей в исследовательских работах. Снаружи кажется, что это идеальное решение: бесконечный источник информации, чтобы ускорить разработку и снизить затраты. Но это решение имеет скрытую цену, которую бизнес-лидеры не могут игнорировать.

В простых терминах, синтетические данные генерируются моделями ИИ, чтобы создать искусственные наборы данных для обучения, тонкой настройки и оценки LLM и агентов ИИ. По сравнению с традиционной аннотацией человеком, это позволяет данным масштабироваться быстро, что важно в быстро меняющемся и конкурентном ландшафте разработки ИИ.

Корпорации могут иметь другие причины использовать “фальшивые” данные, такие как защита конфиденциальной информации в финансовой или медицинской сфере путем генерации анонимных версий. Синтетические данные также являются хорошей заменой, когда проприетарные данные недоступны, такие как перед запуском продукта или когда данные принадлежат внешним клиентам.

Но революционизируют ли синтетические данные разработку ИИ? Короткий ответ – условный да: у них есть большой потенциал, но они также могут обнаружить критические уязвимости LLM и агентов без тщательного человеческого надзора. Производители LLM и разработчики агентов ИИ могут обнаружить, что модели ИИ, обученные на недостаточно проверенных синтетических данных, могут генерировать неточные или предвзятые выходные данные, создавать репутационные кризисы и привести к несоблюдению отраслевых и этических стандартов. Инвестиции в человеческий надзор для совершенствования синтетических данных – это прямая инвестиция в защиту дна, поддержание доверия заинтересованных сторон и обеспечение ответственного внедрения ИИ.

С помощью человеческого вклада синтетические данные могут быть преобразованы в высококачественные обучающие данные. Существует три критических причины для совершенствования сгенерированных данных перед их использованием для обучения ИИ: чтобы заполнить пробелы в знаниях исходной модели, чтобы улучшить качество данных и уменьшить размер выборки, и чтобы соответствовать человеческим ценностям.

Нам нужно захватить уникальные знания

Синтетические данные в основном генерируются LLM, обученными на публично доступных интернет-источниках, что создает внутреннее ограничение. Публичный контент редко захватывает практические, практические знания, используемые в реальной работе. Деятельность, такая как разработка маркетинговой кампании, подготовка финансового прогноза или проведение рыночной analýзы, обычно является частной и не задокументированной в Интернете. Кроме того, источники часто отражают язык и культуру США, ограничивая глобальное представление.

Чтобы преодолеть эти ограничения, мы можем привлечь экспертов для создания образцов данных в областях, где мы подозреваем, что модель генерации синтетических данных не может покрыть. Вернувшись к корпоративному примеру, если мы хотим, чтобы наша окончательная модель эффективно обрабатывала финансовые прогнозы и рыночную análisis, обучающие данные должны включать реалистичные задачи из этих областей. Важно выявить эти пробелы и дополнить синтетические данные образцами, созданными экспертами.

Эксперты часто привлекаются на ранней стадии проекта, чтобы определить объем работы. Это включает в себя создание таксономии, которая описывает конкретные области знаний, где модель должна работать. Например, в области здравоохранения общую медицину можно разделить на подзадачи, такие как питание, сердечно-сосудистое здоровье, аллергия и многое другое. Модель, ориентированная на здравоохранение, должна быть обучена во всех подзадачах, которые она должна охватить. После определения таксономии экспертами здравоохранения LLM можно использовать для быстрого и масштабного генерирования данных с типичными вопросами и ответами. Однако человеческие эксперты все еще нужны для проверки, исправления и улучшения этого контента, чтобы обеспечить его точность, безопасность и контекстуальную актуальность. Этот процесс контроля качества необходим в высокорисковых приложениях, таких как здравоохранение, для обеспечения точности данных и смягчения потенциального вреда.

Качество над количеством: стимулирование эффективности модели с помощью меньшего количества, но лучших образцов

Когда эксперты в области создают данные для обучения LLM и агентов ИИ, они создают таксономии для наборов данных, пишут подсказки, создают идеальные ответы или имитируют конкретную задачу. Все эти шаги тщательно спланированы для соответствия цели модели, а качество обеспечивается экспертами в соответствующих областях.

Генерация синтетических данных не полностью воспроизводит этот процесс. Она полагается на сильные стороны лежащей в основе модели, используемой для создания данных, и полученное качество часто не соответствует человеческим данным. Это означает, что синтетические данные часто требуют гораздо больших объемов, чтобы достичь удовлетворительных результатов, что увеличивает вычислительные затраты и время разработки.

В сложных областях есть нюансы, которые могут обнаружить только человеческие эксперты, особенно с аномалиями или крайними случаями. Человеческие данные последовательно обеспечивают лучшую производительность модели, даже с значительно меньшими наборами данных. Стратегически интегрируя человеческую экспертизу в процесс создания данных, мы можем уменьшить количество образцов, необходимых для эффективной работы модели.

В нашем опыте лучший способ решить эту проблему – вовлечь экспертов в области в создание синтетических наборов данных. Когда эксперты проектируют правила генерации данных, определяют таксономию данных и проверяют или исправляют сгенерированные данные, окончательное качество данных намного выше. Этот подход позволил нашим клиентам добиться сильных результатов, используя меньшее количество образцов, что привело к более быстрому и эффективному пути к производству.

Строительство доверия: незаменимая роль человека в безопасности и выравнивании ИИ

Автоматические системы не могут предвидеть все уязвимости или обеспечить соответствие человеческим ценностям, особенно в крайних случаях и неоднозначных сценариях. Эксперты-люди играют решающую роль в выявлении возникающих рисков и обеспечении этических результатов до развертывания. Это слой защиты, который ИИ, по крайней мере на данный момент, не может полностью обеспечить самостоятельно.

Следовательно, для создания сильной базы данных для красной команды синтетические данные alone не достаточно. Важно вовлечь экспертов по безопасности на ранней стадии. Они могут помочь составить потенциальные атаки и руководить структурой набора данных. LLM можно использовать для генерации большого объема примеров. После этого эксперты нужны для проверки и усовершенствования данных, чтобы обеспечить их реалистичность, высокое качество и полезность для тестирования систем ИИ. Например, LLM может сгенерировать тысячи стандартных хакерских подсказок, но человеческий эксперт по безопасности может создать новые “социальные инженерные” атаки, которые используют тонкие психологические предубеждения – творческую угрозу, которую автоматические системы с трудом могут изобрести самостоятельно.

Были достигнуты значительные успехи в выравнивании LLM с помощью автоматической обратной связи. В статье RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback,” исследователи показывают, что обратная связь на основе ИИ может работать сравнимо с человеческой обратной связью во многих случаях. Однако, хотя обратная связь ИИ улучшается с улучшением моделей, наш опыт показывает, что RLAIF все еще испытывает трудности в сложных областях и с крайними случаями или аномалиями, областями, где производительность может быть критической в зависимости от применения. Человеческие эксперты более эффективны в обработке нюансов задач и контекста, что делает их более надежными для выравнивания.

Агенты ИИ также выигрывают от автоматического тестирования, чтобы решить широкий спектр проблем безопасности. Виртуальные тестовые среды используют сгенерированные данные для имитации поведения агентов, таких как взаимодействие с онлайн-инструментами и выполнение действий на веб-сайтах. Чтобы максимизировать тестовое покрытие в реалистичных сценариях, человеческая экспертиза необходима для разработки тестовых случаев, проверки результатов автоматических оценок и сообщения о уязвимостях.

Будущее синтетических данных

Синтетические данные являются очень ценными для разработки крупномасштабных языковых моделей, особенно когда масштабирование и быстрое развертывание имеют решающее значение в сегодняшнем быстро меняющемся ландшафте. Хотя в самих синтетических данных нет фундаментальных недостатков, им требуется усовершенствование, чтобы достичь их полного потенциала и обеспечить максимальную ценность. Гибридный подход, сочетающий автоматическую генерацию данных с человеческой экспертизой, является очень эффективным методом для разработки способных и надежных моделей, поскольку окончательная производительность модели зависит больше от качества данных, чем от общего объема. Этот интегрированный процесс, использующий ИИ для масштаба и человеческих экспертов для проверки, производит более способные модели с улучшенным выравниванием безопасности, что важно для построения доверия пользователей и обеспечения ответственного развертывания.

Илья Кочик является вице-президентом по развитию бизнеса в Toloka, человеческом партнере для ведущих исследовательских лабораторий GenAI, где он специализируется на передовых задачах для передовых моделей и агентных систем. Основанный в Лондоне, его опыт включает руководящие и технические роли в Google, QuantumBlack (AI by McKinsey) и Bain & Company.