Модели и платформы ИИ

Как Google сократила требования к обучению ИИ в 10 000 раз

mm
Добавьте Unite.AI в избранные источники в Google

Индустрия искусственного интеллекта сталкивается с фундаментальной парадоксом. Хотя машины могут обрабатывать данные в огромных масштабах, обучение остается удивительно неэффективным, сталкиваясь с проблемой снижения отдачи. Традиционные подходы к машинному обучению требуют огромных помеченных наборов данных, которые могут стоить миллионы долларов и занять годы для создания. Эти подходы обычно основаны на убеждении, что больше данных приводит к лучшим моделям ИИ. Однако исследователи Google最近 представили инновационный метод, который бросает вызов этому устоявшемуся убеждению. Они демонстрируют, что подобные результаты ИИ можно достичь с помощью до 10 000 раз меньше обучающих данных. Это развитие имеет потенциал фундаментально изменить наш подход к ИИ. В этой статье мы рассмотрим, как исследователи Google (GOOGL ) достигли этого прорыва, потенциальное будущее влияние этого развития и проблемы и направления вперед.

Проблема больших данных в ИИ

На протяжении десятилетий мантра “больше данных означает лучший ИИ” определяла подход индустрии к ИИ. Большие языковые модели, такие как GPT-4, потребляют триллионы токенов во время обучения. Этот подход, требующий больших данных, создает значительный барьер для организаций, не имеющих обширных ресурсов или специализированных наборов данных. Во-первых, стоимость человеческой пометки значительно высока. Эксперт-аннотаторы взимают высокие ставки, и огромный объем данных, необходимый для проектов, делает их дорогими. Во-вторых, большинство собранных данных часто избыточны и не могут сыграть решающую роль в процессе обучения. Традиционный метод также испытывает трудности с меняющимися требованиями. Когда политики меняются или появляются новые типы проблемного контента, компании должны начать процесс пометки заново. Этот процесс создает постоянный цикл дорогостоящего сбора данных и повторного обучения модели.

Решение проблем больших данных с помощью активного обучения

Одним из известных способов решения этих проблем с данными является активное обучение. Этот подход полагается на тщательный процесс отбора, который выявляет наиболее ценные примеры для человеческой пометки. Основная идея заключается в том, что модели учатся лучше всего на примерах, которые они находят наиболее запутанными, а не пассивно потребляют все доступные данные. В отличие от традиционных методов ИИ, которые требуют больших наборов данных, активное обучение использует более стратегический подход, фокусируясь на сборе только наиболее информативных примеров. Этот подход помогает избежать неэффективности пометки очевидных или избыточных данных, которые предоставляют мало ценности модели. Вместо этого активное обучение нацеливается на пограничные случаи и неопределенные примеры, которые имеют потенциал значительно улучшить производительность модели.

Подход Google к активному обучению

Исследовательская команда Google успешно применила эту парадигму. Их новый метод активного обучения демонстрирует, что тщательно отобранные, высококачественные примеры могут заменить огромные количества помеченных данных. Например, они показывают, что модели, обученные на менее чем 500 эксперт-помеченных примерах, соответствуют или превышают производительность систем, обученных на 100 000 традиционных пометок.

Процесс работает через систему, которую Google называет “LLM-as-Scout”. Большая языковая модель сначала сканирует огромные объемы непомеченных данных, выявляя случаи, когда она чувствует себя наиболее неуверенно. Эти пограничные случаи представляют собой именно те сценарии, в которых модели необходима человеческая помощь для улучшения своего принятия решений. Процесс начинается с начальной модели, которая помечает большие наборы данных с помощью базовых подсказок. Система затем группирует примеры по их предсказанным классификациям и выявляет области, где модель показывает путаницу между разными категориями. Эти перекрывающиеся кластеры раскрывают точные точки, где человеческая экспертиза может стать наиболее ценной.

Методология явно нацеливается на пары примеров, которые расположены ближе всего, но имеют разные пометки. Эти пограничные случаи представляют собой именно те сценарии, в которых человеческая экспертиза имеет наибольшее значение. Концентрируя усилия экспертной пометки на этих запутанных примерах, система достигает замечательных показателей эффективности.

Качество над количеством

Исследование раскрывает ключевой вывод о качестве данных, который бросает вызов общему предположению в ИИ. Оно демонстрирует, что экспертные пометки, с их высокой точностью, последовательно превосходят крупномасштабные краудсорсинговые аннотации. Они измерили это с помощью коэффициента Каппы, статистического инструмента, который оценивает, насколько хорошо прогнозы модели соответствуют мнению экспертов, за пределами того, что могло бы произойти случайно. В экспериментах Google эксперт-аннотаторы достигли коэффициентов Каппы выше 0,8, значительно превосходя то, что обычно обеспечивает краудсорсинг.
Эта более высокая последовательность позволяет моделям учиться эффективно из гораздо меньшего количества примеров. В тестах с Gemini Nano-1 и Nano-2 модели соответствовали или превышали экспертное соответствие, используя всего 250-450 тщательно отобранных примеров по сравнению с около 100 000 случайных краудсорсинговых пометок. Это уменьшение на три-четыре порядка. Однако преимущества не ограничиваются только уменьшением количества данных. Модели, обученные с помощью этого подхода, часто превосходят модели, обученные традиционными методами. Для сложных задач и более крупных моделей улучшения производительности достигали 55-65% по сравнению с базовым уровнем, что показывает более существенное и более надежное соответствие с экспертами политики.

Почему этот прорыв имеет значение сейчас

Это развитие происходит в критический момент для индустрии ИИ. По мере роста моделей и их усложнения традиционный подход к масштабированию обучающих данных становится все более неустойчивым. Экологическая стоимость обучения огромных моделей продолжает расти, и экономические барьеры для входа остаются высокими для многих организаций.

Метод Google решает несколько отраслевых проблем одновременно. Драматическое уменьшение затрат на пометку делает разработку ИИ более доступной для небольших организаций и исследовательских команд. Более быстрые циклы итераций позволяют быстро адаптироваться к меняющимся требованиям, что имеет решающее значение в динамичных областях, таких как модерация контента или кибербезопасность.

Подход также имеет более широкие последствия для безопасности и надежности ИИ. Сосредоточившись на случаях, когда модели наиболее неопределенны, метод естественным образом выявляет потенциальные режимы отказа и пограничные случаи. Этот процесс создает более прочные системы, которые лучше понимают свои ограничения.

Более широкие последствия для разработки ИИ

Этот прорыв предполагает, что мы можем вступать в новую фазу разработки ИИ, где эффективность имеет значение больше, чем масштаб. Традиционный подход “больше значит лучше” к обучающим данным может уступить место более изощренным методам, которые отдают приоритет качеству данных и стратегическому отбору.

Экологические последствия сами по себе значительны. Обучение крупных моделей ИИ в настоящее время требует огромных вычислительных ресурсов и энергопотребления. Если подобные результаты можно достичь с помощью значительно меньшего количества данных, углеродный след разработки ИИ может уменьшиться существенно.

Демократизирующий эффект может быть столь же важным. Небольшие исследовательские команды и организации, которые ранее не могли позволить себе огромные усилия по сбору данных, теперь имеют путь к конкурентоспособным системам ИИ. Это развитие может ускорить инновации и создать более разнообразные перспективы в разработке ИИ.

Ограничения и соображения

Несмотря на свои перспективные результаты, методология сталкивается с несколькими практическими проблемами. Требование эксперт-аннотаторов с коэффициентами Каппы выше 0,8 может ограничить применимость в областях, где нет достаточной экспертизы или четких критериев оценки. Исследование в основном фокусируется на задачах классификации и приложениях безопасности контента. Неизвестно, применяются ли те же драматические улучшения к другим типам задач ИИ, таким как генерация языка или рассуждение.

Итеративная природа активного обучения также вводит сложность по сравнению с традиционными подходами пакетной обработки. Организациям необходимо разработать новые рабочие процессы и инфраструктуру для поддержки циклов запрос-ответ, которые позволяют непрерывное улучшение модели.

Будущие исследования, вероятно, будут исследовать автоматические подходы для поддержания экспертного уровня качества аннотации и разработки домен-специфических адаптаций основной методологии. Интеграция принципов активного обучения с другими методами эффективности, такими как параметро-эффективное тонкое настройка, может привести к дополнительным показателям производительности.

Итог

Исследование Google показывает, что целевые, высококачественные данные могут быть более эффективными, чем огромные наборы данных. Концентрируя усилия только на самых ценных примерах, они сократили потребность в обучении до 10 000 раз, одновременно улучшая производительность. Этот подход снижает затраты, ускоряет разработку, снижает экологическое воздействие и делает передовой ИИ более доступным. Это означает значительный сдвиг в сторону эффективной и устойчивой разработки ИИ.

Доктор Техсин Зия является доцентом в университете COMSATS в Исламабаде, имеющим степень PhD в области ИИ в Венском техническом университете, Австрия. Специализируясь в области искусственного интеллекта, машинного обучения, науки о данных и компьютерного зрения, он внес значительный вклад с публикациями в авторитетных научных журналах. Доктор Техсин также возглавлял различные промышленные проекты в качестве основного исследователя и служил консультантом по ИИ.