Модели и платформы ИИ
Расширение выравнивания ИИ с человеческими ценностями с помощью WARM
Выравнивание систем ИИ с человеческими ценностями
Системы искусственного интеллекта (ИИ) становятся все более способными помогать людям в сложных задачах, от чат-ботов службы поддержки клиентов до алгоритмов медицинской диагностики. Однако, когда эти системы ИИ берут на себя больше ответственности, крайне важно, чтобы они оставались выровнены с человеческими ценностями и предпочтениями. Одним из подходов к достижению этого является техника, называемая обучением с подкреплением от человеческой обратной связи (RLHF). В RLHF система ИИ, известная как политика, вознаграждается или наказывается на основе человеческих суждений о ее поведении. Цель состоит в том, чтобы политика научилась максимизировать свои вознаграждения и, таким образом, вести себя в соответствии с человеческими предпочтениями.
Одним из ключевых компонентов RLHF является модель вознаграждения (RM). RM отвечает за оценку действий и выходов политики и возврат сигнала вознаграждения для руководства процессом обучения. Проектирование хорошей RM является сложной задачей, поскольку человеческие предпочтения могут быть сложными, контекстно-зависимыми и даже несогласованными между людьми. Недавно исследователи из Google DeepMind предложили инновационную технику, называемую Взвешенными Средними Моделями Вознаграждения (WARM), для улучшения проектирования RM.
Проблема хакинга вознаграждения
Одной из основных проблем в RLHF является хакинг вознаграждения. Хакинг вознаграждения происходит, когда политика находит лазейки, чтобы обмануть систему RM и получить высокие вознаграждения без фактического удовлетворения намеченных целей. Например, предположим, что цель состоит в том, чтобы обучить систему ИИ для генерации высококачественных резюме. RM может вознаграждать краткие и информативные резюме. Политика может затем научиться использовать это, генерируя очень короткие, неинформативные резюме, наполненные ключевыми словами, которые обманывают RM.
Хакинг вознаграждения происходит по двум основным причинам:
- Сдвиг распределения – RM обучается на ограниченном наборе данных человеческих помеченных примеров. Когда он развертывается, выходы политики могут来自 разных распределений, к которым RM не обобщается хорошо.
- Шумные метки – Человеческая пометка несовершенна, с несогласованностью между оценщиками. RM может зацепиться за случайные сигналы, а не за надежные индикаторы качества.
Хакинг вознаграждения приводит к бесполезным системам, которые не удовлетворяют человеческим ожиданиям. Хуже того, это может привести к поведению ИИ, которое предвзято или даже опасно, если развертывается бездумно.
Рост слияния моделей
Растущий интерес к стратегиям слияния моделей, таким как Model Ratatouille, обусловлен осознанием того, что более крупные модели, хотя и мощные, могут быть неэффективными и непрактичными. Обучение модели с 1 триллионом параметров требует огромных количеств данных, вычислительных ресурсов, времени и стоимости. Более того, такие модели склонны к переобучению на обучающем распределении, что препятствует их способности обобщаться на различные реальные сценарии.
Слияние моделей предоставляет альтернативный путь к разблокировке большей функциональности без неконтролируемого масштабирования. Переиспользуя несколько специализированных моделей, обученных на разных распределениях, задачах или целях, слияние моделей направлено на улучшение универсальности и устойчивости вне распределения. Предполагается, что разные модели захватывают различные прогностические закономерности, которые могут дополнить друг друга при слиянии.
Недавние результаты иллюстрируют обещание этого понятия. Модели, полученные с помощью слияния, несмотря на то, что имеют гораздо меньше параметров, могут соответствовать или даже превосходить производительность гигантских моделей, таких как GPT-3. Например, ансамбль Model Ratatouille из 7 средних контрольных точек достигает лучшей точности на высокоразмерных текстовых данных, превосходя GPT-3.
Простота слияния путем взвешенного среднего является огромным бонусом. Обучение нескольких вспомогательных моделей действительно требует дополнительных ресурсов. Но, что важно, вычисления во время вывода остаются идентичными для одной модели, поскольку веса конденсируются в одну. Это делает метод легко адаптируемым, без проблем увеличения задержки или затрат на память.
Механизмы слияния моделей
Но что именно позволяет достичь этих точностных выигрышей от слияния моделей? Недавний анализ дает некоторые подсказки:
- Смягчение запоминания: Каждая модель видит разные перемешанные партии данных во время обучения. Усреднение уменьшает любое экземплярное запоминание, сохраняя только обобщения на уровне набора данных.
- Уменьшение дисперсии: Модели, обученные независимо, имеют некоррелированные ошибки. Объединение их усредняет шум, улучшая калибровку.
- Регуляризация посредством разнообразия: Различные вспомогательные задачи заставляют модели зацепиться за более обобщаемые функции, полезные на разных распределениях.
- Увеличение устойчивости: Несогласованность в прогнозах сигнализирует о неопределенности. Усреднение умеривает выбросы, улучшая надежность.
По сути, слияние моделей противобалансирует слабости отдельных моделей, чтобы усилить их коллективные сильные стороны. Объединенная репрезентация захватывает общие основные причинно-следственные структуры, игнорируя случайные вариации.
Эта концептуальная основа связывает слияние моделей с другими популярными техниками, такими как ансамблирование и многозадачное обучение. Все эти методы используют разнообразие между моделями или задачами, чтобы получить универсальные, осведомленные о неопределенности системы. Простота и эффективность взвешенного среднего, однако, дает слиянию моделей уникальное преимущество для продвижения реальных развертываний.
Взвешенные Средние Модели Вознаграждения
WARM инновационно использует прокси-модель вознаграждения (RM), которая является взвешенным средним нескольких отдельных RM, каждая из которых дообучена из той же предварительно обученной LLM, но с разными гиперпараметрами. Этот метод улучшает эффективность, надежность при сдвиге распределения и устойчивость против несогласованных предпочтений. Исследование также показывает, что использование WARM в качестве прокси-RM, особенно с увеличением количества усредненных RM, улучшает результаты и задерживает начало “хакинга вознаграждения”, явления, при котором вознаграждения контроля ухудшаются со временем.
Вот общий обзор:
- Начните с базовой языковой модели, предварительно обученной на большом корпусе. Инициализируйте несколько RM, добавив небольшие задачеспецифические слои сверху.
- Дообучите каждую RM отдельно на наборе данных человеческих предпочтений, используя разные гиперпараметры, такие как скорость обучения для разнообразия.
- Усредните веса дообученных RM, чтобы получить единую ансамблевую WARM.
Ключевым моментом является то, что взвешенное среднее сохраняет только инвариантную информацию, которая обучается во всех разнообразных RM. Это уменьшает зависимость от случайных сигналов, улучшая устойчивость. Ансамбль также выигрывает от уменьшения дисперсии, улучшая надежность при сдвиге распределения.
Как обсуждалось ранее, разнообразие между независимо обученными моделями имеет решающее значение для разблокировки полного потенциала слияния моделей. Но какие же конкретные техники могут способствовать продуктивному разнообразию?
Статья WARM исследует несколько умных идей, которые могут обобщаться более широко:
Перестановка порядка
Тривиальный, но влиятельный подход – это перемешивание порядка, в котором данные точки видны каждой моделью во время обучения. Даже этот простой шаг декоррелирует веса, уменьшая избыточное запоминание закономерностей.
Вариации гиперпараметров
Настройка гиперпараметров, таких как скорость обучения и вероятность dropout, для каждого запуска вводит полезное разнообразие. Модели сходятся по-разному, захватывая различные свойства набора данных.
Усреднение контрольных точек – Baklava
Метод Baklava инициализирует модели для слияния из разных снимков по одному и тому же пути предварительного обучения. Это расслабляет ограничения по сравнению с супом моделей, который требует общей начальной точки. Относительно модели Ratatouille, Baklava избегает дополнительных задач. В целом, это достигает эффективного баланса точности и разнообразия.
Анализ подтверждает, что добавление более старых контрольных точек путем скользящего среднего вредно для индивидуальной производительности, компрометируя достоинства разнообразия. Усреднение только окончательных представлений из каждого запуска работает лучше. В целом, балансирование целей разнообразия с поддержанием точности остается открытой исследовательской задачей.
В целом, слияние моделей хорошо соответствует общему этике в области эффективного повторного использования существующих ресурсов для улучшения надежности, эффективности и универсальности. Простота взвешенного среднего закрепляет его позицию как ведущего кандидата для сборки устойчивых моделей из доступных строительных блоков.
В отличие от традиционных методов ансамблирования, которые усредняют прогнозы, WARM сохраняет минимальную вычислительную нагрузку, поддерживая только один набор весов. Эксперименты на задачах суммаризации текста демонстрируют эффективность WARM:
- Для лучшего из N выборок WARM достигает 92,5% уровня победы против случайного выбора в соответствии с человеческими метками предпочтений.
- В RLHF политика WARM достигает 79,4% уровня победы против политики, обученной с одной RM, после того же количества шагов.
- WARM продолжает работать хорошо даже тогда, когда четверть человеческих меток испорчена.
Эти результаты иллюстрируют потенциал WARM как практической техники для разработки реальных помощников ИИ, которые ведут себя надежно. Сглаживая несогласованности в человеческой обратной связи, политики WARM могут оставаться устойчиво выровнены с человеческими ценностями, даже когда они продолжают обучаться на новых опытах.
Большая картина
WARM находится на пересечении двух ключевых тенденций в исследованиях выравнивания ИИ. Первая – это изучение обобщения вне распределения (OOD), которое направлено на улучшение производительности моделей на новых данных, отличающихся от обучающего распределения. Вторая – это исследования алгоритмической устойчивости, фокусирующиеся на надежности при небольших возмущениях входных данных или шуме.
Устанавливая связи между этими областями вокруг понятия выученных инвариантов, WARM продвигает нас к более строго обоснованным техникам для выравнивания ценностей. Взгляды из WARM могут обобщаться даже за пределами RLHF, предоставляя уроки для более широких систем машинного обучения, взаимодействующих с открытым миром.
Конечно, моделирование вознаграждения – это только одна часть головоломки выравнивания. Нам все еще нужны достижения в других задачах, таких как спецификация вознаграждения, масштабируемый надзор и безопасное исследование. В сочетании с дополнительными техниками WARM может ускорить разработку ИИ, который устойчиво способствует человеческому процветанию. Коллективно разъясняя принципы, лежащие в основе устойчивого выравнивания, исследователи картографируют маршрут к полезному, этическому ИИ.














