Модели и платформы ИИ
EUREKA: Проектирование вознаграждений на уровне человека посредством кодирования больших языковых моделей
С учетом достижений больших языковых моделей в последние годы неудивительно, почему эти框架 LLM отлично подходят для семантического планирования последовательных задач высокого уровня принятия решений. Однако разработчикам все еще сложно использовать весь потенциал框架 LLM для обучения сложным низкоуровневым задачам манипулирования. Несмотря на их эффективность, современные большие языковые модели требуют значительного опыта в области и предмета для изучения даже простых навыков или создания текстовых подсказок, создавая значущий разрыв между их производительностью и человеческой ловкостью.
Чтобы сократить этот разрыв, разработчики из Nvidia (NVDA ), CalTech, UPenn и других представили EUREKA, алгоритм проектирования на основе LLM, работающий на уровне человека. EUREKA направлен на использование различных возможностей框架 LLM, включая написание кода, улучшение в контексте и генерацию контента без предварительного обучения, для выполнения беспрецедентной оптимизации кода вознаграждений. Эти коды вознаграждений, в сочетании с обучением с подкреплением, позволяют框架м изучать сложные навыки или выполнять задачи манипулирования.
В этой статье мы рассмотрим框架 EUREKA с точки зрения разработки, изучая его框架, работу и результаты, которые он достигает при генерации функций вознаграждения. Эти функции, как утверждают разработчики, превосходят те, которые генерируются человеком. Мы также рассмотрим, как框架 EUREKA открывает путь для нового подхода к RLHF (обучению с подкреплением с помощью обратной связи человека) путем включения градиентного обучения в контексте. Давайте начнем.
EUREKA: Введение
Сегодня лучшие框架 LLM, такие как GPT-3 и GPT-4, демонстрируют выдающиеся результаты при служении в качестве семантических планировщиков для последовательных задач высокого уровня принятия решений, но разработчики все еще ищут способы улучшить их производительность при изучении низкоуровневых задач манипулирования, таких как ловкость вращения ручки. Кроме того, разработчики наблюдали, что обучение с подкреплением может быть использовано для достижения устойчивых результатов в ловких условиях и других областях, если вознаграждения спроектированы тщательно человеческими дизайнерами и способны обеспечить сигналы обучения для благоприятного поведения. Когда сравниваются с реальными задачами обучения с подкреплением, которые принимают скудные вознаграждения, это делает difficile для модели изучить закономерности, формирование этих вознаграждений обеспечивает необходимые инкрементные сигналы обучения. Кроме того, функции вознаграждения, несмотря на их важность, чрезвычайно сложны в проектировании, и субоптимальные конструкции этих функций часто приводят к непредвиденному поведению.

Чтобы решить эти проблемы и максимизировать эффективность этих токенов вознаграждения, EUREKA или Эволюционный Универсальный Вознаграждение Кит для Агента направлен на выполнение следующих вкладов.
- Достижение человеческого уровня производительности для проектирования функций вознаграждения.
- Эффективное решение задач манипулирования без использования ручной инженерии вознаграждений.
- Генерация более человеческих и более производительных функций вознаграждения путем введения нового градиентного обучения в контексте вместо традиционного RLHF или метода обучения с подкреплением с помощью обратной связи человека.
Существуют три ключевых алгоритмических выбора дизайна, которые разработчики выбрали для улучшения общности EUREKA: эволюционный поиск, контекст окружения и отражение вознаграждения. Во-первых,框架 EUREKA принимает исходный код окружения в качестве контекста для генерации исполняемых функций вознаграждения в нулевом выстреле. После этого框架 выполняет эволюционный поиск для улучшения качества своих вознаграждений существенно, предлагает партии кандидатов вознаграждения с каждой итерацией или эпохой и совершенствует те, которые он находит наиболее перспективными. На третьем и последнем этапе框架 использует отражение вознаграждения для того, чтобы сделать улучшение вознаграждений более эффективным, процесс, который в конечном итоге помогает框架м включать целевое и автоматическое редактирование вознаграждений, используя текстовое резюме качества этих вознаграждений на основе статистики обучения политики. Следующая фигура дает вам краткий обзор того, как работает框架 EUREKA, и в следующем разделе мы будем говорить о архитектуре и работе в большей детали.

EUREKA: Архитектура модели и постановка проблемы
Основная цель формирования вознаграждения заключается в том, чтобы вернуть сформированную или отредактированную функцию вознаграждения для фактической функции вознаграждения, которая может представлять трудности при прямой оптимизации, как скудные вознаграждения. Кроме того, дизайнеры могут получить доступ к этим фактическим функциям вознаграждения только с помощью запросов, что является причиной, по которой框架 EUREKA выбирает генерацию вознаграждения, программу синтеза на основе RDP или проблемы дизайна вознаграждения.
Проблема дизайна вознаграждения или RDP является кортежем, содержащим модель мира с пространством состояний, пространством для функций вознаграждения, функцией перехода и пространством действий. Затем алгоритм обучения оптимизирует вознаграждения, генерируя политику, которая приводит к MDP или марковскому процессу, который производит скалярную эволюцию любой политики и может быть доступен только с помощью запросов политики. Основная цель RDP заключается в том, чтобы вывести функцию вознаграждения таким образом, чтобы политика могла достичь максимального балла приспособленности. В постановке проблемы EUREKA разработчики указали каждый компонент в проблеме дизайна вознаграждения с помощью кода. Кроме того, для данной строки, которая указывает детали задачи, основной целью проблемы генерации вознаграждения является генерация кода функции вознаграждения для максимизации балла приспособленности.
Двигаясь дальше, в основе框架 EUREKA существуют три фундаментальных алгоритмических компонента. Эволюционный поиск (предложение и совершенствование кандидатов итеративно), контекст окружения (генерация исполняемых вознаграждений в нулевом выстреле) и отражение вознаграждения (для включения тонкого улучшения вознаграждений). Псевдокод для алгоритма проиллюстрирован на следующем изображении.

Контекст окружения
В настоящее время框架 LLM требуют спецификаций окружения в качестве входных данных для проектирования вознаграждений, тогда как框架 EUREKA предлагает подать исходный код окружения напрямую в качестве контекста, без кода вознаграждения, позволяя框ameworkм принять модель мира в качестве контекста. Подход, используемый EUREKA, имеет два основных преимущества. Во-первых,框ameworkм LLM для кодирования обучены на родных наборах кода, написанных на существующих языках программирования, таких как C, C++, Python, Java и т. д., что является основной причиной, по которой они лучше производят кодовые выходы, когда им разрешено напрямую составлять код в синтаксисе и стиле, на которых они были первоначально обучены. Во-вторых, использование исходного кода окружения обычно раскрывает окружение семантически и переменные, которые подходят для использования в попытке вывода функции вознаграждения в соответствии с указанной задачей. На основе этих прозрений框amework EUREKA инструктирует LLM возвращать более исполняемый Python-код напрямую с помощью только форматировочных советов и общих конструкций вознаграждения.
Эволюционный поиск
Включение эволюционного поиска в框amework EUREKA направлено на предоставление естественного решения проблем субоптимальности и ошибок, возникших во время выполнения, как упоминалось ранее. С каждой итерацией или эпохой框amework генерирует различные независимые выходы из большой языковой модели, и если поколения являются все i.i.d, оно экспоненциально снижает вероятность того, что функции вознаграждения во время итераций будут ошибочными, учитывая, что количество образцов увеличивается с каждой эпохой.
На следующем шаге框amework EUREKA использует исполняемые функции вознаграждения из предыдущей итерации для выполнения контекстного мутации вознаграждения, а затем предлагает новую и улучшенную функцию вознаграждения на основе текстовой обратной связи. Когда框amework EUREKA объединен с возможностями улучшения в контексте и следования инструкциям больших языковых моделей, он способен указать оператор мутации как текстовую подсказку и предлагает метод использования текстового резюме обучения политики для изменения существующих кодов вознаграждения.
Отражение вознаграждения
Чтобы основать контекстные мутации вознаграждения, необходимо оценить качество сгенерированных вознаграждений и, что более важно, выразить их словами, и框amework EUREKA решает эту проблему, используя простую стратегию предоставления числовых оценок в качестве оценки вознаграждения. Когда функция приспособленности задачи служит в качестве целостной метрики для фактического вознаграждения, она лишена назначения кредитов и не может предоставить никакой ценной информации о том, почему функция вознаграждения работает или почему она не работает. Итак, в попытке предоставить более целевую и тонкую диагностику вознаграждения,框amework предлагает использовать автоматические обратные связи для суммирования динамики обучения политики в тексте. Кроме того, в программе вознаграждения функции вознаграждения в框amework EUREKA запрашиваются для раскрытия своих компонентов индивидуально, что позволяет框ameworkм отслеживать скалярные значения каждого уникального компонента вознаграждения на контрольных точках политики во время всей фазы обучения.

Хотя процедура функции вознаграждения, используемая框amework EUREKA, проста в конструкции, она необходима благодаря алгоритмически-зависимой природе оптимизации вознаграждений. Это означает, что эффективность функции вознаграждения напрямую влияет на выбор алгоритма обучения с подкреплением, и с изменением гиперпараметров вознаграждение может работать по-разному, даже с тем же оптимизатором. Таким образом,框amework EUREKA может редактировать записи более эффективно и избирательно, синтезируя функции вознаграждения, которые находятся в повышенной синергии с алгоритмом обучения с подкреплением.
Обучение и базовая линия
Существуют два основных компонента обучения框amework EUREKA: Обучение политики и Метрики оценки вознаграждения.
Обучение политики
Окончательные функции вознаграждения для каждой отдельной задачи оптимизируются с помощью одного и того же алгоритма обучения с подкреплением, используя один и тот же набор гиперпараметров, которые настраиваются для того, чтобы сделать вознаграждения, спроектированные человеком, работать хорошо.
Метрики оценки вознаграждения
Поскольку метрика задачи варьируется по масштабу и семантическому значению с каждой задачей,框amework EUREKA сообщает о нормализованном балле человека, который обеспечивает целостную меру для сравнения того, как он работает по сравнению с экспертными человеческими вознаграждениями в соответствии с метриками, основанными на фактах.
Двигаясь дальше, существуют три основных базовых линии: L2R, Человек и Скудный.
L2R
L2R является двухэтапным решением подсказки большой языковой модели, которое помогает генерировать шаблонные вознаграждения. Сначала框amework LLM заполняет шаблон естественного языка для окружения и задачи, указанных в естественном языке, а затем второй LLM преобразует это “описание движения” в код, который пишет функцию вознаграждения, вызывая набор手описных примитивов API вознаграждения.
Человек
Базовая линия Человек представляет собой исходные функции вознаграждения, написанные исследователями обучения с подкреплением, представляя результаты человеческой инженерии вознаграждения на беспрецедентном уровне.
Скудный
Базовая линия Скудный напоминает функции приспособленности и используется для оценки качества вознаграждений, сгенерированных框ameworkм.
Результаты и исходы
Чтобы проанализировать производительность框amework EUREKA, мы будем оценивать его на различных параметрах, включая его производительность против человеческих вознаграждений, улучшение результатов во времени, генерацию новых вознаграждений, включение целевого улучшения и работу с обратными связями человека.
EUREKA превосходит человеческие вознаграждения
Следующая фигура иллюстрирует агрегированные результаты по различным базам, и как можно четко увидеть,框amework EUREKA либо превосходит, либо работает на уровне человеческих вознаграждений на задачах Dexterity и Issac. В сравнении базовая линия L2R обеспечивает аналогичную производительность на низкоуровневых задачах, но когда речь идет о высокоуровневых задачах, разрыв в производительности довольно существенный.

Последовательно улучшаясь во времени
Одним из основных моментов框amework EUREKA является его способность постоянно улучшать и повышать свою производительность во времени с каждой итерацией, и результаты продемонстрированы на фигуре ниже.

Как можно четко увидеть,框amework постоянно генерирует лучшие вознаграждения с каждой итерацией, и он также улучшает и в конечном итоге превосходит производительность человеческих вознаграждений, благодаря использованию контекстного эволюционного поиска вознаграждения.
Генерация новых вознаграждений
Новизна вознаграждений框amework EUREKA может быть оценена путем расчета корреляции между человеческими и EUREKA-вознаграждениями на всех задачах Issac. Эти корреляции затем наносятся на график или карту против нормализованных баллов человека, где каждая точка на графике представляет отдельное вознаграждение EUREKA для каждой отдельной задачи. Как можно четко увидеть,框amework EUREKA в основном генерирует слабо коррелированные функции вознаграждения, превосходящие человеческие функции вознаграждения.

Включение целевого улучшения
Чтобы оценить важность добавления отражения вознаграждения в обратную связь вознаграждения, разработчики оценили абляцию,框amework EUREKA без отражения вознаграждения, которое снижает обратные связи до снимков значений. Когда они запускали задачи Issac, разработчики наблюдали, что без отражения вознаграждения框amework EUREKA испытал снижение примерно на 29% в среднем нормализованном балле.
Работа с обратными связями человека
Чтобы легко включить широкий спектр входных данных для генерации человеческих и более производительных функций вознаграждения,框amework EUREKA, кроме автоматического проектирования вознаграждения, также вводит новый градиентный подход к обучению с подкреплением с помощью обратной связи человека, и были сделаны два значительных наблюдения.
- EUREKA может извлечь пользу и улучшиться из человеческих функций вознаграждения.
- Использование человеческой обратной связи для отражения вознаграждения индуцирует согласованное поведение.

Вышеуказанная фигура демонстрирует, как框amework EUREKA демонстрирует существенный рост производительности и эффективности, используя инициализацию человеческого вознаграждения, независимо от качества человеческих вознаграждений, что указывает на то, что качество базовых вознаграждений не имеет существенного влияния на возможности улучшения вознаграждения в контексте.

Вышеуказанная фигура иллюстрирует, как框amework EUREKA не только может индуцировать более человеческие политики, но и изменить вознаграждения, включая человеческую обратную связь.
Окончательные мысли
В этой статье мы говорили о EUREKA, алгоритме проектирования на уровне человека, работающем на основе больших языковых моделей, который пытается использовать различные возможности больших языковых моделей, включая написание кода, улучшение в контексте и генерацию контента без предварительного обучения, для выполнения беспрецедентной оптимизации кода вознаграждений. Код вознаграждения, в сочетании с обучением с подкреплением, может быть использован этими моделями для изучения сложных навыков или выполнения задач манипулирования. Без человеческого вмешательства или задачеспецифической инженерии подсказок框amework обеспечивает человеческий уровень генерации вознаграждений на широком спектре задач, и его основная сила заключается в изучении сложных задач с помощью подхода обучения с карикулой.
В целом, существенная производительность и универсальность框amework EUREKA указывают на потенциал объединения эволюционных алгоритмов с большими языковыми моделями, который может привести к масштабируемому и общему подходу к проектированию вознаграждений, и этот вывод может быть применим к другим открытым проблемам поиска.












