Моделі та платформи ШІ

POKELLMON: Людина-паритетний агент для битв покемонів з LLM

mm
Додайте Unite.AI до бажаних джерел у Google

Багатомовні моделі та генерація штучного інтелекту продемонстрували безпрецедентний успіх у широкому спектрі завдань обробки природної мови. Після завоювання галузі NLP, наступним викликом для дослідників Генеративного ІІ та БМ є дослідження того, як великі мовні моделі можуть діяти автономно у реальному світі з розширеною генерацією від тексту до дії, представляючи значний парадигм у пошуках Штучного Загального Інтелекту. Онлайн-ігри вважаються придатною основою для розробки агентів, втілених у великих мовних моделях, які взаємодіють із візуальною середовищем так, як це робить людина.

Наприклад, у популярній онлайн-сімуляційній грі Minecraft агенти прийняття рішень можуть бути використані для допомоги гравцям у вивченні світу та розвитку навичок створення інструментів і вирішення завдань. Іншим прикладом взаємодії агентів LLM з візуальною середовищем є гра The Sims, де агенти продемонстрували видатний успіх у соціальних взаємодіях і демонструють поведінку, схожу на поведінку людини. Однак порівняно з існуючими іграми, тактичні битви можуть виявитися кращим вибором для оцінки здатності великих мовних моделей грати у віртуальні ігри. Основна причина, чому тактичні ігри роблять кращу основу, полягає в тому, що рівень перемог можна виміряти безпосередньо, а постійні опоненти, включаючи гравців і штучний інтелект, завжди доступні.

Будуючи на цьому, POKELLMON має на меті стати першим агентом, втіленим у людину, який досягає рівня людини у тактичних іграх, подібних до тих, що відбуваються у битвах покемонів. У своєму ядрі рамки POKELLMON включають три основні стратегії.

  1. Вчення з підкріпленням у контексті, яке споживає текстову відгуку, отриману з битв миттєво, для уточнення політики ітеративно.
  2. Генерація, доповнена знаннями, яка використовує зовнішні знання для протидії галюцинаціям, дозволяючи агенту діяти своєчасно і правильно.
  3. Стабільна генерація дій для мінімізації ситуації паніки при перемиканні, коли агент зустрічає сильного гравця і хоче уникнути зустрічі з ним.

Ця стаття має на меті висвітлити рамки POKELLMON докладно, і ми досліджуємо механізм, методологію, архітектуру рамок, а також їх порівняння з сучасними рамками. Ми також поговоримо про те, як рамки POKELLMON демонструють видатні стратегії битв, схожі на людські, і вчасно приймають рішення, досягнувши поважного рівня перемог майже 50%. Тому давайте почнемо.

POKELLMON: Людина-паритетний агент для битв покемонів з LLM

Ріст можливостей і ефективності великих мовних моделей та генерації штучного інтелекту за останні кілька років був просто чудовим, особливо у завданнях обробки природної мови. Нещодавно розробники та дослідники штучного інтелекту працюють над тим, щоб зробити генерацію штучного інтелекту та великі мовні моделі більш видними у реальних сценаріях з можливістю діяти автономно у фізичному світі. Для досягнення цієї автономної продуктивності у фізичних і реальних ситуаціях дослідники та розробники вважають ігри придатною основою для розробки агентів, втілених у великі мовні моделі, які взаємодіють із візуальною середовищем так, як це робить людина.

Раніше розробники намагалися розробити агенти, втілені у великі мовні моделі, у віртуальних симуляційних іграх, таких як Minecraft та The Sims, хоча вважається, що тактичні ігри, такі як Pokémon, можуть бути кращим вибором для розробки цих агентів. Битви покемонів дозволяють розробникам оцінювати здатність тренера битися у відомих іграх покемонів і пропонують кілька переваг порівняно з іншими тактичними іграми. Оскільки простори дій і стану є дискретними, їх можна перекласти на текст без жодних втрат. Наступна фігура ілюструє типову битву покемонів, у якій гравцеві пропонується сгенерувати дію для виконання на кожному ході, залежно від поточного стану покемонів з обох сторін. Гравці мають можливість вибирати з п’яти різних покемонів, і є загалом чотири ходи у просторі дій. Крім того, гра допомагає знизити напруження на час інференції та витрати на інференцію для великих мовних моделей, оскільки формат ходу усуває необхідність інтенсивної гри. Таким чином, продуктивність залежить переважно від здатності великої мовної моделі до розумових дій.

POKELLMON: Методологія та архітектура

Загальна структура та архітектура рамок POKELLMON ілюструються на наступній картинці.

Під час кожного ходу рамки POKELLMON використовують попередні дії та відповідну текстову відгуку для уточнення політики ітеративно, а також доповнюють поточну інформацію про стан зовнішніми знаннями, такими як ефекти здібностей/ходів або优势/слабкості відносин. Для інформації, наданої на вході, рамки POKELLMON генерують кілька дій незалежно, а потім вибирають найбільш стабільні з них як остаточний результат.

Вчення з підкріпленням у контексті

Людські гравці та спортсмени часто приймають рішення не тільки на основі поточного стану, але також відображають відгуки від попередніх дій, а також досвід інших гравців. Безумовно, позитивний відгук допомагає гравцеві вивчити з помилок і утримує його від повторення однієї й тієї ж помилки знову і знову. Без належної відгуки агенти POKELLMON можуть продовжувати виконувати одну й ту ж помилку, як це демонструється на наступній картинці.

Як можна побачити, агент гри використовує водний хід проти покемона з здібністю “Dry Skin”, яка дозволяє йому нівелювати пошкодження від водних атак. Гра намагається попередити користувача, мигаючи повідомленням “Immune” на екрані, яке може спонукати людину переглянути свої дії, навіть якщо він не знає про “Dry Skin”. Однак це не включено до опису стану для агента, в результаті чого агент повторює одну й ту ж помилку.

Для того, щоб агент POKELLMON вивчив з попередніх помилок, рамки реалізують підхід до навчання з підкріпленням у контексті. Навчання з підкріпленням є популярним підходом у машинному навчанні, який допомагає розробникам уточнювати політику, оскільки для цього потрібні числові нагороди для оцінки дій. Оскільки великі мовні моделі мають можливість інтерпретувати та розуміти мову, текстові описи стали новим типом нагороди для великих мовних моделей. Включаючи текстову відгуку з попередніх дій, агент POKELLMON能够 ітеративно та миттєво уточнювати свою політику, а саме навчання з підкріпленням у контексті. Рамки POKELLMON розробляють чотири типи відгуку,

  1. Фактичний пошкодження, спричинене атакою, на основі різниці у HP за два послідовні ходи.
  2. Ефективність атак. Відгук вказує на ефективність атаки у термінах відсутності ефекту, імунітету, неефективності або супер-ефективності через ефекти здібностей/ходів або типові переваги.
  3. Порядок виконання ходів. Оскільки точні статистичні дані про суперника не доступні, відгук про порядок виконання ходів надає приблизну оцінку швидкості.
  4. Фактичний ефект виконаних ходів на суперника. Обидва атакувальні ходи, а також статус можуть призвести до результатів, таких як відновлення HP, підвищення статистики або дебафів, завдавання умов, таких як заморожування, опіки або отруєння.

Крім того, використання підходу до навчання з підкріпленням у контексті призводить до значного підвищення продуктивності, як це демонструється на наступній картинці.

Коли порівнюється з оригінальною продуктивністю на GPT-4, рівень перемог збільшується майже на 10%, а також на 13% підвищується рівень бою. Крім того, як це демонструється на наступній картинці, агент починає аналізувати та змінювати свою дію, якщо ходи, виконані у попередніх ходах, не відповідали очікуванням.

Генерація, доповнена знаннями, або KAG

Хоча реалізація навчання з підкріпленням у контексті допомагає з галюцинаціями до певної міри, це все ще може призвести до фатальних наслідків до того, як агент отримає відгук. Наприклад, якщо агент вирішує битися проти вогняного покемона з трав’яним покемоном, останній, ймовірно, переможе за один хід. Для подальшого зниження галюцинацій та покращення здатності агента приймати рішення рамки POKELLMON реалізують підхід до генерації, доповненої знаннями, або KAG, техніку, яка використовує зовнішні знання для доповнення генерації.

Тепер, коли модель генерує чотири типи відгуку, описані вище, вона анотує ходи покемонів та інформацію, дозволяючи агенту самому вивести типові відносини. У спробі зменшити галюцинації у розумових діях ще більше, рамки POKELLMON явно анотують типові переваги та слабкості суперника та покемона агента з достатніми описами. Крім того, важко запам’ятати ходи та здібності з різними ефектами покемонів, особливо оскільки їх багато. Наступна таблиця демонструє результати генерації, доповненої знаннями. Варто зазначити, що реалізацією підходу до генерації, доповненої знаннями, рамки POKELLMON能够 підвищити рівень перемог майже на 20% з існуючого 36% до 55%.

Крім того, розробники спостерігали, що коли агент отримував зовнішні знання про покемонів, він почав використовувати спеціальні ходи в потрібний момент, як це демонструється на наступній картинці.

Стабільна генерація дій

Існуючі моделі демонструють, що реалізація підходів до генерації та розумових дій може підвищити здатність великих мовних моделей вирішувати складні завдання. Замість генерації однієї дії, рамки POKELLMON оцінюють існуючі стратегії генерації, включаючи CoT або ланцюг думок, ToT або дерево думок, та самозбереження. Для ланцюга думок агент спочатку генерує думку, яка аналізує поточну ситуацію бою, а потім виводить дію, умовну на цій думці. Для самозбереження агент генерує три дії, а потім вибирає вивід, який отримав найбільшу кількість голосів. Нарешті, для підходу до дерева думок рамки генерують три дії, як і у випадку з самозбереженням, але вибирають ту, яку вони вважають найкращою після оцінки всіх дій самостійно. Наступна таблиця підсумовує продуктивність підходів до генерації.

Є тільки одна дія для кожного ходу, що означає, що навіть якщо агент вирішує перемкнути та суперник вирішує атакувати, покемон, який перемкнувся, прийме пошкодження. Зазвичай агент вирішує перемкнути, оскільки він хоче перемкнути покемона з типовою перевагою, і таким чином покемон, який перемкнувся, зможе витримати пошкодження, оскільки він був типово стійким до ходів суперника. Однак, як вище, для агента з підходом CoT розумових дій, навіть якщо потужний суперник примушує різні оберти, він діє несумісно з місією, оскільки він може не хотіти перемкнути покемона, а кілька покемонів і назад, що ми називаємо панİK переключенням. ПанІК переключення усуває можливість виконання ходів та призводить до поразок.

POKELLMON: Результати та експерименти

Перед тим, як ми обговоримо результати, важливо зрозуміти середовище бою. На початку кожного ходу середовище отримує повідомлення про запит дії від сервера та відповідає на це повідомлення в кінці, яке також містить результат виконання попереднього ходу.

  1. Спочатку парсить повідомлення та оновлює локальні змінні стану, 2. потім перекладає змінні стану у текст. Опис тексту має головним чином чотири частини: 1. Інформація про власну команду, яка містить атрибути покемонів у полі та поза полем (не використані).
  2. Інформація про команду суперника, яка містить атрибути покемонів суперника у полі та поза полем (деяка інформація невідома).
  3. Інформація про поле бою, яка включає погоду, входи до небезпеки та місцевість.
  4. Історична інформація про попередні ходи, яка містить попередні дії покемонів та зберігається у черзі логів. Великі мовні моделі приймають перекладений стан як вхідні дані та виводять дії для наступного кроку. Дія надсилається на сервер та виконується одночасно з дією, виконаною людиною.

Битва проти людських гравців

Наступна таблиця ілюструє продуктивність агента POKELLMON проти людських гравців.

Як можна побачити, агент POKELLMON демонструє продуктивність, порівнянну з гравцями ладдера, які мають вищий рівень перемог порівняно з запрошеним гравцем, а також мають великий досвід бою.

Аналіз бойових навичок

Рамки POKELLMON рідко роблять помилку у виборі ефективного ходу та перемиканні на іншого підходящого покемона завдяки стратегії генерації, доповненої знаннями.

Як показано у вищезазначеному прикладі, агент використовує тільки одного покемона, щоб перемогти всю команду суперника, оскільки він能够 вибирати різні атакувальні ходи, ті, які найбільш ефективні для суперника в цій ситуації. Крім того, рамки POKELLMON також демонструють стратегію, схожу на людську, щодо атрибуції. Деякі покемони мають хід “Toxic”, який може завдавати додаткового пошкодження на кожному ході, тоді як хід “Recover” дозволяє йому відновлювати свій HP. Виграючи з цього, агент спочатку отруює суперника, а потім використовує хід “Recover”, щоб уникнути знепритомнення.

Фінальні думки

У цій статті ми говорили про POKELLMON, підхід, який дозволяє великим мовним моделям грати у битви покемонів проти людей автономно. POKELLMON має на меті стати першим агентом, втіленим у людину, який досягає рівня людини у тактичних іграх, подібних до тих, що відбуваються у битвах покемонів. Рамки POKELLMON вводять три ключові стратегії: навчання з підкріпленням у контексті, яке споживає текстову відгуку як “нагороду” для уточнення політики генерації дій без тренування, генерація, доповнена знаннями, яка використовує зовнішні знання для протидії галюцинаціям та забезпечення того, щоб агент діяв своєчасно та правильно, та стабільна генерація дій, яка запобігає ситуації паніки при перемиканні, коли агент зустрічає сильного суперника.

Kunal Kejriwal — бекенд‑інженер, який спеціалізується на Python, PostgreSQL, Redis та хмарній інфраструктурі в GCP і AWS. Має три роки досвіду у створенні та масштабуванні виробничих систем, пише про інфраструктуру ШІ, розподілені системи та архітектуру розгортання навантажень машинного навчання.