AI 모델 및 플랫폼

포케몬 배틀을 위한 인간 수준 에이전트 POKELLMON: LLM을 활용한 접근

mm
Unite.AI를 Google의 선호 소스에 추가

대규모 언어 모델과 생성적 AI는 자연어 처리 작업에서 이전에 없던 성공을 거두었습니다. NLP 분야를 정복한 후, GenAI와 LLM 연구자의 다음 도전은 대규모 언어 모델이 텍스트에서 행동까지의 확장된 갭을 갖는 실제 세계에서 자율적으로 행동할 수 있도록 탐색하는 것입니다. 온라인 게임은 대규모 언어 모델을 구현하는 에이전트를 개발하기 위한 적절한 테스트 베이스로 간주됩니다.

예를 들어, 인기 있는 온라인 시뮬레이션 게임인 Minecraft에서 의사 결정 에이전트는 플레이어에게 세계를 탐험하고 도구를 만들고 작업을 수행하는 데 도움을 줄 수 있습니다. 또 다른 온라인 게임인 The Sims에서도 에이전트는 사회적 상호작용에서卓越한 성과를 보여주었으며 인간과 유사한 행동을 나타냅니다. 그러나 기존 게임과 비교할 때, 전술 게임은 대규모 언어 모델의 가상 게임 능력을 벤치마크하는 데 더 나은 선택일 수 있습니다. 전술 게임이 더 나은 벤치마크인 주된 이유는 승리율을 직접 측정할 수 있으며 일관된 상대, 즉 인간 플레이어와 AI가 항상 사용할 수 있기 때문입니다.

이와 같은 아이디어를 기반으로, POKELLMON은 포켓몬 배틀과 같은 전술 게임에서 인간 수준의 성과를 달성하는 세계 최초의 에이전트가 되기 위해 설계되었습니다. POKELLMON 프레임워크의 핵심에는 세 가지 주요 전략이 있습니다.

  1. 배틀에서 즉시 얻은 텍스트 기반 피드백을 소비하여 정책을 반복적으로 개선하는 문맥 내 강화 학습.
  2. 외부 지식을 활용하여 환각을 방지하고 에이전트가 적절한 시기에 행동할 수 있도록 하는 지식 증강 생성.
  3. 강력한 상대와 마주쳤을 때 패닉 스위칭 문제를 방지하는 일관된 행동 생성.

이 기사에서는 POKELLMON 프레임워크를 깊이 있게 다루고, 메커니즘, 방법론, 아키텍처 및 최신 프레임워크와의 비교를 탐구합니다. 또한 POKELLMON 프레임워크가 인간과 유사한 전투 전략과 실시간 의사 결정 능력을 어떻게 보여주는지에 대해 논의합니다.

포케몬 배틀을 위한 인간 수준 에이전트 POKELLMON: LLM을 활용한 접근

최근 몇 년 동안 대규모 언어 모델과 생성적 AI의 능력과 효율성은 놀라운 발전을 이루었습니다. 특히 자연어 처리 작업에서卓越한 성과를 보여주었습니다. 최근 개발자와 AI 연구자는 생성적 AI와 대규모 언어 모델을 실제 세계에서 자율적으로 행동할 수 있도록 하는 방법을 탐구하고 있습니다.

이전에는 개발자가 Minecraft와 The Sims와 같은 가상 시뮬레이션 게임에서 대규모 언어 모델을 구현하는 에이전트를 개발하려고 시도했습니다. 그러나 포켓몬 배틀과 같은 전술 게임이 이러한 에이전트를 개발하는 데 더 나은 선택일 수 있습니다. 포켓몬 배틀은 개발자가 트레이너의 전투 능력을 평가할 수 있으며 다른 전술 게임보다 몇 가지 이점을 제공합니다.

POKELLMON: 방법론과 아키텍처

POKELLMON 프레임워크의 전체 아키텍처는 다음 이미지에 나와 있습니다.

각 턴에서, POKELLMON 프레임워크는 이전 행동과 해당 텍스트 기반 피드백을 사용하여 정책을 반복적으로 개선하고, 외부 지식과 같은 능력/이동 효과 또는 우세/약점 관계를 현재 상태 정보에 추가합니다. 입력된 정보에 대해, POKELLMON 프레임워크는 여러 행동을 독립적으로 생성한 다음 가장 일관된 행동을 최종 출력으로 선택합니다.

문맥 내 강화 학습

인간 플레이어와 운동 선수는 현재 상태뿐만 아니라 이전 행동의 피드백과 다른 플레이어의 경험을 반영하여 결정합니다. 적절한 피드백이 플레이어가 실수에서 배우고 같은 실수를 반복하지 않도록 도와준다고 말할 수 있습니다. 적절한 피드백 없이, POKELLMON 에이전트는 같은 오류 행동에 고착될 수 있습니다.

POKELLMON 에이전트는 이전 행동의 피드백을 즉시 사용하여 정책을 반복적으로 개선하는 문맥 내 강화 학습 접근 방식을 구현합니다. 강화 학습은 기계 학습에서 인기 있는 접근 방식이며, 개발자가 정책을 개선하는 데 도움이 됩니다. 대규모 언어 모델은 언어를 해석하고 이해할 수 있으므로, 텍스트 기반 설명은 새로운 형태의 보상으로 등장했습니다.

또한, 문맥 내 강화 학습 접근 방식의 사용으로 인해 성능이 크게 향상되었습니다.

GPT-4의 원래 성능과 비교할 때, 승리율이 거의 10% 증가하고, 전투 점수가 거의 13% 증가했습니다.

지식 증강 생성

문맥 내 강화 학습을 구현하는 것은 환각을 어느 정도 방지하는 데 도움이 됩니다. 그러나 에이전트가 피드백을 받기 전에 치명적인 결과를 초래할 수 있습니다. 예를 들어, 에이전트가 불 타입의 포켓몬과 전투를 하는 경우, 불 타입의 포켓몬이 아마도 한 턴에 승리할 것입니다. 환각을さらに 줄이고 에이전트의 의사 결정 능력을 향상시키기 위해, POKELLMON 프레임워크는 지식 증강 생성 접근 방식을 구현합니다.

지식 증강 생성 접근 방식은 외부 지식을 사용하여 생성을 증강하는 기술입니다. 이제 모델이 위에서 논의한 4가지 유형의 피드백을 생성할 때, 포켓몬 이동과 정보를 주석으로 달아, 에이전트가 유형 우세 관계를 스스로 추론할 수 있도록 합니다.

또한, 지식 증강 생성 접근 방식의 구현으로 인해 승리율이 약 20% 증가했습니다.

일관된 행동 생성

기존 모델은 프롬팅과 추론 접근 방식을 구현하여 복잡한 작업을 해결하는 LLM의 능력을 향상시킵니다. POKELLMON 프레임워크는 기존 프롬팅 전략을 평가합니다.

POKELLMON 프레임워크는 각 턴에 하나의 행동만을 생성합니다. 이는 에이전트가 스위치할 때, 상대가 공격할 때, 스위치인 포켓몬이 피해를 입을 수 있음을 의미합니다.

POKELLMON: 결과와 실험

결과를 논의하기 전에, 전투 환경을 이해하는 것이 중요합니다. 각 턴의 시작에서, 환경은 서버에서 행동 요청 메시지를 받고, 이전 턴의 실행 결과를 포함하는 메시지에 응답합니다.

  1. 메시지를 구문 분석하고 로컬 상태 변수를 업데이트합니다.
  2. 상태 변수를 텍스트로 번역합니다.
  3. 전투 필드 정보를 포함합니다.
  4. 이전 행동의 기록을 포함합니다.

인간 플레이어와의 전투

다음 표는 인간 플레이어와의 전투에서 POKELLMON 에이전트의 성능을 보여줍니다.

POKELLMON 에이전트는 인간 플레이어와의 전투에서卓越한 성과를 보여주었습니다.

전투 기술 분석

POKELLMON 프레임워크는 지식 증강 생성 전략으로 인해 효과적인 이동을 선택하고, 적절한 포켓몬으로 전환합니다.

POKELLMON 프레임워크는 인간과 유사한 전투 전략과 실시간 의사 결정 능력을 보여줍니다.

최종 생각

이 기사에서는 인간 수준의 성과를 달성하는 포켓몬 배틀을 위한 에이전트인 POKELLMON에 대해 논의했습니다. POKELLMON 프레임워크는 세 가지 주요 전략을 도입합니다.

Kunal Kejriwal은 Python, PostgreSQL, Redis 및 GCP와 AWS의 클라우드 인프라를 전문으로 하는 백엔드 엔지니어입니다. 3년간 생산 시스템을 구축하고 확장한 경험을 바탕으로 AI 인프라, 분산 시스템, 그리고 머신러닝 워크로드 배포의 아키텍처에 대해 글을 씁니다.