파트너십

Google DeepMind, 15년간의 게임 AI 연구를 EVE Online으로 확장

mm
Unite.AI를 Google의 선호 소스에 추가

Google DeepMind는 게임 분야에서 15년에 걸친 AI 연구 여정을 상세히 발표했으며, 이는 EVE Online의 독립 스튜디오인 Fenris Creations와의 연구 파트너십으로 정점에 이르고, 두 조직이 EVE 우주 안에서 진행할 단계별 연구 프로그램을 제시합니다. 2026년 8월 21일 게시물은 연구소의 초기 강화학습 결과를 현재의 일반화 에이전트 작업과 연결하고, EVE 환경이 테스트할 것으로 기대되는 구체적인 능력을 명시합니다.

회고는 연구소의 연구 프로그램을 구축한 게임 결과들의 연쇄를 다룹니다: 원시 픽셀만으로 49개의 Atari 2600 게임을 학습한 Deep Q-Network은 2015년 Nature 논문에 기록되었습니다; 2016년 AlphaGo가 세계 챔피언 이세돌을 꺾은 승리; 인간 데이터를 배제하고 체스, 쇼기, 바둑 전반에 일반화한 AlphaGo Zero와 AlphaZero; 규칙을 알지 못한 채 플레이한 MuZero; 그리고 2019년 StarCraft II에서 그랜드마스터 수준에 도달한 AlphaStar. 게시물은 동일한 기반이 AlphaFold에도 이어졌으며, 이는 2024년 화학 분야 노벨상으로 인정받은 단백질 구조 시스템이라고 언급합니다.

게임을 마스터하는 것에서 그 안에서 운영하기까지

게시물은 연구소의 게임 연구가 한 가지 명확한 점수를 가진 단일 게임을 마스터하는 시스템에서, 사람이 하는 것처럼 어떤 게임 세계에서도 작동할 수 있는 에이전트로 전환되는 변화를 제시합니다. 이를 위한 매개체는 SIMA, 즉 Scalable Instructable Multiworld Agent이며, 화면에 보이는 플레이어의 시야를 인식하고 게임 코드에 접근하지 않은 채 일반 키보드와 마우스 조작으로 행동합니다.

SIMA 2는 2025년 11월에 Gemini 모델을 핵심으로 도입되어, 첫 번째 버전이 보유한 600여 개 이상의 언어 따르기 기술을 넘어 목표에 대한 추론, 사용자와의 대화, 자체 주도 플레이를 통한 향상을 가능하게 했습니다. Google DeepMind는 SIMA 2가 훈련 환경 전반에 걸쳐 인간 수준의 작업 완수 성능과의 격차를 크게 줄였으며, ASKA와 Minecraft 연구 구현 등 학습되지 않은 게임에서도 성과를 보인다고 보고합니다. 연구소가 직접 밝힌 제한 사항은: 에이전트가 매우 긴 시간 규모의 과제에 여전히 어려움을 겪으며, 저지연 상호작용에 필요한 컨텍스트 윈도우에 제한된 짧은 기억을 사용하고, 현재는 소수의 학계 및 게임 개발자에게만 제한된 연구 프리뷰 형태로 제공된다는 점입니다.

EVE 파트너십이 추가하는 것

올해 초 EVE Online을 만든 스튜디오가 독립하면서 공개된 Fenris Creations 파트너십은 DeepMind에게 2003년부터 지속적으로 운영되고 있는 영구 세계에 대한 접근 권한을 제공합니다. EVE Online의 단일 샤드 우주는 수천 명의 플레이어가 하나의 공유 경제 안에서 실제 수요와 공급 역학 및 전적으로 플레이어가 구축한 정치 구조를 경험합니다. Fenris Creations, 즉 EVE Universe를 만든 독립 스튜디오는 20년 이상을 투자해 게임 역사상 가장 지속적인 세계 중 하나를 구축해 왔습니다.

게시물은 환경이 시험할 네 가지 능력을 제시합니다: 잊지 않는 지속 학습, 현재 컨텍스트 윈도우를 넘어서는 기억 확장, 수주 또는 수개월에 걸친 장기 계획, 그리고 협력·경쟁·협상·경제를 아우르는 복합 다중 에이전트 역학.

“Google DeepMind와 함께 우리는 AI가 다른 어떤 게임 환경도 요구하지 않는 시간 규모에서 학습하고, 적응하며, 기억해야 하는 미지의 영역으로 나아가고 있습니다,” 라고 Fenris Creations의 CEO인 Hilmar Pétursson이 게시물에서 말했습니다.

파트너십은 세 가지 별도 환경으로 확장됩니다. EVE Online은 대규모 영구 우주를 제공하고; EVE Vanguard는 1인칭, 빠른 전술 의사결정을 추가하며; 프로그래머블 스마트 어셈블리를 갖춘 EVE Frontier는 규칙 자체가 변할 수 있는 세계를 제시합니다.

연구 프로그램은 단계적 경로를 따릅니다: 먼저 라이브 플레이어와 분리된 오프라인 EVE Online 인스턴스에서 시작하고, EVE Frontier를 거쳐 인간과 에이전트가 영구 세계에서 어떻게 공존하는지를 연구하며, 역량이 충분히 성숙했을 때만 라이브 게임에 적용합니다. 협업을 통해 만든 한 시스템은 이미 플레이어에게 제공되고 있습니다: Aura Guidance, 2026년 2월 17일 프로토타입으로 출시되어 Gemini를 활용해 실제 Rookie Help 교환에서 검증된 질문 은행을 기반으로 신규 플레이어 질문에 답변하며, 신규 플레이어 유지율 향상을 측정하는 통제된 A/B 테스트로 운영되고 있습니다.

게시물이 제시한 긴 여정은 Atari의 원시 픽셀에서 23년 된 영구 우주까지 이어집니다: 각 환경은 연구소가 일반 에이전트에 필요하다고 생각하는 다음 능력을 강제하기 위해 선택되었습니다. EVE 우주는 이 접근법의 현재 시험대이며, 오프라인 샌드박스가 지금 작업이 시작되는 곳입니다.

Jonas Reeve는 Unite.AI에서 AI 생성 분석가로 활동하며 인지 AI, 인공 일반 지능(AGI) 및 기계 지능의 이론적 기반에 집중합니다. 그의 연구는 학습, 추론, 기억, 추상화가 생물학적 시스템과 인공 시스템 모두에서 어떻게 나타나는지를 탐구하고, 현대 AI 아키텍처와 인지 과학 및 마음 철학의 오랜 질문들 사이의 연결을 제시합니다.

개념적이고 반성적인 접근 방식을 통해 Jonas는 추론 모델, 에이전트 시스템, 발생 인지, 정렬 이론과 같은 프레임워크를 검토하며, AGI에 대한 진전이 실제로 의미하는 바와 의미하지 않는 바를 명확히 하고자 합니다. 일정이나 과대광고를 쫓기보다 그는 기본 원칙, 개념적 엄밀성, 그리고 현재 모델의 한계를 강조합니다.

Jonas Reeve가 작성한 기사들은 AI 생성이며, 정확성, 명확성 및 고급 AI 개념에 대한 책임 있는 논의를 보장하기 위해 Unite.AI 편집팀이 검토합니다.