파트너십

Google DeepMind, 15년간의 게임 연구가 EVE Online으로 이어진 과정을 개요

mm
Unite.AI를 Google의 선호 소스에 추가

Google DeepMind는 게임 분야 AI 연구의 15년 여정을 상세히 기술한 보고서를 발표했으며, 이는 EVE Online을 만든 독립 스튜디오 Fenris Creations와의 연구 파트너십으로 마무리되고, 두 조직이 EVE 우주 내에서 실행할 단계별 연구 프로그램을 제시합니다. 2026년 8월 21일 게시물은 연구소의 초기 강화학습 결과를 현재의 일반화 에이전트 작업과 연결하고, EVE 환경이 테스트할 것으로 기대되는 구체적인 능력을 명시합니다.

이 회고는 연구소의 연구 프로그램: 원시 픽셀만으로 49개의 Atari 2600 게임을 학습한 Deep Q-Network(2015년 Nature 논문에 기록); 2016년 세계 챔피언 이세돌을 이긴 AlphaGo의 승리; 인간 데이터를 배제하고 체스, 쇼기, 바둑 전반에 일반화된 AlphaGo Zero와 AlphaZero; 규칙을 알지 못한 채 플레이한 MuZero; 그리고 2019년에 스타크래프트 II에서 그랜드마스터 수준에 도달한 AlphaStar. 같은 기반이 AlphaFold에도 이어졌으며, 이는 2024년 노벨 화학상으로 인정받았습니다.

게임을 마스터하는 단계에서 그 안에서 운영하기까지

이 글은 연구소의 게임 연구 방향 전환을 설명합니다: 명확한 점수가 있는 단일 게임을 마스터하는 시스템에서, 사람이 하는 것처럼 어떤 게임 세계에서도 작동할 수 있는 에이전트로 이동하는 것입니다. 이를 위한 수단은 SIMA, 즉 Scalable Instructable Multiworld Agent이며, 화면에 보이는 것을 인식하고 일반 키보드와 마우스 조작만으로 게임 코드를 전혀 접근하지 않고 행동합니다.

SIMA 2는 2025년 11월에 Gemini 모델을 핵심으로 도입되어, 600개가 넘는 언어 따르기 기술을 보유한 초기에 비해 목표 추론, 사용자와 대화, 자기 주도적 플레이를 통한 개선으로 범위를 확장했습니다. Google DeepMind는 SIMA 2가 훈련 환경 전반에 걸쳐 인간 수준의 작업 수행 성능 격차를 크게 메우며, ASKA나 Minecraft 연구 구현과 같이 훈련되지 않은 게임에서도 성과를 보인다고 보고했습니다. 연구소가 스스로 밝힌 제한 사항은: 에이전트가 매우 긴 시간의 과업에 여전히 어려움을 겪으며, 저지연 상호작용에 필요한 컨텍스트 윈도우에 의해 제한된 짧은 기억을 사용하고, 제한된 연구 프리뷰 형태로 소수의 학계와 게임 개발자에게만 제공된다는 점입니다.

EVE 파트너십이 추가하는 내용

올해 초 EVE Online을 만든 스튜디오가 독립하면서 발표된 Fenris Creations와의 파트너십은 DeepMind에게 2003년부터 지속적으로 운영되는 영구 세계에 접근할 수 있게 합니다. EVE Online의 단일 샤드 우주는 수천 명의 플레이어가 하나의 공유 경제 안에서 실시간 수요와 공급, 그리고 전적으로 플레이어가 구축한 정치 구조를 갖추고 있습니다. Fenris Creations는 EVE Universe를 만든 독립 스튜디오로, 20년 넘게 가장 지속적인 게임 세계 중 하나를 구축해 왔습니다.

이 글은 환경이 기대하는 네 가지 능력을 제시합니다: 잊지 않는 지속 학습, 현재 컨텍스트 윈도우를 넘어서는 기억, 수주 또는 수개월에 걸친 장기 계획, 그리고 협력, 경쟁, 협상, 경제를 아우르는 복합적인 다중 에이전트 역학.

“Google DeepMind와 함께 우리는 AI가 다른 어떤 게임 환경도 요구하지 않는 시간 규모에서 학습하고, 적응하며, 기억해야 하는 미지의 영역으로 나아가고 있습니다,” 라고 Fenris Creations의 CEO인 Hilmar Pétursson은 글에서 말했습니다.

파트너십은 세 개의 구별된 환경으로 구성됩니다. EVE Online은 대규모 영구 우주를 제공하고; EVE Vanguard는 1인칭, 빠른 전술 의사결정을 추가하며; EVE Frontier는 프로그래머블 스마트 어셈블리를 통해 규칙 자체가 변할 수 있는 세계를 제시합니다.

연구 프로그램은 단계적 경로를 따릅니다: 먼저 실시간 플레이어와 분리된 오프라인 EVE Online 인스턴스에서 시작하고, EVE Frontier를 통해 인간과 에이전트가 영구 세계에서 어떻게 공존할 수 있는지를 연구하며, 능력이 성숙해질 때만 라이브 게임에 적용됩니다. 협업을 통해 이미 플레이어에게 제공되는 시스템은: Aura Guidance, 2026년 2월 17일 프로토타입으로 출시되어 Gemini를 활용해 실제 Rookie Help 교환에서 검증된 질문을 새 플레이어에게 답변하고, 새 플레이어 유지율 향상을 측정하는 통제된 A/B 테스트를 진행하고 있습니다.

이 글이 제시한 더 긴 흐름은 Atari의 원시 픽셀에서 23년 된 영구 우주까지 이어지며: 각 환경은 다음에 필요한 능력을 강제하기 위해 선택되었습니다. EVE 우주는 이러한 접근법의 현재 테스트이며, 오프라인 샌드박스가 지금 작업이 시작되는 곳입니다.

Jonas Reeve는 Unite.AI의 AI 생성 분석가로, 인지 AI, 인공 일반 지능(AGI), 기계 지능의 이론적 기초에 중점을 둡니다. 그의 연구는 학습, 추론, 기억, 추상화가 생물학적 및 인공 시스템에서 어떻게 나타나는지 탐구하며, 현대적인 AI 아키텍처와 인지 과학 및 마음의 철학의 오래된 질문 사이의 연결을 그립니다.
개념적이고 반성적인 접근 방식을 통해 Jonas는 추론 모델, 에이전트 시스템, 출현적 인지, 정렬 이론과 같은 프레임워크를 조사하여 AGI로의 진보가 실제로 무엇을 의미하는지 및 무엇을 의미하지 않는지 명확히 합니다. 그는 타임라인이나 호재를 추구하는 대신 첫 번째 원칙, 개념적 엄격성, 현재 모델의 한계를 강조합니다.
Jonas Reeve가 작성한 기사들은 AI로 생성되어 Unite.AI의 편집 팀에 의해 검토되어 고급 AI 개념에 대한 정확성, 명확성, 책임있는 논의를 보장합니다.