사상 리더
게임에서 생성된 데이터는 AI 훈련에서 가장 과소평가되는 자원일 수 있다

AI 회사들은 지난 5년 동안 인터넷에 있는 모든 텍스트, 이미지, 그리고 공개적으로 사용 가능한 모든 데이터를 소비해왔다. 그러나 이 공급은 유한하며, 우리는 데이터가 더 이상 AI의 발전을 지속시키기 위해 필요한 속도를 따라가지 못하는 지점에 가까워지고 있다.
그러나 AI 산업이 주로 간과한 명백한 후보가 있다.
나는 게임 시스템을 개발하는 것을 직업으로 하고 있으며, 게임을 통해 흐르는 데이터는 대부분의 AI 연구자가 작업한 적이 없는 것과 다르다. 그러나 게임 밖에서는 거의 아무도 이를 주목하지 않는다.
게임 플랫폼은 매일 수십 테라바이트의 행동 데이터를 생성하며, 이는 실시간 결정, 경제 활동, 그리고 사회적 상호작용을 포함하는 일관된 물리적 규칙을 기반으로 하는 구조화된 데이터이다.
이러한 데이터 중 거의 아무 것도 AI 훈련에 사용되지 않았다. 그러나 이를 사용한 회사들, 즉 DeepMind와 NVIDIA는 분야에서 가장 중요한 돌파구를 달성하였다.
AI의 데이터 문제
Epoch AI의 연구에 따르면, 공개적으로 사용 가능한 인간 생성 텍스트 데이터의 재고는 2026년과 2032년 사이에 완전히 사용될 것으로 예상된다. ChatGPT, Gemini, Claude를 위한 모델들은 이미 인터넷이 제공할 수 있는 거의 모든 것을 소비하였다.
합성 데이터 또는 AI가 자체적으로 생성하여 다시 AI에 공급하는 텍스트는 산업의 일시적인 해결책이다. 그러나 자체 출력으로 훈련된 모델은 시간이 지남에 따라 모델 붕괴라는 문서화된 현상으로 인해 퇴화한다.
나는 이 분야가 실제로 필요한 것은 원인과 결과가 실시간으로 발생하며 모든 행동이 측정 가능한 결과를 가진 풍부한 상호작용 멀티모달 정보라고 믿는다. 게임은 정확히 이러한 것을 생성하며, 이는 거의 다른 어떤 것도 따라갈 수 없는 규모이다.
게임 플랫폼은 매일 수십 테라바이트의 행동 데이터를 시스템을 통해 밀어넣는다. 플레이어의 움직임, 전략적 선택, 반응 시간, 경제적 거래, 그리고 사회적 상호작용은 모두 구조화된 시간戳 데이터 스트림을 통해 흐르며, 이는 대부분의 AI 연구자가 작업한 적이 없다.
最近의 학술 논문은 게임에서 생성된 데이터에 대한 9가지 분류를 제시하며, 이러한 정보의 대부분은 아직 AI 산업에 의해 완전히 활용되지 않았다고 주장한다.
나는 내 경험으로도 이를 확인할 수 있다. 우리 게임 시스템을 통해 흐르는 데이터의 양은 다른 AI 연구 분야에서 금광으로 간주될 것이다. 그러나 게임에서는 데이터가 보관되거나 폐기된다.
게임 데이터는 왜 다르다
게임 엔진을 오래 사용하면, 대부분의 AI 연구자가 아직 요청하지 않은 구조화된 데이터를 가지고 있는 것을 깨닫게 된다. 매 세션은 일관된 물리적 규칙을 기반으로 한 동기화된 물리학, 플레이어 행동, 그리고 시스템 수준의 원인과 결과를 생성한다.
게임 엔진은 물리학을 강제한다. 물체는 일관된 규칙에 따라 떨어지고, 충돌하며, 부서진다. 이는 데이터가 모델이 텍스트 상관관계에서 추측해야 하는 패턴이 아니라 시스템 수준에서 인과관계를 내장한다는 것을 의미한다.
플레이어가 투사체를 발사할 때, 엔진은 궤도, 바람 저항, 그리고 충돌을 계산한다. AI는 물리 법칙을 직접적으로 보여주는 환경에서 학습한다. 이는 물리 법칙을 통계적 근사로 처리하는 환경과는 다르다.
또한 멀티모달 정렬 문제가 있다. 게임에서 시각 데이터, 오디오 큐, 플레이어 입력, 환경 상태는 모두 동시에 발생하며 함께 로깅된다. 이러한 자연스러운 동기화는 실제 데이터셋에서 비용이 많이 드는 것을 복제한다. 여기서 연구자들은 일반적으로 각 모달리티를 수동으로 레이블링하고 정렬해야 한다.
게임은 또한 규모에 따라 에지 케이스를 생성한다. 노 맨즈 스카이는 18 퀸틸리온 개의 고유한 행성을 가지고 있으며, 이는 AI에게 매우 중요하다. 에지 케이스는 모델이 신뢰성 있게 작동하는지 또는 위험하게 실패하는지 결정한다.
또한 게임은 출현하는 복잡성을 생성한다. 오픈AI의 에이전트가 간단한 숨고 숨기 게임에 참여했을 때, 에이전트는 수백만 라운드 동안 6가지의 구체적인 전략을 개발하였다. 이는 모두 프로그래밍되지 않았으며, 게임 환경 내에서 경쟁으로부터 출현하였다.
에이전트는 이동 가능한 물체에서 쉘터를 구축하고, 램프를 사용하여 요새를 침공하며, 물리학 결함을 이용하여 박스를 벽을 넘어 서핑하였다. 이는 모두 코드에 의해 프로그래밍되지 않았으며, 게임 환경 내에서 출현하였다.
이러한 자체 생성된 복잡성은 정확히 AI 연구가 규모에서 필요로 하는 것이다. 게임은 이러한 것을 신뢰성 있게 생성하는 유일한 환경이다.
보드 게임에서 노벨상까지
게임에서 훈련된 AI가 실제 세계로 전환되는 가장 명확한 증거는 노벨상을 수상한 시스템이다. 이는 내가 게임과 AI에 대한 경력을 쌓은 이유를 사람들에게 설명할 때 항상 언급하는 예이다.
DeepMind는 2016년에 AlphaGo를 시작하여 AlphaZero를 개발하였다. AlphaZero는 인간의 지식 없이 체스, 고, 그리고 쇼기를 가르쳤다. AlphaZero의 아키텍처는 이후 AlphaFold의 기반이 되었다. AlphaFold는 50년간의 단백질 접합 문제를 해결하여 2024년 노벨 화학상을 수상하였다.
DeepMind의 CEO Демис Хассабис는 이 파이프라인에 대해 공개적으로 말하였다. 그는 게임이 결코 최종 목표가 아니라, 실제 과학적 문제에 적용하기 전에 AI 기술을 개발하고 테스트하는 가장 효율적인 방법이라고 말했다.
나는 이를 읽고 게임 개발 내부에서 몇 년 동안 본 것을 정확히 설명한 것으로 느꼈다.
이 트레이젝토리는 이후 분야 전반에 걸쳐 반복되었다. 오픈AI가 처음으로 표준화한 강화 학습 환경은 지금 로봇공학, 자율 주행 자동차, 그리고 산업 자동화 연구를 지원한다.
에이전트, 환경, 행동, 그리고 보상으로 구성된 게임과 같은 구조는 연구 편의성으로 시작하여 이제 물리적 세계에서 행동해야 하는 모든 AI 시스템의 기본 프레임워크가 되었다.
게임은 새로운 시뮬레이션 계층이다
2025년 12월, NVIDIA는 NitroGen을 출시하였다. 이는 40,000시간의 게임 플레이와 1,000개 이상의 타이틀에서 훈련된 기초 모델이다. 모델은 공개적으로 사용 가능한 게임 플레이 비디오를 관찰하고, 컨트롤러 오버레이에서 플레이어 행동을 추출하며, 원시 픽셀에서 직접 게임을 학습한다.
NitroGen은 이전에 보지 못한 게임에서 최대 52%의 작업 성공률을 보여주었다. 그러나 실제 중요성은 아키텍처에 있다.
NitroGen은 NVIDIA의 GR00T 로봇공학 프레임워크에서 실행되며, 이는 회사가 물리적 AI와 시뮬레이션에서 실제로 전환하는 데 사용하는 동일한 기반이다. 게임 에이전트와 공장 로봇은 동일한 기본 시스템을 공유한다.
NVIDIA의 Jim Fan은 이 프로젝트를 “액션을 위한 GPT”를 구축하려는 시도라고 설명하였다. 이는 일반적인 목적으로 학습하여 모든 환경에서 작동할 수 있는 모델이다.
나는 게임 시스템을 개발하며, 이러한 모델이 소비하는 정확한 데이터를 생성한다. 이는 내가 일하는 산업에 대해 거의 과장할 수 없다.
이것은 NVIDIA에만 국한된 것이 아니다. Waymo는 자율 주행 자동차를 훈련하기 위해 20억 마일의 시뮬레이션을 기록하였다. 이는 게임 엔진 스타일의 환경에서 너무 위험하거나 희귀한 시나리오를 재현한다.
외과 플랫폼은 게임 엔진을 기반으로 Dramatic한 성능 개선을 보여주었다. 도시 계획자는 도시 규모의 교통 최적화를 위해 유사한 도구를 사용한다.
외과 플랫폼은 게임 엔진을 기반으로 Dramatic한 성능 개선을 보여주었다. 도시 계획자는 도시 규모의 교통 최적화를 위해 유사한 도구를 사용한다. 게임 엔진은 이제 물리적 세계에서 AI가 학습해야 하는 모든 환경에서 유니버설 시뮬레이션 계층이 되었다.
누구도 이야기하지 않는 인프라
人们이 AI 인프라를 논의할 때, 데이터 센터, GPU 클러스터, 컴퓨팅을 의미한다. 내가 게임에서 일한 모든 시간 동안, 나는 AI 공간에서 게임 환경을 같은 맥락에서 언급하는 사람을 한 손으로 셀 수 있다. 이 단절은 매우 빠르게 닫힐 것이다.
이것은 전통적인 데이터셋이 마르면 더 명백해질 것이다. 가장 풍부한 상호작용 데이터를 생성하는 산업은 결국 AI 연구의 중심으로 이동할 것이며, 게임, 시뮬레이션, 그리고 가상 세계는 이 간격을 메우는 데 더 잘 위치해 있다.
자금은 이미 이러한 추세를 따르고 있다. 2025년에 게임 부문에서 AI는 45.4억 달러로 평가되었으며, 2035년에는 810억 달러에 이를 것으로 예상된다.
나는 이야기하는 대부분의 게임 스튜디오는 여전히 자신을 엔터테인먼트 회사로 생각한다. 그러나 시스템이 다음 세대의 AI 모델이 훈련에 필요한 정확한 데이터를 생성한다면, 이는 인프라 비즈니스에 속한다. 이는 계획에 따라서가 아니다.












