AI 모델 및 플랫폼
스크래치에서 배우기 위한 숨겨진 비용: 사전 훈련된 세계 모델이 강화 학습을 재정의하는 방법

오랫동안 강화 학습(RL)의 핵심 아이디어는 AI 에이전트가 새로운 작업을 스크래치에서 배우는 것이었다. 이 “tabula rasa” 접근법은 복잡한 게임을 마스터하는 AI와 같은驚異적인 성과를 가져왔지만, 매우 비효율적이며, 심지어 단순한 행동을 배우기 위해大量의 데이터와 계산이 필요하다.
이제 근본적인 변화가 진행 중이다. 에이전트는 더 이상 스크래치에서 시작하지 않아도 된다. 대신, 에이전트는 사전 훈련된 “세계 모델”을 사용할 수 있다. 이러한 모델은 환경이 어떻게 작동하는지에 대한 지식을 가지고 있으므로, 새로운 작업을 배우기 위해 필요한 데이터와 시간을 크게 줄일 수 있다. 이 변화는 자연어 처리와 컴퓨터 비전 작업에서 기초 모델이 이미 변화를 가져온 더 큰 추세의 일부이다.
스크래치에서 배우기 위한 숨겨진 비용
전통적인 강화 학습 에이전트는 어려운 도전을 직면한다. 그들은 환경이 어떻게 보이는지, 어떻게 반응하는지, 그리고 어떤 행동이 보상을 가져오는지를 배우야 한다. 이러한 학습 부담은 심지어 단순한 작업도 수백만 개의 상호작용을 필요로 하기 때문에, 에이전트가 잘 수행하기 위해 오랜 시간이 걸린다. OpenAI Five와 같은 대규모 시스템은 도타 2에서 인간 수준의 성과를 달성했지만, 수개월의 훈련과 여러 번의 설계 반복을 거쳤다. 아키텍처 또는 알고리즘이 변경될 때마다 모델을 스크래치에서 다시 훈련해야 하므로, 개발 프로세스는 매우 비용이 많이 들고 시간이 많이 걸린다. 이러한 비효율성으로 인해 대규모 자원을 갖지 못한 연구자들은 계산적으로 무거운 문제에 대해 작업하기가 어려워졌다. 스크래치에서 배우는 접근법은 또한 많은 계산을浪費한다. 에이전트의 설계가 변경될 때마다 에이전트가 이미 배운 모든 것을 버리기 때문이다.
로봇공학에서 스크래치에서 배우기 위한 데이터 요구 사항은 특히 도전적이다. 물리적 로봇은 시뮬레이션된 로봇만큼 빠르게 데이터를 수집할 수 없으므로, 학습에 필요한 상호작용을 수행하는 것은 비현실적이다. 안전 문제는 또 다른 어려움을 추가한다. 로봇은 해를 끼치거나 손상을 입히는 행동을 피해야 하기 때문이다. 이러한 제한으로 인해 강화 학습은 실제 세계에서 가장 큰 영향을 미칠 수 있는 영역에서 확장되지 못했다.
세계 모델作为 환경 시뮬레이터
세계 모델은 인간이 어떻게 배우는지에서 영감을 얻었다. 영아들은 공백의 상태에서 시작하지 않는다. 그들은 공식, 사람, 공간에 대한 기본적인 이해를 먼저 개발한다. 마찬가지로, AI 에이전트는 보상을 통해 배우기 전에 이미지를 통해 환경에 대해 배우는 것을 시작할 수 있다.
세계 모델은 본질적으로 환경이 어떻게 작동하는지에 대한 예측을 제공하는 AI 시스템이다. 관찰을 행동으로 매핑하는 것보다, 환경이 행동에 어떻게 반응하는지 예측한다. 이러한 예측 능력으로 인해 에이전트는 다양한 시나리오를 상상하고 실제 시도를 하지 않고 가능한 행동을 테스트할 수 있다. 본질적으로, 모델은 에이전트가 계획을 수립하는 데 사용할 수 있는 내부 시뮬레이터이다.
일부 가장 큰 돌파구는 자율 학습과 생성 모델링을 강화 학습과 결합하여 달성되었다. Dreamer, World Models, PlaNet과 같은 방법은 에이전트가 내부 시뮬레이션에서 상상하고 계획할 수 있게 한다. 실제 환경과 상호작용하는 것보다, 에이전트는 “꿈꾸는” 세계에서 훈련을 받는다. 이는 학습을 훨씬 더 효율적으로 만든다.
미세 조정에서 사전 훈련으로: 강화 학습의 접근 방식의 변화
세계 모델의 출현으로 인해 강화 학습 분야는 자연어 처리와 컴퓨터 비전에서 이미 변화를 가져온 것과 같은 변화를 겪고 있다. 대규모 언어 모델(LLM)은大量의 데이터에 사전 훈련을 통해 놀라운 능력을 얻었다. 그런 다음 특정 작업에 미세 조정을 적용한다. 강화 학습에서도 같은 아이디어가 적용되고 있다. 일반적인 사전 훈련을 시작으로, 특정 작업에 적용한다.
사전 훈련된 세계 모델은 강화 학습 에이전트가 실제로 배우야 하는 것을 변경하고 있다. 환경이 어떻게 작동하는지부터 배우는 대신, 에이전트는 이미 알고 있는 것을 특정 작업에 적용하는 데 중점을 둔다. 즉, 목표는 환경을 배우는 것이 아니라 환경 내에서 행동하는 것이다. 이는 학습을 훨씬 더 빠르고 데이터 효율적으로 만든다. 예를 들어, OpenAI의 Sora와 DeepMind의 Genie와 같은 사전 훈련된 비전-언어-행동 모델은 에이전트가 복잡한 장면을 이해하고 행동의 결과를 예측할 수 있게 한다. 이 새로운 접근 방식은 강화 학습을 단일 작업 학습자에서 기초 에이전트로 변환한다. 기초 에이전트는僅僅 조금의 미세 조정이나 프롬프트로 다양한 도메인에 빠르게 적응할 수 있다. 또한 에이전트는 전통적인 방법보다 훨씬 적은 데이터로 작업을 해결할 수 있으며, 최종 성능을 유지하거나 개선한다. 이는 실제 세계의 도전에 빠르게 적응하고 효율적으로 작동하는 AI 시스템을 만들기 위한 주요 단계이다.
세계 모델이 지능을 가능하게 하는 방법
본질적으로, 세계 모델은 경험을 컴팩트하고 예측 가능한 표현으로 변환한다. 그들은 “X를 하면 다음에 무엇이 일어날까?” 또는 “Y를 달성하기 위한 행동의 순서는 무엇일까?”와 같은 질문에 대답할 수 있다. 이러한 예측 능력은 강화 학습 에이전트에게 세 가지 주요 이점을 제공한다:
- 상호작용 없이 시뮬레이션: 에이전트는 내부 세계 모델에서 수천 개의 가능한 미래를 상상하여 실제 세계의 비싼 탐索를 제거할 수 있다.
- 계획 및 추론: 내부 모델을 통해 에이전트는 장기적인 결과를 평가하고 반응적인 행동을 넘어서서 결정할 수 있다.
- 전이 학습: 세계 모델은 일반적인 구조를 캡처하므로 다양한 작업에 재사용할 수 있으며, 다시 훈련하는 비용을 크게 줄인다.
사전 훈련된 에이전트의 출현하는 생태계
잘 훈련된 세계 모델의 가장 인상적인 능력 중 하나는 제로샷 작업 해결이다. 제로샷 강화 학습에서 에이전트는 추가적인 훈련이나 계획 없이 새로운 작업을 즉시 처리할 수 있다. 이는 보상 중심의 강화 학습에서 제어 가능한 에이전트로의 근본적인 변화이다. 이러한 에이전트는 임의의 지시를 따를 수 있다. 이러한 에이전트는 시나리오를 상상하는 것과 같은 방식으로 다양한 목표에 적응할 수 있다.
이 개념을 중심으로 전체 생태계가 형성되고 있다. 주요 연구 랩은 텍스트, 비전, 로봇공학, 시뮬레이션을 아우르는 범용 에이전트를 구축하고 있다. OpenAI의 Sora와 Google (GOOGL ) DeepMind의 World Model RL과 같은 프로젝트는 이러한 에이전트의 초기 예이다. 이러한 시스템은 멀티모달 인식, 메모리, 제어를 통합하여 물리적 및 디지털 환경에 대해 추론할 수 있는 프레임워크를 제공한다.
同時에, 강화 학습을 서비스(RLaaS)로 제공하는 것이 이러한 도구를 널리 사용할 수 있게 한다. 개발자는 더 이상 에이전트를 스크래치에서 구축하지 않아도 되고, 로봇공학, 게임, 또는 산업 자동화에 대한 사전 훈련된 의사 결정 모델을 미세 조정할 수 있다. 이는 언어 응용 프로그램을 변革한 LLM을 서비스와 같은 방식이다. 이러한 발전은 “에이전트 훈련”에서 “지능 배포”로의焦点을 이동시키고, 진입 장벽을 낮추고, 실제 세계의 적용 가능성을 확대한다.
도전과 열린 질문
사전 훈련된 세계 모델링에도 불구하고, 여전히 여러 도전과 열린 질문이 있다. 주요 문제 중 하나는 모델 편향이다. 사전 훈련된 모델의 세계 이해가 불완전하거나 왜곡된 경우, 에이전트가 결함이 있는 행동을 배우게 할 수 있다. 확장성 또한障礙이다. 복잡한 환경에 대한 정확한 세계 모델을 구축하는 것은大量의 계산 자원을 필요로 한다. 또한, 시뮬레이션 또는 인터넷 기반 데이터에 훈련된 모델이 실제 물리적 환경에서 신뢰성 있게 수행하는 데 어려움을 겪는 현실 간격 문제가 있다. 마지막으로, 에이전트가 더 자율적으로 되는 경우, 안전 및 윤리 문제가 중요해지므로, 안전한 탐색과 적절한 정렬이 필수적이다. 이러한 도전을 극복하기 위해서는 모델 해석, 불확실성 추정, 안전 지향적 학습과 같은 분야에서 진행이 필요하다.
결론
강화 학습은 근본적인 변화를 겪고 있다. 이제는 더 이상 새로운 작업을 위해 AI를 스크래치에서 훈련시키지 않는다. 대신, 환경이 어떻게 작동하는지에 대한 내부 시뮬레이터인 사전 훈련된 “세계 모델”을 사용한다. 이를 통해 에이전트는 새로운 작업을 배우기 위해 훨씬 적은 데이터와 시간이 필요하다. 이는 강화 학습을 좁고 비효율적인 프로세스에서 더 유연하고 확장 가능한 접근 방식으로 전환시켜, 실제 세계의 도전에 빠르게 적응할 수 있는 AI를 만들기 위한 길을 열어준다.












