AI 모델 및 플랫폼

다이아몬드: 비주얼 디테일이 중요하다 – 아타리와 확산을 위한 세계 모델링

mm
Unite.AI를 Google의 선호 소스에 추가

2018년, 신경망 세계 모델의 맥락에서 강화 학습의 아이디어가 처음 소개되었고, 곧 이 기본 원리는 세계 모델에 적용되었다. 강화 학습을 구현하는 일부 유명한 모델로는 Dreamer 프레임워크가 있으며, 이는 재귀 상태 공간 모델의 잠재 공간에서 강화 학습을 소개했다. DreamerV2는 이산적인 잠재 변수의 사용이 복합 오류를 줄일 수 있음을 보여주었고, DreamerV3 프레임워크는 고정된 하이퍼파라미터로 다양한 도메인에서 인간과 같은 성능을 달성할 수 있었다.

또한, 이미지 생성 모델과 세계 모델 사이에 유사성이 있으며, 생성적 비전 모델의 진행이 세계 모델에ประโยชน을 줄 수 있다. 자연어 처리 프레임워크에서 트랜스포머의 사용이 인기를 얻은 이후, DALL-E와 VQGAN 프레임워크가 등장했다. 이러한 프레임워크는 이산적인 오토인코더를 사용하여 이미지들을 이산적인 토큰으로 변환했으며, 순차적 모델링 능력을 활용하여 텍스트에서 이미지로의 생성 모델을 구축했다.同時에, 확산 모델이 인기를 얻었으며, 현재 확산 모델은 고해상도 이미지 생성을 위한 지배적인 패러다임으로 자리 잡았다. 확산 모델과 강화 학습의 능력으로 인해, 두 접근 방식을 결합하여 확산 모델의 유연성을 활용하고, 궤도 모델, 보상 모델, 플래너 및 오프라인 강화 학습의 데이터 증강 정책으로 사용하는 시도가 이루어지고 있다.

세계 모델은 강화 학습 에이전트를 안전하게 효율적으로 훈련시키는 유망한 방법을 제공한다. 전통적으로, 이러한 모델은 환경 동역학을 시뮬레이션하기 위해 이산적인 잠재 변수의 시퀀스를 사용한다. 그러나 이러한 압축은 강화 학습에 중요할 수 있는 시각적 세부 사항을 무시할 수 있다.同時에, 확산 모델은 이미지 생성을 위해 인기를 얻었으며, 전통적인 이산적인 잠재 변수를 사용하는 방법에 도전한다. 이러한 변화를 영감으로, 본 문서에서는 다이아몬드(DIffusion As a Model Of eNvironment Dreams)라는 확산 세계 모델 내에서 훈련된 강화 학습 에이전트에 대해 논의한다. 우리는 확산을 세계 모델링에 적합하게 만드는 필요한 설계 선택을 탐구하고, 향상된 시각적 세부 사항이 에이전트의 성능을 향상시킨다는 것을 보여준다. 다이아몬드는 아타리 100k 테스트에서 새로운 벤치마크를 설정하며, 세계 모델 내에서 완전히 훈련된 에이전트 중最高의 평균 인간 정규화 점수 1.46를 달성했다.

다이아몬드: 디퓨전을 이용한 환경 꿈의 모델

세계 모델 또는 환경의 생성 모델은 에이전트가 환경에 대해 계획하고推論하는 데 중요한 구성 요소로 등장하고 있다. 강화 학습의 사용은 최근에 상당한 성공을 거두었지만, 강화 학습을 구현하는 모델은 샘플 비효율성을 가지고 있어 현실 세계 응용에 큰 제한이 있다.另一方面, 세계 모델은 다양한 환경에서 강화 학습 에이전트를 효율적으로 훈련시키는 능력을 보여주었으며, 샘플 효율성을 크게 개선하여 모델이 실제 경험에서 학습할 수 있게 한다. 최근의 세계 모델링 프레임워크는 일반적으로 환경 동역학을 이산적인 잠재 변수의 시퀀스로 모델링하며, 모델은 잠재 공간을 이산화하여 다단계 시간 지평에서 복합 오류를 피한다. 이러한 접근 방식은 상당한 결과를 낼 수 있지만, 정보 손실과 재구성 품질의 손실, 일반성의 손실과 관련이 있다. 정보 손실은 실제 세계 시나리오에서 정보가 잘 정의되어야 하는 경우, 예를 들어 자율 주행 자동차 훈련과 같은 경우에 큰 장애물이 될 수 있다. 이러한 작업에서, 작은 변경이나 시각적 입력의 세부 사항, 예를 들어 교통 신호의 색상이나 앞의 차량의 방향 지시등이 에이전트의 정책을 변경할 수 있다. 이산적인 잠재 변수의 수를 증가시키면 정보 손실을 피할 수 있지만, 계산 비용을 크게 증가시킨다.

또한, 최근 몇 년 동안 확산 모델이 고해상도 이미지 생성 프레임워크에서 지배적인 접근 방식으로 등장했다. 이러한 프레임워크는 확산 모델을 사용하여 노이즈 프로세스를逆转시키고, 직접적으로 잘 정립된 접근 방식과 경쟁하며, 세계 모델링에서 이산화를 제거하기 위한 유망한 대안을 제공한다. 확산 모델은 조건화가 쉽고, 복잡한 다중 모드 분포를 유연하게 모델링할 수 있으며, 모드 붕괴 없이 이러한 특성이 세계 모델링에 중요하다. 이러한 특성은 세계 모델링에서 중요하며, 조건화는 세계 모델이 에이전트의 행동을 정확하게 반영하도록 하며, 다중 모드 분포 모델링은 에이전트에게 더 다양한 훈련 시나리오를 제공하여 전체 성능을 향상시킨다.

다이아몬드(DIffusion As a Model Of eNvironment Dreams) 프레임워크는 이러한 특성을 기반으로 하며, 확산 세계 모델 내에서 훈련된 강화 학습 에이전트이다. 다이아몬드 프레임워크는 확산 세계 모델이 장기 시간 지평에서 효율적이고 안정적인지 확인하기 위한 필요한 설계 선택을 한다. 프레임워크는 이러한 설계 선택의 중요성을 보여주는 질적 분석을 제공한다. 다이아몬드는 아타리 100k 벤치마크에서 새로운 상태를 설정하며, 평균 인간 정규화 점수 1.46를 달성한다. 이는 세계 모델 내에서 완전히 훈련된 에이전트 중最高의 점수이다. 이미지 공간에서 작동하는 다이아몬드의 확산 세계 모델은 환경을 원활하게 대체하며, 세계 모델과 에이전트의 행동에 대한 더 나은 통찰력을 제공한다. 특히, 특정 게임에서 성능의 향상은 중요할 수 있는 시각적 세부 사항의 더 나은 모델링에 기인한다. 다이아몬드 프레임워크는 환경을 표준적인 부분적으로 관찰 가능한 마르코프 의사 결정 프로세스(POMDP)로 모델링하며, 상태 집합, 이산적인 행동 집합, 이미지 관찰 집합을 사용한다. 전환 함수는 환경 동역학을 설명하며, 보상 함수는 전환을 스칼라 보상으로 매핑한다.

다이아몬드: 방법론과 아키텍처

다이아몬드 프레임워크는 확산 모델을 기반으로 하며, 이는 노이즈 프로세스를逆转시키는 생성 모델의 한 类型이다. 다이아몬드 프레임워크는 연속적인 시간 변수와 해당 마진 및 경계 조건을 갖는 확산 프로세스를 고려하며, 추적 가능한 비구조화된 사전 분포를 사용한다. 또한, 생성 모델을 얻기 위해, 다이아몬드 프레임워크는 시간의 역방향으로 진행하는 확산 프로세스를逆转시켜야 한다. 그러나, 실제 점수 함수에 접근할 수 없기 때문에, 다이아몬드 프레임워크는 점수 매칭 목표를 구현하여 점수 모델을 훈련시키는 데 사용한다. 점수 기반 확산 모델은 무조건적인 생성 모델을 제공한다. 그러나, 환경 동역학의 조건부 생성 모델이 필요한 세계 모델을 구축하기 위해, 다이아몬드 프레임워크는 일반적인 POMDP 접근 방식을 고려하며, 과거의 관찰과 행동을 사용하여 알려지지 않은 마르코프 상태를近似한다. 그림 1에示されている 것처럼, 다이아몬드 프레임워크는 이 역사를 사용하여 확산 모델을 조건화하고, 다음 관찰을 직접 생성한다.

다이아몬드 프레임워크는 실제 구현에서, 확산 기반 세계 모델의 구체적인 실현을 다루며, 특정 확산 접근 방식에 해당하는 漂移 및 확산 계수를 고려한다. 다이아몬드 프레임워크는 DDPM을 자연스럽게 사용하는 대신, EDM 형식을 사용하며, 확산 시간의 실수 함수인 노이즈 스케줄을 갖는 섭동 커널을 고려한다. 프레임워크는 입력과 출력 분산을 유지하기 위해 전처리기를 선택하며, 네트워크 훈련은 신호와 노이즈를 적응적으로 혼합한다. 노이즈가 낮을 때, 목표는 깨끗한 신호와 섭동된 신호의 차이, 즉 추가된 가우시안 노이즈가 된다. 이는 낮은 노이즈 영역에서 훈련 목표가 평凡해지는 것을 방지한다. 그러나, 목표는 노이즈 스케줄의 극단에서 고분산이므로, 모델은 노이즈 수준을 로그 정규 분포에서 샘플링하여 훈련을 중간 노이즈 영역 주변에서 집중시킨다.

다이아몬드: 실험 및 결과

다이아몬드 프레임워크는 아타리 100k 벤치마크를 사용하여 평가한다. 아타리 100k 벤치마크는 에이전트의 다양한 능력을 테스트하기 위한 26개의 게임으로 구성된다. 각 게임에서, 에이전트는 환경에서 100k개의 행동을 수행할 수 있으며, 이는 약 2시간의 인간 게임 플레이에 해당한다. 다이아몬드는 5개의 랜덤 시드와 각 게임으로부터 훈련되었다. 각 훈련 과정은 약 12GB의 VRAM을 필요로 하며, 단일 Nvidia (NVDA ) RTX 4090에서 약 2.9일이 걸렸다. 다음 표는 모든 게임의 점수, 평균, 인간 정규화 점수의 중위수(IQM)를 제공한다.

다이아몬드 프레임워크는 점 추정의 한계를 고려하여, 평균과 인간 정규화 점수의 중위수에 대한 계층적 부트스트랩 신뢰 구간을 제공한다. 또한, 성능 프로파일과 추가 메트릭이 다음 그림에 요약되어 있다.

결과는 다이아몬드가 벤치마크에서 예외적으로 잘 수행됨을 보여주며, 11개의 게임에서 인간 플레이어를 초과하며, 평균 인간 정규화 점수 1.46을 달성한다. 이는 세계 모델 내에서 완전히 훈련된 에이전트 중最高의 점수이다. 또한, 다이아몬드의 IQM은 STORM과 비교할 수 있으며, 다른 모든 기준을 초과한다. 다이아몬드는 Asterix, Breakout, RoadRunner와 같은 환경에서 작은 세부 사항을 캡처하는 것이 중요할 때 탁월한 성능을 보여준다. 또한, 다이아몬드 프레임워크는 확산 모델을 유연하게 구현할 수 있으며, EDM 접근 방식을 사용하지만, DDPM 모델을 사용하는 것이 자연스러운 선택이었다. 두 접근 방식의 비교를 위해, 다이아몬드 프레임워크는 동일한 네트워크 아키텍처와 동일한 정적 데이터셋을 사용하여 두 변형을 훈련시킨다.

다이아몬드 프레임워크는 또한, 다른 기준과 비교하여, 특히 IRIS와 비교하여, 더 나은 성능을 보여준다. 다이아몬드가 생성한 궤도는 일반적으로 실제 환경과 더忠實하며, IRIS가 생성한 궤도에는 시각적 불일치가 있다. 이러한 불일치는 작은 픽셀만影响할 수 있지만, 강화 학습에 큰 영향을 미칠 수 있다. 예를 들어, 에이전트는 일반적으로 보상을 목표로 하며, 적을 피하려고 하므로, 이러한 작은 시각적 불일치는 최적의 정책을 학습하는 것을 더 어려워질 수 있다.

본 문서에서, 다이아몬드(DIffusion As a Model Of eNvironment Dreams) 프레임워크에 대해 논의했다. 다이아몬드 프레임워크는 확산 세계 모델 내에서 훈련된 강화 학습 에이전트이다. 다이아몬드는 아타리 100k 벤치마크에서 새로운 상태를 설정하며, 평균 인간 정규화 점수 1.46를 달성한다. 이는 세계 모델 내에서 완전히 훈련된 에이전트 중最高의 점수이다. 다이아몬드 프레임워크는 환경을 표준적인 부분적으로 관찰 가능한 마르코프 의사 결정 프로세스(POMDP)로 모델링하며, 상태 집합, 이산적인 행동 집합, 이미지 관찰 집합을 사용한다. 전환 함수는 환경 동역학을 설명하며, 보상 함수는 전환을 스칼라 보상으로 매핑한다.

결론

본 문서에서, 다이아몬드(DIffusion As a Model Of eNvironment Dreams) 프레임워크에 대해 논의했다. 다이아몬드 프레임워크는 확산 세계 모델 내에서 훈련된 강화 학습 에이전트이다. 다이아몬드는 아타리 100k 벤치마크에서 새로운 상태를 설정하며, 평균 인간 정규화 점수 1.46을 달성한다. 이는 세계 모델 내에서 완전히 훈련된 에이전트 중最高의 점수이다. 다이아몬드 프레임워크는 환경을 표준적인 부분적으로 관찰 가능한 마르코프 의사 결정 프로세스(POMDP)로 모델링하며, 상태 집합, 이산적인 행동 집합, 이미지 관찰 집합을 사용한다. 전환 함수는 환경 동역학을 설명하며, 보상 함수는 전환을 스칼라 보상으로 매핑한다.

전문직으로서의 엔지니어, 마음으로서의 작가입니다. Kunal은 AI와 ML에 대한 깊은 사랑과 이해를 가진 기술 작가로, 이러한 분야의 복잡한 개념을 흥미롭고 정보적인 문서를 통해 단순화하는데 헌신하고 있습니다.