AI 모델 및 플랫폼

Minecraft을 통한 모방 학습으로 AI가 어려움을 겪다

mm
Unite.AI를 Google의 선호 소스에 추가

過去 몇 개월 동안, Microsoft와 다른 회사들은 기계 학습을 연구하는 팀에게 Minecraft에서 다이아몬드를 찾을 수 있는 AI 시스템을 개발하도록 도전장을 내밀었습니다. BBC에 따르면, AI 플랫폼은 체스와 고를 지배했지만, Minecraft에서 작업을 마스터하는 데 어려움을 겪었습니다.

Microsoft의 Minecraft 기반 AI 챌린지는 MineRL이라고 불렸으며, 경쟁 결과는 최근 NeurIPS 컨퍼런스에서 공식적으로 발표되었습니다. 이 경쟁의 목적은 “모방 학습” 접근 방식을 통해 AI를 훈련하는 것이었습니다. 모방 학습은 관찰을 사용하여 AI를 훈련하는 방법입니다. 모방 학습은 인간이 행동을 수행하는 것을 관찰함으로써 AI 시스템이 행동을 학습하도록 허용합니다. 모방 학습은 강화 학습에 비해 계산적으로 훨씬 적게 비용이 들고 효율적인 방법입니다.

강화 학습은 종종 많은 강력한 컴퓨터를 네트워크로 연결하고 수백 또는 수천 시간의 훈련을 통해 작업을 수행하는 데 효과적이게 됩니다. 반면에, 모방 학습 방법으로 훈련된 AI는 훨씬 더 빠르게 훈련될 수 있습니다. 이는 인간 운영자가 이전에 수행한 작업을 기반으로 이미 지식의 기준선을 가지고 있기 때문입니다.

모방 학습은 AI를 훈련하는 데 실제적인 적용이 있습니다. 특히, AI가 올바른 행동을 배우기 전에 안전하게 탐색할 수 없는 경우에 유용합니다. 예를 들어, 자율 주행 자동차의 경우, 자동차가 원하는 행동을 배우기 전에 도로를 돌아다니는 것을 허용할 수 없습니다. 인간 데모스트레이터의 데이터를 사용하여 자동차를 훈련시키는 것은 더 빠르고 안전한 프로세스를 만들 수 있습니다.

Minecraft에서 다이아몬드를 찾는 것은 여러 단계를 순서대로 수행해야 하는 복잡한 작업입니다. 예를 들어, 도구를 만들기 위해 나무를 자르거나, 다이아몬드를 포함하는 동굴을 탐험하거나, 실제로 동굴에서 다이아몬드를 찾는 것입니다.尽管 이 작업이 복잡하지만, 게임에 익숙한 인간 플레이어는 약 20분 안에 다이아몬드를 찾을 수 있습니다.

경쟁에 660개가 넘는 다른 AI 에이전트가 제출되었습니다. 그러나 단 하나의 AI도 다이아몬드를 찾을 수 없었습니다. AI를 훈련하기 위한 데이터는 수백만 개의 게임 프레임을 포함하는 데이터셋으로, 많은 인간 플레이어로부터 수집되었습니다. 다이아몬드의 위치는 게임 인스턴스가 시작될 때마다 랜덤으로 생성되므로, AI는 단순히 인간 플레이어가 다이아몬드를 찾은 위치를 찾을 수 없습니다. 즉, AI는 도구를 만드는 것, 도구를 사용하는 것, 탐험하는 것, 자원을 찾는 것과 같은 개념이 어떻게 연결되는지 이해해야 합니다.

尽管 어떤 AI 에이전트도 다이아몬드를 성공적으로 찾지 못했지만, 조직 팀은 여전히 경쟁 결과에 만족했습니다. 또한, 이 실험에서 많은 것을 배울 수 있었습니다. AI 팀이 수행한 연구는 AI 분야를 발전시키는 데 도움이 될 수 있습니다. 특히, 강화 학습 전략의 대안을 찾는 데 도움이 될 수 있습니다.

강화 학습은 일반적으로 모방 학습보다 우수한 성능을 제공합니다. 특히, DeepMind의 AlphaGo는 강화 학습의 성공적인 예입니다. 그러나, 강화 학습은大量의 컴퓨팅 자원을 필요로 하므로, 많은 조직이 이러한 자원을 제공할 수 없습니다.

카네기 멜런 대학교의 박사 과정 학생이자 경쟁의 헤드 오거나이저인 William Guss는 BBC에 다음과 같이 말했습니다.

“…大量의 컴퓨팅 자원을 문제에 투입하는 것은 필드에서 상태를 발전시키는 올바른 방법은 아닙니다… 이는 강화 학습 시스템에 대한 접근을 민주화하는 것에 반対하며, 복잡한 환경에서 에이전트를 훈련하는 능력을大量의 컴퓨팅 자원을 가진 기업에 맡깁니다.”

블로거이자 프로그래머로 Machine Learning Deep Learning 주제에 전문가입니다. 다니엘은 다른 사람들이 AI의 힘을 사회적善으로 사용하는 것을 돕기를 희망합니다.