AI 모델 및 플랫폼

디프마イン드의 새로운 AI는 게임을 하면서 규칙을 학습할 수 있다

mm
Unite.AI를 Google의 선호 소스에 추가

알파벳의 자회사 디프마인드가 최근 게임을 하면서 규칙을 학습할 수 있는 AI 시스템을 개발했다. 디프마인드는 이전에 체스, 쇼기, 고, 비디오 게임과 같은 게임을 마스터할 수 있는 인상적인 AI 모델을 만들었지만, 이러한 모델은 미리 게임의 규칙을 제공받아야 한다. 따라서 디프마인드의 새로운 AI는 이전의 강화 학습을 통해 게임을 학습하는 AI 알고리즘보다 현저한 개선이다.

AI 시스템 – MuZero

디프마인드는 최근에 발표한 논문에서 새로운 AI 시스템이 어떻게 작동하는지 설명했다. 새로운 AI, MuZero는 “look-ahead search”라는 원리를 통해 게임을 하면서 규칙을 학습할 수 있다. 네이처 저널에 발표된 논문에 따르면, MuZero는 게임을 하면서 규칙을 학습할 수 있는 첫 번째 AI 모델이다. MuZero는 체스, 쇼기, 고와 같은 게임에서 이전의 AI 모델인 AlphaZero와 비슷한 성능을 보였다. 또한 Ms. Pac-Man과 같은 게임에서 MuZero는 약 6~7개의 이동만을 고려할 수 있었지만, 여전히 좋은 성능을 보였다. 디프마인드는 MuZero의 능력을 시험하기 위해 시뮬레이션의 수를 제한했다. 일반적으로 프로그램이 더 많은 시간을 가질수록 더 좋은 성능을 보였다.

디프마인드의 주요 연구 과학자 데이비드 실버는 TechXplore와의 인터뷰에서 MuZero는 환경의 규칙을 스스로 생성하고, 그 규칙을 사용하여 계획을 세울 수 있는 첫 번째 AI 모델이라고 설명했다. “우리는 실제로 환경이 어떻게 작동하는지 이해하고, 그 이해를 통해 체스와 같은 게임에서 이전에 본 것과 같은 복잡한 계획을 세울 수 있는 시스템을 가지고 있다”고 실버는 말했다. “(MuZero)는 아무것도 없이 시작해서, 오직 시도와 오류를 통해 환경의 규칙을 발견하고, 그 규칙을 사용하여 초인적인 성능을 달성할 수 있다.”

MuZero는 체스와 같은 게임에서 가능한 모든 이동을 고려할 수 있다. MuZero는 가장 가능성과 관련이 있는 이동을 우선순위로 정렬하고, 성공과 실패한 조작 모두에서 학습한다. MuZero는 모든 가능한 요소를 모델링하는 대신, 결정에 가장 관련이 있는 요소만을 고려한다. MuZero는 수많은 잠재적인 변수를 고려하여 가장 관련이 있는 기능을 식별한다. 이러한 기능은 트리 기반 검색 알고리즘으로 표현된다. 검색 트리의 가능성은 테스트 환경의 기능을 기반으로 학습된 모델과 결합된다. 검색은 환경의 가장 관련이 있는 측면이 식별된 후에 수행된다.

최종 결정에 도달하기 위해 세 가지 요소를 고려한다.

MuZero는 이전 선택의 결과, 현재 위치, 그리고 다음에 취할 수 있는 조작을 고려한다. 이 접근법은 이전에 디프마인드에서 사용된 기본적인 검색과 트리 기반 모델보다 우수하다. MuZero는 체스, 쇼기, 고에서 AlphaZero와 비슷한 성능을 보였다. Ms. Pac-Man과 같은 게임에서 MuZero는 약 6~7개의 이동만을 고려할 수 있었지만, 여전히 좋은 성능을 보였다.

디프마인드의 연구 과학자 데이비드 실버는 TechXplore와의 인터뷰에서 MuZero는 환경의 규칙을 스스로 생성하고, 그 규칙을 사용하여 계획을 세울 수 있는 첫 번째 AI 모델이라고 설명했다.

가능한 응용

진짜로 작업의 제약을 학습하고 그 제약 안에서 작동할 수 있는 AI는 다양한 응용이 있다. MuZero는 비디오 압축과 같은 작업에 사용될 수 있다. 비디오 압축은 많은 가능한 비디오 형식과 압축 모드가 있기 때문에 AI를 사용하여 자동화하기 어려운 작업이었다. MuZero는 약 5%의 압축 개선을 달성했다. 이것은 구글과 유튜브에서 호스팅되는 많은 비디오에 영향을 미칠 수 있다. 비디오 외에도 디프마인드는 MuZero와 같은 기술을 단백질 구조 설계와 로봇 프로그래밍에 적용하고 있다.

사우스햄프턴 대학의 컴퓨터 과학 교수 웬디 홀은 MuZero가 강화 학습 알고리즘의 중요한 발전이라고 말했다. 그러나 홀은 이러한 알고리즘이 잘못 사용될 수 있다고 우려한다. 예를 들어, 미국 공군은 이미 MuZero를 사용하여 U-2 정찰기에서 미사일을 발사할 수 있는 AI 시스템을 만들었다. 이것은 디프마인드의 연구자들이 자신의 알고리즘이 어떤致命한 무기에도 사용되지 않기를 희망한다는 사실에도 불구하고이다.

디프마인드의 연구 과학자 데이비드 실버는 디프마인드는 미래를 향해 나아가고, 뇌와 같은 강력하고 유연한 알고리즘을 개발하려고 한다. 유연하고 강력한 알고리즘을 만드는 첫 번째 단계는 시스템이 지능적이라는 것이 무엇을 의미하는지 이해하는 것이다. 지능은 복잡한 환경의 패턴과 규칙을 식별하는 능력과 관련이 있다. 디프마인드는 앞으로 이런 알고리즘을 개발하기 위해 노력하고 있다. king 앞으로 미래를 향해 나아가고, 뇌와 같은 강력하고 유연한 알고리즘을 개발하려고 한다. 유연하고 강력한 알고리즘을 만드는 첫 번째 단계는 시스템이 지능적이라는 것이 무엇을 의미하는지 이해하는 것이다. 지능은 복잡한 환경의 패턴과 규칙을 식별하는 능력과 관련이 있다.

블로거이자 프로그래머로 Machine Learning Deep Learning 주제에 전문가입니다. 다니엘은 다른 사람들이 AI의 힘을 사회적善으로 사용하는 것을 돕기를 희망합니다.