AI 모델 및 플랫폼

인공지능 에이전트, 가상 숨바꼭질에서 출현하는 지능 특성 보여

mm
Unite.AI를 Google의 선호 소스에 추가

인공지능을 연구하는 것에 대한 흥미로운 사실은 인공지능이 설계한 연구자들이 예상하지 못한 행동과 전략을 수행할 수 있다는 것입니다. 최근 가상 게임에서 여러 인공지능 에이전트가 서로 경쟁하는 게임에서 이러한 일이 발생했습니다. 샌프란시스코에 기반을 둔 인공지능 회사인 OpenAI의 연구자들은 인공지능 에이전트가 게임 세계에서 연구자들이 예상하지 못한 전략을 사용하기 시작했다는 것을 발견하여 놀랐습니다.

OpenAI는 여러 인공지능 에이전트를 서로 숨바꼭질하는 게임을 하도록 훈련했습니다. 인공지능 프로그램은 강화 학습으로 훈련되며, 이는 인공지능 알고리즘에서 원하는 행동을 유도하기 위해 알고리즘에 피드백을 제공하는 기술입니다. 인공지능은 처음에 무작위로 행동을 수행하며, 그 행동이 목표에 더 가까이 가져다줄 때마다 에이전트는 보상을 받습니다. 인공지능은 가능한 최대 보상을 얻으려고 하므로 더 많은 보상을 얻을 수 있는 행동을 실험합니다. 시도와 오류를 통해 인공지능은 승리할 수 있는 전략과 가장 많은 보상을 줄 수 있는 전략을 구별할 수 있습니다.

강화 학습은 이미 게임 규칙을 학습하는 데惊異的な 성공을 거두었습니다. OpenAI는 최근에 인공지능 팀을 DOTA 2 게임을 하도록 훈련시켰으며, 인공지능은 지난해 인간 세계 챔피언 팀을 이겼습니다. 비슷한 일이 스타크래프트 게임에서 DeepMind가 인공지능을 훈련시킨 경우에도 발생했습니다. 강화 학습은 또한 인공지능 프로그램을 인간과 함께 피카소 게임을 하도록 가르치는데 사용되었습니다. 여기서 인공지능은 그림을 해석하고 기본적인 常識적推論을 사용하는 방법을 배웠습니다.

연구자들이 만든 가상 숨바꼭질 게임에서 여러 인공지능 에이전트가 서로 경쟁했습니다. 결과는 각 에이전트가 다른 에이전트를 능가하고 가장 많은 보상 점수를 얻으려는 무기 경쟁과 같은 것이었습니다. 한 에이전트가 새로운 전략을 채택하면 상대방 에이전트는 그에 대응하기 위해 새로운 전략을 찾으려고 합니다. OpenAI의 연구자 인 이고르 모르다치(Igor Mordatch)는 IEEE 스펙트럼에 이러한 실험은 에이전트가 서로 상호작용함으로써 “놀라운 행동을 스스로 학습할 수 있음을 보여준다”고 설명했습니다. “그것은 아이들이 서로 игра하는 것과 같습니다.”

그럼 정확히 어떤 놀라운 행동이었을까요? 연구자들은 인공지능 에이전트가 학습할 수 있는 4가지 기본 전략을 예상했으며, 인공지능은 2500만 개의 시뮬레이션 게임 후에 이러한 전략을 빠르게 학습했습니다. 게임은 램프, 블록, 벽이 있는 3D 환경에서 진행되었습니다. 인공지능 에이전트는 서로 쫓아다니는 법, 숨을 수 있는 요새를 만들기 위해 블록을 이동하는 법, 램프를 이동하는 법을 학습했습니다. 인공지능 추적자는 요새 안으로 들어가기 위해 램프를 끌어당기는 법을 학습했으며, 숨는 에이전트는 추적자가 사용할 수 없도록 요새 안으로 램프를 끌어당기는 법을 학습했습니다.

그러나 3억 8천만 게임이 지나간 후, 예상치 못한 일이 발생했습니다. 인공지능 에이전트는 연구자들이 예상하지 못한 2가지 전략을 사용하기 시작했습니다. 추적자 에이전트는 박스 위로 점프하여 박스를 요새 쪽으로 기울여 요새 안으로 들어갈 수 있다는 것을 학습했습니다. 연구자들은 게임 환경의 물리학에서 이러한 행동이 가능하다는 것을 알지 못했습니다. 숨는 에이전트는 박스를 요새 안으로 끌어당겨 추적자가 사용할 수 없도록 하는 법을 학습했습니다.

강화 학습 알고리즘으로 훈련된 에이전트의 예상치 못한 행동은 이 경우에는無害하지만, 다른 상황에서 강화 학습을 적용할 때 잠재적인 문제를 제기합니다. OpenAI 연구 팀의 한 멤버인 Bowen Baker는 IEEE 스펙트럼에 이러한 예상치 못한 행동이 잠재적으로 위험할 수 있다고 설명했습니다. 로봇이 예상치 못한 방식으로 행동한다면 어떻게 될까요?

“이러한 환경을 구축하는 것은 어렵습니다”라고 베이커는 설명했습니다. “에이전트는 이러한 예상치 못한 행동을 나타낼 것이며, 더 복잡한 환경에서 이러한 에이전트를 사용할 때 안전 문제가 발생할 수 있습니다.”

그러나 베이커는 또한 강화 전략이 현재의 문제에 혁신적인 해결책을 제공할 수 있다고 설명했습니다. 강화 학습으로 훈련된 시스템은 우리가 상상할 수 없는 해결책을 가진 다양한 문제를 해결할 수 있습니다.

블로거이자 프로그래머로 Machine Learning Deep Learning 주제에 전문가입니다. 다니엘은 다른 사람들이 AI의 힘을 사회적善으로 사용하는 것을 돕기를 희망합니다.