AI 모델 및 플랫폼

AI 연구자, 과거 이벤트를 기억할 수 있는 비디오 게임 모델 개발

mm
Unite.AI를 Google의 선호 소스에 추가

우버의 AI 연구소에서 연구팀은 최근에 클래식 아타리 비디오 게임에서 인간 플레이어와 다른 AI 시스템을 능가하는 AI 알고리즘 시스템을 개발했다. 연구팀이 개발한 AI 시스템은 이전에 성공한 전략을 기억하고, 과거에 어떤 것이 작동했는지에 따라 새로운 전략을 만들 수 있다. 연구팀은 개발한 알고리즘이 언어 처리와 로봇공학 gibi 기술 분야에서 잠재적인 응용 프로그램을 가지고 있다고 믿는다.

비디오 게임을 chơi할 수 있는 AI 시스템을 생성하는 일반적인 방법은 강화 학습 알고리즘을 사용하는 것이다. 강화 학습 알고리즘은 작업을 수행하는 방법을 배우기 위해 가능한 행동의 범위를 탐색하고, 각 행동 후에 보상을 받는다. 시간이 지남에 따라 AI 모델은 더 큰 보상을 제공하는 행동을 학습하고, 이러한 행동을 수행할 가능성이 높아진다. 그러나 강화 학습 모델은 데이터 포인트가 다른 데이터와 일치하지 않는 경우에 문제가 발생한다.

연구팀에 따르면, 그들의 접근 방식이 다른 AI 연구자들에 의해 고려되지 않은 이유는 전략이 강화 학습에서 일반적으로 사용되는 “내적 동기” 접근 방식과 다르기 때문이다. 내적 동기 접근 방식의 문제는 모델이 잠재적으로 보상되는 영역을 잊어버릴 수 있다는 것이다. 이것은 “분리”로 알려져 있다.因此, 모델이 예상치 못한 데이터를 만났을 때, 아직 탐색할 가치가 있는 영역을 잊어버릴 수 있다.

TechXplore에 따르면, 연구팀은 더 유연하고 예상치 못한 데이터에 반응할 수 있는 학습 모델을 생성하려고 했다. 연구팀은 이전 모델이 문제를 해결하려고 했을 때 취한 모든 행동을 기억할 수 있는 알고리즘을 도입하여 이 문제를 해결했다. AI 모델이 일관되지 않은 데이터 포인트를 만났을 때, 모델은 메모리 맵을 확인한다. 모델은 성공과 실패한 전략을 식별하고 적절한 전략을 선택한다.

비디오 게임을 플레이할 때, 모델은 게임을 플레이하는 동안 스크린샷을 수집하고, 로그를 생성한다. 이미지들은 유사성에 따라 그룹화되어 모델이 참조할 수 있는 명확한 시간 점을 형성한다. 알고리즘은 로그된 이미지들을 사용하여 흥미로운 시간 점으로 돌아가서 탐색을 계속할 수 있다. 모델이 패배하고 있음을 발견하면, 모델은 캡처된 스크린샷을 참조하고 다른 전략을 시도한다.

BBC에 따르면, AI 에이전트가 게임을 플레이할 때 위험한 시나리오를 처리하는 것도 문제이다. 에이전트가 위험에 빠지면, 더 이상 탐색할 가치가 있는 영역으로 돌아갈 수 없게 된다. 이것은 “탈선”으로 알려져 있다. AI 모델은 탐색할 가치가 있는 이전 영역을 탐색하는 데 사용되는 프로세스와 별도로 탈선 문제를 처리한다.

연구팀은 모델이 55개의 아타리 게임을 플레이하도록 했다. 이러한 게임은 일반적으로 AI 모델의 성능을 벤치마크하는 데 사용되지만, 연구팀은 모델에 추가 규칙을 적용했다. 연구팀은 모델이最高 점수를 얻는 것뿐만 아니라, 매번 더 높은 점수를 얻으려고 시도하도록 지시했다. 모델의 성능 결과를 분석한 결과, 연구팀은 모델이 다른 AI 시스템보다 게임에서 약 85%의 시간 동안 더 나은 성능을 보였다는 것을 발견했다. 모델은 특히 Montezuma’s Revenge라는 플랫폼 게임에서 잘 작동했는데, 이 게임에서는 플레이어가 장애물을 피하고 보물을 수집한다. 모델은 인간 플레이어의 기록을 깨고, 다른 AI 시스템보다 더 높은 점수를 얻었다.

우버 AI 연구팀에 따르면, 연구팀이 사용한 전략은 로봇공학 gibi 산업에서 응용 프로그램을 가지고 있다. 로봇은 성공한 행동, 실패한 행동, 시도하지 않은 행동을 기억하는 능력에서 이익을 얻는다.

블로거이자 프로그래머로 Machine Learning Deep Learning 주제에 전문가입니다. 다니엘은 다른 사람들이 AI의 힘을 사회적善으로 사용하는 것을 돕기를 희망합니다.