AI 모델 및 플랫폼
아마존 알렉사 연구 책임자, 튜링 테스트는 구식이다
아마존의 알렉사 부사장 및 수석 과학자인 로히트 프라사드(Rohit Prasad)는 최근 튜링 테스트가 더 이상 AI의 벤치마크로 사용되어서는 안 된다고 주장했다. 튜링 테스트는 오랫동안 AI 모델의 복잡성을 측정하는 데 사용되어 왔다.
컴퓨터 과학자이자 수학자인 앨런 튜링(Alan Turing)은 70년 전 튜링 테스트의 개념을 처음 도입했다. 튜링 테스트의 목적은 기계가 인간과 같은 “생각”을 할 수 있는지 여부를 결정하는 것이었다. 이를 위해 튜링은 기계가 인간과 구별할 수 없는 대화 행동을 보인다면, 그 기계는 생각할 수 있는 능력이 있다고 주장했다.
튜링 테스트의 한계
프라사드는 튜링 테스트가 여러 가지로 제한적이며, 튜링 자신도 초기 논문에서 이러한 한계를 언급했다. AI가 우리의 삶의 모든 측면에 통합됨에 따라, 사람들은 더 이상 기계가 인간과 구별할 수 없다는 것에 관심이 없고, 그들의 기계와의 상호작용이 원활하다는 것에 더 관심이 있다고 프라사드는 주장한다. 이러한 이유로 튜링 테스트는 구식으로 간주되어야 하며, 더 유용한 벤치마크로 대체되어야 한다.
프라사드는 초기 채팅봇은 튜링 테스트를 통과하기 위해 설계되었으며, 최근 몇 년 동안 일부 채팅봇은 인간 판단자의 3분의 1 이상을 속일 수 있었다고 말했다. 그러나 인간의 말 패턴을 성공적으로 모방하는 것은 기계가真正로 “지능적”이라고 간주될 수 있는 것은 아니라는 것이다. AI 모델은 한 분야에서 매우熟練할 수 있지만 다른 분야에서는 매우 부족할 수 있으며, 일반적인 지능은 없다.尽管如此, 튜링 테스트는 여전히 채팅봇과 디지털 어시스턴트의 일반적인 벤치마크로 사용되고 있으며, 프라사드는 비즈니스 리더와 언론인들이 알렉사가 튜링 테스트를 통과할 수 있을 때 언제일지 계속 묻고 있다고 말했다.
프라사드에 따르면, 기계 지능을 평가하는 데 튜링 테스트를 사용하는 주요 문제는 기계가 정보를 조회하고 빠른 계산을 수행하는 능력을 거의 무시한다는 것이다. AI 프로그램은 복잡한 수학과 지리 문제에 대한 답변을 인간을 속이기 위해 인공적으로 지연시키지만, 실제로는 거의 즉시 답변할 수 있다. 또한, 튜링 테스트는 AI가 외부 센서에 의해 수집된 데이터를 사용하는 능력과, 비전 및 동작 알고리즘을 통해 세계와 상호작용하는 능력을 고려하지 않는다.
새로운 벤치마크 생성
프라사드는 일반적인 지능 형태를 평가하는 새로운 방법이 필요하다고 주장했다. 이러한 테스트는 현대 사회에서 AI가 실제로 사용되는 방식과 사람들의 목표를 반영해야 한다. 테스트는 AI가 인간의 지능을 어떻게 보완하는지와人们의 일상 생활을 어떻게 개선하는지 평가해야 한다.さらに, 테스트는 인간과 같은 지능의 특徵, 즉 언어 능력, 자기 감독, 및 “상식”을 어떻게 прояв하는지 이해해야 한다.
현재의 중요한 AI 연구 분야인推論, 공정성, 대화, 및 감각 이해는 튜링 테스트에 의해 평가되지 않지만, 다양한 방법으로 측정될 수 있다. 프라사드는 이러한 지능의 특徵을 평가하는 한 가지 방법은 과제를 구성 요소 작업으로 분해하는 것이라고 설명했다. 또 다른 방법은 인간-컴퓨터 상호작용을 위한 대규모 실제 챌린지를 생성하는 것이다.
아마존이 알렉사 프라이즈를 생성했을 때, 사회 봇이 20분 동안 인간과 대화하는 능력을 평가하는 루브릭을 생성했다. 봇은 다양한 주제에 대해 일관된 대화를 할 수 있는 능력에 따라 평가되었다. 고객은 개발 단계에서 봇을 평가하고, 다시 대화하고 싶은지 여부에 따라 점수를 매겼다. 최종 라운드에서 독립된 판단자가 5점 척도를 사용하여 봇을 평가했다. 판단자가 사용한 루브릭은 적절한 경우 감정과 같은 인간의 속성을 나타내는 방법을 허용했다.
궁극적으로, 프라사드는 알렉사와 같은 AI 파워드 디바이스의 증가하는 보급은 AI의 진행 상황을 측정하는 중요한 기회를 나타낸다고 주장했다. 그러나 우리는 이 새로운 기회를 활용하기 위해 다른 지표가 필요하다.
“ 그러한 AI는 점점 더 많은 작업에 전문가가 되어야 하며, 이는 작업별 지능 대신 더 일반적인 학습 능력으로만 가능하다”고 프라사드는 설명했다. “따라서, 향후 10년 동안 및 그 이후, 대화형 및 프로액티브 지원 능력을 갖춘 AI 서비스의 유용성은 가치 있는 테스트가 될 것이다.”












