AI 모델 및 플랫폼

자신감 있는 오류: 왜 가장 똑똑한 AI 모델은 스스로를 교정하는 데 가장 나쁨인가

mm
Unite.AI를 Google의 선호 소스에 추가

많은 AI 전문가들은 신뢰한다 bahwa 다음 주요 혁신은 스스로를 개선할 수 있는 AI의 시대가 될 것이라고 믿는다. 그 논리는 다음과 같다: 모델이 더 강력해짐에 따라, 결국 데이터에서뿐만 아니라 스스로에서 학습할 수 있을 것이다. 각 반복은 이전 것을 개선할 것이다. 오류는 식별되고, 수정되고, 제거될 것이다. 시간이 지나면, 이러한 개선의 누적은 지능 폭발을 유발할 수 있다. 여기서 AI가 AI를 구축한다. 이 비전은 재귀적 AI, 자율 에이전트 및 오래 기다려온 지능 폭발에 대한 모든 흥분의 근간에 있다. 이 비전의 중심에는 AI 시스템이 신뢰성 있게 자신의 오류를 수정할 수 있는 능력이 있다. 그러나, 강력한 자체 수정 없이, 자체 개선은 달성될 수 없다. 오류가 발생한 것을 인식할 수 없는 시스템은, 자신의 출력에서 의미 있게 학습할 수 없다. 이는 모델이 얼마나 강력해 보이든 상관없이 그렇다.

지배적인 가정은 자체 수정이 모델이 더 강력해짐에 따라 자연스럽게 나타날 것이라는 것이었다. 이 믿음은 직관적으로 느껴진다. 강력한 모델은 더 많이 알고, 더 잘 추론하며, 여러 작업에서 잘 작동한다. 그러나, 최근 연구는 반直관적인 발견을 보여준다. 즉, 더 발전된 모델은 자체 오류를 수정하는 데 약한 모델보다 더 어려움을 겪는다는 것이다. 이 현상은 정확도-수정 역설로 알려져 있다. 이것은 우리가 AI 시스템이 어떻게 추론하는지, 그리고 스스로를 개선할 수 있는 AI에真正로 준비되어 있는지 다시 생각하게 만든다.

자신감 있는 AI 이해

자신감 있는 AI는 자신의 오류를 식별하고, 그로부터 학습하며, 반복적으로 자신의 행동을 개선할 수 있는 AI 시스템을 말한다. 전통적인 모델과 달리, 인간이 큐레이션한 교육 데이터에만 의존하는 것이 아니라, 자신감 있는 AI는 자신의 출력을 능동적으로 평가하고 시간이 지남에 따라 적응한다. 이론적으로, 이것은 피드백 루프를 생성한다. 여기서 각 학습 사이클이 이전 것을 기반으로 하여 지능 폭발로 알려진 것을 생성한다.

그러나, 이 목표를 달성하는 것은 간단하지 않다. 자체 개선에는 원시적인 계산 능력이나 더 큰 데이터셋 이상이 필요하다. 신뢰성 있는 자체 평가를 필요로 하는데, 이는 오류를 감지하고, 그 원인을 식별하며, 수정된 솔루션을 생성하는 능력을 포함한다. 이러한 능력이 없으면, 모델은 올바른 추론 경로와 결함이 있는 경로를 구별할 수 없다. 잘못된 솔루션을 반복하는 것은, 성능을 개선하는 것보다 오류를 강화할 뿐이다.

이 구별은 중요하다. 인간의 경우, 오류에서 학습하는 것은 반성, 가설 테스트 및 코스 수정을 포함한다. AI의 경우, 이러한 프로세스는 시스템 자체에 인코딩되어야 한다. 모델이 자신의 오류를 신뢰성 있게 인식하고 수정할 수 없으면, 자체 개선 루프에 의미 있게 참여할 수 없으며, 재귀적 지능의 약속은 이론적이지 실제적이지 않다.

정확도-수정 역설

자체 수정은 종종 단일 능력으로 처리되지만, 실제로는 별도로 고려해야 하는 여러 개의 별도 능력이 있다. 최소한, 우리는 오류 감지, 오류 위치화 또는 원인 감지, 오류 수정의 세 가지 측정 가능한 하위 능력으로 나눌 수 있다. 오류 감지는 모델이 자신의 출력이 잘못된 것을 인식할 수 있는지 묻는 것이다. 오류 위치화는 오류가 발생한 위치를 식별하는 것을 중점으로 한다. 오류 수정은 수정된 솔루션을 생성할 수 있는 능력을 말한다.

이러한 능력을 별도로 측정함으로써, 연구자들은 현재 시스템의 한계에 대한 중요한 통찰력을 제공한다. 모델은 이러한 능력에 걸쳐 넓게 다르다는 것을 보여준다. 일부 모델은 오류를 감지하는 데 좋지만 수정하는 데는 좋지 않다. 다른 모델은 거의 오류를 인식하지 못하지만 반복된 시도를 통해 개선할 수 있다. 더 중요한 것은, 이러한 통찰력은 한 영역의 개선이 다른 영역의 개선이 보장하지 않는다는 것을 보여준다.

연구자들이 복잡한 수학적 추론 작업에 대한 고급 모델을 테스트했을 때, 이러한 모델은 더 적은 오류를犯했다. 그것은 예상된 것이었다. 그러나, 이러한 모델이 오류를犯했을 때, 스스로 수정할 가능성이 낮았다는 것이 예상치 못한 것이었다. 반대로, 약한 모델은 더 많은 오류를犯했지만, 외부 피드백 없이도 오류를 수정하는 데 훨씬 더 좋았다. 즉, 연구자들은 정확도와 자체 수정이 반대 방향으로 움직인다는 것을 발견했으며, 이것을 정확도-수정 역설이라고 부른다. 이 발견은 AI 개발에서 깊이 뿌리박힌 믿음을 도전한다. 우리는 종종 모델을 확장하면 모든 지능의 측면이 개선된다고 가정한다. 그러나, 역설은 이 가정은 항상 참이 아니며, 특히 내省 능력의 경우 그렇다는 것을 보여준다.

오류 깊이 가설

이 역설은 약한 모델이 강한 모델보다 자체 수정에 더 좋은 이유를 묻는 명백한 질문을 제기한다. 연구자들은 모델이犯하는 오류의 유형을 조사함으로써 이答案을 찾는다. 그들은 강한 모델이 더 적은 오류를犯하지만, 그들이犯하는 오류는 “더 깊고” 수정하기 더 어려운 반면, 약한 모델은 “얕은” 오류를犯하며, 두 번째 패스에서 쉽게 수정할 수 있다는 것을 발견했다.

연구자들은 이 통찰력을 오류 깊이 가설이라고 부른다. 그들은 설정 오류, 논리 오류, 계산 오류로 오류를 분류한다. 설정 오류는 문제를 잘못 해석하는 것을 포함한다. 논리 오류는 추론 경로가 구조적으로 결함이 있는 경우 발생한다. 계산 오류는 단순한 산술 실수이다. GPT-3.5의 경우, 대부분의 오류(62%)는 단순한 계산 실수이다. 이것은 얕은 오류이다. “주의해서 확인”하라는 요청에 모델은 종종 수학 실수를 찾고 수정할 수 있다. 그러나, DeepSeek의 경우, 77%의 오류는 설정 또는 논리 오류이다. 이러한 심각한 오류는 모델이 자신의 접근 방식을 근본적으로 다시 생각해야 한다. 강한 모델은 초기 추론 경로에 고정되는 경향이 있기 때문에 이러한 오류를 잘 다루지 못한다. 모델의 지능이 증가할수록, 수정하기 더 어려운 오류만 남게 된다.

오류 감지와 수정

연구의 가장 놀라운 발견 중 하나는 오류 감지와 수정 능력 사이에 상관관계가 없다는 것이다. 모델은 자신의 답이 잘못된 것을 올바르게 식별할 수 있지만, 여전히 수정하지 못할 수 있다. 또 다른 모델은 오류를 거의 감지하지 못하지만, 반복된 재해결을 통해 개선할 수 있다. Claude-3-Haiku는 가장 극적인 예이다. Claude는 자신의 오류 중 10.1%만 감지했으며, 이는 모든 테스트 모델 중에서 가장 낮은 수치였다.尽管如此, Claude는 29.1%의 내재적 수정률을 달성했으며, 이는最高이었다. 반면, GPT-3.5는 81.5%의 오류를 감지했지만, 26.8%만 수정했다.

이것은 일부 모델이 자신의 오류를 인식하지 못하더라도, 단순히 문제를 다시 해결함으로써 오류를 “우연히” 수정할 수 있다는 것을 시사한다. 이것은 실제 배포에서 위험하다. 모델이過度하게 자신감을 가지고 논리적 오류를 감지하지 못할 때, 그것은 설득력 있는하지만 완전히 잘못된 설명을 사실로 제시할 수 있다. 경우에 따라서, 모델에게 자신의 오류를 식별하도록 지시하면 상황을 더悪化시킬 수 있다. 모델이 자신의 오류가 어디에서 발생했는지 잘못 식별하면, 그것은 결함이 있는 설명에 고정되고, 오류를 두 배로 만든다. 도움이 되기보다는, 자체 생성된 힌트는 모델을 잘못된 추론 경로에 잠근다. 이 행동은 인간의 인지적 편향을 반영한다. 한번 우리가 무엇이 잘못되었는지 알았다고 생각하면, 우리는 더 깊은 원인을 찾는 것을 중단한다.

반복이 도움이 되지만, 모든 모델에서 동일하게

연구는 또한 반복적인 반성이 종종 결과를 개선하지만, 모든 모델이 동일하게 혜택을 받지 않는다는 것을 보여준다. 약한 모델은 여러 번의 재고를 통해 표면적인 문제를 수정할 수 있기 때문에, 반복적인 반성이 크게 도움이 된다. 그러나, 강한 모델은 반복에 의한 수정에서 훨씬 더 작은 이득을 보인다. 그들의 오류는 반복에 의해 쉽게 해결되지 않는다. 외부 지침 없이, 추가적인 시도는 종종 다른 단어로 동일한 결함이 있는 추론을 재생산한다. 이 통찰력은 자체 개선 기술이 보편적으로 효과적이지 않다는 것을 시사한다. 그들의 성공은 모델의 지능보다는犯하는 오류의 성격에 달려 있다.

AI 시스템 설계에 대한 의미

이 통찰력은 실제적 의미를 가지고 있다. 첫째, 우리는 더 높은 정확도가 더好的 자체 수정을 의미한다는 가정에서停止해야 한다. 자율적인 자체 개선을 의존하는 시스템은 최종 성능뿐만 아니라 수정 행동에 대해 명시적으로 테스트되어야 한다. 둘째, 다른 모델에는 다른 개입 전략이 필요할 수 있다. 약한 모델은 단순한 검증 및 반복에서 혜택을 받을 수 있다. 강한 모델은 외부 피드백, 구조화된 검증 또는 도구 기반 검사를 통해 깊은 추론 오류를 극복해야 할 수 있다. 셋째, 자체 수정 파이프라인은 오류를 인식해야 한다. 작업이 얕은 오류 또는 깊은 오류에 취약한지 여부를 이해하는 것은 자체 수정이 실제로 작동할 가능성을 알려준다. 마지막으로, 평가 벤치마크는 감지, 위치화 및 수정을 별도로 처리해야 한다. 이것들을 단일 측정으로 처리하면 실제 배포에서 중요한 약점을 숨긴다.

결론

자신감 있는 AI는 올바른 답을 생성하는 것뿐만 아니라, 잘못된 답을 인식하고, 진단하고, 수정하는 능력에 달려 있다. 정확도-수정 역설은 강한 모델이 자동으로 이 작업을 더 잘하는 것은 아니라는 것을 보여준다. 모델이 더 강력해질수록, 그들의 오류는 더 깊고, 감지하기 더 어려워지며, 자체 수정에 더 저항한다. 이것은 모델 확장만으로는 충분하지 않음을 의미한다. 우리는真正로 자신의 오류에서 학습할 수 있는 AI 시스템을 원한다면, 자체 수정은 별도의 능력으로 취급되어야 하며, 명시적으로 측정되고, 훈련되고, 지원되어야 한다.

Dr. Tehseen Zia는 COMSATS University Islamabad의 정교수이며, 오스트리아 비엔나 기술대학교에서 인공지능 박사학위를 취득했습니다. 인공지능, 기계학습, 데이터 과학, 컴퓨터 비전을 전문으로 하며, 유명한 과학 저널에 발표된 논문으로 знач적인 기여를 했습니다. Dr. Tehseen은 주요 연구자로서 다양한 산업 프로젝트를 이끌었으며, 인공지능 컨설턴트로도 활동했습니다.