AI 모델 및 플랫폼
연구, 복잡성이 증가할수록 LLM이 단순한 추론에 의존하는 것으로 나타났다

연구자들은 전체적인 연구를 11월 20일에 발표하여 192,000개 이상의 추론 흔적을 분석하였고, 이는 대규모 언어 모델(LLM)을 통해 수행되었다. 이 연구는 인공 지능 시스템이 계층적 인지 프로세스를 사용하는 대신浅い 선형 전략에 의존한다는 것을 보여주었다.
연구 팀은 18개의 다른 모델을 분석하였고, 이를 텍스트, 비전, 오디오 추론 작업에 적용하였다. 또한 54개의 인간의 생각을 분석하여 비교하였다. 이 분석을 통해 28개의 인지 요소를 분류하였고, 이는 계산 제약, 메타 인지 제어, 지식 표현, 변환 연산 등을 포함한다. 이 프레임워크는 모델이 올바른答案을 생성하는지 여부를 평가할 뿐만 아니라, 어떻게 그 결론에 도달하는지 평가할 수 있다.
인지 아키텍처의 기본적인 차이
인간의 추론은 일관되게 계층적 중첩과 메타 인지 모니터링을 보여준다. 즉, 인간은 정보를 중첩된 구조로 조직화하고, 복잡한 문제를 해결하는 동안 자신의 생각을 반영하고 조절할 수 있다.
LLM은 주로浅い 전진 체인을 사용하여 문제를 해결한다. 이는 계층적 조직이나 자기 반성을 사용하지 않는다. 이러한 차이는 작업이 구조화되지 않거나 모호할 때 가장 두드러진다. 이 경우 인간의 적응성이 인공 지능 접근 방식보다 훨씬 더 뛰어나다.
연구에 따르면 언어 모델은 성공적인 추론과 관련된 행동 구성 요소를 가지고 있지만, 종종 이러한 구성 요소를 tự발적으로 사용하지 못한다. 성능은 문제 유형에 따라 크게 다르다. 딜레마 추론은 가장 높은 분산을 나타내었고, 작은 모델은 크게 어려움을 겪었다. 반면, 논리적 추론은 중간 정도의 성능을 보였고, 더 큰 모델은 일반적으로 더 작은 모델보다 더 나은 성능을 보였다. 모델은 반直관적인 약점을 보였다. 즉, 복잡한 작업을 성공적으로 수행하지만, 더 단순한 변형에서는 실패한다.
지시된 추론을 통해 성능 개선
연구 팀은 테스트 시간에 추론 지도를 개발하여 성공적인 인지 구조를 자동으로 구성하였다. 이는 복잡한 문제에서 최대 66.7%의 성능 개선을 보여주었다. 이는 LLM이 더 복잡한 추론 능력을 가지고 있지만, 이를 효과적으로 사용하기 위해 명시적인 지도가 필요하다는 것을 시사한다.
인간과 인공 지능의 추론 간격은 작업의 복잡성이 증가할수록 더 넓어지게 된다. 모델은 전진 체인을 통해 단순한 문제를 해결할 수 있지만, 인간이 자연스럽게 사용하는 재귀적, 자기 모니터링 전략을 사용할 때 어려움을 겪는다.
연구의 공개 데이터 세트는 인공 지능과 인간 지능을 비교하는 미래 연구를 위한 기준을 제공한다. 28개의 구별된 인지 요소를 매핑함으로써, 이 프레임워크는 연구자들이 인공 지능의 추론이 어디에서 실패하는지 정확하게 식별할 수 있도록 한다.
인공 지능 개발에 대한 영향
이 연구의 결과는 현재 인공 지능 시스템의 기본적인 제한을 강조한다. 즉, 계산 능력과真正의 인지 소양 간의 간격이다.大量의 데이터로 훈련된 모델은 많은 작업에서 패턴 매칭을 통해 올바른答案을 생성할 수 있지만, 인간의 문제 해결을 특징으로 하는 반성적, 계층적 사고를缺乏한다.
이 연구는 여러 영역에서 식별된 인공 지능의 추론 제한에 대한 증가하는 우려를 강조한다. 지시된 추론에서 성능 개선은 모델이 잠재적인 추론 능력을 더 효과적으로 사용할 수 있도록 도와주는 더好的 프롬프트 전략과 아키텍처 수정이 가능할 수 있다.
이 연구의 가장 중요한 기여는 인지 요소의詳細한 분류이다. 이는 연구자와 개발자에게 개선의 구체적인 목표를 제공한다. 추론을 단일 능력으로 처리하는 대신, 이 프레임워크는 측정 가능한 구성 요소로 나누어지므로 훈련 수정 또는 프롬프트 엔지니어링 기술을 통해 개별적으로 해결할 수 있다.












