AI 모델 및 플랫폼

LLM이 쉬운 퍼즐을 과도하게 생각하지만 어려운 퍼즐에서는 포기하는 이유

mm
Unite.AI를 Google의 선호 소스에 추가

인공지능은 최근 놀라운 발전을 이루었으며, 대규모 언어 모델(LLM)과 그보다 더 발전된 대규모 추론 모델(LRM)은 기계가 인간과 같은 텍스트를 처리하고 생성하는 방식을 재정의했습니다. 이러한 모델은 에세이를 작성하고, 질문에 답변하며, 심지어 수학 문제를 해결할 수 있습니다. 그러나 이러한 모델의 인상적인 능력에도 불구하고, 그들은 의심스러운 행동을 보입니다. 즉, 간단한 문제를 과도하게 복잡하게 만들면서 어려운 문제에서는 포기하는 경향이 있습니다. 애플 연구진의 최근 연구는 이러한 현상을 깊이 있게 분석했습니다. 이 기사에서는 LLM과 LRM이 이러한 방식으로 행동하는 이유와 이것이 미래의 인공지능 개발에 어떤 의미를 갖는지 살펴보겠습니다.

LLM과 LRM 이해

LLM과 LRM이 이러한 방식으로 행동하는 이유를 이해하기 위해서는 먼저 이러한 모델이 무엇인지 명확히 해야 합니다. LLM은 GPT-3 또는 BERT와 같은 모델로, 텍스트 데이터셋을 기반으로 다음 단어를 예측하도록 훈련됩니다. 이는 텍스트 생성, 번역, 요약과 같은 작업에서 탁월한 성능을 발휘합니다. 그러나 이러한 모델은 본질적으로 추론을 위한 것이 아닙니다. 추론은 논리적 추론 또는 문제 해결을涉합니다.

LRM은 이러한 격차를 해결하기 위한 새로운 모델 클래스입니다. 체인 오브 썸(Chain-of-Thought) 프롬프팅과 같은 기술을 통합하여, 모델이 최종 답변을 제공하기 전에 중간 추론 단계를 생성합니다. 예를 들어, 수학 문제를 해결할 때, LRM은 문제를 단계별로 분해하여 인간이 하는 방식과 유사하게 해결합니다. 이러한 접근 방식은 복잡한 작업에서 성능을 향상시키지만, 연구에서 나타난 바와 같이 다양한 복잡성의 문제를 처리할 때 어려움을 겪습니다.

연구 연구

애플 연구진은 LLM과 LRM의 추론 능력을 평가하기 위해 전통적인 벤치마크와 다른 접근 방식을採用했습니다. 전통적인 벤치마크는 데이터 오염으로 인해 모델이 답변을 기억할 수 있기 때문에, 연구진은 제어된 퍼즐 환경을 생성했습니다. 이러한 퍼즐에는 타워 오브 하노이, 체커 점프, 리버 크로싱, 블록 월드와 같은 잘 알려진 퍼즐이 포함됩니다. 예를 들어, 타워 오브 하노이는 특정 규칙을 따라 디스크를 페그 사이에서 이동하는 퍼즐로, 디스크의 수가 증가할수록 복잡성이 증가합니다. 연구진은 이러한 퍼즐의 복잡성을 체계적으로 조정하면서 일관된 논리적 구조를 유지하여, 모델이 다양한 난이도의 스펙트럼에서 어떻게 수행하는지 관찰했습니다. 이러한 방법은 연구진이 최종 답변뿐만 아니라 추론 과정을 분석할 수 있게 해주어, 이러한 모델이 “생각하는” 방식에 대한 더 깊은 이해를 제공합니다.

과도한 생각과 포기에 대한 발견

연구는 문제 복잡성에 따라 세 가지 개별적인 성능 영역을 식별했습니다.

  • 낮은 복잡성 수준에서는 표준 LLM이 LRM보다 더 잘 수행됩니다. LRM은 불필요한 추가 단계를 생성하여 과도한 생각을 하기 때문입니다.
  • 중간 복잡성 문제에서는 LRM이 더 나은 성능을 보입니다. 이는 이러한 모델이 복잡한 문제를 효과적으로 해결하기 위해 자세한 추론 흔적을 생성할 수 있기 때문입니다.
  • 높은 복잡성 문제에서는 LLM과 LRM 모두 완전히 실패합니다. 특히 LRM은 정확성에서 완전한 붕괴를 경험하며, 어려움이 증가함에도 불구하고 추론 노력을 감소시킵니다.

간단한 퍼즐의 경우, 표준 LLM이 더 효율적으로 올바른 답변을 제공했습니다. 그러나 LRM은 이러한 퍼즐에서 과도한 생각을 하여, 솔루션이 간단한 경우에도 길고 복잡한 추론 흔적을 생성했습니다. 이는 LRM이 훈련 데이터에서 과장된 설명을 모방하여, 비효율성을 초래할 수 있음을 시사합니다.

중간적으로 복잡한 시나리오에서는 LRM이 더 나은 성능을 보였습니다. 이러한 모델이 생성할 수 있는 자세한 추론 단계로 인해, 여러 논리적 단계가 필요한 문제를 해결할 수 있었습니다. 이는 표준 LLM이 일관성을 유지하는 데 어려움을 겪는 경우에 이러한 모델이 더 나은 성능을 발휘할 수 있음을 의미합니다.

그러나 매우 복잡한 퍼즐의 경우, 두 모델 모두 완전히 실패했습니다. 놀랍게도, LRM은 특정 지점을 넘어서는 복잡성 증가와 함께 추론 노력을 감소시켰습니다. 이는 이러한 모델의 추론 능력에 대한 근본적인 제한을 나타냅니다.

왜 이런 일이 발생하는가

간단한 퍼즐에서 과도한 생각은 이러한 모델이 훈련된 방식에서 기인합니다. 이러한 모델은 간결한 설명과 자세한 설명이 모두 포함된大量의 텍스트 데이터셋에서 학습합니다. 쉽게 해결할 수 있는 문제의 경우, 모델은 직접적인 답변을 제공하는 대신, 훈련 데이터에서 길고 복잡한 설명을 모방하여, 비효율성을 초래할 수 있습니다.

복잡한 퍼즐에서 실패는 LLM과 LRM이 논리적 규칙을 일반화하는 능력의 부족을 반영합니다. 문제의 복잡성이 증가함에 따라, 이러한 모델은 패턴 매칭에 의존하여 일관된 추론을 보여주지 못하고, 성능이 급격히 저하됩니다. 연구에 따르면, LRM은 명시적인 알고리즘을 사용하지 못하고, 다양한 퍼즐에서 일관된 추론을 보여주지 못합니다. 이는 이러한 모델이 인간과 같은 방식으로 논리적 규칙을 이해하지 못한다는 것을 강조합니다.

다양한 관점

이 연구는 인공지능 커뮤니티에서 논쟁을 일으켰습니다. 일부 전문가들은 이러한 발견이 잘못 해석될 수 있다고 주장합니다. 그들은 LLM과 LRM이 인간과 같은 방식으로 추론하지는 않지만, 특정 복잡성 한계 내에서 효과적인 문제 해결을 보여줄 수 있다고 강조합니다. 그들은 “추론”이 인간의 인지와 동일할 필요는 없지만, 가치 있는 것일 수 있다고 주장합니다. 마찬가지로, 해커 뉴스와 같은 플랫폼上的 토론에서는 연구의 엄격한 접근 방식을赞扬하지만, 추론 능력을 개선하기 위한 추가 연구의 필요성을 강조합니다. 이러한 관점은 인공지능에서 추론이 무엇인지 그리고 어떻게 평가해야 하는지에 대한 계속되는 논쟁을 강조합니다.

의미와 미래 방향

연구의 발견은 인공지능 개발에 중요한 의미를 갖습니다. LRM은 인간의 추론을 모방하는方面에서 발전을 나타내지만, 복잡한 문제를 처리하고 추론 노력을 확장하는 능력의 제한은, 현재의 모델이 일반화된 추론에 아직 도달하지 못했다는 것을 시사합니다. 이는 추론 과정을의 품질과 적응성에 초점을 맞춘 새로운 평가 방법이 필요함을 강조합니다.

미래의 연구는 모델이 논리적 단계를 정확하게 수행하고 문제 복잡성에 따라 추론 노력을 조정할 수 있도록 향상하는 것을 목표로 해야 합니다. 실제 세계의 추론 작업을 반영하는 벤치마크를 개발하는 것은 인공지능 능력에 대한 더 의미 있는 통찰력을 제공할 수 있습니다. 또한, 모델의 패턴 인식에 대한 과도한 의존을 해결하고, 논리적 규칙을 일반화하는 능력을 향상시키는 것이 인공지능 추론을 발전시키기 위한 핵심이 될 것입니다.

결론

이 연구는 LLM과 LRM의 추론 능력에 대한 중요한 분석을 제공합니다. 이는 이러한 모델이 간단한 퍼즐에서 과도한 생각을 하지만, 더 복잡한 퍼즐에서는 포기하는 것을 보여줍니다. 이러한 모델은 특정 상황에서 잘 수행할 수 있지만, 매우 복잡한 문제를 해결하지 못하는 것은, 시뮬레이션된 추론과真正한 이해 사이의 격차를 강조합니다. 연구는 다양한 복잡성 수준에서 적응적으로 추론할 수 있는 인공지능 시스템을 개발하는 필요성을 강조합니다. 이를 통해, 이러한 시스템은 인간과 같은 방식으로 다양한 복잡성의 문제를 해결할 수 있을 것입니다.

Dr. Tehseen Zia는 COMSATS University Islamabad의 정교수이며, 오스트리아 비엔나 기술대학교에서 인공지능 박사학위를 취득했습니다. 인공지능, 기계학습, 데이터 과학, 컴퓨터 비전을 전문으로 하며, 유명한 과학 저널에 발표된 논문으로 знач적인 기여를 했습니다. Dr. Tehseen은 주요 연구자로서 다양한 산업 프로젝트를 이끌었으며, 인공지능 컨설턴트로도 활동했습니다.