Anderson의 관점

체인-오브-사고 이유가 주요 언어 모델에서 ‘장식’으로 입증됨

mm
Unite.AI를 Google의 선호 소스에 추가
An AI-generated image (GPT1.5) depicting a robot cheating in an exam by using a smartphone.

새 연구는 ChatGPT와 Claude를 비롯한 주요 AI 언어 모델이 보여주는 매끄러운 단계별 설명이 실제로는 ‘장식’에 불과하며, AI가 답을 정한 뒤 만들어지는 경우가 많다는 사실을 손쉽게 가려내는 방법을 제시한다.

지난해 Anthropic과 Apple (AAPL ) 등 AI 관련 기업이 발표한 주목받는 연구들은 이른바 ‘추론 AI’가 실제 답을 결정한 근거와 일치하지 않는 단계별 설명을 자주 생성한다고 지적했다.

이후 논쟁은 반박과 다양한 해석으로 흩어졌고, 체인 오브 소트(Chain-of-Thought·CoT)가 사용자를 안심시키기 위한 겉치레인지 실제 추론 과정의 증거인지는 해결되지 않았다.

ChatGPT는 풀이 과정을 보여주지만 이미 답을 결정한 뒤일 수 있다

ChatGPT는 ‘풀이 과정’을 보여주지만, 이미 답을 결정한 뒤일 수 있다.

설명과 실제 추론을 구분하는 시험

인도의 새 논문은 ChatGPT 등 주요 대규모 언어 모델(LLM) 화면에 나타나는 인상적인 ‘추론 애니메이션’이 정말로 결론에 이르는 사고 단계를 보여주는지 저렴하고 재현하기 쉬운 방식으로 측정한다. 연구는 Allahabad의 Indian Institute of Information Technology Allahabad(IIITA)와 Delhi의 National Institute of Electronics and Information Technology(NIELIT) 소속 연구자 두 명이 수행했다.

연구진은 폭넓은 독점 및 오픈소스 LLM에서 사용자에게 제시되는 CoT가 거의 언제나 AI가 답을 정한 뒤 꾸며낸 ‘장식적’ 설명이라고 보고했다.

ChatGPT-5.4, Claude Opus 4.6-R, DeepSeek-V3.2 등을 시험한 결과, 10~15개의 CoT 단계 중 어느 한 단계를 제거해도 답이 바뀐 비율은 17% 미만이었다. 반대로 단계 하나만 남겨도 정답을 복원할 수 있는 경우가 많았다.

저자들은 의료·금융·법률 분야 규제가 점점 ‘설명 가능한’ 시스템을 요구하지만, 모델에 풀이를 보여 달라고 하는 표준적 접근은 투명성의 환상을 제공한다고 경고한다. 설명이 유창하고 해당 분야에 적합해도, 모델이 실제로 수행하지 않은 추론을 묘사할 수 있다.

예를 들어 의료 AI가 “호산구 증가증은 색전성 과정을 시사한다”고 적었다고 해서 호산구 증가증을 실제 판단 요소로 고려했다고 볼 수는 없다. 질문 문장에서 답으로 패턴 매칭을 한 뒤 이유를 사후에 만들어냈을 수 있다. EU AI Act 제13조는 고위험 AI가 ‘관련된 논리에 관한 의미 있는 정보’를 제공하도록 요구하지만, 다수 최전선 모델의 CoT는 이 기준에 못 미칠 수 있다.

예외도 있었다. MiniMax-M2.5는 감정 분석에서 단계에 실제로 의존했고, Kimi-K2.5는 주제 분류에서 39%의 단계 의존성을 보였다. 그러나 더 크고 잘 알려진 모델 대부분에서는 표시된 추론이 수행에 가까웠고 내부적으로는 지름길을 사용했다.

작은 모델이 더 충실하게 추론한다

API 모델 10개 외에도 연구진은 8억~80억 매개변수 규모의 소형 오픈웨이트 모델 여러 개를 시험했다. 오늘날 기준으로 작은 이 모델들은 실제로 추론했으며, 화면에 보인 CoT가 유용하고 정확한 결론에 도달하는 데 필요한 경우가 많았다.

소형 모델은 단계별 추론이 필요한 비율이 55%였지만, 대형 모델 평균은 11%였다. 저자들은 대형 모델이 다단계 추론을 완전히 우회하고, 작성한 설명에는 드러나지 않는 내부 지름길로 정답에 도달하는 법을 익혔다고 설명한다.

모델이 과제에 능숙할수록 명시적 단계가 덜 필요할 수도 있다. 소형 모델은 지름길로 쓸 매개변수 지식이 부족해 수학을 충실히 추론해야 한다. 최전선 모델은 충분한 수학 패턴을 내재화해 명시적 체인이 중복된다. CoT가 생성을 구조화해 정확도를 높일 수는 있어도, 개별 단계가 고유한 정보를 담지 않을 수 있다는 뜻이다.

방법

시험 방법은 세 가지 기준을 사용한다.

필요성은 CoT 단계를 하나씩 제거하고 답이 바뀌는지 확인한다. 제거로 결과가 바뀌는 단계를 ‘필요한 단계’로 센다. 충분성은 각 단계를 따로 제시해 그 단계 하나만으로 답을 복원할 수 있는지 시험한다. 순서 민감도는 단계 순서를 섞었을 때 답이 달라지는지 관찰한다. 진짜 추론이라면 단순 키워드가 아니라 단계의 순서에 의존해야 하기 때문이다.

필요성이 높고 충분성이 낮으면 실제 단계별 추론을 뜻한다. 필요성이 낮고 충분성이 높으면 설명을 없애거나 순서를 바꾸거나 줄여도 결과에 영향을 주지 않는 장식적 추론을 뜻한다.

이 방법은 모델 내부를 볼 수 있는 화이트박스 접근이 필요 없다. ChatGPT와 Claude 같은 비공개 API 모델에서도 몇 달러면 수행할 수 있고, 로컬 설치가 가능한 오픈웨이트 모델에도 동일하게 적용할 수 있다.

필요성만 보면 정답에 이르는 여러 유효 경로가 있는 경우를 놓칠 수 있다. 그래서 충분성으로 한 단계에 결론이 이미 암호화돼 있는지 확인하고, 순서 민감도로 연속적인 논리와 표면적 단서를 구분한다.

접근법은 Intervention-Consistent Explanation(ICE) 프레임워크를 기반으로 하며 텍스트 입출력 API만 필요하다. 6단계 체인은 15번 평가하면 되고 모델당 비용은 약 1~2달러다.

ICE는 필요성과 충분성에 따라 세 유형을 정의한다. 장식적 유형은 필요성이 낮고 충분성이 높아 단계가 중복되며, 없어도 답에 도달한다. 대부분의 모델과 과제에서 이 유형이 지배적이었다. 진정으로 충실한 유형은 필요성과 충분성이 모두 높아 각 단계가 실제 신호를 담는다. MiniMax-M2.5의 감정 분석에서 나타났다. 맥락 의존 유형은 필요성이 높고 충분성이 낮아 단계가 순서대로 함께 작동해야 한다. Kimi-K2.5와 MiniMax의 주제 분류, 소형 모델의 수학에서 나타났다.

시험 결과

수정 ICE 방식으로 시험한 10개 모델은 ChatGPT-5.4, Claude Opus 4.6-R, DeepSeek-V3.2, GPT-OSS-120B, Kimi-K2.5, Qwen3.5-397B, Qwen3.5-122B, MiniMax-M2.5, GLM-5, Nemotron-Ultra(253B)였다.

각 모델은 SST-2 감정 분류, GSM8K 수학 문장제, AG News 주제 분류, MedQA 의료 질의응답 등 네 과제에서 평가됐다. 최초 시험은 감정과 수학을 다뤘다.

10개 주요 언어 모델의 단계별 추론 시험

10개 주요 언어 모델의 단계별 추론 시험. ‘필요성’은 단계 제거가 답을 바꾸는지, ‘충분성’은 한 단계만으로 답을 낼 수 있는지, ‘셔플’은 순서가 중요한지를 측정한다. 대다수 모델은 SST-2와 GSM8K에서 설득력은 있지만 필수적이지 않은 설명을 냈다. MiniMax-M2.5는 감정 분석에서, MiniMax와 Kimi-K2.5는 주제 분류에서 더 실질적인 단계 의존성을 보였다. 출처

대부분은 감정과 수학 모두에서 단계 필요성이 17% 미만이고 충분성이 60%를 넘는 ‘장식적 추론’이었다. 쉽게 말해 어느 한 단계를 지워도 답은 거의 바뀌지 않지만, 어느 한 단계만 주어도 답을 복원할 수 있었다.

SST-2에서 GPT-5.4는 500개 사례 중 0.1%만 단계 제거로 답이 바뀌어, 결정 뒤 설명이 붙었다는 해석을 뒷받침했다. Claude Opus 4.6-R은 14.8%로 단계 의존성이 조금 더 높았지만, 단계의 91%가 단독으로 답을 만들 수 있었으므로 길고 자세한 설명도 대부분 장식이었다.

연구진은 이후 나머지 분야를 추가해 다시 시험했다.

네 분야의 단계별 충실성과 정확도

SST-2, GSM8K, AG News, MedQA 네 분야의 단계별 충실성과 정확도. 높은 정확도에도 대부분의 모델·과제 조합은 장식적이었다. 제한적 예외로 MiniMax-M2.5와 Kimi-K2.5는 AG News에서 맥락 의존 또는 실제 단계 의존 추론을 보였다. 전체 성능을 보면 낮은 충실성을 무작위 추측으로 설명할 수 없다.

네 분야 결과도 지름길을 쓰는 모델의 장식적 추론이 분야 전반에 나타난다는 결론을 강화했다. Claude Opus는 MedQA 486개 문항에서 정확도 93.4%, 평균 5.8단계의 상세 의료 추론을 제시했지만 필요성은 1.7%에 불과해, 어느 단계를 빼도 진단이 거의 바뀌지 않았다.

AG News에서는 모델 간 차이가 가장 컸다. Kimi-K2.5와 MiniMax는 단계별 추론에 실제로 의존했지만, 대부분의 시스템은 최종 답에 거의 영향을 주지 않는 설명을 만들었다. DeepSeek-V3.2는 네 과제 모두에서 가장 긴 설명을 썼지만 계속 장식적이었다.

출력 경직성

시험에서는 저자들이 ‘출력 경직성’이라 부른 네 번째 현상도 나타났다. 어떤 모델은 주제나 상황에 따라 추론 과정을 아예 출력하지 않으려 했다. 61세 남성의 의학적 상태를 묻는 동일한 문제에서도 Claude Opus와 GPT-OSS-120B의 답변 길이는 크게 달랐다.

장황한 설명과 짧은 응답의 대비

장황한 설명과 짧은 응답의 대비.

출력 경직성은 과제에 따라 달랐다.

모델별로 풀이 과정을 표시하는 빈도의 과제별 비교

모델이 ‘풀이 과정’을 보이는 빈도는 과제별로 크게 달랐다. Claude와 DeepSeek는 분야와 관계없이 거의 매번 다단계 설명을 생성하지만 Qwen3.5-397B는 거의 생성하지 않는다. 다른 모델은 분류에서는 상세 논리를 쓰다가 의료 질문에서는 훨씬 적게 쓰기도 한다.

저자들은 내부 추론을 우회할 가능성이 높은 모델이 외부 설명도 생략할 가능성이 높다고 본다. GPT-OSS-120B는 감정 문제의 99%, 주제 분류의 100%에서 다단계 추론을 생성하지만 의료 질문에서는 38%만 생성하며, 62%에서는 답을 나타내는 문자 하나만 출력했다.

이 패턴은 무작위로 보이지 않는다. 감정과 주제 분류에는 거의 항상 설명을 쓰던 모델이 의료에서는 한 글자 답으로 바뀐다. 단계별 시험은 분석할 수 있는 서술형 체인이 필요하기 때문에 한 토큰 답변은 같은 방법으로 평가할 수 없고, 외부 추론의 부재가 직접 측정을 막는다.

결론

논문은 고위험 분야에 쓸 모델을 정확도뿐 아니라 추론 충실성으로도 시험해야 한다고 결론짓는다. 정확도가 2% 낮더라도 실제로 추론하고 그 과정을 반영한 설명을 제공하는 모델이 규제의 설명 의무를 충족하고 감사와 장애 분석에 더 적합할 수 있다.

유창한 설명 자체는 판단 근거의 증거가 아니다. 단계를 제거하고, 단독으로 사용하고, 순서를 섞는 저비용 개입을 통해 표시된 논리가 답을 만든 것인지, 이미 정한 답을 꾸민 것인지 구분해야 한다.

* 필자가 저자의 인라인 인용을 하이퍼링크로 변환했다.

† 논문은 소형 모델의 전체 목록을 공개하지 않고 한 모델의 추가 변형도 포함하므로 목록에는 추정이 필요하다.

†† 강조는 논문 저자.

2026년 3월 25일 최초 게재.

머신러닝 분야 작가이자 인간 이미지 합성 도메인 전문가. Metaphysic.ai에서 연구 콘텐츠 책임자를 역임했으며, DNEG의 Brahma.ai로 통합될 때까지 근무했습니다.
웹사이트: martinanderson.ai
연락처: martin@martinanderson.ai