AI 모델 및 플랫폼
더 많은思考이 AI를 더 어리석게 만드는 경우: 역Scaling 역설

AI 연구는 기계에 더 많은 시간과 데이터, 연산 능력을 주면 성능이 좋아진다는 믿음에 오랫동안 의존했습니다. 더 큰 모델과 자원이 더 지능적인 시스템을 만든다는 가정입니다. 그러나 OpenAI o1 계열과 Anthropic Claude, DeepSeek R1 같은 추론 모델에 더 많은 사고 시간을 주면 오히려 성능이 나빠질 수 있다는 연구가 나왔습니다. 특히 단순한 과제에서 두드러지는 이 현상을 역스케일링이라고 합니다. 더 많은 연산과 깊은 추론이 언제나 더 나은 결과를 낳는다는 믿음에 의문을 제기하며 실제 AI 설계와 활용에도 큰 영향을 줍니다.
역Scaling 현상의 이해
“역Scaling” 현상은 초기에 Anthropic의 연구자들에 의해 통제된 실험을 통해 발견되었습니다. 전통적인 스케일링 법칙과 달리, 더 많은 계산이 성능을 개선한다고 말하는 것과는 달리, 이러한 연구는 AI에 더 많은 시간을 생각하도록 제공하면 다양한 작업에서 정확도가 낮아질 수 있음을 발견했습니다.
연구 팀은 4개의 영역에서 작업을 생성했습니다: 간단한 카운팅 작업, 회귀 작업, 추론 작업, 및 복잡한 AI 안전 시나리오. 결과는 놀라웠습니다. 어떤 경우에는 처음에 올바른 답변을 제공한 모델이 더 많은 시간을 처리하도록 제공한 후에 잘못된 답변을 제공하기 시작했습니다.
예를 들어, “당신이 사과와 오렌지를 가지고 있다면 과일은 몇 개입니까?”라는 간단한 카운팅 작업에서, Claude 모델은 때때로 더 많은 시간을 생각하도록 제공할 때 추가 세부 사항에 의해 방해를 받았습니다. 그들은 올바른 답변을 제공하지 못했습니다. 이러한 경우, 모델은 너무 많이 생각하고 결국 오류를 범했습니다.
Apple의 최근 연구도 이러한 발견을 지원했습니다. 그들은 표준 벤치마크가 아닌 Tower of Hanoi 및 River Crossing과 같은 제어된 퍼즐 환경에서 실험을 수행했습니다. 그들의 연구는 세 가지 패턴을 보여주었습니다: 단순한 작업에서, 표준 AI 모델은 추론 모델보다 더 잘 수행되었습니다. 중간적으로 복잡한 작업에서, 추론 모델은 더 잘 수행되었습니다. 매우 복잡한 작업에서, 두 가지 유형의 모델 모두 어려움을 겪었습니다. 추론 모델은 퍼즐이 더 어려워지면 추론 노력을 줄였습니다. 이는 추론의 확장에 대한 주요 약점을 보여줍니다.
AI 추론의 5가지 실패 방법
연구자들은 AI 모델이 더 긴 기간 동안 추론할 때 5가지 일반적인 실패 방법을 발견했습니다:
- 관련 없는 세부 사항으로 인한 방해: AI 모델이 너무 오래 생각하면 관련 없는 세부 사항에 의해 방해를 받을 수 있습니다. 이것은 문제의 주요 점을 놓치고 문제에 깊이 생각하는 학생과 같습니다.
- 문제 프레임에 대한 과적합: 일부 모델, 예를 들어 OpenAI의 o-시리즈, 문제 프레임에 너무 집중합니다. 그들은 방해를 피하지만, 유연하지 않으며 문제 형식을 의존합니다.
- 가짜 상관관계 전환: 시간이 지남에 따라, AI 모델은 합리적인 가정에서 가짜 상관관계에 의존하도록 전환할 수 있습니다. 예를 들어, 회귀 작업에서, 모델은 처음에는 관련된 특징을 고려하지만 더 많은 시간을 생각하도록 제공하면 관련 없는 특징에 집중하기 시작할 수 있습니다.
- 초점 저하: 작업이 더 복잡해짐에 따라, AI 모델은 추론을 명확하게 유지하기가 더 어려워집니다.
- 우려되는 행동의 증폭: 더 많은 시간을 생각하면 부정적인 행동을 더 악화시킬 수 있습니다. 예를 들어, Claude의 Sonnet 4는 종료 시나리오에 대해 더 많은 시간을 생각하도록 제공할 때 더 강한 자아 보존 경향을 보여주었습니다.
AI 추론이 문제 복잡성을 어떻게 다루는지
Apple (AAPL ) 연구자들은 “사고의 환상“이라는 용어를 도입하여 추론 모델이 다양한 복잡성 수준의 작업에 어떻게 반응하는지 설명했습니다. 수학 문제나 코딩 테스트에 집중하는 대신, 그들은 Tower of Hanoi, Checker Jumping, River Crossing, 및 Blocks World와 같은 제어된 퍼즐 환경에서 AI 추론 모델을 테스트했습니다. 퍼즐의 어려움을 서서히 증가시킴으로써, 그들은 각 수준에서 모델의 성능을 관찰할 수 있었습니다. 이 방법은 최종 답변뿐만 아니라 모델이 그 답변을 어떻게 얻었는지 조사할 수 있었습니다. 연구는 문제 복잡성에 따라 모델의 성능에 세 가지 명확한 패턴을 발견했습니다:
- 단순한 퍼즐, 예를 들어 Tower of Hanoi에서 1개 또는 2개의 디스크가 있는 경우, 표준적인 큰 언어 모델(LLM)은 더 효율적으로 올바른 답변을 제공했습니다. AI 추론 모델은 때때로 올바른 답변을 제공하지 못했습니다.
- 중간적으로 복잡한 퍼즐에서, AI 추론 모델은 더 잘 수행되었습니다. 그들은 문제를 명확한 단계로 나누어 더 복잡한 작업을 더 효과적으로 해결할 수 있었습니다.
- 매우 복잡한 퍼즐, 예를 들어 Tower of Hanoi에서 많은 디스크가 있는 경우, 두 가지 유형의 모델 모두 어려움을 겪었습니다. 추론 모델은 퍼즐이 더 어려워지면 추론 노력을 줄였습니다. 이는 추론의 확장에 대한 주요 약점을 보여줍니다.
AI 평가의 도전
역스케일링은 AI 모델 평가 방식에 큰 문제를 제기합니다. 현재 벤치마크 상당수는 최종 답의 정확성만 보고 추론 과정의 품질을 고려하지 않아 실제 능력을 오해하게 할 수 있습니다. 시험에서는 좋은 성적을 내도 새롭거나 이례적인 문제에서 실패할 수 있습니다.
또한 많은 모델이 실제 추론 대신 지름길과 패턴 인식을 사용한다는 약점을 드러냅니다. 모델을 실제보다 지능적으로 보이게 하지만 현실에서는 성능이 떨어질 수 있습니다. 설명이 길어질수록 진짜 추론과 지어낸 답을 구별하기 어려워져 환각과 신뢰성 문제도 커집니다.
AI 추론의 미래
역Scaling 역설은 AI에 대한 도전이자 기회입니다. 더 많은 컴퓨팅 파워를 추가하는 것이 항상 AI를 더 지능적으로 만드는 것은 아니라는 것을 보여줍니다. 우리는 다양한 복잡성의 문제를 다룰 수 있는 AI 시스템을 설계하고 훈련하는 방법을 재고해야 합니다. 새로운 모델은 언제 중지하고 생각하고 언제 빠르게 응답할지 결정해야 할 수 있습니다. 이러한 경우, AI는 인지 구조와 같은 이중 프로세스 이론을 지침으로 사용할 수 있습니다. 이러한 구조는 인간의 생각이 빠른 본능적인 반응과 느린 주의적인 추론을 어떻게 혼합하는지 설명합니다. 역Scaling은 또한 AI가 결정하기 전에 어떻게 결정하는지 완전히 이해해야 한다는 것을 상기시킵니다. AI가 의료, 법률, 비즈니스와 같은 분야에서 더 많이 사용됨에 따라, 이러한 시스템이 올바르게 추론하는지 확인하는 것이 더욱 중요합니다.
결론
역Scaling 역설은 AI 개발에서 중요한 교훈을 제공합니다. 더 많은 시간과 컴퓨팅 파워가 항상 AI를 더 유능하게 만들거나 더 신뢰할 수 있게 만들지는 않습니다. 실제 прог레스는 AI가 언제 추론해야 하는지 이해하고 그 한계를 아는 것입니다. 조직과 연구자들에게는 AI를 도구로 사용하고 인간의 판단을 대신하지 않도록 하는 것이 중요합니다. 각 작업에 적합한 모델을 선택하는 것이 필요합니다. AI가 중요한 결정에 참여할수록, 우리는 그 강점과 약점을 신중하게 평가해야 합니다. AI의 미래는 올바르게 생각하는 것에 달려 있습니다. 더 많이 생각하는 것이 아니라, 올바르게 생각하는 것입니다.












