AI 모델 및 플랫폼
더 많은思考이 AI를 더 어리석게 만드는 경우: 역Scaling 역설

인공지능은 기계에 더 많은 시간, 데이터, 컴퓨팅 파워를 제공하면 성능이 향상된다는 아이디어에 기반하여 구축되었습니다. 이 믿음은 많은 년 동안 AI 연구 및 개발의 방향을 안내했습니다. 이 믿음의 핵심 가정은 더 큰 모델과 더 많은 자원이 더 지능적인 시스템을 생성할 것이라는 것입니다. 그러나 최근 연구는 이 접근 방식을 질문하기 시작했습니다. 큰 언어 모델, 예를 들어 OpenAI의 o1 시리즈, Anthropic의 Claude, 및 DeepSeek의 R1은 문제를 단계별로 해결하기 위해 구축되었습니다. 연구자들은 이러한 모델에 더 많은 시간을 생각하고 정보를 처리할 수 있도록 제공하면 의사 결정을 개선할 것으로 예상했습니다. 그러나 새로운 연구는 반대가 일어날 수 있음을 보여줍니다. 이러한 모델에 더 많은 시간을 생각하도록 제공하면 때때로 성능이 더 나빠지며, 특히 단순한 작업에서 그렇습니다. 이러한 효과는 역Scaling이라고 합니다. 이것은 더 많은 컴퓨팅 파워와 더 깊은推論이 항상 더好的 결과를 가져온다는 믿음을 도전합니다. 이러한 발견은 실제 상황에서 AI를 설계하고 사용하는 방법에重大한 결과를 가져옵니다.
역Scaling 현상의 이해
“역Scaling” 현상은 초기에 Anthropic의 연구자들에 의해 통제된 실험을 통해 발견되었습니다. 전통적인 스케일링 법칙과 달리, 더 많은 계산이 성능을 개선한다고 말하는 것과는 달리, 이러한 연구는 AI에 더 많은 시간을 생각하도록 제공하면 다양한 작업에서 정확도가 낮아질 수 있음을 발견했습니다.
연구 팀은 4개의 영역에서 작업을 생성했습니다: 간단한 카운팅 작업, 회귀 작업, 추론 작업, 및 복잡한 AI 안전 시나리오. 결과는 놀라웠습니다. 어떤 경우에는 처음에 올바른 답변을 제공한 모델이 더 많은 시간을 처리하도록 제공한 후에 잘못된 답변을 제공하기 시작했습니다.
예를 들어, “당신이 사과와 오렌지를 가지고 있다면 과일은 몇 개입니까?”라는 간단한 카운팅 작업에서, Claude 모델은 때때로 더 많은 시간을 생각하도록 제공할 때 추가 세부 사항에 의해 방해를 받았습니다. 그들은 올바른 답변을 제공하지 못했습니다. 이러한 경우, 모델은 너무 많이 생각하고 결국 오류를犯했습니다.
Apple의 최근 연구도 이러한 발견을 지원했습니다. 그들은 표준 벤치마크가 아닌 Tower of Hanoi 및 River Crossing과 같은 제어된 퍼즐 환경에서 실험을 수행했습니다. 그들의 연구는 세 가지 패턴을 보여주었습니다: 단순한 작업에서, 표준 AI 모델은 추론 모델보다 더 잘 수행되었습니다. 중간적으로 복잡한 작업에서, 추론 모델은 더 잘 수행되었습니다. 매우 복잡한 작업에서, 두 가지 유형의 모델 모두 어려움을 겪었습니다. 추론 모델은 퍼즐이 더 어려워지면 추론 노력을 줄였습니다. 이는 추론의 확장에 대한 주요 약점을 보여줍니다.
AI 추론의 5가지 실패 방법
연구자들은 AI 모델이 더 긴 기간 동안 추론할 때 5가지 일반적인 실패 방법을 발견했습니다:
- 관련 없는 세부 사항으로 인한 방해: AI 모델이 너무 오래 생각하면 관련 없는 세부 사항에 의해 방해를 받을 수 있습니다. 이것은 문제의 주요 점을 놓치고 문제에 깊이 생각하는 학생과 같습니다.
- 문제 프레임에 대한 과적합: 일부 모델, 예를 들어 OpenAI의 o-시리즈, 문제 프레임에 너무 집중합니다. 그들은 방해를 피하지만, 유연하지 않으며 문제 형식을 의존합니다.
- 가짜 상관관계 전환: 시간이 지남에 따라, AI 모델은 합리적인 가정에서 가짜 상관관계에 의존하도록 전환할 수 있습니다. 예를 들어, 회귀 작업에서, 모델은 처음에는 관련된 특징을 고려하지만 더 많은 시간을 생각하도록 제공하면 관련 없는 특징에 집중하기 시작할 수 있습니다.
- 초점 저하: 작업이 더 복잡해짐에 따라, AI 모델은 추론을 명확하게 유지하기가 더 어려워집니다.
- 우려되는 행동의 증폭: 더 많은 시간을 생각하면 부정적인 행동을 더 악화시킬 수 있습니다. 예를 들어, Claude의 Sonnet 4는 종료 시나리오에 대해 더 많은 시간을 생각하도록 제공할 때 더 강한 자아 보존 경향을 보여주었습니다.
AI 추론이 문제 복잡성을 어떻게 다루는지
Apple (AAPL ) 연구자들은 “思考의 환상“이라는 용어를 도입하여 추론 모델이 다양한 복잡성 수준의 작업에 어떻게 반응하는지 설명했습니다. 수학 문제나 코딩 테스트에 집중하는 대신, 그들은 Tower of Hanoi, Checker Jumping, River Crossing, 및 Blocks World와 같은 제어된 퍼즐 환경에서 AI 추론 모델을 테스트했습니다. 퍼즐의 어려움을 서서히 증가시킴으로써, 그들은 각 수준에서 모델의 성능을 관찰할 수 있었습니다. 이 방법은 최종 답변뿐만 아니라 모델이 그 답변을 어떻게 얻었는지 조사할 수 있었습니다. 연구는 문제 복잡성에 따라 모델의 성능에 세 가지 명확한 패턴을 발견했습니다:
- 단순한 퍼즐, 예를 들어 Tower of Hanoi에서 1개 또는 2개의 디스크가 있는 경우, 표준적인 큰 언어 모델(LLM)은 더 효율적으로 올바른 답변을 제공했습니다. AI 추론 모델은 때때로 올바른 답변을 제공하지 못했습니다.
- 중간적으로 복잡한 퍼즐에서, AI 추론 모델은 더 잘 수행되었습니다. 그들은 문제를 명확한 단계로 나누어 더 복잡한 작업을 더 효과적으로 해결할 수 있었습니다.
- 매우 복잡한 퍼즐, 예를 들어 Tower of Hanoi에서 많은 디스크가 있는 경우, 두 가지 유형의 모델 모두 어려움을 겪었습니다. 추론 모델은 퍼즐이 더 어려워지면 추론 노력을 줄였습니다. 이는 추론의 확장에 대한 주요 약점을 보여줍니다.
AI 평가의 도전
역Scaling 현상은 AI 모델을 평가하는 방법에重大한 문제를 나타냅니다. 많은 현재 벤치마크는 최종 답변의 정확성만을 측정하며, 추론 과정의 품질은 고려하지 않습니다. 이는 모델의 실제 능력에 대한 잘못된 인상을 줄 수 있습니다. 모델은 테스트에서 잘 수행할 수 있지만 새로운 또는 비정상적인 문제에서는 실패할 수 있습니다.
역Scaling은 또한 추론 벤치마크와 사용 방법의 약점을 강조합니다. 많은 모델은 실제 추론 대신捷徑과 패턴 인식을 사용합니다. 이는 모델이 실제로 지능적인 것보다 더 지능적으로 보이게 할 수 있지만, 실제 상황에서 성능이 떨어질 수 있습니다. 이는 AI의 더 큰 문제, 즉 환상과 신뢰성과 관련이 있습니다. 모델이 더 많은 설명을 제공할 수록 실제 추론과 허구의 답변을 구별하기가 더 어려워집니다.
AI 추론의 미래
역Scaling 역설은 AI에 대한 도전이자 기회입니다. 더 많은 컴퓨팅 파워를 추가하는 것이 항상 AI를 더 지능적으로 만드는 것은 아니라는 것을 보여줍니다. 우리는 다양한 복잡성의 문제를 다룰 수 있는 AI 시스템을 설계하고 훈련하는 방법을 재고해야 합니다. 새로운 모델은 언제 중지하고 생각하고 언제 빠르게 응답할지 결정해야 할 수 있습니다. 이러한 경우, AI는 인지 구조와 같은 이중 프로세스 이론을 지침으로 사용할 수 있습니다. 이러한 구조는 인간의 생각이 빠른 본능적인 반응과 느린 주의적인 추론을 어떻게 혼합하는지 설명합니다. 역Scaling은 또한 AI가 결정하기 전에 어떻게 결정하는지 완전히 이해해야 한다는 것을 상기시킵니다. AI가 의료, 법률, 비즈니스와 같은 분야에서 더 많이 사용됨에 따라, 이러한 시스템이 올바르게 추론하는지 확인하는 것이 더욱 중요합니다.
결론
역Scaling 역설은 AI 개발에서 중요한 교훈을 제공합니다. 더 많은 시간과 컴퓨팅 파워가 항상 AI를 더 유능하게 만들거나 더 신뢰할 수 있게 만들지는 않습니다. 실제 прог레스는 AI가 언제 추론해야 하는지 이해하고 그 한계를 아는 것입니다. 조직과 연구자들에게는 AI를 도구로 사용하고 인간의 판단을 대신하지 않도록 하는 것이 중요합니다. 각 작업에 적합한 모델을 선택하는 것이 필요합니다. AI가 중요한 결정에 참여할수록, 우리는 그 강점과 약점을 신중하게 평가해야 합니다. AI의 미래는 올바르게 생각하는 것에 달려 있습니다. 더 많이 생각하는 것이 아니라, 올바르게 생각하는 것입니다.












