AI 모델 및 플랫폼

인공지능의 새로운 직관: 더智能하게 생각하는 것이 더 길게 생각하는 것보다 중요합니다

mm
Unite.AI를 Google의 선호 소스에 추가

AI 발전은 오랫동안 데이터와 연산 능력을 늘리면 성능이 향상된다는 믿음에 힘입어 왔습니다. 이 brute-force 방식은 GPT-3 같은 인상적인 시스템을 만들었지만 이제 한계에 다다르고 있습니다. 문제가 복잡해질수록 처리 능력을 단순히 늘리는 방식은 장기적으로 지속 가능하거나 효과적인 해결책이 아니라는 점이 분명해졌습니다. 이에 연구자들은 접근법을 재검토하고 있습니다. 이런 맥락에서 Deep Cogito의 Cogito v2 모델은 AI 발전의 미래를 바꿀 수 있는 새로운 접근법을 제시했습니다. Cogito v2는 더 많은 연산이나 긴 추론에 의존하는 대신 내부적인 “직관”을 길러 탐색을 시작하기 전에 올바른 경로를 알아보도록 합니다. 이는 더 오래 생각하는 대신 더 영리하게 생각하는 데 초점을 맞춘 AI 개발 패러다임의 변화입니다.

AI 개발의 변화

수년 동안 AI 발전은 “많을수록 좋다”는 생각에 이끌렸습니다. OpenAI의 GPT-3 같은 모델은 복잡한 문제를 풀기 위해 긴 추론 과정을 생성하며 어려운 작업에서 인상적인 결과를 냈습니다. 하지만 긴 추론은 더 많은 연산 자원과 시간, 운영 비용을 요구합니다. 연구에 따르면 과정이 길어질수록 수익은 체감하고 효율도 떨어질 수 있습니다. 결국 긴 추론과 더 많은 연산만으로는 복잡한 AI 문제를 효과적으로 해결하기 어렵고, 막대한 처리 시간과 메모리 요구가 한계가 됩니다.

인공지능에서 ‘직관’이 중요한 이유

현재의 AI 시스템과는 달리, 인간은 문제를 해결하기 위해 “직관”을 사용합니다. 직관은 추론을 통해 문제를 해결하는 것이 아니라, 경험과 학습을 통해 문제를 해결하는 것입니다. 이것은 인간이 빠르게 결정할 수 있도록 해줍니다. 이것은 인간이 문제를 해결하는 방식과 달리, AI는 더 많은 연산 능력을 사용하여 문제를 해결합니다. AI의 새로운 “직관”은 이러한 과정을 복제하도록 설계되었습니다.
이 아이디어는 또한 “지능 이전”이라고 불리며, AI 시스템에 인간과 같은 추론 능력을 제공하고, 더 효율적으로 만들 수 있습니다. 강한 지능 이전을 가진 AI 모델은 광범위한 계산 없이도 성공할 가능성이 높은 해결책을 예상할 수 있습니다. 대신에, 비용적인 검색 방법에 의존하지 않고, 이전의 지식을 활용하여 가장 효과적인 경로를 찾습니다.

Cogito v2에서 ‘직관’을 구현한 방법

Cogito는 최근에 출시한 모델 Cogito v2에서 ‘직관’을 구현했습니다. 이 아이디어는 반복적 증류 및 증폭(Iterated Distillation and Amplification, IDA)이라고 불리는 메커니즘을 사용하여 구현되었습니다. 이 메커니즘은 모델이 자신의 추론 과정을 학습하고, 문제 해결 능력을 시간이 지남에 따라 개선할 수 있도록 합니다. 정적인 프롬프트나 고정된 교사에 의존하지 않고, IDA는 AI가 자신의 추론 경로를 핵심 모델 매개변수에 다시 증류할 수 있도록 합니다. 이 자기 개선 과정은 모델의 추론 능력을 시간이 지남에 따라 개선하여, 정확한 답변뿐만 아니라, 가장 효율적인 생각 방법에 대해 최적화합니다.

  • 반복적 증류 및 증폭(IDA)

IDA가 작동하는 방식을 이해하기 위해, 이중 처리 이론을 살펴볼 수 있습니다. 이 이론은 인간의 사고를 빠르고 직관적으로 판단하는 시스템 1과 느리고 의식적으로 추론하는 시스템 2로 나눕니다. 인간은 대부분의 작업에 시스템 1을 쓰고 복잡한 결정에서는 시스템 2를 사용한다고 봅니다.
IDA는 증폭과 증류의 두 단계로 반복됩니다. 증폭 단계에서 모델은 계산 집약적인 방법으로 고품질 해답이나 추론 경로를 만듭니다. 이는 잠재적 해답을 주의 깊게 평가하는 시스템 2 사고와 비슷합니다. 증류 단계에서는 이 통찰을 모델 내부에 흡수해 추론을 시스템 2에서 시스템 1 방식으로 바꿉니다. 운전자가 경험을 쌓으며 더 직관적으로 운전하듯 IDA 모델도 시간이 지나면서 더 빠르고 효율적으로 판단합니다.
핵심은 증폭 단계의 집중적인 추론 결과를 증류 단계에서 모델 매개변수에 다시 담는 것입니다. 그러면 모델은 문제를 직관적으로 해결하는 능력을 쌓고 더 적은 연산으로 판단할 수 있습니다. 주기를 반복할수록 적은 자원으로 의사결정하는 능력이 계속 향상됩니다.

인공지능에 ‘직관’을 통합하는 장점

AI에 직관을 통합할 때의 주요 장점은 효율성입니다. Cogito v2 같은 모델은 경쟁 모델보다 추론 과정이 60% 짧아 더 적은 단계로 답에 도달하고 시간과 자원을 줄일 수 있습니다. 예를 들어 DeepSeek R1이 200개 토큰으로 푸는 문제를 Cogito v2는 100개로 풀 수 있습니다.
Cogito v2의 전체 학습 비용은 350만 달러 미만으로 GPT-4 같은 대형 모델보다 훨씬 낮습니다.
텍스트를 중심으로 학습했지만 이미지 구성과 형식에 관해 추론하는 등 학습하지 않은 영역에서도 새로운 능력을 보였습니다. 이는 일반화된 지능의 중요한 이정표이자 AGI 발전을 향한 의미 있는 단계입니다.

AI 개발의 재고

지능 증류의 성공은 AI 개발 전략이 근본적으로 바뀌어야 함을 시사합니다. 모델 크기와 연산 자원을 늘리기보다 모델이 자체 인지 전략을 만들고 개선하는 시스템에 집중해야 합니다. 이는 지능이 더 큰 뇌나 더 긴 사고 시간보다 더 나은 정신 모델과 추론 전략에서 나온다는 인간 인지 발달의 이해와 맞닿아 있습니다. 더 영리하게 생각하는 AI는 유연성과 적응력을 높여 새로운 과제를 해결할 수 있습니다. 의료와 사이버 보안, 자율주행차 같은 분야의 도입을 앞당기고 AI 시스템을 더 효율적이고 경제적이며 영향력 있게 만들 수 있습니다.

결론

Cogito v2의 성공은 AI의 미래가 모델이나 연산 능력을 무작정 키우는 데 있지 않고 추론 아키텍처를 개선해 문제를 더 영리하게 해결하는 데 있음을 보여 줍니다. 이는 더 적은 연산 자원으로 계속 개선하고 적응하는, 지속 가능하고 접근하기 쉬운 AI의 미래를 제시합니다. 지능적인 추론에 집중하면 AI는 더 복잡한 현실 문제도 해결할 수 있습니다.

Tehseen Zia 박사는 COMSATS University Islamabad에서 정년보장을 받은 부교수이며, 오스트리아 빈 공과대학교에서 AI 박사 학위를 취득했습니다. 인공지능, 머신러닝, 데이터 과학, 컴퓨터 비전을 전문으로 하며, 권위 있는 과학 학술지에 논문을 발표해 중요한 기여를 해 왔습니다. 또한 연구책임자로서 다양한 산업 프로젝트를 이끌었으며 AI 컨설턴트로도 활동했습니다.