AI 모델 및 플랫폼

인공지능의 새로운 직관: 더智能하게 생각하는 것이 더 길게 생각하는 것보다 중요합니다

mm
Unite.AI를 Google의 선호 소스에 추가

인공지능(AI)의 발전은 오랫동안 데이터와 연산 능力的 증가로 성능을 향상시킬 수 있다는 믿음에 의해 주도되어 왔습니다. 이러한 “무력” 접근 방식은 GPT-3와 같은 인상적인 AI 시스템을 만들어 왔으며, 이러한 시스템은 여러 해 동안 놀라운 성능을 보여 왔습니다. 그러나 이러한 패러다임은 제한에 도달하고 있습니다. AI 문제가 더 복잡해짐에 따라, 단순히 더 많은 처리 능력을 추가하는 것이 장기적인 발전에 있어 지속 가능하거나 효과적인 해결책이 아닐 수 있다는 것이 명백해지고 있습니다. 이러한 인식은 연구자들이 자신의 접근 방식을 재고하도록 유도했습니다. 이러한 맥락에서, Deep Cogito의 Cogito v2 모델은 AI 발전의 미래를 변경할 수 있는 새로운 접근 방식을 도입했습니다. 더 많은 처리 능력이나 연장된 추론에 의존하지 않고, Cogito v2는 내부적인 “직관”을 개발하여 모델이 검색을 시작하기 전에 올바른 경로를 식별하도록 합니다. 이것은 AI가 개발되는 방식에 대한 패러다임의 변화입니다. 더 길게 생각하는 것이 아니라, 더智能하게 생각하는 것을 중점으로 합니다.

AI 개발의 변화

수년 동안, AI 발전의 원동력은 “더 많이 더 좋다”라는 생각이었습니다. 이러한 접근 방식은 복잡한 문제를 해결하기 위해 광범위한 추론 체인을 생성하는 AI 모델을 만들어 왔습니다. OpenAI의 모델,例如 GPT-3,은 이러한 접근 방식의 예입니다. 여기서 더 긴 추론 체인은 어려운 작업에서 인상적인 결과를 가져왔습니다. 그러나 이러한 방법은 상당한 단점을 가지고 있습니다. 더 긴 추론 체인은 더 많은 연산 자원을 필요로 하여 추론 시간이 더 길어지고 운영 비용이 더 높아집니다. 또한, 연구에 따르면 이러한 확장된 과정은 종종 감소하는 수익과 효율성을 가져옵니다. 여기서 더 긴 추론은 더 큰 편향과 효율성이 낮아집니다. 기본적인 문제는 더 긴 추론 체인과 더 많은 연산 능력을 사용하는 것이 더 이상 복잡한 AI 문제를 해결하기 위한 효과적인 해결책이 아니라는 것입니다. 이러한 접근 방식은巨大한 처리 시간과 메모리 요구로 제한됩니다.

인공지능에서 ‘직관’이 중요한 이유

현재의 AI 시스템과는 달리, 인간은 문제를 해결하기 위해 “직관”을 사용합니다. 직관은 추론을 통해 문제를 해결하는 것이 아니라, 경험과 학습을 통해 문제를 해결하는 것입니다. 이것은 인간이 빠르게 결정할 수 있도록 해줍니다. 이것은 인간이 문제를 해결하는 방식과 달리, AI는 더 많은 연산 능력을 사용하여 문제를 해결합니다. AI의 새로운 “직관”은 이러한 과정을 복제하도록 설계되었습니다.
이 아이디어는 또한 “지능 이전”이라고 불리며, AI 시스템에 인간과 같은 추론 능력을 제공하고, 더 효율적으로 만들 수 있습니다. 강한 지능 이전을 가진 AI 모델은 광범위한 계산 없이도 성공할 가능성이 높은 해결책을 예상할 수 있습니다. 대신에, 비용적인 검색 방법에 의존하지 않고, 이전의 지식을 활용하여 가장 효과적인 경로를 찾습니다.

Cogito v2에서 ‘직관’을 구현한 방법

Cogito는 최근에 출시한 모델 Cogito v2에서 ‘직관’을 구현했습니다. 이 아이디어는 반복적 증류 및 증폭(Iterated Distillation and Amplification, IDA)이라고 불리는 메커니즘을 사용하여 구현되었습니다. 이 메커니즘은 모델이 자신의 추론 과정을 학습하고, 문제 해결 능력을 시간이 지남에 따라 개선할 수 있도록 합니다. 정적인 프롬프트나 고정된 교사에 의존하지 않고, IDA는 AI가 자신의 추론 경로를 핵심 모델 매개변수에 다시 증류할 수 있도록 합니다. 이 자기 개선 과정은 모델의 추론 능력을 시간이 지남에 따라 개선하여, 정확한 답변뿐만 아니라, 가장 효율적인 생각 방법에 대해 최적화합니다.

  • 반복적 증류 및 증폭(IDA)

IDA가 작동하는 방식을 이해하기 위해, 이중 처리 이론을 살펴볼 수 있습니다. 이 이론은 인간의 생각을 두 가지 시스템으로 나눕니다. 시스템 1은 빠르고 직관적인 결정이며, 시스템 2는 더 느리고 의도적인 추론입니다. 이 이론은 인간이 대부분의 작업에서 시스템 1을 사용하지만, 더 복잡한 결정에 직면하면 시스템 2를 사용한다고 제안합니다.
IDA는 두 단계의 주기입니다. 증폭 단계에서, 모델은 집중적인 계산 방법을 사용하여 높은 品質의 해결책이나 추론 경로를 생성합니다. 이것은 시스템 2의 생각과 유사하며, AI가 잠시 동안 잠재적인 해결책을 주의 깊게 평가합니다. 증류 단계에서, 모델은 증폭 단계의 통찰력을 내부화하여, 추론 과정을 시스템 2에서 시스템 1으로 변환합니다. 인간 운전자가 경험을积累함에 따라 더 직관적으로 운전할 수 있는 것과 마찬가지로, IDA를 사용하는 AI 모델은 시간이 지남에 따라 더 빠르고 효율적인 결정을 내릴 수 있습니다.
IDA의 핵심 아이디어는 증폭 단계에서 계산적으로 집중적인 추론을 사용한 다음, 증류 단계에서 추론을 모델의 매개변수에 다시 증류하는 것입니다. 이 과정은 모델이 직관적으로 문제를 해결할 수 있는 능력을 구축하여, 더 少ない 연산 자원을 사용하여 결정을 내릴 수 있도록 합니다. 이 주기를 반복함으로써, AI 시스템은 연산 자원을 더 少ない로 하여, 결정을 내리는 능력을 지속적으로 개선할 수 있습니다.

인공지능에 ‘직관’을 통합하는 장점

AI의 직관을 통합하는 주요 장점 중 하나는 효율성입니다. Cogito v2와 같은 모델은 경쟁 모델보다 60% 더 짧은 추론 체인을 보여줍니다. 이것은 모델이 더 少ない 단계로 답변에 도달할 수 있으며, 추론에 필요한 시간과 자원을 줄일 수 있습니다. 예를 들어, DeepSeek R1이 200개의 토큰으로 해결할 수 있는 문제는 Cogito v2가 100개의 토큰으로 해결할 수 있습니다.
또한, Cogito v2의 훈련 비용은 전통적인 AI 모델보다 훨씬 낮습니다. Cogito v2의 전체 훈련 과정은 3.5백만 달러 미만으로, 이는 대규모 모델인 GPT-4와 같은 모델의 비용보다 훨씬 낮습니다.
Cogito v2는 또한 훈련되지 않은 분야에서 새로운 능력을 보여주었습니다. 예를 들어, 텍스트에 주로 훈련되었지만, Cogito v2는 이미지에 대해 추론할 수 있으며, 이미지 구성과 서식에 대한 통찰력을 제공할 수 있습니다. 이것은 일반화된 지능의 중요한 里程碑이며, 인공 일반 지능(Artificial General Intelligence, AGI)의 발전을 위한 중요한 단계입니다.

AI 개발의 재고

지능 이전의 성공은 AI 개발 전략이 근본적으로 변경되어야 함을 시사합니다. 모델 크기나 연산 자원을 증가시키는 것보다, 모델이 자신의 인지 전략을 개발하고 개선할 수 있는 시스템을 구축하는 것을 중점으로 해야 합니다. 이것은 인간의 인지 발전에 대한 이해와 일치합니다. 여기서 지능은 더 큰 뇌 또는 더 많은 생각 시간의 결과가 아니라, 더好的 정신 모델과 추론 전략의 결과입니다. 이 접근 방식의 변경은 장기적인 영향을 미칠 수 있습니다. 더智能하게 생각하는 것을 강조함으로써, AI는 더 유연하고, 적응 가능하며, 새로운 도전을 해결할 수 있습니다. 이것은 의료, 사이버 보안, 자율 주행차와 같은 산업에서 AI의 적용을 가속화할 수 있으며, AI 시스템을 더 효율적이고, 비용 효율적이며, 영향력이 있는 시스템으로 만들 수 있습니다.

결론

Cogito v2의 성공은 AI의 미래가 모델을 확대하거나 연산 능력을 증가시키는 것이 아니라, 추론 아키텍처를 개선하고, 더智能하게 문제를 해결하는 것에 있음을 보여줍니다. 이것은 AI 시스템이 더 지속 가능하고, 접근하기 쉬운 미래를 약속합니다. 여기서 시스템은 더 少ない 연산 자원을 사용하여 지속적으로 개선하고, 적응할 수 있습니다. 지능적인 추론에 중점을 둠으로써, AI는 더 복잡한 실세계 문제를 해결할 수 있습니다.

Dr. Tehseen Zia는 COMSATS University Islamabad의 정교수이며, 오스트리아 비엔나 기술대학교에서 인공지능 박사학위를 취득했습니다. 인공지능, 기계학습, 데이터 과학, 컴퓨터 비전을 전문으로 하며, 유명한 과학 저널에 발표된 논문으로 знач적인 기여를 했습니다. Dr. Tehseen은 주요 연구자로서 다양한 산업 프로젝트를 이끌었으며, 인공지능 컨설턴트로도 활동했습니다.