AI 모델 및 플랫폼

메타의 코코넛: 언어 없이 생각하는 AI 방법

mm
Unite.AI를 Google의 선호 소스에 추가

연구자들이 처음으로 대규모 언어 모델(LLM)이 사슬 想法 프롬프팅을 통해 “생각”할 수 있다는 것을 발견했을 때, 그것은 획기적인 순간이었다. 마침내, 우리는 이러한 블랙박스의 추론 과정을 들여다볼 수 있었다. 하지만 언어 모델이 언어로 생각하는 것을 강요받는 것이 그들을 방해할 수 있다는 것을 생각해 본다면?

메타와 샌디에고 대학의 연구자들이 새로운 코코넛(Chain of Continuous Thought) 방법으로 발견한 바로 그것이다.

복잡한 수학 문제를 풀 때마다 모든 단계를 큰 소리로 말해야 하는 것을 상상해 보십시오. 짜증나지 않나요? 이제 언어 모델이 직면하는 핵심 도전을 이해하기 시작했습니다.

언어 모델이 자연어로 추론할 때:

  • 생성된 대부분의 토큰은 언어적인 글루입니다. “따라서”, “다음”, “결과적으로”와 같은 단어가 추론 가치가 없습니다.
  • 임계적인 결정 지점은 특정 단어로.commit하는 필요에 의해 병목 현상이 발생합니다.
  • 모델은 실제 문제 해결보다 문법적 일관성을 유지하는 데 상당한 계산 노력을 사용합니다.

연구자들은 신경 영상 연구에서 интерес 있는 것을 발견했습니다. 인간이 복잡한 추론 과제를 수행할 때, 우리 뇌의 언어 센터는 종종 놀랍도록 조용합니다. 그러나 우리는 언어로 번역된 모든 추론 단계를 강요하는 AI 시스템을 구축했습니다.

퍼즐을 해결하는 방법을 생각해 보십시오. 당신의 마음은 여러 가능성을 동시에 탐색하고, 애매한 가설을 유지하며, 언어로 생각을 결정할 때까지 생각을 분명히 하지 않습니다. 그러나 전통적인 사슬 想法 접근 방식은 AI 모델이 중간 단계를 언어로 표현하도록 강요하여 “언어적 병목 현상”을 생성합니다.

이 통찰력은 다음과 같은 질문으로 이어졌습니다. AI 모델이 언어로 번역하는 대신, 그들의 내부 상태의 연속적이고 고차원 공간에서 추론할 수 있다면 어떨까요?

코코넛의 혁신 이해

당신의 생각을 큰 소리로 말하는 것과 실제 뇌에서 일어나는 정신적 과정의 차이를 상상해 보십시오. 그 간격 – 언어로 표현된 생각과 신경 활동 사이 – 는 메타의 연구자들이 코코넛에서 활용한 것입니다.

코코넛의 실제 혁신은 AI 모델이 두 가지 다른 방식으로 생각할 수 있도록 합니다. 복잡한 퍼즐을 해결할 때, 당신은 모든 가능한 이동을 머리 속으로 말하지 않습니다. 대신:

  1. 문제를 이해: 정보를 입력합니다(퍼즐 규칙을 읽는 것과 같습니다).
  2. 조용히 생각: 뇌가 언어로 표현하지 않고 여러 가능성을 탐색합니다.
  3. 해결책을 공유: 언어로 생각을 표현합니다.

코코넛은 AI 모델이 이와 같은 자연스러운 유연성을 제공합니다. 전통적인 방법과 달리, 언어로 표현된 모든 생각을 강요하지 않고, 모델이 내부 상태의 연속적이고 고차원 공간에서 생각할 수 있도록 합니다.

모델은 두 가지 모드 사이를 원활하게 전환합니다.

  • 질문이나 답변을 이해해야 할 때, 언어를 사용합니다.
  • 하지만 실제 생각 과정에서는 언어의 제약 없이 순수한 신경 패턴을 사용합니다.

이미지: 메타

교육 과정

코코넛의 가장 흥미로운 측면 중 하나는 교육 과정입니다. 이 교육 과정은 자연스러운 학습 진행을 반영합니다. 복잡한 기술을 가르칠 때, 즉시 깊은 끝으로 брос지 않습니다. 점진적으로 복잡성을 추가합니다.

연구자들은 이 접근 방식을 코코넛에 적용했습니다:

1단계: 기초

まず, 모델은 전통적인 사슬 想法 추론을 통해 학습합니다. 이것은 모델이 기본적인 이해를 제공합니다.

2단계: 전환

여기서 интерес 있는 부분입니다. 점차적으로, 언어로 표현된 추론 단계가 연속적인 생각으로 대체됩니다. 훈련 바퀴를 천천히 제거하는 것을 상상해 보십시오. 모델이 내부적인 생각 패턴을 개발하도록 허용합니다.

3단계: 균형

마지막으로, 모델은 깊은 생각과 언어로 표현된 통찰력을 원활하게 전환하는 것을 학습합니다.

교육 과정에서, 모델은 아무도 명시적으로 프로그래밍하지 않은 능력들을 개발했습니다. 예를 들어, 여러 추론 경로를 동시에 고려하는 것입니다. 이러한 출현하는 행동은 특히 흥미롭습니다. 왜냐하면 이것은 더 자연스러운 AI 추론 형태에 더 가까이 다가가고 있음을 시사하기 때문입니다.

이전의 신경 영상 연구를 기억하나요? 인간의 뇌는 언어 센터를 크게 참여하지 않고 복잡한 추론 과제를 처리한다는 것을 보여주었습니다. 코코넛은 유사한 패턴을 개발하는 것으로 보입니다. 깊은 생각을 내부 상태의 연속적이고 고차원 공간에서 수행하고, 언어로 번역하는 것은 필요한 경우에만 통신할 때입니다.

숫자는 이야기를告诉

연구에서 몇 가지 주요 결과가 돋보입니다:

  • 수학 단어 문제 (GSM8k): 여기서 코코넛은 34.1%의 정확도를 달성했습니다. 전통적인 사슬 想法 접근 방식(42.9%)보다 낮지만, 기초 접근 방식보다 훨씬 좋습니다.
  • 논리적 추론 (ProntoQA): 코코넛은 99.8%의 정확도를 달성했습니다. 전통적인 사슬 想法 접근 방식(98.8%)보다 약간 더 높습니다. 하지만 여기서 핵심은, 코코넛이 9개의 토큰만 사용했지만, CoT는 92.5개의 토큰을 사용했다는 것입니다.
  • 복잡한 계획 (ProsQA): 가장 인상적인 결과는 이 고급 추론 테스트에서 나왔습니다. 코코넛은 97%의 정확도를 달성했습니다. 전통적인 방법은 77.5%에 불과했습니다. 그리고 다시, 코코넛은 14.2개의 토큰만 사용했지만, 전통적인 방법은 49.4개의 토큰을 사용했습니다.

이 결과가 약속하는 것은 단순히 숫자가 아니라, 다양한 종류의 생각을 나타냅니다. 코코넛이 수학적 추론에서 아직 발전 중일 수 있지만, 복잡한 논리적 계획과 추론이 필요한 작업에서 탁월합니다.

코코넛은 AI 시스템이 추론하는 방식을 근본적으로 재고하는 것입니다. 이것은 더 자연스럽고, 효율적이고, 강력한 형태의 인공지능으로 우리를 더 가까이 가져옵니다. 언어 기반 추론에서 연속적인 생각으로의 여정은 더 능력 있고 효율적인 AI 시스템을 향한 한 걸음입니다.

Alex는 Unite.AI의 AI 기반 뉴스 운영을 이끌며, 저널리즘, 연구 및 자동화를 결합해 인공지능에 대한 시기적절하고 확장 가능한 보도를 지원합니다. 그의 작업은 새로운 AI 개발이 효율적으로 조명되도록 하면서도 출판물의 편집 기준을 유지하도록 돕습니다.