AI 모델 및 플랫폼

테스트 시간 확장: 새로운 PhD 수준의 추론 모델을 위한 비밀 소스

mm
Unite.AI를 Google의 선호 소스에 추가

인공 지능 분야는 단순히 더 많은 데이터를 추가하거나 모델의 크기를 증가시키는 것이 더 지능적으로 만들 수 있는 방법이 아니라는 점에 도달했습니다.過去 몇 년 동안, 우리는 더 큰 신경망을 구축하고 인터넷의 더 많은 부분을 공급함으로써 궁극적으로 더 지능적으로 만들 수 있을 것이라고 믿었습니다.이 접근 방식, 즉 확장 법칙은 놀라운 성과를 거두었습니다.우리가 시를 작성하고 언어를 번역하며 법학 시험을 통과할 수 있는 모델을 제공했습니다.그러나 이러한 모델은 종종 깊은 논리, 복잡한 수학 및 다단계 과학 문제에 어려움을 겪었습니다.그들은 패턴 매칭에는 훌륭했지만 다단계 추론을 요구하는 문제에서는 종종 실패했습니다.

最近, 새로운 추세가 등장하여 우리가 인공 지능의 능력에 대해 생각하는 방식을 변경하고 있습니다.이 추세는 테스트 시간 확장이라고 합니다.모델이 학습하는 동안에만 집중하는 것이 아니라 실제로 질문에 답변할 때 모델이 “思考”하는 것에 대해 연구자들이 집중하고 있습니다.이 전환은 최신 추론 모델, 예를 들어 OpenAI의 o1 시리즈의 비밀 소스입니다.이 모델은 물리학, 화학, 생물학 gibi 어려운 과목에서 박사 학위 수준의 성능을 발휘하고 있습니다.

학습 확장에서 추론 확장으로의 전환

이것이 주요 변경인지 이해하기 위해, 우리는 지금까지 인공 지능이 어떻게 구축되었는지 살펴보아야 합니다.전통적으로, 모델의 “지능”은其 학습에 따라 결정되었습니다.이는 수천 개의 GPU에서大量의 데이터를 실행하는 데 몇 개월 및 수백만 달러를 소요하는 것을 포함합니다.학습이 완료되면 모델은 본질적으로 동결되었습니다.당신이 질문을 하면, 이미 학습한 패턴에 따라 거의 즉시 답변을 제공했습니다.이것이 우리는 추론 또는 테스트 시간이라고 부르는 것입니다.

이 전통적인 접근 방식의 문제는 모델이 답변을 올바르게 얻을 수 있는 기회가 하나뿐이라는 것입니다.모델은 논리를 “생각”하거나 “재확인”할 수 있는 방법 없이 이미 학습한 패턴에 따라 토큰을 하나씩 처리합니다.테스트 시간 확장은 이 역학을 변경합니다.모델이 추론 단계에서 더 많은 컴퓨팅 파워를 사용할 수 있도록 합니다.인간이 간단한 질문에 몇 초가 걸리지만 복잡한 수학 문제를 해결하는 데 몇 분 또는 몇 시간이 걸릴 수 있는 것과 마찬가지로, 인공 지능 모델은 이제 작업의 난이도에 따라 노력을 확장할 수 있도록 설계되고 있습니다.

테스트 시간 확장의 개념 정의

테스트 시간 확장은 모델이 요청 시 추가 컴퓨팅 리소스를 사용하여 처리할 수 있는 기술을 말합니다.간단히 말해, 모델에 더 많은 “생각 시간”을 주는 것입니다.이것은 모델을 더 크게 만드는 것이 아니라 모델을 더 의도적으로 만드는 것입니다.테스트 시간 확장을 사용하는 모델은 단순히 생각나는 첫 번째 답변을 생성하지 않습니다.대신, 모델은 다양한 경로를 탐색하고, 자신의 논리에서 오류를 확인하고, 사용자가 답변을 보기 전에 답변을 정제할 수 있습니다.

이 개념은 종종 인간의 뇌가 작동하는 방식과 비교됩니다.심리학자들은 종종 “시스템 1″과 “시스템 2” 사고에 대해 이야기합니다.시스템 1은 빠르며 본능적이며 감정적입니다.당신이 얼굴을 인식하거나 익숙한 길을 운전할 때 사용하는 것입니다.시스템 2는 더 느리며 의도적이며 논리적입니다.당신이 어려운 수학 방정식을 해결하거나 복잡한 프로젝트를 계획할 때 사용하는 것입니다.최근까지, 대규모 언어 모델(LLM)은 주로 시스템 1 사고자였습니다.테스트 시간 확장은 시스템 2 사고를 접근할 수 있는 다리를 제공합니다.

추론 프로세스의 메커니즘

연구자들이 테스트 시간 확장을 달성하는 방법은 여러 가지가 있습니다.가장 일반적인 방법 중 하나는 사고 연쇄(Chain of Thought) 프롬프트입니다.그러나 이러한 새로운 모델에서는 사용자가 요청할 필요 없이 시스템에 직접 구축됩니다.모델은 문제를 더 작은 논리적인 단계로 분해하는 것을 학습합니다.이렇게 함으로써, 모델은 각 부분의 솔루션을 확인한 후 다음 단계로 진행할 수 있습니다.

또 다른 중요한 기술은 몬테 카를로 트리 검색과 같은 검색 알고리즘을 사용하는 것입니다.다음으로 가장 가능성이 높은 단어를 예측하는 것보다, 모델은 여러 가능한 경로를 생성하고 각 경로를 평가하여 올바른 솔루션으로 이어질 가능성이 가장 높은 경로를 결정합니다.만약 모델이 막다른 길에 도달하거나 이전 단계가 잘못되었다는 것을 깨닫게 되면, 모델은 다른 접근 방식을 시도할 수 있습니다.이 “미리 보기” 기능은 체스 엔진이 최선의 이동을 선택하기 전에 수천 개의 가능한 이동을 평가하는 방식과 매우 유사합니다.추론 단계에서 많은 가능성을 검색함으로써, 모델은 표준적인 대규모 언어 모델을 사용하여 직접 해결할 수 있는 것보다 훨씬 더 복잡한 문제를 해결할 수 있습니다.

PhD 수준의 추론이 메모리 이상의 것을 필요로 하는 이유

이것이 중요한 이유는 과학 및 수학의 고급 추론이 단순히 메모리만으로 해결될 수 없기 때문입니다.PHD 수준의 물리학 시험에서, 당신은 단순히 교과서에서 읽은 사실을 반복할 수 없습니다.당신은 새로운 상황에 복잡한 원리를 적용해야 합니다.표준 모델은 이러한 시나리오에서 종종 환각을 보입니다.그들은 논리보다는 확률에 따라 다음 단어를 예측하려고 시도하기 때문입니다.

테스트 시간 확장은 모델이 연구자와 같은 방식으로 작동할 수 있도록 합니다.모델은 내부적으로 가설을 테스트할 수 있습니다.예를 들어, 모델이 복잡한 코드를 작성하라는 요청을 받으면, 모델은 내부적으로 논리를 “실행”하고 잠재적인 버그를 식별하며 최종 코드를 표시하기 전에 버그를 수정할 수 있습니다.이 자기 수정 능력은 새로운 모델이 American Invitational Mathematics Examination (AIME) 또는 GPQA와 같은 벤치마크에서 높은 점수를 얻을 수 있도록 합니다.그들은 단순히 추측하는 것이 아니라 검증합니다.

효율성 트레이드 오프 및 컴퓨팅 비용

테스트 시간 확장은 강력하지만, 상당한 비용이 따릅니다.과거에는 인공 지능에서 가장 비싼 부분이 모델의 학습이었습니다.모델이 배포되면 실행하는 것은 상대적으로 저렴하고 빠르었습니다.테스트 시간 확장으로 인해 비용이 사용자의 요청으로 이동했습니다.모델이 더 많은 작업을 수행하고 여러 경로를 생성하며 자신의 작업을 확인하기 때문에, 모델은 더 오랜 시간을 소요하고 더 많은 하드웨어 리소스를 필요로 합니다.

이것은 인공 지능의 새로운 경제학을 창조합니다.쿼리당 비용이 크게 달라질 수 있는 상황으로 이동하고 있습니다.간단한 질문은 몇 분의 1만큼 비용이 들고 1초가 걸릴 수 있습니다.깊은 과학적 탐구는 수십 달러의 컴퓨팅 시간이 소요될 수 있으며 처리에 1시간이 걸릴 수 있습니다.이 트레이드 오프는 고급 추론을 달성하는 데 필요하지만, 또한 개발자가 이러한 모델을 효율적으로 만들 수 있도록 하여 의료 또는 엔지니어링과 같은 산업에서 대규모로 사용할 수 있도록 해야 합니다.

인공 지능의 미래에 대한 영향

테스트 시간 확장의 부상은 인공 지능 개발의 새로운 시대를 의미할 수 있습니다.수년 동안, 우리는 결국 높은 품질의 인간 데이터를 모델에 학습시키는 데 한계에 도달할 것이라는 우려를 가지고 있었습니다.모델이 인간이 이미 작성한 것만으로 학습한다면, 모델은 한계에 도달할 수 있습니다.그러나 테스트 시간 확장은 모델이 더 많이 읽는 것보다 더 열심히 생각함으로써 성능을 향상시킬 수 있음을 보여줍니다.

이것은 인공 지능이 자체적으로 발견을 할 수 있는 문을 열어줍니다.모델이 이전에 본 적 없는 문제를 통해 추론할 수 있다면, 모델은 재료 과학, 약물 발견 또는 재생 에너지에서 새로운 솔루션을 찾을 수 있습니다.인공 지능은 텍스트를 요약하는 도움이 되는 보조工具에서 복잡한 문제를 해결하는 데 도움을 줄 수 있는 디지털 협력자로 이동하고 있습니다.우리는 “생성” 인공 지능에서 “추론” 인공 지능으로 이동하고 있습니다.

결론

테스트 시간 확장은 고급 인공 지능을 위한 결실을 맺고 있습니다.추론 단계에서 더 많은 컴퓨팅 파워를 사용할 수 있도록 함으로써, 우리는 예상보다 훨씬 더 빠르게 높은 수준의 성능을 달성했습니다.이러한 모델은 인간 지능과 훨씬 더 가까운 논리가 느껴지는 수준을 보여주기 시작했습니다.

앞으로 나아가면서, 이러한 기술을 정제하는 것이 도전이 될 것입니다.우리는 추론을 더 빠르고 더 접근하기 쉽게 만들면서 “빠른”思考과 “느린”思考 사이의 올바른 균형을 찾는 방법을 찾아야 합니다.비밀 소스는 더 이상 모델의 크기나 모델이 본 데이터의 양이 아닙니다.비밀은 모델이 생각하는 시간에 있습니다.인공 지능의 진행 상황을 따라가고 있는 사람들에게는 명백합니다.초점이 변경되었습니다.경주는 더 이상 단순히 가장 큰 모델을誰が 가지고 있는 것이 아니라, 누구가 가장 잘 추론할 수 있는 모델을 가지고 있는지에 대한 것입니다.이 전환은 앞으로 10년 동안의 혁신을 정의할 것입니다.

Dr. Tehseen Zia는 COMSATS University Islamabad의 정교수이며, 오스트리아 비엔나 기술대학교에서 인공지능 박사학위를 취득했습니다. 인공지능, 기계학습, 데이터 과학, 컴퓨터 비전을 전문으로 하며, 유명한 과학 저널에 발표된 논문으로 знач적인 기여를 했습니다. Dr. Tehseen은 주요 연구자로서 다양한 산업 프로젝트를 이끌었으며, 인공지능 컨설턴트로도 활동했습니다.