AI 모델 및 플랫폼

은으로부터 금까지: DeepMind의 AI가 수학 올림피아드를 정복한 방법

mm
Unite.AI를 Google의 선호 소스에 추가

DeepMind의 AI는 단 1년 만에 수학적 추론에서 놀라운 발전을 이루었습니다. 2024년 국제 수학 올림피아드(IMO)에서 은메달을 획득한 후, 2025년에는 금메달을 획득했습니다. 이러한 급격한 발전은 복잡하고 추상적인 문제를 해결하는 인공지능의 능력이 점점 더 성장하고 있음을 강조합니다. 이 기사에서는 DeepMind가 이러한 변화를 어떻게 이루었는지, 그背後에 있는 기술적 및 전략적 선택, 그리고 이러한 발전의 더广い 의미를 살펴보겠습니다.

IMO의 중요성

1959년에 설립된 국제 수학 올림피아드는 전 세계적으로 최고의 수학 대회로 인정받고 있습니다. 매년, 전 세계 최고의 학생들이 대면하여 6つの 어려운 문제를 풀어야 합니다. 이러한 문제를 해결하는 데에는 단순한 계산 이상의 것이 필요합니다. 참가자들은 실제 수학적 창의력, 엄격한 논리적思考, 그리고 우아한 증명을 보여야 합니다.

인공지능에게 IMO는 독특한 도전입니다. 인공지능은 패턴 인식, 데이터 분석, 그리고 고와 체스와 같은 복잡한 게임을 마스터했습니다. 그러나 올림피아드 수학은 창의적이고 추상적인 추론, 새로운 아이디어의 합성, 그리고 전통적으로 인간 지능의 특徵으로 간주되는 능력을 요구합니다. 따라서 IMO는 인공지능이真正한 인간적인 추론에 얼마나 가까이 다가갔는지 평가하는 자연스러운 시험장이 되었습니다.

2024년 은메달의 돌파구

2024년, DeepMind는 두 개의 AI 시스템을 소개했습니다: AlphaProof와 AlphaGeometry 2. 두 시스템 모두 “신경-기호” AI의 예입니다. 대규모 언어 모델(LLM)의 강점과 기호 논리의 엄격성을 결합합니다.

AlphaProof는 수학적 문장을 증명하는 데 사용되었습니다. 이는 Lean이라는 형식적 수학 언어를 사용했습니다. AlphaProof는 Gemini라는 대규모 언어 모델과 AlphaZero라는 강화 학습 엔진을 결합했습니다. Gemini는 자연어 문제를 Lean으로 번역하고 증명을 시도하는 역할을 맡았습니다. AlphaProof는 다양한 수학적 분야와 난이도의 샘플 문제를 통해 훈련되었습니다. 시스템은 점점 더 복잡한 문장을 증명하려고 시도함으로써 자신을 개선했습니다.

AlphaGeometry 2는 기하학 문제를 해결하는 데 사용되었습니다. 여기서 Gemini의 언어 이해能力은 AI가 도움이 되는 보조 구조를 예측하는 데 도움이 되었습니다. 기호적 추론 엔진은 논리적 추론을 관리했습니다. 이러한 하이브리드 접근 방식으로 AlphaGeometry는 전통적인 기계적 추론의 범위를 넘어서는 기하학 문제를 해결할 수 있었습니다.

두 시스템은 6개의 IMO 문제 중 4개를 해결했습니다: 2개의 대수, 1개의 수론, 1개의 기하학 문제를 해결하여 42점 중 28점을 획득했습니다. 이는 AI가 처음으로 IMO에서 은메달을 획득한 것입니다. 그러나 이 성공은 문제를 형식적 수학 언어로 번역하는 데 인간 전문가의 도움이 필요했습니다. 또한大量의 계산 자원이 필요했습니다.

금메달을 위한 기술적 혁신

DeepMind의 은메달에서 금메달로의 전환은 몇 가지 중요한 기술적 개선에 의해 주도되었습니다.

1. 자연어를 증명의 매체로 사용

가장 중요한 변화는 전문가가 형식적 언어로 번역해야 하는 시스템에서 자연어를 증명의 매체로 사용하는 시스템으로의 전환입니다. 이는 Gemini의 업그레이드 버전인 Deep Think을 사용하여 달성되었습니다. 모델은 텍스트를 직접 처리하고 비형식적 스케치를 생성하며 내부적으로 중요한 단계를 형식화하고 영어 증명을 생성합니다. 인간의 피드백에서 강화 학습(RLHF)을 사용하여 논리적으로 일관성 있고 간결하며 제시된 해결책을 보상했습니다.

Gemini Deep Think은 두 가지 주요 방식으로 공개 버전의 Gemini와 다릅니다. 첫째, 더 긴 컨텍스트 창과 더 많은 컴퓨팅 토큰을 할당하여 모델이 여러 페이지의 사고를 유지할 수 있습니다. 둘째, 평행 추론을 사용하여 다양한 잠재적 해결책에 대해 수백 개의 추측적 스레드를 생성합니다. 가벼운 감독자가 가장 약속하는 경로를 평가하고 승격합니다. 이는 몬테 카를로 트리 검색의 개념을 차용하지만 텍스트에 적용됩니다. 이는 인간 팀이 아이디어를 моз토름하고, 비생산적인 아이디어를 폐기하고, 우아한 해결책으로 수렴하는 방식과 유사합니다.

2. 훈련과 강화 학습

Gemini Deep Think의 훈련에는 모델을 다음 단계를 예측하도록 미세 조정하는 것이 포함되었습니다. 이를 위해 100,000개의 고품질 올림피아드와 대학 대회 해결책이 수집되었습니다. 이 корпус는 주로 공공 수학 포럼, arXiv 사전 인쇄본, 대학 문제 세트에서 수집되었습니다. 인간 멘토가 훈련 예를 검토하여 비논리적이거나 불완전한 증명을 필터링했습니다. 강화 학습이 모델을 정교한 증명을 생성하도록 도왔습니다. 초기 버전은 너무冗長한 증명을 생성했지만,冗長한 구절에 대한 페널티가 출력을 정리하는 데 도움이 되었습니다.

従来의 미세 조정과 달리, 피드백이 이진법일 때(즉, 증명이 올바르거나 그렇지 않을 때) 어려움을 겪는 경우, DeepMind는 각 검증된 하위 레마가 전체 점수에 기여하는 단계별 보상 시스템을 구현했습니다. 이 보상 메커니즘은 완전한 증명이 빈번하지 않은 경우에도 Gemini를 안내합니다. 훈련 과정은 3개월 동안 지속되었으며 약 25백만 TPU-시간을 사용했습니다.

3. 대규모 평행화

평행화도 DeepMind의 은메달에서 금메달로의 발전에서 중요한 역할을 했습니다. 각 문제는 여러 가지 추론 분기를 평행하게 생성했으며, 자원은 더 약속하는 경로로 동적으로 이동했습니다. 이는 특히 조합론 문제에서 유용했습니다. 이는 인간이 보조 부등식을 테스트하기 전에 전체 귀납을 수행하는 방식과 유사합니다. 이 접근 방식은 계산적으로 비싼데, DeepMind의 TPU v5 클러스터를 사용하여 관리할 수 있었습니다.

2025년 DeepMind의 IMO

경쟁의 무결성을 유지하기 위해, DeepMind는 모델의 가중치를 3주 전에 동결하여 공식 문제가 훈련 세트에 유출되지 않도록 했습니다. 또한 이전에 출판되지 않은 올림피아드 문제에 대한 해결책을 포함하는 데이터를 필터링했습니다.

경쟁 기간 동안, Gemini Deep Think는 6개의 공식 문제를 평문 형식으로 제공받았으며, 인터넷에 접근할 수 없었습니다. 시스템은 표준 랩톱의 컴퓨팅 파워를 시뮬레이션하도록 구성된 클러스터에서 작동했습니다. 전체 문제 해결 과정은 3시간 이내에 완료되었습니다. 생성된 증명은 IMO 조정자에게 변경 없이 제출되었습니다.

Gemini Deep Think은 첫 5개의 문제에서 완벽한 점수를 얻었습니다. 마지막 문제는 인간 참가자의 94%와 마찬가지로 어려운 조합론 퍼즐이었습니다. 그러나 AI는 42점 중 35점을 얻어 금메달을 획득했습니다. 이는 전年的 은메달 성과보다 7점 더 높은 점수였습니다. 관찰자들은 이후 AI의 증명을 “신중한” 그리고 “완전한”이라고 묘사하며, 인간 참가자가 기대하는 엄격한 정당성을 따랐다고 언급했습니다.

인공지능과 수학에 대한 의미

DeepMind의 성과는 인공지능과 수학 모두에게 중요한 里程碑입니다. 인공지능에게 IMO를 정복하는 것은 인공지능 일반 지능(AGI)으로 향하는 한 단계입니다. 여기서 시스템은 인간이 수행할 수 있는 모든 지적 작업을 수행할 수 있습니다. 복잡한 수학적 문제를 해결하는 데에는 추론과 이해가 필요하며, 이는 일반 지능의 기본 구성 요소입니다. 이 성공은 인공지능이 더욱 인간적인 인지 능력으로 발전하고 있음을 나타냅니다.

수학적으로, AI 시스템은 수학자에게 귀중한 도구가 될 수 있습니다. 새로운 분야를 탐색하고, 가설을 검증하며, 심지어 새로운 정리를 발견하는 데 도움이 될 수 있습니다. 증명 구성을 더 단순화함으로써, AI는 인간 수학자들이 더 높은 수준의 개념적 작업에 집중할 수 있도록 해줍니다. 또한 이러한 AI 시스템을 개발한 기술은 인간의 노력만으로는 불가능한 수학적 연구 방법에 영감을 줄 수 있습니다.

그러나 AI의 수학적 발전은 교육 환경과 대회에서 AI의 역할에 대한 질문을 제기합니다. AI의 능력이 계속 성장함에 따라, 수학 교육과 경쟁의 본질이 어떻게 바뀔지에 대한 논의가 있을 것입니다.

미래를 향해

IMO에서 금메달을 획득하는 것은 중요한 里程碑이지만, 현재의 AI 시스템으로는 여전히 해결할 수 없는 수학적 도전이 많습니다. 그러나 1년 만에 은메달에서 금메달로의 급격한 발전은 AI 혁신과 발전의 가속화된 속도를 강조합니다. 이러한 속도가 계속된다면, AI 시스템은 곧 수학의 가장 유명한 미해결 문제를 해결할 수 있을 것입니다. AI가 인간의 창의력을 대체할지还是 강화할지는 여전히 미해결된 질문이지만, 2025년 IMO는 인공지능이 논리적 추론에서 중요한 발전을 이루었다는 것을 명확히 보여줍니다.

Dr. Tehseen Zia는 COMSATS University Islamabad의 정교수이며, 오스트리아 비엔나 기술대학교에서 인공지능 박사학위를 취득했습니다. 인공지능, 기계학습, 데이터 과학, 컴퓨터 비전을 전문으로 하며, 유명한 과학 저널에 발표된 논문으로 знач적인 기여를 했습니다. Dr. Tehseen은 주요 연구자로서 다양한 산업 프로젝트를 이끌었으며, 인공지능 컨설턴트로도 활동했습니다.