AI 모델 및 플랫폼

은으로부터 금까지: DeepMind의 AI가 수학 올림피아드를 정복한 방법

mm
Unite.AI를 Google의 선호 소스에 추가

DeepMind의 AI는 단 1년 만에 수학적 추론에서 놀라운 발전을 이루었습니다. 2024년 국제 수학 올림피아드(IMO)에서 은메달을 획득한 후, 2025년에는 금메달을 획득했습니다. 이러한 급격한 발전은 복잡하고 추상적인 문제를 해결하는 인공지능의 능력이 점점 더 성장하고 있음을 강조합니다. 이 기사에서는 DeepMind가 이러한 변화를 어떻게 이루었는지, 그 배후에 있는 기술적 및 전략적 선택, 그리고 이러한 발전의 더 넓은 의미를 살펴보겠습니다.

IMO의 중요성

1959년에 설립된 국제 수학 올림피아드는 세계 최고 수준의 수학 경시대회로 인정받습니다. 매년 각국의 우수 학생들이 한자리에 모여 단순 계산을 넘어 창의성과 엄밀한 논리, 우아한 증명을 요구하는 어려운 문제 여섯 개를 풉니다.

AI에도 IMO는 독특한 도전입니다. AI는 패턴 인식과 데이터 분석, 바둑과 체스 같은 복잡한 게임을 익혔지만 올림피아드 수학에는 창의적이고 추상적인 추론과 새로운 아이디어의 결합이 필요합니다. 전통적으로 인간 지능의 특징으로 여겨진 능력이어서 AI가 인간다운 추론에 얼마나 가까워졌는지 평가하는 자연스러운 시험장이 됩니다.

2024년 은메달의 돌파구

2024년, DeepMind는 두 개의 AI 시스템을 소개했습니다: AlphaProof와 AlphaGeometry 2. 두 시스템 모두 “신경-기호” AI의 예입니다. 대규모 언어 모델(LLM)의 강점과 기호 논리의 엄격성을 결합합니다.

AlphaProof는 수학적 문장을 증명하는 데 사용되었습니다. 이는 Lean이라는 형식적 수학 언어를 사용했습니다. AlphaProof는 Gemini라는 대규모 언어 모델과 AlphaZero라는 강화 학습 엔진을 결합했습니다. Gemini는 자연어 문제를 Lean으로 번역하고 증명을 시도하는 역할을 맡았습니다. AlphaProof는 다양한 수학적 분야와 난이도의 샘플 문제를 통해 훈련되었습니다. 시스템은 점점 더 복잡한 문장을 증명하려고 시도함으로써 자신을 개선했습니다.

AlphaGeometry 2는 기하학 문제를 해결하는 데 사용되었습니다. 여기서 Gemini의 언어 이해 능력은 AI가 도움이 되는 보조 구조를 예측하는 데 도움이 되었습니다. 기호적 추론 엔진은 논리적 추론을 관리했습니다. 이러한 하이브리드 접근 방식으로 AlphaGeometry는 전통적인 기계적 추론의 범위를 넘어서는 기하학 문제를 해결할 수 있었습니다.

두 시스템은 6개의 IMO 문제 중 4개를 해결했습니다: 2개의 대수, 1개의 수론, 1개의 기하학 문제를 해결하여 42점 중 28점을 획득했습니다. 이는 AI가 처음으로 IMO에서 은메달을 획득한 것입니다. 그러나 이 성공은 문제를 형식적 수학 언어로 번역하는 데 인간 전문가의 도움이 필요했습니다. 또한 대량의 계산 자원이 필요했습니다.

금메달을 위한 기술적 혁신

DeepMind의 은메달에서 금메달로의 전환은 몇 가지 중요한 기술적 개선에 의해 주도되었습니다.

1. 자연어를 증명의 매체로 사용

가장 중요한 변화는 전문가가 형식적 언어로 번역해야 하는 시스템에서 자연어를 증명의 매체로 사용하는 시스템으로의 전환입니다. 이는 Gemini의 업그레이드 버전인 Deep Think을 사용하여 달성되었습니다. 모델은 텍스트를 직접 처리하고 비형식적 스케치를 생성하며 내부적으로 중요한 단계를 형식화하고 영어 증명을 생성합니다. 인간의 피드백에서 강화 학습(RLHF)을 사용하여 논리적으로 일관성 있고 간결하며 제시된 해결책을 보상했습니다.

Gemini Deep Think은 두 가지 주요 방식으로 공개 버전의 Gemini와 다릅니다. 첫째, 더 긴 컨텍스트 창과 더 많은 컴퓨팅 토큰을 할당하여 모델이 여러 페이지의 사고를 유지할 수 있습니다. 둘째, 평행 추론을 사용하여 다양한 잠재적 해결책에 대해 수백 개의 추측적 스레드를 생성합니다. 가벼운 감독자가 가장 약속하는 경로를 평가하고 승격합니다. 이는 몬테 카를로 트리 검색의 개념을 차용하지만 텍스트에 적용됩니다. 이는 인간 팀이 아이디어를 моз토름하고, 비생산적인 아이디어를 폐기하고, 우아한 해결책으로 수렴하는 방식과 유사합니다.

2. 훈련과 강화 학습

Gemini Deep Think는 다음 추론 단계를 예측하도록 미세 조정됐습니다. 공개 수학 포럼과 arXiv 사전 논문, 대학 문제집에서 올림피아드 및 대학 경시대회 풀이 10만 건을 수집했고 인간 검토자가 비논리적이거나 불완전한 증명을 걸러냈습니다. 강화학습과 장황한 문장에 대한 벌점은 정교하면서 간결한 증명을 만들도록 도왔습니다.

완성된 증명 전체만 맞고 틀림을 판정하는 이진 피드백과 달리 DeepMind는 검증된 보조정리마다 점수를 주는 단계별 보상 방식을 사용했습니다. 완전한 증명이 드물어도 학습 방향을 제시할 수 있습니다. 훈련은 3개월 동안 약 2,500만 TPU 시간을 사용했습니다.

3. 대규모 평행화

평행화도 DeepMind의 은메달에서 금메달로의 발전에서 중요한 역할을 했습니다. 각 문제는 여러 가지 추론 분기를 평행하게 생성했으며, 자원은 더 약속하는 경로로 동적으로 이동했습니다. 이는 특히 조합론 문제에서 유용했습니다. 이는 인간이 보조 부등식을 테스트하기 전에 전체 귀납을 수행하는 방식과 유사합니다. 이 접근 방식은 계산적으로 비싼데, DeepMind의 TPU v5 클러스터를 사용하여 관리할 수 있었습니다.

2025년 DeepMind의 IMO

경쟁의 무결성을 유지하기 위해, DeepMind는 모델의 가중치를 3주 전에 동결하여 공식 문제가 훈련 세트에 유출되지 않도록 했습니다. 또한 이전에 출판되지 않은 올림피아드 문제에 대한 해결책을 포함하는 데이터를 필터링했습니다.

경쟁 기간 동안, Gemini Deep Think는 6개의 공식 문제를 평문 형식으로 제공받았으며, 인터넷에 접근할 수 없었습니다. 시스템은 표준 랩톱의 컴퓨팅 파워를 시뮬레이션하도록 구성된 클러스터에서 작동했습니다. 전체 문제 해결 과정은 3시간 이내에 완료되었습니다. 생성된 증명은 IMO 조정자에게 변경 없이 제출되었습니다.

Gemini Deep Think은 첫 5개의 문제에서 완벽한 점수를 얻었습니다. 마지막 문제는 인간 참가자의 94%와 마찬가지로 어려운 조합론 퍼즐이었습니다. 그러나 AI는 42점 중 35점을 얻어 금메달을 획득했습니다. 이는 전년의 은메달 성과보다 7점 더 높은 점수였습니다. 관찰자들은 이후 AI의 증명을 “신중한” 그리고 “완전한”이라고 묘사하며, 인간 참가자가 기대하는 엄격한 정당성을 따랐다고 언급했습니다.

인공지능과 수학에 대한 의미

DeepMind의 성과는 인공지능과 수학 모두에게 중요한 이정표입니다. 인공지능에게 IMO를 정복하는 것은 인공지능 일반 지능(AGI)으로 향하는 한 단계입니다. 여기서 시스템은 인간이 수행할 수 있는 모든 지적 작업을 수행할 수 있습니다. 복잡한 수학적 문제를 해결하는 데에는 추론과 이해가 필요하며, 이는 일반 지능의 기본 구성 요소입니다. 이 성공은 인공지능이 더욱 인간적인 인지 능력으로 발전하고 있음을 나타냅니다.

수학적으로, AI 시스템은 수학자에게 귀중한 도구가 될 수 있습니다. 새로운 분야를 탐색하고, 가설을 검증하며, 심지어 새로운 정리를 발견하는 데 도움이 될 수 있습니다. 증명 구성을 더 단순화함으로써, AI는 인간 수학자들이 더 높은 수준의 개념적 작업에 집중할 수 있도록 해줍니다. 또한 이러한 AI 시스템을 개발한 기술은 인간의 노력만으로는 불가능한 수학적 연구 방법에 영감을 줄 수 있습니다.

그러나 AI의 수학적 발전은 교육 환경과 대회에서 AI의 역할에 대한 질문을 제기합니다. AI의 능력이 계속 성장함에 따라, 수학 교육과 경쟁의 본질이 어떻게 바뀔지에 대한 논의가 있을 것입니다.

미래를 향해

IMO에서 금메달을 획득하는 것은 중요한 이정표이지만, 현재의 AI 시스템으로는 여전히 해결할 수 없는 수학적 도전이 많습니다. 그러나 1년 만에 은메달에서 금메달로의 급격한 발전은 AI 혁신과 발전의 가속화된 속도를 강조합니다. 이러한 속도가 계속된다면, AI 시스템은 곧 수학의 가장 유명한 미해결 문제를 해결할 수 있을 것입니다. AI가 인간의 창의력을 대체할지 아니면 강화할지는 여전히 미해결된 질문이지만, 2025년 IMO는 인공지능이 논리적 추론에서 중요한 발전을 이루었다는 것을 명확히 보여줍니다.

Dr. Tehseen Zia는 COMSATS University Islamabad의 정교수이며, 오스트리아 비엔나 기술대학교에서 인공지능 박사학위를 취득했습니다. 인공지능, 기계학습, 데이터 과학, 컴퓨터 비전을 전문으로 하며, 유명한 과학 저널에 발표된 논문으로 знач적인 기여를 했습니다. Dr. Tehseen은 주요 연구자로서 다양한 산업 프로젝트를 이끌었으며, 인공지능 컨설턴트로도 활동했습니다.