AI 모델 및 플랫폼

뾰족한 지능: AI가 올림피아드 문제에서는 뛰어나지만 학교 수학에서는 부진한 이유

mm
Unite.AI를 Google의 선호 소스에 추가

인공지능 커뮤니티는 2025년에 Google DeepMind와 (GOOGL ) 그리고 OpenAI systems가 gold medal 성과를 International Mathematical Olympiad에서 달성했습니다. 이 AI 모델들은 세계에서 손꼽히는 소수의 뛰어난 청소년 수학자들만이 풀 수 있는 문제들을 해결했습니다. 그럼에도 불구하고, 같은 시스템들은 중학생이라면 손쉽게 할 수 있는 기본적인 산술을 수행하라는 요청에 자주 좌절합니다. 이 놀라운 역설은 오늘날 인공지능의 본질에 관한 근본적인 무언가를 드러냅니다. 우리는 jagged intelligence라고 불릴 수밖에 없는 현상의 출현을 목격하고 있습니다. 이는 기계가 특정 분야에서는 초인적인 능력을 보이지만, 우리가 기본이라고 여기는 작업에서는 실패하는 현상을 의미합니다.

올림피아드 성공

International Mathematical Olympiad은 대학 이전 수학 경시대회의 최고 표준입니다. 매년 전 세계에서 모인 가장 뛰어난 청소년 수학자들이 깊은 통찰력, 창의적 사고, 고급 증명 기법을 요구하는 여섯 개의 문제에 도전합니다. 2025년에는 Google DeepMind와 OpenAI의 AI 시스템이 42점 만점에 35점을 획득해 금메달을 받을 만큼 충분한 점수를 기록했습니다. DeepMind의 AlphaGeometry 2는 복잡한 기하학 문제를 단 19초 만에 해결했으며, AlphaProof는 대부분의 인간 참가자들을 난감하게 만든 수론 및 대수학 문제들을 해결했습니다.

이러한 성과는 수년간의 점진적인 발전 위에 쌓여 왔습니다. 시스템은 Lean과 같은 형식 수학 언어를 사용해 엄밀한 증명을 구성합니다. 또한 curriculum learning과 같은 기법을 활용해 난이도가 점차 상승하는 문제들을 학습합니다. 이러한 훈련을 통해 AI는 수학 객체 간의 복잡한 관계를 이해하고, 미묘한 패턴을 인식하며, 우아한 증명을 구성할 수 있게 됩니다.

기초 단계의 어려움

올림피아드 문제에서 금메달을 획득한 동일한 AI 시스템들은 종종 사소해 보이는 작업에서 실패합니다. 예를 들어, 큰 수를 곱하라고 하면 자신 있게 틀린 답을 제시할 수 있습니다. 마찬가지로 다른 기본 산술 연산을 수행하도록 하면 그 성능이 예측 불가능해집니다. 문제는 단순 계산에만 국한되지 않습니다. 이러한 시스템은 여러 양을 추적하고, 현실 세계의 맥락을 이해하며, 기본 수학 연산을 순차적으로 적용해야 하는 단어 문제에서도 종종 어려움을 겪습니다.

이 약점은 본질적으로 이러한 AI 모델이 작동하는 방식을 반영합니다. 대형 언어 모델은 훈련 데이터에서 본 패턴을 기반으로 다음에 올 텍스트를 예측합니다. “2 + 2″를 마주하면 이 패턴을 인식하고 “4”를 정확히 예측하는데, 이는 덧셈을 이해해서가 아니라 훈련 데이터에 이 시퀀스가 무수히 등장했기 때문입니다. 텍스트에 거의 등장하지 않는 특이한 계산을 제시하면 성능이 급격히 저하됩니다. 이들은 패턴이 명확하고 일관될 때는 뛰어나지만, 보지 못한 문제를 계산하도록 강요받으면 고전하는 패턴 매칭 기계에 불과합니다.

구조적 역설

올림피아드 성공과 산술 실패 사이의 모순은 더 깊은 구조적 문제를 드러냅니다. 현대 AI 시스템은 패턴 인식, 논리적 추론, 해결 공간에 대한 체계적 탐색을 통해 해결할 수 있는 문제에 뛰어납니다. 난이도가 높음에도 불구하고 올림피아드 문제는 AI가 활용할 수 있는 우아한 구조를 가지고 있는 경우가 많습니다. 시스템은 다양한 증명 전략을 탐색하고, 논리적 단계를 검증하며, 기존 수학 프레임워크를 기반으로 구축할 수 있습니다. 이들은 일관성과 논리가 지배하는 기호와 규칙의 세계에서 작동합니다.

반면 기본 산술은 역설적으로 전혀 다른 도전을 제시합니다. 이는 패턴 매칭이 아니라 양을 정확히 조작해야 하며, 근사화가 불가능한 수량적 크기와 관계에 대한 이해를 요구합니다. AI 시스템이 언어 모델링을 통해 산술에 접근하면, 숫자를 계산해야 할 양이 아니라 예측해야 할 토큰으로 취급합니다. 작업 요구와 모델 구조 사이의 이러한 근본적인 불일치가 우리가 관찰하는 성능 격차를 초래합니다.

훈련 데이터와 그 한계

AI 능력은 크게 훈련 데이터의 품질과 특성에 좌우됩니다. 수학 증명과 고급 문제는 온라인에서 잘 구조화된 형태로 자주 등장합니다. 학술 논문, 교과서, 교육 자료는 수학적 추론의 명확한 예시를 제공합니다. 인터넷에는 수학 개념, 증명 기법, 문제 해결 전략에 대한 방대한 논의가 존재합니다. 이러한 풍부한 말뭉치는 AI 시스템이 고급 수학적 사고를 학습하도록 돕습니다.

하지만 기초 수학은 다른 문제에 직면합니다. 기본 산술은 온라인에 자주 등장하지만, AI가 근본 과정을 이해하도록 돕는 상세한 추론 흐름을 동반하는 경우는 드뭅니다. 단순 계산은 절차가 설명되기보다 사실로 제시됩니다. 훈련 데이터에는 계산 결과는 포함되지만, 그 계산 과정 자체는 포함되지 않습니다. 이는 기본 작업에서의 저조한 성능으로 나타나는 근본적인 이해 격차를 초래합니다.

AI 개발에 대한 시사점

이러한 고르지 않은 지능 패턴은 AI 시스템을 설계하고 활용하는 방식에 중요한 함의를 갖는다. 복잡한 과제에서의 성공이 단순한 과제에서도 능숙함을 의미한다고 가정할 수 없다. 수학 정리를 증명할 수 있는 AI가 가계부를 맞추는 데는 실패할 수 있다. 코드를 작성하는 시스템이 기본적인 계산에 어려움을 겪을 수도 있다. 이러한 현실은 실제 적용에서 AI의 능력과 한계를 신중히 고려해야 함을 요구한다.

이 현상은 하이브리드 접근법의 중요성을 또한 보여준다. 모든 작업을 하나의 모델이 처리할 것이라고 기대하기보다, 작업 유형에 따라 특화된 시스템이 필요할 수 있다. 예를 들어, 산술을 위한 기호 계산과 추론을 위한 언어 모델을 결합하면 보다 신뢰할 수 있는 솔루션을 만들 수 있다. AI의 미래는 단일한 일반 지능을 추구하기보다 다수의 특화된 시스템을 조정하는 데에 있을지도 모른다.

앞으로의 길

톱니형 지능을 인식하는 것은 보다 능력 있는 AI 시스템을 구축하기 위한 명확한 방향을 제공한다. 연구자들은 언어 모델에 계산 도구를 통합하여 산술을 계산기에 위임할 수 있게 하는 방법을 개발하고 있다. 새로운 훈련 전략은 모든 기술을 내부화하려 하기보다 외부 도구를 언제 사용할지 모델에게 가르치는 데 초점을 맞춘다. 이 접근법은 인간 지능을 닮았으며, 우리는 계산을 위해 계산기를 사용하고 정신적 노력은 고차원 추론에 집중한다.

톱니형 지능의 역설은 인공지능에 대한 겸손을 가르쳐준다. 이러한 시스템은 보편적으로 우수하거나 일관되게 제한된 것이 아니다. 대신, 우리는 효과적으로 AI를 활용하고 향상시키기 위해 인식해야 할 강점과 약점이 복합적으로 섞여 있다. 성공은 AI가 할 수 있는 일을 확대하는 것뿐만 아니라 근본적인 격차를 해소하는 데에도 달려 있다. 정리를 증명할 수 있지만 기본적인 덧셈에 실패하는 기계는 지능이 인공이든 인간이든 다면적인 현상이며 쉽게 정의될 수 없음을 보여준다.

핵심 요약

AI가 올림피아드 문제를 해결하는 데는 성공하지만 간단한 수학에서는 실패한다는 사실은 지능이 고르게 발달하지 않음을 보여준다. 이러한 시스템은 한 분야에서는 뛰어나지만 다른 분야에서는 약점이 있다. 이 불균형적인 패턴을 이해하는 것은 AI를 설계하고 활용하는 데 중요하다. 하나의 모델이 모든 일을 수행할 것이라고 기대하기보다, 각 시스템의 강점을 살리는 다양한 접근법을 결합해야 할지도 모른다. 실질적인 진전은 AI가 모든 작업에 능숙하다고 가정하는 것이 아니라 실제로 신뢰할 수 있게 작동하도록 만드는 데서 올 것이다.

Dr. Tehseen Zia는 COMSATS University Islamabad의 정교수이며, 오스트리아 비엔나 기술대학교에서 인공지능 박사학위를 취득했습니다. 인공지능, 기계학습, 데이터 과학, 컴퓨터 비전을 전문으로 하며, 유명한 과학 저널에 발표된 논문으로 знач적인 기여를 했습니다. Dr. Tehseen은 주요 연구자로서 다양한 산업 프로젝트를 이끌었으며, 인공지능 컨설턴트로도 활동했습니다.