Modelos y plataformas de IA

De la plata a oro: Cómo el AI de DeepMind conquistó la Olimpiada de Matemáticas

mm
Añade Unite.AI a tus fuentes preferidas en Google

El AI de DeepMind ha hecho un progreso notable en el razonamiento matemático en un plazo de solo un año. Después de ganar una medalla de plata en la Olimpiada Internacional de Matemáticas (IMO) en 2024, su sistema de AI logró la medalla de oro en 2025. Este avance rápido destaca las capacidades crecientes de la inteligencia artificial para abordar problemas complejos y abstractos que requieren creatividad y visión humanas. Este artículo explicará cómo DeepMind logró esta transformación, las elecciones técnicas y estratégicas detrás de ella, y las implicaciones más amplias de estos avances.

La importancia de la IMO

La Olimpiada Internacional de Matemáticas, establecida en 1959, es reconocida a nivel mundial como la competencia de matemáticas más importante para estudiantes de secundaria. Cada año, los mejores estudiantes de todo el mundo se enfrentan a seis problemas desafiantes en álgebra, geometría, teoría de números y combinatoria. Resolver estos problemas requiere mucho más que cálculos; los participantes deben demostrar creatividad matemática real, pensamiento lógico riguroso y la capacidad de construir pruebas elegantes.

Para la inteligencia artificial, la IMO presenta un desafío único. Si bien el AI ha dominado el reconocimiento de patrones, el análisis de datos y incluso juegos complejos como Go y ajedrez, las matemáticas olímpicas requieren razonamiento abstracto y creativo, y la síntesis de nuevas ideas, habilidades tradicionalmente consideradas como características de la inteligencia humana. Como resultado, la IMO se ha convertido en un campo de pruebas natural para evaluar cuán cerca está el AI de lograr un razonamiento verdaderamente similar al humano.

El avance hacia la medalla de plata de 2024

En 2024, DeepMind presentó dos sistemas de AI para abordar problemas de nivel IMO: AlphaProof y AlphaGeometry 2. Ambos sistemas son ejemplos de “neuro-simbólico” AI, que combina las fortalezas de los grandes modelos de lenguaje (LLM) con la rigidez de la lógica simbólica.

AlphaProof fue diseñado para probar declaraciones matemáticas utilizando Lean, un lenguaje matemático formal. Combinó Gemini, el gran modelo de lenguaje de DeepMind, con AlphaZero, que es un motor de aprendizaje por refuerzo conocido por su éxito en juegos de tablero. En este contexto, el papel de Gemini fue traducir problemas de lenguaje natural a Lean y intentar pruebas generando pasos lógicos. AlphaProof se entrenó con millones de problemas de muestra que abarcan diferentes disciplinas y dificultades matemáticas. El sistema se mejoró intentando probar declaraciones cada vez más complejas, similar a cómo AlphaZero aprendió jugando partidas contra sí mismo.

AlphaGeometry 2 fue diseñado para resolver problemas de geometría. Aquí, la comprensión del lenguaje de Gemini permitió al AI predecir construcciones auxiliares útiles, mientras que un motor de razonamiento simbólico manejaba las deducciones lógicas. Este enfoque híbrido permitió a AlphaGeometry abordar problemas geométricos mucho más allá del alcance de la razón tradicional de la máquina.

Juntos, estos sistemas resolvieron cuatro de los seis problemas de la IMO: dos en álgebra, uno en teoría de números y uno en geometría, logrando una puntuación de 28 de 42. Este rendimiento fue un hito significativo, ya que fue la primera vez que un AI alcanzó el nivel de medalla de plata en la IMO. Sin embargo, este éxito dependió en gran medida de expertos humanos para traducir problemas a lenguajes matemáticos formales. También requirió recursos computacionales masivos, que tomaron días de procesamiento para cada problema.

Innovaciones técnicas detrás de la medalla de oro

La transición de DeepMind de una medalla de plata a una medalla de oro se debió a varias mejoras técnicas significativas.

1. Lenguaje natural como medio para las pruebas

El cambio más significativo fue pasar de sistemas que requerían traducciones de expertos a lenguajes formales a tratar el lenguaje natural como el medio para las pruebas. Este cambio se logra a través de una versión mejorada de Gemini equipada con capacidades de Deep Think. En lugar de convertir problemas en Lean, el modelo procesa el texto directamente, genera bocetos informales, formaliza internamente los pasos críticos y produce una prueba refinada en inglés. El aprendizaje por refuerzo a partir de retroalimentación humana (RLHF) se utilizó para recompensar soluciones que eran lógicamente consistentes, breves y presentadas.

Gemini Deep Think se diferencia de la versión pública de Gemini de dos maneras principales. Primero, asigna ventanas de contexto más largas y más tokens de computación por consulta, lo que permite al modelo mantener cadenas de pensamiento de varias páginas. Segundo, utiliza razonamiento paralelo, donde se generan cientos de hilos especulativos para diferentes soluciones potenciales. Un supervisor ligero luego clasifica y promueve los caminos más prometedores, tomando conceptos de búsqueda de árbol de Monte Carlo pero aplicados a texto. Este enfoque imita cómo los equipos humanos generan ideas, descartan conceptos no productivos y convergen en soluciones elegantes.

2. Entrenamiento y aprendizaje por refuerzo

El entrenamiento de Gemini Deep Think involucró ajustar el modelo para predecir los siguientes pasos en lugar de las respuestas finales. Para este propósito, se compiló un corpus de 100,000 soluciones de alta calidad de la Olimpiada y concursos de pregrado. El corpus se recopiló principalmente de foros de matemáticas públicos, preimpresos de arXiv y conjuntos de problemas de la universidad. Mentores humanos revisaron ejemplos de entrenamiento para filtrar pruebas ilógicas o incompletas. El aprendizaje por refuerzo ayudó a refinar el modelo, empujándolo hacia la producción de pruebas concisas y precisas. Las versiones tempranas produjeron pruebas demasiado verbosas, pero las penalizaciones por frases redundantes ayudaron a recortar la salida.

A diferencia del ajuste convencional, que a menudo lucha con recompensas escasas donde la retroalimentación es binaria, ya sea la prueba es correcta o no. DeepMind implementó un sistema de recompensa paso a paso, donde cada sub-lemma verificado contribuyó a la puntuación general. Este mecanismo de recompensa guía a Gemini incluso cuando la prueba completa es infrecuente. El proceso de entrenamiento abarcó tres meses y utilizó aproximadamente 25 millones de horas de TPU.

3. Paralelización masiva

La paralelización también jugó un papel crítico en el avance de DeepMind de la plata al oro. Cada problema generó múltiples ramas de razonamiento en paralelo, con recursos que cambiaban dinámicamente a caminos más prometedores cuando otros se estancaban. Este programación dinámica fue particularmente beneficiosa para los problemas de combinatoria, que tienen grandes espacios de solución. El enfoque es similar a cómo los humanos prueban desigualdades auxiliares antes de comprometerse con una inducción completa. Aunque esta técnica fue computacionalmente costosa, fue manejable utilizando los clusters TPU v5 de DeepMind.

DeepMind en la IMO 2025

Para mantener la integridad de la competencia, DeepMind congeló los pesos del modelo tres semanas antes de la IMO para evitar la fuga de problemas oficiales en el conjunto de entrenamiento. También filtraron los datos que contenían soluciones a preguntas de la Olimpiada no publicadas.

Durante la competencia, Gemini Deep Think se proporcionó con los seis problemas oficiales en formato de texto plano, sin acceso a Internet. El sistema operó en un clúster configurado para simular el poder computacional de una laptop estándar por proceso. Todo el proceso de resolución de problemas se completó en menos de tres horas, bien dentro de los límites de tiempo. Las pruebas generadas se presentaron a los coordinadores de la IMO sin alteraciones.

Gemini Deep Think obtuvo puntuaciones perfectas en los primeros cinco problemas. La última pregunta, que era un rompecabezas de combinatoria desafiante, sin embargo, dejó perplejos tanto al AI como al 94% de los participantes humanos. A pesar de esto, el AI terminó con una puntuación total de 35/42 para asegurar una medalla de oro. Esta puntuación fue siete puntos más alta que el rendimiento de plata del año anterior. Los observadores describieron más tarde las pruebas del AI como ‘diligentes’ y ‘completas’, señalando que seguían las justificaciones rigurosas esperadas de los concursantes humanos.

Implicaciones para el AI y las matemáticas

El logro de DeepMind es un hito significativo tanto para el AI como para las matemáticas. Para el AI, dominar la IMO es un paso hacia la inteligencia artificial general (AGI), donde los sistemas pueden realizar cualquier tarea intelectual que un humano pueda. Resolver problemas matemáticos complejos requiere razonamiento y comprensión, que son componentes fundamentales de la inteligencia general. Este éxito indica que el AI está avanzando hacia capacidades cognitivas más humanas.

Para las matemáticas, los sistemas de AI como Gemini Deep Think pueden convertirse en herramientas invaluables para los matemáticos. Pueden ayudar a explorar nuevas áreas, verificar conjeturas y incluso descubrir nuevos teoremas. Al automatizar los aspectos más tediosos de la construcción de pruebas, el AI libera a los matemáticos humanos para centrarse en el trabajo conceptual de nivel superior. Además, las técnicas desarrolladas para estos sistemas de AI podrían inspirar nuevos métodos en la investigación matemática que pueden no ser posibles a través del esfuerzo humano solo.

Sin embargo, el progreso del AI en las matemáticas también plantea preguntas sobre el papel del AI en los entornos educativos y las competencias. A medida que las capacidades del AI continúan creciendo, habrá debates sobre cómo la participación del AI podría alterar la naturaleza de la educación y la competencia matemáticas.

Mirando hacia adelante

Ganar la medalla de oro en la IMO es un hito significativo, pero muchos desafíos matemáticos aún están fuera del alcance de los sistemas de AI actuales. Sin embargo, el avance rápido de la plata al oro en solo un año destaca el ritmo acelerado de las innovaciones y los desarrollos del AI. Si este ritmo continúa, los sistemas de AI podrían abordar algunos de los problemas matemáticos más famosos sin resolver. Mientras la pregunta de si el AI reemplazará o mejorará la creatividad humana sigue sin resolverse, la IMO de 2025 es una clara indicación de que la inteligencia artificial ha hecho avances significativos en el razonamiento lógico. ments. Si este ritmo continúa, los sistemas de AI podrían abordar algunos de los problemas matemáticos más famosos sin resolver. Mientras la pregunta de si el AI reemplazará o mejorará la creatividad humana sigue sin resolverse, la IMO de 2025 es una clara indicación de que la inteligencia artificial ha hecho avances significativos en el razonamiento lógico.

El Dr. Tehseen Zia es un profesor asociado titular en la Universidad COMSATS de Islamabad, con un doctorado en Inteligencia Artificial de la Universidad Técnica de Viena, Austria. Especializado en Inteligencia Artificial, Aprendizaje Automático, Ciencia de Datos y Visión por Computadora, ha hecho contribuciones significativas con publicaciones en revistas científicas reputadas. El Dr. Tehseen también ha liderado varios proyectos industriales como investigador principal y ha servido como consultor de Inteligencia Artificial.