Líderes de opinión

El Fracaso de los LLM en Matemáticas y Cómo Solucionarlo

mm
Añade Unite.AI a tus fuentes preferidas en Google

Las matemáticas siempre han supuesto un desafío significativo para los modelos de inteligencia artificial. Dominar las matemáticas requiere habilidades de razonamiento complejas, y para la inteligencia artificial, esta tarea es cualquier cosa menos sencilla. Esto crea un problema enorme dado la importancia de la competencia matemática para el éxito profesional, personal y académico.

A pesar de sus capacidades notables, los grandes modelos de lenguaje (LLM) a menudo luchan con tareas matemáticas complejas, como la geometría, que exigen habilidades de razonamiento avanzadas. Esto nos lleva a la pregunta crítica: ¿cuánto de la capacidad matemática de un modelo de inteligencia artificial se debe a un razonamiento genuino en lugar de un simple recuerdo de los datos de entrenamiento?

Los hallazgos recientes de Apple muestran que incluso cuando se centran en problemas de matemáticas de escuela primaria, los modelos más sofisticados no están completamente impulsados por el “razonamiento”.

Llevando esto un paso más allá, el equipo de investigación y desarrollo de MathGPT.ai arrojó nueva luz sobre áreas de álgebra a cálculo de nivel de matemáticas que requieren la mayor mejora.

Este dato exploró cómo las variaciones en el contexto del problema y el lenguaje afectan el rendimiento del modelo en diferentes LLM, incluidos los modelos o1-preview y o1-mini de OpenAI. Los hallazgos revelaron una tendencia preocupante: la precisión disminuyó consistentemente a medida que los problemas se desviaban de las preguntas originales disponibles en los datos de entrenamiento de los LLM, con un rendimiento que caía bruscamente en benchmarks matemáticos más desafiantes por encima del nivel de matemáticas de escuela primaria.

El Dilema entre Recuerdo y Razonamiento

La investigación se centró en tres factores clave:

  1. Utilizar benchmarks matemáticos más desafiantes que las matemáticas de escuela primaria
  2. Explorar un “prompt de un disparo” con una proximidad extrema al problema de prueba
  3. Implementar una estrategia de “lo mejor de n” para n intentos del mismo problema – efectivamente, una votación mayoritaria para eliminar anomalías estadísticas, en el momento de la inferencia.

Los resultados fueron tanto intrigantes como preocupantes. Se presionaron los límites de la variación del problema, lo que mostró una disminución consistente en el rendimiento del modelo de inteligencia artificial a medida que las ecuaciones matemáticas se volvían más complejas.

El Desafío del Conjunto de Datos MATH

Se desplegó el conjunto de datos MATH, conocido por sus problemas de nivel de escuela secundaria desafiantes, en lugar del conjunto de datos Grade School Math 8K, que contiene 8,500 problemas de nivel elemental lingüísticamente diversos. El conjunto de datos MATH presenta preguntas de nivel de escuela secundaria más desafiantes para examinar el rendimiento del modelo en diferentes niveles de dificultad, desde preálgebra hasta teoría de números. Esta elección permitió a MathGPT.ai examinar mejor el rendimiento del modelo en diferentes niveles de dificultad.

En las pruebas, mientras que los valores numéricos y las respuestas finales permanecieron sin cambios, variamos el lenguaje, las variables y el contexto de los problemas. Por ejemplo, un escenario de “paseo del perro” podría transformarse en un problema de “lavavajillas”. Este método ayudó a mitigar la complejidad aumentada del conjunto de datos MATH, al mismo tiempo que desafió las habilidades de razonamiento de los modelos.

Resultados Reveladores

Los resultados fueron impactantes. Incluso los modelos más avanzados lucharon cuando se enfrentaron a variaciones de problemas que probablemente habían encontrado en sus datos de entrenamiento. Por ejemplo, la precisión del modelo o1-mini cayó del 93.66% en preguntas originales al 88.54% en la variación más desafiante. El modelo o1-preview experimentó una disminución similar, cayendo del 91.22% al 82.93% – una caída lo suficientemente pronunciada como para resaltar brechas críticas en su robustez.

Estos hallazgos están en línea con y amplían la investigación anterior de Apple, demostrando que las limitaciones en el razonamiento matemático de la inteligencia artificial se vuelven más aparentes a medida que los problemas crecen en complejidad y requieren una comprensión más profunda en lugar de reconocimiento de patrones.

El Camino hacia Adelante

A medida que continuamos empujando los límites del razonamiento de los LLM, es crucial reconocer tanto su potencial increíble como sus limitaciones actuales. Nuevas investigaciones subrayan la necesidad de innovación continua en el desarrollo de modelos de inteligencia artificial capaces de ir más allá del reconocimiento de patrones para lograr habilidades de resolución de problemas más robustas y generalizables.

Esto ocurre en un momento crítico, especialmente en la educación superior, donde la inteligencia artificial se está utilizando cada vez más como una herramienta de ayuda para los instructores en el aula, mientras que las escuelas siguen viendo altas tasas de fracaso entre los estudiantes de matemáticas que no están preparados para los cursos.

Lograr capacidades cognitivas similares a las humanas o inteligencia general en la inteligencia artificial exige no solo avances tecnológicos, sino también una comprensión matizada de cómo cerrar la brecha entre el recuerdo y el verdadero razonamiento.

Si tenemos éxito en este camino, estoy seguro de que podemos cambiar la vida de millones de estudiantes y profesionales para poner sus vidas en una trayectoria completamente nueva.

Peter es el Presidente de MathGPT.ai, también es un experimentado empresario y mentor de tecnología, dedicado a desarrollar soluciones impactantes que mejoran vidas. Después de obtener un título de posgrado en Stanford en 1992, pasó 30 años fundando y apoyando empresas en juegos, IoT, software, IA y innovación climática.

Como fundador de YouWeb Incubator, ha guiado a startups con financiamiento y mentoría práctica, logrando un éxito notable. Peter también forma parte de las juntas directivas de The Tech, GotIt! y GotIt! AI, asesora al Instituto de Gestión de Carbono de UCLA y lidera la Fundación Dharma Karma.