Modelos y plataformas de IA

El auge de los modelos de razonamiento pequeños: ¿Pueden los modelos de inteligencia artificial compactos igualar el razonamiento de nivel GPT?

mm
Añade Unite.AI a tus fuentes preferidas en Google

En los últimos años, el campo de la inteligencia artificial ha sido cautivado por el éxito de los grandes modelos de lenguaje (LLM). Inicialmente diseñados para el procesamiento del lenguaje natural, estos modelos han evolucionado hasta convertirse en poderosas herramientas de razonamiento capaces de abordar problemas complejos con un proceso de pensamiento paso a paso similar al humano. Sin embargo, a pesar de sus excepcionales capacidades de razonamiento, los LLM presentan importantes desventajas, incluyendo altos costos computacionales y velocidades de despliegue lentas, lo que los hace impracticables para su uso en entornos del mundo real con recursos limitados, como dispositivos móviles o computación de borde. Esto ha llevado a un creciente interés en el desarrollo de modelos más pequeños y eficientes que puedan ofrecer capacidades de razonamiento similares mientras minimizan los costos y las demandas de recursos. Este artículo explora el auge de estos pequeños modelos de razonamiento, su potencial, desafíos e implicaciones para el futuro de la inteligencia artificial.

Un cambio de perspectiva

Durante gran parte de la historia reciente de la inteligencia artificial, el campo ha seguido el principio de las “leyes de escalado”, que sugiere que el rendimiento del modelo mejora de manera predecible a medida que aumentan los datos, la potencia de cálculo y el tamaño del modelo. Si bien este enfoque ha generado modelos poderosos, también ha resultado en importantes compensaciones, incluyendo altos costos de infraestructura, impacto ambiental y problemas de latencia. No todas las aplicaciones requieren las capacidades completas de modelos masivos con cientos de miles de millones de parámetros. En muchos casos prácticos, como asistentes en dispositivos, atención médica y educación, los modelos más pequeños pueden lograr resultados similares si pueden razonar de manera efectiva.

Entendiendo el razonamiento en la inteligencia artificial

El razonamiento en la inteligencia artificial se refiere a la capacidad de un modelo para seguir cadenas lógicas, entender causas y efectos, deducir implicaciones, planificar pasos en un proceso e identificar contradicciones. Para los modelos de lenguaje, esto a menudo significa no solo recuperar información sino también manipularla e inferirla a través de un enfoque estructurado y paso a paso. Este nivel de razonamiento se logra típicamente mediante la fine-tuning de los LLM para realizar razonamiento multietapa antes de llegar a una respuesta. Si bien estos métodos son efectivos, demandan recursos computacionales significativos y pueden ser lentos y costosos de desplegar, lo que plantea preocupaciones sobre su accesibilidad y su impacto ambiental.

Entendiendo los pequeños modelos de razonamiento

Los pequeños modelos de razonamiento tienen como objetivo replicar las capacidades de razonamiento de los modelos grandes pero con una mayor eficiencia en términos de potencia computacional, uso de memoria y latencia. Estos modelos a menudo emplean una técnica llamada destilación de conocimiento, donde un modelo más pequeño (el “alumno”) aprende de un modelo más grande preentrenado (el “maestro”). El proceso de destilación implica entrenar al modelo más pequeño con datos generados por el modelo más grande, con el objetivo de transferir la capacidad de razonamiento. El modelo del alumno se ajusta luego para mejorar su rendimiento. En algunos casos, se aplica aprendizaje por refuerzo con funciones de recompensa especializadas y específicas del dominio para mejorar aún más la capacidad del modelo para realizar razonamiento específico de la tarea.

El auge y los avances de los pequeños modelos de razonamiento

Un hito notable en el desarrollo de los pequeños modelos de razonamiento fue el lanzamiento de DeepSeek-R1. A pesar de haber sido entrenado en un cluster relativamente modesto de GPUs más antiguas, DeepSeek-R1 logró un rendimiento comparable al de modelos más grandes como OpenAI’s o1 en benchmarks como MMLU y GSM-8K. Este logro ha llevado a una reconsideración del enfoque tradicional de escalado, que asumía que los modelos más grandes eran inherentemente superiores.

El éxito de DeepSeek-R1 se puede atribuir a su proceso de entrenamiento innovador, que combinó el aprendizaje por refuerzo a gran escala sin depender de la fine-tuning supervisada en las primeras fases. Esta innovación llevó a la creación de DeepSeek-R1-Zero, un modelo que demostró impresionantes capacidades de razonamiento en comparación con los modelos de razonamiento grandes. Mejoras adicionales, como el uso de datos de inicio en frío, mejoraron la coherencia y la ejecución de tareas del modelo, particularmente en áreas como las matemáticas y la codificación.

Además, las técnicas de destilación han demostrado ser cruciales en el desarrollo de modelos más pequeños y eficientes a partir de modelos más grandes. Por ejemplo, DeepSeek ha lanzado versiones destiladas de sus modelos, con tamaños que van desde 1,5 mil millones hasta 70 mil millones de parámetros. Utilizando estos modelos, los investigadores han entrenado un modelo más pequeño, DeepSeek-R1-Distill-Qwen-32B, que ha superado a OpenAI’s o1-mini en varios benchmarks. Estos modelos ahora son desplegables con hardware estándar, lo que los hace una opción más viable para una amplia gama de aplicaciones.

¿Pueden los modelos pequeños igualar el razonamiento de nivel GPT?

Para evaluar si los pequeños modelos de razonamiento (SRM) pueden igualar el poder de razonamiento de los modelos grandes (LRM) como GPT, es importante evaluar su rendimiento en benchmarks estándar. Por ejemplo, el modelo DeepSeek-R1 obtuvo alrededor de 0,844 en la prueba MMLU, comparable a modelos más grandes como o1. En el conjunto de datos GSM-8K, que se centra en matemáticas de escuela primaria, el modelo destilado de DeepSeek-R1 logró un rendimiento de primer nivel, superando tanto a o1 como a o1-mini.

En tareas de codificación, como las de LiveCodeBench y CodeForces, los modelos destilados de DeepSeek-R1 desempeñaron de manera similar a o1-mini y GPT-4o, demostrando fuertes capacidades de razonamiento en programación. Sin embargo, los modelos más grandes todavía tienen una ventaja en tareas que requieren una comprensión más amplia del lenguaje o el manejo de ventanas de contexto largas, ya que los modelos más pequeños tienden a ser más específicos de la tarea.

A pesar de sus fortalezas, los modelos pequeños pueden luchar con tareas de razonamiento extendidas o cuando se enfrentan a datos fuera de la distribución. Por ejemplo, en simulaciones de ajedrez de LLM, DeepSeek-R1 cometió más errores que los modelos más grandes, lo que sugiere limitaciones en su capacidad para mantener el enfoque y la precisión durante períodos prolongados.

Compensaciones y implicaciones prácticas

Las compensaciones entre el tamaño del modelo y el rendimiento son críticas al comparar los SRM con los LRM de nivel GPT. Los modelos más pequeños requieren menos memoria y potencia computacional, lo que los hace ideales para dispositivos de borde, aplicaciones móviles o situaciones en las que se requiere inferencia sin conexión. Esta eficiencia resulta en costos operativos más bajos, con modelos como DeepSeek-R1 siendo hasta un 96% más baratos de ejecutar que los modelos más grandes como o1.

Sin embargo, estas ganancias en eficiencia vienen con algunas compensaciones. Los modelos más pequeños suelen ajustarse para tareas específicas, lo que puede limitar su versatilidad en comparación con los modelos más grandes. Por ejemplo, mientras que DeepSeek-R1 sobresale en matemáticas y codificación, carece de capacidades multimodales, como la capacidad de interpretar imágenes, que los modelos más grandes como GPT-4o pueden manejar.

A pesar de estas limitaciones, las aplicaciones prácticas de los pequeños modelos de razonamiento son vastas. En la atención médica, pueden impulsar herramientas de diagnóstico que analizan datos médicos en servidores de hospital estándar. En la educación, se pueden utilizar para desarrollar sistemas de tutoría personalizados, proporcionando retroalimentación paso a paso a los estudiantes. En la investigación científica, pueden asistir en el análisis de datos y la prueba de hipótesis en campos como las matemáticas y la física. La naturaleza de código abierto de modelos como DeepSeek-R1 también fomenta la colaboración y democratiza el acceso a la inteligencia artificial, permitiendo que organizaciones más pequeñas se beneficien de tecnologías avanzadas.

En resumen

La evolución de los modelos de lenguaje hacia modelos de razonamiento más pequeños es un avance significativo en la inteligencia artificial. Si bien estos modelos pueden no igualar aún completamente las capacidades amplias de los modelos de lenguaje grandes, ofrecen ventajas clave en eficiencia, rentabilidad y accesibilidad. Al equilibrar el poder de razonamiento con la eficiencia de recursos, los modelos más pequeños están destinados a desempeñar un papel crucial en diversas aplicaciones, haciendo que la inteligencia artificial sea más práctica y sostenible para el uso en el mundo real.

El Dr. Tehseen Zia es un profesor asociado titular en la Universidad COMSATS de Islamabad, con un doctorado en Inteligencia Artificial de la Universidad Técnica de Viena, Austria. Especializado en Inteligencia Artificial, Aprendizaje Automático, Ciencia de Datos y Visión por Computadora, ha hecho contribuciones significativas con publicaciones en revistas científicas reputadas. El Dr. Tehseen también ha liderado varios proyectos industriales como investigador principal y ha servido como consultor de Inteligencia Artificial.