Modelos y plataformas de IA
El Tülu 3 de Allen AI se convierte en un rival inesperado de DeepSeek

Las noticias siguen llegando. Los modelos de DeepSeek han estado desafiando los benchmarks, estableciendo nuevos estándares y causando un gran revuelo. Pero algo interesante acaba de suceder en la escena de investigación de inteligencia artificial que también merece nuestra atención.
Allen AI lanzó en silencio su nueva familia de modelos Tülu 3, y su versión de 405B parámetros no solo está compitiendo con DeepSeek, sino que también la supera en algunos benchmarks clave.
Vamos a poner esto en perspectiva.
El modelo Tülu 3 de 405B parámetros se enfrenta a los mejores modelos como DeepSeek V3 en una variedad de tareas. Estamos viendo un rendimiento comparable o superior en áreas como problemas matemáticos, desafíos de codificación y seguimiento preciso de instrucciones. Y también lo están haciendo con un enfoque completamente abierto.
Han lanzado la pipeline de entrenamiento completa, el código y incluso su novedoso método de aprendizaje por refuerzo llamado Aprendizaje por Refuerzo con Recompensas Verificables (RLVR) que hizo posible esto.
Desarrollos como estos en las últimas semanas están cambiando realmente la forma en que se desarrolla la inteligencia artificial de alto nivel. Cuando un modelo de código abierto completo puede igualar a los mejores modelos cerrados, abre posibilidades que anteriormente estaban bloqueadas detrás de paredes corporativas privadas.
La batalla técnica
¿Qué hizo que Tülu 3 se destacara? Se reduce a un proceso de entrenamiento único de cuatro etapas que va más allá de los enfoques tradicionales.
Vamos a ver cómo Allen AI construyó este modelo:
Etapa 1: Selección estratégica de datos
El equipo sabía que la calidad del modelo comienza con la calidad de los datos. Combinaron conjuntos de datos establecidos como WildChat y Open Assistant con contenido generado de forma personalizada. Pero aquí está la idea clave: no solo agregaron datos, sino que también crearon conjuntos de datos dirigidos para habilidades específicas como razonamiento matemático y codificación.
Etapa 2: Construcción de mejores respuestas
En la segunda etapa, Allen AI se centró en enseñar al modelo habilidades específicas. Crearon diferentes conjuntos de datos de entrenamiento, algunos para matemáticas, otros para codificación y más para tareas generales. Al probar estas combinaciones repetidamente, pudieron ver exactamente dónde el modelo sobresalía y dónde necesitaba trabajo. Este proceso iterativo reveló el verdadero potencial de lo que Tülu 3 podría lograr en cada área.
Etapa 3: Aprendizaje de comparaciones
Aquí es donde Allen AI se volvió creativo. Construyeron un sistema que podría comparar instantáneamente las respuestas de Tülu 3 con las de otros modelos de alto nivel. Pero también resolvieron un problema persistente en la inteligencia artificial: la tendencia de los modelos a escribir respuestas largas solo por el sake de la longitud. Su enfoque, utilizando Optimización de preferencia directa normalizada (DPO), significaba que el modelo aprendía a valorar la calidad sobre la cantidad. El resultado! Respuestas que son precisas y con propósito.
Cuando los modelos de inteligencia artificial aprenden de preferencias (¿cuál respuesta es mejor, A o B?), tienden a desarrollar un sesgo frustrante: comienzan a pensar que las respuestas más largas siempre son mejores. Es como si estuvieran tratando de ganar diciendo más en lugar de decir las cosas bien.
La optimización de preferencia directa normalizada (DPO) soluciona esto ajustando cómo el modelo aprende de preferencias. En lugar de solo mirar qué respuesta fue preferida, tiene en cuenta la longitud de cada respuesta. Piensa en ello como juzgar respuestas por su calidad por palabra, no solo por su impacto total.
¿Por qué esto importa? Porque ayuda a Tülu 3 a aprender a ser preciso y eficiente. En lugar de rellenar respuestas con palabras adicionales para parecer más completo, aprende a entregar valor en la longitud que realmente se necesita.
Esto puede parecer un detalle pequeño, pero es crucial para construir inteligencia artificial que se comunica de manera natural. Los mejores expertos humanos saben cuándo ser concisos y cuándo elaborar – y eso es exactamente lo que la optimización de preferencia directa normalizada (DPO) ayuda a enseñar al modelo.
Etapa 4: La innovación de RLVR
Esta es la innovación técnica que merece atención. RLVR reemplaza los modelos de recompensa subjetivos con verificación concreta.
La mayoría de los modelos de inteligencia artificial aprenden a través de un sistema complejo de modelos de recompensa – esencialmente suposiciones educadas sobre lo que hace una buena respuesta. Pero Allen AI tomó un camino diferente con RLVR.
Piensa en cómo entrenamos actualmente a los modelos de inteligencia artificial. Normalmente necesitamos otros modelos de inteligencia artificial (llamados modelos de recompensa) para juzgar si una respuesta es buena o no. Es subjetivo, complejo y a menudo inconsistente. Algunas respuestas pueden parecer buenas pero contener errores sutiles que se deslizan.
RLVR da la vuelta a este enfoque. En lugar de confiar en juicios subjetivos, utiliza resultados concretos y verificables. Cuando el modelo intenta un problema matemático, no hay área gris – la respuesta es correcta o incorrecta. Cuando escribe código, ese código funciona correctamente o no.
Aquí es donde se vuelve interesante:
- El modelo recibe retroalimentación inmediata y binaria: 10 puntos por respuestas correctas, 0 por incorrectas
- No hay espacio para crédito parcial o evaluación difusa
- El aprendizaje se centra y se vuelve preciso
- El modelo aprende a priorizar la precisión sobre respuestas plausibles pero incorrectas

Diagrama de entrenamiento de RLVR (Allen AI)
Los resultados? Tülu 3 mostró mejoras significativas en tareas donde la corrección es lo más importante. Su rendimiento en razonamiento matemático (benchmark GSM8K) y desafíos de codificación aumentó notablemente. Incluso su capacidad de seguir instrucciones se volvió más precisa porque el modelo aprendió a valorar la precisión concreta sobre respuestas aproximadas.
Lo que hace que esto sea particularmente emocionante es cómo cambia el juego para la inteligencia artificial de código abierto. Los enfoques anteriores a menudo luchaban por igualar la precisión de los modelos cerrados en tareas técnicas. RLVR muestra que con el enfoque de entrenamiento adecuado, los modelos de código abierto pueden lograr ese mismo nivel de confiabilidad.
Un vistazo a los números
La versión de 405B parámetros de Tülu 3 compite directamente con los mejores modelos en el campo. Vamos a examinar dónde sobresale y qué significa esto para la inteligencia artificial de código abierto.
Matemáticas
Tülu 3 sobresale en razonamiento matemático complejo. En benchmarks como GSM8K y MATH, iguala el rendimiento de DeepSeek. El modelo maneja problemas de varios pasos y muestra fuertes capacidades de razonamiento matemático.
Código
Los resultados de codificación son igualmente impresionantes. Gracias al entrenamiento de RLVR, Tülu 3 escribe código que resuelve problemas de manera efectiva. Su fuerza radica en entender instrucciones de codificación y producir soluciones funcionales.
Seguimiento preciso de instrucciones
La capacidad del modelo para seguir instrucciones se destaca como una fortaleza central. Mientras que muchos modelos aproximan o generalizan instrucciones, Tülu 3 demuestra una precisión notable en la ejecución exacta de lo que se le pide.
Abriendo la caja negra del desarrollo de inteligencia artificial
Allen AI lanzó tanto un modelo poderoso como su proceso de desarrollo completo.
Cada aspecto del proceso de entrenamiento está documentado y accesible. Desde el enfoque de cuatro etapas hasta los métodos de preparación de datos y la implementación de RLVR – todo el proceso está abierto para su estudio y replicación. Esta transparencia establece un nuevo estándar en el desarrollo de inteligencia artificial de alto rendimiento.
Los desarrolladores reciben recursos completos:
- Pipelines de entrenamiento completas
- Herramientas de procesamiento de datos
- Marco de evaluación
- Especificaciones de implementación
Esto permite a los equipos:
- Modificar procesos de entrenamiento
- Adaptar métodos para necesidades específicas
- Construir sobre enfoques probados
- Crear implementaciones especializadas
Este enfoque abierto acelera la innovación en todo el campo. Los investigadores pueden construir sobre métodos verificados, mientras que los desarrolladores pueden centrarse en mejoras en lugar de empezar desde cero.
El auge de la excelencia de código abierto
El éxito de Tülu 3 es un gran momento para el desarrollo de inteligencia artificial de código abierto. Cuando los modelos de código abierto igualan o superan a las alternativas privadas, cambia fundamentalmente la industria. Los equipos de investigación de todo el mundo obtienen acceso a métodos probados, acelerando su trabajo y generando nuevas innovaciones. Los laboratorios de inteligencia artificial privados necesitarán adaptarse – ya sea aumentando la transparencia o empujando los límites técnicos aún más lejos.
Mirando hacia adelante, los avances de Tülu 3 en recompensas verificables y entrenamiento de múltiples etapas sugieren lo que está por venir. Los equipos pueden construir sobre estas bases, potencialmente empujando el rendimiento aún más alto. El código existe, los métodos están documentados y una nueva ola de desarrollo de inteligencia artificial ha comenzado. Para los desarrolladores y los investigadores, la oportunidad de experimentar y mejorar estos métodos marca el comienzo de un capítulo emocionante en el desarrollo de inteligencia artificial.
Preguntas frecuentes (FAQ) sobre Tülu 3
¿Qué es Tülu 3 y cuáles son sus características clave?
Tülu 3 es una familia de modelos de lenguaje de código abierto desarrollados por Allen AI, construidos sobre la arquitectura Llama 3.1. Viene en varios tamaños (8B, 70B y 405B parámetros). Tülu 3 está diseñado para un mejor rendimiento en diversas tareas, incluyendo conocimiento, razonamiento, matemáticas, codificación, seguimiento de instrucciones y seguridad.
¿Cuál es el proceso de entrenamiento para Tülu 3 y qué datos se utilizan?
El entrenamiento de Tülu 3 implica varias etapas clave. Primero, el equipo selecciona un conjunto diverso de prompts de conjuntos de datos públicos y datos sintéticos dirigidos a habilidades específicas, asegurándose de que los datos estén descontaminados contra benchmarks. Segundo, se realiza un ajuste fino supervisado (SFT) en una mezcla de datos de seguimiento de instrucciones, matemáticas y codificación. A continuación, se utiliza la optimización de preferencia directa (DPO) con datos de preferencia generados a través de retroalimentación humana y de LLM. Finalmente, se utiliza el Aprendizaje por Refuerzo con Recompensas Verificables (RLVR) para tareas con corrección medible. Tülu 3 utiliza conjuntos de datos curados para cada etapa, incluyendo instrucciones dirigidas, matemáticas y datos de codificación.
¿Cómo aborda Tülu 3 la seguridad y qué métricas se utilizan para evaluarla?
La seguridad es un componente central del desarrollo de Tülu 3, abordada en todo el proceso de entrenamiento. Un conjunto de datos de seguridad específico se utiliza durante el SFT, que se encuentra en gran medida ortogonal a otros datos orientados a tareas.
¿Qué es RLVR?
RLVR es una técnica donde el modelo se entrena para optimizar contra una recompensa verificable, como la corrección de una respuesta. Esto difiere del RLHF tradicional que utiliza un modelo de recompensa.













