Modelli e piattaforme di IA
L’AI di Allen, Tülu 3, è diventato un rivale inaspettato di DeepSeek

Le notizie continuano ad arrivare. I modelli di DeepSeek hanno sfidato i benchmark, stabilito nuovi standard e fatto molto rumore. Ma qualcosa di interessante è appena successo nella scena della ricerca sull’AI che merita la nostra attenzione.
Allen AI ha rilasciato in silenzio la sua nuova famiglia di modelli Tülu 3, e la versione da 405B parameter non sta solo competendo con DeepSeek – la sta eguagliando o superando in alcuni benchmark chiave.
Mettilo in prospettiva.
Il modello Tülu 3 da 405B sta competendo con i migliori performer come DeepSeek V3 in una gamma di attività. Stiamo vedendo prestazioni comparabili o superiori in aree come problemi matematici, sfide di codifica e seguimento di istruzioni precise. E stanno facendo tutto ciò con un approccio completamente aperto.
Hanno rilasciato l’intera pipeline di formazione, il codice e anche il loro nuovo metodo di apprendimento per rinforzo chiamato Reinforcement Learning with Verifiable Rewards (RLVR) che ha reso possibile tutto ciò.
Sviluppi come questi negli ultimi tempi stanno cambiando il modo in cui si svolge lo sviluppo dell’AI di alto livello. Quando un modello aperto può eguagliare i migliori modelli chiusi, apre possibilità che erano precedentemente bloccate dietro mura corporate private.
La Battaglia Tecnica
Cosa ha reso Tülu 3 così speciale? Si tratta di un processo di formazione unico a quattro fasi che va oltre gli approcci tradizionali.
Vediamo come Allen AI ha costruito questo modello:
Fase 1: Selezione Strategica dei Dati
Il team sapeva che la qualità del modello inizia con la qualità dei dati. Hanno combinato dataset stabiliti come WildChat e Open Assistant con contenuti generati in modo personalizzato. Ma ecco l’idea chiave: non hanno solo aggregato i dati – hanno creato dataset mirati per abilità specifiche come ragionamento matematico e competenza nella codifica.
Fase 2: Costruzione di Risposte Migliori
Nella seconda fase, Allen AI si è concentrata sull’insegnamento al modello di abilità specifiche. Hanno creato diversi set di dati di formazione – alcuni per la matematica, altri per la codifica e più per attività generali. Testando queste combinazioni ripetutamente, potevano vedere esattamente dove il modello eccelleva e dove aveva bisogno di lavoro. Questo processo iterativo ha rivelato il vero potenziale di ciò che Tülu 3 poteva raggiungere in ogni area.
Fase 3: Apprendimento dalle Confrontazioni
Questo è il punto in cui Allen AI è diventata creativa. Hanno costruito un sistema che poteva confrontare istantaneamente le risposte di Tülu 3 con quelle di altri modelli di alto livello. Ma hanno anche risolto un problema persistente nell’AI – la tendenza dei modelli a scrivere risposte lunghe solo per il gusto della lunghezza. Il loro approccio, utilizzando Direct Preference Optimization (DPO) normalizzata per la lunghezza, ha significato che il modello ha imparato a valorizzare la qualità sulla quantità. Il risultato? Risposte che sono sia precise che mirate.
Quando i modelli di AI imparano dalle preferenze (quale risposta è migliore, A o B?), tendono a sviluppare un pregiudizio frustrante: iniziano a pensare che le risposte più lunghe siano sempre migliori. È come se stessero cercando di vincere dicendo di più anziché dire le cose bene.
La DPO normalizzata per la lunghezza risolve questo problema regolando come il modello impara dalle preferenze. Invece di guardare solo quale risposta è stata preferita, tiene conto della lunghezza di ogni risposta. Pensalo come giudicare le risposte per la loro qualità per parola, non solo per il loro impatto totale.
Perché questo è importante? Perché aiuta Tülu 3 a imparare a essere preciso e efficiente. Invece di riempire le risposte con parole aggiuntive per sembrare più complete, impara a fornire valore in qualsiasi lunghezza sia effettivamente necessaria.
Questo potrebbe sembrare un dettaglio piccolo, ma è cruciale per costruire un’AI che comunichi in modo naturale. I migliori esperti umani sanno quando essere concisi e quando elaborare – ed è esattamente ciò che la DPO normalizzata per la lunghezza aiuta a insegnare al modello.
Fase 4: L’Innovazione RLVR
Questo è il punto di svolta tecnico che merita attenzione. RLVR sostituisce i modelli di ricompensa soggettivi con verifiche concrete.
La maggior parte dei modelli di AI impara attraverso un sistema complesso di modelli di ricompensa – essenzialmente ipotesi educate su cosa rende una buona risposta. Ma Allen AI ha preso una strada diversa con RLVR.
Pensaci: come addestriamo attualmente i modelli di AI. Di solito abbiamo bisogno di altri modelli di AI (chiamati modelli di ricompensa) per giudicare se una risposta è buona o no. È soggettivo, complesso e spesso inconsistente. Alcune risposte potrebbero sembrare buone ma contenere errori sottili che sfuggono.
RLVR capovolge questo approccio. Invece di affidarsi a giudizi soggettivi, utilizza risultati concreti e verificabili. Quando il modello tenta un problema matematico, non c’è area grigia – la risposta è o giusta o sbagliata. Quando scrive codice, quel codice o funziona correttamente o no.
Ecco dove diventa interessante:
- Il modello riceve un feedback immediato e binario: 10 punti per le risposte corrette, 0 per quelle scorrette
- Non c’è spazio per crediti parziali o valutazioni fuzzy
- L’apprendimento diventa focalizzato e preciso
- Il modello impara a dare priorità all’accuratezza rispetto a risposte plausibili ma scorrette

RLVR Training (Allen AI)
I risultati? Tülu 3 ha mostrato miglioramenti significativi in attività dove la correttezza conta di più. Le sue prestazioni in ragionamento matematico (benchmark GSM8K) e sfide di codifica sono aumentate notevolmente. Anche il suo seguimento delle istruzioni è diventato più preciso perché il modello ha imparato a valorizzare l’accuratezza concreta rispetto a risposte approssimative.
Cosa rende questo particolarmente emozionante è come cambia il gioco per l’AI open source. Gli approcci precedenti spesso lottavano per eguagliare la precisione dei modelli chiusi in attività tecniche. RLVR mostra che con l’approccio di formazione giusto, i modelli open source possono raggiungere lo stesso livello di affidabilità.
Un’occhiata ai Numeri
La versione da 405B parameter di Tülu 3 compete direttamente con i migliori modelli nel campo. Vediamo dove eccelle e cosa significa per l’AI open source.
Matematica
Tülu 3 eccelle nel ragionamento matematico complesso. Nei benchmark come GSM8K e MATH, eguaglia le prestazioni di DeepSeek. Il modello gestisce problemi a più passaggi e mostra forti capacità di ragionamento matematico.
Codifica
I risultati di codifica sono altrettanto impressionanti. Grazie all’addestramento RLVR, Tülu 3 scrive codice che risolve problemi in modo efficace. La sua forza risiede nella comprensione delle istruzioni di codifica e nella produzione di soluzioni funzionali.
Seguimento delle Istruzioni Precise
La capacità del modello di seguire le istruzioni si distingue come una forza fondamentale. Mentre molti modelli approssimano o generalizzano le istruzioni, Tülu 3 dimostra una precisione notevole nell’eseguire esattamente ciò che viene chiesto.
Aprendo la Scatola Nera dello Sviluppo dell’AI
Allen AI ha rilasciato sia un modello potente che l’intero processo di sviluppo.
Ogni aspetto del processo di formazione è documentato e accessibile. Dall’approccio a quattro fasi ai metodi di preparazione dei dati e all’implementazione di RLVR – l’intero processo è aperto per studio e replica. Questa trasparenza stabilisce un nuovo standard nello sviluppo dell’AI ad alte prestazioni.
Gli sviluppatori ricevono risorse complete:
- Pipeline di formazione complete
- Strumenti di elaborazione dei dati
- Framework di valutazione
- Specifiche di implementazione
Ciò consente ai team di:
- Modificare i processi di formazione
- Adattare i metodi per esigenze specifiche
- Costruire su approcci provati
- Creare implementazioni personalizzate
Questo approccio aperto accelera l’innovazione in tutto il settore. I ricercatori possono costruire su metodi verificati, mentre gli sviluppatori possono concentrarsi sui miglioramenti piuttosto che partire da zero.
L’Ascesa dell’Eccellenza Open Source
Il successo di Tülu 3 è un grande momento per lo sviluppo dell’AI open source. Quando i modelli open source eguagliano o superano le alternative private, cambia fondamentalmente l’industria. I team di ricerca in tutto il mondo ottengono accesso a metodi provati, accelerando il loro lavoro e generando nuove innovazioni. I laboratori di AI privati dovranno adattarsi – o aumentando la trasparenza o spingendo i confini tecnici ancora più in là.
Guardando avanti, le innovazioni di Tülu 3 in ricompense verificabili e formazione a più fasi suggeriscono cosa sta per arrivare. I team possono costruire su queste fondamenta, potenzialmente spingendo le prestazioni ancora più in alto. Il codice esiste, i metodi sono documentati e una nuova ondata di sviluppo dell’AI è iniziata. Per gli sviluppatori e i ricercatori, l’opportunità di sperimentare e migliorare questi metodi segna l’inizio di un capitolo emozionante nello sviluppo dell’AI.
Domande Frequenti (FAQ) su Tülu 3
Cosa è Tülu 3 e quali sono le sue caratteristiche chiave?
Tülu 3 è una famiglia di LLM open source sviluppata da Allen AI, costruita sull’architettura Llama 3.1. È disponibile in diverse dimensioni (8B, 70B e 405B parametri). Tülu 3 è progettato per migliorare le prestazioni in una gamma di attività, tra cui conoscenza, ragionamento, matematica, codifica, seguimento delle istruzioni e sicurezza.
Qual è il processo di formazione per Tülu 3 e quali dati vengono utilizzati?
La formazione di Tülu 3 coinvolge diverse fasi chiave. In primo luogo, il team cura un insieme diversificato di prompt da dataset pubblici e dati sintetici mirati ad abilità specifiche, assicurandosi che i dati siano decontaminati rispetto ai benchmark. In secondo luogo, si esegue un addestramento fine-tuning supervisionato (SFT) su una miscela di dati di istruzioni e problemi matematici. Successivamente, si utilizza l’ottimizzazione delle preferenze dirette (DPO) con dati di preferenza generati attraverso feedback umano e LLM. Infine, si utilizza il Reinforcement Learning with Verifiable Rewards (RLVR) per attività con correttezza misurabile. Tülu 3 utilizza dataset curati per ogni fase, tra cui istruzioni guidate da persona, dati matematici e di codifica.
Come Tülu 3 affronta la sicurezza e quali metriche vengono utilizzate per valutarla?
La sicurezza è un componente fondamentale dello sviluppo di Tülu 3, affrontata in tutto il processo di formazione. Un dataset specifico per la sicurezza viene utilizzato durante l’SFT, che si è trovato essere in gran parte ortogonale ad altri dati orientati alle attività.
Cosa è RLVR?
RLVR è una tecnica in cui il modello viene addestrato per ottimizzare una ricompensa verificabile, come la correttezza di una risposta. Ciò differisce dal tradizionale RLHF, che utilizza un modello di ricompensa.













