Modelli e piattaforme di IA

Ai2 rende open source AstaBrief 8B per la generazione rapida di report scientifici

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

L’Allen Institute for AI (Ai2) ha dichiarato il 2 ottobre 2026 che sta rendendo open source AstaBrief 8B, un modello che trasforma una domanda di ricerca e gli estratti di letteratura recuperati in un report citato, rilasciando i pesi del modello e i dati di addestramento mentre il sistema viene lanciato come modalità Fast in Asta, la sua piattaforma agente per il lavoro scientifico.

Modalità Fast nella generazione di report di Asta

AstaBrief è disponibile nella funzione Genera un report di Asta come modalità Fast, funzionando accanto alla modalità Thinking alimentata da Claude, secondo annuncio di Ai2. Ai2 afferma che il suo obiettivo era verificare se un modello piccolo e open, addestrato specificamente per la generazione di report scientifici, potesse eguagliare la qualità dei report dei modelli proprietari in uso, riducendo al contempo i tempi di generazione e i costi di servizio. Ai2 riferisce che, nell’intera pipeline di Asta, la modalità Fast ha una media di 51,1 secondi per report rispetto a 178,5 secondi per la modalità Thinking, una differenza descritta come circa 3,5 volte più veloce e quasi un ordine di grandezza di riduzione del tempo di generazione rispetto ai modelli proprietari monitorati.

La scheda modello AstaBrief 8B indica che il modello è concesso in licenza sotto Apache 2.0, si basa su Qwen3-8B ed è destinato a usi di ricerca e educativi secondo le Linee guida per l’uso responsabile di Ai2. Poiché i pesi sono open, Ai2 afferma che le istituzioni possono eseguire il modello sul proprio hardware, anche dietro il proprio firewall, considerato necessario quando le domande di ricerca riguardano lavori sensibili o non pubblicati. Insieme ai pesi, Ai2 ha rilasciato un flusso di lavoro di esempio nel suo repository GitHub ai2-scholarqa-lib che i ricercatori possono adattare per generare report dai propri PDF.

Dati di addestramento e filtraggio

Ai2 ha iniziato da Qwen3-8B e ha costruito AstaBrief con un fine-tuning supervisionato seguito da ottimizzazione diretta delle preferenze (DPO). L’annuncio afferma che il team ha valutato un addestramento basato sul reinforcement learning, che il loro lavoro precedente su DR Tulu aveva dimostrato poter migliorare la generazione di report lunghi per modelli a peso aperto, ma ha scelto la procedura più semplice perché l’addestramento RL può essere instabile e costoso, e il team desiderava una configurazione più economica e più facile da debug e iterare.

Per velocità, AstaBrief è stato addestrato a scrivere l’intero report in un unico passaggio a partire dalla query dell’utente e dagli snippet recuperati, evitando le fasi di sintesi e clustering degli snippet utilizzate dalla modalità Thinking basata su Claude e saltando la scrittura sezione per sezione. Ai2 afferma di aver riscontrato che ciò era possibile senza compromettere le prestazioni.

La pipeline di addestramento è iniziata con query reali degli utenti inviate tramite il sistema dietro il framework ScholarQA di Ai2, che sostiene la generazione di report di Asta. Il team ha filtrato i log per qualità, rilevanza e privacy, rimuovendo il traffico di beta-tester e bot, scartando le query troppo brevi per essere significative e utilizzando un passaggio basato su LLM per intercettare query non in inglese, richieste non scientifiche e prompt contenenti informazioni personali. Ne è rimasto un pool di 90K query focalizzate sulla ricerca.

Per la fase supervisionata, gli obiettivi di report completi sono stati generati con la pipeline multi-step ScholarQA supportata da un mix di sistemi proprietari: Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini e GPT-4.1. Il filtraggio di qualità ha lasciato 47K esempi utilizzabili. Per il DPO, le coppie provengono da un sottoinsieme separato di query non impiegate durante la generazione dei dati SFT: un report dalla pipeline ScholarQA, tipicamente supportato da Claude 3.5 o 3.7 Sonnet, contro un report generato da o3, o4-mini, DeepSeek-V3 o DeepSeek-R1. Due modelli giudice, GPT-4.1 e DeepSeek-R1, hanno scelto un vincitore per ogni coppia. Ai2 afferma che i giudici hanno concordato con le preferenze umane per il 95 percento delle volte, e solo le coppie su cui entrambi i giudici hanno concordato sono state mantenute, producendo circa 6K esempi finali. Secondo la scheda modello, il modello rilasciato è stato inizializzato dal checkpoint AstaBrief-8B-SFT e rifinito sul dataset AstaBriefDPOMix, con l’addestramento DPO condotto nel framework open-instruct di Ai2 su 8×H100 GPU.

Risultati della valutazione

L’obiettivo principale di sviluppo di Ai2 era SQABench-CS2, che l’annuncio descrive come un insieme di 200 domande di ricerca in informatica scritte dagli utenti. Il team ha monitorato quattro metriche: punteggio rubric, che misura quanto contenuto necessario copre un report; precisione delle risposte, che valuta se ogni paragrafo è pertinente alla domanda; precisione delle citazioni, che verifica se ogni citazione supporta l’affermazione a cui è associata; e richiamo delle citazioni, che misura se le affermazioni del report sono completamente supportate dalle citazioni fornite. Le valutazioni secondarie hanno utilizzato DeepScholarBench, un benchmark di 63 query per la sintesi di ricerca a lungo termine costruito su recenti articoli arXiv, oltre a confronti a coppie contro i report della pipeline alimentata da Claude.

L’annuncio riferisce che il team ha testato quattro filtri basati su statistiche su report di addestramento sintetici: rapporto token output‑input, rilevanza delle citazioni, densità delle citazioni e diversità delle citazioni. Ai2 afferma che i maggiori guadagni provengono dal filtrare i report con bassa densità di citazioni, mentre filtri più aggressivi, combinazioni di filtri e sweep di tassi di apprendimento non hanno apportato miglioramenti significativi. Descrive la lezione più ampia come prova che la specializzazione scientifica non è necessariamente una questione di aggiungere più testo scientifico al pre‑addestramento, e che la composizione e la qualità dei dati post‑addestramento possono cambiare materialmente le prestazioni del modello risultante.

Ai2 afferma che i primi checkpoint SFT hanno migliorato la qualità complessiva del contenuto, ma sono rimasti indietro rispetto alla pipeline alimentata da Claude per quanto riguarda la precisione delle risposte e la qualità delle citazioni, e che la fase DPO ha portato AstaBrief a livelli comparabili con la pipeline Claude e DR Tulu nella generazione di report. La scheda modello segnala che, sul set di test ScholarQA‑CS2, AstaBrief‑8B ha ottenuto una media di 87 sui metriche tracciate, rispetto a 83,7 per il checkpoint SFT e 77,3 per il Qwen3‑8B di base, con AstaBrief‑8B che ha segnato 90,2 nel richiamo degli ingredienti, 89 nella precisione delle risposte, 90,5 nella precisione delle citazioni e 78,2 nel richiamo delle citazioni. La scheda riporta inoltre tassi di vittoria giudicati da LLM per AstaBrief‑8B contro la pipeline Asta ScholarQA del 55 percento sullo split di sviluppo e del 72 percento su quello di test, e elenca punteggi DeepScholarBench di 53,50 per AstaBrief‑8B, 60,25 per Asta ScholarQA e 56,26 per DR‑Tulu‑8B.

In uno studio umano separato descritto nell’annuncio, tre ricercatori scientifici hanno contribuito ciascuno con quattro‑cinque domande su un set di 14 domande e hanno classificato i report dei tre sistemi in base a preferenza complessiva, completezza, rilevanza, organizzazione e accuratezza delle citazioni, consentendo i pareggi. Ai2 riferisce che DR Tulu ha vinto in termini di preferenza complessiva, mentre due dei tre ricercatori hanno preferito AstaBrief rispetto agli altri sistemi per l’accuratezza delle citazioni.

Ai2 avverte che la maggior parte dell’addestramento e della valutazione è stata completata nel 2025, che i modelli proprietari utilizzati per generare i dati di addestramento e come punti di confronto riflettono lo stato dell’arte di quel periodo, e che non ha rieseguito la valutazione completa contro i modelli di frontiera attuali.

Primi utilizzi e prossimi passi dichiarati

Ai2 segnala che, tra i 374 utenti di Asta che hanno provato la modalità Fast, il 29,1 percento l’ha usata per due o più giorni, gli utenti hanno generato in media 3,67 thread di report, il 23 percento non è mai tornato alla modalità Thinking per i thread futuri, e un ulteriore 18 percento ha alternato le modalità a seconda dei propri obiettivi, usando la modalità Fast per circa il 40 percento dei loro thread. Il feedback positivo è stato dell’84,2 percento per la modalità Fast contro l’85,2 percento per la modalità Thinking, tasso che Ai2 caratterizza come simile, notando al contempo che il feedback è generalmente troppo scarso per supportare conclusioni solide.

Ai2 dichiara di stare esplorando un apprendimento delle preferenze più fine, approcci RAG‑plus‑RL più potenti, capacità multi‑turno e multi‑strumento, ulteriori fonti di dati scientifici e la scomposizione delle query, insieme a valutazioni che verificano se un modello preserva l’ambito probatorio delle sue fonti anziché ampliare ciò che gli studi sottostanti hanno stabilito. L’annuncio colloca il lavoro all’interno degli sforzi più ampi di Ai2 sui modelli scientifici, inclusa NSF OMAI, un’iniziativa nazionale statunitense guidata da Ai2 per costruire infrastrutture e modelli AI completamente aperti per la scoperta scientifica, e descrive AstaBrief come un esperimento in una lunga serie di lavori che vanno da ScholarQA e DR Tulu a future versioni di Olmo.

Jonas Reeve è un analista generato dall'IA presso Unite.AI, focalizzato su AI cognitiva, intelligenza artificiale generale (AGI) e le fondamenta teoriche dell'intelligenza delle macchine. Il suo lavoro esplora come apprendimento, ragionamento, memoria e astrazione emergano sia nei sistemi biologici sia in quelli artificiali, tracciando collegamenti tra le moderne architetture AI e le domande di lunga data nella scienza cognitiva e nella filosofia della mente.

Con un approccio concettuale e riflessivo, Jonas esamina quadri teorici come i modelli di ragionamento, i sistemi agentici, la cognizione emergente e la teoria dell'allineamento, mirando a chiarire cosa significhi realmente il progresso verso l'AGI — e cosa non significhi. Piuttosto che inseguire scadenze o hype, egli enfatizza i principi primi, il rigore concettuale e i limiti dei modelli attuali.

Gli articoli scritti da Jonas Reeve sono generati dall'IA e revisionati dal team editoriale di Unite.AI per garantire accuratezza, chiarezza e una discussione responsabile dei concetti avanzati di IA.