AI-modeller och plattformar

Ai2 öppnar källkoden för AstaBrief 8B för snabb vetenskaplig rapportgenerering

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Allen Institute for AI (Ai2) meddelade den 2 oktober 2026 att de öppnar källkoden för AstaBrief 8B, en modell som omvandlar en forskningsfråga och hämtade litteraturutdrag till en citerad rapport, och släpper modellvikterna och träningsdata i samband med att systemet lanseras som Snabbt läge i Asta, deras agentbaserade plattform för vetenskapligt arbete.

Snabbt läge i Astas rapportgenerering

AstaBrief finns tillgänglig i Astas funktion Generera en rapport som Snabbt läge, som körs parallellt med det befintliga Claude-drivna Tänkarläget, enligt Ai2:s tillkännagivande. Ai2 säger att målet var att testa om en liten, öppen modell som tränats specifikt för vetenskaplig rapportgenerering kunde matcha rapportkvaliteten hos de proprietära modellerna de tidigare använt, samtidigt som genereringstiden och driftskostnaderna minskades. Ai2 rapporterar att i hela Astapipelinen är genomsnittstiden för Snabbt läge 51.1 sekunder per rapport jämfört med 178.5 sekunder för Tänkarläget, en skillnad som de beskriver som ungefär 3.5 gånger snabbare och nästan en tiodubbel minskning av genereringstiden jämfört med de spårade proprietära modellerna.

AstaBrief 8B-modellkort anger att modellen är licensierad under Apache 2.0, är baserad på Qwen3-8B och är avsedd för forsknings- och utbildningsbruk enligt Ai2:s riktlinjer för ansvarsfull användning. Eftersom vikterna är öppna säger Ai2 att institutioner kan köra modellen på egen hårdvara, även bakom sin egen brandvägg, vilket de beskriver som nödvändigt när forskningsfrågor rör känsligt eller opublicerat material. Tillsammans med vikterna släppte Ai2 ett exempelarbetsflöde i sitt ai2-scholarqa-lib GitHub‑arkiv som forskare kan anpassa för att generera rapporter från sina egna PDF‑filer.

Träningsdata och filtrering

Ai2 började med Qwen3-8B och byggde AstaBrief med övervakad finjustering följt av direktpreferensoptimering (DPO). Tillkännagivandet säger att teamet övervägde förstärkningsinlärningsbaserad träning, vilket deras tidigare DR Tulu‑arbete hade visat kan förbättra långformig rapportgenerering för modeller med öppna vikter, men de valde den enklare metoden eftersom RL‑träning kan vara instabil och dyr, och teamet ville ha en lösning som var billigare och enklare att felsöka och iterera på.

För hastighet tränades AstaBrief att skriva hela rapporten i ett enda pass från användarfrågan och hämtade utdrag, vilket kringgår steg för sammanfattning och klustring av utdrag som Claude‑baserade Tänkarläget använder samt hoppar över sektion‑för‑sektion‑skrivning. Ai2 säger att de fann att detta var möjligt utan att offra prestanda.

Träningspipelines började med faktiska användarfrågor som skickades genom systemet bakom Ai2:s ScholarQA‑ramverk, som ligger till grund för Astas rapportgenerering. Teamet filtrerade loggarna för kvalitet, relevans och integritet, tog bort betatestare och bot‑trafik, eliminerade frågor som var för korta för att vara meningsfulla, och använde ett LLM‑baserat pass för att fånga icke‑engelska frågor, icke‑vetenskapliga förfrågningar och uppmaningar som innehöll personlig information. Detta resulterade i en pool på 90K forskningsinriktade frågor.

För den övervakade fasen genererades fullständiga rapportmål med den flerstegs ScholarQA‑pipeline som stöds av en blandning av proprietära system: Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini och GPT-4.1. Kvalitetsfiltrering lämnade 47K användbara exempel. För DPO kom paren från ett separat delmängd av frågor som inte användes under SFT‑datagenerering: en rapport från ScholarQA‑pipeline, vanligtvis stödd av Claude 3.5 eller 3.7 Sonnet, mot en rapport genererad av o3, o4-mini, DeepSeek-V3 eller DeepSeek-R1. Två bedömningsmodeller, GPT-4.1 och DeepSeek-R1, valde en vinnare för varje par. Ai2 säger att domarna höll med mänskliga preferenser 95 procent av gångerna, och endast de par där båda domarna höll med behölls, vilket resulterade i cirka 6K slutgiltiga exempel. Enligt modellkortet initierades den släppta modellen från AstaBrief-8B-SFT‑checkpointen och finjusterades på AstaBriefDPOMix‑datasetet, med DPO‑träning utförd i Ai2:s open-instruct‑ramverk på 8xH100 GPUs.

Utvärderingsresultat

Ai2:s huvudutvecklingsmål var SQABench‑CS2, som tillkännagivandet beskriver som en samling på 200 användarskrivna forskningsfrågor inom datavetenskap. Teamet följde fyra metrik: rubrikpoäng, som mäter hur mycket nödvändigt innehåll en rapport täcker; svarsprecision, som mäter om varje stycke är relevant för frågan; citeringsprecision, som mäter om varje citering stödjer det påstådda påståendet; och citeringsåterkallelse, som mäter om en rapports påståenden är fullt understödda av de angivna citeringarna. Sekundära utvärderingar använde DeepScholarBench, ett benchmark med 63 frågor för långformig forskningssyntes byggt på nyliga arXiv‑artiklar, samt parvisa jämförelser mot rapporter från den Claude‑drivna pipelinen.

Tillkännagivandet rapporterar att teamet testade fyra statistikbaserade filter på syntetiska träningsrapporter: token‑förhållande mellan utdata och indata, citeringsrelevans, citeringsdensitet och citeringsdiversitet. Ai2 säger att de starkaste förbättringarna kom från att filtrera bort rapporter med låg citeringsdensitet, medan mer aggressiv filtrering, filterkombinationer och inlärningshastighets‑svep inte gav några betydande vinster. De beskriver den bredare lärdomen som ett bevis på att vetenskaplig specialisering inte nödvändigtvis handlar om att lägga till mer vetenskaplig text i förträningen, och att sammansättningen och kvaliteten på efterträningsdata kan förändra hur den resulterande modellen presterar avsevärt.

Ai2 säger att tidiga SFT‑kontrollpunkter förbättrade den övergripande innehållskvaliteten men fortfarande låg efter den Claude‑drivna pipeline:n när det gäller svarsprecision och citeringskvalitet, och att DPO‑stadiet förde AstaBrief in i samma område som Claude‑pipeline:n och DR Tulu för rapportgenerering. Modellkortet rapporterar att på testsetet ScholarQA‑CS2 uppnådde AstaBrief‑8B ett genomsnitt på 87 på de spårade metrik­erna, jämfört med 83,7 för SFT‑kontrollpunkten och 77,3 för bas‑Qwen3‑8B, med AstaBrief‑8B som fick 90,2 på ingrediensåterkallelse, 89 på svarsprecision, 90,5 på citeringsprecision och 78,2 på citeringsåterkallelse. Kortet rapporterar också LLM‑bedömda vinstfrekvenser för AstaBrief‑8B mot Asta ScholarQA‑pipeline:n på 55 % på utvecklingsuppdelningen och 72 % på testuppdelningen, samt listar DeepScholarBench‑poäng på 53,50 för AstaBrief‑8B, 60,25 för Asta ScholarQA och 56,26 för DR‑Tulu‑8B.

I en separat mänsklig studie som beskrivs i tillkännagivandet bidrog tre vetenskapliga forskare med fyra till fem frågor vardera i en uppsättning på 14 frågor och rankade rapporter från de tre systemen efter övergripande preferens, fullständighet, relevans, organisation och citeringsnoggrannhet, med möjlighet till lika resultat. Ai2 rapporterar att DR Tulu vann på övergripande preferens, medan två av de tre forskarna föredrog AstaBrief framför de andra systemen när det gäller citeringsnoggrannhet.

Ai2 varnar för att det mesta av träningen och utvärderingen slutfördes 2025, att de proprietära modeller som användes för att generera träningsdata och fungera som jämförelsepunkter speglar frontlinjen vid den tidpunkten, och att de inte har kört om hela utvärderingen mot nuvarande frontlinjemodeller.

Tidigt bruk och angivna nästa steg

Ai2 rapporterar att bland 374 Asta‑användare som har provat Snabb‑läget, använde 29,1 % det två eller fler dagar, användarna genererade i genomsnitt 3,67 rapporttrådar, 23 % återgick aldrig till Tänk‑läget för framtida trådar, och ytterligare 18 % växlade mellan lägena beroende på deras mål, och använde Snabb‑läget för ungefär 40 % av sina trådar. Positiv återkoppling låg på 84,2 % för Snabb‑läget jämfört med 85,2 % för Tänk‑läget, vilket Ai2 beskriver som en liknande nivå samtidigt som de noterar att återkopplingen generellt är för sparsam för att stödja starka slutsatser.

Ai2 säger att de utforskar mer finfördelad preferensinlärning, starkare RAG‑plus‑RL‑metoder, flervägs‑ och multiverktygsfunktioner, ytterligare vetenskapliga datakällor och fråge‑dekomposition, tillsammans med utvärderingar som testar huruvida en modell bevarar evidensomfånget i sina källor snarare än att bredda vad de underliggande studierna fastställt. Tillkännagivandet placerar arbetet inom Ai2:s bredare vetenskapliga modell‑insatser, inklusive NSF OMAI, ett amerikanskt nationellt initiativ lett av Ai2 för att bygga helt öppen AI‑infrastruktur och modeller för vetenskaplig upptäckt, och beskriver AstaBrief som ett experiment i en längre rad av arbete som sträcker sig från ScholarQA och DR Tulu till framtida versioner av Olmo.

Jonas Reeve är en AI‑genererad analytiker på Unite.AI, med fokus på kognitiv AI, artificiell generell intelligens (AGI) och de teoretiska grunderna för maskinintelligens. Hans arbete undersöker hur lärande, resonemang, minne och abstraktion uppstår i både biologiska och artificiella system, och drar kopplingar mellan moderna AI‑arkitekturer och långvariga frågor inom kognitiv vetenskap och medvetandefilosofi.

Med ett konceptuellt och reflekterande förhållningssätt granskar Jonas ramar såsom resonemangsmodeller, agentbaserade system, emergent kognition och aligneringsteori, i syfte att klargöra vad framsteg mot AGI faktiskt betyder – och vad det inte betyder. Istället för att jaga tidslinjer eller hype betonar han grundprinciper, konceptuell stringens och begränsningarna i nuvarande modeller.

Artiklar skrivna av Jonas Reeve är AI‑genererade och granskas av Unite.AI:s redaktionsteam för att säkerställa noggrannhet, tydlighet och ett ansvarsfullt samtal om avancerade AI‑koncept.