AI-modellen en platforms

Ai2 maakt AstaBrief 8B open source voor snelle wetenschappelijke rapportgeneratie

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Het Allen Institute for AI (Ai2) zei op 2 oktober 2026 dat het AstaBrief 8B open source maakt, een model dat een onderzoeksvraag en opgehaalde literatuurfragmenten omzet in een geciteerd rapport, en dat het modelgewichten en trainingsgegevens vrijgeeft terwijl het systeem live gaat als Snelle modus in Asta, zijn agentische platform voor wetenschappelijk werk.

Snelle modus in de rapportgeneratie van Asta

AstaBrief is beschikbaar in de functie “Genereer een rapport” van Asta als Snelle modus, die naast de bestaande door Claude aangedreven Denkmodus draait, volgens de aankondiging van Ai2. Ai2 zegt dat het doel was te testen of een klein, open model, specifiek getraind voor wetenschappelijke rapportgeneratie, de rapportkwaliteit van de propriëtaire modellen die het gebruikte kon evenaren, terwijl de generatie‑tijd en de kosten werden verlaagd. Ai2 meldt dat over de volledige Asta‑pipeline de Snelle modus gemiddeld 51.1 seconden per rapport duurt, tegenover 178.5 seconden voor de Denkmodus, een verschil dat zij beschrijft als ongeveer 3.5 keer sneller en bijna een orde‑van‑grootte reductie in generatie‑tijd ten opzichte van de propriëtaire modellen die zij volgde.

De AstaBrief 8B modelkaart stelt dat het model onder Apache 2.0 gelicentieerd is, gebaseerd op Qwen3-8B, en bedoeld is voor onderzoek- en onderwijsgebruik volgens de Responsible Use Guidelines van Ai2. Omdat de gewichten open zijn, zegt Ai2 dat instellingen het model op hun eigen hardware kunnen draaien, inclusief achter hun eigen firewall, wat zij beschrijven als noodzakelijk wanneer onderzoeksvragen betrekking hebben op gevoelige of ongepubliceerde werken. Naast de gewichten heeft Ai2 een voorbeeld‑workflow vrijgegeven in zijn ai2-scholarqa-lib GitHub‑repository die onderzoekers kunnen aanpassen om rapporten te genereren uit hun eigen PDF‑bestanden.

Trainingsgegevens en filtering

Ai2 begon met Qwen3-8B en bouwde AstaBrief met begeleide fijn‑afstemming, gevolgd door directe voorkeuroptimalisatie (DPO). De aankondiging vermeldt dat het team overwoog om training op basis van reinforcement learning te gebruiken, wat hun eerdere DR Tulu‑werk had aangetoond de lange‑vorm rapportgeneratie voor open‑weight modellen kan verbeteren, maar zij kozen voor het eenvoudigere recept omdat RL‑training onstabiel en duur kan zijn en het team een opstelling wilde die goedkoper en makkelijker te debuggen en itereren was.

Voor snelheid werd AstaBrief getraind om het volledige rapport in één stap te schrijven vanuit de gebruikersvraag en opgehaalde fragmenten, waarbij de fase van fragment‑samenvatting en clustering die de door Claude aangedreven Denkmodus gebruikt, werd overgeslagen, evenals het schrijven per sectie. Ai2 zegt dat dit mogelijk bleek te zijn zonder in te boeten op prestaties.

De trainings‑pipeline begon met echte gebruikersvragen die via het systeem achter het ScholarQA‑framework van Ai2 werden ingediend, dat de rapportgeneratie van Asta ondersteunt. Het team filterde de logs op kwaliteit, relevantie en privacy, verwijderde beta‑testers‑ en botverkeer, liet vragen die te kort waren weg, en gebruikte een LLM‑gebaseerde stap om niet‑Engelse vragen, niet‑wetenschappelijke verzoeken en prompts met persoonlijke informatie te detecteren. Hierdoor bleef een pool van 90K onderzoek‑gerichte queries over.

Voor de begeleide fase werden volledige rapportdoelen gegenereerd met de meerstaps ScholarQA‑pipeline, ondersteund door een mix van propriëtaire systemen: Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini en GPT‑4.1. Kwaliteitsfiltering leverde 47 000 bruikbare voorbeelden op. Voor DPO kwamen paren uit een afzonderlijke subset van queries die niet werden gebruikt tijdens de SFT‑datageneratie: één rapport uit de ScholarQA‑pipeline, doorgaans ondersteund door Claude 3.5 of 3.7 Sonnet, tegenover een rapport gegenereerd door o3, o4-mini, DeepSeek‑V3 of DeepSeek‑R1. Twee beoordelingsmodellen, GPT‑4.1 en DeepSeek‑R1, selecteerden een winnaar voor elk paar. Ai2 meldt dat de beoordelaars in 95 % van de gevallen overeenkwamen met menselijke voorkeuren, en alleen paren waarop beide beoordelaars het eens waren werden behouden, wat ongeveer 6 000 definitieve voorbeelden opleverde. Volgens de modelkaart is het vrijgegeven model geïnitialiseerd vanuit het AstaBrief-8B‑SFT‑checkpoint en fijngeschaald op de AstaBriefDPOMix‑dataset, met DPO‑training uitgevoerd in Ai2’s open‑instruct‑framework op 8 xH100‑GPU’s.

Evaluatieresultaten

De belangrijkste ontwikkeldoelstelling van Ai2 was SQABench‑CS2, dat de aankondiging beschrijft als een verzameling van 200 door gebruikers geschreven onderzoeksvragen uit de informatica. Het team volgde vier metriek­en: rubric‑score, die meet hoeveel noodzakelijke inhoud een rapport bevat; antwoord‑precisie, die meet of elke alinea relevant is voor de vraag; citaat‑precisie, die meet of elke verwijzing de bijbehorende bewering ondersteunt; en citaat‑recall, die meet of de beweringen van een rapport volledig worden ondersteund door de geleverde citaten. Secundaire evaluaties maakten gebruik van DeepScholarBench, een benchmark van 63 vragen voor lange‑vorm onderzoekssynthese gebouwd op recente arXiv‑papers, plus pairwise‑vergelijkingen met rapporten uit de door Claude aangedreven pipeline.

De aankondiging meldt dat het team vier statistiek‑gebaseerde filters testte op synthetische trainingsrapporten: output‑naar‑input‑tokenratio, relevantie van citaten, dichtheid van citaten en diversiteit van citaten. Ai2 zegt dat de sterkste verbeteringen voortkwamen uit het filteren van rapporten met een lage citatendichtheid, terwijl agressievere filtering, filtercombinaties en learning‑rate‑sweeps geen betekenisvolle winst opleverden. Het beschrijft de bredere les als bewijs dat wetenschappelijke specialisatie niet per se neerkomt op het toevoegen van meer wetenschappelijke tekst aan de pre‑training, en dat de samenstelling en kwaliteit van post‑training data de prestaties van het resulterende model substantieel kunnen beïnvloeden.

Ai2 zegt dat vroege SFT‑checkpoints de algehele inhoudskwaliteit hebben verbeterd, maar nog steeds achterliepen bij de door Claude aangedreven pipeline op het gebied van antwoordprecisie en citatiekwaliteit, en dat de DPO‑fase AstaBrief binnen het bereik van de Claude‑pipeline en DR Tulu bracht voor rapportgeneratie. De modelkaart meldt dat op de ScholarQA‑CS2‑testset AstaBrief‑8B een gemiddelde van 87 behaalde op de gevolgde metrics, vergeleken met 83.7 voor de SFT‑checkpoint en 77.3 voor base Qwen3‑8B, waarbij AstaBrief‑8B scoorde 90.2 op ingredient recall, 89 op answer precision, 90.5 op citation precision, en 78.2 op citation recall. De kaart meldt ook LLM‑gebeurde winpercentages voor AstaBrief‑8B ten opzichte van de Asta ScholarQA‑pipeline van 55 percent op de development split en 72 percent op de test split, en geeft DeepScholarBench‑scores weer van 53.50 voor AstaBrief‑8B, 60.25 voor Asta ScholarQA, en 56.26 voor DR‑Tulu‑8B.

In een afzonderlijke menselijk onderzoek beschreven in de aankondiging leverden drie wetenschappelijke onderzoekers elk vier tot vijf vragen bij binnen een set van 14 vragen en rangschikten rapporten van de drie systemen op algemene voorkeur, volledigheid, relevantie, organisatie en citatienauwkeurigheid, waarbij gelijke scores waren toegestaan. Ai2 meldt dat DR Tulu won op algemene voorkeur, terwijl twee van de drie onderzoekers AstaBrief verkozen boven de andere systemen op citatienauwkeurigheid.

Ai2 waarschuwt dat het grootste deel van de training en evaluatie in 2025 is voltooid, dat de propriëtaire modellen die werden gebruikt om trainingsdata te genereren en als vergelijkingspunten dienen de stand van de kunst van dat moment weerspiegelen, en dat het de volledige evaluatie niet opnieuw heeft uitgevoerd tegen de huidige frontier‑modellen.

Vroeg gebruik en aangegeven vervolgstappen

Ai2 meldt dat onder de 374 Asta‑gebruikers die Fast mode hebben geprobeerd, 29.1 percent het op twee of meer dagen gebruikte, gebruikers gemiddeld 3.67 rapportthreads genereerden, 23 percent nooit terugschakelde naar Thinking mode voor toekomstige threads, en nog eens 18 percent tussen de modi wisselde afhankelijk van hun doelen, waarbij Fast mode voor ongeveer 40 percent van hun threads werd gebruikt. Positieve feedback bedroeg 84.2 percent voor Fast mode versus 85.2 percent voor Thinking mode, wat Ai2 karakteriseert als een vergelijkbaar percentage, terwijl wordt opgemerkt dat feedback over het algemeen te schaars is om sterke conclusies te ondersteunen.

Ai2 zegt dat het meer fijnmazig preference learning onderzoekt, sterkere RAG‑plus‑RL‑benaderingen, multi‑turn‑ en multi‑tool‑mogelijkheden, extra wetenschappelijke databronnen en query‑decompositie, samen met evaluaties die testen of een model de evidentiary scope van zijn bronnen behoudt in plaats van uit te breiden wat de onderliggende studies hebben vastgesteld. De aankondiging plaatst het werk binnen Ai2’s bredere wetenschappelijke‑model inspanningen, inclusief NSF OMAI, een Amerikaans nationaal initiatief geleid door Ai2 om volledig open AI‑infrastructuur en -modellen voor wetenschappelijke ontdekking te bouwen, en beschrijft AstaBrief als één experiment in een langere reeks werk dat loopt van ScholarQA en DR Tulu tot toekomstige versies van Olmo.

Jonas Reeve is een AI-gegenereerde analist bij Unite.AI, met focus op cognitieve AI, kunstmatige algemene intelligentie (AGI) en de theoretische grondslagen van machinale intelligentie. Zijn werk onderzoekt hoe leren, redeneren, geheugen en abstractie ontstaan in zowel biologische als kunstmatige systemen, en legt verbanden tussen moderne AI-architecturen en eeuwenoude vragen in de cognitieve wetenschap en de filosofie van de geest.

Met een conceptuele en reflectieve benadering onderzoekt Jonas kaders zoals redeneermodellen, agentensystemen, emergente cognitie en uitlijningstheorie, met als doel te verduidelijken wat vooruitgang richting AGI werkelijk betekent – en wat het niet betekent. In plaats van te jagen op tijdlijnen of hype, legt hij de nadruk op eerste principes, conceptuele strengheid en de grenzen van de huidige modellen.

Artikelen geschreven door Jonas Reeve zijn AI-gegenereerd en worden beoordeeld door de redactie van Unite.AI om nauwkeurigheid, duidelijkheid en een verantwoordelijke bespreking van geavanceerde AI-concepten te waarborgen.