KI-Modelle und Plattformen
Ai2 veröffentlicht Open-Source AstaBrief 8B für schnelle wissenschaftliche Berichtserstellung

Das Allen Institute for AI (Ai2) teilte am 2. Oktober 2026 mit, dass es AstaBrief 8B open‑source stellt, ein Modell, das aus einer Forschungsfrage und abgerufenen Literaturauszügen einen zitierten Bericht erzeugt, und veröffentlicht die Modellgewichte sowie Trainingsdaten, während das System im Fast‑Modus in Asta, seiner agentischen Plattform für wissenschaftliche Arbeit, live geht.
Fast‑Modus in Astas Berichtserstellung
AstaBrief ist im Feature „Generate a report“ von Asta als Fast‑Modus verfügbar und läuft neben dem bestehenden, von Claude betriebenen Thinking‑Modus, laut Ai2’s Ankündigung. Ai2 sagt, ihr Ziel sei zu testen, ob ein kleines, offenes Modell, das speziell für die Erstellung wissenschaftlicher Berichte trainiert wurde, die Berichtqualität der proprietären Modelle, die sie bisher verwendet haben, erreichen kann, während die Generierungszeit und die Servicenkosten reduziert werden. Ai2 berichtet, dass im gesamten Asta‑Pipeline‑Durchlauf der Fast‑Modus im Durchschnitt 51,1 Sekunden pro Bericht benötigt, verglichen mit 178,5 Sekunden beim Thinking‑Modus, ein Unterschied, den sie als etwa 3,5‑mal schneller und als nahezu eine Größenordnung kürzere Generierungszeit im Vergleich zu den proprietären Modellen beschreiben.
Die AstaBrief 8B Modelkarte gibt an, dass das Modell unter Apache 2.0 lizenziert ist, auf Qwen3‑8B basiert und gemäß Ai2’s Responsible Use Guidelines für Forschungs‑ und Bildungszwecke vorgesehen ist. Da die Gewichte offen sind, sagt Ai2, dass Institutionen das Modell auf ihrer eigenen Hardware ausführen können, auch hinter ihrer eigenen Firewall, was sie als notwendig beschreiben, wenn Forschungsfragen sensible oder unveröffentlichte Arbeiten betreffen. Zusammen mit den Gewichten hat Ai2 einen Beispiel‑Workflow in seinem ai2-scholarqa-lib GitHub‑Repository veröffentlicht, den Forschende anpassen können, um Berichte aus ihren eigenen PDFs zu erzeugen.
Trainingsdaten und Filterung
Ai2 begann mit Qwen3‑8B und entwickelte AstaBrief durch überwachtes Feintuning, gefolgt von direct preference optimization (DPO). Die Ankündigung erklärt, dass das Team ein auf Reinforcement Learning basierendes Training in Erwägung zog, das in früheren DR‑Tulu‑Arbeiten gezeigt hatte, dass es die Langform‑Berichtserstellung für offene Modelle verbessern kann, sich jedoch für das einfachere Verfahren entschied, weil RL‑Training instabil und teuer sein kann und das Team eine günstigere und leichter zu debuggen sowie iterieren Lösung wollte.
Um Geschwindigkeit zu erreichen, wurde AstaBrief so trainiert, dass es den vollständigen Bericht in einem Durchlauf aus der Nutzerfrage und den abgerufenen Ausschnitten schreibt, wobei die Snippet‑Zusammenfassungs‑ und Clustering‑Stufen, die der Claude‑basierte Thinking‑Modus nutzt, sowie das schrittweise Schreiben von Abschnitten übersprungen werden. Ai2 sagt, dass dies möglich war, ohne die Leistung zu beeinträchtigen.
Die Training‑Pipeline startete mit echten Nutzeranfragen, die über das System hinter Ai2’s ScholarQA‑Framework eingereicht wurden, das die Berichtserstellung von Asta unterstützt. Das Team filterte die Protokolle nach Qualität, Relevanz und Datenschutz, entfernte Beta‑Tester‑ und Bot‑Traffic, verwirft Anfragen, die zu kurz für eine sinnvolle Interpretation waren, und nutzte einen LLM‑basierten Durchlauf, um nicht‑englische Anfragen, nicht‑wissenschaftliche Anfragen und Eingaben mit persönlichen Informationen zu erfassen. Dadurch blieb ein Pool von 90 000 forschungsorientierten Anfragen übrig.
Für die überwachte Phase wurden Vollbericht‑Ziele mit der mehrstufigen ScholarQA‑Pipeline erzeugt, die von einer Mischung proprietärer Systeme unterstützt wird: Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4‑mini und GPT‑4.1. Qualitätsfilterung ließ 47 000 nutzbare Beispiele übrig. Für DPO stammten Paare aus einem separaten Teilset von Anfragen, das nicht für die SFT‑Datengenerierung verwendet wurde: ein Bericht aus der ScholarQA‑Pipeline, typischerweise unterstützt von Claude 3.5 oder 3.7 Sonnet, gegen einen Bericht, der von o3, o4‑mini, DeepSeek‑V3 oder DeepSeek‑R1 erzeugt wurde. Zwei Bewertungsmodelle, GPT‑4.1 und DeepSeek‑R1, wählten für jedes Paar einen Sieger. Ai2 sagt, die Richter stimmten zu 95 % mit menschlichen Präferenzen überein, und nur Paare, bei denen beide Richter übereinstimmten, wurden behalten, was etwa 6 000 Endbeispiele ergab. Laut Modellkarte wurde das veröffentlichte Modell aus dem AstaBrief‑8B‑SFT‑Checkpoint initialisiert und auf dem AstaBriefDPOMix‑Datensatz feingetuned, wobei das DPO‑Training in Ai2’s open‑instruct‑Framework auf 8 × H100‑GPUs durchgeführt wurde.
Ergebnisse der Evaluation
Ai2’s Hauptentwicklungsziel war SQABench‑CS2, das laut Ankündigung als Satz von 200 von Nutzern geschriebenen Computer‑Science‑Forschungsfragen definiert ist. Das Team verfolgte vier Metriken: Rubric‑Score, der misst, wie viel notwendiger Inhalt ein Bericht abdeckt; Answer‑Precision, die misst, ob jeder Absatz zur Frage passt; Citation‑Precision, die misst, ob jede Zitation die zugehörige Behauptung unterstützt; und Citation‑Recall, der misst, ob die Behauptungen eines Berichts vollständig durch die bereitgestellten Zitationen gestützt werden. Sekundäre Bewertungen nutzten DeepScholarBench, einen Benchmark mit 63 Anfragen für die Langform‑Forschungssynthese, aufgebaut aus aktuellen arXiv‑Papieren, sowie paarweise Vergleiche gegen Berichte aus der Claude‑basierten Pipeline.
Die Ankündigung berichtet, dass das Team vier statistikbasierte Filter auf synthetischen Trainingsberichten getestet hat: Token‑Verhältnis von Ausgabe zu Eingabe, Zitationsrelevanz, Zitationsdichte und Zitationsvielfalt. Ai2 sagt, die größten Verbesserungen kamen durch das Filtern von Berichten mit niedriger Zitationsdichte, während aggressiveres Filtern, Kombinationen von Filtern und Lernraten‑Durchläufe keine signifikanten Gewinne brachten. Es wird als breitere Lehre beschrieben, dass wissenschaftliche Spezialisierung nicht unbedingt durch das Hinzufügen mehr wissenschaftlichen Textes zum Vortraining erreicht wird, sondern dass die Zusammensetzung und Qualität der Nach‑Training‑Daten die Leistungsfähigkeit des resultierenden Modells wesentlich beeinflussen kann.
Ai2 sagt, dass frühe SFT-Checkpoints die Gesamtinhaltsqualität verbessert haben, aber immer noch hinter der von Claude betriebenen Pipeline in Bezug auf Antwortpräzision und Zitationsqualität zurückblieben, und dass die DPO-Phase AstaBrief in die Reichweite der Claude-Pipeline und von DR Tulu bei der Berichtserstellung brachte. Das Model‑Card berichtet, dass AstaBrief-8B im ScholarQA‑CS2‑Testset im Durchschnitt 87 über die verfolgten Metriken erreichte, verglichen mit 83,7 für den SFT‑Checkpoint und 77,3 für das Basismodell Qwen3‑8B, wobei AstaBrief-8B 90,2 beim Zutaten‑Recall, 89 bei der Antwortpräzision, 90,5 bei der Zitationspräzision und 78,2 beim Zitations‑Recall erzielte. Die Karte berichtet außerdem, dass die von LLM bewerteten Gewinnraten für AstaBrief-8B gegenüber der Asta ScholarQA‑Pipeline 55 % im Development‑Split und 72 % im Test‑Split betrugen, und listet DeepScholarBench‑Scores von 53,50 für AstaBrief-8B, 60,25 für Asta ScholarQA und 56,26 für DR‑Tulu‑8B auf.
In einer separaten Humanstudie, die in der Ankündigung beschrieben wird, stellten drei Wissenschaftler jeweils vier bis fünf Fragen aus einem 14‑Fragen‑Set zusammen und bewerteten die Berichte der drei Systeme hinsichtlich Gesamtnutzen, Vollständigkeit, Relevanz, Struktur und Zitationsgenauigkeit, wobei Gleichstände zulässig waren. Ai2 berichtet, dass DR Tulu beim Gesamtnutzen gewann, während zwei der drei Forscher AstaBrief in Bezug auf die Zitationsgenauigkeit den anderen Systemen vorzogen.
Ai2 warnt, dass der Großteil des Trainings und der Evaluierung im Jahr 2025 abgeschlossen wurde, dass die proprietären Modelle, die zur Erzeugung der Trainingsdaten und als Vergleichspunkte verwendet wurden, den Stand der Technik zu diesem Zeitpunkt widerspiegeln, und dass die vollständige Evaluation nicht erneut gegen aktuelle State‑of‑the‑Art‑Modelle durchgeführt wurde.
Frühe Nutzung und erklärte nächste Schritte
Ai2 berichtet, dass von 374 Asta‑Nutzer*innen, die Fast mode ausprobiert haben, 29,1 % es an zwei oder mehr Tagen nutzten, die Nutzer*innen im Durchschnitt 3,67 Bericht‑Threads erzeugten, 23 % nie wieder zum Thinking mode für zukünftige Threads wechselten und weitere 18 % je nach Ziel zwischen den Modi wechselten und Fast mode für etwa 40 % ihrer Threads verwendeten. Das positive Feedback lag bei 84,2 % für Fast mode gegenüber 85,2 % für Thinking mode, was Ai2 als eine ähnliche Rate charakterisiert, wobei angemerkt wird, dass das Feedback im Allgemeinen zu spärlich sei, um starke Schlussfolgerungen zu stützen.
Ai2 sagt, dass es ein feinkörnigeres Preference‑Learning, stärkere RAG‑plus‑RL‑Ansätze, Multi‑Turn‑ und Multi‑Tool‑Fähigkeiten, zusätzliche wissenschaftliche Datenquellen und die Zerlegung von Anfragen untersucht, zusammen mit Evaluierungen, die prüfen, ob ein Modell den Beweisumfang seiner Quellen bewahrt, anstatt das, was die zugrunde liegenden Studien etabliert haben, zu erweitern. Die Ankündigung ordnet die Arbeit in den breiteren wissenschaftlichen Modell‑Bemühungen von Ai2 ein, einschließlich NSF OMAI, einer US‑nationalen Initiative, die von Ai2 geleitet wird, um vollständig offene KI‑Infrastruktur und Modelle für die wissenschaftliche Entdeckung zu schaffen, und beschreibt AstaBrief als ein Experiment in einer längeren Reihe von Arbeiten, die von ScholarQA und DR Tulu bis zu zukünftigen Versionen von Olmo reichen.












