Modely a platformy AI
Ai2 zveřejňuje AstaBrief 8B pro rychlé vytváření vědeckých zpráv

Institut Allen pro umělou inteligenci (Ai2) uvedl dne 2. října 2026, že zveřejňuje AstaBrief 8B, model, který převádí výzkumnou otázku a získané úryvky z literatury na citovanou zprávu, a že uvolní váhy modelu i tréninková data, když systém spustí v režimu Fast v Asta, jeho agentické platformě pro vědeckou práci.
Rychlý režim ve generování zpráv v Asta
AstaBrief je k dispozici ve funkci Generovat zprávu v Asta jako Fast režim, běžící vedle stávajícího Thinking režimu poháněného Claude, podle oznámení Ai2. Ai2 uvádí, že jejím cílem bylo otestovat, zda malý otevřený model speciálně trénovaný pro tvorbu vědeckých zpráv může dosáhnout kvality zpráv srovnatelné s proprietárními modely, které dosud používala, a zároveň snížit dobu generování a náklady na služby. Ai2 uvádí, že v celém pipeline Asta je průměrná doba Fast režimu 51,1 s na zprávu oproti 178,5 s u Thinking režimu, což popisuje jako zhruba 3,5‑násobně rychlejší a téměř desetinásobné snížení doby generování ve srovnání s sledovanými proprietárními modely.
karta modelu AstaBrief 8B uvádí, že model je licencován pod Apache 2.0, je založen na Qwen3-8B a je určen pro výzkumné a vzdělávací účely v souladu s Pravidly odpovědného užívání Ai2. Protože jsou váhy otevřené, Ai2 uvádí, že instituce mohou model spouštět na svém vlastním hardwaru, včetně za vlastním firewallem, což popisuje jako nezbytné, když výzkumné otázky zasahují do citlivých nebo nepublikovaných prací. Vedle vah Ai2 zveřejnil ukázkový pracovní postup ve svém úložišti ai2-scholarqa-lib na GitHubu, který výzkumníci mohou přizpůsobit k vytváření zpráv z vlastních PDF souborů.
Tréninková data a filtrování
Ai2 začal s Qwen3-8B a vytvořil AstaBrief pomocí supervizovaného doladění následovaného přímou optimalizací preferencí (DPO). Oznámení uvádí, že tým zvažoval trénink založený na posilovacím učení, o čemž jeho dřívější práce DR Tulu ukázala, že může zlepšit generování dlouhých zpráv u modelů s otevřenými váhami, ale zvolil jednodušší postup, protože trénink RL může být nestabilní a nákladný a tým chtěl řešení levnější a snadněji laditelné.
Pro rychlost byl AstaBrief trénován tak, aby celý report napsal v jednom průchodu z uživatelské otázky a získaných úryvků, obcházel fáze sumarizace úryvků a shlukování, které používá režim Thinking založený na Claude, a vynechal psaní po jednotlivých sekcích. Ai2 uvádí, že zjistil, že je to možné bez ústupu v výkonu.
Tréninková pipeline začala skutečnými uživatelskými dotazy odeslanými přes systém za rámcem ScholarQA od Ai2, který podkládá generování zpráv v Asta. Tým filtroval logy z hlediska kvality, relevance a soukromí, odstraňoval provoz od beta-testérů a botů, vyřazoval dotazy příliš krátké na to, aby byly smysluplné, a pomocí průchodu založeného na LLM zachytával neanglické dotazy, ne‑vědecké požadavky a výzvy obsahující osobní údaje. Výsledkem byl fond 90 000 výzkumně zaměřených dotazů.
Pro dozorovanou fázi byly cílové plné zprávy vytvořeny pomocí vícefázového kanálu ScholarQA, podpořeného kombinací proprietárních systémů: Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini a GPT‑4.1. Po filtrování kvality zůstalo 47 000 použivatelných příkladů. Pro DPO pocházely páry ze samostatné podmnožiny dotazů, které nebyly použity při generování dat pro SFT: jedna zpráva z kanálu ScholarQA, obvykle podpořená Claude 3.5 nebo 3.7 Sonnet, proti zprávě vytvořené o3, o4-mini, DeepSeek‑V3 nebo DeepSeek‑R1. Dva hodnotící modely, GPT‑4.1 a DeepSeek‑R1, vybraly vítěze pro každý pár. Ai2 uvádí, že hodnotitelé souhlasili s lidskými preferencemi v 95 procentech případů a pouze páry, na nichž oba hodnotitelé souhlasili, byly zachovány, což vedlo k asi 6 000 finálním příkladům. Podle modelové karty byl vydaný model inicializován z kontrolního bodu AstaBrief‑8B‑SFT a doladěn na dataset AstaBriefDPOMix, přičemž trénink DPO probíhal v rámci otevřeného instrukčního prostředí Ai2 na 8 xH100 GPU.
Výsledky hodnocení
Hlavním vývojovým cílem Ai2 byl SQABench‑CS2, který oznámení popisuje jako soubor 200 uživateli psaných výzkumných otázek z informatiky. Tým sledoval čtyři metriky: skóre rubriky, které měří, kolik nezbytného obsahu zpráva pokrývá; přesnost odpovědí, která měří, zda je každý odstavec relevantní k otázce; přesnost citací, která měří, zda každá citace podporuje přidružené tvrzení; a úplnost citací, která měří, zda jsou tvrzení zprávy plně podložena poskytnutými citacemi. Sekundární hodnocení využívala DeepScholarBench, benchmark s 63 dotazy pro dlouhou formu výzkumné syntézy postavený na nedávných arXiv pracích, plus párové srovnání se zprávami z pipeline poháněné Claude.
Oznámení uvádí, že tým testoval čtyři statistické filtry na syntetických tréninkových zprávách: poměr tokenů výstup/vstup, relevance citací, hustotu citací a rozmanitost citací. Ai2 říká, že největší zisky přišly filtrováním zpráv s nízkou hustotou citací, zatímco agresivnější filtrování, kombinace filtrů a prohledávání učebních rychlostí nepřinesly žádné významné zlepšení. Popisuje širší ponaučení jako důkaz toho, že vědecká specializace není nutně otázkou přidání více vědeckého textu do předtréninku, a že složení a kvalita dat po tréninku mohou podstatně ovlivnit výkon výsledného modelu.
Ai2 uvádí, že rané kontrolní body SFT zlepšily celkovou kvalitu obsahu, ale stále zaostávaly za pipeline poháněnou Claude co se týče přesnosti odpovědí a kvality citací, a že fáze DPO přivedla AstaBrief do úrovně pipeline Claude a DR Tulu při generování zpráv. Modelová karta uvádí, že na testové sadě ScholarQA‑CS2 dosáhl AstaBrief‑8B průměru 87 napříč sledovanými metrikami, oproti 83.7 pro kontrolní bod SFT a 77.3 pro základní Qwen3‑8B, přičemž AstaBrief‑8B získal 90.2 v připomenutí ingrediencí, 89 v přesnosti odpovědí, 90.5 v přesnosti citací a 78.2 v připomenutí citací. Karta také uvádí, že LLM‑hodnocené míry výher pro AstaBrief‑8B proti pipeline Asta ScholarQA jsou 55 % na vývojovém rozdělení a 72 % na testovacím rozdělení, a uvádí skóre DeepScholarBench: 53.50 pro AstaBrief‑8B, 60.25 pro Asta ScholarQA a 56.26 pro DR‑Tulu‑8B.
V samostatné lidské studii popsané v oznámení se tři vědci podíleli na vytvoření čtyř až pěti otázek v rámci sady 14 otázek a hodnotili zprávy ze tří systémů podle celkové preference, úplnosti, relevance, organizace a přesnosti citací, přičemž byly povoleny remízy. Ai2 uvádí, že DR Tulu vyhrál v celkové preferenci, zatímco dva ze tří výzkumníků upřednostnili AstaBrief před ostatními systémy v přesnosti citací.
Ai2 upozorňuje, že většina tréninku a hodnocení byla dokončena v roce 2025, že proprietární modely použité k vytvoření tréninkových dat a jako srovnávací body odrážely tehdejší špičku, a že plné hodnocení proti současným špičkovým modelům nebylo znovu provedeno.
Počáteční používání a uvedené další kroky
Ai2 uvádí, že mezi 374 uživateli Asta, kteří vyzkoušeli režim Fast, 29.1 % jej použilo dva nebo více dní, uživatelé vytvořili v průměru 3.67 vlákna zpráv, 23 % se nikdy nevrátilo do režimu Thinking u budoucích vláken a dalších 18 % střídalo režimy podle svých cílů, přičemž režim Fast byl používán zhruba u 40 % jejich vláken. Pozitivní zpětná vazba dosáhla 84.2 % pro režim Fast oproti 85.2 % pro režim Thinking, což Ai2 charakterizuje jako podobnou míru a poznamenává, že zpětná vazba je obecně příliš řídká na to, aby podporovala silné závěry.
Ai2 uvádí, že zkoumá podrobnější učení preferencí, silnější přístupy RAG‑plus‑RL, schopnosti víceotáčkových a více‑nástrojových interakcí, další vědecké zdroje dat a rozklad dotazů, spolu s hodnoceními, která testují, zda model zachovává důkazový rozsah svých zdrojů místo rozšiřování toho, co původní studie stanovily. Oznámení umisťuje tuto práci do širšího kontextu vědeckých modelových aktivit Ai2, včetně NSF OMAI, americké národní iniciativy vedené Ai2 s cílem vytvořit zcela otevřenou AI infrastrukturu a modely pro vědecký objev, a popisuje AstaBrief jako jeden experiment v delší řadě prací sahajících od ScholarQA a DR Tulu po budoucí verze Olmo.












