एआई मॉडल और प्लेटफ़ॉर्म
Ai2 ने तेज़ वैज्ञानिक रिपोर्ट निर्माण के लिए AstaBrief 8B को ओपन-सोर्स किया

Allen Institute for AI (Ai2) ने 2 अक्टूबर 2026 को कहा कि वह AstaBrief 8B को ओपन-सोर्स कर रहा है, जो एक मॉडल है जो शोध प्रश्न और प्राप्त साहित्य अंशों को उद्धृत रिपोर्ट में बदलता है, और मॉडल वज़न तथा प्रशिक्षण डेटा जारी कर रहा है क्योंकि यह प्रणाली Asta में Fast mode के रूप में लाइव हो रही है, जो वैज्ञानिक कार्य के लिए उसका एजेंटिक प्लेटफ़ॉर्म है।
Asta की रिपोर्ट निर्माण में Fast Mode
AstaBrief Asta के “Generate a report” फीचर में Fast mode के रूप में उपलब्ध है, जो मौजूदा Claude-शक्तिशाली Thinking mode के साथ चल रहा है, Ai2 की घोषणा के अनुसार। Ai2 कहता है कि इसका लक्ष्य यह परीक्षण करना था कि क्या एक छोटा, ओपन मॉडल जो विशेष रूप से वैज्ञानिक रिपोर्ट निर्माण के लिए प्रशिक्षित है, वह उन स्वामित्व वाले मॉडलों की रिपोर्ट गुणवत्ता से मेल खा सकता है जिन्हें वह उपयोग कर रहा था, साथ ही निर्माण समय और सेवा लागत को कम कर सकता है। Ai2 रिपोर्ट करता है कि पूरी Asta पाइपलाइन में, Fast mode औसतन 51.1 सेकंड प्रति रिपोर्ट लेता है, जबकि Thinking mode 178.5 सेकंड लेता है, यह अंतर लगभग 3.5 गुना तेज़ और स्वामित्व वाले मॉडलों की तुलना में निर्माण समय में लगभग एक क्रम magnitude की कमी के रूप में वर्णित किया गया है।
AstaBrief 8B मॉडल कार्ड बताता है कि मॉडल Apache 2.0 के तहत लाइसेंस प्राप्त है, Qwen3-8B पर आधारित है, और Ai2 के जिम्मेदार उपयोग दिशानिर्देशों के तहत शोध और शैक्षिक उपयोग के लिए अभिप्रेत है। क्योंकि वज़न ओपन हैं, Ai2 कहता है कि संस्थाएँ मॉडल को अपने स्वयं के हार्डवेयर पर चला सकती हैं, जिसमें अपने फ़ायरवॉल के पीछे चलाना शामिल है, जिसे वह संवेदनशील या अप्रकाशित कार्यों से संबंधित शोध प्रश्नों के मामले में आवश्यक बताता है। वज़नों के साथ, Ai2 ने अपने ai2-scholarqa-lib GitHub रिपॉज़िटरी में एक उदाहरण कार्यप्रवाह जारी किया है जिसे शोधकर्ता अपने PDFs से रिपोर्ट बनाने के लिए अनुकूलित कर सकते हैं।
प्रशिक्षण डेटा और फ़िल्टरिंग
Ai2 ने Qwen3-8B से शुरुआत की और AstaBrief को सुपरवाइज़्ड फाइन-ट्यूनिंग के बाद प्रत्यक्ष प्राथमिकता अनुकूलन (DPO) के साथ बनाया। घोषणा में कहा गया है कि टीम ने रिइन्फोर्समेंट-लर्निंग-आधारित प्रशिक्षण पर विचार किया, जिसे उनके पहले के DR Tulu कार्य ने दिखाया था कि ओपन-वेट्स मॉडलों के लिए लंबी रिपोर्ट निर्माण में सुधार कर सकता है, लेकिन उन्होंने सरल विधि चुनी क्योंकि RL प्रशिक्षण अस्थिर और महंगा हो सकता है और टीम एक ऐसी सेटअप चाहती थी जो सस्ता और डिबग व इटरेट करने में आसान हो।
गति के लिए, AstaBrief को उपयोगकर्ता प्रश्न और प्राप्त अंशों से एक ही पास में पूरी रिपोर्ट लिखने के लिए प्रशिक्षित किया गया, जिससे Claude-आधारित Thinking mode द्वारा उपयोग किए जाने वाले अंश-सारांश और क्लस्टरिंग चरणों को बायपास किया गया और सेक्शन-बाय-सेक्शन लेखन को छोड़ दिया गया। Ai2 कहता है कि उन्होंने पाया कि यह प्रदर्शन से समझौता किए बिना संभव था।
प्रशिक्षण पाइपलाइन की शुरुआत वास्तविक उपयोगकर्ता प्रश्नों से हुई जो Ai2 के ScholarQA फ्रेमवर्क के पीछे प्रणाली के माध्यम से सबमिट किए गए, जो Asta की रिपोर्ट निर्माण को आधार प्रदान करता है। टीम ने लॉग को गुणवत्ता, प्रासंगिकता और गोपनीयता के लिए फ़िल्टर किया, बीटा-टेस्टर और बॉट ट्रैफ़िक को हटाया, अर्थपूर्ण न होने वाले बहुत छोटे प्रश्नों को छोड़ दिया, और एक LLM-आधारित पास का उपयोग करके गैर-अंग्रेज़ी प्रश्नों, गैर-वैज्ञानिक अनुरोधों, और व्यक्तिगत जानकारी वाले प्रॉम्प्ट को पकड़ा। इससे 90K शोध-केंद्रित प्रश्नों का पूल बचा।
सुपरवाइज़्ड चरण के लिए, पूर्ण-रिपोर्ट लक्ष्य मल्टी-स्टेप ScholarQA पाइपलाइन के साथ उत्पन्न किए गए, जो स्वामित्व वाले सिस्टमों के मिश्रण से समर्थित थे: Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini, और GPT-4.1। गुणवत्ता फ़िल्टरिंग ने 47K उपयोगी उदाहरण छोड़े। DPO के लिए, जोड़े एक अलग उपसमुच्चय के प्रश्नों से आए जो SFT डेटा जनरेशन के दौरान उपयोग नहीं किए गए थे: एक रिपोर्ट ScholarQA पाइपलाइन से, आमतौर पर Claude 3.5 या 3.7 Sonnet द्वारा समर्थित, और एक रिपोर्ट o3, o4-mini, DeepSeek-V3, या DeepSeek-R1 द्वारा उत्पन्न। दो जज मॉडल, GPT-4.1 और DeepSeek-R1, प्रत्येक जोड़े के लिए विजेता चुनते हैं। Ai2 कहता है कि जज 95 प्रतिशत समय मानव प्राथमिकताओं से सहमत थे, और केवल वे जोड़े जिनमें दोनों जज सहमत हुए रखे गए, जिससे लगभग 6K अंतिम उदाहरण बने। मॉडल कार्ड के अनुसार, जारी किया गया मॉडल AstaBrief-8B-SFT चेकपॉइंट से प्रारंभ किया गया था और AstaBriefDPOMix डेटासेट पर फाइन-ट्यून किया गया, जहाँ DPO प्रशिक्षण Ai2 के open-instruct फ्रेमवर्क में 8xH100 GPUs पर किया गया।
मूल्यांकन परिणाम
Ai2 का मुख्य विकास लक्ष्य SQABench-CS2 था, जिसे घोषणा में 200 उपयोगकर्ता-लिखित कंप्यूटर विज्ञान शोध प्रश्नों के सेट के रूप में वर्णित किया गया है। टीम ने चार मीट्रिक ट्रैक किए: रूब्रिक स्कोर, जो मापता है कि रिपोर्ट कितनी आवश्यक सामग्री को कवर करती है; उत्तर सटीकता, जो मापती है कि प्रत्येक पैराग्राफ प्रश्न के लिए प्रासंगिक है या नहीं; उद्धरण सटीकता, जो मापती है कि प्रत्येक उद्धरण उस दावे का समर्थन करता है या नहीं; और उद्धरण रिकॉल, जो मापता है कि रिपोर्ट के दावे प्रदान किए गए उद्धरणों द्वारा पूरी तरह समर्थित हैं या नहीं। द्वितीयक मूल्यांकन में DeepScholarBench का उपयोग किया गया, जो हाल के arXiv पेपरों से निर्मित 63-प्रश्न बेंचमार्क है लंबी-रूप शोध संश्लेषण के लिए, साथ ही Claude-शक्तिशाली पाइपलाइन की रिपोर्टों के विरुद्ध युग्म तुलना।
घोषणा में बताया गया है कि टीम ने सिंथेटिक प्रशिक्षण रिपोर्टों पर चार सांख्यिकीय-आधारित फ़िल्टरों का परीक्षण किया: आउटपुट-टू-इनपुट टोकन अनुपात, उद्धरण प्रासंगिकता, उद्धरण घनत्व, और उद्धरण विविधता। Ai2 कहता है कि सबसे बड़े लाभ कम उद्धरण घनत्व वाली रिपोर्टों को फ़िल्टर करने से मिले, जबकि अधिक आक्रामक फ़िल्टरिंग, फ़िल्टर संयोजन, और लर्निंग-रेट स्विप्स ने कोई महत्वपूर्ण लाभ नहीं जोड़ा। यह व्यापक सीख को इस तरह प्रस्तुत करता है कि वैज्ञानिक विशेषज्ञता अनिवार्य रूप से प्री-ट्रेनिंग में अधिक वैज्ञानिक पाठ जोड़ने का मामला नहीं है, और पोस्ट-ट्रेनिंग डेटा की संरचना और गुणवत्ता परिणामस्वरूप मॉडल के प्रदर्शन को महत्वपूर्ण रूप से बदल सकती है।
Ai2 कहता है कि शुरुआती SFT checkpoints ने समग्र सामग्री गुणवत्ता में सुधार किया, लेकिन उत्तर सटीकता और उद्धरण गुणवत्ता में Claude‑संचालित पाइपलाइन से अभी भी पीछे रहे, और DPO चरण ने AstaBrief को Claude पाइपलाइन और DR Tulu के रिपोर्ट निर्माण के दायरे में ला दिया। मॉडल कार्ड रिपोर्ट करता है कि ScholarQA‑CS2 परीक्षण सेट पर, AstaBrief‑8B ने ट्रैक किए गए मेट्रिक्स में औसत 87 अंक प्राप्त किए, जबकि SFT checkpoint के लिए 83.7 और बेस Qwen3‑8B के लिए 77.3 अंक थे, और AstaBrief‑8B ने सामग्री पुनःस्मरण पर 90.2, उत्तर सटीकता पर 89, उद्धरण सटीकता पर 90.5, तथा उद्धरण पुनःस्मरण पर 78.2 अंक हासिल किए। कार्ड यह भी बताता है कि AstaBrief‑8B के खिलाफ Asta ScholarQA पाइपलाइन के लिए LLM‑आधारित जीत दर विकास विभाजन में 55 प्रतिशत और परीक्षण विभाजन में 72 प्रतिशत थी, और DeepScholarBench स्कोर क्रमशः AstaBrief‑8B के लिए 53.50, Asta ScholarQA के लिए 60.25, तथा DR‑Tulu‑8B के लिए 56.26 दर्शाता है।
घोषणा में वर्णित एक अलग मानव अध्ययन में, तीन वैज्ञानिक शोधकर्ताओं ने प्रत्येक चार से पाँच प्रश्न 14‑प्रश्न सेट में योगदान किए और तीन सिस्टमों की रिपोर्टों को समग्र पसंद, पूर्णता, प्रासंगिकता, संगठन और उद्धरण सटीकता के आधार पर रैंक किया, जहाँ टाई की अनुमति थी। Ai2 रिपोर्ट करता है कि DR Tulu ने समग्र पसंद में जीत हासिल की, जबकि तीन में से दो शोधकर्ताओं ने उद्धरण सटीकता के मामले में अन्य सिस्टमों की तुलना में AstaBrief को अधिक पसंद किया।
Ai2 चेतावनी देता है कि अधिकांश प्रशिक्षण और मूल्यांकन 2025 में पूरा किया गया था, उपयोग किए गए स्वामित्व वाले मॉडल जो प्रशिक्षण डेटा उत्पन्न करते हैं और तुलना बिंदु के रूप में कार्य करते हैं उस समय की सीमा को दर्शाते हैं, और यह वर्तमान सीमा मॉडल के खिलाफ पूरी मूल्यांकन को पुनः नहीं चलाया है।
प्रारंभिक उपयोग और घोषित अगले कदम
Ai2 रिपोर्ट करता है कि 374 Asta उपयोगकर्ताओं में से जिन्होंने Fast मोड आज़माया, 29.1 प्रतिशत ने इसे दो या अधिक दिनों तक उपयोग किया, उपयोगकर्ताओं ने औसतन 3.67 रिपोर्ट थ्रेड बनाए, 23 प्रतिशत ने भविष्य के थ्रेड के लिए कभी Thinking मोड पर वापस नहीं बदला, और अतिरिक्त 18 प्रतिशत ने अपने लक्ष्यों के अनुसार मोड बदलते रहे, लगभग 40 प्रतिशत थ्रेड के लिए Fast मोड का उपयोग किया। Fast मोड के लिए सकारात्मक प्रतिक्रिया 84.2 प्रतिशत थी, जबकि Thinking मोड के लिए 85.2 प्रतिशत, जिसे Ai2 समान दर के रूप में वर्णित करता है, यह नोट करते हुए कि प्रतिक्रिया सामान्यतः बहुत कम है जिससे मजबूत निष्कर्ष निकालना कठिन है।
Ai2 कहता है कि वह अधिक सूक्ष्म पसंद सीखने, मजबूत RAG‑plus‑RL दृष्टिकोण, बहु‑टर्न और बहु‑टूल क्षमताओं, अतिरिक्त वैज्ञानिक डेटा स्रोतों और क्वेरी विभाजन की खोज कर रहा है, साथ ही ऐसे मूल्यांकन जो यह परीक्षण करें कि मॉडल अपने स्रोतों की प्रमाणिक सीमा को बनाए रखता है या मूल अध्ययनों द्वारा स्थापित दायरे को विस्तारित करता है। घोषणा इस कार्य को Ai2 के व्यापक वैज्ञानिक‑मॉडल प्रयासों के भीतर रखती है, जिसमें NSF OMAI, एक अमेरिकी राष्ट्रीय पहल शामिल है जिसे Ai2 ने वैज्ञानिक खोज के लिए पूरी तरह खुला AI बुनियादी ढांचा और मॉडल बनाने के लिए नेतृत्व किया है, और AstaBrief को ScholarQA और DR Tulu से लेकर भविष्य के Olmo संस्करणों तक चलने वाली लंबी श्रृंखला के एक प्रयोग के रूप में वर्णित किया गया है।












