โมเดลและแพลตฟอร์ม AI
Ai2 เปิดซอร์ส AstaBrief 8B สำหรับการสร้างรายงานวิทยาศาสตร์อย่างรวดเร็ว

สถาบัน Allen สำหรับ AI (Ai2) กล่าวเมื่อวันที่ 2 ตุลาคม 2026 ว่าพวกเขากำลังเปิดซอร์ส AstaBrief 8B โมเดลที่เปลี่ยนคำถามการวิจัยและข้อความสรุปจากวรรณกรรมที่ดึงมาเป็นรายงานที่มีการอ้างอิง พร้อมปล่อยน้ำหนักโมเดลและข้อมูลการฝึกเมื่อระบบเปิดใช้งานในโหมดเร็วใน Asta ซึ่งเป็นแพลตฟอร์มเชิงตัวแทนสำหรับงานวิทยาศาสตร์ของพวกเขา
โหมดเร็วในการสร้างรายงานของ Asta
AstaBrief มีให้ใช้ในฟีเจอร์ Generate a report ของ Asta ในรูปแบบโหมดเร็ว ทำงานคู่กับโหมด Thinking ที่ใช้ Claude อยู่ ตาม ประกาศของ Ai2. Ai2 กล่าวว่าเป้าหมายของพวกเขาคือการทดสอบว่าโมเดลขนาดเล็กแบบเปิดที่ฝึกเฉพาะสำหรับการสร้างรายงานวิทยาศาสตร์สามารถเทียบคุณภาพของรายงานกับโมเดลที่เป็นกรรมสิทธิ์ที่เคยใช้ได้หรือไม่ พร้อมลดเวลาในการสร้างและค่าใช้จ่ายในการให้บริการ. Ai2 รายงานว่าในสายงาน Asta ทั้งหมด โหมดเร็วใช้เวลาเฉลี่ย 51.1 วินาทีต่อรายงาน เทียบกับ 178.5 วินาทีสำหรับโหมด Thinking ซึ่งแตกต่างนี้อธิบายว่าเร็วประมาณ 3.5 เท่าและเป็นการลดเวลาในการสร้างใกล้กับระดับหนึ่งลำดับขนาดเมื่อเทียบกับโมเดลที่เป็นกรรมสิทธิ์ที่ติดตาม
การ์ดโมเดล AstaBrief 8B ระบุว่าโมเดลนี้ได้รับอนุญาตภายใต้ Apache 2.0, มีพื้นฐานมาจาก Qwen3-8B, และมีจุดประสงค์เพื่อการวิจัยและการศึกษา ตามแนวทางการใช้ที่รับผิดชอบของ Ai2. เนื่องจากน้ำหนักโมเดลเป็นแบบเปิด Ai2 กล่าวว่าองค์กรต่าง ๆ สามารถรันโมเดลบนฮาร์ดแวร์ของตนเอง รวมถึงอยู่หลังไฟร์วอลล์ของตน ซึ่งพวกเขาอธิบายว่าเป็นสิ่งจำเป็นเมื่อคำถามการวิจัยเกี่ยวข้องกับงานที่ละเอียดอ่อนหรือยังไม่ได้เผยแพร่. นอกจากนี้ Ai2 ยังปล่อยตัวอย่าง workflow ในคลัง GitHub ai2-scholarqa-lib ของตน ซึ่งนักวิจัยสามารถปรับใช้เพื่อสร้างรายงานจากไฟล์ PDF ของตนเอง
ข้อมูลการฝึกและการกรอง
Ai2 เริ่มจาก Qwen3-8B และสร้าง AstaBrief ด้วยการปรับจูนแบบมีผู้สอนตามด้วย การเพิ่มประสิทธิภาพตามความชอบโดยตรง (DPO). การประกาศระบุว่าทีมได้พิจารณาการฝึกด้วยการเรียนรู้เสริม (reinforcement learning) ซึ่งงาน DR Tulu ก่อนหน้านี้ของพวกเขาแสดงให้เห็นว่าสามารถปรับปรุงการสร้างรายงานรูปแบบยาวสำหรับโมเดลที่เปิดน้ำหนักได้, แต่ทีมเลือกวิธีที่ง่ายกว่าเพราะการฝึก RL อาจไม่เสถียรและมีค่าใช้จ่ายสูง และทีมต้องการการตั้งค่าที่ถูกกว่าและง่ายต่อการดีบักและทำซ้ำ
เพื่อความเร็ว AstaBrief ได้รับการฝึกให้เขียนรายงานเต็มรูปแบบในหนึ่งขั้นตอนจากคำถามของผู้ใช้และข้อความสรุปที่ดึงมา, ข้ามขั้นตอนสรุปข้อความและการจัดกลุ่มที่โหมด Thinking ที่ใช้ Claude ใช้และละเว้นการเขียนเป็นส่วน ๆ. Ai2 กล่าวว่า พวกเขาพบว่าการทำเช่นนี้เป็นไปได้โดยไม่สูญเสียประสิทธิภาพ
สายการฝึกเริ่มต้นด้วยคำถามของผู้ใช้จริงที่ส่งผ่านระบบภายใต้กรอบ ScholarQA ของ Ai2 ซึ่งเป็นพื้นฐานของการสร้างรายงานของ Asta. ทีมได้กรองบันทึกเพื่อคุณภาพ, ความเกี่ยวข้อง, และความเป็นส่วนตัว, โดยลบการทดสอบเบต้าและการจราจรของบอท, ตัดคำถามที่สั้นเกินไปจนไม่มีความหมาย, และใช้กระบวนการตรวจสอบด้วย LLM เพื่อจับคำถามที่ไม่ใช่ภาษาอังกฤษ, คำขอที่ไม่เกี่ยวกับวิทยาศาสตร์, และพรอมต์ที่มีข้อมูลส่วนบุคคล. ผลที่ได้คือคอลเลกชันของคำถามที่มุ่งเน้นการวิจัยจำนวน 90,000 รายการ
สำหรับขั้นตอนที่มีการควบคุม, เป้าหมายรายงานเต็มถูกสร้างด้วยกระบวนการหลายขั้นตอนของ ScholarQA ที่สนับสนุนโดยระบบที่เป็นกรรมสิทธิ์ผสม: Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini, และ GPT-4.1. การกรองคุณภาพทำให้เหลือ 47,000 ตัวอย่างที่ใช้ได้. สำหรับ DPO, คู่ข้อมูลมาจากชุดย่อยของคำถามที่ไม่ได้ใช้ในการสร้างข้อมูล SFT: รายงานหนึ่งจากกระบวนการ ScholarQA ซึ่งโดยทั่วไปสนับสนุนโดย Claude 3.5 หรือ 3.7 Sonnet, เทียบกับรายงานที่สร้างโดย o3, o4-mini, DeepSeek-V3, หรือ DeepSeek-R1. โมเดลผู้ตัดสินสองตัว, GPT-4.1 และ DeepSeek-R1, เลือกผู้ชนะสำหรับแต่ละคู่. Ai2 ระบุว่าผู้ตัดสินสอดคล้องกับความชอบของมนุษย์ใน 95 เปอร์เซ็นต์ของกรณี, และเฉพาะคู่ที่ผู้ตัดสินทั้งสองเห็นด้วยเท่านั้นที่ถูกเก็บไว้, ส่งผลให้ได้ประมาณ 6,000 ตัวอย่างสุดท้าย. ตามบัตรโมเดล, โมเดลที่ปล่อยออกมาถูกเริ่มต้นจากเช็คพอยต์ AstaBrief-8B-SFT และปรับแต่งต่อบนชุดข้อมูล AstaBriefDPOMix, โดยการฝึก DPO ดำเนินการในกรอบงาน open-instruct ของ Ai2 บน GPU 8xH100.
ผลการประเมิน
เป้าหมายการพัฒนาหลักของ Ai2 คือ SQABench-CS2 ซึ่งการประกาศอธิบายว่าเป็นชุดของคำถามการวิจัยด้านคอมพิวเตอร์ไซเอนซ์จำนวน 200 คำถามที่ผู้ใช้เขียนเอง. ทีมติดตามสี่เมตริก: คะแนนรูบริกที่วัดว่ารายงานครอบคลุมเนื้อหาที่จำเป็นเท่าใด; ความแม่นยำของคำตอบที่วัดว่าทุกย่อหน้ามีความเกี่ยวข้องกับคำถามหรือไม่; ความแม่นยำของการอ้างอิงที่วัดว่าการอ้างอิงแต่ละรายการสนับสนุนข้ออ้างที่แนบมาหรือไม่; และการเรียกคืนการอ้างอิงที่วัดว่าข้ออ้างของรายงานได้รับการสนับสนุนอย่างเต็มที่จากการอ้างอิงที่ให้ไว้. การประเมินรองใช้ DeepScholarBench, เกณฑ์มาตรฐาน 63 คำถามสำหรับการสังเคราะห์การวิจัยรูปแบบยาวที่สร้างจากเอกสาร arXiv ล่าสุด, พร้อมการเปรียบเทียบแบบคู่กับรายงานจากสายงานที่ใช้ Claude
การประกาศระบุว่าทีมได้ทดสอบตัวกรองสี่แบบที่อิงสถิติบนรายงานการฝึกสังเคราะห์: อัตราส่วนโทเค็นผลลัพธ์ต่ออินพุต, ความเกี่ยวข้องของการอ้างอิง, ความหนาแน่นของการอ้างอิง, และความหลากหลายของการอ้างอิง. Ai2 กล่าวว่า การเพิ่มประสิทธิภาพที่แข็งแกร่งที่สุดมาจากการกรองรายงานที่มีความหนาแน่นของการอ้างอิงต่ำ, ในขณะที่การกรองที่เข้มข้นมากขึ้น, การผสมผสานตัวกรอง, และการสแกนอัตราการเรียนรู้ไม่ให้ผลลัพธ์ที่มีนัยสำคัญ. พวกเขาอธิบายบทเรียนที่กว้างขึ้นว่าเป็นหลักฐานว่าการเชี่ยวชาญด้านวิทยาศาสตร์ไม่ได้จำเป็นต้องเพิ่มข้อความวิทยาศาสตร์มากขึ้นในการฝึกล่วงหน้า, และว่าการจัดองค์ประกอบและคุณภาพของข้อมูลหลังการฝึกสามารถเปลี่ยนแปลงการทำงานของโมเดลที่ได้อย่างมีนัยสำคัญ
Ai2 กล่าวว่า checkpoint SFT ขั้นต้นได้ปรับปรุงคุณภาพเนื้อหาโดยรวม แต่ยังคงตามหลัง pipeline ที่ใช้ Claude ในด้านความแม่นยำของคำตอบและคุณภาพการอ้างอิง และว่าขั้นตอน DPO ทำให้ AstaBrief อยู่ในระดับเดียวกับ pipeline ของ Claude และ DR Tulu ในการสร้างรายงาน การ์ดโมเดลระบุว่าในชุดทดสอบ ScholarQA‑CS2, AstaBrief‑8B มีค่าเฉลี่ย 87 ในเมตริกที่ติดตาม เปรียบเทียบกับ 83.7 สำหรับ checkpoint SFT และ 77.3 สำหรับ Qwen3‑8B รุ่นฐาน โดย AstaBrief‑8B ได้คะแนน 90.2 ในการเรียกคืนส่วนผสม, 89 ในความแม่นยำของคำตอบ, 90.5 ในความแม่นยำของการอ้างอิง, และ 78.2 ในการเรียกคืนการอ้างอิง การ์ดยังรายงานอัตราการชนะที่ประเมินโดย LLM สำหรับ AstaBrief‑8B เมื่อเทียบกับ pipeline Asta ScholarQA คือ 55 เปอร์เซ็นต์ในส่วนพัฒนาการและ 72 เปอร์เซ็นต์ในส่วนทดสอบ, และระบุคะแนน DeepScholarBench ของ 53.50 สำหรับ AstaBrief‑8B, 60.25 สำหรับ Asta ScholarQA, และ 56.26 สำหรับ DR‑Tulu‑8B.
ในการศึกษามนุษย์แยกต่างหากที่อธิบายไว้ในประกาศ, นักวิจัยวิทยาศาสตร์สามคนแต่ละคนได้ให้คำถามสี่ถึงห้าข้อจากชุดคำถาม 14 ข้อและจัดอันดับรายงานจากระบบทั้งสามตามความชอบโดยรวม, ความครบถ้วน, ความเกี่ยวข้อง, การจัดระเบียบ, และความแม่นยำของการอ้างอิง โดยอนุญาตให้มีการเท่ากันได้ Ai2 รายงานว่า DR Tulu ชนะในด้านความชอบโดยรวม, ในขณะที่นักวิจัยสองคนจากสามคนเลือก AstaBrief มากกว่าระบบอื่นในด้านความแม่นยำของการอ้างอิง.
Ai2 เตือนว่าการฝึกและการประเมินส่วนใหญ่เสร็จสิ้นในปี 2025, โมเดลที่เป็นกรรมสิทธิ์ที่ใช้สร้างข้อมูลการฝึกและเป็นจุดเปรียบเทียบสะท้อนถึงระดับความก้าวหน้าขณะนั้น, และว่าพวกเขายังไม่ได้ทำการประเมินเต็มรูปแบบอีกครั้งกับโมเดลระดับแนวหน้าปัจจุบัน.
การใช้งานเบื้องต้นและขั้นตอนต่อไปที่ระบุ
Ai2 รายงานว่าในผู้ใช้ Asta จำนวน 374 คนที่เคยลองโหมด Fast, 29.1 เปอร์เซ็นต์ใช้โหมดนี้สองวันหรือมากกว่า, ผู้ใช้สร้างเธรดรายงานโดยเฉลี่ย 3.67 เธรด, 23 เปอร์เซ็นต์ไม่เคยกลับไปใช้โหมด Thinking สำหรับเธรดในอนาคต, และอีก 18 เปอร์เซ็นต์สลับโหมดตามเป้าหมายของตน, ใช้โหมด Fast ประมาณ 40 เปอร์เซ็นต์ของเธรดทั้งหมด ความคิดเห็นเชิงบวกอยู่ที่ 84.2 เปอร์เซ็นต์สำหรับโหมด Fast เทียบกับ 85.2 เปอร์เซ็นต์สำหรับโหมด Thinking, ซึ่ง Ai2 ระบุว่าอัตรานี้ใกล้เคียงกัน แม้ว่าจะสังเกตว่าข้อมูลความคิดเห็นโดยทั่วไปค่อนข้างน้อยเกินกว่าจะสรุปได้อย่างแน่นหนา.
Ai2 กล่าวว่า พวกเขากำลังสำรวจการเรียนรู้ความชอบที่ละเอียดมากขึ้น, วิธีการ RAG‑plus‑RL ที่แข็งแกร่งกว่า, ความสามารถหลายรอบและหลายเครื่องมือ, แหล่งข้อมูลวิทยาศาสตร์เพิ่มเติม, และการแยกย่อยคำถาม, พร้อมกับการประเมินที่ทดสอบว่ารุ่นหนึ่งสามารถรักษาขอบเขตของหลักฐานจากแหล่งข้อมูลของมันได้หรือไม่ แทนที่จะขยายขอบเขตที่การศึกษาเดิมกำหนด ประกาศนี้วางงานไว้ในความพยายามของ Ai2 ด้านโมเดลวิทยาศาสตร์ที่กว้างขึ้น, รวมถึง NSF OMAI, โครงการระดับชาติของสหรัฐที่นำโดย Ai2 เพื่อสร้างโครงสร้างพื้นฐานและโมเดล AI ที่เปิดเผยเต็มรูปแบบสำหรับการค้นคว้าวิจัย, และอธิบายว่า AstaBrief เป็นหนึ่งในหลาย ๆ การทดลองในสายงานที่ต่อเนื่องตั้งแต่ ScholarQA และ DR Tulu ไปจนถึงเวอร์ชัน Olmo ในอนาคต.












