نماذج ومنصات الذكاء الاصطناعي

Ai2 يفتح المصدر لـ AstaBrief 8B لتوليد تقارير علمية سريعة

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

قال معهد ألين للذكاء الاصطناعي (Ai2) في 2 أكتوبر 2026 إنه يفتح المصدر لـ AstaBrief 8B، وهو نموذج يحول سؤالًا بحثيًا ومقتطفات من الأدبيات المسترجعة إلى تقرير موثق، مُطلقًا أوزان النموذج وبيانات التدريب مع تشغيل النظام كالوضع السريع في Asta، منصته الوكيلة للعمل العلمي.

الوضع السريع في توليد تقارير Asta

يتوفر AstaBrief في ميزة «إنشاء تقرير» في Asta كالوضع السريع، يعمل جنبًا إلى جنب مع وضع التفكير المدعوم من Claude الحالي، وفقًا إعلان Ai2. تقول Ai2 إن هدفها كان اختبار ما إذا كان نموذجًا صغيرًا ومفتوحًا تم تدريبه خصيصًا لتوليد تقارير علمية يمكنه مطابقة جودة التقارير التي تنتجها النماذج المملوكة التي كانت تستخدمها، مع تقليل وقت التوليد وتكاليف الخدمة. تشير تقارير Ai2 إلى أن الوضع السريع يستهلك في المتوسط 51.1 ثانية لكل تقرير عبر خط أنابيب Asta الكامل، مقارنةً بـ 178.5 ثانية لوضع التفكير، وهو فرق توصف بأنه أسرع بحوالي 3.5 أضعاف وتقريبًا تقليل بمقدار مرتبة واحدة في زمن التوليد مقارنةً بالنماذج المملوكة التي تم تتبعها.

تشير بطاقة نموذج AstaBrief 8B إلى أن النموذج مرخص تحت رخصة Apache 2.0، ومبني على Qwen3-8B، ومخصص للاستخدام البحثي والتعليمي وفقًا لإرشادات الاستخدام المسؤول الخاصة بـ Ai2. وبما أن الأوزان مفتوحة، تقول Ai2 إن المؤسسات يمكنها تشغيل النموذج على عتادها الخاص، بما في ذلك خلف جدار الحماية الخاص بها، وهو ما تصفه بأنه ضروري عندما تتعلق أسئلة البحث بأعمال حساسة أو غير منشورة. إلى جانب الأوزان، أصدرت Ai2 سير عمل مثال في مستودعها ai2-scholarqa-lib على GitHub يمكن للباحثين تكييفه لتوليد تقارير من ملفات PDF الخاصة بهم.

بيانات التدريب والتصفية

بدأت Ai2 من Qwen3-8B وبنت AstaBrief باستخدام تحسين دقيق تحت إشراف ثم تحسين التفضيل المباشر (DPO). تقول الإعلان إن الفريق نظر في التدريب القائم على التعلم المعزز، الذي أظهر عمله السابق DR Tulu أنه يمكن أن يحسن توليد التقارير طويلة الشكل للنماذج المفتوحة الوزن، لكنه اختار الوصفة الأبسط لأن تدريب التعلم المعزز قد يكون غير مستقر ومكلف، وكان الفريق يرغب في إعداد أرخص وأسهل في تصحيح الأخطاء والتكرار.

من أجل السرعة، تم تدريب AstaBrief لكتابة التقرير الكامل في خطوة واحدة استنادًا إلى سؤال المستخدم والمقتطفات المسترجعة، متجاوزًا مراحل تلخيص المقتطفات والتجميع التي يستخدمها وضع التفكير المستند إلى Claude وتخطي الكتابة قسمًا بقسم. تقول Ai2 إنها وجدت أن ذلك ممكن دون التضحية بالأداء.

بدأ خط أنابيب التدريب بأسئلة مستخدمين حقيقية تم تقديمها عبر النظام خلف إطار عمل ScholarQA الخاص بـ Ai2، والذي يدعم توليد تقارير Asta. قام الفريق بتصفية السجلات للبحث عن الجودة والملاءمة والخصوصية، وإزالة حركة الاختبار التجريبي والروبوتات، وحذف الأسئلة القصيرة جدًا التي لا تحمل معنى، واستخدام مرور قائم على نموذج لغة كبير لالتقاط الأسئلة غير الإنجليزية، والطلبات غير العلمية، والعبارات التي تحتوي على معلومات شخصية. أدى ذلك إلى ترك مجموعة من 90 ألف سؤال يركز على البحث.

في مرحلة الإشراف، تم إنشاء أهداف تقارير كاملة باستخدام خط أنابيب ScholarQA متعدد الخطوات المدعوم بمزيج من الأنظمة المملوكة: Claude 3.5 Sonnet، Claude 3.7 Sonnet، o3، o4-mini، وGPT-4.1. تركت عملية التصفية النوعية 47 ألف مثال قابل للاستخدام. بالنسبة لـ DPO، جاءت الأزواج من مجموعة فرعية منفصلة من الأسئلة التي لم تُستخدم أثناء توليد بيانات SFT: تقرير واحد من خط أنابيب ScholarQA، عادةً ما يكون مدعومًا بـ Claude 3.5 أو 3.7 Sonnet، مقابل تقرير تم توليده بواسطة o3 أو o4-mini أو DeepSeek-V3 أو DeepSeek-R1. اختارت نماذج التحكيم، GPT-4.1 وDeepSeek-R1، الفائز لكل زوج. تقول Ai2 إن القضاة اتفقوا مع تفضيلات البشر بنسبة 95 بالمائة من الوقت، ولم تُحفظ إلا الأزواج التي اتفق فيها القاضيان، مما أنتج حوالي 6 آلاف مثال نهائي. وفقًا لبطاقة النموذج، تم تهيئة النموذج المُصدر من نقطة تفتيش AstaBrief-8B-SFT وتم تحسينه على مجموعة بيانات AstaBriefDPOمزيج، مع إجراء تدريب DPO في إطار عمل open-instruct الخاص بـ Ai2 على 8×H100 GPUs.

نتائج التقييم

كان الهدف الرئيسي للتطوير لدى Ai2 هو SQABench-CS2، الذي تصفه الإعلان كمجموعة من 200 سؤال بحثي في علوم الحاسوب كتبها المستخدمون. تتبع الفريق أربعة مقاييس: درجة الروبريك، التي تقيس مقدار المحتوى الضروري الذي يغطيه التقرير؛ دقة الإجابة، التي تقيس ما إذا كان كل فقرة ذات صلة بالسؤال؛ دقة الاستشهاد، التي تقيس ما إذا كان كل استشهاد يدعم الادعاء المرتبط به؛ واسترجاع الاستشهاد، الذي يقيس ما إذا كانت ادعاءات التقرير مدعومة بالكامل بالاستشهادات المقدمة. استخدمت التقييمات الثانوية DeepScholarBench، وهو معيار مكوّن من 63 سؤالًا لتجميع أبحاث طويلة الشكل تم بناؤه من أوراق arXiv الحديثة، بالإضافة إلى مقارنات زوجية ضد تقارير من خط أنابيب Claude المدعوم.

تفيد الإعلان أن الفريق اختبر أربعة مرشحات إحصائية على تقارير تدريب اصطناعية: نسبة الرموز الناتجة إلى المدخلة، صلة الاستشهاد، كثافة الاستشهاد، وتنوع الاستشهاد. تقول Ai2 إن أكبر التحسينات جاءت من تصفية التقارير ذات كثافة الاستشهاد المنخفضة، بينما لم تضف المرشحات الأكثر صرامة أو تركيبات المرشحات أو تجارب معدل التعلم أي تحسينات ذات معنى. وتصف الدرس الأوسع كدليل على أن التخصص العلمي ليس بالضرورة مسألة إضافة المزيد من النص العلمي إلى مرحلة ما قبل التدريب، وأن تركيبة وجودة بيانات ما بعد التدريب يمكن أن تغير بشكل جوهري أداء النموذج الناتج.

Ai2 تقول إن نقاط التفتيش المبكرة لتقنية SFT حسّنت جودة المحتوى العامة لكنها لا تزال متأخرة عن خط أنابيب Claude القائم على الدقة في الإجابة وجودة الاستشهاد، وأن مرحلة DPO جلبت AstaBrief إلى نطاق خط أنابيب Claude وDR Tulu في توليد التقارير. تُظهر بطاقة النموذج أنه على مجموعة اختبار ScholarQA‑CS2، حقق AstaBrief‑8B متوسط 87 عبر المقاييس المتتبعة، مقارنةً بـ 83.7 لنقطة تفتيش SFT و77.3 للنسخة الأساسية Qwen3‑8B، حيث سجل AstaBrief‑8B 90.2 في استدعاء المكوّن، 89 في دقة الإجابة، 90.5 في دقة الاستشهاد، و78.2 في استدعاء الاستشهاد. كما تُشير البطاقة إلى نسب الفوز التي قيمتها نماذج اللغة الكبيرة لـ AstaBrief‑8B مقابل خط أنابيب Asta ScholarQA بنسبة 55 ٪ على مجموعة التطوير و72 ٪ على مجموعة الاختبار، وتدرج درجات DeepScholarBench التي بلغت 53.50 لـ AstaBrief‑8B، و60.25 لـ Asta ScholarQA، و56.26 لـ DR‑Tulu‑8B.

في دراسة بشرية منفصلة موصوفة في الإعلان، ساهم ثلاثة باحثين علميين كلٌ منهم بأربعة إلى خمسة أسئلة ضمن مجموعة مكوّنة من 14 سؤالًا، وصنّفوا التقارير الصادرة عن الأنظمة الثلاثة بناءً على التفضيل العام، والاكتمال، والملاءمة، والتنظيم، ودقة الاستشهاد، مع السماح بالتعادل. تشير تقارير Ai2 إلى أن DR Tulu فاز في التفضيل العام، بينما فضل باحثان من الباحثين الثلاثة AstaBrief على الأنظمة الأخرى من حيث دقة الاستشهاد.

تحذر Ai2 من أن معظم عمليات التدريب والتقييم أُجريت في عام 2025، وأن النماذج المملوكة المستخدمة لتوليد بيانات التدريب وتقديم نقاط المقارنة تعكس المستوى المتقدم في ذلك الوقت، وأنها لم تُعيد تشغيل التقييم الكامل مقابل النماذج المتقدمة الحالية.

الاستخدام المبكر والخطوات التالية المعلنة

تشير تقارير Ai2 إلى أنه من بين 374 مستخدمًا لـ Asta جربوا وضع Fast، استخدم 29.1 ٪ منهم هذا الوضع يومين أو أكثر، وأنتج المستخدمون متوسط 3.67 سلسلة تقارير، ولم يعد 23 ٪ منهم إلى وضع Thinking في السلاسل المستقبلية، بينما بدّل 18 ٪ آخرون بين الوضعين حسب أهدافهم، مستخدمين وضع Fast لحوالي 40 ٪ من سلاسلهم. بلغ معدل ردود الفعل الإيجابية 84.2 ٪ لوضع Fast مقابل 85.2 ٪ لوضع Thinking، وهو ما تصفه Ai2 بأنه معدل مشابه مع الإشارة إلى أن ردود الفعل عامةً قليلة جدًا لدعم استنتاجات قوية.

تقول Ai2 إنها تستكشف تعلم تفضيلات أكثر تفصيلاً، ونهج RAG‑plus‑RL أقوى، وقدرات متعددة الأدوار والأدوات، ومصادر بيانات علمية إضافية، وتفكيك الاستعلام، إلى جانب تقييمات تختبر ما إذا كان النموذج يحافظ على نطاق الأدلة في مصادره بدلاً من توسيع ما أظهرته الدراسات الأساسية. يضع الإعلان هذا العمل ضمن جهود Ai2 الأوسع للنماذج العلمية، بما في ذلك NSF OMAI، المبادرة الوطنية الأمريكية التي تقودها Ai2 لبناء بنية تحتية ونماذج ذكاء اصطناعي مفتوحة بالكامل لاكتشاف علمي، ويصف AstaBrief كواحد من التجارب في سلسلة أعمال تمتد من ScholarQA وDR Tulu إلى إصدارات مستقبلية من Olmo.

يُعد Jonas Reeve محللاً مولَّدًا بالذكاء الاصطناعي في Unite.AI، يركز على الذكاء الاصطناعي الإدراكي، والذكاء العام الاصطناعي (AGI)، والأسس النظرية للذكاء الآلي. يستكشف عمله كيفية ظهور التعلم، والتفكير، والذاكرة، والتجريد في كل من الأنظمة البيولوجية والاصطناعية، ربطًا بين بنى الذكاء الاصطناعي الحديثة والأسئلة القديمة في علم النفس الإدراكي وفلسفة العقل.

من خلال نهجٍ مفاهيميٍ وتأملي، يفحص Jonas أطرًا مثل نماذج التفكير، والأنظمة الوكيلة، والإدراك الناشئ، ونظرية التوافق، سعيًا لتوضيح ما يعنيه التقدم نحو الـAGI فعليًا—وما لا يعنيه. بدلاً من مطاردة الجداول الزمنية أو الضجيج، يركز على المبادئ الأولى، والصرامة المفاهيمية، وحدود النماذج الحالية.

المقالات التي كتبها Jonas Reeve مُولَّدة بالذكاء الاصطناعي وتُراجع من قبل فريق التحرير في Unite.AI لضمان الدقة والوضوح والنقاش المسؤول حول مفاهيم الذكاء الاصطناعي المتقدمة.