نماذج ومنصات الذكاء الاصطناعي
Reflection AI تكشف عن Beam، نموذج وزن مفتوح ب501 مليار معلمة

Reflection AI قدّم Beam في 5 أكتوبر 2026، وهو أول نموذج وزن مفتوح له: نظام خفيف من نوع مزيج الخبراء يحتوي على 501 مليار معلمة إجمالية و23 مليار نشطة، صُمم للبرمجة، والاستدلال، وأعباء عمل وكيلة.
Beam يخضع الآن لاختبارات الأحمر النهائية والتقييمات، ويتم تقديم نسخة مبكرة لمجموعة مختارة من المستخدمين عبر قائمة انتظار. وصفت Reflection Beam بأنه النموذج الأول في سلسلة وقالت إنه يجري بالفعل تدريب ما سيأتي لاحقًا.
ادعاءات القدرة والكفاءة
قالت Reflection إنها دربت Beam مع تركيز خاص على البرمجة وأداء الوكالة. وصفت الشركة النموذج بأنه منافس للنماذج المفتوحة الأكبر مثل GLM 5.2 وكأنه يقترب من Qwen 3.8-Max في مهام البرمجة والوكالة، مع الاعتراف بأن Kimi K3 لا يزال متقدمًا في القدرة الخام؛ وصفت ميزة Beam بأنها كفاءة زمن الاستدلال وقالت إن النموذج يدفع ما تسميه الجبهة الغربية للوزن المفتوح إلى الأمام.
تشمل الدرجات التي أفصحت عنها Reflection في مجموعة تقييمها 80.1 على Terminal Bench v2.1، 80.9 على SWEBench Verified، 77.2 على SWE Bench Pro v2-Hard، 97.8 على AIME 2026، 36.2 على Humanity’s Last Exam بدون أدوات، و90.5 على GPQA Diamond.
فيما يتعلق بالكفاءة، أفادت الشركة أن Beam يحقق درجات مماثلة لـ GLM-5.2 في معايير الاستدلال المتقدمة بينما يستخدم ثلاثة إلى أربعة أضعاف أقل من حساب الاستدلال، مع مكاسب أكبر مقابل النماذج التي تتجاوز معلماتها تريليونين، مثل Qwen 3.8-Max. ووفقًا للمنشور، تستند التقديرات إلى بيانات Artificial Analysis وDataCurve وتقرب حساب التوليد بأنه يساوي ضعف عدد المعلمات النشطة مضروبًا في متوسط الرموز المولدة لكل محاولة؛ وبما أن الأرقام لا تشمل ملء المطالبة الأولية، وعمليات الانتباه، وتكاليف الخدمة، وصفت Reflection هذه الأرقام بأنها مقارنة حسابية تقريبية بدلاً من تكلفة استدلال مقاسة.
قالت Reflection إنها دربت Beam أيضًا بعقوبة طول قابلة للتحكم تكافئ الحلول الناجحة بينما تثبط الرموز غير الضرورية، وأن معلمة جهد الاستدلال الموجهة للمستخدم تسمح للمستخدمين بمقايضة استخدام الرموز مقابل الأداء، حيث تفضّل الإعدادات المنخفضة الردود الأقصر وتسمح الإعدادات الأعلى باستدلال أطول في المهام الصعبة.
تُفيد الإعلان أن القدرات تعمم إلى ما بعد مزيج التدريب: خلال التعلم المعزز على الاستدلال، والهندسة البرمجية، والمهام الطرفية، تحسّن أداء التصفح رغم عدم وجود مهام تصفح، ومع إمكانية الوصول إلى الويب تعلم النموذج بمفرده استعلام نماذج لغوية كبيرة أخرى واستخدام واجهات برمجة تطبيقات OCR لقراءة المستندات. تشمل العروض خريطة مترو مدينة نيويورك محدثة مباشرة مبنية على بيانات MTA العامة، ولعبة رائد فضاء ثلاثية الأبعاد مكتوبة بـ p5.js، ولغز أرض أو ماء حيث صنّف Beam نقاطًا على شبكة إحداثيات عالمية مكوّنة من 16,200 نقطة بتغطية 95.5٪، وهو نتيجة يضعها المنشور بين Opus 5 بنسبة 92.5٪ وFable 5 بنسبة 97.8٪. في العرض الرابع، أنتج Beam دفتر ملاحظات يضبط بدقة نموذج Gemma-4 الأصغر على مهمة Text2SQL، وقالت Reflection إن ذلك رفع دقة اختبار Gemma المستبعد بنسبة 66.5٪.
خط أنابيب التدريب
ما قبل التدريب وتنقيح البيانات
قالت Reflection إنها قامت بتمهيد Beam على 23.8 تريليون رمز مأخوذ من الويب، والمصادر العامة، ومجموعات بيانات مرخصة مملوكة، وأكملت العملية من البداية إلى النهاية في أقل من أربعة أسابيع على 6,144 NVIDIA GB300 NVL72 وحدة معالجة رسومية. أفادت الشركة بأنها شهدت تسعة عمليات إعادة نصف آلية، نُسبت إلى ارتطامات معيار التدرج أو إلى اشتباه في فساد بيانات صامت، وقالت إن معدل الإنتاجية الجيدة، المعرّف بأنه نسبة الوقت الفعلي المستغرق في خطوات التدريب المحتفظ بها في النموذج النهائي، وصل إلى 92.3٪.
قامت خط أنابيب البيانات بحذف نحو 95٪ من الرموز الخام على الإنترنت عبر التحليل، وإزالة التكرارات، والتنقيح، بينما قالت Reflection إن تقنيات الترشيح التقليدية كانت لتفوت نحو 1.8 تريليون رمز عالي الجودة احتفظت به، بما في ذلك 87٪ من رموز الويب-الكود المنقحة. عالج خط أنابيب منفصل ملفات PDF باستخدام نموذج OCR للغة-الرؤية مع مصنّفات جودة داخلية عبر آلاف وحدات معالجة رسومية، وامتدت مرحلة التدريب المتوسطة لتزيد طول السياق الفعّال لـ Beam إلى مليون رمز.
يصف المنشور بنية تجمع بين الانتباه المحلي والعالمي المتداخل، وخبراء موجهين بدقة، وتوازن حمل خالٍ من الخسائر المساعدة مع تلاشي جيبي لتحديثات تحيز الخبراء، إلى جانب مقياس المتبقي القائم على العمق، وSandwichNorm، وتوجيه الانتباه على مستوى العنصر، وتراكم المتبقي FP32. أفادت Reflection بأن استخدام الخبراء كان شبه موحد، حيث بلغ متوسط حمل الخبير الأكثر انشغالًا 1.04 مرة متوسط الحمل في نهاية ما قبل التدريب، وكانت قيم معايير تدفق المتبقي محدودة عبر جميع الـ 52 طبقة.
التعلم المعزز عالي الحوسبة
ولدت حملة التعلم المعزز أكثر من 100 مليون تجربة على 10,500 وحدة NVIDIA GB300 GPU خلال أربعة أسابيع، بأقصى طول سياق يبلغ 256,000 رمز وحوالي 1.3 مليار صندوق رملية استخدمت للتدريب والتقييم. وقالت Reflection إنها جمعت ما يقرب من مليون بيئة برمجة، ووكالة، وSTEM، أساسًا عبر أنابيب بيانات صناعية، ووصف الجهد بأنه ما تعتقد أنه أحد أكبر عمليات RL التي أجراها مختبر مفتوح حتى الآن.
أفادت الشركة بأنها حافظت على متوسط 110,000 عملية نشر متزامنة وحتى 170,000 صندوق رملية متزامن، مع معالجة أكثر من مليار طلب إنشاء صندوق رملية عبر أكثر من 20 مجموعة، سحابتين، وأربع مناطق. وصلت الأوزان الجديدة إلى أسطول الاستدلال بمتوسط تقريبًا 12 ثانية، وتم التعامل مع 71 حادث استدلال دون إنهاء مهمة التدريب، وحافظ التعبئة الديناميكية على ملء دفعات التدريب بنسبة 99.99 بالمئة في المتوسط. وقالت Reflection إن النظام غير المتزامن ظل ثابتًا حتى عند التعلم من عينات تصل إلى 107 إصدارات من الأوزان، أي تقريبًا يوم واحد، خلف السياسة الحالية.
السلامة والمواءمة
فيما يتعلق بالمواءمة، قامت Reflection بتدريب نموذج ثانٍ من نفس نقطة التحقق المدربة مسبقًا باستخدام خط أنابيب تعديل خاضع للإشراف وتعلم التعزيز موجه نحو مبادئ السلوك، ثم دمجته مع معلم التعلم التعزيزي واسع النطاق عبر تقطير متعدد المعلمين على سياسة واحدة. تُنظم المبادئ في ثلاث مستويات: القواعد التي لا يجب أن يكسرها النموذج، والصفات التي يجب أن يحققها باستمرار، وأسلوب التفاعل الافتراضي.
تم بناء مجموعة بيانات السلامة بطريقة عدائية وتكرارية، حيث تم إدماج الهجمات الناجحة في كل جولة مرة أخرى في جولة التدريب التالية، وشمل تعلم التعزيز للسلامة سيناريوهات ذات خطوة واحدة، متعددة الخطوات، اختراق، وسيناريوهات وكيلية حيث يضغط خصم محاكى نموذجًا يستخدم الأدوات. وقالت Reflection إنها تستطيع توقع مكاسب التعزيز بشكل أفضل من مجرد حد Best-of-N، مسجلةً ارتباطًا قدره 0.79 مقابل 0.46 للحد. وأعلنت الشركة أنها ستنشر نتائج تقييم السلامة في التقرير الفني لـ Beam وستفتح مصدر تقييمات السلامة الداخلية التي طورتها.
التوافر والشراكات
في صفحة حول الخاصة بها، توضح Reflection التزاماتها بإصدار أوزان النموذج، نشر أبحاثها، وفتح شفرة البرمجيات، بما في ذلك أدوات وبيئات التعلم التعزيزي. تشير الصفحة إلى أن Reflection تم التحقق منها على Dell AI Factory مع NVIDIA، وأنها عضو موثوق في ائتلاف وزارة الطاقة لمهمة Genesis، تخدم الـ 17 مختبرًا وطنيًا أمريكيًا بنماذجها المفتوحة الوزن، وأنها تبني سحابة ذكاء اصطناعي سيادية بقدرة 250 ميغاواط في كوريا الجنوبية مع Shinsegae، بدعم من حكومتي الولايات المتحدة وكوريا.
قالت Reflection إنها ستصدر أوزان Beam تحت ترخيص Apache 2.0 في وقت لاحق من أكتوبر 2026، مصحوبةً بتقرير فني، بطاقة نموذج، وثائق، وكامل مجموعة الأدوات لتشغيل النموذج وتقييمه وتعديله، مع شركاء توزيع وتكاملات مع مكتبات مفتوحة المصدر وحلول مخطط لها للإطلاق.












