نماذج ومنصات الذكاء الاصطناعي
Ai2 تصدر Olmo-Core 3، مجموعة تدريب مفتوحة لنماذج MoE ذات المليار معامل

أصدر معهد ألين للذكاء الاصطناعي Olmo-core 3 في 1 أكتوبر 2026، وهو ترقية لإطار تطوير نماذج اللغة الكبيرة مبنية حول نظام تدريب مزيج الخبراء المفتوح المعاد تصميمه، وأفاد Ai2 بأنه اختبره بأكثر من تريليون معامل إجمالي.
قال Ai2 إن Olmo-core 3 مصمم لتوسيع تدريب MoE إلى نطاق التريليون معامل مع الحفاظ على الكفاءة الحاسوبية، ووصفه كأحد الأنظمة الأساسية للجيل التالي من Olmo. يصاحب الإصدار التقرير التقني، وعرض توضيحي تفاعلي، ورمز مفتوح.
يمكن لنماذج MoE أن تحتوي على عدد أكبر بكثير من المعاملات دون الحاجة إلى أن يستخدم كل مدخل جميعها، لكن النموذج الكامل لا يزال يتعين تخزينه عبر ذاكرة GPU وتحديثه أثناء التدريب، وتوجيه المدخلات إلى الخبراء المناسبين عبر مجموعة يخلق تكاليفه الخاصة في التواصل والتنسيق. قال Ai2 إن هذه التكاليف يمكن أن تآكل معظم الميزة الحاسوبية مع نمو MoEs، وأن Olmo-core 3 صُمم لسد هذه الفجوة. في أحد معايير Ai2، نمت مجموعة الخبراء من 8 إلى 128 مع الاستمرار في اختيار أربعة خبراء لكل رمز، مما حافظ على ثبات المعاملات النشطة تقريبًا عند حوالي 3.2 مليار بينما ارتفعت سعة المعاملات الإجمالية من 4.6 مليار إلى 47 مليار، مع انخفاض إنتاجية التدريب بأقل من 5٪.
من FSDP إلى مجموعة تدريب تعتمد على DDP
استخدم تنفيذ Ai2 السابق لـ MoE في Olmo-core موازنة البيانات المتجزئة بالكامل، مُعدًا لتجميع وإعادة تجزئة أوزان النموذج لكل دفعة صغيرة من بيانات التدريب. يتحول Olmo-core 3 إلى نظام يعتمد على موازنة البيانات الموزعة التي تبقي الخبراء مقيمين على وحدات معالجة الرسوميات وتوجه البيانات ذات الصلة إليهم، متجنبًا تجميع الأوزان المتكرر. في اختبار أولي على ثمانية وحدات NVIDIA B300، أفاد Ai2 أن MoE بقدرة 47 مليار معامل عالج 52,000 رمز في الثانية لكل وحدة معالجة رسومات باستخدام المجموعة الجديدة، مقارنةً بـ 19,400 باستخدام التنفيذ السابق، وهو ما وصفه Ai2 بأنه تقريبًا 2.7 مرة أعلى في الإنتاجية.
يرجع عمل Ai2 على النماذج المتناثرة إلى OlmoE، الذي استخدم بنية MoE مع 64 خبيرًا موجهًا، بينما استخدم Olmo 3 بنية كثيفة حيث كان تقريبًا كل النموذج نشطًا لكل رمز. يوسع Olmo-core 3 الإطار بنظام تدريب مصمم لنماذج MoE أكبر بكثير. أشار Ai2 إلى أن Megatron-Core من NVIDIA هو خيار ثابت لتدريب MoEs الكبيرة، ووصف Olmo-core 3 بأنه يجلب مجموعة تدريب MoE متكاملة إلى الإطار وراء Olmo.
التوازي، الدقة، وتقنيات الذاكرة
ثلاث تقنيات تحدد كيفية تقسيم النموذج وحالة تدريبه عبر الأجهزة: يوزع التوازي الخبيري الخبراء عبر وحدات معالجة الرسوميات، ويقسم التوازي الأنبوبي طبقات النموذج عبر مجموعات من وحدات معالجة الرسوميات، ويوزع المحسن الموزع حالة المحسن عبر وحدات معالجة الرسوميات بدلاً من تخزين نسخة كاملة على كل وحدة. يقلل Olmo-core 3 أيضًا من تكلفة توجيه البيانات إلى الخبراء المناسبين: يضع التوازي الخبيري الصفّي البيانات الموجهة مباشرةً في مخازن إدخال الخبراء، ويحافظ التوجيه المقيم على وحدات معالجة الرسوميات على بيانات التوجيه على وحدات المعالجة لتتمكن وحدة المعالجة المركزية من جدولة الأعمال دون انتظار نسخها مرة أخرى، وتجمع عمليات الضرب المصفوفي المتجميع (GEMM) العديد من حسابات الخبراء الصغيرة بحيث يمكن لوحدات معالجة الرسوميات تنفيذها بكفاءة أكبر. يصف التقرير التقني تصميمًا لتوازي الخبراء الصفّي القائم على NVSHMEM يكتب كل رمز مباشرةً في مخزن خبيره، مع عمليات ضرب مصفوفية مجمعة مجدولة على الجهاز تجعل توازي الخبراء خاليًا تمامًا من المزامنة.
يدعم Olmo-core 3 MXFP8، وهو تنسيق عدد منخفض الدقة. في معيار مراقب على أربع وحدات NVIDIA B300 مع توزيع العمل بشكل موحد عبر الخبراء، أفاد Ai2 أن إنتاجية التدريب ارتفعت بنحو 21٪ مقارنةً بالخط الأساسي BF16، بينما انخفض الحد الأقصى للذاكرة النشطة من 103 جيجابايت إلى 95 جيجابايت، مع معظم الزيادة ناتجة عن حسابات التغذية الأمامية ونقل البيانات بين الخبراء. يضيف التقرير أن نقاط التحقق غير المعتمدة على الطوبولوجيا تسجل موترات FP32 العالمية بشكل مستقل عن تخطيط التوازي، بحيث يمكن استئناف التشغيل على طوبولوجيا مختلفة، وأن إعادة حساب التنشيط في المقارنة المراقبة أزالت ما يقرب من ثلثي ذاكرة التنشيط وخفضت الذاكرة القصوى بنحو ربع مقابل تكلفة تقارب خُمس الإنتاجية.
معايير التريليون معامل والحدود المعلنة
قال Ai2 إنه اختبر Olmo-core 3 عبر مجموعة من التكوينات على وحدات NVIDIA B300، بما في ذلك نموذج بسعة 1.2 تريليون معامل مع 58.36 مليار معامل نشط لكل رمز عبر 512 وحدة معالجة رسومات، حيث بلغت أعلى إنتاجية ملحوظة 858 تيرافلوب/ثانية لكل وحدة معالجة رسومات. صرح Ai2 أن هذه الاختبارات استخدمت توجيهًا عشوائيًا لقياس أداء النظام بدلاً من جودة نموذج مدرب. يسرد التقرير التقني نقاط التشغيل المقاسة من نموذج بسعة 12.9 مليار معامل على 16 وحدة معالجة رسومات حتى نموذج بسعة 1.2 تريليون معامل على 512، ويشير إلى أن المعدلات الرئيسية هي مراجع نظامية تم قياسها تحت توجيه عشوائي، وليس منحنى توسع مُتحكم فيه أو ادعاء زمن للوصول إلى الجودة.
Ai2 جربت أيضًا DeepEP v2، وهو خلفية بديلة للتواصل بين الخبراء عبر وحدات معالجة الرسومات، حيث وصلت إلى تكوين يحتوي على 2.38 تريليون معلمة إجمالية. تصف Ai2 هذه النتيجة بأنها اختبار سعة قصيرة يُظهر الحجم الذي يمكن أن يصل إليه Olmo-core 3 بدلاً من أداء تدريب مستدام. التقرير الفني، بعنوان “Supercharging Olmo-core for Efficient and Scalable MoE Training”، مؤرخ في أكتوبر 2026؛ مؤلفوه من Allen Institute for AI وجامعة واشنطن، مع ذكر Tianhua Tao كالمؤلف الرئيسي والمطور الأساسي.
النتائج الموثقة وخطط Olmo للجيل التالي
يوثق التقرير نمط فشل تسميه بـ Ai2 يُطلق عليه “token gerrymandering”، حيث يمكن أن يتحسن مقياس يهدف إلى تشجيع التوجيه المتوازن حتى عندما يصبح عبء العمل الفعلي أقل توازنًا. تشمل النتائج الموثقة الأخرى: خفض معدلات تعلم الخبراء لأنهم يعالجون عددًا أقل من الرموز لم يحسن النتائج في عائلة النماذج المختبرة؛ استغرقت حسابات وحدة معالجة الرسومات أوقاتًا مختلفة عندما تغيرت القيم المعالجة، حتى مع بقاء أبعاد المصفوفة نفسها؛ وتداخل الاتصال والحساب على تدفقات GPU منفصلة لم يجعل التدريب أسرع دائمًا وفي بعض الاختبارات أبطأ التنفيذ من الطرف إلى الطرف. كما يصف التقرير الأساليب التي تم اختبارها ولكن لم تُعتمد، بما في ذلك نقل تنشيطات المعالجة إلى وحدة المعالجة المركزية التي لم يتمكن الرابط المضيف من حملها، ومخططين للتداخل تنافسا حساب الخبراء على موارد GPU.
صفت Ai2 الجيل التالي من Olmo بأنه سيستخدم بنية MoE، وأنها تستهدف أن تكون أكثر Olmo قدرةً حتى الآن، مدربة على أكبر مجموعة بيانات لها ومع أطول نافذة سياق. وأعلنت المنظمة أن Olmo-core 3 مفتوح بالكامل، بحيث يمكن للباحثين والمطورين استخدامه لتدريب MoEs الخاصة بهم، وتكييفه مع أجهزة مختلفة، وتجربة التوجيه والتوازي وأجزاء أخرى من النظام. يصف مستودع Olmo-core على GitHub المشروع ككتل بناء PyTorch لنظام OLMo، ويحمل ترخيص Apache-2.0، ويمكن تثبيته من المصدر أو من PyPI باسم ai2-olmo-core.












