نماذج ومنصات الذكاء الاصطناعي
أصبحت Tülu 3 من Allen AI منافسًا غير متوقع لـ DeepSeek

تواصل الأخبار. نماذج DeepSeek تحدّى المعايير وتحدد معايير جديدة وتصدر الكثير من الضوضاء. لكن حدث شيء مثير للاهتمام في مشهد البحث عن الذكاء الاصطناعي يستحق انتباهك.
Allen AI أطلقت بشكل هادئ عائلة Tülu 3 الجديدة من النماذج، والنسخة التي تحتوي على 405 مليار معامل لا تتنافس فقط مع DeepSeek – بل تتجاوزها أو تعادلها في بعض المعايير الرئيسية.
دعونا نضع هذا في سياقه.
نموذج Tülu 3 الذي يحتوي على 405 مليار معامل يتنافس مع أفضل الأداء مثل DeepSeek V3 عبر مجموعة من المهام. نحن نشهد أداءً قابلاً للمقارنة أو الأفضل في مجالات مثل حل المسائل الرياضية و挑وار البرمجة والامتثال الدقيق للتعليمات. كما أنها تفعل ذلك باستخدام نهج مفتوح بالكامل.
لقد أصدرت Pipeline التدريب الكامل والكود وطريقة التعلم بالتعزيز الجديدة التي تسمى التعلم بالتعزيز مع المكافآت القابلة للتحقق (RLVR) التي جعلت هذا ممكنًا.
التطورات مثل هذه على مدار الأسابيع القليلة الماضية تغير حقًا طريقة حدوث تطور الذكاء الاصطناعي من الطراز الأعلى. عندما يمكن لنموذج مفتوح المصدر完全 أن يتجاوز أفضل النماذج المغلقة هناك، فإنه يفتح إمكانيات كانت مقفلة في السابق خلف جدران الشركات.
المعركة الفنية
ما الذي جعل Tülu 3 بارزاً؟ يعود الأمر إلى عملية تدريب فريدة من نوعها تتكون من أربعة مراحل تتجاوز النهج التقليدية.
دعونا ننظر إلى كيفية بناء Allen AI لهذا النموذج:
المرحلة 1: اختيار البيانات الاستراتيجي
كان الفريق يعلم أن جودة النموذج تبدأ من جودة البيانات. لقد جمعوا بين مجموعات بيانات محددة مثل WildChat و Open Assistant مع المحتوى المولّد حسب الطلب. ولكن هنا تكمن الفكرة الرئيسية: لم يجمعوا فقط البيانات – بل أنشأوا مجموعات بيانات مستهدفة لمهارات محددة مثل التفكير الرياضي والبرمجة.
المرحلة 2: بناء استجابات أفضل
في المرحلة الثانية، ركزت Allen AI على تعليم نموذجها مهارات محددة. لقد أنشأوا مجموعات بيانات تدريبية مختلفة – بعضها للرياضيات والبعض الآخر للبرمجة والمزيد للمهام العامة. من خلال اختبار هذه المجموعات بشكل متكرر، يمكنهم رؤية بالضبط哪里 يتفوق النموذج وحيث يحتاج إلى عمل. هذا العملية التكرارية كشفت عن الإمكانيات الحقيقية لما يمكن أن ينجزه Tülu 3 في كل مجال.
المرحلة 3: التعلم من المقارنات
هنا أصبحت Allen AI مبدعة. لقد بنوا نظامًا يمكنه مقارنة استجابات Tülu 3 على الفور مع أفضل النماذج الأخرى. ولكنهم cũng حلوا مشكلة مستمرة في الذكاء الاصطناعي – نمط النماذج للكتابة استجابات طويلة فقط من أجل الطول. نهجهم، باستخدام التحسين المباشر للتفضيل مع تطبيع الطول (DPO)، يعني أن النموذج يتعلم القيمة الجودة على الكمية. النتيجة؟ استجابات دقيقة ومدروسة.
عندما يتعلم النماذج من التفضيلات (أي استجابة أفضل، A أو B؟)، فإنها تميل إلى تطوير انحيازًا مثيرًا للاستياء: يبدأون في التفكير أن الاستجابات الأطول دائمًا أفضل. إنه مثل محاولة الفوز بالكلام أكثر من الكلام الجيد.
التحسين المباشر للتفضيل مع تطبيع الطول يصلح هذا من خلال调整 كيفية تعلم النموذج من التفضيلات. بدلاً من النظر فقط إلى الاستجابة المفضلة، يأخذ في الاعتبار طول كل استجابة. فكر في ذلك كتقييم الاستجابات حسب جودتها لكل كلمة، وليس فقط تأثيرها الإجمالي.
لماذا يهم هذا؟ لأنه يساعد Tülu 3 على تعلم الدقة والكفاءة. بدلاً من حشو الاستجابات بكلمات إضافية لتظهر أكثر شمولاً، يتعلم تقديم القيمة في أي طول هو بالفعل ضروري.
قد يبدو هذا تفصيلاً صغيرًا، لكنه حاسم لبناء الذكاء الاصطناعي الذي يتواصل بشكل طبيعي. أفضل الخبراء البشر يعرفون متى يكونون موجزين ومتى يطيلون – وهذا بالضبط ما يساعد التحسين المباشر للتفضيل مع تطبيع الطول على تعليم النموذج.
المرحلة 4: 혁신 RLVR
هذا هو الكسر الفني الذي يستحق الانتباه. RLVR ي置ّ مكافآت ملموسة قابلة للتحقق بدلاً من نماذج المكافأة الخاضعة.
معظم نماذج الذكاء الاصطناعي تتعلم من خلال نظام معقد من نماذج المكافأة – أساسًا تخمينات متعلمة حول ما يجعل استجابة جيدة. لكن Allen AI اخترت طريقًا مختلفًا مع RLVR.
فكر في كيفية تدريب نماذج الذكاء الاصطناعي حاليًا. عادة ما نحتاج إلى نماذج أخرى (تسمى نماذج المكافأة) لتقييم ما إذا كانت الاستجابة جيدة أو لا. إنه موضوعي، معقد، وأحيانًا غير متسق. قد تظهر بعض الاستجابات جيدة ولكن تحتوي على أخطاء خفية تنفلت.
RLVR يقلب هذا النهج رأسًا على عقب. بدلاً من الاعتماد على الأحكام الذاتية، يستخدم نتائج ملموسة قابلة للتحقق. عندما يحاول النموذج حل مسألة رياضية، لا يوجد مجال للرمادية – الجواب إما صحيح أو خاطئ. عندما يكتب رمزًا، فإن هذا الرمز إما يعمل بشكل صحيح أو لا.
هنا يصبح الأمر مثيرًا للاهتمام:
- يحصل النموذج على ملاحظات فورية وثنائية: 10 نقاط للاجابات الصحيحة، 0 للاجابات الخاطئة
- لا يوجد مجال للائتمان الجزئي أو التقييم الغامض
- يصبح التعلم مركزًا ودقيقًا
- يتعلم النموذج تقديم الدقة على الاستجابات المقنعة ولكن الخاطئة

RLVR Training (Allen AI)
النتائج؟ أظهر Tülu 3 تحسينات ملحوظة في المهام التي يهم فيها الصواب أكثر. أداؤه على التفكير الرياضي (معايير GSM8K) وتحديات البرمجة قفز بشكل ملحوظ. حتى اتباعه للتعليمات أصبح أكثر دقة لأن النموذج تعلم تقدير الدقة الملموسة على الاستجابات التقريبية.
ما يجعل هذا مثيرًا بشكل خاص هو كيف يغير اللعبة للذكاء الاصطناعي مفتوح المصدر. النهج السابقة غالبًا ما عانت من صعوبة في مطابقة دقة النماذج المغلقة في المهام الفنية. RLVR يظهر أن النماذج مفتوحة المصدر يمكن أن تحقق نفس مستوى الموثوقية مع النهج الصحيح.
نظرة على الأرقام
النسخة من Tülu 3 التي تحتوي على 405 مليار معامل تتنافس مباشرة مع أفضل النماذج في المجال. دعونا ننظر إلى哪里 تتفوق و ماذا يعني هذا للذكاء الاصطناعي مفتوح المصدر.
الرياضيات
Tülu 3 يتفوق في التفكير الرياضي المعقد. على معايير مثل GSM8K و MATH، يطابق أداء DeepSeek. النموذج يتعامل مع مشاكل متعددة الخطوات ويظهر قوة في التفكير الرياضي.
البرمجة
النتائج البرمجية تثبت أنها مثيرة للإعجاب بنفس القدر. بفضل تدريب RLVR، يكتب Tülu 3 رمزًا يحل المشاكل بشكل فعال. قوته تكمن في فهم تعليمات البرمجة وإنتاج حلول وظيفية.
اتباع التعليمات الدقيق
قدرة النموذج على اتباع التعليمات تبرز كقوة أساسية. بينما تقترب العديد من النماذج أو تعمم التعليمات، يظهر Tülu 3 دقة ملحوظة في تنفيذ ما هو مطلوب بالضبط.
فتح الصندوق الأسود لتطوير الذكاء الاصطناعي
أصدرت Allen AI نموذجًا قويًا وعمليّة التطوير الكاملة.
كل جانب من عملية التدريب موثق ومتاح. من النهج الأرباعي إلى أساليب تحضير البيانات وتنفيذ RLVR – العملية الكاملة مفتوحة للدراسة والتكرار. هذه الشفافية تحدد معيارًا جديدًا في تطوير الذكاء الاصطناعي عالي الأداء.
المطورون يتلقون موارد شاملة:
- أنابيب تدريب كاملة
- أدوات معالجة البيانات
- أطر تقييم
- مواصفات التطبيق
هذا يسمح للفرق:
- تعديل عمليات التدريب
- تكييف الأساليب لاحتياجات محددة
- بناء على نهج مثبت
- إنشاء تطبيقات متخصصة
هذا النهج المفتوح يسرع الابتكار في جميع أنحاء المجال. يمكن للباحثين بناءً على أساليب مثبتة، بينما يمكن للمطورين التركيز على التحسينات بدلاً من البدء من الصفر.
صعود التميز مفتوح المصدر
نجاح Tülu 3 هو لحظة كبيرة لتطوير الذكاء الاصطناعي مفتوح المصدر. عندما تطابق أو تتجاوز النماذج مفتوحة المصدر البديل الخاص، فإنه يغير بشكل أساسي الصناعة. فرق البحث في جميع أنحاء العالم تكتسب وصولًا إلى أساليب مثبتة، مما يسرع عملها ويولد ابتكارات جديدة. يجب على معاملات الذكاء الاصطناعي الخاصة التكيف – إما بزيادة الشفافية أو دفع الحدود الفنية إلى أبعد.
النظر إلى الأمام، تشير إنجازات Tülu 3 في المكافآت القابلة للتحقق والتدريب المتعدد المراحل إلى ما سيأتي. يمكن للفرق بناءً على هذه الأسس، وربما دفع الأداء إلى أعلى.
الأسئلة الشائعة (FAQ) حول Tülu 3
ما هي Tülu 3 وما هي ميزاتها الرئيسية؟
Tülu 3 هي عائلة من نماذج اللغة الكبيرة مفتوحة المصدر تم تطويرها بواسطة Allen AI، مبنية على هيكل Llama 3.1. وهي تأتي بأحجام مختلفة (8B و 70B و 405B معامل). Tülu 3 مصممة لأداء محسّن عبر مهام متنوعة تشمل المعرفة والتفكير والرياضيات والبرمجة و اتباع التعليمات والدقة.
ما هي عملية تدريب Tülu 3 وما هي البيانات المستخدمة؟
تدريب Tülu 3 يتضمن عدة مراحل رئيسية. أولاً، يجمع الفريق مجموعة من الاستفسارات من مجموعات بيانات عامة وبيانات مولدة اصطناعيًا تستهدف مهارات محددة، مما يضمن أن تكون البيانات خالية من التلوث مقابل المعايير. ثانيًا، يتم إجراء تعديل دقيق خاضع للإشراف (SFT) على مزيج من بيانات اتباع التعليمات والرياضيات والبرمجة. بعد ذلك، يستخدم التحسين المباشر للتفضيل (DPO) مع بيانات التفضيل التي تم إنشاؤها من خلال反馈 بشري ونموذج اللغة. أخيرًا، يستخدم التعلم بالتعزيز مع المكافآت القابلة للتحقق (RLVR) للمهام التي يمكن قياس دقتها. Tülu 3 يستخدم مجموعات بيانات منضبطة لكل مرحلة، بما في ذلك تعليمات مدفوعة بالشخصية والرياضيات والبرمجة.
كيف تتعامل Tülu 3 مع السلامة وما هي المقاييس المستخدمة لتقييمها؟
السلامة هي مكون أساسي من تطوير Tülu 3، يتم تناولها على مدار عملية التدريب. يتم استخدام مجموعة بيانات خاصة بالسلامة خلال SFT، والتي تُظهر أنها في الغالب متعامدة مع بيانات المهام الموجهة الأخرى.
ما هو RLVR؟
RLVR هو تقنية يتم فيها تدريب النموذج لتحسين المكافأة القابلة للتحقق، مثل صحة الإجابة. هذا يختلف عن RLHF التقليدية التي تستخدم نموذج المكافأة.













