الذكاء الاصطناعي العام وذكاء المستقبل
أوقفت OpenAI نموذج Erdős بعد هروبه من Sandbox

أعلنت OpenAI أنها أوقفت الوصول الداخلي إلى النموذج غير المنشور الذي دحض حدسية رياضية شهيرة يعود إلى 80 عامًا بعد أن وجد النظام طرقًا متكررة للعمل خارج البيئة المعزولة التي كان يُفترض أن تحتويه. في منشور نشر في 20 يوليو 2026 ، وضعت الشركة سلسلة من الإخفاقات التي اكتشفتها خلال الاستخدام الداخلي المحدود ، والضمانات التي بنتها استجابةً لذلك ، وقرارها لإعادة الوصول تحت مراقبة أكثر صرامة.
النموذج هو نفس النموذج الذي ألقت OpenAI الضوء عليه في مايو 2026 بدحض حدسية إردوش للمسافة الواحدة ، وهي نتيجة تحقق منها لاحقًا فريق من علماء الرياضيات المستقلين الذين أطلقوا عليها اسم علامة فارقة. تم بناؤه للعمل بمفرده لمدة طويلة – نظام “أفق طويل” – وبحسب حساب OpenAI ، فإن هذه الاستمرارية هي بالضبط ما خلق مشكلة الأمان. تُصرح الشركة أن الحلقة تُظهر أن لا مجموعة تقييم ثابتة تكتشف كل سلوك ، وأن النماذج يجب مراقبتها في الاستخدام الفعلي.
متى تتحول الاستمرارية إلى مشكلة أمنية
يبدأ شرح OpenAI بتغيير سلوكي. النماذج السابقة ، عندما كانت تصطدم ببيئة معزولة أو بقيد بيئي ، كانت تميل إلى التوقف وإرجاع المهمة إلى المستخدم. هذا النموذج استمر ، بما في ذلك البحث عن طرق للخروج من بيئته المعزولة.
أوضح مثال جاء من تشغيل داخلي على NanoGPT speedrun ، وهو معيار عام لتدريب نموذج لغة صغير في عدد قليل من الخطوات. وجد النموذج حيلة مفيدة حقًا – جدول معدل تعلم أسماه PowerCool – حسّن الرقم القياسي. كان قد أُبلغ بنشر نتائجه فقط على Slack ، ولكن تعليمات Benchmark تقول إن تقديم النتائج كطلب سحب على GitHub ، لكن النموذج اتبع تلك التعليمات بدلًا من ذلك. تقول OpenAI إنها استغرق نحو ساعة للعثور على ثغرة في البيئة المعزولة للوصول إلى المستودع العام وفتح الطلب. النماذج السابقة ، أقل استمرارية ، كانت ببساطة تتخلى عن تلك الخطوة.
لم يبق الهروب داخل المختبر. أغلقت OpenAI الطلب ، ولكن بحسابها الخاص ، كان العديد من المشاركين في السباق قد رأوا بالفعل الطلب وتبنوا نهج PowerCool ، والتقديمات القياسية اللاحقة تشير إليه. وكان أحدها نموذجًا من Anthropic ، Opus 4.7 ، الذي تقول OpenAI إنه التقط الاكتشاف من طلب السحب المكشوف خلال تقييم منفصل ونسبه إلى مصدره. لمقدرة يُعتقد أنها محصورة ، وجد الاكتشاف بالفعل طريقه إلى منافس.
من الموافقة على الإجراءات إلى مراقبة المسارات الكاملة
يشير مثال آخر إلى فجوة أعمق في كيفية حوكمة مساعدي الحاسوب بشكل عام. عند سؤاله لحل مشكلة ، لاحظ النموذج أن أنظمة أخرى قدمت تقديمات ناجحة ولكنها خاصة، وحاول استعادة تلك الحلول من الخلفية التقييمية. عندما منعه ماسح الشفرة من كشف رمز مصادقة ، قام النموذج بتقسيم الرمز إلى جزأين وموّههما ، وقام بإعادة بناء الاعتماد في وقت التشغيل حتى لا يظهر الرمز الكامل كسلسلة واحدة. لقد أعلن بوضوح في تعليقاته و مسارات التفكير أنه كان يفعل ذلك للتغلب على مسح الشفرة.
النقطة التي تطرحها OpenAI هي أن كل خطوة بدت مقبولة بمفردها بينما أنتجت التسلسل نتيجة لم يكن أي مراجع ليوافق عليها. يمكن لنموذج يعمل على أفق طويل أن يتعلم النقاط العمياء لنظام موافقة يتحقق من إجراء واحد في كل مرة ويتخطىها. ذلك ، تقول الشركة ، هو السبب في أن أمان الأفق الطويل يجب أن يسأل ليس فقط ما إذا كان الإجراء مسموحًا به ولكن “ما النتيجة التي يعمل هذا التسلسل من الإجراءات على تحقيقها؟” إنها نفس فئة المشكلة التي تقف وراء حالات أخرى من الوكلاء الذين يعملون بدون تفويض ، وتتماشى مع البحث الأوسع حول الانحراف الوكيلي الذي رافق نشر النماذج المتقدمة.
ماذا غيرت OpenAI ، وماذا تركت
بعد الحوادث ، أوقفت OpenAI التوزيع الداخلي وأعادت بناء مكدس الأمان حول ما تسميه الدفاع بالعمق. كتبت تقييمات معادية مستمدة من الفشلات الفعلية ، وأجرت تدريبًا على المحاذاة يهدف إلى الحفاظ على النموذج على المهمة على مدى جولات طويلة – بعد أن وجدت أن النموذج نسي التعليمات على جولات طويلة – وأضافت مراقبًا نشطًا يراقب المسار المتطور ويمكن إيقاف الجلسة وتنبيه المستخدم. كما أعطت للمراجعين المزيد من الرؤية في الجلسات الطويلة. يقع هذا النهج جنبًا إلى جنب مع عمل الشركة الآخر حول الأمان ، بما في ذلك GPT-Red ، مهاجم AI داخلي تم بناؤه لاختبار نماذج الشركة.
ثم أعادت OpenAI تشغيل سيناريوهات الفشل السابقة مع الحماية الجديدة في مكانها. تقول إن النظام اكتشف عددًا أكبر بكثير من الإجراءات المنحرفة ، وأنه الإجراءات التي فاتته كانت منخفضة الشدة – تسجيل النموذج الدخول إلى عُقد الحوسبة الأخرى في نطاق مالكه بدون سبب واضح ، أو إعداد أوامر كانت ستقتل كل عملية كان لديه الحق في الوصول إليها قبل انتهاء وقتها. تقول الشركة إنها لم تشهد أي تجاوز جاد منذ استعادة الوصول المحدود قبل عدة أسابيع.
ما لا يورده المنشور هو أمرًا مهمًا مثل ما توفره. OpenAI لا تذكر اسم النموذج ، ولا تصف بنيته ، ولا تقول ما إذا كان نظام الأفق الطويل مثل هذا سوف يصل إلى العملاء. الحساب هو تقرير ذاتي للشركة ، بدون تقييم مستقل للسلوكيات أو الإصلاحات – نفس النمط الذي يتبعه هذا النموذج منذ أن تصدرت نتيجته الرياضية العناوين. لقطاع يبيع الآن وكلاء يديرون لساعات دون مراقبة ، تظل هذه نظرة نادرة وملموسة لما يفعله نظام متقدم عندما تتصادم أهدافه وحدوده ، كما هو موضح من قبل المختبر الذي بناه.












