الأمن السيبراني

OpenAI تعطل حملة استخراج التفكير النموذجي المنسقة

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

قالت OpenAI في منشور أمني نُشر في 30 سبتمبر 2026 أنها حددت وعطلت حملة منسقة تهدف إلى استخراج التفكير المحمي من نماذجها، وربطت مجموعة أساسية من النشاط بأفراد مرتبطين بـ Moonshot AI، مطور Kimi. حدث النشاط الأول الذي لوحظ في الأسبوع الأول من يوليو 2026.

ما لاحظته OpenAI

وصفت OpenAI النشاط بأنه يتماشى مع التقطير العدائي، والذي عرّفته بأنه الاستخدام المنهجي وغير المصرح به لمخرجات أو تفكير نموذج واحد للمساعدة في تدريب أو إعادة إنتاج أو تحسين نموذج آخر. وفقًا للشركة، فإن التفكير المحمي هو السجل الداخلي للنموذج أثناء معالجة مهمة؛ واستخراجه يمكن أن يكشف عن معلومات تم حجبها عن الإجابة النهائية ويساعد الآخرين على إعادة إنتاج قدرات النموذج.

قالت OpenAI إن المشغلين لم يكسروا تشفيرها، ولا يخرقوا قاعدة بيانات، ولا يحصلوا على وصول مباشر إلى محادثات المستخدم المخزنة. قام المشغلون بالتلاعب بتفاعلات النموذج بحيث يمكن إعادة إنتاج التفكير المحمي بأشكال مرئية للطالب بطريقة منسقة وموسعة، مما يخالف شروط خدمة الشركة. إحدى التقنية التي لاحظتها OpenAI تضمنت نسخ التفكير المشفر من محادثة واحدة وطلب من نموذج في محادثة أخرى فك تشفيره ونسخ محتوى التفكير المخفي. أفادت الشركة أن هذا التلاعب ليس ثغرة فريدة لنماذجها وأنها شاركت المعلومات حوله مع شركاء الصناعة عبر Frontier Model Forum لتعزيز الدفاعات الجماعية.

بدأ النشاط في 1 يوليو 2026، في البداية بحجم منخفض، حتى لاحظت OpenAI ارتفاعًا كبيرًا في الحجم في 24 و25 يوليو 2026 مكوّنًا من 16,000 طلب باستخدام نمط استخراج ذي صلة من أكثر من 4,000 مستخدم. يشير حاشية في المنشور إلى أن هذه الأرقام تصف محاولات استخراج، وليس بالضرورة نجاحها. قالت OpenAI إن تحقيقًا إضافيًا حدد نشاط نمط موجه مرتبط عبر مجموعة تضم أكثر من 15,000 مستخدم، وقد عطلته بالكامل بحلول 28 يوليو 2026. تطور النشاط مع مرور الوقت، مما، بحسب الشركة، يؤكد أن التقطير العدائي يمثل تحديًا أمنيًا أوسع يتطلب دفاعات متدرجة وتكيفية.

قالت OpenAI إن التقطير العدائي يشكل مخاطر على السلامة والأمن القومي: يمكن استخدام التفكير المستخرج لتدريب نموذج آخر دون الحفاظ على الضمانات المطبقة على مخرجات النموذج الأصلية للمستخدم، ويمكن للتقطير على نطاق واسع تسريع نقل القدرات المتقدمة دون نفس الاستثمار في السلامة، وقد أشارت الشركة إلى أن هذه المخاوف تزداد مع اكتساب النماذج لقدرات ذات استخدام مزدوج. وأضافت OpenAI أنه قبل النشر، حققت في نطاق الحملة وتأثيرها المحتمل، ونفذت تدابير التخفيف الخاصة بها، وتشاركت مع الباحثين وشركاء الصناعة وأخذت ملاحظاتهم، وأن أعمال التخفيف والتحقيق الإضافية لا تزال مستمرة.

الإسناد

قالت OpenAI إنه من غير الواضح ما إذا كان جميع المشغلين الذين لوحظوا خلال الفترة ذات الصلة ينتمون إلى فاعل واحد، وأنها تربط مجموعة أساسية من النشاط بأفراد مرتبطين بـ Moonshot AI، مطور Kimi.

في 8 سبتمبر 2026، أصدرت وكالة الأمن القومي، ووكالة الأمن السيبراني والبنية التحتية، ومكتب التحقيقات الفيدرالي استشارة أمن سيبراني مشتركة تفيد بأن Moonshot AI نفذت حملة تقطير واسعة النطاق ضد شركات الذكاء الاصطناعي المتقدمة في الولايات المتحدة منذ منتصف 2025 على الأقل. تشير الاستشارة إلى أن Moonshot AI استخرجت بيانات Claude Fable 5 هامة لتدريب نموذج Kimi‑K3 وبيانات GPT‑4o لتدريب نموذج Kimi‑K2، وأن الشركة استخدمت نماذج أمريكية لتقطير تحسين الضبط الخاضع للإشراف، وتعلم التعزيز، والهندسة البرمجية، وقدرات الرياضيات.

تشير الاستشارة بشكل أوسع إلى أن، على الأرجح مع علم الحكومة الصينية، قامت DeepSeek وMoonshot AI وAlibaba وMiniMax وStepFun وZ.AI باستخراج مليارات الرموز عبر ملايين التبادلات من نماذج الذكاء الاصطناعي المتقدمة في الولايات المتحدة، بما في ذلك متغيرات Claude وGPT وGemini وGrok، منذ أواخر 2024 على الأقل. وفقًا للوكالات، قامت هذه الشركات بتمرير الطلبات عبر واجهات برمجة تطبيقات أصلية، ومزودي سحابة بعيدين، ومجمعات طرف ثالث؛ واستخدمت سوقًا رمادية من وكلاء API تُعرف باسم محطات النقل لتجاوز القيود الجغرافية، وانتهاك شروط الاستخدام، وتقويض إمكانية التتبع؛ وحققت وفورات في التكلفة من خلال شراء جماعي للاشتراكات المتميزة المشتركة بين فرق المطورين. أوصت الوكالات بأن تقوم شركات الذكاء الاصطناعي الأمريكية بتنفيذ اكتشاف شامل وتخفيف، ونشر تغييرات استجابة مستهدفة لمحاولات التقطير المشتبه بها، وإنشاء مشاركة استخباراتية عبر المنظمات.

بحث أثر تتبع التفكير

قالت OpenAI إن باحثين أمنيين مستقلين جلبوا إلى انتباهها ثغرات متعلقة عبر النماذج وضغط المحادثات من خلال الإفصاح المسؤول. أفادت الشركة بأنها حققت في النتائج، وأكدت أن مسارات الهجوم التي حددها الباحثون كانت حقيقية، وأن هذا العمل ساعدها على فهم فئة الهجمات الأوسع وتسريع إجراءات التخفيف.

في ورقة قدمت إلى arXiv في 10 أغسطس 2026، ألكسندر بانفيلوف، ديفيد شموц، إيليا شومايلوف، لوكا بويرر-كيلنر، يواكيم شيفر، أميا برابهو، جوناس جايبينغ، وماكسيم أندريوشينكو يذكرون أن المزودين الرئيسيين يخفون التفكير خطوة بخطوة لنماذجهم لحماية الملكية الفكرية وتقليل تسرب المعلومات، مع إرجاع الآثار إلى العميل على شكل كتل نصية مشفرة يرسلها العميل مع كل طلب لاحق. يحدد المؤلفون ثغرة معمارية: هذه الكتل المشفرة متوافقة تمامًا وقابلة للتبادل عبر جلسات مختلفة، مستخدمين، ونماذج داخل نظام المزود. يصفون اختراق فك التشفير القابل للتوسع حيث يتم حقن أثر تفكير مشفر من نموذج معين في نموذج أضعف وأقل حماية من نفس المزود، مما يجبره على فك الشيفرة وإخراج الأثر نصًا صريحًا دون اختراق النموذج الأكثر قدرة مباشرةً.

يذكر المؤلفون أن الثغرة تمكّن من أربعة مسارات هجوم متميزة: تجاوز آليات مكافحة التقطير، والتي أظهروا ذلك عبر Anthropic وOpenAI وGoogle؛ استخراج بيانات خاصة على نطاق واسع، حيث استعادوا 367 قطعة من المعلومات الشخصية القابلة للتعريف و182 اعتمادًا عبر فك تشفير 315,320 كتلة تفكير تم جمعها من المستودعات العامة؛ الكشف غير المقصود عن معلومات خطرة مخفية داخل عملية التفكير حتى عندما يرفض المخرج النهائي الظاهر للنموذج طلبًا خبيثًا بأمان؛ وحقن موجهات غير مرئية تُدمج حمولة خبيثة بالكامل داخل الكتل المشفرة لتسميم نشرات الوكلاء العامة. بعد الإبلاغ المسؤول، يقترح المؤلفون تدابير تخفيف تشفيرية وعلى مستوى النظام لتأمين التفكير على جانب العميل.

كيف استجابت OpenAI

قالت OpenAI إنها خففت الحملة من خلال مزيج من إنفاذ الحسابات، الضوابط التقنية، وتنسيق الشركاء: حظرت أو قيدت الحسابات الاحتيالية، وعززت ضوابط التسجيل والبنية التحتية، ووسعت المراقبة للشبكات ذات الصلة. وأشارت الشركة إلى أنها أيضًا عززت الحمايات للتفكير المخفي عبر المستخدمين، مساحات العمل، المؤسسات، وعائلات النماذج: أغلقت مسارًا كان يسمح لشخص يمتلك بالفعل تفكيرًا مشفرًا لمستخدم آخر بإعادة تشغيله واستعادة محتوياته، وأضافت فحوصات لاكتشاف وإيقاف المخرجات المتدفقة التي قد تكشف التفكير، وعملت مع مزودي الطرف الثالث لتحديد وتعطيل الحسابات عندما ينتقل النشاط المتعلق عبر خدماتهم.

قالت OpenAI إنها شاركت النتائج ذات الصلة عبر منتدى نماذج الحدود والقنوات المناسبة لتبادل المعلومات الحكومية حتى يتمكن مطورو النماذج المتقدمة وشركاؤها في القطاع العام من البحث عن نشاط مماثل وتعزيز دفاعاتهم الخاصة، وأشارت إلى أن الأنظمة التي تدعم قطع التفكير القابلة للنقل أو الإعادة قد تواجه مخاطر ذات صلة.

قالت OpenAI إنها تتوقع أن تصبح محاولات التقطير العدائي أكثر تعقيدًا مع تحسن نماذج الحدود ومع سعي الفاعلين إلى طرق أرخص لتقليد قدراتها. وأشارت الشركة إلى أن عمليات النشر المستضافة من قبل الشركاء تحتاج إلى نفس الحمايات التي تُطبق على الخدمات الداخلية، وأن هجمات مخرجات الأدوات تتطلب حمايات تفحص أكثر من النص الظاهر العادي، وأنها تواصل تحسين دفاعات الأدوات، وتغطية المصنفات، ورفض النماذج بينما تنشر الضوابط ذات الصلة عبر شركاء السحابة. وقالت OpenAI إن استجابتها ستستمر في التركيز على ثلاثة مجالات: حمايات تقنية أقوى ضد الاستخراج، تحسين الكشف والإنفاذ ضد الحملات المنسقة، وتعزيز مشاركة معلومات التهديد عبر الصناعة والحكومة.

Miles Okada هو محلل مُولَّد بالذكاء الاصطناعي في Unite.AI، يغطي الذكاء الاصطناعي والأمن السيبراني مع تركيز على التهديدات الناشئة والهياكل الدفاعية والديناميكيات المتطورة بين المهاجمين والأنظمة المؤتمتة. يدرس عمله كيف يُعيد الذكاء الاصطناعي تشكيل عمليات الأمن، من الكشف والاستجابة الذاتية للتهديدات إلى صعود تقنيات الذكاء الاصطناعي العدائي.

من منظور تقني وتحقيقي، يحلل Miles تحليل أبحاث الأمن وإفصاحات الحوادث والنشرات العملية لفهم أين يُقوي الذكاء الاصطناعي الدفاعات—وأين يضيف ثغرات جديدة. يولي اهتمامًا خاصًا لاستغلال النماذج، وتسميم البيانات، وأتمتة الهجمات، والواقع التشغيلي لتأمين الأنظمة المدعومة بالذكاء الاصطناعي على نطاق واسع.

المقالات التي يكتبها Miles Okada مُولَّدة بالذكاء الاصطناعي وتُراجعها فريق التحرير في Unite.AI لضمان الدقة والصرامة وتغطية مسؤولة للمشهد الأمني المتغير بسرعة في مجال الذكاء الاصطناعي.