الأمن السيبراني
Lava تكتشف آلاف خوادم GPU المكشوفة وثغرة مراقبة NVIDIA عالية الخطورة

البنية التحتية وراء نموذج الذكاء الاصطناعي يمكن أن تكشف عن كمية مفاجئة قبل أن يقتحمها أحد. قد يكشف نقطة مراقبة عامة عن وحدات GPU في الخادم، واستخدامها، والبرمجيات المحيطة بها. يمكن أن يتحول عيب في نفس خدمة المراقبة إلى خطر على التوافر.
بحث جديد من Lava، صدر في 8 أكتوبر، يصف المشكلتين. حددت شركة الأمن حوالي 2,100 مضيفًا عامًّا لخدمة NVIDIA DCGM Exporter تُبلغ عن أكثر من 12,000 وحدة GPU فريدة دون مصادقة. خلال تحقيقها، اكتشفت Lava أيضًا ثغرة عالية الخطورة يمكن أن تسمح لمهاجم غير مصدق بإستنفاد الموارد وتعطيل مراقبة GPU.
قامت NVIDIA بتعيين المشكلة CVE-2026-47483، وصنفتها 8.2, عالية، وأصدرت تحديثًا. تضع النتائج جزءًا أقل بريقًا من بنية تحتية الذكاء الاصطناعي تحت الأضواء: الخدمات المستخدمة لمراقبة الحوسبة المكلفة تحتاج إلى حماية خاصة بها.
ما وجده الباحثون—ومعنى الأرقام
يصف البحث الأصلي لـ Michael Katchinskiy من Lava أربعة فحوصات أُجريت بين مارس ومايو 2026. وبالتالي تمثل الإجماليات ملاحظات خلال تلك الفترة البحثية، وليس عددًا حيًا للأنظمة المكشوفة اليوم.
أرجعت المضيفات بيانات قياس GPU دون مصادقة. لاحظت Lava معجلات مراكز البيانات، بما في ذلك H100s وH200s وBlackwell Ultra B300s، بالإضافة إلى أنظمة RTX 4090 و5090. قدرت الشركة أن وحدات GPU التي تم رصدها تمثل أكثر من 100 مليون دولار من الأجهزة، بناءً على قيم سوقية تقريبية. هذا الرقم يصف قيمة الأجهزة، وليس الخسائر الناتجة عن هجوم.
حوالي ربع المضيفات المكشوفة لـ DCGM سمحت أيضًا بالوصول إلى نقاط نهاية داخلية لتتبع Go. هذه الفئة مهمة: نقطة نهاية المقاييس المكشوفة وواجهة التتبع الضعيفة القابلة للوصول مرتبطتان لكنهما اكتشافان مميزان. سيكون من المضلل وصف جميع وحدات GPU التي تزيد عن 12,000 كضحايا مؤكدين لهذه الثغرة.
تقول Lava إنها أعادت إنتاج استنزاف الموارد في بيئة مُتحكم فيها، بدلاً من مهاجمة النشر العام. تُظهر الدراسة مسار هجوم محتمل؛ لكنها لا تثبت أن المنظمات التي تم رصدها تعرضت للاستغلال أو أن بيانات نماذجها سُرقت.
لماذا تكشف مراقبة GPU أكثر من مجرد إشارة حالة
DCGM هو اختصار لـ Data Center GPU Manager. يوضح توثيق DCGM Exporter من NVIDIA أن المُصدّر يجمع حقول قياس GPU المختارة ويقدمها بتنسيق يمكن لـ Prometheus استهلاكه. تُستخدم نقطة نهاية المقاييس عادةً من قبل أنظمة المراقبة لتتبع حالة ونشاط عقد GPU.
درجة الحرارة، الاستخدام، استهلاك الذاكرة، استهلاك الطاقة وأحداث الأخطاء مفيدة للمشغلين لأنها تصف سلوك الحوسبة. عندما تكون نفس المعلومات متاحة للغرباء، تتحول إلى مصدر جرد واستطلاع.
يمكن للاستجابات المكشوفة أن تكشف عن نماذج الأجهزة وتفاصيل التشغيل. القراءات المتكررة يمكن أن توفر دلائل على فترات الانشغال والنشاط المتكرر. هذه الدلائل ليست دليلًا على أن نموذجًا معينًا يتم تدريبه أو تقديمه، لكنها يمكن أن تساعد الطرف الخارجي في تضييق ما يحتويه البيئة ومتى تكون نشطة.
هذه الفروقات تستحق الحفاظ عليها. قراءة قياسات GPU ليست مماثلة لقراءة أوزان النموذج أو بيانات التدريب أو الموجهات. ومع ذلك، لا تزال معلومات البنية التحتية ذات قيمة: المهاجم الذي يتعرف على المكونات والإصدارات الموجودة لديه نقطة انطلاق أكثر تحديدًا من شخص يواجه خادمًا غير شفاف.
الثغرة تستهدف خدمة المراقبة
النشرة الأمنية لـ NVIDIA تحدد العيب في DCGM Exporter /debug/pprof نقاط النهاية. يمكن لطلبات التتبع غير المصدقة المتزامنة أن تتسبب في استهلاك غير مسيطر عليه للموارد، مع احتمال حدوث إنكار الخدمة وكشف المعلومات. تُعطي النشرة الفضل لـ Michael Katchinskiy من Lava لتقاريرها.
التتبع هو قدرة تشخيصية شرعية. يساعد المطورين على فحص سلوك وحدة المعالجة المركزية والذاكرة داخل التطبيق. تنشأ مشكلة الأمان عندما تصبح وظيفة داخلية محتملة التكلفة قابلة للوصول من قبل متصل غير موثوق دون ضوابط مناسبة.
وفقًا لـ Lava، اشتبه الباحثون في البداية في خطأ تكوين المشغل، ثم أعادوا إنتاج السلوك باستخدام الحاوية الرسمية من NVIDIA. أظهروا أن استنزاف الموارد يمكن أن يتسبب في تعطل المُصدّر، مما يزيل الرؤية عن صحة GPU. يمكن لضغط وحدة المعالجة المركزية والذاكرة أيضًا أن يؤثر على أعباء التدريب أو الاستدلال التي تشترك في الخادم.
تعطيل المُصدّر لا يعني بالضرورة إيقاف عبء عمل GPU نفسه. التأثير الفوري هو فقدان المراقبة؛ وتعتمد التدخلات مع أعباء العمل المجاورة على عزل الموارد والنشر. هذه ثغرة خدمة برمجية حول بنية تحتية لـ GPU، وليس دليلًا على عيب في رقاقة GPU.
التمييز مهم من الناحية التشغيلية. إذا اختفت المراقبة أثناء تباطؤ عبء العمل، يحتاج المستجيبون إلى التحقيق فيما إذا كان نظام الملاحظة نفسه يتعطل. اعتبار كل مقياس مفقود مجرد إزعاج في الأدوات قد يؤخر التعرف على حادث استهلاك الموارد.
الانكشاف يمتد إلى ما وراء طبقة وحدة معالجة الرسومات
تصف إعلان Lava أيضًا 12,096 مضيف Node Exporter يمكن الوصول إليها علنًا. يقوم Node Exporter بالإبلاغ عن معلومات الخادم ونظام التشغيل بدلاً من أداء نفس دور DCGM Exporter. تشمل البيانات المكشوفة تفاصيل الأجهزة والبرمجيات التي قد تساعد الأطراف الخارجية على فهم الأنظمة المحيطة بأعباء عمل GPU.
يجب إبقاء هذه الأعداد منفصلة. تُعد ملاحظات Node Exporter اكتشافًا أوسع لانكشاف البنية التحتية، وليس عددًا آخر من المضيفين المؤكد تعرضهم للثغرة CVE-2026-47483. دمج الأرقام سيُخفِي أي خدمة وما يمثل كل رقم من مخاطر.
الاستنتاج الأوسع هو أن أمان الذكاء الاصطناعي يحتاج إلى تضمين طبقة المراقبة والإدارة. لا تحمي ضوابط وصول النموذج تلقائيًا خدمة المقاييس التي تُنشر بجانب النموذج. يمكن للمنظمة تأمين واجهة برمجة تطبيقات الاستدلال الخاصة بها مع ترك خدمة أخرى على نفس البنية التحتية مفتوحة للإنترنت.
تطبيق التصحيحات وتقييد الوصول يعالجان مشكلات مختلفة
التحديث الأمني متاح بالفعل. نشرة NVIDIA تحدد DCGM Exporter 4.8.2 كإصدار محدث وتُدرج أيضًا DCGM 4.5.3. يجب على المشغلين مراجعة النشرة الحالية وتوافق الإصدارات المدعومة لنشرهم بدلاً من اعتبار رقمَي الإصدار هذين المكوّنين قابلين للتبادل.
يُعالج التحديث الثغرة المُفصح عنها. لكنه لا يثبت، بحد ذاته، أن نقطة النهاية الخاصة بالمقاييس مقيدة بشكل مناسب. يمكن لمُصدّر مُصحح أن يظل يكشف عن بيانات القياس إذا ظل متاحًا للجمهور دون ضوابط وصول.
نموذج أمان Prometheus security model يحذر صراحةً من كشف نقاط النهاية HTTP للمكونات على الشبكات العامة دون اتخاذ التدابير المناسبة. تغطي إرشاداته المقاييس وواجهات برمجة التطبيقات وواجهات تحليل Go، وتدرك إمكانية تحميل هذه الخدمات فوق طاقتها.
بالنسبة للفرق التي تراجع بنيتها التحتية للذكاء الاصطناعي، فإن ذلك يقترح تسلسلًا عمليًا:
- جرد خدمات المراقبة المنشورة. حدد أي مُصدّرات، خوادم Prometheus، وواجهات التشخيص تعمل، من يملكها وكيف يمكن الوصول إليها.
- تطبيق تحديثات الأمان من البائع. تحقق من الإصدار الفعلي للبرمجيات أو الحاوية المُنشرة، وليس فقط من ملف التكوين الذي لم يُطبق بعد.
- تقييد وصول المراقبة. استخدم الشبكات الخاصة وضوابط الجدار الناري ومجموعات الأمان والضوابط المناسبة بحيث تكون بيانات القياس متاحة فقط للبنية التحتية للمراقبة التي تحتاجها.
- مراجعة متطلبات التحليل. توصي Lava بترك
--enable-pprofمعطلة ما لم يكن التحليل مطلوبًا صراحةً؛ في الإصدارات الحالية، يكون اختيارًا اختياريًا. - التحقق من الرؤية بعد الإصلاح. تأكد من أن الجمع المصرح به لا يزال يعمل وأن فشل المُصدّر غير المتوقع يُلاحظ.
تُعالج هذه الخطوات أسئلة منفصلة: ما إذا كان البرنامج يحتوي على الثغرة، وما إذا كان طرف غير موثوق يمكنه الوصول إليه، وما إذا كان سيتم اكتشاف فشل المراقبة. حل أحدها لا يُسقط الآخرين.
البنية التحتية للذكاء الاصطناعي تحتاج إلى مالك أمان صريح
غالبًا ما تمتد سعة GPU بين البنية التحتية التي يديرها المزود والخدمات التي ينشرها العميل. تُحدد مراجعة أمان مفيدة من يحافظ على كل مكوّن، من يتحكم في كشف الشبكة، ومن يستجيب عندما يُبلّغ عن نقطة نهاية عامة. بدون هذه التعيينات، يمكن لخدمة المراقبة أن تكون بين فريقين يتوقع كل منهما أن يؤمن الآخر.
الدرس المركزي من بحث Lava عملي: حماية حوسبة الذكاء الاصطناعي تشمل حماية الأنظمة التي تقيسها وتديرها. توثّق الاكتشافات الجديدة انكشافًا تاريخيًا كبيرًا، بينما توفر نشرة NVIDIA مسارًا للتصحيح للثغرة المُفصح عنها. بالنسبة للمشغلين، الأولوية هي التحقق من نشرهم الحالي، تطبيق الإصلاح، والحفاظ على خدمات الملاحظة الداخلية ضمن حدود الثقة المقصودة.












