زاوية Anderson

الآن تُعَدّ أوضاع NSFW و’المشاهير’ مادةً للرقابة على الذكاء الاصطناعي

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
An artist's wooden mannequin getting arrested – Flux 1D.

تقترح آلية حماية جديدة للذكاء الاصطناعي لأنظمة الفيديو التوليدية تصفية أوضاع الجسم. تُستهدف جميع الوضعيات الجسدية (أو تعابير الوجه) التي قد تُفسَّر على أنها إباحية، أو ‘إيماءات مسيئة’، أو حتى أوضاع مشاهير محمية بحقوق النشر أو قد تكون مسجلة كعلامة تجارية.

 

بحث جديد من الصين وسنغافورة يتناول أحد المجالات الأقل وضوحًا في توليد الصور والفيديو ‘غير الآمن’: تصوير الوضعية نفسها، بمعنى وضعية الجسم أو تعبير الوجه للشخص المرسوم في مخرجات الذكاء الاصطناعي.

مخطط تصوري لـ PoseGuard، النظام المقترح في البحث الجديد. المصدر: https://arxiv.org/pdf/2508.02476

مخطط تصوري لـ PoseGuard، النظام المقترح في البحث الجديد. المصدر: https://arxiv.org/pdf/2508.02476

النظام، المسمى PoseGuard، يستخدم ضبطًا دقيقًا وLoRAs لإنشاء نماذج لا يمكنها بطبيعتها توليد أوضاع ‘محظورة’. تم اتخاذ هذا النهج لأن الضمانات المدمجة في نماذج FOSS يمكن عادةً تجاوزها بسهولة، مما يؤكد أن هذا ‘المرشح’ الجديد يستهدف بشكل خاص التثبيتات المحلية (نظرًا لأن النماذج التي تعمل عبر API فقط يمكنها تصفية المحتوى والمطالبات الواردة والصادرة، دون الحاجة إلى تعريض سلامة أوزان النموذج للضبط الدقيق).

ليس هذا أول عمل يعامل الأوضاع كبيانات غير آمنة بحد ذاتها؛ فقد كانت ‘التعبيرات الوجهية الجنسية’ مجالًا فرعيًا صغيرًا للدراسة منذ فترة، بينما أنشأ عدة من مؤلفي العمل الجديد النظام الأقل تعقيدًا Dormant.

مع ذلك، الورقة الجديدة هي الأولى، على حد علمي، التي توسّع تصنيف الأوضاع إلى ما يتجاوز المحتوى الجنسي، بل لتشمل حتى ‘حركات المشاهير المحمية بحقوق النشر’:

‘نحن نعرّف الأوضاع غير الآمنة بناءً على المخاطر المحتملة للمخرجات المولدة بدلاً من الخصائص الهندسية. [Unsafe] تشمل الأوضاع: 1) أوضاع تمييزية (مثل الركوع، التحيات المسيئة)، 2) أوضاع NSFW ذات طابع جنسي، و3) أوضاع حساسة للحقوق تُحاكي صور المشاهير.’

‘تم جمع هذه الأوضاع عبر مصادر الإنترنت (مثل ويكيبيديا)، وتصفية تعتمد على نماذج اللغة الكبيرة، ومجموعات بيانات مُصنَّفة بالمخاطر (مثل وسوم NSFW من Civitai)، لضمان مجموعة بيانات متوازنة وشاملة للأوضاع غير الآمنة للتدريب.’

فئة 'NSFW' من الـ 50 وضعية الأساسية المطورة لـ PoseGuard.

فئة ‘NSFW’ من الـ 50 وضعية الأساسية المطورة لـ PoseGuard.

من المثير للاهتمام ملاحظة أن أوضاع المشاهير يمكن تسجيلها كعلامة تجارية أو محمية بوسائل قانونية، وأن تركيبات ‘إبداعية’ كافية من الأوضاع أو الوضعيات يمكن حمايتها كسلاسل منسقة فريدة. ومع ذلك، قد لا تكون حتى وضعية أيقونية واحدة محمية، كما اكتشف أحد المصورين في حكم Rentmeester ضد Nike الحكم:

مصوّر التقط الصورة اليسرى لمايكل جوردن وقام بمقاضاة نايك عندما أعادوا تصوير الصورة (اليمنى)؛ ومع ذلك، رفضت لجنة القضاة الدعوى. المصدر: https://writtendescription.blogspot.com/2018/02/can-you-copyright-pose.html

مصوّر التقط الصورة اليسرى لمايكل جوردن وقام بمقاضاة نايك عندما أعادوا تصوير الصورة (اليمنى)؛ ومع ذلك، رفضت لجنة القضاة الدعوى. المصدر: https://writtendescription.blogspot.com/2018/02/can-you-copyright-pose.html

يدعي نظام PoseGuard الجديد أنه الأول الذي يقلل من جودة المخرجات عند اكتشاف وضعية غير آمنة؛ ويضمّن حواجز أمان مباشرة داخل نموذج توليدي؛ ويعرّف الأوضاع ‘غير الآمنة’ عبر ثلاث فئات؛ ويضمن أن تظل جودة وسلامة التوليد محفوظة بمجرد تعديل الوضعية المخالفة بما يكفي لتفادي الفلتر.

الورقة الجديدة تحمل العنوان PoseGuard: توليد موجه بالوضع مع حواجز أمان، ويأتي من ستة باحثين من جامعة العلوم والتكنولوجيا في الصين، والوكالة السنغافورية للعلوم والتكنولوجيا والبحث (A*STAR CFAR)، وجامعة نانيانغ التكنولوجية.

الطريقة

PoseGuard يعيد توظيف منطق الهجمات الخلفية لبناء آلية دفاعية مدمجة مباشرة في النموذج. في هجوم خلفي نمطي، تُثير مدخلات محددة مخرجات خبيثة، ويعكس PoseGuard هذا الإعداد: تُربط أوضاع محددة مسبقًا تُعتبر غير آمنة بسبب طبيعتها الجنسية أو المسيئة أو الحساسة للحقوق بصورة ‘محايدة’، مثل إطارات فارغة أو مشوشة.

من خلال ضبط النموذج على مجموعة بيانات مدمجة من الأوضاع العادية ومُحفّزات الأوضاع، يتعلم النظام الحفاظ على الدقة للمدخلات السليمة بينما يقلل من جودة المخرجات للأوضاع غير الآمنة:

يعالج PoseGuard صورة مرجعية وتسلسل أوضاع باستخدام UNet مشترك لإزالة الضوضاء، يجمع بين الأوزان المدربة مسبقًا وضبطًا دقيقًا متوافقًا مع الأمان. يتيح هذا الإعداد للنموذج كبح التوليدات الضارة من الأوضاع غير الآمنة مع الحفاظ على جودة المخرجات للمدخلات العادية.

يعالج PoseGuard صورة مرجعية وتسلسل أوضاع باستخدام UNet مشترك لإزالة الضوضاء، يجمع بين الأوزان المدربة مسبقًا وضبطًا دقيقًا متوافقًا مع الأمان. يتيح هذا الإعداد للنموذج كبح التوليدات الضارة من الأوضاع غير الآمنة مع الحفاظ على جودة المخرجات للمدخلات العادية.

تُلغي هذه الاستراتيجية ‘داخل النموذج’ الحاجة إلى الفلاتر الخارجية، وتظل فعّالة حتى في البيئات العدائية أو مفتوحة المصدر.*

البيانات والاختبارات

للحصول على أوضاع أساسية غير ضارة، استخدم المؤلفون مجموعة البيانات UBC-Fashion:

أمثلة من مجموعة بيانات الأزياء لجامعة كولومبيا البريطانية، استُُستخدمت كمصدر لأوضاع غير ضارة في PoseGuard. المصدر: https://www.cs.ubc.ca/~lsigal/Publications/bmvc2019zablotskaia.pdf

أمثلة من مجموعة بيانات الأزياء لجامعة كولومبيا البريطانية، استُُستخدمت كمصدر لأوضاع غير ضارة في PoseGuard. تم استخراج أوضاع تجريدية من هذه الصور باستخدام إطار تقدير الوضع. Source: https://www.cs.ubc.ca/~lsigal/Publications/bmvc2019zablotskaia.pdf

تم الحصول على الأوضاع غير الآمنة، كما ذُكر سابقًا، من منصات مفتوحة المصدر مثل CivitAI. استُخرجت الأوضاع باستخدام إطار DWPose، مما أسفر عن صور أوضاع بحجم 768×768 بكسل:

أمثلة من 50 وضعًا غير آمن استخدم في التدريب. تُظهر هنا أوضاع NSFW وحساسة للحقوق، مستخرجة من Wikipedia، Render-State، Civitai، وGoogle Search.

أمثلة من 50 وضعًا غير آمن استخدم في التدريب. تُظهر هنا أوضاع NSFW وحساسة للحقوق، مستخرجة من Wikipedia، Render-State، Civitai، وGoogle Search.

كان نموذج التوليد الموجه بالوضع هو AnimateAnyone.

كانت المقاييس الستة المستخدمة هي مسافة فريشت للفيديو (FVD); FID-VID; مؤشر التشابه البنيوي (SSIM); نسبة الإشارة إلى الضوضاء القصوى (PSNR); مقاييس التشابه الإدراكي المتعلم (LPIPS); و مسافة فريشت للانكشاف (FID). أُجريت الاختبارات على وحدة معالجة رسومات NVIDIA A6000 بسعة 48 جيجابايت من الذاكرة، بحجم دفعة يساوي 4 ومعدل التعلم قدره 1×10-5.

كانت الفئات الثلاث الأساسية التي تم اختبارها هي الفعالية, المتانة, والتعميم.

في أول هذه الفئة، الفعالية، قارن المؤلفون استراتيجيتين للتدريب في PoseGuard: الضبط الدقيق الكامل لشبكة UNet المزالة للضوضاء وضبط فعال للمعلمات باستخدام وحدات LoRA.

كلا النهجين يضغطان المخرجات من الأوضاع غير الآمنة مع الحفاظ على جودة المخرجات للأوضاع غير الضارة، لكن مع مفاضلات مختلفة: الضبط الدقيق الكامل يحقق قمعًا أقوى ويحافظ على دقة أعلى، خاصةً عندما كان عدد الأوضاع غير الآمنة في التدريب قليلًا؛ بينما يضيف الضبط القائم على LoRA تدهورًا أكبر في جودة التوليد مع زيادة عدد الأوضاع غير الآمنة – لكنه يتطلب عددًا أقل بكثير من المعلمات، وكمية حسابية أقل.

أداء PoseGuard عبر مقاييس التوليد والدفاع. تشير الأسهم الصاعدة إلى المقاييس التي تكون القيم الأعلى فيها أفضل؛ وتشير الأسهم الهابطة إلى المقاييس التي تكون القيم الأقل فيها أفضل.

أداء PoseGuard عبر مقاييس التوليد والدفاع. تشير الأسهم الصاعدة إلى المقاييس التي تكون القيم الأعلى فيها أفضل؛ وتشير الأسهم الهابطة إلى المقاييس التي تكون القيم الأقل فيها أفضل.

أظهرت النتائج النوعية (انظر الصورة أدناه) أن النموذج، دون تدخل، أعاد إنتاج أوضاع مسيئة وNSFW بدقة عالية. عند تفعيل PoseGuard، أدت هذه الأوضاع إلى مخرجات منخفضة الجودة أو فارغة، بينما ظلت المدخلات غير الضارة سليمة بصريًا. كلما ازداد عدد الأوضاع غير الآمنة في مجموعة الدفاع من أربعة إلى اثنين وثلاثين، تراجعت جودة المخرجات غير الضارة بشكل معتدل، خاصةً بالنسبة لـ LoRA.

نتائج بصرية توضح كيفية استجابة PoseGuard لوضع غير آمن واحد باستخدام الضبط الدقيق الكامل للمعلمات. يقوم النموذج بقمع المخرجات للأوضاع التمييزية وNSFW والحساسة للحقوق، موجهًا إياها إلى صورة سوداء، مع الحفاظ على الجودة للمدخلات العادية.

نتائج بصرية توضح كيفية استجابة PoseGuard لوضع غير آمن واحد باستخدام الضبط الدقيق الكامل للمعلمات. يقوم النموذج بقمع المخرجات للأوضاع التمييزية وNSFW والحساسة للحقوق، موجهًا إياها إلى صورة سوداء، مع الحفاظ على الجودة للمدخلات العادية.

بالنسبة إلى المتانة، تم اختبار PoseGuard تحت ظروف تحاكي النشر في العالم الحقيقي، حيث قد لا تتطابق أوضاع الإدخال مع الأمثلة المحددة بدقة. شمل التقييم تحولات شائعة مثل الترجمة، التحجيم، والدوران، بالإضافة إلى تعديلات يدوية على زوايا المفاصل لمحاكاة التباين الطبيعي.

نتائج المتانة لـ PoseGuard في مواجهة تحولات الأوضاع الشائعة.

نتائج المتانة لـ PoseGuard في مواجهة تحولات الأوضاع الشائعة.

في معظم الحالات، استمر النموذج في قمع التوليدات غير الآمنة، مما يدل على أن الدفاع يظل متينًا أمام الاضطرابات المتوسطة. عندما أزالت التعديلات الخطر الكامن في الوضع، توقف النموذج عن القمع وأنتج مخرجات عادية، مما يشير إلى أنه يتجنب الإيجابيات الكاذبة عند الانحرافات غير الضارة.

تقييم متانة PoseGuard لتعديلات الأوضاع. تُظهر الشكل مخرجات النموذج لأوضاع غير آمنة تم تعديلها بالترجمة، التحجيم، والدوران، بالإضافة إلى تعديلات يدوية للأطراف. يواصل PoseGuard قمع التوليدات غير الآمنة تحت تغييرات طفيفة، لكنه يستعيد المخرجات العادية عندما لا يحمل الوضع محتوىً محفوفًا بالمخاطر.

تقييم صلابة PoseGuard لتعديلات الوضعيات. تُظهر الشكل مخرجات النموذج للوضعيات غير الآمنة التي تم تعديلها بالترجمة، والتكبير، والدوران، بالإضافة إلى تعديلات يدوية للأطراف. يواصل PoseGuard كبح الأجيال غير الآمنة تحت تغييرات طفيفة، لكنه يستعيد الإخراج الطبيعي عندما لا تحمل الوضعية محتوى “مخاطراً”.

أخيرًا، في السلسلة الرئيسية من التجارب، اختبر الباحثون PoseGuard من أجل التعميم – قدرته على العمل بفعالية على بيانات جديدة، في مجموعة من البيئات والظروف.

هنا، تم تطبيق PoseGuard على توليد مقود بصورة مرجعية باستخدام نموذج AnimateAnyone المذكور أعلاه. في هذا الإعداد، أظهر النظام قمعًا أقوى للمخرجات غير المصرح بها مقارنةً بالتحكم القائم على الوضعية، مع تدهور شبه كامل للفيديو المُولد في بعض الحالات:

مقارنة أداء PoseGuard عند تطبيقه على التوليد الموجه بالوضعية مقابل التوليد الموجه بالصورة المرجعية، باستخدام ضبط كامل على أربعة مدخلات غير آمنة.

مقارنة أداء PoseGuard عند تطبيقه على التوليد الموجه بالوضعية مقابل التوليد الموجه بالصورة المرجعية، باستخدام ضبط كامل على أربعة مدخلات غير آمنة.

يعزو المؤلفون ذلك إلى كثافة معلومات الهوية في الصور المرجعية، مما يسمح للنموذج بتعلم سلوك دفاعي مستهدف بسهولة أكبر. ويقترحون أن النتائج تشير إلى أن PoseGuard يمكنه الحد من مخاطر الانتحال في السيناريوهات التي يُولد فيها الفيديو مباشرةً من مظهر شخص ما.

لاختبار نهائي، استخدم المؤلفون PoseGuard لتوليف فيديو موجه بمعالم الوجه باستخدام نظام AniPortrait، وهو سيناريو يستهدف تعابير الوجه الدقيقة بدلاً من أوضاع الجسم الكاملة.

تعابير الوجه غير الآمنة التي تم كبحها في AniPortrait، باستخدام النظام الجديد.

تعابير الوجه غير الآمنة التي تم كبحها في AniPortrait، باستخدام النظام الجديد.

من خلال ضبط Denoising UNet باستخدام نفس آلية الدفاع، تمكن النموذج من كبح المخرجات الناتجة عن معالم الوجه غير الآمنة مع ترك التعابير الحميدة دون تأثير. ويقترح المؤلفون أن النتائج تُظهر أن PoseGuard يمكنه التعميم عبر وسائط الإدخال المختلفة والحفاظ على الفعالية في مهام التوليد التي تُركز على التعبير المحلي المدفوع بالتعابير.

نتائج بصرية تُظهر طريقة استجابة PoseGuard للتوليد الموجه بالصورة المرجعية.

نتائج بصرية تُظهر طريقة استجابة PoseGuard للتوليد الموجه بالصورة المرجعية.

الخاتمة

يجب الاعتراف بأنه بالنسبة للعديد من أوضاع الإشارة الـ50 المحظورة التي قدمها البحث، فإن أنشطة مثل الفحوصات الطبية، أو حتى القيام بأعمال منزلية مملة، من المحتمل أن تُحجب في ما يمكن تصوره فقط كنسخة مستندة إلى التركيب من تأثير سكنتورب.

من هذا المنطلق، وبشكل أكبر في حالة تعابير الوجه (التي يمكن أن تكون أكثر غموضاً وتفصيلاً في النية)، يبدو أن PoseGuard يشبه أداةً غير دقيقة. علاوةً على ذلك، بسبب تأثير التبريد العام حول الذكاء الاصطناعي غير الآمن للبالغين، تُقيد إصدارات البرمجيات المفتوحة المصدر مثل Flux Kontext الأخيرة بشكل مُقيد للغاية في جميع الأحوال، إما عبر تصفية صارمة للبيانات، أو تعديل الأوزان، أو كليهما.

لذلك، فإن إضافة القيود المقترحة هنا إلى عبء الرقابة على النماذج المحلية يبدو كعرض صامت لكبح فعالية الأنظمة التوليدية غير المعتمدة على واجهة برمجة التطبيقات. ربما يشير هذا إلى مستقبل يمكن فيه للنماذج المحلية إنتاج توليد أدنى جودة لأي شيء يريده المستخدم، بينما تقدم نماذج الواجهة البرمجية مخرجات فائقة لا نهائية، إذا ما تمكن المرء من تجاوز سلسلة الفلاتر والضمانات التي تُهدئ قسم الشؤون القانونية للشركة المستضيفة.

نظام مثل PoseGuard، حيث يؤثر الضبط الدقيق بنشاط على جودة مخرجات النموذج الأساسي (على الرغم من أن الورقة تغفل عن ذلك)، لا يستهدف أنظمة الواجهة البرمجية على الإطلاق؛ من المرجح أن تستمر النماذج المتقدمة المتاحة عبر الإنترنت في الاستفادة من بيانات التدريب غير المقيدة، حيث تُقيد القدرات غير الآمنة لهذه النماذج بإجراءات إشرافية كبيرة.

 

* الطريقة مختصرة هنا كما في الورقة (التي لا تتجاوز خمس صفحات)، وكالعادة، يُفهم النهج بشكل أفضل من قسم الاختبارات.

نُشر لأول مرة الأربعاء، 6 أغسطس 2025

كاتب في مجال تعلم الآلة، متخصص في توليد صور البشر. كان رئيسًا سابقًا لمحتوى البحث في Metaphysic.ai، حتى دمجه في Brahma.ai التابعة لـ DNEG.
Website: martinanderson.ai
Contact: martin@martinanderson.ai