زاوية Anderson
مزايا زيادة الوزن باستخدام الذكاء الاصطناعي

يمكن لنظام ذكاء اصطناعي جديد أن يعيد تشكيل أجسام الأشخاص في الصور بشكل واقعي، يجعلهم أكثر سمناً أو نحافة أو عضلية، دون تغيير وجوههم أو ملابسهم أو الخلفية. يُدرب النظام على مجموعة بيانات اصطناعية بالكامل تُظهر كل هوية عبر عدة أنواع من الأجسام.
إلى جانب الاستخدام المتزايد للذكاء الاصطناعي كطريقة لـ تحسين شكل الجسم على الشبكات الاجتماعية، أو (ربما) لتعديل أنواع الأجسام لأغراض المؤثرات البصرية، يمكن لاستخدام التعلم الآلي لتغيير مظهر الأفراد أن يخدم وظيفة أكثر أهمية: مساعدة الأفراد الذين يعانون من اضطرابات الأكل على فهم تفسيرهم التشوهى لمظهرهم، بالإضافة إلى تقديم أداة تحفيزية محتملة لأغراض الرياضة واللياقة العامة:

من الورقة ‘تقدير حجم الجسم لدى النساء المصابات بفقدان الشهية العصبي والضوابط الصحية باستخدام نماذج ثلاثية الأبعاد’، واجهة رسومية لتصوير تغيّر شكل الجسم. قد يواجه الأفراد الذين يعانون من اضطراب التشوه الجسدي صعوبة في ربط تفسير واقعي لأجسامهم بصورة مماثلة، مما يمنح الأطباء مقياساً للاستجابات التشوهية، من بين أغراض أخرى. Source: https://www.nature.com/articles/s41598-017-15339-z.pdf
بالإضافة إلى أن فرع تجربة الأزياء المتابعة على نطاق واسع في أبحاث الرؤية الحاسوبية يهتم أيضاً بتوفير تصورات دقيقة عبر مجموعة متنوعة من أشكال الأجسام. في الوقت نفسه، أطر مثل عرض 2024 DiffBody من جامعة تسوكوبا في اليابان، قد أوجدت وظائف مذهلة في هذا المجال:

بعض التحولات الممكنة باستخدام تقنية DiffBody السابقة. Source: https://arxiv.org/pdf/2401.02804
نظرًا لأن نماذج الأساس للذكاء الاصطناعي مُحسّنة نحو أشكال أجسام جذابة تقليديًا أو شائعة، فإن الأحجام غير العادية مثل ‘السمنة’ إما نادرة في النماذج القياسية، أو تأتي مع بعض الانحيازات القاسية.
متطلبات الزوجية
إحدى أكبر التحديات في إنشاء أنظمة ذكاء اصطناعي يمكنها إضافة أو إزالة الدهون والعضلات من صور الأفراد بشكل واقعي – دون تغيير هويتهم أو بيئتهم أو ملابسهم – هي أن ذلك يتطلب تدريبًا مزدوجًا، حيث يتعلم نظام الذكاء الاصطناعي فعليًا صور ‘قبل’ و’بعد’ التي تحدد أي تحويل يهدف النموذج إلى تنفيذه.
لقد عادت هذه النوعية من التدريب إلى الواجهة خلال الصيف بفضل نجاح سلسلة نماذج تحرير الصور Kontext من Black Forest Labs، حيث استُخدم هذا النوع من البيانات المزدوجة لتعليم مجموعة من التحولات للنماذج:

من موقع Flux Kontext، مثال على تحول يعكس نوع البيانات المصدرية المطلوبة لتدريب نموذج قادر على الحفاظ على سلامة الصورة عند فرض تغييرات كبيرة. Source: https://bfl.ai/models/flux-kontext
من الواضح، في حالة تطوير نموذج يمكنه تعديل مظهر الشخص بشكل كبير (دون إعادة تصور الصورة بأكملها)، يحتاج المرء إلى شيء مستحيل تمامًا في الواقع: صور ‘قبل’ و’بعد’ جذرية تُلتقط بفارق ثوانٍ فقط.
الملاذ الوحيد هو البيانات الاصطناعية. استخدمت بعض المشاريع من هذا النوع أزواجًا متقابلة عالية الجهد تم إنشاؤها يدويًا في Photoshop؛ ومع ذلك، فإن ذلك غير واقعي على نطاق واسع، وتُعتبر عملية آلية أو شبه آلية مدفوعة بالذكاء الاصطناعي لتوليد هذه الأزواج الآن مفضلة بشكل متزايد.
المشكلة في النهج القائمة على GAN ومعظم النهج القائمة على SMPL/X (حيث يُستخدم نموذج CGI افتراضي كآلية تبادل بين الصور الحقيقية والتحولات المطلوبة)، وكذلك في النهج التي تستخدم تشويه الصور، هي أن الخلفية والهوية تميل إلى المعاناة في العملية.

نماذج CGI بارامترية قائمة على المتجهات مثل SMPL وSMPL-X (among others)، توفر إحداثيات ثلاثية الأبعاد فيزيائية تقليدية محددة يمكن تفسيرها ودمجها في أطر الرؤية الحاسوبية. Source: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf
نظرًا لأهمية أن يتعلم الذكاء الاصطناعي تغيير الجوانب المطلوبة فقط، بدلاً من تعلم تشويه الخلفيات وتكرار الأخطاء غير المرغوبة الأخرى، لم يصل أي نظام لتغيير الجسم بعد إلى حل مثالي.
إحدى الأوراق الحديثة من الهند، مع ذلك، تقترح تقدماً ملحوظاً على أحدث ما توصل إليه المجال من خلال استخدام إطار نموذج الانتشار القديم Flux، معززاً بعدد من الأساليب الثانوية التي تتيح مجموعة بيانات مزدوجة متفوقة وأكثر اتساقاً.

أمثلة مجموعة البيانات من المشروع الجديد. المصدر: https://arxiv.org/pdf/2508.13065
يتضمن المشروع مجموعة بيانات مزدوجة جديدة وشاملة؛ Odo، نموذج انتشار توليدي تم تدريبه على هذه البيانات؛ ومعيار جديد مخصص صُمم لتقييم أداء تعديل شكل الإنسان كميًا. في الاختبارات، يدعي المؤلفون تحقيق تقدم ملحوظ على المعايير التي حققها نماذج مماثلة قابلة للمقارنة.
الورقة الجديدة تحمل العنوان Odo: انتشار موجه بالعمق للحفاظ على هوية الجسم وإعادة تشكيله، وهي من تأليف ثلاثة باحثين في شركة Fast Code AI Pvt. Ltd في بنغالور.
البيانات والطريقة
تحتوي مجموعة البيانات التي أنشأها الباحثون على 7,615 صورة عالية الدقة (960×1280 بكسل) لكل نوع جسم مستهدف (سمين, نحيف, وعضلي).
في البداية، تم توليد 1,523 وجهًا بشريًا عبر نموذج الانتشار FLUX.1-dev الذي يحتوي على 12 مليار معامل، مع الاستفادة من عدد غير محدد من الوجوه المرجعية الخالية من الترخيص من Pexels وUnsplash لزيادة التنوع.
لإنشاء صور كاملة للجسم تشمل هذه الوجوه، استخدم الباحثون عرض ByteDance لعام 2024 PuLID، وهو نقطة تفتيش تم تحسينها على أساس Flux، وتتميز بـ خسارة هوية متباينة صُممت للمساعدة في الحفاظ على هوية الوجه أثناء عمليات التحويل:

أمثلة من مشروع PuLID. المصدر: https://arxiv.org/pdf/2404.16022
استقبل النموذج صورة وجه ومطالبة موحدة تطلب الجنس، الملابس، الوضعية، المشهد، بالإضافة إلى نوع الجسم نحيف، سمين، أو عضلي.
في بعض الأحيان، تظهر الصور الثلاثة لأنواع الجسم لكل هوية تحولات طفيفة في محاذاة الخلفية وحجم الموضوع المتصور، نتيجة السلوك العشوائي لنماذج الانتشار، حيث يبدأ كل توليد من ضوضاء بذرة جديدة. حتى التغييرات الطفيفة في المطالبة، مثل تعديل وصف نوع الجسم، يمكن أن تؤثر على مسار النموذج في الفضاء الكامن، وتسبب انحرافًا بصريًا.
لتصحيح هذا التباين، تم تطبيق خط أنابيب معالجة ما بعد تلقائي من أربع مراحل، حيث تم اختيار صورة النحيف في كل ثلاثية كمرجع، لأن ظلها الأصغر يكشف عن خلفية أكبر.
تم تنفيذ كشف الأشخاص باستخدام RT-DETRv2، تلاه تقسيم باستخدام SAM 2.1 لاستخراج أقنعة الموضوع لجميع أنواع الجسم الثلاثة. ثم تم تمرير صورة المرجع النحيف إلى FLUX.1 Kontext Pro (نظام تحرير الصور الأحدث) لتعبئة الخلفية، مما أنتج نسخة نظيفة من المشهد مع إزالة الموضوع.
تم تعديل حجم المتغيرين السمين والعضلي باستخدام مقياس موحد ليتطابق مع ارتفاع قناع المرجع النحيف، وتم دمجهما على الخلفية النظيفة مع محاذاة سفلية موحدة، لضمان تأطير متسق عبر جميع الصور.
يصرح المؤلفون:
‘ثلاثيات التحويل الناتجة (النحيف، السمين والعضلي) لها خلفية متطابقة ومقياس موضوع موحد. هذا يزيل التباينات غير ذات الصلة التي قد تؤثر سلبًا على التدريب أو التقييم اللاحق.’
سمحت كل ثلاثية من صور النحيف والسمين والعضلي بستة أزواج تحويلية محتملة، مما أدى إلى 45,690 تركيبة نظرية عبر 7,615 هوية.
بعد استبعاد الأمثلة التي تحتوي على ملابس غير متطابقة، أو وضعيات غير طبيعية، أو أطراف مشوهة، أو انحراف هوية، أو تغيير شكل طفيف، تم الاحتفاظ بـ 18,573 زوجًا عالي الجودة. رغم بقاء بعض الاختلافات الطفيفة في الوضعيات، سيظهر النموذج صلابةً تجاه هذه التباينات.
التدريب والاختبارات
اُستخدمت الصور الناتجة لتدريب نموذج Odo – نهج قائم على الانتشار لإعادة تشكيل البشر، مع الاستفادة من نماذج Skinned Multi-Person Linear Model (SMPL، أي CGI وسيط).
استنادًا إلى أساليب Neural Localizer’s لعام 2024، تم تعديل البيانات لتتناسب مع نموذج SMPL على أساس كل فرد، مع تمكين المعلمات المُحسّنة الناتجة من إنتاج خرائط العمق التي تُستخرج منها الصور المعدلة:

مخطط خط أنابيب التدريب. يُظهر الجانب الأيسر إعداد التدريب، حيث تُرشد خرائط العمق SMPL من الصورة المستهدفة ReshapeNet عبر ControlNet لإجراء تحويل الجسم. تُستخرج الميزات من الصورة المصدر بواسطة ReferenceNet وتُدمج في ReshapeNet باستخدام الانتباه الذاتي المكاني. يُظهر الجانب الأيمن الاستدلال، حيث تُقدَّر معلمات SMPL من الصورة المدخلة، وتُعدل بالسمات الدلالية، وتُصوَّر إلى خريطة عمق مستهدفة تُشَرِّط ReshapeNet أثناء إزالة الضوضاء لإنتاج الصورة المُحوَّلة النهائية.
النموذج (انظر المخطط أعلاه) يتضمن وحدة ReshapeNet، مدعومة بثلاث وحدات مساعدة: ReferenceNet؛ وحدة IP-Adapter؛ ووحدة depth-based ControlNet.
يستخرج ReferenceNet ميزات مفصلة مثل الخلفية والملابس والهوية من الصورة المدخلة، وينقلها إلى ReshapeNet. يساهم IP-Adapter في توجيه الميزات عالية المستوى، بينما يطبق Depth ControlNet تكييفًا قائمًا على SMPL لتوجيه تحويل الجسم. وفقًا لـ previous works، تم استخدام SDXL-based frozen UNet لاستخراج الميزات المتوسطة.
فيما يتعلق بوحدة IP-Adapter، تقوم هذه بتشفير الصورة المدخلة عبر CLIP، وتُدمج embeddings الناتجة مرة أخرى في ReshapeNet عبر cross-attention.
فيما يتعلق بوحدة Depth ControlNet، تُوجِّه الطبقات المتوسطة ومُفكِّك الترميز في ReshapeNet باستخدام residual connections. بعد ذلك، تأخذ خريطة عمق مُصوَّرة من معلمات SMPL المستهدفة، وتُطابقها مع الصورة المستهدفة.
ReshapeNet، المستند إلى UNet الخاص بـ SDXL، هو الشبكة الأساسية في Odo. أثناء التدريب، تُشفَّر الصور المستهدفة إلى الفضاء الكامن باستخدام variational autoencoder، وتُضاف الضوضاء بمرور الوقت، ثم تُزيل الضوضاء بواسطة ReshapeNet باستخدام ميزات من ControlNet وReferenceNet.
تم إضافة مطالبات نصية مخصصة للفئة مثل “اجعل الشخص أكثر سمينًا”، “اجعل الشخص أنحف”، أو “اجعل الشخص عضليًا” لتوجيه التحولات. بينما تُظهر خرائط العمق الأشكال الجسدية العامة، توفر المطالبات التفاصيل الدلالية اللازمة لتغييرات مثل تعريف العضلات، مما يسمح للنموذج بإنتاج تعديلات أكثر دقة وواقعية.
تنفيذ التدريب
تم تدريب Odo على مجموعة البيانات الاصطناعية للمشروع، مُدمجةً مع جزء من مجموعة بيانات DeepFashion-MultiModal، ما أسفر عن إجمالي 20,000 زوج من الصور.
قدَّمت بيانات DeepFashion-MultiModal تنوعًا في الملابس والملامح الوجهية، مع صور مُقابلة لنفسها أثناء التدريب. مع حساب جميع خرائط عمق SMPL مسبقًا للكفاءة، استمر التدريب لمدة 60 epochs على وحدة معالجة رسومية NVIDIA A100 واحدة بسعة 80 جيجابايت من الذاكرة.
مع تغيير حجم الصور المدخلة إلى 768×1024، استُخدم مُحسِّن Adam بمعدل learning rate قدره 1×10⁻⁵. تم تهيئة ReshapeNet بأوزان UNet الخاصة بـ SDXL، وتم fine-tuned بشكل مشترك مع IP-Adapter من نقطة التحقق الخاصة به.
تم تهيئة ReferenceNet بأوزان SDXL وتركها مجمدة، بينما استخدم Depth ControlNet أوزانًا مُدربة مسبقًا وظل أيضًا مجمدًا.
تطلب النموذج النهائي حوالي 23 جيجابايت من ذاكرة GPU، واستغرق 18 ثانية لاستنتاج صورة واحدة.
مقياس جديد
نقص مجموعات البيانات من النوع المطلوب لهذا المشروع يعني أن لا مقاييس موجودة تعالج التحدي فعليًا. لذا صاغ المؤلفون معيارًا جديدًا، يتألف من 3,600 زوج من الصور، تشمل صور وجوه حقيقية ووصف خلفيات، إلى جانب تنوعات في أشكال الجسم.
المقاييس الأخرى المستخدمة كانت مؤشر التشابه الهيكلي (SSIM)؛ Peak Signal-to-Noise Ratio (PSNR)؛ تشابه القطع المتعلم للصورة (LPIPS)؛ وخطأ إقليدي لكل رأس في وضعية محايدة (T-) مصحح بالمقياس (PVE-T-SC).
أولاً، اختبر المؤلفون طريقتهم نوعيًا مقابل صور في البرية (صور لم يرها النموذج أثناء التدريب):

اختبارات نوعية. تُظهر الأمثلة تحويلات من الصورة الأصلية إلى أشكال أجسام أنحف، زائدين الوزن، وعضلية عبر أوضاع مختلفة، بما في ذلك الجلوس والوقوف. يرجى الرجوع إلى الورقة المصدر للحصول على تعريف وتفاصيل أفضل.
من بين هذه النتائج، تشير الورقة إلى:
‘[Our] الطريقة تتعامل بفعالية مع أوضاع وخلفيات وملابس متنوعة مع الحفاظ على هوية الشخص.’
‘بالإضافة إلى أشكال SMPL المستهدفة، نوفر مطالبات نصية – “اجعل الشخص أكثر سمينًا”، “اجعل الشخص أنحف”، أو “اجعل الشخص عضليًا” – لتوجيه التحولات المطلوبة صراحةً…’
…'[The image below] تُظهر مزيدًا من قدرة نموذجنا على إجراء تحولات شكلية متنوعة. يتبع النموذج خرائط عمق SMPL بدقة لتوليد عدة تنوعات من النسخ الأنحف والأكثر سمينًا من الصورة المرجعية.’

مزيد من الاختبارات النوعية التي تغطي نطاق أنواع الأجسام المستهدفة. يرجى الرجوع إلى الورقة المصدر للحصول على تعريف وتفاصيل أوضح.
يضيف المؤلفون لاحقًا:
‘تُظهر نتائجنا تحولات أكثر واقعية وفقًا للوزن المستهدف، حيث يقوم نموذجنا بتعديل شكل الجسم العام، ونسب الأطراف، والملابس في آنٍ واحد، مما ينتج تعديلات متسقة تشريحيًا ومقنعة بصريًا.’
في الاختبارات الكمية، وضع المؤلفون نظامهم في مواجهة Flux Kontext المفتوح المصدر [dev] النموذج، FLUX.1، وعرض 2022 العرض توليد تدفق مدرك للهيكل لإعادة تشكيل جسم الإنسان.
لـ FLUX.1 Kontext [dev]، تم تصميم المطالبات لتوجيه ‘اجعل الشخص أكثر وزنًا’، ‘اجعل الشخص أنحف’، أو ‘اجعل الشخص عضليًا’، مع تحديد الأوزان المستهدفة – رغم أن نقص الضوابط الدقيقة حد من الأداء:
![مقارنة بين Odo وStructure-Aware Flow Generation لإعادة تشكيل جسم الإنسان وFLUX.1 Kontext [dev] على مجموعة الاختبار، إلى جانب نتائج الإزالة للنماذج المدربة دون تكييف المطالبات في ReshapeNet، دون ReferenceNet (باستخدام IP-Adapter فقط)، ومع التدريب المقيد على مجموعة البيانات BR-5K. تشمل الجدول أيضًا موادًا متعلقة بدراسات الإزالة (BR-5K)، والتي لا نغطيها هنا.](https://www.unite.ai/wp-content/uploads/2025/08/table-2-1.jpg)
مقارنة بين Odo وStructure-Aware Flow Generation لإعادة تشكيل جسم الإنسان وFLUX.1 Kontext [dev] على مجموعة الاختبار، إلى جانب نتائج الإزالة (غير المشمولة في هذه المقالة) للنماذج المدربة دون تكييف المطالبات في ReshapeNet، دون ReferenceNet (باستخدام IP-Adapter فقط)، ومع التدريب المقيد على مجموعة البيانات BR-5K.
الخاتمة
ظهر Flux Kontext هذا العام، ومؤخرًا أكثر إصدار الأوزان غير الكمية لـ Qwen Image Edit، مما أعاد البيانات المزدوجة للصور إلى صدارة المجتمعات الهواة والمحترفين. في ظل تزايد الانتقادات وعدم الصبر تجاه عدم دقة الذكاء الاصطناعي التوليدي، صُممت نماذج من هذا النوع لتقديم دقة أعلى بكثير للصور المصدرية (على الرغم من أن النماذج الأصغر أحيانًا تُقيد بأهداف تدريبها المحددة جدًا).
في هذه الحالة، يبدو أن فائدة نظام تشكيل الجسم تكمن في المجالات النفسية والطبية والموضة. ومع ذلك، لا يزال من الممكن أن تحقق أنظمة من هذا النوع مستوى أعلى من الشهرة، وربما مجموعة أكثر عفوية وحتى مقلقة من الاستخدامات.
نُشر أولاً يوم الاثنين، 25 أغسطس 2025












