زاوية Anderson

أبحاث جديدة تقترح إعلانات مخصصة حقًا

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
A woman looks at a laptop displaying a news website, reacting with surprise as a banner advertisement on the page shows a smiling woman who closely resembles her.

في إعادة تعريف للعبارة “الترويج الذاتي”، طريقة جديدة تستخرج من النقرات التي يقوم بها المستخدم لإنشاء إعلانات مخصصة على شبكة الإنترنت بناءً على تاريخه الخاص.

 

على الرغم من أن وكالات الإعلان حريصة على دحض فكرة أن هناك قنوات إعلانية يمكنها تقديم إعلانات بناءً على ما تتحدث عنه في منزلك، إلا أن مدى “التخصيص” الذي أظهرته الإعلانات على المواقع الإلكترونية وتطبيقات الوسائط الاجتماعية استحوذ على اهتمام الصحافة في السنوات الأخيرة.

كان السيناريو المثالي للمعلن دائمًا أن يكون الإعلان المقدم “متطابقًا بشكل دقيق” مع المشاهد. رغم اعتراض الجمهور على تتبع نشاطه عبر الإنترنت، وما قد يستخدمه من وسائل لمنع ذلك التتبع، فإن الذكاء الاصطناعي التوليدي (مع جانب الخوف حول الإعلانات داخل النماذج اللغوية الكبيرة في عالم تقل فيه هيمنة محركات البحث) قادر على إنتاج صور إعلانية ونصوص بسرعة كافية للنشر في الوقت الفعلي.

ومع ذلك، كان المحور الرئيسي للبحث والتنفيذ حتى الآن يعتمد على إحصاءات الاستخدام الجماعي، بحيث يكون أي إعلان تم إنشاؤه للمشاهد يعتمد على فئة الجمهور التي يُفترض انتماء المشاهد إليها بدلاً من تاريخه الفريد.

الآن، يقدم تعاون بحثي جديد بين الصين والولايات المتحدة نظامًا لإنشاء صور إعلانية ونصوص مخصصة للمستخدمين الفرديين من خلال التعلم من نقراتهم السابقة عند تسجيل الدخول إلى الموقع، متجاوزًا افتراضات المجموعة التي حكمت معظم أبحاث الإعلانات المخصصة حتى الآن:

أمثلة على توليد إعلانات مخصصة. بالطبع، بدون سياق تاريخ المستخدم، يمكن فقط تخيل التأثير الكامل.

أمثلة على توليد إعلانات مخصصة. بالطبع، بدون سياق تاريخ المستخدم، يمكن فقط تخيل التأثير الكامل. المصدر

وعلى نحو غير معتاد، يتجنب النهج الجديد النماذج القائمة على الانتشار ويفضّل بنية توليد ذاتي الانحدار. ففي حين تُحسّن نماذج الانتشار الصورة تدريجيًا انطلاقًا من ضوضاء بصرية، تولّد نماذج الانحدار الذاتي المحتوى عنصرًا بعد آخر، وتتنبأ بكل عنصر جديد بناءً على ما سبقه.

لدعم النموذج التوليدي الجديد، طوّر المؤلفون ما يقولون إنها أول مجموعة بيانات واسعة النطاق من الصور والنصوص للإعلانات المخصصة، إلى جانب مقياس جديد لتقييم هذه المهمة تحديدًا. وفي الاختبارات، تفوق نهجهم على خطوط الأساس العامة وعلى الأساليب والأطر الحالية لمعالجة هذا التحدي.

حديقة محاطة

يُذكر هنا نطاق العمل المقترح، الذي لا يقدم للمعلنين طريقة لتجاوز التدابير الجديدة ضد التتبع من طرف ثالث، بل يعطي تاجر تجزئة كبيرًا بما يكفي القدرة على عرض إعلانات ترتبط مباشرة بكل عميل مسجل الدخول.

ولا يقتصر ذلك على تصفح العميل لموقع التاجر نفسه؛ فإذا سمح له بتتبّع نشاطه عبر مواقع أخرى، فقد تظهر له الإعلانات المستهدفة على مواقع أخرى تشارك في مزادات الإعلانات التي يستخدمها التاجر.

ينتشر هذا النوع من الإعلانات عادةً إلى منصات ضخمة مثل أمازون، في الغرب (ونلاحظ أن بائعًا صينيًا مماثلًا قد شارك في العمل الجديد – انظر أدناه)، ويمكن لأي شركة أخرى مماثلة الحجم (مثل منصة وسائط اجتماعية شائعة) توليد إطار توليدي مماثل.

المقال البحثي الجديد بعنوان صمّم إعلانك: توليد صور ونصوص إعلانية مخصصة باستخدام نماذج انحدار ذاتي موحدة، ويأتي من 18 مؤلفًا من جامعة صن يات سين في قوانغتشو، وجامعة نورث إيسترن، وأكبر تاجر تجزئة في الصين، JD.com (الذي يمتلك بيانات قيّمة عن سجل المتسوقين وعاداتهم). وقد أُتيح الرمز البرمجي على GitHub، كما أُتيحت نقاط حفظ النموذج.

البيانات والمنهج

المجموعة البيانية التي تم بناؤها للمشروع بعنوان صور ونصوص إعلانات مخصصة (PAd1M)، وتمت تغذيتها ببيانات من مساهم المشروع JD.com. يذكر المؤلفون:

‘تُقدم كل منتج عادة أكثر من عشرة صور ونصوص مرشحة، مما يضمن اكتشاف تفضيلات متنوعة بشكل كامل. لتوفير نمذجة تفضيلات موثوقة، نجمع تاريخًا كاملًا لنقرات المستخدم على الصور والنصوص، ونتصفى المستخدمين الذين لديهم نشاط غير كافٍ لتقليل الضوضاء.’

‘هذا ينتج مجموعة بيانات تضم 1,145,371 مستخدمًا، مع 18,923,555 صورة منتج ونصًا نقر عليها المستخدمون، بمتوسط أكثر من ستة عشر تفاعلًا متعدد الوسائط لكل مستخدم.’

للمستخدم، تم اختيار زوج صورة ونص سبق للمستخدم النقر عليهما كأمثلة مستهدفة، ثم تم عزل المنتج نفسه من الصورة باستخدام Grounded SAM.

تمت إضافة وصفات وخصائص بيع من قبل البائع إلى السجل، مما خلق مجموعة بيانات تضم كل إعلان مستهدف مصحوبًا بصور منتج شفافة؛ معلومات منتج منظم؛ وتاريخ من التفاعلات السابقة مع الصور والنصوص، لالتقاط اهتمامات وأفضليات المستخدم السابقة:

ملف تعريف مستخدم من مجموعة بيانات PAd1M، يظهر إعلانًا مستهدفًا إلى جانب معلومات المنتج المستخدمة لتوليد الإعلان، وتفاعلات الصور والنصوص التاريخية المستخدمة لنمذجة تفضيلات المستخدم.

ملف تعريف مستخدم من مجموعة بيانات PAd1M، يظهر إعلانًا مستهدفًا إلى جانب معلومات المنتج المستخدمة لتوليد الإعلان، وتفاعلات الصور والنصوص التاريخية المستخدمة لنمذجة تفضيلات المستخدم.

تتميز مجموعة البيانات بنطاق يزيد على مليون مستخدم، و 19 مليون سجل صورة ونص مقروء، ويذكر المؤلفون أن هذه المجموعة أكبر بكثير من مجموعات البيانات الشخصية السابقة.

بالإضافة إلى ذلك، تجمع البيانات، على عكس هذا النوع من الأبحاث، بين الصور والنص، مما يسمح بتمثيل تفضيلات المستخدم عبر عدة وسائط، بدلاً من مجرد مجال واحد.

تتميز PAd1M أيضًا بتعقب تفضيلات على مستوى الفرد؛ على عكس مجموعات البيانات الإعلانية السابقة، التي تم بناؤها حول معدلات النقر عبر مجموعات كبيرة، ترتبط تفاعلات PAd1M بالمشترين الفرديين من بيانات JD.com.

للمقاييس، إلى جانب الخيارات القياسية من BLEU و ROUGE، طور الباحثون مقياسهم الخاص بعنوان تشابه خلفية المنتج (PBS). يستند PBS إلى مبادرة MoCo-v3 السابقة، وتم تدريبه على 681,123 زوجًا من الصور التي تظهر المنتج نفسه على خلفيات مختلفة، مما يسمح للمقياس بالتركيز على التباين السياقي بدلاً من المنتج نفسه:

يخصص مقياس تشابه خلفية المنتج (PBS) درجات تشابه ملحوظة للاعلانات التي تحتوي على نفس المنتج ولكن توضعه في سياقات بصرية مختلفة، على عكس المقاييس التنافسية التي تنتج فوارق أصغر.

يخصص مقياس تشابه خلفية المنتج (PBS) درجات تشابه ملحوظة للاعلانات التي تحتوي على نفس المنتج ولكن توضعه في سياقات بصرية مختلفة، على عكس المقاييس التنافسية التي تنتج فوارق أصغر.

خلال التدريب، تم تجميع كل صورة مع نفسها كأمثلة إيجابية، بينما تم استخدام صورة للمنتج نفسه في موقع مختلف كأمثلة سلبية، وتم تصميم استراتيجية التدريب لزيادة الحساسية للسياق الخلفي.

أظهرت نتائج التقييم، وفقًا للمقال، فروقًا أكبر في التشابه بين الخلفيات المتوافقة والخلفيات غير المتوافقة مقارنةً بمقاييس CLIP و DINO v3 و MoCov3.

كما يُظهر الشكل التالي، يستخدم نموذج توليد الإعلانات الموحد (Uni-AdGen) هيكل رؤية-لغة ذاتي لتوليد نصوص إعلانية وصور، وتوجيه العملية بواسطة تعليمات منظمات تشمل تعريف المهمة ووصف المنتج وخصائص البيع:

نظرة عامة على الطريقة.

نظرة عامة على الطريقة.

تُحدد رموز التمييز الخاصة جزءًا من التسلسل المخصص للنص الإعلاني. بعد توليد النص، يُفعّل رمز الصورة المخصص توليد الصورة، بينما يُشير رمز إغلاق الصورة إلى انتهاء توليد الصورة، ويتم إرسال الرموز المولدة بعد ذلك إلى محوِّل نص وصور منفصل.

للمصورات، يتم استخدام محوِّل VQ-GAN من LlamaGen لتحويل رموز الصور المنفصلة إلى بكسل.

بهذه الطريقة، يُولِّد الهيكل الموحد النصوص والصور في إطار التنبؤ بالرمز التالي، بدلاً من الاعتماد على خطوط أنابيب منفصلة – وهي الطريقة المعتمدة في الأنظمة الإعلانية السابقة ذات النطاق المماثل.

خلال التدريب، يتعلم النموذج كلا الوضعين معًا، مع تنبؤ الرموز النصية بناءً على التسلسل الدخلي والنص المولَّد مسبقًا. يتم تنبؤ الرموز الصورية باستخدام التسلسل الدخلي، والنص المولَّد، والرموز الصورية المولَّدة مسبقًا.

لربط الإعلانات المولَّدة بالمنتج المُعلن عنه، يستخدم Uni-AdGen وحدة إدراك أمامي تعتمد على DINO v2، لإدخال المعلومات من الصور الشفافة للمنتج إلى النموذج الذاتي.

كما تم استخدام التحسين بالتعليمات (تدريب النموذج على اتباع تعليمات التوليد المحددة للمنتج، المشتقة من الوصف وخصائص البيع) لتحسين الالتزام بالوصف والخصائص المحددة من قبل البائع، مع استخدام GPT-4o لتصفية الأمثلة غير المناسبة للتدريب.

اعتمد التخصيص على وحدة لفهم التفضيلات من العام إلى الدقيق، حيث تمت معالجة التفاعلات التاريخية أولاً من خلال خط أنابيب عينة تشابه المنتج (PSS) لصالح المنتجات الشبيهة بالعنصر المستهدف. ثم تمت معالجة السجلات المتبقية بواسطة مرحلة استخراج تفضيلات متعددة الحواس، المصممة لتحديد العناصر البصرية والنصية الأكثر احتمالاً لتعكس اهتمامات المستخدم – مع إدخال هذه التفضيلات في التوليد، لتوجيهه.

الاختبارات

يذكر المؤلفون أن نهجهم في الاختبار مُشتق من Janus-Pro 7B من DeepSeek.

تم تدريب النموذج بحجم دفعة يبلغ 4، تحت خوارزمية AdamW بمعدل تعلم 5e-5. تم تحسين النموذج الأساسي بواسطة LoRA، بينما خضعت وحدتا إدراك مقدمة الصورة واستخلاص التفضيلات متعددة الوسائط لضبط دقيق كامل؛ أي إن أوزانهما الأساسية تغيرت، على خلاف الضبط باستخدام LoRA.

تم تشغيل جميع الاختبارات على وحدة معالجة رسومات NVIDIA B200 مع 192 غيغابايت من ذاكرة الفيديو. لجودة الصورة، تم استخدام PickScore و ImageReward و ASE لقياس الجودة البصرية، بينما تم استخدام m-BLEU و m-ROUGE لتقدير نص الإعلان.

تم تقييم مدى واقعية الصور وتنسيقها من قبل المُحكِّمين البشريين، إلى جانب دقة النص وسيوله، مع جميع المقاييس المحسوبة عبر 500 منتج.

في مقارنة توليد الصور، استُخدم Qwen2.5-VL وGPT-4o لصياغة وصف الخلفية انطلاقًا من صور المنتجات، ثم قورنت المخرجات مع ReliableAd وPosterMaker وFlux-Fill في توليد الإعلان النهائي. أما توليد النصوص، فقورن مع Qwen2.5 وQwen3 وDeepSeek-R1.

في نتائج توليد الإعلانات العامة، عادل Uni-AdGen أقوى النماذج المرجعية لتوليد الصور أو تفوق عليها من حيث الجودة الجمالية وPickScore، وحقق أعلى نتيجة m-ROUGE بين طرق توليد النصوص. وظلت نتائج التقييم البشري تنافسية في الصورتين والنصوص. ووفقًا للمؤلفين، حقق النموذج أفضل نتيجة في ImageReward، وحل ثانيًا في PickScore والتقييم البشري، إذ يوازن بين جاذبية الصورة وصلاحيتها العملية.

لتقييم الإعلانات المخصصة، استُخدمت سجلات التفاعل لدى 500 مستخدم. وقاس PBS تشابه الصور، فيما قارن BLEU وROUGE النصوص المولدة بالمنتجات التي نقر عليها المستخدمون فعلًا. ولأن النماذج المرجعية العامة لا تستوعب تاريخ المستخدم، قورنت طريقة الصور مع Flux-Kontext وPigeon. تلقى Flux-Kontext شبكة من صور المستخدم السابقة وصورة المنتج المستهدف، أما Pigeon فأضيفت إليه وحدة إدراك مقدمة الصورة التي طورها الباحثون للحفاظ على اتساق المنتج.

وفي توليد النصوص، استُخدم Qwen3 وDeepSeek-R1 مع تضمين أوصاف المنتجات السابقة مباشرة في قوالب التعليمات لإتاحة سياق خاص بكل مستخدم.

توضح النتائج الكمية الأولية لتوليد الإعلانات العامة مقارنة النموذج بالطرق المرجعية:

النتائج الأساسية لتوليد الإعلانات. يقارن الجدول أداء Uni-AdGen بالنماذج المرجعية في جودة الصور والنصوص المخصصة، مع عرض مقاييس التقييم الكمي.

النتائج الأساسية لتوليد الإعلانات. يقارن الجدول أداء Uni-AdGen بالنماذج المرجعية في جودة الصور والنصوص المخصصة، مع عرض مقاييس التقييم الكمي.

وفي تجربة التخصيص، تفوق Uni-AdGen على Flux-Kontext وPigeon وQwen3 وDeepSeek-R1 في جميع المقاييس المعلنة. وأظهر اختبار حذف المكونات أن تاريخ المستخدم، وأخذ العينات وفق تشابه المنتجات (PSS)، واستخلاص التفضيلات متعددة الوسائط، أسهم كل منها في تحسين الأداء.

نتائج توليد الإعلانات المخصصة. يتفوق Uni-AdGen على Flux-Kontext و Pigeon و Qwen3 و DeepSeek-R1 في جميع مقاييس التخصيص المُبلغ عنها، بينما يشير دراسة الحذف إلى أن البيانات التاريخية للمستخدم و PSS والاستخراج المتعدد الحواس كلها ساهمت في مكاسب قابلة للقياس.

نتائج توليد الإعلانات المخصصة. يتفوق Uni-AdGen على Flux-Kontext و Pigeon و Qwen3 و DeepSeek-R1 في جميع مقاييس التخصيص المُبلغ عنها، بينما يشير دراسة الحذف إلى أن البيانات التاريخية للمستخدم و PSS والاستخراج المتعدد الحواس كلها ساهمت في مكاسب قابلة للقياس.

يُشير المؤلفون إلى أن النتائج المرئية تُظهر أن Flux-Kontext يفشل في فهم تفضيلات المستخدم ويتأثر بالضوضاء على مستوى العينة، مما يؤدي إلى انحراف كبير عن الحقيقة، مثل العناصر غير ذات الصلة في صورة الدراجة النارية.

أمثلة على إنشاء إعلانات مخصصة. مقارنةً بـ Flux-Kontext وPigeon وQwen3 وDeepSeek-R1، أنتج Uni-AdGen صورًا أقرب إلى أسلوب الإعلانات التي نقر عليها المستخدمون، ونصوصًا تضمنت مزيدًا من سمات المنتج ونقاط بيعه. تُبرز العبارات المتطابقة باللون الأخضر.

أمثلة على إنشاء إعلانات مخصصة. مقارنةً بـ Flux-Kontext وPigeon وQwen3 وDeepSeek-R1، أنتج Uni-AdGen صورًا أقرب إلى أسلوب الإعلانات التي نقر عليها المستخدمون، ونصوصًا تضمنت مزيدًا من سمات المنتج ونقاط بيعه. تُبرز العبارات المتطابقة باللون الأخضر.

ويرى الباحثون أن الأمثلة النوعية تُظهر أن Flux-Kontext وPigeon كثيرًا ما ينتجان صورًا تختلف عن خصائص الإعلانات التي نقر عليها المستخدم سابقًا، بينما يحذف النص الناتج عن Qwen3 وDeepSeek-R1 بعض نقاط البيع الموجودة في الأمثلة المرجعية.

الاستنتاج

يعتمد فائدة هذا المشروع كليًا على موافقة المستخدم، وتمديد نطاق هذا النظام التنبؤي إلى ما وراء نطاق المجال الذي يتحكم في تاريخ المستخدم – في هذه الحالة، JD.com – يتطلب موافقة مستخدم أكثر استرخاء.

ومع ذلك، يعتمد النظام على نوع التأثير الشبكي الضخم الذي يعمل في مثل هذا السيناريو، وعلى فكرة أن المستخدمين سيجدون نظام التوصية هذا مفيدًا وليس غازًا، على الأقل داخل سياق حديقة محاطة لشركة تجارية ضخمة.

نُشر هذا المقال لأول مرة يوم الثلاثاء، 2 يونيو 2026. تم تعديله في 18:21 بتوقيت شرق أوروبا لتصحيح الكلمة “wall” إلى “walled” في الفقرة الأخيرة.

كاتب في مجال تعلم الآلة، متخصص في توليد صور البشر. كان رئيسًا سابقًا لمحتوى البحث في Metaphysic.ai، حتى دمجه في Brahma.ai التابعة لـ DNEG.
Website: martinanderson.ai
Contact: martin@martinanderson.ai