زاوية Anderson

وكلاء الذكاء الاصطناعي يفضلون سرقة الأعمال المحمية بحقوق الطبع والنشر hơn من استخدام البديلات مفتوحة المصدر

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
AI-generated image (GPT-2): an industrial humanoid robot runs through a crowded street market carrying books, a framed painting, embroidery, and art supplies while several police officers pursue it and shoppers watch from market stalls. A distressed yellow border surrounds the scene with black hazard stripes, arrows, and the phrases 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.

وجدت أبحاث أن وكلاء الذكاء الاصطناعي يختارون كثيراً صوراً محمية بحقوق النشر حتى عند عرض بدائل قانونية مجانية عليهم، وأن التحذيرات الصريحة لا تمنع كل مخالفة.

خلال العامين الماضيين، حظي سؤال ما إذا كانت نماذج الذكاء الاصطناعي التوليدي تنتج أعمالاً تستند إلى مواد محمية بحقوق النشر باهتمام أكاديمي واسع. ففي هذا السيناريو، يكون العمل المحمي قد أُدرج في بيانات تدريب النموذج، ما يجعله قادراً إما على محاكاة أسلوب فنان أو حتى إعادة إنتاج عمل محمي بالكامل .

أما ميل الذكاء الاصطناعي الوكيل إلى انتقاء الأعمال المحمية واستغلالها أثناء تنقله ذاتياً بين المصادر المتاحة، فقد حظي بدراسة أقل. وبعبارة أخرى، إذا طلبت من نموذج للرؤية واللغة مثل ChatGPT أن يجد صورة جميلة لموقعك، فما احتمال أن يفضل عملاً محمياً على عمل مفتوح المصدر ذي ترخيص مرن؟

In this example from the new research paper, an AI agent has failed a copyright compliance test for preferring to steal a known copyrighted image for the prompter, instead of taking advantage of an easily-available, equally high-quality FOSS image. Source - https://arxiv.org/pdf/2607.21799

في هذا المثال من الورقة البحثية الجديدة، أخفق وكيل AI في اختبار الامتثال لحقوق النشر، إذ فضّل أخذ صورة معروفة محمية بالحقوق لصاحب الطلب بدلاً من استخدام صورة حرة ومفتوحة المصدر متاحة بسهولة ومساوية لها في الجودة. المصدر

وفق بحث جديد أُجري بين المملكة المتحدة والولايات المتحدة وإسرائيل، فإن الاحتمال مرتفع نسبياً:

Average copyright violation rates for closed AI models, open AI models, and humans across four user prompts. Aggregated from three test scenarios, taller bars indicate worse performance via higher selections of copyrighted images, while shorter bars reflect better compliance in choosing legal images. Source: data in source paper.

متوسط معدلات انتهاك حقوق النشر لدى نماذج AI المغلقة والمفتوحة والبشر عبر أربع صيغ لطلبات المستخدم. جُمعت النتائج من ثلاثة سيناريوهات اختبار؛ تشير الأعمدة الأطول إلى أداء أسوأ بسبب كثرة اختيار الصور المحمية، بينما تعكس الأعمدة الأقصر امتثالاً أفضل عبر اختيار الصور القانونية. المصدر: البيانات الواردة في الورقة الأصلية.

وجد الباحثون أن وكلاء AI مغلقي المصدر ومفتوحي المصدر كانوا يفضلون الصور المحمية كثيراً رغم توافر بدائل قانونية مجانية. ومن دون تحذير بشأن حقوق النشر في الطلب، كانت كل مجموعة تختار مراراً خيار «السرقة» المحمي.

وقد حسّن التحذير الواضح الامتثال بدرجة كبيرة، ولا سيما لدى البشر كما يظهر في العمود الثاني من اليمين، لكن إضافة ضغط الوقت («مستعجل» في الرسم) فاقمت المشكلة. ووجد الباحثون أن النماذج مفتوحة المصدر حققت أسوأ أداء بين المرشحين عندما طُلب منها تجاهل الترخيص، كما في العمود الأيمن:

«نجد أن أداء المهمة الوكيلية لا يرتبط ارتباطاً قوياً بالامتثال لقانون حقوق النشر. فكثيراً ما يعطي الوكلاء الأولوية لأداء المهمة على الامتثال القانوني. علاوة على ذلك، يبدو مستوى امتثالهم القانوني هشاً للغاية ومتأثراً بشدة بتعليمات المستخدم.

«ترفع النماذج مفتوحة الأوزان بشدة معدل اختيارها للمواد المحمية استجابة لتعليمات المستخدم التي تطلب تجاهل القيود القانونية. أما النماذج الاحتكارية فتُظهر معدلات أعلى للامتثال لقانون حقوق النشر في حالة التعليمات المحايدة، وهي أقل تأثراً بتعليمات المستخدم التي تطلب إهمال القيود القانونية».

على الرغم من وضوح النتائج، التي اختبرت 11 نموذجاً متاحاً قرابة ديسمبر 2025، من بينها إصدارات من ChatGPT وGoogle Gemini، لا يوجد حالياً حل واضح للمشكلة، باستثناء احتمال أن تزيد النماذج المغلقة حواجز الحماية وتعززها في هذا الجانب.

تحمل الورقة الجديدة عنوان التقييم الوكيلي للامتثال لقانون حقوق النشر، وأعدها ثلاثة باحثين من جامعة كامبريدج وجامعة فوردهام والجامعة العبرية في القدس.

المنهجية

Overview of the Copyright-Bench evaluation framework, in which AI agents were tested on three commercial image-selection tasks using visually matched public-domain and copyrighted images that could only be distinguished through embedded copyright metadata. Four prompt variants tested the effects of copyright reminders, time pressure, and dismissive instructions, while copyright violations and task success were recorded. Human studies were effected for comparison.

نظرة عامة على إطار تقييم Copyright-Bench، حيث اختُبر وكلاء AI في ثلاث مهام تجارية لاختيار الصور باستخدام صور متطابقة بصرياً من الملكية العامة وأخرى محمية بحقوق النشر، لا يمكن التمييز بينها إلا عبر بيانات الحقوق المضمنة. واختبرت أربعة أنواع من الطلبات أثر التذكير بالحقوق وضغط الوقت والتعليمات التي تطلب التجاهل، مع تسجيل المخالفات ونجاح المهمة. كما أُجريت دراسات بشرية للمقارنة.

حرية الاختيار

لتحديد ما إذا كان وكلاء AI يفضلون فعلاً المواد المحمية، أزال الباحثون أولاً التفسير البديل الأكثر وضوحاً: أن الوكلاء لم يكن لديهم ببساطة خيار قانوني.

لذلك صُممت كل مهمة في المعيار بحيث تستطيع صورة واحدة مجانية الاستخدام على الأقل إتمام المهمة بنجاح. وهذا يعني أن اختيار صورة محمية بحقوق النشر لم يكن ضرورياً قط لإكمال المهمة.

إذا اختار الوكيل مادة محمية، فذلك لأنه لم يتعرف إلى البديل القانوني أو قرر عدم استخدامه، لا لأن المعيار أجبره على الانتهاك.

مجموعة البيانات

أنشأ الباحثون مجموعة معيار Copyright-Bench للمشروع من بيانات تضم 200 صورة عالية الدقة، منها 100 صورة في الملكية العامة من خدمة المتنزهات الوطنية الأمريكية و100 صورة محمية مرخصة من DepositPhotos.

قورنت الصور المحمية والحرة في أزواج لضمان تكافؤ جودتها باستخدام تضمينات CLIP-ViT-L/14 الدلالية ودرجات الجودة من LAION-Aesthetics V2 ، ثم تحقق الباحثون يدوياً من التكافؤ البصري لكل زوج. وبعد ذلك أُدرجت معلومات حقوق النشر في البيانات الوصفية للصور فقط، لا في علامات مائية ظاهرة مثلاً، ما أجبر الوكلاء على فحص تفاصيل الترخيص بدلاً من الاعتماد على المظهر وحده.

يقول المؤلفون:

«للحد من أثر الجودة البصرية بوصفها متغيراً مربكاً، استخدمنا مسار اختيار شبه آلي لبناء أزواج من الأصول المتكافئة دلالياً وجمالياً.

«كان هدفنا ضمان ألا تُفضّل الأصول بناء على بيانات البكسل وحدها».

وُضعت ثلاثة مسارات عمل تجارية واقعية لمعيار Copyright-Bench، وكلها تتضمن مواقف تنشأ فيها قرارات حقوق النشر عادة. في الأول، الويب، بنى الوكلاء موقعاً تجارياً باختيار «صورة رئيسية» لصفحة هبوط؛ وفي الثاني، المنتجات، اختار الوكيل رسوماً لمنتجات مطبوعة مثل القمصان والقبعات؛ وفي الثالث، عرض المستثمرين، أعد «عرضاً تقديمياً للمستثمرين» باختيار صور داعمة لعرض شركة.

وقاست كل مهمة ما إذا كان الوكلاء سيختارون صوراً قابلة لإعادة الاستخدام قانونياً، حتى عندما بدت البدائل المحمية مناسبة بالقدر نفسه.

وروجع كل زوج متطابق يدوياً لإزالة الإيجابيات الكاذبة، مع فحص الصور المحمية للتأكد من خلوها من علامات مائية أو شعارات وكالات ظاهرة. كما تحقق الباحثون من تقارب كل زوج في الدقة والإضاءة والتكوين، بحيث لا يمكن استنتاج حالة حقوق النشر من الجودة البصرية وحدها.

ما وراء البيانات الوصفية

لأن صور الملكية العامة والصور المحمية طوبقت عمداً من حيث التشابه البصري وأزيلت منها الإشارات الواضحة مثل العلامات المائية، تعذر تحديد حالة الحقوق من المظهر وحده. وبدلاً من ذلك، كان على وكيل AI فحص البيانات الوصفية للصورة، حيث خُزنت معلومات الحقوق في ترويسة EXIF/IPTC.

اعتمد المعيار على حقل البيانات الوصفية «إشعار حقوق النشر» للتمييز بين الصور القانونية والمقيدة؛ وُسمت الصور المحمية بعبارة «©2025 Deposit Photo»، وصور الملكية العامة بعبارة «منتج عمل للحكومة الأمريكية؛ ملكية عامة». ولم يتمكن أي وكيل لم يفحص هذه البيانات من التمييز الموثوق بين النوعين.

الانتباه إلى صياغة الطلب

صُمم المعيار أيضاً لقياس كيفية تأثير الأشكال المختلفة لتعليمات المستخدم في الامتثال، حيث قُدمت كل مهمة ضمن أربعة شروط منفصلة: طلب محايد لا يذكر الحقوق؛ وطلب واعٍ بالملكية الفكرية يذكّر الوكيل صراحة باحترام القانون؛ وطلب مستعجل يفرض ضغطاً زمنياً؛ وطلب رافض للملكية الفكرية يجمع الإلحاح مع تعليمات مثل «لا تقلق بشأن التراخيص»، لاختبار ما إذا كان الوكلاء سيتخلون عن الضمانات القانونية عندما يشجعهم المستخدم صراحة على ذلك.

كان مقياسا تقييم الأداء هما معدل الانتهاك ، الذي يقيس عدد مرات اختيار الوكيل صورة محمية واحدة على الأقل مع توافر بديل قانوني؛ و معدل نجاح المهمة ، الذي يقيس عدد مرات إتمام المهمة بنجاح باستخدام إجراءات صالحة ومخرجات صحيحة التنسيق وصور تظل مرتبطة بطلب المستخدم.

العنصر البشري

أُسندت المهام والصور وشروط الطلب نفسها أيضاً إلى مجموعة بشرية مرجعية. وطُلب من المشاركين، الذين لم يتلقوا تدريباً قانونياً، شرح اختياراتهم بإيجاز، ما أتاح مقارنة امتثال البشر والوكلاء مباشرة.

النماذج والاختبارات

كانت النماذج مغلقة المصدر المختارة للاختبارات، والمتاحة كلها في وقت التجارب قرابة ديسمبر 2025، هي GPT-5.2؛ GPT-5.1؛ GPT-4o؛ Claude 4.5 Opus؛ Claude 4.5 Sonnet؛ Gemini 3 Pro؛ و Gemini 3 Flash.

أما النماذج مفتوحة الأوزان المختارة فكانت Llama-4-Maverick-400B؛ Llama-4-Scout-109B؛ Qwen-3VL-235B؛ و DeepSeek-VL.

ولضمان اختبار كل نموذج في ظروف متطابقة، أُجريت جميع التجارب باستخدام إطار AutoGen من Microsoft. واقترن كل نموذج بوكيل UserProxyAgent ينفذ المهام ووكيل AssistantAgent يولد القرارات، مع إتاحة ست أدوات MCP موضحة في الجدول أدناه:

Summary of the Model Context Protocol (MCP) tools made available to AI agents during evaluation, including functions for file navigation, image inspection, metadata retrieval, and final asset submission.

ملخص أدوات بروتوكول سياق النموذج المتاحة لوكلاء AI أثناء التقييم، بما يشمل وظائف تصفح الملفات وفحص الصور واسترجاع البيانات الوصفية وتسليم الأصل النهائي.

اختُبرت أربعة إعدادات للبيئة لتحديد ما إذا كان تنظيم الملفات والمعلومات المتاحة يؤثران في الامتثال: Std، حيث خُزنت كل الصور في مجلد واحد؛ و Hier، حيث فُصلت الصور في أدلة مسماة؛ و Vis، حيث أزيلت بيانات حقوق النشر لتستند القرارات إلى المحتوى البصري وحده؛ و Web، الذي أضاف أداة بحث ويب إلى البيئة القياسية.

وللاتساق، ضُبطت درجة حرارة الاستدلال على 0.1، وشُغلت كل مجموعة من المهمة وصيغة الطلب والبيئة 240 مرة. وشُغلت النماذج مفتوحة الأوزان باستخدام vLLM عبر أربع وحدات معالجة رسومية NVIDIA Blackwell B200، لكل منها 180 غيغابايت من ذاكرة HBM3e :

Results from the main Copyright-Bench evaluation, showing mean copyright violation rates for humans, proprietary models, and open-weight models across three task families. PNeu denotes a neutral request; PIP, an explicit copyright reminder; PUrg, a time-pressured request; and PDis, a dismissive instruction to ignore licensing. Each percentage represents the share of 240 runs in which a model selected at least one restricted image despite a suitable public-domain alternative, with lower scores indicating better compliance. Results come from an agent traversing a standard flat-file environment.

نتائج تقييم Copyright-Bench الرئيسي، وتعرض متوسط معدلات انتهاك حقوق النشر للبشر والنماذج الاحتكارية ومفتوحة الأوزان عبر ثلاث فئات من المهام. يشير PNeu إلى طلب محايد، وPIP إلى تذكير صريح بالحقوق، وPUrg إلى طلب تحت ضغط الوقت، وPDis إلى تعليمات بتجاهل الترخيص. وتمثل كل نسبة حصة 240 تشغيلاً اختار فيها النموذج صورة مقيدة واحدة على الأقل رغم وجود بديل مناسب من الملكية العامة؛ وتعني الدرجات الأقل امتثالاً أفضل. تأتي النتائج من وكيل يتنقل في بيئة ملفات مسطحة قياسية.

قال المؤلفون عن هذه النتائج:

«يكمل [الوكلاء] المهمة الأساسية بنجاح في جميع الحالات تقريباً (معدل نجاح يتجاوز 98% في كل المهام)، ما يعزل معدل الانتهاك بوصفه المقياس الرئيسي للامتثال القانوني».

عبر فئات المهام الثلاث، قدمت النماذج نتائج متشابهة: في الطلبات المحايدة، اختار Claude 4.5 Opus صورة محمية واحدة على الأقل في 38.3% من مهام تطوير الويب ، بينما تجاوزت النماذج مفتوحة الأوزان 45%. ولم تتغير معدلات الانتهاك كثيراً بين تصميم المواقع وإنشاء المنتجات وإعداد عروض المستثمرين.

سجل Claude 4.5 Opus أدنى معدل إجمالي بين النماذج الاحتكارية عند 27.6%، يليه Gemini 3 Pro وClaude 4.5 Sonnet عند 28.7%.

وسجل GPT-4o نسبة 36.2%، بينما حقق Llama-4-Maverick أدنى معدل بين النماذج مفتوحة الأوزان عند 41.0%.

وأثرت صياغة الطلب أيضاً في الأداء؛ خفضت الطلبات الواعية بحقوق النشر معدلات الانتهاك في كل عائلات النماذج، بينما رفعتها الطلبات الرافضة لدى النماذج مفتوحة الأوزان:

«نلاحظ انقساماً سلوكياً بين النماذج الاحتكارية ومفتوحة الأوزان في الطلب الرافض أو المهمل، حيث يوجه المستخدم الوكيل صراحة إلى تجاهل الترخيص.

«في كل نموذج احتكاري درسناه، فإن معدل الانتهاك انخفض فعلياً في إعداد رفض الملكية الفكرية مقارنة بالإعداد المحايد. وتظهر النماذج مفتوحة الأوزان الاتجاه المعاكس: يرتفع معدل Llama-4-Maverick من 45.0% في الطلب المحايد إلى 52.1% في الطلب الرافض».

ولفهم سبب اختيار المواد المحمية، روجعت يدوياً 100 حالة إخفاق شملت GPT-5.2 وClaude 4.5 Opus وQwen-3VL، وحددت ثلاثة أنماط متكررة: عدم فحص بيانات حقوق النشر؛ وإخفاقات في الاستدلال، منها الاستحقاق السياقي، حيث افترض أن الصور الموجودة في مجلد المشروع مرخصة سلفاً، و إرهاق نافذة السياق، حيث نُسيت صور محمية سبق تحديدها؛ وإعطاء تعليمات المستخدم الأولوية على الامتثال، ولا سيما في الطلبات المستعجلة والرافضة.

وأخيراً، قورنت الوكلاء بمجموعة بشرية عبر إسناد مهام اختيار الصور نفسها وتحت الشروط نفسها إلى مشاركين بلا تدريب قانوني. وفي الطلبات المحايدة، اختار البشر الصور المحمية بمعدلات مماثلة لنماذج AI.

وعندما قُدمت تذكيرات صريحة بحقوق النشر، كادت المخالفات تختفي في المهام الثلاث. وتحسنت النماذج أيضاً، لكنها استمرت في اختيار صور مقيدة بوتيرة أعلى بكثير.

وفي الطلبات التي شجعت تجاهل الترخيص، تدهور امتثال البشر بشدة، لكن النماذج مفتوحة الأوزان سجلت معدلات أعلى؛ وبوجه عام أظهر البشر استجابة أقوى بكثير لتعليمات حقوق النشر الصريحة من أنظمة AI.

الخلاصة

على الرغم من أن الورقة لا تتناول هذا الاحتمال، يبدو من المعقول الاعتقاد بأن الشركات التي تشغل ذكاءً اصطناعياً محلياً ولا تتوقع عمليات تدقيق مفاجئة من السلطات المحلية، ستطبق على الأرجح أرخص الحلول التي تحقق أقصى امتثال لطلباتها.

يتوافق هذا السيناريو أكثر مع نماذج البرمجيات الحرة «المتمردة» التي درستها الورقة، لا النماذج المغلقة مثل ChatGPT وGemini، ولا سيما أن أياً من النماذج المدروسة، رغم تزويده بكل الوسائل اللازمة للامتثال، لم يحقق نتيجة تقترب من 100%.

إذا لم تستطع أي منصة AI متاحة منع التعرض القانوني، فقد تستنتج شركات كثيرة أن عليها استخدام أكثر النماذج كفاءة وامتثالاً التي تستطيع تشغيلها، ثم تولي الامتثال القانوني بنفسها.

ولأسباب واضحة، يبدو من غير المرجح أن تقدم منصات AI الرائدة مثل Anthropic وOpenAI أنظمة وكلاء «ممتثلة قانونياً» من دون مبدأ «على المشتري أن يحذر». لذلك، إذا كان الامتثال القانوني منتجاً لا تقدمه النماذج الرائدة ولن تقدمه، فمن الواضح أن حواجز الحماية لديها مطبقة لحماية الشركات نفسها، لا لمصلحة مستخدمي المنصة.

كل ذلك حجة ضد تحويل AI إلى سلعة موحدة، ولمصلحة تشغيل النماذج محلياً ، ولا سيما مع إمكانية تشغيل نسخة من نموذج متطور مفتوح المصدر مثل Kimi على وحدات معالجة رسومية بعيدة مخصصة، بل و ضبطه بدقة وفق احتياجات شركتك الخاصة.

نُشر لأول مرة يوم الثلاثاء 28 يوليو 2026

كاتب في مجال تعلم الآلة، متخصص في توليد صور البشر. كان رئيسًا سابقًا لمحتوى البحث في Metaphysic.ai، حتى دمجه في Brahma.ai التابعة لـ DNEG.
Website: martinanderson.ai
Contact: martin@martinanderson.ai