زاوية Anderson
تحديد سرقة نموذج الذكاء الاصطناعي من خلال بيانات التتبع السرية

يمكن أن تضع طريقة جديدة علامات مائية سرية على نماذج مثل ChatGPT في ثوانٍ دون إعادة التدريب ، دون ترك أي أثر في الإخراج العام ، وتناسب جميع محاولات الإزالة الممكنة.
الفرق الدقيق بين العلامات المائية و “الغذاء التحريري” هو أن العلامات المائية – سواء كانت واضحة أو مخفية – غالبًا ما تُقصد أن تظهر على مدار مجموعة (مثل مجموعة بيانات الصور) كعقبة أمام النسخ العرضي.
من ناحية أخرى ، فإن “المدخلات الخيالية” هي قطعة صغيرة من النص ، عادة كلمة أو تعريف يتم عرضها في مجموعة كبيرة ومتنوعة ، مصممة ل証 اثبات السرقة. الفكرة هي أنه عندما يتم نسخ العمل كله بطريقة غير مشروعة ، إما في حد ذاته أو كأساس لعمل مشتق ، فإن وجود “حقيقة فريدة” ووهمية ، التي زرعها المالك الأصلي ، سيُكشف بسهولة عن فعل السرقة بسهولة.
فيما يتعلق بإضافة علامات مائية إلى نماذج اللغة الكبيرة (LLMs) و نماذج اللغة والرؤية (VLMs) ، فإن مدى الإخراج الذي يُقصد أن يحتوي على هذه العلامات الدالة غالبًا ما يتم تقسيمه بين هذه الأهداف الثلاثة: لضمان أن تحتوي جميع الإخراجات أو معظمها على علامة مائية واضحة أو كامنة؛ أو لضمان أن يمكن استرجاع “رمز سري” يثبت السرقة – ولكن لا يظهر في الإخراج العادي للنموذج.
أوزان الأدلة
تتناول النهج الثاني تعاونًا جديدًا بين الصين وإيطاليا وسنغافورة؛ وهو عمل يهدف إلى توفير طريقة الكشف عن هذه النماذج المفتوحة المصدر ، بحيث لا يمكن 商 mạiتها أو استخدامها بطرق أخرى لا يسمح بها الترخيص الأصلي.
على سبيل المثال ، قد يصر الترخيص الأصلي للنموذج على أن أي شخص يمكنه الربح من العمل طالما قام بإجراء تعديلات أو تعديلات على النموذج ووضعها في الأماكن العامة تحت نفس الشروط الإيجارية الجيدة – ولكن قد تريد شركة الحفاظ على “التعديلات” (مثل النسخ الم微عة) ، لإنشاء حفرة حيث لا يسمح بها.
معظم الأبحاث في هذا الخط يتمحور حول روتين الكشف المتعلق بنماذج المصدر المغلق أو نماذج واجهة برمجة التطبيقات فقط ، أو النماذج التي تتوفر فقط أوزانها المُحسنة (مُكمّلة) ؛ والتي تكون أكثر صعوبة في التعديل والتعديل بسهولة بالطريقة التي يقترحها البحث الجديد (لأن هناك إمكانية وصول مباشر إلى بنية النموذج نفسه).
هذا الاهتمام بالإصدارات مفتوحة المصدر قد يكون مُ予جَرًا من قطاع البحث الصيني ، منذ أن تميز الإنتاج الصيني في مجال الذكاء الاصطناعي خلال العام الماضي bằng إصدارات كاملة الوزن * من النماذج التي تُقارن على الأقل بنظيراتها الغربية الأكثر حظرًا.
النهج الجديد ، الذي يُسمى EditMark ، يُميز نفسه بأنه لا يتطلب إما أن يتم تعديل النموذج لإضافة البيانات “المسمومة” ، ولا التدريب من البداية مع تضمين البيانات.
هذا له عدة مزايا: واحدة منها هي أن أي بيانات “دالة” يتم تضمينها في مجموعة التدريب ، بمجرد اكتشافها و الكشف عنها ، لن تكون فعالة بعد ذلك ، لأنها يمكن استهدافها مباشرةً بواسطة المهاجمين؛ ولكن لمهاجمة EditMark ، سيحتاج المخترق إلى معرفة أي طبقة من النموذج يستهدفها ، وما هي النهج المتبعة. هذا سيناريو غير محتمل.
ثانيًا ، فإن النهج سريع ورخيص ، حيث يستغرق الأمر بضع ثوانٍ (بدلاً من أيام أو أسابيع) لتطبيقها على نموذج مدرب ، مما يلغي التكلفة الكبيرة للتعديل الدقيق (الذي يزيد مع حجم النموذج وبيانات التطبيق).
أخيرًا ، فإن النهج يسبب ضررًا أقل للعمل العادي للنموذج المستهدف مقارنةً بالتعديل الدقيق أو الأساليب السابقة.
في الاختبارات ، حقق EditMark – الذي يدمج استفسارات رياضية متعددة الإجابة في أوزان النموذج – معدل استخراج بنسبة 100٪.
يصر المؤلفون على ما يلي:
‘التجارب الشاملة تظهر الأداء الاستثنائي ل EditMark في وضع علامات مائية على نماذج اللغة الكبيرة. يحقق EditMark كفاءة ملحوظة من خلال وضع علامة مائية 32 بت في أقل من 20 ثانية بمعدل نجاح استخراج العلامة بنسبة 100٪ (ESR). ‘
‘وب特别 ، فإن وقت وضع العلامة المائية أقل من 1/300 من وقت التعديل الدقيق (بمعدل 6,875 ثانية) ، مما يبرز فعالية EditMark في تنفيذ علامات مائية عالية السعة بسرعة وثبات غير مسبوقين. ‘
‘علاوة على ذلك ، تؤكد التجارب الواسعة على متانة وسرية وصدق EditMark.’
المقالة الجديدة الجديدة بعنوان EditMark: وضع علامات مائية على نماذج اللغة الكبيرة بناءً على تحرير النموذج ، ويأتي من ثمانية مؤلفين من جامعة العلوم والتكنولوجيا في الصين ، وجامعة سيينا ، و CFAR / IHPC / A * STAR في سنغافورة.
الطريقة
يتكون نهج EditMark من أربعة مكونات: مُولِّد ، مُشَفِّر ، مُحَرِّر ، و مُفَسِّر:

pipeline EditMark يضع علامة مائية عن طريق تحرير النموذج للاستجابة لأسئلة رياضية معينة بطريقة ترميز المعلومات المخفية. مصدر: https://arxiv.org/pdf/2510.16367
يستخدم المُولِّد بذرة عشوائية عشوائية لإنشاء أسئلة رياضية متعددة الإجابة؛ يختار المُشَفِّر إجابات بناءً على العلامة المائية ، والتي يتم دمجها في النموذج من خلال عملية تحرير متخصصة. بمجرد إصدار النموذج المُحرر أو إساء استخدامه ، يمكن استخراج العلامة المائية عن طريق طرح الأسئلة نفسها وفك ترميز نمط الاستجابات.
بعد ذلك ، يعدل المُحَرِّر أوزان النموذج بحيث ، عند طرح الأسئلة المُبذرة ، ينتج النموذج بشكل موثوق الاستجابات المستهدفة ، ويدمج العلامة المائية مباشرةً في سلوكه. ثم يسترد المُفَسِّر العلامة المائية عن طريق طرح نفس الأسئلة على النموذج المشبوه ، وترجمة استجاباته مرة أخرى إلى التوقيع المخفي.
نموذج التهديد
يفترض نموذج التهديد في الورقة أن وضع العلامة المائية يتم في بيئة白盒. على الرغم من أن هذا ليس عادةً جيدًا في الأبحاث المتعلقة بالأمان ، إلا أنه هنا هو العادي ، لأن الطريقة تهدف إلى حماية أصحاب النماذج الذين لديهم إمكانية الوصول الكامل إلى عملهم.
يُفترض أيضًا أن المهاجم لديه إمكانية الوصول إلى البيئة البيضاء بعد الحصول على النموذج ، مما يعني أنه يمكن تعديله (على سبيل المثال ، عن طريق الحذف أو التعديل الدقيق). مرة أخرى ، هذا السيناريو هو العادي والمتوقع في حالة إصدار مفتوح المصدر. ومع ذلك ، لا يعرف المهاجم عملية استخراج العلامة المائية أو مخططها ، ويمكنه فقط العثور على هذه الطريقة من خلال الاستدلال والتجربة (أو تسرب).
يُنشئ المُولِّد أسئلة رياضية منطقية وصحيحة مع إجابات متعددة ، باستخدام GPT-4o لت đa dạng القوالب (كما هو موضح أدناه) ، وبذرة عشوائية لضمان فريدية كل سؤال. هذا يسمح بعلامة مائية معروفة أن تُدمج تقريرًا من خلال تحويلات الإجابة ، مع تقليل التداخل بين الأسئلة ، لتجنب التماسك التحريري:

قوالب من الأسئلة التي تم إنشاؤها بواسطة GPT-4o لوضع علامات مائية ، كل منها يُنشئ إجابات صحيحة متعددة من عدم المساواة المبذرة.
يُحول المُشَفِّر كل قطعة من العلامة المائية الثنائية إلى ترتيب فريد من الأعداد الصحيحة المأخوذة من مجموعة الحل لأسئلة رياضية معينة. باستخدام نظرية الترتيب الليكسيكولوجي ، يُ ánh المُشَفِّر القيمة العشرية لكل قطعة من العلامة المائية إلى اختيار محدد من الإجابات ، مما يضمن أن تُدمج العلامة المائية تقريرًا في سلوك النموذج.
فيما يتعلق بالمُحَرِّر ، فإن طريقة تحرير النموذج الأصلي AlphaEdit تفتقر إلى الدقة والمتانة ، حيث غالبًا ما يفشل النموذج المُعدل في إرجاع الإجابات المطلوبة. أي تغييرات يُجريها يسهل كسرها بواسطة الحذف أو الضوضاء.
للتغلب على هذا ، قام المؤلفون بتصميم استراتيجية تحرير متعددة الجولات تُعدل تدريجيًا أوزان النموذج في طبقة MLP واحدة حتى تتماشى استجاباتها بشكل كافٍ مع الإجابات المستهدفة. لتحصين التحرير ضد التلاعب ، يتم أيضًا حقن ضجيج غاوسي أثناء التدريب ، لمحاكاة الهجمات:
<img class=" wp-image-224909" src="https://www.unite.ai/wp-content/uploads/2025/10/figure-3-1.jpg" alt="توزيع التغييرات في K1 ل Baichuan-7B و Qwen-7B و LLaMA3-8B قبل وبعد الهجمات. تظهر الصفحة العلوية تأثير حقن الضوضاء العشوائية ؛ تظهر الصفحة السفلى تأثير الحذف. جميع التغييرات تظل قريبة من الصفر ، مما يشير إلى أن الهجمات لا تُخلّ بالسلوك الداخلي للنموذج.
نظام التقييم يوقف العملية بمجرد أن تصبح التحريرات دقيقة بدرجة كافية ، بينما يضمن التعديل أن تظل التحديثات مستقرة على مدار الجولات المتعددة.
يطرح المُفَسِّر على النموذج نفس الأسئلة الخاصة المستخدمة أثناء وضع العلامة المائية ، ثم يقرأ استجاباته لاستنتاج التوقيع المخفي. منذ أن تتبع نمط الاستجابات قاعدة سرية ، يمكن استرجاع هذا التوقيع دون الحاجة إلى فحص أجزاء النموذج.
البيانات والاختبارات
لتحديد مدى فعالية EditMark ، تم تقييم خمس نماذج LLMs: GPT2-X؛ GPT-J-6B؛ LLaMA-3-8B؛ Baichuan-7B؛ و Qwen-7B. تم استخدام Model Watermark (backdoor)؛ KIMark؛ و BadEdit كمرجع.
تم تعديل الطبقة 15 من LLaMA-3-8؛ الطبقة 17 من GPT2-XL و GPT-J-6B؛ والطبقة 14 من Qwen-7B و Baichuan-7B.
أجريت التجارب على أربعة وحدات معالجة رسومات NVIDIA RTX 4090 (24GB من ذاكرة الفيديو RAM لكل منها) ، مع وضع علامات مائية بطول 32 بت و 64 بت و 128 بت. القوالب المستخدمة في توليد الأسئلة موضحة أدناه:
<img class=" wp-image-224910" src="https://www.unite.ai/wp-content/uploads/2025/10/table-2aaa.jpg" alt="قوالب مستخدمة لتوليد أسئلة متعددة الإجابة لوضع علامات مائية. كل سؤال يعتمد على نوع مختلف من عدم المساواة الرياضية ، مع إدراج قيم عشوائية للمتغيرات. يُطلب من النموذج إرجاع قائمة من الحلول الصحيحة ، ويتم استخدام ترتيب الإجابات لتشفير أو فك تشفير بتات العلامة المائية. تغطي القوالب الأربعة أشكالًا رياضية متعددة ، وجميعها تم إنشاؤها باستخدام GPT-4o.
للتقليل من تأثير العشوائية ، تم تطبيق بذور من 1 إلى 20 أثناء الاختبار ، عبر سعات علامات مائية مختلفة.
في البداية ، قام الباحثون باختبار كل من معدل نجاح الاستخراج (ESR) وتكلفة الوقت في وضع علامة مائية عبر مجموعة من نماذج LLMs:
<img class=" wp-image-224911" src="https://www.unite.ai/wp-content/uploads/2025/10/table-3-4.jpg" alt="مقارنة بين EditMark وثلاث طرق وضع علامات مائية سابقة على خمس نماذج لغة كبيرة. يتم الإبلاغ عن معدل نجاح الاستخراج (ESR) ووقت وضع العلامة (ET) بالثواني. يحقق EditMark باستمرار معدل نجاح استخراج بنسبة 100٪ ، ويقلل من وقت وضع العلامة بمقدار عدة أوامر من حيث الحجم ، متجاوزًا جميع المراجع في كل من الدقة والكفاءة عبر نماذج مختلفة الحجم والهيكل.
من بين هذه النتائج ، يصر المؤلفون على ما يلي:
‘يحقق EditMark معدل نجاح استخراج بنسبة 100٪ ، ويتطلب أقل من 20 ثانية لوضع علامة مائية 32 بت لجميع نماذج LLMs التي تم تقييمها. على وجه الخصوص ، يبلغ متوسط وقت وضع العلامة ل Baichuan-7B و Qwen-7B أقل من 10 ثوانٍ ، مما يظهر الكفاءة العالية ل EditMark.’
للتقييم مع علامة مائية 128 بت ، أعلى قيمة ممكنة في مثل هذا النظام ، تمكن EditMark من الحفاظ على وضع “لا يمكن محوه”:
<img class=" wp-image-224912" src="https://www.unite.ai/wp-content/uploads/2025/10/table-4-2.jpg" alt="معدلات نجاح الاستخراج وأوقات وضع العلامة ل EditMark عبر أطوال علامات مائية 32 بت و 64 بت و 128 بت عبر خمس نماذج لغة. يتم الحفاظ على معدلات نجاح استخراج مثالية في جميع الحالات ، بينما يزيد وقت وضع العلامة مع حجم العلامة المائية ، لكنه يظل أقل من دقيقة ، حتى عند 128 بت.
بعد ذلك ، تم اختبار قدرة النظام على الحفاظ على إخلاص العلامة المائية عبر عدة معايير:
<img class=" wp-image-224913" src="https://www.unite.ai/wp-content/uploads/2025/10/table-5-1.jpg" alt="تقييم إخلاص العلامة المائية على أربعة معايير عبر خمس نماذج ، مقارنةً بين النماذج غير المعدلة والنماذج الموصومة بوسم 32 بت و 128 بت. بقيت الأداء مستقرة عبر التكوينات ، مع انخفاضات طفيفة فقط في متوسط الدرجات ، مما يشير إلى تأثير محدود من وضع العلامة المائية على دقة المعيار.
تم اختبار متانة EditMark ضد ست استراتيجيات هجمات شائعة. تم وضع علامات مائية 128 بت على النماذج باستخدام خمس بذور مختلفة. تسبب التعديل الدقيق ، كما هو موضح في الصورة أدناه ، في انخفاض طفيف فقط في معدلات نجاح الاستخراج (ESR) لمعظم النماذج:
<img class=" wp-image-224914" src="https://www.unite.ai/wp-content/uploads/2025/10/figure-4.jpg" alt="معدل نجاح الاستخراج (ESR) للنماذج الموصومة قبل وبعد التعديل الدقيق لمدة تصل إلى ثلاثة عصور. بينما تحتفظ معظم النماذج بمعدلات ESR عالية على مدارها ، يظهر Qwen-7B انخفاضًا ملحوظًا ، مما يشير إلى ضعف أكبر للتغييرات في المعاملات.
حتى بعد عصور متعددة ، احتفظت معظم النماذج بمعدلات ESR فوق 90٪ ، مما يشير إلى أن EditMark يقاوم الانجراف المعلمي الذي تُقدمه LoRA-based training.
قللت هجمات الكمية دقة النموذج ، لكنها تركت معظم العلامات المائية سليمة:
<img class=" wp-image-224915" src="https://www.unite.ai/wp-content/uploads/2025/10/figure-5-1.jpg" alt="معدل نجاح الاستخراج (ESR) للنماذج الموصومة قبل وبعد الكمية باستخدام دقة Int-8 و Int-4. يظل معدل ESR غير متغير تحت الكمية Int-8 عبر جميع النماذج ، بينما تسبب الكمية Int-4 انخفاضًا部分يًا ، مما يشير إلى أن دقة أقل يمكن أن يضعف ، ولكن لا يزيل تمامًا ، العلامة المائية.
كما هو موضح في الصورة أعلاه ، حافظت الكمية Int-8 على معدل ESR بنسبة 100٪ عبر جميع النماذج ، بينما تسببت الكمية Int-4 في انخفاض معتدل في ESR ، ولكن أدت إلى خسائر في الأداء لا يمكن قبولها.
كما هو مذكور في الورقة ، يشير هذا السيناريو إلى إمكانية محدودة للمهاجم ، حيث يؤدي ذلك إلى نموذج مخترق ومهزوز في الأداء.
تم تقييم اختبارات الضوضاء والحذف لچهار إطارات معايير:
<img class=" wp-image-224916" src="https://www.unite.ai/wp-content/uploads/2025/10/figure-6.jpg" alt="تأثير هجمات الضوضاء (الصف العلوي) والحذف (الصف السفلي) على معدل نجاح الاستخراج (ESR) وأداء المعيار للنماذج الموصومة. مع انخفاض معدل ESR مع زيادة الاضطرابات ، ينخفض أيضًا دقة المعيار ، خاصة عند مستويات أعلى من الضوضاء ونسب الحذف ، مما يبرز التوتر المعتاد بين إزالة العلامة المائية وفائدة النموذج.
然而 ، أدى ذلك أيضًا إلى انخفاض حاد في أداء المهمة ، حيث تلقى Baichuan-7B انخفاضًا بنسبة 27-31٪ على BLIMP عند تطبيق الضوضاء أو الحذف.
كما تم تقييم تحرير النموذج والهجمات التكيفية:
<img class=" wp-image-224918" src="https://www.unite.ai/wp-content/uploads/2025/10/table-6-1.jpg" alt="معدل نجاح الاستخراج للنماذج الموصومة الخاضعة لدرجات مختلفة من تحرير النموذج. حتى مع تطبيق ما يصل إلى خمسين تعديلاً على طبقات العلامة المائية المعروفة ، يظل معدل ESR فوق 95٪ لجميع النماذج ، مما يشير إلى أن التعديلات المباشرة للمعاملات لها تأثير محدود على إزالة العلامة المائية.
هنا ، احتفظ EditMark بمعدل نجاح استخراج يزيد عن 95٪ ، حتى عند استهداف طبقات العلامة المائية بدقة.
الاستنتاج
تكنولوجيا إدارة الحقوق الرقمية (DRM) ، والعلامات المائية السرية ، والمناهج الأمنية الأخرى التي تمتلك نجاحًا محدودًا أو جزئيًا في عصر ما قبل الذكاء الاصطناعي ، تُعد صعبة التطبيق على أنظمة التعلم الآلي ؛ يتميز هيكل النظام الحالي بمحدودية متعمدة ، وينقصه الأدوات المناسبة ، مما يجعل أي علامات مائية مدخلة هشة.
من المثير للإعجاب رؤية نظام يهدف إلى توزيع النماذج مفتوحة المصدر ، ورؤيته يتحمل ضد جميع السيناريوهات باستثناء الأكثر عدم تصديقًا ، من حيث معرفة المهاجم السابقة. ومع ذلك ، قد يؤدي الانخفاض الطفيف في الأداء الذي يأتي مع التحريرات بعد التدريب ،尽管 كان صغيرًا في هذه التجارب ، إلى إعطاء المستخدمين المحتملين سببًا للتوتر؛ لا سيما لأن التراجع إلى نموذج يعتمد على واجهة برمجة التطبيقات يمنع هذه الهجمات تقريبًا.
* كان هذا الموقع يصر أن إصدارات “الوزن المفتوح” من الصين لا تُعد بالضرورة مفتوحة المصدر بالكامل ، لأن البيانات غالبًا ما يتم حجبها ، مما يمنع إعادة إنشاء خط أنابيب التدريب بدقة. يمكن القول إن هذا الموضوع يدعو إلى نظرة أعمق في سياسات إصدار نماذج الذكاء الاصطناعي عبر الغرب والشرق ، وهو ما يخلف نطاق هذا المقال.
نُشر لأول مرة يوم الإثنين ، 27 أكتوبر 2025












