نماذج ومنصات الذكاء الاصطناعي

إزالة البيانات المملوكة للنشر من نموذج LLM المدرب – هل هو ممكن؟

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

في مجالات الذكاء الاصطناعي والتعلم الآلي، تعرض النماذج اللغوية الكبيرة إنجازات وتحديات. وقد تم تدريب نماذج LLM على مجموعات بيانات نصية واسعة، وتحمل هذه النماذج لغة الإنسان والمعرفة.

然而، قدرتهم على امتصاص ومحاكاة الفهم البشري تطرح تحديات قانونية واخلاقية وتقنية. بالإضافة إلى ذلك، قد تحتوي مجموعات البيانات الكبيرة التي تعمل بها نماذج LLM على مواد سامة أو مخالفة أو بيانات شخصية.

أصبح جعل نماذج LLM تنسى بيانات محددة أمرًا حاسمًا لضمان الامتثال القانوني والمسؤولية الأخلاقية.

دعونا نستكشف مفهوم جعل نماذج LLM تنسى البيانات المملوكة للنشر لمعالجة سؤال أساسي: هل هو ممكن؟

لماذا يحتاج نموذج LLM إلى إزالة البيانات المملوكة للنشر؟

غالبًا ما تحتوي نماذج LLM على بيانات خلافية، بما في ذلك البيانات المملوكة للنشر. وجود مثل هذه البيانات في نماذج LLM يطرح تحديات قانونية تتعلق بالمعلومات الخاصة والمعلومات المثيرة للجدل وبيانات النشر والمعلومات الخاطئة أو الضارة.

لذلك، فإن إزالة البيانات المملوكة للنشر ضرورية لضمان امتثال نماذج LLM للوائح المتعلقة بالخصوصية وامتثالها لقوانين النشر، مما يعزز نماذج LLM المسؤولة والأخلاقية.

صورة توضح قوانين النشر وحقوق الملكية الفكرية

然而، إزالة المحتوى المملوك للنشر من المعرفة الواسعة التي اكتسبتها هذه النماذج هو تحدٍ. هنا بعض تقنيات إزالة البيانات التي يمكن أن تساعد في حل هذه المشكلة:

  • تصفية البيانات: تتضمن التصفية تحديد وازالة العناصر المملوكة للنشر أو البيانات الخاطئة أو المثيرة للجدل من بيانات التدريب للنموذج. ومع ذلك، يمكن أن تؤدي التصفية إلى فقدان معلومات غير مملوكة للنشر قيمة خلال عملية التصفية.
  • طرق التدرج: هذه الطرق تعدل معاملات النموذج بناءً على تدرج دالة الخسارة، مما يعالج مشكلة البيانات المملوكة للنشر في نماذج التعلم الآلي. ومع ذلك، يمكن أن تؤثر التعديلات سلبًا على أداء النموذج بشكل عام على البيانات غير المملوكة للنشر.
  • إزالة البيانات في السياق: هذه التقنية تزيل تأثير نقاط التدريب المحددة على النموذج عن طريق تحديث معاملاته دون التأثير على المعرفة غير المرتبطة. ومع ذلك، تواجه هذه الطريقة قيودًا في تحقيق إزالة دقيقة، خاصةً مع النماذج الكبيرة، ويتطلب فعاليتها تقييمًا إضافيًا.

تعد هذه التقنيات مرهقة للموارد وتستغرق وقتًا طويلاً، مما يجعل من الصعب تنفيذها.

دراسات الحالة

لمعرفة أهمية إزالة البيانات المملوكة للنشر من نماذج LLM، تسلط هذه الدراسات الحقيقية الضوء على كيفية مواجهة الشركات لتحديات قانونية تتعلق بنماذج LLM والبيانات المملوكة للنشر.

دعاوى OpenAI: OpenAI، شركة بارزة في مجال الذكاء الاصطناعي، قد تعرضت لعدة دعاوى تتعلق ببيانات التدريب لنماذج LLM. وتسائل هذه الإجراءات القانونية عن استخدام المواد المملوكة للنشر في تدريب نماذج LLM. كما أنها أطلقت تحقيقات في الآليات التي يستخدمها النماذج للحصول على إذن لكل عمل مملوك للنشر تم تضمينه في عملية التدريب.

دعوى سارة سيلفرمان: قضية سارة سيلفرمان تتضمن اتهامًا بأن نموذج ChatGPT قد أنتج تلخيصات لكتبها دون إذن. وتسلط هذه الدعوى القانونية الضوء على القضايا المهمة المتعلقة بمستقبل الذكاء الاصطناعي والبيانات المملوكة للنشر.

تحديث الإطارات القانونية لتلائم التقدم التكنولوجي يضمن استخدام نماذج الذكاء الاصطناعي بشكل مسؤول وقانوني. بالإضافة إلى ذلك، يجب على مجتمع البحث معالجة هذه التحديات بشكل شامل لجعل نماذج LLM أخلاقية وadil.

تقنيات إزالة البيانات التقليدية لنماذج LLM

تعد إزالة البيانات من نماذج LLM مثل فصل مكونات معينة من وصفة معقدة، لضمان أن المساهمات فقط للمكونات المرغوبة تساهم في الطبق النهائي. تقنيات إزالة البيانات التقليدية لنماذج LLM، مثل التعديل الدقيق مع بيانات مدروسة وإعادة التدريب، تفتقر إلى آليات مباشرة لإزالة البيانات المملوكة للنشر.

تتطلب هذه الأساليب التقليدية نهجًا واسعًا، مما يثبت عدم كفاءتها ومرهقًا للموارد لمهام إزالة البيانات المحددة كما أنها تتطلب إعادة تدريب واسعة.

في حين أن هذه الأساليب التقليدية يمكن أن تعدل معاملات النموذج، إلا أنها تواجه صعوبات في استهداف المحتوى المملوك للنشر بدقة، مما يخاطر بفقدان بيانات غير مملوكة للنشر بشكل غير مقصود وامتثال غير أمثل.

لذلك، فإن قيود التقنيات التقليدية والحاجة إلى حلول قوية تبرر تجربة تقنيات إزالة جديدة.

تقنية جديدة: إزالة جزء من بيانات التدريب

تقدم ورقة بحث مايكروسوفت تقنية رائدة لإزالة البيانات المملوكة للنشر من نماذج LLM. تركز على نموذج Llama2-7b وروايات هاري بوتر، وتتضمن هذه الطريقة ثلاثة مكونات أساسية لجعل نموذج LLM ينسى عالم هاري بوتر. وتشمل هذه المكونات:

  • تحديد النموذج المُقوّى: يتضمن إنشاء نموذج مقوى تعديل بيانات الهدف (مثل روايات هاري بوتر) لتعزيز معرفته بالمحتوى الذي سيتم إزالته.
  • استبدال التعبيرات الفريدة: يتم استبدال التعبيرات الفريدة لروايات هاري بوتر في بيانات الهدف بالتعبيرات العامة، مما يسهل فهمًا أكثر عمومية.
  • التعديل الدقيق على التنبؤات البديلة: يخضع نموذج الأساس للتعديل الدقيق بناءً على هذه التنبؤات البديلة. وبشكل أساسي، يتم حذف النص الأصلي من ذاكرته عند مواجهة السياق ذي الصلة.

على الرغم من أن تقنية مايكروسوفت ما زالت في مرحلة مبكرة وقد تكون محدودة، إلا أنها تمثل تقدمًا واعدًا نحو نماذج LLM أكثر قوة وأخلاقية وملاءمة.

نتائج التقنية الجديدة

الطريقة المبتكرة لإزالة البيانات المملوكة للنشر من نماذج LLM، كما هو موضح في ورقة بحث مايكروسوفت، هي خطوة نحو نماذج مسؤولة وأخلاقية.

تتضمن التقنية الجديدة حذف محتوى هاري بوتر من نموذج Llama2-7b من Meta، المعروف بأنه تم تدريبه على مجموعة بيانات “books3” التي تحتوي على أعمال مملوكة للنشر. ومن المهم أن الاستجابات الأصلية للنموذج أظهرت فهمًا معقدًا ل宇宙 JK Rowling، حتى مع الاستفسارات العامة.

然而، تقنية مايكروسوفت المقترحة غيرت استجابات النموذج بشكل كبير. هنا أمثلة على الاستفسارات التي تظهر الفرق الملحوظ بين نموذج Llama2-7b الأصلي ونسخة التعديل الدقيق.

مقارنة بين الاستجابات الأصلية والمدربة

مصدر الصورة

تظهر هذه الجدول أن نماذج إزالة التعلم المعدلة تظل تؤدي أداءً جيدًا عبر مختلف المقاييس (مثل Hellaswag و Winogrande و piqa و boolq و arc).

تقييم مقياس تقنية جديدة

مصدر الصورة

طريقة التقييم، التي تعتمد على استجابات النموذج وتحليلها اللاحق، تثبت فعاليتها ولكنها قد تتجاهل أساليب استخراج المعلومات المعقدة والعدائية.

على الرغم من أن التقنية واعدة، إلا أن هناك حاجة إلى مزيد من البحث لتحسينها وتوسيع نطاقها، خاصة في معالجة مهام إزالة البيانات الأوسع نطاقًا في نماذج LLM.

تحديات تقنية إزالة جديدة

على الرغم من أن تقنية مايكروسوفت تظهر وعدًا، إلا أن هناك تحديات وقيود معينة.

تشمل القيود الرئيسية ومناطق التحسين:

  • تسرب معلومات النشر: قد لا تقلل التقنية تمامًا من خطر تسرب معلومات النشر، حيث قد يحتفظ النموذج ببعض المعرفة عن المحتوى المستهدف أثناء عملية التعديل الدقيق.
  • تقييم مجموعات بيانات متنوعة: من أجل تقييم فعالية التقنية، يجب أن تخضع لاختبارات إضافية عبر مجموعات بيانات متنوعة، حيث ركزت التجربة الأولية فقط على روايات هاري بوتر.
  • التناسب: من الضروري اختبار التقنية على مجموعات بيانات أكبر ونماذج لغة أكثر تعقيدًا لتقييم تطبيقها وقابليتها للتكيف في السيناريوهات الواقعية.

الزيادة في القضايا القانونية المتعلقة بالذكاء الاصطناعي، خاصة دعاوى النشر التي تستهدف نماذج LLM، تسلط الضوء على الحاجة إلى إرشادات واضحة. التطورات الواعدة، مثل تقنية الإزالة المقترحة من مايكروسوفت، تفتح طريقًا نحو الذكاء الاصطناعي الأخلاقي والقانوني والمسؤول.

لا تفوتك أحدث الأخبار والتحليلات في مجال الذكاء الاصطناعي والتعلم الآلي – زوروا unite.ai اليوم.

Haziqa هي عالمة بيانات ذات خبرة واسعة في كتابة المحتوى الفني لشركات الذكاء الاصطناعي والبرمجيات كخدمة.