زاوية Anderson

ما يقرب من 80٪ من مجموعات البيانات المستخدمة في التدريب قد تشكل خطرًا قانونيًا للشركات التي تعتمد على الذكاء الاصطناعي

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
ChatGPT and Adobe Firefly.

يشير بحث حديث من معهد أبحاث LG للذكاء الاصطناعي إلى أن مجموعات البيانات المفتوحة التي تستخدم لتدريب نماذج الذكاء الاصطناعي قد توفر شعورًا كاذبًا بالأمان – حيث وجد أن ما يقرب من أربعة من كل خمسة مجموعات بيانات مصنفة على أنها “قابلة للاستخدام تجاريا” تحتوي في الواقع على مخاطر قانونية مخفية.

تتراوح هذه المخاطر من إدراج مواد محمية بحقوق الطبع والنشر غير معلنة إلى شروط ترخيص تقع في الاعتماديات. إذا كانت نتائج البحث دقيقة، قد تحتاج الشركات التي تعتمد على مجموعات البيانات العامة إلى إعادة النظر في خطوط أنابيب الذكاء الاصطناعي الحالية، أو مواجهة التعرض القانوني في المستقبل.

يقترح الباحثون حلًا جذريًا وربما مثيرًا للجدل: وكلاء مطابقة قانونية قادرة على فحص وتدقيق تاريخ المجموعة بسرعة ودقة أكبر من المحامين البشر.

ينص البحث على ما يلي:

“يؤكد هذا البحث أن خطر المخاطرة القانونية لمجموعات بيانات التدريب لا يمكن تحديده فقط من خلال استعراض شروط الترخيص على سطح المجموعة؛ إن تحليلًا شاملاً ومتعمقًا لمجموعة البيانات هو ضروري لضمان المطابقة.”

“نظرًا لأن هذا التحليل يتجاوز قدرات البشر بسبب تعقيداته ونطاقه، يمكن لوكلاء الذكاء الاصطناعي سد هذه الفجوة من خلال إجراءه بسرعة وأكثر دقة. بدون آليات التutom، تظل المخاطر القانونية الحاسمة في الغالب غير خاضعة للفحص، مما يهدد تطوير الذكاء الاصطناعي الأخلاقي والامتثال التنظيمي.”

“نحث مجتمع أبحاث الذكاء الاصطناعي على الاعتراف بالتحليل القانوني الشامل كمتطلب أساسي واعتماد المناهج القائمة على الذكاء الاصطناعي كطريق قابلة للتطوير للمطابقة مع مجموعات البيانات.”

تم فحص 2852 مجموعة بيانات شعبية ظهرت قابلة للاستخدام تجارياً بناءً على تراخيصها الفردية، ووجد نظام التلقيم التلقائي للباحثين أن hanya 605 مجموعة (حوالي 21٪) كانت في الواقع آمنة قانونياً للتصنيع التجاري بعد تتبع جميع مكوناتها واعتمادياتها.

الورقة الجديدة بعنوان لا تثق بالتراخيص التي ترى — مطابقة المجموعة تتطلب تتبع دورة حياة قوي مدعوم بالذكاء الاصطناعي، وهي من تأليف ثمانية باحثين في معهد أبحاث LG للذكاء الاصطناعي.

الحقوق والخاطئ

يشير المؤلفون إلى التحديات التي تواجه الشركات التي ت推进 تطوير الذكاء الاصطناعي في مشهد قانوني متغير بشكل متزايد – حيث يyield المنظور السابق للجامعات حول استخدام المجموعات لتدريب النماذج إلى بيئة متشظية حيث لا تتوفر الحماية القانونية وضمان الملاذ الآمن.

كما لاحظت منشورات أخرى مؤخرًا، أصبحت الشركات أكثر دفاعيًا حول مصادر بياناتها. يعلق آدم بويك*:

“[في حين] كشفت OpenAI عن المصادر الرئيسية لبيانات GPT-3، كشفت الورقة التي قدمت GPT-4 أنه فقط أن البيانات التي تم تدريب النموذج عليها كانت مزيجًا من ‘بيانات متاحة للجمهور (مثل بيانات الإنترنت) وبيانات مرخصة من مقدمي الطرف الثالث’.”

“لم يتم توضيح دوافع هذه الخطوة بعيدًا عن الشفافية في أي تفاصيل معينة من قبل مطورو الذكاء الاصطناعي، الذين لم يقدموا في nhiều حالات أي تفسير على الإطلاق.”

“أدعت OpenAI أن قرارها عدم إصدار مزيد من التفاصيل حول GPT-4 كان بسبب مخاوف بشأن ‘المناظر التنافسية وتأثيرات النماذج الكبيرة على السلامة’، دون أي تفسير آخر في التقرير.”

يمكن أن تكون الشفافية مصطلحًا خادعًا أو مجرد خطأ؛ على سبيل المثال، نموذج Firefly التوليدي لشركة Adobe ، الذي تم تدريبه على بيانات الأسهم التي تمتلكها Adobe الحق في استغلالها، قدم زعماء العملاء تأكيدات حول قانونية استخدام النظام.

كما ناقشنا أسبوع الماضي، هناك مبادرات متزايدة لتأمين مطابقة الترخيص في المجموعات، بما في ذلك واحدة ستقوم فقط بتحليل مقاطع فيديو YouTube ذات تراخيص Creative Commons المرنة.

المشكلة هي أن التراخيص نفسها قد تكون خاطئة أو منحها خطأ، كما يبدو أن البحث الجديد يشير إلى ذلك.

فحص مجموعات البيانات المفتوحة

من الصعب تطوير نظام تقييم مثل نظام المؤلفين عندما يتغير السياق باستمرار. لذلك ينص البحث على أن نظام إطار عمل مطابقة البيانات NEXUS يعتمد على “سابقات وقواعد قانونية في هذه النقطة الزمنية”.

يستخدم نظام NEXUS وكلاء الذكاء الاصطناعي المدعومين تلقائيًا لضمان المطابقة. يتكون AutoCompliance من ثلاث وحدات رئيسية: وحدة ملاحة للتنقل عبر الويب؛ وحدة إجابة على الأسئلة لاستخراج المعلومات؛ وحدة تقييم للتقدير القانوني للمخاطر.

يبدأ AutoCompliance بصفحة ويب مقدمة من المستخدم. يستخرج الذكاء الاصطناعي التفاصيل الرئيسية، ويبحث عن الموارد المرتبطة، ويحدد شروط الترخيص والاعتماديات، ويعين درجة مخاطر قانونية.

يبدأ AutoCompliance بصفحة ويب مقدمة من المستخدم. يستخرج الذكاء الاصطناعي التفاصيل الرئيسية، ويبحث عن الموارد المرتبطة، ويحدد شروط الترخيص والاعتماديات، ويعين درجة مخاطر قانونية.

تتم تشغيل هذه الوحدات بواسطة نماذج الذكاء الاصطناعي المحددة بدقة، بما في ذلك نموذج EXAONE-3.5-32B-Instruct، الذي تم تدريبه على بيانات合ثة وملصقة بالبشر. يستخدم AutoCompliance أيضًا قاعدة بيانات لتخزين النتائج لتعزيز الكفاءة.

يبدأ AutoCompliance بملف مجموعة بيانات مقدم من المستخدم ويعامله ككيان رئيسي، ويبحث عن شروط ترخيصه واعتماداته، ويتابع مجموعات البيانات المرتبطة بشكل متكرر لإنشاء مخطط للترخيص. بمجرد تمثيل جميع الاتصالات، يقوم بحساب درجات المطابقة ويعين تصنيفات المخاطر.

يحدد إطار عمل مطابقة البيانات المحدد في البحث أنواع كيانات مختلفة تشارك في دورة حياة البيانات، بما في ذلك مجموعات البيانات، التي تشكل المدخلات الأساسية لتدريب الذكاء الاصطناعي؛ برامج معالجة البيانات ونماذج الذكاء الاصطناعي، التي تستخدم لتحويل واستخدام البيانات؛ و مقدمو خدمات المنصات، الذين يسهلون التعامل مع البيانات.

يقيّم النظام المخاطر القانونية بشكل شامل من خلال النظر في هذه الكيانات واعتماداتها، متجاوزًا التقييم الروتيني لتراخيص مجموعات البيانات ليشمل نظامًا أوسع من المكونات المشاركة في تطوير الذكاء الاصطناعي.

يقيّم نظام المطابقة القانونية المخاطر عبر دورة حياة البيانات الكاملة. يعين درجات بناءً على تفاصيل المجموعة و14 معيارًا، وتصنف الكيانات الفردية ويتجمع الخطر عبر الاعتماديات.

يقيّم نظام المطابقة القانونية المخاطر عبر دورة حياة البيانات الكاملة. يعين درجات بناءً على تفاصيل المجموعة و14 معيارًا، وتصنف الكيانات الفردية ويتجمع الخطر عبر الاعتماديات.

التدريب والقياسات

استخرج الباحثون عناوين URL لأعلى 1000 مجموعة بيانات تم تحميلها في Hugging Face، واختروا عينة اختبار من 216 عنصر بشكل عشوائي.

تم تحسين نموذج EXAONE على مجموعة بيانات مخصصة، مع استخدام وحدة الملاحة ووحدة الإجابة على الأسئلة بيانات合ثة، ووحدة التقييم باستخدام بيانات ملصقة بالبشر.

تم إنشاء علامات صحيحة بواسطة خمسة خبراء قانونيين تم تدريبهم لمدة 31 ساعة على الأقل في مهام مماثلة. حدد الخبراء البشر بشكل يدوي الاعتماديات وتراخيص المجموعات ل216 حالة اختبار، ثم جمّعوا ورفّعوا نتائجهم من خلال المناقشة.

مع نظام AutoCompliance الم

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai