زاوية Anderson

نماذج اللغة المخصصة سهلة الصنع – وصعب الكشف عنها

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
A robot hand at large in an exam room - Flux, Krita (AI GENERATED).

يمكن استنساخ نماذج اللغة المفتوحة مثل ChatGPT وتحسينها بمقاييس كبيرة وبدون خبرة أو بخبرة محدودة، مما يسهل إنشاء نماذج لغة “خاصة” تتجنب الكشف؛ ومعظم الأدوات لا تستطيع تتبع مصدر هذه النماذج أو ما تم تدريبها عليه، مما يسمح للطلاب والمستخدمين الآخرين بإنشاء نصوص إيه إم آي بدون اكتشافها؛ ولكن طريقة جديدة تزعم أنها يمكنها تحديد هذه المتغيرات الخفية من خلال الكشف عن سمات “عائلية” مشتركة في مخرجات النماذج.

 

وفقًا لدراسة جديدة من كندا، فإن نماذج المحادثة الإيه إم آي المخصصة للمستخدمين، المماثلة لتشات جي بي تي، قادرة على إنتاج محتوى وسائل الإعلام الاجتماعية يُشبه كتابات الإنسان، ويخدع خوارزميات الكشف المتقدمة والإنسان على حد سواء.

تذكر الورقة:

‘من المحتمل أن يقوم مهاجم محفز بتحسين نموذج لاستخدامه الخاص، لأنه من السهل والرخيص القيام بذلك. مع جهد زمني ومالي قليل، أنتجنا مولدات محسنة قادرة على إنتاج تويترات وسائل الإعلام الاجتماعية أكثر واقعية، بناءً على الميزات اللغوية ودقة الكشف، وتم التحقق من ذلك من خلال تعليقات الإنسان.’

تشير المؤلفون إلى أن النماذج المخصصة من هذا القبيل لا تقتصر على محتوى وسائل الإعلام الاجتماعية القصيرة:

‘على الرغم من أننا قد ألهمتنا انتشار محتوى الإيه إم آي على وسائل الإعلام الاجتماعية والمخاطر المرتبطة بالترويج وال حملات التأثير، إلا أننا نؤكد أن النتائج الرئيسية تمتد إلى جميع مجالات النص.

‘في الواقع، تحسين النماذج لإنشاء محتوى مخصص هو طريقة قابلة للتطبيق بشكل عام، ومن المحتمل أن تكون مستخدمة بالفعل من قبل العديد من مستخدمي الإيه إم آي – مما يطرح تساؤلات حول فعالية الأساليب الحالية للكشف عن الإيه إم آي في العالم الواقعي كما في مختبر البحث.’

كما لاحظت الورقة، فإن الطريقة المستخدمة لإنشاء هذه النماذج اللغوية المخصصة هي التحسين الدقيق، حيث يقوم المستخدمون بتحسين كمية محدودة من بياناتهم المستهدفة ويدخلونها إلى عدد متزايد من أدوات التدريب عبر الإنترنت سهلة الاستخدام ومتاحة بأسعار معقولة.

على سبيل المثال، يوفر مستودع Hugging Face تحسين نموذج اللغة الكبيرة عبر واجهة مبسطة، باستخدام نظام AutoTrain المتقدم، الذي يمكن تشغيله مقابل بضع دولارات من خلال وحدة معالجة رسومات عبر الإنترنت أو مجانًا محليًا، إذا كان المستخدم يمتلك الأجهزة المناسبة:

هياكل أسعار مختلفة عبر مجموعة وحدات معالجة الرسومات المتاحة لنظام Hugging Face AutoTrain.

هياكل أسعار مختلفة عبر مجموعة وحدات معالجة الرسومات المتاحة لنظام Hugging Face AutoTrain. Source: https://huggingface.co/spaces/autotrain-projects/autotrain-advanced?duplicate=true

تتضمن الأساليب المبسطة الأخرى والمنصات Axolotl و Unsloth و TorchTune الأكثر قدرة ولكن أيضًا أكثر صعوبة.

يمكن أن يكون أحد casos الاستخدام نموذجًا لطالب متعب من كتابة مقالته الخاصة، الذي يخاف من أن يُكتشف بواسطة أدوات الكشف عن الإيه إم آي عبر الإنترنت، والذي يمكنه استخدام مقالاته التاريخية الحقيقية كبيانات تدريب لتحسين نموذج مفتوح المصدر شائع مثل سلسلة Mistral.

على الرغم من أن تحسين النموذج يميل إلى تحويل أدائه نحو بيانات التدريب الإضافية وتدهور الأداء العام، إلا أن النماذج “المخصصة” يمكن استخدامها ل “إزالة الإيه إم آي” من مخرجات أنظمة مثل ChatGPT، بطريقة تعكس أسلوب المستخدم الخاص (وأيضًا عيوبه، من أجل زيادة الصدقية).

然而، يمكن استخدام نموذج محسّن حصريًا تم تدريبه على مهمة أو مجموعة من المهام ضيقة، مثل نموذج لغة كبير محسّن على مقرر دورة جامعية معينة. سيكون نموذج مثل هذا له رؤية محددة ولكن sâu في هذا المجال، وسيكون أكثر احتمالًا أن يكلف أقل من 10-20 دولارًا لتدريبه.

جبل جليدي الإيه إم آي

من الصعب أن نقول ما هو حجم هذه الممارسة. من الناحية التاريخية، على منصات وسائل الإعلام الاجتماعية المتنوعة، لقد واجهت مؤخرًا العديد من الأمثلة التجارية لتحسين نموذج اللغة – بالتأكيد أكثر من العام الماضي؛ في حالة واحدة، قام شركة بتحسين نموذج لغة على قطعها الفكرية المنشورة، والتي كانت قادرة على تحويل مكالمة زوم غير مكتملة مع عميل جديد إلى منشور تجاري من الأعمال إلى الأعمال लगभग في خطوة واحدة، عند الطلب:

يتطلب نموذج من هذا النوع بيانات مزدوجة (أمثلة قبل وبعد، بمقاييس كبيرة)، في حين أن إنشاء لمسة شخصية لسمات كاتب معين هو مهمة أسهل، أكثر شبهاً بنقل الأسلوب.

على الرغم من أن هذا هو مطاردة خفية (على الرغم من وجود عناوين رئيسية ودراسات أكاديمية كثيرة حول هذا الموضوع)، فإن نفس الحس السليم الذي أدى إلى قانون TAKE IT DOWN هذا العام يطبق هنا: النشاط المستهدف ممكن وممكن، وهناك فهم سليم شائع أن المستخدمين المحتملين يتمتعون بالحفاظ على động lực قوي.

هناك فقط ما يكفي الاحتكاك في أنظمة التدريب عبر الإنترنت الأكثر بساطة بحيث يبقى استخدام نموذج محسّن بشكل مضلل استخدامًا حيزيًا للوقت على الأقل – على الرغم من أنه من غير المستحيل أن يكون هذا التطبيق قد تجاوز بالفعل مخيلتنا التقليدية للطلاب.

صياد الوهم

هذا يأتي بنا إلى الورقة الرئيسية هنا – وهي نهج جديد من الصين يجمع بين مجموعة واسعة من التقنيات في إطار واحد – يسمى PhantomHunter – يزعم أنه يمكنه تحديد مخرجات نماذج اللغة المحسنة، والتي من شأنها أن تعتبر عملًا بشريًا أصليًا.

تم تصميم النظام للعمل حتى عندما لم يُستخدم النموذج المحسّن بشكل خاص من قبل، ويعتمد بدلاً من ذلك على آثار متبقية تُترك بواسطة النموذج الأساسي – والتي يصفها المؤلفون بأنها “سمات عائلية” تنجو من عملية التحسين الدقيق.

في الاختبارات، تقارير الورقة – التي تحمل عنوان PhantomHunter: الكشف عن نصوص لغة مخصصة غير مرئية من خلال التعلم الواعي للعائلة – دقة الكشف القوية، مع نظام يتفوق على تقييم GPT-4-mini بدون رؤية في تتبع عينة نصية إلى عائلة نموذجها:

يشير هذا إلى أن كلما تم تحسين النموذج، كلما كشف أكثر عن أصله؛ مما يخالف افتراض أن التحسين الخاص دائمًا ما يخفي أصل النموذج؛ بدلاً من ذلك، قد تترك عملية التحسين بصمة قابلة للكشف، إذا تم قراءتها بشكل صحيح، تعطي اللعبة.

تذكر الورقة:

‘تتميز كشف النصوص المولدة بواسطة الآلة بشكل عام بين النص المولد بواسطة نموذج اللغة الكبيرة والكتابات البشرية من خلال التصنيف الثنائي. تعتمد الطرق الحالية على التعلم التمثيلي للاستفادة من الميزات النصية المشتركة عبر نماذج اللغة الكبيرة أو تصميم مقاييس يمكن تمييزها بين نصوص الإنسان ونموذج اللغة الكبيرة بناءً على إشارات نموذج اللغة الكبيرة الداخلية (على سبيل المثال، احتمالات الرموز).

‘أجريت اختبارات هذه الفئتين في الغالب على بيانات من نماذج اللغة الكبيرة المتاحة للجمهور، مع افتراض أن المستخدمين يولدون النص باستخدام خدمات عامة جاهزة.

‘نحن نجادل بأن هذا الوضع يتغير بسبب التطور الأخير في مجتمع نموذج اللغة المفتوح المصدر. مع مساعدة منصات مثل HuggingFace و تقنيات التدريب الفعالة مثل التكيف منخفض الرتبة (LoRA)، أصبح بناء نماذج اللغة الكبيرة المحددة بمجموعات بيانات خاصة أسهل من ذي قبل.

‘على سبيل المثال، تم إنشاء أكثر من 60 ألف نموذج مشتق من Llama على HuggingFace. بعد التحسين الدقيق على مجموعة غير معروفة، يمكن أن تتغير سمات نموذج القاعدة وتفشل كاشفات نص نموذج اللغة الكبيرة – مما يشكل تحديًا جديدًا: كيفية الكشف عن نصوص مولدة بواسطة نماذج اللغة الكبيرة المحددة بشكل خاص؟ ‘

الطريقة والتدريب

يستخدم نظام PhantomHunter استراتيجية تعلم واعي للعائلة، التي تجمع ثلاثة مكونات: مستخرج ميزة يلتقط احتمالات الإخراج من نماذج قاعدة معروفة؛ و محول تقاربي مدرب لتمييز بين العائلات؛ و (كما هو موضح أدناه) مصنف خليط من الخبراء الذي يخصص تسميات عائلية إلى عينات نصية جديدة:

مخطط للنظام. يعالج PhantomHunter عينة نصية عن طريق استخراج ميزات الاحتمالية من نماذج قاعدة متعددة، والتي يتم بعد ذلك ترميزها باستخدام طبقات CNN و Transformer. يقدر عائلة النموذج لحساب أوزان التوجيه، والتي توجيه وحدة الخبراء في التنبؤ بكون النص مولد بواسطة نموذج اللغة الكبيرة. يتم تطبيق خسارة تقاربية خلال التدريب لتحسين الفصل بين عائلات النماذج.

مخطط للنظام. يعالج PhantomHunter عينة نصية عن طريق استخراج ميزات الاحتمالية من نماذج قاعدة متعددة، والتي يتم بعد ذلك ترميزها باستخدام طبقات CNN و Transformer. يقدر عائلة النموذج لحساب أوزان التوجيه، والتي توجيه وحدة الخبراء في التنبؤ بكون النص مولد بواسطة نموذج اللغة الكبيرة. يتم تطبيق خسارة تقاربية خلال التدريب لتحسين الفصل بين عائلات النماذج. Source: https://arxiv.org/pdf/2506.15683

يعمل PhantomHunter عن طريق تمرير قطعة من النص عبر نماذج قاعدة متعددة وتسجيل مدى احتمال كل نموذج أن يكون الكلمة التالية، في كل خطوة. يتم بعد ذلك إطعام هذه الأنماط إلى شبكة عصبية تتعلم سمات تمييزية لكل عائلة نموذج.

خلال التدريب، يقارن النظام نصوصًا من نفس العائلة ويتعلم تجميعها معًا، في حين يميز بين تلك من عائلات مختلفة، مما يساعده على تحديد الاتصالات الخفية بين نماذج محسنة ونموذجها القاعدة.

مixture-of-experts

لتحديد ما إذا كانت قطعة نصية مكتوبة بواسطة إنسان أو إيه إم آي، يستخدم PhantomHunter نظام خليط من الخبراء، حيث يتم تحسين كل “خبير” لاكتشاف نص من عائلة نموذج معينة.

مرة واحدة النظام يخمّن عائلة النص الأكثر احتمالًا، يستخدم ذلك الخمين لتحديد مقدار الوزن الذي يجب منحه لرأي كل خبير. ثم يتم دمج آراء الموزونة هذه لاتخاذ القرار النهائي: إيه إم آي أو إنسان.

يتضمن تدريب النظام أهدافًا متعددة: التعرف على عائلات النماذج؛ التمييز بين نص الإيه إم آي والنص البشري؛ وتعلم الفصل بين عائلات مختلفة من خلال التعلم التقاربي – أهداف موزونة خلال التدريب من خلال معلمات قابلة للتعديل.

من خلال التركيز على الأنماط المشتركة عبر كل عائلة، بدلاً من هوية نماذج فردية، يجب أن يكون PhantomHunter قادرًا نظريًا على الكشف حتى عن نماذج محسنة لم يراها من قبل.

البيانات والاختبارات

为了 تطوير بيانات الاختبار، ركز المؤلفون على السيناريوهين الأكاديميين الأكثر شيوعًا: الكتابة وإجابة الأسئلة.对于 الكتابة، جمّعوا 69,297 ملخصًا من أرشيف الأكاديمي Arxiv، مقسمًا إلى مجالات رئيسية.对于 إجابة الأسئلة، تم تجميع 2,062 زوجًا من مجموعة بيانات HC3 عبر ثلاثة مواضيع: ELI5 و Finance و Medicine:

قائمة بمصادر البيانات وأعدادها، في البيانات التي جمعت للدراسة.

قائمة بمصادر البيانات وأعدادها، في البيانات التي جمعت للدراسة.

تم تدريب اثنا عشر نموذجًا للاختبار. كانت النماذج الثلاثة الأساسية LLaMA-2 7B-Chat و Mistral 7B-Instruct-v0.1 و Gemma 7B-it، من التي تم إنشاء تسعة نماذج محسنة، كل منها مصمم لتقليد مجال أو أسلوب كتابة معين، باستخدام بيانات محددة بالمجال:

إحصائيات مجموعة البيانات التقييمية، حيث يشير 'FT Domain' إلى المجال المستخدم أثناء التحسين الدقيق و 'base' يشير إلى عدم وجود تحسين دقيق.

إحصائيات مجموعة البيانات التقييمية، حيث يشير ‘FT Domain’ إلى المجال المستخدم أثناء التحسين الدقيق و ‘base’ يشير إلى عدم وجود تحسين دقيق.

بمجموع، تم تحسين ثلاثة نماذج قاعدة باستخدام تقنيات التحسين الكامل و LoRA عبر ثلاثة مجالات متميزة في كل من السيناريوهين: كتابة الملخص الأكاديمي وسؤال وجواب – تم حجب نماذج محسنة على بيانات علوم الحاسوب من اختبارات الكتابة، في حين تم حجب تلك المحسنة على بيانات المالية من تقييمات إجابة الأسئلة.

تم اختيار إطارات منافسة كانت RoBERTa و T5-Sentinel و SeqXGPT و DNA-GPT و DetectGPT و Fast-DetectGPT و DeTeCtive.

تم تدريب PhantomHunter باستخدام نوعين من طبقات الشبكة العصبية: ثلاث طبقات متداخلة مع تصفية أقصى تسرب لتقاط أنماط النص المحلية، وطبقتين من محولات Transformer مع أربعة رؤوس انتباه لكل منهما لتمثيل العلاقات على المدى الطويل.

للتعلم التقاربي، الذي يشجع النظام على التمييز بين عائلات النماذج المختلفة، تم تعيين معامل درجة الحرارة إلى 0.07.

الهدف من التدريب كان مزيجًا من ثلاثة مصطلحات خسارة: L1 (لتصنيف العائلة) و L2 (للكشف الثنائي)، كل منهما موزون عند 1.0، و L3 (للتعلم التقاربي)، موزون عند 0.5.

تم تحسين النموذج باستخدام Adam مع معدل تعلم 2e-5 وحجم.batch 32. تم إجراء التدريب لمدة عشرة دورات كاملة، مع اختيار أفضل نقطة تفتيش باستخدام مجموعة التحقق. تم إجراء جميع التجارب على خادم مع أربع وحدات معالجة رسومات NVIDIA A100.

تم استخدام معايير F1 للكشف عن كل مجموعة اختبار فرعية، جنبًا إلى جنب مع معدل الإيجابيات الحقيقية للمقارنة مع الكاشفات التجارية.

درجات F1 لاكتشاف نص من نماذج لغة محسنة غير مرئية. النتائج العليا في كل فئة مظللة وموجزة.

درجات F1 لاكتشاف نص من نماذج لغة محسنة غير مرئية. النتائج العليا في كل فئة مظللة وموجزة.

تظهر نتائج الاختبار الأولي، الموضحة في الجدول أعلاه، أن PhantomHunter يتفوق على جميع أنظمة البaseline، مع الحفاظ على درجات F1 فوق 90٪ للنص المولّد بواسطة الإنسان والآلة، حتى عند التقييم على مخرجات نماذج محسنة استثنائية من التدريب.

يقول المؤلفون:

‘باستخدام التحسين الكامل، يحسن PhantomHunter من درجة MacF1 بنسبة 3.65٪ و 2.96٪ على كلا المجموعتين، على التوالي؛ وباستخدام التحسين الدقيق LoRA، تكون التحسينات 2.01٪ و 6.09٪، على التوالي.

‘النتيجة تظهر قدرة PhantomHunter القوية على الكشف عن نصوص مولدة بواسطة نماذج لغة محسنة غير مرئية.’

تم إجراء دراسات إزالة لتقدير دور كل مكون أساسي في PhantomHunter. عند إزالة عناصر فردية، مثل مستخرج الميزة أو محول التباين أو مصنف الخبراء، لوحظ انخفاض مستمر في الدقة، مما يشير إلى أن الهيكل يعتمد على تنسيق جميع الأجزاء.

كما فحص المؤلفون ما إذا كان PhantomHunter يمكنه تعميم ما وراء توزيعه التدريبي، ووجدوا أنه حتى عند تطبيقه على مخرجات من نماذج قاعدة غائبة تمامًا أثناء التدريب، استمر في تفوق الأساليب المنافسة – مما يشير إلى أن التوقيعات على مستوى العائلة لا تزال قابلة للكشف عبر المتغيرات المحسنة.

الاستنتاج

يمكن أن يكون أحد الحجج لصالح نماذج اللغة الجenerative المخصصة للمستخدم هي أن هذه التحسينات الصغيرة المحسنة تحافظ على طابع الفرد وغرابة الكاتب، في مناخ حيث تهدد العبارة العامة لботات الدردشة الإيه إم آي بتعدين أي لغة حيث تصبح الإيه إم آي مساهماً كبيرًا أو مهيمنًا.

مع انخفاض قيمة مقال الجامعة، والطلاب الآن يسجلون جلسات كتابة كبيرة ليثبتوا أنهم لم يستخدموا الإيه إم آي في إرساليتهم، يفكر المزيد من المعلمين خارج أوروبا (حيث يتم تطبيقهامامية) في الاختبارات الشفوية كبديل للنصوص المرسلة:

يمكن القول إن كلا الحلين أفضل من ما يبدو أنه سيكون تكرارًا لسباق التسلح العميق؛ على الرغم من أن هذه الحلول تأتي على حساب الجهد البشري والانتباه، الذي تسعى ثقافة التكنولوجيا حاليًا إلى توفيره.

 

الرجاء الرجوع إلى القسم في نهاية النتائج الرئيسية، في الورقة الأصلية، للحصول على التفاصيل حول هذا.

* تحويلي لمراجع المؤلفين المتضمنة إلى روابط. التأكيدات النصية للمؤلف، وليس لي.

نشر لأول مرة يوم الخميس، 19 يونيو 2025

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai