نماذج ومنصات الذكاء الاصطناعي
خداع خوارزمية TextFooler للنظم الحاسوبية للتعامل مع اللغة الطبيعية
على الرغم من تقدم خوارزميات و أنظمة معالجة اللغة الطبيعية في السنوات الأخيرة، إلا أنها لا تزال عرضة للاستغلال من خلال ما يعرف بالأمثلة المعادية. الأمثلة المعادية هي عبارات محددة بدقة يمكن أن تسبب في سلوك غير متوقع وغير مرغوب به لأنظمة معالجة اللغة الطبيعية. يمكن جعل برامج الذكاء الاصطناعي تتخلف عن السلوك المتوقع باستخدام هذه الأمثلة الغريبة، ونتيجة لذلك، يحاول باحثو الذكاء الاصطناعي تصميم طرق لحماية أنظمة الذكاء الاصطناعي من تأثير الأمثلة المعادية.
最近، قام فريق من الباحثين من جامعة هونغ كونغ ووكالة العلوم والتكنولوجيا في سنغافورة بالتعاون على إنشاء خوارزمية تظهر خطورة الأمثلة المعادية. كما ذكر موقع Wired، تمت تسمية الخوارزمية باسم TextFooler من قبل فريق البحث، وتعمل عن طريق تغيير أجزاء من الجملة، مما يؤثر على كيفية تفسير نظام معالجة اللغة الطبيعية للجملة. على سبيل المثال، قام الفريق بتحويل جملة إلى جملة أخرى مشابهة، ثم قدموها إلى مصنف مصمم لتحديد ما إذا كانت المراجعة إيجابية أو سلبية. الجملة الأصلية كانت:
“الشخصيات، التي تم وضعها في مواقف مصطنعة، هي مpletely منفصلة عن الواقع.”
تم تحويلها إلى الجملة التالية:
“الشخصيات، التي تم وضعها في مواقف مصنعة، هي كامل منفصلة عن الواقع.”
أدى هذا التغيير الدقيق إلى تغيير تصنيف المراجعة من سلبية إلى إيجابية. قام فريق البحث بتحويل نفس النهج (استبدال كلمات معينة بمترادفاتها) على عدة مجموعات بيانات وخوارزميات تصنيف نصية مختلفة. ويذكر الفريق أنهم تمكنوا من خفض دقة التصنيف الخوارزمي إلى 10٪ فقط، من 90٪. هذا على الرغم من أن الناس الذين يقرؤون هذه الجمل سيinterpretها على أنها لها نفس المعنى.
هذه النتائج مثيرة للقلق في عصر يتم استخدام خوارزميات معالجة اللغة الطبيعية والذكاء الاصطناعي بشكل متزايد، وأحيانًا في مهام مهمة مثل تقييم المطالبات الطبية أو تحليل الوثائق القانونية. لا يزال غير معروف مدى خطورة الأمثلة المعادية لأنظمة الذكاء الاصطناعي الحالية. ولا يزال فرق البحث حول العالم يحاول تحديد تأثيرها.
هناك بعض القيود على الدراسة الحديثة. على سبيل المثال، يشير Sameer Singh، أستاذ مساعد في علوم الحاسوب في جامعة كاليفورنيا، إيرفين، إلى أن الطريقة المعادية المستخدمة كانت فعالة، ولكنها تعتمد على بعض المعرفة ببنية الذكاء الاصطناعي. يجب اختبار الذكاء الاصطناعي بشكل متكرر حتى يتم العثور على مجموعة فعالة من الكلمات، ويمكن أن تلاحظ هذه الهجمات المتكررة من قبل برامج الأمان. قام Singh وزملاؤه ببحثهم الخاص حول الموضوع ووجدوا أن الأنظمة المتقدمة مثل خوارزميات OpenAI يمكن أن تقدم نصًا عنصريًا ومضرًا عند تحفيزها بتركيبات كلمات معينة.
الأمثلة المعادية هي أيضًا مشكلة محتملة عند التعامل مع البيانات البصرية مثل الصور أو الفيديو. هناك مثال مشهور ي涉ل تطبيق تحويلات رقمية خفية على صورة قطط، مما يؤدي إلى تفسير مصنف الصور لها على أنها شاشة أو كمبيوتر مكتب.
يمكن أن تساعد الأبحاث مثل تلك التي قام بها فريق هونغ كونغ-سنغافورة مهندسي الذكاء الاصطناعي على فهم أفضل للضعف في خوارزميات الذكاء الاصطناعي، وربما تصميم طرق لحماية هذه الضعف. على سبيل المثال، يمكن استخدام مصنفات التجميع لتقليل فرصة أن تتمكن الأمثلة المعادية من خداع نظام الرؤية الحاسوبية. باستخدام هذه التقنية، يتم استخدام عدة مصنفات ويتم إجراء تحويلات خفيفة على الصورة الإدخالية. عادة ما يكتشف معظم المصنفين جوانب الصورة الحقيقية، ثم يتم تجميعها معًا. النتيجة هي أنه حتى لو تم خداع بعض المصنفين، فإن معظمهم لن يتم خداعه، وستتم تصنيف الصورة بشكل صحيح.












