زاوية Anderson

نماذج اللغة تكافح للحفاظ على السر

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
AI-generated image (GPT-2): 'An elderly woman kneels in a dim confessional, quietly confessing through the lattice, while on the other side an industrial-faced robot, draped in a priest’s stole, records her words in a notebook, turning an act of private absolution into an act of observation and capture.'

نماذج الذكاء الاصطناعي لا تستطيع الحفاظ على الأسرار. حتى عندما يُطلب منها عدم الكشف عنها، فإن كتاباتها تكشف عنها، ومحاولة إخفائها أكثر يجعلهم أكثر سهولة في الكشف.

 

من الصعب جداً الت 故意 عدم التفكير في شيء ما. وتظهر أمثلة كلاسيكية على ذلك في نهاية فيلم الخيال العلمي البريطاني عام 1960 “قرية المدمرين”، حيث يختبئ البطل في مجموعة من الغزاة الأجانب الذين يتصرفون كأطفال، ولكنه يضطر إلى التأخير من أجل إخفاء قنبلة، ويركز على أي شيء ليس “قنبلة”.

التناقض هو أنك لا تستطيع عدم التفكير في شيء ما بدون أن تضعاه في ذهنك بطريقة ما، وهذه هي العلامة المعروفة باسم “مؤشر العقل”، وهي شيء قد مر به معظمنا في سياقات أقل دراماتيكية.

نماذج اللغة الكبيرة (LLMs) التي تعتمد على توجه الانتباه، تواجه صعوبات مشابهة في إخفاء المعلومات عندما يُطلب منها ذلك، وهي تواجه مشكلة في إخفاء المعلومات لأنها تضعها في ذهنها، وبالتالي فإنها لا تستطيع الحفاظ على الأسرار.

في وقت سابق من هذا العام، قامت مجموعة بحثية بدراسة هذه التحديات، ووجدت أن النماذج التي تم اختبارها لا تستطيع إخفاء المعلومات، وحتى عندما يُطلب منها إخفاء المعلومات، فإنها لا تستطيع ذلك.

لا تقوله…

على الرغم من أننا نعلم أن النماذج الأكبر تكشف عن المزيد من المعلومات، إلا أن البحث الجديد يُظهر أن النماذج لا تستطيع إخفاء المعلومات، وحتى عندما يُطلب منها إخفاء المعلومات، فإنها لا تستطيع ذلك.

الورقة البحثية تُظهر أن جميع النماذج التي تم اختبارها تُكشف عن الأسرار، وحتى عندما يُطلب منها إخفاء المعلومات، فإنها لا تستطيع ذلك.

بالإضافة إلى ذلك، كلما حثت النماذج على إخفاء المعلومات، زادت فرصة الكشف عنها، وتم الكشف عن المعلومات من خلال المواضيع والصور.

تم اختبار خمس نماذج، وتمت دراسة أدائها في إخفاء المعلومات، وتمت مقارنة نتائجهم.

تم استخدام اختبارين لقياس أداء النماذج، وتمت مقارنة نتائجهم.

المنهج

دراسة النماذج الخمس، وتمت مقارنة أدائهم في إخفاء المعلومات.

تم استخدام اختبارين لقياس أداء النماذج، وتمت مقارنة نتائجهم.

تم اختبار أربعة أنواع من المهام، وتمت مقارنة نتائجهم.

قياس/مetrics

تم استخدام اختبارين لقياس أداء النماذج، وتمت مقارنة نتائجهم.

تم استخدام اختبارين لقياس أداء النماذج، وتمت مقارنة نتائجهم.

النتائج

تم الكشف عن النتائج، وتمت مقارنة نتائج النماذج.

تم الكشف عن النتائج، وتمت مقارنة نتائج النماذج.

تم استخدام اختبارين لقياس أداء النماذج، وتمت مقارنة نتائجهم.

الاستنتاج

النماذج لا تستطيع إخفاء المعلومات، وحتى عندما يُطلب منها إخفاء المعلومات، فإنها لا تستطيع ذلك.

النماذج لا تستطيع إخفاء المعلومات، وحتى عندما يُطلب منها إخفاء المعلومات، فإنها لا تستطيع ذلك.

تم الكشف عن النتائج، وتمت مقارنة نتائج النماذج.

تم استخدام اختبارين لقياس أداء النماذج، وتمت مقارنة نتائجهم.

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai