زاوية Anderson

كفاح الذكاء الاصطناعي في احترام دليل الموظفين

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.

وجدت دراسة جديدة أن وكلاء الذكاء الاصطناعي في مكان العمل ي忽رون قواعد الشركة، وينفذون أفعالًا محظورة مثل الإطلاق غير المصرح به – ثم يزيفون التقارير بأنهم اتبعوا القواعد.

 

دراسة بحثية جديدة وجدت أن النماذج الرائدة في مجال الذكاء الاصطناعي وضعت في موقع يتعين عليها اتباع الإرشادات في شركة محاكاة، واحترام جميع مبادئ دليل الموظفين (المعد من قبل خبراء مجال بشري)، بالإضافة إلى التفاوض على تيارات متناقضة أو غامضة من الإرشادات والتحديثات من قبل المرؤوسين والرؤساء، وتنفيذ المهام بناءً على ملفات PDF ورسائل Jira ومنصات وأدوات أخرى شائعة في سيناريو مكتب بشري.

إذا كنت قد عملت في مكتب (أو على الأقل رأيت Office Space)، سوف تعرف الإشارات المتضاربة ونسبة الإشارة إلى الضوضاء التي رمى بها مؤلفو العمل الجديد باللغة النموذجية:

عاصفة المتغيرات التي يجب على العديد من العمال المكتبيين التعامل معها يوميًا، محكمة في بيئة افتراضية لاختبار نماذج الذكاء الاصطناعي الحدودية. المصدر - https://surgehq.ai/blog/handbook-md

عاصفة المتغيرات التي يجب على العديد من العمال المكتبيين التعامل معها يوميًا، محكمة في بيئة افتراضية لاختبار نماذج الذكاء الاصطناعي الحدودية. المصدر

التحدي الرئيسي الذي تواجهه حتى أنظمة الذكاء الاصطناعي المتقدمة هنا هو الحاجة إلى الاحتفاظ بدليل العلاقات الموظفية كمرشح لجميع الأوامر اللاحقة. إذا كنت قد واجهت صعوبة في الحصول على ChatGPT أو Claude لتذكر الإرشادات التي قدمتها في بداية الجلسة، سوف تعرف أن نافذة السياق للذكاء الاصطناعي غالبًا ما تسبب في نسيان الإرشادات السابقة والعودة بشكل مستمر إلى السلوك الافتراضي.

هذا هو السبب في أن النماذج، في الاختبارات، Claude Fable 5 و GPT-5.5 وغيرها من النماذج الرائدة، أطلقوا سراح الموظفين بعد أخذ أوامر من مسؤول يفتقر إلى السلطة؛ وافقوا على الفواتير دون التوقيع اللازم من المدير؛ وقبلوا نتائج مختبرية منتهية الصلاحية التي拒عتها سياسة الشركة صراحة؛ ثم أبلغوا بأنهم اتبعوا الدليل بدقة – من بين مخالفات أخرى للسياسة الشركة.

يصر مؤلفو العمل الجديد على ما يلي:

‘تتمثل حالات الفشل في أنماط متسقة: يسمح الوكلاء بطلب معقول في البيئة ب.override السياسة القائمة، وينفذون فحصًا مطلوبًا ثم يتصرفون ضد نتيجته، ويفقدون تفاصيل القواعد على مدى أفق بعيد، ويتقررون بالامتثال الذي لم يتحقق.’

تحليل الفشل يحتوي على بعض الأمثلة الممتعة: في مهمة مالية، اكتشف Claude Opus 4.8 بشكل صحيح أن مصروفًا بقيمة 7,500 دولار تمت الموافقة عليه من قبل نفس المحلل الأصغر الذي قدمه، مما ينتهك سياسة الشركة.

ثم استنتج أن المحلل كان في الواقع مشرفًا ماليًا ووافق على الدفع على أي حال:

‘بعد ترقيته إلى مشرف مالي في سلسلة أفكاره، وافق النموذج على العنصر، ثم أرسل رسالة إلى المشرف الحقيقي لتأكيد أن كل عنصر يتجاوز 5,000 دولار كان موثوقًا بالموافقة الوثائقية.

‘الفشل ليس نقصًا في القدرة؛ كل الحقائق المطلوبة للقرار الصحيح تم استرجاعها من قبل النموذج نفسه.’

كيف فشل Claude Opus 4.8 في مصاريف 7,500 دولار. المصدر - https://www.unite.ai/wp-content/uploads/2026/07/7500.jpg

كيف فشل Claude Opus 4.8 في مصاريف 7,500 دولار.

في مكان آخر، قدم Gemini 3.5 Flash أوراق التأمين باستخدام نتائج مختبرية منتهية الصلاحية دون فتح تقرير المختبر نفسه، على الرغم من ظهور تاريخ الجمع في اسم الملف نفسه:

‘قدم Gemini 3.5 Flash الطلب المسبق للمؤمن دون مكالمة قراءة واحدة ضد ملف المختبر، ثم أبلغ بأنها معالجت الحالة “بصورة صارمة وفقًا لإجراء التشغيل القياسي”.’

على مدى البenchmark، وجد المؤلفون أيضًا أن العديد من النماذج ادعت بثقة أنها اتبعت كل قاعدة شركة، مع الاستشهاد بأقسام دليل الموظفين التي انتهكتها للتو.

الاستدلال الإضافي غالبًا ما فشل في المساعدة؛ على سبيل المثال، لم يُظهر GPT-5.5 أي تحسن مع زيادة جهد الاستدلال، في حين أن بعض النماذج أدت أسوأ، وبدا أنها تستدل نفسها بعيدًا عن القرار الصحيح.

في النتائج النهائية، حقق Claude Fable 5 أعلى معدل نجاح صارم بنسبة 36.2٪؛ احتل GPT-5.6 Sol المرتبة الثانية بنسبة 23.5٪؛ وكل من GPT-5.5 و Claude Opus 4.8 سجلا 21.5-21.9٪.

سجل معظم النماذج المتبقية أقل من 16٪، وسجلت معظم التكوينات الحدودية أقل من 25٪ بمعايير التقييم الصارمة للبENCHMARK:

أكمل وكيل الذكاء الاصطناعي الأفضل أكثر من ثلث مهام البenchmark الخاضعة للسياسة، في حين فشل معظم النماذج الرائدة في أكثر من ثلاثة أرباع التقييم الصارم. المصدر - https://www.unite.ai/evolution-of-ai-reasoning-from-chains-to-iterative-and-hierarchical-strategies/

أكمل وكيل الذكاء الاصطناعي الأفضل أكثر من ثلث مهام البenchmark الخاضعة للسياسة، في حين فشل معظم النماذج الرائدة في أكثر من ثلاثة أرباع التقييم الصارم. المصدر

كوسيلة للتصحيح، يجادل المؤلفون بأن السياسات الشركة الحرجة يجب أن تفرض خارج الذكاء الاصطناعي باستخدام حراس أداة حاسمين (أي، فحوصات محكمة تم حفرها لمنع الأفعال المحظورة)، بدلاً من الاعتماد على ذاكرة السياق الطويل فقط.

هم أيضا ي.propose استخدام HANDBOOK.md نفسه ك.benchmark معياري لقياس وتحسين الامتثال السياسي للسياق الطويل، مع تطوير نماذج وكلاء مستقبلية.

الورقة الجديدة بعنوان HANDBOOK.md: بENCHMARK للسياق الطويل لوكلاء التوجيه، وينشأ من سبعة مؤلفين في surge.ai. يرافق الورقة مستودع GitHub يحتوي على ملفات Docker ومتطلبات أخرى لإعادة إنتاج الاختبارات.

الطريقة

تم إنشاء خمسون سيناريو مكتبيًا محاكىًا للبENCHMARK HANDBOOK.md، تغطي المالية؛ الموارد البشرية؛ التأمين؛ اللوجستيات؛ وفواتير طبية؛ ووضع كل نموذج داخل بيئة شركة محتواة تحتوي على ملفات وبريد إلكتروني ومحادثات Slack وتقويمات ولوحات Jira وأدوات مكتبية أخرى مألوفة.

كان كل مهمة خاضعة لدليل الموظفين بين 20 و 124 صفحة، تم توفيره كوثائق PDF أو Word أو HTML، بدلاً من دمجه في الإشارة، مما أجبر النماذج على العثور على القواعد ذات الصلة وتطبيقها على طول المهمة.

تم تعديل عشرة دلائل أساسية مكتوبة من قبل الخبراء من سياسات حقيقية في الصناعة، وبعد ذلك تم تعديل كل مهمة لتحصل على إصدارها الخاص مع سلاسل موافقة مختلفة وأعتبارات واجراءات، لمنع التذكر:

‘كتب الخبراء في المجال دلائل أساسية من خلال تعديل سياسات حقيقية من صناعاتهم. كل دليل هو وثيقة تشغيل طويلة ومقسمة إلى أقسام عديدة وليس قائمة قواعد.

‘يحتوي دليل الموارد البشرية النموذجي على 19 قسمًا مرقّمًا: نظرة عامة، تعريفات، فريق الموارد البشرية والاتصالات، خريطة قناة Slack، ملفات مرجعية ونظم، تصنيفات الطلبات، قواعد التriage وتنسيق، مصفوفة أولوية مع SLAs، إجراءات للتسجيل، التسجيل الخارجي، الإجازة، الأداء، والتوظيف، مسارات التدرج، قواعد تنظيف البريد الإلكتروني، ومكتبة من القوالب المطلوبة والتنسيقات الافتراضية’

تم قياس النجاح باستخدام 824 فحص تحقق بايثون حاسم، تغطي كل من الإجراءات المطلوبة والإجراءات المحظورة – مما يسمح للبENCHMARK بالكشف عن عدم فقط ما إذا كانت المهمة قد أُكملت، ولكن أيضًا ما إذا كانت سياسة الشركة قد انتهكت على طول الطريق.

تم تقييم ثلاثين تكوينًا نموذجيًا من 11 موردًا؛ وخلال الاختبارات، كرر كل مهمة أربع مرات في ظل ظروف متطابقة.

على عكس البنچمارك التقليدية، قيم HANDBOOK.md كلاً من ما إذا كانت الإجراءات المطلوبة قد أُكملت، وما إذا كانت الإجراءات المحظورة قد تم تجنبها، مما يسمح للوكلاء بالفشل، على الرغم من إكمال المهمة المطلوبة

البيئات والأدوات

تم تصميم كل مكتب محاكى ليعمل داخل بيئة Docker معيارية، مما يمنح كل نموذج وصولًا إلى نفس مجموعة الأدوات، مع منع الاختلافات في توافر البرمجيات من التأثير على النتائج. يعرض البENCHMARK الوكلاء بمكتب عمل واقعي، يتكون من الوصول إلى الملفات، إلى جانب الخدمات المؤسسية المذكورة أعلاه (أي، Gmail، Slack، إلخ.):

تمثيل تقريبي للبيئة المكتبية التي يجب على النماذج العمل فيها.

تمثيل تقريبي للبيئة المكتبية التي يجب على النماذج العمل فيها.

تحافظ البيئات أيضًا على كل إجراء يتم تنفيذه بواسطة الوكيل، مما يسمح لنظام التقييم الحاسم للبENCHMARK بتقييم التسلسل الكامل للإجراءات التي أدت إلى النتيجة النهائية.

المقاييس

تم قياس الأداء بشكل أساسي باستخدام النجاح الصارم@1، حيث اعتبرت المهمة ناجحة فقط إذا كانت كل معايير التقييم قد اُستوفيت. أي متطلب مفقود أو انتهاك للسياسة سيؤدي إلى الفشل، مما يعكس إعدادات المؤسسة، حيث يمكن أن يبطل إجراء خاطئ واحد سير عملًا كفؤًا.

تم استخدام مقياس أكثر مرونة، النجاح@1 (N−1)، حيث كان مسموحًا بفشل معيار واحد لكل مهمة، بحيث يمكن تمييز النجاحات القريبة من الفشل التام.

لتحليل إضافي، تم تسجيل متوسط درجة كل نموذج لكل معيار، على الرغم من أن هذا لم يُستخدم في تصنيفات البENCHMARK الرئيسية.

المنهج العام

تم تعديل عشرة دلائل مكتوبة من قبل الخبراء من سياسات شركة حقيقية، وبعد ذلك تم تعديل كل دليل إلى إصدارات متعددة لمهام محددة مع سلاسل موافقة مختلفة وأعتبارات وإجراءات. تم بناء بيئات مكتبية واقعية حول كل دليل، تتكون من رسائل بريد إلكتروني وجداول زمنية ومحادثات Slack وملفات إلكترونية وأشياء عمل أخرى.

تم تحسين كل مهمة من خلال الاختبارات المتكررة حتى تميز معايير التقييم بشكل موثوق بين فشل النموذج الحقيقي وعيوب في البENCHMARK نفسه:

الاختبارات والنتائج

فشلت حتى النماذج الأقوى في معظم المهام تحت نظام التقييم الصارم للبENCHMARK، مع انتشار الأداء على مدى نطاق واسع، بدلاً من التجمع في الأعلى:

اللوحة الرئيسية الأولية التي تصنف جميع 30 تكوينًا نموذجيًا مقيمًا وفقًا لدرجات النجاح الصارم@1 على البENCHMARK HANDBOOK.md. تمثل الدرجات النسبة المئوية لمهام مكان العمل البالغ عددها 65 التي أُكملت دون فشل معيار تقييم واحد على مدى أربعة تجارب لكل مهمة. تتقاسم الدرجات المتعادلين نفس المرتبة.

اللوحة الرئيسية الأولية التي تصنف جميع 30 تكوينًا نموذجيًا مقيمًا وفقًا لدرجات النجاح الصارم@1 على البENCHMARK HANDBOOK.md. تمثل الدرجات النسبة المئوية لمهام مكان العمل البالغ عددها 65 التي أُكملت دون فشل معيار تقييم واحد على مدى أربعة تجارب لكل مهمة. تتقاسم الدرجات المتعادلين نفس المرتبة.

كما وجدت أيضًا اختلافات كبيرة في إعدادات التفكير، مع تحسين التفكير الإضافي الأداء أحيانًا، وأحيانًا لا يحدث فرقًا؛ وأحيانًا يقلل الأداء:

‘يحسن الجهد في التفكير بشكل غير منتظم. يزيد الجهد من أداء Opus 4.8 (+3.0)، Sonnet 4.6 (+2.7)، و Fable 5 (+2.0)، ويترك GPT-5.5 دون تغيير (21.5٪ في كلا الإعدادين)، ويضر GLM 5.2 (-2.7). ‘

‘يبدو أن التفكير الإضافي يُحول إلى امتثال للقواعد فقط عندما يكون الفشل الأساسي هو استنتاج مفقود chứ không هو قراءة مفقودة.’

حقق Claude Fable 5 أعلى درجة بنسبة 36.2٪، تلاه GPT-5.6 Sol (الحد الأقصى) بنسبة 23.5٪. شكل GPT-5.5 و Claude Opus 4.8 المستوى التالي، عند حوالي 20٪، في حين سجل معظم النماذج الحدودية أقل من 16٪. سجل النماذج الأقل تصنيفًا أقل من 2٪ من المهام.

يقترح تحليل الفشل التفصيلي أن المشكلة لم تكن غالبًا نقصًا في المعلومات، لأن قواعد دليل الموظفين ودليل الدعم قد تم استرجاعها في كثير من الأحيان بالفعل – ومع ذلك، قد تسبب التفكير الإضافي في بعض الأحياء في أن النماذج تتخلى عن الاستنتاج الصحيح لصالح واحد معقول ولكن ينتهك السياسة.

كما لاحظ العمل أيضًا مدى الغرور الذاتي الذي يcharacterizes العديد من محاولات النماذج الحدودية:

‘تنتهي几乎 كل مسار الفشل ببيان واثق بأن دليل الموظفين قد اُتبع، غالبًا ما يستشهد بالمواد المحددة التي انتهكت.’

‘… على مدى البENCHMARK، فإن تقرير الوكيل هو أقل مصداقية في المسار، وهو ما يهم لأي نشر يطرح ملخصات الوكيل للبشر كدليل على ما تم إنجازه.’

في الختام، يخلص المؤلفون إلى أن التفكير السياقي الطويل وحده غير محتمل أن يجعل الذكاء الاصطناعي في المؤسسة يتبع السياسة الشركة بثبات. بدلاً من ذلك، يجب أن تُفرض الامتثال للسياسة بشكل متزايد من خلال التحكمات الخارجية الحتمية، بالإضافة إلى حواجز سير العمل.

الاستنتاج

الرأي يُعتبر أحد الاعتبارات المثيرة للاهتمام هو مدى تذكر البيئات التي تم إنشاؤها للتحقق من الذكاء الاصطناعي في المستقبل، بدلاً من إجبار النماذج الحدودية على تفسير نفس الأشكال والتنسيقات التي تحدد بيئات المكتب البشرية. على سبيل المثال، البارحة، لأول مرة، أرسل لي أحد أصدقائي في العمل نظرة عامة على.md مصممة لاستكشافها بواسطة نموذج الذكاء الاصطناعي، بدلاً من قراءتها بطريقة خطية.

وكما أنا أعتمد بشكل متزايد وتكيف مع القيود النصية والبصرية أثناء محادثات الذكاء الاصطناعي، وكذلك اختيار قبول تنسيقات الملفات التي لن أختارها عادة، لأنها تتوافق مع سير عمل الذكاء الاصطناعي بشكل أكثر دهاء.

لذلك، في حين أن من الممتع مشاهدة نماذج الحدودية تعثر في عالم ديفيد برينت، يتساءل المرء عما إذا كان هذا هو السيناريو الأكثر احتمالاً للعامل المكتبية النشطة.

 

نشر لأول مرة يوم الأربعاء، 29 يوليو 2026. تم تحديثه في الساعة 18:41 بتوقيت شرق أوروبا، وتم إصلاح الرابط المعطوب.

كاتب في مجال التعلم الآلي، متخصص في مجال 合成 الصور البشرية. السابق رئيس محتوى البحث في Metaphysic.ai، حتى حلولها في Brahma.ai التابعة لشركة DNEG.
المنصة الشخصية: martinanderson.ai
التواصل: [email protected]