Anderson का एंगल
एआई कार्यालय नियमावली का सम्मान करने में संघर्ष करता है
![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN.jpg)
एक नए बेंचमार्क में पाया गया है कि कार्यस्थल एआई एजेंट कंपनी के नियमों को नजरअंदाज करते हैं, अनधिकृत कार्रवाइयों जैसे अनधिकृत बर्खास्तगी जैसे निषिद्ध कार्य करते हैं – फिर झूठी रिपोर्ट करते हैं कि उन्होंने अनुपालन किया है।
एक दिलचस्प नए शोध अध्ययन ने प्रमुख एलएलएम मॉडलों को एक सिम्युलेटेड कंपनी में निर्देशों का पालन करने की स्थिति में रखा, जिसमें एक प्रदान की गई कर्मचारी हैंडबुक (मानव डोमेन विशेषज्ञों द्वारा बनाई गई) के सभी सिद्धांतों का सम्मान किया गया, साथ ही साथ उप-स्वामी और वरिष्ठों से विरोधाभासी या भ्रमित निर्देशों और अद्यतनों के झोंके को निगोशिएट किया गया, और कार्यों को पीडीएफ, जीरा पोस्ट, और अन्य परिचित प्लेटफार्मों और उपकरणों से आधारित किया गया।
यदि आप कभी कार्यालय में काम कर चुके हैं (या कम से कम ऑफिस स्पेस देखा है), तो आप विरोधाभासी संकेतों और भ्रमित संकेत-शोर अनुपात को पहचानेंगे जो लेखकों ने नए काम में भाषा मॉडलों को दिया है:

दैनिक आधार पर कई कार्यालय कर्मचारियों को जो चरों का तूफान है, उसे एक आभासी वातावरण में परीक्षण के लिए एजेंटिक फ्रंटियर मॉडल के लिए परीक्षण किया गया है। स्रोत
यहाँ सबसे बड़ी चुनौती यह है कि यहां तक कि अग्रणी एआई सिस्टम को भी प्रदान की गई कर्मचारी संबंध मैनुअल को सभी बाद के आदेशों के लिए एक फिल्टर के रूप में बनाए रखने की आवश्यकता है। यदि आपने कभी चैटजीपीटी या क्लाउड को शुरू से ही दिए गए निर्देशों को याद रखने के लिए संघर्ष किया है, तो आप जानते हैं कि एआई का संदर्भ विंडो अक्सर इसे पहले के प्रॉम्प्ट को भूलने और अपने डिफ़ॉल्ट व्यवहार पर वापस आने का कारण बनता है।
यही कारण है कि परीक्षणों में, क्लाउड फेबल 5, जीपीटी-5.5, और अन्य अग्रणी मॉडलों ने एक कार्यकारी के आदेश पर कर्मचारियों को बर्खास्त कर दिया, जिनके पास ऐसा करने का अधिकार नहीं था; प्रबंधक के हस्ताक्षर के बिना चालान को मंजूरी दे दी; और फिर रिपोर्ट की कि उन्होंने हैंडबुक का पालन किया – कई अन्य कंपनी नीति के उल्लंघनों के बीच:
लेखकों का कहना है:
‘विफलता के पैटर्न एक सुसंगत हैं: एजेंट एक पर्यावरण अनुरोध को लंबे समय तक खड़ा रखता है, एक आवश्यक जांच करता है और फिर उसके परिणाम के खिलाफ कार्य करता है, नियम विवरण को लंबे समय तक खो देता है, और अनुपालन की रिपोर्ट करता है जो उन्होंने हासिल नहीं किया है।’
विफलता विश्लेषण में कुछ मनोरंजक उदाहरण हैं: एक वित्त कार्य में, क्लाउड ओपस 4.8 ने सही ढंग से पाया कि $7,500 के खर्च को उसी जूनियर विश्लेषक द्वारा अनुमोदित किया गया था जिसने इसे जमा किया था, जो कंपनी की नीति का उल्लंघन था।
फिर यह तर्क दिया कि विश्लेषक वास्तव में वित्त नियंत्रक था और फिर भी भुगतान को मंजूरी दे दी:
‘अपने स्वयं के विचार के भीतर उन्हें नियंत्रक को बढ़ावा देने के बाद, मॉडल ने आइटम को साफ़ किया, फिर वास्तविक नियंत्रक को संदेश दिया कि प्रत्येक आइटम पर $5K से अधिक के लिए प्रलेखित अनुमोदन था। ‘
‘विफलता एक लापता क्षमता नहीं है; सही निर्णय के लिए आवश्यक हर तथ्य मॉडल द्वारा स्वयं पुनर्प्राप्त किया गया था।’

क्लाउड ओपस 4.8 ने $7,500 को सुलझाने में विफल रहा।
अन्य स्थान पर, जेमिनी 3.5 फ्लैश ने प्रयोगशाला परिणामों का उपयोग किए बिना बीमा कागजी कार्रवाई जमा की, जो पहले से ही समाप्त हो चुके थे, यहां तक कि फ़ाइल नाम में संग्रह तिथि दिखाई दे रही थी:
‘जेमिनी 3.5 फ्लैश ने प्राधिकरण को बिना एक भी पढ़ने वाले कॉल के पूर्व अनुमोदन को बीमा दाता को जमा किया, फिर रिपोर्ट की कि उन्होंने मामले को “मानक संचालन प्रक्रिया” के अनुसार संसाधित किया है।’
बेंचमार्क भर में, लेखकों ने यह भी पाया कि कई मॉडल ने दावा किया कि उन्होंने हर कंपनी नियम का पालन किया, जबकि उन्होंने हैंडबुक के उन्हीं खंडों का उल्लेख किया जिन्हें उन्होंने अभी उल्लंघन किया था।
अतिरिक्त तर्क अक्सर विफल रहा; उदाहरण के लिए, जीपीटी-5.5 में बढ़ी हुई तर्क प्रयास के साथ कोई सुधार नहीं हुआ, जबकि कुछ मॉडल वास्तव में खराब प्रदर्शन करते थे, जो तर्क द्वारा सही निर्णय से दूर हो गए थे।
अंतिम परिणामों में, क्लाउड फेबल 5 ने 36.2% के साथ उच्चतम सख्त पास दर हासिल की; जीपीटी-5.6 सोल ने 23.5% के साथ दूसरा स्थान हासिल किया; और जीपीटी-5.5 और क्लाउड ओपस 4.8 ने प्रत्येक 21.5-21.9% स्कोर किया।
बेंचमार्क के सख्त मूल्यांकन मानदंडों के तहत अधिकांश शेष मूल्यांकित मॉडल 16% से कम स्कोर किए, और अधिकांश फ्रंटियर कॉन्फ़िगरेशन 25% से कम स्कोर किए:

सर्वश्रेष्ठ प्रदर्शन करने वाले एआई एजेंट ने बेंचमार्क के नीति-नियंत्रित कार्यस्थल कार्यों में से एक तिहाई से अधिक पूरा किया, जबकि अधिकांश अग्रणी मॉडल सख्त मूल्यांकन के तहत तीन-चौथाई से अधिक विफल रहे। स्रोत
उपचार के तौर पर, लेखकों का तर्क है कि महत्वपूर्ण कंपनी नीतियों को निर्धारित उपकरण-कॉल गार्ड (यानी, हार्ड-कोडेड जांच जो निषिद्ध क्रियाओं को अवरुद्ध करती हैं) का उपयोग करके एआई के बाहर लागू किया जाना चाहिए, न कि केवल लंबे संदर्भ स्मृति पर भरोसा किया जाना चाहिए।
वे यह भी प्रस्ताव करते हैं कि हैंडबुक.मडी को लंबे संदर्भ नीति अनुपालन में सुधार को मापने और ट्रैक करने के लिए एक मानक बेंचमार्क के रूप में उपयोग किया जाना चाहिए, क्योंकि भविष्य के एजेंटिक मॉडल विकसित किए जाते हैं।
नया कागज़ हैंडबुक.मडी: लंबे संदर्भ एजेंटिक निर्देश अनुसरण के लिए एक बेंचमार्क शीर्षक से है, और सात लेखकों द्वारा सर्ज.एआई से आता है। कागज़ के साथ एक गिटहब रिपॉजिटरी है जिसमें परीक्षणों को पुन: उत्पन्न करने के लिए डॉकर फ़ाइलें और अन्य आवश्यकताएं शामिल हैं।
विधि
एचएएनडीबूक.मडी बेंचमार्क के लिए 65 सिम्युलेटेड ऑफिस परिदृश्य बनाए गए, जो वित्त; एचआर; बीमा; लॉजिस्टिक्स; और चिकित्सा बिलिंग; और प्रत्येक मॉडल को एक कंटेनरीकृत कंपनी वातावरण में रखता है जिसमें फ़ाइलें, ईमेल, स्लैक बातचीत, कैलेंडर, जीरा बोर्ड, और अन्य परिचित कार्यस्थल उपकरण शामिल हैं।
प्रत्येक कार्य एक हैंडबुक द्वारा शासित था जो 20 और 124 पृष्ठों के बीच था, जो पीडीएफ, वर्ड, या एचटीएमएल दस्तावेज़ के रूप में प्रदान किया गया था, न कि प्रॉम्प्ट में एम्बेड किया गया था, जिससे मॉडल को कार्य के दौरान प्रासंगिक नियमों का पता लगाने, पढ़ने और लागू करने के लिए मजबूर किया गया था।
दस विशेषज्ञ-लिखित आधार हैंडबुक वास्तविक उद्योग नीतियों से अनुकूलित किए गए, जिसके बाद प्रत्येक कार्य को अलग-अलग अनुमोदन श्रृंखला, सीमा, और प्रक्रियाओं के साथ अपनी खुद की संशोधित संस्करण मिली:
‘डोमेन विशेषज्ञों ने दस आधार हैंडबुक लिखे जो अपने उद्योगों से वास्तविक नीतियों को अनुकूलित करके लिखे गए थे। प्रत्येक एक लंबा, बहु-अनुभाग संचालन दस्तावेज़ है, न कि नियमों की सूची। ‘
‘एक प्रतिनिधि एचआर हैंडबुक में 19 संख्याबद्ध अनुभाग हैं: एक अवलोकन, परिभाषाएं, एचआर टीम और संपर्क, स्लैक चैनल मैप, संदर्भ फ़ाइलें और सिस्टम, अनुरोध टैक्सोनोमी, ट्राइएज और मार्गदर्शन नियम, प्राथमिकता मैट्रिक्स के साथ एसएलए, ऑनबोर्डिंग, ऑफबोर्डिंग, छुट्टी, प्रदर्शन, और भर्ती के लिए प्रक्रियाएं, एस्केलेशन पथ, ईमेल हाउसकीपिंग नियम, और आवश्यक टेम्पलेट्स और डिफ़ॉल्ट प्रारूपों की लाइब्रेरी।’
सफलता को 824 निर्धारित पायथन-आधारित सत्यापन जांच के साथ मापा गया था, जो दोनों आवश्यक क्रियाओं और निषिद्ध क्रियाओं को कवर करता था – जिससे बेंचमार्क को न केवल यह पता लगाने की अनुमति मिली कि क्या एक कार्य पूरा किया गया था, बल्कि यह भी कि क्या कंपनी नीति का उल्लंघन किया गया था:
ग्यारह प्रदाताओं के तीस मॉडल कॉन्फ़िगरेशन मूल्यांकित किए गए थे; और परीक्षणों के दौरान, प्रत्येक कार्य चार बार समान परिस्थितियों में दोहराया गया था।
अन्य बेंचमार्क के विपरीत, एचएएनडीबूक.मडी ने यह मूल्यांकन किया कि आवश्यक क्रियाएं पूरी की गईं और निषिद्ध क्रियाएं टाली गईं, एजेंटों को विफल होने की अनुमति देता है, भले ही अनुरोधित कार्य पूरा किया गया हो:
पर्यावरण और टूलिंग
प्रत्येक सिम्युलेटेड कार्यस्थल को एक मानकीकृत डॉकर वातावरण के भीतर चलाने के लिए डिज़ाइन किया गया है, जिससे प्रत्येक मॉडल को समान सेट के उपकरणों तक पहुंच प्रदान की जाती है, जबकि परिणामों को प्रभावित करने से सॉफ़्टवेयर की उपलब्धता में अंतर को रोका जाता है:
मॉडलों को काम करने के लिए कार्यालय वातावरण का एक खुरदरा प्रतिनिधित्व。
पर्यावरण भी प्रत्येक क्रिया को संरक्षित करता है जो एजेंट द्वारा किया जाता है, जिससे बेंचमार्क की निर्धारित मूल्यांकन प्रणाली को अंतिम परिणाम की ओर ले जाने वाली क्रियाओं की पूरी श्रृंखला का मूल्यांकन करने की अनुमति मिलती है:
मेट्रिक्स
प्रदर्शन को मुख्य रूप से सख्त पास@1 का उपयोग करके मापा गया था, जिसमें एक कार्य को सफल माना जाता था केवल तभी जब प्रत्येक मूल्यांकन मानदंड संतुष्ट था। किसी भी मिस्ड आवश्यकता या नीति उल्लंघन के परिणामस्वरूप विफलता होगी, जो उद्यम सेटिंग्स को दर्शाती है, जहां एक गलत कार्रवाई एक अन्यथा सक्षम कार्यप्रवाह को अमान्य कर सकती है:
एक अधिक दयालु मेट्रिक, पास@1 (एन-1), का भी उपयोग किया गया था, जिसमें एक विफल मानदंड प्रति कार्य की अनुमति दी जाती थी, ताकि निकट मिस को पूर्ण विफलता से अलग किया जा सके:
अतिरिक्त विश्लेषण के लिए, प्रत्येक मॉडल का औसत प्रति-मानदंड स्कोर दर्ज किया गया था, हालांकि इसका उपयोग बेंचमार्क के शीर्षलेख रैंकिंग में नहीं किया गया था:
सामान्य दृष्टिकोण
दस विशेषज्ञ-लिखित हैंडबुक वास्तविक कंपनी नीतियों से अनुकूलित किए गए, जिसके बाद प्रत्येक को विभिन्न अनुमोदन श्रृंखला, सीमा, और प्रक्रियाओं के साथ अपनी खुद की संशोधित संस्करण मिली:
वास्तविक कार्यालय वातावरण प्रत्येक हैंडबुक के चारों ओर बनाए गए, जिसमें ईमेल, कैलेंडर, स्लैक बातचीत, स्प्रेडशीट और अन्य कार्यस्थल कलाकृतियां शामिल थीं:
प्रत्येक कार्य को बार-बार परीक्षण के माध्यम से परिष्कृत किया गया था जब तक कि मूल्यांकन मानदंड वास्तविक मॉडल विफलता को बेंचमार्क में खामियों से अलग करने में विश्वसनीय रूप से नहीं लगते थे:
परीक्षण और परिणाम
यहां तक कि सबसे मजबूत मॉडल भी बेंचमार्क के सख्त ग्रेडिंग प्रणाली के तहत अधिकांश कार्यों में विफल रहे, जिसमें प्रदर्शन एक विस्तृत श्रृंखला में फैला हुआ था, बल्कि शीर्ष पर समूहीकृत नहीं था:
एचएएनडीबूक.मडी बेंचमार्क पर 30 मूल्यांकित मॉडल कॉन्फ़िगरेशन की शुरुआती परिणाम लीडरबोर्ड रैंकिंग, जो उनके सख्त पास@1 स्कोर के अनुसार है। स्कोर बेंचमार्क के 65 कार्यस्थल कार्यों में से प्रतिशत का प्रतिनिधित्व करते हैं जो चार परीक्षण प्रति कार्य में एक भी विफल मूल्यांकन मानदंड के साथ पूरा किए गए थे।
मॉडल द्वारा तर्क सेटिंग्स में अंतर भी मॉडल द्वारा काफी भिन्न थे; कभी-कभी अतिरिक्त तर्क प्रदर्शन में सुधार करता था; कभी-कभी यह थोड़ा अंतर नहीं करता था; और कभी-कभी इसे कम करता था:
‘[तर्क] प्रयास असमान रूप से मदद करता है। प्रयास में वृद्धि ओपस 4.8 (+3.0), सोनेट 4.6 (+2.7), और फेबल 5 (+2.0) में सुधार करती है; जीपीटी-5.5 को अपरिवर्तित छोड़ देती है (21.5% दोनों सेटिंग्स पर), और जीएलएम 5.2 (-2.7) को नुकसान पहुंचाती है। ‘
‘अतिरिक्त विचार अक्सर मदद करता है। राइजिंग प्रयास ओपस 4.8 (+3.0), सोनेट 4.6 (+2.7), और फेबल 5 (+2.0) में सुधार करता है; जीपीटी-5.5 को अपरिवर्तित छोड़ देता है (21.5% दोनों सेटिंग्स पर), और जीएलएम 5.2 (-2.7) को नुकसान पहुंचाता है। ‘
क्लाउड फेबल 5 ने 36.2% के साथ उच्चतम स्कोर हासिल किया, उसके बाद क्लाउड फेबल 5 ने 34.2% के साथ दूसरा स्थान हासिल किया, और जीपीटी-5.6 सोल (मैक्स) ने 23.5% के साथ तीसरा स्थान हासिल किया। जीपीटी-5.5 और क्लाउड ओपस 4.8 ने लगभग 20% के साथ अगले स्तर का गठन किया, जबकि अधिकांश शेष फ्रंटियर मॉडल 16% से कम स्कोर किए। सबसे कम रैंक वाले मॉडल ने 2% से कम कार्य पूरे किए।
कागज़ के विस्तृत विफलता विश्लेषण से पता चलता है कि समस्या अक्सर जानकारी की कमी नहीं थी, क्योंकि प्रासंगिक हैंडबुक नियम और समर्थन साक्ष्य अक्सर पहले से ही पुनर्प्राप्त किए जा चुके थे – फिर भी अतिरिक्त तर्क कभी-कभी मॉडल को सही निष्कर्ष को छोड़ने और एक संभावित लेकिन नीति-उल्लंघन वाले एक के लिए जाने का कारण बनता था।
काम यह भी बताता है कि एलएलएम के कई प्रयासों में कितना स्व-धोखा है:
‘लगभग हर विफल ट्रेजेक्टरी हैंडबुक का पालन किया गया है, जो अक्सर उन खंडों का उल्लेख करते हैं जिन्हें उन्होंने उल्लंघन किया था। रिपोर्ट विस्तृत, संरचित और गलत हैं […]
‘[…] बेंचमार्क भर में, एजेंट की स्व-रिपोर्ट मानवों को साक्ष्य के रूप में प्रस्तुत की जाने वाली सबसे कम विश्वसनीय कलाकृति है, जो यह दिखाने के लिए कि क्या किया गया था।’
निष्कर्ष में, लेखकों का निष्कर्ष है कि लंबे संदर्भ तर्क अकेले उद्यम एआई को विश्वसनीय रूप से कंपनी नीति का पालन करने की संभावना नहीं है। इसके बजाय, नीति अनुपालन को तर्क द्वारा बढ़ाया जाना चाहिए, साथ ही साथ कार्यप्रवाह गार्डरेल के माध्यम से भी:
निष्कर्ष
राय एक दिलचस्प विचार यह है कि भविष्य में कितनी दूर तक वे पर्यावरण जो प्रयोगों के लिए बनाए गए हैं, एआई को सुविधा प्रदान करने के लिए पुनः कल्पना की जाएंगी, बजाय इसके कि एलएलएम को मानव कार्यालय वातावरण को व्याख्या करने के लिए मजबूर किया जाए।
और मैं भी एलएलएम सहयोग के दौरान दृश्य और पाठ सीमाओं के अनुकूल होने की अधिक संख्या में अपना तरीका अपना रहा हूं, साथ ही साथ ऐसे फ़ाइल प्रारूपों का चयन और स्वीकृति कर रहा हूं जो मैं सामान्य रूप से नहीं चुनूंगा, क्योंकि वे एलएलएम कार्यप्रवाह को अधिक कुशलता से समायोजित करते हैं।
इसलिए, जबकि यह देखना मनोरंजक है कि फ्रंटियर मॉडल डेविड ब्रेंट की दुनिया में कैसे लड़खड़ाते हैं, यह संदेह है कि क्या यह ‘एजेंटिक ऑफिस वर्कर’ के लिए सबसे संभावित परिदृश्य है।
सबसे पहले बुधवार, 29 जुलाई, 2026 को प्रकाशित। 18:41 ईईटी, तोड़े गए लिंक को ठीक किया गया।












