Anderson का एंगल

एआई कार्यालय नियमावली का सम्मान करने में संघर्ष करता है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.

एक नए बेंचमार्क में पाया गया है कि कार्यस्थल एआई एजेंट कंपनी के नियमों को नजरअंदाज करते हैं, अनधिकृत कार्रवाइयों जैसे अनधिकृत बर्खास्तगी जैसे निषिद्ध कार्य करते हैं – फिर झूठी रिपोर्ट करते हैं कि उन्होंने अनुपालन किया है।

 

एक दिलचस्प नए शोध अध्ययन ने प्रमुख एलएलएम मॉडलों को एक सिम्युलेटेड कंपनी में निर्देशों का पालन करने की स्थिति में रखा, जिसमें एक प्रदान की गई कर्मचारी हैंडबुक (मानव डोमेन विशेषज्ञों द्वारा बनाई गई) के सभी सिद्धांतों का सम्मान किया गया, साथ ही साथ उप-स्वामी और वरिष्ठों से विरोधाभासी या भ्रमित निर्देशों और अद्यतनों के झोंके को निगोशिएट किया गया, और कार्यों को पीडीएफ, जीरा पोस्ट, और अन्य परिचित प्लेटफार्मों और उपकरणों से आधारित किया गया।

यदि आप कभी कार्यालय में काम कर चुके हैं (या कम से कम ऑफिस स्पेस देखा है), तो आप विरोधाभासी संकेतों और भ्रमित संकेत-शोर अनुपात को पहचानेंगे जो लेखकों ने नए काम में भाषा मॉडलों को दिया है:

दैनिक आधार पर कई कार्यालय कर्मचारियों को जो चरों का तूफान है, उसे एक आभासी वातावरण में परीक्षण के लिए एजेंटिक फ्रंटियर मॉडल के लिए परीक्षण किया गया है। स्रोत - https://surgehq.ai/blog/handbook-md

दैनिक आधार पर कई कार्यालय कर्मचारियों को जो चरों का तूफान है, उसे एक आभासी वातावरण में परीक्षण के लिए एजेंटिक फ्रंटियर मॉडल के लिए परीक्षण किया गया है। स्रोत

यहाँ सबसे बड़ी चुनौती यह है कि यहां तक कि अग्रणी एआई सिस्टम को भी प्रदान की गई कर्मचारी संबंध मैनुअल को सभी बाद के आदेशों के लिए एक फिल्टर के रूप में बनाए रखने की आवश्यकता है। यदि आपने कभी चैटजीपीटी या क्लाउड को शुरू से ही दिए गए निर्देशों को याद रखने के लिए संघर्ष किया है, तो आप जानते हैं कि एआई का संदर्भ विंडो अक्सर इसे पहले के प्रॉम्प्ट को भूलने और अपने डिफ़ॉल्ट व्यवहार पर वापस आने का कारण बनता है।

यही कारण है कि परीक्षणों में, क्लाउड फेबल 5, जीपीटी-5.5, और अन्य अग्रणी मॉडलों ने एक कार्यकारी के आदेश पर कर्मचारियों को बर्खास्त कर दिया, जिनके पास ऐसा करने का अधिकार नहीं था; प्रबंधक के हस्ताक्षर के बिना चालान को मंजूरी दे दी; और फिर रिपोर्ट की कि उन्होंने हैंडबुक का पालन किया – कई अन्य कंपनी नीति के उल्लंघनों के बीच:

लेखकों का कहना है:

‘विफलता के पैटर्न एक सुसंगत हैं: एजेंट एक पर्यावरण अनुरोध को लंबे समय तक खड़ा रखता है, एक आवश्यक जांच करता है और फिर उसके परिणाम के खिलाफ कार्य करता है, नियम विवरण को लंबे समय तक खो देता है, और अनुपालन की रिपोर्ट करता है जो उन्होंने हासिल नहीं किया है।’

विफलता विश्लेषण में कुछ मनोरंजक उदाहरण हैं: एक वित्त कार्य में, क्लाउड ओपस 4.8 ने सही ढंग से पाया कि $7,500 के खर्च को उसी जूनियर विश्लेषक द्वारा अनुमोदित किया गया था जिसने इसे जमा किया था, जो कंपनी की नीति का उल्लंघन था।

फिर यह तर्क दिया कि विश्लेषक वास्तव में वित्त नियंत्रक था और फिर भी भुगतान को मंजूरी दे दी:

‘अपने स्वयं के विचार के भीतर उन्हें नियंत्रक को बढ़ावा देने के बाद, मॉडल ने आइटम को साफ़ किया, फिर वास्तविक नियंत्रक को संदेश दिया कि प्रत्येक आइटम पर $5K से अधिक के लिए प्रलेखित अनुमोदन था। ‘

‘विफलता एक लापता क्षमता नहीं है; सही निर्णय के लिए आवश्यक हर तथ्य मॉडल द्वारा स्वयं पुनर्प्राप्त किया गया था।’

क्लाउड ओपस 4.8 ने $7,500 को सुलझाने में विफल रहा। स्रोत - https://surgehq.ai/blog/handbook-md

क्लाउड ओपस 4.8 ने $7,500 को सुलझाने में विफल रहा।

अन्य स्थान पर, जेमिनी 3.5 फ्लैश ने प्रयोगशाला परिणामों का उपयोग किए बिना बीमा कागजी कार्रवाई जमा की, जो पहले से ही समाप्त हो चुके थे, यहां तक कि फ़ाइल नाम में संग्रह तिथि दिखाई दे रही थी:

‘जेमिनी 3.5 फ्लैश ने प्राधिकरण को बिना एक भी पढ़ने वाले कॉल के पूर्व अनुमोदन को बीमा दाता को जमा किया, फिर रिपोर्ट की कि उन्होंने मामले को “मानक संचालन प्रक्रिया” के अनुसार संसाधित किया है।’

बेंचमार्क भर में, लेखकों ने यह भी पाया कि कई मॉडल ने दावा किया कि उन्होंने हर कंपनी नियम का पालन किया, जबकि उन्होंने हैंडबुक के उन्हीं खंडों का उल्लेख किया जिन्हें उन्होंने अभी उल्लंघन किया था।

अतिरिक्त तर्क अक्सर विफल रहा; उदाहरण के लिए, जीपीटी-5.5 में बढ़ी हुई तर्क प्रयास के साथ कोई सुधार नहीं हुआ, जबकि कुछ मॉडल वास्तव में खराब प्रदर्शन करते थे, जो तर्क द्वारा सही निर्णय से दूर हो गए थे।

अंतिम परिणामों में, क्लाउड फेबल 5 ने 36.2% के साथ उच्चतम सख्त पास दर हासिल की; जीपीटी-5.6 सोल ने 23.5% के साथ दूसरा स्थान हासिल किया; और जीपीटी-5.5 और क्लाउड ओपस 4.8 ने प्रत्येक 21.5-21.9% स्कोर किया।

बेंचमार्क के सख्त मूल्यांकन मानदंडों के तहत अधिकांश शेष मूल्यांकित मॉडल 16% से कम स्कोर किए, और अधिकांश फ्रंटियर कॉन्फ़िगरेशन 25% से कम स्कोर किए:

सर्वश्रेष्ठ प्रदर्शन करने वाले एआई एजेंट ने बेंचमार्क के नीति-नियंत्रित कार्यस्थल कार्यों में से एक तिहाई से अधिक पूरा किया, जबकि अधिकांश अग्रणी मॉडल सख्त मूल्यांकन के तहत तीन-चौथाई से अधिक विफल रहे।

सर्वश्रेष्ठ प्रदर्शन करने वाले एआई एजेंट ने बेंचमार्क के नीति-नियंत्रित कार्यस्थल कार्यों में से एक तिहाई से अधिक पूरा किया, जबकि अधिकांश अग्रणी मॉडल सख्त मूल्यांकन के तहत तीन-चौथाई से अधिक विफल रहे। स्रोत

उपचार के तौर पर, लेखकों का तर्क है कि महत्वपूर्ण कंपनी नीतियों को निर्धारित उपकरण-कॉल गार्ड (यानी, हार्ड-कोडेड जांच जो निषिद्ध क्रियाओं को अवरुद्ध करती हैं) का उपयोग करके एआई के बाहर लागू किया जाना चाहिए, न कि केवल लंबे संदर्भ स्मृति पर भरोसा किया जाना चाहिए।

वे यह भी प्रस्ताव करते हैं कि हैंडबुक.मडी को लंबे संदर्भ नीति अनुपालन में सुधार को मापने और ट्रैक करने के लिए एक मानक बेंचमार्क के रूप में उपयोग किया जाना चाहिए, क्योंकि भविष्य के एजेंटिक मॉडल विकसित किए जाते हैं।

नया कागज़ हैंडबुक.मडी: लंबे संदर्भ एजेंटिक निर्देश अनुसरण के लिए एक बेंचमार्क शीर्षक से है, और सात लेखकों द्वारा सर्ज.एआई से आता है। कागज़ के साथ एक गिटहब रिपॉजिटरी है जिसमें परीक्षणों को पुन: उत्पन्न करने के लिए डॉकर फ़ाइलें और अन्य आवश्यकताएं शामिल हैं।

विधि

एचएएनडीबूक.मडी बेंचमार्क के लिए 65 सिम्युलेटेड ऑफिस परिदृश्य बनाए गए, जो वित्त; एचआर; बीमा; लॉजिस्टिक्स; और चिकित्सा बिलिंग; और प्रत्येक मॉडल को एक कंटेनरीकृत कंपनी वातावरण में रखता है जिसमें फ़ाइलें, ईमेल, स्लैक बातचीत, कैलेंडर, जीरा बोर्ड, और अन्य परिचित कार्यस्थल उपकरण शामिल हैं।

प्रत्येक कार्य एक हैंडबुक द्वारा शासित था जो 20 और 124 पृष्ठों के बीच था, जो पीडीएफ, वर्ड, या एचटीएमएल दस्तावेज़ के रूप में प्रदान किया गया था, न कि प्रॉम्प्ट में एम्बेड किया गया था, जिससे मॉडल को कार्य के दौरान प्रासंगिक नियमों का पता लगाने, पढ़ने और लागू करने के लिए मजबूर किया गया था।

दस विशेषज्ञ-लिखित आधार हैंडबुक वास्तविक उद्योग नीतियों से अनुकूलित किए गए, जिसके बाद प्रत्येक कार्य को अलग-अलग अनुमोदन श्रृंखला, सीमा, और प्रक्रियाओं के साथ अपनी खुद की संशोधित संस्करण मिली:

‘डोमेन विशेषज्ञों ने दस आधार हैंडबुक लिखे जो अपने उद्योगों से वास्तविक नीतियों को अनुकूलित करके लिखे गए थे। प्रत्येक एक लंबा, बहु-अनुभाग संचालन दस्तावेज़ है, न कि नियमों की सूची। ‘

‘एक प्रतिनिधि एचआर हैंडबुक में 19 संख्याबद्ध अनुभाग हैं: एक अवलोकन, परिभाषाएं, एचआर टीम और संपर्क, स्लैक चैनल मैप, संदर्भ फ़ाइलें और सिस्टम, अनुरोध टैक्सोनोमी, ट्राइएज और मार्गदर्शन नियम, प्राथमिकता मैट्रिक्स के साथ एसएलए, ऑनबोर्डिंग, ऑफबोर्डिंग, छुट्टी, प्रदर्शन, और भर्ती के लिए प्रक्रियाएं, एस्केलेशन पथ, ईमेल हाउसकीपिंग नियम, और आवश्यक टेम्पलेट्स और डिफ़ॉल्ट प्रारूपों की लाइब्रेरी।’

सफलता को 824 निर्धारित पायथन-आधारित सत्यापन जांच के साथ मापा गया था, जो दोनों आवश्यक क्रियाओं और निषिद्ध क्रियाओं को कवर करता था – जिससे बेंचमार्क को न केवल यह पता लगाने की अनुमति मिली कि क्या एक कार्य पूरा किया गया था, बल्कि यह भी कि क्या कंपनी नीति का उल्लंघन किया गया था:

ग्यारह प्रदाताओं के तीस मॉडल कॉन्फ़िगरेशन मूल्यांकित किए गए थे; और परीक्षणों के दौरान, प्रत्येक कार्य चार बार समान परिस्थितियों में दोहराया गया था।

अन्य बेंचमार्क के विपरीत, एचएएनडीबूक.मडी ने यह मूल्यांकन किया कि आवश्यक क्रियाएं पूरी की गईं और निषिद्ध क्रियाएं टाली गईं, एजेंटों को विफल होने की अनुमति देता है, भले ही अनुरोधित कार्य पूरा किया गया हो:

पर्यावरण और टूलिंग

प्रत्येक सिम्युलेटेड कार्यस्थल को एक मानकीकृत डॉकर वातावरण के भीतर चलाने के लिए डिज़ाइन किया गया है, जिससे प्रत्येक मॉडल को समान सेट के उपकरणों तक पहुंच प्रदान की जाती है, जबकि परिणामों को प्रभावित करने से सॉफ़्टवेयर की उपलब्धता में अंतर को रोका जाता है:

मॉडलों को काम करने के लिए कार्यालय वातावरण का एक खुरदरा प्रतिनिधित्व।

मॉडलों को काम करने के लिए कार्यालय वातावरण का एक खुरदरा प्रतिनिधित्व。

पर्यावरण भी प्रत्येक क्रिया को संरक्षित करता है जो एजेंट द्वारा किया जाता है, जिससे बेंचमार्क की निर्धारित मूल्यांकन प्रणाली को अंतिम परिणाम की ओर ले जाने वाली क्रियाओं की पूरी श्रृंखला का मूल्यांकन करने की अनुमति मिलती है:

मेट्रिक्स

प्रदर्शन को मुख्य रूप से सख्त पास@1 का उपयोग करके मापा गया था, जिसमें एक कार्य को सफल माना जाता था केवल तभी जब प्रत्येक मूल्यांकन मानदंड संतुष्ट था। किसी भी मिस्ड आवश्यकता या नीति उल्लंघन के परिणामस्वरूप विफलता होगी, जो उद्यम सेटिंग्स को दर्शाती है, जहां एक गलत कार्रवाई एक अन्यथा सक्षम कार्यप्रवाह को अमान्य कर सकती है:

एक अधिक दयालु मेट्रिक, पास@1 (एन-1), का भी उपयोग किया गया था, जिसमें एक विफल मानदंड प्रति कार्य की अनुमति दी जाती थी, ताकि निकट मिस को पूर्ण विफलता से अलग किया जा सके:

अतिरिक्त विश्लेषण के लिए, प्रत्येक मॉडल का औसत प्रति-मानदंड स्कोर दर्ज किया गया था, हालांकि इसका उपयोग बेंचमार्क के शीर्षलेख रैंकिंग में नहीं किया गया था:

सामान्य दृष्टिकोण

दस विशेषज्ञ-लिखित हैंडबुक वास्तविक कंपनी नीतियों से अनुकूलित किए गए, जिसके बाद प्रत्येक को विभिन्न अनुमोदन श्रृंखला, सीमा, और प्रक्रियाओं के साथ अपनी खुद की संशोधित संस्करण मिली:
वास्तविक कार्यालय वातावरण प्रत्येक हैंडबुक के चारों ओर बनाए गए, जिसमें ईमेल, कैलेंडर, स्लैक बातचीत, स्प्रेडशीट और अन्य कार्यस्थल कलाकृतियां शामिल थीं:

प्रत्येक कार्य को बार-बार परीक्षण के माध्यम से परिष्कृत किया गया था जब तक कि मूल्यांकन मानदंड वास्तविक मॉडल विफलता को बेंचमार्क में खामियों से अलग करने में विश्वसनीय रूप से नहीं लगते थे:

परीक्षण और परिणाम

यहां तक कि सबसे मजबूत मॉडल भी बेंचमार्क के सख्त ग्रेडिंग प्रणाली के तहत अधिकांश कार्यों में विफल रहे, जिसमें प्रदर्शन एक विस्तृत श्रृंखला में फैला हुआ था, बल्कि शीर्ष पर समूहीकृत नहीं था:

एचएएनडीबूक.मडी बेंचमार्क पर 30 मूल्यांकित मॉडल कॉन्फ़िगरेशन की शुरुआती परिणाम लीडरबोर्ड रैंकिंग, जो उनके सख्त पास@1 स्कोर के अनुसार है। स्कोर बेंचमार्क के 65 कार्यस्थल कार्यों में से प्रतिशत का प्रतिनिधित्व करते हैं जो चार परीक्षण प्रति कार्य में एक भी विफल मूल्यांकन मानदंड के साथ पूरा किए गए थे।

एचएएनडीबूक.मडी बेंचमार्क पर 30 मूल्यांकित मॉडल कॉन्फ़िगरेशन की शुरुआती परिणाम लीडरबोर्ड रैंकिंग, जो उनके सख्त पास@1 स्कोर के अनुसार है। स्कोर बेंचमार्क के 65 कार्यस्थल कार्यों में से प्रतिशत का प्रतिनिधित्व करते हैं जो चार परीक्षण प्रति कार्य में एक भी विफल मूल्यांकन मानदंड के साथ पूरा किए गए थे।

मॉडल द्वारा तर्क सेटिंग्स में अंतर भी मॉडल द्वारा काफी भिन्न थे; कभी-कभी अतिरिक्त तर्क प्रदर्शन में सुधार करता था; कभी-कभी यह थोड़ा अंतर नहीं करता था; और कभी-कभी इसे कम करता था:

‘[तर्क] प्रयास असमान रूप से मदद करता है। प्रयास में वृद्धि ओपस 4.8 (+3.0), सोनेट 4.6 (+2.7), और फेबल 5 (+2.0) में सुधार करती है; जीपीटी-5.5 को अपरिवर्तित छोड़ देती है (21.5% दोनों सेटिंग्स पर), और जीएलएम 5.2 (-2.7) को नुकसान पहुंचाती है। ‘

‘अतिरिक्त विचार अक्सर मदद करता है। राइजिंग प्रयास ओपस 4.8 (+3.0), सोनेट 4.6 (+2.7), और फेबल 5 (+2.0) में सुधार करता है; जीपीटी-5.5 को अपरिवर्तित छोड़ देता है (21.5% दोनों सेटिंग्स पर), और जीएलएम 5.2 (-2.7) को नुकसान पहुंचाता है। ‘

क्लाउड फेबल 5 ने 36.2% के साथ उच्चतम स्कोर हासिल किया, उसके बाद क्लाउड फेबल 5 ने 34.2% के साथ दूसरा स्थान हासिल किया, और जीपीटी-5.6 सोल (मैक्स) ने 23.5% के साथ तीसरा स्थान हासिल किया। जीपीटी-5.5 और क्लाउड ओपस 4.8 ने लगभग 20% के साथ अगले स्तर का गठन किया, जबकि अधिकांश शेष फ्रंटियर मॉडल 16% से कम स्कोर किए। सबसे कम रैंक वाले मॉडल ने 2% से कम कार्य पूरे किए।

कागज़ के विस्तृत विफलता विश्लेषण से पता चलता है कि समस्या अक्सर जानकारी की कमी नहीं थी, क्योंकि प्रासंगिक हैंडबुक नियम और समर्थन साक्ष्य अक्सर पहले से ही पुनर्प्राप्त किए जा चुके थे – फिर भी अतिरिक्त तर्क कभी-कभी मॉडल को सही निष्कर्ष को छोड़ने और एक संभावित लेकिन नीति-उल्लंघन वाले एक के लिए जाने का कारण बनता था।

काम यह भी बताता है कि एलएलएम के कई प्रयासों में कितना स्व-धोखा है:

‘लगभग हर विफल ट्रेजेक्टरी हैंडबुक का पालन किया गया है, जो अक्सर उन खंडों का उल्लेख करते हैं जिन्हें उन्होंने उल्लंघन किया था। रिपोर्ट विस्तृत, संरचित और गलत हैं […]

‘[…] बेंचमार्क भर में, एजेंट की स्व-रिपोर्ट मानवों को साक्ष्य के रूप में प्रस्तुत की जाने वाली सबसे कम विश्वसनीय कलाकृति है, जो यह दिखाने के लिए कि क्या किया गया था।’

निष्कर्ष में, लेखकों का निष्कर्ष है कि लंबे संदर्भ तर्क अकेले उद्यम एआई को विश्वसनीय रूप से कंपनी नीति का पालन करने की संभावना नहीं है। इसके बजाय, नीति अनुपालन को तर्क द्वारा बढ़ाया जाना चाहिए, साथ ही साथ कार्यप्रवाह गार्डरेल के माध्यम से भी:

निष्कर्ष

राय एक दिलचस्प विचार यह है कि भविष्य में कितनी दूर तक वे पर्यावरण जो प्रयोगों के लिए बनाए गए हैं, एआई को सुविधा प्रदान करने के लिए पुनः कल्पना की जाएंगी, बजाय इसके कि एलएलएम को मानव कार्यालय वातावरण को व्याख्या करने के लिए मजबूर किया जाए।

और मैं भी एलएलएम सहयोग के दौरान दृश्य और पाठ सीमाओं के अनुकूल होने की अधिक संख्या में अपना तरीका अपना रहा हूं, साथ ही साथ ऐसे फ़ाइल प्रारूपों का चयन और स्वीकृति कर रहा हूं जो मैं सामान्य रूप से नहीं चुनूंगा, क्योंकि वे एलएलएम कार्यप्रवाह को अधिक कुशलता से समायोजित करते हैं।

इसलिए, जबकि यह देखना मनोरंजक है कि फ्रंटियर मॉडल डेविड ब्रेंट की दुनिया में कैसे लड़खड़ाते हैं, यह संदेह है कि क्या यह ‘एजेंटिक ऑफिस वर्कर’ के लिए सबसे संभावित परिदृश्य है।

 

सबसे पहले बुधवार, 29 जुलाई, 2026 को प्रकाशित। 18:41 ईईटी, तोड़े गए लिंक को ठीक किया गया।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai