रिपोर्ट्स
जब एआई एजेंट भीड़ का अनुसरण करते हैं: मल्टी‑एजेंट सहमति में छिपा जोखिम

एक कमरे में सभी सहमत एआई एजेंटों की उपस्थिति आश्वस्त करने वाली लग सकती है। एक उत्तर प्रस्तावित करता है, दूसरा उसे जाँचता है, और कई अन्य निष्कर्ष को समर्थन देते हैं। लेकिन उन एजेंटों में से कितने वास्तव में मूल प्रमाण की जाँच करते हैं? यदि प्रत्येक ने पिछले एजेंट के निर्णय को अपनाया, तो सर्वसम्मत फ़ैसला एक अकेली गलती को छुपा सकता है।
शिकागो विश्वविद्यालय के हैरिस स्कूल ऑफ पब्लिक पॉलिसी द्वारा उजागर नया शोध इस समस्या की जांच करता है। अपनी घोषणा में वर्णित जानबूझकर प्रतिकूल प्रयोगों में, बाद के एजेंटों ने प्रारंभिक गलत निष्कर्ष का अनुसरण किया, भले ही उनका अपना डेटा सही उत्तर की ओर इशारा करता था। घोषणा यह भी रेखांकित करती है कि ये शुरुआती तनाव‑परीक्षण परिणाम हैं, न कि यह प्रमाण कि स्वायत्त एजेंट नियमित रूप से इस प्रकार व्यवहार करते हैं।
मल्टी‑एजेंट वर्कफ़्लो बनाने वाले संगठनों के लिए प्रमुख प्रश्न यह है कि स्वतंत्र सत्यापन को प्रतिध्वनि से कैसे अलग किया जाए। नीचे हम प्रयोग की जांच करेंगे, इसे स्थापित सामाजिक‑अधिगम शोध से जोड़ेंगे, और सिस्टम डिज़ाइन के लिए व्यावहारिक निहितार्थ विकसित करेंगे। इंजीनियरिंग प्रस्ताव और संख्यात्मक उदाहरण हमारा विश्लेषण हैं, अतिरिक्त प्रयोगात्मक निष्कर्ष नहीं।
शोधकर्ताओं ने क्या परीक्षण किया
एंडी हॉल, डैन थॉम्पसन, अलेक्ज़ैंडर फौइरनाइज़ और सैंडी हैंडन‑नादर ने 29 सितंबर, 2026 को असाधारण मल्टी‑एजेंट भ्रम और भीड़ का पागलपन प्रकाशित किया। एजेंटों ने निजी स्वीकृति या अस्वीकृति संकेतों से, जो 70 % समय में सूचनात्मक थे, यह अनुमान लगाया कि एक सिम्युलेटेड टास्क ग्रेडर कैसे काम करता है। उन्होंने पहले के बोर्ड पोस्ट पढ़े, निष्कर्ष पोस्ट किए और अलग‑अलग विश्वासों की रिपोर्ट की। तनाव स्थिति ने पहले चार संकेतों को गलत बना दिया।
संचार के बिना, बाद के स्वतंत्र संकेत प्रारंभिक त्रुटि को पतला कर देते हैं। बोर्ड के साथ, गलत निर्णय बने रहे; एजेंटों ने अपने स्वयं के प्रमाण को भी गलत रिपोर्ट किया। अधिकांश प्रयोगों में Claude Haiku 4.5 का उपयोग किया गया। लेखकों ने Sonnet 4.6, Opus 4.6 और GPT‑5 mini के साथ पुनरावृत्ति की रिपोर्ट की है, जबकि Gemini 2.5 Flash के लिए संभवतः एक अपवाद है।
सात संचार नीतियों और अतिरिक्त परिदृश्यों में, निजी परीक्षण परिणामों को संरक्षित रखने वाले नियम सबसे बेहतर प्रदर्शन करते हैं। एक नियम ने सटीक रिपोर्टिंग को अनिवार्य किया और निर्मित परीक्षण या गणनाओं को प्रतिबंधित किया। पश्च‑पर rationales ने बोर्ड बहुमत का उल्लेख 90 % से अधिक समय किया, लेकिन लेखकों ने चेतावनी दी है कि ये व्याख्याएँ आंतरिक तंत्र को स्थापित नहीं करतीं।
भीड़ और प्रतिध्वनि के बीच अंतर
बौद्धिक पृष्ठभूमि जनरेटिव एआई से पहले की है। उनके 1992 का सूचना प्रवाह पर पेपर में, सुशील बिखचंदानी, डेविड हिर्शलेफ़र और इवो वेल्च बताते हैं कि क्रमिक निर्णयकर्ता पूर्ववर्तियों का अनुसरण कैसे कर सकते हैं जबकि अपनी स्वयं की जानकारी को नज़रअंदाज़ कर देते हैं। उनका ढांचा यह समझाने में मदद करता है कि अनुरूपता नाज़ुक सामूहिक विश्वासों के साथ कैसे सह-अस्तित्व रख सकती है। बाद में सूचना प्रवाह और सामाजिक सीखने की समीक्षा, ओमर तामुज़ के साथ सह‑लेखित, ने आगे के सैद्धांतिक और अनुभवजन्य शोध का सर्वेक्षण किया।
एक काल्पनिक सॉफ़्टवेयर जांच पर विचार करें। एजेंट A एक विफल परीक्षण को यह प्रमाण मानता है कि प्रमाणीकरण लाइब्रेरी टूट गई है। एजेंट B A की रिपोर्ट पढ़ता है और लाइब्रेरी को बदलने की सिफ़ारिश करता है। एजेंट C दोनों संदेशों को समान दोष की दो पुष्टि के रूप में सारांशित करता है। अब एक समन्वयकर्ता देखता है कि तीन एजेंट सहमत हैं, जबकि पूरी श्रृंखला एक परीक्षण की एक ही व्याख्या पर आधारित है।
एजेंट D को जोड़ना आवश्यक रूप से नई जानकारी उत्पन्न नहीं करेगा। यदि D केवल सारांश पढ़ता है, तो वर्कफ़्लो ने दावे को दोहराने का एक और अवसर बना दिया है। प्रासंगिक पुष्टि इकाई स्वतंत्र अवलोकन है: एक अलग पुनरुत्पादन, एक अलग परीक्षण या संदेहास्पद विफलता की प्रत्यक्ष जांच।
यह अंतर तब भी महत्वपूर्ण है जब प्रत्येक घटक सक्षम और सहयोगी हो। सहमति केवल तभी उपयोगी है जब उसके प्रमाणात्मक आधार इसे उचित ठहराते हों। इसलिए एक प्रणाली को यह ट्रैक करना चाहिए कि कौन से एजेंट ने जांच की, कौन ने केवल दूसरे एजेंट के आउटपुट की व्याख्या की, और कौन ने बिना जांचे निष्कर्ष को दोहराया।
स्वतंत्रता गणित को क्यों बदलती है
एक सरल गणना दांव को स्पष्ट करती है। मान लीजिए पाँच काल्पनिक मतदाता प्रत्येक द्विआधारी प्रश्न का सही उत्तर 0.7 की संभावना से देते हैं, और उनके उत्तर स्वतंत्र हैं। कम से कम तीन के सही होने की संभावना लगभग 83.7 % है। उनके वोटों को मिलाने से एकल मतदाता की 70 % सटीकता से बेहतर परिणाम मिलता है।
अब मान लीजिए सभी पाँच एक ही उत्तर की नकल करते हैं। बहुमत तभी सही होगा जब मूल उत्तर सही हो: 70 % समय। भागीदारों की दिखाई देने वाली संख्या बढ़ गई है, लेकिन स्वतंत्र जानकारी की मात्रा नहीं बढ़ी। ये उदाहरणात्मक संभावनाएँ हैं, नई शोध से प्राप्त प्रदर्शन माप नहीं।
तनाव स्थिति की व्याख्या के लिए एक और उपयोगी गणना है। यदि चार संकेत स्वतंत्र रूप से 30 % संभावना से गलत हैं, तो सभी चार के गलत होने की संभावना 0.3 की चौथी शक्ति, अर्थात 0.81 % है। यह उन धारणाओं के तहत किसी विशेष प्रारंभिक क्रम की संभावना को दर्शाता है। यह यह नहीं बताता कि तैनात एजेंट टीम विफल होगी की संभावना क्या है।
एक विफलता अनुमान के लिए यह आवश्यक होगा कि कठिन परिस्थितियों की आवृत्ति और उन परिस्थितियों में प्रणाली का व्यवहार दोनों को समझा जाए। इन मात्राओं को मिलाना परिणाम को या तो अधिक भयावह या अधिक आश्वस्त दिखा सकता है, जितना साक्ष्य अनुमति देते हैं। एक तनाव परीक्षण एक महत्वपूर्ण कमजोरी को उजागर कर सकता है, बिना उसकी सामान्य कार्य में आवृत्ति को मापे।
सहमति बनाने से पहले साक्ष्य का मार्ग बनाएं
एक व्यावहारिक प्रतिक्रिया यह है कि साझा कार्यस्थल में अवलोकनों को व्याख्याओं से अलग किया जाए। काल्पनिक प्रमाणीकरण जांच के लिए, एक अवलोकन में परीक्षण पहचानकर्ता, परीक्षण किया गया कोड संस्करण, वास्तविक आउटपुट और निष्पादन समय शामिल हो सकते हैं। एक अलग फ़ील्ड एजेंट के प्रस्तावित स्पष्टीकरण और उसकी अनिश्चितता को रिकॉर्ड करेगा।
यह संरचना समन्वयक को एक ठोस प्रश्न पूछने की अनुमति देती है: क्या यह सिफारिश एक नया अवलोकन प्रस्तुत करती है, या यह पहले गिने गए साक्ष्य को संदर्भित करती है? एक ही विफल परीक्षण का उल्लेख करने वाले तीन सारांश साक्ष्य लेज़र में एक ही परीक्षण के रूप में रहने चाहिए। एक दूसरा स्वतंत्र पुनरुत्पादन एक अलग जांच के रूप में दिखाई देना चाहिए।
महंगी या महत्वपूर्ण निर्णयों के लिए, टीमें एजेंटों को एक-दूसरे के निष्कर्षों के सामने लाने से पहले प्रारंभिक आकलन एकत्र कर सकती हैं। एक समीक्षक स्रोत सामग्री की जांच करेगा, प्रारंभिक निर्णय लेगा और तभी समूह चर्चा देखेगा। विचार बदलना संभव रहेगा, लेकिन प्रणाली यह रिकॉर्ड कर सकेगी कि कौन सा नया साक्ष्य इसे उचित ठहराता है।
ये मूल्यांकन के लिए डिज़ाइन प्रस्ताव हैं, इस प्रयोग द्वारा सत्यापित सुरक्षा उपाय नहीं। वे लागत बढ़ाते हैं: अधिक संरचित रिकॉर्ड, अतिरिक्त टूल कॉल और संभावित रूप से धीमी समन्वय। उनका मूल्य उन निर्णयों के मुकाबले आंका जाना चाहिए जिन्हें वे सुरक्षित रखते हैं। एक विचार-मंथन कार्यप्रवाह ढीली बातचीत को सहन कर सकता है; एक उत्पादन घटना जांच को बहुत अधिक कड़ा साक्ष्य मार्ग चाहिए।
प्रॉम्प्ट नियम और रनटाइम नियंत्रण अलग समस्याओं को हल करते हैं
एजेंट को साक्ष्य संरक्षित रखने के लिए कहना उपयोगी है, लेकिन एक उत्पादन वास्तुकला मूल टूल आउटपुट को स्वयं संरक्षित करके आगे बढ़ सकती है। एक निष्पादन सेवा परिणामों को एक रिकॉर्ड में लिख सकती है जिसे एजेंट उद्धृत कर सकते हैं लेकिन ओवरराइट नहीं कर सकते। पाठक तब व्याख्या की तुलना मूल आउटपुट से कर सकते हैं।
एक अपरिवर्तनीय लॉग यह गारंटी नहीं देता कि परीक्षण अच्छी तरह से डिज़ाइन किया गया था, स्रोत विश्वसनीय था या व्याख्या सही है। यह, हालांकि, विसंगतियों को जांच योग्य बनाता है। एक प्रणाली एक दोषपूर्ण परीक्षण को उस रिपोर्ट से अलग कर सकती है जो उस परीक्षण का गलत वर्णन करती है।
प्राधिकरण एक अलग निर्णय बना रहना चाहिए। यह आत्मविश्वासपूर्ण निष्कर्ष कि प्रणाली को मरम्मत की आवश्यकता है, इसे बदलने की अनुमति नहीं देता। निष्पादन अनुमतियों को सहमति प्रक्रिया से बाहर रखकर एक एपिस्टेमिक त्रुटि को स्वचालित रूप से संचालनात्मक कार्रवाई बनने से रोका जा सकता है। एक एजेंट टीम गलत हो सकती है बिना अनियंत्रित परिवर्तन करने की अनुमति मिले।
मॉडल विविधता का भी मूल्यांकन किया जाना चाहिए, न कि यह मान लिया जाए कि यह समस्या को हल कर देती है। विभिन्न मॉडल अलग-अलग व्याख्याएँ प्रदान कर सकते हैं, लेकिन एजेंटों को अलग नाम या भूमिकाएँ देना यह स्थापित नहीं करता कि उनका साक्ष्य स्वतंत्र है। वही गलत सारांश पढ़ने वाला विविध समूह अभी भी एक ही साक्ष्य बाधा साझा कर सकता है।
एक मजबूत मूल्यांकन को क्या मापना चाहिए
लिंक किया गया प्रकाशन एक सार्वजनिक शोध लेख है। पाठकों को इसे तैनात बहु-एजेंट उत्पादों के व्यापक बेंचमार्क के रूप में नहीं देखना चाहिए। इसका मूल्य उस विशिष्ट विफलता मोड में है जिसे यह परीक्षण योग्य बनाता है; इसके व्यापक निहितार्थों के लिए अतिरिक्त साक्ष्य की आवश्यकता है।
एक उपयोगी अनुवर्ती मूल्यांकन संकेतों के क्रम, निजी साक्ष्य की शुद्धता, प्रतिभागियों की संख्या और संचार संरचना को बदलना चाहिए। इसमें सामान्य क्रम के साथ जानबूझकर भ्रामक क्रम भी शामिल होने चाहिए, और प्रारंभिक बहुमत सही होने के साथ-साथ प्रारंभिक बहुमत गलत होने की स्थितियों को भी शामिल करना चाहिए। अन्यथा, एक नीति सफल दिख सकती है केवल इसलिए कि वह एजेंटों को हर सहमति पर भरोसा न करने की शिक्षा देती है।
सिर्फ शुद्धता महत्वपूर्ण अंतर को नहीं पकड़ पाएगी। मूल्यांकनकर्ताओं को यह मापना चाहिए कि रिपोर्टें अवलोकनों को ईमानदारी से संरक्षित करती हैं या नहीं, एजेंट कितनी बार सहायक साक्ष्य बनाते हैं, क्या एक सही अल्पसंख्यक अंतिम निर्णय को बदल सकता है, और क्या समन्वयक दोहराए गए उद्धरणों को अलग जांच के रूप में गिनता है। टोकन खपत और विलंबता को समान तुलना में रखा जाना चाहिए: एक सुरक्षित प्रोटोकॉल को अभी भी संचालनात्मक रूप से उपयोगी लागत की आवश्यकता होती है।
तंत्रों की जांच के लिए, शोधकर्ता प्रारंभिक निर्णयों तक पहुँच को प्रयोगात्मक रूप से बदल सकते हैं जबकि कार्य साक्ष्य को स्थिर रख सकते हैं। वे स्वतंत्र प्रारंभिक आकलनों की तुलना बोर्ड पढ़ने के बाद बने आकलनों से कर सकते हैं। प्रस्तुति क्रम को यादृच्छिक बनाना साक्ष्य प्रभावों को क्रम या प्रमुखता प्रभावों से अलग करने में मदद करेगा। उत्पन्न व्याख्याएँ परिकल्पनाओं को मार्गदर्शन कर सकती हैं, लेकिन उन्हें यह सिद्ध करने के एकमात्र प्रमाण के रूप में नहीं इस्तेमाल किया जाना चाहिए कि मॉडल ने अपना उत्तर क्यों बदला।
बहु-एजेंट विश्वसनीयता की एक बेहतर परिभाषा
झुंड मानसिकता की भाषा जीवंत है, लेकिन इसे यह प्रमाण मानकर नहीं पढ़ना चाहिए कि मॉडल मानव सामाजिक दबाव का अनुभव करते हैं या मानव विश्वास रखते हैं। संचालनात्मक चिंता देखी जा सकने वाली है: जानकारी एक कार्यप्रवाह में प्रवेश करती है, निर्णय बाद के निर्णयों को प्रभावित करते हैं, और अंतिम उत्तर यह अस्पष्ट कर सकता है कि उसका समर्थन कहाँ से आया।
निर्माताओं के लिए अगला मील का पत्थर ठोस सुधार होना चाहिए। जब एक एजेंट एक संभावित गलती करता है, क्या दूसरा विरोधाभासी साक्ष्य की पहचान कर सकता है? क्या समन्वयक उस असहमति को पर्याप्त समय तक बनाए रख सकता है ताकि उसकी जांच की जा सके? क्या अंतिम निर्णय यह बता सकता है कि कौन से स्वतंत्र जांचों ने समस्या को हल किया?
एक बड़ी टीम तब भरोसा जीतती है जब वह सत्यापनीय जानकारी जोड़ती है और चुनौती के तहत निर्णयों में सुधार करती है। एजेंटों की गिनती, समर्थन की गिनती और लंबी चर्चाओं का उत्पादन पर्याप्त विकल्प नहीं हैं। सबसे उपयोगी मल्टी‑एजेंट प्रणाली वह है जिसकी साक्ष्यता तब भी जांच योग्य रहती है जब उसके प्रतिभागी सहमत हों।












