विचार नेता
उन्होंने हमें एजेंट्स का वादा किया था, लेकिन हमें केवल स्टेटिक चेन मिली
वर्ष 2023 के वसंत में, दुनिया LLM-आधारित AI एजेंट्स के उदय से उत्साहित हो गई। शक्तिशाली डेमो जैसे AutoGPT और BabyAGI ने LLMs के संभावनाओं को प्रदर्शित किया, जो एक लूप में चलते हैं, अगली क्रिया का चयन करते हैं, परिणामों का अवलोकन करते हैं और अगली क्रिया का चयन करते हैं, एक-एक करके (जिसे ReACT फ्रेमवर्क के रूप में भी जाना जाता है)। यह नया तरीका एजेंट्स को शक्ति प्रदान करने की उम्मीद थी जो स्वायत्त रूप से और सामान्य रूप से बहु-चरण कार्यों को करते हैं। उन्हें एक उद्देश्य और एक सेट टूल दें और वे बाकी का ख्याल रखेंगे। 2024 के अंत तक, परिदृश्य AI एजेंट्स और AI एजेंट-निर्माण फ्रेमवर्क से भर जाएगा। लेकिन वे वादे के खिलाफ कैसे खड़े होते हैं?
यह कहना सुरक्षित है कि ReACT फ्रेमवर्क पर आधारित एजेंट्स, जो निर्दोष हैं, गंभीर सीमाओं से पीड़ित हैं। उन्हें एक कार्य दें जो कुछ चरणों से अधिक की आवश्यकता होती है, जिसमें कुछ टूल्स का उपयोग होता है और वे दयनीय रूप से विफल हो जाएंगे। उनकी स्पष्ट विलंबता समस्याओं के अलावा, वे ट्रैक खो देंगे, निर्देशों का पालन करने में विफल रहेंगे, बहुत जल्दी या बहुत देर से रुक जाएंगे, और प्रत्येक प्रयास पर व्यापक रूप से भिन्न परिणाम प्रदान करेंगे। और यह कोई आश्चर्य नहीं है। ReACT फ्रेमवर्क अनुमानित LLMs की सीमाओं को लेता है और उन्हें चरणों की संख्या से बढ़ाता है। हालांकि, एजेंट निर्माता जो वास्तविक दुनिया के उपयोग के मामलों को हल करने की कोशिश कर रहे हैं, विशेष रूप से उद्यम में, उस स्तर के प्रदर्शन के साथ नहीं कर सकते हैं। उन्हें जटिल बहु-चरण कार्यों के लिए विश्वसनीय, अनुमानित और समझने योग्य परिणामों की आवश्यकता होती है। और उन्हें AI प्रणालियों की आवश्यकता होती है जो LLMs की अनुमानित प्रकृति को बढ़ाने के बजाय कम करती हैं।
तो एजेंट्स कैसे बनाए जाते हैं आज उद्यम में? जिन उपयोग के मामलों के लिए कुछ टूल्स और कुछ चरणों (जैसे कि वार्तालाप RAG) से अधिक की आवश्यकता होती है, आज एजेंट निर्माता मुख्य रूप से ReACT के गतिशील और स्वायत्त वादे को छोड़ दिया है और स्टेटिक चेनिंग पर आधारित तरीकों का उपयोग करते हैं – एक विशिष्ट उपयोग के मामले को हल करने के लिए डिज़ाइन की गई पूर्व-निर्धारित श्रृंखला का निर्माण। यह दृष्टिकोण पारंपरिक सॉफ्टवेयर इंजीनियरिंग की तरह है और ReACT के एजेंटिक वादे से बहुत दूर है। यह नियंत्रण और विश्वसनीयता के उच्च स्तर को प्राप्त करता है लेकिन स्वायत्तता और लचीलेपन की कमी है। समाधान इसलिए विकास सघन, अनुप्रयोग में संकीर्ण और पर्यावरण में उच्च स्तर के परिवर्तनशीलता को संबोधित करने के लिए बहुत जिद्दी हैं।
निश्चित रूप से, स्टेटिक चेनिंग प्रथाओं में “स्टेटिक” होने के स्तर में भिन्नता हो सकती है। कुछ श्रृंखलाएं केवल परमाणु चरणों (उदाहरण के लिए, जानकारी निकालने, पाठ का सारांश बनाने या एक संदेश का मसौदा तैयार करने) के लिए LLMs का उपयोग करती हैं, जबकि अन्य LLMs का उपयोग रनटाइम पर गतिशील रूप से कुछ निर्णय लेने के लिए भी करते हैं (उदाहरण के लिए, एक LLM वैकल्पिक प्रवाह के बीच मार्गदर्शन करने के लिए या एक चरण के परिणाम को मान्य करने के लिए एक LLM ताकि यह निर्धारित किया जा सके कि क्या इसे फिर से चलाना चाहिए)। किसी भी स्थिति में, जब तक LLMs किसी भी गतिशील निर्णय लेने के लिए जिम्मेदार होते हैं – हम अनिवार्य रूप से विश्वसनीयता और स्वायत्तता के बीच एक व्यापार बंदी में फंस जाते हैं। समाधान जितना अधिक स्थिर है, उतना ही अधिक विश्वसनीय और अनुमानित है, लेकिन कम स्वायत्त और इसलिए अधिक अनुप्रयोग में संकीर्ण और अधिक विकास सघन है। समाधान जितना अधिक गतिशील और स्वायत्त है, उतना ही अधिक सामान्य और निर्माण के लिए सरल है, लेकिन कम विश्वसनीय और अनुमानित है।
यह व्यापार बंदी निम्नलिखित ग्राफिक में दर्शाया जा सकता है:

यह सवाल उठाता है, क्यों हमने अभी तक एक एजेंटिक फ्रेमवर्क नहीं देखा है जो ऊपरी दाएं चतुर्थांश में रखा जा सकता है? क्या हम विश्वसनीयता के लिए स्वायत्तता का व्यापार करने के लिए हमेशा के लिए बर्बाद हैं? क्या हम एक फ्रेमवर्क नहीं प्राप्त कर सकते हैं जो ReACT एजेंट (एक उद्देश्य और एक सेट टूल लें और इसे आउट फिगर करें) की सरल इंटरफ़ेस प्रदान करता है बिना विश्वसनीयता को त्यागे?
उत्तर यह है – हम कर सकते हैं और हम करेंगे! लेकिन इसके लिए, हमें यह महसूस करने की आवश्यकता है कि हमने इसे पूरी तरह से गलत किया है। सभी वर्तमान एजेंट-निर्माण फ्रेमवर्क एक सामान्य दोष साझा करते हैं: वे LLMs पर गतिशील, स्वायत्त घटक के रूप में निर्भर करते हैं। हालांकि, हमें जो महत्वपूर्ण तत्व याद आ रहा है – जो हमें एजेंट्स बनाने की आवश्यकता है जो स्वायत्त और विश्वसनीय दोनों हैं – वह योजना प्रौद्योगिकी है। और LLMs महान योजनाकार नहीं हैं।
लेकिन पहले, “योजना” क्या है? हम “योजना” से मतलब है कि वांछित परिणाम तक ले जाने वाले वैकल्पिक कार्रवाई के पाठ्यक्रमों को स्पष्ट रूप से मॉडल करने और उन वैकल्पिकों को कुशलता से अन्वेषण और शोषण करने की क्षमता है, बजट प्रतिबंधों के तहत। योजना को मैक्रो और माइक्रो स्तर दोनों पर किया जाना चाहिए। एक मैक्रो-योजना को एक कार्य को निर्भर और स्वतंत्र चरणों में तोड़ देना चाहिए जो वांछित परिणाम प्राप्त करने के लिए निष्पादित किया जाना चाहिए। जो अक्सर अनदेखा किया जाता है वह माइक्रो-योजना की आवश्यकता है जो एकल चरण स्तर पर वांछित परिणामों को गारंटी देने के लिए है। एकल चरण स्तर पर गारंटीकृत परिणाम प्राप्त करने और विश्वसनीयता हासिल करने के लिए कई रणनीतियाँ हैं जो अधिक अनुमान-समय कंप्यूटिंग का उपयोग करके की जा सकती हैं। उदाहरण के लिए, आप सेमांटिक खोज प्रश्नों को कई बार पुनर्लिखित कर सकते हैं, आप एक दिए गए प्रश्न के लिए अधिक संदर्भ प्राप्त कर सकते हैं, आप एक बड़ा मॉडल का उपयोग कर सकते हैं, और आप एक LLM से अधिक अनुमान प्राप्त कर सकते हैं – सभी आवश्यकता-संतुष्ट परिणामों से जिनमें से आप सबसे अच्छा चुन सकते हैं। एक अच्छा माइक्रो-योजनाकार अनुमान-समय कंप्यूटिंग का उपयोग करके दिए गए कंप्यूट और विलंबता बजट के तहत सर्वोत्तम परिणाम प्राप्त कर सकता है। इस तरह, योजनापूर्ण AI प्रणाली LLMs की संभावित प्रकृति को शांत करने के लिए कदम स्तर पर गारंटीकृत परिणाम प्राप्त कर सकती है। ऐसे गारंटी के बिना, हम मैक्रो-स्तर पर भी सबसे अच्छी योजना को कमजोर करने वाली त्रुटि की समस्या में वापस आ जाते हैं।
लेकिन LLMs योजनाकार क्यों नहीं हो सकते? आखिर, वे उच्च-स्तरीय निर्देशों को उचित श्रृंखला में विचार या योजनाओं में अनुवाद करने में सक्षम हैं। कारण यह है कि योजना के लिए और भी बहुत कुछ चाहिए। योजना के लिए वांछित परिणाम तक ले जाने वाले वैकल्पिक कार्रवाई के पाठ्यक्रमों को मॉडल करने और उन वैकल्पिकों के अपेक्षित उपयोगिता और अपेक्षित लागत (कंप्यूट या विलंबता में) के बारे में तर्क करने की क्षमता की आवश्यकता होती है। जबकि LLMs वैकल्पिक कार्रवाई के पाठ्यक्रमों के प्रतिनिधित्व उत्पन्न करने में सक्षम हो सकते हैं, वे उनके संबंधित अपेक्षित उपयोगिता और लागत का अनुमान नहीं लगा सकते हैं। उदाहरण के लिए, एक विशिष्ट संदर्भ के लिए एक उत्तर उत्पन्न करने के लिए मॉडल X का उपयोग करने के अपेक्षित उपयोगिता और लागत क्या हैं? एक विशिष्ट टुकड़ा जानकारी को सूचीबद्ध दस्तावेज़ निगम में खोजने के लिए एक API कॉल करने के अपेक्षित उपयोगिता क्या है? आपका LLM इसका कोई संकेत नहीं है। और अच्छे कारण के लिए – इन संभावित विशेषताओं के ऐतिहासिक निशान शायद ही कभी जंगल में पाए जाते हैं और LLM प्रशिक्षण डेटा में शामिल नहीं किए जाते हैं। वे AI प्रणाली के विशिष्ट टूल और डेटा वातावरण में संचालित होने के लिए विशिष्ट होते हैं, जो LLMs द्वारा प्राप्त की जाने वाली सामान्य ज्ञान से अलग है। और यहां तक कि अगर LLMs अपेक्षित उपयोगिता और लागत का अनुमान लगा सकते हैं, तो सबसे प्रभावी कार्रवाई का चयन करने के लिए उन पर तर्क करना एक तार्किक निर्णय-सिद्धांतक दृष्टिकोण है, जो LLMs की अगली टोकन भविष्यवाणियों द्वारा विश्वसनीय रूप से किया जा सकता है।
तो AI योजना प्रौद्योगिकी के लिए लापता सामग्री क्या है? हमें प्लानर मॉडल की आवश्यकता है जो अनुभव और सिमुलेशन से सीख सकते हैं और विशिष्ट टूल और डेटा वातावरण में वैकल्पिक कार्रवाई के पाठ्यक्रमों और संबंधित उपयोगिता और लागत संभावनाओं को स्पष्ट रूप से मॉडल कर सकते हैं। हमें एक योजना परिभाषा भाषा (PDL) की आवश्यकता है जो वैकल्पिक कार्रवाई के पाठ्यक्रमों और संभावनाओं के बारे में प्रतिनिधित्व और तर्क करने के लिए उपयोग की जा सकती है। हमें एक निष्पादन इंजन की आवश्यकता है जो PDL में परिभाषित एक दिए गए योजना को निर्धारित रूप से और कुशलता से निष्पादित कर सकता है।
कुछ लोग पहले से ही इस वादे को पूरा करने पर काम कर रहे हैं। तब तक, स्टेटिक चेन बनाना जारी रखें। बस कृपया उन्हें “एजेंट” कहकर पुकारने से बचें।












