राय
Jev और AI एजेंटों के लिए नई निर्णय परत

क्यों System One मॉडल तेज़ निर्णय को धीमी तर्क प्रक्रिया से अलग कर सकते हैं
बहुत सारे AI एजेंट लगभग सभी निर्णयों के लिए एक भाषा मॉडल का उपयोग करते हैं। भाषा मॉडल एक टूल चुनता है, परिणामों का मूल्यांकन करता है, तय करता है कि क्या उसे आगे बढ़ना है, और अंत में उत्तर उत्पन्न करता है। लचीला; हालांकि, जब हाँ-या-नहीं निर्णय बड़े पैमाने पर दोहराए जाते हैं तो यह प्रक्रिया महंगी हो सकती है। Unite.AI ने पहले चर्चा की थी कि एजेंटिक वर्कफ़्लो मॉडल कॉल, संदर्भ, और पुनः प्रयासों को कैसे बढ़ाते हैं. प्रत्येक अतिरिक्त निर्णय उपयोगकर्ताओं को उपयोगी जानकारी प्रदान करने से पहले समय और धन जोड़ सकता है।
Jev सुझाव देता है कि कार्य को अलग तरीके से विभाजित किया जाए। एक ऐसा मॉडल उपयोग करें जो सीमित निर्णयों के लिए बनाया गया हो, जहाँ उत्तर सेट परिभाषित हो। खुले‑अंत वाले तर्क और भाषा के लिए एक जनरेटिव मॉडल उपयोग करें। Jev यह संकेत देता है कि मुख्य विचार यह नहीं है कि सभी एजेंटों को एक नया उत्पाद खरीदना चाहिए। मुख्य अवधारणा यह है कि एक एजेंट को हर बिंदु पर समान प्रकार की बुद्धिमत्ता की आवश्यकता नहीं है।
Jev वास्तव में क्या करता है
TypeSafe ने Jev को सितंबर 2026 में लॉन्च किया, उनके नए System One मॉडलों में से पहला। Jev प्रॉज़ नहीं लिखता। इसके बजाय, आप इसे एक स्थिति (जैसे समर्थन संदेश और उपयोगकर्ता डेटा) भेजते हैं। आप एक या अधिक प्रश्न भी भेजते हैं जिनके उत्तर प्रकार पूर्वनिर्धारित होते हैं। फिर Jev टाइप्ड उत्तर और संभावनाओं के साथ प्रतिक्रिया देता है।
के अनुसार कंपनी की आधिकारिक दस्तावेज़ीकरण, निर्णय लेने के लिए तीन मूलभूत तत्व हैं:
- Choice आपको पूर्वनिर्धारित विकल्पों में से चुनने की अनुमति देता है।
- Score आपको किसी चीज़ को क्रमबद्ध रूब्रिक के विरुद्ध रेट करने की अनुमति देता है।
- Noul यह अनुमान लगाता है कि कोई कथन सत्य है उसकी संभाव्यता।
आप एक ही अनुरोध में समान स्थिति के बारे में कई स्वतंत्र प्रश्न पूछ सकते हैं।
उदाहरण के लिए, मान लीजिए आप एक ग्राहक सेवा मुद्दे को संभाल रहे हैं। एक सिस्टम यह निर्धारित करना चाह सकता है कि कौन सी टीम इस केस को संभालेगी। यह यह भी तय कर सकता है कि किसी को कितनी जल्दी जवाब देना चाहिए और देख सकता है कि ग्राहक ने रिफंड का अनुरोध किया है या नहीं।
एक चैट मॉडल संभावित रूप से सभी तीन कार्य कर सकता है। हालांकि, इसे परिणाम आपके ऐप को संरचित प्रतिक्रिया के रूप में वापस देना होगा। इसके विपरीत, Jev केवल उन सीमित निर्णयों को प्रदान करता है। आपका ऐप फिर उन निर्णयों के आधार पर अगला कार्य तय करेगा।
आर्किटेक्चरल बदलाव मॉडल से अधिक महत्वपूर्ण है
इन बहसों में अधिकांश बड़े मॉडलों की तुलना छोटे मॉडलों से करते हैं। Jev एक वैकल्पिक सीमा प्रस्तावित करता है। कुछ चरण भाषा उत्पन्न करने में शामिल होते हैं। अन्य संकीर्ण निर्णय होते हैं जिन्हें सॉफ़्टवेयर उपयोग कर सकता है।
यह एजेंट में एक निर्णय परत बनाता है। मॉडल अनुमान लगाएगा। सॉफ़्टवेयर नीति लागू करेगा। यदि अनुमानित संभावना परीक्षण किए गए थ्रेशोल्ड से अधिक हो और क्रिया कम जोखिम वाली और उलटने योग्य हो, तो कार्यप्रवाह जारी रह सकता है। यदि परिणामों में अनिश्चितता है या यदि क्रिया गंभीर प्रभाव डाल सकती है, तो प्रणाली मानव निगरानी की मांग कर सकती है। एक तर्क मॉडल अनिश्चितता की जाँच में मदद कर सकता है, लेकिन यह आवश्यक मानव अनुमोदन को प्रतिस्थापित नहीं करता।

Figure 1. एक सीमित निर्णय पथ थ्रेशोल्ड, अनुमतियों, और एस्केलेशन को कोड में रखता है।
मॉडल रूटिंग के साथ कुछ समानताएँ हैं, लेकिन एक महत्वपूर्ण अंतर है। RouteLLM दो भाषा मॉडलों में से कौन सा चुनना है, इस बारे में निर्णय लेता है। यह गुणवत्ता और कीमत को संतुलित करने के लिए एक मजबूत और एक कमजोर मॉडल के बीच चयन करता है। एक System One मॉडल सीमित निर्णय उत्पन्न करता है जिन्हें कोड सीधे उपयोग कर सकता है। ये निर्णय मॉडल रूटिंग के साथ-साथ एजेंट के भीतर अन्य निर्णयों को भी समर्थन दे सकते हैं।
एजेंट लूप्स स्वाभाविक रूप से क्यों उपयुक्त हैं
एजेंट लूप्स की प्रकृति उन्हें बहुत छोटे स्तर पर कई निर्णय लेने के लिए विशेष रूप से उपयुक्त बनाती है। ये निर्णय अंतिम आउटपुट तक पहुंचने में मदद करते हैं। दूसरे शब्दों में, उपयोगकर्ता अपने प्रश्न या अनुरोध सबमिट करने के बाद एजेंट को बहुत सारे “छोटे” निर्णय लेने पड़ते हैं। ये निर्णय उत्तर या आउटपुट लौटने से पहले होते हैं।
एक उदाहरण होगा यह तय करना कि कौन से टूल उपयोग किए जाएँ, प्राप्त रिकॉर्ड्स को रैंक करना, और जोखिम का मूल्यांकन करना। सिस्टम यह भी निर्धारित करता है कि पर्याप्त साक्ष्य मौजूद हैं या नहीं और प्रक्रिया को जारी रखना चाहिए या नहीं। संभावना है कि ये सभी बार‑बार होंगे। साथ ही, प्रत्येक लूप के बीच देरी समय के साथ बढ़ सकती है।
एजेंट लूप्स के लिए यह भूमिका इस उदाहरण से स्पष्ट होती है: LangChain का Jev एकीकरण, जहाँ Jev मॉडल रूटिंग और टूल‑कॉल जांच दोनों कर सकता है। जबकि Jev जनरेटिव मॉडल के किनारों के आसपास एकीकृत होता है, जनरेटिव मॉडल स्वयं योजना बनाता रहता है और सामग्री उत्पन्न करता है। यह Jev के लिए एक बहुत अधिक वास्तविक उपयोग केस का प्रतिनिधित्व करता है। यह एक सामान्य‑उद्देश्य भाषा मॉडल को प्रतिस्थापित करने के बजाय पूरक करता है।
इसके अलावा, प्रश्नों को समानांतर करने से टीमों के कार्य विभाजन के बारे में सोचने का तरीका भी बदलता है। विशेष रूप से, टीमें एक अस्पष्ट निर्देश को कई अलग‑अलग मूल्यांकन प्रश्नों में विभाजित कर सकती हैं। यह संभावित रूप से मॉडल कॉल की क्रमिकता को बहुत छोटा बना सकता है। यह एक ऐसा कार्यप्रवाह बना सकता है जिसे मूल्यांकन करना बहुत आसान हो। यह डेवलपर्स को स्पष्ट व्यावसायिक तर्क का उपयोग करके प्राप्त निर्णयों को संयोजित करने की अनुमति भी देता है।
सामान्य‑उद्देश्य भाषा मॉडल संरचित आउटपुट उत्पन्न कर सकते हैं और कुछ मामलों में बेहतर विकल्प हो सकते हैं। उदाहरण के लिए, एक निर्धारण और उसका स्पष्टीकरण साथ‑साथ प्रदान करना आवश्यक हो सकता है। इसलिए, Jev को प्रभावी माना जाने के लिए केवल स्कीमा अनुपालन से अधिक दिखाना होगा।
Jev की प्रभावशीलता कुल सिस्टम लेटेंसी में कमी हासिल करने पर निर्भर करती है। यह उपयोगी संभाव्यता अनुमान उत्पन्न करने और विभिन्न इनपुट पर प्रदर्शन की स्थिरता दिखाने पर भी निर्भर करती है। यदि Jev इन लाभों को प्रदान करने में विफल रहता है, तो किसी अन्य मॉडल का चयन केवल अतिरिक्त विकास और संचालन ओवरहेड जोड़ देगा।
क्या टाइप्ड का मतलब सही है?
Jev के बारे में दावे करते समय उपयोग की जाने वाली भाषा को भी सावधानीपूर्वक तैयार करना चाहिए। क्योंकि आउटपुट स्पेस पहले से परिभाषित है, मॉडल को कोई निर्मित फ़ील्ड या अपठनीय पैराग्राफ नहीं लौटाना चाहिए। यह एक प्रकार की विफलता को समाप्त करता है; यह अर्थ‑त्रुटि को समाप्त नहीं करता। यह कोई बाधा नहीं है कि सिस्टम गलत विभाग, गलत जोखिम स्तर या अत्यधिक निश्चितता का बयान लौटाए। यह सब कुछ पूरी तरह टाइप‑सेफ़ रहते हुए कर सकता है।
TypeSafe की अपनी System One दस्तावेज़ एक महत्वपूर्ण अंतर दर्शाता है। कैलिब्रेशन को भविष्यवाणियों के समूहों के बीच मापा जाता है; यह व्यक्तिगत भविष्यवाणी की शुद्धता की गारंटी नहीं देता। उत्पादन में, इसका प्रभाव पड़ता है। टीमों को यह परीक्षण करना चाहिए कि उनके अपने डेटा पर अनुमानित संभावनाएँ वास्तविक परिणामों से मेल खाती हैं या नहीं।
प्रदर्शन प्रमाण अभी प्रारंभिक हैं
TypeSafe रिपोर्ट करता है कि प्रतिक्रिया समय 70 से 500 मिलीसेकंड है. यह अपने आंतरिक कार्यप्रवाह मूल्यांकनों में उल्लेखनीय लागत बचत और गति सुधार का भी उल्लेख करता है। अतिरिक्त रूप से, TypeSafe संकेत देता है कि ये प्रमुख लाभ वास्तविक दुनिया में उच्चतम सीमा के निकट हो सकते हैं। TypeSafe की सार्वजनिक रूप से उपलब्ध कार्यप्रवाह परीक्षण अन्य अग्रणी मॉडलों द्वारा प्रदान किए गए संदर्भ संभावनाओं का उपयोग करती है, न कि ग्राउंड‑ट्रुथ लेबलों का। परिणाम परिकल्पनाएँ बनाने के लिए उपयुक्त हैं। परिणाम वास्तविक कार्यभार के खिलाफ स्वतंत्र परीक्षण की जगह नहीं ले सकते।
स्वीकार करने से पहले एक व्यावहारिक परीक्षण
जब आप अपना पहला AI‑संचालित निर्णय कार्यप्रवाह बनाते हैं, तो सबसे महत्वपूर्ण निर्णयों (जैसे, चिकित्सा अनुमोदन या खाता निलंबन) को न चुनें। इसके बजाय, ऐसा कुछ चुनें जो बहुत सामान्य, उलटने योग्य और टीम के अन्य सदस्यों द्वारा आसानी से समीक्षा योग्य हो। इसमें टिकट रूटिंग, दस्तावेज़ वर्गीकरण, मॉडल चयन और कम‑जोखिम गुणवत्ता आश्वासन शामिल हैं, लेकिन इन्हीं तक सीमित नहीं हैं।
चार प्रश्न आपको यह आकलन करने में मदद करेंगे कि क्या यह काम करेगा:
- क्या आउटपुट के संभावित उत्तरों की सीमित संख्या है?
- क्या आप निर्णय के मानदंड को स्पष्ट रूप से व्यक्त कर सकते हैं?
- क्या मापने योग्य परिणाम हैं? भविष्यवाणी, उसकी संभाव्यता, कार्रवाई और बाद के परिणामों को ट्रैक करें। भविष्यवाणी संभावनाओं की वास्तविक परिणामों से तुलना करके कैलिब्रेशन को नियमित रूप से जांचें।
- क्या आपके पास वैकल्पिक योजना है यदि स्वचालित निर्णय प्रक्रिया विफल हो जाए? यह निर्धारित करने के लिए एक विशिष्ट बिंदु पहचानें कि कब तर्क‑मॉडल का उपयोग करना है, अधिक जानकारी माँगनी है, या मानव को शामिल करना है।
आपके विश्लेषण में पूरे कार्यप्रवाह को शामिल होना चाहिए, जिसमें निर्णय‑निर्माण प्रक्रिया भी शामिल है। निर्णय सटीकता, अस्वीकार या एस्केलेशन दर, कुल एंड‑टू‑एंड प्रोसेसिंग समय, सफलतापूर्वक पूर्ण किए गए कार्य की लागत, और त्रुटियों का प्रभाव जैसे मेट्रिक्स का उपयोग करें। प्रतिकूल परिस्थितियों में परीक्षण चलाएँ: शब्दावली में विविधता, प्रासंगिक डेटा को छोड़ना, कम‑आवृत्ति श्रेणियाँ, और प्रतिकूल इनपुट। डाउनस्ट्रीम अतिरिक्त लागत उत्पन्न करने वाला अनुकूलित वर्गीकरणकर्ता अनुकूलन नहीं है।
यहाँ दीर्घकालिक सीख
यदि Jev सफल होता है, बहुत बदलता है, या जल्दी बदल दिया जाता है, तो एक बात स्थिर रहती है। वास्तु‑शिल्प प्रश्न बना रहता है। क्या हर मशीन‑आधारित निर्णय को उत्पन्न भाषा के रूप में प्रस्तुत करना आवश्यक है?
कई मामलों में, उत्तर “नहीं” है। उत्पादन वातावरण में, जनरेटिव मॉडल का उपयोग करके व्याख्याएँ, योजनाएँ और स्पष्टीकरण उत्पन्न किए जा सकते हैं। सीमित निर्णय मॉडलों का उपयोग करके वही सिस्टम रूट, स्कोर और गेट कर सकता है। कोड अभी भी स्वीकार्य थ्रेशहोल्ड मान और अनुमतियों को निर्धारित कर सकता है। मनुष्यों को उन निर्णयों की जिम्मेदारी लेनी चाहिए जो दूसरों के जीवन को प्रभावित करते हैं।
हालाँकि यह एक स्वायत्त मॉडल के सभी कार्यों को भरोसेमंद रूप से करने की तुलना में कम नाटकीय दृष्टिकोण है, यह दर्शाता है कि विश्वसनीय सिस्टम कैसे बनते हैं। एजेंटों के प्रदर्शन में अगला उन्नयन संभवतः सिस्टम के उन क्षेत्रों पर निर्भर करेगा जहाँ सोचने में अधिक समय लगता है। अन्य क्षेत्रों को तेज़ निर्णयों की आवश्यकता होती है, और कुछ को बिल्कुल कोई कार्रवाई नहीं चाहिए।












