विचार नेता
एआई के बड़े पैमाने पर छिपी हुई लागतें

पर 1 जून, 2026, GitHub ने स्थायी रूप से Copilot के लिए फ्लैट-रेट “premium requests” को समाप्त कर दिया और उन्हें उपयोग-आधारित AI क्रेडिट्स से बदल दिया। जब नई मॉडल के तहत पहला बिल एक माह बाद आया, कुछ एजेंटिक उपयोगकर्ताओं ने ऐसे बिल देखे जिनके लिए वे तैयार नहीं थे: एक डेवलपर ने बताया कि सबसे भारी एजेंटिक कार्यप्रवाहों के लिए मासिक लागत $29 से बढ़कर $750 हो गई।
यह 2026 के दौरान AI टूलिंग बाजार में व्यापक बदलाव का एक स्पष्ट उदाहरण था – और वह उन संगठनों का इंतजार कर सकता है जो आज भी फ्लैट रेट का भुगतान कर रहे हैं।
संगठन उन बचाए गए घंटों की गिनती करते हैं। उनमें से कई उन चीज़ों को नहीं गिनाते जो फ्लैट रेट अदृश्य रखता है: संदर्भ उपभोग और विफलता के बाद पुनः प्रयास। अन्य लागतें विक्रेता के बिल पर कभी नहीं दिखतीं, जिसमें आउटपुट की समीक्षा करने और प्रॉम्प्ट्स को बनाए रखने में बिताया गया समय शामिल है। एक बार बिलिंग वास्तविक उपभोग पर शिफ्ट हो जाने पर, लागत अनुशासन के बिना संगठन ऐसे बिल का जोखिम उठाते हैं जो Copilot के नए मॉडल ने कुछ उपयोगकर्ताओं को चौंकाया, उसी तरह उन्हें चौंका सकता है।
जिस संदर्भ को कोई मूल्य नहीं देता
AI को स्पष्ट रूप से संदर्भ की आवश्यकता होती है; यह सवाल नहीं है। सवाल यह है कि भेजा जा रहा संदर्भ प्रासंगिक है या केवल सुविधाजनक रूप से उपलब्ध है। पूरे दस्तावेज़ को भेजना मॉडल को जानकारी देने का सबसे तेज़ तरीका है। यह स्वचालित रूप से सबसे सस्ता या सबसे अच्छा तरीका नहीं है।
मई 2026 में, Stanford के Digital Economy Lab ने आठ अग्रणी मॉडलों में एजेंटिक कोडिंग कार्यों का विश्लेषण प्रकाशित किया और पाया कि ये कार्य एक साधारण कोड चैट की तुलना में लगभग एक हजार गुना अधिक टोकन उपभोग करता है, जहाँ मुख्य कारण मॉडल का आउटपुट नहीं बल्कि वह इनपुट संदर्भ है जिसे वह बार‑बार पुनः भेजता है। एजेंट प्रत्येक अगले चरण में अपनी पूरी इतिहास को फिर से पढ़ता है। वही कार्य, कई बार चलाने पर, टोकन उपभोग में तीस गुना तक अंतर दिखाता है।
सटीकता भी संदर्भ की मात्रा के साथ रैखिक रूप से नहीं बढ़ती: यह अक्सर मध्यम मात्रा पर शिखर पर पहुँचती है और फिर केवल लागत बढ़ाती है बिना मूल्य जोड़े।
टोकन अंधापन, तब, AI को संदर्भ की आवश्यकता न होने के बारे में नहीं है। यह इस तथ्य से जुड़ा है कि माप के बिना, कोई नहीं पूछता कि वह सभी संदर्भ वास्तव में आवश्यक है या नहीं। फ्लैट रेट के तहत, इस प्रश्न को अनदेखा करना आसान है। उपभोग-आधारित बिलिंग के तहत, यह लागत का हिस्सा बन जाता है।
जब आप विफलता के लिए दो बार भुगतान करते हैं
एजेंटिक कार्यप्रवाह एक अतिरिक्त लागत ले जाते हैं जो लगभग कभी ROI गणनाओं में नहीं दिखती। दस चरणों की एक सरल श्रृंखला की कल्पना करें, प्रत्येक का स्वयं में 95 प्रतिशत सही चलने की संभावना है। यह पर्याप्त विश्वसनीय लगती है, लेकिन जब इन्हें जोड़ते हैं, उस श्रृंखला के पास पूरे रन को बिना किसी त्रुटि के पूरा करने की लगभग 60 प्रतिशत संभावना है।
एक ऐसे कार्यप्रवाह में जो प्रत्येक कॉल पर संचित संदर्भ को फिर से भेजता है, प्रत्येक विफलता और उसके बाद का पुनः प्रयास केवल दोहराए गए चरण की लागत नहीं उठाता: आप उससे पहले भेजी गई सभी चीज़ों के लिए भी फिर से भुगतान करते हैं।
यह एक सामान्य समस्या है जिसका सामना लगभग हर कोई अपनी पहली एजेंटिक पाइपलाइन बनाते समय करता है। मैं भी इसे स्वयं अनुभव किया। शुरू में, केवल दो‑तीन एजेंटों के साथ, यह अधिक मायने नहीं रखता था। लेकिन जैसे ही पाइपलाइन बढ़ी, प्रत्येक विफल रन अधिक महंगा हो गया, और यही कारण था कि मैंने यह पूछना शुरू किया कि प्रत्येक एजेंट को कौन सा संदर्भ चाहिए और उसे कैसे कैश किया जाए, न कि केवल यह कि रन सफल हुआ या नहीं।
उसी विश्लेषण से पता चलता है कि प्रति चरण 95 प्रतिशत विश्वसनीयता वाले दस‑चरणीय एजेंट पर पुनः प्रयासों में लगभग 40 प्रतिशत अधिक टोकन खर्च होते हैं, तुलना में एक पूरी तरह विश्वसनीय प्रणाली के। यह वह लागत है जिसे आप बिल पर देखेंगे, लेकिन संभवतः किसी भी ROI स्प्रेडशीट में नहीं पाएँगे।
निगरानी बग नहीं है। यह बजट में शामिल है
इस बिंदु को सटीक रूप से बताया जाना चाहिए, क्योंकि इसे गलत समझना आसान है। AI आउटपुट की समीक्षा सिस्टम विफलता नहीं है; यह AI के साथ काम करने का वैध, अपेक्षित हिस्सा है, जैसे कोड रिव्यू डेवलपर्स के साथ काम करने का वैध हिस्सा है। समस्या यह नहीं है कि आउटपुट की समीक्षा की जाती है। समस्या यह है कि यह कार्य लगभग कभी भी इस गणना में शामिल नहीं किया जाता कि AI ने वास्तव में कितना बचत किया।
Glean के Work AI Institute ने 6,000 कर्मचारियों का सर्वेक्षण किया और पाया कि ऑटोमेशन उन्हें लगभग 11 घंटे प्रति सप्ताह बचाता है, लेकिन लगभग छह और आधा घंटे उन घंटों में रखरखाव कार्यों में जाते हैं: AI सिस्टम को संदर्भ देना, उनके काम की जाँच करना, और त्रुटियों को साफ़ करना। इसलिए शुद्ध बचत लगभग चार और आधा घंटे है – शीर्षक आंकड़े का आधे से कम। AI अभी भी समय बचाता है, लेकिन पहली संख्या जितना नहीं।
प्रॉम्प्ट्स को रखरखाव की आवश्यकता है, केवल लेखक की नहीं
आज प्रॉम्प्ट्स अधिकतर प्रोडक्शन कोड की तरह व्यवहार करते हैं: मॉडल अपडेट, संदर्भ में परिवर्तन या प्रतीत होने वाला छोटा संपादन उनके प्रदर्शन को बदल सकता है। संस्करण नियंत्रण और परीक्षण के बिना, ये परिवर्तन चुपचाप समस्याएँ उत्पन्न कर सकते हैं। कोड के लिए मानक रीग्रेशन टेस्ट अक्सर प्रॉम्प्ट्स की सत्यापन में छोड़ दिए जाते हैं। एक ऐसा परिवर्तन जो एक वाक्य में छोटा संपादन जैसा दिखता है, उत्पादन में पहुँच सकता है और सटीकता को घटा सकता है, बिना किसी के ध्यान में आए जब तक कि समस्या दृश्यमान न हो जाए।
एक उचित मूल्यांकन फ्रेमवर्क बनाना – जिसमें टेस्ट सेट और प्रत्येक परिवर्तन पर स्वचालित रीग्रेशन टेस्ट शामिल हों – अतिरिक्त कार्य है जो लगभग कभी भी “AI समय बचाता है” गणना में नहीं दिखता।
सस्ते टोकन, उच्च बिल
GitHub Copilot अपवाद नहीं था। CFO Dive द्वारा उद्धृत एक सर्वेक्षण ने पाया कि लगभग दस में से सात अमेरिकी कंपनियों ने पिछले वर्ष कम से कम आंशिक AI बजट ओवररन की रिपोर्ट की, मुख्यतः उपभोग-आधारित बिलिंग में पूर्ण परिवर्तन से पहले, उसके बाद नहीं।
Bain & Company ने अपने जून विश्लेषण में टोकन अर्थशास्त्र पर एक विरोधाभास जो पूरी स्थिति को सबसे बेहतर रूप से दर्शाता है, जोड़ा: टोकन की कीमत वर्ष भर में आधी हो गई, जबकि उसी अवधि में उपभोग 4.5 गुना बढ़ गया।
मॉडल सस्ता हो गया, लेकिन बिल जिद्दी रूप से उच्च बना रहा। कंपनियों ने नए मॉडलों की ओर रुख किया, एजेंटों को अधिक जटिल कार्य दिए और उनके लिए अधिक कार्यप्रवाह खोजे। एक सस्ता टोकन कम खर्च का मतलब नहीं था; इसका अर्थ था कि इसे उपभोग करने के अधिक कारण मौजूद थे।
बिल आने से पहले कैसे तैयार हों
इससे उत्पन्न होने वाला ढांचा कम AI उपयोग के बारे में नहीं है। यह AI की लागत को जानने के बारे में है, इससे पहले कि आप इसे और अधिक स्केल करने का निर्णय लें।
- पहले दृश्यता प्राप्त करें
जब तक आपके पास उपभोग को टीम, कार्यप्रवाह, एप्लिकेशन और पूर्ण कार्य, हर विस्तार एक अंधा दांव है। वह दृश्यता भी मुफ्त नहीं है: एजेंटिक कार्यप्रवाहों के लिए विशेष रूप से, प्रत्येक चरण को ट्रेस करना, क्या हुआ और क्यों इसका लॉग रखना, और अनियंत्रित लूप की निगरानी करना अपने स्वयं के इंजीनियरिंग समय और टूलिंग की मांग करता है। इसे AI चलाने की लागत के हिस्से के रूप में बजट में शामिल करें, न कि इसके ऊपर एक बाद में सोचा गया अतिरिक्त खर्च।
- शुद्ध आधार पर ROI की पुनर्गणना करें
रिपोर्ट किए गए बचाए गए घंटों से समीक्षा, सुधार और प्रॉम्प्ट रखरखाव में लगे समय को घटाएँ। यदि उपयोग‑केस का उद्देश्य समय बचत है और शुद्ध परिणाम नकारात्मक या सत्यापित नहीं किया जा सकता, तो यह स्केल करने के लिए तैयार नहीं है। जहाँ इच्छित लाभ गुणवत्ता, क्षमता, जोखिम में कमी या राजस्व है, वहाँ उस परिणाम को सीधे मापें।
- लागत अनुशासन लागू करें, लेकिन समान रूप से नहीं
जहाँ विफलता कम लागत वाली हो, जैसे आंतरिक उपकरण, प्रयोगात्मक एजेंट, विकास वातावरण, वहाँ कठोर खर्च सीमा समझ में आती है। महत्वपूर्ण, ग्राहक‑समक्ष कार्यक्षमता के लिए – उदाहरण के तौर पर एक ग्राहक‑सेवा सहायक – कठोर सीमा लागू नहीं की जा सकती, क्योंकि इससे आउटेज का जोखिम बनता है। ऐसे मामलों में आपको सस्ते मॉडल की स्तरित बैकअप और प्रारम्भिक चेतावनी अलर्ट की आवश्यकता होती है, न कि शून्य पर बंद करना।
- प्रॉम्प्ट और मूल्यांकन को इंजीनियरिंग संपत्तियों के रूप में मानें
उन्हें संस्करणित करें, परीक्षण करें और तैनाती से पहले बदलावों की समीक्षा करें, बिलकुल उसी तरह जैसे आप प्रोडक्शन कोड का प्रबंधन करते हैं।
अपना डेटा लेकर नवीनीकरण में प्रवेश करें
विक्रेता की कीमतें आपके अपने उपयोग डेटा के बिना मूल्यांकन करना कठिन होता है। नवीनीकरण या मॉडल परिवर्तन से पहले, प्रस्तावित शर्तों के तहत आपके मौजूदा कार्यप्रवाहों की लागत की गणना करें। लक्ष्य केवल कम कीमत पर बातचीत करना नहीं है। यह जानना है कि वह कीमत आपके वास्तविक उपभोग स्तर पर कैसे व्यवहार करेगी, न कि बिल से पता चलने पर।
इस सप्ताह आप तीन चीज़ें कर सकते हैं: देखें कि क्या आप टीम और कार्यप्रवाह के अनुसार AI उपभोग को विभाजित कर सकते हैं; एक उपयोग‑केस चुनें और समीक्षा में लगे समय को रिपोर्ट किए गए बचाए गए घंटों के साथ रखें; और पता लगाएँ कि जहाँ कठोर खर्च सीमा लागत को नियंत्रित करने के बजाय आउटेज पैदा कर सकती है।
AI लागत को प्रबंधित किया जा सकता है। बस तब नहीं जब आप पहली बार बिल से पता लगा रहे हों कि वे क्या हैं।












