विचार नेता

कार्य-संरेखित बनाम मानव-संरेखित: क्यों एआई का अगला मानक हमें होना चाहिए

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

हर कुछ महीने में, एक नया मॉडल आता है और एआई लीडरबोर्ड को पुनः व्यवस्थित करता है। स्टैनफोर्ड के 2026 AI Index Report के अनुसार, फ्रंटियर मॉडल ने एक वर्ष में लगभग 30 प्रतिशत अंक “Humanity’s Last Exam” पर हासिल किए, जो विशेष रूप से एआई के लिए कठिन बनाने हेतु बनाया गया बेंचमार्क है। वह छलांगें जो पहले वर्षों में लेती थीं, अब महीनों में हो रही हैं, और उद्योग प्रत्येक नई उच्च स्कोर को यह प्रमाण मानता है कि एआई बेहतर हो रहा है।

मैं प्रगति को नहीं खारिज करता। ये सिस्टम अपने निर्मित कार्य में उल्लेखनीय हैं। लेकिन मैंने मनोविज्ञान में लगभग दो दशकों तक काम किया, फिर एआई में कदम रखा, और मैं लगातार एक ऐसे प्रश्न पर लौटता हूँ जिसका कोई भी बेंचमार्क उत्तर नहीं देता। मॉडल वास्तव में किस चीज़ में बेहतर हो रहा है, और किसके लिए? एक मॉडल सभी मौजूदा सटीकता‑आधारित लीडरबोर्ड को टॉप कर सकता है और फिर भी उपयोगकर्ता को कुछ तरीकों से नुकसान पहुँचा सकता है। एआई के उपयोगकर्ता पर प्रभाव मापने वाला कोई परीक्षण नहीं है, और इस पर अधिक ध्यान देना चाहिए।

Two Different Kinds of Alignment

एआई उद्योग लगातार संरेखण (alignment) के बारे में बात करता है, लेकिन चर्चा अक्सर इस बात पर केंद्रित रहती है कि मॉडल निर्देशों का सटीक पालन करता है या हानिकारक सामग्री उत्पन्न करता है या नहीं। इसे कार्य‑संरेखित एआई कहा जाता है। यह सामने रखे गए अनुरोध को सही और कुशलता से पूरा करने के लिए अनुकूलित होता है।

हालाँकि, लोगों की सुरक्षा के लिए एक और दृष्टिकोण है। मानव‑संरेखित एआई इस बात का आकलन करता है कि स्क्रीन के दूसरे पक्ष पर मौजूद व्यक्ति पर इंटरैक्शन के बाद क्या प्रभाव पड़ता है। क्या वह अगली कठिन निर्णय को स्वयं संभालने में अधिक सक्षम हो गया, या वह सिस्टम पर अधिक निर्भर हो गया? जहाँ कार्य‑संरेखण आउटपुट को मापता है, वहीं मानव‑संरेखण बाद के प्रभाव को मापता है।

इन दो लक्ष्यों में हमेशा टकराव नहीं होता। एक मॉडल जो तकनीकी प्रश्न का तेज़ और सटीक उत्तर देता है, दोनों को संतुष्ट कर सकता है। लेकिन जब प्रश्न का एकल सही उत्तर नहीं होता, तो संरेखण में अंतर स्पष्ट हो जाता है।

What the Leaderboards Don’t Show

उद्योग के सबसे अधिक उद्धृत बेंचमार्क प्रतिस्पर्धात्मक गणित और बड़े पैमाने पर कोडिंग कार्यों की जाँच करते हैं। ये मूल्यवान कौशल हैं, लेकिन प्रत्येक प्रश्न का एक सही उत्तर होता है, और मॉडल को उसे खोजने के लिए बनाया जाता है।

यह वस्तुनिष्ठ समस्याओं के लिए अच्छा काम करता है, लेकिन लोग एआई का उपयोग गणित, कोडिंग और बुनियादी शोध से अधिक के लिए करते हैं। वे अपने करियर पथ के बारे में प्रश्न पूछते हैं और अपने साझेदारों के साथ कठिन वार्तालापों को सुलझाते हैं। ऐसे प्रश्नों को मॉडल ने कितना सही संभाला, इसका मूल्यांकन करने वाला कोई परीक्षण नहीं है, क्योंकि उत्तर की जाँच के लिए कोई वस्तुनिष्ठ सत्य नहीं है। प्रासंगिक जानकारी पूछने वाले व्यक्ति के भीतर ही रहती है। चाहे प्रॉम्प्ट कितना भी विस्तृत हो, मॉडल उस तक पहुँच नहीं सकता।

Responsible AI इस अंतर को कुछ हद तक भरता है, लेकिन यहाँ भी काम का उद्देश्य केवल हानि को कम करना है, न कि मानव सोच को सुधारना। वर्तमान सुरक्षा उपाय मॉडल को खतरनाक कार्यों में मदद करने से रोकने पर केंद्रित हैं। वे यह नहीं देखते कि हजारों सामान्य वार्तालाप जो प्रत्येक सुरक्षा जाँच पास करते हैं, लोगों को अपने स्वयं के निर्णय पर भरोसा कम करने की ओर ले जा रहे हैं या नहीं।

How Models Create Dependence

मैंने जिन सभी मॉडलों का परीक्षण किया है, वे व्यापक, तेज़ और आत्मविश्वासी होने की ओर झुकते हैं। यह वह चीज़ है जिसके लिए उन्हें प्रशिक्षण के दौरान इनाम दिया जाता है, और यह टूटे हुए सॉफ़्टवेयर बिल्ड या कानूनी फ़ाइलिंग डेडलाइन से निपटने के लिए सही प्रवृत्ति है। जब निर्णय किसी व्यक्ति के मूल्यों और इतिहास पर निर्भर करता है, तो वही प्रवृत्ति उपयोगकर्ता के खिलाफ काम करने लगती है।

शोध ने पहले ही दिखा दिया है कि यह केवल सैद्धांतिक नहीं है। OpenAI और MIT Media Lab ने ChatGPT के भावनात्मक उपयोग पर दो अध्ययन किए और पाया कि जो लोग एआई को मित्र मानते हैं और इसे लंबे समय तक उपयोग करते हैं, वे अधिक नकारात्मक परिणामों की रिपोर्ट करते हैं, जैसे बढ़ी हुई अकेलापन और भावनात्मक निर्भरता, एक पैटर्न जिसे MIT Technology Review ने भी कवर किया। अलग से, जर्नल Societies में प्रकाशित 2025 का अध्ययन ने बार‑बार एआई टूल उपयोग और आलोचनात्मक सोच स्कोर के बीच एक महत्वपूर्ण नकारात्मक सहसंबंध पाया। यह “cognitive offloading” कहलाने वाली प्रक्रिया द्वारा मध्यस्थता किया गया, यानी मानसिक कार्य को स्वयं करने के बजाय टूल को सौंप देना।

इसका अर्थ यह नहीं है कि लोग एआई का उपयोग कम करें। बल्कि हमें यह समझना चाहिए कि जब कोई सिस्टम हर प्रकार के प्रश्न को एक ही तरीके से हल करता है, तो लेज़र के वैकल्पिक पक्ष में कुछ खो जाता है, और अभी लगभग कोई भी इस हानि को ट्रैक नहीं कर रहा है।

Give Direct Answers Their Due

मैं स्पष्ट करना चाहता हूँ कि कार्य‑संरेखित एआई किस जगह सही फिट है, क्योंकि इस लेख का उद्देश्य हर चीज़ पर हेज करने वाले मॉडल की वकालत करना नहीं है। यदि कोई व्यक्ति सर्वर त्रुटि या कर फ़ाइलिंग डेडलाइन के बारे में पूछता है, तो तेज़, स्पष्ट, अधिकारिक उत्तर उसे अच्छी तरह मदद करता है। एआई का उत्तर खुला‑समाप्त प्रश्न होना सहायक नहीं होगा। समस्या तब उत्पन्न होती है जब हम वही प्रवृत्ति एक तलाक के वजन को लेकर पूछे गए प्रॉम्प्ट पर लागू करते हैं, जैसे कि कोड डिबगिंग के प्रॉम्प्ट पर करते हैं।

What We Should Measure Instead

Restraint. उपयोगकर्ता के लिए प्रश्न को हल करने का खर्च लाभ से अधिक हो तो उसे पहचानने और उसी अनुसार पीछे हटने की क्षमता।

Calibrated questioning. जब समस्या व्यक्तिपरक हो या किसी के पहचान और मूल्यों से जुड़ी हो, तो बताने के बजाय पूछना।

Reading the moment. यह अंतर करना कि कौन‑सा अनुरोध सीधे, व्यापक उत्तर की मांग करता है और कौन‑सा उपयोगकर्ता को स्वयं सोचने के लिए स्थान देता है।

Albert Bandura के दशकों पुराने self‑efficacy पर शोध ने पाया कि लोग अपने स्वयं के महारत के अनुभवों से आत्म‑विश्वास बनाते हैं, न कि किसी और या किसी चीज़ के समस्या को हल करने से। यह सिद्धांत एआई के आधे शताब्दी पहले का है, और इसे तकनीक के डिज़ाइन और मूल्यांकन में सम्मिलित किया जाना चाहिए।

What Progress Should Mean Next

यह बात तकनीकी प्रगति को धीमा करने की नहीं है। मैं कोडिंग और तर्कशक्ति में सुधार का जश्न मनाता हूँ। लेकिन केवल कार्य‑समाप्ति पर आधारित स्कोरकार्ड हमें बताता है कि एआई अधिक बुद्धिमान हो रहा है, लेकिन यह नहीं बताता कि उपयोगकर्ता स्वयं बेहतर सोचने में सक्षम हो रहे हैं या नहीं।

मैं इस परिवर्तन को देखना चाहूँगा। जैसे-जैसे ये सिस्टम अधिक सक्षम होते जा रहे हैं, उनका उपयोग करने वाले लोगों को भी अधिक सक्षम होना चाहिए। हमने सिद्ध किया है कि एआई परीक्षण में हमसे बेहतर प्रदर्शन कर सकता है। अगला परीक्षण यह मूल्यांकन करना चाहिए कि क्या यह हमें बातचीत समाप्त होने के बाद भी बेहतर सोचने में मदद कर सकता है।

मुख्य कार्यकारी अधिकारी, Gray Sky AI