Anderson का एंगल

सिस्टम प्रॉम्प्ट्स में गुप्त तिथियाँ भाषा मॉडल मूल्यांकन को कमजोर करती हैं

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
Harold Lloyd hangs from a clock face in Safety Last! (1923). The film is in the US public domain.. Source: https://www.youtube.com/watch?v=tzh4htLXp6Q

बिना बेंचमार्क करने की क्षमता के, उपभोक्ताओं और व्यवसायों के लिए यह समझना कठिन हो जाता है कि किसी मॉडल ने हालिया संस्करणों में क्या प्रगति की है, और वह अपने प्रतिस्पर्धियों के मुकाबले कैसे खड़ा है:

arena.ai पर प्रभावशाली LLM लीडरबोर्ड। स्रोत: https://arena.ai/leaderboard/chat/text

arena.ai पर प्रभावशाली LLM लीडरबोर्ड। स्रोत

चूंकि LLMs गैर-निर्धारित (अर्थात्, वे समान इनपुट देने पर हमेशा सुसंगत आउटपुट नहीं उत्पन्न करेंगे), उनका मूल्यांकन जटिल है। यहां तक कि जब शोधकर्ता समान प्रॉम्प्ट, मॉडल सेटिंग्स और बेंचमार्क डेटासेट का उपयोग करते हैं, तो निष्पादन पर्यावरण में मामूली अंतर भी अलग-अलग उत्तर उत्पन्न कर सकते हैं और प्रदर्शन स्कोर को काफी बदल सकते हैं।

हार्डवेयर कॉन्फ़िगरेशन, संख्यात्मक सटीकता, इन्फ़रेंस बैच आकार, और यहाँ तक कि बहुविकल्पीय उत्तरों का क्रम जैसे कारक परिणामों को प्रभावित कर सकते हैं। इससे यह समझना कठिन हो जाता है कि रिपोर्ट किया गया सुधार वास्तविक प्रगति को दर्शाता है या केवल मॉडल के परीक्षण की परिस्थितियों में कुछ अर्द्ध-यादृच्छिक परिवर्तन है।

एक हद तक, इन चर में से कुछ को ध्यान में रखा जा सकता है, या कम से कम यह निर्धारित किया जा सकता है कि वे कौन सी त्रुटि सीमा उत्पन्न करते हैं, ताकि तुलनात्मक मूल्यांकन सार्थक बन सके। यह प्रयास करना महत्वपूर्ण है, क्योंकि बड़ी मात्रा में पैसा और प्रतिष्ठा इस बात पर निर्भर करती है कि इस प्रकार की AI प्रणालियों का बेंचमार्क कुछ हद तक सटीकता के साथ किया जा सके।

हालांकि, नई शोध के अनुसार, एक विशेष चर न केवल बेंचमार्क को विनाशकारी बना सकता है, बल्कि इसे परिभाषित करने वाले प्रॉम्प्ट से हटाना भी बहुत कठिन है – आज की तिथि।

समय बदलते हैं

नया पेपर*, जर्मनी, मेक्सिको और USA के बीच एक शैक्षणिक सहयोग, यह दावा करता है कि वर्तमान तिथि को सभी अग्रणी और कई तैनाती वाले ओपन-वेट मॉडल के सिस्टम प्रॉम्प्ट में स्वचालित और गुप्त रूप से शामिल किया जाता है, जिससे पुनरुत्पादन लगभग असंभव हो सकता है:

‘हम LLM मूल्यांकन में गैर-निर्धारितता का एक महत्वपूर्ण, अक्सर अनदेखा स्रोत पहचानते हैं: सिस्टम प्रॉम्प्ट में वर्तमान तिथि का गुप्त इंजेक्शन।’

‘9 मॉडलों, 6 डेटासेट्स और चार कार्यों में, यह गतिशील मेटाडेटा मॉडल प्रदर्शन को बदलता है और लीडरबोर्ड रैंकिंग को पुनः व्यवस्थित करता है, बैच आकार या संख्यात्मक सटीकता जैसे अन्य सिस्टम-स्तरीय कारकों द्वारा प्रस्तुत परिवर्तन से अधिक।’

शोधकर्ता यह भी नोट करते हैं कि पहचाना गया प्रभाव उन कार्यों में अधिक है जिनमें उत्तर उत्पन्न करने की आवश्यकता होती है, जहाँ प्रदर्शन बहुविकल्पीय प्रश्नों में 6% तक, गणितीय तर्क में 14% तक, और कोड जनरेशन में 7% तक बदलता है – और मशीन अनुवाद स्कोर भी उल्लेखनीय रूप से बदलते हैं।

उदाहरण उत्तर प्रदान करने और क्रमिक तर्क को प्रोत्साहित करने से समस्या हल नहीं हुई – वास्तव में, बाद वाला इसे बुरा बना दिया:

2024 में विभिन्न तिथियों पर Llama 3.1 (8B) के MMLU बेंचमार्क पर सटीकता में उतार-चढ़ाव। क्रमिक तर्क (लाल) सीधे उत्तरों (नीला) की तुलना में काफी अधिक परिवर्तनशीलता उत्पन्न करता है, यह दर्शाते हुए कि चेन-ऑफ़-थॉट प्रॉम्प्टिंग तिथि के प्रति संवेदनशीलता को कैसे बढ़ाता है। स्रोत - https://arxiv.org/pdf/2609.36931

2024 में विभिन्न तिथियों पर Llama 3.1 (8B) के MMLU बेंचमार्क पर सटीकता में उतार-चढ़ाव। क्रमिक तर्क (लाल) सीधे उत्तरों (नीला) की तुलना में काफी अधिक परिवर्तनशीलता उत्पन्न करता है, यह दर्शाते हुए कि चेन-ऑफ़-थॉट प्रॉम्प्टिंग तिथि के प्रति संवेदनशीलता को कैसे बढ़ाता है। स्रोत

यह प्रभाव स्वामित्व मॉडल में भी पहचाना गया, जहाँ GPT-5.1 ने दिसंबर 2025 के एक सप्ताह के परीक्षण के दौरान तीन बहुविकल्पीय बेंचमार्क पर 4% तक की सटीकता उतार-चढ़ाव दिखाया। शोधकर्ताओं ने एक खाली सिस्टम प्रॉम्प्ट का उपयोग किया, तर्क को अक्षम किया और यादृच्छिकता को शून्य पर सेट किया – लेकिन तिथि अभी भी प्रदाता द्वारा स्वचालित रूप से डाली गई:

GPT-5.1 की सटीकता दिसंबर 2025 में सात लगातार दिनों में उतरी-चढ़ी, जबकि उपयोगकर्ता प्रॉम्प्ट और मॉडल सेटिंग्स समान थीं। सबसे बड़ा अंतर GPQA (नारंगी) पर हुआ, जहाँ सर्वोत्तम और सबसे खराब दिनों के बीच चार प्रतिशत अंक का अंतर था। डैश्ड लाइन प्रत्येक बेंचमार्क की सप्ताह भर की औसत सटीकता को दर्शाती है।

GPT-5.1 की सटीकता दिसंबर 2025 में सात लगातार दिनों में उतरी-चढ़ी, जबकि उपयोगकर्ता प्रॉम्प्ट और मॉडल सेटिंग्स समान थीं। सबसे बड़ा अंतर GPQA (नारंगी) पर हुआ, जहाँ सर्वोत्तम और सबसे खराब दिनों के बीच चार प्रतिशत अंक का अंतर था। डैश्ड लाइन प्रत्येक बेंचमार्क की सप्ताह भर की औसत सटीकता को दर्शाती है।

शोधकर्ता सुझाव देते हैं कि जहाँ संभव हो, सिस्टम प्रॉम्प्ट से तिथि को हटाया जाए, या उसे ठीक करके दस्तावेज़ किया जाए, ताकि निष्पक्ष तुलना सुनिश्चित हो सके। हालांकि, वे नोट करते हैं कि तिथि-केन्द्रित प्रभाव अधिक गहराई से अंतर्निहित हो सकता है:

‘तिथि संवेदनशीलता का एक संभावित कारण यह है कि सिस्टम प्रॉम्प्ट सुपरवाइज़्ड फाइन-ट्यूनिंग (SFT) और मानव फीडबैक से रिइनफ़ोर्समेंट लर्निंग (RLHF) के दौरान स्थिर हो सकता है, जिससे मॉडल किसी भी हल्के परिवर्तन के प्रति नाज़ुक हो जाता है।’

समस्या की जांच के लिए, शोधकर्ताओं ने सिस्टम प्रॉम्प्ट के लिए छह अलग-अलग शब्दांकन आज़माए, और पाया कि ये परिवर्तन सटीकता को उसी मात्रा में प्रभावित करते हैं जितना तारीख बदलने से (0.78%)। इसलिए तारीख का प्रभाव जानबूझकर किए गए प्रॉम्प्ट इंजीनियरिंग जितना ही है – बस यह स्वतः बदल जाता है, उपयोगकर्ता को भी पता नहीं चलता।

अन्य तरीकों को आज़माया गया ‘वर्तमान तारीख’ समस्या को कम करने के लिए, जिसमें फ्यू-शॉट लर्निंग (जहाँ मॉडल को उत्तर देने से पहले पाँच उदाहरण उत्तर मिले) शामिल था। इससे थोड़ा सुधार हुआ, औसत परिवर्तन 2.52% से घटकर 2.27% हो गया, लेकिन समस्या हल नहीं हुई।

GPU हार्डवेयर, बैच आकार, संख्यात्मक सटीकता, उत्तर क्रम और सिस्टम‑प्रॉम्प्ट शब्दांकन में भी बदलाव किए गए। सबसे बड़े प्रभाव उत्तर‑क्रम और प्रॉम्प्ट शब्दांकन में देखे गए, जो तारीख बदलने के प्रभाव के सबसे करीब थे।

अंतिम दिन

यह उचित है कि एक LLM/VLM चैट की शुरुआत से ही तारीख समझ ले; हालांकि, सिस्टम प्रॉम्प्ट में इसे स्पष्ट रूप से शामिल करने (अदृश्य नियम जो गार्डरेल्स लागू करता है, और उपयोगकर्ता के पहुँच से बाहर तरीकों से LLM के व्यवहार को निर्धारित करता है) का कोई स्पष्ट कारण नहीं दिखता, जबकि LLM नियमित रूप से एक सब‑KB RAG कॉल करके नवीनतम तारीख को प्राप्त कर सकता है, जो उपयोगकर्ता के साथ संवाद शुरू करने से पहले एक छोटा रख‑रखाव कार्य है।

निस्संदेह अन्य संभावनाएँ मौजूद हैं इस मुद्दे को सुलझाने की; हालांकि, चूँकि सिस्टम प्रॉम्प्ट में वर्तमान तारीख को सम्मिलित करने को अब तक समस्या के रूप में नहीं देखा गया, इसलिए संभवतः इस संबंध में बहुत कम या कोई जांच नहीं की गई है।

ऑनलाइन डेटिंग

परीक्षणों के लिए, प्रत्येक मॉडल के लिए समान प्रॉम्प्ट उपयोग किए गए, केवल सिस्टम प्रॉम्प्ट में तारीख बदली गई। 2024 के हर दिन का परीक्षण किया गया, 1 जनवरी से लेकर 31 दिसंबर तक, जबकि सभी अन्य सेटिंग्स समान रखी गईं।

छह बेंचमार्क उपयोग किए गए: MMLU; GPQA; और ARC-Challenge, बहुविकल्पीय प्रश्नों के लिए (उत्तर‑टोकन संभाव्यता द्वारा स्कोर किया गया)। GSM8K चरण‑दर‑चरण गणित के लिए (अंतिम उत्तर जाँच किया गया); HumanEval पायथन कोड जनरेशन के लिए (यूनिट‑टेस्ट किया गया); और WMT अंग्रेजी‑से‑जर्मन; अंग्रेजी‑से‑फ़िनिश; और अंग्रेजी‑से‑चेक अनुवाद के लिए (पूरे आउटपुट का मूल्यांकन किया गया)। समय‑निर्भर प्रश्नों को बाहर रखा गया।

नौ मॉडल परीक्षण किए गए: Llama 3.1 Instruct (8B और 70B); Gemma 3 Instruct (4B और 27B); Qwen3 (4B); Qwen3-Next (80B); Phi-4 (14B); और GPT-OSS (20B और 120B)।

सटीकता (सही उत्तरों का प्रतिशत) का उपयोग बहुविकल्पीय और गणितीय परीक्षणों को स्कोर करने के लिए किया गया, जबकि अपेक्षित कैलिब्रेशन त्रुटि (ECE) ने मापा कि मॉडल की आत्मविश्वास वास्तविक प्रदर्शन से कितनी मेल खाती है।

कोड को pass@1 (पहले प्रयास में सभी परीक्षण पास करने वाले उत्पन्न कोड समाधान का प्रतिशत) से जाँचा गया; अनुवादों को BLEU और chrF से स्कोर किया गया।

परिणामों ने शोधकर्ताओं की परिकल्पना की पुष्टि की: केवल सिस्टम प्रॉम्प्ट में तारीख बदलने से मॉडल उसी प्रश्नों के उत्तर देने की सटीकता बदल गई।

परीक्षण परिणाम दिखाते हैं कि पाँच प्रमुख मॉडल MMLU पर कैसे प्रदर्शन करते हैं जब सिस्टम‑प्रॉम्प्ट की तारीख 2024 के दौरान बदलती रही। सटीकता ऊपर दिखायी गई है, जबकि अपेक्षित कैलिब्रेशन त्रुटि (ECE) नीचे। सभी पाँच मॉडलों ने दोनों मापदंडों में उतार‑चढ़ाव दिखाया, जबकि परीक्षण स्थितियों में अन्य कोई बदलाव नहीं किया गया। कम ECE स्कोर बेहतर संगति दर्शाते हैं आत्मविश्वास और सटीकता के बीच।

परीक्षण परिणाम दिखाते हैं कि पाँच प्रमुख मॉडल MMLU पर कैसे प्रदर्शन करते हैं जब सिस्टम‑प्रॉम्प्ट की तारीख 2024 के दौरान बदलती रही। सटीकता ऊपर दिखायी गई है, जबकि अपेक्षित कैलिब्रेशन त्रुटि (ECE) नीचे। सभी पाँच मॉडलों ने दोनों मापदंडों में उतार‑चढ़ाव दिखाया, जबकि परीक्षण स्थितियों में अन्य कोई बदलाव नहीं किया गया। कम ECE स्कोर बेहतर संगति दर्शाते हैं आत्मविश्वास और सटीकता के बीच।

लेख में पहले दिखाए गए अन्य परिणामों के साथ, यह LLM बेंचमार्किंग के लिए संभावित रूप से बुरी खबर है, क्योंकि एक मॉडल का स्कोर उस दिन पर निर्भर कर सकता है जिस दिन उसे परीक्षण किया गया, जिससे उसकी लीडरबोर्ड पर स्थिति बदल सकती है, बिना उसकी क्षमताओं में वास्तविक सुधार या गिरावट के।

निष्कर्ष

यह मुद्दा उन निर्धारक कंप्यूटिंग सिस्टमों के बीच विभाजन को उजागर करता है जिनके हम 2023 के आसपास तक उपयोग करते थे, और उन बहुत अलग प्रकृति के डिफ्यूज़न‑आधारित और समान AI सिस्टमों के बीच जो तब से विकसित हुए हैं और विकसित होते रहेंगे।

डेट रेज़ोल्यूशन मूल रूप से हल हो गया था 1 जनवरी 1970, लेकिन जाहिर है कि यह कंप्यूटिंग की दुनिया में कट-ऑफ़ डेट्स के रूप में फिर से प्रकट हो रहा है, अन्य कालिक चिंताएँ के बीच।

 

*शीर्षक ‘मॉडल की डेटिंग: सिस्टम प्रॉम्प्ट में छिपी तिथियाँ LLM मूल्यांकन को प्रभावित करती हैं’

पहली बार प्रकाशित शुक्रवार, 9 अक्टूबर, 2026

मशीन लर्निंग पर लेखक, मानव छवि संश्लेषण में डोमेन विशेषज्ञ। Metaphysic.ai में शोध सामग्री के पूर्व प्रमुख, जब तक यह DNEG की Brahma.ai में विलीन नहीं हो गया।
वेबसाइट: martinanderson.ai
संपर्क: martin@martinanderson.ai