Anderson का एंगल
सिस्टम प्रॉम्प्ट्स में गुप्त तिथियाँ भाषा मॉडल मूल्यांकन को कमजोर करती हैं

बिना बेंचमार्क करने की क्षमता के, उपभोक्ताओं और व्यवसायों के लिए यह समझना कठिन हो जाता है कि किसी मॉडल ने हालिया संस्करणों में क्या प्रगति की है, और वह अपने प्रतिस्पर्धियों के मुकाबले कैसे खड़ा है:

arena.ai पर प्रभावशाली LLM लीडरबोर्ड। स्रोत
चूंकि LLMs गैर-निर्धारित (अर्थात्, वे समान इनपुट देने पर हमेशा सुसंगत आउटपुट नहीं उत्पन्न करेंगे), उनका मूल्यांकन जटिल है। यहां तक कि जब शोधकर्ता समान प्रॉम्प्ट, मॉडल सेटिंग्स और बेंचमार्क डेटासेट का उपयोग करते हैं, तो निष्पादन पर्यावरण में मामूली अंतर भी अलग-अलग उत्तर उत्पन्न कर सकते हैं और प्रदर्शन स्कोर को काफी बदल सकते हैं।
हार्डवेयर कॉन्फ़िगरेशन, संख्यात्मक सटीकता, इन्फ़रेंस बैच आकार, और यहाँ तक कि बहुविकल्पीय उत्तरों का क्रम जैसे कारक परिणामों को प्रभावित कर सकते हैं। इससे यह समझना कठिन हो जाता है कि रिपोर्ट किया गया सुधार वास्तविक प्रगति को दर्शाता है या केवल मॉडल के परीक्षण की परिस्थितियों में कुछ अर्द्ध-यादृच्छिक परिवर्तन है।
एक हद तक, इन चर में से कुछ को ध्यान में रखा जा सकता है, या कम से कम यह निर्धारित किया जा सकता है कि वे कौन सी त्रुटि सीमा उत्पन्न करते हैं, ताकि तुलनात्मक मूल्यांकन सार्थक बन सके। यह प्रयास करना महत्वपूर्ण है, क्योंकि बड़ी मात्रा में पैसा और प्रतिष्ठा इस बात पर निर्भर करती है कि इस प्रकार की AI प्रणालियों का बेंचमार्क कुछ हद तक सटीकता के साथ किया जा सके।
हालांकि, नई शोध के अनुसार, एक विशेष चर न केवल बेंचमार्क को विनाशकारी बना सकता है, बल्कि इसे परिभाषित करने वाले प्रॉम्प्ट से हटाना भी बहुत कठिन है – आज की तिथि।
समय बदलते हैं
नया पेपर*, जर्मनी, मेक्सिको और USA के बीच एक शैक्षणिक सहयोग, यह दावा करता है कि वर्तमान तिथि को सभी अग्रणी और कई तैनाती वाले ओपन-वेट मॉडल के सिस्टम प्रॉम्प्ट में स्वचालित और गुप्त रूप से शामिल किया जाता है, जिससे पुनरुत्पादन लगभग असंभव हो सकता है:
‘हम LLM मूल्यांकन में गैर-निर्धारितता का एक महत्वपूर्ण, अक्सर अनदेखा स्रोत पहचानते हैं: सिस्टम प्रॉम्प्ट में वर्तमान तिथि का गुप्त इंजेक्शन।’
‘9 मॉडलों, 6 डेटासेट्स और चार कार्यों में, यह गतिशील मेटाडेटा मॉडल प्रदर्शन को बदलता है और लीडरबोर्ड रैंकिंग को पुनः व्यवस्थित करता है, बैच आकार या संख्यात्मक सटीकता जैसे अन्य सिस्टम-स्तरीय कारकों द्वारा प्रस्तुत परिवर्तन से अधिक।’
शोधकर्ता यह भी नोट करते हैं कि पहचाना गया प्रभाव उन कार्यों में अधिक है जिनमें उत्तर उत्पन्न करने की आवश्यकता होती है, जहाँ प्रदर्शन बहुविकल्पीय प्रश्नों में 6% तक, गणितीय तर्क में 14% तक, और कोड जनरेशन में 7% तक बदलता है – और मशीन अनुवाद स्कोर भी उल्लेखनीय रूप से बदलते हैं।
उदाहरण उत्तर प्रदान करने और क्रमिक तर्क को प्रोत्साहित करने से समस्या हल नहीं हुई – वास्तव में, बाद वाला इसे बुरा बना दिया:

2024 में विभिन्न तिथियों पर Llama 3.1 (8B) के MMLU बेंचमार्क पर सटीकता में उतार-चढ़ाव। क्रमिक तर्क (लाल) सीधे उत्तरों (नीला) की तुलना में काफी अधिक परिवर्तनशीलता उत्पन्न करता है, यह दर्शाते हुए कि चेन-ऑफ़-थॉट प्रॉम्प्टिंग तिथि के प्रति संवेदनशीलता को कैसे बढ़ाता है। स्रोत
यह प्रभाव स्वामित्व मॉडल में भी पहचाना गया, जहाँ GPT-5.1 ने दिसंबर 2025 के एक सप्ताह के परीक्षण के दौरान तीन बहुविकल्पीय बेंचमार्क पर 4% तक की सटीकता उतार-चढ़ाव दिखाया। शोधकर्ताओं ने एक खाली सिस्टम प्रॉम्प्ट का उपयोग किया, तर्क को अक्षम किया और यादृच्छिकता को शून्य पर सेट किया – लेकिन तिथि अभी भी प्रदाता द्वारा स्वचालित रूप से डाली गई:

GPT-5.1 की सटीकता दिसंबर 2025 में सात लगातार दिनों में उतरी-चढ़ी, जबकि उपयोगकर्ता प्रॉम्प्ट और मॉडल सेटिंग्स समान थीं। सबसे बड़ा अंतर GPQA (नारंगी) पर हुआ, जहाँ सर्वोत्तम और सबसे खराब दिनों के बीच चार प्रतिशत अंक का अंतर था। डैश्ड लाइन प्रत्येक बेंचमार्क की सप्ताह भर की औसत सटीकता को दर्शाती है।
शोधकर्ता सुझाव देते हैं कि जहाँ संभव हो, सिस्टम प्रॉम्प्ट से तिथि को हटाया जाए, या उसे ठीक करके दस्तावेज़ किया जाए, ताकि निष्पक्ष तुलना सुनिश्चित हो सके। हालांकि, वे नोट करते हैं कि तिथि-केन्द्रित प्रभाव अधिक गहराई से अंतर्निहित हो सकता है:
‘तिथि संवेदनशीलता का एक संभावित कारण यह है कि सिस्टम प्रॉम्प्ट सुपरवाइज़्ड फाइन-ट्यूनिंग (SFT) और मानव फीडबैक से रिइनफ़ोर्समेंट लर्निंग (RLHF) के दौरान स्थिर हो सकता है, जिससे मॉडल किसी भी हल्के परिवर्तन के प्रति नाज़ुक हो जाता है।’
समस्या की जांच के लिए, शोधकर्ताओं ने सिस्टम प्रॉम्प्ट के लिए छह अलग-अलग शब्दांकन आज़माए, और पाया कि ये परिवर्तन सटीकता को उसी मात्रा में प्रभावित करते हैं जितना तारीख बदलने से (0.78%)। इसलिए तारीख का प्रभाव जानबूझकर किए गए प्रॉम्प्ट इंजीनियरिंग जितना ही है – बस यह स्वतः बदल जाता है, उपयोगकर्ता को भी पता नहीं चलता।
अन्य तरीकों को आज़माया गया ‘वर्तमान तारीख’ समस्या को कम करने के लिए, जिसमें फ्यू-शॉट लर्निंग (जहाँ मॉडल को उत्तर देने से पहले पाँच उदाहरण उत्तर मिले) शामिल था। इससे थोड़ा सुधार हुआ, औसत परिवर्तन 2.52% से घटकर 2.27% हो गया, लेकिन समस्या हल नहीं हुई।
GPU हार्डवेयर, बैच आकार, संख्यात्मक सटीकता, उत्तर क्रम और सिस्टम‑प्रॉम्प्ट शब्दांकन में भी बदलाव किए गए। सबसे बड़े प्रभाव उत्तर‑क्रम और प्रॉम्प्ट शब्दांकन में देखे गए, जो तारीख बदलने के प्रभाव के सबसे करीब थे।
अंतिम दिन
यह उचित है कि एक LLM/VLM चैट की शुरुआत से ही तारीख समझ ले; हालांकि, सिस्टम प्रॉम्प्ट में इसे स्पष्ट रूप से शामिल करने (अदृश्य नियम जो गार्डरेल्स लागू करता है, और उपयोगकर्ता के पहुँच से बाहर तरीकों से LLM के व्यवहार को निर्धारित करता है) का कोई स्पष्ट कारण नहीं दिखता, जबकि LLM नियमित रूप से एक सब‑KB RAG कॉल करके नवीनतम तारीख को प्राप्त कर सकता है, जो उपयोगकर्ता के साथ संवाद शुरू करने से पहले एक छोटा रख‑रखाव कार्य है।
निस्संदेह अन्य संभावनाएँ मौजूद हैं इस मुद्दे को सुलझाने की; हालांकि, चूँकि सिस्टम प्रॉम्प्ट में वर्तमान तारीख को सम्मिलित करने को अब तक समस्या के रूप में नहीं देखा गया, इसलिए संभवतः इस संबंध में बहुत कम या कोई जांच नहीं की गई है।
ऑनलाइन डेटिंग
परीक्षणों के लिए, प्रत्येक मॉडल के लिए समान प्रॉम्प्ट उपयोग किए गए, केवल सिस्टम प्रॉम्प्ट में तारीख बदली गई। 2024 के हर दिन का परीक्षण किया गया, 1 जनवरी से लेकर 31 दिसंबर तक, जबकि सभी अन्य सेटिंग्स समान रखी गईं।
छह बेंचमार्क उपयोग किए गए: MMLU; GPQA; और ARC-Challenge, बहुविकल्पीय प्रश्नों के लिए (उत्तर‑टोकन संभाव्यता द्वारा स्कोर किया गया)। GSM8K चरण‑दर‑चरण गणित के लिए (अंतिम उत्तर जाँच किया गया); HumanEval पायथन कोड जनरेशन के लिए (यूनिट‑टेस्ट किया गया); और WMT अंग्रेजी‑से‑जर्मन; अंग्रेजी‑से‑फ़िनिश; और अंग्रेजी‑से‑चेक अनुवाद के लिए (पूरे आउटपुट का मूल्यांकन किया गया)। समय‑निर्भर प्रश्नों को बाहर रखा गया।
नौ मॉडल परीक्षण किए गए: Llama 3.1 Instruct (8B और 70B); Gemma 3 Instruct (4B और 27B); Qwen3 (4B); Qwen3-Next (80B); Phi-4 (14B); और GPT-OSS (20B और 120B)।
सटीकता (सही उत्तरों का प्रतिशत) का उपयोग बहुविकल्पीय और गणितीय परीक्षणों को स्कोर करने के लिए किया गया, जबकि अपेक्षित कैलिब्रेशन त्रुटि (ECE) ने मापा कि मॉडल की आत्मविश्वास वास्तविक प्रदर्शन से कितनी मेल खाती है।
कोड को pass@1 (पहले प्रयास में सभी परीक्षण पास करने वाले उत्पन्न कोड समाधान का प्रतिशत) से जाँचा गया; अनुवादों को BLEU और chrF से स्कोर किया गया।
परिणामों ने शोधकर्ताओं की परिकल्पना की पुष्टि की: केवल सिस्टम प्रॉम्प्ट में तारीख बदलने से मॉडल उसी प्रश्नों के उत्तर देने की सटीकता बदल गई।

परीक्षण परिणाम दिखाते हैं कि पाँच प्रमुख मॉडल MMLU पर कैसे प्रदर्शन करते हैं जब सिस्टम‑प्रॉम्प्ट की तारीख 2024 के दौरान बदलती रही। सटीकता ऊपर दिखायी गई है, जबकि अपेक्षित कैलिब्रेशन त्रुटि (ECE) नीचे। सभी पाँच मॉडलों ने दोनों मापदंडों में उतार‑चढ़ाव दिखाया, जबकि परीक्षण स्थितियों में अन्य कोई बदलाव नहीं किया गया। कम ECE स्कोर बेहतर संगति दर्शाते हैं आत्मविश्वास और सटीकता के बीच।
लेख में पहले दिखाए गए अन्य परिणामों के साथ, यह LLM बेंचमार्किंग के लिए संभावित रूप से बुरी खबर है, क्योंकि एक मॉडल का स्कोर उस दिन पर निर्भर कर सकता है जिस दिन उसे परीक्षण किया गया, जिससे उसकी लीडरबोर्ड पर स्थिति बदल सकती है, बिना उसकी क्षमताओं में वास्तविक सुधार या गिरावट के।
निष्कर्ष
यह मुद्दा उन निर्धारक कंप्यूटिंग सिस्टमों के बीच विभाजन को उजागर करता है जिनके हम 2023 के आसपास तक उपयोग करते थे, और उन बहुत अलग प्रकृति के डिफ्यूज़न‑आधारित और समान AI सिस्टमों के बीच जो तब से विकसित हुए हैं और विकसित होते रहेंगे।
डेट रेज़ोल्यूशन मूल रूप से हल हो गया था 1 जनवरी 1970, लेकिन जाहिर है कि यह कंप्यूटिंग की दुनिया में कट-ऑफ़ डेट्स के रूप में फिर से प्रकट हो रहा है, अन्य कालिक चिंताएँ के बीच।
*शीर्षक ‘मॉडल की डेटिंग: सिस्टम प्रॉम्प्ट में छिपी तिथियाँ LLM मूल्यांकन को प्रभावित करती हैं’
पहली बार प्रकाशित शुक्रवार, 9 अक्टूबर, 2026

![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-400x240.jpg)
![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-80x80.jpg)









