มุมมองของ Anderson
วันที่ลับในพรอมต์ระบบทำลายการประเมินโมเดลภาษา

หากไม่มีความสามารถในการ ประเมินมาตรฐาน Large Language Models (LLMs) ผู้บริโภคและธุรกิจจะยากต่อการเข้าใจว่ารุ่นหนึ่งได้ก้าวหน้ามากแค่ไหนในเวอร์ชันล่าสุด และสามารถเทียบกับคู่แข่งได้อย่างไร:

ลีดเดอร์บอร์ด LLM ที่มีอิทธิพลบน arena.ai. แหล่งที่มา
เนื่องจาก LLMs มีลักษณะไม่กำหนดล่วงหน้า (เช่น พวกมันจะ ไม่ ผลลัพธ์ที่สม่ำเสมอเสมอเมื่อได้รับอินพุตเดียวกัน) การประเมินจึงเป็นเรื่องยาก แม้ว่าเมื่อผู้วิจัยใช้พรอมต์เดียวกัน การตั้งค่าโมเดลและชุดข้อมูลประเมินมาตรฐาน ความแตกต่างเล็กน้อยที่ดูเหมือนจะไม่มีนัยสำคัญในสภาพแวดล้อมการทำงานก็อาจทำให้ได้คำตอบที่แตกต่างและเปลี่ยนคะแนนประสิทธิภาพอย่างมีนัยสำคัญ
ปัจจัยเช่นการกำหนดค่าฮาร์ดแวร์, ความแม่นยำเชิงตัวเลข, ขนาดแบทช์การสรุปผล, และแม้แต่ ลำดับของคำตอบแบบหลายตัวเลือก สามารถมีอิทธิพลต่อผลลัพธ์ สิ่งนี้ทำให้ยากต่อการตรวจสอบว่าการปรับปรุงที่รายงานนั้นสะท้อนความก้าวหน้าที่แท้จริงหรือเป็นเพียงความแปรปรวนกึ่งสุ่มในเงื่อนไขที่โมเดลถูกทดสอบ
ในระดับหนึ่ง เราสามารถคำนึงถึงตัวแปรเหล่านี้บางส่วน หรืออย่างน้อยกำหนดขอบเขตความคลาดเคลื่อนที่พวกมันสร้างขึ้น เพื่อให้การประเมินเปรียบเทียบมีความหมาย การพยายามทำเช่นนี้สำคัญ เนื่องจากเงินจำนวนมากและชื่อเสียงจำนวนมากขึ้นอยู่กับความสามารถในการประเมินมาตรฐานระบบ AI ประเภทนี้ด้วยความแม่นยำระดับหนึ่ง
อย่างไรก็ตาม ตามงานวิจัยใหม่ ตัวแปรหนึ่งที่เฉพาะเจาะจงไม่เพียงทำลายการประเมินมาตรฐานเท่านั้น แต่ยังยากมากต่อการกำจัดออกจากพรอมต์ที่กำหนดมัน – วันที่ปัจจุบัน.
เวลาเปลี่ยนแปลง
บทความ ใหม่* ซึ่งเป็นความร่วมมือทางวิชาการระหว่างเยอรมนี เม็กซิโก และสหรัฐอเมริกา ระบุว่าข้อเท็จจริงที่วันที่ปัจจุบันถูกใส่โดยอัตโนมัติและเป็นความลับในพรอมต์ระบบของโมเดลระดับแนวหน้าทั้งหมดและการใช้งานหลายกรณีของ โมเดลแบบเปิดน้ำหนัก หมายความว่าการทำซ้ำอาจเกือบเป็นไปไม่ได้:
‘เราตรวจพบแหล่งที่มาของความไม่กำหนดล่วงหน้าที่สำคัญและมักถูกมองข้ามในการประเมิน LLM: การแทรกซ่อนของวันที่ปัจจุบันลงในพรอมต์ระบบ’
‘ใน 9 โมเดล, 6 ชุดข้อมูล, และ 4 งาน, ข้อมูลเมตาดาต้าแบบไดนามิกนี้ทำให้ประสิทธิภาพของโมเดลเปลี่ยนแปลงและจัดอันดับลีดเดอร์บอร์ดใหม่, เกินความแปรปรวนที่เกิดจากปัจจัยระดับระบบอื่น ๆ เช่น ขนาดแบทช์หรือความแม่นยำเชิงตัวเลข.’
นักวิจัยยังระบุว่าผลกระทบที่พบมีขนาดใหญ่กว่าในงานที่ต้องการคำตอบที่สร้างขึ้น โดยประสิทธิภาพแปรผันสูงสุดถึง 6% ในคำถามแบบหลายตัวเลือก, 14% ในการให้เหตุผลทางคณิตศาสตร์, และ 7% ในการสร้างโค้ด – และคะแนนการแปลเครื่องก็แปรผันอย่างมีนัยสำคัญเช่นกัน.
การให้ตัวอย่างคำตอบและส่งเสริม การให้เหตุผลแบบขั้นตอนต่อขั้นตอน ไม่ได้แก้ปัญหา – ในความเป็นจริง สิ่งหลังทำให้สถานการณ์ แย่ลง:

ความแปรผันของความแม่นยำในวันที่ต่าง ๆ ในปี 2024 สำหรับ Llama 3.1 (8B) บนการประเมินมาตรฐาน MMLU. การให้เหตุผลแบบขั้นตอนต่อขั้นตอน (สีแดง) ทำให้เกิดความแปรปรวนมากกว่าคำตอบโดยตรง (สีน้ำเงิน) อย่างมีนัยสำคัญ, แสดงให้เห็นว่าการกระตุ้นแบบโซ่ความคิดเพิ่มความอ่อนไหวต่อวันที่ แหล่งที่มา
ผลกระทบนี้ยังถูกพบในโมเดลที่เป็นกรรมสิทธิ์, โดย GPT-5.1 แสดงความแปรผันของความแม่นยำสูงสุดถึง 4% ในสามการประเมินมาตรฐานแบบหลายตัวเลือกระหว่างสัปดาห์การทดสอบในเดือนธันวาคม 2025. นักวิจัยใช้พรอมต์ระบบว่าง, ปิดการให้เหตุผลและตั้งค่า ความสุ่ม เป็นศูนย์ – แต่วันที่ยังคงถูกแทรกโดยอัตโนมัติโดยผู้ให้บริการ:

ความแม่นยำของ GPT-5.1 แปรผันตลอดเจ็ดวันต่อเนื่องในเดือนธันวาคม 2025, แม้ว่าพรอมต์ผู้ใช้และการตั้งค่าโมเดลจะเหมือนกัน. ความแปรปรวนสูงสุดเกิดขึ้นบน GPQA (สีส้ม), โดยเพิ่มขึ้นสี่จุดเปอร์เซ็นต์ระหว่างวันที่ดีที่สุดและแย่ที่สุด. เส้นประแสดงความแม่นยำเฉลี่ยของแต่ละการประเมินมาตรฐานตลอดสัปดาห์.
นักวิจัยแนะนำให้ลบวันที่ออกจากพรอมต์ระบบเมื่อเป็นไปได้, หรือแก้ไขและบันทึกไว้, เพื่อให้การเปรียบเทียบเป็นธรรม อย่างไรก็ตาม, พวกเขาเน้นว่าการมีอิทธิพลที่มุ่งเน้นวันที่อาจฝังลึกยิ่งขึ้น:
‘เหตุผลที่เป็นไปได้หนึ่งสำหรับความอ่อนไหวต่อวันที่คือพรอมต์ระบบอาจถูกตรึงไว้ระหว่างการปรับแต่งโดยผู้ควบคุม (SFT) และการเรียนรู้แบบเสริมจากข้อเสนอแนะของมนุษย์ (RLHF), ทำให้โมเดลเปราะบางต่อการแก้ไขเล็กน้อยใด ๆ’
เพื่อสืบสวนปัญหา นักวิจัยได้ลองเปลี่ยนคำสั่งระบบเป็นหกรูปแบบที่แตกต่างกัน และพบว่าการเปลี่ยนเหล่านี้ส่งผลต่อความแม่นยำเท่ากับการเปลี่ยนวันที่ (0.78%) ดังนั้นวันที่จึงมีอิทธิพลเท่ากับการทำ การออกแบบพรอมต์ อย่างตั้งใจ – ยกเว้นว่ามันเปลี่ยนโดยอัตโนมัติโดยที่ผู้ใช้ไม่รู้ตัว
วิธีอื่น ๆ ถูกลองเพื่อบรรเทาปัญหา ‘วันที่ปัจจุบัน’ รวมถึง การเรียนรู้แบบ few-shot (ที่โมเดลได้รับตัวอย่างคำตอบห้าตัวก่อนตอบ) ซึ่งช่วยได้เล็กน้อย ลดความแปรผันเฉลี่ยจาก 2.52% เหลือ 2.27% แต่ไม่ได้แก้ปัญหา
การเปลี่ยนแปลงในฮาร์ดแวร์ GPU, ขนาด batch, ความแม่นยำเชิงตัวเลข, ลำดับคำตอบและการใช้คำสั่งระบบก็ถูกทดสอบเช่นกัน ผลกระทบที่ใหญ่ที่สุดพบกับลำดับคำตอบและการใช้คำสั่งระบบ ซึ่งใกล้เคียงกับผลของการเปลี่ยนวันที่ที่สุด
วันสุดท้าย
เป็นเรื่องสมเหตุสมผลที่คาดว่า LLM/VLM จะเข้าใจวันที่ตั้งแต่ต้นของการสนทนา; อย่างไรก็ตาม ดูเหมือนจะไม่มีเหตุผลชัดเจนที่จะใส่ไว้ในคำสั่งระบบ ( แนวป้องกัน ที่ไม่มองเห็นซึ่งกำหนดพฤติกรรมของ LLM ในแบบที่ผู้ใช้ไม่สามารถเข้าถึง) เมื่อ LLM สามารถทำการเรียก RAG ขนาดย่อยหลายกิโลไบต์เพื่อดึงวันที่ล่าสุดเป็นขั้นตอนการดูแลรักษาเล็กน้อยก่อนโต้ตอบกับผู้ใช้ได้เป็นประจำ
ไม่มีข้อสงสัยว่ามีวิธีอื่น ๆ ที่อาจแก้ไขเรื่องนี้; อย่างไรก็ตาม เนื่องจากการใส่วันที่ปัจจุบันลงในคำสั่งระบบจนถึงตอนนี้ยังไม่เคยถูกมองว่าเป็นปัญหา จึงอาจมีการสอบสวนน้อยหรือไม่มีเลยในเรื่องนี้
การออกเดทออนไลน์
สำหรับการทดสอบ ใช้พรอมต์เดียวกันสำหรับทุกโมเดล โดยเปลี่ยนเฉพาะวันที่ในคำสั่งระบบเท่านั้น ได้ทดสอบทุกวันของปี 2024 ตั้งแต่ 1 มกราคมจนถึง 31 ธันวาคม โดยตั้งค่าทั้งหมดอื่นให้คงที่
ใช้เกณฑ์การทดสอบหกชุด: MMLU; GPQA; และ ARC-Challenge สำหรับคำถามแบบเลือกตอบ (ให้คะแนนตามความน่าจะเป็นของโทเคนคำตอบ) GSM8K สำหรับคณิตศาสตร์ขั้นตอนต่อขั้น (ตรวจคำตอบสุดท้าย); HumanEval สำหรับการสร้างโค้ด Python (ทดสอบหน่วย); และ WMT สำหรับการแปลอังกฤษ-เยอรมัน; อังกฤษ-ฟินแลนด์; และอังกฤษ-เช็ก (ประเมินผลลัพธ์ทั้งหมด) คำถามที่ขึ้นกับเวลาไม่ได้รวมอยู่
มีการทดสอบโมเดลเก้าแบบ: Llama 3.1 Instruct (8B และ 70B); Gemma 3 Instruct (4B และ 27B); Qwen3 (4B); Qwen3-Next (80B); Phi-4 (14B); และ GPT-OSS (20B และ 120B)
ความแม่นยำ (เปอร์เซ็นต์ของคำถามที่ตอบถูก) ถูกใช้เป็นคะแนนสำหรับการทดสอบแบบเลือกตอบและคณิตศาสตร์ ในขณะที่ Expected Calibration Error (ECE) วัดว่าความมั่นใจของโมเดลสอดคล้องกับประสิทธิภาพจริงแค่ไหน
โค้ดถูกตรวจด้วย pass@1 (เปอร์เซ็นต์ของโซลูชันโค้ดที่ผ่านการทดสอบทั้งหมดในครั้งแรก); การแปลถูกให้คะแนนด้วย BLEU และ chrF
ผลลัพธ์ยืนยันสมมติฐานของนักวิจัย: การเปลี่ยนวันที่ในคำสั่งระบบเพียงอย่างเดียวทำให้ความแม่นยำของโมเดลในการตอบคำถามเดียวกันเปลี่ยนไป

ผลการทดสอบแสดงว่าห้าโมเดลชั้นนำทำงานอย่างไรบน MMLU เมื่อวันที่คำสั่งระบบเปลี่ยนตลอดปี 2024 ความแม่นยำแสดงที่ด้านบน, พร้อมกับค่า Expected Calibration Error (ECE) ด้านล่าง ทั้งห้าโมเดลแสดงการผันผวนในทั้งสองมาตรการ แม้ไม่มีการเปลี่ยนแปลงอื่นใดในเงื่อนไขการทดสอบ ค่า ECE ที่ต่ำกว่าบ่งบอกถึงการสอดคล้องที่ดีกว่าระหว่างความมั่นใจและความแม่นยำ.
พร้อมกับผลลัพธ์อื่น ๆ ที่แสดงในบทความนี้ สิ่งนี้อาจเป็นข่าวร้ายสำหรับการประเมินผล LLM เนื่องจากโมเดลอาจได้คะแนนดีกว่า หรือแย่กว่า ขึ้นอยู่กับวันที่ที่ทดสอบ ซึ่งอาจทำให้ตำแหน่งบนลีดเดอร์บอร์ดเปลี่ยนไป แม้ไม่มีการปรับปรุงหรือการลดทอนความสามารถจริงใด ๆ
สรุป
ประเด็นนี้เน้นความแตกต่างระหว่างระบบคอมพิวเตอร์เชิงกำหนดที่เราเคยคุ้นเคยก่อนประมาณปี 2023 กับธรรมชาติที่แตกต่างอย่างสิ้นเชิงของระบบ AI ที่ใช้การกระจายและระบบคล้ายกันที่ได้พัฒนาและยังคงพัฒนาอยู่ตั้งแต่นั้นมา
การแก้ไขระดับวันที่โดยพื้นฐานแล้วสำเร็จ เมื่อ 1 มกราคม 1970, แต่ดูเหมือนว่าจะกลับมากวนโลกคอมพิวเตอร์ในรูปแบบของ วันที่ตัดขาด, รวมถึง ข้อกังวลด้านเวลา อื่น ๆ
* มีชื่อว่า ‘การจับคู่โมเดล: วันที่ซ่อนอยู่ในพรอมต์ระบบส่งผลต่อการประเมิน LLM’
เผยแพร่ครั้งแรกวันศุกร์ที่ 9 ตุลาคม 2026

![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-400x240.jpg)
![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-80x80.jpg)









