Góc nhìn Anderson
Ngày Ẩn trong Lời Nhắc Hệ Thống Làm Suy Yếu Đánh Giá Mô Hình Ngôn Ngữ

Nếu không có khả năng đánh giá chuẩn các Mô Hình Ngôn Ngữ Lớn (LLM), người tiêu dùng và doanh nghiệp sẽ khó hiểu được mô hình đã tiến bộ như thế nào qua các phiên bản gần đây, và nó so sánh ra sao với các đối thủ cạnh tranh:

Bảng xếp hạng LLM có ảnh hưởng tại arena.ai. Nguồn
Vì các LLM là phi quyết định (tức là chúng sẽ không luôn tạo ra kết quả nhất quán cho cùng một đầu vào), việc đánh giá chúng rất khó khăn. Ngay cả khi các nhà nghiên cứu sử dụng các lời nhắc giống hệt, cài đặt mô hình và bộ dữ liệu đánh giá chuẩn, những khác biệt nhỏ dường như trong môi trường thực thi có thể tạo ra các câu trả lời khác nhau và làm thay đổi đáng kể điểm hiệu năng.
Các yếu tố như cấu hình phần cứng, độ chính xác số, kích thước batch suy luận, và thậm chí thứ tự của các đáp án trắc nghiệm có thể ảnh hưởng đến kết quả. Điều này khiến việc xác định liệu một cải tiến được báo cáo có phản ánh tiến bộ thực sự hay chỉ là sự biến đổi bán ngẫu nhiên trong các điều kiện thử nghiệm của mô hình trở nên khó khăn.
Ở một mức độ nào đó, người ta có thể tính đến một số biến số này, hoặc ít nhất xác định mức sai số mà chúng tạo ra, để việc đánh giá so sánh trở nên có ý nghĩa. Việc này quan trọng để thử, vì rất nhiều tiền và danh tiếng phụ thuộc vào khả năng đánh giá chuẩn các hệ thống AI loại này với một mức độ chính xác nhất định.
Tuy nhiên, theo nghiên cứu mới, một biến số cụ thể không chỉ phá hủy các tiêu chuẩn đánh giá mà còn rất khó loại bỏ khỏi các lời nhắc định nghĩa chúng – ngày hiện tại.
Thời Gian Thay Đổi
Bài báo mới*, một sự hợp tác học thuật giữa Đức, Mexico và Hoa Kỳ, khẳng định rằng thực tế ngày hiện tại được tự động và bí mật đưa vào lời nhắc hệ thống của tất cả các mô hình tiên tiến và nhiều triển khai của mô hình mở trọng lượng đồng nghĩa với việc khả năng tái tạo có thể gần như không thể:
‘Chúng tôi xác định một nguồn phi quyết định quan trọng, thường bị bỏ qua trong đánh giá LLM: việc tiêm ẩn ngày hiện tại vào lời nhắc hệ thống.’
‘Trong số 9 mô hình, 6 bộ dữ liệu và bốn nhiệm vụ, siêu dữ liệu động này làm thay đổi hiệu năng mô hình và thay đổi thứ hạng bảng xếp hạng, vượt qua độ biến thiên do các yếu tố cấp hệ thống khác như kích thước batch hoặc độ chính xác số gây ra.’
Các nhà nghiên cứu cũng lưu ý rằng hiệu ứng được xác định lớn hơn đối với các nhiệm vụ yêu cầu câu trả lời sinh ra, với hiệu năng thay đổi tới 6% trên các câu hỏi trắc nghiệm, 14% trên suy luận toán học, và 7% trên việc tạo mã – và điểm dịch máy cũng biến động đáng kể.
Cung cấp các câu trả lời mẫu và khuyến khích lập luận từng bước không giải quyết được vấn đề – thực tế, cách sau lại làm cho nó tệ hơn:

Biến động độ chính xác qua các ngày khác nhau trong năm 2024 cho Llama 3.1 (8B) trên tiêu chuẩn MMLU. Lập luận từng bước (đỏ) tạo ra sự biến đổi đáng kể hơn so với câu trả lời trực tiếp (xanh), chứng minh cách gợi ý chuỗi suy nghĩ làm tăng độ nhạy cảm với ngày. Nguồn
Hiệu ứng này cũng được phát hiện trong các mô hình độc quyền, với GPT-5.1 cho thấy biến động độ chính xác lên tới 4% trên ba tiêu chuẩn trắc nghiệm trong một tuần thử nghiệm vào tháng 12 năm 2025. Các nhà nghiên cứu đã sử dụng lời nhắc hệ thống trống, tắt lập luận và đặt độ ngẫu nhiên về không – nhưng ngày vẫn được nhà cung cấp tự động chèn vào:

Độ chính xác của GPT-5.1 dao động trong bảy ngày liên tiếp vào tháng 12 năm 2025, mặc dù các lời nhắc người dùng và cài đặt mô hình giống hệt nhau. Sự biến đổi lớn nhất xảy ra trên GPQA (cam), đạt chênh lệch bốn điểm phần trăm giữa ngày tốt nhất và ngày tệ nhất. Đường nét đứt đại diện cho độ chính xác trung bình của mỗi tiêu chuẩn trong suốt tuần.
Các nhà nghiên cứu đề xuất loại bỏ ngày khỏi lời nhắc hệ thống khi có thể, hoặc sửa chữa và ghi chép lại, để đảm bảo các so sánh công bằng. Tuy nhiên, họ lưu ý rằng ảnh hưởng tập trung vào ngày có thể đã ăn sâu hơn:
‘Một lý do có thể cho độ nhạy cảm với ngày là lời nhắc hệ thống có thể đã được cố định trong quá trình tinh chỉnh có giám sát (SFT) và học tăng cường từ phản hồi của con người (RLHF), khiến mô hình trở nên dễ gãy khi có bất kỳ sự thay đổi nhẹ nào.’
Để điều tra vấn đề, các nhà nghiên cứu đã thử sáu cách diễn đạt khác nhau cho lời nhắc hệ thống, và nhận thấy rằng những thay đổi này ảnh hưởng đến độ chính xác cũng nhiều như việc thay đổi ngày (0,78%). Do đó ngày tháng dường như có ảnh hưởng tương đương với việc thực hiện kỹ thuật lời nhắc có chủ đích – ngoại trừ việc nó thay đổi tự động, mà người dùng không hề biết.
Các phương pháp khác đã được thử để giảm thiểu vấn đề ‘ngày hiện tại’, bao gồm học ít-shot (mô hình nhận năm câu trả lời mẫu trước khi phản hồi). Điều này giúp một chút, giảm biến động trung bình từ 2,52% xuống 2,27%, nhưng không khắc phục được vấn đề.
Các thay đổi về phần cứng GPU, kích thước batch, độ chính xác số học, thứ tự câu trả lời và cách diễn đạt lời nhắc hệ thống cũng đã được thử. Ảnh hưởng lớn nhất được thấy ở thứ tự câu trả lời và cách diễn đạt lời nhắc, gần nhất với tác động của việc thay đổi ngày.
Những Ngày Cuối
Có lý do để mong đợi một LLM/VLM sẽ hiểu ngày ngay từ đầu của cuộc trò chuyện; tuy nhiên, dường như không có lý do rõ ràng để đưa nó vào lời nhắc hệ thống (tiêu chuẩn ẩn mà áp đặt rào chắn, và điều kiện hành vi của LLM theo cách người dùng không thể truy cập) khi LLM có thể thường xuyên thực hiện một cuộc gọi RAG dưới 1KB để nạp ngày mới nhất, như một quy trình bảo trì nhỏ trước khi tương tác với người dùng.
Không nghi ngờ rằng còn những khả năng khác để giải quyết vấn đề; tuy nhiên, vì việc đưa ngày hiện tại vào lời nhắc hệ thống chưa từng được xem là vấn đề, nên có lẽ đã có rất ít hoặc không có nghiên cứu nào liên quan đến điều này.
Hẹn Hò Trực Tuyến
Trong các thử nghiệm, các lời nhắc giống hệt nhau đã được sử dụng cho mọi mô hình, chỉ có ngày trong lời nhắc hệ thống được thay đổi. Mỗi ngày của năm 2024 đã được kiểm tra, từ ngày 1 tháng 1 đến ngày 31 tháng 12, với mọi cài đặt khác giữ nguyên.
Sáu bộ tiêu chuẩn đã được sử dụng: MMLU; GPQA; và ARC-Challenge, cho các câu hỏi trắc nghiệm (được chấm dựa trên xác suất token câu trả lời). GSM8K cho toán học từng bước (kiểm tra đáp án cuối cùng); HumanEval cho việc tạo mã Python (được kiểm thử đơn vị); và WMT cho dịch tiếng Anh‑Đức; tiếng Anh‑Phần Lan; và tiếng Anh‑Séc (đầu ra đầy đủ được đánh giá). Các câu hỏi phụ thuộc thời gian đã bị loại bỏ.
Nine models were tested: Llama 3.1 Instruct (8B và 70B); Gemma 3 Instruct (4B và 27B); Qwen3 (4B); Qwen3-Next (80B); Phi-4 (14B); và GPT-OSS (20B và 120B).
Độ chính xác (tỷ lệ phần trăm câu hỏi trả lời đúng) được dùng để chấm điểm các bài trắc nghiệm và toán học, trong khi Lỗi Độ Hiệu Chỉnh Dự Kiến (ECE) đo mức độ mà độ tin cậy của mô hình phù hợp với hiệu suất thực tế.
Mã đã được kiểm tra bằng pass@1 (tỷ lệ phần trăm các giải pháp mã tạo ra vượt qua tất cả các bài kiểm tra ngay lần đầu); các bản dịch được chấm bằng BLEU và chrF.
Kết quả xác nhận giả thuyết của các nhà nghiên cứu: chỉ đơn giản thay đổi ngày trong lời nhắc hệ thống đã thay đổi độ chính xác mà các mô hình trả lời cùng một câu hỏi.

Kết quả thử nghiệm cho thấy năm mô hình hàng đầu hoạt động như thế nào trên MMLU khi ngày lời nhắc hệ thống được thay đổi trong suốt năm 2024. Độ chính xác được hiển thị ở trên cùng, với lỗi độ hiệu chỉnh dự kiến (ECE) ở dưới. Tất cả năm mô hình đều có sự dao động ở cả hai chỉ số, mặc dù không có thay đổi nào khác trong điều kiện thử nghiệm. Điểm ECE thấp hơn cho thấy sự đồng nhất tốt hơn giữa độ tin cậy và độ chính xác.
Cùng với các kết quả khác đã được trình bày trước đó trong bài, đây có thể là tin xấu cho việc đánh giá LLM, vì một mô hình có thể đạt điểm cao hơn hoặc thấp hơn tùy vào ngày nó được thử, có thể làm thay đổi vị trí của nó trên bảng xếp hạng, mà không có bất kỳ cải thiện hay suy giảm thực tế nào trong khả năng.
Kết luận
Vấn đề này làm nổi bật sự chia rẽ giữa các hệ thống tính toán quyết định mà chúng ta đã quen thuộc trước khoảng năm 2023, và bản chất rất khác của các hệ thống AI dựa trên khuếch tán và tương tự đã phát triển, và tiếp tục phát triển, kể từ đó.
Độ phân giải ngày đã về cơ bản được giải quyết vào ngày 1 tháng 1 năm 1970, nhưng dường như đã trở lại ám ảnh thế giới tính toán dưới dạng ngày cắt, cùng với các vấn đề thời gian khác.
* Tiêu đề ‘Đánh Dấu Mô Hình: Ngày Ẩn trong Lời Nhắc Hệ Thống Ảnh Hưởng Đánh Giá LLM’
Được xuất bản lần đầu vào thứ Sáu, ngày 9 tháng 10 năm 2026

![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-400x240.jpg)
![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-80x80.jpg)









