Anderson의 관점

시스템 프롬프트에 숨겨진 날짜가 언어 모델 평가를 저해한다

mm
Unite.AI를 Google의 선호 소스에 추가
Harold Lloyd hangs from a clock face in Safety Last! (1923). The film is in the US public domain.. Source: https://www.youtube.com/watch?v=tzh4htLXp6Q

대형 언어 모델(LLM)을 벤치마크할 수 있는 능력이 없으면, 소비자와 기업이 모델이 최근 버전에서 어떤 진전을 이루었는지, 그리고 경쟁 모델에 비해 어떻게 서 있는지를 이해하기 어렵다:

arena.ai의 영향력 있는 LLM 리더보드. 출처: https://arena.ai/leaderboard/chat/text

arena.ai의 영향력 있는 LLM 리더보드. 출처

LLM은 비결정적이기 때문에(즉, 동일한 입력에 대해 아니라 항상 일관된 출력을 생성하지 않는다), 이를 평가하는 것은 까다롭다. 연구자들이 동일한 프롬프트, 모델 설정 및 벤치마크 데이터셋을 사용하더라도 실행 환경의 사소한 차이가 다른 답변을 만들어내고 성능 점수를 크게 바꿀 수 있다.

하드웨어 구성, 수치 정밀도, 추론 배치 크기, 그리고 심지어 다중 선택 답변의 순서와 같은 요인들이 결과에 영향을 줄 수 있다. 이는 보고된 개선이 실제 진보를 반영하는지, 아니면 모델이 테스트된 조건의 반자동 변동에 불과한지 파악하기 어렵게 만든다.

어느 정도까지는 이러한 변수들을 고려하거나 최소한 그들이 만드는 오차 범위를 파악할 수 있어 비교 평가가 의미 있게 된다. 이는 많은 자금과 명성이 이러한 AI 시스템을 어느 정도 정확도로 벤치마크할 수 있는지에 달려 있기 때문에 시도해 볼 가치가 있다.

하지만 새로운 연구에 따르면, 특정 변수 하나가 벤치마크에 파괴적일 뿐만 아니라 이를 정의하는 프롬프트에서 제거하기도 매우 어려운데—오늘 날짜이다.

시대가 변한다

독일, 멕시코, 미국 간의 학술 협업으로 이루어진 새 논문*에 따르면, 현재 날짜가 모든 최첨단 및 다수의 배포에서 오픈-웨이트 모델의 시스템 프롬프트에 자동으로 비밀스럽게 포함된다는 사실은 재현 가능성을 거의 불가능에 가깝게 만든다:

‘우리는 LLM 평가에서 비결정성의 중요한, 종종 간과되는 원천을 확인했다: 시스템 프롬프트에 현재 날짜가 숨겨진 형태로 삽입되는 것이다.’

‘9개의 모델, 6개의 데이터셋, 4개의 과제에 걸쳐, 이 동적 메타데이터는 모델 성능을 변화시키고 리더보드 순위를 재배열한다. 이는 배치 크기나 수치 정밀도와 같은 다른 시스템 수준 요인보다 더 큰 변동을 초래한다.’

연구자들은 또한 확인된 효과가 생성형 답변이 필요한 작업에서 더 크게 나타난다고 언급했으며, 다중 선택 질문에서는 성능 변동이 최대 6%, 수학적 추론에서는 14%, 코드 생성에서는 7%까지 달라졌으며, 기계 번역 점수도 크게 변동했다.

예시 답변을 제공하고 단계별 추론을 장려해도 문제가 해결되지 않았다—실제로 후자가 더 악화했다.

2024년 서로 다른 날짜에 대한 Llama 3.1 (8B)의 MMLU 벤치마크 정확도 변동. 단계별 추론(빨간색)은 직접 답변(파란색)보다 훨씬 큰 변동성을 나타내며, 체인‑오브‑생각 프롬프트가 날짜에 대한 민감성을 어떻게 증폭시키는지 보여준다. 출처 - https://arxiv.org/pdf/2609.36931

2024년 서로 다른 날짜에 대한 Llama 3.1 (8B)의 MMLU 벤치마크 정확도 변동. 단계별 추론(빨간색)은 직접 답변(파란색)보다 훨씬 큰 변동성을 나타내며, 체인‑오브‑생각 프롬프트가 날짜에 대한 민감성을 어떻게 증폭시키는지 보여준다. 출처

이 효과는 독점 모델에서도 확인되었으며, GPT-5.1은 2025년 12월 일주일 동안 테스트한 세 개의 다중 선택 벤치마크에서 정확도 변동이 최대 4%까지 나타났다. 연구진은 빈 시스템 프롬프트를 사용하고 추론을 비활성화했으며 무작위성을 0으로 설정했지만—날짜는 여전히 제공자에 의해 자동으로 삽입되었다:

GPT-5.1의 정확도는 2025년 12월 연속 7일 동안 동일한 사용자 프롬프트와 모델 설정에도 불구하고 변동했다. 가장 큰 변동은 GPQA(주황색)에서 나타났으며, 최고와 최저 일 사이에 4 퍼센트 포인트 차이가 났다. 점선은 각 벤치마크의 주간 평균 정확도를 나타낸다.

GPT-5.1의 정확도는 2025년 12월 연속 7일 동안 동일한 사용자 프롬프트와 모델 설정에도 불구하고 변동했다. 가장 큰 변동은 GPQA(주황색)에서 나타났으며, 최고와 최저 일 사이에 4 퍼센트 포인트 차이가 났다. 점선은 각 벤치마크의 주간 평균 정확도를 나타낸다.

연구진은 가능한 경우 시스템 프롬프트에서 날짜를 제거하거나 수정·문서화하여 공정한 비교를 보장할 것을 권고한다. 그러나 그들은 날짜 중심의 영향이 더 깊이 내재되어 있을 수 있다고 언급한다:

‘날짜 민감성의 한 가능한 이유는 시스템 프롬프트가 감독 미세조정(SFT) 및 인간 피드백을 통한 강화학습(RLHF) 과정에서 고정될 수 있어, 모델이 약간의 수정에도 취약해질 수 있기 때문이다.’

문제를 조사하기 위해 연구자들은 시스템 프롬프트에 대해 여섯 가지 다른 문구를 시도했으며, 이러한 변화가 정확도에 미치는 영향이 날짜를 바꾸는 것(0.78%)과 거의 동일함을 발견했습니다. 따라서 날짜는 의도적인 프롬프트 엔지니어링만큼 영향을 미치는 것으로 보이지만, 사용자가 알지도 못한 채 자동으로 변경됩니다.

‘현재 날짜’ 문제를 완화하기 위해 다른 접근법도 시도했는데, 그 중 few-shot learning(모델이 응답하기 전에 다섯 개의 예시 답변을 제공받는 방식)이 조금 도움이 되어 평균 변동폭을 2.52%에서 2.27%로 낮췄지만 문제를 완전히 해결하지는 못했습니다.

GPU 하드웨어, 배치 크기, 수치 정밀도, 답변 순서 및 시스템 프롬프트 문구의 변화도 테스트되었습니다. 가장 큰 효과는 답변 순서와 프롬프트 문구에서 나타났으며, 이는 날짜를 바꾸는 영향에 가장 근접했습니다.

마지막 날들

LLM/VLM이 채팅 초기에 날짜를 이해하는 것이 합리적이지만, 시스템 프롬프트에(사용자가 접근할 수 없는 방식으로 LLM의 행동을 제한하는 guardrails를 부과하는 보이지 않는 기준) 날짜를 명시적으로 포함시킬 명확한 이유는 없어 보입니다. LLM이 최신 날짜를 가져오기 위해 서브‑KB RAG 호출을 수행하고, 사용자와의 상호작용 전에 간단한 정리 작업으로 처리할 수 있기 때문입니다.

다른 해결 방안도 분명 존재할 것입니다. 그러나 현재 날짜를 시스템 프롬프트에 삽입하는 것이 문제로 인식되지 않았기 때문에, 이에 대한 조사도 거의 이루어지지 않았을 가능성이 높습니다.

온라인 데이팅

테스트에서는 모든 모델에 동일한 프롬프트를 사용했으며, 시스템 프롬프트의 날짜만을 변경했습니다. 2024년 1월 1일부터 12월 31일까지 매일을 테스트했으며, 다른 모든 설정은 동일하게 유지되었습니다.

여섯 가지 벤치마크가 사용되었습니다: MMLU; GPQA; 그리고 ARC-Challenge는 객관식 질문(답변 토큰 확률로 채점)용입니다. GSM8K는 단계별 수학(최종 답변 검증)용; HumanEval은 파이썬 코드 생성(단위 테스트)용; 그리고 WMT는 영어‑독일어, 영어‑핀란드어, 영어‑체코어 번역(전체 출력 평가)용입니다. 시간에 의존하는 질문은 제외되었습니다.

아홉 개의 모델이 테스트되었습니다: Llama 3.1 Instruct (8B 및 70B); Gemma 3 Instruct (4B 및 27B); Qwen3 (4B); Qwen3-Next (80B); Phi-4 (14B); 그리고 GPT-OSS (20B 및 120B).

정확도(정답으로 답한 질문의 비율)는 객관식 및 수학 테스트의 점수로 사용되었으며, 예상 보정 오류(ECE)는 모델의 신뢰도가 실제 성능과 얼마나 일치하는지를 측정했습니다.

코드는 pass@1(첫 시도에서 모든 테스트를 통과한 생성 코드 비율)로 검증했으며, 번역은 BLEU와 chrF로 평가했습니다.

결과는 연구자들의 가설을 확인했습니다: 시스템 프롬프트의 날짜만 바꾸어도 모델이 동일한 질문에 답하는 정확도가 변한다는 것이었습니다.

2024년 내내 시스템 프롬프트 날짜가 변경됨에 따라 다섯 주요 모델이 MMLU에서 어떻게 수행했는지를 보여주는 테스트 결과. 정확도는 상단에, 예상 보정 오류(ECE)는 하단에 표시됩니다. 다른 테스트 조건은 전혀 변경되지 않았음에도 불구하고, 다섯 모델 모두 두 지표에서 변동을 보였습니다. 낮은 ECE 점수는 신뢰도와 정확도 사이의 정렬이 더 잘 이루어졌음을 의미합니다.

2024년 내내 시스템 프롬프트 날짜가 변경됨에 따라 다섯 주요 모델이 MMLU에서 어떻게 수행했는지를 보여주는 테스트 결과. 정확도는 상단에, 예상 보정 오류(ECE)는 하단에 표시됩니다. 다른 테스트 조건은 전혀 변경되지 않았음에도 불구하고, 다섯 모델 모두 두 지표에서 변동을 보였습니다. 낮은 ECE 점수는 신뢰도와 정확도 사이의 정렬이 더 잘 이루어졌음을 의미합니다.

앞서 기사에서 제시된 다른 결과와 함께, 이는 LLM 벤치마킹에 잠재적으로 부정적인 영향을 미칠 수 있습니다. 모델이 테스트된 날짜에 따라 점수가 높아지거나 낮아질 수 있어, 실제 능력의 향상이나 감소 없이도 순위표에서 위치가 변동될 수 있기 때문입니다.

결론

이 문제는 2023년 이전에 우리가 익숙해졌던 결정론적 컴퓨팅 시스템과, 그 이후 진화하고 계속 진화하고 있는 확산 기반 및 유사 AI 시스템의 매우 다른 특성 사이의 격차를 강조합니다.

날짜 해상도는 1970년 1월 1일에 본질적으로 해결되었지만, 현재는 컷오프 날짜와 같은 시간적 문제 형태로 컴퓨팅 세계를 괴롭히고 있는 것으로 보입니다.

 

‘모델에 날짜 지정: 시스템 프롬프트에 숨겨진 날짜가 LLM 평가에 미치는 영향’

2026년 10월 9일 금요일 최초 게시

머신러닝 분야 작가이자 인간 이미지 합성 도메인 전문가. Metaphysic.ai에서 연구 콘텐츠 책임자를 역임했으며, DNEG의 Brahma.ai로 통합될 때까지 근무했습니다.
웹사이트: martinanderson.ai
연락처: martin@martinanderson.ai