Ângulo de Anderson

Datas secretas em prompts de sistema comprometem a avaliação de modelos de linguagem

mm
Adicione Unite.AI às suas fontes preferidas no Google
Harold Lloyd hangs from a clock face in Safety Last! (1923). The film is in the US public domain.. Source: https://www.youtube.com/watch?v=tzh4htLXp6Q

Sem a capacidade de benchmark Grandes Modelos de Linguagem (LLMs), é difícil para consumidores e empresas entenderem que progresso um modelo fez nas versões recentes e como ele se compara aos concorrentes:

O influente ranking de LLMs no arena.ai. Fonte: https://arena.ai/leaderboard/chat/text

O influente ranking de LLMs no arena.ai. Fonte

Como os LLMs são não‑determinísticos (ou seja, eles não produzirão sempre saídas consistentes dadas as mesmas entradas), avaliá‑los é complicado. Mesmo quando os pesquisadores usam prompts idênticos, configurações de modelo e conjuntos de dados de benchmark, diferenças aparentemente menores no ambiente de execução podem gerar respostas diferentes e alterar significativamente as pontuações de desempenho.

Fatores como configuração de hardware, precisão numérica, tamanho de lote de inferência, e até a ordem das respostas de múltipla escolha podem influenciar os resultados. Isso pode dificultar a percepção de se uma melhoria reportada reflete progresso genuíno ou apenas alguma variação semirandomizada nas condições em que o modelo foi testado.

Até certo ponto, pode‑se levar em conta algumas dessas variáveis, ou ao menos determinar qual margem de erro elas geram, para que a avaliação comparativa se torne significativa. É importante tentar, pois muito dinheiro e muita reputação dependem da capacidade de fazer benchmark de sistemas de IA desse tipo com certo grau de precisão.

No entanto, de acordo com novas pesquisas, uma variável específica pode não apenas ser destrutiva para benchmarks, mas também é muito difícil de eliminar dos prompts que os definem – data de hoje.

Os tempos mudam

O novo artigo*, uma colaboração acadêmica entre Alemanha, México e EUA, afirma que o fato de a data atual ser incluída automática e secretamente no prompt de sistema de todas as fronteiras e muitas implantações de modelos de peso aberto significa que a reprodutibilidade pode ser quase impossível:

‘Identificamos uma fonte crítica, frequentemente negligenciada, de não‑determinismo na avaliação de LLMs: a inserção oculta da data atual nos prompts de sistema.’

‘Em 9 modelos, 6 conjuntos de dados e quatro tarefas, esses metadados dinâmicos alteram o desempenho do modelo e reorganizam as classificações do ranking, superando a variância introduzida por outros fatores de nível de sistema, como tamanho de lote ou precisão numérica.’

Os pesquisadores também observam que o efeito identificado é maior para tarefas que exigem respostas geradas, com desempenho variando até 6 % em questões de múltipla escolha, 14 % em raciocínio matemático e 7 % em geração de código – e com pontuações de tradução automática também variando significativamente.

Fornecer respostas de exemplo e incentivar raciocínio passo a passo não resolveu o problema – na verdade, este último o tornou pior:

Flutuações de precisão em diferentes datas em 2024 para Llama 3.1 (8B) no benchmark MMLU. Raciocínio passo a passo (vermelho) produz variabilidade substancialmente maior que respostas diretas (azul), demonstrando como o prompting de cadeia de pensamento amplifica a sensibilidade à data. Fonte - https://arxiv.org/pdf/2609.36931

Flutuações de precisão em diferentes datas em 2024 para Llama 3.1 (8B) no benchmark MMLU. Raciocínio passo a passo (vermelho) produz variabilidade substancialmente maior que respostas diretas (azul), demonstrando como o prompting de cadeia de pensamento amplifica a sensibilidade à data. Fonte

O efeito também foi identificado em modelos proprietários, com GPT-5.1 apresentando flutuações de precisão de até 4 % em três benchmarks de múltipla escolha durante uma semana de testes em dezembro de 2025. Os pesquisadores usaram um prompt de sistema vazio, desativaram o raciocínio e definiram aleatoriedade como zero – mas a data ainda foi inserida automaticamente pelo provedor:

A precisão do GPT-5.1 flutuou ao longo de sete dias consecutivos em dezembro de 2025, apesar de prompts de usuário idênticos e configurações de modelo. A maior variação ocorreu no GPQA (laranja), alcançando quatro pontos percentuais entre os melhores e piores dias. A linha tracejada representa a precisão média de cada benchmark ao longo da semana.

A precisão do GPT-5.1 flutuou ao longo de sete dias consecutivos em dezembro de 2025, apesar de prompts de usuário idênticos e configurações de modelo. A maior variação ocorreu no GPQA (laranja), alcançando quatro pontos percentuais entre os melhores e piores dias. A linha tracejada representa a precisão média de cada benchmark ao longo da semana.

Os pesquisadores recomendam remover a data dos prompts de sistema sempre que possível, ou corrigi‑la e documentá‑la, para garantir comparações justas. No entanto, observam que a influência centrada na data pode estar mais profundamente enraizada:

‘Uma possível razão para a sensibilidade à data é que o prompt de sistema pode estar fixo durante o ajuste fino supervisionado (SFT) e o aprendizado por reforço a partir de feedback humano (RLHF), tornando o modelo frágil a qualquer modificação sutil.’

Para investigar o problema, os pesquisadores testaram seis formulações diferentes para o prompt do sistema e descobriram que essas alterações afetaram a precisão tanto quanto a mudança da data (0,78%). Portanto, a data parece ter tanta influência quanto a engenharia de prompts deliberada – exceto que ela muda automaticamente, sem que o usuário sequer perceba.

Outras abordagens foram testadas para mitigar o problema da “data atual”, incluindo aprendizado de poucos exemplos (onde o modelo recebeu cinco respostas de exemplo antes de responder). Isso ajudou um pouco, reduzindo a variação média de 2,52% para 2,27%, mas não resolveu o problema.

Alterações no hardware da GPU, tamanho do lote, precisão numérica, ordem das respostas e formulação do prompt do sistema também foram testadas. Os maiores efeitos foram observados na ordem das respostas e na formulação do prompt, que se aproximaram mais do impacto de mudar a data.

Últimos Dias

É razoável esperar que um LLM/VLM compreenda a data desde o início de uma conversa; no entanto, não parece haver razão explícita para incorporá‑la ao prompt do sistema (a rubrica invisível que impõe restrições e condiciona os comportamentos do LLM de maneiras inacessíveis ao usuário) quando o LLM poderia rotineiramente fazer uma chamada RAG sub‑Kb para ingerir a data mais recente, como uma pequena rotina de manutenção antes de interagir com o usuário.

Sem dúvida, existem outras possibilidades para resolver a questão; porém, como a imposição da data atual no prompt do sistema ainda não foi vista como um problema, presumivelmente houve pouca ou nenhuma investigação a respeito.

Relacionamento Online

Para os testes, prompts idênticos foram usados para cada modelo, alterando apenas a data no prompt do sistema. Todos os dias de 2024 foram testados, de 1 de janeiro até 31 de dezembro, mantendo todas as demais configurações iguais.

Seis benchmarks foram usados: MMLU; GPQA; e ARC-Challenge, para questões de múltipla escolha (pontuadas pela probabilidade do token de resposta). GSM8K para matemática passo a passo (resposta final verificada); HumanEval para geração de código Python (testado unitariamente); e WMT para tradução inglês‑alemão; inglês‑finlandês; e inglês‑tcheco (saída completa avaliada). Questões dependentes de tempo foram excluídas.

Nove modelos foram testados: Llama 3.1 Instruct (8B e 70B); Gemma 3 Instruct (4B e 27B); Qwen3 (4B); Qwen3-Next (80B); Phi-4 (14B); e GPT-OSS (20B e 120B).

A precisão (percentual de questões respondidas corretamente) foi usada para pontuar os testes de múltipla escolha e matemática, enquanto Erro de Calibração Esperado (ECE) mediu o quão bem a confiança dos modelos correspondia ao seu desempenho real.

O código foi avaliado usando pass@1 (percentual de soluções de código geradas que passam em todos os testes na primeira tentativa); as traduções foram pontuadas usando BLEU e chrF.

Os resultados confirmaram a hipótese dos pesquisadores: simplesmente mudar a data no prompt do sistema alterou a precisão com que os modelos respondiam às mesmas questões.

Resultados de teste mostrando como cinco modelos líderes se comportaram no MMLU à medida que a data do prompt do sistema foi alterada ao longo de 2024. A precisão é mostrada no topo, com erro de calibração esperado (ECE) abaixo. Todos os cinco modelos apresentaram flutuações em ambas as métricas, apesar de nenhuma outra mudança nas condições do teste. Pontuações de ECE mais baixas indicam melhor alinhamento entre confiança e precisão.

Resultados de teste mostrando como cinco modelos líderes se comportaram no MMLU à medida que a data do prompt do sistema foi alterada ao longo de 2024. A precisão é mostrada no topo, com erro de calibração esperado (ECE) abaixo. Todos os cinco modelos apresentaram flutuações em ambas as métricas, apesar de nenhuma outra mudança nas condições do teste. Pontuações de ECE mais baixas indicam melhor alinhamento entre confiança e precisão.

Juntamente com outros resultados mostrados anteriormente no artigo, isso pode ser uma notícia ruim para a avaliação de LLMs, pois um modelo poderia obter pontuações melhores ou piores dependendo do dia em que foi testado, possivelmente alterando sua posição em um ranking, sem qualquer melhoria ou declínio real em suas capacidades.

Conclusão

Esta questão destaca a divisão entre os sistemas computacionais determinísticos aos quais estávamos acostumados antes de aproximadamente 2023 e a natureza muito diferente dos sistemas de IA baseados em difusão e similares que evoluíram, e continuam a evoluir, desde então.

A resolução de datas foi essencialmente resolvida em 1 de janeiro de 1970, mas aparentemente voltou a assombrar o mundo da computação na forma de datas de corte, entre outras questões temporais.

 

* Intitulado ‘Datando o Modelo: Datas Ocultas em Prompts de Sistema Afetam a Avaliação de LLM’

Primeira publicação sexta‑feira, 9 de outubro de 2026

Escritor em aprendizado de máquina, especialista em síntese de imagens humanas. Ex‑chefe de conteúdo de pesquisa na Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Website: martinanderson.ai
Contato: martin@martinanderson.ai