Ángulo de Anderson
Fechas secretas en los prompts del sistema socavan la evaluación de modelos de lenguaje

Sin la capacidad de evaluar los Modelos de Lenguaje a Gran Escala (LLMs), resulta difícil para consumidores y empresas comprender qué progreso ha logrado un modelo en versiones recientes y cómo se compara con sus competidores:

La influyente tabla de clasificación de LLM en arena.ai. Fuente
Dado que los LLM son no determinísticos (es decir, no siempre producirán salidas consistentes con los mismos inputs), evaluarlos es complicado. Incluso cuando los investigadores usan prompts idénticos, configuraciones del modelo y conjuntos de datos de referencia, diferencias aparentemente menores en el entorno de ejecución pueden generar respuestas distintas y alterar significativamente las puntuaciones de rendimiento.
Factores como la configuración del hardware, precisión numérica, tamaño de lote de inferencia y incluso el orden de las respuestas de opción múltiple pueden influir en los resultados. Esto puede dificultar determinar si una mejora reportada refleja un progreso real o simplemente una variación semialeatoria en las condiciones bajo las cuales se probó el modelo.
En cierta medida, se pueden tener en cuenta algunas de estas variables, o al menos determinar qué margen de error generan, de modo que la evaluación comparativa sea significativa. Es importante intentarlo, ya que mucho dinero y mucha reputación dependen de poder evaluar sistemas de IA de este tipo con cierto grado de precisión.
Sin embargo, según nuevas investigaciones, una variable en particular no solo puede ser destructiva para las evaluaciones, sino que también es muy difícil de eliminar de los prompts que las definen – la fecha actual.
Los tiempos cambian
El nuevo artículo*, una colaboración académica entre Alemania, México y EE. UU., afirma que el hecho de que la fecha actual se incluya automática y secretamente en el prompt del sistema de todos los modelos de vanguardia y de muchas implementaciones de modelos de peso abierto significa que la reproducibilidad podría ser casi imposible:
‘Identificamos una fuente crítica, a menudo pasada por alto, de no determinismo en la evaluación de LLM: la inyección oculta de la fecha actual en los prompts del sistema.’
‘En 9 modelos, 6 conjuntos de datos y cuatro tareas, estos metadatos dinámicos alteran el rendimiento del modelo y reordenan las clasificaciones de la tabla de líderes, superando la variación introducida por otros factores a nivel de sistema como el tamaño de lote o la precisión numérica.’
Los investigadores también señalan que el efecto identificado es mayor en tareas que requieren respuestas generadas, con un rendimiento que varía hasta un 6 % en preguntas de opción múltiple, un 14 % en razonamiento matemático y un 7 % en generación de código, y con puntuaciones de traducción automática que también varían significativamente.
Proporcionar respuestas de ejemplo y fomentar el razonamiento paso a paso no resolvió el problema – de hecho, esto lo hizo peor:

Fluctuaciones de precisión en diferentes fechas en 2024 para Llama 3.1 (8B) en el benchmark MMLU. El razonamiento paso a paso (rojo) produce una variabilidad sustancialmente mayor que las respuestas directas (azul), demostrando cómo el prompting de cadena de pensamiento amplifica la sensibilidad a la fecha. Fuente
El efecto también se identificó en modelos propietarios, con GPT-5.1 mostrando fluctuaciones de precisión de hasta un 4 % en tres benchmarks de opción múltiple durante una semana de pruebas en diciembre de 2025. Los investigadores usaron un prompt del sistema vacío, desactivaron el razonamiento y establecieron la aleatoriedad a cero, pero la fecha seguía insertándose automáticamente por el proveedor:

La precisión de GPT-5.1 fluctuó a lo largo de siete días consecutivos en diciembre de 2025, a pesar de prompts de usuario idénticos y configuraciones del modelo. La mayor variación se produjo en GPQA (naranja), alcanzando cuatro puntos porcentuales entre los mejores y peores días. La línea discontinua representa la precisión media de cada benchmark durante la semana.
Los investigadores recomiendan eliminar la fecha de los prompts del sistema cuando sea posible, o corregirla y documentarla, para garantizar comparaciones justas. Sin embargo, señalan que la influencia centrada en la fecha podría estar más arraigada:
‘Una posible razón para la sensibilidad a la fecha es que el prompt del sistema podría estar fijado durante el ajuste fino supervisado (SFT) y el aprendizaje por refuerzo a partir de retroalimentación humana (RLHF), lo que vuelve al modelo frágil ante cualquier ligera modificación.’
Para investigar el problema, los investigadores probaron seis redacciones diferentes para el mensaje del sistema y descubrieron que estos cambios afectaron la precisión tanto como cambiar la fecha (0,78 %). Por lo tanto, la fecha parece tener tanta influencia como la ingeniería de prompts deliberada, salvo que cambia automáticamente, sin que el usuario lo sepa.
Se probaron otros enfoques para mitigar el problema de la “fecha actual”, incluido el aprendizaje de pocos ejemplos (en el que el modelo recibió cinco respuestas de ejemplo antes de responder). Esto ayudó un poco, reduciendo la variación promedio del 2,52 % al 2,27 %, pero no resolvió el problema.
También se probaron cambios en el hardware de GPU, el tamaño de lote, la precisión numérica, el orden de las respuestas y la redacción del mensaje del sistema. Los efectos más significativos se observaron con el orden de las respuestas y la redacción del mensaje, que se acercaron más al impacto de cambiar la fecha.
Últimos Días
Es razonable esperar que un LLM/VLM comprenda la fecha desde el inicio de una conversación; sin embargo, no parece haber una razón explícita para incorporarla en el mensaje del sistema (la rúbrica invisible que impone barreras de seguridad y condiciona el comportamiento del LLM de maneras inaccesibles al usuario) cuando el LLM podría realizar rutinariamente una llamada RAG de menos de un kilobyte para incorporar la fecha más reciente, como una pequeña tarea de mantenimiento antes de interactuar con el usuario.
Sin duda existen otras posibilidades para resolver el asunto; sin embargo, dado que la imposición de la fecha actual en el mensaje del sistema no se ha percibido como un problema hasta ahora, presumiblemente ha habido poca o ninguna investigación al respecto.
Citas en Línea
Para las pruebas, se utilizaron mensajes idénticos para cada modelo, cambiando únicamente la fecha en el mensaje del sistema. Se probó cada día de 2024, desde el 1 de enero hasta el 31 de diciembre, manteniendo todas las demás configuraciones iguales.
Se utilizaron seis referencias de evaluación: MMLU; GPQA; y ARC-Challenge, para preguntas de opción múltiple (puntualizadas por la probabilidad del token de respuesta). GSM8K para matemáticas paso a paso (respuesta final verificada); HumanEval para generación de código Python (pruebas unitarias); y WMT para traducción inglés‑alemán; inglés‑finlandés; e inglés‑checo (salida completa evaluada). Se excluyeron las preguntas dependientes del tiempo.
Se probaron nueve modelos: Llama 3.1 Instruct (8B y 70B); Gemma 3 Instruct (4B y 27B); Qwen3 (4B); Qwen3-Next (80B); Phi-4 (14B); y GPT-OSS (20B y 120B).
La precisión (el porcentaje de preguntas respondidas correctamente) se utilizó para puntuar las pruebas de opción múltiple y de matemáticas, mientras que el Error de Calibración Esperado (ECE) midió qué tan bien la confianza de los modelos coincidía con su rendimiento real.
El código se verificó usando pass@1 (el porcentaje de soluciones de código generadas que superan todas las pruebas en el primer intento); las traducciones se puntuaron con BLEU y chrF.
Los resultados confirmaron la hipótesis de los investigadores: simplemente cambiar la fecha en el mensaje del sistema alteró la precisión con la que los modelos respondían a las mismas preguntas.

Resultados de pruebas que muestran cómo cinco modelos líderes se desempeñaron en MMLU a medida que la fecha del mensaje del sistema se modificó a lo largo de 2024. La precisión se muestra en la parte superior, con el error de calibración esperado (ECE) debajo. Los cinco modelos mostraron fluctuaciones en ambas métricas, a pesar de que no hubo otros cambios en las condiciones de la prueba. Las puntuaciones más bajas de ECE indican una mejor alineación entre la confianza y la precisión.
Junto con otros resultados mostrados anteriormente en el artículo, esto es potencialmente una mala noticia para la evaluación de LLM, ya que un modelo podría obtener una puntuación mayor o menor según el día en que se pruebe, lo que podría cambiar su posición en una tabla de clasificación, sin que haya una mejora o deterioro real en sus capacidades.
Conclusión
Este problema destaca la brecha entre los sistemas informáticos deterministas a los que estábamos acostumbrados antes de aproximadamente 2023, y la naturaleza muy diferente de los sistemas de IA basados en difusión y similares que han evolucionado, y continúan evolucionando, desde entonces.
La resolución de fechas se resolvió esencialmente el 1 de enero de 1970, pero, al parecer, ha vuelto a atormentar al mundo de la computación en forma de fechas de corte, entre otras preocupaciones temporales.
* Titulado ‘Fechando el modelo: fechas ocultas en los prompts del sistema afectan la evaluación de los LLM’
Primera publicación viernes, 9 de octubre de 2026

![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-400x240.jpg)
![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-80x80.jpg)









