Modelos y plataformas de IA
Los Modelos de IA Tropezan con la Lectura Básica de Relojes mientras los Humanos Sobresalen

Un estudio exhaustivo que pone a prueba 11 modelos de IA líderes contra humanos en la lectura de relojes analógicos ha expuesto una debilidad sorprendente en los sistemas de inteligencia artificial actuales. Mientras que los humanos lograron un 89,1% de precisión al decir la hora, el modelo de Google (GOOGL ) con mejor rendimiento logró solo un 13,3% de precisión en la misma prueba.
El estudio ClockBench, realizado por el investigador Alek Safar, demuestra que incluso los sistemas de IA más avanzados luchan con tareas visuales que la mayoría de las personas dominan en la infancia. La prueba midiό los sistemas de Google, OpenAI, Anthropic y otros laboratorios de IA importantes utilizando 180 relojes analógicos personalizados.
Esto va más allá de los relojes. Los resultados resaltan limitaciones fundamentales en la forma en que los sistemas de IA procesan y razonan la información visual. “La lectura de relojes analógicos establece una alta barrera para realizar razonamiento dentro del espacio visual”, señala Safar en el documento de investigación. La tarea requiere que los modelos identifiquen las manecillas del reloj, entiendan sus relaciones y traduzcan la posición visual en tiempo numérico.
La brecha de rendimiento se vuelve aún más llamativa al examinar los patrones de error. Cuando los humanos cometieron errores, el error mediano fue de solo tres minutos. Los modelos de IA, por otro lado, se equivocaron por uno a tres horas, lo que equivale aproximadamente a adivinar al azar en un reloj de 12 horas.
Debilidades Específicas Reveladas
Los sistemas de IA lucharon particularmente con:
- Números romanos (precisión del 3,2%)
- Caras de reloj reflejadas o al revés
- Fondos coloridos o diseños complejos
- Relojes con manecillas de segundos que requieren lecturas precisas
Resulta interesante que, cuando los modelos de IA lograron leer un reloj, realizaron bien tareas posteriores como sumar tiempo o convertir zonas horarias. Esto sugiere que el desafío principal radica en el reconocimiento visual inicial en lugar del razonamiento matemático.
Análisis de Rendimiento de la Industria
Los modelos de Google lideraron el paquete, con Gemini 2.5 Pro logrando un 13,3% de precisión y Gemini 2.5 Flash alcanzando un 10,5%. GPT-5 de OpenAI obtuvo un 8,4%, mientras que los modelos Claude de Anthropic realizaron peor, con Claude 4 Sonnet en un 4,2% y Claude 4.1 Opus en un 5,6%.
xAI’s Grok 4 obtuvo resultados sorprendentemente malos con una precisión del 0,7%, aunque esto se debió a que el modelo marcó incorrectamente el 63% de todos los relojes como mostrando horas imposibles cuando solo el 20,6% lo hicieron realmente.

Fuente: Alek Safar
Implicaciones Más Amplias para el Desarrollo de la IA
El estudio se basa en el enfoque de referencia “fácil para humanos, difícil para la IA” visto en pruebas como ARC-AGI y SimpleBench. Mientras que los sistemas de IA han conquistado rápidamente tareas intensivas en conocimiento y incluso han superado el rendimiento humano en muchas pruebas estandarizadas, el razonamiento visual básico sigue siendo problemático.
La investigación sugiere que los enfoques de escalado actuales pueden no resolver los desafíos del razonamiento visual. Safar hipotetiza que los relojes analógicos pueden estar subrepresentados en los datos de entrenamiento y que traducir las representaciones visuales de los relojes en texto para el razonamiento crea complicaciones adicionales.
ClockBench se une a una creciente colección de benchmarks diseñados para identificar limitaciones de la IA que no son inmediatamente obvias desde el rendimiento en pruebas tradicionales. El conjunto de datos completo permanece privado para evitar la contaminación de futuros entrenamientos de IA, con solo pequeñas muestras hechas públicas para pruebas.
Los resultados plantean preguntas sobre si los paradigmas actuales de desarrollo de IA pueden abordar estas brechas de razonamiento visual o si se necesitarán enfoques completamente nuevos, similar a cómo la computación en tiempo de prueba desbloqueó el progreso en otros dominios.
Por ahora, el humilde reloj analógico se mantiene como una fortaleza inesperada contra la inteligencia artificial, legible por virtualmente cualquier humano pero confundiendo a los sistemas de IA más sofisticados del mundo.












