Modelos y plataformas de IA

Los Modelos de IA Tropezan con la Lectura BÃĄsica de Relojes mientras los Humanos Sobresalen

mm
AÃąade Unite.AI a tus fuentes preferidas en Google

Un estudio exhaustivo que pone a prueba 11 modelos de IA líderes contra humanos en la lectura de relojes analÃģgicos ha expuesto una debilidad sorprendente en los sistemas de inteligencia artificial actuales. Mientras que los humanos lograron un 89,1% de precisiÃģn al decir la hora, el modelo de Google (GOOGL ) con mejor rendimiento logrÃģ solo un 13,3% de precisiÃģn en la misma prueba.

El estudio ClockBench, realizado por el investigador Alek Safar, demuestra que incluso los sistemas de IA mÃĄs avanzados luchan con tareas visuales que la mayoría de las personas dominan en la infancia. La prueba midiό los sistemas de Google, OpenAI, Anthropic y otros laboratorios de IA importantes utilizando 180 relojes analÃģgicos personalizados.

Esto va mÃĄs allÃĄ de los relojes. Los resultados resaltan limitaciones fundamentales en la forma en que los sistemas de IA procesan y razonan la informaciÃģn visual. “La lectura de relojes analÃģgicos establece una alta barrera para realizar razonamiento dentro del espacio visual”, seÃąala Safar en el documento de investigaciÃģn. La tarea requiere que los modelos identifiquen las manecillas del reloj, entiendan sus relaciones y traduzcan la posiciÃģn visual en tiempo numÃĐrico.

La brecha de rendimiento se vuelve aÚn mÃĄs llamativa al examinar los patrones de error. Cuando los humanos cometieron errores, el error mediano fue de solo tres minutos. Los modelos de IA, por otro lado, se equivocaron por uno a tres horas, lo que equivale aproximadamente a adivinar al azar en un reloj de 12 horas.

Debilidades Específicas Reveladas

Los sistemas de IA lucharon particularmente con:

  • NÚmeros romanos (precisiÃģn del 3,2%)
  • Caras de reloj reflejadas o al revÃĐs
  • Fondos coloridos o diseÃąos complejos
  • Relojes con manecillas de segundos que requieren lecturas precisas

Resulta interesante que, cuando los modelos de IA lograron leer un reloj, realizaron bien tareas posteriores como sumar tiempo o convertir zonas horarias. Esto sugiere que el desafío principal radica en el reconocimiento visual inicial en lugar del razonamiento matemÃĄtico.

AnÃĄlisis de Rendimiento de la Industria

Los modelos de Google lideraron el paquete, con Gemini 2.5 Pro logrando un 13,3% de precisiÃģn y Gemini 2.5 Flash alcanzando un 10,5%. GPT-5 de OpenAI obtuvo un 8,4%, mientras que los modelos Claude de Anthropic realizaron peor, con Claude 4 Sonnet en un 4,2% y Claude 4.1 Opus en un 5,6%.

xAI’s Grok 4 obtuvo resultados sorprendentemente malos con una precisiÃģn del 0,7%, aunque esto se debiÃģ a que el modelo marcÃģ incorrectamente el 63% de todos los relojes como mostrando horas imposibles cuando solo el 20,6% lo hicieron realmente.

Fuente: Alek Safar

Implicaciones MÃĄs Amplias para el Desarrollo de la IA

El estudio se basa en el enfoque de referencia “fÃĄcil para humanos, difícil para la IA” visto en pruebas como ARC-AGI y SimpleBench. Mientras que los sistemas de IA han conquistado rÃĄpidamente tareas intensivas en conocimiento y incluso han superado el rendimiento humano en muchas pruebas estandarizadas, el razonamiento visual bÃĄsico sigue siendo problemÃĄtico.

La investigaciÃģn sugiere que los enfoques de escalado actuales pueden no resolver los desafíos del razonamiento visual. Safar hipotetiza que los relojes analÃģgicos pueden estar subrepresentados en los datos de entrenamiento y que traducir las representaciones visuales de los relojes en texto para el razonamiento crea complicaciones adicionales.

ClockBench se une a una creciente colecciÃģn de benchmarks diseÃąados para identificar limitaciones de la IA que no son inmediatamente obvias desde el rendimiento en pruebas tradicionales. El conjunto de datos completo permanece privado para evitar la contaminaciÃģn de futuros entrenamientos de IA, con solo pequeÃąas muestras hechas pÚblicas para pruebas.

Los resultados plantean preguntas sobre si los paradigmas actuales de desarrollo de IA pueden abordar estas brechas de razonamiento visual o si se necesitarÃĄn enfoques completamente nuevos, similar a cÃģmo la computaciÃģn en tiempo de prueba desbloqueÃģ el progreso en otros dominios.

Por ahora, el humilde reloj analÃģgico se mantiene como una fortaleza inesperada contra la inteligencia artificial, legible por virtualmente cualquier humano pero confundiendo a los sistemas de IA mÃĄs sofisticados del mundo.

Alex McFarland es un periodista y escritor de inteligencia artificial que explora los Últimos desarrollos en inteligencia artificial. Ha colaborado con numerosas startups y publicaciones de inteligencia artificial en todo el mundo.