Modele i platformy AI

Modele AI mają trudności z odczytywaniem zegarów analogowych, podczas gdy ludzie radzą sobie z tym z łatwością

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Wszechstronne badanie testujące 11 wiodących modeli AI w odczytywaniu zegarów analogowych w porównaniu z ludźmi ujawniło zaskakującą słabość w obecnych systemach sztucznej inteligencji. Podczas gdy ludzie osiągnęli 89,1% dokładności w odczytywaniu czasu, najlepszy model Google (GOOGL ) osiągnął tylko 13,3% dokładności w tym samym teście.

Badanie ClockBench, przeprowadzone przez badacza Aleka Safara, pokazuje, że nawet najbardziej zaawansowane systemy AI mają trudności z zadaniami wizualnymi, które większość ludzi opanowuje jako dzieci. Test sprawdzający systemy z Google, OpenAI, Anthropic i innych dużych laboratoriów AI przy użyciu 180 specjalnie zaprojektowanych zegarów analogowych.

To wykracza poza zegary. Wyniki podkreślają podstawowe ograniczenia w sposobie, w jaki systemy AI przetwarzają i rozumieją informacje wizualne. “Czytanie zegarów analogowych stawia wysoką poprzeczkę dla rozumowania w przestrzeni wizualnej”, zauważa Safar w pracy badawczej. Zadanie wymaga od modeli identyfikacji wskazówek zegara, zrozumienia ich relacji i przekształcenia pozycjonowania wizualnego w czas liczbowy.

Różnica w wydajności staje się jeszcze bardziej uderzająca przy badaniu wzorców błędów. Kiedy ludzie popełniali błędy, mediana błędu wynosiła tylko trzy minuty. Modele AI, z drugiej strony, przegapiły cel o jeden do trzech godzin – co jest mniej więcej równoważne losowemu zgadywaniu na 12-godzinnym zegarze.

Ujawnione słabości

Systemy AI szczególnie miały trudności z:

  • Rzymskimi cyframi (3,2% dokładności)
  • Odbiciem lub odwróconymi tarczami zegarowymi
  • Kolorowymi tłami lub złożonymi projektami
  • Zegarami z wskazówkami sekundowymi wymagającymi dokładnych odczytów

Interesujące jest to, że kiedy modele AI prawidłowo odczytały zegar, radziły sobie dobrze w zadaniach następczych, takich jak dodawanie czasu lub konwertowanie stref czasowych. To sugeruje, że podstawowym wyzwaniem jest początkowe rozpoznawanie wizualne, a nie rozumowanie matematyczne.

Przełom w branży

Modele Google prowadziły stawkę, z Gemini 2.5 Pro, które osiągnęło 13,3% dokładności, oraz Gemini 2.5 Flash, które osiągnęło 10,5%. Model GPT-5 od OpenAI uzyskał 8,4%, podczas gdy modele Claude od Anthropic uzyskały niższe wyniki, z modelem Claude 4 Sonnet na poziomie 4,2% i modelem Claude 4.1 Opus na poziomie 5,6%.

xAI’s Grok 4 uzyskał niespodziewanie słabe wyniki, na poziomie 0,7% dokładności, choć wynikało to z faktu, że model niepoprawnie oznaczył 63% wszystkich zegarów jako pokazujących niemożliwe czasy, podczas gdy tylko 20,6% zegarów rzeczywiście pokazywało niemożliwe czasy.

Źródło: Alek Safar

Szersze implikacje dla rozwoju AI

Badanie opiera się na podejściu “łatwe dla ludzi, trudne dla AI” widocznym w testach takich jak ARC-AGI i SimpleBench. Chociaż systemy AI szybko podbiły zadania wymagające wiedzy i nawet przewyższyły wyniki ludzi w wielu standardowych testach, podstawowe rozumowanie wizualne pozostaje problematyczne.

Badanie sugeruje, że obecne podejścia do skalowania mogą nie rozwiązać wyzwań związanych z rozumowaniem wizualnym. Safar hipotetyzuje, że zegary analogowe mogą być niedoreprezentowane w danych szkoleniowych i że tłumaczenie reprezentacji wizualnych zegarów na tekst do celów rozumowania tworzy dodatkowe komplikacje.

Badanie ClockBench dołącza do rosnącej kolekcji benchmarków zaprojektowanych w celu identyfikacji ograniczeń AI, które nie są natychmiast widoczne w wynikach tradycyjnych testów. Cały zestaw danych pozostaje prywatny, aby uniknąć zanieczyszczenia przyszłych danych szkoleniowych AI, a tylko niewielkie próbki są udostępniane publicznie do testowania.

Wyniki budzą pytania, czy istniejące paradygmaty rozwoju AI mogą rozwiązać te luki w rozumowaniu wizualnym, czy też będą potrzebne całkowicie nowe podejścia – podobnie jak to, jak obliczenia w czasie testów odblokowały postęp w innych dziedzinach.

Na razie skromny zegar analogowy stoi jako nieoczekiwana twierdza przeciwko sztucznej inteligencji, czytelny przez praktycznie każdego człowieka, ale zaskakujący najbardziej zaawansowane systemy AI.

Alex prowadzi operacje informacyjne zasilane AI w Unite.AI, łącząc dziennikarstwo, badania i automatyzację, aby wspierać terminowe i skalowalne relacjonowanie sztucznej inteligencji. Jego praca pomaga zapewnić, że nowe osiągnięcia w dziedzinie AI są prezentowane efektywnie, przy zachowaniu standardów redakcyjnych publikacji.