Modele i platformy AI

Modele AI mają trudności z odczytywaniem zegarów analogowych, podczas gdy ludzie radzą sobie z tym z łatwością

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Wszechstronne badanie testujące 11 wiodących modeli AI w odczytywaniu zegarów analogowych w porównaniu z ludźmi ujawniło zaskakującą słabość w obecnych systemach sztucznej inteligencji. Podczas gdy ludzie osiągnęli 89,1% dokładności w odczytywaniu czasu, najlepszy model Google (GOOGL ) osiągnął tylko 13,3% dokładności w tym samym teście.

Badanie ClockBench, przeprowadzone przez badacza Aleka Safara, pokazuje, że nawet najbardziej zaawansowane systemy AI mają trudności z zadaniami wizualnymi, które większość ludzi opanowuje jako dzieci. Test sprawdzający systemy z Google, OpenAI, Anthropic i innych dużych laboratoriów AI przy użyciu 180 specjalnie zaprojektowanych zegarów analogowych.

To wykracza poza zegary. Wyniki podkreślają podstawowe ograniczenia w sposobie, w jaki systemy AI przetwarzają i rozumieją informacje wizualne. “Czytanie zegarów analogowych stawia wysoką poprzeczkę dla rozumowania w przestrzeni wizualnej”, zauważa Safar w pracy badawczej. Zadanie wymaga od modeli identyfikacji wskazówek zegara, zrozumienia ich relacji i przekształcenia pozycjonowania wizualnego w czas liczbowy.

Różnica w wydajności staje się jeszcze bardziej uderzająca przy badaniu wzorców błędów. Kiedy ludzie popełniali błędy, mediana błędu wynosiła tylko trzy minuty. Modele AI, z drugiej strony, przegapiły cel o jeden do trzech godzin – co jest mniej więcej równoważne losowemu zgadywaniu na 12-godzinnym zegarze.

Ujawnione słabości

Systemy AI szczególnie miały trudności z:

  • Rzymskimi cyframi (3,2% dokładności)
  • Odbiciem lub odwróconymi tarczami zegarowymi
  • Kolorowymi tłami lub złożonymi projektami
  • Zegarami z wskazówkami sekundowymi wymagającymi dokładnych odczytów

Interesujące jest to, że kiedy modele AI prawidłowo odczytały zegar, radziły sobie dobrze w zadaniach następczych, takich jak dodawanie czasu lub konwertowanie stref czasowych. To sugeruje, że podstawowym wyzwaniem jest początkowe rozpoznawanie wizualne, a nie rozumowanie matematyczne.

Przełom w branży

Modele Google prowadziły stawkę, z Gemini 2.5 Pro, które osiągnęło 13,3% dokładności, oraz Gemini 2.5 Flash, które osiągnęło 10,5%. Model GPT-5 od OpenAI uzyskał 8,4%, podczas gdy modele Claude od Anthropic uzyskały niższe wyniki, z modelem Claude 4 Sonnet na poziomie 4,2% i modelem Claude 4.1 Opus na poziomie 5,6%.

xAI’s Grok 4 uzyskał niespodziewanie słabe wyniki, na poziomie 0,7% dokładności, choć wynikało to z faktu, że model niepoprawnie oznaczył 63% wszystkich zegarów jako pokazujących niemożliwe czasy, podczas gdy tylko 20,6% zegarów rzeczywiście pokazywało niemożliwe czasy.

Źródło: Alek Safar

Szersze implikacje dla rozwoju AI

Badanie opiera się na podejściu “łatwe dla ludzi, trudne dla AI” widocznym w testach takich jak ARC-AGI i SimpleBench. Chociaż systemy AI szybko podbiły zadania wymagające wiedzy i nawet przewyższyły wyniki ludzi w wielu standardowych testach, podstawowe rozumowanie wizualne pozostaje problematyczne.

Badanie sugeruje, że obecne podejścia do skalowania mogą nie rozwiązać wyzwań związanych z rozumowaniem wizualnym. Safar hipotetyzuje, że zegary analogowe mogą być niedoreprezentowane w danych szkoleniowych i że tłumaczenie reprezentacji wizualnych zegarów na tekst do celów rozumowania tworzy dodatkowe komplikacje.

Badanie ClockBench dołącza do rosnącej kolekcji benchmarków zaprojektowanych w celu identyfikacji ograniczeń AI, które nie są natychmiast widoczne w wynikach tradycyjnych testów. Cały zestaw danych pozostaje prywatny, aby uniknąć zanieczyszczenia przyszłych danych szkoleniowych AI, a tylko niewielkie próbki są udostępniane publicznie do testowania.

Wyniki budzą pytania, czy istniejące paradygmaty rozwoju AI mogą rozwiązać te luki w rozumowaniu wizualnym, czy też będą potrzebne całkowicie nowe podejścia – podobnie jak to, jak obliczenia w czasie testów odblokowały postęp w innych dziedzinach.

Na razie skromny zegar analogowy stoi jako nieoczekiwana twierdza przeciwko sztucznej inteligencji, czytelny przez praktycznie każdego człowieka, ale zaskakujący najbardziej zaawansowane systemy AI.

Alex McFarland jest dziennikarzem i pisarzem zajmującym się sztuczną inteligencją, który bada najnowsze rozwoje w dziedzinie sztucznej inteligencji. Współpracował z licznymi startupami i wydawnictwami związanymi z sztuczną inteligencją na całym świecie.