Kąt Andersona
Układanki Jigsaw Zwiększają Rozumienie Wizualne AI

Naukowcy odkryli, że modele AI mogą stać się mądrzejsze w rozpoznawaniu obrazów, rozwiązywaniu układanek jigsaw. Przebudowanie pomieszanego obrazu, filmu lub sceny 3D pomaga im poprawić umiejętności wizualne bez potrzeby dodatkowych danych, etykiet lub narzędzi.
W obecnej gonitwie, aby przesunąć Multimodalne Duże Modele Językowe (MLLM) do przodu, istnieją niewiele łatwych zwycięstw i nie ma darmowych lunchów.
Mimo że wiele chińskich FOSS wydań z 2025 roku ma niższe koszty rozwoju i eksploatacji, zachodnie wydania mają tendencję do rzucania więcej w problem: więcej danych, więcej mocy obliczeniowej, więcej energii (chociaż nie, jak niedawno zauważyliśmy, więcej rzeczywistych anotatorów ludzkich, ponieważ jest to zbyt drogie nawet dla rewolucji AI o skali $trillion+).
W literaturze naukowej, większość rzekomo “darmowych” podejść do ewolucji architektur AI oferuje tylko niewielkie przyrosty; lub też poprawy w obszarach, które nie są najbardziej krytycznie pożądane. Niemniej jednak, poszukiwanie dotąd nieodkrytych “podstawowych zasad”, które mogłyby przyspieszyć tempo rozwoju, jest zbyt kuszące, aby je porzucić.
Zbieranie kawałków
Podczas gdy nie jest to dokładnie w tej samej kategorii, nowa współpraca akademicka między chińskimi instytucjami twierdzi, że określiła, iż sprawienie, by VLM rozwiązywały układanki jigsaw, znacznie poprawia ich wyniki, nawet jeśli ten podejście uczenia wzmocnionego wcześniej nie odniosło sukcesu w tym obszarze, i nawet jeśli wymaga to żadnych dodatkowych systemów, modeli pomocniczych ani innych “dodatkowych” procesów;

Visual Jigsaw to samouczący się framework post-trenningowy, który poprawia umiejętności wizualne w multimodalnych dużych modelach językowych. Przez trenowanie na zadaniach jigsaw na obrazach, filmach i danych 3D, modele zyskują bardziej wyrafinowane, drobne, przestrzenne i kompozycyjne postrzeganie w obrazach, silniejsze rozumowanie czasowe w filmach i wzmocnione zrozumienie geometrii w scenach 3D. Wykresy radarowe na powyższym obrazie pokazują spójne zyski w porównaniu z modelem Qwen2.5-VL, z skalami wartości dostosowanymi do każdego benchmarku dla wyjaśnienia. Źródło: https://arxiv.org/pdf/2509.25190
System opracowany przez naukowców nosi nazwę Visual Jigsaw, i polega na trenowaniu istniejących MLLM na materiałach, które zostały rozdrobnione i przypadkowo rozproszone, jak układanka. Autorzy opracowali trzy modalności dla tego podejścia: obraz, film i 3D (tj. siatki), i stwierdzili, że umiarkowana adaptacja tego samego procesu przyniosła korzyści we wszystkich trzech dziedzinach:

Przedstawienie trzech zadań Visual Jigsaw. W zadaniu Image Jigsaw obraz jest podzielony na fragmenty, pomieszany i model predystuuje poprawną układankę; w zadaniu Video Jigsaw klipy są pomieszane i model przywraca ich kolejność w czasie; w zadaniu 3D Jigsaw punkty o różnych głębokościach są pomieszane i model klasyfikuje je od najbliższych do najdalszych. Wyniki modelu są oceniane w stosunku do prawdy, z częściową punktacją za częściowo poprawne rozwiązania.
Metoda trenowania Visual Jigsaw pomaga modelom AI poprawić zrozumienie informacji wizualnych, zmuszając je do ponownego złożenia tych pomieszanych obrazów, fragmentów filmów lub danych 3D.
Proces oparty jest na słowach, a nie na obrazach, i dlatego nie ma potrzeby generowania obrazów lub używania dodatkowych składników wizualnych. To podejście pasuje do systemu zwanego Reinforcement Learning from Verifiable Rewards (RLVR), gdzie model otrzymuje nagrodę za poprawne odpowiedzi na podstawie jasnych, automatycznych zasad; i gdzie, zatem, nie jest wymagane etykietowanie przez ludzi.
Ten kluczowy fakt jest tak naprawdę trudny do ustalenia z nowego artykułu: że system składa układankę semantycznie, przez opisy, a nie w sposób reprezentatywny, w jaki ludzie uczą się rozwiązywać takie układanki:

Z materiałów uzupełniających nowego artykułu, przykład zadania RL ilustrujący tekstowy charakter tego procesu uczenia się. Obrazy, które byłyby wyświetlane modelowi MLLM, nie są tutaj przedstawione.
Mimo że MLLM zajmuje się obszernie zadaniami związanymi z wizją, są to architektury oparte na języku, a nie zaprojektowane do generowania obrazów, filmów lub reprezentacji kształtu, takich jak siatki 3D.

Przykłady z zadania Image Jigsaw. Każdy wiersz pokazuje pomieszane fragmenty, które model musi uporządkować w ich oryginalnej układance, z poprawną układanką pokazaną po prawej stronie.
W każdym przypadku ten rodzaj trenowania jest wykonywany po głównej fazie uczenia, gdy model już ma pewne zdolności do zrozumienia obrazów.
Poprzednie podejścia, takie jak szwajcarski artykuł z 2017 roku Nauczanie się reprezentacji wizualnych przez rozwiązywanie układanek jigsaw, wykorzystywały to podejście z mniej powodzeniem, na sieciach neuronowych typu CNN, co jest zauważalnie innym rodzajem architektury w porównaniu z nowoczesnym MLLM.

Z wydania z 2017 roku ‘Nauczanie się reprezentacji wizualnych przez rozwiązywanie układanek jigsaw’, wczesny przykład użycia fragmentacji jako nagrody opartej na wyzwaniu dla systemu neuronowego. Źródło: https://arxiv.org/pdf/1603.09246
W testach Visual Jigsaw doprowadził do tego, co autorzy twierdzą, że są spójne i mierzone poprawy w szerokim zakresie benchmarków: zadanie Image Jigsaw poprawiło postrzeganie drobne, zrozumienie układu przestrzennego i rozumowanie kompozycyjne; zadanie Video Jigsaw wzmocniło zdolność modelu do śledzenia sekwencji czasowych i rozumowania o kolejności zdarzeń; i zadanie 3D Jigsaw wzmocniło zrozumienie głębokości i rozumowanie przestrzenne przy użyciu tylko RGB-D wejść.
Przez wszystkie trzy modalności, artykuł powtarza, nowa metoda przewyższa kilka konkurencyjnych benchmarków, pomimo braku architektonicznych zmian, dodatkowych modułów wizualnych lub dodatkowych danych nadzorowanych:
‘Obszerne eksperymenty pokazują znaczne poprawy w postrzeganiu drobnym, rozumowaniu czasowym i zrozumieniu przestrzennym 3D. Nasze wyniki podkreślają potencjał samouczących się zadań wizualnych w post-trenowaniu MLLM i mają na celu zainspirować dalsze badania nad projektami wstępnymi.’
Nowy artykuł nosi tytuł Visual Jigsaw Post-Training Improves MLLMs, i pochodzi od sześciu naukowców z Nanyang Technological University, Linköping University i SenseTime Research. Artykuł jest zaopatrzony w stronę projektu z demonstracjami na żywo (i możesz nawet załadować swój własny obraz do demonstracji obrazu jigsaw). Kod i wagi dla projektu zostały udostępnione,
Metoda
Chociaż będziemy przyglądać się, jak informacje są rozdzielane, aby dostosować się do trzech testowanych modalności, powinniśmy najpierw rozważyć projekt nagrody dla nowego systemu.
Podejście Visual Jigsaw ocenia odpowiedzi modelu za pomocą stopniowej nagrody, a nie tylko prostego pass lub fail. Jeśli model predystuuje dokładną poprawną kolejność kawałków układanki, otrzymuje pełną nagrodę; jeśli odpowiedź jest w większości poprawna, ale nie idealna, model otrzymuje częściową punktację, skalowaną przez współczynnik dyskontowy, aby uniknąć przeceniania przypadków, które są bliskie sukcesu (co zapobiega temu, że model “oszukuje” system, powtarzając zgadywania, które są tylko częściowo poprawne).
Nieważne odpowiedzi, takie jak “oszustwo” polegające na używaniu tego samego numeru wielokrotnie, otrzymują wynik zero. Aby zachęcić do spójnego formatowania, model musi umieścić swoje rozumowanie wewnątrz <think> tagów i swoją ostateczną odpowiedź wewnątrz <answer> tagów. Otrzymuje małą premię, jeśli ten format jest używany poprawnie.
Obrazy
Aby utworzyć puzzle dla obrazów modalności, obraz jest najpierw podzielony na siatkę fragmentów, rozcinając go na równe bloki:

Przykłady obrazowych fragmentów do rozwiązania przez system.
Fragmenty są ułożone w stałej kolejności od lewego górnego rogu do prawego dolnego, jak w przypadku kolejności czytania na stronie, zanim zostaną pomieszane losowym tasowaniem. Następnie model jest narażony na ten pomieszany zestaw fragmentów i musi odgadnąć oryginalną kolejność, predystuując poprawną permutację, która przywraca oryginalny układ.
Podczas trenowania, 118 000 obrazów z zbioru COCO zostało użytych, z każdego obrazu wynikającego dziewięć fragmentów (tj. “kawałków układanki”). Podpowiedź podana systemowi jest pokazana wcześniej w tym artykule (obraz powyżej z podpisem rozpoczynającym się ‘Z materiałów uzupełniających nowego artykułu’).
Video
Dla zadania Video Jigsaw, film jest podzielony na sekwencję klipów, rozcinając go równomiernie w czasie, a następnie tasując klipy. Następnie model jest pokazywany tej pomieszanemu sekwencji i musi odgadnąć ich poprawną, oryginalną kolejność chronologiczną.

Przykłady zadania Video Jigsaw, z materiałów uzupełniających artykułu.
Do trenowania tej modalności użyto 100 000 filmów z zbioru LLaVA-Video, z każdego filmu podzielonego na sześć klipów. Aby uniemożliwić modelowi wykorzystanie oczywistych wskazówek dopasowania ramki na granicach klipów, 5% ramki na początku i końcu każdego klipu zostało obcięte.
Klipy zawierały nie więcej niż 12 ramki, każda o maksymalnej rozdzielczości 128x28x28 pikseli. Filmy krótsze niż 24 sekundy zostały wykluczone.
Podpowiedź dla tego zadania jest poniżej:

Podpowiedź RL przedstawiona modelom MLLM dla zadania Video Jigsaw, bez klipów, które byłyby przedstawione modelowi MLLM.
Dane 3D
Pełne zadanie 3D Jigsaw zwykle obejmuje rozbicie przestrzeni 3D (takiej jak voxel bloki lub punktowe chmury) na mniejsze kawałki i trenowanie modelu do odtworzenia ich oryginalnej układanki przestrzennej.
Jednakże, przeciętny MLLM nie jest wyposażony w surowe dane 3D bezpośrednio, zamiast tego polegając na semantycznie interpretowanych danych wejściowych obrazu lub filmu. Dlatego też, aby utworzyć zadanie, które nadal wykorzystuje rozumowanie 3D, a jednocześnie pozostaje zgodne z bieżącymi MLLM, autorzy wprowadzili bardziej przystępny wariant, wykorzystujący wspomniane wcześniej obrazy RGB-D (tj. 2D obrazy, które zawierają informacje o głębokości dla każdego piksela).

Przykłady pytań z 3D Spatial Understanding Benchmark, wykorzystywanych do oceny wyników w rozumowaniu względnym i ruchu kamery. Model 3D Jigsaw poprawnie wnioskuje zarówno relację przestrzenną między dwoma widokami sceny, jak i prawdopodobny kierunek ruchu kamery, przewyższając model Qwen2.5-VL-7B.
Od każdego obrazu RGB-D model otrzymuje pomieszaną listę punktów, które pierwotnie miały różne głębokości, sięgające od najbliższych do najdalszych, a celem jest odzyskanie ich poprawnej kolejności głębokościowej, wykorzystując tylko 2D obraz jako odniesienie:

Podpowiedź RL dla zadania 3D Jigsaw.
Każdy punkt jest oznaczony na obrazie (który jest pokazywany modelowi, ale nie jest wizualizowany w przykładzie powyżej), a model musi predystuować, który był najbliższy, drugi najbliższy itd., skutecznie odtwarzając oryginalną sekwencję głębokości bez dostępu do surowych wartości głębokości.
Zadanie 3D Jigsaw jest trenowane na obrazach RGB-D z zbioru ScanNet, wykorzystując 300 000 próbek utworzonych przez wybranie losowych zestawów sześciu punktów głębokościowych na obraz.

Przykłady chmur punktów z zbioru ScanNet, wykorzystywanych w zadaniu 3D Jigsaw. Źródło: https://arxiv.org/pdf/1702.04405
Każdy punkt musiał leżeć w zakresie głębokości od 0,1 do 10 metrów, a aby promować różnorodność, nie wolno było, aby dwa punkty w zestawie były bliżej siebie niż 40 pikseli w płaszczyźnie obrazu lub mniej niż 0,2 metra od siebie w głębokości.
Testy
Do początkowych testów, system wykorzystywał Qwen2.5-VL-7B-Instruct jako bazowy multimodalny model. Trenowanie wykorzystywało algorytm Group Relative Policy Optimization (GRPO), z usuniętymi regularizacją KL i stratą entropii.
Dla częściowych predykacji, współczynnik dyskontowy 0,2 został zastosowany. Trenowanie zadania Image Jigsaw wykorzystywało globalny rozmiar partii 256, podczas gdy zadania Video i 3D Jigsaw wykorzystywały 128. Stawka uczenia została ustalona na 1×10⁻⁶.
Dla każdej podpowiedzi, model generował 16 odpowiedzi przy temperaturze dekodowania 1,0. Zarówno zadania Image Jigsaw, jak i Video Jigsaw były trenowane przez 1000 kroków, podczas gdy zadanie 3D Jigsaw było trenowane przez 800 kroków.
Image Jigsaw
Model Image Jigsaw został przetestowany w trzech kategoriach benchmarków wizualnych: dla postrzegania drobnego i zrozumienia, MMVP, podzbiór postrzegania drobnego MMStar; MMBench; HR-Bench; V*; MME-RealWorld (lite); LISA-Grounding; i OVD-Eval.
Dla zrozumienia przestrzennego monokularnego, benchmarki były VSR; OmniSpatial; i Depth Anything V2 (DA-2K). Dla zrozumienia wizualnego kompozycyjnego, testy wykorzystywały Winoground i SugerCrepe++.
Trzy benchmarki zostały przetestowane, wszystkie pochodzące z Qwen2.5-VL-7B: ThinkLite-VL dla rozumowania multimodalnego; VL-Cogito dla ogólnych zadań wizualnych i naukowych; i LLaVA-Critic-R1 dla postrzegania obrazu.
Wszystkie zostały ocenione przy użyciu krótkich odpowiedzi, ponieważ rozumowanie łańcuchowe (CoT) czasem redukowało wyniki.

Wyniki oceny na benchmarkach obrazowych. Model Image Jigsaw poprawił wyniki w porównaniu z modelem Qwen2.5-VL-7B we wszystkich kategoriach zadań (tj. postrzeganie drobne i zrozumienie; zrozumienie przestrzenne monokularne; i rozumowanie wizualne kompozycyjne), przewyższając poprzednie benchmarki post-trenningowe.
Z wyników modelu Image Jigsaw, pokazanych powyżej, autorzy stwierdzają:
‘[Obraz powyżej] pokazuje, że nasza metoda poprawia spójnie zdolności wizualne na trzech typach benchmarków. Te wyniki potwierdzają, że włączenie zadania Image Jigsaw do post-trenowania znacznie wzmacnia umiejętności percepcyjne i zrozumienie wizualne MLLM poza strategiami post-trenningowymi opartymi na rozumowaniu.
‘Przypisujemy te poprawy temu, że rozwiązywanie zadań Image Jigsaw wymaga od modelu zwrócenia uwagi na szczegóły lokalnych fragmentów, wywnioskowania globalnych układów przestrzennych i rozumowania o relacjach między fragmentami, co bezpośrednio korzysta z postrzegania drobnego, przestrzennego i kompozycyjnego.’
Video Jigsaw
Dla zadania Video Jigsaw, ocena została przeprowadzona na AoTBench; Vinoground; TOMATO; FAVOR-Bench; TUNA-Bench; Video-MME; TempCompass; TVBench; MotionBench; LVBench; VSI-Bench; Video-TT; i CVBench.
Video-R1 został użyty jako benchmark, który został przeszkolony z cold-start supervised fine-tuning, a następnie z wzmocnionym uczeniem dla zrozumienia i rozumowania wideo. W tym przypadku oceny obejmowały pełny proces rozumowania, ponieważ stale dawały lepsze wyniki niż bezpośrednie odpowiedzi.
Wszystkie modele były ograniczone do 256x28x28 pikseli i przetestowane w trzech ustawieniach klatki – 16, 32 i 64:

Wyniki oceny na benchmarkach wideo, z modelem Video Jigsaw przewyższającym benchmark w sposób ciągły we wszystkich zadaniach i ustawieniach klatki.
Model Video Jigsaw wykazał spójne poprawy we wszystkich benchmarkach wideo i ustawieniach klatki, z zyskami szczególnie silnymi w zadaniach wymagających rozumowania czasowego i kierunkowego, takich jak te w AoTBench, oraz w benchmarkach rozumowania między-wideo, takich jak CVBench:
‘Te wyniki potwierdzają, że rozwiązywanie zadań Video Jigsaw zachęca model do lepszego pojmowania ciągłości czasowej, zrozumienia relacji między filmami i rozumowania o spójności kierunkowej, oraz uogólniania do holistycznych i ogólnych scenariuszy zrozumienia wideo.’
3D Data
Dla modalności 3D, model został oceniony na SAT-Real; 3DSRBench; ViewSpatial; All-Angles; wcześniej wspomniany OmniSpatial; VSI-Bench; SPARBench (tiny); i wcześniej wspomniany DA-2K.

Wyniki oceny na benchmarkach 3D: model 3D Jigsaw poprawił wyniki w zadaniach porównywania głębokości, a także w szerszych benchmarkach percepcji 3D, obejmujących dane wejściowe jednowidokowe, wielowidokowe i wideo egocentryczne.
Tutaj autorzy stwierdzają:
‘[Model 3D Jigsaw] osiąga znaczne poprawy we wszystkich benchmarkach. Niezaskakująco, największy zysk jest w benchmarku DA-2K, który jest bezpośrednio związany z naszym zadaniem pre-trenningowym porządkowania głębokości. Co więcej, obserwujemy spójne poprawy w szerokim zakresie innych zadań, w tym tych z danymi wejściowymi jednowidokowymi (np. 3DSRBench, OmniSpatial), wielowidokowymi (np. ViewSpatial, All-Angles) i wideo egocentrycznymi (np. VSI-Bench).
‘Te wyniki dowodzą, że nasze podejście nie tylko naucza modelu konkretnego umiejętności porządkowania głębokości, ale także skutecznie wzmacnia ogólną zdolność modelu do postrzegania i rozumienia struktury przestrzennej 3D.’
Wnioski
To, co nie jest całkowicie jasne z tego artykułu, to dokładna relacja między obrazami a opisami, która napędza tę poprawę wyników MLLM.
Początkowo, proces uczenia się przez rozwiązywanie układanek wydaje się bardzo analogiczny do naszych własnych wczesnych prób i rozwoju. Jednakże, przy bliższym spojrzeniu na artykuł, okazuje się, że język służy MLLM jako interesująca most między rzeczywistościami wizualnymi i semantycznymi.
* Proszę zauważyć, że autorzy artykułu preferują mniej powszechny termin ‘Multimodalne Duże Modele Językowe’, skrót MLLM. Jest to pojęcie wschodzące lub rzadko używane, które odnosi się do modeli, które mogą obszernie rozumować i analizować obrazy przestrzennie, ale które nie generują obrazów. W miarę pojawiania się nowych paradygmatów i modeli, ten leksykon jest pod stałą rewizją.
Pierwotnie opublikowane w czwartek, 2 października 2025












