Anderson의 관점

퍼즐을 풀면서 AI의 시각적推論 능력을 향상시키다

mm
Unite.AI를 Google의 선호 소스에 추가
'An industrial robot attempting to solve a jigsaw puzzle. Besides one robotic arm with which it assembles the puzzle, the robot is not anthropomorphic , and views the jigsaw puzzle with a single camera similar to a surveillance camera UHQ, stock'. SDXL and Adobe Firefly V3.

새로운 연구에 따르면, 퍼즐을 풀면서 AI 모델이 시각적 인지를 향상시킬 수 있다고 합니다. 이미지, 비디오, 3D 장면을 재배열하여 모델이 시각적 능력을 향상시킬 수 있습니다.

 

현재 Multimodal Large Language Models (MLLMs*)을 앞으로 밀어붙이기 위해競爭이 치열한 상황에서, 쉽게 성과를 낼 수 있는 방법은 거의 없으며, 무료로 성과를 얻을 수 있는 방법은 없습니다.

2025년에 발표된 중국의 오픈소스 소프트웨어 중 많은 것이 개발 및 실행 비용이 낮다고 보고되었지만, 서구 국가의 소프트웨어는 문제를 해결하기 위해 더 많은 데이터, 더 많은 연산 능력, 더 많은 전기를 사용하는 경향이 있습니다(그러나 최근에 언급한 바와 같이, 실제 사람의 주석을 더 많이 사용하는 것은 너무 비싸기 때문에, $1조 이상의 자금을 투자한 제네럴 AI 혁명에서도 마찬가지입니다).

연구 문헌에서, AI 아키텍처의 진화를 위한 대부분의 कथ된 ‘무료’ 접근법은 약간의 개선만 제공하거나, 가장 중요하게 추구되는 영역이 아닌 영역에서 개선만 제공합니다. 그렇지만, AI 개발의 속도를 가속화할 수 있는 새로운 ‘기본 원리’를 찾는 것은 너무 매력적이기 때문에 放棄할 수 없습니다.

퍼즐을 풀면서

그렇지만, 중국의 기관間의 새로운 학술 협력에 따르면, VLMs가 퍼즐을 풀면서 성능이 크게 향상된다고 합니다. 이 강화 학습 접근법은 이전에 이 영역에서 약간의 성공만을 거두었으며, 또한 추가 시스템, 보조 모델 또는 기타 ‘부가’ 프로세스가 필요하지 않습니다.

Visual Jigsaw는 멀티모달 대규모 언어 모델의 시각 중심 능력을 향상시키는 자체 감독 후 처리 프레임워크입니다. 이미지, 비디오, 3D 데이터를 통해 조각 작업을 수행하여 모델이 이미지의 세부적인 인식, 공간적 인식, 구성적 인식을 향상시키고, 비디오의 시간적推論을 강화하며, 3D 장면의 기하학적 인식을 향상시킵니다. 위의 이미지의 레이더 차트는 일관된 성능 향상을 보여주며, 각 벤치마크의 값 척도를 조정하여 명확성을 높였습니다. 출처: https://arxiv.org/pdf/2509.25190

Visual Jigsaw는 멀티모달 대규모 언어 모델의 시각 중심 능력을 향상시키는 자체 감독 후 처리 프레임워크입니다. 이미지, 비디오, 3D 데이터를 통해 조각 작업을 수행하여 모델이 이미지의 세부적인 인식, 공간적 인식, 구성적 인식을 향상시키고, 비디오의 시간적推論을 강화하며, 3D 장면의 기하학적 인식을 향상시킵니다. 위의 이미지의 레이더 차트는 일관된 성능 향상을 보여주며, 각 벤치마크의 값 척도를 조정하여 명확성을 높였습니다. 출처: https://arxiv.org/pdf/2509.25190

연구자들이 개발한 시스템은 Visual Jigsaw라고 불리며, 기존의 MLLM을 조각난 이미지, 비디오, 3D 데이터로 훈련시킵니다. 이 접근법에는 세 가지 모달리티가 있습니다: 이미지, 비디오, 3D(즉, CGI 스타일의 메시)입니다.

세 가지 Visual Jigsaw 작업의 표현. 이미지 조각 작업에서는 이미지의 패치를 나누고 섞은 다음, 모델이 원래 레이아웃을 예측합니다. 비디오 조각 작업에서는 클립을 섞은 다음, 모델이 원래 순서를 복원합니다. 3D 조각 작업에서는 깊이가 다른 점을 섞은 다음, 모델이 가장 가까운 점부터 가장 먼 점까지의 순서를 예측합니다. 모델의 출력은 실제 값과 비교하여 평가되며, 부분적으로 올바른 해결책에는 부분적인 점수가 주어집니다.

세 가지 Visual Jigsaw 작업의 표현. 이미지 조각 작업에서는 이미지의 패치를 나누고 섞은 다음, 모델이 원래 레이아웃을 예측합니다. 비디오 조각 작업에서는 클립을 섞은 다음, 모델이 원래 순서를 복원합니다. 3D 조각 작업에서는 깊이가 다른 점을 섞은 다음, 모델이 가장 가까운 점부터 가장 먼 점까지의 순서를 예측합니다. 모델의 출력은 실제 값과 비교하여 평가되며, 부분적으로 올바른 해결책에는 부분적인 점수가 주어집니다.

Visual Jigsaw의 훈련 방법은 AI 모델이 시각적 정보를 이해하는 능력을 향상시키는 데 도움이 됩니다. 이는 이미지, 비디오, 3D 데이터를 재배열하여 모델이 시각적 능력을 향상시킵니다.

이 과정은 이미지나 비디오를 생성하거나 추가적인 시각적 구성 요소를 사용할 필요가 없습니다. 이 방법은 강화 학습에서 검증 가능한 보상(RLVR)이라는 시스템에 속하며, 모델이 올바른 답변을 기반으로 보상을 받으며, 자동적인 규칙에 따라 보상이 주어집니다. 따라서, 인간의 주석이 필요하지 않습니다.

이 중요한 사실은 새로운 논문에서 khó 발견할 수 있습니다. 시스템이 의미적으로 퍼즐을 풀고 있으며, 인간이 퍼즐을 풀 때와 같은 방식으로 형상 представ적으로 학습하지 않는다는 것입니다.

새로운 논문의 보충 자료에서, 텍스트 기반의 보조 학습 과정을 보여주는 강화 학습 작업의 예.

새로운 논문의 보충 자료에서, 텍스트 기반의 보조 학습 과정을 보여주는 강화 학습 작업의 예. 이 이미지는 MLLM에 표시된 이미지와 함께 표시되지 않습니다.

MLLM은 광범위하게 시각 중심 작업을 다루지만, 언어 기반 아키텍처로, 이미지, 비디오 또는 3D 메시와 같은 형상 표현을 생성하도록 설계되지 않았습니다.

이미지 조각 작업의 예. 각 행은 모델이 원래 레이아웃으로 재배열해야 하는 섞인 패치와, 올바른 레이아웃을 보여줍니다.

이미지 조각 작업의 예. 각 행은 모델이 원래 레이아웃으로 재배열해야 하는 섞인 패치와, 올바른 레이아웃을 보여줍니다.

이 훈련은 모델이 이미지를 이해하는 기본 능력을 갖춘 후에 수행됩니다.

이전의 접근법, 예를 들어 2017年的 스위스 논문 퍼즐을 풀면서 시각적 표현을 학습하는 무감독 학습은 이와 유사한 강화 학습 접근법을 사용했지만, 현대의 MLLM과는 다르게, convolutional neural networks(CNNs)를 사용하여 약간의 성공을 거두었습니다.

2017년 발표된 '퍼즐을 풀면서 시각적 표현을 학습하는 무감독 학습'에서, 신경망에 대한 보상 기반 도전을 보여주는 초기 예.

2017년 발표된 ‘퍼즐을 풀면서 시각적 표현을 학습하는 무감독 학습’에서, 신경망에 대한 보상 기반 도전을 보여주는 초기 예.

테스트에서, Visual Jigsaw는 광범위한 벤치마크에서 일관된 성능 향상을 보여주었습니다. 이미지 조각 작업은 세부적인 인식, 공간적 레이아웃 이해, 구성적推論을 향상시켰습니다. 비디오 조각 작업은 모델의 시간적 순서 추적 능력과 이벤트 순서에 대한推論을 강화했습니다. 3D 조각 작업은 깊이 기반 이해와 공간적推論을 강화했습니다.

모든 세 모달리티에서, 논문은 새로운 방법이 여러 경쟁적인 기준선보다 성능이 좋았으며, 아키텍처 변경, 추가 시각적 모듈, 또는 추가적인 감독 데이터가 필요하지 않았습니다.

‘광범위한 실험에서, 세부적인 인식, 시간적推론, 3D 공간적 이해에서 상당한 향상을 보여주었습니다. 우리의 발견은 MLLM의 후처리에서 시각 중심 작업의 잠재력을 강조하며, 시각 중심 전처리 디자인에 대한 추가적인 연구를 촉발시키고자 합니다.’

새로운 논문Visual Jigsaw 후처리가 MLLM을 향상시킨다라고 제목이 붙여져 있으며, 南洋理工大学, Linköping University, SenseTime Research의 6명의 연구자에 의해 발표되었습니다. 이 논문은 프로젝트 사이트와 함께 제공되며, 라이브 데모(이미지 기반 조각 데모에 자신의 이미지를 로드할 수 있습니다)와 함께 제공됩니다. 이 프로젝트의 코드와 가중치공개되었습니다.

방법

새로운 시스템의 보상 설계를 고려하기 전에, 세 가지 테스트된 모달리티를 위한 정보를 분할하는 방법을 살펴보겠습니다.

Visual Jigsaw 접근법은 모델의 응답을 등급별 보상을 사용하여 평가하며, 단순한 통과 또는 실패가 아닙니다. 모델이 정확한 순서를 예측하면 전체 보상을 받으며, 부분적으로 올바른 답변일 경우, 부분적인 보상을 받습니다. 이 보상은 할인 계수를 사용하여 계산되며, 모델이 부분적으로 올바른 답변을 반복하여 시스템을 조작하는 것을 방지합니다.

잘못된 답변, 예를 들어 같은 숫자를 반복하여 사용하는 경우, 0의 점수를 받습니다. 일관된 형식을鼓励하기 위해, 모델은 자신의 추론을 <think> 태그 안에 넣고, 최종 답변을 <answer> 태그 안에 넣어야 합니다. 올바른 형식을 사용하면 작은 보너스를 받습니다.

이미지

이미지 모달리티를 위한 퍼즐을 만들기 위해, 이미지를 동일한 크기의 블록으로 나누어, 격자로 만듭니다.

시스템이 풀어야 하는 이미지 기반 패치의 예.

시스템이 풀어야 하는 이미지 기반 패치의 예.

패치는 왼쪽 위에서 오른쪽 아래까지의 순서로 배열되며, 페이지의 읽기 순서와 같습니다. 그런 다음 패치는 무작위로 섞여, 모델은 원래 순서를 예측하여 원래 레이아웃을 복원해야 합니다.

훈련에서는 COCO 데이터셋의 118,000개의 이미지에서 각 이미지당 9개의 패치(즉, ‘퍼즐 조각’)를 사용했습니다. 시스템에 주어진 프롬프트는 이 기사의 앞부분에 표시되어 있습니다(이미지의 캡션이 ‘새로운 논문의 보충 자료에서’로 시작하는 이미지입니다).

비디오

비디오 조각 작업을 위해, 비디오를 시간적으로 동일한 간격으로 나누어, 클립으로 만듭니다. 그런 다음 클립을 섞어, 모델이 원래 순서를 복원해야 합니다.

비디오 퍼즐 도전의 예. 논문의 보충 자료에서.

비디오 퍼즐 도전의 예. 논문의 보충 자료에서.

이 모달리티의 훈련에서는 LLaVA-Video 데이터셋의 100,000개의 비디오를 사용했으며, 각 비디오는 6개의 클립으로 나누어졌습니다. 클립 경계에서 명백한 프레임 매칭 큐를 모델이 이용하지 않도록 하기 위해, 각 클립의 시작과 끝에서 5%의 프레임을 제거했습니다.

클립은 12개의 프레임을 초과하지 않으며, 최대 128x28x28 픽셀의 해상도를 가집니다. 24초보다 짧은 비디오는 제외되었습니다.

이 작업의 프롬프트는 아래에 표시되어 있습니다.

비디오 작업에 대한 강화 학습 프롬프트.

비디오 작업에 대한 강화 학습 프롬프트. MLLM에 표시된 클립이 표시되지 않습니다.

3D 데이터

전체 3D 조각 작업은 일반적으로 3D 공간(예: voxel 블록 또는 point cloud 조각)을 더 작은 조각으로 나누어, 모델이 원래 공간적 레이아웃을 재구성하도록 훈련하는 것을 포함합니다.

그러나 평균 MLLM은 원시 3D 데이터를 직접 처리할 수 없으며, 시각적 또는 언어적 입력에 의존합니다. 따라서 현재 MLLM과 호환되는 3D 推論을 가능하게 하는 더 구체적인 변형을 생성하기 위해, 연구자들은 RGB-D 이미지(즉, 각 픽셀에 대한 깊이 정보가 포함된 2D 이미지)를 사용했습니다.

3D 공간적 이해 벤치마크에서 상대적 관점과 카메라 운동에 대한推論을 평가하는 예제 질문.

3D 공간적 이해 벤치마크에서 상대적 관점과 카메라 운동에 대한推論을 평가하는 예제 질문. 3D 조각 모델은 장면의 공간적 관계와 카메라 회전의 가능성 방향을 모두 올바르게 추론하며, Qwen2.5-VL-7B 기준선보다 성능이 좋습니다.

각 RGB-D 이미지에서, 모델은 깊이가 다른 점들의 섞인 목록을 받으며, 2D 이미지를 참조하여 깊이에 따른 올바른 순서를 복원해야 합니다.

3D 조각 작업의 강화 학습 프롬프트.

3D 조각 작업의 강화 학습 프롬프트.

각 점은 이미지에 표시되며(위의 이미지에 직접 표시되지 않음), 모델은 가장 가까운 점, 두 번째로 가까운 점, 그리고 가장 먼 점의 순서를 예측해야 합니다. 즉, 원래의 깊이 순서를 재구성해야 합니다.

3D 조각 작업은 ScanNet 데이터셋의 RGB-D 이미지에서 300,000개의 샘플을 사용하여 훈련되며, 각 이미지당 6개의 깊이 점을 선택합니다.

3D 조각 작업에서 사용된 ScanNet 데이터셋의 점 클라우드 예.

3D 조각 작업에서 사용된 ScanNet 데이터셋의 점 클라우드 예. 출처: https://arxiv.org/pdf/1702.04405

각 점은 0.1에서 10미터 사이의 깊이 범위에 있어야 하며, 다양성을 촉진하기 위해, 한 세트 내의 두 점은 이미지 평면에서 40픽셀 이내에 있거나, 깊이에서 0.2미터 이내에 있지 않아야 합니다.

테스트

초기 테스트에서는 Qwen2.5-VL-7B-Instruct를 기준 모델로 사용했습니다. 훈련에는 Group Relative Policy Optimization (GRPO) 알고리즘이 사용되었으며, KL 정규화와 엔트로피 손실이 제거되었습니다.

부분 예측의 경우, 0.2의 할인 계수가 적용되었습니다. 이미지 조각 훈련에서는 배치 크기가 256으로 설정되었으며, 비디오 및 3D 조각에서는 128으로 설정되었습니다. 학습률은 1×10⁻⁶으로 설정되었습니다.

각 프롬프트에 대해, 모델은 16개의 응답을 1.0의 디코딩 온도에서 생성했습니다. 이미지 및 비디오 조각 작업은 1,000 스텝으로 훈련되었으며, 3D 조각 작업은 800 스텝으로 훈련되었습니다.

이미지 조각

이미지 조각 모델은 세 가지 범주의 시각 중심 벤치마크에서 테스트되었습니다: 세부적인 인식 및 이해를 위한 MMVP, MMStar의 세부적인 인식 하위 집합, MMBench, HR-Bench, V\*, MME-RealWorld(lite), LISA-Grounding, OVD-Eval.

모노큘러 공간적 이해를 위한 벤치마크는 VSR, OmniSpatial, DA-2K(Depth Anything V2)였습니다. 구성적 시각적 이해를 위한 테스트는 Winoground, SugerCrepe++를 사용했습니다.

세 가지 기준선이 테스트되었습니다. 모두 Qwen2.5-VL-7B에서 파생되었습니다: ThinkLite-VL은 멀티모달 推論을 위한 것이었으며, VL-Cogito는 일반적인 시각 및 과학 작업을 위한 것이었으며, LLaVA-Critic-R1은 이미지 인식을 위한 것이었습니다.

모두 짧은 답변만을 사용하여 평가되었으며, 이는 체인-오브-사고(Chain-of-Thought) 推論이 때때로 성능을 저하시키기 때문입니다.

이미지 벤치마크의 평가 결과. 이미지 조각은 Qwen2.5-VL-7B 기준 모델보다 모든 작업 범주에서 성능이 향상되었으며, 이전의 후처리 기준선을 초과했습니다.

이미지 벤치마크의 평가 결과. 이미지 조각은 Qwen2.5-VL-7B 기준 모델보다 모든 작업 범주에서 성능이 향상되었으며, 이전의 후처리 기준선을 초과했습니다.

이미지 조각의 결과에 대해 저자들은 다음과 같이 말합니다:

‘위의 이미지에서 볼 수 있듯이, 우리의 방법은 세 가지 유형의 벤치마크에서 시각 중심 능력을 일관되게 향상시킵니다. 이러한 결과는 이미지 조각 후처리가 MLLM의 시각적 기반과 세부적인 시각적 이해를 크게 향상시킨다는 것을 확인합니다. ‘

‘우리는 이러한 향상을 모델이 지역 패치 세부 사항에 주목하고, 전역적인 공간적 레이아웃을 추론하며, 패치 간의 관계를 추론해야 하기 때문에, 세부적인 이해, 공간적 이해, 구성적 이해에 직접적인 이점이 있기 때문으로 돌립니다.’

비디오 조각

비디오 조각의 경우, AoTBench, Vinoground, TOMATO, FAVOR-Bench, TUNA-Bench, Video-MME, TempCompass, TVBench, MotionBench, LVBench, VSI-Bench, Video-TT, CVBench에서 평가되었습니다.

비디오-R1은 기준선으로 사용되었으며, 차가운 시작에 대한 감독된 미세 조정과 비디오 이해 및 推論을 위한 강화 학습을 사용하여 훈련되었습니다. 이 경우, 평가에는 전체 推論 과정도 포함되었습니다. 이는 직접적인 답변보다 일관되게 더好的 결과를 생성했기 때문입니다.

모델은 256x28x28 픽셀로 제한되었으며, 16, 32, 64 프레임 설정에서 테스트되었습니다.

비디오 벤치마크의 평가 결과. 비디오 조각은 모든 작업과 프레임 설정에서 기준선보다 성능이 좋았습니다.

비디오 벤치마크의 평가 결과. 비디오 조각은 모든 작업과 프레임 설정에서 기준선보다 성능이 좋았습니다.

비디오 조각은 비디오 이해 벤치마크와 프레임 설정에서 일관된 향상을 보여주었습니다. 특히 AoTBench와 CVBench와 같은 시간적 연속성과 방향성을 요구하는 작업에서 강한 향상을 보여주었습니다.

‘이러한 결과는 비디오 조각을 풀면서 모델이 시간적 연속성을 더 잘 포착하고, 비디오 간의 관계를 이해하며, 방향적 일관성을 이유로하고, 전체적인 비디오 이해 시나리오에 일반화할 수 있음을 확인합니다.’

3D 데이터

3D 모달리티의 경우, SAT-Real, 3DSRBench, ViewSpatial, All-Angles, OmniSpatial, VSI-Bench, SPARBench(tiny), DA-2K에서 평가되었습니다.

3D 벤치마크의 평가 결과: 3D 조각은 깊이 비교 작업과 더 넓은 3D 인식 벤치마크에서 성능이 향상되었습니다.

3D 벤치마크의 평가 결과: 3D 조각은 깊이 비교 작업과 더 넓은 3D 인식 벤치마크에서 성능이 향상되었습니다.

저자들은 다음과 같이 말합니다:

‘3D 조각은 모든 벤치마크에서 상당한 향상을 보여주었습니다. 당연히, 가장 큰 향상은 DA-2K와 같은 깊이 추정 벤치마크에서 나타났습니다. 더 중요한 것은, 우리는 싱글 뷰, 멀티 뷰, 에고센트릭 비디오 입력을 포함한 다양한 작업에서 일관된 향상을 관찰했습니다. ‘

‘이러한 결과는 우리의 접근법이 깊이 순서뿐만 아니라 모델의 일반적인 3D 공간적 구조에 대한 인식과 推論 능력을 강화한다는 것을 보여줍니다.’

결론

이 논문에서 명확하지 않은 점은 이미지와 설명 사이의 정확한 관계입니다. 이 관계가 MLLM의 성능을 향상시키는 데 어떻게 기여하는지입니다.

일견에, 퍼즐을 풀면서 학습하는 과정은 우리의 초기 학습과 발달과 유사해 보입니다. 그러나 더 깊이 살펴보면, 언어가 MLLM에 대한 시각적 및 의미적 현실 사이의 매개체 역할을 하는 방식이 나타납니다.

 

* 참고로, 이 논문의 저자는 ‘멀티모달 대규모 언어 모델’이라는 용어를 선호하며, 이는 ‘MLLMs’로 약어화됩니다. 이는 새로운 용어이며, 이미지의 공간적 분석과 推論을 수행할 수 있지만, 이미지를 생성하지 않는 모델에 적용됩니다. 새로운 패러다임과 모델이 등장함에 따라, 이 용어는不断으로 개정되고 있습니다.

최초로 게시된 날짜: 2025년 10월 2일

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: [email protected]