Anderson의 관점
가장 최신의 언어 모델도 시간 논리 이해에 어려움을 겪는다

미래 상태를 예측하는 것은 컴퓨터 비전 연구에서 중요한 임무입니다. 특히 로봇공학 분야에서 실제 상황을 고려해야 하기 때문입니다. 임무에 중요한 작업을 맡은 기계 학습 시스템은 물리적 세계에 대한 적절한 이해가 필요합니다.
그러나 어떤 경우에는 시간적 현실에 대한 겉보기에 인상적인 지식이 속임수일 수 있습니다. 아랍에미리트의 새로운 논문에 따르면, 최신의 다중 모달 대규모 언어 모델(Multimodal Large Language Models, MLLMs)도 이미지에서 시간을 표현하는 방식을 해석할 때 어려움을 겪습니다.
예를 들어, 순차적인 이미지 쌍(아래 이미지 참조)은 인간에게는 쉽지만, 고급 MLLMs에게는 어려운 문제입니다. 특히 이미지의 순서가 바뀌거나, 단일 이미지로 연결되거나, 여러 이미지가 순서대로 배열된 경우 등입니다.

새로운 연구를 위해 컴파일된 데이터셋의 샘플입니다. 연구자들은 이 데이터를 https://huggingface.co/datasets/fazliimam/temporal-vqa/viewer에서 제공합니다.
연구자들은 모델에 기본적인 시간적推論 과제를 맡겼습니다. 예를 들어, 이벤트 순서를 결정하거나 시간 간격을 추정하는 것입니다. 그러나 7개의 MLLMs를 테스트한 결과, 모델들은 인간의 정확도보다 현저히 낮은 성능을 보였습니다.
‘전체적으로, 결과는 현재의 MLLMs가 제안된 벤치마크에 어려움을 겪고 있음을 보여줍니다. GPT-4o는 다른 모델보다 우수한 성능을 보였지만, 일관된 시간적推論을 보여주지 못했습니다.
‘모델들의 정확도는 낮았으며, 이는 시간적 순서를 이해하고 해석하는 능력에 대한重大한 제한을 보여줍니다. 이러한 결함은 모델에 다중 이미지 입력이나 최적화된 프롬프트를 제공하더라도 나타납니다. 이는 현재의 아키텍처와 훈련 방법이 시간적 순서를 이해하는 데 부족함을 보여줍니다.’
기계 학습 시스템은 가장 정확한 결과를 내는 동시에 가장 효율적이고 사람들에게 호감을 주는 결과를 최적화하도록 설계되었습니다. 그러나 이러한 시스템이 명시적으로 이유를 설명하지 않기 때문에,Shortcut을 사용하는지 여부를 알기 어려울 수 있습니다.
이 경우, MLLM은 올바른 答案에 도달할 수 있지만, 그 방법은 잘못된 것입니다. 이러한 答案이 올바르다고 해도, 모델은 나중에 같은 방법으로 잘못된 결과를 내놓을 수 있습니다.
さらに, 이러한 잘못된 방법이 인간의 피드백을 통해 데이터와 모델에 반영되면, 더 심각한 문제가 될 수 있습니다.
이 경우, MLLMs는 시간적 현실과 시간적 현상을真正로 이해하지 못하고, 보조적인 지표를 관찰하고錨定하는 것으로 보입니다.
이는 MLLMs가 시간적 현상을 일반화하지 못한다는 것을 보여줍니다. 적어도 인간이那样할 수 있는 정도까지는 아닙니다.
새로운 논문은 다중 모달 MLLMs가 시각적 시간적 이해와 推論을 할 수 있는가? 答案은 아니오!라는 제목으로, 모하메드 빈 자예드 인공지능 대학과 알리바바 국제 디지털 커머스의 3명의 연구자에 의해 발표되었습니다.
데이터와 테스트
저자들은 이전의 벤치마크와 연구가 단일 이미지 입력이나 너무 쉬운 질문에 집중하고 있기 때문에, MLLMs의 시간적推論 능력을 제대로 평가하지 못한다고 주장합니다.
따라서 저자들은 두 가지 새로운 접근 방식을 제안합니다. 시간적 순서 이해(Temporal Order Understanding, TOU)와 시간 간격 추정(Time-lapse Estimation, TLE)입니다. TOU 접근 방식은 모델이 두 개의 비디오 프레임에서 이벤트 순서를 결정하는 능력을 테스트합니다. TLE 방법은 모델이 두 개의 이미지 사이의 시간 간격을 추정하는 능력을 평가합니다.

TemporarlVQA 벤치마크의 두 가지 주요 작업: 시간적 순서 이해와 시간 간격 추정
연구자들은 TOU 벤치마크를 위해 360개의 이미지 쌍을 수집했습니다. 이미지들은 Pixabay와 Pexels의 오픈 소스 비디오에서 가져왔습니다. 이렇게 하면 데이터셋을 GUI를 통해 제공할 수 있었습니다.
비디오는 일상 활동을 하는 사람들부터 비인간적인 내용인 동물과 식물까지 다양한 주제를 다루었습니다. 이러한 이미지 쌍은 이벤트 순서를 명확하게 보여줄 수 있도록 선택되었습니다.
인간의 선택을 통해 프레임이 명확하게 순서를 정할 수 있도록 했습니다. 예를 들어, 한 쌍의 이미지에서는 부분적으로 채워진 티컵과 같은 티컵이 완전히 차있는 티를 보여줍니다. 이러한 순서는 쉽게 식별할 수 있습니다.

이 두 개의 이미지의 시간적 논리는 티가 스푼으로 빨리 돌아가지 않는다는 것입니다.
이렇게 360개의 이미지 쌍을 얻었습니다.
TLE 접근 방식에서는 구글과 플리커에서 저작권이 없는 이미지와 유튜브의 저작권이 없는 비디오의 일부 프레임을 선택했습니다. 이미지의 주제는 몇 초에서 몇 년까지의 시간 간격을 보여주는 장면이나 객체를 특징으로 했습니다.
이렇게 125개의 이미지 쌍을 수집했습니다.
모든 MLLMs가 다중 이미지 처리를 지원하지 않기 때문에, 테스트는 각 모델의 능력에 맞게 달라졌습니다.
수집된 데이터셋의 여러 버전을 생성했습니다. 일부 쌍은 수직으로 연결되고, 다른 일부는 수평으로 연결되었습니다. 또 다른 변형에서는 실제 시간적 순서를 바꾸었습니다.
두 가지 프롬프트 유형을 개발했습니다. 첫 번째는 다음과 같은 템플릿을 따랐습니다.
첫 번째 이미지의 이벤트는 두 번째 이미지의 이벤트보다 먼저 발생했나요? 참 또는 거짓을 이유와 함께 표시하십시오.
두 번째는 다음과 같은 스키마를 따랐습니다.
이 두 개의 이미지 중에서 먼저 발생한 이벤트를 표시하십시오. 이유와 함께 왼쪽 또는 오른쪽, 위 또는 아래, 첫 번째 또는 두 번째를 표시하십시오.
TLE의 경우, 모델은 두 개의 이미지 사이의 시간 간격을 평가해야 했습니다. 시간 단위로는 초, 분, 시, 일, 월, 년이 있었습니다.
이 경우 사용된 프롬프트는 다음과 같습니다.
제공된 이미지에서 첫 번째 이미지와 두 번째 이미지 사이의 시간 간격을 추정하십시오.
다음 옵션 중 하나를 선택하십시오.
-
15초 미만
B. 2분에서 15분 사이
C. 1시간에서 12시간 사이
D. 2일에서 30일 사이
E. 4개월에서 12개월 사이
F. 3년 이상
테스트에 사용된 MLLMs는 ChatGPT-4o, Gemini1.5-Pro, LLaVA-NeXT, InternVL, Qwen-VL, Llama-3-vision, 및 LLaVA-CoT였습니다.
시간적 순서 이해: 결과

다양한 모델과 입력 레이아웃에 대한 시간적 순서 이해 결과
위의 결과에서, 저자들은 모든 테스트된 MLLMs가 시간적 순서 이해 벤치마크에서 어려움을 겪었으며, 이는 모델들의 시간적 순서를 해석하고 推論하는 능력에重大한 제한을 보여줍니다.
저자들은 이러한 결과가 모델들의 시간적 순서 이해 능력에 대한 근본적인 제한을 보여줍니다. 이는 다중 이미지 입력이나 최적화된 프롬프트를 사용하더라도 나타납니다.
테스트는 프롬프트 전략에 따라 성능의 큰 차이를 보여주었습니다. GPT-4o는 최적화된 프롬프트에서 성능을 개선했지만(단일 이미지에서 4%, 다중 이미지에서 65.3%), 성능은 여전히 낮은 수준에 머물렀습니다.
LLaVA-NeXT와 Qwen-VL과 같은 모델은 대체 프롬프트에서 성능이 저하되는 등 더 민감했습니다.
이미지 레이아웃(즉, 수직 대 수평)은 모델의 성능에重大한 영향을 미쳤습니다. GPT-4o는 수직 배열에서 일관성을 개선했지만(39.2%에서 52.8%로), 다른 모델은 강한 방향적 편향을 보여주었습니다.
이러한 불일치는 모델들이真正로 시간적 순서를 분석하거나 시간 경과를 이해하는 대신, 공간적 단서나 이미지 레이아웃에 의존하여 결정을 내린다는 것을 시사합니다.

GPT-4o의 예측을 다른 입력 순서에서 테스트한 결과
단일 이미지와 다중 이미지 입력을 비교한 테스트에서는 전체적인 성능 개선이 제한적이었습니다. GPT-4o는 다중 이미지 입력에서 약간 더 나은 성능을 보였지만(31.0%에서 43.6%로, P1에서; 46.0%에서 65.3%로, P2에서), 다른 모델은 안정적인 nhưng 낮은 정확도를 보였습니다.
저자들은 이러한 결과가 추가적인 시각적 컨텍스트가 시간적 推論 능력을 크게 향상시키지 않는다는 것을 보여줍니다. 모델들은 시간적 정보를 효과적으로 통합하지 못합니다.
인간 연구
인간 연구에서, 3개의 설문조사를 통해 최고 성능의 다중 모달 MLLM과 인간의 성능을 비교했습니다.
인간은 90.3%의 정확도를 달성하여 GPT-4o의 65.3%를 25%超过했습니다. 데이터셋은 신뢰할 수 있었으며, 인간 오류는 최소화되었으며, 정답에 대한 일관된 동의가 있었습니다.

첫 번째 테스트의 인간 사용자 연구 결과
시간 간격 추정: 결과

시간 간격 추정 결과: 모델의 정확도를 평가하는 테스트
이 테스트에서, MLLMs는 시간 간격 추정에서 중간 정도의 성능을 보였습니다. GPT-4o는 70%의 정확도를 달성했지만, 다른 모델은 훨씬 낮은 성능을 보였습니다.
저자들은 다음과 같이 주장합니다.
‘시간 간격 추정 작업은 MLLMs가 이미지 쌍 사이의 시간 간격을 추정하는 능력을 테스트합니다. 모든 MLLMs,包括 GPT-4o와 Gemini1.5-Pro,이 작업에서 어려움을 겪습니다. GPT-4o는 60-70%의 중간 정도의 정확도를 보입니다. 그러나 일관된 성능을 보여주지 못합니다.
‘LLaVA-CoT는 초와 일의 시간 간격에서 優秀한 성능을 보이지만, 다른 시간 간격에서는 낮은 성능을 보입니다.’
인간 연구
시간 간격 추정의 인간 연구에서, 평균 인간 성능은 GPT-4o(이 범주에서 최고 성능 모델)의 12.3%를超过했습니다.
저자들은 일부 테스트가 매우 어려웠으며, 한 경우 모든 인간 참여자가 잘못된 答案을 반환했으며, 모든 AI 모델도 잘못된 答案을 반환했다고 주장합니다.
저자들은 GPT-4o가 합리적으로 강력한 推論 능력을 보이지만, 이미지의 순서에 관계없이 일관된 성능을 보여주지 못한다고 결론지었습니다.
결론
MLLMs가 결국 충분한 ‘Shortcut’ 데이터를 수집하여 이러한 유형의 도전을 극복할 수 있다면, 인간과 같은 일반화 능력을 개발했는지 여부는 중요하지 않을 수 있습니다.
또한 우리가 시간적 推論 능력을 얻는 정확한 경로는 알려지지 않았습니다. 우리는 이러한 유형의 테스트에서 ‘본능’으로 작동하는 패턴을 배우기까지 ‘속임수’를 사용하는지 여부도 모릅니다.
* 모델은 점점 더 인간의 피드백에 기여한 손실 함수로 최적화되고, 인간의 테스트와 이후의 트라이에 의해 효과적으로 최적화됩니다.
最初에 게시됨: 2025년 1월 27일












