Anderson의 관점

AI가 아날로그 시계를 읽는 어려움은 더 깊은 의미를 가질 수 있다

mm
Unite.AI를 Google의 선호 소스에 추가
ChatGPT-4o and Adobe Firefly.

중국과 스페인의 연구자들이 발표한 새로운 논문에 따르면, GPT-4.1과 같은 고급 다중 모드 AI 모델은 아날로그 시계의 이미지를 통해 시간을 읽는 데 어려움을 겪는 것으로 나타났다. 시계의 작은 시각적 변화는 주요 해석 오류를 일으킬 수 있으며, 미세 조정은 오직 친숙한 예제에서만 도움이 된다. 이러한 결과는 실제 작업에서 이러한 모델의 신뢰성에 대한 우려를 제기한다.

 

인간이 어떤 영역에 대한 깊은 이해를 개발할 때, 예를 들어 중력이나 기본 물리적 원리와 같은 경우, 우리는 특정 예제를 넘어 기본적인 추상화를 이해하게 된다. 이것은 우리가 그 지식을 창의적으로 적용할 수 있도록 해주며, 새로운 상황이나 예제를 인식할 수 있도록 해준다.

중요한 영역의 경우, 우리는 그것을 존재하지 않는 곳에서도 인식할 수 있다. 예를 들어, pareidolia는 높은 비용의 인식 실패를 방지하기 위해 발생하는 현상이다. 이러한 패턴 인식 메커니즘은 실제 패턴이 없는 곳에서도 패턴을 찾도록 우리를 유도한다.

영역이 우리에게 처음으로 노출될 때, 그리고 반복적으로 노출될수록, 그 영역에 대한 이해는 더 깊고 일생에 걸쳐 지속된다. 아날로그 시계는 우리가 아이들일 때 처음으로 노출되는 시각적 데이터 중 하나이다. 이러한 시계는 시간을 가르치기 위해 사용된다.

시간을 가르치기 위한 교육 도구. 출처: https://www.youtube.com/watch?v=IBBQXBhSNUs

시간을 가르치기 위한 교육 도구. 출처: https://www.youtube.com/watch?v=IBBQXBhSNUs

시계 디자인의 변화는 때때로 우리에게 도전을 줄 수 있지만, 초기에 형성된 영역에 대한 이해의 탄력성은 khá ấn tượng하다. 우리는 복잡하거나 ‘이상한’ 디자인 선택에도 불구하고 아날로그 시계를 식별할 수 있다.

시계의 일부 어려운 얼굴. 출처: https://www.ablogtowatch.com/wait-a-minute-legibility-is-the-most-important-part-of-watch-design/

시계의 일부 어려운 얼굴. 출처: https://www.ablogtowatch.com/wait-a-minute-legibility-is-the-most-important-part-of-watch-design/

인간은 시계가 작동하는 방식을 이해하기 위해 수천 개의 예제가 필요하지 않다. 기본 개념을 이해하면, 우리는 거의 모든 형태의 시계를 인식할 수 있다.

AI 모델이 이 작업을 수행하는 데 어려움을 겪는 것은 더 깊은 문제를 나타낸다. 그들의 명백한 강점은 높은 볼륨의 노출에 의존하는 것일 수 있다.

모의 게임을 넘어서?

최근의 조사에서, 대형 모델의 표면적인 성능과 진정한 ‘이해’ 사이의 긴장은 반복적으로 나타났다. 지난 달, Zhejiang University와 Westlake University는 “Do PhD-level LLMs Truly Grasp Elementary Addition?”라는 논문을 발표했다.

‘벤치마크에서 인상적인 성과에도 불구하고, 모델은 실제 이해보다는 패턴 매칭에 의존하는 것으로 나타났다. 기호적 표현과 기본 속성의 위반에서 실패가 나타났다. ‘

‘명시적인 규칙 제공이 성능을 저하하는 것으로 나타났으며, 이는 내재된 구조적 제한을 암시한다. 이러한 통찰은 평가 격차를 나타내며, 실제 수학적 추론을 위한 구조가 필요함을 강조한다.’

이번 주에, 같은 질문이 다시 제기되었다. Nanjing University of Aeronautics and Astronautics와 Universidad Politécnica de Madrid의 협력으로, “Have Multimodal Large Language Models (MLLMs) Really Learned to Tell the Time on Analog Clocks?”라는 논문이 발표되었다.

연구의 진행은 논문에서 자세히 다루어지지 않았지만, 초기 테스트에서 GPT-4.1은 다양한 시계 이미지에서 시간을 읽는 데 어려움을 겪는 것으로 나타났다.

이것은 모델의 훈련 데이터에 갭이 있을 수 있음을 시사하며, 모델이 실제로 기본 개념을 학습할 수 있는지 테스트하기 위해 더 균형 잡힌 데이터셋이 필요함을 나타낸다. 따라서 연구자들은 모든 가능한 시간을 균일하게 커버하는 합성 아날로그 시계 데이터셋을 구축했다.

연구자들이 사용한 합성 아날로그 시계 데이터셋의 예시. 출처: https://huggingface.co/datasets/migonsa/analog_watches_finetune

연구자들이 사용한 합성 아날로그 시계 데이터셋의 예시. 출처: https://huggingface.co/datasets/migonsa/analog_watches_finetune

미세 조정 전에, GPT-4.1은 이러한 시계를 읽는 데 일관적으로 실패했다. 그러나 새로운 데이터셋에 노출된 후, 표준 시계면에서 성능이 개선되었다.

그러나 시계의 모양이나 손의 스타일이 변경되면 정확도가 급격히 떨어졌다. 심지어 작은 변경, 예를 들어 더 얇은 손이나 화살표도 모델을 혼동시켰다.

표준 디자인,歪曲된 모양, 및 수정된 손의 시계 이미지와 함께 GPT-4.1이 반환한 시간. 출처: https://arxiv.org/pdf/2505.10862

표준 디자인,歪曲된 모양, 및 수정된 손의 시계 이미지와 함께 GPT-4.1이 반환한 시간. 출처: https://arxiv.org/pdf/2505.10862

충분한 시간

대부분의 훈련 데이터셋은 웹에서 스크랩된 이미지에 의존하며, 이러한 이미지들은 특정 시간, 특히 10:10을 반복적으로 나타낸다.

새로운 논문에서 '10:10' 시간의 예시.

새로운 논문에서 ’10:10′ 시간의 예시.

이로 인해 모델은 시계의 다양한 구성만을 볼 수 있으며, 이는 모델이 반복적인 패턴을 넘어 일반화하는 능력을 제한한다.

미세 조정 테스트

미세 조정을 통해 모델의 실패를 극복할 수 있는지 테스트하기 위해, GPT-4.1은 새로운 데이터셋에 미세 조정되었다. 미세 조정 전에, 모델의 예측은广く 산재되어 있었으며, 모든 유형의 시계에서 상당한 오류가 발생했다. 미세 조정 후, 표준 시계면에서 정확도가 크게 개선되었다.

그러나 손의 모양이 변경된 시계에서는 큰 오류가 계속 발생했다.

두 가지 유형의 실패 모드가 나타났다. 표준 및歪曲된 시계에서는 모델이 손의 방향을 잘못 판단했다. 그러나 손의 스타일이 변경된 시계에서는 모델이 손의 기능을 혼동했다.

미세 조정 전후의 모델의 성능 비교.

미세 조정 전후의 모델의 성능 비교.

손의 신호

손의 모양이 모델의 성능에 미치는 영향을 테스트하기 위해, 연구자들은 모델의 예측을 분석했다. 손의 역할을 혼동하는 경우, 모델의 오류는 크게 증가했다.

손의 방향을 잘못 판단하는 경우, 오류는 상대적으로 작았다. 그러나 손의 역할을 혼동하는 경우, 모델은 시간을 정확하게 판단할 수 없었다.

연구자들은 또한 손의 모양이 모델의 성능에 미치는 영향을 테스트했다. 결과는 손의 모양이 모델의 성능에 미치는 영향이 크지 않음을 보여주었다.

손의 역할을 혼동하는 경우와 아닌 경우의 오류 비교.

손의 역할을 혼동하는 경우와 아닌 경우의 오류 비교.

결론

이 논문의焦點은 처음에는 사소해 보일 수 있지만, 실제로는 더 깊은 문제를 다루고 있다. 시계를 읽는 것은 중요하지 않다. 중요한 것은 모델이 어떻게 시계를 읽는지 이해하는 것이다. 모델이 시계를 읽는 데 실패하는 이유는 더 근본적인 문제를 나타낸다.

모델이 시계를 읽는 데 실패하는 이유는 모델이 실제로 시간을 이해하지 못했기 때문이다. 모델은 시계의 패턴을 학습했을 수 있지만, 실제 시간을 이해하지 못했다.

이것은 모델이 실제로 이해하는 것이 무엇인지에 대한疑問을 제기한다. 모델은 실제로 이해하는 것이 무엇인지,还是 단순히 패턴을 학습하는 것일까?

 

최초로 게시됨: 2025년 5월 19일

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai