Andersonの視点
AIがアナログ時計を読むのに苦労することの深い意味

中国とスペインの研究者による新しい論文によると、GPT-4.1のような高度な多モーダルAIモデルでも、アナログ時計の画像から時間を読むことが難しいことがわかった。時計の小さな視覚的な変化が大きな解釈ミスにつながることがあり、ファインチューニングは既知の例でのみ役立つ。結果は、これらのモデルが未知の画像に直面したときの信頼性について懸念を引き起こしている。
人間は、重力やその他の基本的な物理的原理などのドメインについて深い理解を得たとき、特定の例を超えて、根底にある抽象概念を把握することができる。これにより、人間はその知識を創造的に適用し、新しい状況を認識することができる。
重要なドメインでは、人間はそれを存在しない場所でも認識することがある。パレイドリアやアポフェニアなどの認知バイアスが人間をパターン認識メカニズムに駆り立てるからである。
人間が子供の頃に最初に教えられる視覚的なデータセットの1つは、時計の教材である。印刷物やインタラクティブなアナログ時計が時間を教えるために使用される。

時間を教えるための教材。 ソース:https://www.youtube.com/watch?v=IBBQXBhSNUs
時計のデザインの変化は時々人間を挑戦するが、早期のドメインマスターの堅牢性は印象的であり、複雑または「エキセントリック」なデザイン選択にもかかわらず、アナログ時計の面を識別することができる。

時計の難読面の例。 ソース:https://www.ablogtowatch.com/wait-a-minute-legibility-is-the-most-important-part-of-watch-design/
人間は、アナログ時計の基本的な概念を理解するために、数千の例を必要としない。基本的な概念を理解した後、人間はほぼどのような形式でもそれを認識することができる。
一方で、AIモデルはこのタスクに苦労する。これは、AIモデルの表面的な強さが、理解よりも大量のデータに依存していることを示唆している。
模倣ゲームを超えて
大きなモデルを調査した最近の研究では、表面的なパフォーマンスと真正の「理解」の間の緊張が浮き彫りになっている。先月、浙江大学とウェストレイク大学は、論文を発表し、LLMが真正に加算を理解しているかどうかを疑問視した。
‘ベンチマークでは印象的な結果を出すが、モデルはパターンマッチングに依存しており、真正の理解には至っていない。シンボリックな表現や基本的な特性の違反での失敗がその証拠である。’
‘明示的なルールの提供がパフォーマンスを損なうことは、固有のアーキテクチャ上の制約を示唆している。評価のギャップを明らかにし、真正の数学的推論が可能なアーキテクチャの必要性を強調している。’
今週、ナンジャン大学とマドリード工科大学の研究者は、多モーダル大語言モデルがアナログ時計を読むことができるかどうかを調査した。
研究の進展は論文で概要のみが示されているが、研究者による初期のテストでは、GPT-4.1が多様な時計画像から時間を読むのに苦労していることがわかった。簡単な場合でも、誤った答えを出していた。
これは、モデルのトレーニングデータにギャップがあることを示唆している。したがって、研究者は、すべての可能な時間を均等にカバーし、インターネット画像の通常の偏りを避けた合成時計データセットを作成した。

研究者による合成アナログ時計データセットの例。 ソース:https://huggingface.co/datasets/migonsa/analog_watches_finetune
ファインチューニング前のGPT-4.1はこれらの時計を読むのに苦労していたが、新しいコレクションに触れた後、パフォーマンスが改善した。しかし、時計の形状や針のスタイルが変わると、精度が低下した。
時計の針が薄かったり、矢印の付いた時計では、GPT-4.1は時間を読むのに苦労した。ダリエスケの「融けた時計」でも同様だった。

標準デザインの時計、歪んだ形状の時計、変更された針の時計の画像と、GPT-4.1による時間の推定。 ソース:https://arxiv.org/pdf/2505.10862
研究者は、GPT-4.1が時計を読むのに苦労するのは、視覚的なパターンマッチングに依存しているからであると結論付けた。
十分な時間
トレーニングデータセットは、ウェブからスクラップされた画像に依存しており、特定の時間、特に10:10が繰り返されることが多い。

アナログ時計画像における「10:10」の普遍性の例。
これにより、モデルは狭い時間の範囲しか見えず、繰り返しのパターンを超えて一般化することができない。
ファインチューニングテスト
GPT-4.1は、上記の合成データセットでファインチューニングされた。ファインチューニング前の予測は広範囲に散らばっていたが、コレクションに触れた後、精度が改善した。
しかし、時計の針が変更された場合、エラーが大きくなることがわかった。
2つの異なる失敗モードが見られた。標準的な時計と歪んだ時計では、モデルは針の方向を誤った。時計の針のスタイルが変更された場合、モデルは時針と分針を混同した。

ファインチューニング前のGPT-4.1の初期的な弱さと、バランスの取れた合成データセットでファインチューニングした後の部分的な改善。
手のサイン
時計の針のスタイルが変更された場合、モデルは時間を読むのに苦労する。研究者は、モデルが針の役割を正しく識別した場合とそうでない場合を比較した。
結果は、手の役割を混同した場合、エラーが大きくなることを示した。
時計の針の形状がモデルが方向を把握する能力を損なうかどうかを調べるために、別の実験が行われた。2つの新しいデータセットが作成され、それぞれに60個の合成時計が含まれた。1つは元の時計のデザインを使用し、もう1つは変更されたデザインを使用した。モデルは、時針が指している分針の位置を推定するように求められた。
結果は、変更された時計の針で精度がわずかに低下したことを示したが、モデルの全体的な解釈を妨げるには十分ではなかった。

変更された時計のデータセットにおけるエラーの比較。
欠落していた実験結果と解釈
研究者はインターネット画像に多い時刻の偏りを避けるため、あらゆる時刻を均等に含む合成アナログ時計データセットを作成した。ウェブ上の時計画像は広告で好まれる10時10分に偏るため、通常の学習では針の配置の範囲が狭くなり、モデルが反復パターンを超えて一般化できない可能性がある。
GPT-4.1は追加学習前から標準時計でも多くの誤りを示した。平均絶対誤差は標準時計150例で232.48秒、文字盤を変形すると1,380.69秒、針を細くして矢印を付けると3,726.93秒に増えた。見た目の変化がより大きい変形文字盤より、針のわずかな変更の方が大きく性能を落としたことは、抽象的な時刻概念ではなく外観パターンに依存している可能性を示す。
追加学習で改善した範囲
均衡した合成データで追加学習すると、標準時計の精度は大幅に改善し、変形時計でも一定の改善があった。しかし細い針や矢印付きの針では大きな誤差が残った。通常と変形の文字盤では針の方向を誤ることが多かったのに対し、針の外観を変えると時針、分針、秒針の役割自体を取り違えた。
この結果は、モデルが針の太さや形を役割と結び付けて学んだことを示唆する。見慣れない設計で改善が限定的だったため、追加学習が時刻を読む一般概念を獲得させたのか、それとも既知の見た目へのパターン適合を洗練しただけなのか疑問が残る。
針の役割と方向の混同
研究者は変更された針のデータを、モデルが三本の役割を正しく認識した場合と取り違えた場合に分け、追加学習の前後でMAEと角度誤差を比較した。時針を分針と誤認するような役割の混同が最大の時刻誤差を生んだ。役割を正しく認識した針の方向だけを誤った場合、誤差は比較的小さかった。追加学習前は時針の角度誤差が最も大きく、秒針が最も小さかった。
役割を正しく識別した例だけに限定しても、変更された針の精度は標準時計に届かなかった。そこで時針一本だけを60種類の目盛りへ向けた合成時計を、通常の針と変更した針で別々に作り、指している目盛りを答えさせた。変更版では精度がわずかに下がったが、時計全体で見られた大幅な失敗を説明できるほどではなかった。
なぜ小さな課題が重要なのか
問題が空間方向の知覚だけなら追加学習で比較的簡単に直せるかもしれない。しかし複数の視覚手掛かりを統合する能力に原因があるなら、現行アーキテクチャのより根本的な弱点である。未知の視覚特徴一つが、以前うまく解けた課題の全体解釈を崩すことは、現実世界で見慣れない入力に遭遇するVLMの信頼性に直結する。
人間は時計の原理を理解すれば何千もの例を見なくても歪みや抽象的なデザインに対応できる。モデルに多様なデータを大量に与えることで同じ抽象化と一般化に到達できるのか、あるいは推論時に起こり得る変形を網羅するまで例を増やすしかないのかは未解決であり、どちらも現在の学習方式が本当に何を獲得しているかという疑問を残す。
結論
この研究の焦点は、表面的に見るとごく普通のようだが、実際には深い意味を持っている。人間がドメインについて深い理解を得る方法と、AIモデルがドメインについて学習する方法の違いについて示唆している。
どちらの道も、現在のアーキテクチャが真正に学習できることについて疑問を引き起こしている。
初めて発行された日:2025年5月19日
原文から復元した図














