Andersonの視点

AIがアナログ時計を読むのに苦労することの深い意味

mm
Unite.AI を Google の優先ソースに追加
ChatGPT-4o and Adobe Firefly.

中国とスペインの研究者による新しい論文によると、GPT-4.1のような高度な多モーダルAIモデルでも、アナログ時計の画像から時間を読むことが難しいことがわかった。時計の小さな視覚的な変化が大きな解釈ミスにつながることがあり、ファインチューニングは既知の例でのみ役立つ。結果は、これらのモデルが未知の画像に直面したときの信頼性について懸念を引き起こしている。

 

人間は、重力やその他の基本的な物理的原理などのドメインについて深い理解を得たとき、特定の例を超えて、根底にある抽象概念を把握することができる。これにより、人間はその知識を創造的に適用し、新しい状況を認識することができる。

重要なドメインでは、人間はそれを存在しない場所でも認識することがある。パレイドリアやアポフェニアなどの認知バイアスが人間をパターン認識メカニズムに駆り立てるからである。

人間が子供の頃に最初に教えられる視覚的なデータセットの1つは、時計の教材である。印刷物やインタラクティブなアナログ時計が時間を教えるために使用される。

時間を教えるための教材。ソース:https://www.youtube.com/watch?v=IBBQXBhSNUs

時間を教えるための教材。 ソース:https://www.youtube.com/watch?v=IBBQXBhSNUs

時計のデザインの変化は時々人間を挑戦するが、早期のドメインマスターの堅牢性は印象的であり、複雑または「エキセントリック」なデザイン選択にもかかわらず、アナログ時計の面を識別することができる。

時計の難読面の例。ソース:https://www.ablogtowatch.com/wait-a-minute-legibility-is-the-most-important-part-of-watch-design/

時計の難読面の例。 ソース:https://www.ablogtowatch.com/wait-a-minute-legibility-is-the-most-important-part-of-watch-design/

人間は、アナログ時計の基本的な概念を理解するために、数千の例を必要としない。基本的な概念を理解した後、人間はほぼどのような形式でもそれを認識することができる。

一方で、AIモデルはこのタスクに苦労する。これは、AIモデルの表面的な強さが、理解よりも大量のデータに依存していることを示唆している。

模倣ゲームを超えて

大きなモデルを調査した最近の研究では、表面的なパフォーマンスと真正の「理解」の間の緊張が浮き彫りになっている。先月、浙江大学とウェストレイク大学は、論文を発表し、LLMが真正に加算を理解しているかどうかを疑問視した。

‘ベンチマークでは印象的な結果を出すが、モデルはパターンマッチングに依存しており、真正の理解には至っていない。シンボリックな表現や基本的な特性の違反での失敗がその証拠である。’

‘明示的なルールの提供がパフォーマンスを損なうことは、固有のアーキテクチャ上の制約を示唆している。評価のギャップを明らかにし、真正の数学的推論が可能なアーキテクチャの必要性を強調している。’

今週、ナンジャン大学とマドリード工科大学の研究者は、多モーダル大語言モデルがアナログ時計を読むことができるかどうかを調査した。

研究の進展は論文で概要のみが示されているが、研究者による初期のテストでは、GPT-4.1が多様な時計画像から時間を読むのに苦労していることがわかった。簡単な場合でも、誤った答えを出していた。

これは、モデルのトレーニングデータにギャップがあることを示唆している。したがって、研究者は、すべての可能な時間を均等にカバーし、インターネット画像の通常の偏りを避けた合成時計データセットを作成した。

研究者による合成アナログ時計データセットの例。ソース:https://huggingface.co/datasets/migonsa/analog_watches_finetune

研究者による合成アナログ時計データセットの例。 ソース:https://huggingface.co/datasets/migonsa/analog_watches_finetune

ファインチューニング前のGPT-4.1はこれらの時計を読むのに苦労していたが、新しいコレクションに触れた後、パフォーマンスが改善した。しかし、時計の形状や針のスタイルが変わると、精度が低下した。

時計の針が薄かったり、矢印の付いた時計では、GPT-4.1は時間を読むのに苦労した。ダリエスケの「融けた時計」でも同様だった。

標準デザインの時計、歪んだ形状の時計、変更された針の時計の画像と、GPT-4.1による時間の推定。ソース:https://arxiv.org/pdf/2505.10862

標準デザインの時計、歪んだ形状の時計、変更された針の時計の画像と、GPT-4.1による時間の推定。 ソース:https://arxiv.org/pdf/2505.10862

研究者は、GPT-4.1が時計を読むのに苦労するのは、視覚的なパターンマッチングに依存しているからであると結論付けた。

十分な時間

トレーニングデータセットは、ウェブからスクラップされた画像に依存しており、特定の時間、特に10:10が繰り返されることが多い。

アナログ時計画像における「10:10」の普遍性の例。

アナログ時計画像における「10:10」の普遍性の例。

これにより、モデルは狭い時間の範囲しか見えず、繰り返しのパターンを超えて一般化することができない。

ファインチューニングテスト

GPT-4.1は、上記の合成データセットでファインチューニングされた。ファインチューニング前の予測は広範囲に散らばっていたが、コレクションに触れた後、精度が改善した。

しかし、時計の針が変更された場合、エラーが大きくなることがわかった。

2つの異なる失敗モードが見られた。標準的な時計と歪んだ時計では、モデルは針の方向を誤った。時計の針のスタイルが変更された場合、モデルは時針と分針を混同した。

ファインチューニング前のGPT-4.1の初期的な弱さと、バランスの取れた合成データセットでファインチューニングした後の部分的な改善。

ファインチューニング前のGPT-4.1の初期的な弱さと、バランスの取れた合成データセットでファインチューニングした後の部分的な改善。

手のサイン

時計の針のスタイルが変更された場合、モデルは時間を読むのに苦労する。研究者は、モデルが針の役割を正しく識別した場合とそうでない場合を比較した。

結果は、手の役割を混同した場合、エラーが大きくなることを示した。

時計の針の形状がモデルが方向を把握する能力を損なうかどうかを調べるために、別の実験が行われた。2つの新しいデータセットが作成され、それぞれに60個の合成時計が含まれた。1つは元の時計のデザインを使用し、もう1つは変更されたデザインを使用した。モデルは、時針が指している分針の位置を推定するように求められた。

結果は、変更された時計の針で精度がわずかに低下したことを示したが、モデルの全体的な解釈を妨げるには十分ではなかった。

変更された時計のデータセットにおけるエラーの比較。

変更された時計のデータセットにおけるエラーの比較。

結論

この研究の焦点は、表面的に見るとごく普通のようだが、実際には深い意味を持っている。人間がドメインについて深い理解を得る方法と、AIモデルがドメインについて学習する方法の違いについて示唆している。

どちらの道も、現在のアーキテクチャが真正に学習できることについて疑問を引き起こしている。

 

初めて発行された日:2025年5月19日

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai