Andersonの視点

最先端の言語モデルも「解釈的」な書き起こしに陥りやすい

mm
Unite.AI を Google の優先ソースに追加
AI-generated image (GPT-2): a construction worker wearing a tool belt stands beneath scaffolding, holding a printed job sheet and scratching his head while facing a large stone wall engraved with a partially completed version of the United States Declaration of Independence in which numerous words have been mistakenly replaced with incorrect alternatives, ending at the word 'foam'. A workbench holding chisels and a hammer stands in the foreground, with stone dust scattered below the unfinished carving. The photorealistic scene is surrounded by a yellow-and-black warning-style border labeled 'AI FANTASY INSIDE' along the top and right edges and 'REALITY OUTSIDE' along the bottom and left edges, with black directional arrows pointing inward.

アマゾンの新しい研究によると、モデルが賢くなるほど、Optical Character Recognition(OCR)を実行する際に「創造的」になる可能性が高くなる。

(AMZN )

 

Optical Character Recognition(OCR)は、ほとんど解決された問題と考えられている。如果テキストをスキャンしたり、OCRシステムにテキストの写真を提示したりすると、OCRシステムは各文字を個別に認識し、1文字ずつ最も適切な推定を行う。

左上、特徴的な位置の識別された文字のゾーニング(ソース - https://home.nr.no/~eikvil/OCR.pdf - https://ijarse.com/ADMIN/admin/postimages/images/fullpdf/1473863345_515_IJARSE.pdf

左上、特徴的な位置の識別された文字のゾーニング(ソース);メインイメージ:機関リポジトリのセグメンテーション結果 (ソース).

OCRは、文字を個別に解釈し、近い距離にある文字が単語や他の言語構造を形成するかどうかは気にしない。OCRは、スペルチェックはその範囲外であるため、問題が発生するまでにすでに出て行ったことになる。

最も人気のあるOCRシステムの1つは、古典的なTesseractであり、厳格なアルゴリズムベースのインタープリターであり、オープンソースアプリケーションやワークフローで広く使用されている。すべてのオペレーティングシステムで利用可能な幅広い「フラット」アルゴリズムベースのOCRアドオンにより、画像テキストを編集可能なテキストに戻す機能は、無料のコモディティの地位に達した。しかし、どのシステムも欠陥や癖がないわけではない。

さらに、OCRアルゴリズム競争空間で競合している組織や商業製品は、レガシーシステムをAI支援のドキュメント管理システムに適応させてきた。しかし、基本的なテクノロジーは、推定されたグループのセグメント化された識別された文字を出力することであり、変更されていない。

Word Up

他の多くのタスクと同様に、OCRは、新しい世代のVision Language Models(VLMs)によって増加的に処理されている。非編集可能なテキストやラスタライズされたテキストに直面した場合、エージェントバージョンのこれらの最新のシステムは、熟練して読み取り、必要に応じて音訳できる。

しかし、アマゾン.comからの新しい研究によると、AIがOCRと同じ機能を正確に複製することを期待している人は驚かされることになる。新しい研究では、好きなLLMがトランスクリプションで「余分な」ことをする可能性が高いことがわかった。つまり、1文字ずつのコンテキストを超えて、1単語ずつのコンテキストに達し、法務、医療、歴史的な書き起こしのような分野で望ましくない結果をもたらす可能性のある「エラー」を修正する。

著者らは主張する:

‘Vision Language Models(VLMs)は、伝統的なOCRパイプラインの代わりにドキュメントの理解に使用されることが増えています。 ‘

‘私たちは、それらが常に忠実なトランスクリプターとして機能しないことを示します。テキストが不完全な場合、より妥当な形式に書き直す傾向があります – クリーンなテキストのOCRベンチマークでは検出できない動作です。 ‘

著者らは、FaithC4というボリューミアスな新しいキュレーションデータセットとベンチマークを紹介し、15のFOSSとクローズドソースモデル、チャットGPTやGoogle Geminiのバージョンをテストした。

一般的な目的のAIモデルは、伝統的なOCRシステムよりも、不完全な単語をより「妥当な」ものに置き換える可能性が高かった。時には、約65%の乱れた単語を書き直し、小さなローカルエラーも、他の部分で正確なテキストにミスを生じさせた。

短い単語は特に脆弱で、明示的な指示で修正しないように指示すると、問題が軽減されたが、完全には解決されなかった。

論文は述べている:

‘書き直す動作は、一部のエラーを回復するのに有益かもしれませんが、法務文書、医療レコード、歴史的原稿などの分野では、文字通りの書き起こしが必要な場合、問題となる可能性があります。 ‘

‘この書き直す動作は、VLMの研究ではほとんど見落とされている。既存のOCR ベンチマークはクリーンなテキストの認識に焦点を当てているため、不完全な入力に対するモデルの動作を調査するには不十分です。 ‘

中心的なメッセージは、より高度なAIシステムがエラーを修正しないように苦労することであり、アルゴリズムベースのOCRプラットフォームが「生」のまま配信できるエラーは、人間の解釈が必要であることが多いが、間違った「修正」がすでに適用されている場合、問題はほとんどのチェックシステムのレーダー下を滑り込むことになる。

新しい論文は、Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Modelsというタイトルで、アマゾン.comの5人の研究者によって発表された。

データと方法

ベンチマークデータセットを構築するために、著者らはC4と呼ばれる2020年のウェブクロールコレクションであるColossal Cleaned Crawled Corpusを利用した。コーパスから、英語、中国語、韓国語の1,455の単一ページ文書が選択され、各パスは1ページに収まるようにサイズ設定された。

最終的なベンチマークには、500の英語文書、500の中国語文書、455の韓国語文書が含まれ、多言語のテストベッドが提供された。これは、AIシステムがテキストを忠実にコピーするか、あるいは書き直すかを測定するためのものである。

テキストを故意に破損させた後、AIモデルがそれを忠実にコピーするかどうかをテストするために、文書に制御されたエラーが導入された。約8%の有効な単語が変更され、各単語には少なくとも4つの文字が含まれていた。触れられていないバージョンのこれらの文書は、基準となる真実として使用された。

3つのパーティションバリアントが適用された:スクランブルは、単語の内部文字をシャッフルしながら、最初と最後の文字を保持した;ランダムは、同じ書き体系からのランダムな代替文字に各文字を置き換えた;ビジュアルは、視覚的に類似した文字を置き換えたが、基礎となるテキストを変更した。

中国語のバリアントは、スクランブル条件を省略した。中国語の書き体系には、スペースで区切られた単語がないため、代わりに固定の4文字のウィンドウを使用した。他のパーティションに対して、韓国語の平均単語長は短いため、変更するための単語が少なかった。

各文書はPDFページとしてレンダリングされ、競合するトランスクリプションシステムに渡された。

テスト

この研究のテストには、クローズドソースの汎用モデル、GPT-5.4-miniGemini-3-FlashGemini-2.5-Flash;およびオープンソースモデル、Qwen3.5-4BQwen3-VL-4BInternVL3.5-4BGemma4-E4BGemma4-E2Bが含まれた。

さらに、OCR専用モデル、olmOCR-2-7BDeepSeek-OCR-2MinerU2.5-ProPaddleOCR-VL-1.5LightOnOCR-2-1B;および伝統的なOCRエンジン、TesseractdocTRがテストされた。

3つのグループは、言語に異なる程度に依存している。汎用AIモデルは、事前トレーニング中に取得した広範な言語知識に大きく依存している。OCR専用モデルは、タスク固有のトレーニングを通じて、忠実なドキュメントトランスクリプションに重点を置いている。伝統的なOCRシステムは、言語的推論ではなく、文字認識に依存している。

2つのメトリックが採用された。最初のものは、単語エラーレートWER)であり、OCRの標準メトリックであり、システムがどのくらいの単語を間違ってトランスクリプションしたかを決定する。単純に間違った文字を数えるのではなく、WERは、置換、削除、挿入を、元のテキストに対して記録し、間違った単語や、省略された単語、または追加された単語に敏感である。

中国語の場合、スペースで区切られた単語がないため、同じアプローチが、文字エラーレートCER)として、文字レベルで適用された。

より繊細なミスを捉えるために、編集距離類似度EDS)メトリックも使用された。EDSは、予測されたテキストを元のテキストと比較し、WERとは異なり、完全に間違った単語と、1つまたは2つの文字だけ異なる単語を区別できる。当然、これにより、WERでは検出できない「ニアミス」や部分的な書き直しを検出するのに役立つ。

グラフに示されているように、伝統的なOCRシステムは、3つのパーティションタイプすべてに対して最も耐性があり、精度の低下が少なかった。これは、主に個々の文字を認識し、コンテキストから単語を推論しようとしないためである。

英語、中国語、韓国語で、3つのテキストパーティション方法を適用した後の単語エラーレート(左)と編集距離類似度(右)の変化。伝統的なOCRシステムは全体的に最も小さなパフォーマンス低下を示し、OCR専用モデルは中間の位置にあり、汎用AIモデルは一般的に最も影響を受けた。

英語、中国語、韓国語で、3つのテキストパーティション方法を適用した後の単語エラーレート(左)と編集距離類似度(右)の変化。伝統的なOCRシステムは全体的に最も小さなパフォーマンス低下を示し、OCR専用モデルは中間の位置にあり、汎用AIモデルは一般的に最も影響を受けた。 ソース

OCR専用AIモデルは、中間の位置にあり。MinerUとLightOnは比較的堅牢で、olmOCRとDeepSeek-OCRは破損したテキストに対してより敏感性を示した。これは、ドキュメント固有のトレーニングによって、トランスクリプションの再解釈の傾向が軽減されるが、完全には排除されないことを示している。

汎用AIモデルは全体的に最も悪い結果を示し、破損したテキストに直面したときに、トランスクリプションエラーが大幅に増加した。ほとんどのモデルは、OCR専用モデルや伝統的なOCRシステムよりもはるかに大きな低下を示した。ただし、Gemini-3-Flashは、伝統的なOCRシステムのように動作するという点で、注目すべき例外であった。

全体的なランキングは、各モデルの言語知識への依存度と密接に一致していた。言語の先入観が強いモデルは、テキストを書き直す傾向が強かった。

エラーの種類の分析、以下の表に示されているように、伝統的なOCRシステムは、置換、挿入、削除などの従来のトランスクリプションエラーを主に生じた。

英語の「スクランブル」パーティションテストの結果、各トランスクリプションシステムがエラーを、正確な書き直し、ニアミスなトランスクリプション(「近い」)、より大きなトランスクリプションエラー(「中程度」)、および完全に間違った出力(「間違った」)に分配した方法を示す。モデルは、破損した単語の書き直し率に基づいて順位付けされている。

英語の「スクランブル」パーティションテストの結果、各トランスクリプションシステムがエラーを、正確な書き直し、ニアミスなトランスクリプション(「近い」)、より大きなトランスクリプションエラー(「中程度」)、および完全に間違った出力(「間違った」)に分配した方法を示す。モデルは、破損した単語の書き直し率に基づいて順位付けされている。

逆に、汎用AIモデルは、破損した単語を、周囲の文脈を保ったまま、妥当な代替案に置き換える可能性が高かった。これは、単に破損したテキストを誤読しているのではなく、言語的コンテキストを使用して書き直していることを示唆している。

研究では、トランスクリプションエラーが破損した単語に限定されないことも発見された。

各パーティションタイプ後の、破損した単語と破損していない単語のエラー率の結果。多くのモデルで、破損した単語のエラーが周囲の未破損テキストに広がった。

各パーティションタイプ後の、破損した単語と破損していない単語のエラー率の結果。多くのモデルで、破損した単語のエラーが周囲の未破損テキストに広がった。

英語文書の約4.7%の単語を変更すると、未破損の周囲テキストのエラー率が大幅に増加した。

各パーティションタイプ後の、破損した単語と破損していない単語のトランスクリプションエラーの増加を示す。汎用AIモデルは、エラーの増幅が最も大きかった。

各パーティションタイプ後の、破損した単語と破損していない単語のトランスクリプションエラーの増加を示す。汎用AIモデルは、エラーの増幅が最も大きかった。

汎用VLMは最も影響を受けた。未破損の単語のエラー率は、基準値よりも10倍以上増加した。逆に、伝統的なOCRシステムは、エラー率の増加がわずかであった。

これは、実際には、わずかな量の破損したテキストが、他の部分が完全に整ったドキュメントの精度を損なうことを意味する。

最後に、著者らは、単語の長さが書き直し動作に影響を与えるかどうかを調査した。結果は、短い単語が長い単語よりもはるかに脆弱であることを示した。

これは、短い単語には視覚的なヒントが少ないため、VLMがコンテキスト言語知識に頼る傾向があるためである。破損したテキストが「生」のままトランスクリプションされるのではなく、代わりに妥当な代替案に置き換えられる可能性が高くなる。

著者らはまた、明示的にモデルにエラーを修正しないように指示すると、この傾向が軽減されるが、完全には排除されないことを発見した。これは、解釈的なトランスクリプションが、現在のVLMの固有の特性であることを示唆している。

著者らは結論する:

‘法務文書処理、歴史的原稿のデジタル化、法医学などの分野では、文字通りのトランスクリプションが必要な場合、伝統的なOCRシステムまたは慎重に選択されたOCR専用VLMが、汎用VLMよりも安全な選択肢である。汎用VLMは、クリーンなテキストのベンチマークでは捉えられない、体系的な書き直しを導入する。 ‘

結論

この研究は、LLMの文献で繰り返し出現するテーマを繰り返す。すなわち、トレーニング済みのVLMモデルは非常に強力であるが、批判的な指示に抵抗することがある。この場合、画像の中の文字を読み取り、解釈するという指示である。

より高度なモデルは、単にそれを実行できないように見える。まるで「雑用」と見なしたり、タスクを「半分終了」のまま完了するという、非合理的な強迫に駆られているように見える。

 

* 著者らのインライン引用をハイパーリンクに変換したもの。

初版は2026年7月27日に公開された。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai