Anderson 视角
即使是领先的语言模型也容易出现“解释性”转录

亚马逊的新研究发现,模型越智能,就越容易在执行光学字符识别(OCR)时“发挥创造力”。
光学字符识别(OCR)被认为是一个基本解决的问题。如果您扫描一些文本或将文本照片呈现给OCR系统,它会对每个字母进行详细的识别,根据每个字母的上下文进行最佳猜测:
OCR解释字符;这些字符可能或可能不构成单词或其他语言结构。OCR不关心;当这些问题出现时,它已经完成了工作,转到下一个任务,因为拼写检查不在其职责范围内。
最流行的OCR系统之一是久经考验的Tesseract,一个严格的算法解释器,广泛应用于各种开源应用程序和工作流程。随着各种操作系统上可用的“平面”算法OCR插件,图像文本转换为可编辑文本的能力已经成为一种免费的商品——即使没有系统是完美的。
此外,为了保持相关性,传统上在算法OCR领域竞争的组织和商业产品已经将其遗留系统适应为人工智能辅助文档管理系统。然而,核心技术——输出估计的分段和识别的字母——仍然保持不变。
词语
随着越来越多的任务,OCR越来越多地被新一代视觉语言模型(VLMs)处理;面对不可编辑或光栅化的文本,代理版本的这些最新系统可以敏捷地阅读和转录必要的文本。
然而,根据亚马逊的一篇新研究论文,这些认为人工智能将完全复制OCR功能的人可能会感到惊讶:这项新研究发现,人们喜爱的LLM很可能在转录时“多管闲事”,无论是否需要;超越每个字母的上下文,进入每个单词的上下文——并纠正它发现的任何“错误”,以可能对法律、医疗和历史转录等领域产生不良后果的方式。
作者断言:
‘视觉语言模型(VLMs)越来越多地取代传统的OCR管道用于文档理解。 ‘
‘我们表明,它们并不总是作为忠实的转录者:当文本不完美时,它们经常倾向于将其重写为更合理的形式——一种行为,干净文本的OCR基准无法检测到。’
作者介绍了一份新的、经过策划的数据集和基准,称为FaithC4,他们在15个FOSS和闭源模型上进行了测试,包括ChatGPT和Google Gemini的版本。
他们发现,通用人工智能模型比传统OCR系统更容易用更“合理”的单词替换不完美的单词,有时会重写高达65%的乱码单词,同时,小的局部错误也会在其他地方造成错误,即使文本在其他地方是准确的。
短单词尤其容易受到影响,明确的指令不进行更正减少了这个问题,尽管它并没有消除它。
论文指出*:
‘虽然重写行为可以有益于恢复某些真正的错误,但对于某些领域来说可能会带来问题,例如法律文件、医疗记录和历史手稿。 ‘
‘尽管其重要性,当前的VLM研究中,这种重写行为基本上被忽略了。现有的OCR 基准专注于干净的文本识别,因此对于研究模型如何处理不完美的输入是不足的。’
核心信息是,更加先进的人工智能系统在处理不完美的输入时会遇到困难,而算法OCR平台可以轻松配置为提供“原始”输出;在许多情况下,人类的解释是必不可少的来解决问题;但是,如果已经应用了不正确的“更正”,问题将趋于在大多数检查系统的雷达下滑行。
新论文的标题是视觉语言模型:阅读还是重写?,由五位亚马逊研究人员撰写。
数据和方法
为了填充他们的基准数据集,作者使用了C4,即2020年的巨大清理爬行语料库。从这个语料库中,选择了1455个单页文档,涵盖英语、汉语和韩语, 每个段落的大小都设置为适合单个渲染页面。
最终的基准包含500个英语文档、500个汉语文档和455个韩语文档,提供了一个多语言测试平台,用于衡量人工智能系统是否忠实地复制文本,还是以某种方式重写它。
为了测试人工智能模型是否会忠实地复制所看到的内容,控制错误被引入文档,然后将其渲染为图像,其中大约8%的合格单词被修改,每个单词至少包含四个字符。未修改的版本被用作基准事实。
然后应用了三种扰动变体:混乱重新排列单词的内部字母,同时保留第一个和最后一个字母;随机用同一书写系统中的随机替代字符替换每个字符;和视觉用视觉上相似的字符替换,同时改变底层文本。
汉语变体省略了混乱条件,因为其书写系统缺乏空格分隔的单词,而是使用固定四字符窗口进行其他扰动;此外,韩语的平均单词长度较短,意味着较少的单词有资格进行修改。
每个文档然后被渲染为PDF页面,并传递给竞争的转录系统。
测试
研究的测试涵盖了闭源通用模型,例如GPT-5.4-mini;Gemini-3-Flash;和Gemini-2.5-Flash;以及开源模型,包括通用模型Qwen3.5-4B;Qwen3-VL-4B;InternVL3.5-4B;Gemma4-E4B;和Gemma4-E2B。
此外,OCR专用模型也被包括在内,包括olmOCR-2-7B;DeepSeek-OCR-2;MinerU2.5-Pro;PaddleOCR-VL-1.5;和LightOnOCR-2-1B。最后,传统的OCR引擎Tesseract和docTR也被测试了。
这三组模型在语言依赖程度上有所不同:通用人工智能模型在预训练期间大量依赖广泛的语言知识;OCR专用模型更强调通过任务特定训练实现忠实的文档转录;传统OCR系统则依赖字符识别,而不是语言推理。
采用了两个指标,首先是单词错误率(WER),这是OCR中确定系统转录错误的单词数量的标准指标。WER记录了替换、删除和插入相对于原始文本的操作,使其对错误单词和被省略或添加的单词都很敏感。
对于汉语,单词不用空格分隔,因此采用了相同的方法,但在字符级别上,称为字符错误率(CER)。
为了捕捉更微妙的错误,还使用了编辑距离相似度(EDS)指标。EDS将预测的文本与原始文本在字符级别进行比较,并且与WER不同,EDS可以区分完全错误的单词和仅有一个或两个字符不同的单词。自然,这使得它有用来检测近似匹配,以及可能看起来相似的部分重写。
如图所示,传统的OCR系统在所有三种扰动类型中表现最为稳健,准确性损失很小,因为它们主要识别个别字符,而不是尝试从上下文推断单词:
单词错误率(左)和编辑距离相似度(右)在英语、汉语和韩语中应用三种文本扰动方法后。传统的OCR系统显示了最小的性能下降,OCR专用模型占据了中间地带,而通用人工智能模型通常受到损坏文本的影响最大。 来源
OCR专用AI模型占据了中间地带;MinerU和LightOn相对稳健;而olmOCR和DeepSeek-OCR表现出更大的对损坏文本的敏感性,表明文档特定训练减少了,但并没有消除,倾向于重新解释所读内容的趋势。
通用人工智能模型的整体表现最差,遇到扰动文本时转录错误大幅增加。它们的下降幅度远大于OCR专用模型或传统OCR系统——尽管Gemini-3-Flash是一个值得注意的例外,表现得更像传统的OCR系统。
总体而言,排名与每个模型依赖语言知识的程度密切匹配,语言先验越强,重写文本而不是简单转录的趋势越大。
错误类型的细分,如下表所示,表明传统的OCR系统主要产生传统的转录错误,例如替换、插入和删除:
英语’乱码’扰动测试的结果,显示每个转录系统如何在精确重写、近似匹配(’Close’)、更大的转录错误(’Moderate’)和完全错误输出(’Wrong’)之间分配错误。模型按重写损坏单词的比率排序。
相反,通用人工智能模型更有可能用合理的替代品替换损坏的单词,同时保留周围的句子,提供了强有力的证据,表明它们不仅仅是误读损坏的文本,而是使用语言上下文积极地重写它。
该研究还发现,转录错误并没有局限于损坏的单词:

错误传播分析的结果,显示每个扰动类型后损坏和未损坏单词的每个单词错误率。修改了大约4.7%的单词,导致转录错误扩散到许多模型中的周围未修改文本中。
如上表和下图所示,仅修改了英语文档中大约4.7%的单词,就大大增加了周围未修改文本中的错误率:

错误传播分析的进一步结果,显示每个扰动类型后损坏和未损坏单词的转录错误增加。通用人工智能模型表现出最大的错误放大,错误经常扩散到原始损坏单词之外。
通用VLMs受到的影响最大,未修改单词的错误率增加了十倍以上。相反,传统的OCR系统只显示出轻微的增加。模型重写损坏单词的比例越高,错误传播也越强,表明这两种行为都源于对语言上下文的相同依赖。
在实践中,这意味着少量损坏的文本可以损害一个原本完整的文档的准确性,使得干净的OCR基准评分成为衡量真实转录保真度的不可靠指标。
最后,作者还研究了单词长度是否影响重写行为,发现短单词比长单词更容易受到影响。
因为它们包含的视觉提示较少,简短单词似乎鼓励VLMs更依赖语言上下文知识——增加了损坏文本被默默地替换为合理的替代品的可能性,而不是被逐字转录(这可能会引起人类的注意)。
作者还发现,明确指示模型不更正错误减少了这种趋势,但并没有消除它。这似乎表明,解释性转录是当前VLMs的固有特征,而不是一种可以通过提示来可靠地抑制的行为。
作者得出结论:
‘对于需要逐字转录的应用程序,例如法律文件处理、历史手稿数字化和法医,传统的OCR系统或仔细选择的OCR专用VLMs仍然是最安全的选择,而通用VLMs引入了系统性的重写,干净的基准无法捕捉到。’
结论
该研究重申了LLM文献中一个反复出现的观点:虽然训练好的VLM模型非常强大,但它们也抵制关键指令——在本例中,读取并解析图像中的字母。
更先进的模型似乎无法做到这一点——好像它们认为这是“苦差事”,或者被驱使去完成“半成品任务”。
* 我将作者的内联引用转换为超链接。
首次发表于2026年7月27日,星期一













