Anderson 视角
解决美国政府的PDF山脉问题:使用计算机视觉

Adobe的PDF格式已经深深地扎根于美国政府的文件流程中,目前估计有数亿份州发文档存在。这些PDF文档往往不透明,缺乏元数据,如果你不知道自己在找什么,你可能永远也找不到相关文档。即使你知道自己在找什么,你可能也不需要搜索。然而,一个新的项目使用计算机视觉和其他机器学习方法,将这座几乎无法接近的数据山转化为研究人员、历史学家、记者和学者的宝贵资源。
当美国政府在20世纪90年代发现Adobe的便携式文档格式(PDF)时,它决定采用这种格式。与可编辑的Word文档不同,PDF可以以各种方式“烘焙”,使其难以或无法修改;字体可以嵌入,确保跨平台兼容性;打印、复制甚至打开都可以在细粒度上控制。
更重要的是,这些核心功能在格式的早期“基线”规范中已经存在,承诺存档材料无需后期处理即可确保可访问性。几乎所有政府出版所需的功能都已就绪到1996年。
由于区块链证明和NFT技术还没有出现,PDF就像数字时代中的一份“死”类似文件,只比传真多了一个概念上的差异。这正是所期望的结果。
内部关于PDF的异议
PDF的封闭性、不可分析性和“非社会性”在国会图书馆关于该格式的文档中有所体现,国会图书馆偏爱PDF作为其“首选格式”:
‘PDF/A格式的主要目的是以一种方式表示电子文档,使其静态视觉外观随时间保持一致,独立于用于创建、存储或渲染文件的工具和系统。为此,PDF/A尝试最大限度地提高设备独立性、自包含性和自描述性。’
美国政府各部门对PDF格式的热情、可访问性标准和最低版本要求各不相同。例如,环境保护署有严格但支持性的政策,而美国政府的官方网站plainlanguage.gov 承认 ‘用户讨厌PDF’,甚至直接链接到2020年尼尔森诺曼集团的报告,题为PDF:20年后仍然不适合人类使用。
与此同时,irs.gov 于1995年专门创建了数字化文档,并立即采用了PDF格式,至今仍然是其热心倡导者。
PDF的病毒式传播
自从Adobe将PDF的核心规范开源以来,一系列服务器端处理工具和库已经出现,其中许多现在已经成为久经考验和根深蒂固的项目,和1996年的PDF规范一样可靠和稳定。同时,软件供应商也急于将PDF功能集成到低成本工具中。
因此,无论各个政府部门是否喜欢PDF,PDF仍然是美国政府部门通信和文件框架中的必备组成部分。
2015年,Adobe的文档云工程副总裁Phil Ydens 估计,全球存在2.5万亿个PDF文档,而PDF格式据信占所有网页内容的6-11%。在一个痴迷于颠覆旧技术的科技文化中,PDF已经成为不可根除的“锈蚀”——主机结构的核心组成部分。

2018年。目前还没有强大的竞争对手。 来源:https://twitter.com/trbrtc/status/980407663690502145
根据华盛顿大学和国会图书馆的研究人员最近的一项研究,‘数亿个美国政府文档以PDF形式发布在网上,到目前为止,图书馆已经存档了这些文档’。
然而,研究人员认为这只是“冰山一角”:
‘正如领先的数字历史学者Roy Rosenzweig早在2003年就指出,关于出生数字的原始资料的学术研究,开发能够扩展到数十亿甚至数百亿个数字资源的方法和方法至关重要。我们现在已经到了需要为这种规模开发方法的时候了。 ‘
‘例如,国会图书馆的网络档案现在包含超过20亿个单独的数字资源。’
PDF:抗分析
华盛顿研究人员的项目将多种机器学习方法应用于国会图书馆的1,000个精选文档的公开可用和注释 语料库,旨在开发能够快速、多模式地检索基于文本和图像的查询的系统,可以扩展到当前(和不断增长的)PDF卷的高度,不仅是在政府部门,还在多个领域。
正如该论文所观察到的,20世纪90年代美国政府各部门数字化的加速步伐导致了政策和实践的分歧,经常采用不包含元数据的PDF发布方法,这些元数据曾经是政府图书馆服务的黄金标准——甚至没有基本的原生PDF元数据,这些元数据本可以使PDF集合更容易访问和索引。
讨论这一时期的混乱,作者指出:
‘这些努力导致了政府出版物数量的爆炸式增长,这反过来又导致了对这些出版物的一致元数据的产生和图书馆的获取方法的崩溃。’
因此,典型的PDF山脉除了直接链接到它的URL之外没有任何上下文。进一步来说,山脉中的文档是封闭的、自我参照的,不会形成任何“传奇”或叙事,这些是当前的搜索方法不太可能发现的,即使这些隐藏的联系无疑存在。
在考虑的规模下,手动注释或策划是不可能的。 该项目的1000个国会图书馆文档所派生的数据集包含超过4000万个PDF,研究人员计划在不久的将来使其成为一个可解决的挑战。
计算机视觉用于PDF分析
大多数作者引用过的先前研究使用基于文本的方法从PDF材料中提取特征和高级概念;相比之下,他们的项目专注于通过检查PDF的视觉层次来推导特征和趋势,与当前关于新闻内容的多模态分析的研究一致。
虽然机器学习也已通过诸如Semantic Scholar等行业特定方案应用于PDF分析,但作者旨在创建更高级的提取管道,这些管道在广泛的出版物中具有广泛的适用性,而不是针对科学出版或其他狭窄领域的严格要求。
解决不平衡数据
在创建指标模式时,研究人员必须考虑数据的偏斜程度,至少在每个项目的大小方面。
在1000个PDF文档的精选数据集中(作者假设这代表了4000万个文档),33%的文档只有一页长,39%的文档有2-5页长。这意味着72%的文档有5页或更少。
之后,有一个相当大的跳跃:18%的剩余文档长达6-20页,6%的文档长达20-100页,3%的文档长达100页或以上。这意味着最长的文档占据了大部分单独页面,而一个考虑文档而不是页面的更粗略方法会将注意力转向数量更多的较短文档。
尽管如此,这些都是有见地的指标,因为单页文档往往是技术图表或地图;2-5页文档往往是新闻稿和表格;而非常长的文档通常是书面报告和出版物,尽管在长度上,它们与包含完全不同语义解释挑战的大量自动数据转储混在一起。
因此,研究人员将这种不平衡视为一个有意义的语义属性本身。尽管如此,PDF仍需要按页处理和量化。
架构
在开始处理过程时,PDF的元数据被解析为表格数据。这种元数据不会缺失,因为它由已知的数量组成,例如文件大小和源URL。
然后将PDF分成页面,每个页面通过ImageMagick转换为JPEG格式。然后将图像输入ResNet-50网络,网络从第二到最后一层推导出一个2048维向量。

PDF提取管道。 来源:https://arxiv.org/ftp/arxiv/papers/2112/2112.02471.pdf
同时,页面被转换为文本文件,通过scikit-learn获得TF-IDF特征化。
TF-IDF代表词频-逆文档频率,它衡量每个短语在文档中的普遍性与其在整个数据集中的频率,按0到1的细粒度进行衡量。研究人员在系统的TF-IDF设置中使用单个单词(一元组)作为最小单位。
尽管他们承认机器学习为此任务提供了更复杂的方法,但作者认为任何更复杂的方法都是不必要的。
每个文档都有一个关联的源URL,这使得系统能够确定数据集中的文档来源。

这对1000个文档来说可能看起来很微不足道,但对于4000万个文档来说,这将是一个真正的开眼界的体验。
新的文本搜索方法
该项目的目标之一是使基于文本的查询的搜索结果更有意义,使得无需过多的先验知识就可以进行探索。作者指出:
‘虽然关键字搜索是一种直观且高度可扩展的搜索方法,但它也可能受到限制,因为用户负责制定关键字查询以检索相关结果。’
一旦获得TF-IDF值,就可以计算出最常见的词语,并估计语料库中的“平均”文档。研究人员认为,由于这些跨文档关键字通常很有意义,这个过程形成了学者可以探索的有用关系,这些关系不能仅通过单独索引每个文档的文本来获得。
从视觉上来说,这个过程促进了一个“情绪板”的词语,它们来自各种政府部门:

通过TF-IDF获得的各种美国政府部门的TF-IDF关键字
这些提取的关键字和关系可以稍后用于形成动态矩阵,以便在搜索结果中,语料库中的PDF开始“讲述故事”,关键字关系将文档(可能跨越数百年)连接起来,以便为一个主题或主题形成一个可探索的多部分“传奇”。
研究人员使用k-means聚类来识别相关文档,即使这些文档没有共同的来源。这使得可以开发适用于整个数据集的关键短语元数据,无论是作为严格文本搜索中术语的排名还是作为更动态的探索环境中的附近节点:

视觉分析
华盛顿研究人员方法的真正新颖之处在于,他们将基于机器学习的视觉分析技术应用于数据集中PDF的光栅化外观。
这样就可以在视觉基础上生成一个“编辑”标签,即使文本本身没有提供足够的共同基础。

新项目中通过计算机视觉识别的一组编辑的PDF封面
此外,这种方法可以从政府文档中推导出这样的标签,即使这些文档已经被光栅化,这通常是编辑材料的案例,使得对这种做法的彻底和全面搜索成为可能。
此外,地图和图表可以被识别和分类,作者对这种潜在功能进行了评论:
‘对于有兴趣披露机密或敏感信息的学者来说,隔离这种材料集群以进行分析和研究可能特别有趣。’
该论文指出,一系列视觉指标可以用来对文档进行分类和创建“传奇”,这些指标通常与特定类型的政府PDF相关,例如国会印章或其他标志或反复出现的视觉特征,这些特征在纯文本搜索中没有语义存在。
此外,无法分类的文档或来自非共同来源的文档可以根据其布局(例如,列、字体类型和其他独特方面)来识别。

仅凭布局就可以在视觉搜索空间中进行分组和分类
虽然作者并没有忽视文本,但很明显,视觉搜索空间驱动了这项工作。
‘搜索和分析PDF的能力根据其视觉特征是一种全面的方法:它不仅增强了现有的文本分析工作,而且重新定义了出生数字内容的搜索和分析可以是什么。’
作者计划将他们的框架扩展到更大规模的数据集,包括2008年总统任期结束网络档案数据集,该数据集包含超过1000万个项目。最初,然而,他们计划将系统扩展到解决“数万”个政府PDF的问题。
该系统的初衷是首先由真正的用户评估,包括图书管理员、档案管理员、律师、历史学家和其他学者,并将根据这些群体的反馈不断演进。
处理出生数字政府出版物的规模:处理和搜索数百万个PDF的管道由Benjamin Charles Germain Lee(来自保罗·G·艾伦计算机科学与工程学院)和特雷弗·欧文斯(来自国会图书馆的公共历史学家和数字内容管理负责人)撰写。
*我将内联引用转换为超链接。
最初发表于2021年12月28日












