Anderson의 관점
미국 정부의 PDF 산을 컴퓨터 비전으로 해결하다

아도비의 PDF 형식은 미국 정부 문서 파이프라인에 너무 깊숙이 자리 잡고 있어서 현재 존재하는 주정부 발행 문서의 수가 수백만 개로 추산된다. 이러한 PDF들은 종종 불투명하고 메타데이터가 부족하여, 문서를 찾기 위해 정확히 무엇을 찾고 있는지 모른다면 해당 문서를 찾을 수 없다. 그리고 만약 정확히 무엇을 찾고 있는지 알고 있다면, 검색이 필요하지 않았을 것이다.그러나 새로운 프로젝트는 컴퓨터 비전과 기계 학습 접근 방식을 사용하여 거의 접근할 수 없는 데이터의 산을 가치 있는 자원으로 변환하고자 한다. 이 프로젝트는 연구자, 역사학자, 저널리스트, 학자들을 위한 탐색 가능한 자원으로 만들고자 한다.
1990년대에 미국 정부가 아도비의 PDF 형식을 발견했을 때, 편집 가능한 워드 문서와 달리 PDF를 다양한 방식으로 “구워”서 수정할 수 없게 만들 수 있다는 것을 알게 되었다. 또한 글꼴을 삽입하여 크로스 플랫폼 호환성을 보장할 수 있었고, 인쇄, 복사, 열기 등을 세부적으로 제어할 수 있었다.
더욱 중요한 것은 이러한 핵심 기능이 형식의 가장 오래된 ‘베이스라인’ 사양에서 사용할 수 있었으며, 저장 자료가 나중에 접근성을 보장하기 위해 다시 처리되거나 방문할 필요가 없음을 약속했다. 거의 모든 정부 출판에 필요한 것이 1996년까지 준비되었다.
블록체인 출처와 NFT 기술이 몇십 년 후에 등장하기 전, PDF는 거의 ‘사라진’ 아날로그 문서와 비슷했으며, 팩스와 거의 같은 개념이었다. 이것이 정확히 원하는 것이었다.
PDF에 대한 내부의 반대
PDF가 폐쇄적이고, difficile하며, ‘비사회적’인 정도는 라이브러리 오브 콩그레스의 문서에서 설명되어 있다. 라이브러리 오브 콩그레스는 PDF를 ‘선호하는 형식’으로 간주한다.
‘PDF/A 형식의 주요 목적은 전자 문서를 시간이 지남에 따라 정적 시각적 모양을 유지하는 방식으로 나타내는 것이다. 이를 위해 PDF/A는 장치 독립성, 자체 포함, 자체 문서화를 최대화하려고 한다.’
미국 정부 부처에서 PDF 형식에 대한 지속적인热情, 접근성 표준, 최소 버전 요구 사항은 모두 다르다. 예를 들어, 환경 보호청은 이와 관련하여 엄격하지만 지원적인 정책을 가지고 있지만, 공식 미국 정부 웹사이트 plainlanguage.gov는 ‘사용자가 PDF를 싫어한다’고 인정하고, 2020년 Nielsen Norman Group 보고서를 직접 링크한다. 이 보고서는 PDF: 20년 후에도 여전히 인간 소비에 부적합이라는 제목이다.
한편, irs.gov는 1995년에 세금 기관의 문서를 디지털로 전환하기 위해 만들어졌으며, PDF를 즉시 채택하여 여전히 열렬한 지지자이다.
PDF의 바이러스적 확산
PDF의 핵심 사양이 아도비에 의해 오픈 소스로 공개되자, 서버 측 처리 도구와 라이브러리들이出现했다. 이러한 도구들은 이제 1996년의 PDF 사양과 마찬가지로 신뢰할 수 있고 버그가 없는 것으로 알려져 있다. 소프트웨어 벤더들은 PDF 기능을 저렴한 도구에 통합하기 위해 경쟁했다.
결과적으로, PDF는 미국 정부 부처의 커뮤니케이션과 문서 프레임워크에서 유비쿼터스하게 남아 있다.
2015년 아도비의 VP 엔지니어링 담당자 Phil Ydens는 추정했 bahwa 2.5조 개의 PDF 문서가 세계에 존재한다. PDF 형식은 웹 콘텐츠의 6~11%를 차지하는 것으로 믿어진다. 기술 문화가 오래된 기술을 파괴하는 것에 중독되어 있지만, PDF는 제거할 수 없는 ‘러스트’가 되어, 그것을 호스팅하는 구조의 중심 부분이 되었다.

2018년부터. 아직 강력한 도전자가 나타나지 않았다. 출처: https://twitter.com/trbrtc/status/980407663690502145
워싱턴 대학교와 라이브러리 오브 콩그레스의 연구자들이 수행한 최근 연구에 따르면, ‘수백만 개의 고유한 미국 정부 문서가 웹에 게시된 PDF 형식으로 보관되었다’고 한다.
그러나 연구자들은 이것이 단지 ‘팁의 아이스버그’에 불과하다고 주장한다.
‘주도적인 디지털 역사 학자 Roy Rosenzweig는 2003년부터 디지털 원천 자료에 대한 학술을 위해 대규모로 확장할 수 있는 방법과 접근 방식을 개발하는 것이 필수적이라고 지적했다. 우리는 이제 이러한 규모의 접근 방식을 개발해야 하는 시점에 도달했다. 예를 들어, 라이브러리 오브 콩그레스의 웹 아카이브에는 20억 개 이상의 개별 디지털 자원이 포함되어 있다.’
‘예를 들어, 라이브러리 오브 콩그레스의 웹 아카이브에는 20억 개 이상의 개별 디지털 자원이 포함되어 있다.’
PDF: 분석에 저항적
워싱턴 연구자들의 프로젝트는 기계 학습 방법을 라이브러리 오브 콩그레스의 1,000개 문서에 적용하여, 텍스트와 이미지 기반 쿼리에 대한 다중 모드 검색을 가능하게 한다. 이 프레임워크는 정부 부처뿐만 아니라 다양한 부문에서 PDF 볼륨을 처리할 수 있다.
연구 논문은 1990년대에 미국 정부 부처의 디지털화가 가속화됨에 따라, 정책과 관행이 다각화되었으며, 종종 메타데이터의 품질이 낮은 PDF 출판 방법을 채택했다고 지적한다. 이는 라이브러리 오브 콩그레스의 웹 아카이브에 보관된 PDF 문서의 경우에도 마찬가지이다.
이 기간의 혼란에 대해 논의하면서, 저자들은 다음과 같이 말한다:
‘이러한 노력은 정부 출판물의 양이 폭발적으로 증가하여, 이러한 출판물에 대한 일관된 메타데이터를 생성하고 라이브러리가これら를 획득하는 일반적인 접근 방식이 붕괴되었다.’
결과적으로, 일반적인 PDF 산은 URL을 제외한 모든 컨텍스트가 없는 상태로 존재한다. 또한, 문서는 폐쇄적이고, 자기 참조적이며, 현재의 검색 방법론이 발견할 가능성이 없는 ‘사가’나 내러티브의 일부를 형성하지 않는다. 수백만 개의 PDF가 있는 경우, 수동으로 주석을 달거나 큐레이션하는 것은 불가능하다.
PDF 분석을 위한 컴퓨터 비전
연구자들은 대부분의 이전 연구에서 텍스트 기반 방법을 사용하여 PDF 자료에서 특징과 고수준 개념을 추출했다. 그러나 이 프로젝트는 PDF를 시각적으로 검토하여 특징과 트렌드를 파악한다.
이 프로젝트는 현재 뉴스 콘텐츠의 다중 모드 분석을 위한 연구와 일치한다.
기계 학습은 PDF 분석을 위한 섹터별 스키마를 통해 적용되었다. 그러나 연구자들은 과학 출판이나 다른狭い 부문의 엄격한 규칙에 맞추어진 파이프라인보다, 더广い 범위의 출판물에 적용할 수 있는 고수준의 추출 파이프라인을 만들고자 한다.
불균형 데이터 처리
연구자들은 메트릭스 스키마를 생성하면서, 데이터가 얼마나歪められている지 고려해야 했다.
선택된 데이터셋의 1,000개의 PDF 중 33%는 1페이지만으로 구성되어 있으며, 39%는 2~5페이지이다. 이는 문서의 72%가 5페이지 이하임을 의미한다.
이후에, 18%의 문서는 6~20페이지, 6%는 20~100페이지, 3%는 100페이지 이상이다. 이는 가장 긴 문서가 개별 페이지의 대부분을 구성한다는 것을 의미한다. 그러나 더 粗い 접근 방식은 더 많은 짧은 문서에 주목한다.
연구자들은 이 불균형을 의미 있는 의미론적 속성으로 간주한다. 그러나 PDF는 페이지당 처리되고 양적으로 평가되어야 한다.
아키텍처
프로세스의 시작에서, PDF의 메타데이터는 테이블 데이터로 파싱된다. 이 메타데이터는 파일 크기와 소스 URL과 같은 알려진 양으로 구성된다.
PDF는 페이지로 분할되고, 각 페이지는 JPEG 형식으로 변환된다. 이미지에는 ResNet-50 네트워크가 적용되어, 두 번째 마지막 레이어에서 2,048 차원의 벡터를 추출한다.

PDF에서 추출을 위한 파이프라인. 출처: https://arxiv.org/ftp/arxiv/papers/2112/2112.02471.pdf
同时, 페이지는 pdf2text로 텍스트 파일로 변환되고, TF-IDF 특징은 scikit-learn을 통해 얻어진다.
TF-IDF는 단어의 빈도와 문서 빈도를 측정하는 방법이다. 연구자들은 단어(유니그램)를 시스템의 TF-IDF 설정에서 가장 작은 단위로 사용했다.
연구자들은 기계 학습에 더 복잡한 방법이 있음을 인정하지만, 이 작업에는 더 복잡한 것이 불필요하다고 주장한다.
각 문서에 소스 URL이 연결되어 있기 때문에, 시스템은 문서의 출처를 결정할 수 있다.

이것은 1,000개의 문서에 대해서는 사소해 보일 수 있지만, 40만 개 이상의 문서에 대해서는 매우 중요한 것이다.
새로운 텍스트 검색 접근 방식
이 프로젝트의 목표 중 하나는 텍스트 기반 쿼리의 검색 결과를 더 의미 있게 만드는 것이다. 이는 과도한 사전 지식 없이 유익한 탐색을 허용한다. 연구자들은 다음과 같이 말한다:
‘키워드 검색은 직관적이고 확장 가능한 검색 방법이지만, 사용자가 관련 결과를 검색하는 키워드 쿼리를 생성해야 하는 책임이 있다.’
TF-IDF 값을 얻은 후, 가장 일반적으로 등장하는 단어를 계산하고, ‘평균’ 문서를 추정할 수 있다. 연구자들은 이러한跨文档 키워드가 일반적으로 의미 있으므로, 이는 학자들이 탐색할 수 있는 유용한 관계를 형성한다. 이는 개별 문서의 텍스트만으로는 얻을 수 없는 관계이다.
시각적으로, 이 과정은 정부 부처에서 다양한 단어의 ‘무드 보드’를 생성한다:

TF-IDF 키워드สำหร 다양한 미국 정부 부처, TF-IDF로 얻음
이 추출된 키워드와 관계는 나중에 동적 매트릭스를 형성하여, PDF의 корпус가 ‘이야기’를 시작하고, 키워드 관계가 문서를 연결하여 주제 또는 테마에 대한 탐색 가능한 다중 부분 ‘사가’를 구성한다.
연구자들은 k-평균 클러스터링을 사용하여 관련된 문서를 식별한다. 이는 문서가 공통의 소스를 공유하지 않는 경우에도 가능하다. 이는 데이터셋에 걸쳐 적용할 수 있는 키워드 메타데이터를 개발하는 것을 가능하게 한다.

시각적 분석
워싱턴 연구자들의 접근 방식의真正한 혁신은 PDF의 래스터화된 모양에 기계 학습 기반 시각적 분석 기술을 적용하는 것이다.
이 방법을 사용하면, 텍스트 자체에서 공통의 기반이 제공되지 않더라도 ‘REDACTED’ 태그를 생성할 수 있다.

새 프로젝트에서 컴퓨터 비전으로 식별된 REDACTED PDF 첫 페이지 클러스터
또한, 이 방법은 정부 문서가 래스터화된 경우에도 이러한 태그를 생성할 수 있다. 이는 기밀 정보가 포함된 경우에 종종 발생한다. 이는 이러한 관행에 대한 철저한 검색을 가능하게 한다.
또한, 지도와 도면을 식별하고 분류할 수 있다. 저자들은 이러한 기능에 대해 다음과 같이 말한다:
‘기밀 또는 민감한 정보를 공개하는 것에 관심이 있는 학자들에게는 이러한 유형의 클러스터를 분석하고 연구하는 것이 특히 중요할 수 있다.’
문서를 분류하고 ‘사가’를 생성하는 데 사용할 수 있는 다양한 시각적 지표가 있다. 이러한 ‘토큰’은 의회 인장이거나 다른 로고 또는 반복되는 시각적 특징일 수 있다. 이러한 특징은 순수한 텍스트 검색에서 의미가 없는 경우에도 문서를 분류하고 ‘사가’를 생성하는 데 사용할 수 있다.
레이아웃만으로도 그룹화와 분류를 허용한다.

레이아웃만으로도 그룹화와 분류를 허용한다.
저자들은 다음과 같이 말한다:
‘PDF를 시각적 특징에 따라 검색하고 분석하는 능력은 포괄적인 접근 방식이다. 이는 기존의 텍스트 분석 노력을 보완하고, 생체 디지털 콘텐츠에 대한 검색과 분석을 재창조한다.’
연구자들은 이 프레임워크를 더 큰 데이터셋에 적용하여, 2008년 말 대통령 웹 아카이브 데이터셋과 같은 데이터셋을 포함하여, 1,000만 개 이상의 항목을 포함하는 데이터셋을 처리할 수 있도록 할 계획이다. 초기에는, 시스템을 ‘수만 개’의 정부 PDF에 적용할 계획이다.
시스템은 실제 사용자, 즉 사서, 기록 보관员, 변호사, 역사학자, 학자들과 같은 사람들과 함께 평가될 것이다. 시스템은 이러한 그룹의 피드백에 따라 발전할 것이다.
생체 디지털 정부 출판물의 규모에 대처하기: 수백만 개의 PDF를 처리하고 검색하기 위한 파이프라인는 Paul G. Allen School for Computer Science & Engineering의 Benjamin Charles Germain Lee와 Washington, D.C.의 Library of Congress의 Public Historian in Residence 및 Digital Content Management 책임자 Trevor Owens가 작성했다.
*인라인 인용을 하이퍼링크로 변환한 내 작업.
원래 2021년 12월 28일에 게시됨.












