Andersonの視点

米政府のPDFマウンテンにコンピュータビジョンで挑む

mm
Unite.AI を Google の優先ソースに追加

アドビのPDF形式は、米政府の文書パイプラインに深く根付いており、現在存在する州が発行した文書の数は、保守的に見積もると数億件に達していると考えられている。これらのPDFは、多くの場合自動化システムによって作成されており、不透明でメタデータが不足していることが多い。これらのPDFは、集団的に物語やサーガを語ることはなく、もしもあなたが何を探しているのかを正確に知らなければ、関連する文書を見つけることはほとんど不可能である。もしもあなたが知っていたとしたら、あなたはおそらく検索する必要はなかった。しかし、新しいプロジェクトは、コンピュータビジョンと他の機械学習アプローチを使用して、このほとんどアプローチ不能なデータの山を、研究者、歴史家、ジャーナリスト、学者にとって有価値で探索可能なリソースに変えることを目指している。

米政府は1990年代にアドビのPortable Document Format(PDF)を発見し、PDFが好きだった。編集可能なWord文書とは異なり、PDFはさまざまな方法で「焼き付け」られることができ、後で修正することが困難または不可能になる可能性がある。フォントを埋め込むことができ、クロスプラットフォームの互換性を保証でき、印刷、コピー、開くことができるグランラ性のある方法で制御することができた。

もっと重要なことは、これらのコア機能は、フォーマットの古い「ベースライン」仕様で利用可能であり、保存資料が後でアクセス可能であることを保証するために再処理または再訪問する必要はなかった。ほとんどすべての政府出版物に必要なものが1996年までに整備されていた。

ブロックチェーンの出自とNFTテクノロジーが数十年先になるまで、PDFは「死んだ」アナログ文書に近かった。つまり、ファックスからコンセプト上のハICCのみだった。

PDFについての内部の不満

PDFがどれほど閉じているか、扱いにくいか、そして「非社会的」であるかは、Library of Congressのフォーマットの文書で説明されている。Library of Congressは、PDFを「優先フォーマット」として好んでいる。

‘PDF/Aフォーマットの主な目的は、電子文書を静的な視覚的な外見を時間の経過とともに保存する方法で表現することである。ツールやシステムの独立性、自己包含性、自己文書化を最大化するために、PDF/Aはデバイスの独立性、自己包含性、自己文書化を試みる。’

PDFフォーマットへの継続的な熱意、оступ性のための規格、最小バージョンの要件は、米政府の各部門によって異なる。たとえば、環境保護庁はこの点で厳格だが支援的な政策を持っているが、米政府の公式ウェブサイトplainlanguage.govは、認識しているが、‘ユーザーはPDFを嫌がっている’、そして2020年のNielsen Norman GroupのレポートPDF: 20年後でもまだ人間の消費に適していない」への直接リンクもある。

PDFのウイルス的拡散

PDFのコア仕様がアドビによってオープンソース化された後、一連のサーバーサイド処理ツールとライブラリが登場し、多くの場合、1996年のPDF仕様と同じくらい古く、信頼性があり、バグに強い。ソフトウェアベンダーは、PDF機能を低コストツールに統合するために競争した。

結果として、PDFは、愛されているか嫌われているかは関係なく、米政府の多くの部門のコミュニケーションと文書化の枠組みに広く普及している。

2015年、アドビのドキュメントクラウドのエンジニアリングVPであるPhil Ydensは、推定しているが、世界には2.5兆のPDF文書が存在し、フォーマットは6〜11%のウェブコンテンツを占めている。テクノロジー文化は古いテクノロジーを破壊することに依存しているが、PDFは不可欠な「錆」である。つまり、ホストする構造の一部となっている。

PDF: 分析に抵抗する

ワシントン研究者たちのプロジェクトは、公開および注釈されたコーパスの1,000個の文書に、機械学習方法を適用し、テキストと画像ベースのクエリのための高速な多モーダル検索を可能にするシステムを開発することを目指している。

コンピュータビジョンによるPDF分析

以前の研究とは異なり、研究者たちは、PDFを視覚的なレベルで調査することによって、機能とトレンドを導き出すことに重点を置いている。

不均衡データへの対応

研究者たちは、メトリクススキーマを作成する際に、データがどれほど歪んでいるかを考慮しなければならない。

アーキテクチャ

プロセスの開始時に、PDFのメタデータは表形式のデータに解析される。

新しいテキスト検索へのアプローチ

プロジェクトの1つの目的は、テキストベースのクエリの検索結果をより意味のあるものにすることである。

視覚分析

ワシントン研究者たちのアプローチの真の新しさは、データセットのPDFのラスター化された外見に基づいた視覚分析技術を適用することである。

生まれたデジタル政府出版物の規模に取り組む:数百万のPDFを処理して検索するためのパイプラインに向けては、Benjamin Charles Germain Lee(Paul G. Allen School for Computer Science & Engineering)とTrevor Owens(Library of CongressのPublic Historian in ResidenceおよびDigital Content Managementの責任者)によって書かれた。

元の出版日:2021年12月28日

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai