Góc nhìn Anderson
Xử lý Núi PDF của Chính phủ Mỹ với Thị giác Máy tính

Định dạng PDF của Adobe đã ăn sâu vào các đường ống tài liệu của chính phủ Mỹ đến mức số lượng tài liệu do chính phủ phát hành hiện có được ước tính là hàng trăm triệu. Thường không minh bạch và thiếu siêu dữ liệu, những tệp PDF này – nhiều tệp được tạo bởi các hệ thống tự động – tập thể không kể chuyện hoặc sử thi; nếu bạn không biết chính xác mình đang tìm kiếm gì, bạn có thể sẽ không bao giờ tìm thấy một tài liệu liên quan. Và nếu bạn đã biết, bạn có thể không cần tìm kiếm.Tuy nhiên, một dự án mới đang sử dụng thị giác máy tính và các phương pháp học máy khác để thay đổi gần như không thể tiếp cận này núi dữ liệu thành một nguồn tài nguyên quý giá và có thể khám phá được cho các nhà nghiên cứu, nhà sử học, nhà báo và học giả.
Khi chính phủ Mỹ phát hiện ra Định dạng Tài liệu Di động (PDF) của Adobe vào những năm 1990, họ quyết định rằng họ thích nó. Không giống như các tài liệu Word có thể chỉnh sửa, các tệp PDF có thể được “nướng” theo nhiều cách làm cho chúng khó hoặc thậm chí không thể sửa đổi sau này; phông chữ có thể được nhúng, đảm bảo khả năng tương thích trên nhiều nền tảng; và in, sao chép và thậm chí mở có thể được kiểm soát trên cơ sở chi tiết.
Quan trọng hơn, những tính năng cốt lõi này đã có sẵn trong một số thông số kỹ thuật “cơ bản” của định dạng, hứa hẹn rằng tài liệu lưu trữ sẽ không cần phải xử lý lại hoặc truy cập lại sau này để đảm bảo khả năng tiếp cận. Gần như mọi thứ mà xuất bản chính phủ cần đều đã được đặt ra vào năm 1996.
Với công nghệ blockchain và NFT cách đây vài thập kỷ, PDF là gần như một tài liệu “chết” tương tự, chỉ cách một bước nhảy về mặt khái niệm so với một bản fax. Đây chính xác là những gì được mong muốn.
Kháng nghị Nội bộ về PDF
Mức độ mà các tệp PDF là kín, không thể tiếp cận và “không xã hội” được đặc trưng trong tài liệu về định dạng tại Thư viện Quốc hội, ưa thích PDF là định dạng “ưa thích” của nó:
‘Mục đích chính của định dạng PDF/A là đại diện cho các tài liệu điện tử theo cách bảo tồn hình ảnh trực quan tĩnh của chúng theo thời gian, độc lập với các công cụ và hệ thống được sử dụng để tạo, lưu trữ hoặc hiển thị tệp. Để đạt được điều này, PDF/A cố gắng tối đa hóa sự độc lập của thiết bị, tự chứa và tự ghi chép.’
Sự hào hứng liên tục đối với định dạng PDF, tiêu chuẩn cho khả năng tiếp cận và yêu cầu về phiên bản tối thiểu, tất cả đều khác nhau trên các bộ phận của chính phủ Mỹ. Ví dụ, trong khi Cơ quan Bảo vệ Môi trường có các chính sách nghiêm ngặt nhưng hỗ trợ trong lĩnh vực này, trang web chính thức của chính phủ Mỹ plainlanguage.gov nhận ra rằng ‘người dùng ghét PDF’, và thậm chí liên kết trực tiếp đến một báo cáo năm 2020 của Nielsen Norman Group có tiêu đề PDF: Vẫn không phù hợp cho tiêu dùng của con người, 20 năm sau.
Trong khi đó, irs.gov, được tạo vào năm 1995 cụ thể để chuyển đổi tài liệu của cơ quan thuế sang kỹ thuật số, đã ngay lập tức áp dụng PDF và vẫn là một người ủng hộ nhiệt tình.
Sự Lan Truyền của PDF
Kể từ khi các thông số kỹ thuật cốt lõi của PDF được phát hành dưới dạng mã nguồn mở bởi Adobe, một loạt các công cụ và thư viện xử lý phía máy chủ đã xuất hiện, nhiều công cụ hiện đã trở thành được thiết lập và ăn sâu như các thông số kỹ thuật PDF năm 1996, và cũng đáng tin cậy và chống lỗi, trong khi các nhà cung cấp phần mềm đã vội vàng tích hợp chức năng PDF vào các công cụ giá rẻ.
Kết quả là, dù được yêu thích hay ghét bỏ bởi các bộ phận chủ quản của nó, các tệp PDF vẫn phổ biến trong các khung tài liệu và truyền thông trên một số lượng lớn các bộ phận của chính phủ Mỹ.
Vào năm 2015, Phó Chủ tịch Kỹ thuật của Adobe về Đám mây Tài liệu, Phil Ydens ước tính rằng có 2,5 nghìn tỷ tài liệu PDF tồn tại trên thế giới, trong khi định dạng này được cho là chiếm khoảng 6-11% tất cả nội dung web. Trong một văn hóa công nghệ bị nghiện phá vỡ các công nghệ cũ, PDF đã trở thành “rỉ sét” không thể xóa bỏ – một phần trung tâm của cấu trúc mà nó chứa.

Từ 2018. Không có bằng chứng đáng kể về một thách thức đáng gờm nào. Nguồn: https://twitter.com/trbrtc/status/980407663690502145
Theo một nghiên cứu gần đây từ các nhà nghiên cứu tại Đại học Washington và Thư viện Quốc hội, ‘hàng trăm triệu tài liệu chính phủ Mỹ độc nhất được đăng trên web dưới dạng PDF đã được lưu trữ bởi các thư viện cho đến nay’.
Tuy nhiên, các nhà nghiên cứu cho rằng đây chỉ là “đỉnh của tảng băng trôi”*:
‘Như một nhà sử học hàng đầu về lịch sử kỹ thuật số Roy Rosenzweig đã lưu ý từ năm 2003, khi nói đến các nguồn chính thức sinh ra dưới dạng kỹ thuật số cho các nghiên cứu học thuật, điều quan trọng là phải phát triển các phương pháp và cách tiếp cận sẽ mở rộng quy mô lên hàng chục và hàng trăm triệu, thậm chí hàng tỷ nguồn tài nguyên [kỹ thuật số]. Chúng ta đã đến thời điểm mà việc phát triển các cách tiếp cận cho quy mô này là cần thiết.
‘Ví dụ, các lưu trữ web của Thư viện Quốc hội hiện chứa hơn 20 tỷ tài nguyên kỹ thuật số riêng lẻ.’
PDF: Kháng lại Phân tích
Dự án của các nhà nghiên cứu tại Washington áp dụng một số phương pháp học máy để một cơ sở dữ liệu công khai và được chú thích của 1.000 tài liệu được chọn từ Thư viện Quốc hội, với ý định phát triển các hệ thống có khả năng truy xuất và tìm kiếm đa phương thức nhanh như chớp về văn bản và hình ảnh trong các khuôn khổ có thể mở rộng lên hàng triệu PDF, không chỉ trong chính phủ, mà trên nhiều lĩnh vực khác.
Khi tốc độ số hóa tăng tốc trên nhiều bộ phận chính phủ Mỹ khác nhau trong những năm 1990, dẫn đến các chính sách và thực tiễn khác nhau, và thường dẫn đến việc áp dụng các phương pháp xuất bản PDF không chứa cùng chất lượng siêu dữ liệu mà từng là tiêu chuẩn vàng của dịch vụ thư viện chính phủ – hoặc thậm chí không có siêu dữ liệu bản địa PDF cơ bản, điều có thể hữu ích trong việc làm cho các bộ sưu tập PDF trở nên dễ tiếp cận và thân thiện hơn với việc lập chỉ mục.
Thảo luận về giai đoạn gián đoạn này, các tác giả lưu ý:
‘Những nỗ lực này dẫn đến sự tăng trưởng nhanh chóng về số lượng xuất bản chính phủ, điều này đã dẫn đến sự sụp đổ của cách tiếp cận chung mà theo đó siêu dữ liệu nhất quán được sản xuất cho các xuất bản như vậy và theo đó Thư viện thu được bản sao của chúng.’
Do đó, một núi PDF điển hình tồn tại mà không có bất kỳ ngữ cảnh nào ngoại trừ các URL liên kết trực tiếp đến nó. Hơn nữa, các tài liệu trong núi này được đóng gói, tự tham chiếu và không hình thành một phần của bất kỳ “saga” hoặc câu chuyện nào mà các phương pháp tìm kiếm hiện tại có thể nhận ra, mặc dù những kết nối ẩn như vậy chắc chắn tồn tại.
Ở quy mô đang xem xét, việc chú thích hoặc quản lý thủ công là một triển vọng không thể. Cơ sở dữ liệu mà 1.000 tài liệu của Thư viện Quốc hội được rút ra chứa hơn 40 triệu tệp PDF, mà các nhà nghiên cứu dự định sẽ biến thành một thách thức có thể giải quyết được trong tương lai gần.
Thị giác Máy tính cho Phân tích PDF
Hầu hết các nghiên cứu trước đây mà các tác giả trích dẫn sử dụng các phương pháp dựa trên văn bản để trích xuất các tính năng và khái niệm cấp cao từ tài liệu PDF; ngược lại, dự án của họ tập trung vào việc trích xuất các tính năng và xu hướng bằng cách kiểm tra các tệp PDF ở mức trực quan, phù hợp với nghiên cứu hiện tại về phân tích đa phương thức của nội dung tin tức.
Mặc dù học máy cũng đã được áp dụng theo cách này cho phân tích PDF thông qua các kế hoạch cụ thể theo lĩnh vực như Semantic Scholar, các tác giả nhằm mục đích tạo ra các đường ống trích xuất cấp cao hơn có thể áp dụng rộng rãi trên nhiều loại xuất bản, chứ không chỉ dành cho xuất bản khoa học hoặc các lĩnh vực hẹp khác.
Xử lý Dữ liệu Không Cân bằng
Khi tạo một lược đồ đo lường, các nhà nghiên cứu đã phải xem xét cách dữ liệu bị lệch, ít nhất là về kích thước mỗi mục.
Trong 1.000 tệp PDF trong tập dữ liệu được chọn (mà các tác giả giả định là đại diện cho 40 triệu tệp mà chúng được rút ra), 33% chỉ dài một trang, và 39% dài từ 2 đến 5 trang. Điều này đặt 72% tài liệu ở mức 5 trang hoặc ít hơn.
Sau đó, có một bước nhảy khá lớn: 18% tài liệu còn lại dài từ 6 đến 20 trang, 6% từ 20 đến 100 trang và 3% từ 100 trang trở lên. Điều này có nghĩa là các tài liệu dài nhất chiếm đa số các trang riêng lẻ được trích xuất, trong khi một cách tiếp cận ít chi tiết hơn sẽ xem xét các tài liệu riêng lẻ sẽ làm cho sự chú ý bị偏 về các tài liệu ngắn hơn nhiều.
Mặc dù vậy, đây là những số liệu đầy ý nghĩa, vì các tài liệu một trang thường là sơ đồ kỹ thuật hoặc bản đồ; tài liệu từ 2 đến 5 trang thường là thông cáo báo chí và biểu mẫu; và các tài liệu rất dài thường là báo cáo và xuất bản dài, mặc dù về chiều dài, chúng được trộn lẫn với các dump dữ liệu tự động khổng lồ chứa các thách thức giải thích ngữ nghĩa hoàn toàn khác.
Do đó, các nhà nghiên cứu đang coi sự mất cân bằng này là một thuộc tính ngữ nghĩa có ý nghĩa.
Kiến trúc
Ở đầu quá trình, siêu dữ liệu của tệp PDF được phân tích thành dữ liệu bảng. Siêu dữ liệu này sẽ không bị thiếu, vì nó bao gồm các lượng已知 như kích thước tệp và URL nguồn.
Tệp PDF sau đó được chia thành các trang, với mỗi trang được chuyển đổi thành định dạng JPEG thông qua ImageMagick. Hình ảnh sau đó được cung cấp cho mạng ResNet-50, từ đó có được một vector 2.048 chiều từ lớp thứ hai đến cuối cùng.

Quy trình trích xuất từ tệp PDF. Nguồn: https://arxiv.org/ftp/arxiv/papers/2112/2112.02471.pdf
Đồng thời, trang được chuyển đổi thành tệp văn bản bởi pdf2text, và các featurizations TF-IDF được thu được thông qua scikit-learn.
TF-IDF là viết tắt của Tần suất Từ và Tần suất Tài liệu Nghịch đảo, đo lường sự phổ biến của mỗi cụm từ trong tài liệu so với tần suất của nó trong toàn bộ tập dữ liệu, trên một thang đo chi tiết từ 0 đến 1. Các nhà nghiên cứu đã sử dụng các từ đơn (unigrams) làm đơn vị nhỏ nhất trong cài đặt TF-IDF của hệ thống.
Mặc dù họ thừa nhận rằng học máy có các phương pháp tinh vi hơn để cung cấp so với TF-IDF, các tác giả lập luận rằng bất cứ điều gì phức tạp hơn là không cần thiết cho nhiệm vụ đã nêu.
Việc mỗi tài liệu có một URL nguồn liên kết cho phép hệ thống xác định nguồn gốc của các tài liệu trong tập dữ liệu.

Điều này có thể看似 tầm thường đối với 1.000 tài liệu, nhưng nó sẽ là một điều mở mắt đối với 40 triệu+.
Các Cách Tiếp cận Mới cho Tìm kiếm Văn bản
Một trong những mục tiêu của dự án là làm cho kết quả tìm kiếm cho các truy vấn dựa trên văn bản trở nên có ý nghĩa hơn, cho phép khám phá có kết quả mà không cần kiến thức trước đó quá nhiều. Các tác giả tuyên bố:
‘Trong khi tìm kiếm từ khóa là một phương pháp trực quan và có thể mở rộng, nó cũng có thể hạn chế, vì người dùng phải chịu trách nhiệm xây dựng các truy vấn từ khóa để thu được kết quả liên quan.’
Khi các giá trị TF-IDF được thu được, có thể tính toán các từ được đặc trưng thường xuyên nhất và ước tính một “tài liệu trung bình” trong tập dữ liệu. Các nhà nghiên cứu cho rằng vì các từ khóa liên tài liệu này thường có ý nghĩa, quá trình này tạo ra các mối quan hệ hữu ích cho các học giả để khám phá, điều mà không thể thu được chỉ bằng cách lập chỉ mục riêng lẻ văn bản của từng tài liệu.
Trực quan, quá trình này tạo điều kiện cho một “bảng màu” của các từ phát sinh từ các bộ phận chính phủ khác nhau:

Từ khóa TF-IDF cho các bộ phận chính phủ Mỹ khác nhau, thu được bằng TF-IDF.
Các từ khóa và mối quan hệ được trích xuất này có thể được sử dụng sau này để tạo thành các ma trận động trong kết quả tìm kiếm, với tập dữ liệu các tệp PDF bắt đầu “kể chuyện”, và các mối quan hệ từ khóa liên kết các tài liệu (có thể là trên hàng trăm năm), để phác thảo một “saga” đa phần có thể khám phá được cho một chủ đề hoặc chủ đề.
Các nhà nghiên cứu sử dụng phân cụm k-means để xác định các tài liệu liên quan, ngay cả khi các tài liệu không chia sẻ một nguồn chung. Điều này cho phép phát triển các siêu dữ liệu từ khóa có thể áp dụng trên toàn bộ tập dữ liệu, điều này sẽ biểu hiện dưới dạng xếp hạng cho các thuật ngữ trong tìm kiếm văn bản nghiêm ngặt hoặc dưới dạng các nút lân cận trong một môi trường khám phá động hơn:

Phân tích Trực quan
Sự mới mẻ thực sự của cách tiếp cận của các nhà nghiên cứu tại Washington là áp dụng các kỹ thuật phân tích trực quan dựa trên học máy cho hình ảnh raster của các tệp PDF trong tập dữ liệu.
Điều này cho phép tạo ra một thẻ “REDACTED” dựa trên cơ sở trực quan, nơi không có gì trong văn bản sẽ cung cấp một cơ sở chung.

Một cụm trang đầu của tệp PDF đã được chỉnh sửa được xác định bởi thị giác máy tính trong dự án mới.
Hơn nữa, phương pháp này có thể thu được thẻ như vậy ngay cả từ các tài liệu chính phủ đã được raster hóa, điều này thường xảy ra với tài liệu đã được chỉnh sửa, làm cho việc tìm kiếm toàn diện và toàn diện đối với thực tiễn này trở nên khả thi.
Ngoài ra, các bản đồ và sơ đồ có thể được xác định và phân loại, và các tác giả bình luận về chức năng này:
‘Đối với các học giả quan tâm đến việc tiết lộ thông tin bí mật hoặc nhạy cảm, việc cô lập chính xác loại cụm tài liệu này để phân tích và nghiên cứu có thể đặc biệt quan trọng.’
Bài báo lưu ý rằng nhiều chỉ số trực quan phổ biến đối với các loại tệp PDF chính phủ cụ thể cũng có thể được sử dụng để phân loại tài liệu và tạo “saga”. Những “token” như vậy có thể là con dấu của Quốc hội, hoặc các logo hoặc tính năng trực quan lặp lại khác không có sự tồn tại ngữ nghĩa trong tìm kiếm văn bản thuần túy.
Các tài liệu mà không thể phân loại hoặc có nguồn gốc không phổ biến có thể được xác định từ bố cục của chúng, chẳng hạn như cột, loại phông chữ và các khía cạnh đặc trưng khác.

Bố cục alone có thể cung cấp các nhóm và phân loại trong không gian tìm kiếm trực quan.
Mặc dù các tác giả không bỏ qua văn bản, rõ ràng không gian tìm kiếm trực quan là điều đã thúc đẩy công việc này.
‘Khả năng tìm kiếm và phân tích các tệp PDF theo các tính năng trực quan của chúng là một cách tiếp cận rộng lớn: nó không chỉ bổ sung cho các nỗ lực hiện có xung quanh phân tích văn bản mà còn tưởng tượng lại những gì tìm kiếm và phân tích có thể là cho nội dung sinh ra dưới dạng kỹ thuật số.’
Các tác giả dự định sẽ phát triển khuôn khổ của họ để phù hợp với các tập dữ liệu lớn hơn nhiều, bao gồm cả Archives Web Tổng thống Kết thúc Kỳ hạn 2008 tập dữ liệu, chứa hơn 10 triệu mục. Ban đầu, tuy nhiên, họ dự định sẽ mở rộng hệ thống để giải quyết “hàng chục nghìn” tệp PDF của chính phủ.
Hệ thống này dự kiến sẽ được đánh giá ban đầu với người dùng thực, bao gồm các nhà lưu trữ, nhà lưu trữ, luật sư, nhà sử học và các học giả khác, và sẽ phát triển dựa trên phản hồi từ những nhóm này.
Đấu tranh với Quy mô của Các Xuất bản Chính phủ Sinh ra dưới dạng Kỹ thuật số: Hướng tới Các Đường ống cho Xử lý và Tìm kiếm Hàng triệu Tệp PDF được viết bởi Benjamin Charles Germain Lee (tại Trường Kỹ thuật và Khoa học Máy tính Paul G. Allen) và Trevor Owens, Nhà sử học Công cộng tại Thư viện Quốc hội ở Washington, D.C..
* Tôi đã chuyển đổi các trích dẫn trực tuyến thành liên kết.
Được xuất bản lần đầu vào ngày 28 tháng 12 năm 2021












