Взгляд Anderson
Решение проблемы PDF-документов правительства США с помощью компьютерного зрения

Формат PDF от Adobe так глубоко укоренился в документообороте правительства США, что количество государственных документов, находящихся в настоящее время в обращении, оценивается консервативно в сотни миллионов. Часто не透рачные и лишенные метаданных, эти PDF-документы – многие из которых были созданы автоматизированными системами – коллективно не рассказывают никаких историй или саг; если вы не знаете точно, что вы ищете, вы, скорее всего, никогда не найдете соответствующий документ. И если вы знали, вы, вероятно, не нуждались в поиске.Однако новый проект использует компьютерное зрение и другие методы машинного обучения, чтобы изменить эту几乎 непреодолимую гору данных в ценный и исследуемый ресурс для исследователей, историков, журналистов и ученых.
Когда правительство США открыло для себя формат PDF от Adobe в 1990-х годах, оно решило, что ему это нравится. В отличие от редактируемых документов Word, PDF-документы могли быть “запечатаны” разными способами, что делало их трудными или даже невозможными для изменения позже; шрифты могли быть встроены, обеспечивая совместимость между платформами; и печать, копирование и даже открытие могли быть контролируемы на детальном уровне.
Более того, эти основные функции были доступны в некоторых из самых старых “базовых” спецификаций формата, обещая, что архивный материал не потребует повторной обработки или повторного посещения позже, чтобы обеспечить доступность. Почти все, что нужно было правительству для публикации, было на месте к 1996 году.
С технологиями блокчейна и NFT еще не изобретенными, PDF был так близок к “мертвому” аналоговому документу, как только мог быть в зарождающемся цифровом веке – всего лишь концептуальный скачок от факса. Это было именно то, что было нужно.
Внутренние разногласия по поводу PDF
Степень, в которой PDF-документы являются герметичными, неуязвимыми и “несоциальными”, характеризуется в документации на формат в Библиотеке Конгресса, которая отдает предпочтение PDF как своему “предпочтительному формату”:
‘Основная цель формата PDF/A – представлять электронные документы таким образом, чтобы сохранить их статический визуальный вид с течением времени, независимо от инструментов и систем, используемых для создания, хранения или отображения файлов. Для этого PDF/A стремится максимизировать независимость устройства, самодостаточность и самоописание.’
Продолжающийся энтузиазм по поводу формата PDF, стандарты доступности и требования к минимальной версии варьируются в разных департаментах правительства США. Например, хотя Агентство по охране окружающей среды имеет строгие, но поддерживающие политики в этом отношении, официальный сайт правительства США plainlanguage.gov признает, что ‘пользователи ненавидят PDF’, и даже ссылается напрямую на отчет 2020 года Nielsen Norman Group под названием PDF: все еще не подходит для потребления человеком, 20 лет спустя.
Между тем, irs.gov, созданный в 1995 году специально для перехода документации налогового агентства на цифровой формат, сразу же принял PDF и остается горячим сторонником.
Вирусное распространение PDF
С тех пор, как Adobe открыла исходные спецификации PDF, появился ряд инструментов и библиотек для обработки PDF на стороне сервера, многие из которых теперь стали почитаемыми и укоренились, как и 1996-годовые спецификации PDF, и такие же надежные и устойчивые к ошибкам, как и программные поставщики спешили интегрировать функциональность PDF в недорогие инструменты.
В результате, любимые или ненавидимые своими хозяевами департаментами, PDF-документы остаются повсеместными в коммуникационных и документационных рамках по всему огромному числу департаментов правительства США.
В 2015 году вице-президент Adobe по инженерии Document Cloud Фил Йденс оценил, что существует 2,5 триллиона PDF-документов в мире, в то время как формат, как полагают, составляет от 6 до 11% всего веб-контента. В технологической культуре, которая привыкла разрушать старые технологии, PDF стал неискоренимой “ржавчиной” – центральной частью структуры, которая его принимает.

С 2018 года. Еще нет убедительных доказательств существования достойного соперника. Источник: https://twitter.com/trbrtc/status/980407663690502145
Согласно недавнему исследованию исследователей из Университета Вашингтона и Библиотеки Конгресса, ‘сотни миллионов уникальных документов правительства США, опубликованных в Интернете в формате PDF, были архивированы библиотеками на данный момент’.
Но исследователи утверждают, что это только “вершина айсберга”*:
‘Как отметил ведущий ученый по цифровой истории Рой Розенцвейг еще в 2003 году, когда речь идет о цифровых первичных источниках для научных исследований, необходимо разработать методы и подходы, которые будут масштабироваться до десятков и сотен миллионов, и даже миллиардов цифровых ресурсов. Мы теперь достигли точки, где разработка подходов для этого масштаба становится необходимой.
‘Например, веб-архивы Библиотеки Конгресса теперь содержат более 20 миллиардов отдельных цифровых ресурсов.’
PDF-документы: устойчивые к анализу
Проект исследователей из Вашингтона применяет ряд методов машинного обучения к публично доступному и аннотированному корпусу из 1000 выбранных документов из Библиотеки Конгресса, с целью разработки систем, способных к молниеносному, многомодальному извлечению текстовых и изображений запросов в рамках, которые могут масштабироваться до высот текущих (и растущих) объемов PDF, не только в правительстве, но и во многих других секторах.
Как отмечается в статье, ускоряющийся темп оцифровки в различных департаментах правительства США в 1990-х годах привел к разнообразным политикам и практикам, и часто к принятию методов публикации PDF, которые не содержали такого же качества метаданных, какое было золотым стандартом библиотечных услуг правительства – или даже базовых родных метаданных PDF, которые могли бы быть полезны для того, чтобы сделать коллекции PDF более доступными и дружественными к индексированию.
Обсуждая этот период разрушения, авторы отмечают:
‘Эти усилия привели к взрывному росту количества правительственных публикаций, что, в свою очередь, привело к разрушению общего подхода, которым производились последовательные метаданные для таких публикаций, и которым библиотеки приобретали копии их.’
Следовательно, типичная гора PDF существует без какого-либо контекста, кроме URL-адресов, которые связаны с ним напрямую. Кроме того, документы в горе являются замкнутыми, самореферентными и не образуют части какой-либо “саги” или повествования, которое текущие методы поиска, вероятно, не смогут различить, хотя такие скрытые связи, безусловно, существуют.
На таком масштабе ручная аннотация или курирование является невозможным. Корпус данных, из которого были получены 1000 документов Библиотеки Конгресса, содержит более 40 миллионов PDF, которые исследователи намерены сделать адресной задачей в ближайшем будущем.
Компьютерное зрение для анализа PDF
Большинство предыдущих исследований, на которые ссылаются авторы, используют текстовые методы для извлечения функций и высокоуровневых концепций из материалов PDF; в отличие от этого, их проект центрируется на получении функций и тенденций путем изучения PDF на визуальном уровне, в соответствии с текущими исследованиями по многомодальному анализу новостного контента.
Хотя машинное обучение также было применено таким образом к анализу PDF через секторальные схемы, такие как Semantic Scholar, авторы стремятся создать более высокоуровневые пайплайны извлечения, которые будут широко применимы в различных публикациях, а не настроены на строгие требования научной публикации или других узких секторов.
Решение проблемы несбалансированных данных
При создании схемы метрик исследователи должны были учитывать, насколько искажены данные, по крайней мере, в плане размера каждого элемента.
Из 1000 PDF в выбранном наборе данных (который авторы предполагают представительным для 40 миллионов, из которых они были получены), 33% составляют только одну страницу, и 39% – 2-5 страниц. Это означает, что 72% документов имеют длину пять страниц или меньше.
После этого есть довольно большой скачок: 18% оставшихся документов имеют длину 6-20 страниц, 6% – 20-100 страниц и 3% – 100+ страниц. Это означает, что самые длинные документы составляют большинство отдельных страниц, извлеченных, в то время как менее детальный подход, который учитывает документы сами по себе, будет смещен в сторону более многочисленных коротких документов.
Тем не менее, это являются проницательными метриками, поскольку односторонние документы, как правило, являются техническими схемами или картами; 2-5-страничные документы, как правило, являются пресс-релизами и формами; и очень длинные документы, как правило, являются книгами-отчетами и публикациями, хотя, в плане длины, они смешиваются с огромными автоматизированными сбросами данных, которые содержат совершенно другие проблемы для семантической интерпретации.
Следовательно, исследователи рассматривают это несбалансированность как осмысленное семантическое свойство само по себе. Тем не менее, PDF-документы все равно необходимо обрабатывать и количественно оценивать на основе каждой страницы.
Архитектура
В начале процесса метаданные PDF разбираются в табличные данные. Эти метаданные не будут отсутствовать, поскольку они состоят из известных величин, таких как размер файла и исходный URL.
Затем PDF разбивается на страницы, каждая из которых конвертируется в формат JPEG с помощью ImageMagick. Изображение затем подается в сеть ResNet-50, которая получает 2048-мерный вектор из предпоследнего слоя.

Конвейер для извлечения из PDF. Источник: https://arxiv.org/ftp/arxiv/papers/2112/2112.02471.pdf
В то же время страница конвертируется в текстовый файл с помощью pdf2text, и получаются векторы TF-IDF с помощью scikit-learn.
TF-IDF означает Term Frequency Inverse Document Frequency, который измеряет распространенность каждого фраза в документе по отношению к его частоте во всей базе данных, на тонкой шкале от 0 до 1. Исследователи использовали отдельные слова (униграммы) в качестве наименьшей единицы в настройках TF-IDF системы.
Хотя они признают, что машинное обучение имеет более сложные методы, чем TF-IDF, авторы утверждают, что все, что более сложное, является ненужным для заявленной задачи.
Факт того, что каждый документ имеет связанный с ним исходный URL, позволяет системе определить происхождение документов по всей базе данных.

Это может показаться тривиальным для 1000 документов, но это будет довольно откровением для 40 миллионов+.
Новые подходы к текстовому поиску
Одной из целей проекта является сделать результаты поиска для текстовых запросов более осмысленными, позволяя плодотворному исследованию без необходимости избыточных предварительных знаний. Авторы заявляют:
‘Хотя поиск по ключевым словам является интуитивным и высоко расширяемым методом поиска, он также может быть ограничивающим, поскольку пользователи несут ответственность за формулирование запросов ключевых слов, которые возвращают релевантные результаты.’
Как только значения TF-IDF получены, становится возможным рассчитать наиболее часто встречающиеся слова и оценить “средний” документ в корпусе. Исследователи утверждают, что поскольку эти междокументные ключевые слова обычно осмысленны, этот процесс формирует полезные отношения для исследователей, которые не могут быть получены только путем индивидуального индексирования текста каждого документа.
Визуально процесс облегчает “мудборд” слов, исходящих из различных правительственных департаментов:

Ключевые слова TF-IDF для различных правительственных департаментов США, полученные с помощью TF-IDF.
Эти извлеченные ключевые слова и отношения могут позже быть использованы для формирования динамических матриц в результатах поиска, с корпусом PDF, начинающим “рассказывать истории”, и ключевыми словами, связывающими документы (возможно, даже за сотни лет), чтобы очертить исследуемую многочастную “сагу” для темы или темы.
Исследователи используют кластеризацию k-means, чтобы определить связанные документы, даже когда документы не имеют общего источника. Это позволяет разработать метаданные ключевых фраз, применимые во всей базе данных, которые могут проявляться либо как рейтинги терминов в строгом текстовом поиске, либо как ближайшие узлы в более динамичной среде исследования:

Визуальный анализ
Истинная новизна подхода исследователей из Вашингтона заключается в применении методов машинного обучения, основанных на визуальном анализе, к растеризованному виду PDF в базе данных.
Таким образом, становится возможным сгенерировать тег “REDACTED” на основе визуального анализа, где ничего в тексте не предоставит достаточно общей основы.

Кластер красных PDF-страниц, идентифицированный компьютерным зрением в новом проекте.
Кроме того, этот метод может получить такой тег даже из правительственных документов, которые были растеризованы, что часто бывает с удаленными материалами, что делает возможным исчерпывающий и всесторонний поиск этой практики.
Дополнительно, карты и схемы могут быть идентифицированы и категоризированы, и авторы комментируют эту потенциальную функциональность:
‘Для исследователей, интересующихся раскрытием классифицированной или иной чувствительной информации, может быть особенно интересно выделить именно этот тип кластера материала для анализа и исследования.’
Статья отмечает, что широкий спектр визуальных индикаторов, общих для определенных типов правительственных PDF, также может быть использован для классификации документов и создания “саг”. Такие “токены” могли бы быть конгрессиональной печатью или другими логотипами или повторяющимися визуальными особенностями, которые не имеют семантического существования в чистом текстовом поиске.
Документы, которые противоречат классификации, или которые происходят из необычного источника, могут быть идентифицированы по их расположению, такому как столбцы, типы шрифтов и другие характерные особенности.

Расположение может обеспечить группировку и классификацию в визуальном пространстве поиска.
Хотя авторы не пренебрегли текстом, rõчно, что визуальное пространство поиска – это то, что движет этой работой.
‘Способность искать и анализировать PDF по их визуальным особенностям – это всесторонний подход: он не только дополняет существующие усилия по текстовому анализу, но и переосмысливает, что может быть поиск и анализ для цифрового контента.’
Авторы намерены разработать свою основу, чтобы она могла вместить намного более крупные базы данных, включая 2008 год архива веб-сайта президента базу данных, которая содержит более 10 миллионов элементов. Первоначально, однако, они намерены масштабировать систему, чтобы решить “десятки тысяч” правительственных PDF.
Система предназначена для первоначальной оценки с помощью реальных пользователей, включая библиотекарей, архивистов, юристов, историков и других ученых, и будет развиваться на основе обратной связи от этих групп.
Борьба с масштабом цифровых правительственных публикаций: к пайплайнам для обработки и поиска миллионов PDF написан Бенджамином Чарльзом Джермейном Ли (в школе компьютерных наук и инженерии Пола Г. Аллена) и Тревором Оуэнсом, публичным историком и главой управления цифровым контентом в Библиотеке Конгресса в Вашингтоне, округ Колумбия.
*Мой перевод внутренних цитат в гиперссылки.
Оригинально опубликовано 28 декабря 2021 года












