Погляд Anderson
Розробка гірської породи PDF урядом США за допомогою комп’ютерного зору

Формат PDF компанії Adobe так глибоко вкоренився в документообіг урядових документів США, що кількість державних документів, які зараз існують, консервативно оцінюється сотнями мільйонів. Часто не прозорі та позбавлені метаданих, ці PDF – багато з яких були створені автоматизованими системами – колективно не розповідають жодних історій чи саг; якщо ви не знаєте точно, що шукаєте, ви, ймовірно, ніколи не знайдете відповідного документа. І якщо ви знали, ви, ймовірно, не потребували пошуку. Однак новий проєкт використовує комп’ютерний зір та інші підходи машинного навчання для перетворення цієї майже недоступної гори даних у цінний і досліджуваний ресурс для дослідників, істориків, журналістів та вчених.
Коли уряд США відкрив формат PDF компанії Adobe в 1990-х роках, він вирішив, що йому це сподобається. На відміну від редакторських документів Word, PDF можна було “запікати” різними способами, які робили їх важкими або навіть неможливими для подальшої зміни; шрифти можна було вбудувати, щоб забезпечити сумісність між платформами; і друкування, копіювання та навіть відкриття можна було контролювати на рівні гранулярності.
Більше того, ці основні функції були доступні в деяких з найдавніших “базових” специфікацій формату, обіцяючи, що архівний матеріал не потребуватиме повторної обробки або перегляду пізніше, щоб забезпечити доступність. Практично все, що потрібно було урядовому видавництву, було на місці до 1996 року.
З технологіями блокчейна та NFT ще не на горизонті, PDF був якнайближче до “мертвого” аналогового документа, тільки концептуальний скачок від факсу. Це було саме те, що було потрібно.
Внутрішні розбіжності щодо PDF
Ступінь, у якій PDF є герметичними, недоступними та “несоціальними”, характеризується в документації щодо формату в Бібліотеці Конгресу, яка віддає перевагу PDF як своєму “відбірному формату”:
‘Основною метою формату PDF/A є представлення електронних документів таким чином, щоб зберегти їх статичну візуальну зовнішність з плином часу, незалежно від інструментів та систем, використаних для створення, зберігання чи відтворення файлів. Для цього PDF/A намагається максимізувати незалежність пристрою, самозміст та самодокументування.’
Триває ентузіазм щодо формату PDF, стандарти доступності та вимоги до мінімальної версії різняться між урядовими відомствами США. Наприклад, тоді як Агентство з охорони навколишнього середовища має суворі, але підтримуючі політики в цьому відношенні, офіційний веб-сайт уряду США plainlanguage.gov визнає, що ‘користувачі ненавидять PDF’, і навіть посилається безпосередньо на звіт Nielsen Norman Group 2020 року під назвою PDF: все ще не підходить для споживання людиною, 20 років потому.
Тим часом irs.gov, створений у 1995 році спеціально для переходу документів податкової служби на цифровий формат, одразу прийняв PDF і досі є заднім прихильником.
Вірусне поширення PDF
Відразу після того, як Adobe випустила ядро специфікацій PDF у відкритий джерело, з’явилася серія інструментів обробки сервера та бібліотек, багато з яких тепер так само шановані та вкорінені, як і специфікації PDF 1996 року, і так само надійні та стійкі до помилок, тоді як виробники програмного забезпечення поспішали інтегрувати функціональність PDF у низькобюджетні інструменти.
В результаті PDF залишаються універсальними в рамках комунікацій та документів у величезній кількості урядових відомств США.
У 2015 році віце-президент Adobe з інженерії Document Cloud Філ Іденс оцінив, що існує 2,5 трильйона документів PDF у світі, тоді як формат, як вважають, складає від 6 до 11% всіх веб-контентів. У технологічній культурі, залежній від порушення старих технологій, PDF став невилучним “іржею” – центральною частиною структури, яка його приймає.
<img class="wp-image-179394" src="https://www.unite.ai/wp-content/uploads/2021/12/convert-to-pdf.jpg" alt="З 2018 року. Є мало свідчень про потужного конкурента." Джерело: https://twitter.com/trbrtc/status/980407663690502145
За даними недавнього дослідження дослідників Університету Вашингтона та Бібліотеки Конгресу, ‘сотні мільйонів унікальних документів уряду США, опублікованих у вигляді PDF у мережі, були архівовані бібліотеками на даний момент’.
Однак дослідники стверджують, що це тільки “верхівка айсберга”*:
‘Як провідний вчений цифрової історії Рой Розенцвейг зазначив ще у 2003 році, коли мова йде про цифрові первинні джерела для наукових досліджень, необхідно розробити методи та підходи, які будуть масштабуватися до десятків і сотень мільйонів, а навіть мільярдів цифрових ресурсів. Ми тепер дійшли до моменту, коли розробка підходів для цього масштабу є необхідною.
‘Наприклад, веб-архіви Бібліотеки Конгресу тепер містять понад 20 мільярдів окремих цифрових ресурсів.’
PDF: опір аналізу
Проєкт дослідників Університету Вашингтона застосовує ряд методів машинного навчання до доступної та анотованої корпусу з 1000 вибраних документів з Бібліотеки Конгресу, з метою створення систем, здатних до швидкого, багатомодального пошуку текстових та зображень-запитів у рамках, які можуть масштабуватися до висот поточних (і зростаючих) об’ємів PDF, не тільки в уряді, але й у багатьох інших галузях.
Як зазначається в статті, прискорений темп цифровізації у різних урядових відомствах США в 1990-х роках призвів до розбіжностей у політиці та практиці, а часто до прийняття методів публікації PDF, які не містили такого ж рівня метаданих, який був раніше золотим стандартом бібліотечних послуг уряду – або навіть базових метаданих PDF, які могли б бути корисними для забезпечення доступності та дружності до індексування.
Обговорюючи цей період розбіжностей, автори зазначають:
‘Ці зусилля призвели до вибухового зростання кількості урядових публікацій, яке, в свою чергу, призвело до порушення загального підходу до виробництва метаданих для цих публікацій та до того, як бібліотеки придбали копії їх.’
В результаті типова гора PDF існує без будь-якого контексту, крім URL-адрес, які безпосередньо посилаються на нього. Крім того, документи в горі закриті, самореферентні та не утворюють жодної “саги” чи розповіді, яку сучасні методи пошуку можуть розгадати, хоча такі приховані зв’язки, безумовно, існують.
На розглянутому масштабі ручне анотація чи кураторство є неможливим проєктом. Корпус даних, з якого було отримано 1000 документів Бібліотеки Конгресу, містить понад 40 мільйонів PDF, які дослідники намагаються зробити адресованою задачею в найближчому майбутньому.
Комп’ютерний зір для аналізу PDF
Більшість попередніх досліджень, на які посилаються автори, використовують текстові методи для витягування функцій та високорівневих концепцій з матеріалу PDF; натомість їхній проєкт центрується на витягуванні функцій та тенденцій шляхом вивчення PDF на візуальному рівні, у відповідності з поточними дослідженнями щодо багатомодального аналізу новинного контенту.
Хоча машинне навчання також було застосовано до аналізу PDF через галузеві схеми, такі як Semantic Scholar, автори намагаються створити більш високорівневі потоки витягування, які будуть широко застосовні у різних публікаціях, а не налаштовані на суворі науки публікацій або інших вузьких галузей.
Вирішення проблеми несбалансованих даних
Створюючи схему метрик, дослідники мали розглянути, наскільки зміщені дані, принаймні за розміром кожного елемента.
З 1000 PDF у вибраному наборі даних (який автори вважають представницьким для 40 мільйонів, з яких вони були отримані), 33% мають лише одну сторінку, а 39% – 2-5 сторінок. Це означає, що 72% документів мають не більше п’яти сторінок.
Після цього відбувається досить великий стрибок: 18% залишкових документів мають 6-20 сторінок, 6% – 20-100 сторінок, а 3% – понад 100 сторінок. Це означає, що найдовші документи складають більшість окремих сторінок, витягнутих з них, тоді як менш детальний підхід, який розглядає документи окремо, буде схилятися до більш чисельних коротких документів.
Незважаючи на це, ці метрики є корисними, оскільки односторінкові документи зазвичай є технічними схемами або картами; документи на 2-5 сторінок зазвичай є прес-релізами та формами; а дуже довгі документи зазвичай є звітами та публікаціями у вигляді книг, хоча за довжиною вони змішані з великими автоматизованими сховищами даних, які містять зовсім інші виклики для семантичної інтерпретації.
Отже, дослідники розглядають цю нерівновагу як значущу семантичну властивість сама по собі. Тим не менш, PDF все одно потрібно обробляти та кількісно оцінювати на основі кожної сторінки.
Архітектура
На початку процесу метадані PDF розбираються у табличні дані. Ці метадані не будуть відсутні, оскільки вони складаються з відомих величин, таких як розмір файлу та джерельна URL-адреса.
PDF потім розділяється на сторінки, з кожною сторінкою, перетвореною на формат JPEG за допомогою ImageMagick. Зображення потім подається у мережу ResNet-50, яка витягує 2048-мірний вектор з другого передостаннього шару.

Потік витягування з PDF. Джерело: https://arxiv.org/ftp/arxiv/papers/2112/2112.02471.pdf
У той же час сторінка перетворюється на текстовий файл за допомогою pdf2text, а витягування TF-IDF здійснюється за допомогою scikit-learn.
TF-IDF означає Частота терміну – обернена частота документа, яка вимірює поширеність кожного виразу всередині документа до його частоти у всьому наборі даних, на тонкому масштабі від 0 до 1. Дослідники використовували окремі слова (уніграми) як найменшу одиницю в налаштуваннях TF-IDF системи.
Хоча вони визнають, що машинне навчання пропонує більш складні методи, ніж TF-IDF, автори стверджують, що все, що складніше, є зайвим для задачі.
Той факт, що кожен документ має пов’язану з ним джерельну URL-адресу, дозволяє системі визначити походження документів у всьому наборі даних.

Це може здатися тривіальним для тисяч документів, але це буде досить відкриттям для 40 мільйонів+.
Нові підходи до текстового пошуку
Одна з цілей проєкту полягає в тому, щоб зробити результати пошуку для текстових запитів більш осмисленими, дозволяючи плідному дослідження без потреби надмірної попередньої інформації. Автори зазначають:
‘Хоча пошук за ключовими словами є інтуїтивним і високо розширеним методом пошуку, він також може бути обмеженим, оскільки користувачі відповідають за формулювання запитів ключових слів, які повертають відповідні результати.’
Як тільки значення TF-IDF отримані, можна розрахувати найбільш часто представлені слова та оцінити “середній” документ у корпусі. Дослідники стверджують, що оскільки ці ключові слова між документами зазвичай осмислені, цей процес формує корисні відносини для вчених, які можуть бути досліджені, які не могли бути отримані лише шляхом індивідуального індексування тексту кожного документа.
Візуально цей процес полегшує “муд-борд” слів, що походять з різних урядових відомств:

Ключові слова TF-IDF для різних урядових відомств США, отримані за допомогою TF-IDF.
Ці витягнуті ключові слова та відносини можна пізніше використовувати для формування динамічних матриць у результатах пошуку, з корпусом PDF, який починає “розповідати історії”, а відносини ключових слів сполучають документи (можливо, навіть за сотні років), щоб викласти досліджувану багаточастинну “сагу” для теми чи теми.
Дослідники використовують кластеризацію k-means для визначення документів, які пов’язані, навіть якщо документи не мають спільного джерела. Це дозволяє розробити метадані ключових фраз, застосовні до всього набору даних, які можуть проявлятися як рейтинги термінів у строгому текстовому пошуку або як сусідні вузли у більш динамічному середовищі дослідження:

Візуальний аналіз
Істинна новизна підходу дослідників Університету Вашингтона полягає в застосуванні машинного навчання на основі візуального аналізу до растеризованого вигляду PDF у наборі даних.
Цим шляхом можна згенерувати тег “ВИДАЛЕНО” на візуальній основі, де нічого в тексті не давало б достатньої підстави.

Кластер редагованих сторінок PDF, виявлених комп’ютерним зором у новому проєкті.
Крім того, цей метод може витягнути такий тег навіть з урядових документів, які були растеризовані, що часто буває з редагованим матеріалом, що робить можливим вичерпний та повний пошук цієї практики.
Крім того, карти та схеми можна визначити та категоризувати, а автори коментують цю потенційну функціональність:
‘Для вчених, які цікавляться розкриттям класифікованої або іншої чутливої інформації, може бути особливо цікаво виділити саме такий кластер матеріалу для аналізу та дослідження.’
Стаття зазначає, що широкий спектр візуальних індикаторів, спільних для конкретних типів урядових PDF, можна також використовувати для класифікації документів та створення “саг”. Такі “токени” могли б бути конгрес-штампом або іншими логотипами чи повторюваними візуальними особливостями, які не мають семантичного існування у чистому текстовому пошуку.
Крім того, документи, які не піддаються класифікації, або документи, які походять з не спільного джерела, можна ідентифікувати за їхнім макетом, таким як колонки, типи шрифтів та інші характерні особливості.

Макет сам по собі може забезпечити групування та класифікацію у візуальному просторі пошуку.
Хоча автори не забули про текст, очевидно, що візуальний простір пошуку є тим, що спонукало цю роботу.
‘Спроможність шукати та аналізувати PDF за їхніми візуальними особливостями є таким же потужним підходом: він не тільки доповнює наявні зусилля щодо текстового аналізу, але й переосмислює, що може бути пошуком та аналізом для цифрового контенту.’
Автори мають намір розробити свою систему для роботи з набагато більшим набором даних, включаючи 2008 рік Архіву веб-сайту Президента набір даних, який містить понад 10 мільйонів елементів. Спочатку вони мають намір розширити систему для роботи з “тисячами” урядових PDF.
Система призначена для початкової оцінки з реальними користувачами, включаючи бібліотекарів, архівістів, юристів, істориків та інших вчених, і буде розвиватися на основі відгуку цих груп.
Розпорядженнясь з масштабом цифрових урядових публікацій: до трубопроводів для обробки та пошуку мільйонів PDF написано Бенджаміном Чарльзом Джермейном Лі (у школі інформатики та інженерії імені Пола Г. Аллена) та Тревором Оуенсом, громадським істориком та керівником управління цифровим контентом у Бібліотеці Конгресу у Вашингтоні.
* Мій перехід внутрішніх посилань на гіперпосилання.
Опубліковано вперше 28 грудня 2021 року












