Andersonův úhel

Zvládání-pdf-mountain americké vlády s počítačovým viděním

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Formát PDF od Adobe se tak hluboce zakořenil v dokumentačních procesech americké vlády, že počet státem vydaných dokumentů, které v současné době existují, je konzervativně odhadován na stovky milionů. Často neprůhledné a chybějící metadata, tyto PDF – mnoho z nich vytvořených automatizovanými systémy – společně nevyprávějí žádné příběhy nebo ságy; pokud přesně nevíte, co hledáte, pravděpodobně nikdy nenajdete relevantní dokument. A pokud jste to věděli, pravděpodobně byste nevyžadovali hledání. Ale nový projekt využívá počítačové vidění a další přístupy strojového učení ke změně tohoto téměř nepřístupného množství dat na cenný a prozkoumatelný zdroj pro výzkumníky, historiky, novináře a učence.

Když americká vláda objevila formát PDF od Adobe v 90. letech, rozhodla se, že se jí líbí. Na rozdíl od editovatelných dokumentů Word, PDF mohlo být “upečeno” mnoha způsoby, které je činily obtížnými nebo dokonce nemožnými k pozdějšímu změně; písma mohla být vložena, zajišťující kompatibilitu napříč platformami; a tisk, kopírování a dokonce i otevírání mohly být řízeny na granulární bázi.

Více důležitějšího je, že tyto základní funkce byly k dispozici v některých z nejstarších “základních” specifikací formátu, slibujících, že archivní materiály nebudou potřebovat pozdější zpracování nebo opětovnou návštěvu, aby zajistily přístupnost. Téměř vše, co vládní publikace potřebovala, bylo na místě do roku 1996.

S blockchain prověrkou a NFT technologiemi desetiletí pryč, PDF byl tak blízko, jak mohl být digitální věk k “mrtvému” analogovému dokumentu, pouze konceptuální skok od faxu. To bylo přesně to, co bylo požadováno.

Vnitřní nesouhlas o PDF

Rozsah, v jakém jsou PDF neprůhledné, nesnesitelné a “nesociální”, je charakterizován v dokumentaci o formátu v Knihovně Kongresu, která upřednostňuje PDF jako svůj “preferovaný formát”:

‘Hlavním účelem formátu PDF/A je reprezentovat elektronické dokumenty způsobem, který zachovává jejich statický vzhled po dlouhou dobu, nezávisle na nástrojích a systémech používaných pro vytváření, ukládání nebo vykreslování souborů. Za tímto účelem se PDF/A snaží maximalizovat nezávislost na zařízení, samobsažnost a samodokumentaci.’

Trvající nadšení pro formát PDF, standardy pro přístupnost a požadavky na minimální verzi se liší napříč americkými vládními úřady. Například zatímco Agentura pro ochranu životního prostředí má přísné, ale podpůrné politiky v tomto ohledu, oficiální webová stránka americké vlády plainlanguage.gov uznává, že ‘uživatelé nenávidí PDF’, a dokonce odkazuje přímo na zprávu z roku 2020 Nielsen Norman Group s názvem PDF: Stále nevhodné pro lidskou spotřebu, 20 let poté.

Zatímco irs.gov, založená v roce 1995 speciálně za účelem přechodu dokumentace daňového úřadu na digitální formu, okamžitě přijala PDF a je stále nadšenou podporovatelkou.

Virální šíření PDF

Od doby, kdy byly vydány základní specifikace PDF jako otevřený zdroj, Adobe, řada server-side zpracování nástrojů a knihoven se objevila, mnoho z nich je nyní ctihodných a zakořeněných jako 1996-era PDF specifikace, a stejně spolehlivých a odolných vůči chybám, zatímco softwaroví dodavatelé spěchali integrovat PDF funkčnost do nízkonákladových nástrojů.

V důsledku toho, milované nebo nenáviděné svými hostitelskými úřady, PDF zůstávají všudypřítomné v komunikačních a dokumentačních rámcích napříč obrovským množstvím amerických vládních úřadů.

V roce 2015 odhadoval Phil Ydens, viceprezident pro inženýrství Document Cloud ve společnosti Adobe, že 2,5 bilionu PDF dokumentů existuje na světě, zatímco formát se domnívá, že představuje mezi 6-11% veškerého obsahu webu. V technologické kultuře, která je závislá na rušení starých technologií, se PDF stal neodstranitelnou “rezavou” – centrální součástí struktury, která ho hostí.

Z roku 2018. Ještě není žádný silný konkurent.

Z roku 2018. Ještě není žádný silný konkurent. Zdroj: https://twitter.com/trbrtc/status/980407663690502145

Podle nedávné studie výzkumníků z University of Washington a Knihovny Kongresu, ‘stovky milionů unikátních vládních dokumentů Spojených států zveřejněných na webu v PDF formátu byly archivovány knihovnami do dneška’.

Ale výzkumníci tvrdí, že toto je pouze “špička ledovce”*:

‘Jak uvedl přední digitální historik Roy Rosenzweig již v roce 2003, je-li třeba vyvinout metody a přístupy, které budou škálovat na desítky a stovky milionů a dokonce i miliardy digitálních zdrojů. Nyní jsme dospěli do bodu, kdy je vývoj těchto přístupů nutný.

‘Jako příklad, webové archivy Knihovny Kongresu nyní obsahují více než 20 miliard jednotlivých digitálních zdrojů.’

PDF: Odolné vůči analýze

Projekt washingtonských výzkumníků aplikuje řadu metod strojového učení na veřejně dostupný a anotovaný korpus 1 000 vybraných dokumentů z Knihovny Kongresu, s cílem vyvinout systémy schopné bleskově rychlé, multimodální obnovy textových a obrazových dotazů ve frameworku, který může škálovat na výšky současných (a rostoucích) objemů PDF, nejen ve vládě, ale napříč množstvím sektorů.

Vědci pozorují, že zrychlování tempa digitalizace napříč řadou balkanizovaných amerických vládních úřadů v 90. letech vedlo k rozdílným politikám a postupům a často k přijetí metod publikování PDF, které neobsahovaly stejnou kvalitu metadat, jakou byla kdysi zlatým standardem vládních knihovních služeb – nebo dokonce základní nativní metadata PDF, která by mohla být nějakým způsobem užitečná pro zpřístupnění sbírek PDF a jejich přátelství s indexováním.

Při diskusi o tomto období narušení autoři uvádějí:

‘Tyto snahy vedly k explozivnímu růstu množství vládních publikací, které následně vedly k rozpadu obecného přístupu, jímž byly vytvářeny konzistentní metadata pro tyto publikace a jímž knihovny získaly kopie z nich.’

V důsledku toho typická PDF hora existuje bez jakéhokoli kontextu kromě URL, které přímo odkazují na ni. Další, dokumenty v hoře jsou uzavřené, sebereferenční a nedělají část žádné “ságy” nebo narace, kterou současné metodologie hledání jsou pravděpodobně odhalit, ačkoli takové skryté spojení bezpochyby existují.

Na této úrovni je ruční anotace nebo katalogizace nemožným úkolem. Korpus dat, ze kterého byl odvozen projektový korpus 1000 dokumentů Knihovny Kongresu, obsahuje více než 40 milionů PDF, které výzkumníci hodlají učinit adresovatelnou výzvou v blízké budoucnosti.

Počítačové vidění pro analýzu PDF

Většina předchozích výzkumů, na které autoři odkazují, používá textově založené metody pro extrakci funkcí a vysokých konceptů z materiálu PDF; na rozdíl od toho, jejich projekt se zaměřuje na odvození funkcí a trendů zkoumáním PDF na vizuální úrovni, v souladu s současným výzkumem do multimodální analýzy novinového obsahu.

Ačkoli strojové učení bylo také aplikováno tímto způsobem na analýzu PDF prostřednictvím sektorově specifických schémat, jako je Semantic Scholar, autoři cílí na vytvoření více high-level extrakčních pipeline, které jsou široce aplikovatelné napříč řadou publikací, spíše než přizpůsobené přísnostem vědeckého publikování nebo jiných stejně úzkých sektorů.

Způsobení nevyvážených dat

Při vytváření schématu metrik, výzkumníci museli zohlednit, jak jsou data zkreslena, alespoň z hlediska velikosti na položku.

Z 1000 PDF v selektivním datasetu (který autoři předpokládají, že je reprezentativní pro 40 milionů, ze kterých byly vybrány), 33% je pouze jedna stránka dlouhá, a 39% je 2-5 stránek dlouhá. To znamená, že 72% dokumentů je pět stránek nebo méně.

Poté je zde khá skok: 18% zbývajících dokumentů je 6-20 stránek, 6% je 20-100 stránek a 3% je 100+ stránek. To znamená, že nejdelší dokumenty tvoří většinu jednotlivých stránek extrahovaných, zatímco méně granulární přístup, který zvažuje dokumenty samotné, by zkreslil pozornost směrem k mnohem více početným kratším dokumentům.

Nicméně, tyto jsou hluboké metriky, protože dokumenty o jedné stránce tendují být technickými schématy nebo mapami; 2-5 stránek dokumenty tendují být tiskovými zprávami a formuláři; a velmi dlouhé dokumenty jsou obecně knihy-zprávy a publikace, i když, z hlediska délky, jsou smíšeny s obrovskými automatizovanými datovými dumpami, které obsahují zcela odlišné výzvy pro sémantickou interpretaci.

Proto výzkumníci zacházejí s touto nerovnováhou jako s významným sémantickým vlastnictvím samo o sobě. Nicméně, PDF stále potřebují být zpracovány a kvantifikovány na základě stránky.

Architektura

Na začátku procesu je metadata PDF parsováno do tabulkových dat. Tato metadata nebudou chybět, protože se skládají z známých množství, jako je velikost souboru a zdroj URL.

PDF je poté rozdělen do stránek, s každou stránkou převedenou do formátu JPEG prostřednictvím ImageMagick. Obrázek je poté krmen do sítě ResNet-50, která odvozuje 2 048-rozměrný vektor ze druhé poslední vrstvy.

Potrubí pro extrakci z PDF. Zdroj: https://arxiv.org/ftp/arxiv/papers/2112/2112.02471.pdf

Potrubí pro extrakci z PDF. Zdroj: https://arxiv.org/ftp/arxiv/papers/2112/2112.02471.pdf

V téže době je stránka převedena do textového souboru pdf2text a získány jsou TF-IDF featurizace prostřednictvím scikit-learn.

TF-IDF znamená Term Frequency Inverse Document Frequency, což měří prevalenci každé fráze v dokumentu ve vztahu k jeho frekvenci v hostitelském datasetu, na jemné škále od 0 do 1. Výzkumníci použili jednotlivá slova (unigramy) jako nejmenší jednotku v systému TF-IDF.

Ačkoli uznávají, že strojové učení nabízí sofistikovanější metody než TF-IDF, autoři argumentují, že cokoliv složitějšího je zbytečné pro stanovený úkol.

Fakt, že každý dokument má přidružený zdroj URL, umožňuje systému určit původ dokumentů napříč datasetem.

To může vypadat jako triviální věc pro tisíc dokumentů, ale bude to docela zajímavé pro 40 milionů+.

Nové přístupy k textovému hledání

Jedním z cílů projektu je učinit výsledky hledání pro textové dotazy více smysluplnými, umožňujícími plodné prozkoumání bez potřeby nadměrné předchozí znalosti. Autoři uvádějí:

‘Zatímco hledání klíčových slov je intuitivní a vysoce extenzivní metodou hledání, může být také omezující, protože uživatelé jsou odpovědní za formulaci klíčových slov, která vrátí relevantní výsledky.’

Jakmile jsou získány hodnoty TF-IDF, je možné vypočítat nejčastěji zobrazená slova a odhadnout “průměrný” dokument v korpusu. Výzkumníci tvrdí, že jelikož tyto mezidokumentační klíčová slova jsou obvykle smysluplná, tento proces vytváří užitečné vztahy pro učence k prozkoumání, které by nemohly být získány pouze individualizovaným indexováním textu každého dokumentu.

Vizuálně, proces usnadňuje “mood board” slov vyzařujících z různých vládních úřadů:

TF-IDF klíčová slova pro různé úřady americké vlády, získaná pomocí TF-IDF.

TF-IDF klíčová slova pro různé úřady americké vlády, získaná pomocí TF-IDF.

Tato extrahovaná klíčová slova a vztahy mohou být později použita k vytvoření dynamických matic v výsledcích hledání, s korpusem PDF začínajícím “vyprávět příběhy”, a klíčovými vztahy spojujícími dokumenty (možná i po stovky let), aby nastínily prozkoumatelnou multi-part “ságu” pro téma nebo téma.

Výzkumníci používají k-means clustering k identifikaci dokumentů, které jsou související, i když dokumenty nemají společný zdroj. To umožňuje vývoj klíčových frází metadat aplikovatelných napříč datasetem, které by se manifestovaly buď jako hodnocení pro termíny v přísném textovém hledání, nebo jako blízké uzly v více dynamickém prostředí prozkoumání:

Visuální analýza

Skutečná novinka washingtonských výzkumníků spočívá v aplikaci technik strojového učení založených na vizuální analýze na rasterizovaném vzhledu PDF v datasetu.

To umožňuje generovat “REDACTED” značku na vizuálním základě, kde by nic v textu samo o sobě neposkytovalo dostatečně společnou základnu.

Skladba redigovaných titulních stránek PDF identifikovaných počítačovým viděním v novém projektu.

Skladba redigovaných titulních stránek PDF identifikovaných počítačovým viděním v novém projektu.

Dále, mapy a schéma mohou být podobně identifikovány a kategorizovány, a autoři komentují tuto potenciální funkčnost:

‘Pro učence, kteří se zajímají o odhalení klasifikovaných nebo jinak citlivých informací, může být izolovat přesně tuto skupinu materiálu pro analýzu a výzkum velmi zajímavé.’

Článek poznamenává, že široká škála vizuálních indikátorů společných pro konkrétní typy vládních PDF může být podobně použita k klasifikaci dokumentů a vytvoření “ság”. Takové “tokeny” by mohly být Congressional pečeť, nebo jiné loga nebo rekurentní vizuální funkce, které nemají žádnou sémantickou existenci v čistém textovém hledání.

Dokumenty, které se vzpírají klasifikaci, nebo které pocházejí z nekomunálního zdroje, mohou být identifikovány podle jejich rozvržení, jako jsou sloupce, typy písem a další charakteristické aspekty.

Rozvržení samo o sobě může poskytnout seskupení a klasifikace ve vizuálním prostoru hledání.

Rozvržení samo o sobě může poskytnout seskupení a klasifikace ve vizuálním prostoru hledání.

Autoři mají v úmyslu vyvinout svůj framework, aby zahrnoval mnohem větší dataset, včetně 2008 End of Term Presidential Web Archive datasetu, který obsahuje více než 10 milionů položek. Zpočátku však chtějí systém škálovat, aby řešil “desítky tisíc” vládních PDF.

Systém je určen k vyhodnocení inicializací s reálnými uživateli, včetně knihovníků, archivářů, právníků, historiků a dalších učenců, a bude se vyvíjet na základě zpětné vazby od těchto skupin.

 

Grappling with the Scale of Born-Digital Government Publications: Toward Pipelines for Processing and Searching Millions of PDFs je napsán Benjaminem Charlesem Germainem Lee (na Paul G. Allen School for Computer Science & Engineering) a Trevorem Owenem, Public Historianem v Rezidenci a vedoucím digitálního obsahu Knihovny Kongresu ve Washingtonu, D.C..

 

* Moje konverze inline citací na hypertextové odkazy.

Původně zveřejněno 28. prosince 2021

 

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai