Anderson’un Açısı

ABD Hükümetinin PDF Dağını Bilgisayarlı Görüntü Isleme ile Aşmak

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Adobe’ un PDF formatı, ABD hükümeti belge işleme hatlarına öyle derinden yerleşmiştir ki, mevcut olan devlet tarafından yayınlanan belgelerin sayısı muhafazakar bir tahmine göre yüz milyonların üzerindedir. Çoğu zaman opak ve meta veri içermeyen bu PDF’ler – birçoğu otomatik sistemler tarafından oluşturulmuştur – topluca hiçbir hikaye veya saga anlatmaz; eğer tam olarak ne aradığınızı bilmiyorsanız, muhtemelen ilgili bir belgeyi asla bulamayacaksınız. Ve eğer biliyorsanız, muhtemelen aramaya ihtiyacınız yoktu.Fakat yeni bir proje, bilgisayar görüntüleme ve diğer makine öğrenimi yaklaşımlarını kullanarak bu几乎 erişilemez veri dağını, araştırmacılar, tarihçiler, gazeteciler ve akademisyenler için değerli ve keşfedilebilir bir kaynak haline getirmeyi amaçlıyor.

ABD hükümeti 1990’larda Adobe’un Taşınabilir Belge Formatını (PDF) keşfettiğinde, bunu beğendi. Düzenlenebilir Word belgelerinden farklı olarak, PDF’ler çeşitli şekillerde “pişirilebilirdi” ki bu da onları daha sonra değiştirmeyi zor veya imkansız hale getirirdi; yazı tipleri gömülebilirdi, böylece çapraz platform uyumluluğu sağlanırdı ve yazdırma, kopyalama ve hatta açma işlemleri granül bazında kontrol edilebilirdi.

Daha da önemlisi, bu temel özellikler formatın en eski “temel” özelliklerinde mevcuttu, bu da arşiv materyalinin daha sonra erişilebilirlik sağlamak için yeniden işlenmesine veya yeniden ziyaret edilmesine gerek kalmayacağı anlamına geliyordu. Hükümet yayıncılığı için neredeyse her şey 1996’ya kadar yerine gelmişti burada.

Blok zinciri kökeni ve NFT teknolojileri on yıllar uzakta iken, PDF, ortaya çıkan dijital çağın “ölü” analog bir belgeye ulaşabileceği en yakın şeydi, sadece bir kavramsal aksaklık uzakta bir faksın ötesindeydi. Bu, tam olarak istendiği şeydi.

PDF Hakkında İç Çatışma

PDF’lerin ne kadar kapalı, işlenemez ve “sosyal olmayan” olduğu, Kongre Kütüphanesi’ndeki belgelemeyle karakterize edilir, burada PDF, “tercih edilen format” olarak favori yapılır:

‘PDF/A formatının birincil amacı, elektronik belgeleri, oluşturuldukları, depolandıkları veya görüntülendikleri araçlardan ve sistemlerden bağımsız olarak statik görsel görünümünü koruyacak şekilde temsil etmektir. Bu amaçla, PDF/A, cihaz bağımsızlığını, kendi kendine içerme ve kendi kendine belgeleme yeteneklerini en üst düzeye çıkarmaya çalışır.’

PDF formatına devam eden coşku, erişilebilirlik standartları ve minimum sürüm gereksinimleri, ABD hükümeti departmanları arasında çeşitlilik gösterir. Örneğin, Çevre Koruma Ajansı bu konuda sıkı ancak destekleyici politikalarına sahiptir, ancak resmi ABD hükümeti web sitesi plainlanguage.gov kabul eder ki ‘kullanıcılar PDF’i sevmiyor’ ve doğrudan 2020 Nielsen Norman Group raporuna bağlanır, adı PDF: 20 Yıl Sonra Hala İnsanca Tüketim İçin Uygun Değil.

Öte yandan, irs.gov, 1995 yılında vergi ajansının belgelerini dijitalleştirme amacıyla oluşturuldu ve hala hevesli bir PDF savunucusudur.

PDF’lerin Viral Yayılması

PDF’nin temel özellikleri Adobe tarafından açık kaynak olarak yayınlandığından beri, bir dizi sunucu tarafı işleme aracı ve kütüphaneler ortaya çıktı, birçokları artık saygın ve 1996’daki PDF özellikleri kadar yerleşmiş ve güvenilir, ayrıca yazılım satıcıları PDF işlevselliğini düşük maliyetli araçlara entegre etmeye koştu.

Bu nedenle, sevilen veya nefret edilen hükümet departmanlarında, PDF’ler ABD hükümeti departmanlarındaki iletişim ve belgeleme çerçevelerinde her yerde mevcuttur.

2015 yılında Adobe’un Belge Bulutu için Mühendislik Başkan Yardımcısı Phil Ydens tahmin etti ki 2,5 trilyon PDF belgesi dünya üzerinde mevcuttur, oysa formatın tüm web içeriğinin %6-11’ini oluşturduğu düşünülüyor. Eski teknolojileri bozmaya alışkın bir teknoloji kültüründe, PDF, barındırdığı yapıların merkezi bir parçası haline gelen “pas” haline geldi.

2018'den. Henüz güçlü bir rakip olduğuna dair bir kanıt yok.

2018’den. Henüz güçlü bir rakip olduğuna dair bir kanıt yok. Kaynak: https://twitter.com/trbrtc/status/980407663690502145

Washington Üniversitesi ve Kongre Kütüphanesi’nden araştırmacaların son bir çalışmasına göre, ‘yüz milyonlarca benzersiz ABD hükümeti belgesinin web arşivlerine PDF形式nde arşivlendi’.

Ancak araştırmacılar, bunun sadece “buzdağının görünen kısmı” olduğunu iddia ediyorlar:

‘Önde gelen dijital tarihçi Roy Rosenzweig, 2003’te doğuştan dijital birincil kaynaklar için, milyonlarca ve hatta milyarlarca dijital kaynak için ölçeklenebilecek yöntemler ve yaklaşımlar geliştirmek gerektiğini belirtmişti. Şimdi bu ölçekte yaklaşım geliştirmek gerekli.

‘Örneğin, Kongre Kütüphanesi web arşivleri şimdi 20 milyardan fazla bireysel dijital kaynağı içeriyor.’

PDF’ler: Analize Dirençli

Washington araştırmacılarının projesi, bir dizi makine öğrenimi yöntemini Kongre Kütüphanesi’nden seçilen 1000 belge kamu ve annotated korpusuna uygular, amacı hükümet ve diğer sektörlerdeki mevcut ve büyüyen PDF hacimlerine ölçeklenebilecek, çok modlu metin ve görüntü tabanlı sorgulama sistemleri geliştirmektir.

1990’larda ABD hükümeti departmanlarındaki hızlı dijitalleştirme, politika ve uygulamaların farklılaşmasına yol açtı ve sık sık, hükümet kütüphesi hizmetlerinin bir zamanlar altın standardı olan meta verilerini içermeyen PDF yayınlama yöntemlerinin benimsenmesine neden oldu.

Bu dönemin bozulmasını tartışırken, yazarlar not eder:

‘Bu çabalar, hükümet yayınlarının miktarında patlayıcı bir büyümeye yol açtı, bu da bu tür yayınlar için tutarlı meta verilerin üretilmesi ve kütüphanelerce edinilmesi genel yaklaşımının bozulmasına neden oldu.’

Sonuç olarak, tipik bir PDF dağı typically herhangi bir bağlam olmadan, doğrudan bağlantısı olan URL’ler dışında var olur. Ayrıca, dağdaki belgeler kapalıdır, kendi kendine referanslıdır ve mevcut arama yöntemleri muhtemelen algılayamayacağı bir “saga” veya anlatının parçası değildir, böyle gizli bağlantılar şüphesiz vardır.

Ele alinan ölçekte, manuel anotasyon veya küratörlük imkansız bir перспектиiftir. Projenin 1000 Kongre Kütüphanesi belgesinin türetilmiş olduğu veri korpusu 40 milyondan fazla PDF içerir ve araştırmacılar bunu yakın gelecekte ele alabilir bir zorluk haline getirmeyi amaçlıyorlar.

Bilgisayarlı Görüntü Isleme için PDF Analizi

Yazarların atıfta bulunduğu önceki araştırmaların çoğu, PDF materyallerinden özellikler ve yüksek düzeyli kavramlar çıkarmak için metin tabanlı yöntemleri kullanır; buna karşılık, projeleri PDF’leri görsel düzeyde inceleyerek özellikler ve eğilimleri türetmeye odaklanır, bu da mevcut araştırmayla uyumlu bir şekilde haber içeriğinin çok modlu analizine benzer.

PDF analizi için makine öğrenimi de bilim yayıncılığı veya diğer dar sektörler için değil, çeşitli yayınlara uygulanabilir daha yüksek düzeyli çıkarma boru hatları oluşturmak amacıyla bilim yayıncılığına özgü şemalar gibi Semantic Scholar aracılığıyla PDF analizi için uygulanmıştır, ancak yazarlar daha dar sektörlerin sınırlamalarına göre ayarlanmış değil, daha geniş bir uygulama yelpazesine uygulanabilir daha yüksek düzeyli çıkarma boru hatları oluşturmayı amaçlar.

Dengesiz Verileri Ele Almak

Araştırmacılar, bir ölçeklendirme şeması oluştururken, verilerin ne kadar çarpık olduğunu, en azından her bir öğenin boyutuna göre düşünmek zorunda kaldılar.

Seçilen veri kümesindeki 1000 PDF’den (%33’ü sadece bir sayfa, %39’u 2-5 sayfa), belgelerin %72’si beş sayfayı geçmiyor.

Sonrasında, bir sıçrama var: kalan belgelerin %18’i 6-20 sayfa, %6’sı 20-100 sayfa ve %3’ü 100+ sayfa. Bu, en uzun belgelerin bireysel sayfaların çoğunluğunu oluşturduğu, daha az granül bir yaklaşımın ise daha çok sayıda kısa belgeleri vurgulayacağı anlamına gelir.

Bu, single-page belgelerin genellikle teknik şemalar veya haritalar, 2-5 sayfalık belgelerin genellikle basın açıklamaları ve formlar, çok uzun belgelerin ise genellikle kitap boyutunda raporlar ve yayınlardan oluştuğu anlamına gelir, ancak bunlar, anlamsal yorum için farklı zorluklar sunan devasa otomatik veri dökümleri ile karışırlar.

Bu nedenle, araştırmacılar bu dengesizliği, kendiliğinden anlamlı bir özellikler olarak ele alıyorlar. Yine de, PDF’lerin her bir sayfası temelinde işlenmesi ve nicelendirilmesi gerekiyor.

Mimari

Sürecin başında, PDF’nin meta verisi, bilinen miktarlar gibi dosya boyutu ve kaynak URL’si olan bir tablo verisine ayrıştırılır.

PDF daha sonra sayfalarına bölünür ve her sayfa, ImageMagick aracılığıyla JPEG formatına dönüştürülür. Görüntü, daha sonra bir ResNet-50 ağına beslenir ve ağın ikinci son katmanından 2048 boyutlu bir vektör türetilir.

PDF'lerden çıkarma boru hattı. Kaynak: https://arxiv.org/ftp/arxiv/papers/2112/2112.02471.pdf

PDF’lerden çıkarma boru hattı. Kaynak: https://arxiv.org/ftp/arxiv/papers/2112/2112.02471.pdf

Aynı zamanda, sayfa bir metin dosyasına scikit-learn aracılığıyla pdf2text ve TF-IDF öznitelikleri ile dönüştürülür.

TF-IDF, Term Frequency Inverse Document Frequency’nin kısaltmasıdır, bu, her bir ifadenin belge içindeki yaygınlığını, tüm veri kümesindeki sıklığına göre ölçen bir ölçektir, 0 ile 1 arasında ince bir ölçektedir. Araştırmacılar, sistemlerinin TF-IDF ayarlarında en küçük birimler olarak tek kelimeler (unigramlar) kullanmışlardır.

Her belgenin bir kaynak URL’si ile ilişkili olması, sistemi belge provenansını veri kümesi boyunca belirlemesini sağlar.

Bu, binlerce belge için önemsiz gibi görünebilir, ancak 40 milyondan fazla belge için oldukça önemli bir göz açıcı olacaktır.

Yeni Yaklaşımlar ile Metin Arama

Projenin amaçlarından biri, metin tabanlı sorgular için arama sonuçlarını daha anlamlı hale getirmektir, bu da fazla öncül bilgiye gerek kalmadan verimli bir keşif sağlar. Yazarlar şöyle diyor:

‘Anahtar kelime araması, sezgisel ve yüksek oranda genişletilebilen bir arama yöntemidir, ancak sınırlı olabilir, çünkü kullanıcılar alakalı sonuçları elde etmek için anahtar kelime sorgularını formüle etmekten sorumludurlar.’

TF-IDF değerleri elde edildikten sonra, en çok kullanılan kelimeler hesaplanabilir ve bir “ortalama” belge korpusu kestirilebilir. Araştırmacılar, bu belge arası anahtar kelimelerin genellikle anlamlı olduğunu, bu sürecin akademisyenler için keşfedilmeye değer ilişkiler oluşturabileceğini, ancak her bir belgenin metninin bireysel indekslenmesiyle alone elde edilemeyeceğini iddia ediyorlar.

Görsel olarak, bu süreç, çeşitli hükümet departmanlarından gelen kelimelerin “mood board”unu sağlar:

Çeşitli ABD hükümeti departmanları için TF-IDF anahtar kelimeleri, TF-IDF ile elde edilmiştir.

Çeşitli ABD hükümeti departmanları için TF-IDF anahtar kelimeleri, TF-IDF ile elde edilmiştir.

Bu çıkarılan anahtar kelimeler ve ilişkiler daha sonra, arama sonuçlarında dinamik matrisler oluşturmak için kullanılabilir, PDF’ler korpusu yavaş yavaş “hikayeler” anlatmaya başlar ve anahtar kelime ilişkileri, belgeleri (muhtemelen yüzlerce yıl boyunca) bir konu veya tema için keşfedilebilir bir çok parçalı “saga” oluşturmak için birleştirebilir.

Araştırmacılar, ortak olmayan bir kaynak paylaşımlarına sahip belgeleri tanımlamak için k-means kümeleme kullanır, bu da veri kümesi boyunca geçerli anahtar kelime meta verilerinin geliştirilmesini sağlar, bu da ya metin aramasında terim sıralamaları olarak ya da daha dinamik bir keşif ortamında yakın nodlar olarak ortaya çıkabilir:

Görsel Analiz

Washington araştırmacılarının yaklaşımının gerçek yeniliği, PDF’lerin veri kümesindeki rasterize görünümüne makine öğrenimi tabanlı görsel analiz tekniklerini uygulamaktır.

Bu şekilde, görsel temelde bir “REDACTED” etiketi oluşturmak mümkündür, burada metinde hiçbir şey ortak bir temel sağlamayacaktır.

Yeni projede bilgisayar görüntüleme tarafından tanımlanan redakte edilmiş PDF ön sayfaları kümesi.

Yeni projede bilgisayar görüntüleme tarafından tanımlanan redakte edilmiş PDF ön sayfaları kümesi.

Dahası, bu yöntem, hükümet belgelerinin redakte edilmiş materyallerini tanımlamak ve kategorize etmek için de kullanılabilir ve yazarlar bu potansiyel işlevselliğe dikkat çeker:

‘Sınıflandırılmış veya diğer duyarlı bilgilerin açıklanmasıyla ilgilenen akademisyenler için, tam da bu tür materyal kümesini analiz ve araştırma için izole etmek özellikle ilginç olabilir.’

Makale, geniş bir çeşitlilikte hükümet PDF’lerine özgü görsel belirteçlerin de belgeleri sınıflandırmak ve “saga” oluşturmak için kullanılabileceğini belirtir. Bu “token”ler Kongre mührü veya diğer logolar veya tekrarlanan görsel özellikler olabilir ve bunlar, saf metin aramasında anlamsal varlıkları yoktur.

Belgelerin düzeni, sütunlar, yazı tipleri ve diğer ayırt edici özellikler gibi, sınıflandırılmalarına ve “saga” oluşturulmasına yardımcı olabilir.

Düzen alone, bir görsel arama alanında gruplama ve sınıflandırma sağlayabilir.

Düzen alone, bir görsel arama alanında gruplama ve sınıflandırma sağlayabilir.

Yazarlar, metni ihmal etmediler, ancak açıkça görsel arama alanı, bu çalışmanın itici gücüdür.

‘PDF’leri görsel özelliklerine göre arama ve analiz etme yeteneği, böylece mevcut çabalara değil, doğuştan dijital içerik için arama ve analizinin ne olabileceğini yeniden hayal eden bir yaklaşım sunar.’

Yazarlar, çerçevelerini çok daha büyük veri kümelerine, 2008 Sonu Başkanlık Web Arşivi veri kümesine veri kümesine uyum sağlamak için geliştirmeyi amaçlıyorlar, bu veri kümesi 10 milyondan fazla öğe içeriyor. İlk olarak, sistemi hükümet PDF’lerinin “on binler”ini ele almayı amaçlıyorlar.

Sistem, ilk olarak kütüphaneciler, arşivciler, avukatlar, tarihçiler ve diğer akademisyenler gibi gerçek kullanıcılarla değerlendirilmeye yönelik olup, bu gruplardan gelen geri bildirimlere göre geliştirilecektir.

Doğuştan Dijital Hükümet Yayınları ile Başa Çıkmak: Milyonlarca PDF’i İşleme ve Arama Boru Hatları Doğru Paul G. Allen Bilgisayar Bilimi ve Mühendisliği Okulu’ndan Benjamin Charles Germain Lee ve Kongre Kütüphanesi’nden Trevor Owens tarafından yazılmıştır.

* İmli alıntılara hyperlink dönüştürme.

Aslen 28 Aralık 2021’de yayınlandı

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai