Η γωνία του Anderson
Αντιμετωπίζοντας το Βουνό των PDF της Κυβέρνησης των ΗΠΑ με Υπολογιστική Όραση

Το формάτ PDF της Adobe έχει εδραιωθεί τόσο βαθιά στις πipelines εγγράφων της κυβέρνησης των ΗΠΑ, που ο αριθμός των εγγράφων που εκδίδονται από την κυβέρνηση και υπάρχουν σήμερα, υπολογίζεται συντηρητικά να είναι στους εκατομμύρια. Συχνά αδιαφανή και χωρίς μεταδεδομένα, αυτά τα PDF – πολλά από τα οποία δημιουργούνται από αυτόματους συστήματα – δεν λένε κανένα ιστορικό ή σαγόνι· αν δεν ξέρεις ακριβώς τι ψάχνεις, πιθανότατα δεν θα βρεις ποτέ το σχετικό έγγραφο. Και αν το ήξερες, πιθανότατα δεν χρειαζόσουν την αναζήτηση.Ωστόσο, ένα νέο πρόγραμμα χρησιμοποιεί υπολογιστική όραση και άλλες προσεγγίσεις μηχανικής μάθησης για να μετατρέψει αυτό το σχεδόν ακατόρθωτο βουνό δεδομένων σε một πολύτιμο και εξερεύνησιμο πόρο για ερευνητές, ιστορικούς, δημοσιογράφους και ακαδημαϊκούς.
Όταν η κυβέρνηση των ΗΠΑ ανακάλυψε το φορητό φορμάτ εγγράφου (PDF) της Adobe στη δεκαετία του 1990, αποφάσισε ότι του άρεσε. Σε αντίθεση με τα επεξεργάσιμα έγγραφα Word, τα PDF μπορούσαν να “ψηθούν” με διάφορους τρόπους που τα έκαναν δύσκολα ή ακόμη και αδύνατα να τροποποιηθούν αργότερα· οι γραμματοσειρές μπορούσαν να ενσωματωθούν, εξασφαλίζοντας συμβατότητα μεταξύ πλατφορμών· και η εκτύπωση, η αντιγραφή και ακόμη και η ανοίξή τους μπορούσαν όλες να ελεγχθούν σε λεπτομερή βάση.
Περισσότερο σημαντικά, αυτές οι βασικές λειτουργίες ήταν διαθέσιμες σε κάποιες από τις παλαιότερες “βασικές” προδιαγραφές του φορματίου, υποσχόμενες ότι το αρχειακό υλικό δεν θα χρειαζόταν να επεξεργαστεί ή να επανεξεταστεί αργότερα για να διασφαλιστεί η προσβασιμότητα.几乎 όλα όσα χρειαζόταν η κυβέρνηση για την έκδοση, ήταν στη θέση τους το 1996.
Με την τεχνολογία blockchain και NFT να είναι ακόμη μακριά, το PDF ήταν όσο κοντά μπορούσε να φτάσει η αναδυόμενη ψηφιακή εποχή σε ένα “νεκρό” αναλογικό έγγραφο, μόνο ένα концептуαλικό σκαλοπάτι μακριά από ένα φαξ. Αυτό ήταν ακριβώς αυτό που ήθελε.
Εσωτερική Διαμάχη για το PDF
Ο βαθμός στον οποίο τα PDF είναι ερμητικά, ακατάλληλα και “μη κοινωνικά” χαρακτηρίζεται στην τεκμηρίωση του φορματίου στην Βιβλιοθήκη του Κογκρέσου, η οποία προτιμά το PDF ως το “προτιμώμενο φορμάτ” της:
‘Ο πρωταρχικός σκοπός του φορματίου PDF/A είναι να αντιπροσωπεύει ηλεκτρονικά έγγραφα με τρόπο που να διατηρεί την στατική οπτική τους εμφάνιση με την πάροδο του χρόνου, ανεξάρτητα από τα εργαλεία και τα συστήματα που χρησιμοποιούνται για τη δημιουργία, την αποθήκευση ή την απόδοση των αρχείων. Για αυτόν τον σκοπό, το PDF/A προσπαθεί να μεγιστοποιήσει την ανεξαρτησία της συσκευής, την αυτοπεριέχουσα και την αυτοτεκμηρίωση.’
Η συνεχής ενθουσιασμός για το φορμάτ PDF, τα πρότυπα για την προσβασιμότητα και οι απαιτήσεις για μια ελάχιστη έκδοση, ποικίλλουν μεταξύ των τμημάτων της κυβέρνησης των ΗΠΑ. Για παράδειγμα, ενώ η Υπηρεσία Προστασίας του Περιβάλλοντος έχει αυστηρές αλλά υποστηρικτικές πολιτικές σε αυτόν τον τομέα, η επίσημη ιστοσελίδα της κυβέρνησης plainlanguage.gov αναγνωρίζει ότι ‘οι χρήστες μισούν τα PDF’, και ακόμη συνδέεται απευθείας με μια αναφορά του 2020 της Nielsen Norman Group με τίτλο PDF: Ακόμη Ακατάλληλο για Ανθρώπινη Κατανάλωση, 20 Χρόνια Αργότερα.
Εν τω μεταξύ, η ιστοσελίδα irs.gov, δημιουργήθηκε το 1995 ειδικά για τη μετάβαση της τεκμηρίωσης του φορολογικού οργανισμού σε ψηφιακή μορφή, και άμεσα υιοθέτησε το PDF και είναι ακόμη ενθουσιώδης υποστηρικτής.
Η Ιογενής Διασπορά των PDF
Από τότε που οι βασικές προδιαγραφές για το PDF δημοσιεύθηκαν με ανοιχτό κώδικα από την Adobe, μια σειρά εργαλείων επεξεργασίας διακομιστή και βιβλιοθηκών έχει εμφανιστεί, πολλά από τα οποία τώρα είναι σεβαστά και εδραιωμένα όσο και οι προδιαγραφές PDF του 1996, και τόσο αξιόπιστα και ανθεκτικά σε σφάλματα, ενώ οι προμηθευτές λογισμικού βιάστηκαν να ενσωματώσουν λειτουργικότητα PDF σε φθηνά εργαλεία.
Συνέπεια, αγαπημένα ή μισητά από τα οικοδεσπότες τμημάτων, τα PDF παραμένουν πανταχού παρόντα στις επικοινωνίες και τα πλαίσια τεκμηρίωσης σε ένα τεράστιο αριθμό τμημάτων της κυβέρνησης των ΗΠΑ.
Το 2015, ο Αντιπρόεδρος Μηχανικής της Adobe για το Document Cloud, Phil Ydens εκτίμησε ότι 2,5 τρισεκατομμύρια έγγραφα PDF υπάρχουν στον κόσμο, ενώ το φορμάτ πιστεύεται ότι αντιπροσωπεύει κάπου μεταξύ 6-11% του συνολικού περιεχομένου του ιντερνέτ. Σε μια τεχνολογική κουλτούρα που είναι εθισμένη στο να διαταράσσει τις παλιές τεχνολογίες, το PDF έχει γίνει αμετακίνητο “σίδηρο” – ένα κεντρικό μέρος της δομής που το φιλοξενεί.

Από το 2018. Δεν υπάρχει ενδείξεις για ένα ισχυρό αντίπαλο ακόμη. Πηγή: https://twitter.com/trbrtc/status/980407663690502145
Σύμφωνα με μια πρόσφατη μελέτη από ερευνητές στο Πανεπιστήμιο του Ουάσινγκτον και τη Βιβλιοθήκη του Κογκρέσου, ‘εκατομμύρια μοναδικά έγγραφα της κυβέρνησης των ΗΠΑ που έχουν αναρτηθεί στο διαδίκτυο σε μορφή PDF έχουν αρχειοθετηθεί από βιβλιοθήκες μέχρι σήμερα’.
Ωστόσο, οι ερευνητές ισχυρίζονται ότι αυτό είναι μόνο η “άκρη του παγόβουνου”*:
‘Όπως ο ηγέτης ιστορικός Roy Rosenzweig είχε σημειώσει από το 2003, όταν πρόκειται για ψηφιακά πρωτογενή πηγές για την ακαδημαϊκή έρευνα, είναι απαραίτητο να αναπτύξουμε μεθόδους και προσεγγίσεις που θα κλιμακωθούν σε δεκάδες και εκατομμύρια ψηφιακά πόρους. Τώρα έχουμε φτάσει στο σημείο όπου η ανάπτυξη προσεγγίσεων για αυτή την κλίμακα είναι απαραίτητη.
‘Ως παράδειγμα, οι ιστοσελίδες αρχείων της Βιβλιοθήκης του Κογκρέσου περιέχουν περισσότερες από 20 δισεκατομμύρια ψηφιακά πόρους.’
PDF: Ανθεκτικά στην Ανάλυση
Το πρόγραμμα των ερευνητών του Ουάσινγκτον εφαρμόζει μια σειρά από μεθόδους μηχανικής μάθησης σε ένα δημόσια διαθέσιμο και annotated σώμα 1.000 επιλεγμένων εγγράφων από τη Βιβλιοθήκη του Κογκρέσου, με σκοπό να αναπτύξουν συστήματα ικανά για αστραπιαία, πολυμορφική ανάκτηση κειμένου και εικόνων σε πλαίσια που μπορούν να κλιμακωθούν μέχρι τις τρέχουσες (και αυξανόμενες) όγκους PDF, όχι μόνο στην κυβέρνηση, αλλά και σε πολλαπλά τμήματα.
Όπως παρατηρεί η εργασία, ο ταχύτατος ρυθμός ψηφιοποίησης σε μια σειρά από τμήματα της κυβέρνησης των ΗΠΑ στη δεκαετία του 1990 οδήγησε σε διαφορετικές πολιτικές και πρακτικές, και συχνά στην υιοθέτηση μεθόδων δημοσίευσης PDF που δεν περιείχαν την ίδια ποιότητα μεταδεδομένων που ήταν κάποτε το χρυσό πρότυπο των υπηρεσιών βιβλιοθήκης της κυβέρνησης – ή ακόμη και βασικά εγγενή μεταδεδομένα PDF, τα οποία θα μπορούσαν να είναι κάπως χρήσιμα για να κάνουν τις συλλογές PDF πιο προσιτές και φιλικές προς τον δείκτη.
Συζητώντας αυτή την περίοδο διαταραχής, οι συγγραφείς σημειώνουν:
‘Αυτές οι προσπάθειες οδήγησαν σε μια εκρηκτική αύξηση της ποσότητας των κυβερνητικών δημοσιεύσεων, η οποία με τη σειρά της οδήγησε σε μια κατάρρευση της γενικής προσέγγισης με την οποία παράγονταν συνεπή μεταδεδομένα για αυτές τις δημοσιεύσεις και με την οποία οι βιβλιοθήκες αποκτούσαν αντίγραφα τους.’
Συνέπεια, ένα τυπικό βουνό PDF υπάρχει χωρίς κανένα контέκστ εκτός από τις URLs που συνδέονται απευθείας με αυτό. Επιπλέον, τα έγγραφα στο βουνό είναι κλειστά, αυτοαναφορικά και δεν αποτελούν μέρος κανένας “σαγόνι” ή αφηγήματος που οι τρέχουσες μεθόδους αναζήτησης είναι πιθανό να διακρίνουν,尽管 τέτοιες κρυφές συνδέσεις υπάρχουν σίγουρα.
Υπολογιστική Όραση για Ανάλυση PDF
Η πλειονότητα των προηγούμενων ερευνών που οι συγγραφείς αναφέρουν χρησιμοποιούν κειμενοβασισμένες μεθόδους για την εξαγωγή χαρακτηριστικών και υψηλού επιπέδου εννοιών από υλικό PDF· αντίθετα, το πρόγραμμα τους επικεντρώνεται στην εξαγωγή χαρακτηριστικών και τάσεων εξετάζοντας τα PDF σε οπτικό επίπεδο, σύμφωνα με τρέχουσα έρευνα για την πολυμορφική ανάλυση του περιεχομένου των ειδήσεων.
Αντιμετωπίζοντας τις Ασυνήθιστες Δεδομένα
Στη δημιουργία eines σχήματος μετρήσεων, οι ερευνητές έχουν πρέπει να λάβουν υπόψη πώς είναι歪μενα τα δεδομένα, τουλάχιστον όσον αφορά το μέγεθος ανά στοιχείο.
Από τα 1.000 PDF στο επιλεγμένο σύνολο (τα οποία οι συγγραφείς υποθέτουν ότι είναι αντιπροσωπευτικά των 40 εκατομμυρίων από τα οποία έχουν τραβηχθεί), το 33% είναι μόνο μια σελίδα μακρύ, και το 39% είναι 2-5 σελίδες μακρύ. Αυτό τοποθετεί το 72% των εγγράφων σε πέντε σελίδες ή λιγότερες.
Μετά από αυτό, υπάρχει ένα αρκετά άλμα: το 18% των εγγράφων που μένουν είναι 6-20 σελίδες μακρύ, το 6% είναι 20-100 σελίδες και το 3% είναι 100+ σελίδες. Αυτό σημαίνει ότι τα μακρύτερα έγγραφα αποτελούν την πλειονότητα των μεμονωμένων σελίδων που εξάγονται, ενώ μια λιγότερο λεπτομερής προσέγγιση που λαμβάνει υπόψη τα έγγραφα μόνο θα στρέψει την προσοχή προς τα πολύ πιο πολυάριθμα μικρότερα έγγραφα.
Αρχιτεκτονική
Στην αρχή της διαδικασίας, τα μεταδεδομένα του PDF αναλύονται σε πίνακες δεδομένων. Αυτά τα μεταδεδομένα δεν θα λείπουν, επειδή αποτελούνται από γνωστές ποσότητες όπως το μέγεθος του αρχείου και η πηγή URL.
Το PDF χωρίζεται στη συνέχεια σε σελίδες, με κάθε σελίδα να μετατρέπεται σε μορφή JPEG μέσω ImageMagick. Η εικόνα στη συνέχεια τροφοδοτείται σε ένα δίκτυο ResNet-50 που εξάγει einen 2.048 διαστάσεων διανυσμα από το δεύτερο-τελευταίο επίπεδο.

Η διαδικασία εξαγωγής από τα PDF. Πηγή: https://arxiv.org/ftp/arxiv/papers/2112/2112.02471.pdf
Ταυτόχρονα, η σελίδα μετατρέπεται σε αρχείο κειμένου από το pdf2text, και TF-IDF featurizations λαμβάνονται μέσω scikit-learn.
Νέες Προσεγγίσεις για την Αναζήτηση Κειμένου
Ένα από τα στόχους του προγράμματος είναι να κάνει τα αποτελέσματα αναζήτησης για ερωτήσεις κειμένου πιο σημαντικά, επιτρέποντας την ευχάριστη εξερεύνηση χωρίς την ανάγκη για υπερβολική προηγούμενη γνώση. Οι συγγραφείς αναφέρουν:
‘Ενώ η αναζήτηση με λέξεις-κλειδιά είναι μια直觀 και πολύ extensible μέθοδος αναζήτησης, μπορεί επίσης να είναι περιοριστική, поскольку οι χρήστες είναι υπεύθυνοι για τη διατύπωση ερωτημάτων που να ανακτούν σχετικά αποτελέσματα.’
Όταν οι τιμές TF-IDF λαμβάνονται, είναι δυνατό να υπολογιστεί το πιο συχνά εμφανιζόμενο λέξεις και να εκτιμηθεί ένα “μέσο” έγγραφο στο σώμα. Οι ερευνητές ισχυρίζονται ότι既然 αυτές οι λέξεις-κλειδιά μεταξύ εγγράφων είναι συνήθως σημαντικές, αυτή η διαδικασία δημιουργεί χρήσιμες σχέσεις για τους ακαδημαϊκούς να εξερευνήσουν, οι οποίες δεν θα μπορούσαν να ληφθούν μόνο με την ατομική indeξing του κειμένου κάθε εγγράφου.

Λέξεις-κλειδιά TF-IDF για διάφορα τμήματα της κυβέρνησης των ΗΠΑ, λαμβανόμενα από TF-IDF.
Οπτική Ανάλυση
Η αληθινή καινοτομία της προσέγγισης των ερευνητών του Ουάσινγκτον είναι να εφαρμόσουν τεχνικές οπτικής ανάλυσης με βάση την υπολογιστική όραση στις ραστροποιημένες εμφανίσεις των PDF στο σώμα.
Με αυτόν τον τρόπο, είναι δυνατό να δημιουργηθεί ένα “ΔΙΑΓΡΑΦΗ” tag με βάση την οπτική, όπου τίποτα στο κείμενο δεν θα μπορούσε να παρέχει μια κοινή βάση.

Μια ομάδα redacted PDF πρώτων σελίδων αναγνωρισμένων από την υπολογιστική όραση στο νέο πρόγραμμα.
Επιπλέον, χάρτες και σχήματα μπορούν να αναγνωριστούν και να ταξινομηθούν, και οι συγγραφείς σχολιάζουν αυτή τη δυνατότητα:
‘Για τους ακαδημαϊκούς που ενδιαφέρονται για τις αποκαλύψεις ταξινομημένων ή ευαίσθητων πληροφοριών, μπορεί να είναι ιδιαίτερα ενδιαφέρον να απομονωθεί ακριβώς αυτό το είδος ομάδας υλικού για ανάλυση και έρευνα.’
Η εργασία σημειώνει ότι μια ευρεία ποικιλία οπτικών δεικτών που είναι κοινή σε συγκεκριμένα είδη κυβερνητικών PDF μπορούν επίσης να χρησιμοποιηθούν για να ταξινομήσουν έγγραφα και να δημιουργήσουν “σαγόνια”. Τέτοια “tokens” θα μπορούσαν να είναι το σήμα του Κογκρέσου, ή άλλα λογότυπα ή επαναλαμβανόμενα οπτικά χαρακτηριστικά που δεν έχουν σημασιολογική ύπαρξη σε μια καθαρή αναζήτηση κειμένου.
Επιπλέον, έγγραφα που αντιστέκονται στην ταξινόμηση, ή όπου το έγγραφο προέρχεται από μια μη κοινή πηγή, μπορούν να αναγνωριστούν από τη διάταξη τους, όπως στήλες, τύποι γραμματοσειρών και άλλα διακριτά χαρακτηριστικά.

Η διάταξη μόνο μπορεί να προσφέρει ομαδοποιήσεις και ταξινομήσεις σε ένα οπτικό χώρο αναζήτησης.
Οι συγγραφείς έχουν την πρόθεση να αναπτύξουν το πλαίσιο τους για να φιλοξενήσει πολύ μεγαλύτερα σύνολα δεδομένων, συμπεριλαμβανομένου του 2008 End of Term Presidential Web Archive συνόλου δεδομένων, το οποίο περιέχει πάνω από 10 εκατομμύρια αντικείμενα. Αρχικά, ωστόσο, έχουν την πρόθεση να κλιμακώσουν το σύστημα για να αντιμετωπίσουν “δεκάδες χιλιάδες” κυβερνητικών PDF.
Το σύστημα προορίζεται να αξιολογηθεί αρχικά με πραγματικούς χρήστες, συμπεριλαμβανομένων βιβλιοθηκονόμων, αρχειονόμων, δικηγόρων, ιστορικών και άλλων ακαδημαϊκών, και θα εξελιχθεί με βάση τις αντιδράσεις από αυτές τις ομάδες.
Αντιμετωπίζοντας το Μέγεθος των Ψηφιακών Κυβερνητικών Δημοσιεύσεων: Προς τις Πipelines για την Επεξεργασία και την Αναζήτηση Εκατομμυρίων PDF γράφτηκε από τον Benjamin Charles Germain Lee (στο Paul G. Allen School for Computer Science & Engineering) και τον Trevor Owens, Δημόσιο Ιστορικό στην Κατοικία και Αρχηγό της Ψηφιακής Διαχείρισης Περιεχομένου στη Βιβλιοθήκη του Κογκρέσου στην Ουάσινγκτον, DC..
* Η μετατροπή μου των εσωτερικών αναφορών σε υπερσυνδέσμους.
Δημοσιεύθηκε αρχικά στις 28 Δεκεμβρίου 2021












