AI-modeller og platforme
DeepScribe AI kan hjælpe med at oversætte gamle tavler
Forskere fra University of Chicagos Oriental Institute og Computer Science-afdelingen har samarbejdet om at designe en AI, der kan hjælpe med at afkode tavler fra gamle civilisationer. Ifølge Phys.org hedder AI’en DeepScribe og er blevet trænet på over 6.000 annoterede billeder fra Persepolis Fortification Archive, og når AI-modellen er færdig, vil den kunne fortolke ikke-analyserede tavler, hvilket gør det lettere at studere gamle dokumenter.
Eksperter, der studerer gamle dokumenter, som forskerne, der studerer dokumenter skabt under Achaemenid-riket i Persien, har brug for at oversætte gamle dokumenter hånd i hånd, en langvarig proces, der er udsat for fejl. Forskere har brugt computere til at hjælpe med at fortolke gamle dokumenter siden 1990’erne, men computerprogrammerne, der blev brugt, var af begrænset hjælp. De komplekse cuneiform-tegn samt tavlernes tredimensionale form satte en grænse for, hvor nyttige computerprogrammerne kunne være.
Computer vision-algoritmer og deep learning-arkitekturer har bragt nye muligheder til feltet. Sanjay Krishnan fra Computer Science-afdelingen på OI samarbejdede med associate professor i Assyriology Susanne Paulus for at lancere DeepScribe-programmet. Forskerne overtog en databaseadministrationsplatform kaldet OCHRE, der organiserede data fra arkæologiske udgravninger. Målet er at skabe et AI-værktøj, der er både omfattende og fleksibelt, og kan fortolke skrift fra forskellige geografiske regioner og tidsperioder.
Som Phys.org rapporterede, forklarede Krishnan, at udfordringerne ved at genkende skrift, som arkæologiske forskere står overfor, i virkeligheden er de samme udfordringer, som computer vision-forskere står overfor:
“Fra computer vision-perspektivet er det virkelig interessant, fordi disse er de samme udfordringer, vi står overfor. Computer vision har forbedret sig så meget over de sidste fem år; for ti år siden ville dette have været noget, man ikke kunne have gjort. Det er et godt maskinlæringsproblem, fordi nøjagtigheden er objektiv her, vi har en mærket træningssæt og vi forstår skriftet ret godt, og det hjælper os. Det er ikke et helt ukendt problem.”
Træningssættet i spørgsmålet er resultatet af at tage tavlerne og oversættelserne fra over 80 års arkæologisk forskning på OI og U Chicago og lave højopløselige annoterede billeder fra dem. For tiden er træningsdataen på ca. 60 terabyte i størrelse. Forskerne kunne bruge datasættet til at skabe en ordbog med over 100.000 enkeltidentificerede tegn, som modellen kunne lære fra. Når den trænede model blev testet på et uset billede, opnåede modellen en nøjagtighed på ca. 80%.
Mens holdet af forskere forsøger at øge modellens nøjagtighed, kan selv 80% nøjagtighed hjælpe i processen med at transkribere. Ifølge Paulus kan modellen bruges til at identificere eller oversætte højt repetitive dele af dokumenterne, så eksperter kan bruge deres tid på at fortolke de mere vanskelige dele af dokumentet. Selv hvis modellen ikke kan sige med sikkerhed, hvad et symbol oversætter til, kan den give forskerne sandsynligheder, hvilket allerede giver dem en fordel.
Holdet har også til hensigt at gøre DeepScribe til et værktøj, som andre arkæologer kan bruge i deres projekter. For eksempel kan modellen blive gen-trænet på andre cuneiform-sprog eller kan modellen give informerede estimater om teksten på beskadigede eller ufuldstændige tavler. En tilstrækkeligt robust model kunne potentielt endda estimere alderen og oprindelsen af tavler eller andre artefakter, noget, der normalt bliver gjort med kemisk testning.
DeepScribe-projektet er finansieret af Centre for the Development of Advanced Computing (CDAC). Computer vision er blevet brugt i andre CDAC-finansierede projekter, som et projekt, der er designet til at genkende stil i kunstværker, og et projekt, der er designet til at kvantificere biodiversitet i marine bivalver. Holdet af forskere håber også, at deres samarbejde vil føre til fremtidige samarbejder mellem Computer Science-afdelingen og OI på University of Chicago.












