AI-modeller och plattformar

DeepScribe AI kan hjälpa till att översätta forntida tabletter

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Forskare från University of Chicagos Oriental Institute och datavetenskapsavdelningen har samarbetat för att designa en AI som kan hjälpa till att avkoda tabletter från forntida civilisationer. Enligt Phys.org heter AI:n DeepScribe och har tränats på över 6 000 annoterade bilder från Persepolis Fortification Archive. När AI-modellen är komplett kommer den att kunna tolka outredda tabletter, vilket gör det lättare att studera forntida dokument.

Experter som studerar forntida dokument, som forskarna som studerar dokument skapade under den akemenidiska dynastin i Persien, måste översätta forntida dokument för hand, vilket är en lång process som är benägen för fel. Forskare har använt datorer för att hjälpa till att tolka forntida dokument sedan 1990-talet, men de datorprogram som användes var av begränsad hjälp. De komplexa kilskriftstecknen, samt de tre dimensionella formerna på tabletterna, satte en gräns för hur användbara datorprogrammen kunde vara.

Datorseendealgoritmer och djupinlärningsarkitektur har öppnat nya möjligheter inom detta område. Sanjay Krishnan, från datavetenskapsavdelningen vid OI, samarbetade med associate professor i assyriologi Susanne Paulus för att lansera DeepScribe-programmet. Forskarna övervakade en databasplattform som kallades OCHRE, som organiserade data från arkeologiska utgrävningar. Målet är att skapa ett AI-verktyg som är både omfattande och flexibelt, och som kan tolka skript från olika geografiska regioner och tidsperioder.

Som Phys.org rapporterade förklarade Krishnan att utmaningarna med att känna igen skript, som arkeologiska forskare står inför, i princip är samma utmaningar som datorseende-forskare står inför:

“Från datorseendets perspektiv är det verkligen intressant eftersom det är samma utmaningar som vi står inför. Datorseende har förbättrats så mycket under de senaste fem åren; för tio år sedan skulle detta ha varit en handvändning, vi skulle inte ha kommit så långt. Det är ett bra maskinlärningsproblem, eftersom noggrannheten är objektiv här, vi har en märkt träningsuppsättning och vi förstår skriptet ganska bra och det hjälper oss. Det är inte ett helt okänt problem.”

Träningsuppsättningen i fråga är resultatet av att ta tabletterna och översättningarna från över 80 års arkeologisk forskning vid OI och U Chicago, och skapa högupplösta annoterade bilder från dem. För närvarande är träningsdata ungefär 60 terabyte stort. Forskarna kunde använda datasetet och skapa en ordbok med över 100 000 individuellt identifierade tecken som modellen kunde lära sig från. När den tränade modellen testades på en osedd bilduppsättning uppnådde modellen ungefär 80 procents noggrannhet.

Medan forskarteamet försöker öka modellens noggrannhet kan även 80 procents noggrannhet hjälpa till i transkriptionsprocessen. Enligt Paulus kan modellen användas för att identifiera eller översätta högt repetitiva delar av dokumenten, och låta experter spendera sin tid på att tolka de svårare delarna av dokumentet. Även om modellen inte kan säga med säkerhet vad ett tecken översätter till, kan den ge forskare sannolikheter, vilket redan sätter dem i en fördelaktig position.

Forskarteamet syftar också till att göra DeepScribe till ett verktyg som andra arkeologer kan använda i sina projekt. Till exempel kan modellen omtränas på andra kilskriftsspråk, eller så kan modellen göra informerade uppskattningar om texten på skadade eller ofullständiga tabletter. En tillräckligt robust modell kan potentiellt till och med uppskatta åldern och ursprunget för tabletter eller andra föremål, vilket vanligtvis görs med kemisk testning.

DeepScribe-projektet finansieras av Centre for the Development of Advanced Computing (CDAC). Datorseende har använts i andra CDAC-finansierade projekt också, som ett projekt som syftar till att känna igen stil i konstverk och ett projekt som är utformat för att kvantifiera biologisk mångfald i marina bivalver. Forskarteamet hoppas också att deras samarbete kommer att leda till framtida samarbeten mellan datavetenskapsavdelningen och OI vid University of Chicago, samt andra projekt som DeepScribe-projektet, som ett projekt som syftar till att känna igen stil i konstverk och ett projekt som är utformat för att kvantifiera biologisk mångfald i marina bivalver.

Blogger och programmerare med specialområden inom Machine Learning och Deep Learning ämnen. Daniel hoppas på att hjälpa andra att använda kraften från AI för socialt väl.