Modele i platformy AI
DeepScribe AI może pomóc w tłumaczeniu starożytnych tablic
Badacze z Oriental Institute i Wydziału Informatyki Uniwersytetu Chicagowskiego współpracowali przy projekcie opracowania sztucznej inteligencji, która może pomóc w odczytaniu tablic z cywilizacji starożytnych. Według Phys.org, sztuczna inteligencja nosi nazwę DeepScribe i została opracowana na podstawie ponad 6 000 opatrzonych adnotacjami obrazów z Archiwum Fortyfikacji Persepolis. Gdy model sztucznej inteligencji zostanie ukończony, będzie w stanie interpretować niewykwalifikowane tablice, co ułatwi badanie starożytnych dokumentów.
Eksperci, którzy badają starożytne dokumenty, jak na przykład badacze, którzy studiują dokumenty stworzone podczas imperium Achemenidów w Persji, muszą tłumaczyć starożytne dokumenty ręcznie, co jest długim procesem podatnym na błędy. Badacze od lat 90. używali komputerów do pomocy w interpretowaniu starożytnych dokumentów, ale programy komputerowe, które były używane, były ograniczone. Złożone znaki klinowe, a także trójwymiarowy kształt tablic, ograniczały użyteczność programów komputerowych.
Algoritmy widzenia komputerowego i architektury głębokiego uczenia się przyniosły nowe możliwości w tej dziedzinie. Sanjay Krishnan z Wydziału Informatyki w OI współpracował z associate profesorem asyriologii Susanne Paulus, aby uruchomić program DeepScribe. Badacze nadzorowali platformę zarządzania danymi o nazwie OCHRE, która organizowała dane z wykopalisk archeologicznych. Celem jest stworzenie narzędzia sztucznej inteligencji, które będzie zarówno obszernym, jak i elastycznym, w stanie interpretować pisma z różnych regionów geograficznych i okresów czasowych.
Jak donosi Phys.org, Krishnan wyjaśnił, że wyzwania związane z rozpoznawaniem pisma, które badacze archeologiczni napotykają, są podstawowo takie same, jak te, które napotykają badacze widzenia komputerowego:
“Z perspektywy widzenia komputerowego jest to naprawdę interesujące, ponieważ są to te same wyzwania, których doświadczamy. Widzenie komputerowe w ciągu ostatnich pięciu lat znacznie się poprawiło; dziesięć lat temu byłoby to niewykonalne, nie doszlibyśmy tak daleko. To jest dobry problem uczenia maszynowego, ponieważ dokładność jest obiektywna, mamy oznaczony zestaw treningowy i rozumiemy pismo dość dobrze, co nam pomaga. To nie jest zupełnie nieznany problem.”
Treningowy zestaw wynika z faktu, że tablice i tłumaczenia z ponad 80 lat badań archeologicznych w OI i U Chicago zostały przekształcone w wysokiej rozdzielczości obrazy z adnotacjami. Obecnie zestaw treningowy ma rozmiar około 60 terabajtów. Badacze byli w stanie wykorzystać zestaw danych i stworzyć słownik ponad 100 000 indywidualnie zidentyfikowanych znaków, które model mógłby nauczyć się rozpoznawać. Gdy przeszkolony model został przetestowany na nieznanym zestawie obrazów, model osiągnął dokładność około 80%.
Pomimo że zespół badaczy stara się zwiększyć dokładność modelu, nawet 80% dokładności może pomóc w procesie transkrypcji. Według Paulus, model mógłby być wykorzystany do identyfikacji lub tłumaczenia bardzo powtarzalnych części dokumentów, pozwalając ekspertom poświęcić czas na interpretację trudniejszych części dokumentu. Nawet jeśli model nie może z całą pewnością określić, co dany symbol oznacza, może podać badaczom prawdopodobieństwa, co już daje im przewagę.
Zespół stara się również uczynić DeepScribe narzędziem, które inne archeolodzy będą mogli wykorzystać w swoich projektach. Na przykład, model mógłby być przeszkolony na innych językach klinowych, lub model mógłby dokonywać świadomych szacunków dotyczących tekstu na uszkodzonych lub niekompletnych tablicach. Bardzo wytrzymały model mógłby nawet oszacować wiek i pochodzenie tablic lub innych artefaktów, co zwykle jest robione za pomocą testów chemicznych.
Projekt DeepScribe jest finansowany przez Centrum Rozwoju Zaawansowanej Informatyki (CDAC). Widzenie komputerowe zostało wykorzystane w innych projektach finansowanych przez CDAC, takich jak projekt mający na celu rozpoznanie stylu w dziełach sztuki i projekt zaprojektowany w celu ilościowego określenia różnorodności biologicznej w mięczakach morskich. Zespół badaczy również liczy, że ich współpraca doprowadzi do przyszłych współprac pomiędzy Wydziałem Informatyki i OI na Uniwersytecie Chicagowskim.












