Modele i platformy AI
Model AI może poprawić rozdzielczość mgłych obrazów nawet o 60 razy
Naukowcy z Uniwersytetu Duke opracowali model AI, który potrafi pobierać bardzo mgłe, pikselowane obrazy i renderować je z wysokim szczegółem. Według TechXplore, model jest w stanie pobierać stosunkowo niewiele pikseli i skalować obrazy, aby utworzyć realistycznie wyglądające twarze, które są około 64 razy większe niż oryginalny obraz. Model “halucynuje” lub wyobraża sobie cechy, które są pomiędzy liniami oryginalnego obrazu.
Badania te są przykładem super-rozdzielczości. Jak wyjaśniła Cynthia Rudin z zespołu informatycznego Uniwersytetu Duke w rozmowie z TechXplore, ten projekt badań ustanawia rekord w super-rozdzielczości, ponieważ nigdy wcześniej nie tworzono obrazów o takim poziomie szczegółowości z tak małej liczby pikseli. Naukowcy starali się podkreślić, że model nie odtwarza twarzy osoby z oryginalnego, niskiej jakości obrazu. Zamiast tego generuje nowe twarze, wypełniając szczegóły, które wcześniej nie istniały. Dlatego model nie mógłby być wykorzystany do celów takich jak systemy bezpieczeństwa, ponieważ nie byłby w stanie przekształcić rozmytych obrazów w obrazy prawdziwej osoby.
Tradycyjne techniki super-rozdzielczości działają, podejmując próby odgadnięcia, które piksele są potrzebne, aby przekształcić obraz w obraz o wysokiej rozdzielczości, na podstawie obrazów, które model wcześniej nauczył się rozpoznawać. Ponieważ dodane piksele są wynikiem prób odgadnięcia, nie wszystkie piksele będą pasowały do otaczających pikseli, a pewne obszary obrazu mogą wyglądać mgliście lub zniekształcone. Naukowcy z Uniwersytetu Duke wykorzystali inny sposób szkolenia swojego modelu AI. Model stworzony przez naukowców z Duke działa, pobierając najpierw obrazy o niskiej rozdzielczości i dodając szczegóły do obrazu w czasie, odwołując się do wysokiej jakości, wygenerowanych przez AI twarzy jako przykładów. Model odnosi się do wygenerowanych przez AI twarzy i próbuje znaleźć takie, które przypominają cele obrazu, gdy wygenerowane twarze są skalowane do rozmiaru celu.
Zespół badawczy stworzył model Generative Adversarial Network (GAN), aby zajmować się tworzeniem nowych obrazów. GAN to tak naprawdę dwie sieci neuronowe, które są szkolone na tym samym zbiorze danych i rywalizują ze sobą. Jedna sieć jest odpowiedzialna za generowanie fałszywych obrazów, które naśladują prawdziwe obrazy w zbiorze danych szkoleniowych, podczas gdy druga sieć jest odpowiedzialna za wykrywanie fałszywych obrazów spośród prawdziwych. Pierwsza sieć jest powiadamiana, gdy jej obrazy zostaną zidentyfikowane jako fałszywe, i ulepsza się, aż fałszywe obrazy będą nadal nie do odróżnienia od prawdziwych.
Naukowcy nazwali swój model super-rozdzielczości PULSE, a model konsekwentnie wytwarza obrazy wysokiej jakości, nawet jeśli otrzyma obrazy tak mgłe, że inne metody super-rozdzielczości nie mogą wytworzyć z nich obrazów wysokiej jakości. Model jest nawet w stanie tworzyć realistycznie wyglądające twarze z obrazów, na których cechy twarzy są prawie niewidoczne. Na przykład, gdy otrzyma obraz twarzy o rozdzielczości 16×16, może utworzyć obraz 1024 x 1024. Ponad milion pikseli jest dodawanych podczas tego procesu, wypełniając szczegóły takie jak pasma włosów, zmarszczki i nawet oświetlenie. Gdy naukowcy poprosili ludzi o ocenę 1440 obrazów wygenerowanych przez PULSE w porównaniu z obrazami wygenerowanymi przez inne metody super-rozdzielczości, obrazy wygenerowane przez PULSE uzyskały najwyższe oceny.
Pomimo że naukowcy wykorzystali swój model na obrazach twarzy ludzi, te same techniki, które zastosowali, mogą być stosowane praktycznie do dowolnego obiektu. Obrazy o niskiej rozdzielczości różnych obiektów mogą być wykorzystane do tworzenia obrazów o wysokiej rozdzielczości tych obiektów, otwierając możliwości zastosowań w różnych branżach i dziedzinach, od mikroskopii, obrazowania satelitarnego, edukacji, produkcji i medycyny.












