Modele i platformy AI

Transformery Wizji Pokonują Wyzwania za Pomocą Nowej Metody “Patch-to-Cluster Attention”

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Sztuczne inteligencje (AI), w szczególności Transformery Wizji (ViTs), wykazały ogromny potencjał w identyfikowaniu i klasyfikowaniu obiektów na obrazach. Jednakże, ich praktyczne zastosowanie było ograniczone przez dwa znaczące wyzwania: wysokie wymagania obliczeniowe i brak przejrzystości w podejmowaniu decyzji. Teraz, grupa badaczy opracowała przełomowe rozwiązanie: nową metodę zwaną “Patch-to-Cluster attention” (PaCa). PaCa ma na celu poprawienie możliwości ViTs w identyfikowaniu, klasyfikowaniu i segmencie obiektów na obrazach, a jednocześnie rozwiązać długoletnie problemy z wymaganiami obliczeniowymi i klarownością decyzji.

Rozwiązywanie Wyzwań ViTs: Spojrzenie na Nowe Rozwiązanie

Transformery, dzięki swoim wyjątkowym możliwościom, są jednymi z najbardziej wpływowych modeli w świecie AI. Możliwości tych modeli zostały rozszerzone na dane wizualne za pomocą ViTs, klasy transformerów szkolonych z danymi wizualnymi. Pomimo ogromnego potencjału oferowanego przez ViTs w interpretowaniu i rozumieniu obrazów, zostały one zahamowane przez dwa główne problemy.

Po pierwsze, ze względu na naturę obrazów zawierających ogromne ilości danych, ViTs wymagają znacznej mocy obliczeniowej i pamięci. Ta złożoność może być przytłaczająca dla wielu systemów, szczególnie podczas radzenia sobie z obrazami o wysokiej rozdzielczości. Po drugie, proces podejmowania decyzji w ViTs jest często skomplikowany i nieprzejrzysty. Użytkownicy mają trudności z zrozumieniem, jak ViTs różnicują między różnymi obiektami lub cechami na obrazie, co jest kluczowe dla wielu aplikacji.

Jednakże, innowacyjna metoda PaCa oferuje rozwiązanie obu tych wyzwań. “Rozwiązujemy wyzwanie związane z wymaganiami obliczeniowymi i pamięciowymi, używając technik klasterowania, które pozwalają architekturze transformera lepiej identyfikować i koncentrować się na obiektach na obrazie”, wyjaśnia Tianfu Wu, autor pracy i profesor nadzwyczajny inżynierii elektrycznej i komputerowej na Uniwersytecie Stanu Karolina Północna.

Użycie technik klasterowania w PaCa drastycznie redukuje wymagania obliczeniowe, zmieniając problem z procesu kwadratowego w proces liniowy. Wu wyjaśnia dalej proces, “Poprzez klasterowanie, jesteśmy w stanie uczynić ten proces liniowym, gdzie każda mniejsza jednostka musi być porównana tylko z określoną liczbą klastrów”.

Klasterowanie służy również do wyjaśnienia procesu podejmowania decyzji w ViTs. Proces tworzenia klastrów ujawnia, jak ViT decyduje, które cechy są ważne w grupowaniu sekcji danych obrazu. Ponieważ AI tworzy tylko ograniczoną liczbę klastrów, użytkownicy mogą łatwo zrozumieć i zbadać proces podejmowania decyzji, znacznie poprawiając interpretowalność modelu.

Metoda PaCa Przewyższa Inne Najnowocześniejsze ViTs

Przez kompleksowe testy, badacze stwierdzili, że metoda PaCa przewyższa inne ViTs na kilku polach. Wu wyjaśnia, “Stwierdziliśmy, że PaCa przewyższa SWin i PVT we wszystkich aspektach”. Proces testowania ujawnił, że PaCa wyróżnia się w klasyfikowaniu i identyfikowaniu obiektów na obrazach oraz w segmencie, efektywnie zaznaczając granice obiektów na obrazach. Ponadto okazało się, że jest bardziej efektywne czasowo, wykonując zadania szybciej niż inne ViTs.

Zachęceni sukcesem PaCa, zespół badawczy planuje dalszy rozwój, szkoląc go na większych zbiorach danych podstawowych. Dzięki temu, mają nadzieję poszerzyć granice tego, co jest obecnie możliwe z AI opartej na obrazach.

Artykuł “PaCa-ViT: Nauka Patch-to-Cluster Attention w Vision Transformers” zostanie przedstawiony na nadchodzącej konferencji IEEE/CVF Computer Vision and Pattern Recognition. Jest to ważny kamień milowy, który może otworzyć drogę do bardziej efektywnych, przejrzystych i dostępnych systemów AI.

Alex McFarland jest dziennikarzem i pisarzem zajmującym się sztuczną inteligencją, który bada najnowsze rozwoje w dziedzinie sztucznej inteligencji. Współpracował z licznymi startupami i wydawnictwami związanymi z sztuczną inteligencją na całym świecie.