Modely a platformy AI
Transforméry vidění překonávají výzvy díky nové metodě “Patch-to-Cluster Attention”
Umělé inteligence (AI) technologie, zejména Transforméry vidění (ViTs), ukázaly obrovský potenciál ve své schopnosti identifikovat a kategorizovat objekty v obrazech. Nicméně, jejich praktické použití bylo omezeno dvěma významnými výzvami: vysokými požadavky na výpočetní výkon a nedostatkem transparentnosti v rozhodování. Nyní, skupina výzkumníků vyvinula průlomové řešení: novou metodologii nazvanou “Patch-to-Cluster pozornost” (PaCa). PaCa má za cíl zlepšit schopnosti ViTs v identifikaci objektů, klasifikaci a segmentaci obrazů, zatímco současně řeší dlouholeté problémy s výpočetními nároky a transparentností rozhodování.
Řešení výzev ViTs: Pohled na nové řešení
Transforméry, díky svým výjimečným schopnostem, jsou mezi nejvlivnějšími modely v světě AI. Síla těchto modelů byla rozšířena na vizuální data prostřednictvím ViTs, třídy transformérů, které jsou trénovány na vizuálních vstupních datech. Navzdory enormnímu potenciálu, který ViTs nabízejí při interpretaci a porozumění obrazům, byly omezovány dvěma hlavními problémy.
Prvním problémem je, že kvůli povaze obrazů, které obsahují obrovské množství dat, ViTs vyžadují podstatný výpočetní výkon a paměť. Tato složitost může být přehlcující pro mnoho systémů, zejména při zpracování obrazů s vysokým rozlišením. Druhým problémem je, že proces rozhodování uvnitř ViTs je často zmatený a neprůhledný. Uživatelé mají obtížné pochopit, jak ViTs rozlišují mezi různými objekty nebo rysy v obraze, což je zásadní pro mnoho aplikací.
Nicméně, inovativní metodologie PaCa nabízí řešení obou těchto problémů. “Řešíme výzvu související s výpočetními a paměťovými nároky pomocí technik clusterizace, které umožňují transformátorové architektuře lépe identifikovat a zaměřit se na objekty v obraze,” vysvětluje Tianfu Wu, hlavní autor článku o této práci a docent elektrotechniky a počítačového inženýrství na Severokarolínské státní univerzitě.
Použití technik clusterizace v PaCa dramaticky snižuje výpočetní nároky, mění problém z kvadratického procesu na zvládnutelný lineární proces. Wu dále vysvětluje proces, “Clusterizací jsme schopni tento proces změnit na lineární, kde každá menší jednotka potřebuje být porovnávána pouze s předem stanoveným počtem clusterů.”
Clusterizace také slouží ke zjasnění procesu rozhodování u ViTs. Proces vytváření clusterů odhaluje, jak ViT rozhoduje, které rysy jsou důležité pro seskupování částí obrazových dat. Protože AI vytváří pouze omezený počet clusterů, uživatelé mohou snadno pochopit a prozkoumat proces rozhodování, což významně zlepšuje interpretovatelnost modelu.
Metodologie PaCa překonává ostatní state-of-the-art ViTs
Prostřednictvím komplexního testování, výzkumníci zjistili, že metodologie PaCa překonává ostatní ViTs v několika ohledech. Wu vysvětluje, “Zjistili jsme, že PaCa překonala SWin a PVT ve všech ohledech.” Testovací proces ukázal, že PaCa vyniká v klasifikaci a identifikaci objektů v obrazech a segmentaci, efektivně vymezuje hranice objektů v obrazech. Kromě toho, bylo zjištěno, že je časově efektivnější, plní úkoly rychleji než ostatní ViTs.
Povzbuzeni úspěchem PaCa, výzkumný tým se snaží dále rozvíjet tuto technologii, trénující ji na větších základních datech. Cílem je posunout hranice toho, co je目前 možné s obrazovými AI.
Výzkumná práce, “PaCa-ViT: Učení Patch-to-Cluster pozornosti v Transformérech vidění,” bude prezentována na nadcházející IEEE/CVF Konferenci o počítačovém vidění a rozpoznávání vzorů. Je to důležitý milník, který by mohl otevřít cestu k více efektivním, transparentním a přístupným AI systémům.












