AI-modeller och plattformar
Vision Transformers övervinner utmaningar med ny “Patch-to-Cluster Attention”-metod
Artificiell intelligens (AI) teknologier, särskilt Vision Transformers (ViTs), har visat stor potential i sin förmåga att identifiera och kategorisera objekt i bilder. Men deras praktiska tillämpning har begränsats av två betydande utmaningar: de höga kraven på beräkningskraft och bristen på transparens i beslutsfattandet. Nu har en grupp forskare utvecklat en banbrytande lösning: en ny metod kallad “Patch-to-Cluster attention” (PaCa). PaCa syftar till att förbättra ViTs förmåga att identifiera, klassificera och segmentera objekt i bilder, samtidigt som den löser de långvariga problemen med beräkningskrav och beslutsfattandeklarhet.
Att hantera utmaningarna för ViTs: En glimt av den nya lösningen
Transformatorer, tack vare sin överlägsna förmåga, är bland de mest inflytelserika modellerna i AI-världen. Dessa modellers kraft har utvidgats till visuella data genom ViTs, en klass av transformatorer som tränas med visuella indata. Trots den enorma potential som ViTs erbjuder för att tolka och förstå bilder, har de hållits tillbaka av ett par stora problem.
För det första kräver ViTs, på grund av att bilder innehåller stora mängder data, betydande beräkningskraft och minne. Denna komplexitet kan vara överväldigande för många system, särskilt när det gäller att hantera högupplösta bilder. För det andra är beslutsfattandeprocessen inom ViTs ofta förvirrad och ogenomskinlig. Användare har svårt att förstå hur ViTs skiljer på olika objekt eller funktioner i en bild, vilket är avgörande för många tillämpningar.
Men den innovativa PaCa-metoden erbjuder en lösning på båda dessa utmaningar. “Vi hanterar utmaningen relaterad till beräknings- och minneskrav genom att använda klusteringsmetoder, som gör att transformatorarkitekturen bättre kan identifiera och fokusera på objekt i en bild”, förklarar Tianfu Wu, huvudförfattare till en artikel om arbetet och biträdande professor i elektroteknik och datateknik vid North Carolina State University.
Användningen av klusteringsmetoder i PaCa minskar dramatiskt de beräkningsmässiga kraven, vilket förvandlar problemet från en kvadratisk process till en hanterbar linjär process. Wu förklarar processen vidare, “Genom att klustra kan vi göra denna process linjär, där varje mindre enhet endast behöver jämföras med ett förutbestämt antal kluster”.
Klusteringsmetoden i PaCa tjänar också till att förtydliga beslutsfattandeprocessen i ViTs. Processen att bilda kluster avslöjar hur ViT bestämmer vilka funktioner som är viktiga för att gruppera sektioner av bilddata tillsammans. Eftersom AI skapar endast ett begränsat antal kluster kan användare enkelt förstå och undersöka beslutsfattandeprocessen, vilket avsevärt förbättrar modellens tolkbarhet.
PaCa-metoden överträffar andra state-of-the-art ViTs
Genom omfattande tester fann forskarna att PaCa-metoden överträffar andra ViTs på flera punkter. Wu förklarar, “Vi fann att PaCa överträffade SWin och PVT på alla sätt”. Testprocessen visade att PaCa utmärkte sig i klassificering och identifiering av objekt i bilder samt segmentering, och kunde effektivt avgränsa objektsgränser i bilder. Dessutom visade det sig vara mer tids-effektivt och kunde utföra uppgifter snabbare än andra ViTs.
Uppmuntrade av PaCas framgång syftar forskargruppen till att ytterligare utveckla metoden genom att träna den på större grundläggande datamängder. Genom att göra detta hoppas de kunna utöka gränserna för vad som för närvarande är möjligt med bildbaserad AI.
Forskningsartikeln “PaCa-ViT: Learning Patch-to-Cluster Attention in Vision Transformers” kommer att presenteras vid den kommande IEEE/CVF Conference on Computer Vision and Pattern Recognition. Det är en viktig milstolpe som kan bana väg för mer effektiva, transparenta och tillgängliga AI-system.












