AI-modellen en platforms
Vision Transformers overwinnen uitdagingen met nieuwe ‘Patch-to-Cluster Attention’-methode
Kunstmatige intelligentie (AI)-technologieën, met name Vision Transformers (ViTs), hebben een groot potentieel getoond in hun vermogen om objecten in afbeeldingen te identificeren en categoriseren. Echter, hun praktische toepassing is beperkt door twee significante uitdagingen: de hoge computatie-eisen en het gebrek aan transparantie in besluitvorming. Nu heeft een groep onderzoekers een doorbraakoplossing ontwikkeld: een novate methodologie genaamd “Patch-to-Cluster attention” (PaCa). PaCa heeft als doel de capaciteiten van ViTs te verbeteren in het identificeren, categoriseren en segmenteren van objecten in afbeeldingen, terwijl het tegelijkertijd de langdurige problemen van computatie-eisen en besluitvormingstransparantie oplost.
Uitdagingen van ViTs aanpakken: een blik op de nieuwe oplossing
Transformers, vanwege hun superieure capaciteiten, zijn onder de meest invloedrijke modellen in de AI-wereld. De kracht van deze modellen is uitgebreid naar visuele gegevens via ViTs, een klasse van transformers die zijn getraind met visuele invoer. Ondanks het enorme potentieel dat ViTs bieden in het interpreteren en begrijpen van afbeeldingen, zijn ze teruggedrongen door een paar grote problemen.
Ten eerste vereisen ViTs vanwege de aard van afbeeldingen met grote hoeveelheden gegevens, een aanzienlijke computatiekracht en geheugen. Deze complexiteit kan overweldigend zijn voor veel systemen, vooral bij het verwerken van hoge-resolutieafbeeldingen. Ten tweede is het besluitvormingsproces binnen ViTs vaak verwarrend en ondoorzichtig. Gebruikers vinden het moeilijk om te begrijpen hoe ViTs onderscheid maken tussen verschillende objecten of kenmerken in een afbeelding, wat cruciaal is voor veel toepassingen.
De innovatieve PaCa-methodologie biedt echter een oplossing voor beide uitdagingen. “We lossen het probleem van computatie- en geheugeneisen op door clustering-technieken te gebruiken, waardoor de transformer-architectuur beter in staat is om objecten in een afbeelding te identificeren en te focussen”, legt Tianfu Wu, corresponderend auteur van een paper over het onderzoek en associate professor in Elektrotechniek en Informatica aan de North Carolina State University, uit.
Het gebruik van clustering-technieken in PaCa reduceert de computatie-eisen aanzienlijk, waardoor het probleem van een kwadratisch proces naar een beheersbaar lineair proces wordt omgezet. Wu legt het proces verder uit: “Door clustering zijn we in staat om dit proces lineair te maken, waarbij elke kleinere eenheid alleen hoeft te worden vergeleken met een vooraf bepaald aantal clusters.”
Clustering dient ook om het besluitvormingsproces in ViTs te verduidelijken. Het proces van cluster-vorming onthult hoe de ViT besluit welke kenmerken belangrijk zijn bij het groeperen van secties van de afbeeldingsgegevens. Aangezien de AI alleen een beperkt aantal clusters creëert, kunnen gebruikers gemakkelijk het besluitvormingsproces begrijpen en onderzoeken, waardoor de interpretatie van het model aanzienlijk wordt verbeterd.
PaCa-methodologie overtreft andere state-of-the-art ViTs
Door uitgebreide tests vonden onderzoekers dat de PaCa-methodologie andere ViTs op verschillende fronten overtreft. Wu legt uit: “We vonden dat PaCa SWin en PVT op alle fronten overtrof.” Het testproces onthulde dat PaCa uitblonk in het categoriseren en identificeren van objecten in afbeeldingen en segmenteren, en efficiënt de grenzen van objecten in afbeeldingen aangaf. Bovendien werd vastgesteld dat het meer tijdsefficiënt was, taken sneller uitvoerde dan andere ViTs.
Aangemoedigd door het succes van PaCa, heeft het onderzoeksteam de ontwikkeling van PaCa verder uitgebreid door het te trainen op grotere basisdatasets. Door dit te doen, hopen ze de grenzen van wat momenteel mogelijk is met afbeeldingsgebaseerde AI te verleggen.
Het onderzoeksrapport, “PaCa-ViT: Learning Patch-to-Cluster Attention in Vision Transformers“, zal worden gepresenteerd op de aanstaande IEEE/CVF Conference on Computer Vision and Pattern Recognition. Het is een belangrijke mijlpaal die de weg kan vrijmaken voor meer efficiënte, transparante en toegankelijke AI-systemen.












