AI-modeller og plattformer
Visjonstransformatorer overvinner utfordringer med ny ‘Patch-to-Cluster Attention’-metode
Kunstig intelligens (KI) teknologier, spesielt Visjonstransformatorer (ViTs), har vist stor løfte i deres evne til å identifisere og kategorisere objekter i bilder. Men deres praktiske anvendelse har vært begrenset av to betydelige utfordringer: de høye kravene til beregningskraft og mangelen på gjennomsiktighet i beslutningstakingen. Nå har en gruppe forskere utviklet en gjennombruddsløsning: en ny metode kjent som “Patch-to-Cluster attention” (PaCa). PaCa har som mål å forbedre ViTs’ evner i bildeobjektidentifikasjon, klassifisering og segmentering, samtidig som den løser de langvarige problemene med beregningskrav og beslutningstakingsklarhet.
Å møte utfordringene til ViTs: Et glimt inn i den nye løsningen
Transformatorer, på grunn av deres overlegne evner, er blant de mest innflytelsesrike modellene i KI-verdenen. Kraften til disse modellene har blitt utvidet til visuell data gjennom ViTs, en klasse av transformatorer som er trent med visuelle innputt. Til tross for det enorme potensialet som tilbys av ViTs i tolkning og forståelse av bilder, har de blitt hindret av to større problemer.
Først, på grunn av at bilder inneholder store mengder data, krever ViTs betydelig beregningskraft og minne. Denne kompleksiteten kan være overveldende for mange systemer, spesielt når det gjelder høyoppløselige bilder. For det andre er beslutningstakingsprosessen innen ViTs ofte sammenfiltret og uklar. Brukere finner det vanskelig å forstå hvordan ViTs skille mellom ulike objekter eller egenskaper i et bilde, noe som er avgjørende for mange anvendelser.
Likevel tilbyr den innovative PaCa-metoden en løsning på begge disse utfordringene. “Vi møter utfordringen relatert til beregnings- og minnekrev med å bruke klusteringsteknikker, som tillater transformatorarkitekturen å bedre identifisere og fokusere på objekter i et bilde,” forklarer Tianfu Wu, hovedforfatter av en artikkel om arbeidet og en assosiert professor i elektro- og datateknikk ved North Carolina State University.
Bruk av klusteringsteknikker i PaCa reduserer dramatisk beregningskravene, og gjør problemet fra et kvadratisk prosess til en håndterbar lineær prosess. Wu forklarer prosessen videre, “Ved å klustre, er vi i stand til å gjøre dette til en lineær prosess, hvor hver mindre enhet bare trenger å sammenlignes med et forhåndsbestemt antall kluster.”
Klustering tjener også til å klargjøre beslutningstakingsprosessen i ViTs. Prosessen med å danne kluster avslører hvordan ViT bestemmer hvilke egenskaper som er viktige for å gruppere deler av bilde-data sammen. Ettersom AI bare skaper et begrenset antall kluster, kan brukere enkelt forstå og undersøke beslutningstakingsprosessen, noe som betydelig forbedrer modellens tolkbarhet.
PaCa-metoden overgår andre state-of-the-art ViTs
Gjennom omfattende testing fant forskerne at PaCa-metoden overgår andre ViTs på flere områder. Wu utdyper, “Vi fant at PaCa overgikk SWin og PVT på alle måter.” Testprosessen avslørte at PaCa utmerket seg i klassifisering og identifisering av objekter i bilder og segmentering, og var mer tidseffektiv, utførte oppgaver raskere enn andre ViTs.
Oppmuntret av PaCas suksess, har forskningsteamet som mål å videreutvikle den ved å trene den på større grunnleggende datasamlinger. Ved å gjøre dette, håper de å utvide grensene for hva som i dag er mulig med bildebasert KI.
Forskningsartikkelen “PaCa-ViT: Learning Patch-to-Cluster Attention in Vision Transformers” skal presenteres på den kommende IEEE/CVF-konferansen om datavisjon og mønstergjenkjenning. Det er et viktig milepæl som kan bana vei for mer effektive, gjennomsiktige og tilgjengelige KI-systemer.












