Andersons vinkel

Bedre maskinlæringspræstation gennem CNN-baseret billedgeninding

mm
Føj Unite.AI til dine foretrukne kilder på Google

Google Research har foreslået en ny metode til at forbedre effektiviteten og nøjagtigheden af billedbaserede computer vision-træningsworkflows ved at forbedre måden, hvorpå billederne i en datasaet bliver formindsket på forarbejdningstrinnet.

I artiklen Lær at ændre billedstørrelse til computer vision-opgaver bruger forskerne Hossein Talebi og Peyman Milanfar en CNN til at oprette en ny hybrid billedformindskningsarkitektur, der resulterer i en bemærkelsesværdig forbedring af genkendelsesresultaterne på fire populære computer vision-datasæt.

Den foreslåede fælles ramme for genkendelse og formindskning. Kilde: https://arxiv.org/pdf/2103.09950.pdf

Den foreslåede fælles ramme for genkendelse og formindskning. Kilde: https://arxiv.org/pdf/2103.09950.pdf

Artiklen påpeger, at de reskalering/formindskningsmetoder, der i øjeblikket bruges i automatiserede maskinlæringspipelines, er årtier gamle og ofte kun bruger grundlæggende bilineær, bikubisk og nærmeste nabo formindskning – metoder, der behandler alle pixel uden diskrimination.

Til gengæld forbedrer den foreslåede metode billeddata via en CNN og inkorporerer denne input i de formindskede billeder, der til sidst vil gå gennem modellens arkitektur.

Billedbegrænsninger i AI-træning

For at træne en model, der håndterer billeder, vil en maskinlæringsramme inkludere en forarbejdningstrin, hvor en forskelligartet samling af billeder i forskellige størrelser, farverum og opløsninger (der vil bidrage til træningsdatasættet) systematisk beskæres og formindskes til konsistente dimensioner og en stabil, enkelt format.

Generelt vil dette involvere en kompromis omkring PNG-formatet, hvor en afvejning mellem behandlingstid/ressourcer, filstørrelse og billedkvalitet vil blive etableret.

I de fleste tilfælde er de endelige dimensioner af det behandlede billede meget små. Herunder ser vi et eksempel på 80×80 opløsning, som nogle af de tidligste deepfakes-datasæt var genereret:

Dette er 80x80 opløsningen, som nogle af de tidligste deepfakes-datasæt var genereret.

Da ansigter (og andre mulige emner) sjældent passer ind i den krævede kvadratisk forhold, kan sorte bjælker være nødvendige (eller spild af plads tilladt) for at homogenisere billederne, hvilket yderligere reducerer den faktiske brugbare billeddata:

Her er ansigtet blevet udtrukket fra en større billedområde, indtil det er beskåret så økonomisk som muligt for at inkludere hele ansigtsområdet. Men som vist til højre, vil en stor del af den resterende område ikke blive brugt under træning, hvilket tilføjer større vægt til billedkvaliteten af de formindskede data.

Her er ansigtet blevet udtrukket fra en større billedområde, indtil det er beskåret så økonomisk som muligt for at inkludere hele ansigtsområdet. Men som vist til højre, vil en stor del af den resterende område ikke blive brugt under træning, hvilket tilføjer større vægt til billedkvaliteten af de formindskede data.

Da GPU-kapaciteterne har forbedret sig i de seneste år, med den nye generation af NVIDIA-kort udstyret med øgede mængder af video-RAM (VRAM), er gennemsnitsbidragende billedstørrelser begyndt at øge, selvom 224×224 pixel stadig er ret standard (for eksempel er det størrelsen på ResNet-50-datasættet).

Et ubeskaaret billede på 224x244 pixel.

Et ubeskaaret billede på 224×244 pixel.

At få batches til at passe ind i VRAM

Grunden til, at billederne skal være af samme størrelse, er, at gradient descent, metoden, hvormed modellen forbedrer sig over tid, kræver ensartet træningsdata.

Grunden til, at billederne skal være så små, er, at de skal indlæses (fuldt dekomprimeret) i VRAM under træning i små batches, normalt mellem 6-24 billeder pr. batch. For få billeder pr. batch, og der er ikke nok gruppe materiale til at generalisere godt, samt forlænge træningstiden; for mange, og modellen kan ikke opnå nødvendige karakteristika og detaljer (se nedenfor).

Dette ‘live loading’-afsnit af træningsarkitekturen kaldes latent rum. Dette er, hvor funktioner gentagne gange udtrækkes fra samme data (dvs. samme billeder) indtil modellen er konvergeret til en tilstand, hvor den har alle de generaliserede kundskaber, den behøver for at udføre transformationer på senere, usete data af samme type.

Dette proces tager normalt dage, selvom det kan tage en måned eller mere af konstant og uafbrudt højvolumen 24/7 kognition for at opnå nyttig generalisering. Øgninger i VRAM-størrelse er kun nyttige op til et punkt, da selv mindre øgninger i billedopløsning kan have en orden-af-magnitude-effekt på behandlingskapacitet og relaterede effekter på nøjagtighed, der ikke altid er favorable.

At bruge større VRAM-kapacitet til at rumme større batch-størrelser er også en blandet velsignelse, da de større træningshastigheder, der opnås ved dette, sandsynligvis vil blive kompenseret af mindre præcise resultater.

Derfor, da træningsarkitekturen er så begrænset, er alt, der kan medføre en forbedring inden for de eksisterende begrænsninger i pipelinen, en bemærkelsesværdig præstation.

Hvordan overlegen formindskning hjælper

Den ultimative kvalitet af et billede, der skal inkluderes i et træningsdatasæt, er blevet bevist at have en forbedrende effekt på træningens udfald, især i objektgenkendelsesopgaver. I 2018 påpegede forskere fra Max Planck Institute for Intelligent Systems at valget af resampling-metode mærkbart påvirker træningspræstation og udfald.

Desuden har tidligere arbejde fra Google (co-forfattet af artiklens forfattere) fundet, at klassifikationsnøjagtighed kan forbedres ved at opretholde kontrol over kompressionsarter i datasætbilleder.

CNN-arkitekturen for den foreslåede formindskningsalgoritme fra Google Research.

CNN-arkitekturen for den foreslåede formindskningsalgoritme fra Google Research.

CNN-modellen, der er bygget ind i den nye resampler, kombinerer bilineær formindskning med en ‘skip connection’-funktion, der kan inkorporere output fra det trænede netværk i det formindskede billede.

Til forskel fra en typisk encoder/decoder-arkitektur kan den nye forslag både fungere som en feed-forward-bottleneck og som en inverse bottleneck til opskalering til enhver mål-størrelse og/eller aspektforhold. Desuden kan den ‘standard’-resampling-metode udskiftes med enhver anden egnet traditionel metode, såsom Lanczos.

Højfrekvensdetaljer

Den nye metode producerer billeder, der i virkeligheden synes at ‘bage’ nøglefunktioner (der til sidst vil blive genkendt under træningen) direkte ind i kildebilledet. Æstetisk set er resultaterne usædvanlige:

Den nye metode anvendt på fire netværk – Inception V2; DenseNet-121; ResNet-50; og MobileNet-V2. Resultaterne af den foreslåede formindsknings-/ændringsmetode fra Google Research producerer billeder med åbenlyse pixel-aggregering, der forudser de nøglefunktioner, der vil blive opfanget under træningen.

Den nye metode anvendt på fire netværk – Inception V2; DenseNet-121; ResNet-50; og MobileNet-V2. Resultaterne af den foreslåede formindsknings-/ændringsmetode fra Google Research producerer billeder med åbenlyse pixel-aggregering, der forudser de nøglefunktioner, der vil blive opfanget under træningen.

Forskerne påpeger, at disse initielle eksperimenter er eksklusivt optimeret til billedgenkendelsesopgaver, og at deres CNN-drevne ‘lærte formindsker’ i tests kunne opnå forbedrede fejlratninger i disse opgaver. Forskerne har til hensigt at anvende metoden til andre typer billedbaserede computer vision-anvendelser i fremtiden.

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai