AI-modeller og platforme

Udnyttelse af menneskelig opmærksomhed kan forbedre AI-genererede billeder

mm
Føj Unite.AI til dine foretrukne kilder på Google
An AI-generated image by ChatGPT. Prompt: ' a panoramic image representing salient object detection, featuring a person. The salient heat-map should be clear and obvious, and this illustration should be in the style of results from scientific papers about saliency maps'

Nyt forskning fra Kina har foreslået en metode til at forbedre kvaliteten af billeder genereret af Latent Diffusion Models (LDM) som Stable Diffusion.

Metoden fokuserer på at optimere de saliente regioner af et billede – områder, der er mest sandsynlige at tiltrække menneskelig opmærksomhed.

Den nye forskning har fundet, at saliency-kort (fjerde kolonne fra venstre) kan bruges som et filter eller 'maske' til at styre fokus på støjprocesser mod områder af billedet, som mennesker er mest sandsynlige at opmærksomme sig på. Kilde: https://arxiv.org/pdf/2410.10257

Den nye forskning har fundet, at saliency-kort (fjerde kolonne fra venstre) kan bruges som et filter eller ‘maske’ til at styre fokus på støjprocesser mod områder af billedet, som mennesker er mest sandsynlige at opmærksomme sig på. Kilde: https://arxiv.org/pdf/2410.10257

Traditionelle metoder optimerer hele billedet ensartet, mens den nye tilgang udnytter en saliency-detektor til at identificere og prioritere mere ‘vigtige’ områder, som mennesker gør.

I kvantitative og kvalitative tests var forskernes metode i stand til at overgå tidligere diffusion-baserede modeller, både i billedkvalitet og trofasthed til tekstprompt.

Den nye metode scorede også bedst i en menneskelig perceptionstest med 100 deltagere.

Naturlig Selektion

Saliency, evnen til at prioritere information i den virkelige verden og i billeder, er en essentiel del af menneskelig syn.

Et simpelt eksempel på dette er den øgede opmærksomhed på detaljer, som klassisk kunst tildeler vigtige områder af et maleri, såsom ansigtet i et portræt, eller masterne på et skib i et søbaseret motiv; i sådanne eksempler konvergerer kunstnerens opmærksomhed på det centrale motiv, hvilket betyder, at brede detaljer såsom en portrætbaggrund eller fjerne bølger i en storm er mere skitserede og repræsentative end detaljerede.

Informerede af menneskelige studier er maskinlæringsmetoder opstået over de sidste ti år, som kan replikere eller i det mindste approksimere denne menneskelige fokus på interessepunkter i et billede.

Objekt-segmentering (semantisk segmentering) kan være en hjælp til at individuere aspekter af et billede og udvikle tilsvarende saliency-kort. Kilde: https://arxiv.org/pdf/1312.6034

Objekt-segmentering (semantisk segmentering) kan være en hjælp til at individuere aspekter af et billede og udvikle tilsvarende saliency-kort. Kilde: https://arxiv.org/pdf/1312.6034

I forskningslitteraturen har den mest populære saliency-kort-detektor over de sidste fem år været 2016 Gradient-weighted Class Activation Mapping (Grad-CAM) initiativ, som senere udviklede sig til den forbedrede Grad-CAM++ system, blandt andre variationer og forbedringer.

Grad-CAM bruger gradient-aktivering af en semantisk token (såsom ‘hund’ eller ‘kat’) til at producere et visuelt kort over, hvor konceptet eller notationen synes sandsynligt at være repræsenteret i billedet.

Eksempler fra den originale Grad-CAM-papir. I den anden kolonne individuerer guided backpropagation alle bidragende funktioner. I den tredje kolonne tegnes semantiske kort for de to koncepter 'hund' og 'kat'. Den fjerde kolonne repræsenterer konkatinationen af de to foregående inferencer. Den femte, den occlusion (maskning) kort, der svarer til inferencen; og endelig, i den sjette kolonne, visualiserer Grad-CAM en ResNet-18 lag. Kilde: https://arxiv.org/pdf/1610.02391

Eksempler fra den originale Grad-CAM-papir. I den anden kolonne individuerer guided backpropagation alle bidragende funktioner. I den tredje kolonne tegnes semantiske kort for de to koncepter ‘hund’ og ‘kat’. Den fjerde kolonne repræsenterer konkatinationen af de to foregående inferencer. Den femte, den occlusion (maskning) kort, der svarer til inferencen; og endelig, i den sjette kolonne, visualiserer Grad-CAM en ResNet-18 lag. Kilde: https://arxiv.org/pdf/1610.02391

Menneskelige undersøgelser af resultaterne fra disse metoder har afsløret en korrelation mellem disse matematiske individuationer af nøgleinteressepunkter i et billede og menneskelig opmærksomhed (når man scannrer billedet).

SGOOL

Den nye papir overvejer, hvad saliency kan bringe til tekst-til-billede (og potentiel tekst-til-video) systemer såsom Stable Diffusion og Flux.

Når man fortolker en brugers tekst-prompt, udforsker Latent Diffusion Models deres trænede latent rum for lært visuelle koncepter, der svarer med ordene eller fraserne, der bruges. De parses derefter disse fundne datapunkter gennem en støjprocess, hvor tilfældig støj langsomt udvikles til en kreativ fortolkning af brugerens tekst-prompt.

På dette punkt giver modellen dog ligelig opmærksomhed til hver enkelt del af billedet. Siden populariseringen af diffusion-modeller i 2022, med lanceringen af OpenAI’s tilgængelige Dall-E billedgenereringer, og den efterfølgende open-sourcing af Stability.ai’s Stable Diffusion-ramme, har brugere fundet, at ‘essentielle’ sektioner af et billede ofte er underbetjent.

Da et typisk portræt af et menneske sandsynligvis kun vil have ansigtet (som er af maksimal vigtighed for betragteren) beskæftige sig med ikke mere end 10-35% af det totale billede, fungerer denne demokratiske metode til opmærksomhedsfordeling imod både menneskelig perception og kunst- og fotografihistorie.

Når knapperne på en persons jeans modtager samme beregningskraft som deres øjne, kan ressourceallokeringen siges at være non-optimal.

Derfor foreslår forfatterne en ny metode, kaldet Saliency Guided Optimization of Diffusion Latents (SGOOL), som bruger en saliency-mapper til at øge opmærksomhed på forsumpede områder af et billede, og bruger færre ressourcer på sektioner, der sandsynligvis vil forblive i periferien af betragterens opmærksomhed.

Metode

SGOOL-pipelines inkluderer billedgenerering, saliency-mapping og optimering, med det samlede billede og saliency-raffineret billede behandlet sammen.

Konceptuel schema for SGOOL.

Konceptuel schema for SGOOL.

Diffusion-modellens latente indlejring er optimeret direkte med fine-tuning, og fjerner behovet for at træne en specifik model. Stanford University’s Denoising Diffusion Implicit Model (DDIM) sampling-metode, som er velkendt for brugere af Stable Diffusion, er tilpasset til at inkorporere den sekundære information, der leveres af saliency-kort.

Papiret siger:

‘Vi anvender først en saliency-detektor til at efterligne det menneskelige synssystem og markere de saliente regioner. For at undgå at træne en ekstra model, optimerer vores metode direkte diffusion-latenter.

‘Desuden udnytter SGOOL en invers diffusion-proces og giver den konstante hukommelsesimplementering. Derfor bliver vores metode en parameter-effektiv og plug-and-play fine-tuning metode. Omfattende eksperimenter er blevet udført med flere metrikker og menneskelig evaluering.’

Da denne metode kræver multiple iterationer af støjprocessen, anvendte forfatterne Direct Optimization Of Diffusion Latents (DOODL) framework, som giver en invers diffusion-proces – selvom det stadig anvender opmærksomhed til hele billedet.

Til at definere områder af menneskelig interesse, anvendte forskerne University of Dundees 2022 TransalNet-ramme.

Eksempler på saliency-detektion fra 2022 TransalNet-projektet. Kilde: https://discovery.dundee.ac.uk/ws/portalfiles/portal/89737376/1_s2.0_S0925231222004714_main.pdf

Eksempler på saliency-detektion fra 2022 TransalNet-projektet. Kilde: https://discovery.dundee.ac.uk/ws/portalfiles/portal/89737376/1_s2.0_S0925231222004714_main.pdf

De saliente regioner, der blev behandlet af TransalNet, blev derefter beskåret for at generere konklusive saliency-sektioner, der sandsynligvis ville være af mest interesse for rigtige mennesker.

Forskellen mellem brugerens tekst og billedet skal være overvejet, i forhold til at definere en tab-funktion, der kan bestemme, om processen fungerer. Til dette blev en version af OpenAI’s Contrastive Language–Image Pre-training (CLIP) – nu en hovedbestanddel af billedsyntheseforskningssektoren – anvendt, sammen med overvejelse af den estimerede semantiske afstand mellem tekstprompten og det globale (ikke-saliency) billedoutput.

Forfatterne hævder:

‘[Den] endelige tab-funktion [funktion] omfatter relationerne mellem saliency-dele og det globale billede samtidigt, hvilket hjælper med at balancere lokale detaljer og global konsistens i generationsprocessen.

‘Dette saliency-bevidste tab er udnyttet til at optimere billed-latent. Gradients er beregnet på den støjede [latent] og udnyttes til at forbedre konditionseffekten af input-prompten på både saliente og globale aspekter af det oprindelige genererede billede.’

Data og Tests

For at teste SGOOL, anvendte forfatterne en ‘vanilla’-distribution af Stable Diffusion V1.4 (betegnet som ‘SD’ i testresultater) og Stable Diffusion med CLIP-guidance (betegnet som ‘baseline’ i resultater).

Systemet blev evaluere mod tre offentlige datasets: CommonSyntacticProcesses (CSP), DrawBench og DailyDallE*.

Sidstnævnte indeholder 99 detaljerede prompts fra en kunstner, der er nævnt i en af OpenAI’s blogindlæg, mens DrawBench tilbyder 200 prompts over 11 kategorier. CSP består af 52 prompts baseret på otte forskellige grammatiske tilfælde.

For SD, baseline og SGOOL, blev CLIP-modellen anvendt over ViT/B-32 til at generere billed- og tekst-embeddings. Den samme prompt og tilfældig seed blev anvendt. Output-størrelsen var 256×256, og standardvægt og indstillinger for TransalNet blev anvendt.

Foruden CLIP-score-metrikken blev en estimeret Human Preference Score (HPS) anvendt, samt en realverden-studie med 100 deltagere.

Kvantitative resultater, der sammenligner SGOOL med tidligere konfigurationer.

Kvantitative resultater, der sammenligner SGOOL med tidligere konfigurationer.

I forhold til de kvantitative resultater, der er vist i tabellen ovenfor, siger papiret:

‘[Vores] model overgår betydeligt SD og Baseline på alle datasets under både CLIP-score og HPS-metrikker. Gennemsnitsresultaterne af vores model på CLIP-score og HPS er 3,05 og 0,0029 højere end andenpladsen, henholdsvis.’

Forfatterne estimerede yderligere box-plots for HPS og CLIP-scores i forhold til tidligere tilgange:

Box-plots for HPS og CLIP-scores, der blev opnået i testene.

Box-plots for HPS og CLIP-scores, der blev opnået i testene.

De kommenterede:

‘Det kan ses, at vores model overgår de andre modeller, hvilket indikerer, at vores model er mere i stand til at generere billeder, der er konsistente med promptene.

‘Men i box-plots er det ikke let at visualisere sammenligningen på grund af størrelsen på denne evaluering-metrik. Derfor fortsætter vi med at plotte de tilsvarende bar-plots.

‘Det kan ses, at SGOOL overgår SD og Baseline på alle datasets under både CLIP-score og HPS-metrikker. De kvantitative resultater demonstrerer, at vores model kan generere mere semantisk konsistente og menneskeligt foretrukne billeder.’

Forskerne bemærker, at selvom baseline-modellen kan forbedre billedkvaliteten, tager den ikke hensyn til de saliente områder af billedet. De hævder, at SGOOL, ved at nå et kompromis mellem global og salient billedvurdering, opnår bedre billeder.

I kvalitative (automatiserede) sammenligninger blev antallet af optimeringer sat til 50 for SGOOL og DOODL.

Kvalitative resultater for testene. Se kildepapiret for bedre definition.

Kvalitative resultater for testene. Se kildepapiret for bedre definition.

Kvalitative resultater for testene. Se kildepapiret for bedre definition.

Her bemærker forfatterne:

‘I [første række] er emnerne for prompten “en kat, der synger” og “en barbershop-kvartet”. Der er fire katte i billedet genereret af SD, og indholdet af billedet er dårligt aligneret med prompten.

‘Katten bliver ignoreret i billedet genereret af Baseline, og der er mangel på detaljer i portrætteringen af ansigtet og detaljerne i billedet. DOODL forsøger at generere et billede, der er konsistent med prompten.

‘Men da DOODL optimerer det globale billede direkte, bliver personerne i billedet optimeret mod katten.’

De bemærker yderligere, at SGOOL, i modsætning hertil, genererer billeder, der er mere konsistente med den oprindelige prompt.

I den menneskelige perceptionstest vurderede 100 frivillige testbilleder for kvalitet og semantisk konsistens (dvs. hvor tæt de fulgte deres kilde-tekstprompt). Deltagerne havde ubegrænset tid til at træffe deres valg.

Resultater for den menneskelige perceptionstest.

Resultater for den menneskelige perceptionstest.

Som papiret påpeger, er forfatternes metode bemærkelsesværdigt foretrukket over tidligere tilgange.

Konklusion

Ikke længe efter, at svaghederne, der blev adresseret i denne artikel, blev åbenlyse i lokale installationer af Stable Diffusion, dukkede forskellige tilpassede metoder (såsom After Detailer) op for at tvinge systemet til at anvende ekstra opmærksomhed på områder, der var af større menneskelig interesse.

Men denne type tilgang kræver, at diffusionssystemet først går gennem sin normale proces med at anvende ligelig opmærksomhed til hver del af billedet, med den øgede indsats, der udføres som en ekstra fase.

Beviserne fra SGOOL tyder på, at anvendelse af grundlæggende menneskelig psykologi til prioritering af billedsektioner kunne forbedre den oprindelige inferens uden efterbehandlings-trin.

 

* Papiret giver den samme link for dette som for CommonSyntacticProcesses.

Først publiceret onsdag, 16. oktober 2024

Forfatter inden for maskinlæring, domænespecialist i menneskelig billedsyntese. Tidligere chef for forskningsindhold hos Metaphysic.ai, indtil den blev opløst i DNEGs Brahma.ai.
Websted: martinanderson.ai
Kontakt: martin@martinanderson.ai