Andersons hoek

Het benutten van menselijke aandacht kan AI-gegenereerde afbeeldingen verbeteren

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google
An AI-generated image by ChatGPT. Prompt: ' a panoramic image representing salient object detection, featuring a person. The salient heat-map should be clear and obvious, and this illustration should be in the style of results from scientific papers about saliency maps'

Nieuw onderzoek uit China heeft een methode voorgesteld om de kwaliteit van afbeeldingen gegenereerd door Latent Diffusion Models (LDM’s) zoals Stable Diffusion te verbeteren.

De methode richt zich op het optimaliseren van de opvallende gebieden van een afbeelding – gebieden die het meest waarschijnlijk de menselijke aandacht trekken.

Het nieuwe onderzoek heeft aangetoond dat saliency-kaarten (vierde kolom van links) kunnen worden gebruikt als filter, of 'masker', om de locus van aandacht in denoising-processen naar gebieden van de afbeelding te sturen die mensen het meest waarschijnlijk zullen opmerken. Bron: https://arxiv.org/pdf/2410.10257

Het nieuwe onderzoek heeft aangetoond dat saliency-kaarten (vierde kolom van links) kunnen worden gebruikt als filter, of ‘masker’, om de locus van aandacht in denoising-processen naar gebieden van de afbeelding te sturen die mensen het meest waarschijnlijk zullen opmerken. Bron: https://arxiv.org/pdf/2410.10257

Traditionele methoden optimaliseren de gehele afbeelding uniform, terwijl de nieuwe aanpak een saliency-detector gebruikt om meer ‘belangrijke’ gebieden te identificeren en prioriteit te geven, net zoals mensen doen.

In kwantitatieve en kwalitatieve tests was de methode van de onderzoekers in staat om eerder diffusion-gebaseerde modellen te overtreffen, zowel in termen van afbeeldingskwaliteit als trouw aan tekstprompts.

De nieuwe aanpak scoorde ook het beste in een menselijke perceptietest met 100 deelnemers.

Natuurlijke selectie

Saliency, de mogelijkheid om informatie in de echte wereld en in afbeeldingen te prioriteren, is een essentieel onderdeel van het menselijk zicht.

Een eenvoudig voorbeeld hiervan is de toegenomen aandacht voor details die klassieke kunst toewijst aan belangrijke gebieden van een schilderij, zoals het gezicht in een portret, of de masten van een schip in een zee-gebaseerd onderwerp; in dergelijke voorbeelden convergeert de aandacht van de kunstenaar naar het centrale onderwerp, waardoor bredere details zoals een portretachtergrond of de verre golven van een storm schetsmatig en meer algemeen vertegenwoordigd zijn dan gedetailleerd.

Geïnformeerd door menselijke studies, zijn er in de afgelopen tien jaar machine learning-methoden ontwikkeld die dit menselijke locus van interesse in een afbeelding kunnen repliceren of ten minste benaderen.

Objectsegmentatie (semantische segmentatie) kan helpen bij het individueren van facetten van een afbeelding en het ontwikkelen van overeenkomstige saliency-kaarten. Bron: https://arxiv.org/pdf/1312.6034

Objectsegmentatie (semantische segmentatie) kan helpen bij het individueren van facetten van een afbeelding en het ontwikkelen van overeenkomstige saliency-kaarten. Bron: https://arxiv.org/pdf/1312.6034

In de loop van het onderzoeksliteratuur is de meest populaire saliency-kaartdetector in de afgelopen vijf jaar de 2016 Gradient-weighted Class Activation Mapping (Grad-CAM) initiatief, dat later evolueerde naar het verbeterde Grad-CAM++ systeem, onder andere varianten en verfijningen.

Grad-CAM gebruikt de gradientactivatie van een semantisch token (zoals ‘hond’ of ‘kat’) om een visuele kaart te produceren van waar het concept of de annotatie waarschijnlijk in de afbeelding wordt weergegeven.

Voorbeelden uit het oorspronkelijke Grad-CAM-artikel. In de tweede kolom worden alle bijdrageende kenmerken geïndividualiseerd door guided backpropagation. In de derde kolom worden de semantische kaarten getekend voor de twee concepten 'hond' en 'kat'. De vierde kolom vertegenwoordigt de concatenatie van de twee voorgaande inferenties. De vijfde, de occlusie (masker) kaart die overeenkomt met de inferentie; en ten slotte, in de zesde kolom, visualiseert Grad-CAM een ResNet-18-laag. Bron: https://arxiv.org/pdf/1610.02391

Voorbeelden uit het oorspronkelijke Grad-CAM-artikel. In de tweede kolom worden alle bijdrageende kenmerken geïndividualiseerd door guided backpropagation. In de derde kolom worden de semantische kaarten getekend voor de twee concepten ‘hond’ en ‘kat’. De vierde kolom vertegenwoordigt de concatenatie van de twee voorgaande inferenties. De vijfde, de occlusie (masker) kaart die overeenkomt met de inferentie; en ten slotte, in de zesde kolom, visualiseert Grad-CAM een ResNet-18-laag. Bron: https://arxiv.org/pdf/1610.02391

Menselijke enquêtes over de resultaten verkregen door deze methoden hebben een overeenkomst aangetoond tussen deze wiskundige individuatie van sleutelinteressepunten in een afbeelding en menselijke aandacht (bij het scannen van de afbeelding).

SGOOL

Het nieuwe artikel onderzoekt wat saliency kan bijdragen aan tekst-naar-afbeelding (en mogelijk tekst-naar-video) systemen zoals Stable Diffusion en Flux.

Wanneer een gebruikers tekstprompt wordt geïnterpreteerd, onderzoeken Latent Diffusion Models hun getrainde latent ruimte voor geleerde visuele concepten die overeenkomen met de woorden of zinnen die worden gebruikt. Ze parseren deze gevonden datapunten vervolgens door een denoising proces, waarbij willekeurig lawaai geleidelijk wordt geëvolueerd naar een creatieve interpretatie van de gebruikers tekstprompt.

Op dit punt geeft het model echter gelijke aandacht aan elk deel van de afbeelding. Sinds de popularisering van diffusiemodellen in 2022, met de lancering van OpenAI’s beschikbare Dall-E afbeeldingengeneratoren, en de daaropvolgende open-sourcing van Stability.ai’s Stable Diffusion framework, hebben gebruikers ontdekt dat ‘essentiële’ secties van een afbeelding vaak onderbediend zijn.

Gezien dat in een typische weergave van een mens, het gezicht van de persoon (dat van maximum belang is voor de kijker) waarschijnlijk niet meer dan 10-35% van de totale afbeelding in beslag neemt, werkt deze democratische methode van aandachtverdeling tegen zowel de natuur van menselijke perceptie als de geschiedenis van kunst en fotografie.

Wanneer de knopen op iemands spijkerbroek evenveel rekenkracht krijgen als hun ogen, kan de toewijzing van middelen non-optimaal worden genoemd.

Daarom gebruikt de nieuwe methode die door de auteurs wordt voorgesteld, getiteld Saliency Guided Optimization of Diffusion Latents (SGOOL), een saliency-kaart om aandacht te vergroten op verwaarloosde gebieden van een afbeelding, en wijdt minder middelen aan secties die waarschijnlijk aan de periferie van de aandacht van de kijker zullen blijven.

Methode

De SGOOL-pijplijn omvat afbeeldingengeneratie, saliency-kaart en optimalisatie, met de totale afbeelding en saliency-geraffineerde afbeelding die gezamenlijk worden verwerkt.

Conceptueel schema voor SGOOL.

Conceptueel schema voor SGOOL.

De latent embeddings van het diffusiemodel worden rechtstreeks geoptimaliseerd met fine-tuning, waardoor de noodzaak om een specifiek model te trainen wordt verwijderd. Stanford University’s Denoising Diffusion Implicit Model (DDIM) samplingmethode, bekend bij gebruikers van Stable Diffusion, wordt aangepast om de secundaire informatie te incorporeren die door saliency-kaarten wordt verstrekt.

Het artikel vermeldt:

‘We gebruiken eerst een saliency-detector om het menselijk visueel aandachtsysteem te imiteren en de opvallende gebieden te markeren. Om een extra model te trainen, optimaliseren we onze methode rechtstreeks de diffusie-latenten.

‘Bovendien maakt SGOOL gebruik van een omkeerbare diffusieproces en schenkt het de voordelen van constante geheugenuitvoering. Daardoor wordt onze methode een parameter-efficiënte en plug-and-play fine-tuningmethode. Uitgebreide experimenten zijn uitgevoerd met verschillende metrics en humane evaluatie.’

Gegevens en tests

Om SGOOL te testen, gebruikten de auteurs een ‘vanille’-distributie van Stable Diffusion V1.4 (aangeduid als ‘SD’ in testresultaten) en Stable Diffusion met CLIP-guidance (aangeduid als ‘baseline’ in resultaten).

Het systeem werd geëvalueerd tegen drie openbare datasets: CommonSyntacticProcesses (CSP), DrawBench, en DailyDallE*.

De laatste bevat 99 uitgebreide prompts van een kunstenaar die is gefeatured in een van de blogposts van OpenAI, terwijl DrawBench 200 prompts biedt over 11 categorieën. CSP bestaat uit 52 prompts op basis van acht diverse grammaticale gevallen.

Voor SD, baseline en SGOOL, werd in de tests de CLIP-model gebruikt over ViT/B-32 om de afbeelding en tekstembeddings te genereren. Dezelfde prompt en willekeurige seed werd gebruikt. De uitvoergrootte was 256×256, en de standaardgewichten en -instellingen van TransalNet werden gebruikt.

Naast de CLIP-score-metric, werd een geschatte Human Preference Score (HPS) gebruikt, naast een real-worldstudie met 100 deelnemers.

Kwantitatieve resultaten die SGOOL vergelijken met eerdere configuraties.

Kwantitatieve resultaten die SGOOL vergelijken met eerdere configuraties.

Met betrekking tot de kwantitatieve resultaten die in de tabel hierboven worden weergegeven, vermeldt het artikel:

‘Ons model presteert significant beter dan SD en Baseline op alle datasets onder zowel CLIP-score- als HPS-metrics. De gemiddelde resultaten van ons model op CLIP-score en HPS zijn 3,05 en 0,0029 hoger dan de tweede plaats, respectievelijk.’

De auteurs schatten verder de boxplots van de HPS- en CLIP-scores ten opzichte van de eerdere benaderingen:

Boxplots voor de HPS- en CLIP-scores die in de tests zijn verkregen.

Boxplots voor de HPS- en CLIP-scores die in de tests zijn verkregen.

Zij merken op:

‘Het kan worden gezien dat ons model de andere modellen overtreft, wat aangeeft dat ons model beter in staat is om afbeeldingen te genereren die consistent zijn met de prompts.

‘Echter, in de boxplot is het niet gemakkelijk om de vergelijking te visualiseren vanwege de grootte van deze evaluatiemetric op [0, 1]. Daarom gaan we verder met het plotten van de overeenkomstige staafdiagrammen.

‘Het kan worden gezien dat SGOOL SD en Baseline overtreft op alle datasets onder zowel CLIP-score- als HPS-metrics. De kwantitatieve resultaten demonstreren dat ons model in staat is om meer semantisch consistente en door mensen voorkeur gegeven afbeeldingen te genereren.’

De onderzoekers merken op dat de basismethode in staat is om de kwaliteit van de afbeeldingsuitvoer te verbeteren, maar dat deze geen rekening houdt met de opvallende gebieden van de afbeelding. Zij beweren dat SGOOL, door een compromis te bereiken tussen globale en opvallende beeldbeoordeling, betere afbeeldingen verkrijgt.

In kwalitatieve (geautomatiseerde) vergelijkingen werd het aantal optimalisaties ingesteld op 50 voor SGOOL en DOODL.

Kwalitatieve resultaten voor de tests. Raadpleeg het bronartikel voor betere definitie.

Kwalitatieve resultaten voor de tests. Raadpleeg het bronartikel voor betere definitie.

Kwalitatieve resultaten voor de tests. Raadpleeg het bronartikel voor betere definitie.

Hier merken de auteurs op:

‘In de [eerste rij], zijn de onderwerpen van de prompt “een kat die zingt” en “een barbershopkwartet”. Er zijn vier katten in de afbeelding gegenereerd door SD, en de inhoud van de afbeelding is slecht uitgelijnd met de prompt.

‘De kat wordt genegeerd in de afbeelding gegenereerd door Baseline, en er is een gebrek aan detail in de weergave van het gezicht en de details in de afbeelding. DOODL probeert een afbeelding te genereren die consistent is met de prompt.

‘Echter, omdat DOODL de globale afbeelding rechtstreeks optimaliseert, worden de personen in de afbeelding geoptimaliseerd naar de kat.’

Zij merken verder op dat SGOOL, in tegenstelling, afbeeldingen genereert die meer consistent zijn met de oorspronkelijke prompt.

In de menselijke perceptietest, beoordeelden 100 vrijwilligers testafbeeldingen op kwaliteit en semantische consistentie (d.w.z. hoe goed ze overeenkwamen met hun bron-tekstprompts). De deelnemers hadden onbeperkte tijd om hun keuzes te maken.

Resultaten voor de menselijke perceptietest.

Resultaten voor de menselijke perceptietest.

Zoals het artikel opmerkt, is de methode van de auteurs aanzienlijk meer gewenst dan de eerdere benaderingen.

Conclusie

Niet lang nadat de tekortkomingen die in dit artikel worden aangepakt, zichtbaar werden in lokale installaties van Stable Diffusion, ontstonden verschillende maatwerkmethoden (zoals After Detailer) om het systeem te dwingen extra aandacht te besteden aan gebieden die van groter menselijk belang waren.

Echter, deze benadering vereist dat het diffusiesysteem eerst door zijn normale proces gaat van het toewijzen van gelijke aandacht aan elk deel van de afbeelding, met de extra werkzaamheden die als extra stap worden uitgevoerd.

De bewijzen uit SGOOL suggereren dat het toepassen van basisprincipes van menselijke psychologie op de prioritering van afbeeldingssecties de initiële inferentie aanzienlijk kan verbeteren, zonder post-processingstappen.

 

* Het artikel biedt dezelfde link voor dit als voor CommonSyntacticProcesses.

Eerst gepubliceerd op woensdag 16 oktober 2024

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai