AI-modeller och plattformar

Forskare utvecklar ny metod för att kontrollera AI-bildgenerering

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Forskare från North Carolina State University har utvecklat en ny metod för att kontrollera artificiell intelligens (AI) bildgenerering, som kan användas inom områden som autonoma fordon.

Villkorlig bildgenerering och andra tekniker

Villkorlig bildgenerering är en AI-uppgift som innebär att AI-system skapar bilder baserat på en specifik uppsättning villkor, som användaren kan begära. Nyare tekniker har tagit detta ett steg längre och införlivar villkor för en bildlayout, vilket möjliggör för användare att specificera vilka typer av objekt de vill se i specifika områden på skärmen.

Den nya metod som utvecklats av forskarna vid universitetet bygger på alla dessa tekniker och möjliggör för användare att ha mer kontroll över bilderna samtidigt som vissa egenskaper behålls över en serie av bilder.

Tianfu Wu är medförfattare till forskningsartikeln och biträdande professor i datorteknik vid NC State.

“Vår metod är högt konfigurerbar”, säger Wu. “Liksom tidigare metoder tillåter vår metod användare att ha systemet generera en bild baserat på en specifik uppsättning villkor. Men vår metod tillåter också användare att behålla bilden och lägga till den. Till exempel kan användare ha AI skapa en bergsscen. Användarna kan sedan ha systemet lägga till skidåkare i den scenen.”

Manipulering av element

Med den nya metoden kan användare också tillåta AI att manipulera element så att de är identifiably desamma medan de fortfarande rör sig eller ändras på något sätt. Ett sådant exempel skulle vara att AI skapar en serie av bilder där skidåkare vänder sig mot betraktaren medan de rör sig över ett landskap.

“En tillämpning för detta skulle vara att hjälpa autonoma robotar ‘föreställa sig’ hur slutresultatet kan se ut innan de börjar en given uppgift”, säger Wu. “Du kunde också använda systemet för att generera bilder för AI-träning. Så, istället för att samla in bilder från externa källor, kunde du använda detta system för att skapa bilder för att träna andra AI-system.”

Den nya metoden testades med COCO-Stuff-databasen och Visual Genome-databasen, och baserat på standarderna för bildkvalitet, överträffar den tidigare state-of-the-art-tekniker.

“Vårt nästa steg är att se om vi kan utöka detta arbete till video och tredimensionella bilder”, säger Wu.

För att träna den nya metoden var forskarna tvungna att använda en 4-GPU-arbetsstation på grund av den tunga beräkningskraft som krävdes. Trots detta är det fortfarande mindre beräkningskrävande att distribuera systemet.

“Vi fann att en GPU ger dig nästan realtidshastighet”, säger Wu.

“Utöver vår artikel har vi gjort vår källkod för denna metod tillgänglig på GitHub. Det sagt, vi är alltid öppna för att samarbeta med industripartner.”

Alex McFarland är en AI-journalist och författare som utforskar de senaste utvecklingarna inom artificiell intelligens. Han har samarbetat med många AI-startups och publikationer över hela världen.