AI-modeller og platforme
Forskere udvikler ny metode til kontrol af kunstig intelligens-billeddannelse
Forskere fra North Carolina State University har udviklet en ny metode til kontrol af kunstig intelligens (KI)-billeddannelse, som kan anvendes i felter som autonome køretøjer.
Betinget billeddannelse og andre teknikker
Betinget billeddannelse er en KI-opgave, der indebærer, at KI-systemer skaber billeder baseret på en bestemt sæt af betingelser, som brugeren kan anmode om. Nyere teknikker har taget dette endnu længere og inkorporerer betingelser for billedlayout, hvilket giver brugerne mulighed for at specificere, hvilke typer af objekter de ønsker at se i bestemte områder på skærmen.
Den nye metode, der er udviklet af forskerne på universitetet, bygger på alle disse teknikker og giver brugerne mulighed for at have mere kontrol over billederne, samtidig med at visse karakteristika bevares på tværs af en række billeder.
Tianfu Wu er medforfatter til forskningspapiret og adjunkt i datateknik på NC State.
“Vores tilgang er meget konfigurerbar,” siger Wu. “Ligesom tidligere tilgange giver vores tilgang brugerne mulighed for at få systemet til at generere et billede baseret på en bestemt sæt af betingelser. Men vores tilgang giver også brugerne mulighed for at bevare billedet og tilføje til det. For eksempel kunne brugerne få KI til at skabe et bjerglandskab. Brugerne kunne derefter få systemet til at tilføje skiløbere til det landskab.”
Manipulation af elementer
Med den nye metode kan brugerne også give KI mulighed for at manipulere elementer, så de er genkendelige som de samme, selvom de bevæger sig eller ændrer sig på en eller anden måde. Et sådant eksempel ville være, at KI skaber en række billeder, hvor skiløbere vender sig mod betragteren, mens de bevæger sig hen over et landskab.
“En af anvendelserne af denne metode kunne være at hjælpe autonome robotter med at ‘forestille sig’, hvordan slutresultatet måske ser ud, før de påbegynder en given opgave,” siger Wu. “Man kunne også bruge systemet til at generere billeder til KI-træning. I stedet for at samle billeder fra eksterne kilder kunne man bruge dette system til at skabe billeder til træning af andre KI-systemer.”
Den nye tilgang blev testet med COCO-Stuff-datasættet og Visual Genome-datasættet, og ifølge standarderne for billedkvalitet overgår den tidligere tilgange.
“Vores næste skridt er at se, om vi kan udvide dette arbejde til video og tredimensionale billeder,” siger Wu.
For at træne den nye tilgang måtte forskerne ty til en 4-GPU-arbejdsstation på grund af den tungt beregningskrævende proces. Trods dette er det stadig mindre beregningskrævende at implementere systemet.
“Vi fandt ud af, at en enkelt GPU giver næsten realtidshastighed,” siger Wu.
“Ud over vores papir har vi gjort vores kildekode for denne tilgang tilgængelig på GitHub. Det sagde, vi er altid åbne for at samarbejde med industripartnere.”












