AI-modellen en platforms
Onderzoekers ontwikkelen nieuwe methode voor het controleren van AI-afbeeldingengeneratie
Onderzoekers van de North Carolina State University hebben een nieuwe methode ontwikkeld voor het controleren van kunstmatige intelligentie (AI) voor het genereren van afbeeldingen, die gebruikt kan worden in gebieden zoals autonome voertuigen.
Conditionele afbeeldingengeneratie en andere technieken
Conditionele afbeeldingengeneratie is een AI-taak die inhoudt dat AI-systemen afbeeldingen creëren op basis van een specifieke set voorwaarden, die de gebruiker kan opgeven. Nieuwere technieken hebben dit nog verder ontwikkeld en incorporeren voorwaarden voor een afbeeldingslay-out, waardoor gebruikers kunnen specificeren welke objecten ze op specifieke plekken op het scherm willen zien.
De nieuwe state-of-the-art-methode die door de onderzoekers aan de universiteit is ontwikkeld, bouwt voort op al deze technieken en stelt gebruikers in staat om meer controle te hebben over de afbeeldingen terwijl bepaalde kenmerken over een reeks afbeeldingen behouden blijven.
Tianfu Wu is co-auteur van het onderzoeksrapport en een assistent-professor in computerengineering aan NC State.
“Onze aanpak is zeer configureerbaar,” zegt Wu. “Net als eerdere benaderingen, stelt de onze gebruikers in staat om het systeem een afbeelding te laten genereren op basis van een specifieke set voorwaarden. Maar de onze stelt gebruikers ook in staat om die afbeelding te behouden en eraan toe te voegen. Bijvoorbeeld, gebruikers kunnen het AI-systeem een berglandschap laten creëren. De gebruikers kunnen het systeem dan laten toevoegen aan die scène.”
Manipulatie van elementen
Met de nieuwe methode kunnen gebruikers het AI-systeem ook laten manipuleren van elementen zodat ze identificeerbaar hetzelfde blijven, terwijl ze toch bewegen of veranderen. Een voorbeeld hiervan zou zijn dat het AI-systeem een reeks afbeeldingen creëert waarin skiërs naar de kijker toe draaien terwijl ze over een landschap bewegen.
“Een toepassing hiervoor zou zijn om autonome robots te helpen ‘zich voor te stellen’ hoe het eindresultaat eruit zou zien voordat ze een bepaalde taak beginnen,” zegt Wu. “Je zou het systeem ook kunnen gebruiken om afbeeldingen te genereren voor AI-training. In plaats van afbeeldingen te compileren uit externe bronnen, zou je dit systeem kunnen gebruiken om afbeeldingen te creëren voor het trainen van andere AI-systemen.”
De nieuwe aanpak is getest met de COCO-Stuff-dataset en de Visual Genome-dataset, en op basis van de standaarden voor afbeeldingskwaliteit, presteert het beter dan de eerdere state-of-the-art-technieken.
“Onze volgende stap is om te zien of we dit werk kunnen uitbreiden naar video en driedimensionale afbeeldingen,” zegt Wu.
Om de nieuwe aanpak te trainen, moesten de onderzoekers een 4-GPU-werkstation gebruiken vanwege de zware computationele kracht die nodig was. Ondanks dit, is het implementeren van het systeem nog steeds minder computationeel duur.
“We hebben ontdekt dat één GPU bijna real-time-snelheid biedt,” zegt Wu.
“Naast ons rapport, hebben we onze broncode voor deze aanpak beschikbaar gemaakt op GitHub. We zijn altijd open voor samenwerking met industriele partners.”












