Modely a platformy AI
Výzkumníci vyvinuli novou metodu pro kontrolu generování obrazů pomocí umělé inteligence
Výzkumníci z North Carolina State University vyvinuli novou metodu pro kontrolu generování obrazů pomocí umělé inteligence, která by mohla být použita v oblastech jako autonomní vozidla.
Podmíněná generace obrazů a další techniky
Podmíněná generace obrazů je úkolem umělé inteligence, který zahrnuje vytváření obrazů na základě specifické sady podmínek, které může uživatel požadovat. Novější techniky došly ještě dále a zahrnují podmínky pro rozložení obrazu, což umožňuje uživatelům specifikovat typy objektů, které chtějí vidět na konkrétních místech na obrazovce.
Nová metoda, kterou vyvinuli výzkumníci na univerzitě, vychází z těchto technik a umožňuje uživatelům mít větší kontrolu nad obrazy, zatímco zachovává určitou charakteristiku napříč sérií obrazů.
Tianfu Wu je spoluautor výzkumné práce a asistent profesora počítačového inženýrství na NC State.
“Náš přístup je vysoce konfigurovatelný,” říká Wu. “Stejně jako předchozí přístupy, náš umožňuje uživatelům nechat systém vygenerovat obraz na základě specifické sady podmínek. Ale náš také umožňuje uživatelům zachovat obraz a přidat k němu. Například uživatelé by mohli nechat umělou inteligenci vytvořit horskou scénu. Uživatelé by pak mohli nechat systém přidat lyžaře do té scény.”
Manipulace s prvky
S novou metodou mohou uživatelé také nechat umělou inteligenci manipulovat prvky tak, aby byly identifikovatelné jako stejné, zatímco se stále pohybují nebo mění nějakým způsobem. Jedním z takových příkladů by bylo vytvoření série obrazů, kde lyžaři se otáčejí k divákovi, zatímco se pohybují po krajině.
“Jedním z aplikací této metody by bylo pomoci autonomním robotům ‘představit si’, jak by mohl vypadat konečný výsledek, než začnou s daným úkolem,” říká Wu. “Můžete také použít systém k generování obrazů pro školení umělé inteligence. Místo sestavení obrazů z externích zdrojů můžete použít tento systém k vytvoření obrazů pro školení jiných systémů umělé inteligence.”
Nový přístup byl testován s datasetem COCO-Stuff a datasetem Visual Genome, a na základě standardů pro kvalitu obrazu překonává předchozí špičkové techniky.
“Náš další krok je zjistit, zda můžeme tuto práci rozšířit na video a trojrozměrné obrazy,” říká Wu.
Pro výcvik nové metody museli výzkumníci spoléhat na 4-GPU pracovní stanici kvůli vysoké výpočetní náročnosti. Přesto je nasazení systému stále méně výpočetně náročné.
“Zjistili jsme, že jeden GPU poskytuje téměř reálnou rychlost,” říká Wu.
“Kromě naší práce jsme také zpřístupnili zdroj kódu pro tento přístup na GitHub. Říkáme, že jsme vždy otevřeni spolupráci s průmyslovými partnery.”












