Modely a platformy AI

Výzkumníci vyvinuli počítačový model JL2P pro překlad filmových scénářů do animací

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Výzkumníci z Univerzity Carnegie Mellon vyvinuli počítačový model, který je schopen překládat text, který popisuje fyzické pohyby, do jednoduchých počítačově generovaných animací. Tyto nové vývojové směry by mohly umožnit vytvářet filmy a další animace přímo z počítačového modelu, který čte scénáře.

Vědci dělají pokroky v oblasti pochopení počítači přirozeného jazyka a generování fyzických póz z scénářů. Tento nový počítačový model může být spojnicí mezi nimi.

Louis-Philippe Morency, asociativní profesor v Ústavu jazykových technologií (LTI), a Chaitanya Ahuja, doktorand LTI, používají neuronovou architekturu nazvanou Společný jazyk-póza (JL2P). Model JL2P je schopen společně vkládat věty a fyzické pohyby. To umožňuje naučit se, jak jazyk souvisí s akcemi, gesty a pohyby.

“Myslím, že jsme na počátku této výzkumu, ale z hlediska modelování, umělé inteligence a teorie je to velmi zajímavý okamžik,” řekl Morency. “Právě teď mluvíme o animování virtuálních postav. Nakonec by tato spojení mezi jazykem a gesty mohlo být aplikováno na roboty; mohli bychom jim prostě říci, co chceme, aby dělali.

“Také bychom mohli jít opačným směrem – použít toto spojení mezi jazykem a animací, aby počítač mohl popisovat, co se děje ve videu,” dodal.

Model Joint Language-to-Pose bude prezentován Ahujou 19. září na Mezinárodní konferenci o 3D vidění. Tato konference se bude konat v Quebec City, Kanada.

Model JL2P byl vytvořen pomocí kurikulárního přístupu k učení. První důležitý krok spočíval v tom, aby model naučil krátké, jednoduché sekvence. To by bylo něco jako „Osoba jde dopředu.“ Pak přešel na delší a složitější sekvence, jako „Osoba jde dopředu, poté se otočí a jde dopředu znovu“ nebo „Osoba skáče přes překážku, zatímco běží.“

Když model používá sekvence, dívá se na slovesa a příslovce. Tyto popisují akci a rychlost/zrychlení akce. Pak se dívá na podstatná jména a přídavná jména, která popisují umístění a směry. Podle Ahuji je konečným cílem modelu animovat složitější sekvence s více akcemi, které se vyskytují současně nebo v sekvenci.

V současné době jsou animace omezeny na postavové figurky, ale vědci budou dále vyvíjet model. Jednou z komplikací, které vznikají, je podle Morencyho to, že mnoho věcí se děje současně. Některé z nich se dokonce dějí v jednoduchých sekvencích.

“Synchronizace mezi částmi těla je velmi důležitá,” řekl Morency. “Každý čas, když pohybujete nohama, také pohybujete pažemi, trupem a možná i hlavou. Animace těla potřebují koordinovat tyto různé součásti, zatímco současně dosahují složitých akcí. Vnesení jazykové narace do tohoto komplexního animačního prostředí je både výzvou a vzrušujícím. To je cesta k lepšímu pochopení řeči a gest.”

Pokud model Joint Language-to-Pose dokáže vyvinout do té míry, že bude schopen vytvářet složitější animace a akce na základě jazyka, možnosti jsou obrovské. Může být použit nejen v oblastech, jako je film a animace, ale také povede k vývoji v oblasti pochopení řeči a gest.

Přejdeme-li k umělé inteligenci, model JL2P by mohl být použit na robotech. Například roboti by mohli být ovládáni a řečeno, co mají dělat, a oni by byli schopni pochopit jazyk a reagovat odpovídajícím způsobem.

Tyto nové vývojové směry budou mít dopad na mnoho různých oblastí, a model bude dále rozšiřovat své schopnosti pochopení složitých jazyků.

Alex McFarland je AI novinář a spisovatel, který zkoumá nejnovější vývoj v oblasti umělé inteligence. Spolupracoval s mnoha AI startupy a publikacemi po celém světě.