Modely a platformy AI
Výzkumníci vyvinuli počítačový model JL2P pro překlad filmových scénářů do animací

Výzkumníci z Univerzity Carnegie Mellon vyvinuli počítačový model, který je schopen překládat text, který popisuje fyzické pohyby, do jednoduchých počítačově generovaných animací. Tyto nové vývojové směry by mohly umožnit vytvářet filmy a další animace přímo z počítačového modelu, který čte scénáře.
Vědci dělají pokroky v oblasti pochopení počítači přirozeného jazyka a generování fyzických póz z scénářů. Tento nový počítačový model může být spojnicí mezi nimi.
Louis-Philippe Morency, asociativní profesor v Ústavu jazykových technologií (LTI), a Chaitanya Ahuja, doktorand LTI, používají neuronovou architekturu nazvanou Společný jazyk-póza (JL2P). Model JL2P je schopen společně vkládat věty a fyzické pohyby. To umožňuje naučit se, jak jazyk souvisí s akcemi, gesty a pohyby.
“Myslím, že jsme na počátku této výzkumu, ale z hlediska modelování, umělé inteligence a teorie je to velmi zajímavý okamžik,” řekl Morency. “Právě teď mluvíme o animování virtuálních postav. Nakonec by tato spojení mezi jazykem a gesty mohlo být aplikováno na roboty; mohli bychom jim prostě říci, co chceme, aby dělali.
“Také bychom mohli jít opačným směrem – použít toto spojení mezi jazykem a animací, aby počítač mohl popisovat, co se děje ve videu,” dodal.
Model Joint Language-to-Pose bude prezentován Ahujou 19. září na Mezinárodní konferenci o 3D vidění. Tato konference se bude konat v Quebec City, Kanada.
Model JL2P byl vytvořen pomocí kurikulárního přístupu k učení. První důležitý krok spočíval v tom, aby model naučil krátké, jednoduché sekvence. To by bylo něco jako „Osoba jde dopředu.“ Pak přešel na delší a složitější sekvence, jako „Osoba jde dopředu, poté se otočí a jde dopředu znovu“ nebo „Osoba skáče přes překážku, zatímco běží.“
Když model používá sekvence, dívá se na slovesa a příslovce. Tyto popisují akci a rychlost/zrychlení akce. Pak se dívá na podstatná jména a přídavná jména, která popisují umístění a směry. Podle Ahuji je konečným cílem modelu animovat složitější sekvence s více akcemi, které se vyskytují současně nebo v sekvenci.
V současné době jsou animace omezeny na postavové figurky, ale vědci budou dále vyvíjet model. Jednou z komplikací, které vznikají, je podle Morencyho to, že mnoho věcí se děje současně. Některé z nich se dokonce dějí v jednoduchých sekvencích.
“Synchronizace mezi částmi těla je velmi důležitá,” řekl Morency. “Každý čas, když pohybujete nohama, také pohybujete pažemi, trupem a možná i hlavou. Animace těla potřebují koordinovat tyto různé součásti, zatímco současně dosahují složitých akcí. Vnesení jazykové narace do tohoto komplexního animačního prostředí je både výzvou a vzrušujícím. To je cesta k lepšímu pochopení řeči a gest.”
Pokud model Joint Language-to-Pose dokáže vyvinout do té míry, že bude schopen vytvářet složitější animace a akce na základě jazyka, možnosti jsou obrovské. Může být použit nejen v oblastech, jako je film a animace, ale také povede k vývoji v oblasti pochopení řeči a gest.
Přejdeme-li k umělé inteligenci, model JL2P by mohl být použit na robotech. Například roboti by mohli být ovládáni a řečeno, co mají dělat, a oni by byli schopni pochopit jazyk a reagovat odpovídajícím způsobem.
Tyto nové vývojové směry budou mít dopad na mnoho různých oblastí, a model bude dále rozšiřovat své schopnosti pochopení složitých jazyků.












