AI-mallit ja alustat

Tutkijat kehittivät JL2P-tietokonemallin elokuvakäsikirjoitusten animaatioksi kääntämiseksi

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Carnegie Mellon Universityn tutkijat ovat kehittäneet tietokoneen, joka pystyy kääntämään tekstin, joka kuvaa fyysisiä liikkeitä, yksinkertaisiksi tietokoneella luoduiksi animaatioiksi. Nämä uudet kehitysaskeleet voivat mahdollistaa elokuvien ja muiden animaatioiden luomisen suoraan tietokoneen mallista, joka lukee käsikirjoituksia.

Tutkijat ovat edistyneet tietokoneiden ymmärtämisessä sekä luonnollista kieltä että fyysisten asentojen luomisessa käsikirjoituksesta. Tämä uusi tietokoneen malli voi olla silta näiden kahden välillä.

Louis-Philippe Morency, apulaisprofessori Language Technologies Institute (LTI):ssä, ja Chaitanya Ahuja, LTI:n tohtorikoulutettava, ovat käyttäneet neurorakennetta, jota kutsutaan Joint Language-to-Pose (JL2P):ksi. JL2P-malli pystyy yhdistämään lauseita ja fyysisiä liikkeitä. Tämä mahdollistaa sen oppimisen, miten kieli liittyy toimintoihin, eleisiin ja liikkeisiin.

“Luulen, että olemme tämän tutkimuksen alkuvaiheessa, mutta mallinnuksen, tekoälynn ja teorian näkökulmasta tämä on erittäin jännittävä hetki”, Morency sanoi. “Tällä hetkellä puhumme virtuaalihahmojen animoinnista. Lopulta tämä kielen ja eleiden välinen yhteys voidaan soveltaa roboteihin; voimme kertoa henkilökohtaiselle robottiavustajalle, mitä haluamme sen tekemään.

“Voimme myös lopulta mennä toiseen suuntaan – käyttää tätä kielen ja animaation välistä yhteyttä, jotta tietokone voi kuvailla, mitä videossa tapahtuu”, hän lisäsi.

Joint Language-to-Pose-malli esitellään Ahujan toimesta 19. syyskuuta Kansainvälisessa 3D-näkemyön konferenssissa. Konferenssi järjestetään Quebecin kaupungissa, Kanadassa.

JL2P-malli luotiin kurssinopetuslähestymistavalla. Ensimmäinen tärkeä askel oli mallin oppiminen lyhyistä, helppoisista jonoista. Se olisi esimerkiksi “Henkilö kävelee eteenpäin.” Sitten se siirtyi pidempiin ja vaikeampiin jonoihin, kuten “Henkilö kävelee eteenpäin, kääntyy ympäri ja kävelee eteenpäin uudelleen” tai “Henkilö hyppää esteen yli juostessaan.”

Kun malli käyttää jonoja, se tarkastelee verbejä ja adverbejä. Nämä kuvaavat toimintaa ja sen nopeutta/kiihtyvyyttä. Sitten se tarkastelee substantiiveja ja adjektiiveja, jotka kuvaavat sijainteja ja suuntia. Ahujan mukaan mallin lopullinen tavoite on animoida monimutkaisia jonoja, joissa on useita toimintoja, jotka tapahtuvat samanaikaisesti tai peräkkäin.

Tällä hetkellä animaatiot ovat rajoitettu vain piirustuksiin, mutta tutkijat jatkavat mallin kehittämistä. Yksi monista komplikaatioista, jotka Morencyn mukaan ilmenevät, on, että monia asioita tapahtuu samanaikaisesti, jotkut niistä jopa yksinkertaisissa jonoissa.

“Keon välinen synchronia on erittäin tärkeää”, Morency sanoi. “Joka kerta, kun liikutat jalkojasi, liikutat myös käsisi, vartalosi ja mahdollisesti pääsi. Animaatioiden on koordinoitava näitä eri osia samanaikaisesti ja saavuttava monimutkaisia toimintoja. Kielen kertomuksen sisällyttäminen tähän monimutkaiseen animaatioympäristöön on sekä haasteellista että jännittävää. Tämä on askel kohti parempaa ymmärtämistä puheesta ja eleistä.”

Jos Joint Language-to-Pose-malli pystyy kehittymään sellaiseksi, että se voi luoda monimutkaisia animaatioita ja toimintoja kielen perusteella, mahdollisuudet ovat valtavat. Se voidaan käyttää alaan, kuten elokuva- ja animaatiotuotannossa, ja se myös auttaa ymmärtämään puhetta ja eleitä.

Kääntymällä tekoälyyn, JL2P-malli voidaan käyttää roboteilla. Esimerkiksi robotit voidaan ohjata ja kertoa, mitä niiden on tehtävä, ja ne voivat ymmärtää kielen ja vastata sen mukaan.

Nämä uudet kehitysaskeleet vaikuttavat moniin eri aloihin, ja malli jatkaa kehittymistään ymmärtämään monimutkaisia kieliä.

Alex McFarland on AI-toimittaja ja kirjailija, joka tutkii viimeisimpiä kehityksiä tekoälyssä. Hän on tehnyt yhteistyötä useiden AI-startup-yritysten ja julkaisujen kanssa maailmanlaajuisesti.