Yapay zeka modelleri ve platformları

Araştırmacılar JL2P Bilgisayar Modelini Film Senaryolarını Animasyonlara Çevirmek için Geliştirdiler

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Carnegie Mellon Üniversitesi’ndeki araştırmacılar, fiziksel hareketleri tanımlayan metni basit bilgisayar üretimi animasyonlara çevirebilen bir bilgisayar modeli geliştirdiler. Bu yeni gelişmeler, filmler ve diğer animasyonların doğrudan bir bilgisayar modelinin senaryoyu okumasından yaratılmasını mümkün kılabilir.

Bilgisayarların hem doğal dili hem de senaryodan fiziksel pozlar üretmesini sağlayan bilim insanları ilerleme kaydediyorlar. Bu yeni bilgisayar modeli, bu iki unsur arasındaki bağlantıyı kurabilir.

Dil Teknolojileri Enstitüsü (LTI)’nde yardımcı doçent olan Louis-Philippe Morency ve LTI doktora öğrencisi Chaitanya Ahuja, Joint Language-to-Pose (JL2P) olarak adlandırılan bir sinirsel mimari kullanıyorlar. JL2P modeli, cümleleri ve fiziksel hareketleri bir arada gömme yeteneğine sahiptir. Bu, dilin eylemle, jestlerle ve hareketlerle nasıl bağlantılı olduğunu öğrenmesini sağlar.

“Sanırım bu araştırmaların başlangıcındayız, ancak modelleme, yapay zeka ve teori açısından çok heyecan verici bir an yaşadığımızı düşünüyorum” dedi Morency. “Şu anda sanal karakterleri canlandırıyoruz. Sonunda, bu dil ve jestler arasındaki bağlantı, robotlara uygulanabilir; bir kişisel asistan robotuna ne yapmasını istediğimizi söyleyebiliriz.

“Ayrıca bu bağlantıyı kullanarak, bir bilgisayar bir videoda neler olduğunu tanımlayabilir” diye ekledi.

Joint Language-to-Pose modeli, 19 Eylül’de Quebec City, Kanada’da yapılacak olan 3D Görüntüleme Uluslararası Konferansı’nda Ahuja tarafından sunulacak.

JL2P modeli, bir müfredat-öğrenme yaklaşımı ile oluşturuldu. İlk önemli adım, modelin kısa ve basit dizileri öğrenmesiydi. Örneğin, “Bir kişi ileriye doğru yürür.” Daha sonra, daha uzun ve zor dizilere geçti, örneğin “Bir kişi ileriye doğru adım atar, sonra döner ve tekrar ileriye doğru adım atar” veya “Bir kişi bir engelin üzerinden atlar ve koşarken.”

Model bu dizileri kullanırken, eylemi ve hız/ivme’yi tanımlayan fiilleri ve sıfatları inceliyor. Ardından, yerleri ve yönleri tanımlayan isim soyadları ve sıfatları inceliyor. Ahuja’ya göre, modelin nihai amacı, aynı anda veya ardışık olarak gerçekleşen çoklu eylemlerle karmaşık dizileri canlandırmaktır.

Şu anda, animasyonlar yalnızca çubuk figürlerle sınırlı, ancak bilim insanları modeli geliştirmeye devam edecekler. Morency’ye göre, ortaya çıkan bir sorun, birçok şeyin aynı anda gerçekleşmesi ve bazılarının basit diziler halinde gerçekleşmesidir.

“Vücut parçaları arasındaki senkronizasyon çok önemlidir” dedi Morency. “Her zaman bacaklarınızı hareket ettirdiğinizde, aynı zamanda kollarınızı, gövdenizi ve muhtemelen başınızı da hareket ettirmelisiniz. Vücut animasyonları, bu farklı bileşenleri koordine ederken aynı zamanda karmaşık eylemleri gerçekleştirmelidir. Bu kompleks animasyon ortamında dil anlatısını getirme hem zorlu hem de heyecan verici. Bu, konuşma ve jestlerin daha iyi anlaşılmasına doğru bir yol.”

Eğer Joint Language-to-Pose modeli, dil temelinde karmaşık animasyonlar ve eylemler oluşturabilmeye ulaşırsa, olanaklar çok büyük olacaktır. Sadece film ve animasyon alanlarında değil, aynı zamanda konuşma ve jestlerin anlaşılmasına yönelik gelişmelere de yol açacaktır.

Yapay zekaya gelince, JL2P modeli robotlarda kullanılabilir. Örneğin, robotlar kontrol edilebilir ve ne yapmaları gerektiği söylenerek, dilin anlamını kavrayabilir ve uygun şekilde yanıt verebilirler.

Bu yeni gelişmeler birçok farklı alana etki edecek ve model, karmaşık dili anlamada daha da yetkin hale gelecek.

Alex McFarland yapay zeka muhabiri ve yazarıdır ve yapay zekadaki son gelişmeleri araştırıyor. Birçok yapay zeka başlangıç şirketi ve dünya çapındaki yayınlarda işbirliği yaptı.