Robotik ve fiziksel yapay zeka

Makine Öğrenimi Modeli Nesne İlişkilerini Anlar

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Massachusetts Teknoloji Enstitüsü (MIT) araştırmacıları, bir sahnedeki nesneler arasındaki temel ilişkileri anlayan yeni bir makine öğrenimi (ML) modeli geliştirdiler. Model, bireysel ilişkileri birer birer temsil eder ve ardından temsil edilenleri birleştirmek suretiyle genel sahneyi tanımlar.

Bu yeni yaklaşım sayesinde, ML modeli metin açıklamalarından daha doğru görüntüler oluşturabilir ve bunu, sahnedeki birden fazla proje birbirleriyle farklı ilişkiler içinde düzenlendiğinde bile yapabilir.

Bu yeni gelişme önemlidir, çünkü birçok derin öğrenme modeli, bireysel nesneler arasındaki karmaşık ilişkileri anlamaktan acizdir.

Ekibin modeli, endüstriyel robotların çok adımlı manipülasyon görevleri gerçekleştirmesi gereken durumlarda, örneğin öğeleri istiflemesi veya cihazları monte etmesi gereken durumlarda kullanılabilir. Ayrıca makinelerin sonunda çevrelerinden öğrenmesine ve insanlarla aynı şekilde etkileşime girmesine de yol açar.

Yilun Du, Bilgisayar Bilimi ve Yapay Zeka Laboratuvarı’nda (CSAIL) doktora öğrencisi ve makalenin ortak lider yazarıdır. Du, araştırmasını Shuang Li ile birlikte yürüttü, Li de CSAIL’de doktora öğrencisidir ve Nan Liu, Illinois Üniversitesi’nde Urbana-Champaign’de yüksek lisans öğrencisidir. Araştırmaya ayrıca Joshua B. Tenenbaum, Bilişsel Bilim ve Hesaplama Profesörü ve Bilişsel Bilim ve Hesaplama Bölümünde Paul E. Newton Kariyer Geliştirme Profesörü ve kıdemli yazar Antonio Torralba, Delta Elektronik Profesörü ve Elektrik ve Bilgisayar Mühendisliği Profesörü katıldı. Tenenbaum ve Torralba her ikisi de CSAIL üyesidir.

Yeni Çerçeve

“Bir masaya baktığımda, XYZ konumunda bir nesne olduğunu söyleyemem. Zihinlerimiz öyle çalışmaz. Zihinlerimizde, bir sahneyi anladığımızda, aslında nesneler arasındaki ilişkileri temel alarak anlarız. Nesneler arasındaki ilişkileri anlayabilen bir sistem inşa ederek, bu sistemi daha etkili bir şekilde kullanabileceğimizi ve çevrelerimizi değiştirebileceğimizi düşünüyoruz” diyor Du.

Yeni çerçeve, nesnelerin ve ilişkilerinin metin açıklamasına dayalı olarak bir sahne görüntüsü oluşturabilir.

Sistem, bu cümleleri daha küçük parçalara ayırabilir, her bir ilişkiyi ayrı ayrı modelleyebilir ve parçaları birleştirerek bir optimizasyon süreci aracılığıyla sahnenin görüntüsünü oluşturabilir.

Cümleler daha kısa parçalara ayrıldığında, sistem bunları farklı şekillerde yeniden birleştirebilir ve böylece daha önce karşılaşmadığı sahne açıklamalarına uyum sağlayabilir.

“Diğer sistemler, tüm ilişkileri holistik olarak alır ve açıklamadan tek bir görüntü oluşturur. Ancak bu tür yaklaşımlar, daha fazla ilişki içeren açıklamalar gibi dağıtımdan outside açıklamalar için başarısız olur, çünkü bu modeller gerçekten tek bir görüntü oluşturmak için adapte olamaz. Ancak biz bu ayrı, daha küçük modelleri birleştirdiğimiz için, daha fazla ilişki modelleyebilir ve yeni kombinasyonlara adapte olabiliriz” diyor Du.

Sistem bu işlemi tersine de gerçekleştirebilir. Bir görüntüye beslendiğinde, sahnedeki nesneler arasındaki ilişkileri tanımlayan metin açıklamalarını bulabilir.

Modelin Değerlendirilmesi

Araştırmacılar, insanların oluşturulan görüntülerin orijinal sahne açıklamasına uyup uymadığını değerlendirmesini istedi. Açıklamalar üç ilişki içerdiğinde, ki bu en karmaşık türdü, katılımcıların %91’i yeni modelin diğer derin öğrenme yöntemlerinden daha iyi performans gösterdiğini söyledi.

“İlginç bir şey keşfettik, modelimiz için cümlelerimizi bir ilişki açıklamasından iki, üç veya hatta dört açıklamaya artırabiliriz ve yaklaşımımız hala bu açıklamalarla doğru bir şekilde tanımlanan görüntüler oluşturabilir, diğer yöntemler ise başarısız olur” diyor Du.

Model, daha önce karşılaşmadığı açıklamalarla çalışma yeteneğini de gösterdi.

“Bu çok umut verici, çünkü bu, insanların nasıl çalıştığına daha yakındır. İnsanlar sadece birkaç örnek görebilir, ancak bu birkaç örneğinden yararlı bilgi çıkarabilir ve onları birleştirebiliriz, böylece sınırsız kombinasyonlar oluşturabiliriz. Modelimiz de az veri öğrenerek daha karmaşık sahneler veya görüntü oluşturmalarına genelleyebilme özelliğine sahiptir” diyor Li.

Ekibin modelini daha karmaşık gerçek dünya görüntülerinde test etmesi ve sonunda modeli robotik sistemlere entegre etme yollarını keşfetmesi planlanmaktadır.

Alex, Unite.AI'nin yapay zeka destekli haber operasyonlarını yönetiyor; gazetecilik, araştırma ve otomasyonu birleştirerek yapay zekanın zamanında ve ölçeklenebilir bir şekilde kapsanmasını sağlıyor. Çalışması, gelişmekte olan yapay zeka gelişmelerinin verimli bir şekilde ortaya çıkarılmasını sağlarken, yayıncının editöryel standartlarını korur.