Yapay zeka modelleri ve platformları

Araştırmacılar Derin Öğrenmeyi Kullanarak Anıtsal Fotoğrafları 4D’ye Dönüştürüyor

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Cornell Üniversitesi’ndeki araştırmacılar, dünya anıtlarının fotoğraflarını 4D’ye dönüştürmek için derin öğrenmeyi kullanan yeni bir yöntem geliştirdiler. Ekibin Roma’daki Trevi Çeşmesi gibi önemli noktaların turist fotoğraflarına güveniyor ve sonuçlar manevra kabiliyetine sahip 3D görüntüler ve zaman içinde görünen değişikliklerdir.

Yeni geliştirilen yöntem, etiketlenmemiş ve tarih verilmemiş on binlerce fotoğrafı alıyor ve sentezliyor ve bu, bilgisayar vizyonu için büyük bir adım ileriye doğru.

Çalışma “Crowdsampling the Plenoptic Function” olarak adlandırıldı ve 23-28 Ağustos tarihleri arasında düzenlenen sanal Avrupa Bilgisayar Vizyonu Konferansı’nda sunuldu.

Noah Snavely, Cornell Tech’te bilgisayar bilimi yardımcı doçenti ve makalenin kıdemli yazarı. Diğer katkıda bulunanlar arasında makalenin ilk yazarı Cornell doktor öğrencisi Zhengqi Li, bilgisayar bilimi yardımcı doçenti Abe Davis ve Cornell Tech doktor öğrencisi Wenqi Xian yer alıyor.

“Bu, sahneyi modellemenin yeni bir yolu, sadece başınızı hareket ettirmenize ve mesela çeşmeyi farklı açılardan görmeye izin veriyor, aynı zamanda zamanı değiştirmek için kontroller sunuyor” dedi Snavely.

“Gerçekten Trevi Çeşmesi’ne tatile gittiyseniz, görünümü gittiğiniz saatle ilgili olacaktı – gece, alttan sel floodlight’ları ile aydınlatılacaktı. Öğleden sonra, güneşli olacaktı, bulutlu bir günde gitmediyseniz” diye devam etti. “Bu dağınık fotoğraf koleksiyonlarından zaman ve hava durumuna bağlı olarak tüm görünüm aralığını öğrendik, böylece sahneyi keşfedebilir ve aynı zamanda sahne içinde hareket edebilirsiniz.”

Geleneksel Bilgisayar Vizyonu Sınırlamaları

Geleneksel bilgisayar vizyonu, birçok farklı tekstürün yeniden üretilmesi gerektiği için, fotoğraflar aracılığıyla yerleri doğru bir şekilde temsil etmekte zorlanıyor.

“Gerçek dünya, görünümü ve çeşitli materyalleri ile çok çeşitli – parlayan şeyler, su, ince yapılar” dedi Snavely.

Geleneksel bilgisayar vizyonu, tutarlı olmayan verilerle de mücadele ediyor. Plenoptik fonksiyon, bir şeyin uzay ve zamanın her olası bakış açısında nasıl göründüğünü açıklıyor, ancak bunu yeniden üretmek için sahnedeki yüzlerce webcam gerekiyor. Sadece bu değil, aynı zamanda gün boyunca ve gece boyunca kayıt yapıyor olmaları gerekiyor. Bu yapılabilir, ancak birçok sahne için bu yöntemin gerekli olduğu kaynak miktarı aşırı derecede yüksek.

Diğer Fotoğraflardan Öğrenme

Araştırmacılar ekibi, bu sorunu aşmak için yeni bir yöntem geliştirdi.

“Veri setinde tam olarak bu görüş açısında 16:00’da çekilmiş bir fotoğraf olmayabilir. Bu nedenle, bir konumda 21:00’de çekilmiş bir fotoğraftan ve başka bir konumda 16:03’te çekilmiş bir fotoğraftan öğreniyoruz” dedi Snavely. “Ve bu fotoğrafların ne zaman çekildiğini bilmiyoruz. Ancak derin öğrenmeyi kullanarak, herhangi bir zamanda ve yerde sahnenin nasıl görüneceğini çıkarabiliriz.”

Araştırmacılar, dört boyutlu görünümü interpolasyon için Deep Multiplane Images olarak adlandırılan yeni bir sahne temsili tanıttı.

Snavely’ye göre, “2B animasyonda 3B efektleri oluşturmak için icat edilen aynı fikir, gerçek dünya sahnelerinde 3B efektleri oluşturmak için bu derin çok katmanlı görüntüyü oluşturmak için tüm bu farklı ölçümlerden turisti fotoğraflarına uyduruyoruz. İlginç bir şekilde, bu çok eski, klasik teknikten kaynaklanıyor.”

Çalışma, eğitilmiş modelin çeşitli sitelerden 50.000 kamu fotoğrafıyla bir sahne oluşturabileceğini gösterdi. Ekibin inancına göre, bu, bilgisayar vizyonu araştırmaları ve sanal turizm dahil olmak üzere birçok alanda sonuçlar doğurabilir.

“Gerçekten orada olduğunuzu hissedebilirsiniz” dedi Snavely. “Çok çeşitli sahneler için şaşırtıcı bir şekilde iyi çalışıyor.”

Proje, eski Google (GOOGL ) CEO’su ve filantropist Eric Schmidt ve Wendt Schmidt’ten destek aldı.

https://www.youtube.com/watch?v=MAVFKWX8LYo&feature=emb_title

Alex, Unite.AI'nin yapay zeka destekli haber operasyonlarını yönetiyor; gazetecilik, araştırma ve otomasyonu birleştirerek yapay zekanın zamanında ve ölçeklenebilir bir şekilde kapsanmasını sağlıyor. Çalışması, gelişmekte olan yapay zeka gelişmelerinin verimli bir şekilde ortaya çıkarılmasını sağlarken, yayıncının editöryel standartlarını korur.