Yapay zeka modelleri ve platformları
Yeni Tekniğin AI 3D Nesneleri Tanıma Konusunda Yardımcı Olması

North Carolina State Üniversitesi’ndeki araştırmacılar tarafından geliştirilen yeni bir teknik, yapay zeka (AI) programlarının 3D nesneleri tanıma yeteneğini geliştiriyor. MonoCon olarak adlandırılan bu teknik, aynı zamanda AI’nin 2D görüntüler kullanarak 3D nesnelerin birbirleriyle olan ilişkilerini öğrenmesine yardımcı oluyor.
MonoCon, otonom araçların 2D görüntülerden faydalanarak diğer araçların etrafından navigasyon yapmasına yardımcı olmak gibi geniş bir uygulama yelpazesine sahip olabilir. Ayrıca imalat ve robotik alanlarında da önemli bir rol oynayabilir.
Tianfu Wu, ilgili araştırma makalesinin yazarlarından biri ve North Carolina State Üniversitesi’nde elektrik ve bilgisayar mühendisliği yardımcı profesörü.
“3D bir dünyada yaşıyoruz, ancak bir fotoğraf çektiğimizde, bu dünyayı 2D bir görüntü olarak kaydediyoruz” diyor Wu.
“AI programları, kameralardan görsel girdi alırlar. Bu nedenle, AI’nin dünyayla etkileşime girmesini istiyorsak, 2D görüntülerin 3D uzay hakkında neler anlatabileceğini yorumlayabilmesi gerektiğini garantilememiz gerekir. Bu araştırmada, bu zorluğun bir parçası üzerinde odaklanıyoruz: AI’nin 2D görüntülerde 3D nesneleri -örneğin insanları veya arabaları- doğru bir şekilde tanıtabilmesi ve bu nesneleri uzayda yerleştirebilmesi,” diye devam ediyor Wu.
Otonom Araçlar
Otonom araçlar genellikle 3D uzayı navigasyon için lidar kullanır. Lidar, uzaklıkları ölçmek için lazerleri kullanır ve pahalıdır, bu nedenle otonom sistemler çok fazla yedeklilik içermez. Bir sürücüsüz arabaya dozens of lidar sensörleri eklemek inanılmaz derecede pahalı olur.
“Ancak, bir otonom aracın görsel girdileri kullanarak uzayı navigasyon yapabilmesi mümkün olsaydı, yedeklilik ekleyebilirdik” diyor Wu. “Kameralar lidardan çok daha ucuz olduğu için, sisteme ek kameralar eklemek ekonomik olarak mümkün olurdu ve bu da sistemi daha güvenli ve daha güçlü hale getirecekti.
“Bu, bir pratik uygulama olabilir. Ancak, bu çalışmanın temel olarak ilerlemesinden de heyecan duyuyoruz: 2D nesnelerden 3D verilerin elde edilebileceği.”
AI’yi Eğitme
MonoCon, 2D görüntülerde 3D nesneleri tanımlayabilir ve bunları bir “sınırlayıcı kutu” içine yerleştirerek AI’ye nesnenin dış kenarlarını bildirir.
“Çalışmamızın ayırt edici özelliği, AI’yi nasıl eğittiğimizdir, bu da önceki eğitim tekniklerine dayanır” diyor Wu. “Önceki çabalar gibi, AI’yi eğittiğimiz sırada nesneleri 3D sınırlayıcı kutulara yerleştiriyoruz. Ancak, AI’ye yalnızca kamera-nesne uzaklığını ve sınırlayıcı kutuların boyutlarını tahmin etmesini istemiyoruz, aynı zamanda her bir kutunun sekiz noktasının konumlarını ve merkezi etrafındaki iki boyutlu uzaklıklarını da tahmin etmesini istiyoruz. Buna ‘yardımcı bağlam’ diyoruz ve bu yardımcı bağlamın, AI’nin 2D görüntülerden 3D nesneleri daha doğru bir şekilde tanımlamasına yardımcı olduğunu bulduk.
“Önerilen yöntem, ölçü teorisi中的 bir teoreme, Cramér-Wold teoremine dayanıyor. Ayrıca, bilgisayar görüşündeki diğer yapılandırılmış çıktı tahmin görevlerine de uygulanabilir.”
MonoCon, KITTI olarak bilinen yaygın olarak kullanılan bir benchmark veri kümesiyle test edildi.
“Bu makaleyi sunduğumuz sırada, MonoCon, 2D görüntülerden otomobiller hakkında 3D verileri çıkaran diğer AI programlarından daha iyi performans gösteriyordu” diyor Wu.
Ekibin şimdi süreci daha büyük veri kümeleriyle ölçeklendirmeyi planlıyor.
“İleriye doğru, süreci daha büyük veri kümeleriyle ölçeklendirecek ve otonom sürüş için MonoCon’u değerlendirmek ve ayarlamak üzere çalışacağız” diyor Wu. “Ayrıca, imalat alanında uygulamaları keşfetmek istiyoruz, özellikle de robotik kollardan faydalanma gibi görevlerin performansını iyileştirebilecek miyiz diye görmek istiyoruz.”












