Yapay zeka modelleri ve platformları
Intel Labs Bilgisayar Görme Gelişimini İki Yeni Yapay Zeka Modeli ile İlerletiyor

VI-Depth 1.0 ve MiDaS 3.1 açık kaynaklı yapay zeka modelleri, bilgisayar görme için derinlik tahmini işlemini geliştiriyor.
Derinlik tahmini, robotik, artırılmış gerçeklik (AR) ve sanal gerçeklik (VR) gibi bir dizi uygulama oluşturmak için gerekli olan zorlu bir bilgisayar görme görevidir. Mevcut çözümler genellikle mesafeleri doğru bir şekilde tahmin etmekte zorluk çeker, bu da görsel navigasyon için hareket planlamak ve engellerden kaçınmak açısından kritik bir yönüdür. Intel (INTC ) Labs araştırmacıları, monoküler derinlik tahmini için iki yapay zeka modeli yayınlayarak bu sorunu ele alıyor: biri görsel-inersiyel derinlik tahmini için ve diğeri de güçlü göreceli derinlik tahmini (RDE) için.
En son RDE modeli, MiDaS sürüm 3.1, yalnızca bir resim kullanarak güçlü göreceli derinlik tahmini yapıyor. Büyük ve çeşitli bir veri kümesiyle eğitildiği için daha geniş bir dizi görev ve ortamda verimli bir şekilde çalışabiliyor. MiDaS’ın en son sürümü, daha büyük bir eğitim kümesi ve güncellenmiş kodlayıcı sırtları ile RDE için model doğruluğunu yaklaşık %30 oranında artırıyor.
MiDaS, birçok projeye entegre edildi, en dikkat çekici olanı Stable Diffusion 2.0, burada derinlik-görüntü özelliğini etkinleştirmektedir ve bir girdi resminin derinliğini çıkarır ve ardından hem metin hem de derinlik bilgisini kullanarak yeni resimler oluşturur. Örneğin, dijital yaratıcı Scottie Fox, bir kombinasyon olan Stable Diffusion ve MiDaS kullanarak 360 derecelik bir VR ortamı oluşturdu. Bu teknoloji, adli vakaların suç sahnesi yeniden yapılandırması, sağlık hizmetleri için terapötik ortamlar ve etkileşimli oyun deneyimleri gibi yeni sanal uygulamalara yol açabilir.
RDE genel olarak iyi bir genelleme yeteneğine sahiptir ve faydalıdır, ancak ölçek eksikliği, haritalama, planlama, navigasyon, nesne tanıma, 3D yeniden yapılandırma ve resim düzenleme gibi metrik derinlik gerektiren aşağı akış görevleri için faydasını azaltır. Intel Labs araştırmacıları, bu sorunu ele almak için VI-Depth adlı başka bir yapay zeka modeli yayınlıyor.
VI-Depth, monoküler derinlik tahmini ve görsel-inersiyel odometri (VIO) birleştiren bir görsel-inersiyel derinlik tahmini pipeline’dir ve metrik ölçekle yoğun derinlik tahmini üretir. Bu yaklaşım, sahne yeniden yapılandırması, haritalama ve nesne manipülasyonu için doğru derinlik tahmini sağlar.
Inersiyel veri birleştirmek, ölçek belirsizliğini çözmeye yardımcı olabilir. Çoğu mobil cihaz zaten inersiyel ölçüm birimleri (IMU) içerir. Küresel hizalama uygun küresel ölçeği belirler, mentre yoğun ölçek hizalama (SML) yerel olarak çalışır ve bölgeleri doğru metrik derinliğe doğru iter veya çeker. SML ağı, MiDaS’ı bir kodlayıcı sırtı olarak kullanır. Modüler pipeline’da, VI-Depth veri ile sürülen derinlik tahmini ile MiDaS göreceli derinlik tahmini modelini birleştirir ve ayrıca IMU sensör ölçüm birimini birleştirir. Veri kaynaklarının birleşmesi, VI-Depth’in bir resmin her pikseli için daha güvenilir yoğun metrik derinlik üretmesine olanak tanır.
MiDaS 3.1 ve VI-Depth 1.0 açık kaynaklı MIT lisansı altında GitHub’da mevcuttur.
Daha fazla bilgi için, “Vision Transformers for Dense Prediction” ve “Towards Robust Monocular Depth Estimation: Mixing Datasets for Zero-shot Cross-dataset Transfer” makalelerine başvurun.












