Yapay zeka modelleri ve platformları
Uni3D: 3D Temsili Öğrenmenin Birleşmiş Keşfi
Metin ve görsellerin temsilinin ölçeklendirilmesi, son yıllarda araştırma konusunun önemli bir parçası haline gelmiştir. Geçmişte yapılan geliştirmeler ve araştırmalar, dil öğrenimi ve görme konusunda birçok devrime yol açmıştır. Ancak, metin ve görsel temsilinin ölçeklendirilmesine rağmen, 3D sahneler ve nesnelerin temsilinin ölçeklendirilmesi yeterli ölçüde tartışılmamıştır.
Bugün, 3D temsili öğrenmeyi birleştiren bir 3D temel modeli olan Uni3D’yi tartışacağız. Uni3D çerçevesi, 2D ViT veya Vision Transformer kullanarak, görüntü-metin özelliklerini 3D nokta bulutu özellikleriyle hizalamak için sonuna kadar önceden eğitilmiş bir çerçevedir.
Uni3D çerçevesi, ön görevler ve basit bir mimari kullanarak, önceden eğitilmiş 2D modelleri ve görüntü-metin hizalı modellerini başlangıç ve hedef olarak kullanmak için büyük potansiyeli ortaya koyar. Bu yaklaşım, 2D modellerinin ve stratejilerinin 3D dünyasına ölçeklendirilmesini sağlar.
Bu makalede, 3D bilgisayar görme ve Uni3D çerçevesi hakkında daha derinlemesine bilgi vereceğiz, temel kavramları ve modelin mimarisini keşfedeceğiz. Şimdi başlayalım.
Uni3D ve 3D Temsili Öğrenme: Bir Giriş
Son birkaç yılda, bilgisayar görme, AI endüstrisinin en çok yatırım yapılan alanlarından biri haline gelmiştir. 2D bilgisayar görme çerçevelerindeki önemli ilerlemelerin ardından, geliştiriciler 3D bilgisayar görme alanına odaklanmışlardır. Bu alan, özellikle 3D temsili öğrenme, bilgisayar grafikleri, makine öğrenimi, bilgisayar görme ve matematik gibi disiplinlerin birleşimini içerir. 3D sensörlerin, özellikle LiDAR’ın geliştirilmesi ve AR/VR endüstrisinde yaygın olarak kullanılması, 3D temsili öğrenmenin dikkat çekmesine neden olmuştur. Potansiyel uygulamaları her gün artmaktadır.
Mevcut çerçeveler, 3D model mimarisi, görev odaklı modelleme ve öğrenme hedefleri konusunda önemli ilerlemeler kaydetmiştir. Ancak, çoğu 3D mimarisi küçük ölçekli veri, parametre ve görev senaryolarıyla sınırlıdır. Ölçeklendirilebilir 3D temsil öğrenmenin zorluğu, gerçek zamanlı uygulamalarda çeşitli ortamlarda uygulanabilirlik konusunda devam etmektedir.
Son birkaç yılda, büyük dil modellerinin ölçeklendirilmesi, doğal dil işleme alanını devrimleştirerek büyük ilerlemeler kaydetmiştir. Ayrıca, veri ve model ölçeklendirme tekniklerini kullanarak dil modelinden 2D modele doğru ilerleme, geliştiricilerin 3D temsil öğrenmesine benzer bir başarı elde etmelerine olanak tanır.
Uni3D, büyük ölçekli 3D temsil öğrenmeyi hedefleyen bir 3D temel modeldir. Çerçevede, 2D ViT veya Vision Transformer kullanılarak, görüntü-metin özellikleriyle 3D nokta bulutu özelliklerini hizalamak için sonuna kadar önceden eğitilmiş bir çerçevedir. Aşağıdaki şekil, Uni3D çerçevesinin zero-shot doğruluğunu parametrelerle karşılaştırır. Uni3D çerçevesi, 3D temsilini 6 milyondan över bir milyara ölçeklendirir.

Uni3D çerçevesi, 2D ViT veya Vision Transformer kullanarak, görüntü-metin özellikleriyle 3D nokta bulutu özelliklerini hizalamak için sonuna kadar önceden eğitilmiş bir çerçevedir. Çerçevede, ön görevler ve basit bir mimari kullanarak, önceden eğitilmiş 2D modelleri ve görüntü-metin hizalı modellerini başlangıç ve hedef olarak kullanmak için büyük potansiyeli ortaya koyar.
- Modeli 6M’den över bir milyara parametre ölçeklendirme.
- 2D başlatma, görsel self-önceden eğitimden metin denetimine.
- Metin-görsel hedef modelini 150 milyondan över bir milyara parametre ölçeklendirme.
Esnek ve birleşik Uni3D çerçevesi altında, geliştiriciler her bir bileşenin performansında tutarlı bir artış gözlemlemektedir. Büyük ölçekli 3D temsil öğrenme, paylaşılan 2D ve ölçeklendirme stratejilerinden de büyük ölçüde yararlanmaktadır.
Aşağıdaki şekil, Uni3D çerçevesinin önceki sanat eserleriyle karşılaştırıldığında, az-shot ve zero-shot ayarlarında performansında bir artış gösterdiğini gösterir. Uni3D çerçevesinin, ModelNet’te %88’in üzerinde bir zero-shot sınıflandırma doğruluğu elde ettiği ve birçok devlet-sanat denetim yönteminin performansıyla eşdeğer olduğu unutulmamalıdır.

Ayrıca, Uni3D çerçevesi diğer temsilci 3D görevlerde, parça segmentasyonu ve açık dünya anlayışında da üstün performans ve doğruluk sağlar. Uni3D çerçevesi, 2D ve 3D görme arasında köprü kurmayı ve çoklu modalite birleşimini sağlamak için, basit bir ön-eğitim yaklaşımı kullanarak büyük ölçekli 3D temel modelleri ölçeklendirerek daha güçlü 3D temsil öğrenmeyi hedeflemektedir.
Uni3D: İlgili Çalışmalar
Uni3D çerçevesi, önceki 3D temsil öğrenme ve temel modellerden ilham alır ve öğrenir.
3D Temsili Öğrenme
3D temsil öğrenme yöntemi, 3D nesnelerin anlaşılması için bulut noktalarını kullanır ve bu alan, geliştiriciler tarafından yakın zamanda büyük ölçüde keşfedilmiştir. Bu yöntemler, sınırlı veri ile çalışır ve genellikle 3D’den 2D’ye veya NLP’ye çoklu temsil araştırmazlar.
Ancak, CLIP çerçevesinin, kontrastlı öğrenme yöntemiyle raw metinden görsel kavramları öğrenmede yüksek verimlilik sağladığı ve 3D temsil öğrenmeye doğru ilerlediğini görmek mümkündür.
Temel Modeller
Geliştiriciler, çoklu modalite temsilini ölçeklendirerek ve birleştiren temel modeller tasarlamak için yoğun bir şekilde çalışmaktadır. Örneğin, NLP alanında, geliştiriciler, önceden eğitilmiş dil modellerini ölçeklendirme üzerine çalışmaktadır ve bu, NLP endüstrisini yavaş yavaş devrimleştiriyor.
2D görme alanında da ilerlemeler kaydedilmektedir, çünkü geliştiriciler, veri ve model ölçeklendirme tekniklerini kullanarak dil modelinden 2D modele doğru ilerlemeyi sağlamaktadır. Ancak, 3D modelleri için bu çerçeveleri tekrarlamak zordur, çünkü 3D verisi sınırlıdır ve 3D çerçevelerini birleştirmek ve ölçeklendirme zorlukları vardır.
Uni3D: Yöntem ve Mimarisi

Aşağıdaki şekil, Uni3D çerçevesinin genel bir görünümünü gösterir. Geliştiriciler, 70 milyondan fazla metin ve 10 milyondan fazla görüntü ile bir milyondan fazla 3D şekli kullanarak Uni3D çerçevesini över bir milyara parametre ölçeklendirirler. Uni3D çerçevesi, 2D ViT veya Vision Transformer kullanarak, görüntü-metin özellikilerini 3D nokta bulutu özellikleriyle hizalamak için sonuna kadar önceden eğitilmiş bir çerçevedir.
Uni3D Çerçevesini Ölçeklendirme
Önceki çalışmalar, bulut noktası temsil öğrenmesinin, belirli model mimarilerini tasarlayarak ve sınırlı veri ile çalışarak, daha iyi performans elde etmeye odaklanmıştır. Ancak, 3D’de ölçeklendirilebilir ön-eğitim araştırmaları, sınırlı 3D verisi nedeniyle önemli sonuçlar elde edilememiştir. Uni3D çerçevesi, vanilla transformer yapısını kullanarak, 2D veya NLP ölçeklendirme stratejilerini model boyutunu ölçeklemek için kullanabilir.

Önceki çalışmalar, bulut noktası temsil öğrenmesinin, belirli model mimarilerini tasarlayarak ve sınırlı veri ile çalışarak, daha iyi performans elde etmeye odaklanmıştır. Ancak, 3D’de ölçeklendirilebilir ön-eğitim araştırmaları, sınırlı 3D verisi nedeniyle önemli sonuçlar elde edilememiştir. Uni3D çerçevesi, vanilla transformer yapısını kullanarak, 2D veya NLP ölçeklendirme stratejilerini model boyutunu ölçeklemek için kullanabilir.
Uni3D’yi Başlatma
Önceki çalışmalarda, 3D temsil öğrenmesinin ölçeklendirilmesinde, büyük model boyutları nedeniyle ortaya çıkan zorluklar, yani hội tụ ve aşırı uyarlama sorunları, önemli bir engel teşkil etmiştir. Bu sorunu aşmak için, 3D arka planları, belirli 3D ön görevlerle önceden eğitmek ve önceden eğitilmiş parametreleri başlatmak etkili bir yaklaşımdır. Ancak, bu yaklaşım yüksek eğitim maliyetleri ile birlikte gelir ve 3D verisi sınırlı olduğu için, çapraz modal öğrenme için güçlü bir başlatma sağlamak zordur.
Uni3D çerçevesi, ViT’ye benzer bir vanilla transformer yapısını kullanır. Bu yaklaşım, Uni3D çerçevesinin, diğer modalitelerle önceden eğitilmiş büyük modelleri doğal olarak benimsemesine olanak tanır.
Çoklu Modal Hizalama
Uni3D çerçevesi, OpenShape ve ULIP çerçevelerine benzer paradigmalara dayanarak, görüntü, dil ve bulut noktaları arasında çoklu modal hizalama öğrenmeye çalışır. Ayrıca, diğer yöntemlerle adil bir karşılaştırma yapmak için, OpenShape tarafından oluşturulan toplu 3D veri kümesini eğitim için kullanır. Bu toplu veri kümesi, 4 farklı 3D veri kümesinden oluşur:
- Objaverse.
- ShapeNet.
- 3D-FUTURE.
- ABO.
Deneysel Sonuçlar
Uni3D çerçevesi, çeşitli ayarlarında ve görevlerde, özellikle zero-shot ve few-shot ayarlarında, açık dünya anlayışında ve daha fazlasında test edilmiştir. Şimdi, bu sonuçlara daha yakından bakalım.
Sıfır Atış Şekil Sınıflandırması
Uni3D çerçevesinin zero-shot şekil sınıflandırma performansını değerlendirmek için, geliştiriciler, ModelNet, ScanObjNN ve Objaverse-LVIS benchmark veri kümeleri üzerinde deneyler gerçekleştirmişlerdir. ModelNet ve ScanObjNN, sınıflandırma görevleri için yaygın olarak kullanılan veri kümeleridir ve sırasıyla 15 ve 40 nesne kategorisini içerir. Objaverse-LVIS benchmark veri kümesi ise, 40.000’den fazla nesne ve 1.100’den fazla kategori içeren, temizlenip açıklamalı bir veri kümesidir. Çerçeveler arasındaki karşılaştırma aşağıdaki şekildedir ve Uni3D çerçevesinin, farklı ayarlarında önceki sanat eserlerini önemli ölçüde aştığı görülmektedir.

Az Atış Doğrusal Sondalama
AI’de, doğrusal sondalama, bir çerçevenin veya modelin öğrendiği temsilin değerini belirlemek için kullanılan bir yöntemdir. Uni3D’nin doğrusal sondalama yeteneğini değerlendirmek için, geliştiriciler, OpenShape ile aynı ayarları kullanarak, Uni3D çerçevesinin parametrelerini dondurmuş ve ardından Uni3D için bir doğrusal sınıflandırıcı eğitmiştir. Aşağıdaki şekil, farklı çerçevelerin Objaverse-LVIS veri kümesi üzerindeki doğrusal sondalama yeteneklerini gösterir ve modelin 10 farklı rastgele tohum üzerindeki ortalama performansını gösterir. Uni3D çerçevesinin, farklı az-shot ayarlarında mevcut yöntemleri önemli ölçüde aştığı görülmektedir.

Açık Dünya Anlama
Uni3D çerçevesinin gerçek dünya nesnelerini ve şekillerini anlamak için yeteneğini değerlendirmek için, geliştiriciler, ScanNet ve CLIP veri kümelerini kullanmışlardır. Ground truth anlık segmentasyonun mevcut olduğu ve her bir sahnenin bireysel anlık segmentasyonunu tanımak amaçlandığı unutulmamalıdır. Sonuçlar aşağıdaki şekildedir ve Uni3D çerçevesinin, gerçek dünya anlayışında ve tanınmada üstün sonuçlar elde ettiği görülmektedir. Uni3D çerçevesi, mevcut çerçeveleri önemli ölçüde aşmaktadır,尽管 gerçek dünya veri kümeleri üzerinde eğitim görülmemiştir.

Çapraz Modal Alma
Uni3D çerçevesi tarafından öğrenilen çoklu modal temsil, 3D şekilleri metin veya görüntü sorgularından doğal olarak almasına olanak tanır. 3D şekilleri almak için, model, 3D şekillerin gömme noktaları ile sorgu metni veya görüntüsünün gömme noktaları arasındaki kosin benzerliğini hesaplar. Ardından, KNN veya K En Yakın Komşu algoritmasını kullanarak, sorguya en benzer 3D şekilleri üretir ve sonuçlar aşağıdaki şekildedir. Uni3D çerçevesinin, gerçek dünya görüntülerini kullanarak 3D şekilleri başarılı bir şekilde aldığını görmek mümkündür.

İlk sütunda, çerçeve iki sorgu görüntüsünü kullanarak, sorgu görüntülerine en benzer 3D şekilleri üretir. İkinci sütunda, çerçeve iki girdi görüntüsünü kullanarak, her iki girdi görüntüsüne benzeyen 3D şekilleri alır. Son sütunda, model, sorgu metinlerini kullanarak, sorgu metinlerine en benzer 3D şekilleri üretir.
Son Düşünceler
Bu makalede, över bir milyara parametre, 10 milyondan fazla görüntü ve 70 milyondan fazla metin ile bir milyondan fazla 3D şekli kullanarak büyük ölçekli 3D temsil öğrenmeyi hedefleyen bir 3D temel modeli olan Uni3D’yi tartıştık. Geliştiriciler, 2D veya NLP ölçeklendirme stratejilerini kullanarak model boyutunu ölçeklemek için vanilla transformer yapısını kullanmışlardır. Ayrıca, Uni3D çerçevesi, 2D çerçevelerinin ve stratejilerinin 3D dünyasına ölçeklendirilmesine olanak tanır. Deneysel sonuçlar, Uni3D çerçevesinin, çeşitli ayarlarında ve görevlerde, özellikle zero-shot ve few-shot ayarlarında, açık dünya anlayışında ve daha fazlasında üstün sonuçlar elde ettiğini göstermiştir.












