Yapay zeka modelleri ve platformları
YOLO-Dünya: Gerçek Zamanlı Açık-Sözlük Nesne Algılama
Nesne algılama, bilgisayar vizyonu endüstrisinde temel bir challenge olarak kabul edilir ve robotik, görüntü anlaşılması, otonom araçlar ve görüntü tanıma gibi uygulamalarda kullanılır. Son yıllarda, AI’de yapılan çalışmalar, özellikle derin sinir ağları sayesinde, nesne algılama alanında önemli ilerlemeler kaydedilmiştir. Ancak, bu modellerin sabit bir sözlüğü vardır ve yalnızca COCO veri setinin 80 kategorisini tanıyabilirler. Bu sınırlama, nesne algılayıcıların yalnızca belirli kategorileri tanımak için eğitildiği eğitim sürecinden kaynaklanır, bu da onların uygulanabilirliğini sınırlar.
Bu sınırlamayı aşmak için, YOLO-Dünya’yı sunuyoruz, YOLO (You Only Look Once) çerçevesini açık sözlük algılama yetenekleri ile güçlendirmeyi amaçlayan yenilikçi bir yaklaşım. Bu, büyük ölçekli veri setleri üzerinde ön eğitim yaparak ve görme-dil modelleme yaklaşımını uygulayarak gerçekleştirilir. Özellikle, YOLO-Dünya, bir Re-parametrezable Görme-Dil Yol Birleştirme Ağı (RepVL-PAN) ve bölge-metin karşılaştırma kaybını kullanır, böylece dilbilimsel ve görsel bilgiler arasında etkileşim sağlar. RepVL-PAN ve bölge-metin karşılaştırma kaybı ile, YOLO-Dünya sıfır-şut ortamda geniş bir nesne yelpazesi tanıyabilir ve açık sözlük segmentasyonu ve nesne algılama görevlerinde dikkat çekici performans gösterir.
Bu makale, YOLO-Dünya’nın teknik temellerini, model mimarisini, eğitim sürecini ve uygulama senaryolarını anlaşılır bir şekilde sunmayı amaçlar. Giriş yapalım.
YOLO-Dünya: Gerçek Zamanlı Açık-Sözlük Nesne Algılama
YOLO veya You Only Look Once, modern nesne algılama yöntemleri arasında en popüler olanlardan biridir. Hız ve verimliliği ile tanınan YOLO mekanizmasının ortaya çıkışı, makinelerin resim ve videolardaki nesneleri gerçek zamanlı olarak nasıl yorumlayıp tanıdığını devrim niteliğinde bir değişiklik getirmiştir. Geleneksel nesne algılama çerçeveleri, iki adımlı bir nesne algılama yaklaşımı uygular: ilk adımda, çerçeve olası nesne bölgelerini önerir ve ikinci adımda nesneyi sınıflandırır. YOLO çerçevesi ise bu iki adımı tek bir sinir ağı modeline entegre eder, bu da çerçeveyi resme yalnızca bir kez bakarak nesne ve konumunu tahmin etmesini sağlar, böylece adı YOLO veya You Only Look Once olur.
Ayrıca, YOLO çerçevesi nesne algılamayı bir regresyon problemi olarak ele alır ve tam resimden doğrudan sınıf olasılıkları ve sınırlayıcı kutuları tahmin eder. Bu yöntemin uygulanması, yalnızca algılama hızını artırmakla kalmaz, aynı zamanda modelin karmaşık ve çeşitli verilerden genellemesini de artırır, bu da gerçek zamanlı çalışan uygulamalar için uygun bir seçim haline getirir. Son yıllarda derin sinir ağlarında kaydedilen önemli ilerlemeler de nesne algılama çerçevelerinin geliştirilmesinde önemli bir rol oynamıştır, ancak nesne algılama çerçevelerinin başarısı hala sınırlıdır, çünkü yalnızca sınırlı bir sözlüğe sahip nesneleri tanıyabilirler. Bu, nesne kategorilerinin veri setinde tanımlanması ve etiketlenmesi nedeniyle ortaya çıkar, eğitimli dedektörler yalnızca bu belirli kategorileri tanıyabilir, bu da nesne algılama modellerinin gerçek zamanlı ve açık ortamlarda uygulanabilirliğini sınırlar.
Devam ederek, son yıllarda geliştirilen görme-dil modelleri, dil kodlayıcılardan damıtılmış sözlük bilgilerini kullanarak açık sözlük algılamayı ele alır. Bu çerçeveler, geleneksel nesne algılama modellerinden daha iyi performans gösterir, ancak vẫn sınırlı uygulanabilirliğe sahiptir, çünkü eğitim veri setlerinin sözlük çeşitliliği sınırlıdır. Ayrıca, seçilen çerçeveler, açık sözlük nesne dedektörlerini büyük ölçekte eğitmeyi ve bölge düzeyinde görme-dil ön eğitimini önerir. Ancak, bu yaklaşım hala gerçek zamanlı algılama konusunda iki temel neden nedeniyle zorluklarla karşılaşır: karmaşık dağıtım süreci için kenar cihazları ve ağır hesaplama gereksinimleri. Olumlu bir not olarak, bu çerçeveler, büyük dedektörleri ön eğitim yaparak açık tanıma yetenekleri ile olumlu sonuçlar elde etmiştir.
YOLO-Dünya çerçevesi, yüksek etkili açık sözlük nesne algılamayı gerçekleştirmeyi ve geleneksel YOLO dedektörlerinin açık sözlük nesne algılamasını artırmak için büyük ölçekli ön eğitim yaklaşımlarının uygulanabilirliğini araştırmayı amaçlar. Önceki nesne algılama çalışmalarının aksine, YOLO-Dünya çerçevesi yüksek推理 hızları ile dikkat çekici verimlilik gösterir ve aşağı akış uygulamalarında kolayca dağıtılabilir. YOLO-Dünya modeli, geleneksel YOLO mimarisini takip eder ve girdi metinlerini bir ön eğitimli CLIP metin kodlayıcısı kullanarak kodlar. Ayrıca, YOLO-Dünya çerçevesi, görüntü ve metin özelliklerini güçlendirmek için bir Re-parametrezable Görme-Dil Yol Birleştirme Ağı (RepVL-PAN) bileşenini mimarisine dahil eder.
Çıktı aşamasında, çerçeve metin kodlayıcısını kaldırır ve metin gömme noktalarını RepVL-PAN ağırlıklarına yeniden parametreleştirir, bu da etkili dağıtımı sağlar. Çerçeve ayrıca, geleneksel YOLO modelleri için açık sözlük ön eğitim yöntemlerini incelemek amacıyla bölge-metin karşılaştırma öğrenimi içerir. Bölge-metin karşılaştırma öğrenimi, görüntü-metin veri setlerini, zemine veri setlerini ve algılama veri setlerini bölge-metin çiftlerine birleştirir. Buna dayanarak, YOLO-Dünya çerçevesi, bölge-metin çiftleri üzerinde ön eğitim yaparak açık ve büyük sözlük algılamada dikkat çekici yetenekler gösterir. Ayrıca, YOLO-Dünya çerçevesi, gerçek zamanlı ve gerçek dünya senaryolarında açık sözlük nesne algılamasının verimliliğini artırmak amacıyla bir tetikle-sonra-tanıma paradigması araştırır.
Aşağıdaki resimden de görülebileceği gibi, geleneksel nesne dedektörleri, önceden tanımlanmış kategorilere sahip kapalı bir sözlük algılamasına odaklanırken, açık sözlük dedektörleri metin gömme noktalarını kullanarak açık sözlük algılamayı gerçekleştirir. Karşılaştırıldığında, YOLO-Dünya’nın tetikle-sonra-tanıma yaklaşımı, kullanıcılarınOffline bir sözlüğü oluşturmasına olanak tanır, bu da dedektörlerin gerçek zamanlı olarakOffline sözlüğü yorumlamasını sağlar.

YOLO-Dünya : Yöntem ve Mimari
Bölge-Metin Çiftleri
Geleneksel nesne algılama çerçeveleri, YOLO ailesi dahil, genellikle örnek etiketlemeleri kullanarak eğitilir, bu etiketlemeler kategori etiketleri ve sınırlayıcı kutular içerir. Buna karşılık, YOLO-Dünya çerçevesi, örnek etiketlemelerini bölge-metin çiftleri olarak yeniden formüle eder, burada metin nesnenin açıklaması, isimlendirilmiş ifadeler veya kategori adı olabilir. YOLO-Dünya çerçevesinin hem metin hem de görüntü girişleri ve çıktı olarak predicted kutular ile entspreching nesne gömme noktalarını çıkardığını belirtmek önemlidir.
Model Mimari
Temel olarak, YOLO-Dünya modeli bir Metin Kodlayıcısı, bir YOLO dedektörü ve bir Re-parametrezable Görme-Dil Yol Birleştirme Ağı (RepVL-PAN) bileşeninden oluşur, aşağıdaki resimde gösterildiği gibi.

Girdi metni için, metin kodlayıcısı metni metin gömme noktalarına kodlar, ardından YOLO dedektörü, girdi resminden çok ölçekli özellikleri çıkarır. RepVL-PAN bileşeni, metin ve özellik gömme noktaları arasındaki çapraz-modality birleştirme ile metin ve görüntü temsilini güçlendirir.
YOLO Dedektörü
YOLO-Dünya modeli, mevcut YOLOv8 çerçevesi üzerine kurulmuştur, bu da Darknet omurga bileşeni, nesne gömme noktaları ve sınırlayıcı kutu regresyonu için bir başlık ve çok ölçekli özellik piramidi için bir Path Aggression Network (PAN) içerir.
Metin Kodlayıcısı
Verilen bir metin için, YOLO-Dünya modeli, bir ön eğitimli CLIP Transformer metin kodlayıcısı kullanarak karşılık gelen metin gömme noktalarını çıkarır. YOLO-Dünya çerçevesinin bir CLIP metin kodlayıcısı benimsemesinin temel nedeni, görsel nesnelerle metinleri bağlamak için geleneksel metin-sadece dil kodlayıcılardan daha iyi görsel-anlamsal performansı sunmasıdır. Ancak, girdi metni bir açıklama veya bir refere eden ifade ise, YOLO-Dünya modeli, ifadelere fede etmek için daha basit bir n-gram algoritması kullanır. Bu ifadelere sonra metin kodlayıcısına beslenir.
Metin Karşılaştırma Başlığı
Ayrılmış başlık, önceki nesne algılama modelleri tarafından kullanılan bir bileşendir ve YOLO-Dünya çerçevesi, sabit sayıda nesne için nesne gömme noktaları ve sınırlayıcı kutuları regresyonu için çift 3×3 konvolüsyonlu bir ayrılmış başlık kullanır. YOLO-Dünya modeli, L2 normalizasyon yaklaşımını ve metin gömme noktalarını kullanarak nesne-metin benzerliğini elde etmek için bir metin karşılaştırma başlığını kullanır. Ayrıca, YOLO-Dünya modeli, bir kayma faktörü ve öğrenilebilir bir ölçek faktörü ile afin dönüşüm yaklaşımını kullanır, bu da L2 normalizasyon ve afin dönüşümün, bölge-metin eğitimi sırasında modelin stabilitesini artırmasına yardımcı olur.
Çevrimiçi Sözlük Eğitimi
Eğitim aşamasında, YOLO-Dünya modeli her bir mozaik örneği için bir çevrimiçi sözlük oluşturur, bu örnekler her biri 4 resim içerir. Model, mozaik resimlerdeki tüm olumlu isimlikleri örnekler ve bazı olumsuz isimlikleri rastgele ilgili veri setinden örnekler. Her örnek için sözlük, en fazla n isim içerir, varsayılan değer 80’dir.
Offline Sözlük Çıktısı
Çıktı aşamasında, YOLO-Dünya modeli,Offline sözlüğü ile birlikte tetikle-sonra-tanıma stratejisi sunar, bu da modelin verimliliğini daha da artırır. Kullanıcı, önce olası kategorileri veya açıklamaları içeren özel tetikleyicileri tanımlar. YOLO-Dünya modeli, bu tetikleyicileri metin kodlayıcısı kullanarak kodlar veOffline sözlük gömme noktalarını elde eder. Sonuç olarak,Offline sözlük çıkışı, modelin her girdi için hesaplamaları yapmasını engeller ve modelin sözlüğü gereksinimlere göre esnek bir şekilde ayarlamasını sağlar.
Re-parametrezable Görme-Dil Yol Birleştirme Ağı (RevVL-PAN)
Aşağıdaki şekil, önerilen Re-parametrezable Görme-Dil Yol Birleştirme Ağı’nın yapısını gösterir, bu ağ, üstten alta ve alttan üste giden yolları kullanarak çok ölçekli özellik piramidini oluşturur.

Görüntü ve metin özellikleri arasındaki etkileşimi artırmak için, YOLO-Dünya modeli, bir Görüntü-Havuzlama Dikkati ve bir Metin-Rehberli CSPLayer (Cross-Stage Partial Layers) önerir, bu da görsel-anlamsal temsilin açık sözlük yetenekleri için iyileştirilmesini amaçlar. Çıktı aşamasında, YOLO-Dünya modeli,Offline sözlük gömme noktalarını RepVL-PAN ağırlıklarına yeniden parametreleştirir, bu da etkili dağıtımı sağlar.
Yukarıdaki şekilden de görülebileceği gibi, YOLO-Dünya modeli, üstten alta veya alttan üste birleştirme之后 CSPLayer’ı kullanır ve metin rehberliğini çok ölçekli görüntü özelliklerine dahil eder, bu da Metin-Rehberli CSPLayer’ı oluşturur. Herhangi bir görüntü özelliği ve karşılık gelen metin gömme noktası için, model, son bottleneck bloğundan sonra maksimum-sigmoid dikkatini kullanır ve metin özelliklerini görüntü özelliklerine birleştirir. Güncellenmiş görüntü özelliği, daha sonra çapraz-stage özelliklerine eklenir ve çıktı olarak sunulur.
Devam ederek, YOLO-Dünya modeli, görüntü özelliklerini birleştirerek metin gömme noktasını güncellemek için Görüntü-Havuzlama Dikkati katmanını sunar, bu da metin gömme noktalarını görüntü-bilinçli bilgilerle güçlendirir. Görüntü özelliklerine doğrudan çapraz-dikkat kullanmak yerine, model, çok ölçekli özelliklerde maksimum havuzlama kullanır ve 3×3 bölgeleri elde eder, bu da 27 yama tokeni oluşturur ve model, metin gömme noktalarını bir sonraki adımda günceller.
Ön Eğitimi Şemaları
YOLO-Dünya modeli, iki temel ön eğitimi şeması takip eder: Bölge-Metin Karşılaştırma Kaybından Öğrenme ve Görüntü-Metin Verileri ile Sahte Etiketleme. İlk ön eğitimi şeması için, model, verilen metin ve mozaik örnekleri için nesne tahminleri ile birlikte çıktı üretir. YOLO-Dünya çerçevesi, tahminleri zemine truths ile eşleştirir ve görev-atama etiketlemesini takip eder, bireysel olumlu tahminlere metin dizini olarak hizmet eden bir sınıflandırma etiketi atar. Diğer taraftan, Görüntü-Metin Verileri ile Sahte Etiketleme ön eğitimi şeması, bölge-metin çiftleri oluşturmak için görüntü-metin çiftlerini kullanmak yerine otomatik bir etiketleme yaklaşımı önerir. Önerilen etiketleme yaklaşımı üç adımdan oluşur: isimlendirilmiş ifadeleri çıkarma, sahte etiketleme ve filtreleme. İlk adım, girdi metninden isimlendirilmiş ifadeleri çıkarmak için n-gram algoritmasını kullanır, ikinci adım, verilen isimlendirilmiş ifade için bireysel resimlere sahte kutular oluşturmak için ön eğitimli açık sözlük dedektörünü kullanır, üçüncü ve son adım, bölge-metin ve metin-görüntü çiftlerinin alakalılığını değerlendirmek için ön eğitimli bir CLIP çerçevesini kullanır, ardından model, alakasız pseudo-resimler ve etiketlemeleri filtreler.
YOLO-Dünya : Sonuçlar
YOLO-Dünya modeli ön eğitimli olduktan sonra, sıfır-şut ortamda LVIS veri setinde doğrudan değerlendirilir, LVIS veri seti 1200’den fazla kategori içerir, bu da mevcut çerçevelerin büyük sözlük algılamasında performanslarını test etmek için kullandıkları ön eğitim veri setlerinden daha fazladır. Aşağıdaki şekil, YOLO-Dünya çerçevesinin bazı mevcut nesne algılama çerçeveleri ile LVIS veri setinde sıfır-şut ortamda performansını gösterir.

Görülebileceği gibi, YOLO-Dünya çerçevesi, çoğu mevcut çerçeveden daha iyi推理 hızları ve sıfır-şut performansı gösterir, hatta daha fazla veri içeren Grounding DINO, GLIP ve GLIPv2 gibi çerçevelerle karşılaştırıldığında. Genel olarak, sonuçlar, küçük nesne algılama modellerinin, yalnızca 13 milyon parametre ile YOLO-Dünya-S gibi, görme-dil görevleri için ön eğitimde dikkat çekici açık sözlük yetenekleri ile kullanılabileceğini gösterir.
Son Düşünceler
Bu makalede, YOLO-Dünya’yı tanıttık, bu, YOLO veya You Only Look Once çerçevesini açık sözlük algılama yetenekleri ile güçlendirmeyi amaçlayan yenilikçi bir yaklaşımdır. Özellikle, YOLO-Dünya çerçevesi, bir Re-parametrezable Görme-Dil Yol Birleştirme Ağı (RepVL-PAN) ve bölge-metin karşılaştırma kaybını kullanarak dilbilimsel ve görsel bilgiler arasındaki etkileşimi sağlar. RepVL-PAN ve bölge-metin karşılaştırma kaybı ile, YOLO-Dünya çerçevesi sıfır-şut ortamda geniş bir nesne yelpazesi tanıyabilir ve açık sözlük segmentasyonu ve nesne algılamada dikkat çekici performans gösterir.












