Yapay zeka modelleri ve platformları

Ferret: Referans ve Temel Alma Görevlerinde Üstün Performans

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Mekansal anlama yeteneğini görüntü-dil öğrenme modellerinde sağlamlaştırmak, hala temel bir araştırma zorluğu olmaya devam etmektedir. Bu anlama yeteneği, iki kritik yetenek için temel oluşturur: temel alma ve referans verme. Referans verme, modelin belirli bölgelerin semantiklerini doğru bir şekilde yorumlamasını sağlar, oysa temel alma, semantik açıklamaları kullanarak bu bölgeleri yerleştirmeyi içerir.

Geliştiriciler, Ferret adlı bir Çoklu Modal Büyük Dil Modeli (MLLM) tanıttılar. Ferret, bir görüntüdeki herhangi bir granülite veya şekle karşı mekansal referansları anlamak ve açık sözlük açıklamalarını doğru bir şekilde temel almak için tasarlandı. Ferret, görüntü bölgelerini temsil etmek için sürekli özellikler ve ayrıksı koordinatları birleştiren yeni bir hibrit temsil önerir. Mekansal farkındalıklı görsel örnekleme, farklı şekillerin gösterdiği değişken seyreklilikle başa çıkmak için tasarlandı ve böylece Ferret, serbest şekil, sınırlayıcı kutular ve noktalar gibi çeşitli bölge girişlerini işleyebilir.

Ferret’in yaklaşımı, klasik temel alma ve referans görevlerinde üstünlük sağlamasını ve diğer MLLM’leri lokalizasyon talep eden ve bölge tabanlı çoklu modal iletişim görevlerinde geçmesini sağlar. Bu makale, Ferret’in mimarisi ve metodolojisi hakkında bilgi verir ve çeşitli çoklu modal dil görevlerindeki etkileyici performansını vurgular. Gelin bunu daha derinlemesine inceleyelim.

Ferret: Referans ve Temel Alma Görevlerinde Üstün Performans

Bir modelde referans, modelin belirli bölgelerin semantiklerini doğru bir şekilde anlamasını sağlayan bir yetenektir, oysa temel alma, modelin semantik açıklamaları kullanarak bu bölgeleri yerleştirmesi için gerekli bir yetenektir. Her ne kadar farklı görevlere sahip olsalar da, referans ve temel alma aynı temel kavramı paylaşır: mekansal semantik ve bilginin hizalanması. Ancak, aynı kavramı paylaşmalarına rağmen, mevcut modeller temel alma ve referans görevlerini ayrı ayrı öğrenir. Bu yöntem çalışsa da, insan benzeri yeteneklere ulaşmayı engelleyen bir engel oluşturur, çünkü insanlar bir görevden öğrenip diğer görevlerde kolayca uygulayabilir ve temel alma/referans yeteneklerini akıl yürütme ve günlük diyalogla kolayca entegre edebilirler. Ferret çerçevesi, mevcut MLLM çerçevelerindeki bu boşluğu dikkate alır ve üç temel soru araştırır:

  1. Temel alma ve referans yeteneklerini çerçevede nasıl birleştirebilir ve bu birliktelik birbirlerini nasıl destekleyebilir?
  2. İnsanlar referans için çeşitli bölge türleri kullanır, örneğin kutu, nokta, karalama, serbest şekil. Bu çeşitli bölgeleri nasıl temsil edebiliriz?
  3. Temel alma ve referans talimatlarını takip eden, güçlü ve açık sözlük olan, pratik ve gerçek zamanlı uygulamalar için kritik olan nasıl yapabiliriz?

Ferret çerçevesi, bu sorulara yanıt vermeye çalışan yeni bir referans ve temel alma Çoklu Modal Büyük Dil Modelidir. Ferret çerçevesi, temel olarak çoklu modal büyük dil modelini seçer, çünkü bunlar dikkat çekici küresel görüş ve dil anlama yeteneklerine sahiptir. Ayrıca, temel alma ve referans yeteneklerini birleştirmek için, Ferret çerçevesi, bölgelerin koordinatlarını doğal dil numerik formunda temsil eder. Ancak, uygulamada, kutu koordinatları veya tek noktaları kullanarak serbest şekil gibi çeşitli bölge şekillerini temsil etmek verimsizdir, çünkü bu şekiller daha gelişmiş doğruluk ve evrensel insan-model etkileşimi için kritiktir. Bu sorunu çözmek için, Ferret çerçevesi, şekillerin değişken seyrekliliğini işleyebilen mekansal farkındalıklı görsel örnekleme kullanır. Çerçeve daha sonra, sürekli görsel özelliklerle ayrıksı koordinatları birleştirerek, girdi中的 görsel bölgeleri temsil etmek için hibrit bölge temsili oluşturur.

Ferret çerçevesi, yukarıda belirtilen yöntemleri kullanarak, metin ve başvurulan bölgelerin karışımını çözmek için tasarlandı ve her başvurulabilir nesne için koordinatları üretebiliyor ve bu nesneleri çıktıda temel alabiliyor. Böylece, Ferret, Çoklu Modal Büyük Dil Modellerinde serbest şekil girişlerini işleyen ilk çerçevedir. Ayrıca, Ferret çerçevesi, mekansal lokalizasyon ve anlama yeteneklerine dikkat çekici açık sözlük yetenekleri emer ve geleneksel temel alma ve referans görevlerinde üstün performans gösterir.

Ferret çerçevesi, üç mevcut AI çerçevesinden ilham alır: Çoklu Modal Büyük Dil Modelleri, Referans ve Temel Alma için MLLM’ler ve Temel Alma ve Görsel Anlama Birleştirme.

Büyük Dil Modellerinin tanıtılması, yani GPT, DALL-E, PaLM, LLaMA ve BLOOM, NLP araştırmalarında manzara değiştirdi ve çoklu modal dil modellerinde önemli ilerlemeler sağladı. Daha önceki çoklu modal dil modelleri, büyük ölçekli görüntü-metin üretimi ile sınırlı kaldı, bazı dikkat çekici örnekler PaLI, SimVLM, GIT, BLIP-2, FLAMINGO, CM3 ve PaLI-X’tir. Ancak, Flamingo çerçevesi, LLM’leri önceden eğitilmiş bir CLIP görüntü kodlayıcısı ile cross-gated dikkat blokları aracılığıyla etkili bir şekilde entegre etti ve dikkat çekici çoklu modal birkaç-shot öğrenme yetenekleri gösterdi. Mevcut araştırma, büyük dil modellerini görsel talimat ayarlaması için kullanma yollarını aramaya odaklanıyor, dikkat çekici örnekler MiniGPT-4, Otter, InstructBLIP ve daha fazlası. Ayrıca, son modeller gibi Emu ve GILL, MLLM’leri görüntü oluşturma ve görüntü geri çağırma için kullanma yeteneklerinde dikkat çekici başarı gösterdi. Ferret çerçevesi ayrıca, Vision Language modelleri için metin ve sınırlayıcı kutu çıktısını birleştirmeye odaklanan önceki araştırmalara atıfta bulunur.

Ferret: Metodoloji ve Mimarisi

Hibrit Bölge Temsili

Nokta, kutu ve serbest şekil, bir dil modelinin belirli bölgelere atıfta bulunmak için kullandığı üç baskın biçimdir. Bir yandan, nokta ve kutu formatı koordinatlar tarafından doğru bir şekilde temsil edilebilir, ancak serbest şekil daha zorlu bir görevdir, çünkü serbest şekiller çeşitli olabilir ve sadece dikdörtgen kutular veya noktalarla sınırlı değildir. Serbest şekiller, maskeler, çokgenler ve karalamalar gibi çeşitli bölgeleri içerebilir. Koordinatları kullanarak serbest şekilleri temsil etmek, modelin bölgeler ve karşılık gelen koordinatlar arasındaki ilişkiyi öğrenme yeteneğini engelleyen karmaşık ve hesaplamalı olarak pahalı bir görevdir.

Bu sorunu çözmek ve tüm üç formata genellemek için, Ferret çerçevesi, belirli bir bölgeye atıfta bulunmak için sürekli görsel özellikler ile ayrıksı koordinatları birleştiren hibrit bölge temsili önerir.

Sürekli görsel özellikler için, Ferret çerçevesi, bir bölge için aynı büyüklükte bir 2B ikili maske oluşturur, hedeflenen bölge içinde 1 değerini ve bölge dışında 0 değerini atar. Model daha sonra ikili maskeyi, çıkarılan görüntü özellik haritasıyla birlikte alır ve bunları mekansal farkındalıklı görsel örnekleme için gönderir.

Mimarisi

Ferret modelinin mimarisi üç temel bileşenden oluşur:

  1. Görüntü kodlayıcısı, görüntü gömmelerini çıkarmak için.
  2. Mekansal farkındalıklı görsel örnekleme, bölge sürekli özelliklerini çıkarmak için.
  3. Büyük dil modeli, metin, görüntü ve bölge özelliklerini birlikte modellemek için.

Görüntü, önce önceden eğitilmiş görsel kodlayıcısına girilir ve görüntü gömmeeleri çıkarılır. Metin girişleri için, çerçeve önce önceden eğitilmiş bir LLM tokenleştirici kullanır ve sonra bu tokenleri metin gömmeelerine projeler. Başvurulan bölgeler için, Ferret, bölge adı之后 özel bir token ve koordinatları sürekli özellikler için bir yer tutucu olarak ekler. Eğer bölge adı bilinmiyorsa veya karmaşıktır, çerçeve sadece bölge adını veya alan adını kullanır.

Başvurulan bölgelerle ilgili büyük bir zorluk, bunların şeklinin çok değişken olabilmesidir, yani farklı şekillerde olabilir ve sadece dikdörtgen kutular veya noktalarla sınırlı değildir. Düzensiz şekilli başvurulan bölgeler, geleneksel yöntemlerle işlenemez, örneğin ızgara tabanlı işleme veya konvolüsyon teknikleri. Bu sorunu çözmek için, Ferret çerçevesi, mekansal farkındalıklı görsel örnekleme önerir. Çıkarılan özellik haritası ve ikili bölge maskesi için, Ferret modeli önce ikili bölge maskesi içinde N sayıda nokta rastgele örnekler.

Her bir noktadan, model, bikübik enterpolasyon kullanarak özelliğini alır. N noktaları, sonra bir dizi bloktan geçirilir, her biri üç farklı aşama geçirir: örnekleme, toplama ve havuzlama. Örnekleme aşamasında, sabit bir sayıda nokta, FPS veya En Uzak Nokta Örnekleme algoritması kullanarak N sayıda noktadan örneklenir, bu da yeterli kapsama garantisi verir. İkinci adımda, her bir örnek noktası için, çerçeve, mevcut N noktadan k en yakın komşusunu arar. Her bir grup için, model sonra örnek noktasının özelliklerini komşu noktalarıyla birleştirir. Son adımda, Ferret çerçevesi, k komşu özelliklerini birleştirerek örneklenen noktanın temsilini oluşturmak için maksimum havuzlama gerçekleştirir. Bu üç adımda, Ferret çerçevesi, daha az nokta ile daha yüksek yoğunluklu özellik uzayına sahip olur, çünkü sadece yerel komşuların özelliklerini değil, aynı zamanda göreli konumlarını da içerir.

GPT Destekli Görsel Veri Oluşturma

Diyaalog talimat ayarlaması verileri, Çoklu Modal Büyük Dil Modelleri için kritiktir, çünkü bunlar sadece mevcut veri setlerini şablonlar aracılığıyla dönüştürmeye yardımcı olmaz, aynı zamanda modelin insan niyetini anlamasını ve uygun bir yanıt oluşturmasını sağlar. Çoğu MLLM, görsel talimat ayarlaması verileri elde etmek için birkaç-shot yöntemini kullanır, burada model, görüntüdeki sahnelerin metin açıklamalarını ve insan tarafından oluşturulmuş diyalogları birkaç-shot gösteriler olarak sağlar. Ancak, mevcut talimat ayarlaması yöntemleri, özellikle mekansal ilgili bilgileri açıkça belirtmeden, görüntünün tamamını açıklamaya odaklanır. Ferret çerçevesi, bölge tabanlı bilgiyi toplamak için üç adımda referans ve temel alma talimat ayarlaması verilerini vurgular.

  1. Küresel açıklamalar ve nesnelerin yanı sıra, çerçeve, bölge açıklamaları ve nesneleri arasındaki fiziksel ilişkiyi ve koordinatlarını tanımlayan sembolik sahne açıklamalarını sağlar.
  2. İnsan tarafından oluşturulmuş diyaloglar için, çerçeve, girdide veya çıktıda veya her ikisinde de başvurulabilir nesne veya bölgelerin之后 koordinatları ekler, diyaloglar özellikle belirli bölgelere odaklanır ve dil modelini benzer kalıpları yeni diyalog oluşturma için takip etmeye teşvik eder.
  3. Model tarafından oluşturulan diyalog, birkaç-shot örnekler tarafından sağlanan kalıpları ve talimatları takip etmeyebilir. Bu sorunu çözmek için, çerçeve, diyalogları model tarafından ilk olarak oluşturulanları iyileştirmek için bir dil modeli kullanır.

Mekansal Olumsuz Madencilik

Önceki araştırmalar, çoklu modal büyük dil modellerinin, Evet veya Hayır sorularına yanıt verirken hayal gücüne sahip olma olasılıklarının yüksek olduğunu gösterdi. Ferret modelinin benzer koşullarda hayal gücüne sahip olmamasını sağlamak için, Ferret çerçevesi, Mekansal Olumsuz Madencilik yaklaşımını, Görüntü Koşullu Kategori Yerelleştirme ve Anlamsal Koşullu Kategori Yerelleştirme ile birlikte kullanır. Her iki yöntem de, modelin belirli nesne kategorilerini yerleştirmesini ve görüntüdeki belirli nesnelerin yokluğunu tanımalarını sağlar.

Ferret: Sonuçlar ve Deneysel Çalışma

Performansını analiz etmek için, Ferret çerçevesi, geleneksel temel alma ve referans benchmark’lerinde değerlendirilir, daha sonra çerçeve, daha karmaşık bir çoklu modal sohbet görevinde ve başvurulan ve temel alınan yeteneklerini test etmede değerlendirilir.

Modelin başvurulan yeteneği, bir bölgeye başvurulan bir bölge verildiğinde, modelin bu başvurulan bölgenin semantiklerini nasıl doğru bir şekilde anladığını ölçmek için değerlendirilir. Modelin doğruluğunu ölçmek için, nesneler, en temel semantik olarak dikkate alınır, çünkü bunlar hem temel hem de tanımlamak kolaydır. İnsanların esnekliğini taklit etmek için, çerçeve, nesnenin konumunu görüntüde serbest bir şekil, bir kutu ve bir nokta ile değiştirir. Serbest bir şekil için, model, gerçek nesne içinde simülasyon için rastgele çizgiler oluşturur. Bir kutu için, Ferret çerçevesi, LVIS bileşeninden sağlanan gerçek sınırlayıcı kutusunu kullanır. Son olarak, bir nokta için, model, gerçek nesne içinde ve gerçek nesne sınırına yakın bir noktayı rastgele örnekler. Üç başvurulan türünün sonuçları aşağıdaki görüntüde gösterilir.

Ferret çerçevesi, başvurulan diyalog görevlerinde dikkat çekici bir performans gösterir ve çeşitli görsel öğrenme görevleriyle, özellikle de başvurulan çıktıları olan görevlerle entegrasyon için uygun bir zemin oluşturur. Modelin temel alma yeteneğini değerlendirmek için, Ferret çerçevesi önce görsel temel alma görevlerine, üretime dayalı bir paradigma ile tabi tutulur, daha sonra modelin, bölgeler ve kelimeler arasındaki hizalamayı ölçmek için temel alınan açıklama görevlerinde değerlendirilir.

Görsel temel alma görevlerinde, çerçeve, dil sorgularını görüntünün hizalı bölgelerine yerleştirmeyi amaçlar ve Ferret çerçevesi, tüm benchmark’lerde dikkat çekici bir performans gösterir, bu performans, uzmanlaşmış fine-tuning yöntemleri tarafından elde edilen performansa benzerdir.

Temel alınan açıklama görevleri için, model bir açıklama üretmeli ve sonra üretilen isim cümlelerini görüntüdeki bölgelere yerleştirmelidir. Modelin nihai tahmini, üç bileşenden oluşur: görsel bölgeler olarak kutular, metin açıklamaları ve kutular ile kelimeler arasındaki hizalama. Sonuçlar aşağıdaki görüntüde gösterilir ve Ferret çerçevesi, devlet-sanat yöntemlerine benzer bir performans sağlar.

Son olarak, çoklu modal sohbet, bir MLLM içindeki en çok arzulanan yeteneklerden biridir ve mevcut MLLM’ler, genellikle ayrıntılı açıklamaları, konuşmaları ve karmaşık akıl yürütmeyi, dil modeli bir yargıç olarak değerlendirir. Ancak, çoklu modal sohbeti, başvurulan veya temel alınan eylemlerle zorunlu kılan bir veri seti olmadığından, bir boşluk oluşur. Bu boşluğu doldurmak için, Ferret çerçevesi, başvurulan ve temel alınan yeteneklerini değerlendirmek için üç bölge tabanlı soruyu kapsar.

Son olarak, Ferret çerçevesi, devlet-sanat GPT çerçevesine doğrudan karşılaştırılır ve sonuçlar aşağıdaki görüntüde gösterilir.

Son Düşünceler

Bu makalede, başvurulan ve temel alma yeteneklerinde dikkat çekici bir performans gösteren Ferret adlı bir çoklu modal büyük dil modelinden bahsettik. Ferret çerçevesi, bir görüntüdeki herhangi bir şekle karşı başvurulan yeteneğine sahiptir ve model tarafından öngörülen metni otomatik olarak temel alabilir. Ferret, değişken seyreklilik gösteren farklı şekilleri işleyebilen mekansal farkındalıklı görsel örnekleme kullanır ve böylece Ferret, serbest şekil, sınırlayıcı kutular ve noktalar gibi çeşitli bölge girişlerini işleyebilir.

Mesleği mühendis, kalbi yazar. Kunal, AI ve ML'ye derin bir sevgi ve anlayışla technical writer, bu alanlardaki karmaşık kavramları etkileyici ve bilgilendirici belgelerle basitleştirmeye adanmış.