Yapay zeka modelleri ve platformları
Osprey: Piksel Düzeyinde Anlama için Görsel Talimat Ayarlaması
Son zamanlarda görsel talimat ayarlaması yöntemlerinin geliştirilmesi ile Multimodal Büyük Dil Modelleri (MLLM’ler), genel amaçlı vizyon-dil yetenekleri konusunda önemli ilerlemeler kaydetmiştir. Bu yetenekler, modern genel amaçlı görsel asistanların temel bileşenlerini oluşturmaktadır. MiniGPT-4, LLaVA, InstructBLIP gibi recent modeller, etkileyici görsel akıl yürütme ve talimat takibi yetenekleri sergilemektedir. Ancak, bu modellerin çoğunun görüntü-metin çiftlerine dayanması, mereka için bir sınırlılık oluşturmaktadır. Özellikle, piksel düzeyinde anlama yetenekleri konusunda MLLM’lerin sınırları, mereka için önemli bir engel oluşturmaktadır.
Osprey, bir maske-metin talimat eğitim yöntemi olarak, MLLM’lerin yeteneklerini genişletmeyi amaçlamaktadır. Piksel düzeyinde görsel-dil anlama yetenekleri elde etmek için, Osprey frameworkü, bir maske-tabanlı bölge-metin verisi oluşturur ve bu veriyi kullanarak, büyük dil modellerine (LLM’ler) görsel maskesi temsilini enjekte eder. Osprey frameworkü, bir CNN tabanlı CLIP modeli ve bir maske-farkında görsel çıkarıcıyı entegre eder. Bu sayede, Osprey, nesne düzeyinde ve parça düzeyinde bölgeleri anlamak için gerekli yetenekleri kazanır.
Bu makalede, Osprey frameworkünün mimarisini ve yeteneklerini inceleyeceğiz. Ayrıca, Osprey’nin çeşitli bölge anlama görevlerinde nasıl performans gösterdiğini de ele alacağız.
Osprey: Piksel Düzeyinde Anlama için Görsel Talimat Ayarlaması
Multimodal Büyük Dil Modelleri gibi MiniGPT-4, Otter, Qwen-LV, InstructBLIP ve diğerleri, genel amaçlı görsel asistanlar geliştirmek için ön plana çıkan modellerdir. Ancak, MLLM’ler, ince görsel anlama görevlerinde (örneğin, kaptiyonlama, bölge sınıflandırma ve akıl yürütme) yeterli performans göstermemektedir. Bu durumun temel nedeni, bölge düzeyinde hizalama eksikliğidir. Recent MLLM’ler gibi GPT4RoI, Shikra ve diğerleri, nesne düzeyinde anlama yetenekleri kazandırmak için, bounding box’lar ile belirtilen bölgeleri işler ve görsel talimat ayarlaması ile uzaysal özellikler kullanmaktadır.
Osprey: Yöntem ve Mimari
Osprey frameworkünün mimarisi, büyük bir dil modeli, piksel düzeyinde maske-farkında görsel çıkarıcı ve bir görüntü düzeyinde vizyon kodlayıcısından oluşur.
Convolutional CLIP Görsel Kodlayıcı
Osprey frameworkü, bir CNN tabanlı CLIP modeli kullanır. Bu model, multimodal büyük dil modellerinde yaygın olarak kullanılan ViT tabanlı CLIP modelinin yerine geçer. CNN tabanlı CLIP modeli, farklı girdi çözünürlüklerinde genelleme yetenekleri sergiler ve hızlı çıkarım ve verimli eğitim sağlar.
Maske-Farkında Görsel Çıkarıcı
Osprey frameworkü, maske-farkında görsel çıkarıcıyı kullanarak, piksel düzeyinde bölge özelliklerini çıkarır. Bu çıkarıcı, maske düzeyinde görsel özellikleri kodlar ve ayrıca her bölgenin uzaysal konum bilgilerini toplar.
LLM Tokenization
Osprey frameworkü, büyük dil modelleri için girdi dillerini tokenize eder. Metin girdileri için, framework, önceden eğitilmiş LLM tokenizatörleri kullanır ve sonra tokenize edilmiş metin dizilerini metin gömme uzayına projeler.
Osprey: Üç Aşamlı Eğitim Süreci
Osprey frameworkü, üç aşamlı bir eğitim süreci kullanır. Her aşama, bir sonraki token tahmini kaybını en aza indirerek denetlenir.
Aşama 1: Görüntü-Metin Hizalama Eğitim
İlk aşama, CNN tabanlı CLIP vizyon kodlayıcısını ve görüntü-metin bağdaştırıcısını kullanarak, görüntü ve dil özelliklerini hizalar.
Aşama 2: Maske-Metin Hizalama Ön-Eğitim
İkinci aşama, maske-farkında görsel çıkarıcıyı kullanarak, dil gömme uzayında maske tabanlı bölge özelliklerini hizalar.
Aşama 3: Sonlu Ayarlanma
Üçüncü ve son aşama, büyük dil modelini, maske tabanlı bölge özellik çıkarıcısını ve görüntü düzeyinde vizyon kodlayıcısını, kullanıcı talimatlarını takip etme yeteneklerini geliştirmek için ayarlar.
Osprey: Deneysel Sonuçlar
Osprey frameworkünün yeteneklerini değerlendirmek için, çeşitli deneyler yapılmıştır. Bu deneyler, Osprey’nin sınıflandırma, piksel düzeyinde bölge tanıma ve karmaşık açıklamalar gibi görevlerde nasıl performans gösterdiğini göstermektedir.
Açık-Sözlük Segmentation
Açık-sözlük segmentation, maske tabanlı bölge tanıma ve ilgili kategoriyi açıkça üretme amacını taşır. Osprey, bu görevde state-of-the-art multimodal büyük dil modellerini geçerek, önemli bir başarı elde etmiştir.
Bölge Nesne Sınıflandırma
Bölge nesne sınıflandırma görevinde, Osprey frameworkü, bir görüntüdeki belirli bir bölgedeki nesneyi sınıflandırmak için kullanılır. Osprey, bu görevde de state-of-the-art modelleri geçerek, önemli bir başarı elde etmiştir.
Ayrıntılı Bölge Açıklaması
Ayrıntılı bölge açıklaması görevinde, Osprey frameworkü, bir görüntüdeki belirli bir bölgenin açıklamasını üretmek için kullanılır. Osprey, bu görevde de state-of-the-art modelleri geçerek, önemli bir başarı elde etmiştir.
Bölge Düzeyinde Kaptiyonlama
Bölge düzeyinde kaptiyonlama görevinde, Osprey frameworkü, bir görüntüdeki belirli bir bölgenin kaptiyonunu üretmek için kullanılır. Osprey, bu görevde de state-of-the-art modelleri geçerek, önemli bir başarı elde etmiştir.
Son Düşünceler
Bu makalede, Osprey frameworkünün yeteneklerini ve mimarisini incelemiş olduk. Osprey, MLLM’lerin yeteneklerini genişletmek için, piksel düzeyinde görsel-dil anlama yetenekleri elde etmeyi amaçlamaktadır. Osprey frameworkü, bir maske-tabanlı bölge-metin verisi oluşturur ve bu veriyi kullanarak, büyük dil modellerine görsel maskesi temsilini enjekte eder. Osprey, bir CNN tabanlı CLIP modeli ve bir maske-farkında görsel çıkarıcıyı entegre eder. Bu sayede, Osprey, nesne düzeyinde ve parça düzeyinde bölgeleri anlamak için gerekli yetenekleri kazanır.












