Yapay zeka modelleri ve platformları
LLaVA-UHD: Herhangi Bir Aspect Oranında ve Yüksek Çözünürlükte Görüntüleri Etkin Bir Şekilde Algılar
Büyük Dil Modellerinin yakın zamanda gösterdiği ilerleme ve gelişme, görme-dil akıl yürütme, anlama ve etkileşim yeteneklerinde önemli bir artışa neden oldu. Modern çerçeveler, bu yetenekleri gerçekleştirmek için görsel sinyalleri Büyük Dil Modellerine (LLM) besleyerek onları görsel olarak dünyayı yorumlayabilme yeteneğine sahip kılar. Bu, görsel kodlama stratejilerinin önemli bir rol oynadığı çeşitli senaryolardır. Ancak gerçek dünya görüntüleri sadece çeşitli senaryolara sahip olmakla kalmaz, aynı zamanda çözünürlük ve en boy oranları açısından önemli ölçüde farklılık gösterir, bu da LLM’ler için çeşitli alanlar ve görevler açısından önemli zorluklar oluşturur. Gerçek dünya görüntülerindeki önemli varyansı ele almak için modern büyük dil modelleri, genellikle 224×224 gibi düşük bir çözünürlükte ve 1:1 gibi sabit bir en boy oranında görüntüleri algılar. Bu fedakarlık, LLM’lerin gerçek dünya uygulamalarında genellemesini artırmaya yardımcı olsa da, genellikle görüntülerin contentsini önemli ölçüde bulanıklaştırır ve şiddetli şekil bozulmasına neden olur. Bu, özellikle optik karakter tanıma ve küçük nesne anlama gibi ince görevler için optimize edilen büyük çok modelli modellerin veya LMM’lerin yeteneklerini azaltır. Ayrıca, çözünürlük ve en boy oranı önceden belirlendiğinden, modeller yalnızca bulanık görüntüleri tahmin edebilir, bu da model hallucinasyonuna yol açar, yani model görsellerde temellenmeyen metinsel yanıtlar üretir.
Bu makalede, LLaVA-UHD adlı bir yaklaşımı ele alacağız. LLaVA-UHD, LLaVA-1.5 ve GPT-4V çerçevelerini temsilatif örnekler olarak alır ve görsel kodlama stratejilerindeki sistematik hataları ortaya çıkarmaya çalışır. LLaVA-UHD çerçevesi, bir çok modelli modeldir ve bu zorlukları ele almaya yönelik bir girişimdir. LLaVA-UHD çerçevesi, yüksek çözünürlükte ve herhangi bir en boy oranında görüntüleri algılayabilir. LLaVA-UHD çerçevesi, üç ana bileşenden oluşur. İlk olarak, yerel çözünürlük görüntülerini daha küçük değişken boyutlu dilimlere bölen bir görüntü modülleme stratejisi, verimliliği artırmak ve kodlamayı uzatmak amacıyla tasarlanmıştır. İkincisi, görsel kodlayıcılar tarafından üretilen görüntü tokenlerini daha da-condensing bir sıkıştırma modülü. Son olarak, büyük dil modelleri için dilim tokenlerini organize eden bir uzaysal şema. Kapsamlı deneyler, LLaVA-UHD çerçevesinin 9 testte devlet-sanat büyük dil modellerini geçebileceğini gösteriyor. Ayrıca, yalnızca %94 çıkarım hesabını kullanarak, LLaVA-UHD çerçevesi 6 kat daha büyük çözünürlükte görüntüleri destekleyebilir, yani 672×1088.
LLaVA-UHD: Herhangi Bir Aspect Oranında ve Yüksek Çözünürlükte Görüntüleri Etkin Bir Şekilde Algılar
Görme-dil akıl yürütme, anlama ve etkileşim, yakın zamanda büyük dil modellerinin ilerlemesi nedeniyle önemli bir ilerleme gösterdi. Modern çerçevelerde, bu yetenekleri gerçekleştirmek için görsel sinyaller Büyük Dil Modellerine (LLM) beslenerek onları görsel olarak dünyayı yorumlayabilme yeteneğine sahip kılar. Bu, görsel kodlama stratejilerinin önemli bir rol oynadığı çeşitli senaryolardır. Ancak gerçek dünya görüntülerindeki farklı senaryolar, sadece çeşitli senaryolara sahip olmakla kalmaz, aynı zamanda çözünürlük ve en boy oranları açısından önemli ölçüde farklılık gösterir, bu da LLM’ler için çeşitli alanlar ve görevler açısından önemli zorluklar oluşturur.
LLaVA-UHD çerçevesi, LLaVA-1.5 ve GPT-4V çerçevelerini temsilatif örnekler olarak alır ve görsel kodlama stratejilerindeki sistematik hataları ortaya çıkarmaya çalışır. LLaVA-UHD çerçevesi, bir çok modelli modeldir ve bu zorlukları ele almaya yönelik bir girişimdir. LLaVA-UHD çerçevesi, yüksek çözünürlükte ve herhangi bir en boy oranında görüntüleri algılayabilir. LLaVA-UHD çerçevesi, üç ana bileşenden oluşur. İlk olarak, yerel çözünürlük görüntülerini daha küçük değişken boyutlu dilimlere bölen bir görüntü modülleme stratejisi, verimliliği artırmak ve kodlamayı uzatmak amacıyla tasarlanmıştır. İkincisi, görsel kodlayıcılar tarafından üretilen görüntü tokenlerini daha da-condensing bir sıkıştırma modülü. Son olarak, büyük dil modelleri için dilim tokenlerini organize eden bir uzaysal şema.

Yukarıdaki görüntü, GPT-4V’nin bir görüntüdeki nesne sayısını belirleme deneylerinin sonuçlarını yansıtır. LLaVA-UHD çerçevesinin temelinde, üç bileşen bulunur. İlk olarak, yerel çözünürlük görüntülerini daha küçük değişken boyutlu dilimlere bölen bir görüntü modülleme stratejisi, verimliliği artırmak ve kodlamayı uzatmak amacıyla tasarlanmıştır. İkincisi, görsel kodlayıcılar tarafından üretilen görüntü tokenlerini daha da-condensing bir sıkıştırma modülü. Son olarak, büyük dil modelleri için dilim tokenlerini organize eden bir uzaysal şema.
LLaVA-UHD: Yöntem ve Mimarisi
GPT-4V ve LLaVA-1.5 gibi mevcut çerçeveler hakkında bazı pilot deneylerden elde edilen bilgiler temelinde, LLaVA-UHD çerçevesi, aşağıdaki görüntüde gösterilen üç bileşenli bir mimari uygular.

İlk olarak, yerel çözünürlük görüntülerini daha küçük değişken boyutlu dilimlere bölen bir görüntü modülleme stratejisi, verimliliği artırmak ve kodlamayı uzatmak amacıyla tasarlanmıştır. İkincisi, görsel kodlayıcılar tarafından üretilen görüntü tokenlerini daha da-condensing bir sıkıştırma modülü. Son olarak, büyük dil modelleri için dilim tokenlerini organize eden bir uzaysal şema. Şimdi bu bileşenlere daha yakından bakalım.
Modüler Görsel Kodlama
Yüksek çözünürlükte ve farklı en boy oranındaki görüntüleri işlemek için bir ortak yaklaşım, Vision Transformer veya ViT’nin konum gömme embeddings’ini doğrudan kodlama için hedef şekle interpolate etmektir. Ancak, bu yaklaşımın uygulanması genellikle yüksek hesaplama maliyetleri ile birlikte gelir ve dağılım dışı sorunlar performansı daha da azaltır. Bu zorluğu ele almak için, LLaVA-UHD çerçevesi, yerel çözünürlük görüntülerini daha küçük değişken boyutlu dilimlere bölen bir modüler görsel kodlama stratejisi sunar. LLaVA-UHD çerçevesi, değişken boyutlu dilimlerin kullanımını sağlayarak, yerel çözünürlük görüntülerine tam olarak adapte olmayı başarır ve hiçbir şekil bozulmasına, yeniden boyutlandırmasına veya doldurmasına gerek kalmaz.
Ayrıca, çoğu mevcut LLM, görüntü dilimlerini kodlamak için statik bir çözünürlük kullanır, bu da modelin yerel çözünürlüklere tam olarak adapte olmasını engeller, çünkü sadece birkaç önceden tanımlanmış sabit şekil dilimine erişebilirler. Ayrıca, statik dilim çözünürlüğü, modelin performansı, verimliliği ve doğruluğunu olumsuz etkiler, çünkü kaçınılmaz olarak şekil bozulmasına, yeniden boyutlandırmasına veya doldurmasına neden olur. Bu sorunu ele almak için, LLaVA-UHD çerçevesi, görüntü dilimlerini, bölme stratejisi tarafından tanımlanan en boy oranında kodlamak önerir. Daha spesifik olarak, LLaVA-UHD çerçevesi, orijinal görüntüyü, görsel kodlayıcıların önceden tanımlanmış konum gömme embeddings’ine uyan şekilde, orantılı olarak yeniden boyutlandırır ve ardından görsel kodlayıcıların 1D konum gömme embeddings’ini, 2D formatına dönüştürür.
Sıkıştırma Katmanı
Yüksek çözünürlükte görüntüleri işlemek için bir ortak sorun, LLM’lerin işlemesi gereken görsel tokenlerin miktarının önemli ölçüde fazla olmasıdır (örneğin, LLaVA-1.5 çerçevesi, 672×1008 çözünürlükte bir görüntüyü işlerken yaklaşık 3500 görsel token üretir), bu da önemli bir hesaplama kaynağı ve maliyeti oluşturur. Bu zorluğu ele almak için, LLaVA-UHD modeli, görsel tokenleri sıkıştırmak için bir paylaşılan perceiver resampler katmanı uygular. Model, daha sonra, görsel kodlayıcıların çıktısını, daha düşük bir sayıya örnekleyen bir dizi sorgu vektörü uygular. Mevcut Multilayer Perceptron tabanlı görsel proje stratejilerine kıyasla, LLaVA-UHD tarafından uygulanan perceiver örneklemesi, görüntünün çözünürlüğü ne olursa olsun, görsel tokenlerin sayısını sabit ve makul bir seviyede tutmayı başarır, bu da LLaVA-UHD çerçevesini yüksek çözünürlükte görüntü işleme ve anlama görevleri için daha uygun hale getirir. Örneğin, LLaVA-UHD çerçevesi, 672×1008 çözünürlükte bir görüntüyü kodlarken, LLaVA-1.5 çerçevesinin 336×336 çözünürlükte bir görüntüyü kodlarken ürettiği aynı miktarda tokeni üretir, bu da yaklaşık 6 kat daha hiệuktir.
Görüntü Dilimlerinin Uzaysal Şeması
Görüntü dilimlerinin uzaysal organizasyonunu büyük dil modeline bildirmek önemlidir, çünkü görüntülerin bölünmesi dinamiktir. LLaVA-UHD çerçevesi, iki özel token kullanarak LLM’ye dilimlerin göreli konumunu bildiren bir uzaysal şema tasarlar. Bu uzaysal şemada, LLaVA-UHD çerçevesi, bir satırdaki dilim temsililerini ayırmak için “,” kullanır ve farklı satırları “n” ile ayırır.
LLaVA-UDH: Deneyler ve Sonuçlar
LLaVA-UHD çerçevesi, genel görsel soru cevaplandırma testleri, optik karakter tabanlı görsel soru cevaplandırma testleri, hallucinasyon testi ve kapsamlı testler dahil 9 popüler testte değerlendirilir. Ayrıca, LLaVA-UHD çerçevesi, LLaVA-1.5, MiniGPT-v2, InstructBLIP, BLIP-2 ve daha birçok güçlü temel çerçevelerle karşılaştırılır.
LLaVA-UHD çerçevesinin 9 popüler testteki performansı özetlenir ve popüler testlerle karşılaştırılır. Sonuçlar aşağıdaki tabloda gösterilir.

Bu sonuçlara dayanarak, LLaVA-UHD çerçevesinin güçlü temel modelleri geçebildiği ve daha büyük miktarda veri üzerinde eğitilen güçlü genel temel modelleri geçebildiği söylenebilir. İkincisi, sonuçlar ayrıca LLaVA-UHD çerçevesinin LLaVA-1.5 mimarisinden önemli ölçüde daha iyi sonuçlar elde ettiğini gösterir. LLaVA-1.5, yalnızca 336×336 çözünürlükte ve sabit bir en boy oranında görüntüleri desteklerken, LLaVA-UHD çerçevesi 672×1088 çözünürlükte ve herhangi bir en boy oranında görüntüleri destekler ve aynı miktarda görsel tokeni üretir.


Son Düşünceler
Bu makalede, LLaVA-UHD adlı bir yaklaşımı ele aldık. LLaVA-UHD, LLaVA-1.5 ve GPT-4V çerçevelerini temsilatif örnekler olarak alır ve görsel kodlama stratejilerindeki sistematik hataları ortaya çıkarmaya çalışır. LLaVA-UHD çerçevesi, bir çok modelli modeldir ve bu zorlukları ele almaya yönelik bir girişimdir. LLaVA-UHD çerçevesi, yüksek çözünürlükte ve herhangi bir en boy oranında görüntüleri algılayabilir. LLaVA-UHD çerçevesi, üç ana bileşenden oluşur. İlk olarak, yerel çözünürlük görüntülerini daha küçük değişken boyutlu dilimlere bölen bir görüntü modülleme stratejisi, verimliliği artırmak ve kodlamayı uzatmak amacıyla tasarlanmıştır. İkincisi, görsel kodlayıcılar tarafından üretilen görüntü tokenlerini daha da-condensing bir sıkıştırma modülü. Son olarak, büyük dil modelleri için dilim tokenlerini organize eden bir uzaysal şema. Kapsamlı deneyler, LLaVA-UHD çerçevesinin 9 testte devlet-sanat büyük dil modellerini geçebileceğini gösteriyor. Ayrıca, yalnızca %94 çıkarım hesabını kullanarak, LLaVA-UHD çerçevesi 6 kat daha büyük çözünürlükte görüntüleri destekleyebilir, yani 672×1088.












