Yapay zeka modelleri ve platformları

MiniGPT-5: Araya Gömülü Görüntü ve Dil Oluşturma için Generatif Vokens

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Son birkaç yılda, Büyük Dil Modelleri (LLM’ler), Doğal Dil İşleme (NLP) alanında yapılan atılımlar nedeniyle dünya çapındaki AI geliştiricilerinin ilgisini çekmiştir. Bu modeller, metin oluşturma ve anlama konusunda yeni standartlar belirlemiştir. Ancak, metin oluşturma konusundaki ilerlemeye rağmen, metin anlatımlarına uyumlu görüntüler oluşturmak hala zorlu bir görevdir. Bunu çözmek için, geliştiriciler, “generatif vokens” temelinde bir vizyon ve dil oluşturma yaklaşımı geliştirdiler ve bu sayede, metin-görüntü çıktılarının uyumlu hale getirilmesi için bir köprü oluşturdular.

MiniGPT-5’in temelinde, açıklama gerektirmeyen çoklu modal veri oluşturma üzerinde odaklanan iki aşamalı bir eğitim stratejisi yer alır. Ayrıca, modelin bütünlüğünü artırmak için, geliştiriciler, vokenlerin görüntü oluşturma için etkinliğini artıran bir sınıflandırıcı-özgür rehberlik sistemi entegre ettiler. İlk aşamada, MiniGPT-5 çerçevesi, MMDialog veri kümesiyle eğitilen Divter modeline kıyasla güçlü bir performans sergiledi ve VIST veri kümesinde yapılan insan değerlendirmelerinde, multimodal çıktıların tutarlılığını ve verimliliğini sürekli olarak gösterdi.

MiniGPT5: Bir Giriş

LLM çerçevelerinin son gelişmeleriyle ve bu çerçevelere dayalı uygulamalarla birlikte, çoklu ortam özelliklerinin entegrasyonu, devlet-sanat içerik oluşturma araçlarından multimodal diyalog ajanlarına kadar çeşitli uygulamaları güçlendiren bir alandır. Sürekli araştırma ve geliştirmeyle, dil ve görüntüye dayalı modeller, metin ve görsel verilerini sorunsuz bir şekilde oluşturmak için çalışmaya başlamıştır. LLM’lerin multimodal veri oluşturma yeteneği, e-ticaret, medya ve sanal gerçeklik gibi çeşitli alanlardaki etkileşimleri artıracaktır.

Nihayetinde, modellerin metin ve görsel modelleri kullanarak tutarlı ve mantıklı bir şekilde sentezleme, tanıma ve yanıt verme yeteneğine sahip olmalarını sağlamak önemlidir. Bu, bilgi akışının uyumlu hale getirilmesini ve tutarlı anlatımların oluşturulmasını sağlar. Metin ve görsel modellerin entegrasyonu, LLM’lerde daha akıcı, etkileşimli ve entegre multimodal etkileşimler için bir ihtiyaç yaratmaktadır. Ancak, LLM’lerde entegre ve etkileşimli multimodal etkileşimleri elde etmek zorlu bir görevdir ve çeşitli zorluklarla dolu bir alandır.

  1. Mevcut LLM’ler, metin oluşturma ve metin-görüntü çiftlerini işleme konusunda oldukça verimlidir, ancak görüntü oluşturma konusunda tatmin edici bir performans sergilemez.
  2. Bu modellerin geliştirilmesi, konu odaklı verilere dayanır ve bu da modellerin oluşturduğu metinleri ilgili görsellerle uyumlu hale getirmesini zorlaştırır.
  3. Son olarak, LLM’lerin yeteneklerinin artmasıyla birlikte, özellikle aşağı akış görevlerinde, bellek gereksinimlerinin artması için daha etkili stratejiler geliştirilmelidir.

MiniGPT-5 çerçevesi, yukarıda belirtilen zorlukları çözmek için “generatif vokens” kavramını ortaya atan bir ara yüzü sunar. MiniGPT-5 çerçevesi, multimodal veri oluşturma için yeni bir yaklaşım sunar ve büyük dil modellerini Stable Diffusion teknikleriyle birleştirir. Çerçevede, özel görsel tokenler kullanılır ve bu tokenler, farklı alanlardaki uyumsuzlukları gidermek için ham görseller üzerinde doğrudan eğitim yapılmasına olanak tanır.

Ancak, MiniGPT-5 modelini mevcut çerçevelerden ayıran şey, MiniGPT-5’in genel aşamalarının alan spesifik açıklamaları içermemesidir. Ayrıca, oluşturulan metin ve ilgili görsellerin birbirleriyle uyumlu olması için, MiniGPT-5 çerçevesi, bir çift-kayıp stratejisi uygular ve bu strateji, sınıflandırıcı-özgür rehberlik ve generatif vokens kullanımını daha da geliştirir. MiniGPT-5 çerçevesi, eğitim verimliliğini optimize eder ve parametre-etkin bir fine-tuning stratejisi kullanarak bellek kısıtlamalarına çözüm getirir.

Kısaca özetlemek gerekirse, MiniGPT-5 çerçevesi

  1. Çoklu modal kodlayıcılar kullanarak, geleneksel LLM’lerden daha etkili bir yöntem sunar ve generatif tokenlerle birlikte Stable Diffusion tekniklerini kullanarak ara yüzü ve görsel çıktıları oluşturur.
  2. Açıklama gerektirmeyen multimodal çıktı oluşturma için iki aşamalı bir eğitim stratejisi sunar ve eğitim sırasında sınıflandırıcı-özgür rehberlik dahil eder.

MiniGPT-5 modeli, metin-görüntü oluşturma, çoklu modal büyük dil modelleri ve büyük dil modelleriyle multimodal veri oluşturma konularındaki önceki araştırmalardan esinlenmiştir.

  • Metin-Görüntü Oluşturma: Metin açıklamalarını ilgili görsel temsilcilere dönüştürmek için metin-görüntü modellerini kullanma.
  • Çoklu Modal Büyük Dil Modelleri: Önceden eğitilmiş LLM modellerini kullanarak multimodal veri oluşturma uygulamalarını ve etkinliğini keşfetme.
  • Çoklu Modal Oluşturma ile Büyük Dil Modelleri: Büyük dil modellerinin dil ve görsel veri oluşturma yeteneklerini entegre etmek için.

MiniGPT-5: Yöntem, Mimari ve Çerçeveler

Büyük dil modellerini çoklu modal veri oluşturma yetenekleriyle donatmak için, MiniGPT-5 modeli, metin-görüntü oluşturma modellerini ve önceden eğitilmiş çoklu modal büyük dil modellerini entegre eden bir çerçeve sunar. MiniGPT-5 çerçevesi, “generatif vokens” kavramını tanıtır ve bu tokenler, farklı alanlardaki uyumsuzlukları gidermek için ham görseller üzerinde doğrudan eğitim yapılmasına olanak tanır. Çerçevede, sınıflandırıcı-özgür rehberlik ve gelişmiş iki aşamalı eğitim yöntemi kullanılır.

Çoklu Modal Giriş Aşaması

Son yıllarda yapılan LLM geliştirmeleri, LLM’lerin çoklu modal anlama yeteneklerini ortaya çıkarmıştır ve bu da görüntüleri sıralı girdi olarak işleme yeteneği sağlar. MiniGPT-5 çerçevesi, görsel özellikler oluşturmak için özel olarak tasarlanmış generatif vokens kullanır ve bu sayede, LLM’lerin çoklu modal veri oluşturma yeteneklerini genişletir. Ayrıca, MiniGPT-5 çerçevesi, çoklu modal çıktı öğrenimi için parametre-etkin ve ileri fine-tuning tekniklerini kullanır.

Çoklu Modal Kodlama

MiniGPT-5 çerçevesindeki önceden eğitilmiş görsel kodlayıcı, her girdi görselini bir öznitelik olarak dönüştürür ve her metin tokeni bir vektör olarak gömülür. Girdi.prompt öznitelikleri, bu gömme işlemlerinin birleştirilmesiyle oluşturulur.

Büyük Dil Modellerine Voken Eklenmesi

Geleneksel olarak, büyük dil modellerinin sözlüğü yalnızca metin tokenlerinden oluşur. Bu nedenle, MiniGPT-5 çerçevesi geliştiricileri, büyük dil modellerinin sözlüğüne özel tokenler olarak generatif tokenler eklemişlerdir. Çerçevede, bu özel vokenlerin gizli çıktı durumu, sonraki görüntü oluşturma için kullanılır ve vokenlerin konumu, ara yüzü ve görsel çıktıların eklenmesini temsil eder.

PEFT veya Parametre-Etkin Fine-Tuning

PEFT veya Parametre-Etkin Fine-Tuning, LLM’leri eğitmek için kullanılan bir kavramdır, ancak multimodal ayarlar中的 uygulamaları henüz büyük ölçüde keşfedilmemiştir. MiniGPT-5 çerçevesi, MiniGPT-4 çerçevesinin kodlayıcısı üzerinde Parametre-Etkin Fine-Tuning kullanır ve bu sayede, modelin komutları veya talimatları daha iyi anlamasını ve genel performansını geliştirmesini sağlar.

Çoklu Modal Çıktı Oluşturma

Generatif modeli, generatif tokenlerle doğru bir şekilde hizalamak için, MiniGPT-5 çerçevesi, boyutları eşleştirmek ve denetim kayıplarını dahil etmek için bir sıkıştırma eşleme modülü formüle eder. Denetim kayıpları, görsel özelliklerin tokenlerle doğrudan hizalanmasını sağlar, bu da modelin tokenlerin doğru konumlarını öğrenmesini sağlar. MiniGPT-5 çerçevesindeki generatif vokenler, görseller tarafından doğrudan yönlendirilir, bu nedenle çerçeve, görsellerin kapsamlı bir açıklamasına ihtiyaç duymaz ve bu da açıklama-özgür öğrenmeyi sağlar.

Metin Alanı Oluşturma

MiniGPT-5 çerçevesi, metin alanını oluşturmak için, vokenleri ve metinleri birlikte oluşturur ve eğitim aşamasında, geliştiriciler, vokenleri zemin truth görsellerinin konumuna ekler ve modeli, metin oluşturma sırasında vokenleri tahmin etmeye eğitime tabi tutar.

Görüntü Oluşturma için Voken Özelliklerinin Eşlenmesi

Metin alanını oluşturduktan sonra, çerçeve, gizli çıktı durumunu, metin-görüntü oluşturma modelinin metin koşullu özellik alanıyla hizalar. Çerçeve, ayrıca bir özellik haritalama modülü içerir ve bu modül, bir çift-katmanlı MLP modeli, öğrenilebilir bir kodlayıcı özellik dizisi ve dört-katmanlı bir kodlayıcı-dekodlayıcı transformer modeli içerir.

LDM veya Latent Diffusion Model ile Görüntü Oluşturma

Gerekli görselleri oluşturmak için, çerçeve, eşleme özelliklerini koşullu girdi olarak kullanır. Çerçeve, ayrıca, gürültü eklenerek, zemin truth görselini önceden eğitilmiş bir VAE kullanarak bir latent özellik olarak dönüştürür ve bu özellik, gürültü azaltma işleminde kullanılır.

MiniGPT-5 çerçevesinin kapsamlı yaklaşımı, geliştiricilerin görsel ve metin öğelerini tutarlı bir şekilde oluşturmasına ve anlamasına olanak tanır. Bu, özel tokenlerin, önceden eğitilmiş modellerin yeteneklerinin ve yenilikçi eğitim tekniklerinin kullanımını içerir.

MiniGPT-5: Eğitim ve Sonuçlar

MiniGPT-5 çerçevesi üzerinde çalışılırken, geliştiriciler, sınırlı bir ara yüzü ve görsel veri kümesiyle doğrudan eğitim yapmanın, görsellerin kalitesini azaltabileceğini ve metin-görüntü uyumsuzluğuna neden olabileceğini gözlemlediler. Bu sorunu çözmek için, geliştiriciler, iki farklı eğitim stratejisi benimsemiştir.

  1. Sınıflandırıcı-özgür rehberlik tekniklerinin dahil edilmesi, generatif tokenlerin difüzyon sürecinde etkinliğini artırır.
  2. İkinci strateji, iki aşamaya ayrılmıştır
    1. İlk aşama, kabaca özelliklerin hizalanması üzerinde odaklanır.
    2. İkinci aşama, özellik öğrenimini kolaylaştırır.

CFG veya Sınıflandırıcı-Özgür Rehberlik

Multimodal oluşturma için CFG kullanımının ilk fikri, oluşturulan görseller ve metinler arasındaki tutarlılığı ve mantığı artırmak için ortaya çıktı. Bu yöntem, koşullu ve koşulsuz oluşturma için eğitim yapmanın, generatif modelin koşullu sonuçları geliştirebileceğini gözlemledi.

İki Aşamalı Eğitim Stratejisi

Metin-görüntü oluşturma ve saf metin oluşturma arasındaki önemli alan değişikliği nedeniyle, MiniGPT-5 çerçevesi, iki aşamalı bir eğitim stratejisi kullanır

  1. Tek-modal hizalama aşaması (UAS)
  2. Çoklu modal öğrenme aşaması (MLS)

İlk olarak, çerçeve, görüntü oluşturma özelliklerini, voken özellikleriyle tek metin-görüntü veri kümesinde hizalar ve bu aşamada, çerçeve, LLM’nin, kaptiyonları LLM girdisi olarak kullanarak vokenleri oluşturmasına izin verir.

UAS erfolgreich tamamlandıktan sonra, model, tek metin açıklamaları için görseller oluşturabilir, ancak metin-görüntü çiftleri ve karmaşık akıl yürütme gerektiren görüntü ve metin oluşturma konusunda zorluklarla karşılaşır. Bu zorluğu aşmak için, geliştiriciler, PEFT parametrelerini kullanarak MiniGPT-5 çerçevesini, VIST gibi ara yüzü ve görsel veri kümeleriyle fine-tune etmişlerdir. Bu aşamada, çerçeve, veri kümesinden üç farklı görev oluşturur

  1. Sadece Metin Oluşturma: Verilen sonraki görsel için ilgili metni oluşturur.
  2. Sadece Görüntü Oluşturma: Verilen sonraki metin için ilgili görseli oluşturur.
  3. Çoklu Modal Oluşturma: Verilen bağlam için metin-görüntü çiftlerini oluşturur.

MiniGPT-5: Benchmarklar ve Sonuçlar

Çoklu modal oluşturma performansını kapsamlı bir şekilde değerlendirmek için, MiniGPT-5 geliştirme ekibi, performansını diğer önemli temel modellerle, Divter, GILL ve fine-tune edilmiş tek-modal oluşturma modeliyle karşılaştırmıştır. Karşılaştırma, aşağıdaki tabloda gösterilmiştir.

MiniGPT-5 çerçevesi, multimodal çıktı oluşturma için insan girdilerini de dahil ederek performansını değerlendirmektedir. Genel olarak, MiniGPT-5 çerçevesinin çoklu modal görevlerdeki etkinliği, üç perspektiften ölçülmektedir.

  1. Dil Devamlılığı: Oluşturulan içeriğin verilen bağlamla uyumlu bir şekilde hizalanmasını değerlendirir.
  2. Görüntü Kalitesi: Oluşturulan görselin ilgili ve netliğini değerlendirir.
  3. Çoklu Modal Uygunluk: Birleşik metin-görüntü çıktısının ilk bağlamla uyumlu olup olmadığını belirler.

VIST Son Aşama Değerlendirmesi

Deneylerin ilk aşamasında, MiniGPT-5 çerçevesi, ilgili görselleri oluşturmayı amaçlar ve aşağıdaki tablo, bu ayarlamadan elde edilen sonuçları özetler.

Görülebileceği gibi, MiniGPT-5 çerçevesi, üç ayarlamada da, fine-tune edilmiş SD2 çerçevesini aşarak, MiniGPT-5 pipelineının etkinliğini vurgular.

Üstteki şekil, MiniGPT-5 çerçevesinin, fine-tune edilmiş MiniGPT-4 çerçevesiyle, S-BERT, Rouge-L ve Meteor performans ölçütlerinde karşılaştırmalı performansını gösterir. Sonuçlar, generatif vokenlerin kullanımının, multimodal anlama görevlerinde çerçevenin performansını olumsuz etkilemediğini gösterir. Ayrıca, MiniGPT-5 çerçevesinin, geniş bir veri yelpazesinde, uzun-yatay multimodal girdi.promptlarını kullanarak, yüksek kaliteli ve tutarlı görseller oluşturabildiğini, ancak orijinal modelin multimodal anlama yeteneğini bozmadan gösterir.

Üstteki tablo, 5.000 örnek için, çoklu modal oluşturma açısından, Çoklu Modal Uygunluk, Görüntü Kalitesi ve Dil Devamlılığı açısından, üç çerçevesinin performansını karşılaştırır. Görülebileceği gibi, MiniGPT-5 çerçevesi, diğer iki temel modeli, %70’den fazla durumda aşar. Aşağıdaki tablo, CC3M doğrulama veri kümesinde, tek görsel oluşturma için MiniGPT-5 çerçevesinin performansını gösterir. Veri kısıtlamaları nedeniyle, geliştiriciler, Stable Diffusion ile kullanıldığında voken hizalaması için bir boşluk bulmuşlardır. Bu kısıtlamaya rağmen, MiniGPT-5 çerçevesi, tüm ölçütlerde, mevcut en iyi temel GILL çerçevesini aşar.

Sonuç

Bu makalede, MiniGPT-5’i, “generatif vokens” kavramını ortaya atan, ara yüzü ve görsel çıktıları oluşturan bir algoritma tekniği olarak tanıttık. MiniGPT-5 çerçevesinin temel bileşenlerini ve mimarisini, ayrıca, mevcut temel ve en iyi modellere kıyasla performans ve verimlilikte önemli iyileştirmeler gösteren sonuçları tartıştık. MiniGPT-5, çoklu modal içerik ve veri oluşturma alanındaki yeni bir standardı oluşturmayı amaçlar ve önceki modellerin karşılaştığı zorlukları çözmeyi hedefler.

Mesleği mühendis, kalbi yazar. Kunal, AI ve ML'ye derin bir sevgi ve anlayışla technical writer, bu alanlardaki karmaşık kavramları etkileyici ve bilgilendirici belgelerle basitleştirmeye adanmış.