Yapay zeka modelleri ve platformları

SHOW-O: Tek Bir Transformer ile Çoklu Modal Anlama ve Oluşturma Birleştirme

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Büyük dil modellerindeki (LLM) önemli ilerlemeler, çoklu modal büyük dil modellerinin (MLLM) geliştirilmesini teşvik etti. İlk MLLM çabaları, LLaVA, MiniGPT-4 ve InstructBLIP, gibi vizyon-dil görevlerinde görsel soru cevaplandırma (VQA) gibi önemli çoklu modal anlama yetenekleri sergiledi. LLM’leri çoklu modal alanlara entegre etmek için bu çalışmalar, önceden eğitilmiş modalitye özgü bir kodlayıcıdan (örneğin CLIP) özelliklerin LLM’lerin girdi alanına yansıtılmasını keşfetti, böylece transformer omurgası içinde çoklu modal anlama ve akıl yürütme sağladı. MLLM’ler için çeşitli tasarım seçimleri olsa da, bu modellerin çoğu, metin oluşturma için LLM’lerde etkili olduğu kanıtlanmış olan otoregresif oluşturma paradigmasına uygun bir şekilde eğitilir. Güçlü çoklu modal anlama yeteneklerine rağmen, bu modeller principalmente görsel algıya odaklanır ve metin dışında çoklu modal çıktılar oluşturma yeteneklerine sahip değildir.

Transformer modelleri, doğal dil işlemede otoregresif modellemede büyük başarılar gösterdi. Bu ilerlemelerden esinlenen önceki çalışmalar, aynı otoregresif modellemeyi, görüntü ve video oluşturma için görüntü piksellerinin bağımlılığını öğrenmek için doğrudan uyguladı. Örneğin, VideoPoet, multimodal girdilerden yüksek kaliteli videolar sentezlemek için yalnızca bir decoder transformer mimarisini kullanır. Daha yakın zamanda, LlamaGen, Llama gibi bir büyük dil modeli mimarisinin, otoregresif olarak görüntü token’lerini modelleyebileceğini ve sınıf koşullu görüntü oluşturma görevlerinde makul bir performans sergileyebileceğini gösterdi.

Bu makalede, çoklu modal anlama ve oluşturmayı birleştiren birleşik bir transformer olan Show-O hakkında konuşacağız. Tamamen otoregresif modellerin aksine, Show-O, girdilerin ve çıktıların çeşitli ve karma modalitelerini adaptif olarak işleyebilmek için otoregresif ve diskret difüzyon modellemeyi birleştirir. Birleşik model, görsel soru cevaplandırma, metin-görsel oluşturma, metin yönlendirmeli boyama/uzatma ve karma mod oluşturma gibi bir dizi vizyon-dil görevini esnek bir şekilde destekler. Çeşitli benchmark’lerde, Show-O, eşdeğer veya daha büyük sayıda parametreye sahip mevcut bireysel modellere benzer veya üstün performans gösterir, bu da onu bir sonraki nesil temel model olarak potansiyeli vurgular.

… (rest of the content)

SHOW-O: Çoklu Modal Anlama ve Oluşturma Birleştirme

Son birkaç yılda, çoklu modal zeka’nın iki ana direği olan anlama ve oluşturma yeteneklerinde önemli ilerlemeler kaydedildi. Çoklu modal anlama için, Çoklu Modal Büyük Dil Modelleri (MLLM) gibi LLaVA, vizyon-dil görevlerinde önemli yetenekler sergiledi. Görsel oluşturma için, gürültü azaltma difüzyon olasılık modelleri (DDPM), geleneksel oluşturma paradigmalarını devrimleştirerek, metin-görsel/video oluşturma görevlerinde önceden görülmemiş performans sergiledi.

… (rest of the content)

SHOW-O: Yöntem ve Mimarisi

Show-O’nun temel amacı, çoklu modal anlama ve oluşturmayı birleştiren birleşik bir model geliştirmektir. Böyle bir birleşik model oluşturmak önemli zorluklar oluşturur, temel sorunlar şunları içerir: i) modelin girdi/çıktı alanını tanımlamak; ii) çeşitli modalitelerden farklı girdi verilerini birleştirmek; iii) otoregresif ve difüzyon modellemeyi birleşik bir transformer’a entegre etmek; ve iv) böyle bir birleşik modeli etkili bir şekilde eğitmek.

… (rest of the content)

Omni-Dikkat Mekanizması

Mevcut çalışmaların aksine, yalnızca otoregresif olarak dizileri modelleyen, Show-O, çeşitli sinyal tiplerini farklı şekillerde modellemesine olanak tanıyan bir omni-dikkat mekanizması tanıtır. Bu kapsamlı dikkat mekanizması, girdi dizisinin formatına bağlı olarak nedensel ve tam dikkat arasında adaptif olarak geçiş yapar. Aşağıdaki şekil, farklı girdi dizileri için omni-dikkat örneklerini gösterir.

… (rest of the content)

SHOW-O: Deneyler ve Sonuçlar

Aşağıdaki tablo, Show-O’nun kamu benchmark’lerinde, görüntü başlıklama ve görsel soru cevaplandırma görevlerinde çoklu modal anlama yeteneğini sunar.

… (rest of the content)

Niteliksel Karşılaştırmalar

Show-O, difüzyon tabanlı modellerle, SDv1.5, SDXL ve otoregresif tabanlı model LlamaGen ile birlikte, birleşik modeller gibi LWM ve SEED-X ile nitel karşılaştırmalar sunar, aşağıdaki şekilde gösterildiği gibi.

… (rest of the content)

Metin Yönlendirmeli Boyama ve Uzatma

Show-O, herhangi bir fine-tuning gerektirmeden doğal olarak metin yönlendirmeli boyama ve uzatmayı destekler. Aşağıdaki şekil, birkaç örneği gösterir.

… (rest of the content)

Son Düşünceler

Bu makalede, çoklu modal anlama ve oluşturmayı birleştiren birleşik bir transformer olan Show-O hakkında konuştuk. Tamamen otoregresif modellerin aksine, Show-O, girdilerin ve çıktıların çeşitli ve karma modalitelerini adaptif olarak işleyebilmek için otoregresif ve diskret difüzyon modellemeyi birleştirir. Birleşik model, görsel soru cevaplandırma, metin-görsel oluşturma, metin yönlendirmeli boyama/uzatma ve karma mod oluşturma gibi bir dizi vizyon-dil görevini esnek bir şekilde destekler. Çeşitli benchmark’lerde, Show-O, eşdeğer veya daha büyük sayıda parametreye sahip mevcut bireysel modellere benzer veya üstün performans gösterir, bu da onu bir sonraki nesil temel model olarak potansiyeli vurgular.

Mesleği mühendis, kalbi yazar. Kunal, AI ve ML'ye derin bir sevgi ve anlayışla technical writer, bu alanlardaki karmaşık kavramları etkileyici ve bilgilendirici belgelerle basitleştirmeye adanmış.