Raporlar

Alibaba Qwen3-VL Teknik Raporunu Yayınladı: İki Saatlik Video Analizi Ayrıntılı Belgelendirme

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Alibaba’nın Qwen ekibi, 26 Kasım’da Qwen3-VL teknik raporunu yayınladı. Eylül ayında ilk kez piyasaya sürülen açık kaynaklı görüntü-dil modelinin ayrıntılı belgelerini sunuyor. 64 yazarlı makale, sistemin 256.000 tokenlik bir bağlam penceresi içinde iki saatlik videoları işlerken, belirli kareleri bulmada neredeyse mükemmel bir doğruluğa sahip olduğunu ortaya koyuyor.

Bayrak gemisi Qwen3-VL-235B-A22B modeli, 30 dakikalık videolarda “iğne-in-a-haystack” testlerinde %100 doğruluk oranıyla sonuçlandı ve yaklaşık bir milyon token içeren iki saatlik videolarda %99,5’lik bir doğruluk oranıyla kaldı. Test yöntemi, uzun videoların rastgele pozisyonlarına semantik olarak önemli bir “iğne” karesi yerleştirir ve modelin bu specific kareyi bulup analiz etmesini sağlar.

Bu yetenek, Qwen3-VL’i uzun form video anlama alanında önemli bir ilerleme olarak konumlandırıyor – çoğu görüntü-dil modelinin uzun süreler boyunca tutarlı bir analizde mücadele ettiği bir alan.

Önder Modellere Karşı Benchmark Performansı

Teknik rapor, Qwen3-VL’in çeşitli değerlendirme ölçütlerinde performansı belgeliyor, özellikle görsel matematik görevlerinde güçlü bir performans sergiliyor. Model, MathVista’da %85,8’lik bir skor elde etti, bu GPT-5’in %81,3’ünden daha yüksek ve MathVision’da %74,6’lık bir doğruluk oranıyla Gemini 2.5 Pro (%73,3) ve GPT-5 (%65,8)’i geride bıraktı.

Belge işleme yetenekleri de benzer şekilde güçlü çıktı. Model, DocVQA’da %96,5’lik bir skor elde etti ve 39 dilde metin tanıma desteği sunan OCRBench’de 875 puan elde etti – bu, önceki Qwen2.5-VL modelinin dil kapsamının neredeyse dört katı. Desteklenen 32 dilin %70’inde OCR görevlerinde %70’lik bir doğruluk oranı korunmuştur.

Model ailesi, Hugging Face ve Alibaba Cloud aracılığıyla erişilebilir ve hem yoğun varyantlar (2B, 4B, 8B, 32B parametre) hem de uzmanlar arası yapılandırmalar (30B-A3B ve 235B-A22B) içerir. Eylül ayında piyasaya sürülmesinden bu yana, 8B varyantı alone 2 milyondan fazla indirme sayısına ulaştı.

Ancak sonuçlar uniform bir şekilde baskın değildi. MMMU-Pro, karmaşık bir multidisipliner testte Qwen3-VL, %69,3’lük bir skor elde etti, bu GPT-5’in %78,4’ünden daha düşük. Ticari rakipler de genel video soru-cevap benchmark’lerinde avantajlarını korudular, bu da modelin görsel matematik ve belge analizi gibi uzmanlık alanlarında güçlü olduğunu, ancak daha geniş bir lider olmadığını gösteriyor.

Üç Mimarî Yenilik

Teknik rapor, bu yetenekleri sağlayan üç önemli mimari güncellemeyi açıklıyor. İlk olarak, “interleaved MRoPE” önceki konum gömme yöntemlerinin yerini alıyor ve matematiksel temsilcileri zaman, genişlik ve yükseklik boyutları boyunca eşit olarak dağıtıyor. Bu değişiklik, özellikle uzun videolarda performansı iyileştirmeyi hedefliyor.

İkincisi, DeepStack entegrasyonu, çok seviyeli Vision Transformer özelliklerini birleştirerek ince görsel ayrıntıları yakalamak ve görüntü-metin hizalamasını sıkılaştırmak için kullanılır. Üçüncü yenilik, zaman rotary konum gömme yerine metin tabanlı zaman damgası hizalamasını kullanır, bu da modelin video içeriğindeki belirli anlara atıfta bulunması gerektiğinde daha kesin bir zamanlama sağlar.

Sistem ayrıca saf algı ötesinde ajan yeteneklerini de gösteriyor. ScreenSpot Pro’da, model %61,8’lik bir doğruluk oranıyla grafik kullanıcı arayüzlerinde gezinme yeteneğini gösterdi. AndroidWorld testinde, sistem bağımsız olarak Android uygulamalarını çalıştırmak zorunda kaldı ve 32B varyantı %63,7’lik bir doğruluk oranıyla sonuçlandı.

Açık Kaynak Rekabetçi Manzara

Eylül ayında piyasaya sürülen tüm Qwen3-VL modelleri, Apache 2.0 lisansı altında açık ağırlıklarla erişilebilir. Ürün yelpazesi, kenar dağıtım için uygun kompakt 2B parametreli varyanttan, önemli hesaplama kaynakları gerektiren 235B-A22B bayrak gemisi modeline kadar uzanıyor – sonuncusu 471 GB’a ulaşıyor.

Bu teknik belgelerin zamanlaması dikkat çekici. Google’ın Gemini 1.5 Pro’su, 2024 yılı başlarında benzer kare çıkarma yeteneklerini uzun videolardan gösterdi, ancak Qwen3-VL, bu işlevselliği açık kaynaklı ekosisteme getiriyor. Çin’in üretken AI kullanıcı tabanı son altı ayda 515 milyona ulaşarak ikiye katlanırken ve Qwen model ailesinin dünya çapında 300 milyondan fazla indirme sayısına ulaşırken, Alibaba açık modellerini küresel çok modlu AI geliştirme temelinde konumlandırıyor.

Önceki Qwen2.5-VL, 10 aydan kısa bir süre içinde 2.800’den fazla atıf biriktirdi, bu da güçlü bir araştırma benimsemesini gösteriyor. Qwen3-VL için ayrıntılı teknik rapor, bu eğilimi hızlandırması bekleniyor ve araştırmacılara bu yetenekleri geliştirmek veya yarışmak için gerekli mimari ve eğitim ayrıntılarını sağlayacak.

Bu, Geliştiriciler için Ne Anlama Geliyor

Video analizi, belge zekası veya görsel akıl yürütme uygulamaları üzerinde çalışan ekipler için Qwen3-VL, API bağımlılığı olmadan üretim hazır yetenekleri sunuyor. Modelin görsel matematikte özel bir gücü, onu eğitim teknolojisi, bilimsel araştırma araçları ve resimlerdeki grafik, diyagram veya matematiksel gösterimlerin yorumlanmasını gerektiren herhangi bir uygulama için hemen ilgili hale getiriyor.

Açık ve kapalı modeller arasındaki fark, belirli alanlarda daralıyor, ancak diğerlerinde önemli ölçüde kalıyor. Qwen3-VL, açık ağırlıklı modellerin görsel matematik gibi uzmanlık görevlerinde özel sistemleri geçebileceğini veya onlara eşit olabileceğini gösteriyor, ancak daha geniş akıl yürütme benchmark’lerinde geride kalıyor.

Açık kaynaklı AI topluluğu için, ayrıntılı teknik rapor, sadece bir belge olmaktan daha fazlasını temsil ediyor – diğer ekiplerin inceleyebileceği, eleştirebileceği ve üzerine inşa edebileceği bir yol haritası. Bu, yarışan uygulamalara veya tamamlayıcı araştırmaya yol açar mı, henüz görülecek, ancak açık çok modlu zeka için temel, önemli ölçüde yükseldi.

Alex McFarland yapay zeka muhabiri ve yazarıdır ve yapay zekadaki son gelişmeleri araştırıyor. Birçok yapay zeka başlangıç şirketi ve dünya çapındaki yayınlarda işbirliği yaptı.