Raporty
Zespół Alibaba opublikował raport techniczny Qwen3-VL, szczegółowo opisujący analizę dwugodzinnego filmu wideo

Zespół Qwen z Alibaba opublikował raport techniczny Qwen3-VL w dniu 26 listopada, dostarczając szczegółowej dokumentacji otwartego modelu widzenia i języka, który po raz pierwszy został uruchomiony we wrześniu. Artykuł napisany przez 64 autorów ujawnia, że system może przetwarzać filmy wideo trwające dwie godziny w oknie kontekstowym 256 000 tokenów, przy zachowaniu niemal idealnej dokładności w lokalizowaniu konkretnych klatek.
Flagowy model Qwen3-VL-235B-A22B osiągnął 100% dokładności w testach “igła w stogu siana” podczas wyszukiwania filmów trwających 30 minut, a utrzymywał się na poziomie 99,5% dokładności nawet przy skanowaniu filmów trwających dwie godziny, zawierających około jeden milion tokenów. Metodologia testowa polega na wstawieniu semantycznie istotnej “igły” klatki w losowych pozycjach w długich filmach, a następnie model jest wyzwany do zlokalizowania i analizy tej konkretnych klatki.
Ta zdolność pozycjonuje Qwen3-VL jako znaczący postęp w zrozumieniu długich filmów wideo – dziedzinie, w której większość modeli widzenia i języka miała trudności w utrzymaniu spójnej analizy przez dłuższy czas.
Wydajność odniesienia w porównaniu z wiodącymi modelami
Raport techniczny dokumentuje wydajność Qwen3-VL w różnych metrykach oceny, ze szczególną siłą w zadaniach matematyki wizualnej. Model uzyskał 85,8% na MathVista, przewyższając GPT-5 z wynikiem 81,3%, i wyprzedził MathVision z 74,6% dokładnością w porównaniu z Gemini 2.5 Pro (73,3%) i GPT-5 (65,8%).
Możliwości przetwarzania dokumentów okazały się równie silne. Model osiągnął 96,5% na DocVQA do zrozumienia dokumentu i 875 punktów na OCRBench, wspierając rozpoznawanie tekstu w 39 językach – niemal czterokrotnie większy zakres językowy niż jego poprzednik Qwen2.5-VL. Ponad 70% dokładności zostało utrzymane w zadaniach OCR w 32 z tych obsługiwanych języków.
Rodzina modeli, dostępna za pośrednictwem Hugging Face i Alibaba Cloud, obejmuje zarówno gęste warianty (2B, 4B, 8B, 32B parametrów) oraz konfiguracje mixture-of-experts (30B-A3B i 235B-A22B). Sam wariant 8B przekroczył 2 miliony pobrań od wrześniowej premiery.
Jednak wyniki nie były jednolicie dominujące. Na MMMU-Pro, złożonym teście multidyscyplinarnym, Qwen3-VL uzyskał 69,3% w porównaniu z 78,4% GPT-5. Komercyjni konkurenci utrzymali również przewagę w ogólnych benchmarkach odpowiedzi na pytania wideo, co sugeruje, że model excels jako specjalista w matematyce wizualnej i analizie dokumentów, a nie jako powszechny lider.
Trzy innowacje architektoniczne
Raport techniczny przedstawia trzy kluczowe ulepszenia architektoniczne, które napędzają te możliwości. Po pierwsze, “interleaved MRoPE” zastępuje poprzednie metody osadzania pozycyjnego, rozkładając reprezentacje matematyczne równomiernie w wymiarach czasu, szerokości i wysokości, zamiast grupowania ich według wymiaru. Ta zmiana jest skierowana specjalnie na poprawę wydajności na długich filmach.
Drugie, integracja DeepStack łączy funkcje transformatora wizualnego na wielu poziomach, aby uchwycić drobne szczegóły wizualne i zwiększyć wyrównanie obrazu i tekstu. Trzecia innowacja przechodzi poza czasowe osadzanie pozycyjne z rotacją, umożliwiając bardziej precyzyjne odniesienie czasowe, gdy model musi odnosić się do konkretnych momentów w treści wideo.
System również demonstruje możliwości agenta poza czystą percepcją. Na ScreenSpot Pro, który ocenia nawigację w interfejsach graficznych, model osiągnął 61,8% dokładności. Testowanie AndroidWorld, gdzie system musi niezależnie obsługiwać aplikacje Android, variant 32B osiągnął 63,7% dokładności.
Otwarte źródło konkurencyjne
Wszystkie modele Qwen3-VL wydane od września są dostępne na licencji Apache 2.0 z otwartymi wagami. Linia produktów rozciąga się od kompaktowego wariantu 2B-parametrowego, odpowiedniego do wdrożenia na krawędzi, do flagowego modelu 235B-A22B, wymagającego znacznych zasobów obliczeniowych – ten ostatni waży 471 GB.
Czas opublikowania tej dokumentacji technicznej jest godny uwagi. Gemini 1.5 Pro od Google (GOOGL ) wykazał podobne możliwości ekstrakcji klatek z długich filmów wideo na początku 2024 roku, ale Qwen3-VL wprowadza porównywalną funkcjonalność do ekosystemu open source. Z chińską bazą użytkowników sztucznej inteligencji generatywnej, która podwoiła się do 515 milionów w ostatnich miesiącach, a rodziną modeli Qwen, która przyciągnęła ponad 300 milionów pobrań na całym świecie, Alibaba wyraźnie pozycjonuje swoje otwarte modele jako podstawę dla globalnego rozwoju sztucznej inteligencji multimodalnej.
Poprzedni Qwen2.5-VL już zgromadził ponad 2800 cytowań w ciągu mniej niż 10 miesięcy, co wskazuje na silne przyjęcie w badaniach. Szczegółowy raport techniczny dla Qwen3-VL powinien przyspieszyć tę tendencję, dostarczając badaczom architektonicznych i szkoleniowych szczegółów niezbędnych do budowania lub konkurowania z tymi możliwościami.
Co to oznacza dla deweloperów
Dla zespołów pracujących nad analizą wideo, inteligencją dokumentów lub wnioskowaniem wizualnym, Qwen3-VL oferuje gotowe do produkcji możliwości bez zależności od API. Szczególna siła modelu w matematyce wizualnej sprawia, że jest on natychmiast istotny dla technologii edukacyjnych, narzędzi badawczych i każdej aplikacji wymagającej interpretacji wykresów, diagramów lub notacji matematycznej w obrazach.
Przerwa między otwartymi a zamkniętymi modelami nadal się zmniejsza w określonych dziedzinach, podczas gdy w innych pozostaje znaczna. Qwen3-VL pokazuje, że modele o otwartych wagach mogą dopasować lub przewyższyć systemy własnościowe w specjalistycznych zadaniach, takich jak matematyka wizualna, nawet gdy pozostają w tyle w szerszych benchmarkach wnioskowania.
Dla społeczności open-source AI, szczegółowy raport techniczny reprezentuje więcej niż dokumentację – jest to mapa drogowa, którą inne zespoły mogą studiować, krytykować i rozbudowywać. Niezależnie od tego, czy prowadzi to do konkurencyjnych wdrożeń, czy uzupełniających badań, pozostaje to nieznane, ale linia bazowa dla otwartej inteligencji multimodalnej znacznie się podniosła.












