Rapporter
Alibaba Utgir Qwen3-VL Teknisk Rapport Med Detaljer Om To-Timers Videoanalyse

Alibabas Qwen-team publiserte Qwen3-VL teknisk rapport den 26. november, og ga detaljert dokumentasjon av den åpne kildekoden for visuell språkmodell som først ble lansert i september. Den 64-forfatterne rapporten avslører at systemet kan prosessere to-timers videoer innenfor et 256 000-token kontekstvindu samtidig som det opprettholder nesten perfekt nøyaktighet i å finne bestemte rammeverk.
Flaggskipet Qwen3-VL-235B-A22B-modellen oppnådde 100 % nøyaktighet i “nåle-i-høystakken”-tester når det søkte etter 30-minutters videoer, og holdt en nøyaktighet på 99,5 % selv når det scannet to-timers videoer som inneholdt omtrent en million token. Testmetodikken setter inn en semantisk betydningsfull “nåle”-ramme på tilfeldige posisjoner innenfor lange videoer, og utfordrer modellen til å finne og analysere denne bestemte rammen.
Dette plasserer Qwen3-VL som en betydelig fremgang i forståelse av langvarige videoer – et område der de fleste visuell-språk-modellene har kjempet for å opprettholde sammenhengende analyse over lengre tidsperioder.
Benchmark Ytelse Mot Ledende Modeller
Den tekniske rapporten dokumenterer Qwen3-VLs ytelse over flere evalueringer, med særlig styrke i visuell matematikk-oppgaver. Modellen scoret 85,8 % på MathVista, og overgikk GPT-5s 81,3 %, og ledet MathVision med 74,6 % nøyaktighet sammenlignet med Gemini 2,5 Pro (73,3 %) og GPT-5 (65,8 %).
Dokumentbehandlingsevnen viste seg å være like sterk. Modellen oppnådde 96,5 % på DocVQA for dokumentforståelse og 875 poeng på OCRBench, og støttet tekstgjenkjenning på 39 språk – nesten fire ganger språkdekningen til sin forgjenger Qwen2,5-VL. Over 70 % nøyaktighet ble opprettholdt på OCR-oppgaver på 32 av disse språkene.
Modellfamilien, som er tilgjengelig gjennom Hugging Face og Alibaba Cloud, inkluderer både tette variasjoner (2B, 4B, 8B, 32B parametre) og ekspertkonfigurasjoner (30B-A3B og 235B-A22B). Den 8B-varianten alene har overskredet 2 millioner nedlastinger siden september-lanseringen.
Men resultater var ikke uniformt dominante. På MMMU-Pro, en kompleks flerdisciplinær test, scoret Qwen3-VL 69,3 % sammenlignet med GPT-5s 78,4 %. Kommersielle konkurrenter opprettholdt også fordeler i generelle video-spørsmål-benchmark, noe som tyder på at modellen excellerer som en spesialist i visuell matematikk og dokumentanalyse snarere enn en universell leder.
Tre Arkitektoniske Innovasjoner
Den tekniske rapporten omhandler tre nøkkelarkitektoniske oppgraderinger som driver disse evnene. Først erstatter “interleaved MRoPE” tidligere posisjonsinnleggelsesmetoder ved å distribuere matematiske representasjoner jevnt over tid, bredde og høyde-dimensjoner snarere enn å gruppere dem etter dimensjon. Denne endringen retter seg spesielt mot forbedret ytelse på lange videoer.
Andre, DeepStack-integrasjon fusjonerer multi-nivå Vision Transformer-egenskaper for å fange fine-grained visuelle detaljer og stramme bilde-tekst-justering. Den tredje innovasjonen går utover tids-rotasjonelle posisjonsinnleggelsesmetoder til eksplisitt tekst-basert tidsstempel-justering, og muliggjør mer presise tidsmessige grunnlag når modellen må henvisere til bestemte øyeblikk i video-innholdet.
Systemet demonstrerer også agent-egenskaper utover ren persepsjon. På ScreenSpot Pro, som evaluerer navigasjon innenfor grafiske brukergrensesnitt, oppnådde modellen 61,8 % nøyaktighet. AndroidWorld-testing, hvor systemet må uavhengig operere Android-applikasjoner, så den 32B-varianten nådde 63,7 % nøyaktighet.
Det Åpne Konkurranselandskapet
Alle Qwen3-VL-modeller som er utgitt siden september er tilgjengelige under Apache 2,0-lisensen med åpne vekter. Utvalget spenner fra den kompakte 2B-parameterversjonen som er egnet for kant-utplassering til den flaggskip-235B-A22B-modellen som krever betydelige beregningsressurser – den siste veier 471 GB.
Tidspunktet for denne tekniske dokumentasjonen er merkbart. Googles Gemini 1,5 Pro viste lignende ramme-ekstraheringsfunksjoner fra lange videoer tidlig i 2024, men Qwen3-VL bringer sammenlignbar funksjonalitet til det åpne kildekodemiljøet. Med Kinas generative AI-brukere nådde 515 millioner i løpet av de siste månedene, og Qwen-modellfamilien har tiltrukket over 300 millioner nedlastinger verden over, stiller Alibaba tydelig sine åpne modeller som grunnlaget for globalt multimodalt AI-utvikling.
Den forrige Qwen2,5-VL har allerede samlet over 2 800 sitater på under 10 måneder, noe som indikerer sterk forskningsadopsjon. Den detaljerte tekniske rapporten for Qwen3-VL bør akselerere denne trenden, og gi forskerne de arkitektoniske og treningsdetaljene de trenger for å bygge på eller konkurrere med disse evnene.
Hva Dette Betyr For Utviklere
For team som arbeider med videoanalyse, dokumentintelligens eller visuell resonnering-applikasjoner, tilbyr Qwen3-VL produksjonsklare evner uten API-avhengighet. Modellens spesielle styrke i visuell matematikk gjør den umiddelbart relevant for utdannings-teknologi, vitenskapelige forskningstøy og enhver applikasjon som krever tolkning av diagram, diagrammer eller matematiske noter innenfor bilder.
Gapet mellom åpne og lukkede modeller fortsetter å snevre inn i bestemte domener, mens det forblir betydelig i andre. Qwen3-VL demonstrerer at åpne vekt-modeller kan matche eller overgå proprietære systemer på spesialiserte oppgaver som visuell matematikk, selv om de taper på bredere resonemingsbenchmark.
For det åpne AI-samfunnet representerer den detaljerte tekniske rapporten mer enn bare dokumentasjon – det er en veikart som andre team kan studere, kritisere og bygge på. Uansett om dette fører til konkurrerende implementeringer eller komplementær forskning, er baseline for åpen multimodal intelligens flyttet betydelig høyere.












