Zprávy
Alibaba vydal technickou zprávu Qwen3-VL s detailní analýzou dvouhodinových videí

Tým Qwen z Alibaba vydal technickou zprávu Qwen3-VL 26. listopadu, která poskytuje podrobnou dokumentaci otevřeného modelu vidění a jazyka, který byl poprvé spuštěn v září. Článek s 64 autory odhaluje, že systém může zpracovat dvouhodinová videa v kontextovém okně 256 000 tokenů a přitom udržet téměř dokonalou přesnost při lokalizaci konkrétních snímků.
Vlajkový model Qwen3-VL-235B-A22B dosáhl 100% přesnosti v testech “jehla v kupce sena” při vyhledávání 30minutových videí a udržel 99,5% přesnosti i při procházení dvouhodinových videí, které obsahují přibližně jeden milion tokenů. Metodika testu vkládá semanticky významný “jehla” snímek na náhodné pozice ve dlouhých videích a poté vyzývá model, aby lokalizoval a analyzoval konkrétní snímek.
Tato schopnost позиcionuje Qwen3-VL jako významný pokrok ve zpracování dlouhých videí – oblasti, ve které většina modelů vidění a jazyka bojovala s udržením soudržné analýzy po delší dobu.
Srovnávací výkon s předními modely
Technická zpráva dokumentuje výkon Qwen3-VL napříč několika vyhodnocovacími metrikami, se zvláštní silou ve vizuálních matematických úkolech. Model dosáhl 85,8 % na MathVista, překonal GPT-5 s 81,3 %, a vedl MathVision s 74,6 % přesností ve srovnání s Gemini 2.5 Pro (73,3 %) a GPT-5 (65,8 %).
Schopnosti zpracování dokumentů se ukázaly jako podobně silné. Model dosáhl 96,5 % na DocVQA pro pochopení dokumentů a 875 bodů na OCRBench, podporující rozpoznávání textu v 39 jazycích – téměř čtyřnásobek jazykové pokrytí jeho předchůdce Qwen2.5-VL. Více než 70% přesnosti bylo udrženo při úkolech OCR v 32 z těchto podporovaných jazyků.
Modelová rodina, dostupná prostřednictvím Hugging Face a Alibaba Cloud, zahrnuje jak husté varianty (2B, 4B, 8B, 32B parametrů), tak konfigurace mixture-of-experts (30B-A3B a 235B-A22B). Varianta 8B sama o sobě překročila 2 miliony stažení od září.
Nicméně výsledky nebyly uniformně dominantní. Na MMMU-Pro, komplexním multidisciplinárním testu, Qwen3-VL dosáhl 69,3 % ve srovnání s GPT-5 s 78,4 %. Komerční konkurenti také udrželi výhody v obecných videích otázek a odpovědí, naznačující, že model vyniká jako specialista na vizuální matematiku a analýzu dokumentů spíše než univerzální lídr.
Tři architektonické inovace
Technická zpráva popisuje tři klíčové architektonické úpravy, které pohání tyto schopnosti. První, “interleaved MRoPE”, nahrazuje předchozí metody positionálního vkládání tím, že distribuuje matematické reprezentace rovnoměrně napříč časem, šířkou a výškou, spíše než skupinuje je podle dimenze. Tato změna cíleně zlepšuje výkon na dlouhých videích.
Druhá, DeepStack integrace, spojuje víceúrovňové funkce Vision Transformer, aby zachytil jemné vizuální detaily a utáhl obraz-textové zarovnání. Třetí inovace jde za rámec temporálních rotativních positionálních vkládání a explicitního textového zarovnání časových razítek, umožňující přesnější temporální ukotvení, když model potřebuje odkázat na konkrétní okamžiky ve videovém obsahu.
Systém také prokazuje agentní schopnosti za hranice pouhého vnímání. Na ScreenSpot Pro, který vyhodnocuje navigaci v grafických uživatelských rozhraních, model dosáhl 61,8 % přesnosti. Testování AndroidWorld, kde systém musí nezávisle provozovat aplikace Android, vidělo variantu 32B dosáhnout 63,7 % přesnosti.
Otevřená konkurenční krajina
Všechny modely Qwen3-VL vydané od září jsou dostupné pod licencí Apache 2.0 s otevřenými váhami. Řada sahá od kompaktní varianty 2B parametrov, vhodné pro nasazení na okraji, až po vlajkový model 235B-A22B, který vyžaduje významné výpočetní zdroje – ten druhý váží 471 GB.
Načasování této technické dokumentace je pozoruhodné. Google’s Gemini 1.5 Pro prokázal podobné schopnosti extrakce snímků z dlouhých videí na počátku roku 2024, ale Qwen3-VL přináší srovnatelnou funkčnost do otevřené ekosystémy. S čínskou uživatelskou základnou generativního AI, která dosáhla 515 milionů v posledních měsících a modelem Qwen, který přilákal přes 300 milionů stažení po celém světě, Alibaba jasně позиcionuje své otevřené modely jako základ pro globální multimodální AI vývoj.
Předchozí Qwen2.5-VL již nasbíral přes 2 800 citací za méně než 10 měsíců, což naznačuje silné přijetí ve výzkumu. Podrobná technická zpráva pro Qwen3-VL by měla urychlit tuto trajektorii, poskytující výzkumníkům architektonické a tréninkové detaily potřebné k tomu, aby na tyto schopnosti navázali nebo s nimi soutěžili.
Co to znamená pro vývojáře
Pro týmy, které pracují na analýze videa, inteligenci dokumentů nebo vizuálním uvažováním, Qwen3-VL nabízí produkční schopnosti bez závislosti na API. Modelova zvláštní síla ve vizuální matematice jej činí okamžitě relevantním pro vzdělávací technologie, vědecké výzkumné nástroje a jakékoli aplikace, které vyžadují interpretaci grafů, diagramů nebo matematické notace v obrazech.
Mezera mezi otevřenými a uzavřeným modely se zužuje v určitých oblastech, zatímco v jiných zůstává podstatná. Qwen3-VL prokazuje, že otevřené modely s váhami mohou odpovídat nebo překonávat proprietární systémy na specializovaných úkolech, jako je vizuální matematika, zatímco na širších rozumových testech zaostávají.
Pro otevřenou AI komunitu, podrobná technická zpráva představuje více než dokumentaci – je to roadmap, který mohou ostatní týmy studovat, kritizovat a rozvíjet. Zda to povede k soutěžícím implementacím nebo komplementárnímu výzkumu, zůstává být vidět, ale baseline pro otevřenou multimodální inteligenci se podstatně zvýšil.












