Berichte
Alibaba veröffentlicht technischen Bericht zu Qwen3-VL mit detaillierter Analyse von zwei Stunden Videodaten

Alibabas Qwen-Team hat den technischen Bericht zu Qwen3-VL am 26. November veröffentlicht und damit detaillierte Dokumentationen des Open-Source-Modells für visuelle Sprachverarbeitung bereitgestellt, das erstmals im September verfügbar war. Der 64-seitige Bericht zeigt, dass das System in der Lage ist, innerhalb eines 256.000-Token-Kontextfensters zwei Stunden lange Videos zu verarbeiten und dabei nahezu perfekte Genauigkeit bei der Lokalisierung spezifischer Frames beizubehalten.
Das Flaggschiff-Modell Qwen3-VL-235B-A22B erreichte 100% Genauigkeit in “Nadel-im-Heuhaufen”-Tests bei der Suche nach 30-minütigen Videos und hielt bei der Durchsuchung von zwei Stunden langen Videos mit etwa einer Million Token eine Genauigkeit von 99,5% ein. Die Testmethodik besteht darin, einen semantisch bedeutungsvollen “Nadel”-Frame an zufälligen Positionen innerhalb langer Videos einzufügen und das Modell dann dazu herauszufordern, diesen spezifischen Frame zu lokalisieren und zu analysieren.
Diese Fähigkeit positioniert Qwen3-VL als bedeutenden Fortschritt im Bereich der Verarbeitung von langen Videos – ein Bereich, in dem die meisten Modelle für visuelle Sprachverarbeitung Schwierigkeiten haben, kohärente Analysen über längere Zeiträume hinweg aufrechtzuerhalten.
Leistungsbewertung im Vergleich zu führenden Modellen
Der technische Bericht dokumentiert die Leistung von Qwen3-VL bei verschiedenen Bewertungskriterien, insbesondere bei visuellen Mathematik-Aufgaben. Das Modell erreichte 85,8% bei MathVista und übertraf damit GPT-5 mit 81,3%, und führte bei MathVision mit 74,6% die Rangliste an, gefolgt von Gemini 2.5 Pro (73,3%) und GPT-5 (65,8%).
Die Fähigkeiten bei der Dokumentenverarbeitung erwiesen sich als ebenso stark. Das Modell erreichte 96,5% bei DocVQA für die Dokumentenverständnis und 875 Punkte bei OCRBench, was die Texterkennung in 39 Sprachen unterstützt – fast viermal so viele Sprachen wie bei seinem Vorgänger Qwen2.5-VL. In 32 dieser unterstützten Sprachen wurde eine Genauigkeit von über 70% bei OCR-Aufgaben beibehalten.
Die Modellfamilie, die über Hugging Face und Alibaba Cloud verfügbar ist, umfasst sowohl dichte Varianten (2B, 4B, 8B, 32B Parameter) als auch Mixture-of-Experts-Konfigurationen (30B-A3B und 235B-A22B). Die 8B-Variante allein hat seit der Veröffentlichung im September über 2 Millionen Downloads verzeichnet.
Allerdings waren die Ergebnisse nicht einheitlich dominant. Bei MMMU-Pro, einem komplexen multidisziplinären Test, erreichte Qwen3-VL 69,3% gegenüber 78,4% von GPT-5. Kommerzielle Konkurrenten behielten auch Vorteile bei allgemeinen Video-Fragen-Beantwortungsbenchmarks, was darauf hindeutet, dass das Modell sich als Spezialist für visuelle Mathematik und Dokumentenanalyse und nicht als universeller Anführer behauptet.
Drei architektonische Innovationen
Der technische Bericht skizziert drei wichtige architektonische Upgrades, die diese Fähigkeiten ermöglichen. Zunächst ersetzt “interleaved MRoPE” die bisherigen Positionseingabe-Methoden, indem mathematische Repräsentationen gleichmäßig über Zeit-, Breiten- und Höhendimensionen verteilt werden, anstatt sie nach Dimensionen zu gruppieren. Diese Änderung zielt speziell auf verbesserte Leistung bei langen Videos ab.
Zweitens ermöglicht die Integration von DeepStack die Fusion von Vision-Transformer-Funktionen auf mehreren Ebenen, um feinkörnige visuelle Details zu erfassen und die Bild-Text-Übereinstimmung zu verbessern. Die dritte Innovation geht über temporäre Rotary-Positionseingaben hinaus und ermöglicht eine explizite textbasierte Zeitstempel-Übereinstimmung, was eine präzisere zeitliche Verankerung ermöglicht, wenn das Modell auf bestimmte Momente in Videoinhalten verweisen muss.
Das System zeigt auch Fähigkeiten jenseits der reinen Wahrnehmung. Bei ScreenSpot Pro, das die Navigation innerhalb grafischer Benutzeroberflächen bewertet, erreichte das Modell 61,8% Genauigkeit. Bei AndroidWorld-Tests, bei denen das System unabhängig Android-Anwendungen bedienen muss, erreichte die 32B-Variante 63,7% Genauigkeit.
Die Open-Source-Wettbewerbslandschaft
Alle seit September veröffentlichten Qwen3-VL-Modelle sind unter der Apache-2.0-Lizenz mit offenen Gewichten verfügbar. Das Angebot reicht von der kompakten 2B-Parameter-Variante, die für die Edge-Deployment geeignet ist, bis zum Flaggschiff-Modell 235B-A22B, das erhebliche Rechenressourcen erfordert – letzteres wiegt 471 GB.
Der Zeitpunkt dieser technischen Dokumentation ist bemerkenswert. Google’s Gemini 1.5 Pro demonstrierte ähnliche Frame-Extraktionsfähigkeiten aus langen Videos Anfang 2024, aber Qwen3-VL bringt vergleichbare Funktionalitäten in das Open-Source-Ökosystem. Mit Chinas generativer AI-Nutzerbasis, die in den letzten Monaten auf 515 Millionen angewachsen ist und der Qwen-Modellfamilie, die weltweit über 300 Millionen Downloads verzeichnet hat, positioniert Alibaba offensichtlich seine offenen Modelle als Grundlage für die globale multimodale KI-Entwicklung.
Der vorherige Qwen2.5-VL hat bereits in weniger als 10 Monaten über 2.800 Zitate gesammelt, was auf eine starke Forschungsadoption hinweist. Der detaillierte technische Bericht zu Qwen3-VL sollte diese Entwicklung beschleunigen und Forschern die architektonischen und Trainingsdetails liefern, die benötigt werden, um diese Fähigkeiten zu verbessern oder zu konkurrieren.
Was dies für Entwickler bedeutet
Für Teams, die an Videoanalyse, Dokumentenintelligenz oder visueller Argumentation arbeiten, bietet Qwen3-VL produktionsreife Fähigkeiten ohne API-Abhängigkeiten. Die besondere Stärke des Modells in der visuellen Mathematik macht es sofort relevant für Bildungstechnologie, wissenschaftliche Forschungstools und jede Anwendung, die die Interpretation von Grafiken, Diagrammen oder mathematischer Notation in Bildern erfordert.
Die Lücke zwischen offenen und geschlossenen Modellen schließt sich in bestimmten Bereichen, bleibt in anderen jedoch erheblich. Qwen3-VL zeigt, dass offene Modelle mit offenen Gewichten spezialisierte Aufgaben wie visuelle Mathematik meistern oder sogar übertreffen können, während sie bei breiteren Denkaufgaben zurückbleiben.
Für die Open-Source-AI-Community stellt der detaillierte technische Bericht mehr dar als nur Dokumentation – es ist eine Roadmap, die andere Teams studieren, kritisieren und darauf aufbauen können. Ob dies zu konkurrierenden Implementierungen oder komplementären Forschungen führt, bleibt abzuwarten, aber der Baseline für offene multimodale Intelligenz hat sich erheblich erhöht.












