レポート
アリババ、Qwen3-VL 技術レポートを公開 – 2時間のビデオ分析を可能にする

アリババの Qwen チームは、9 月に初めてリリースされたオープンソースのビジョン言語モデル Qwen3-VL の技術レポートを 11 月 26 日に公開しました。この 64 人の著者による論文は、システムが 256,000 トークンのコンテキストウィンドウ内で 2 時間のビデオを処理しながら、特定のフレームの位置をほぼ完全な精度で検出できることを明らかにしています。
フラグシップモデル Qwen3-VL-235B-A22B は、30 分間のビデオの「針の山の中で針を探す」テストで 100% の精度を達成し、2 時間のビデオをスキャンして約 100 万トークンを含む場合でも、99.5% の精度を維持しました。このテスト方法では、長いビデオの中に意味のある「針」フレームをランダムな位置に挿入し、モデルがその特定のフレームを検出して分析することを課題としています。
この機能により、Qwen3-VL は長時間のビデオ理解における重要な進歩となります。多くのビジョン言語モデルが長時間の分析を維持するのに苦労してきた分野です。
リーディング モデルとのベンチマーク パフォーマンス
技術レポートでは、Qwen3-VL のパフォーマンスが複数の評価指標に対して文書化されており、特に視覚的な数学タスクで強みを示しています。モデルは MathVista で 85.8% のスコアを達成し、GPT-5 の 81.3% を上回り、MathVision で 74.6% の精度を達成し、Gemini 2.5 Pro (73.3%) と GPT-5 (65.8%) をリードしました。
ドキュメント処理能力も同様に強力でした。モデルは DocVQA で 96.5% のスコアを達成し、文書の理解を示し、OCRBench で 875 ポイントを獲得し、39 言語に対するテキスト認識をサポートしました。これは、前身の Qwen2.5-VL の言語カバレッジの約 4 倍に相当します。サポートされている 32 言語のうち、70% 以上の精度を維持しました。
モデル ファミリーは、Hugging Face と Alibaba Cloud を通じて利用可能であり、密なバリアント (2B、4B、8B、32B パラメータ) と専門家の混合構成 (30B-A3B と 235B-A22B) の両方を含みます。8B バリアント alone は、9 月のリリース以来 Already 200 万回以上ダウンロードされています。
ただし、結果は一様に優勢ではありませんでした。MMM-U-Pro という複雑な多分野テストでは、Qwen3-VL は 69.3% のスコアを達成し、GPT-5 の 78.4% を下回りました。商用競合他社も、一般的なビデオ質問回答ベンチマークで優位性を維持しました。これは、モデルが視覚的な数学とドキュメント分析のスペシャリストとして優れており、より広範な推論ベンチマークではリーダーではないことを示しています。
3 つのアーキテクチャ イノベーション
技術レポートでは、これらの機能を駆り立てる 3 つの重要なアーキテクチャのアップグレードについて説明しています。まず、「交互の MRoPE」は、以前の位置埋めめ込み方法を置き換えて、時間、幅、 高さの寸法にわたって数学的表現を均等に分散することにより、長時間のビデオのパフォーマンスを改善することを目指しています。
2 番目に、DeepStack 統合により、Vision Transformer のマルチレベル機能を結合して、細かい視覚的な詳細を捉え、画像とテキストの整列を強化します。3 番目のイノベーションは、時間ロータリー位置埋めめ込みを超えて、テキストベースのタイムスタンプ整列を明示的に実装し、モデルがビデオ コンテンツ内の特定の瞬間を参照する必要がある場合に、より正確な時間基準を可能にします。
システムは純粋な認識を超えたエージェント機能も実証しています。ScreenSpot Pro では、グラフィカル ユーザー インターフェイス内でのナビゲーションを評価し、モデルは 61.8% の精度を達成しました。AndroidWorld テストでは、システムが Android アプリケーションを独立して操作する必要があり、32B バリアントは 63.7% の精度を達成しました。
オープンソース競合環境
9 月以降にリリースされたすべての Qwen3-VL モデルは、Apache 2.0 ライセンスの下でオープンな重みで利用可能です。ラインナップは、エッジ デプロイメントに適したコンパクトな 2B パラメータ バリアントから、重要な計算リソースを必要とするフラグシップ 235B-A22B モデルまで広がっています。後者は 471 GB のサイズになります。
この技術文書のタイミングは注目に値します。Google (GOOGL ) の Gemini 1.5 Pro は、2024 年初頭に長いビデオからフレームを抽出する同等の機能を実証しましたが、Qwen3-VL はこれらの機能をオープンソース エコシステムに持ち込みます。中国の生成 AI ユーザー ベースが最近 6 か月で 2 倍の 515 万人に増加し、Qwen モデル ファミリーが世界中で 3 億回以上ダウンロードされたことを考えると、アリババは明らかにオープン モデルをグローバル マルチモーダル AI 開発の基盤として位置付けていることがわかります。
以前の Qwen2.5-VL は、わずか 10 か月で 2,800 回以上の引用を受け、研究採用が強いことを示しています。Qwen3-VL の詳細な技術レポートは、このトレンドをさらに加速することでしょう。研究者に、これらの機能を構築したり競合させたりするために必要なアーキテクチャとトレーニングの詳細を提供するからです。
開発者にとっての意味
ビデオ分析、ドキュメント インテリジェンス、または視覚的推論アプリケーションを開発しているチームにとって、Qwen3-VL は API 依存関係なしでプロダクションレディの機能を提供します。モデルの視覚的な数学における特定の強みにより、教育技術、科学研究ツール、または画像内のグラフ、図、または数学的表記を解釈する必要があるすべてのアプリケーションにすぐに役立ちます。
オープン モデルとクローズド モデルの間のギャップは、特定のドメインでは狭まり、他のドメインでは依然として大きいままです。Qwen3-VL は、視覚的な数学のような特化されたタスクではオープン重みモデルがプロプライエタリ システムと同等またはそれを上回ることができることを示していますが、より広範な推論ベンチマークでは後れを取っていることを示しています。
オープンソース AI コミュニティにとって、詳細な技術レポートは単なる文書化以上のものです。道案内となり、他のチームが研究し、批判し、構築することができます。競合する実装や補足的な研究につながるかどうかはまだわかりませんが、オープン マルチモーダル インテリジェンスの基準は大幅に高まりました。












