Report
Alibaba Rilascia il Rapporto Tecnico di Qwen3-VL con Dettagli sull’Analisi di Video di Due Ore

Il team di Qwen di Alibaba ha pubblicato il rapporto tecnico di Qwen3-VL il 26 novembre, fornendo una documentazione dettagliata del modello di visione-linguaggio open-source che è stato lanciato per la prima volta a settembre. Il documento di 64 autori rivela che il sistema può elaborare video di due ore all’interno di una finestra di contesto di 256.000 token mantenendo una precisione quasi perfetta nella localizzazione di frame specifici.
Il modello flagship Qwen3-VL-235B-A22B ha raggiunto una precisione del 100% nei test “ago nel pagliaio” quando si cerca di trovare frame specifici all’interno di video di 30 minuti, e ha mantenuto una precisione del 99,5% anche quando si scansionano video di due ore che contengono circa un milione di token. La metodologia di test inserisce un frame “ago” semanticamente significativo in posizioni casuali all’interno di lunghe video, poi sfida il modello a localizzare e analizzare quel frame specifico.
Questa capacità posiziona Qwen3-VL come un avanzamento significativo nella comprensione dei video a lungo termine – un dominio in cui la maggior parte dei modelli di visione-linguaggio ha faticato a mantenere un’analisi coerente nel corso di lunghi periodi di tempo.
Prestazioni di Benchmark Rispetto ai Modelli Leader
Il rapporto tecnico documenta le prestazioni di Qwen3-VL in diverse metriche di valutazione, con una particolare forza nei compiti di matematica visiva. Il modello ha raggiunto una precisione dell’85,8% in MathVista, superando l’81,3% di GPT-5, e ha guidato MathVision con una precisione del 74,6% rispetto al 73,3% di Gemini 2.5 Pro e al 65,8% di GPT-5.
Le capacità di elaborazione dei documenti si sono rivelate altrettanto forti. Il modello ha raggiunto una precisione del 96,5% in DocVQA per la comprensione dei documenti e 875 punti in OCRBench, supportando il riconoscimento del testo in 39 lingue – quasi quattro volte la copertura linguistica del suo predecessore Qwen2.5-VL. Si è mantenuta una precisione superiore al 70% nei compiti di OCR in 32 di quelle lingue supportate.
La famiglia di modelli, disponibile attraverso Hugging Face e Alibaba Cloud, include sia varianti dense (2B, 4B, 8B, 32B parametri) che configurazioni di mixture-of-experts (30B-A3B e 235B-A22B). La variante da 8B da sola ha superato i 2 milioni di download dal rilascio di settembre.
Tuttavia, i risultati non sono stati uniformemente dominanti. In MMMU-Pro, un test complesso e multidisciplinare, Qwen3-VL ha raggiunto una precisione del 69,3% rispetto al 78,4% di GPT-5. I competitor commerciali hanno mantenuto vantaggi anche nei benchmark di risposta alle domande sui video, suggerendo che il modello eccelle come specialista in matematica visiva e analisi dei documenti piuttosto che come leader universale.
Tre Innovazioni Architettoniche
Il rapporto tecnico delinea tre aggiornamenti architettonici chiave che guidano queste capacità. In primo luogo, “interleaved MRoPE” sostituisce i precedenti metodi di incorporamento della posizione distribuendo le rappresentazioni matematiche in modo uniforme attraverso le dimensioni del tempo, della larghezza e dell’altezza, anziché raggrupparle per dimensione. Questo cambiamento si concentra specificamente sul miglioramento delle prestazioni sui video lunghi.
In secondo luogo, l’integrazione di DeepStack fonde le funzionalità del Vision Transformer a più livelli per catturare dettagli visivi fini e stringere l’allineamento immagine-testo. La terza innovazione va oltre gli incorporamenti di posizione temporale rotativi per allineare esplicitamente i timestamp basati sul testo, abilitando un ancoraggio temporale più preciso quando il modello deve fare riferimento a momenti specifici nel contenuto video.
Il sistema dimostra anche capacità di agente al di là della pura percezione. In ScreenSpot Pro, che valuta la navigazione all’interno di interfacce utente grafiche, il modello ha raggiunto una precisione del 61,8%. I test di AndroidWorld, dove il sistema deve operare in modo indipendente le applicazioni Android, hanno visto la variante da 32B raggiungere una precisione del 63,7%.
Il Paesaggio Competitivo Open-Source
Tutti i modelli Qwen3-VL rilasciati dal settembre sono disponibili con licenza Apache 2.0 e pesi aperti. La gamma va dal compatto modello da 2B parametri adatto per il deployment edge al modello flagship da 235B-A22B che richiede risorse computazionali significative – quest’ultimo pesa 471 GB.
Il timing di questa documentazione tecnica è notevole. Gemini 1.5 Pro di Google (GOOGL ) ha dimostrato capacità di estrazione di frame simili da video lunghi all’inizio del 2024, ma Qwen3-VL porta funzionalità comparabili all’ecosistema open-source. Con l’utente di intelligenza artificiale generativa cinese che è raddoppiato a 515 milioni negli ultimi mesi e la famiglia di modelli Qwen che ha attirato oltre 300 milioni di download in tutto il mondo, Alibaba sta chiaramente posizionando i suoi modelli aperti come fondamento per lo sviluppo dell’intelligenza artificiale multimodale globale.
Il precedente Qwen2.5-VL ha già accumulato oltre 2.800 citazioni in meno di 10 mesi, indicando una forte adozione della ricerca. Il rapporto tecnico dettagliato per Qwen3-VL dovrebbe accelerare quella traiettoria, fornendo ai ricercatori i dettagli architettonici e di formazione necessari per costruire su o competere con queste capacità.
Cosa Significa Ciò per gli Sviluppatori
Per i team che lavorano sull’analisi dei video, l’intelligenza dei documenti o il ragionamento visivo, Qwen3-VL offre capacità pronte per la produzione senza dipendenze API. La forza particolare del modello nella matematica visiva lo rende immediatamente rilevante per la tecnologia educativa, gli strumenti di ricerca scientifica e qualsiasi applicazione che richieda l’interpretazione di grafici, diagrammi o notazioni matematiche all’interno delle immagini.
Il divario tra modelli aperti e chiusi continua a ridursi in determinati domini mentre rimane sostanziale in altri. Qwen3-VL dimostra che i modelli con pesi aperti possono eguagliare o superare i sistemi proprietari in compiti specializzati come la matematica visiva, anche se sono in ritardo nei benchmark di ragionamento più ampi.
Per la comunità di intelligenza artificiale open-source, il rapporto tecnico dettagliato rappresenta più della documentazione – è una mappa stradale che altri team possono studiare, criticare e costruire. Che ciò porti a implementazioni concorrenti o ricerche complementari rimane da vedere, ma la base per l’intelligenza artificiale multimodale aperta si è appena spostata notevolmente verso l’alto.












