Звіти

Alibaba випускає технічний звіт Qwen3-VL, який детально описує аналіз відео тривалістю два години

mm
Додайте Unite.AI до бажаних джерел у Google

Команда Qwen компанії Alibaba опублікувала технічний звіт Qwen3-VL 26 листопада, надавши детальну документацію відкритої моделі бачення та мови, яка вперше була випущена у вересні. У звіті, написаному 64 авторами, розкривається здатність системи обробляти відео тривалістю два години у вікні контексту з 256 000 токенів, зберігаючи майже ідеальну точність при локалізації конкретних кадрів.

Флагманська модель Qwen3-VL-235B-A22B досягла 100% точності у тестах “іголка в копиці сіна” при пошуку відео тривалістю 30 хвилин, а також утримувала 99,5% точності навіть при скануванні відео тривалістю два години, що містять приблизно один мільйон токенів. Методологія тестування включає вставку семантично значимого “іголкового” кадру в випадкові позиції всередині довгих відео, а потім викликує модель знайти та проаналізувати саме цей кадр.

Ця здатність позиціонує Qwen3-VL як значний прорив у розумінні довгих відео – області, де більшість моделей бачення та мови мали труднощі з підтриманням послідовного аналізу протягом тривалих періодів часу.

Базова продуктивність проти лідируючих моделей

Технічний звіт документує продуктивність Qwen3-VL за різними оціночними метриками, з особливою силою у візуальних математичних завданнях. Модель набрала 85,8% на MathVista, перевершивши GPT-5 з 81,3%, і лідирувала на MathVision з 74,6% точності порівняно з Gemini 2.5 Pro (73,3%) і GPT-5 (65,8%).

Спроможності обробки документів виявилися подібно сильними. Модель досягла 96,5% на DocVQA для розуміння документів і 875 балів на OCRBench, підтримуючи розпізнавання тексту у 39 мовах – майже у чотири рази більше мовної підтримки її попередника Qwen2.5-VL. Більше 70% точності було збережено на завданнях OCR у 32 з тих підтримуваних мов.

Сім’я моделей, доступна через Hugging Face і Alibaba Cloud, включає як щільні варіанти (2B, 4B, 8B, 32B параметрів), так і конфігурації mixture-of-experts (30B-A3B і 235B-A22B). Сам варіант 8B перевищив 2 мільйони завантажень з моменту вересневого випуску.

Однак результати не були однозначно домінуючими. На MMMU-Pro, складному багатодисциплінарному тесті, Qwen3-VL набрав 69,3% порівняно з 78,4% у GPT-5. Комерційні конкуренти також підтримували переваги у загальних відео-тестах на відповідь на питання, що свідчить про те, що модель excels як спеціаліст у візуальних математичних та документальних аналізах, а не універсальний лідер.

Три архітектурні інновації

Технічний звіт описує три ключові архітектурні оновлення, які забезпечують ці можливості. По-перше, “перемішаний MRoPE” замінює попередні методи позиційного вкладення, розподіляючи математичні представлення рівномірно по часових, ширинних і висотних вимірам, а не групуючи їх за вимірами. Ця зміна конкретно націлена на покращення продуктивності на довгих відео.

По-друге, інтеграція DeepStack об’єднує багаторівневі функції Vision Transformer для захоплення тонких візуальних деталей і зміцнення текстово-образової відповідності. Третя інновація переходить від тимчасових роторних позиційних вкладень до явної текстово-часової відповідності, що дозволяє більш точно прив’язувати часові моменти у відеоконтенті, коли модель потребує посилатися на конкретні моменти.

Система також демонструє агентські можливості, що виходять за рамки чистого сприйняття. На ScreenSpot Pro, який оцінює навігацію у графічних інтерфейсах користувача, модель досягла 61,8% точності. Тестування AndroidWorld, де система повинна незалежно керувати програмами Android, показало, що варіант 32B досяг 63,7% точності.

Конкурентний ландшафт відкритого джерела

Усі моделі Qwen3-VL, випущені з вересня, доступні під ліцензією Apache 2.0 з відкритими вагами. Лінійка моделей охоплює компактний варіант 2B-параметра, придатний для розгортування на краю, до флагманської моделі 235B-A22B, яка вимагає значних обчислювальних ресурсів – остання має розмір 471 ГБ.

Час публікації цього технічного звіту є помітним. Google’s Gemini 1.5 Pro продемонстрував подібні можливості витягування кадрів з довгих відео на початку 2024 року, але Qwen3-VL привносить порівнянну функціональність до екосистеми відкритого джерела. З урахуванням того, що кількість користувачів генеративного ІІ у Китаї подвоїлася до 515 мільйонів за останні місяці, а сім’я моделей Qwen привернула понад 300 мільйонів завантажень по всьому світу, Alibaba явно позиціонує свої відкриті моделі як основу для глобального розвитку багатомодального ІІ.

Попередня модель Qwen2.5-VL вже накопичила понад 2 800 цитувань менш ніж за 10 місяців, що свідчить про сильне прийняття у дослідницькій спільноті. Детальний технічний звіт для Qwen3-VL повинен прискорити цю траєкторію, надавши дослідникам архітектурні та тренувальні деталі, необхідні для побудови або конкуренції з цими можливостями.

Що це означає для розробників

Для команд, які працюють над відеоаналізом, інтелектом документів або візуальною логікою, Qwen3-VL пропонує готові до виробництва можливості без залежності від API. Особлива сила моделі у візуальних математичних завданнях робить її негайно актуальною для освітніх технологій, наукових дослідницьких інструментів та будь-яких застосунків, які вимагають інтерпретації графіків, діаграм або математичної нотації всередині зображень.

Пропуск між відкритими та закритими моделями продовжує звужуватися у певних областях, залишаючись суттєвим у інших. Qwen3-VL демонструє, що моделі відкритих ваг можуть відповідати або перевершувати пропрієтарні системи на спеціалізованих завданнях, таких як візуальні математичні завдання, навіть якщо вони відстають у ширших тестах на логічні висновки.

Для відкритої спільноти ІІ технічний звіт представляє більше, ніж документацію – це дорожня карта, яку інші команди можуть вивчати, критикувати та будувати на основі неї. Чи це призведе до конкуруючих реалізацій або додаткових досліджень, залишається невідомим, але базовий рівень відкритого багатомодального ІІ значно підвищився.

Алекс Макфарленд - журналіст та письменник з питань штучного інтелекту, який досліджує останні розробки в галузі штучного інтелекту. Він співпрацював з численними стартапами та виданнями з штучного інтелекту у світі.