Отчёты
Alibaba Выпускает Технический Отчет Qwen3-VL, В Котором Определена Двухчасовая Анализ Видео

Команда Qwen от Alibaba опубликовала технический отчет Qwen3-VL 26 ноября, предоставив подробную документацию открытой модели зрения-языка, которая была впервые запущена в сентябре. 64-авторская статья показывает, что система может обрабатывать двухчасовые видео в контекстном окне из 256 000 токенов, сохраняя почти идеальную точность при определении конкретных кадров.
Флагманская модель Qwen3-VL-235B-A22B достигла 100% точности в тестах “игла в стоге сена” при поиске 30-минутных видео и сохранила 99,5% точности даже при сканировании двухчасовых видео, содержащих примерно один миллион токенов. Методология тестирования включает в себя вставку семантически значимого “иглы” кадра в случайные позиции внутри длинных видео, а затем бросает вызов модели, чтобы найти и проанализировать этот конкретный кадр.
Эта возможность позиционирует Qwen3-VL как значительный прорыв в понимании длинных видео – области, где большинство моделей зрения-языка испытывали трудности в поддержании связного анализа в течение длительного времени.
Бенчмарк Производительности Среди Лидирующих Моделей
Технический отчет документирует производительность Qwen3-VL по нескольким метрикам оценки, с особой силой в задачах визуальной математики. Модель набрала 85,8% на MathVista, превзойдя GPT-5 с 81,3%, и лидировала на MathVision с 74,6% точности по сравнению с Gemini 2.5 Pro (73,3%) и GPT-5 (65,8%).
Возможности обработки документов также оказались достаточно сильными. Модель достигла 96,5% на DocVQA для понимания документов и 875 баллов на OCRBench, поддерживая распознавание текста на 39 языках – почти в четыре раза больше языковой поддержки, чем у ее предшественника Qwen2.5-VL. Более 70% точности было сохранено на задачах OCR в 32 из этих поддерживаемых языков.
Модельная семья, доступная через Hugging Face и Alibaba Cloud, включает в себя как плотные варианты (2B, 4B, 8B, 32B параметров), так и конфигурации mixture-of-experts (30B-A3B и 235B-A22B). Вариант 8Balone превысил 2 миллиона загрузок с момента выпуска в сентябре.
Однако результаты не были统но доминирующими. На MMMU-Pro, сложном многодисциплинарном тесте, Qwen3-VL набрал 69,3% по сравнению с 78,4% GPT-5. Коммерческие конкуренты также сохранили преимущества в общих видео-вопросах и ответах, что предполагает, что модель excels как специалист в визуальной математике и анализе документов, а не как универсальный лидер.
Три Архитектурных Инновации
Технический отчет очерчивает три ключевых архитектурных улучшения, которые стимулируют эти возможности. Первое – “переплетенный MRoPE” заменяет предыдущие методы позиционного встраивания, распределяя математические представления равномерно по времени, ширине и высоте, а не группируя их по размерности. Это изменение конкретно нацелено на улучшение производительности на длинных видео.
Второе – интеграция DeepStack объединяет многоуровневые функции Vision Transformer для захвата мелкозернистых визуальных деталей и более плотной привязки изображения и текста. Третья инновация выходит за рамки временных вращающихся позиционных встраиваний и обеспечивает явную текстовую привязку временных меток, что позволяет более точно привязать время, когда модель должна ссылаться на конкретные моменты в видео-контенте.
Система также демонстрирует возможности агента за пределами чистого восприятия. На ScreenSpot Pro, который оценивает навигацию в графических интерфейсах пользователя, модель достигла 61,8% точности. Тестирование AndroidWorld, где система должна независимо работать с приложениями Android, показало, что вариант 32B достиг 63,7% точности.
Открытый Конкурентный Ландшафт
Все модели Qwen3-VL, выпущенные с сентября, доступны под лицензией Apache 2.0 с открытыми весами. Линейка моделей варьируется от компактного варианта 2B-параметров, подходящего для развертывания на краю, до флагманской модели 235B-A22B, требующей значительных вычислительных ресурсов – последняя весит 471 ГБ.
Тиминг этого технического документа заметен. Google’s Gemini 1.5 Pro продемонстрировал аналогичные возможности извлечения кадров из длинных видео в начале 2024 года, но Qwen3-VL привносит сравнимую функциональность в открытую экосистему. С двукратным ростом пользователей генеративного ИИ в Китае до 515 миллионов в последние месяцы и моделью Qwen, привлекшей более 300 миллионов загрузок по всему миру, Alibaba явно позиционирует свои открытые модели как основу для глобального многомодального развития ИИ.
Предыдущая модель Qwen2.5-VL уже накопила более 2 800 цитат за менее чем 10 месяцев, что указывает на сильное внедрение в исследования. Подробный технический отчет для Qwen3-VL должен ускорить эту траекторию, предоставляя исследователям архитектурные и обучающие детали, необходимые для построения или конкуренции с этими возможностями.
Что Это Значит Для Разработчиков
Для команд, работающих над анализом видео, интеллектом документов или визуальными рассуждениями, Qwen3-VL предлагает готовые к производству возможности без зависимости от API. Особая сила модели в визуальной математике делает ее сразу же актуальной для образовательной технологии, научных исследовательских инструментов и любого приложения, требующего интерпретации диаграмм, схем или математической нотации внутри изображений.
Провал между открытыми и закрытыми моделями продолжает сужаться в определенных областях, оставаясь существенным в других. Qwen3-VL демонстрирует, что модели с открытыми весами могут соответствовать или превосходить проприетарные системы на специализированных задачах, таких как визуальная математика, даже когда они отстают в более широких бенчмарках рассуждений.
Для открытого сообщества ИИ подробный технический отчет представляет собой больше, чем просто документацию – это дорожная карта, которую другие команды могут изучить, прокомментировать и построить на основе. Будет ли это привести к конкурирующим реализациям или дополнительным исследованиям, остается быть увиденным, но базовый уровень открытого многомодального интеллекта значительно повысился.












