Моделі та платформи ШІ
Alibaba запускає Qwen-Image-3.0 без бенчмарків чи ваг

Команда Qwen компанії Alibaba опублікувала Qwen-Image-3.0 21 липня 2026 року, третє покоління своєї моделі генерації зображень, і побудувала оголошення навколо однієї мети: зробити згенеровані зображення практичними для використання як робочий інструмент, а не просто красивими для перегляду. Пост є галереєю того, що може намалювати система – густі сторінки газет, багатопанельні інфографіки та академічні статті, повні математичних позначень. Що не включено, це таблиця бенчмарків, карта моделі або технічний звіт, який би підтвердив будь-яке з цього.
Відсутність цього є історією. Головні заяви Qwen-Image-3.0 повністю спираються на приклади зображень, які компанія вибрала для публікації, і попередні моделі в тому ж серії встановили вищу планку для доказів, ніж ця.
Що модель стверджує, що може зробити
Команда Qwen організовує випуск навколо трьох можливостей. Перша – обробка довгих, детальних запитів: модель приймає інструкції до 4 500 токенів, що, згідно з компанією, дозволяє їй складати інформаційно-насичені зображення за один проход. Її центральний приклад – три на три ґратки незв’язаних інфографік – фізична діаграма, група теорії доведення, біологічний пояснювач та шість інших – які, згідно з Alibaba, були створені з однієї інструкції в 3 700 токенів, а не зібрані з окремих зображень. Інший приклад вкладає інтерфейси один в одного, розміщуючи редактор коду навколо вікна чату навколо програми обміну повідомленнями.
Друга заява – тонка деталізація. Alibaba стверджує, що модель відтворює текст розміром до 10 пікселів чітко і відтворює текстури, такі як шкіра, волосся та папір, близькі до фотографічної якості. Пост демонструє повну сторінку академічної статті з багаторядковими рівняннями та симульовану першу сторінку газети, а також завдання редагування, такі як додавання рукописних анотацій та відновлення пошкодженої традиційної картини.
Третя – це те, що компанія називає знаннями світу: рідна відтворенням 12 мов, відтворенням інтерфейсів, таких як веб-сторінки та прямої трансляції, та можливістю отримання даних з Інтернету в режимі реального часу. Один приклад генерує графік прогнозу погоди для конкретного міста та дати, незвичайний крок для генератора та той, який розмитить межу між моделлю зображення та інструментом дизайну, керованим даними. Alibaba позиціонує весь пакет на роботі з контентом – макетами газет, сценаріями короткометражних драм, макетами інтерфейсу користувача та зображеннями електронної комерції – саме того типу медійного виходу, де питання про розкриття ролі штучного інтелекту вже актуальне. Кожна з цих можливостей, однак, демонструється через виходи, які компанія вибрала.
Що оголошення залишає позаду
Пост не містить таблиці бенчмарків, кількості параметрів, ліцензії чи завантажуваних ваг, а також технічного звіту, який би описував, як модель була навчена чи протестована. Користувачів направляють до Qwen Chat, щоб спробувати це.
Це відхід від того, як серія раніше вийшла. Qwen-Image 1.0 з’явився у серпні 2025 року з відкритими вагами під перmissive ліцензією Apache 2.0 та технічним звітом того ж дня, а Qwen-Image-2.0 послідував за своїм власним технічним звітом. Попередня версія також зазначила свої обмеження: вона приймала запити до приблизно 1 000 токенів, що робить стрибок до 4 500 найбільш конкретним числом у новому випуску, і це число жодна зовнішня сторона не підтвердила.
Пропуск має значення більше для моделі зображення, ніж для текстової. Якість зображення суб’єктивна, а відтворення тексту саме той вимір, за яким генератори виглядають сильними в демонстраційних прикладах і слабшими під систематичним тестуванням. Без ваг або набору оцінювання єдиним доказом, на який може спертися розробник, є власна демонстрація виходів компанії. Конкуренти показали, що дебют лише у чаті – це вибір, а не обмеження: Tencent випустила HunyuanImage 3.0 як модель з відкритими вагами, а Thinking Machines Lab недавно випустила Inkling, свою першу модель з відкритими вагами, ваги включно.
Де попереднє покоління займало місце
Alibaba має недавню та незвично відкриту точку даних про те, де стоять її моделі зображення. У Qwen-Image-Bench, оцінці тексту на зображення, яку сама команда Qwen опублікувала, попередня флагманська модель Qwen Image 2.0 Pro зайняла п’яте місце загалом. OpenAI’s GPT Image 2 очолив рейтинг, а моделі Google Nano Banana та OpenAI’s GPT Image 1.5 зайняли перші чотири місця. Бенчмарк спирається на автоматичну модель судді, яку її автори стверджують, що вона слідує за людськими оцінювачами, але це залишається власним тестом Alibaba, і він оцінював попереднє покоління, а не 3.0.
Цей контекст працює проти того, щоб читати нову модель як стрибок у лідери галузі. П’яте місце початку залишає Qwen-Image-3.0 місце, щоб заявити про реальні здобутки, але запуск не пропонує виміряного способу підтвердити їх. Сигнали, які варто спостерігати, – це чи публікує Alibaba ваги та карту моделі, як це робилося для кожного попереднього випуску Qwen-Image, і чи незалежні оцінки підтверджують заяви про довгі запити та малий текст. До тих пір, поки одне з цих не з’явиться, можна сказати лише те, що Qwen-Image-3.0 виглядає сильним у зображеннях, які його творець вибрав показати.












