AI 模型与平台
阿里巴巴发布 Qwen-Image-3.0,没有基准或权重

阿里巴巴的 Qwen 团队 发布了 Qwen-Image-3.0,这是其图像生成模型的第三代,围绕一个单一的目标构建:使生成的图像足够实用,可以用作工作工具,而不仅仅是好看的图像。发布帖子是一系列展示系统可以绘制的图像的画廊——密集的报纸页面、多面板信息图表和充满数学符号的学术论文。然而,它不包括基准评分、模型卡或技术报告来支持这些说法。
这种缺乏是故事的关键。Qwen-Image-3.0 的头条声明完全依赖于公司选择发布的示例图像,而早期的模型在同一系列中设定了更高的证据标准。
模型声称的功能
Qwen 团队围绕三个功能组织了发布。第一个是处理长、详细的提示:模型接受最多 4,500 个令牌的指令,公司声称这使其能够在单次传递中组成信息密集的图像。其中心示例是 3×3 的信息图表网格——物理图表、群论证明、生物学解释器和其他六个——据阿里巴巴称,是从一个 3,700 个令牌的指令生成的,而不是从单独的图像中组装而成。另一个示例将界面嵌套在彼此内部,例如将代码编辑器放在聊天窗口周围,聊天窗口放在消息应用程序周围。
第二个声明是细节。阿里巴巴声称该模型以 10 像素的大小渲染文本,清晰可读,并以接近照片质量的方式复制皮肤、头发和纸张等纹理。帖子显示了一整页的学术论文,包含多行方程式和模拟的报纸首页,以及编辑任务,例如添加手写注释和恢复受损的传统绘画。
第三个是公司所谓的世界知识:12 种语言的本地渲染、网页和直播等界面的复制,以及从互联网上提取实时数据的能力。一个示例生成了特定城市和日期的天气预报图表,对于生成器来说,这是一个不寻常的范围,它模糊了图像模型和数据驱动设计工具之间的界限。阿里巴巴将整个套件推向内容生产工作——报纸布局、短剧分镜头、UI 模拟和电子商务图像——在这些领域,是否应该明确披露 AI 的作用 的问题已经存在。然而,每一个功能都是通过公司选择的输出来展示的。
公告中省略的内容
帖子中没有基准表、参数计数、许可证或可下载的权重,也没有描述模型训练或测试的技术报告。用户被指向 Qwen Chat 来尝试它。
这与该系列以前的发布方式有所不同。 Qwen-Image 1.0 于 2025 年 8 月发布,带有开放的权重和宽松的 Apache 2.0 许可证,并附有同日发布的技术报告,而 Qwen-Image-2.0 随后发布了自己的 技术报告。前一个版本还声明了其限制:它接受最多约 1,000 个令牌的提示,这使得新发布中最具体的数字是 4,500,这是一个没有外部验证的数字。
这种差距对于图像模型来说比文本模型更重要。图像质量是主观的,文本渲染正是生成器在手动选择的演示中看起来很强大,但在系统测试中看起来较弱的轴。没有权重或评估集,开发人员唯一可以采取的证据是阿里巴巴自己的输出集。竞争对手已经证明仅聊天式的首秀是一种选择,而不是限制:腾讯发布了 HunyuanImage 3.0 作为开放权重模型,Thinking Machines Lab最近发布了 Inkling,其首个开放权重的多模态 AI 模型,包括权重。
上一代的排名
阿里巴巴最近有一个非常坦率的数据点,说明其图像模型的排名。 在 Qwen-Image-Bench 中,一个文本到图像的评估,Qwen 团队自己发布的,前一代旗舰 Qwen Image 2.0 Pro 排名第五。 OpenAI 的 GPT Image 2 领先,Google 的 Nano Banana 模型和 OpenAI 的 GPT Image 1.5 排名前四。基准依赖于一个自动判断模型,其作者声称其与人类评估者密切匹配,但它仍然是阿里巴巴自己的测试,并且评估的是前一代,而不是 3.0。
这种背景使得将新模型视为领先地位的说法变得不太可信。从第五名开始,Qwen-Image-3.0 有足够的空间来声称真正的进步,但发布会没有提供任何衡量标准来确认这些进步。值得关注的信号是阿里巴巴是否发布权重和模型卡,正如它对每个早期 Qwen-Image 发布所做的那样,以及是否有独立评估支持长提示和小文本的声明。直到其中之一实现,人们只能说 Qwen-Image-3.0 在其制造商选择显示的图像中看起来很强大。












