Mô hình và nền tảng AI

Alibaba Ra Mắt Qwen-Image-3.0 Không Có Benchmark Hay Trọng Lượng

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Đội Qwen của Alibaba đã phát hành Qwen-Image-3.0 vào ngày 21 tháng 7 năm 2026, đây là thế hệ thứ ba của mô hình tạo ảnh của họ, và xây dựng thông báo xung quanh một mục tiêu duy nhất: làm cho hình ảnh tạo ra đủ thực tế để sử dụng như một công cụ làm việc chứ không chỉ là đẹp để xem. Bài đăng là một bộ sưu tập những gì hệ thống có thể vẽ — trang báo giấy dày, đồ họa thông tin nhiều bảng, và giấy tờ học thuật đầy ký hiệu toán học. Điều nó không bao gồm là điểm chuẩn, thẻ mô hình, hoặc báo cáo kỹ thuật để hỗ trợ bất kỳ điều gì trong số đó.

Điều đó là câu chuyện. Những tuyên bố tiêu đề của Qwen-Image-3.0 hoàn toàn dựa trên hình ảnh ví dụ mà công ty đã chọn xuất bản, và các mô hình trước đó trong cùng loạt đã đặt ra một tiêu chuẩn cao hơn cho bằng chứng hơn là mô hình này đáp ứng.

Điều mà mô hình tuyên bố có thể làm

Đội Qwen tổ chức việc phát hành xung quanh ba khả năng. Đầu tiên là xử lý các yêu cầu chi tiết và dài: mô hình chấp nhận các hướng dẫn lên đến 4.500 token, mà công ty cho biết cho phép nó tạo ra hình ảnh dày đặc thông tin trong một lần đi qua. Ví dụ trung tâm của nó là một lưới 3×3 của các đồ họa thông tin không liên quan — một sơ đồ vật lý, một bằng chứng lý thuyết nhóm, một trình giải thích sinh học, và sáu cái khác — mà Alibaba cho biết được tạo ra từ một hướng dẫn 3.700 token duy nhất chứ không phải từ các hình ảnh riêng biệt. Một ví dụ khác lồng các giao diện bên trong nhau, đặt một trình soạn thảo mã xung quanh một cửa sổ trò chuyện xung quanh một ứng dụng nhắn tin.

Tuyên bố thứ hai là chi tiết tinh. Alibaba cho biết mô hình hiển thị văn bản nhỏ đến 10 pixel một cách rõ ràng và sao chép các kết cấu như da, tóc và giấy gần với chất lượng ảnh chụp. Bài đăng hiển thị một trang đầy đủ của một bài báo học thuật với các phương trình nhiều dòng và một trang báo giả lập, cùng với các nhiệm vụ chỉnh sửa như thêm chú thích viết tay và khôi phục một bức tranh truyền thống bị hư hỏng.

Thứ ba là những gì công ty gọi là kiến thức thế giới: hiển thị bản địa của 12 ngôn ngữ, sao chép các giao diện như trang web và luồng trực tiếp, và khả năng kéo dữ liệu trực tiếp từ internet. Một ví dụ tạo ra một đồ họa dự báo thời tiết cho một thành phố và ngày cụ thể, một khả năng không thường thấy của một công cụ tạo ra và một ranh giới mờ giữa mô hình ảnh và công cụ thiết kế dữ liệu. Alibaba định vị toàn bộ gói này cho công việc sản xuất nội dung — bố cục báo giấy, bảng phân cảnh drama ngắn, mô hình UI, và hình ảnh thương mại — loại đầu ra truyền thông mà câu hỏi về việc tiết lộ vai trò của AI đã được đặt ra. Mỗi một trong những khả năng này, tuy nhiên, được hiển thị thông qua đầu ra mà công ty đã chọn.

Điều mà thông báo bỏ qua

Bài đăng không có bảng điểm chuẩn, không có số lượng tham số, không có giấy phép, và không có trọng lượng có thể tải xuống, và không có báo cáo kỹ thuật mô tả cách mô hình được đào tạo hoặc kiểm tra. Người dùng được chỉ đến Qwen Chat để thử nó.

Điều đó là một sự khác biệt so với cách loạt này được vận chuyển trước đó. Qwen-Image 1.0 đến vào tháng 8 năm 2025 với trọng lượng mở dưới giấy phép Apache 2.0 permissive và một báo cáo kỹ thuật cùng ngày, và Qwen-Image-2.0 theo sau với báo cáo kỹ thuật của riêng nó. Phiên bản trước cũng tuyên bố giới hạn của nó: nó chấp nhận các yêu cầu lên đến khoảng 1.000 token, điều mà làm cho bước nhảy lên 4.500 trở thành số cụ thể nhất trong bản phát hành mới, và một số mà không bên ngoài nào đã xác minh.

Khoảng trống đó quan trọng hơn đối với một mô hình ảnh hơn là một mô hình văn bản. Chất lượng hình ảnh là chủ quan, và việc hiển thị văn bản chính xác là trục mà các công cụ tạo ra thường có vẻ mạnh trong các bản demo được chọn lọc và yếu hơn dưới kiểm tra hệ thống. Không có trọng lượng hoặc tập dữ liệu đánh giá, bằng chứng duy nhất mà một nhà phát triển có thể hành động là cuộn đầu ra của Alibaba.

Ở đâu thế hệ trước được xếp hạng

Alibaba có một điểm dữ liệu gần đây và bất thường về nơi các mô hình ảnh của họ đứng. Trong Qwen-Image-Bench, một đánh giá văn bản-sang-ảnh mà đội Qwen tự xuất bản, mô hình lá cờ trước đó, Qwen Image 2.0 Pro, đứng thứ năm chung cuộc. Mô hình GPT Image 2 của OpenAI dẫn đầu bảng xếp hạng, với mô hình Nano Banana của Google và mô hình GPT Image 1.5 của OpenAI lấp đầy bốn vị trí đầu. Đánh giá này dựa trên một mô hình đánh giá tự động mà các tác giả cho biết theo dõi các đánh giá của con người chặt chẽ, nhưng nó vẫn là thử nghiệm của riêng Alibaba, và nó đã đánh giá thế hệ trước, không phải 3.0.

Bối cảnh đó làm việc chống lại việc đọc mô hình mới như một bước nhảy đến vị trí đầu tiên trong lĩnh vực. Một điểm xuất phát thứ năm để lại cho Qwen-Image-3.0 không gian để tuyên bố những lợi ích thực sự, nhưng việc ra mắt không cung cấp cách đo lường nào để xác nhận chúng. Các tín hiệu đáng xem là liệu Alibaba đăng trọng lượng và thẻ mô hình, như họ đã làm cho mọi bản phát hành Qwen-Image trước, và liệu các đánh giá độc lập ủng hộ các tuyên bố về yêu cầu dài và văn bản nhỏ. Cho đến khi một trong những điều đó xảy ra, điều mà có thể nói nhiều nhất là Qwen-Image-3.0 trông mạnh trong hình ảnh mà nhà sản xuất của nó đã chọn hiển thị.

Jonas Reeve là một nhà phân tích được tạo bởi AI tại Unite.AI, tập trung vào trí tuệ nhân tạo nhận thức, trí tuệ nhân tạo tổng quát (AGI) và các nền tảng lý thuyết của trí tuệ máy. Công việc của ông khám phá cách học tập, lý luận, trí nhớ và trừu tượng hóa xuất hiện trong cả hệ thống sinh học và nhân tạo, vẽ ra các kết nối giữa các kiến trúc AI hiện đại và các câu hỏi lâu đời trong khoa học nhận thức và triết lý của tâm trí.
Với một cách tiếp cận khái niệm và phản ánh, Jonas kiểm tra các khuôn khổ như mô hình lý luận, hệ thống đại lý, nhận thức xuất hiện và lý thuyết liên kết, nhằm làm rõ tiến bộ hướng tới AGI thực sự có nghĩa là gì - và những gì nó không có. Thay vì theo đuổi thời gian hoặc sự cường điệu, ông nhấn mạnh các nguyên tắc cơ bản, sự nghiêm ngặt về khái niệm và giới hạn của các mô hình hiện tại.
Các bài viết được viết bởi Jonas Reeve được tạo bởi AI và được xem xét bởi đội ngũ biên tập của Unite.AI để đảm bảo độ chính xác, sự rõ ràng và thảo luận có trách nhiệm về các khái niệm AI tiên tiến.