KI-Modelle und Plattformen
Alibaba startet Qwen-Image-3.0 ohne Benchmarks oder Gewichte

Alibabas Qwen-Team veröffentlichte Qwen-Image-3.0 am 21. Juli 2026, die dritte Generation seines Bildgenerierungsmodells, und baute die Ankündigung um ein einziges Ziel auf: Machen Sie die generierten Bilder praktisch genug, um sie als Arbeitswerkzeug und nicht nur als hübsch anzusehen. Der Launch-Post ist eine Galerie dessen, was das System zeichnen kann – dichte Zeitungsseiten, Multi-Panel-Infografiken und akademische Papiere voller mathematischer Notation. Was es nicht enthält, ist ein Benchmark-Score, eine Modellkarte oder ein technischer Bericht, um all dies zu untermauern.
Diese Abwesenheit ist die Geschichte. Qwen-Image-3.0s Schlagzeilenansprüche basieren ausschließlich auf Beispielbildern, die das Unternehmen veröffentlicht hat, und die früheren Modelle in der gleichen Serie setzten eine höhere Latte für Beweise als diese.
Was das Modell zu tun beansprucht
Das Qwen-Team organisiert die Veröffentlichung um drei Fähigkeiten herum. Die erste ist die Verarbeitung langer, detaillierter Anweisungen: Das Modell akzeptiert Anweisungen von bis zu 4.500 Token, was das Unternehmen sagt, es ermöglicht, informationsschwere Bilder in einem einzigen Durchgang zu komponieren. Sein Mittelpunkt ist ein Beispiel, ein drei-mal-drei-Raster unabhängiger Infografiken – ein Physik-Diagramm, ein Gruppentheorie-Beweis, ein Biologie-Erklärung und sechs weitere – die Alibaba sagt, aus einer einzigen 3.700-Token-Anweisung produziert wurde und nicht aus separaten Bildern zusammengesetzt wurde. Ein weiteres Beispiel verschachtelt Schnittstellen ineinander, indem es einen Code-Editor um ein Chat-Fenster um eine Messaging-App legt.
Der zweite Anspruch ist feine Details. Alibaba sagt, das Modell rendert Text so klein wie 10 Pixel lesbar und reproduziert Texturen wie Haut, Haar und Papier nahezu fotografischer Qualität. Der Post zeigt eine vollständige Seite eines akademischen Papiers mit mehrzeiligen Gleichungen und einer simulierten Zeitungsfrontseite sowie Bearbeitungsaufgaben wie das Hinzufügen handschriftlicher Anmerkungen und die Wiederherstellung eines beschädigten traditionellen Gemäldes.
Der dritte ist, was das Unternehmen “Weltwissen” nennt: native Rendering von 12 Sprachen, Reproduktion von Schnittstellen wie Webseiten und Livestreams und die Fähigkeit, Live-Daten aus dem Internet zu ziehen. Ein Beispiel generiert eine Wettervorhersage-Grafik für eine bestimmte Stadt und ein bestimmtes Datum, ein ungewöhnlicher Schritt für einen Generator und einer, der die Grenze zwischen einem Bildmodell und einem datengetriebenen Design-Tool verwischt. Alibaba wirbt das gesamte Paket für Content-Produktionsarbeiten – Zeitungslayouts, Kurzfilm-Storyboards, UI-Mockups und E-Commerce-Bilder – die Art von Medienausgaben, bei denen die Frage der Offenlegung von KI bereits aktuell ist. Jede dieser Fähigkeiten jedoch wird durch Ausgaben gezeigt, die das Unternehmen ausgewählt hat.
Was die Ankündigung auslässt
Der Post enthält keine Benchmark-Tabelle, keine Parameteranzahl, keine Lizenz und keine herunterladbaren Gewichte, und keinen technischen Bericht, der beschreibt, wie das Modell trainiert oder getestet wurde. Benutzer werden zu Qwen Chat verwiesen, um es auszuprobieren.
Das ist ein Abweichen von der Art und Weise, wie die Serie zuvor veröffentlicht wurde. Qwen-Image 1.0 wurde im August 2025 mit offenen Gewichten unter einer permissiven Apache-2.0-Lizenz und einem gleichzeitigen technischen Bericht veröffentlicht, und Qwen-Image-2.0 folgte mit seinem eigenen technischen Bericht. Die vorherige Version gab auch seine Grenzen an: Es akzeptierte Anweisungen von bis zu etwa 1.000 Token, was den Sprung auf 4.500 das konkreteste Zahl in der neuen Veröffentlichung macht, und eine, die keine außenstehende Partei verifiziert hat.
Die Lücke ist wichtiger für ein Bildmodell als für ein Textmodell. Bildqualität ist subjektiv, und Textrendering ist genau die Achse, auf der Generatoren in handverlesenen Demos stark und unter systematischer Überprüfung schwächer aussehen. Ohne Gewichte oder eine Evaluierungsmenge ist der einzige Beweis, auf den ein Entwickler zurückgreifen kann, Alibabas eigene Ausgabe von Ausgaben. Konkurrenten haben gezeigt, dass ein Chat-Debüt eine Wahl und keine Einschränkung ist: Tencent veröffentlichte HunyuanImage 3.0 als offenes Gewichtsmodell, und Thinking Machines Lab veröffentlichte kürzlich Inkling, sein erstes offenes Gewichts-Multimodell, Gewichte inklusive.
Wo die letzte Generation rangierte
Alibaba hat einen aktuellen und ungewöhnlich offenen Datenpunkt darüber, wo seine Bildmodelle stehen. In Qwen-Image-Bench, einer Text-zu-Bild-Evaluierung, die das Qwen-Team selbst veröffentlichte, belegte das vorherige Flaggschiff, Qwen Image 2.0 Pro, den fünften Platz insgesamt. OpenAIs GPT Image 2 führte die Rangliste an, gefolgt von Googles Nano-Banana-Modellen und OpenAIs GPT Image 1.5. Der Benchmark basiert auf einem automatisierten Richtmodell, dessen Autoren sagen, dass es menschliche Bewerter genau verfolgt, bleibt jedoch Alibabas eigener Test und bewertet die vorherige Generation, nicht 3.0.
Der Kontext spricht gegen die Lesart, dass das neue Modell einen Sprung an die Spitze des Feldes darstellt. Ein fünfter Platz als Ausgangspunkt lässt Qwen-Image-3.0 Raum, um echte Gewinne zu beanspruchen, aber der Launch bietet keine gemessene Möglichkeit, sie zu bestätigen. Die Signale, die es wert sind, zu beobachten, sind, ob Alibaba Gewichte und eine Modellkarte veröffentlicht, wie es für jede frühere Qwen-Image-Veröffentlichung getan hat, und ob unabhängige Evaluierungen die langen Anweisungen und kleinen Textansprüche unterstützen. Bis eines davon eintritt, kann nur gesagt werden, dass Qwen-Image-3.0 in den Bildern, die sein Hersteller ausgewählt hat, stark aussieht.












