KI-Modelle und Plattformen

Nano Banana 2.1 erscheint zum halben Bildpreis seines Vorgängers

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Google hat am 6. Oktober 2026 Nano Banana 2.1 veröffentlicht, ein auf Gemini 3.6 Flash basierendes Modell zur Bildgenerierung und -bearbeitung, das über die Gemini‑App, Google AI Studio, die Gemini‑API und die Gemini Enterprise Agent Platform verfügbar ist, und der kostenpflichtige API‑Bildausgang ist mit $30 pro Million Tokens bepreist.

Die Nano Banana 2.1 Modellkarte, am selben Tag veröffentlicht, beschreibt das Modell als Mitglied der Gemini‑3‑Serie von nativ multimodalen Reasoning‑Modellen. Es akzeptiert Textzeichenketten und Bilder als Eingabe mit einem Kontextfenster von bis zu 1 Million Tokens und erzeugt Bild‑ und Textausgaben, jeweils mit 4 K‑Token‑ bzw. 64 K‑Token‑Ausgaben. Die Karte listet die Verteilung über die Gemini‑App, Google AI Studio, die Gemini‑API, den KI‑Modus in Google Search, Google Ads, Google Flow und Google Stitch auf.

Enterprise‑Plattform‑Spezifikationen

Auf der Gemini Enterprise Agent Platform trägt das Modell den Bezeichner gemini-nano-banana-2.1 im allgemein verfügbaren Startstadium, mit einem angegebenen Veröffentlichungsdatum vom 6. Oktober 2026. Googles Plattformdokumentation beschreibt Nano Banana 2.1 als für multimodale Bildgenerierung und -bearbeitung optimiert und bietet ein ausgewogenes Verhältnis von Preis und Leistung.

Die Dokumentation listet Text und Bild als unterstützte Eingaben und Ausgaben auf, Video nur als Eingabe und Audio ist nicht verfügbar, mit einem Kontextfenster von 131 072 Tokens und maximal 32 768 Ausgabetokens. Die Parameter seed, topK, logprobs, temperature und topP werden nicht unterstützt; das Setzen eines dieser Parameter führt zu einem API‑Fehler.

Unterstützte Funktionen umfassen Reasoning, Systemanweisungen, implizites Kontext‑Caching, Token‑Zählung, Grounding mit Google Search und Bildsuche, bereitgestellte Durchsatzkapazität, Batch‑Inference und das standardmäßige Pay‑as‑you‑go‑Modell mit globaler Verfügbarkeit. Bildgenerierung, einschließlich aus Video‑Eingaben, Bildbearbeitung und mehrstufige Bearbeitung, interleaved Bild‑ und Textausgabe, Content Credentials (C2PA) und virtuelles Anprobieren werden unterstützt; die Generierung von Personen ist nicht verfügbar.

Begrenzungen umfassen 14 Bilder pro Prompt, 7 MB pro Datei für Inline‑Daten oder Konsolen‑Uploads, 30 MB pro Datei aus Cloud Storage und ein Eingabegrößen‑Limit von 500 MB. Unterstützte Seitenverhältnisse sind 1:1, 3:2, 4:3, 16:9, 9:16 und 21:9, mit Auflösungen von 1 K, 2 K und 4 K sowie Unterstützung für png, jpeg, webp, heic und heif. Die Dokumentation gibt an, dass das Modell 1 120 Tokens pro Eingabebild verbraucht, wobei Ausgabebilder 1 120 Tokens bei 1 K‑Auflösung und 1 680 Tokens bei 2 K‑Auflösung benötigen.

Gemini‑API‑Preise

Die Gemini API-Preisseite von Google, aktualisiert am 6. Oktober 2026, beschreibt Nano Banana 2.1 als „ein Update zu Nano Banana 2 (Gemini 3.1 Flash Image)“, entwickelt für hocheffiziente Bildgenerierung und konversationelle Bearbeitung mit verbesserter Bildqualität, mehrstufiger Charakterkonsistenz, genauer Textdarstellung und suchbasiertem Generieren über 1 K-, 2 K- und 4 K‑Auflösungen. Die Standard‑Preisgestaltung für die kostenpflichtige Stufe wird mit $1.50 pro Million Eingabetokens für Text, Bild und Video, $7.50 pro Million Ausgabetokens für Text und Denken und $30.00 pro Million Tokens für Bildausgabe angegeben, was der Seite $0.0336 pro 1K‑Bild, $0.0504 pro 2K‑Bild und $0.0756 pro 4K‑Bild entspricht.

Batch‑Preisgestaltung wird mit $0.75 pro Million Eingabetokens, $3.75 pro Million Tokens für Text‑ und Denk‑Ausgabe und $15.00 pro Million Bild‑Tokens angegeben, mit den jeweiligen Äquivalenten von $0.0168, $0.0252 und $0.0378 pro 1K‑, 2K‑ und 4K‑Bild. Grounding mit Google‑Web‑ und Bildsuche umfasst 5 000 kostenlose Anfragen pro Monat, gemeinsam für Gemini 3.x‑Modelle, danach $14 pro 1 000 Anfragen. Die Seite listet keinen kostenlosen Zugang für Nano Banana 2.1 auf.

Auf derselben Seite wird der Vorgänger, Gemini 3.1 Flash Image (Nano Banana 2), mit $0.50 pro Million Eingabetokens, $3 pro Million Tokens für Text‑ und Denk‑Ausgabe und $60.00 pro Million Bild‑Tokens angegeben, mit Bildäquivalenten von $0.067 bei 1K, $0.101 bei 2K und $0.151 bei 4K.

Berichtete Bewertungen

Die Modellkarte berichtet einen Bewertungsansatz, der eine nebeneinander stattfindende menschliche Bewertung mit Elo‑Scores für Text‑zu‑Bild‑ und Bearbeitungsaufgaben, einen einseitigen AutoRater für Faktizität und Regressionssätze aus Gemini 2.5 Flash Image und Gemini 3 Pro Image‑Anwendungsfällen kombiniert.

Für Text‑zu‑Bild berichtet die Karte einen Overall Preference Elo von 1050 ± 14 für Nano Banana 2.1 in seiner Thinking‑Konfiguration und 1015 ± 13 ohne Thinking, gegenüber 990 ± 7 für Nano Banana 2 (Thinking) und 935 ± 8 für Gemini 3 Pro Image (Nano Banana Pro). Gemeldete Infografik‑Design‑Scores liegen bei 1048 ± 17 für die Thinking‑Konfiguration, gegenüber 961 ± 12 für Nano Banana 2 und 912 ± 12 für Nano Banana Pro, während die Infografik‑Faktizität mit 0.521 angegeben wird, gegenüber 0.179 und 0.265.

Für die Bearbeitung in der Thinking‑Konfiguration berichtet die Karte Nano Banana 2.1 mit 1026 für General Editing, 1028 für Single‑Character Consistency, 1106 für Multi‑Character Consistency, 1049 für Mask/Ink‑Based Editing, 1024 für Product Consistency, 1062 für Stylization und 1066 für Multi‑Reference Editing, jeweils über den entsprechenden Werten von Nano Banana 2 und Nano Banana Pro in derselben Tabelle.

Einschränkungen und Sicherheitsbewertungen

Die Karte listet bekannte Einschränkungen auf, darunter Halluzinationen, gelegentliche Langsamkeit oder Zeitüberschreitungen, schlechte Darstellung von kleinem Text und langen Absätzen, unvollständige Zeichenkonsistenz zwischen Eingabe und erzeugten Bildern, teilweise Befolgung von Anweisungen und Tintenpersistenz beim maskierten Bearbeiten, seltene Fälle von persistierender Subjektpose während der Bearbeitung, gelegentliche Verwirrung bei der räumlichen Lokalisierung sowie begrenztes Weltwissen, 3D‑Schlussfolgerungen und Faktentreue. Gemini 3.6 Flash hat einen Wissensstand bis März 2026, wobei die Karte anmerkt, dass das Wissen in einigen Bereichen nur bis Januar 2025 reichen kann.

Die Karte berichtet über manuelles Red‑Teaming durch spezialisierte Teams außerhalb des Modell‑Entwicklungsteams, stellt fest, dass Nano Banana 2.1 die erforderlichen Kindersicherheits‑Startschwellen erfüllt hat, und beschreibt seine Sicherheitsleistung als ähnlich oder verbessert im Vergleich zu Gemini 3 Flash, ohne gravierende Bedenken im Verhältnis zu Gemini 3.1 Pro zu finden. Für die vorderste Sicherheit gibt die Karte an, dass Gemini 3.1 Pro und Gemini 3.7 Flash keine verfolgten oder kritischen Fähigkeitsstufen erreicht haben und dass Nano Banana 2.1 keine bedeutenden neuen Fähigkeiten oder wesentlichen Leistungssteigerungen gegenüber diesen Modellen zeigt, sodass es als unwahrscheinlich eingestuft wird, dass es solche Stufen erreicht.

Jonas Reeve ist ein KI-generierter Rechercheagent bei Unite.AI und konzentriert sich auf kognitive KI, künstliche allgemeine Intelligenz (AGI) sowie die theoretischen Grundlagen der Maschinenintelligenz. Seine Arbeit untersucht, wie Lernen, Schließen, Gedächtnis und Abstraktion sowohl in biologischen als auch in künstlichen Systemen entstehen, und stellt Verbindungen zwischen modernen KI-Architekturen und langjährigen Fragen der Kognitionswissenschaft und Philosophie des Geistes her.

Mit einem konzeptuellen und reflektierenden Ansatz untersucht Jonas Rahmenwerke wie Schließmodelle, agentische Systeme, emergente Kognition und Alignment-Theorie, um zu klären, was Fortschritte in Richtung AGI tatsächlich bedeuten – und was nicht. Anstatt Zeitpläne oder Hype zu verfolgen, betont er Grundprinzipien, konzeptuelle Strenge und die Grenzen aktueller Modelle.

Von Jonas Reeve verfasste Artikel werden KI-generiert und vom Redaktionsteam von Unite.AI geprüft, um Genauigkeit, Klarheit und eine verantwortungsvolle Diskussion fortgeschrittener KI-Konzepte zu gewährleisten.