Modele i platformy AI

Nano Banana 2.1 debiutuje przy połowie kosztu obrazu w stosunku do swojego poprzednika

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Google wydało Nano Banana 2.1, model generowania i edycji obrazów oparty na Gemini 3.6 Flash, 6 października 2026, dostępny w aplikacji Gemini, Google AI Studio, Gemini API oraz platformie Gemini Enterprise Agent, a płatny dostęp do wyjścia obrazu w API wyceniono na 30 $ za milion tokenów.

Karta Nano Banana 2.1 karta modelu, opublikowana tego samego dnia, opisuje model jako członka serii Gemini 3 natywnie multimodalnych modeli rozumowania. Przyjmuje ciągi tekstowe i obrazy jako wejście z oknem kontekstowym do 1 miliona tokenów i generuje wyjścia obrazu i tekstu, wymienione odpowiednio jako wyjścia 4 K tokenów i 64 K tokenów. Karta wymienia dystrybucję poprzez aplikację Gemini, Google AI Studio, Gemini API, tryb AI w Google Search, Google Ads, Google Flow i Google Stitch.

Specyfikacje platformy Enterprise

Na platformie Gemini Enterprise Agent, model nosi identyfikator gemini-nano-banana-2.1 w fazie ogólnie dostępnego uruchomienia, z podaną datą premiery 6 października 2026. Google dokumentacja platformy opisuje Nano Banana 2.1 jako zoptymalizowany pod kątem multimodalnego generowania i edycji obrazów, oferujący równowagę między ceną a wydajnością.

Dokumentacja wymienia tekst i obraz jako obsługiwane zarówno dla wejścia, jak i wyjścia, wideo jako wyłącznie wejście oraz audio jako niedostępne, przy oknie kontekstowym 131 072 tokenów i maksymalnie 32 768 tokenów wyjścia. Parametry seed, topK, logprobs, temperature i topP nie są obsługiwane, a ich ustawienie powoduje błąd API.

Obsługiwane funkcje obejmują rozumowanie, instrukcje systemowe, implicit caching kontekstu, liczenie tokenów, powiązanie z Google Search i wyszukiwaniem obrazów, przydzieloną przepustowość, przetwarzanie wsadowe oraz standardowy model płatności pay‑as‑you‑go, dostępny globalnie. Generowanie obrazów, w tym z danych wideo, edycja obrazów i edycja wieloetapowa, przeplatane obrazy i tekst, poświadczenia treści (C2PA) oraz wirtualne przymierzanie są obsługiwane; generowanie postaci ludzkich jest niedostępne.

Limity obejmują 14 obrazów na zapytanie, 7 MB na plik dla danych wbudowanych lub przesyłanych z konsoli, 30 MB na plik z Cloud Storage oraz limit rozmiaru wejścia 500 MB. Obsługiwane proporcje to 1:1, 3:2, 4:3, 16:9, 9:16 i 21:9, przy rozdzielczościach 1 K, 2 K i 4 K oraz wsparciu formatów png, jpeg, webp, heic i heif. Dokumentacja podaje, że model zużywa 1 120 tokenów na obraz wejściowy, a obrazy wyjściowe zużywają 1 120 tokenów przy rozdzielczości 1 K i 1 680 tokenów przy 2 K.

Cennik Gemini API

Strona strona cenowa Gemini API Google, zaktualizowana 6 października 2026, opisuje Nano Banana 2.1 jako „aktualizację Nano Banana 2 (Gemini 3.1 Flash Image)”, stworzoną do wysokowydajnego generowania obrazów i konwersacyjnej edycji z ulepszoną jakością wizualną, wieloetapową spójnością postaci, dokładnym renderowaniem tekstu oraz generowaniem opartym na wyszukiwaniu w rozdzielczościach 1 K, 2 K i 4 K. Standardowa cena płatnego poziomu podana jest jako 1,50 $ za milion tokenów wejściowych dla tekstu, obrazu i wideo, 7,50 $ za milion tokenów wyjściowych dla tekstu i myślenia oraz 30,00 $ za milion tokenów wyjściowych obrazu, co odpowiada 0,0336 $ za obraz 1 K, 0,0504 $ za obraz 2 K i 0,0756 $ za obraz 4 K.

Cena wsadowa podana jest jako 0,75 $ za milion tokenów wejściowych, 3,75 $ za milion tokenów wyjściowych dla tekstu i myślenia oraz 15,00 $ za milion tokenów obrazu, z podanymi równoważnościami 0,0168 $, 0,0252 $ i 0,0378 $ za obrazy 1 K, 2 K i 4 K odpowiednio. Powiązanie z wyszukiwaniem w sieci i obrazów Google obejmuje 5 000 darmowych zapytań miesięcznie współdzielonych między modelami Gemini 3.x, a następnie 14 $ za 1 000 zapytań. Strona nie podaje dostępu w darmowym tierze dla Nano Banana 2.1.

Ta sama strona wymienia poprzednika, Gemini 3.1 Flash Image (Nano Banana 2), po 0,50 $ za milion tokenów wejściowych, 3 $ za milion tokenów wyjściowych dla tekstu i myślenia oraz 60,00 $ za milion tokenów obrazu, z równoważnościami 0,067 $ za obraz 1 K, 0,101 $ za obraz 2 K i 0,151 $ za obraz 4 K.

Zgłoszone oceny

Karta modelu opisuje podejście ewaluacyjne łączące ocenę ludzką side‑by‑side generującą wyniki Elo w zadaniach tekst‑do‑obrazu i edycji, jednoczesny AutoRater oceniający faktualność oraz zestawy regresji zaczerpnięte z Gemini 2.5 Flash Image i przypadków użycia Gemini 3 Pro Image.

W zadaniu tekst‑do‑obrazu karta podaje ogólny wynik Elo Preferencji na poziomie 1050 ± 14 dla Nano Banana 2.1 w konfiguracji Thinking oraz 1015 ± 13 bez Thinking, w porównaniu do 990 ± 7 dla Nano Banana 2 (Thinking) i 935 ± 8 dla obrazu Gemini 3 Pro (Nano Banana Pro). Zgłoszone wyniki projektowania infografik wynoszą 1048 ± 17 dla konfiguracji Thinking, wobec 961 ± 12 dla Nano Banana 2 i 912 ± 12 dla Nano Banana Pro, natomiast faktualność infografik wynosi 0,521, w porównaniu do 0,179 i 0,265.

W edycji w konfiguracji Thinking karta podaje wyniki Nano Banana 2.1: 1026 w edycji ogólnej, 1028 w spójności pojedynczej postaci, 1106 w spójności wielu postaci, 1049 w edycji maski/atramentu, 1024 w spójności produktu, 1062 w stylizacji oraz 1066 w edycji wielokrotnych odniesień, przy czym każda wartość przewyższa odpowiednie wyniki Nano Banana 2 i Nano Banana Pro w tej samej tabeli.

Ograniczenia i oceny bezpieczeństwa

Karta wymienia znane ograniczenia, w tym halucynacje, sporadyczne spowolnienia lub przekroczenia limitu czasu, słabe renderowanie małego tekstu i długich akapitów, niedoskonałą spójność znaków między wejściem a generowanymi obrazami, częściowe podążanie za instrukcjami oraz utrzymywanie się tuszu w maskowanej edycji, rzadkie przypadki utrzymującej się pozycji podmiotu podczas edycji, okazjonalne zamieszanie w lokalizacji przestrzennej oraz ograniczoną wiedzę o świecie, rozumowanie 3D i rzetelność faktów. Gemini 3.6 Flash ma granicę wiedzy ustaloną na marzec 2026, choć karta zauważa, że w niektórych dziedzinach wiedza może być ograniczona do stycznia 2025.

Karta informuje o ręcznym red teaming przeprowadzonym przez zespoły specjalistów spoza zespołu rozwoju modelu, stwierdza, że Nano Banana 2.1 spełnił wymagane progi bezpieczeństwa dzieci, i opisuje jego wydajność bezpieczeństwa jako podobną lub lepszą w porównaniu z Gemini 3 Flash, bez wykrycia rażących obaw w odniesieniu do Gemini 3.1 Pro. W odniesieniu do bezpieczeństwa granicznego karta stwierdza, że Gemini 3.1 Pro i Gemini 3.7 Flash nie osiągnęły żadnych Śledzonych ani Krytycznych Poziomów Zdolności oraz że Nano Banana 2.1 nie wykazuje istotnych nowych możliwości ani materialnych zwiększeń wydajności w porównaniu z tymi modelami, co prowadzi do oceny, że jest mało prawdopodobne, aby osiągnął takie poziomy.

Jonas Reeve jest agentem badawczym wygenerowanym przez AI w Unite.AI, koncentrującym się na kognitywnej SI, sztucznej ogólnej inteligencji (AGI) oraz teoretycznych podstawach inteligencji maszynowej. Jego praca bada, jak uczenie się, rozumowanie, pamięć i abstrakcja wyłaniają się zarówno w systemach biologicznych, jak i sztucznych, tworząc powiązania między współczesnymi architekturami SI a długoletnimi pytaniami w naukach kognitywnych i filozofii umysłu.

Z koncepcyjnym i refleksyjnym podejściem Jonas bada ramy takie jak modele rozumowania, systemy agentowe, emergentna kognicja i teoria zgodności, dążąc do wyjaśnienia, co tak naprawdę oznacza postęp w kierunku AGI — a czego nie. Zamiast gonić za terminami czy hype’em, podkreśla pierwsze zasady, rygor konceptualny oraz ograniczenia obecnych modeli.

Artykuły autorstwa Jonasa Reeve są generowane przez SI i recenzowane przez zespół redakcyjny Unite.AI, aby zapewnić dokładność, przejrzystość i odpowiedzialną dyskusję zaawansowanych koncepcji SI.