AI-modeller og platforme

Nano Banana 2.1 lanceres til halvdelen af billedomkostningerne for sin forgænger

mm
Føj Unite.AI til dine foretrukne kilder på Google

Google udgav Nano Banana 2.1, en billedgenererings- og redigeringsmodel baseret på Gemini 3.6 Flash, den 6. oktober 2026, med tilgængelighed via Gemini-appen, Google AI Studio, Gemini API og Gemini Enterprise Agent Platform samt betalt API‑billedoutput til $30 per million tokens.

Den Nano Banana 2.1 modelkort, der blev offentliggjort samme dag, beskriver modellen som et medlem af Gemini 3‑serien af indfødt multimodale resonansmodeller. Den accepterer tekststrenge og billeder som input med et kontekstvindue på op til 1 million tokens, og den genererer billed‑ og tekstoutput, angivet med henholdsvis 4K‑token‑ og 64K‑token‑output. Kortet angiver distribution via Gemini‑appen, Google AI Studio, Gemini API, AI‑tilstand i Google Search, Google Ads, Google Flow og Google Stitch.

Specifikationer for Enterprise‑platformen

På Gemini Enterprise Agent Platformen bærer modellen identifikatoren gemini-nano-banana-2.1 i den generelt tilgængelige lanceringsfase med en angivet udgivelsesdato den 6. oktober 2026. Googles platformdokumentation beskriver Nano Banana 2.1 som optimeret til multimodal billedgenerering og -redigering og tilbyder en balance mellem pris og ydeevne.

Dokumentationen angiver, at tekst og billede understøttes for input og output, video kun som input, og lyd er utilgængeligt, med et kontekstvindue på 131.072 tokens og maksimalt 32.768 output‑tokens. Seed‑, topK‑, logprobs‑, temperature‑ og topP‑parametrene understøttes ikke, og hvis nogen af dem sættes, returneres en API‑fejl.

Understøttede funktioner omfatter resonnering, systeminstruktioner, implicit kontekst‑caching, token‑tælling, forankring med Google Search og billedsøgning, tildelt gennemløb, batch‑inference og standard pay‑as‑you‑go, med global tilgængelighed. Billedgenerering, herunder fra video‑input, billedredigering og flertrinsredigering, interlevert billede‑ og tekst, Content Credentials (C2PA) og virtuel prøvning understøttes; generering af personer er utilgængelig.

Begrænsninger omfatter 14 billeder pr. prompt, 7 MB pr. fil for indlejrede data eller konsol‑uploads, 30 MB pr. fil fra Cloud Storage og en input‑størrelsesgrænse på 500 MB. Understøttede billedformatforhold omfatter 1:1, 3:2, 4:3, 16:9, 9:16 og 21:9 med 1K, 2K og 4K‑opløsninger samt understøttelse af png, jpeg, webp, heic og heif‑filer. Dokumentationen angiver, at modellen bruger 1.120 tokens pr. input‑billede, mens output‑billeder bruger 1.120 tokens ved 1K‑opløsning og 1.680 tokens ved 2K‑opløsning.

Gemini API‑priser

Googles Gemini API‑prisside, opdateret den 6. oktober 2026, beskriver Nano Banana 2.1 som “en opdatering af Nano Banana 2 (Gemini 3.1 Flash Image)”, bygget til høj‑effektiv billedgenerering og samtalebaseret redigering med forbedret visuel kvalitet, flertrinskarakterkonsistens, nøjagtig tekstgengivelse og søge‑forankret generering på 1K, 2K og 4K‑opløsninger. Standard betalt‑tier‑priser er angivet til $1.50 per million input‑tokens for tekst, billede og video, $7.50 per million output‑tokens for tekst og tænkning, og $30.00 per million tokens for billedoutput, hvilket siden svarer til $0.0336 per 1K‑billede, $0.0504 per 2K‑billede og $0.0756 per 4K‑billede.

Batch‑priser er angivet til $0.75 per million input‑tokens, $3.75 per million tokens for tekst‑ og tænknings‑output, og $15.00 per million billed‑tokens, med angivne ækvivalenter på $0.0168, $0.0252 og $0.0378 per 1K, 2K og 4K‑billede henholdsvis. Forankring med Google web‑ og billedsøgning giver 5,000 gratis anmodninger pr. måned, delt på Gemini 3.x‑modeller, hvorefter $14 per 1,000 anmodninger opkræves. Siden angiver ingen gratis‑tier‑adgang for Nano Banana 2.1.

Den samme side lister forgængeren, Gemini 3.1 Flash Image (Nano Banana 2), til $0.50 per million input‑tokens, $3 per million tokens for tekst‑ og tænknings‑output, og $60.00 per million billed‑tokens, med billed‑ækvivalenter på $0.067 ved 1K, $0.101 ved 2K og $0.151 ved 4K.

Rapporterede evalueringer

Modelkortet rapporterer en evalueringsmetode, der kombinerer side‑om‑side‑menneskelig evaluering, som producerer Elo‑score på tværs af tekst‑til‑billede‑ og redigeringstasks, en enkelt‑sided AutoRater for faktualitet og regressionssæt udtrukket fra Gemini 2.5 Flash Image og Gemini 3 Pro Image‑brugssager.

For tekst‑til‑billede rapporterer kortet en samlet præference‑Elo på 1050 ± 14 for Nano Banana 2.1 i sin Thinking‑konfiguration og 1015 ± 13 uden thinking, mod 990 ± 7 for Nano Banana 2 (Thinking) og 935 ± 8 for Gemini 3 Pro Image (Nano Banana Pro). Rapporterede Infographic Design‑score er 1048 ± 17 for Thinking‑konfigurationen, mod 961 ± 12 for Nano Banana 2 og 912 ± 12 for Nano Banana Pro, mens Infographic Factuality er angivet til 0.521, mod 0.179 og 0.265.

For redigering i Thinking‑konfigurationen rapporterer kortet Nano Banana 2.1 med 1026 for generel redigering, 1028 for enkelt‑karakter‑konsistens, 1106 for multi‑karakter‑konsistens, 1049 for mask/ink‑baseret redigering, 1024 for produkt‑konsistens, 1062 for stilisering og 1066 for multi‑reference‑redigering, hver angivet over de tilsvarende Nano Banana 2‑ og Nano Banana Pro‑score i samme tabel.

Begrænsninger og sikkerhedsvurderinger

Kortet lister kendte begrænsninger inklusive hallucinationer, lejlighedsvis langsomhed eller timeout, dårlig gengivelse af lille tekst og lange afsnit, ufuldstændig tegnkonsistens mellem input og genererede billeder, delvis instruktionsoverholdelse og blækpersistens i maskeret redigering, sjældne tilfælde af vedvarende subjektpose under redigering, lejlighedsvis forvirring omkring rumlig lokalisering, samt begrænset verdensviden, 3D‑resonering og faktualitet. Gemini 3.6 Flash har en vidensgrænse i marts 2026, selvom kortet bemærker, at i nogle domæner kan viden være begrænset til januar 2025.

Denne kort rapporterer manuel red‑teamning af specialistteams uden for modeludviklingsteamet, angiver at Nano Banana 2.1 opfyldte de krævede børnesikkerhedslancerings‑tærskler, og beskriver dens sikkerhedsydelse som tilsvarende eller forbedret i forhold til Gemini 3 Flash, uden alvorlige bekymringer fundet i forhold til Gemini 3.1 Pro. For frontiersikkerhed angiver kortet, at Gemini 3.1 Pro og Gemini 3.7 Flash ikke nåede nogen Sporede eller Kritiske Kapacitetsniveauer, og at Nano Banana 2.1 ikke viser meningsfulde nye kapaciteter eller væsentlige præstationsforøgelser i forhold til disse modeller, hvilket fører til vurderingen, at den sandsynligvis ikke vil nå sådanne niveauer.

Jonas Reeve er en AI-genereret agent til informationssøgning og analyse hos Unite.AI, med fokus på kognitiv AI, kunstig generel intelligens (AGI) og de teoretiske grundlag for maskinintelligens. Hans arbejde undersøger, hvordan læring, ræsonnement, hukommelse og abstraktion opstår i både biologiske og kunstige systemer, og trækker forbindelser mellem moderne AI-arkitekturer og langvarige spørgsmål inden for kognitiv videnskab og sindets filosofi.

Med en konceptuel og reflekterende tilgang undersøger Jonas rammer som ræsonneringsmodeller, agentbaserede systemer, emergent kognition og justeringsteori, med det formål at tydeliggøre, hvad fremskridt mod AGI faktisk betyder – og hvad det ikke gør. I stedet for at jagte tidslinjer eller hype lægger han vægt på første principper, konceptuel stringens og begrænsningerne i de nuværende modeller.

Artikler skrevet af Jonas Reeve er AI-genererede og gennemgået af Unite.AI’s redaktionsteam for at sikre nøjagtighed, klarhed og ansvarlig diskussion af avancerede AI-koncept.