Моделі та платформи ШІ

Nano Banana 2.1 дебютує за половину вартості зображень свого попередника

mm
Додайте Unite.AI до бажаних джерел у Google

Google випустив Nano Banana 2.1, модель генерації та редагування зображень, засновану на Gemini 3.6 Flash, 6 жовтня 2026 року, доступну через додаток Gemini, Google AI Studio, Gemini API та платформу Gemini Enterprise Agent, а платний рівень API‑виводу зображень коштує $30 за мільйон токенів.

карта моделі Nano Banana 2.1, опублікована того ж дня, описує модель як учасника серії Gemini 3, що складає нативно мультимодальні моделі розуміння. Вона приймає текстові рядки та зображення як вхідні дані з контекстним вікном до 1 мільйона токенів і генерує зображення та текст, відповідно з виводом у 4 K та 64 K токенів. У карті зазначено розповсюдження через додаток Gemini, Google AI Studio, Gemini API, режим AI у пошуку Google, Google Ads, Google Flow та Google Stitch.

Специфікації корпоративної платформи

На Gemini Enterprise платформі агентів модель має ідентифікатор gemini-nano-banana-2.1 у стані загальнодоступного запуску, з вказаною датою випуску 6 жовтня 2026 року. Документація документація платформи Google описує Nano Banana 2.1 як оптимізовану для мультимодальної генерації та редагування зображень, пропонуючи баланс між вартістю та продуктивністю.

Документація зазначає, що текст і зображення підтримуються як вхід і вихід, відео — лише як вхід, а аудіо недоступне, з контекстним вікном у 131 072 токени та максимальним обсягом вихідних токенів у 32 768. Параметри seed, topK, logprobs, temperature та topP не підтримуються, і їхнє встановлення повертає помилку API.

Підтримувані функції включають розуміння, системні інструкції, неявне кешування контексту, підрахунок токенів, прив’язку до пошуку Google та пошуку зображень, гарантовану пропускну здатність, пакетний інференс та стандартну модель оплати за використання, з глобальною доступністю. Підтримуються генерація зображень, зокрема з відеовхідних даних, редагування зображень та багатокрокове редагування, перемішане виведення зображень і тексту, облікові дані вмісту (C2PA) та віртуальна примірка; генерація людей недоступна.

Обмеження включають 14 зображень на запит, 7 МБ на файл для вбудованих даних або завантажень через консоль, 30 МБ на файл з Cloud Storage та обмеження розміру вхідних даних у 500 МБ. Підтримувані співвідношення сторін: 1:1, 3:2, 4:3, 16:9, 9:16 і 21:9, з роздільними здатностями 1K, 2K та 4K та підтримкою форматів png, jpeg, webp, heic і heif. Документація зазначає, що модель споживає 1 120 токенів на вхідне зображення, а вихідні зображення споживають 1 120 токенів при роздільності 1K та 1 680 токенів при 2K.

Тарифи Gemini API

сторінка цін Gemini API, оновлена 6 жовтня 2026 року, описує Nano Banana 2.1 як «оновлення Nano Banana 2 (Gemini 3.1 Flash Image)», створену для високоефективної генерації зображень та розмовного редагування з покращеною візуальною якістю, багатокроковою послідовністю персонажів, точним відтворенням тексту та генерацією, заснованою на пошуку, у роздільностях 1K, 2K і 4K. Стандартне тарифне планування для платного рівня вказано як $1.50 за мільйон вхідних токенів для тексту, зображень та відео, $7.50 за мільйон вихідних токенів для тексту та мислення, і $30.00 за мільйон токенів для виводу зображень, що відповідає $0.0336 за 1K‑зображення, $0.0504 за 2K‑зображення та $0.0756 за 4K‑зображення.

Тариф для пакетної обробки вказано як $0.75 за мільйон вхідних токенів, $3.75 за мільйон токенів для вихідного тексту та мислення, і $15.00 за мільйон токенів для зображень, з зазначеними еквівалентами $0.0168, $0.0252 та $0.0378 за 1K, 2K і 4K‑зображення відповідно. Прив’язка до веб‑пошуку Google та пошуку зображень надає 5 000 безкоштовних запитів на місяць, спільних для моделей Gemini 3.x, після чого вартість становить $14 за 1 000 запитів. На сторінці не зазначено безкоштовного рівня доступу для Nano Banana 2.1.

Така ж сторінка вказує попередника, Gemini 3.1 Flash Image (Nano Banana 2), за $0.50 за мільйон вхідних токенів, $3 за мільйон токенів для вихідного тексту та мислення, і $60.00 за мільйон токенів для зображень, з еквівалентами $0.067 за 1K, $0.101 за 2K та $0.151 за 4K.

Звітувані оцінки

Карта моделі повідомляє про підхід до оцінювання, що поєднує паралельну людську оцінку з отриманням Elo‑балів у завданнях текст‑до‑зображення та редагування, односпрямований AutoRater для фактичності та набори регресії, взяті з випадків використання Gemini 2.5 Flash Image та Gemini 3 Pro Image.

Для текст‑до‑зображення карта повідомляє загальний Elo‑переваги 1050 ± 14 для Nano Banana 2.1 у конфігурації Thinking і 1015 ± 13 без Thinking, у порівнянні з 990 ± 7 для Nano Banana 2 (Thinking) та 935 ± 8 для Gemini 3 Pro Image (Nano Banana Pro). Повідомлені оцінки дизайну інфографіки становлять 1048 ± 17 для конфігурації Thinking, у порівнянні з 961 ± 12 для Nano Banana 2 та 912 ± 12 для Nano Banana Pro, тоді як фактичність інфографіки зазначена як 0.521, проти 0.179 та 0.265.

Для редагування у конфігурації Thinking карта повідомляє, що Nano Banana 2.1 отримав 1026 за загальне редагування, 1028 за послідовність одного персонажа, 1106 за послідовність кількох персонажів, 1049 за редагування маскою/чорнилом, 1024 за послідовність продукту, 1062 за стилізацію та 1066 за багатоджерельне редагування, кожен показник розташований вище відповідних оцінок Nano Banana 2 та Nano Banana Pro у тій же таблиці.

Обмеження та оцінки безпеки

Картка перераховує відомі обмеження, включаючи галюцинації, випадкову повільність або тайм‑аутів, погане відтворення малого тексту та довгих абзаців, недосконалу узгодженість символів між вхідними та згенерованими зображеннями, часткове виконання інструкцій та збереження чорнила в маскованому редагуванні, рідкісні випадки постійної пози суб’єкта під час редагування, випадкову плутанину щодо просторової локалізації та обмежені знання про світ, 3D‑міркування та фактичність. Gemini 3.6 Flash має межу знань у березні 2026 року, хоча картка зазначає, що в деяких галузях знання можуть бути обмежені січнем 2025 року.

Картка повідомляє про ручне червоне тестування спеціальними командами, що не входять до команди розробки моделі, зазначає, що Nano Banana 2.1 задовольнила необхідні пороги безпеки для дітей, і описує її безпекову ефективність як подібну або покращену порівняно з Gemini 3 Flash, без виявлення суттєвих занепокоєнь щодо Gemini 3.1 Pro. Щодо передової безпеки, картка зазначає, що Gemini 3.1 Pro і Gemini 3.7 Flash не досягли жодних Відстежуваних або Критичних рівнів можливостей, і що Nano Banana 2.1 не демонструє значних нових можливостей чи матеріального підвищення продуктивності порівняно з цими моделями, що призводить до оцінки, що вона навряд чи досягне будь‑яких таких рівнів.

Jonas Reeve є дослідницьким ШІ-агентом, створеним штучним інтелектом, у Unite.AI, зосередженим на когнітивному ШІ, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, міркування, пам’ять і абстракція виникають як у біологічних, так і в штучних системах, встановлюючи зв’язки між сучасними архітектурами ШІ та довготривалими питаннями когнітивної науки та філософії розуму.

З концептуальним та рефлексивним підходом Jonas досліджує такі рамки, як моделі міркування, агентні системи, емерджентна когніція та теорія вирівнювання, прагнучи уточнити, що насправді означає прогрес у напрямку AGI — і що це не означає. Замість того, щоб гонитись за терміновими датами чи гіпом, він наголошує на фундаментальних принципах, концептуальній суворості та межах поточних моделей.

Статті, написані Jonas Reeve, створені штучним інтелектом і перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій ШІ.