AI 模型与平台
Nano Banana 2.1 以图像成本仅为前代的一半推出

Google 于 2026 年 10 月 6 日发布了 Nano Banana 2.1,这是一款基于 Gemini 3.6 Flash 的图像生成与编辑模型,可在 Gemini 应用、Google AI Studio、Gemini API 以及 Gemini Enterprise Agent Platform 上使用,付费 API 图像输出的价格为每百万代币 30 美元。
该 Nano Banana 2.1 模型卡 于同一天发布,描述该模型是 Gemini 3 系列原生多模态推理模型的一员。它接受文本字符串和图像作为输入,上下文窗口最高可达 100 万代币,并生成图像和文本输出,分别列为 4K 代币和 64K 代币的输出。卡片列出了通过 Gemini 应用、Google AI Studio、Gemini API、Google 搜索中的 AI 模式、Google Ads、Google Flow 和 Google Stitch 的分发渠道。
企业平台规格
在 Gemini Enterprise Agent Platform 上,该模型的标识符为 gemini-nano-banana-2.1,处于一般可用的发布阶段,列出的发布日期为 2026 年 10 月 6 日。Google 的 平台文档 将 Nano Banana 2.1 描述为针对多模态图像生成和编辑进行优化,提供价格与性能的平衡。
文档列出文本和图像作为输入和输出受支持,视频仅限输入,音频不可用,拥有 131,072 代币的上下文窗口,最大输出代币为 32,768。seed、topK、logprobs、temperature 和 topP 参数不受支持,设置这些参数会返回 API 错误。
支持的功能包括推理、系统指令、隐式上下文缓存、代币计数、基于 Google 搜索和图像搜索的 grounding、预置吞吐量、批量推理以及标准的按需付费,具备全球可用性。支持图像生成(包括来自视频输入)、图像编辑和多轮编辑、图像与文本交错、内容凭证(C2PA)以及虚拟试穿;人物生成不可用。
限制包括每次提示最多 14 张图像,每个文件的内联数据或控制台上传上限为 7 MB,来自 Cloud Storage 的文件上限为 30 MB,输入大小上限为 500 MB。支持的宽高比包括 1:1、3:2、4:3、16:9、9:16 和 21:9,分辨率支持 1K、2K、4K,文件格式支持 png、jpeg、webp、heic 和 heif。文档指出模型每输入一张图像消耗 1,120 代币,输出图像在 1K 分辨率下消耗 1,120 代币,2K 分辨率下消耗 1,680 代币。
Gemini API 定价
Google 的 Gemini API 定价页面(更新于 2026 年 10 月 6 日)将 Nano Banana 2.1 描述为“Nano Banana 2(Gemini 3.1 Flash Image)的升级版”,旨在实现高效的图像生成和对话式编辑,具备提升的视觉质量、多轮角色一致性、精准的文本渲染以及在 1K、2K、4K 分辨率下的搜索 grounding 生成。标准付费层定价为每百万输入代币 1.50 美元(适用于文本、图像和视频),每百万输出代币 7.50 美元(适用于文本和思考),以及每百万代币 30.00 美元的图像输出,该页面将其换算为每张 1K 图像 0.0336 美元、每张 2K 图像 0.0504 美元、每张 4K 图像 0.0756 美元。
批量定价列为每百万输入代币 0.75 美元,每百万代币的文本和思考输出为 3.75 美元,每百万图像代币为 15.00 美元,分别对应每张 1K 图像 0.0168 美元、2K 图像 0.0252 美元、4K 图像 0.0378 美元。通过 Google 网络和图像搜索的 grounding 每月提供 5,000 次免费请求,跨 Gemini 3.x 模型共享,之后每 1,000 次请求收费 14 美元。该页面未列出 Nano Banana 2.1 的免费层访问。
同一页面列出了前代 Gemini 3.1 Flash Image(Nano Banana 2),其定价为每百万输入代币 0.50 美元,文本和思考输出每百万代币 3 美元,每百万图像代币 60.00 美元,对应每张 1K 图像 0.067 美元、2K 图像 0.101 美元、4K 图像 0.151 美元。
报告的评估
模型卡报告了一种评估方法,结合并排人工评估以产生文本到图像和编辑任务的 Elo 分数、单侧 AutoRater 用于事实性评估,以及从 Gemini 2.5 Flash 图像和 Gemini 3 Pro 图像用例中抽取的回归集。
在文本到图像任务中,卡片报告 Nano Banana 2.1 在 Thinking 配置下的整体偏好 Elo 为 1050 ±14,未使用 Thinking 时为 1015 ±13;相比之下,Nano Banana 2(Thinking)为 990 ±7,Gemini 3 Pro 图像(Nano Banana Pro)为 935 ±8。报告的资讯图设计得分在 Thinking 配置下为 1048 ±17,分别低于 Nano Banana 2 的 961 ±12 和 Nano Banana Pro 的 912 ±12;而资讯图事实性得分为 0.521,相比 0.179 和 0.265。
在 Thinking 配置下的编辑任务中,卡片报告 Nano Banana 2.1 的通用编辑得分为 1026,单角色一致性为 1028,多角色一致性为 1106,遮罩/墨水编辑为 1049,产品一致性为 1024,风格化为 1062,多参考编辑为 1066,均高于同表中对应的 Nano Banana 2 和 Nano Banana Pro 的得分。
局限性与安全评估
该卡列出了已知的限制,包括幻觉、偶尔的迟缓或超时、小文本和长段落的渲染不佳、输入与生成图像之间的字符一致性不完美、对指令的部分遵循以及遮罩编辑中的墨水残留、编辑过程中罕见的主体姿势持久化、空间定位的偶尔混淆,以及对世界知识、3D 推理和事实性的有限了解。Gemini 3.6 Flash的知识截止日期为2026年3月,尽管该卡指出在某些领域知识可能仅限于2025年1月。
该卡报告称,由模型开发团队之外的专业团队进行手动红队测试,指出 Nano Banana 2.1 满足了所需的儿童安全发布阈值,并描述其安全性能相较于 Gemini 3 Flash 相似或有所提升,且相对于 Gemini 3.1 Pro 未发现严重问题。关于前沿安全,该卡指出 Gemini 3.1 Pro 和 Gemini 3.7 Flash 未达到任何已跟踪或关键能力水平,且 Nano Banana 2.1 在这些模型上未显示出有意义的新能力或实质性性能提升,因此评估其不太可能达到任何此类水平。












