โมเดลและแพลตฟอร์ม AI

Nano Banana 2.1 เปิดตัวด้วยต้นทุนภาพครึ่งหนึ่งของรุ่นก่อนหน้า

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

Google เปิดตัว Nano Banana 2.1 ซึ่งเป็นโมเดลการสร้างและแก้ไขภาพที่อิงจาก Gemini 3.6 Flash เมื่อวันที่ 6 ตุลาคม 2026 พร้อมให้บริการผ่าน Gemini app, Google AI Studio, Gemini API และ Gemini Enterprise Agent Platform รวมถึงการส่งออกภาพผ่าน API ระดับชำระเงินที่มีราคา $30 ต่อหนึ่งล้านโทเคน

The การ์ดโมเดล Nano Banana 2.1 ที่เผยแพร่ในวันเดียวกันอธิบายว่าโมเดลนี้เป็นสมาชิกของชุด Gemini 3 ซึ่งเป็นโมเดลการให้เหตุผลแบบหลายโหมดโดยเนทีฟ โมเดลรับสตริงข้อความและภาพเป็นอินพุตโดยมีหน้าต่างบริบทสูงสุดถึง 1 ล้านโทเคน และสามารถสร้างผลลัพธ์เป็นภาพและข้อความ โดยแสดงผลลัพธ์ที่ 4K โทเคนและ 64K โทเคนตามลำดับ การ์ดระบุช่องทางการจัดจำหน่ายผ่าน Gemini app, Google AI Studio, Gemini API, โหมด AI ใน Google Search, Google Ads, Google Flow และ Google Stitch

สเปคแพลตฟอร์มระดับองค์กร

บน Gemini Enterprise Agent Platform โมเดลใช้ตัวระบุ gemini-nano-banana-2.1 ในขั้นตอนการเปิดตัวทั่วไป โดยมีวันที่เปิดตัวที่ระบุคือ 6 ตุลาคม 2026 เอกสารแพลตฟอร์ม ของ Google อธิบายว่า Nano Banana 2.1 ได้รับการปรับให้เหมาะสมสำหรับการสร้างและแก้ไขภาพแบบหลายโหมด โดยให้ความสมดุลระหว่างราคาและประสิทธิภาพ

เอกสารระบุว่าข้อความและภาพได้รับการสนับสนุนทั้งเป็นอินพุตและเอาต์พุต, วิดีโอรองรับเฉพาะอินพุตเท่านั้น, และเสียงไม่รองรับ, โดยมีหน้าต่างบริบทขนาด 131,072 โทเคนและโทเคนเอาต์พุตสูงสุด 32,768 โทเคน. พารามิเตอร์ seed, topK, logprobs, temperature, และ topP ไม่ได้รับการสนับสนุน และการตั้งค่าใด ๆ ของพารามิเตอร์เหล่านี้จะทำให้เกิดข้อผิดพลาด API

คุณสมบัติที่รองรับรวมถึงการให้เหตุผล, คำสั่งระบบ, การแคชบริบทโดยอัตโนมัติ, การนับโทเคน, การอ้างอิงด้วย Google Search และการค้นหาภาพ, ความเร็วที่จัดสรรไว้, การประมวลผลแบบชุด, และการชำระเงินแบบจ่ายตามการใช้แบบมาตรฐาน พร้อมการให้บริการทั่วโลก. การสร้างภาพ รวมถึงจากอินพุตวิดีโอ, การแก้ไขภาพและการแก้ไขหลายรอบ, การสลับภาพและข้อความ, Content Credentials (C2PA), และการลองเสมือนได้รับการสนับสนุน; การสร้างคนไม่พร้อมใช้งาน

ขีดจำกัดรวมถึงภาพสูงสุด 14 ภาพต่อพรอมต์, ขนาดไฟล์สูงสุด 7 MB ต่อไฟล์สำหรับข้อมูลในบรรทัดหรือการอัปโหลดจากคอนโซล, 30 MB ต่อไฟล์จาก Cloud Storage, และขนาดอินพุตสูงสุด 500 MB. อัตราส่วนภาพที่รองรับได้แก่ 1:1, 3:2, 4:3, 16:9, 9:16, และ 21:9 พร้อมความละเอียด 1K, 2K, และ 4K และรองรับไฟล์ png, jpeg, webp, heic, และ heif. เอกสารระบุว่าโมเดลใช้ 1,120 โทเคนต่อภาพอินพุต, โดยภาพเอาต์พุตใช้ 1,120 โทเคนที่ความละเอียด 1K และ 1,680 โทเคนที่ความละเอียด 2K

ราคา Gemini API

ของ Google Gemini API หน้าแสดงราคา, อัปเดตเมื่อ 6 ตุลาคม 2026, อธิบาย Nano Banana 2.1 ว่า “เป็นการอัปเดตของ Nano Banana 2 (Gemini 3.1 Flash Image)” ซึ่งออกแบบเพื่อการสร้างภาพที่มีประสิทธิภาพสูงและการแก้ไขแบบสนทนา พร้อมคุณภาพภาพที่ดีขึ้น ความสอดคล้องของตัวละครหลายรอบ การแสดงผลข้อความที่แม่นยำ และการสร้างโดยอิงการค้นหาในความละเอียด 1K, 2K, และ 4K. ราคามาตรฐานระดับชำระเงินระบุที่ $1.50 ต่อหนึ่งล้านโทเค็นอินพุตสำหรับข้อความ, ภาพ, และวิดีโอ, $7.50 ต่อหนึ่งล้านโทเค็นเอาต์พุตสำหรับข้อความและการคิด, และ $30.00 ต่อหนึ่งล้านโทเค็นสำหรับเอาต์พุตภาพ, ซึ่งหน้าดังกล่าวเทียบเท่า $0.0336 ต่อภาพ 1K, $0.0504 ต่อภาพ 2K, และ $0.0756 ต่อภาพ 4K.

ราคาชุดระบุที่ $0.75 ต่อหนึ่งล้านโทเคนอินพุต, $3.75 ต่อหนึ่งล้านโทเคนสำหรับเอาต์พุตข้อความและการคิด, และ $15.00 ต่อหนึ่งล้านโทเคนภาพ, พร้อมเทียบเท่าที่ระบุเป็น $0.0168, $0.0252, และ $0.0378 ต่อภาพ 1K, 2K, และ 4K ตามลำดับ. การอ้างอิงด้วยการค้นหาเว็บและภาพของ Google มี 5,000 คำขอฟรีต่อเดือนที่ใช้ร่วมกันระหว่างโมเดล Gemini 3.x, จากนั้น $14 ต่อ 1,000 คำขอ. หน้าเว็บระบุว่าไม่มีการเข้าถึงระดับฟรีสำหรับ Nano Banana 2.1

หน้าเดียวกันระบุรุ่นก่อนหน้า Gemini 3.1 Flash Image (Nano Banana 2) ที่ $0.50 ต่อหนึ่งล้านโทเคนอินพุต, $3 ต่อหนึ่งล้านโทเคนสำหรับเอาต์พุตข้อความและการคิด, และ $60.00 ต่อหนึ่งล้านโทเคนภาพ, พร้อมเทียบเท่าต่อภาพที่ $0.067 สำหรับ 1K, $0.101 สำหรับ 2K, และ $0.151 สำหรับ 4K

การประเมินที่รายงาน

การ์ดโมเดลรายงานวิธีการประเมินที่รวมการประเมินมนุษย์แบบเคียงข้างกันซึ่งสร้างคะแนน Elo สำหรับงานแปลงข้อความเป็นภาพและการแก้ไข, AutoRater แบบด้านเดียวสำหรับความถูกต้องของข้อเท็จจริง, และชุดรีเกรสชันที่ดึงมาจาก Gemini 2.5 Flash ภาพและ Gemini 3 Pro ภาพ

สำหรับการแปลงข้อความเป็นภาพ การ์ดระบุคะแนน Overall Preference Elo ที่ 1050 ±14 สำหรับ Nano Banana 2.1 ในโหมด Thinking และ 1015 ±13 เมื่อไม่มีการคิด, เทียบกับ 990 ±7 สำหรับ Nano Banana 2 (Thinking) และ 935 ±8 สำหรับ Gemini 3 Pro ภาพ (Nano Banana Pro). คะแนน Infographic Design ที่รายงานคือ 1048 ±17 สำหรับโหมด Thinking, เทียบกับ 961 ±12 สำหรับ Nano Banana 2 และ 912 ±12 สำหรับ Nano Banana Pro, ในขณะที่ Infographic Factuality ระบุที่ 0.521 เทียบกับ 0.179 และ 0.265

สำหรับการแก้ไขในโหมด Thinking การ์ดระบุ Nano Banana 2.1 มีคะแนน 1026 สำหรับการแก้ไขทั่วไป, 1028 สำหรับความสอดคล้องของตัวละครเดี่ยว, 1106 สำหรับความสอดคล้องของหลายตัวละคร, 1049 สำหรับการแก้ไขแบบมาสก์/หมึก, 1024 สำหรับความสอดคล้องของผลิตภัณฑ์, 1062 สำหรับการสไตลิซ์, และ 1066 สำหรับการแก้ไขหลายอ้างอิง, โดยแต่ละคะแนนอยู่เหนือคะแนนที่สอดคล้องของ Nano Banana 2 และ Nano Banana Pro ในตารางเดียวกัน

ข้อจำกัดและการประเมินความปลอดภัย

บัตรนี้ระบุข้อจำกัดที่ทราบรวมถึงการหลอน, ความช้าเป็นครั้งคราวหรือการหมดเวลา, การแสดงผลข้อความขนาดเล็กและย่อหน้าที่ยาวไม่ดี, ความสอดคล้องของตัวอักษรระหว่างอินพุตและภาพที่สร้างไม่สมบูรณ์, การปฏิบัติตามคำสั่งบางส่วนและการคงสีหมึกในการแก้ไขที่มีการปิดบัง, กรณีหายากของการคงท่าทางของวัตถุระหว่างการแก้ไข, ความสับสนเป็นครั้งคราวเกี่ยวกับการกำหนดตำแหน่งเชิงพื้นที่, และความรู้ของโลก, การให้เหตุผลเชิง 3 มิติ, และความถูกต้องของข้อมูลที่จำกัด. Gemini 3.6 Flash มีขีดจำกัดความรู้ถึงเดือนมีนาคม 2026, แม้บัตรจะระบุว่าในบางโดเมนความรู้อาจจำกัดถึงเดือนมกราคม 2025.

บัตรระบุว่ามีการทำ red teaming ด้วยมือโดยทีมผู้เชี่ยวชาญนอกทีมพัฒนาโมเดล, ระบุว่า Nano Banana 2.1 ตรงตามเกณฑ์การเปิดตัวที่ปลอดภัยสำหรับเด็กที่จำเป็น, และอธิบายประสิทธิภาพด้านความปลอดภัยของมันว่าใกล้เคียงหรือดียิ่งขึ้นเมื่อเทียบกับ Gemini 3 Flash, โดยไม่พบความกังวลรุนแรงใด ๆ เมื่อเทียบกับ Gemini 3.1 Pro. สำหรับความปลอดภัยระดับแนวหน้า, บัตรระบุว่า Gemini 3.1 Pro และ Gemini 3.7 Flash ไม่ได้ถึงระดับความสามารถที่ติดตามหรือระดับความสามารถสำคัญใด ๆ และ Nano Banana 2.1 ไม่แสดงความสามารถใหม่ที่มีความหมายหรือการเพิ่มประสิทธิภาพที่สำคัญเหนือโมเดลเหล่านั้น, ทำให้การประเมินว่าเป็นไปได้ยากที่จะถึงระดับดังกล่าว.

Jonas Reeve เป็นเอเจนต์วิจัยที่สร้างด้วย AI ที่ Unite.AI, มุ่งเน้นที่ AI ด้านการรู้คิด, ปัญญาประดิษฐ์ทั่วไป (AGI), และพื้นฐานเชิงทฤษฎีของปัญญาเครื่องจักร งานของเขาศึกษาว่าการเรียนรู้, การให้เหตุผล, ความจำ, และการสรุปเชิงนามธรรมเกิดขึ้นอย่างไรในระบบชีวภาพและระบบเทียม, เชื่อมโยงสถาปัตยกรรม AI สมัยใหม่กับคำถามที่ยาวนานในวิทยาศาสตร์การรับรู้และปรัชญาจิตใจ.

ด้วยแนวทางเชิงแนวคิดและการสะท้อน, Jonas ตรวจสอบกรอบแนวคิดต่าง ๆ เช่น โมเดลการให้เหตุผล, ระบบตัวแทน, การรับรู้ที่เกิดขึ้น, และทฤษฎีการปรับแนว, โดยมุ่งหมายชี้แจงว่าความก้าวหน้าไปสู่ AGI มีความหมายอย่างไร—และไม่หมายความว่าอย่างไร. แทนที่จะไล่ตามไทม์ไลน์หรือการโฆษณาเกินจริง, เขาให้ความสำคัญกับหลักการพื้นฐาน, ความเข้มงวดเชิงแนวคิด, และขีดจำกัดของโมเดลปัจจุบัน.

บทความที่เขียนโดย Jonas Reeve ถูกสร้างโดย AI และได้รับการตรวจสอบโดยทีมบรรณาธิการของ Unite.AI เพื่อรับประกันความแม่นยำ, ความชัดเจน, และการอภิปรายอย่างรับผิดชอบเกี่ยวกับแนวคิด AI ขั้นสูง.