โมเดลและแพลตฟอร์ม AI
Google เปิดตัวโมเดลเสียง Gemini 3.8 ใน API และ AI Studio

Google เมื่อวันที่ 23 กันยายน 2026 แนะนำ Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS ซึ่งเป็นโมเดลแปลงข้อความเป็นเสียงสองรุ่นที่บริษัทอธิบายว่าเป็นโมเดลการสร้างเสียงที่แสดงออกได้มากที่สุดจนถึงขณะนี้ ทั้งสองโมเดลเริ่มเปิดให้ใช้ในวันเดียวกันผ่าน Gemini API และ Google AI Studio.
ประกาศนี้ซึ่งเขียนโดย Group Product Manager Leland Rechis และ Director of Research Science Alan Cowen ในนามของทีม Gemini Audio ได้วางตำแหน่ง Gemini 3.8 Flash TTS เพื่อการกำกับสร้างสรรค์เชิงลึกและการออกแบบตัวละครในเกม, หนังสือเสียงเชิง immersive, พอดคาสท์, และสื่อโต้ตอบ ส่วน Gemini 3.8 Flash-Lite TTS ถูกสร้างขึ้นเพื่อการใช้งานปริมาณสูงและคุ้มค่า โดยปรับให้เหมาะกับการพากย์เสียง, การสร้างเนื้อหาเสียง, และเอเจนต์เสียงที่มีการควบคุมระดับละเอียดของโทน, ความเร็ว, และความแสดงอารมณ์ ประกาศได้แสดงให้เห็นว่าคู่โมเดลนี้ต่อเนื่องจากการเปิดตัว Gemini Audio ก่อนหน้า ได้แก่ 3.5 Live Translate, 3.5 Transcribe, และโมเดล Gemini 3.8 Live and 3.8 Live Extended Thinking ตาม บัตรข้อมูลโมเดล ของ Gemini 3.8 Audio โมเดลเหล่านี้อิงจาก Gemini 3 Pro และรูปแบบ TTS ยอมรับข้อความเข้าได้สูงสุด 8K โทเค็นและส่งออกเสียงได้สูงสุด 64K โทเค็น.
การออกแบบเสียงและการทำสำเนาเสียง
Google ระบุว่า Gemini 3.8 Flash TTS สามารถสร้างเสียงที่กำหนดเองตั้งแต่ต้นได้ผ่านการสั่งงานด้วยภาษาธรรมชาติ โดยปรับบทบาท, สำเนียง, และลักษณะเสียงในภาษามากกว่า 100 ภาษาและสำเนียง บริษัทกล่าวว่าการเปิดตัวนี้ขยายชุดเสียงเดิมจำนวน 30 เสียงเป็นห้องสมุดที่มีเสียงพร้อมผลิตมากกว่า 2,000 เสียงพร้อมการครอบคลุมภาษาที่กว้างขวาง รวมถึงรูปแบบภูมิภาคเช่น สเปนเม็กซิกัน, ฝรั่งเศสแคว้นควิเบก, และอังกฤษสก็อต ผู้ใช้สามารถบันทึกและจัดการเสียงที่กำหนดเองเพื่อรักษาประสิทธิภาพให้สม่ำเสมอตลอดโครงการที่ดำเนินอยู่ และฟีเจอร์การผสมเสียงที่ปรับเทิมเบอร์, ความสูงของเสียง, ความเร็ว, และสำเนียงของเสียงในห้องสมุดกำลังจะเปิดให้ใช้ในเร็ว ๆ นี้
การทำสำเนาเสียงจะสร้างโปรไฟล์เสียงที่สอดคล้องจากตัวอย่างเสียงของผู้ใช้ที่มีความยาว 30 วินาทีหรือจากเสียงที่ผู้ใช้มีสิทธิ์ใช้ Google ระบุว่าฟีเจอร์นี้มาพร้อมกับการตรวจสอบการยินยอมในตัว, การฝังลายน้ำ SynthID, และข้อมูลประจำตัว C2PA
การกำกับการแสดงและผลการทดสอบมาตรฐาน
ทั้งสองโมเดลอนุญาตให้กำกับการแสดงแต่ละบรรทัดได้: ผู้ใช้สามารถเขียนคำสั่งการแสดงของตนเองหรือให้ Gemini ควบคุมการส่งเสียงจากสคริปต์ธรรมชาติ Google ระบุว่าการสร้างเนื้อหาระยะยาวยังคงรักษาคุณภาพเสียง, ความเร็ว, และโทนสีของตัวละครได้อย่างคงที่ตลอดหลายชั่วโมงของเสียงต่อเนื่องโดยมีการเบี่ยงเบนของผู้พูดน้อยที่สุด ซึ่งเหมาะกับพอดคาสท์และหนังสือเสียง ฉากสองผู้พูดแบบเนทีฟกำหนดการสนทนาหลายรอบจากสคริปต์เดียวโดยคงเสียงสองเสียงแยกจากกันด้วยการสลับบทอย่างเป็นธรรมชาติ การระเบิดเสียงตามสคริปต์และการตอบสนองแบบ backchannel เพิ่มสัญญาณที่ไม่ใช่คำพูดเช่น <laughs>, <sigh>, และ <gasp>, พร้อมกับการแทรกเช่น “mhm” และ “yeah”
ในการประเมินผล Google รายงานว่า Gemini 3.8 Flash TTS ได้รับอันดับสูงสุดโดยรวมใน Voice Design Benchmark ของ Hume AI ด้วยคะแนน 71.4 และยังเป็นผู้นำด้านการจำลองสำเนียงด้วยคะแนน 60.8 โมเดล Flash TTS และ Flash‑Lite TTS ครองตำแหน่งแรกและสองใน Overall Quality Index ของ Hume AI และโมเดลใหม่แสดงการปรับปรุงอย่างมีนัยสำคัญเหนือ Gemini 3.1 Flash TTS ในกรณีการใช้งานต่าง ๆ รวมถึงเนื้อหาระยะยาวและการควบคุมบทภาพยนตร์สองผู้พูด ในการประเมินความชอบของมนุษย์แบบตาบอดบน Voice Arena Google กล่าวว่าโมเดลทั้งสองได้ตำแหน่งสูงสุดเหนือคู่แข่งในหลายภาษา ได้แก่ ญี่ปุ่น, โปรตุเกสบราซิล, เวียดนาม, ภาษาอาหรับมาตรฐานสมัยใหม่, สเปนเม็กซิกัน, และฮินดี
ความปลอดภัย, ข้อจำกัด, และการพร้อมใช้งาน
ภายใต้ระบบการตรวจสอบการยินยอม ผู้ใช้ต้องให้บันทึกการยินยอมด้วยเสียงจากเจ้าของเสียงที่ตรงกับผู้พูดอ้างอิงก่อนที่จะสร้างเสียงสำเนาได้ ทุกคลิปเสียงที่โมเดล Gemini Audio สร้างขึ้นจะมีลายน้ำ SynthID ซึ่ง Google อธิบายว่าเป็นลายน้ำที่มองไม่เห็นและฝังโดยตรงในผลลัพธ์เสียงเพื่อให้การพูดที่สร้างโดย AI ยังสามารถตรวจจับได้
บัตรข้อมูลโมเดลระบุข้อจำกัดที่ทราบรวมถึงการหลงผิดและปัญหาความล่าช้าหรือการหมดเวลาเป็นครั้งคราว และให้ข้อมูลการตัดความรู้ที่สิ้นสุดในเดือนมกราคม 2025 สำหรับความปลอดภัยระดับแนวหน้า Google DeepMind ระบุว่าการประเมินของพวกเขาไม่พบความสามารถใหม่ที่มีนัยสำคัญหรือการเพิ่มประสิทธิภาพที่สำคัญในโมเดล Gemini 3.8 Audio เมื่อเทียบกับ Gemini 3.7 Flash ซึ่งการประเมินของพวกเขาพบว่าไม่ได้ถึงระดับความสามารถที่ติดตามหรือระดับความสำคัญใด ๆ ภายใต้กรอบความปลอดภัยแนวหน้า ดังนั้นจึงกล่าวว่าโมเดล Gemini 3.8 Audio มีแนวโน้มที่จะไม่ถึงระดับเหล่านั้น
Gemini 3.8 Flash TTS ยังพร้อมใช้งานใน Gemini Notebook และ Flash‑Lite TTS ใน Google Vids โดยการเข้าถึงระดับองค์กรผ่าน API ใน Gemini Enterprise ระบุว่าจะเปิดให้ใช้ในเร็ว ๆ นี้ Google AI Studio เพิ่มสนามทดลองเสียงที่สร้างคล้ายกับพื้นที่ทำงานการออกแบบเสียง ซึ่งนักพัฒนาสามารถสั่งให้สร้างอัตลักษณ์เสียงใหม่ตั้งแต่ต้นหรือทำสำเนาเสียงแล้วกำกับการส่งเสียงบรรทัดต่อบรรทัดในตัวแก้ไขสคริปต์สองผู้พูด หมายเหตุในประกาศระบุว่าการทำสำเนาเสียงผ่าน AI Studio ไม่พร้อมใช้งานในรัฐอิลลินอยส์, เท็กซัส, เขตเศรษฐกิจยุโรป, สหราชอาณาจักร, สวิตเซอร์แลนด์, และอินเดีย แพลตฟอร์มนักพัฒนา Agora, LiveKit, Pipecat, และ Vercel รองรับโมเดลผ่าน Gemini API และ Google ได้ระบุว่า Figma, HeyGen, Linguana, Wondercraft, 99.co, และ Ollang เป็นพันธมิตรที่ผสานรวมโมเดล TTS ใหม่สำหรับการพากย์เสียงระดับโลก, การแปลสื่อ, และเอเจนต์เสียงสนทนา












