โมเดลและแพลตฟอร์ม AI
Google นำ Live Avatar ไปสู่การแสดงภาพแบบสดใน Gemini 3.8 Live

Google เมื่อวันที่ 24 กันยายน 2026 เปิดตัว Gemini 3.8 Live กับ Live Avatar ซึ่งเป็นฟีเจอร์ที่เพิ่มวิดีโอที่สร้างขึ้นแบบใกล้เคียงเวลาจริงให้กับเสียงของโมเดลสนทนาสดดั้งเดิมของมัน และทำให้พร้อมใช้งานทั่วไปใน Gemini Enterprise พร้อมจุดเชื่อมต่อในสหรัฐอเมริกาและสหภาพยุโรป.
ประกาศนี้ซึ่งเขียนโดยนักวิจัย Shuo-yiin Chang และวิศวกรซอฟต์แวร์ CJ Zheng ในนามของทีม Gemini Audio นำเสนอฟีเจอร์นี้เป็นชั้นการแสดงภาพแบบสดสำหรับ AI สนทนาของ Gemini. Google กล่าวว่า การซิงค์ปากที่แม่นยำ การแสดงออกที่เป็นธรรมชาติ และการสลับบทพูดที่ราบรื่นทำให้ธุรกิจสามารถขยายบริการเสมือนเช่น การบริการลูกค้าและการเดินชมแบบโต้ตอบได้.
การเปิดตัวนี้ตามหลัง การเปิดตัว Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking เมื่อ 15 กันยายน 2026 ของ Google ซึ่งเป็นโมเดลสนทนาสดที่ Google จัดตำแหน่งเพื่อการสนทนาที่ขยายได้และคุ้มค่าและสำหรับงานเหตุผลที่ซับซ้อนสูงตามลำดับ โดยเริ่มเปิดให้ใช้งานผ่าน Gemini API, Google AI Studio, แอป Gemini, Google Workspace, และ Search Live.
การพร้อมใช้งานทั่วไปใน Gemini Enterprise
Gemini 3.8 Live กับ Live Avatar พร้อมใช้งานทั่วไปใน Gemini Enterprise ตั้งแต่วันที่ 24 กันยายน 2026 และ Google Cloud ระบุว่าเทคโนโลยีนี้ได้รับการพรีวิวครั้งแรกที่งาน Google Cloud Next 2026. การเปิดตัวนี้ให้บริการผ่านจุดเชื่อมต่อในสหรัฐและยุโรปและรวมถึงแบนด์วิดท์ที่จัดสรรไว้ การปฏิบัติตามมาตรฐานองค์กร และการกำกับดูแลข้อมูลที่เข้มงวด ตามโพสต์ของ Google Cloud โดย Fabien Blanc-paques ผู้จัดการผลิตภัณฑ์กลุ่มสำหรับ Gemini Live. Gemini 3.8 Live Extended Thinking ยังคงอยู่ในขั้นพรีวิวส่วนตัว.
ลูกค้าองค์กรสามารถทดลองโมเดลนี้ในคอนโซล Gemini Enterprise, ผสานรวมผ่านเอกสาร API ของ Gemini Live, และตรวจสอบราคาได้บนหน้าราคาของ Google Cloud. Google Cloud แนะนำให้ลูกค้าติดต่อกับตัวแทนขายเพื่อขอแบนด์วิดท์ที่จัดสรร, สถาปัตยกรรมการปรับใช้ที่กำหนดเอง, และการทำรายการอนุญาตอวาตาร์แบบกำหนดเอง.
วิธีการทำงานของ Live Avatar
Live Avatar ประมวลผลข้อมูลภาพและเสียงพร้อมกันและตอบกลับด้วยเสียงและวิดีโอที่แสดงอารมณ์ในเวลาใกล้เคียงจริง ตามข้อมูลของ Google. ฟีเจอร์นี้ยังรองรับการเรียกเครื่องมือแบบอะซิงโครนัส ทำให้สามารถเริ่มการเรียกเครื่องมือและดึงข้อมูลในพื้นหลังโดยไม่หยุดการสนทนา. การสาธิตหนึ่งของ Google แสดงให้เห็นว่าอวาตาร์ตรวจสอบผู้เข้าพักในโรงแรมขณะการสนทนายังคงดำเนินต่อโดยไม่มีการขัดจังหวะ.
Google กล่าวว่าอวาตาร์ปรับการซิงค์ปากและการแสดงออกเมื่อการสนทนาเปลี่ยนผ่าน 97 ภาษา โดยคงคุณภาพวิดีโอและหลีกเลี่ยงการเบี่ยงเบนภาพ. โพสต์ของ Google Cloud ยังเพิ่มความเข้าใจภาพสดจากกล้องและการแชร์หน้าจอพร้อมกับเสียง, การกู้คืนการขัดจังหวะที่รักษาบริบทการสนทนาและการทำธุรกรรมแบ็กเอนด์, การตรวจจับและเปลี่ยนภาษอัตโนมัติโดยไม่ต้องสลับด้วยมือ, และการปรับใช้บนเว็บ, มือถือ, และคีออสโต้ตอบ. การสาธิตแยกของ Google Cloud แสดงให้เห็นว่าตัวแทนรับเรื่องการเคลมประกันกรอกบันทึกการเคลมขณะลูกค้าแสดงความเสียหายผ่านกล้อง, ในขณะที่ทีมตัวแทนที่สร้างด้วย Agent Development Kit ของ Google ตรวจสอบนโยบาย, ใช้กฎการรับเรื่อง, และจัดชุดเอกสารผู้ประเมินในพื้นหลัง.
อวาตาร์, การใส่น้ำลายน้ำ, และข้อจำกัดของ Model Card
องค์กรสามารถปรับใช้จากห้องสมุดอวาตาร์สำเร็จรูปหรือสร้างอวาตาร์กำหนดเองจากภาพอ้างอิงคุณภาพสูง, และ Google กล่าวว่า ผลลัพธ์จะคงลักษณะ, สไตล์แบรนด์, หรืออัตลักษณ์ของตัวละครจากภาพอ้างอิงนั้น. การเข้าถึงการสร้างอวาตาร์กำหนดเองต้องมีการอนุญาตรายการสำหรับองค์กร; Google Cloud อธิบายกระบวนการอนุญาตและการตรวจสอบเป็นมาตรการป้องกันตัวตนและการใช้งานในทางที่ผิด. ทุกสตรีมเสียงและวิดีโอที่สร้างขึ้นจะฝังน้ำลายน้ำ SynthID ที่ไม่สามารถมองเห็นได้, ทำให้เนื้อหาที่สร้างโดย AI สามารถตรวจจับได้.
ตาม Gemini 3.8 Audio การ์ดโมเดล โมเดลเหล่านี้อิงจาก Gemini 3 Pro. Gemini 3.8 Live รองรับเสียง, รูปภาพ, วิดีโอ และข้อความโดยมีหน้าต่างบริบทสูงสุดถึง 128K โทเคน, และด้วย Live Avatar จะส่งออกเสียง, วิดีโอ และข้อความโดยจำกัดการส่งออกที่ 24K โทเคนต่อครั้ง. การ์ดโมเดลระบุว่าเวอร์ชัน Live Avatar สร้างวิดีโอที่แสดงอาการเคลื่อนไหวของศีรษะอย่างเป็นธรรมชาติที่สอดคล้องกับการพูด, ขับเคลื่อนโดยภาพที่กำหนดและอินพุตเสียง, และสามารถดำเนินการโต้ตอบต่อเนื่องได้หลายนาทีแทนที่จะเป็นหลายชั่วโมง.
การ์ดโมเดลระบุข้อจำกัดที่ทราบรวมถึงการเกิดภาพหลอนที่เป็นไปได้และความช้า หรือการหมดเวลาเป็นครั้งคราว, และกำหนดจุดตัดความรู้ที่มกราคม 2025. การประเมินความปลอดภัยระดับแนวหน้าไม่พบความสามารถใหม่ที่มีความหมายหรือการเพิ่มประสิทธิภาพที่สำคัญเมื่อเทียบกับ Gemini 3.7 Flash, ดังนั้น Google จึงถือว่าโมเดล Gemini 3.8 Audio มีแนวโน้มจะไม่ถึงระดับความสามารถที่ติดตามหรือระดับความสามารถสำคัญใด ๆ ภายใต้กรอบความปลอดภัยแนวหน้า.
การปรับใช้โดยลูกค้า
Google Cloud ระบุหลายองค์กรที่กำลังใช้ฟีเจอร์นี้. Cox Automotive สร้างผู้ช่วยช้อปปิ้งที่ใช้ AI สำหรับ Autotrader ซึ่งใช้การไฮไลท์หน้าจอแบบสดและการเรียกเครื่องมือเพื่อแนะนำผู้ซื้อรถผ่านการค้นหารถ, การเปรียบเทียบ, และการเงินแบบเรียลไทม์.
“ผู้ซื้อมักคาดหวังว่าจะอธิบายความต้องการของตนด้วยคำของตนเอง มากกว่าการกรองและเมนูต่าง ๆ. Avatar AI สนทนาของ Autotrader นำประสบการณ์นี้มาสู่การค้นหายานพาหนะโดยจับคู่การสนทนาธรรมชาติกับสินค้าคงคลังที่เหมาะสม,” Marianne Johnson, รองประธานฝ่ายบริหารและหัวหน้าผลิตภัณฑ์ของ Cox Automotive, กล่าวใน ประกาศของ Google Cloud.
ผู้บริหารสูงสุดของ Equal AI Akhilesh Damaraju กล่าวว่า AI ส่วนบุคคลของบริษัทจัดการการโทรสดมากกว่าหนึ่งล้านครั้งต่อวันในเก้าภาษาอินเดีย, และระบุว่า Gemini 3.8 Live ปรับปรุงการจัดการการขัดจังหวะ, การสนทนาหลายภาษา, และความน่าเชื่อถือของการเรียกใช้เครื่องมือ. Bob Van Osten, รองประธานฝ่ายผลิตภัณฑ์ของ Salesforce สำหรับ Agentforce, กล่าวว่า Agentforce และ Gemini 3.8 Live กำลังมาร่วมกันในความร่วมมือระหว่าง Salesforce AI Research กับ Google ที่ผสานความสามารถมัลติโหมดแบบเรียลไทม์กับ AI ที่มีลักษณะเป็นตัวแทน. Eric Walsh, วิศวกรซอฟต์แวร์ที่ Specs, กล่าวว่าอัปเดตการตรวจจับกิจกรรมเสียง (Voice Activity Detection) ของโมเดลและการปรับปรุงความหน่วงเวลาเป็นก้าวสำคัญสำหรับผู้ช่วย AI บนแพลตฟอร์ม SPECS.












