โมเดลและแพลตฟอร์ม AI
Google เปิดตัวโมเดลเสียง Gemini 3.8 Live และ Extended Thinking

Google ประกาศ Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking เมื่อวันที่ 15 กันยายน 2026, เป็นโมเดลการสนทนาสดคู่ที่กำลังเปิดให้ใช้ผ่าน Gemini API, Google AI Studio, Gemini Enterprise, Search Live, Gemini Live, และ Google Workspace.
โมเดลเหล่านี้ถูกแนะนำโดย Tom Ouyang วิศวกรระดับหลัก และ Malini Jaganathan สมาชิกทีมเทคนิค โดยเขียนในนามทีม Gemini Audio Google อธิบายว่าคู่โมเดลนี้เป็นโมเดลการสนทนาสดที่ก้าวหน้าที่สุดของบริษัท จัดทำเพื่อการสนทนาธรรมชาติ และระบุว่าการเพิ่มขึ้นของความฉลาดและการให้เหตุผลแบบขนานทำให้การทำงานร่วมกันบนงานที่ซับซ้อนโดยเสียงเป็นไปอย่างเป็นธรรมชาติ บริษัทวางตำแหน่ง Gemini 3.8 Live เพื่อรองรับการขยายขนาดและประหยัดต้นทุน โดยผสานความฉลาดในการสนทนากับการสนทนาที่ลื่นไหลและการเชื่อมโยงภาพ ในขณะที่ Gemini 3.8 Live Extended Thinking ถูกออกแบบมาสำหรับงานที่ซับซ้อนสูงที่ต้องการความฉลาดเพิ่มขึ้นและการให้เหตุผลหลายขั้นตอน ตามข้อมูลของ Google โมเดลเหล่านี้มอบบล็อกการสร้างให้กับนักพัฒนาและองค์กรเพื่อสร้างเอเย่นต์เสียงที่เชื่อถือได้และพร้อมใช้งานในการผลิต พร้อมทำให้การสนทนากับ Gemini ผ่านแอป Gemini, Workspace, และ Search มีความราบรื่นยิ่งขึ้น
ผลการทดสอบเบนช์มาร์กที่รายงาน
Google รายงานว่า Gemini 3.8 Live Extended Thinking ครองตำแหน่งสูงสุดโดยรวมใน Artificial Analysis’ Speech to Speech Quality Index ด้วยคะแนน 82.6 และเป็นผู้นำด้านการทำงานของเอเจนต์ด้วยอัตราการสำเร็จงาน 68.6% บน τ-Voice และ 35.1% บนเกณฑ์ τ-Voice-banking ของ Sierra บริษัทยังรายงานคะแนน 97.7% ใน Big Bench Audio และระบุว่า Extended Thinking มีระดับราคาที่แข่งขันได้อย่างสูงเมื่อเทียบกับโมเดลแนวหน้าอื่น ๆ Google กล่าวว่า Gemini 3.8 Live ได้อันดับสองใน Artificial Analysis’ Speech Agent Arena โดยอ้างถึงความนิยมสูงในหมู่ผู้ใช้ และอธิบายว่าเป็นโมเดลที่คุ้มค่าต่อค่าใช้จ่ายและออกแบบเพื่อการขยายขนาด ใน EVA-Bench ของ ServiceNow ซึ่งเป็นเบนช์มาร์กสำหรับประเมินเอเจนต์เสียง Google กล่าวว่าโมเดลของบริษัทผลักดัน Pareto Frontier สำหรับกระบวนการทำงานที่ซับซ้อนโดยสมดุลระหว่างความแม่นยำและคุณภาพการสนทนา; โพสต์ระบุว่าการประเมินนี้ดำเนินการบน Live API บน Gemini Enterprise Agent Platform
ความสามารถในการสนทนาระยะเวลาจริง
ตามข้อมูลของ Google Gemini 3.8 Live ประมวลผลข้อมูลภาพในเวลาใกล้เคียงจริง เพิ่มบริบทที่บริษัทกล่าวว่าจะทำให้การตอบกลับมีประโยชน์มากขึ้น โมเดลตรวจจับและสลับภาษาที่รองรับ 97 ภาษาโดยอัตโนมัติระหว่างการสนทนา และดำเนินการเครื่องมือและการเรียก API ในพื้นหลังขณะการสนทนายังคงดำเนินต่อไป โดยรับรู้คำขอและรักษาการสนทนาไว้ขณะงานเสร็จสมบูรณ์ สำหรับงานที่ต้องการการให้เหตุผลเชิงลึก Google ระบุว่า Extended Thinking ให้เหตุผลและพูดพร้อมกัน ใช้สัญญาณเสียงต้นเพื่อรับรู้คำสั่งอย่างเป็นธรรมชาติและบรรยายความคืบหน้าแบบสดเพื่อแนะนำผู้ใช้ผ่านงานพื้นหลังหลายขั้นตอนขณะที่ดำเนินการโดยไม่ทำให้การสนทนาถูกขัดจังหวะ
วิดีโอสาธิตที่เผยแพร่พร้อมกับการประกาศแสดงให้เห็นว่า Gemini 3.8 Live ช่วยนำการฝึกอบรมพนักงานแบบเรียลไทม์โดยใช้บริบทภาพเพื่อตอบคำถามสด เล่นหมากรุกในเวลาใกล้เคียงจริง สร้างแผนธุรกิจครบถ้วนและชุดเครื่องมือการตลาดแบบกำหนดเองผ่านการพูดธรรมชาติ และให้การช่วยเหลือการแก้ปัญหาแบบขั้นตอนต่อขั้นตอนภายใน Search Live การสาธิตของ Extended Thinking แสดงให้เห็นว่าโมเดลแปลงภาพร่างดิบและข้อเสนอแนะเสียงใกล้เคียงจริงเป็นคอมโพเนนท์ React ที่ใช้งานได้ ประสานการจองร้านอาหารหลายขั้นตอนผ่านการเรียกฟังก์ชันแบบอะซิงโครนัสโดยไม่ขัดจังหวะการสนทนา และทำงานข้าม Docs Live, Gmail Live, และ Keep Live ใน Google Workspace
Live API และระบบนิเวศนักพัฒนา
Google ระบุว่า Agora, Fishjam, LiveKit, Pipecat, Vercel, และ Vision Agents เป็นแพลตฟอร์มนักพัฒนาที่ใช้ Gemini Live API เพื่อให้ผู้พัฒนาสร้างและปรับใช้อินเทอร์เฟซที่ขับเคลื่อนด้วยเสียงในขณะที่แพลตฟอร์มเหล่านั้นจัดการโครงสร้างพื้นฐานการสตรีมสื่อแบบเรียลไทม์ บริษัทกล่าวว่ามีการร่วมมือกับ Salesforce, Genspark, และ Lumeris ในโมเดลใหม่ ๆ โดยชี้ให้เห็นความสนใจของพวกเขาต่อความหน่วงเวลา ความลื่นไหล และความสามารถในการเรียกเครื่องมือของโมเดล
เอกสาร Live API อย่างเป็นทางการอธิบายว่าอินเทอร์เฟซนี้เปิดให้มีการโต้ตอบด้วยเสียงและภาพแบบเรียลไทม์ที่มีความหน่วงต่ำกับ Gemini โดยประมวลผลสตรีมต่อเนื่องของเสียง รูปภาพ และข้อความเพื่อให้การตอบสนองเป็นคำพูดทันทีผ่านการเชื่อมต่อ WebSocket แบบ stateful อินพุตที่ระบุคือเสียง PCM 16‑bit ดิบที่ 16kHz, รูปภาพ JPEG สูงสุดหนึ่งเฟรมต่อวินาที, และข้อความ โดยเอาต์พุตเสียงเป็น PCM 16‑bit ดิบที่ 24kHz นักพัฒนาสามารถเลือกการใช้งานแบบ server‑to‑server ซึ่งแบ็กเอนด์ส่งต่อข้อมูลสตรีมของคลไคลเอนต์ไปยัง Live API, หรือแบบ client‑to‑server ซึ่งโค้ดส่วนหน้าเชื่อมต่อโดยตรงผ่าน WebSocket เอกสารระบุกรณีการใช้งานตั้งแต่ผู้ช่วยช้อปปิ้งในค้าปลีกและเอเจนต์สนับสนุน, ตัวละครเกมแบบโต้ตอบ, ประสบการณ์ที่เปิดใช้งานเสียงและวิดีโอในหุ่นยนต์, แว่นตาอัจฉริยะ, และยานพาหนะ, ผู้ช่วยสุขภาพ, เครื่องมือให้คำปรึกษาทางการเงิน, ผู้ให้คำแนะนำด้านการศึกษา, การแปลแบบเรียลไทม์, และการถอดเสียงและใส่คำบรรยายแบบสด
Google ระบุว่าเสียงทั้งหมดที่สร้างโดยผลิตภัณฑ์ AI ของบริษัทจะมีลายน้ำ SynthID ซึ่งเป็นลายน้ำที่มองไม่เห็นฝังโดยตรงในเอาต์พุตเสียง เพื่อให้เนื้อหาที่สร้างโดย AI สามารถตรวจจับได้และช่วยป้องกันข้อมูลเท็จ โพสต์นี้ชี้ให้ผู้อ่านไปยังการ์ดโมเดลเพื่อดูรายละเอียดเกี่ยวกับแนวทางความปลอดภัยและความรับผิดชอบของบริษัท
การพร้อมใช้งานและการเปิดตัว
โมเดลทั้งสองเริ่มเปิดตัวในวันที่ 15 กันยายน สำหรับนักพัฒนา โมเดลเหล่านี้พร้อมใช้งานใน Gemini API และ Google AI Studio และสำหรับองค์กรอยู่ในช่วงพรีวิวส่วนตัวใน Gemini Enterprise. Gemini 3.8 Live พร้อมให้ทุกคนใช้ใน Search Live ในขณะที่ Extended Thinking พร้อมใช้งานใน Gemini Live, ใน Docs สำหรับผู้สมัครสมาชิก Google AI Pro และ Ultra ผ่าน Workspace, และใน Gmail และ Keep สำหรับผู้สมัครสมาชิก Google AI ทั้งหมด. Google ระบุว่า Gemini Enterprise สำหรับการสนับสนุน Customer Experience ของโมเดลทั้งสองจะเปิดให้บริการเร็ว ๆ นี้ และว่า Extended Thinking จะเปิดให้บริการเร็ว ๆ นี้แก่ลูกค้าองค์กรของ Google Workspace.












