Mô hình và nền tảng AI
Google ra mắt các mô hình giọng nói Gemini 3.8 Live và Extended Thinking

Google đã công bố Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking vào ngày 15 tháng 9 năm 2026, một cặp mô hình đối thoại trực tiếp được triển khai trên Gemini API, Google AI Studio, Gemini Enterprise, Search Live, Gemini Live và Google Workspace.
Các mô hình này được giới thiệu bởi Tom Ouyang, một kỹ sư chính, và Malini Jaganathan, một thành viên của đội ngũ kỹ thuật, thay mặt cho Nhóm Gemini Audio. Google mô tả cặp mô hình này là những mô hình đối thoại trực tiếp tiên tiến nhất của mình, được xây dựng cho cuộc trò chuyện tự nhiên, và cho rằng những cải tiến về trí tuệ và suy luận song song khiến chúng trở nên trực quan hơn khi cộng tác trong các nhiệm vụ phức tạp được thực hiện bằng giọng nói. Công ty định vị Gemini 3.8 Live cho quy mô và hiệu quả chi phí, kết hợp trí tuệ hội thoại với đối thoại mượt mà và định vị hình ảnh, trong khi Gemini 3.8 Live Extended Thinking được xây dựng cho các nhiệm vụ có độ phức tạp cao đòi hỏi trí tuệ tăng cường và suy luận đa bước. Theo Google, các mô hình này cung cấp cho các nhà phát triển và doanh nghiệp các khối xây dựng cho các tác nhân giọng nói đáng tin cậy, sẵn sàng sản xuất, đồng thời làm cho các cuộc trò chuyện với Gemini trên ứng dụng Gemini, Workspace và Search trở nên mượt mà hơn.
Kết quả Đánh giá Tiêu chuẩn Được Báo cáo
Google báo cáo rằng Gemini 3.8 Live Extended Thinking đạt vị trí tổng thể hàng đầu trên Chỉ số Chất lượng Giọng nói tới Giọng nói của Artificial Analysis với điểm số 82,6, và dẫn đầu trong việc hoàn thành nhiệm vụ đại lý với 68,6% trên τ-Voice và 35,1% trên tiêu chuẩn τ-Voice-banking của Sierra. Công ty cũng báo cáo điểm 97,7% trên Big Bench Audio và cho rằng Extended Thinking duy trì mức giá cạnh tranh cao so với các mô hình tiên tiến khác. Google cho biết Gemini 3.8 Live đứng thứ hai trong Speech Agent Arena của Artificial Analysis, nêu lên mức độ ưa thích cao của người dùng, và mô tả nó là rất hiệu quả về chi phí và được thiết kế cho quy mô. Trên EVA-Bench của ServiceNow, một tiêu chuẩn để đánh giá các tác nhân giọng nói, Google cho rằng các mô hình của mình đẩy ranh giới Pareto cho các quy trình công việc phức tạp bằng cách cân bằng thành công giữa độ chính xác và chất lượng hội thoại; bài viết lưu ý rằng đánh giá này được thực hiện trên Live API trên nền tảng Gemini Enterprise Agent Platform.
Khả năng Đối thoại thời gian thực
Theo Google, Gemini 3.8 Live xử lý đầu vào hình ảnh gần như thời gian thực, thêm ngữ cảnh mà công ty cho rằng tạo ra các phản hồi hữu ích hơn. Mô hình tự động phát hiện và chuyển đổi giữa 97 ngôn ngữ được hỗ trợ trong quá trình trò chuyện, và thực thi các công cụ và cuộc gọi API trong nền khi cuộc trò chuyện tiếp tục, xác nhận yêu cầu và duy trì đối thoại trong khi các nhiệm vụ hoàn thành. Đối với các nhiệm vụ đòi hỏi suy luận sâu hơn, Google cho biết Extended Thinking suy luận và nói đồng thời, sử dụng các dấu hiệu lời nói sớm để xác nhận các lời nhắc một cách tự nhiên và lời thuyết minh tiến trình trực tiếp để hướng dẫn người dùng qua các nhiệm vụ nền đa bước khi chúng tiến triển, mà không làm gián đoạn luồng hội thoại.
Video minh họa được công bố cùng thông báo cho thấy Gemini 3.8 Live hướng dẫn một buổi đào tạo nhân viên mới trong thời gian thực, sử dụng ngữ cảnh hình ảnh để trả lời các câu hỏi trực tiếp, chơi cờ trong gần thời gian thực, xây dựng các kế hoạch kinh doanh hoàn chỉnh và bộ công cụ tiếp thị tùy chỉnh thông qua giọng nói tự nhiên, và cung cấp trợ giúp khắc phục sự cố từng bước trong Search Live. Các bản trình diễn của Extended Thinking cho thấy mô hình biến các bản phác thảo thô và phản hồi giọng nói gần thời gian thực thành các thành phần React chức năng, phối hợp đặt chỗ nhà hàng đa bước qua các cuộc gọi hàm bất đồng bộ mà không làm gián đoạn cuộc trò chuyện, và hoạt động trên Docs Live, Gmail Live và Keep Live trong Google Workspace.
Live API và Hệ sinh thái Nhà phát triển
Google liệt kê Agora, Fishjam, LiveKit, Pipecat, Vercel và Vision Agents là các nền tảng dành cho nhà phát triển sử dụng Gemini Live API để cho phép các nhà phát triển xây dựng và triển khai giao diện điều khiển bằng giọng nói trong khi các nền tảng này quản lý cơ sở hạ tầng truyền phát phương tiện thời gian thực nền tảng. Công ty cho biết cũng đang hợp tác với Salesforce, Genspark và Lumeris trên các mô hình mới, nhấn mạnh sự quan tâm của họ đến độ trễ, tính linh hoạt và khả năng gọi công cụ của các mô hình.
Tài liệu chính thức của Live API mô tả giao diện cho phép tương tác giọng nói và hình ảnh thời gian thực, độ trễ thấp với Gemini, xử lý các luồng âm thanh, hình ảnh và văn bản liên tục để cung cấp phản hồi nói ngay lập tức qua kết nối WebSocket có trạng thái. Các đầu vào được ghi nhận là âm thanh PCM 16-bit thô ở 16kHz, hình ảnh JPEG lên tới một khung mỗi giây, và văn bản, với đầu ra âm thanh là PCM 16-bit thô ở 24kHz. Các nhà phát triển có thể chọn triển khai kiểu server-to-server, trong đó backend chuyển tiếp dữ liệu luồng của khách hàng tới Live API, hoặc triển khai kiểu client-to-server, trong đó mã phía giao diện kết nối trực tiếp qua WebSocket. Tài liệu liệt kê các trường hợp sử dụng bao gồm trợ lý mua sắm bán lẻ và các tác nhân hỗ trợ, nhân vật trò chơi tương tác, trải nghiệm hỗ trợ giọng nói và video trong robot, kính thông minh và phương tiện, người đồng hành sức khỏe, công cụ tư vấn tài chính, người hướng dẫn giáo dục, dịch thuật thời gian thực, và ghi âm, phụ đề trực tiếp.
Google khẳng định rằng tất cả âm thanh được tạo ra bởi các sản phẩm AI của mình đều được gắn dấu nước SynthID, một dấu nước không thể nhận biết được được khắc trực tiếp vào đầu ra âm thanh để nội dung do AI tạo ra vẫn có thể được phát hiện, nhằm giúp ngăn chặn thông tin sai lệch. Bài viết hướng độc giả tới thẻ mô hình để biết chi tiết về cách tiếp cận an toàn và trách nhiệm của công ty.
Khả dụng và Triển khai
Cả hai mô hình đã bắt đầu ra mắt vào ngày 15 tháng 9. Đối với các nhà phát triển, chúng có sẵn trong Gemini API và Google AI Studio, và đối với doanh nghiệp chúng đang ở giai đoạn preview riêng trong Gemini Enterprise. Gemini 3.8 Live có sẵn cho mọi người trong Search Live, trong khi Extended Thinking có sẵn trong Gemini Live, trong Docs cho người đăng ký Google AI Pro và Ultra thông qua Workspace, và trong Gmail và Keep cho tất cả người đăng ký Google AI. Google cho biết Gemini Enterprise hỗ trợ Customer Experience cho cả hai mô hình sẽ sớm ra mắt, và Extended Thinking cũng sẽ sớm có mặt cho khách hàng doanh nghiệp của Google Workspace.












