Mô hình và nền tảng AI
Google giới thiệu Avatar Trực tiếp với Hiện diện Hình ảnh cho Gemini 3.8 Live

Google vào ngày 24 tháng 9 năm 2026 đã giới thiệu Gemini 3.8 Live với Live Avatar, một tính năng bổ sung video được tạo gần như thời gian thực vào giọng nói của các mô hình đối thoại trực tiếp gốc, và đã đưa nó vào khả dụng chung trong Gemini Enterprise với các điểm cuối ở Hoa Kỳ và Liên minh Châu Âu.
Thông báo, do nhà khoa học nghiên cứu Shuo-yiin Chang và kỹ sư phần mềm CJ Zheng viết thay mặt đội Gemini Audio, giới thiệu tính năng này như một lớp hiện diện hình ảnh cho AI hội thoại của Gemini. Google cho biết khả năng đồng bộ môi nhĩ chính xác, biểu cảm tự nhiên và luân chuyển lượt nói mượt mà cho phép doanh nghiệp mở rộng các dịch vụ ảo như hỗ trợ khách hàng và hướng dẫn tương tác.
Bản phát hành này theo sau ra mắt ngày 15 tháng 9 năm 2026 của Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking của Google, các mô hình đối thoại trực tiếp mà Google định vị cho các cuộc trò chuyện có khả năng mở rộng, chi phí hiệu quả và cho các nhiệm vụ suy luận phức tạp cao, lần lượt, và đã bắt đầu được triển khai qua Gemini API, Google AI Studio, ứng dụng Gemini, Google Workspace và Search Live.
Khả dụng Chung trong Gemini Enterprise
Gemini 3.8 Live với Live Avatar đã có sẵn trong Gemini Enterprise kể từ ngày 24 tháng 9 năm 2026, và Google Cloud cho biết công nghệ này lần đầu được xem trước tại Google Cloud Next 2026. Bản phát hành được cung cấp qua các điểm cuối ở Hoa Kỳ và EU và bao gồm băng thông được cấp phát, tuân thủ doanh nghiệp và quản trị dữ liệu nghiêm ngặt, theo bài đăng của Google Cloud do Fabien Blanc-paques, quản lý sản phẩm nhóm cho Gemini Live, viết. Gemini 3.8 Live Extended Thinking vẫn đang ở giai đoạn xem trước riêng tư.
Khách hàng doanh nghiệp có thể thử mô hình trong bảng điều khiển Gemini Enterprise, tích hợp nó thông qua tài liệu Gemini Live API, và xem xét giá trên trang giá của Google Cloud. Google Cloud khuyên khách hàng làm việc với đại diện bán hàng của mình để được cấp băng thông, kiến trúc triển khai tùy chỉnh và danh sách cho phép avatar tùy chỉnh.
Cách Hoạt Động của Live Avatar
Live Avatar xử lý đồng thời các đầu vào hình ảnh và âm thanh và trả lời bằng âm thanh và video biểu cảm gần như thời gian thực, theo Google. Tính năng này cũng hỗ trợ gọi công cụ không đồng bộ, cho phép khởi động các lời gọi công cụ và truy xuất dữ liệu trong nền mà không làm dừng cuộc trò chuyện. Một buổi trình diễn của Google cho thấy avatar kiểm tra tình trạng của một khách sạn trong khi đối thoại tiếp tục mà không bị gián đoạn.
Google cho biết avatar điều chỉnh đồng bộ môi nhĩ và biểu cảm khi các cuộc trò chuyện chuyển qua 97 ngôn ngữ, duy trì độ trung thực video và tránh hiện tượng trôi hình ảnh. Bài đăng của Google Cloud bổ sung khả năng hiểu hình ảnh trực tiếp từ luồng camera và chia sẻ màn hình cùng với âm thanh, khả năng khôi phục gián đoạn giữ nguyên ngữ cảnh cuộc trò chuyện và các giao dịch phía sau, tự động phát hiện ngôn ngữ và chuyển đổi mà không cần bật tắt thủ công, và triển khai trên web, di động và các kiosk tương tác. Một buổi trình diễn riêng của Google Cloud cho thấy một nhân viên tiếp nhận yêu cầu bồi thường bảo hiểm điền sổ ghi chú khi khách hàng hiển thị thiệt hại qua camera, trong khi đội ngũ đại lý được xây dựng bằng Agent Development Kit của Google xác minh chính sách, áp dụng các quy tắc tiếp nhận và tổng hợp gói điều chỉnh trong nền.
Avatar, Đánh Dấu Nước, và Giới Hạn Thẻ Mô Hình
Các tổ chức có thể triển khai từ thư viện avatar có sẵn hoặc tạo avatar tùy chỉnh từ hình ảnh tham chiếu chất lượng cao, và Google cho biết kết quả giữ nguyên hình ảnh, phong cách thương hiệu hoặc nhân dạng nhân vật của tham chiếu. Truy cập vào việc tạo avatar tùy chỉnh yêu cầu danh sách cho phép doanh nghiệp; Google Cloud mô tả quy trình danh sách cho phép và xác minh như một biện pháp bảo vệ danh tính và ngăn ngừa lạm dụng. Mỗi luồng âm thanh và video được tạo ra đều được nhúng một dấu nước SynthID không thể nhận thấy, giúp nội dung do AI tạo ra có thể được phát hiện.
Theo thẻ mô hình Gemini 3.8 Audio, các mô hình dựa trên Gemini 3 Pro. Gemini 3.8 Live chấp nhận âm thanh, hình ảnh, video và văn bản với cửa sổ ngữ cảnh lên tới 128K token, và với Live Avatar nó xuất ra âm thanh, video và văn bản với giới hạn đầu ra 24K token. Thẻ mô hình cho biết các biến thể Live Avatar tạo ra video biểu cảm với chuyển động đầu tự nhiên đồng bộ với lời nói, được điều khiển bởi hình ảnh và đầu vào âm thanh đã cấu hình, và chúng duy trì một vài phút tương tác liên tục thay vì hàng giờ dài.
Thẻ mô hình liệt kê các hạn chế đã biết bao gồm khả năng ảo giác và đôi khi chậm hoặc thời gian chờ, và đặt giới hạn kiến thức vào tháng 1 năm 2025. Đánh giá an toàn biên giới của nó không phát hiện khả năng mới có ý nghĩa hoặc cải tiến hiệu suất đáng kể so với Gemini 3.7 Flash, và dựa trên đó Google cho rằng các mô hình Gemini 3.8 Audio không có khả năng đạt bất kỳ Mức Khả năng Được Theo Dõi hoặc Quan Trọng nào trong Khung An toàn Biên giới của mình.
Triển Khai của Khách Hàng
Google Cloud nêu tên một số doanh nghiệp đang xây dựng với tính năng này. Cox Automotive đã tạo một trợ lý mua sắm dựa trên AI cho Autotrader, sử dụng việc tô sáng màn hình trực tiếp và gọi công cụ để hướng dẫn người mua xe qua việc tìm kiếm, so sánh và tài trợ xe trong thời gian thực.
“Người mua ngày càng mong muốn mô tả nhu cầu của họ bằng lời nói của mình thay vì phải lọc và duyệt qua các menu. Avatar AI hội thoại mới của Autotrader mang trải nghiệm này đến việc khám phá xe bằng cách ghép nối cuộc trò chuyện tự nhiên với danh mục xe phù hợp,” Marianne Johnson, phó chủ tịch điều hành và giám đốc sản phẩm của Cox Automotive, nói trong thông báo của Google Cloud.
Giám đốc điều hành của Equal AI, Akhilesh Damaraju, cho biết AI cá nhân của công ty xử lý hơn một triệu cuộc gọi trực tiếp mỗi ngày bằng chín ngôn ngữ Ấn Độ, và cho biết Gemini 3.8 Live đã cải thiện khả năng xử lý gián đoạn, các cuộc hội thoại đa ngôn ngữ và độ tin cậy khi gọi công cụ. Bob Van Osten, phó chủ tịch sản phẩm của Salesforce cho Agentforce, cho biết Agentforce và Gemini 3.8 Live đang hợp tác trong một dự án chung giữa Salesforce AI Research và Google, kết hợp khả năng đa phương tiện thời gian thực với AI có tính năng đại lý. Eric Walsh, kỹ sư phần mềm tại Specs, cho biết các cập nhật về Phát hiện Hoạt động Giọng nói và cải thiện độ trễ của mô hình là những bước tiến cho trợ lý AI trên nền tảng SPECS.












