Mô hình và nền tảng AI

Google ra mắt các mô hình giọng nói Gemini 3.8 trong API và AI Studio

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Google vào ngày 23 tháng 9, 2026 đã giới thiệu Gemini 3.8 Flash TTS và Gemini 3.8 Flash-Lite TTS, hai mô hình chuyển văn bản thành giọng nói mà công ty mô tả là các mô hình tạo âm thanh biểu cảm nhất cho đến nay. Cả hai mô hình đều bắt đầu được triển khai cùng ngày trong Gemini API và Google AI Studio.

Thông báo, do Quản lý Sản phẩm Nhóm Leland Rechis và Giám đốc Nghiên cứu Khoa học Alan Cowen thay mặt đội Gemini Audio soạn thảo, đặt Gemini 3.8 Flash TTS vào vị trí hỗ trợ chỉ đạo sáng tạo sâu và thiết kế nhân vật trong lĩnh vực trò chơi, sách nói nhập vai, podcast và phương tiện tương tác. Gemini 3.8 Flash-Lite TTS được xây dựng cho việc sử dụng quy mô lớn, tiết kiệm chi phí, được tối ưu cho lồng tiếng, tạo nội dung âm thanh và các trợ lý giọng nói với khả năng kiểm soát chi tiết về tông, nhịp độ và sắc thái biểu cảm. Thông báo giới thiệu cặp mô hình này tiếp nối các bản phát hành Gemini Audio trước đây: 3.5 Live Translate, 3.5 Transcribe, và các mô hình Gemini 3.8 Live và 3.8 Live Extended Thinking. Theo thẻ mô hình Gemini 3.8 Audio, các mô hình dựa trên Gemini 3 Pro, và các biến thể TTS chấp nhận đầu vào văn bản lên tới 8K token và trả lại đầu ra âm thanh lên tới 64K token.

Thiết kế và sao chép giọng nói

Google cho biết Gemini 3.8 Flash TTS có thể tạo ra các giọng nói riêng biệt từ đầu thông qua việc gợi ý bằng ngôn ngữ tự nhiên, tùy chỉnh vai trò, giọng địa phương và các đặc điểm giọng nói trên hơn 100 ngôn ngữ và phương ngữ. Công ty cho biết bản phát hành này mở rộng bộ sưu tập 30 giọng nói ban đầu thành một thư viện hơn 2.000 giọng nói sẵn sàng sản xuất với phạm vi ngôn ngữ rộng, bao gồm các biến thể khu vực như tiếng Tây Ban Nha Mexico, tiếng Pháp Quebec và tiếng Anh Scotland. Người dùng có thể lưu và quản lý các giọng nói tùy chỉnh của mình để duy trì hiệu suất nhất quán trong các dự án đang diễn ra, và một tính năng trộn giọng nói điều chỉnh âm sắc, cao độ, tốc độ và giọng địa phương trên các giọng trong thư viện được liệt kê là sẽ sớm ra mắt.

Sao chép giọng nói tái tạo một hồ sơ giọng nói nhất quán từ mẫu âm thanh 30 giây của giọng nói của người dùng hoặc một giọng nói mà người dùng có quyền sử dụng. Google cho biết tính năng này được cung cấp kèm theo xác minh đồng thuận tích hợp, dấu nước SynthID và chứng chỉ C2PA.

Chỉ đạo hiệu suất và các chuẩn mực đã báo cáo

Cả hai mô hình cho phép chỉ đạo từng dòng của mỗi biểu diễn: người dùng có thể viết chỉ dẫn sân khấu của riêng mình hoặc để Gemini điều khiển việc truyền tải dựa trên các gợi ý kịch bản tự nhiên. Google cho biết việc tạo nội dung dạng dài duy trì chất lượng giọng nói, nhịp độ và âm sắc nhân vật ổn định trong suốt hàng giờ âm thanh liên tục với độ trôi dạt của người nói tối thiểu, hướng tới podcast và sách nói. Cảnh quay hai người nói bản địa hướng các cuộc trò chuyện đa lượt từ một kịch bản duy nhất trong khi giữ hai giọng nói tách biệt với việc luân phiên tự nhiên. Các đoạn giọng nói được kịch bản và phản hồi ngược thêm các dấu hiệu phi ngôn ngữ như <laughs>, <sigh>, và <gasp>, cùng với các lời xen kẽ như “mhm” và “yeah”.

Trong các đánh giá, Google báo cáo rằng Gemini 3.8 Flash TTS đạt vị trí tổng thể hàng đầu trên Thước đo Thiết kế Giọng nói của Hume AI với điểm số 71.4 và cũng dẫn đầu trong mô hình giọng địa phương với 60.8. Công ty cho biết Flash TTS và Flash-Lite TTS giữ vị trí thứ nhất và thứ hai trên Chỉ số Chất lượng Tổng thể của Hume AI, và các mô hình mới cho thấy cải tiến đáng kể so với Gemini 3.1 Flash TTS trong các trường hợp sử dụng bao gồm nội dung dạng dài và kiểm soát kịch bản hai người nói. Trong các đánh giá ưu tiên của con người mù trên Voice Arena, Google cho biết hai mô hình này đạt vị trí hàng đầu trong số các đối thủ ở các ngôn ngữ bao gồm tiếng Nhật, tiếng Bồ Đào Nha Brazil, tiếng Việt, tiếng Ả Rập Chuẩn hiện đại, tiếng Tây Ban Nha Mexico và tiếng Hindi.

An toàn, hạn chế và khả dụng

Theo hệ thống xác minh đồng thuận, người dùng phải cung cấp bản ghi âm đồng thuận bằng lời từ chủ sở hữu giọng nói phù hợp với người nói tham chiếu trước khi có thể tạo ra giọng nói sao chép. Mỗi đoạn âm thanh mà các mô hình Gemini Audio tạo ra đều mang dấu nước SynthID, mà Google mô tả là không thể nhận biết và được nhúng trực tiếp vào đầu ra âm thanh để giọng nói do AI tạo ra vẫn có thể được phát hiện.

Thẻ mô hình liệt kê các hạn chế đã biết bao gồm hiện tượng ảo và đôi khi chậm hoặc gặp lỗi thời gian chờ, và đưa ra thời điểm cắt kiến thức là tháng 1 năm 2025. Đối với an toàn biên giới, Google DeepMind cho biết các đánh giá của họ không phát hiện khả năng mới có ý nghĩa hoặc tăng trưởng hiệu suất đáng kể nào trong các mô hình Gemini 3.8 Audio so với Gemini 3.7 Flash, mà các đánh giá của họ cho thấy không đạt bất kỳ mức Khả năng Theo dõi hoặc Khả năng Quan trọng nào theo Khung An toàn Biên giới. Dựa trên đó, họ cho rằng các mô hình Gemini 3.8 Audio không có khả năng đạt các mức này.

Gemini 3.8 Flash TTS cũng có sẵn trong Gemini Notebook và Flash-Lite TTS trong Google Vids, với quyền truy cập doanh nghiệp qua API trong Gemini Enterprise được liệt kê là sẽ sớm ra mắt. Google AI Studio bổ sung một sân chơi âm thanh được xây dựng giống như không gian làm việc thiết kế giọng nói, nơi các nhà phát triển có thể tạo ra các danh tính giọng nói mới từ đầu hoặc sao chép một giọng nói và sau đó chỉ đạo việc truyền tải từng dòng trong trình chỉnh sửa kịch bản hai người nói. Một chú thích trong thông báo ghi chú rằng việc sao chép giọng nói qua AI Studio không khả dụng ở Illinois, Texas, Khu vực Kinh tế Châu Âu, Vương quốc Anh, Thụy Sĩ và Ấn Độ. Các nền tảng phát triển Agora, LiveKit, Pipecat và Vercel hỗ trợ các mô hình thông qua Gemini API, và Google đã nêu Figma, HeyGen, Linguana, Wondercraft, 99.co và Ollang là các đối tác tích hợp các mô hình TTS mới cho việc lồng tiếng toàn cầu, địa phương hóa truyền thông và các trợ lý giọng nói đàm thoại.

Jonas Reeve là một nhà phân tích được tạo bởi AI tại Unite.AI, tập trung vào trí tuệ nhân tạo nhận thức, trí tuệ nhân tạo tổng quát (AGI) và các nền tảng lý thuyết của trí tuệ máy. Công việc của ông khám phá cách học tập, lý luận, trí nhớ và trừu tượng hóa xuất hiện trong cả hệ thống sinh học và nhân tạo, vẽ ra các kết nối giữa các kiến trúc AI hiện đại và các câu hỏi lâu đời trong khoa học nhận thức và triết lý của tâm trí.
Với một cách tiếp cận khái niệm và phản ánh, Jonas kiểm tra các khuôn khổ như mô hình lý luận, hệ thống đại lý, nhận thức xuất hiện và lý thuyết liên kết, nhằm làm rõ tiến bộ hướng tới AGI thực sự có nghĩa là gì - và những gì nó không có. Thay vì theo đuổi thời gian hoặc sự cường điệu, ông nhấn mạnh các nguyên tắc cơ bản, sự nghiêm ngặt về khái niệm và giới hạn của các mô hình hiện tại.
Các bài viết được viết bởi Jonas Reeve được tạo bởi AI và được xem xét bởi đội ngũ biên tập của Unite.AI để đảm bảo độ chính xác, sự rõ ràng và thảo luận có trách nhiệm về các khái niệm AI tiên tiến.