Mô hình và nền tảng AI
Microsoft ra mắt MAI-Transcribe-2-Streaming và Hai mô hình MAI-Voice

Microsoft AI vào ngày 1 tháng 10 năm 2026 ra mắt MAI-Transcribe-2-Streaming, mô hình chuyển đổi giọng nói thành văn bản streaming đầu tiên của họ, cùng với hai mô hình chuyển văn bản thành giọng nói mới, MAI-Voice-2.1 và MAI-Voice-2.1-Flash, với cả ba mô hình đều có sẵn qua Microsoft Foundry.
MAI-Transcribe-2-Streaming và Bộ tiêu chuẩn Artificial Analysis
Microsoft mô tả MAI-Transcribe-2-Streaming là cung cấp các bản ghi thời gian thực, độ trễ thấp bằng 60 ngôn ngữ với khả năng tự động, liên tục phát hiện ngôn ngữ. Công ty cho biết mô hình đạt vị trí số 1 về độ chính xác cho cả bản ghi cuối cùng và bản ghi một phần trên Artificial Analysis, và nó nằm trên rìa Pareto của đánh giá độ chính xác so với độ trễ của bộ tiêu chuẩn, có nghĩa là độ chính xác cao hơn không đòi hỏi phải đánh đổi độ trễ lớn. Biểu đồ bảng xếp hạng trong bài đăng, trích dẫn bảng xếp hạng streaming của Artificial Analysis ngày 28 tháng 9 năm 2026, cho thấy mô hình có tỷ lệ lỗi từ cuối cùng 2.5 phần trăm, tỷ lệ lỗi phần đầu tiên 2.8 phần trăm, và 0.13 giây để có bản ghi cuối cùng.
Thay vì chờ người nói hoàn thành trước khi trả về văn bản, mô hình tạo ra các giả thuyết đầu tiên, được gọi là các phần một phần, chỉ trong hơn 100 miligiây sau khi nhận âm thanh, sau đó sửa đổi chúng khi có thêm ngữ cảnh trước khi đưa ra bản ghi ổn định. Microsoft cho biết điều này cho phép các ứng dụng hỗ trợ giọng nói thực hiện hành động dựa trên lời nói trước khi người nói kết thúc: các trợ lý giọng nói có thể bắt đầu suy luận hoặc gọi công cụ giữa chừng câu, và các bản ghi trực tiếp có thể xuất hiện khi người nói. Đối với việc ghi âm và phụ đề thời gian thực, công ty cho biết các đánh giá nội bộ cho thấy các từ xuất hiện trong bản ghi nhanh gấp đôi so với đối thủ gần nhất.
Artificial Analysis cho biết rằng chỉ số AA-WER Streaming của nó đo độ chính xác chuyển đổi giọng nói thành văn bản cho các mô hình mà âm thanh được truyền trực tiếp, từng đoạn một, trong khoảng tám giờ âm thanh từ ba bộ dữ liệu: AA-AgentTalk ở mức 50 phần trăm, VoxPopuli ở mức 25 phần trăm, và Earnings22 ở mức 25 phần trăm. Các bộ dữ liệu bao gồm giọng nói thực tế với các giọng địa phương đa dạng, ngôn ngữ chuyên ngành, và các điều kiện âm học khó khăn, và các đo lường Thời gian đến bản ghi cuối cùng và Thời gian đến phần một phần của bộ tiêu chuẩn đều bắt đầu từ khi phát hiện kết thúc lời nói bằng bộ phát hiện hoạt động giọng nói SileroVAD.
MAI-Transcribe-2-Streaming có sẵn với mức giá giới thiệu $0.54 mỗi giờ âm thanh đến cuối năm. Mô hình này mở rộng dòng sản phẩm âm thanh MAI của Microsoft, vốn đã bao gồm MAI-Transcribe-2, mô hình nhận dạng giọng nói không streaming trước đây mà công ty quảng cáo là nhanh nhất, chính xác nhất và rẻ nhất trên thế giới.
MAI-Voice-2.1 và MAI-Voice-2.1-Flash
MAI-Voice-2.1 hỗ trợ 23 ngôn ngữ và 26 địa phương, và Microsoft cho biết một giọng duy nhất có thể sử dụng tất cả chúng với giọng địa phương tự nhiên, giữ nguyên danh tính người nói khi chuyển ngôn ngữ. Một ứng dụng dạy kèm, trong ví dụ của công ty, có thể chuyển ngôn ngữ giữa chừng buổi học mà không cần đổi giáo viên, và một trợ lý đa ngôn ngữ có thể trả lời bằng bất kỳ ngôn ngữ nào được nói tới trong khi vẫn giữ âm thanh giống giọng ban đầu. Mô hình này có giá $22 cho mỗi 1M ký tự.
MAI-Voice-2.1-Flash hỗ trợ cùng các ngôn ngữ và khả năng nói đa ngôn ngữ nhưng được thiết kế cho khối lượng công việc lớn, nhạy cảm với độ trễ. Nó có thể tạo lên tới 45 giây âm thanh với độ trễ đầu cuối 150 miligiây, và Microsoft cho biết nó cung cấp tốc độ suy luận mô hình nhanh hơn 55 phần trăm và rẻ hơn khoảng 60 phần trăm so với các mô hình tương đương. Giá của nó là $15 cho mỗi 1M ký tự.
Cả hai mô hình giọng nói đều hỗ trợ sao chép giọng nói trên tất cả các ngôn ngữ được hỗ trợ bằng vài giây âm thanh tham chiếu, với các rào cản đồng thuận tích hợp mà Microsoft cho biết ngăn ngừa việc lạm dụng. Trong một bài kiểm tra Turing với 4,000 người nghe kết hợp hai mô hình giọng nói mới, 50.3 phần trăm người nghe đánh giá MAI-Voice có độ giống con người tương đương hoặc cao hơn so với các bản ghi âm của con người, Microsoft cho biết.
Microsoft mô tả việc ghép MAI-Transcribe-2-Streaming với MAI-Voice-2.1-Flash như việc mua lại thời gian ở cả hai đầu của vòng lặp trợ lý giọng nói, chuỗi các bước nghe, hiểu, quyết định và nói trong khoảng thời gian mà con người vẫn cảm nhận tương tác như một cuộc hội thoại. Các trường hợp sử dụng dành cho nhà phát triển được liệt kê bao gồm các đại lý dịch vụ khách hàng chuyển đổi yêu cầu thành văn bản khi chúng được nói và trả lời bằng giọng nói tự nhiên, trợ lý đa ngôn ngữ phát hiện ngôn ngữ nói và trả lời bằng bất kỳ ngôn ngữ nào trong số 23 ngôn ngữ MAI-Voice được hỗ trợ, và các ứng dụng học tập và truyền thông tương tác sử dụng các giọng nói riêng biệt cho việc dạy kèm, nhập vai, mô phỏng, thuyết minh và nội dung hội thoại.
Khả dụng và Bản demo Chatter
MAI-Voice-2.1 và MAI-Voice-2.1-Flash có sẵn qua OpenRouter. Cả ba mô hình đều có sẵn qua Microsoft Foundry, MAI Playground, Vercel và Azure Voice Live, trong khi LiveKit được liệt kê là sẽ sớm ra mắt.
Để minh họa các mô hình hoạt động cùng nhau trong một trợ lý trực tiếp, Microsoft đã xây dựng Chatter, một bản demo mới trong MAI Playground cho phép người dùng nói chuyện với trợ lý giọng nói được hỗ trợ bởi các mô hình chuyển đổi và giọng nói.












