Mô hình và nền tảng AI

MAI-Transcribe-2 Dẫn Đầu Bảng Tiêu Chuẩn FLEURS Trên 60 Ngôn Ngữ, Microsoft cho biết

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Microsoft AI đã ra mắt MAI-Transcribe-2 vào ngày 3 tháng 9 năm 2026, một mô hình nhận dạng giọng nói mà phòng thí nghiệm cho biết đứng đầu bảng tiêu chuẩn FLEURS trên 60 ngôn ngữ với tỷ lệ lỗi từ trung bình 5,2 %. Trong thông báo, Microsoft mô tả mô hình này là hệ thống chuyển đổi giọng nói sang văn bản mạnh nhất đến nay và đưa ra mức giá 0,10 USD cho mỗi giờ âm thanh.

Microsoft cho biết MAI-Transcribe-2 bổ sung chức năng phân đoạn người nói, các kiểu chuyển đổi có thể cấu hình và dấu thời gian cấp từ, đồng thời vượt trội hơn các mô hình cạnh tranh như Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large và ScribeV2 trên một dải âm thanh thực tế rộng hơn. Theo thông báo, mô hình này xác định ranh giới Pareto cho độ chính xác và độ trễ trên Artificial Analysis và đứng thứ hai trên bảng xếp hạng tỷ lệ lỗi từ của Artificial Analysis, cải thiện so với các phiên bản MAI-Transcribe trước đó.

Microsoft định vị mô hình này cho các tải công việc như ghi chú lâm sàng, tài liệu pháp lý, khả năng tiếp cận và phụ đề đóng. Công ty báo cáo khả năng suy luận nhanh hơn với độ trễ giảm đáng kể, đặc biệt đối với âm thanh dài, đạt tốc độ xử lý nhanh tới 10 lần so với các đối thủ hàng đầu. Nó cũng cho biết mô hình duy trì chất lượng chuyển đổi trong môi trường ồn ào ngoài các phòng thu được kiểm soát.

Kết Quả Đánh Giá

Dựa trên các đánh giá do Artificial Analysis thực hiện, Microsoft cho biết MAI-Transcribe-2 nhanh gấp 10 lần so với GPT-Transcribe của OpenAI, nhanh gấp 7 lần so với Scribe v2 của ElevenLabs và nhanh gấp 5 lần so với Gemini 3.5 Transcribe trong khi vẫn đạt độ chính xác cao hơn. Công ty cho biết mô hình này đứng độc nhất trong góc hấp dẫn nhất của biểu đồ độ chính xác so với tốc độ của bảng tiêu chuẩn, với tỷ lệ lỗi 2,0 % và hệ số tốc độ 403,6, có nghĩa là một giờ âm thanh được xử lý trong khoảng mười giây.

Trong bảng tiêu chuẩn đa ngôn ngữ FLEURS công cộng, Microsoft báo cáo rằng MAI-Transcribe-2 duy trì mức độ chính xác cao đồng đều trên tất cả 60 ngôn ngữ đã kiểm tra. Công ty mô tả mô hình này là chính xác trên nhiều ngôn ngữ hơn bất kỳ mô hình nào khác và cho biết các nhà phát triển thực hiện chuyển đổi đa ngôn ngữ có thể dựa vào một mô hình duy nhất, giảm độ phức tạp và có khả năng tiết kiệm việc sử dụng GPU. Thông báo cũng cho biết tốc độ và khả năng thông lượng của mô hình cho phép Microsoft cung cấp mức giá mà họ gọi là cạnh tranh nhất trên thị trường. Khi ra mắt, mức giá 0,10 USD mỗi giờ là ưu đãi có thời hạn đến cuối năm.

Khả Dụng và Tính Năng Dành Cho Nhà Phát Triển

tài liệu Microsoft Learn liệt kê MAI-Transcribe-2 là có sẵn trong Azure Speech ở giai đoạn xem trước công khai, không có thỏa thuận mức dịch vụ và không được khuyến nghị cho các tải công việc sản xuất. Tài liệu mô tả MAI-Transcribe là một mô hình chuyển giọng nói thành văn bản được xây dựng nội bộ bởi đội ngũ Microsoft AI, bao phủ các tải công việc như phụ đề video, cuộc họp, ghi chú lâm sàng, tài liệu trung tâm cuộc gọi, công cụ hỗ trợ truy cập, tạo nội dung và trợ lý giọng nói. Nó cũng liệt kê MAI-Transcribe-2 cùng với các phiên bản trước MAI-Transcribe-1.5 và MAI-Transcribe-1, phiên bản sau bị ngừng hỗ trợ vào ngày 20 tháng 8 năm 2026.

Yêu cầu được chuyển qua chế độ nâng cao của Fast Transcription API, với mô hình được chọn bằng cách đặt thuộc tính mô hình chế độ nâng cao thành MAI-Transcribe-2. Đầu vào âm thanh bị giới hạn ở các tệp dưới 300 MB định dạng WAV, MP3 hoặc FLAC, và việc sử dụng yêu cầu có đăng ký Azure cùng một tài nguyên Microsoft Foundry cho Speech.

Các tham số tùy chọn kiểm soát bộ tính năng của mô hình. Phân đoạn người nói tách bản ghi theo người nói và trả về các đoạn được gắn nhãn người nói cùng siêu dữ liệu độ lệch và thời lượng. Dấu thời gian cấp từ cung cấp thời gian cho mỗi từ, trong khi tùy chọn segment trả về thời gian cho mỗi đoạn và tùy chọn none bỏ qua dữ liệu thời gian. Tham số phrase-list tạo độ thiên lệch cho việc nhận dạng theo các thuật ngữ được cung cấp như thuật ngữ chuyên ngành, viết tắt và danh từ riêng, với tài liệu lưu ý rằng các thuật ngữ này chỉ là gợi ý chứ không phải đầu ra bắt buộc.

Tham số kiểu chuyển đổi mặc định là verbatim, ghi lại lời nói chính xác như được nói, bao gồm các từ đệm và khởi đầu sai, phục vụ cho các tải công việc tuân thủ, QA và phân tích. Cài đặt clean loại bỏ các từ đệm và tự động định dạng các mẫu lời nói phổ biến để tạo ra phụ đề, ghi chú và bản sao công bố dễ đọc hơn. Lựa chọn ngôn ngữ là tùy chọn; mặc định mô hình tự động phát hiện ngôn ngữ được nói, và tài liệu khuyên chỉ ép buộc một ngôn ngữ cụ thể khi việc tự động phát hiện thất bại. Việc chuyển đổi mã cho các cặp ngôn ngữ hỗn hợp như Hinglish và Spanglish được xử lý tự động, và khả năng chịu nhiễu cho âm thanh ghi ngoài môi trường kiểm soát đã được tích hợp sẵn trong mô hình.

Tài liệu cũng ghi chú rằng MAI-Transcribe có thể cung cấp chuyển đổi âm thanh đầu vào trong Voice Live API thông qua một trường cấu hình phiên. Microsoft cho biết mô hình này có thể được trình diễn qua Microsoft Foundry và MAI Playground, và khả năng trên OpenRouter được liệt kê là sẽ sớm ra mắt.

Jonas Reeve là một nhà phân tích được tạo bởi AI tại Unite.AI, tập trung vào trí tuệ nhân tạo nhận thức, trí tuệ nhân tạo tổng quát (AGI) và các nền tảng lý thuyết của trí tuệ máy. Công việc của ông khám phá cách học tập, lý luận, trí nhớ và trừu tượng hóa xuất hiện trong cả hệ thống sinh học và nhân tạo, vẽ ra các kết nối giữa các kiến trúc AI hiện đại và các câu hỏi lâu đời trong khoa học nhận thức và triết lý của tâm trí.
Với một cách tiếp cận khái niệm và phản ánh, Jonas kiểm tra các khuôn khổ như mô hình lý luận, hệ thống đại lý, nhận thức xuất hiện và lý thuyết liên kết, nhằm làm rõ tiến bộ hướng tới AGI thực sự có nghĩa là gì - và những gì nó không có. Thay vì theo đuổi thời gian hoặc sự cường điệu, ông nhấn mạnh các nguyên tắc cơ bản, sự nghiêm ngặt về khái niệm và giới hạn của các mô hình hiện tại.
Các bài viết được viết bởi Jonas Reeve được tạo bởi AI và được xem xét bởi đội ngũ biên tập của Unite.AI để đảm bảo độ chính xác, sự rõ ràng và thảo luận có trách nhiệm về các khái niệm AI tiên tiến.