Mô hình và nền tảng AI

xAI ra mắt mô hình chuyển đổi giọng nói thành văn bản Grok Voice Transcribe 2.0

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

xAI đã phát hành Grok Voice Transcribe 2.0, mô hình chuyển đổi giọng nói thành văn bản mới nhất của mình, vào ngày 18 tháng 9 năm 2026, với mức giá xử lý hàng loạt là 0,10 USD mỗi giờ âm thanh, đồng thời mô tả mô hình này là chính xác gấp đôi so với Grok Voice Transcribe 1.0.

Grok Voice Transcribe 2.0 được xây dựng dựa trên mô hình nền tảng âm thanh đằng sau Grok Voice. Theo xAI, Grok Voice hiện đã hỗ trợ hàng chục nghìn cuộc gọi hỗ trợ khách hàng mỗi ngày, chuyển đổi hàng triệu giờ lời thuyết minh video, và vận hành các trợ lý giọng nói trong các sản phẩm vật lý, bao gồm trợ lý Grok trong các xe Tesla. Công ty cho biết mô hình mới được huấn luyện trên âm thanh đa ngôn ngữ, sống động, ồn ào, được ghi lại trong nhiều môi trường đa dạng và được tinh chỉnh sau đào tạo, và mô tả kết quả là một trong những mô hình chuyển đổi giọng nói thành văn bản chính xác nhất hiện có cho các tình huống thực tế.

Đánh giá độ chính xác

xAI cho biết Grok Voice Transcribe 2.0 đứng đầu về độ chính xác trong số 32 mô hình streaming trên bảng xếp hạng công khai Artificial Analysis. Ngoài các tiêu chuẩn công khai, công ty đo tỷ lệ lỗi từ trên bốn bộ đánh giá nội bộ được rút ra từ lưu lượng sản xuất: âm thanh điện thoại từ các cuộc gọi hỗ trợ khách hàng, các cuộc trò chuyện với Grok, thông tin xác thực nói như mã tài khoản và địa chỉ email, và các lệnh giọng nói đa ngôn ngữ ngắn. Công ty báo cáo rằng mô hình mới cải thiện so với Grok Voice Transcribe 1.0 trên cả bốn bộ và dẫn đầu mọi mô hình mà họ thử nghiệm trên bộ dữ liệu điện thoại, bao gồm các cuộc gọi hỗ trợ khách hàng tiếng Anh ở tần số 8 kHz. Các biểu đồ do xAI công bố so sánh mô hình này với Gemini 3.5 Transcribe, MAI-Transcribe-2, ElevenLabs Scribe v2, Deepgram Nova-3 và Whisper Large v3 trên các bộ dữ liệu nội bộ đó.

Theo xAI, việc chuyển đổi đa ngôn ngữ mang lại mức tăng độ chính xác lớn nhất so với phiên bản 1.0. Công ty cho biết mô hình có thể chuyển đổi hàng chục ngôn ngữ, tự động phát hiện ngôn ngữ và theo dõi các chuyển đổi ngôn ngữ giữa các đoạn ghi âm trong một lần xử lý. Các cụm từ ngắn, chẳng hạn như lệnh trong xe, cung cấp ít ngữ cảnh cho mô hình xác định ngôn ngữ; trong bộ dữ liệu cụm từ ngắn của xAI bao gồm các câu lệnh trợ lý giọng nói trải rộng 19 ngôn ngữ, tỷ lệ lỗi từ giảm từ 20,6 % xuống 6,8 %, công ty báo cáo.

Tính năng và truy cập API

Thông qua Speech-to-Text API, Grok Voice Transcribe 2.0 xử lý việc chuyển đổi hàng loạt các tệp ghi âm và URL cũng như truyền phát thời gian thực. Bộ tính năng được tài liệu mô tả bao gồm dấu thời gian mức từ với điểm tin cậy, phân đoạn người nói không tính phí thêm, chuyển đổi đa kênh lên đến tám kênh, ưu tiên các thuật ngữ chính lên tới 100 thuật ngữ miền mỗi yêu cầu, định dạng văn bản trả về số, ngày, tiền tệ, số điện thoại và địa chỉ email dưới dạng viết, loại bỏ từ đệm, và phát hiện lượt nói thông minh để xác định khi người nói kết thúc lượt nói cho các trợ lý giọng nói. xAI cho biết các tích hợp Speech-to-Text API hiện có sẽ nhận được cải thiện độ chính xác mà không cần thay đổi mã.

Tài liệu chính thức tài liệu chuyển đổi giọng nói thành văn bản liệt kê 12 định dạng âm thanh được hỗ trợ, kích thước tệp tối đa 500 MB, và các tần số mẫu 8000, 16000, 22050, 24000, 44100 và 48000 Hz. Tham số ngôn ngữ cho phép định dạng dạng viết trên 25 ngôn ngữ, trong đó có tiếng Anh, tiếng Tây Ban Nha, tiếng Pháp, tiếng Đức, tiếng Hindi, tiếng Nhật và tiếng Hàn.

Các yêu cầu batch sử dụng dữ liệu biểu mẫu multipart và phải cung cấp một tệp đã tải lên hoặc một URL để máy chủ tải xuống và chuyển đổi; phản hồi trả về bản chuyển đổi đầy đủ, ngôn ngữ được phát hiện dưới dạng mã BCP-47, độ dài âm thanh tính bằng giây, và các đoạn mức từ với thời gian bắt đầu và kết thúc. Đối với streaming, khách hàng gửi âm thanh thô dưới dạng khung nhị phân tới điểm cuối WebSocket tại wss://api.x.ai/v1/stt và nhận các sự kiện bản chuyển đổi JSON khi âm thanh được xử lý, với các kết quả tạm thời tùy chọn được phát ra khoảng mỗi 500 millisecond.

Triển khai Loom, Giá cả và Ngừng hỗ trợ

xAI cho biết Atlassian đã đánh giá Grok Voice Transcribe 2.0 so với giải pháp chuyển đổi hiện tại của mình, nhận thấy nó chính xác hơn, và hiện đang sử dụng mô hình này để chuyển đổi mọi video trên Loom, sản phẩm ghi màn hình của họ. thông báo của xAI trích dẫn Sanchan Saxena, phó chủ tịch cấp cao của Teamwork Collection tại Atlassian, về các quy trình làm việc đưa bản chuyển đổi Loom vào công cụ mã hoá Cursor: “Với Grok cung cấp chức năng chuyển đổi giọng nói thành văn bản cho Loom và Cursor biến nó thành mã, chúng tôi đang khép vòng từ ngữ cảnh đến mã: ghi lại những gì bạn muốn nói, và công việc sẽ được thực hiện.”

Giá cả giống hệt với Grok Voice Transcribe 1.0: 0,10 USD mỗi giờ âm thanh cho chuyển đổi batch và 0,20 USD mỗi giờ cho streaming, bao gồm cả phân đoạn người nói, dấu thời gian và các thuật ngữ chính. xAI cho biết Grok Voice Transcribe 2.0 sẽ sớm trở thành mô hình mặc định trong Speech-to-Text API và phiên bản 1.0 sẽ bị ngừng hỗ trợ trong vài tuần tới; khách hàng muốn tiếp tục sử dụng mô hình cũ trong quá trình chuyển đổi có thể cố định grok-voice-transcribe-1.0 trong yêu cầu của họ. Tài liệu hiện tại liệt kê grok-voice-transcribe-1.0 là mặc định khi tham số model bị bỏ qua, với grok-voice-transcribe-2.0 có thể chọn trên cả endpoint REST và WebSocket.

Jonas Reeve là một nhà phân tích được tạo bởi AI tại Unite.AI, tập trung vào trí tuệ nhân tạo nhận thức, trí tuệ nhân tạo tổng quát (AGI) và các nền tảng lý thuyết của trí tuệ máy. Công việc của ông khám phá cách học tập, lý luận, trí nhớ và trừu tượng hóa xuất hiện trong cả hệ thống sinh học và nhân tạo, vẽ ra các kết nối giữa các kiến trúc AI hiện đại và các câu hỏi lâu đời trong khoa học nhận thức và triết lý của tâm trí.
Với một cách tiếp cận khái niệm và phản ánh, Jonas kiểm tra các khuôn khổ như mô hình lý luận, hệ thống đại lý, nhận thức xuất hiện và lý thuyết liên kết, nhằm làm rõ tiến bộ hướng tới AGI thực sự có nghĩa là gì - và những gì nó không có. Thay vì theo đuổi thời gian hoặc sự cường điệu, ông nhấn mạnh các nguyên tắc cơ bản, sự nghiêm ngặt về khái niệm và giới hạn của các mô hình hiện tại.
Các bài viết được viết bởi Jonas Reeve được tạo bởi AI và được xem xét bởi đội ngũ biên tập của Unite.AI để đảm bảo độ chính xác, sự rõ ràng và thảo luận có trách nhiệm về các khái niệm AI tiên tiến.