Mô hình và nền tảng AI

IBM cho biết Granite Speech 5.0 Chuyển Đổi 3,5 Giờ Giọng Nói trong Một Giây

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

IBM đã ra mắt hai mô hình nhận dạng giọng nói tiếng Anh gọn nhẹ vào ngày 25 tháng 8 năm 2026, tuyên bố tốc độ chuyển đổi chưa từng có của bất kỳ mô hình mở nào trước đây: hơn 3,5 giờ âm thanh được xử lý trong một giây duy nhất. Hai mô hình này, Granite Speech 5.0 TurboCTC và phiên bản phi thương mại, mỗi mô hình chỉ có 470 triệu tham số, và công ty báo cáo tổng tốc độ vượt qua 12.600 RTFx trên một GPU NVIDIA H200 duy nhất, nghĩa là âm thanh chảy qua các mô hình nhanh hơn hơn mười hai nghìn lần so với thời gian thực.

Tốc độ này đi kèm với độ chính xác cạnh tranh, ít nhất theo số liệu của IBM. Trên các bộ dữ liệu kiểm tra ngắn hạn tiếng Anh công khai của Bảng Xếp Hạng OpenASR, phiên bản phi thương mại đạt tỷ lệ lỗi từ (WER) tổng hợp 4,85 % và phiên bản có giấy phép mở đạt 5,00 %, theo thông báo của IBM. Cả hai con số đều do nhà cung cấp báo cáo: IBM gắn nhãn chúng là không chính thức, mặc dù quá trình suy luận đã được thực hiện qua hạ tầng jobs của Hugging Face và được chấm điểm bằng công cụ của bảng xếp hạng, vì vậy công ty kỳ vọng chúng sẽ khớp với bảng chính thức khi được cập nhật.

Hai mô hình có kích thước và kiến trúc giống hệt nhau, chỉ khác nhau ở dữ liệu đào tạo và giấy phép. Mô hình Apache 2.0 được đào tạo trên khoảng 60.000 giờ âm thanh tiếng Anh và được phép sử dụng thương mại. Phiên bản phi thương mại bổ sung GigaSpeech và SPGI Speech, khoảng 15.000 giờ nữa, đưa tổng khối lượng dữ liệu gần 75.000 giờ dưới giấy phép CC-BY-NC-SA-4.0. IBM cho biết dữ liệu bổ sung này mang lại lợi thế độ chính xác nhẹ trên hầu hết các bộ kiểm tra, với ưu thế đáng chú ý hơn trên SPGI Speech và nhược điểm rõ rệt trên bộ kiểm tra mới dạng đoạn Earnings22 của bảng xếp hạng.

Bộ Mã Hóa Không Có Mô Hình Ngôn Ngữ

Yếu tố tốc độ dựa trên những gì IBM đã bỏ qua. Các phiên bản Granite Speech trước đây (dòng 3.3 và 4.x được ghi lại trong bài báo Granite Speech của IBM) đã gắn một bộ mã hoá âm học Conformer vào mô hình ngôn ngữ Granite qua một bộ chiếu và các bộ điều hợp LoRA, tạo ra văn bản một cách tự hồi quy như một mô hình trò chuyện. Các mô hình 5.0 loại bỏ hoàn toàn mô hình ngôn ngữ. Những gì còn lại là bộ mã hoá Conformer 16 lớp được đào tạo bằng phương pháp phân loại thời gian kết nối (CTC), một sơ đồ giải mã ánh xạ các khung âm thanh trực tiếp sang các token đầu ra trong một lần truyền không tự hồi quy với giải mã tham lam.

Hai thay đổi nữa thực hiện phần lớn công việc. Khi các bộ mã hoá Granite trước đây phát ra 50 ký tự mỗi giây, các mô hình mới phát ra 12,5 token mỗi giây, đạt được thông qua ba giai đoạn giảm mẫu thời gian 2x từ đầu vào log‑Mel 100 khung mỗi giây. Và từ vựng đầu ra đã chuyển từ ký tự sang 16.384 đơn vị phụ từ đã được đào tạo, sử dụng SentencePiece trong mô hình phi thương mại và BPE trong mô hình Apache. Ít token hơn, dài hơn, với tốc độ khung chỉ bằng một phần tư là yếu tố đẩy tốc độ xử lý vượt qua 20 lần so với các mô hình Granite Speech trước đây, theo báo cáo của IBM.

Đổi lại là phạm vi khả năng rộng hơn để tập trung vào chuyển đổi. Không có mô hình ngôn ngữ, các mô hình này mất khả năng dịch giọng nói và ưu tiên từ khóa mà các phiên bản trước hỗ trợ. Điều chúng có được là kích thước phù hợp cho máy tính xách tay và phần cứng biên: IBM định vị cặp mô hình này cho các doanh nghiệp cần chuyển đổi giọng nói‑to‑text, nơi độ trễ và tốc độ xử lý quan trọng hơn so với một mô hình có thể suy luận về nội dung đã nghe.

Những Điều Đánh Giá Thể Hiện và Không Thể Thể Hiện

Dấu hiệu độc lập mạnh nhất hiện nay đến từ âm thanh trường xa. Trên Bảng Xếp Hạng FFASR, đo lường khả năng nhận dạng giọng nói trong môi trường ồn ào, vang vọng, IBM báo cáo kết quả chính thức tính đến ngày 25 tháng 8 năm 2026, đưa mô hình phi thương mại lên vị trí thứ năm về độ chính xác và mô hình Apache lên vị trí thứ chín — trong khi cả hai đều xếp hạng là hai mục nhanh nhất trên bảng, với tốc độ đo trên một GPU NVIDIA L4. FFASR đánh giá các mô hình trên âm thanh ồn ào, vang vọng và nguồn di chuyển ở nhiều mức SNR, các điều kiện khiến nhận dạng trường xa suy giảm, theo mô tả của bảng xếp hạng.

Số liệu tiêu đề 12.600 RTFx cần được đặt trong ngữ cảnh. Đó là con số suy luận theo lô trên một trong những GPU trung tâm dữ liệu nhanh nhất hiện có, không phải những gì một máy tính xách tay chạy bản demo streaming WebGPU sẽ thấy. Các con số WER tổng hợp chỉ bao phủ tiếng Anh dạng ngắn, và bảng xếp hạng OpenASR chính thức, bao gồm các bộ kiểm tra riêng, chưa kịp cập nhật các mô hình mới khi công bố. Quan điểm của IBM ở đây là trung thực: đây là kết quả mạnh mẽ do nhà cung cấp báo cáo, đang chờ xác nhận từ bảng xếp hạng.

Công thức đào tạo cũng đáng chú ý vì tính mở của dữ liệu. Mọi bộ dữ liệu trong hai bộ dữ liệu của các mô hình đều có sẵn công khai, và 2.740 giờ dữ liệu tổng hợp bao gồm 2.500 giờ âm thanh đa người nói được ghép từ các đoạn âm thanh đơn người và 240 giờ các câu phát âm được tạo ra bởi các mô hình gpt‑oss mở của OpenAI và tổng hợp bằng StyleTTS2, nhằm vào các số, tiền tệ và địa chỉ thường gây khó khăn cho bộ nhận dạng. Quá trình đào tạo mất 10 ngày trên 8 GPU NVIDIA H100 trong cụm máy tính Blue Vela của IBM, theo thẻ mô hình.

Cả hai mô hình hiện đang có trên Hugging Face với hỗ trợ gốc trong thư viện transformers — cài đặt từ mã nguồn cho tới bản phát hành tiếp theo — dưới bộ sưu tập Granite Speech, và một bản demo streaming dựa trên trình duyệt chạy trên Chrome và Edge. Để có cái nhìn tổng quan về vị trí của các mô hình chuyển đổi chuyên dụng so với các dịch vụ thương mại, hãy xem tổng hợp của chúng tôi về phần mềm chuyển giọng nói AI.

Jonas Reeve là một nhà phân tích được tạo bởi AI tại Unite.AI, tập trung vào trí tuệ nhân tạo nhận thức, trí tuệ nhân tạo tổng quát (AGI) và các nền tảng lý thuyết của trí tuệ máy. Công việc của ông khám phá cách học tập, lý luận, trí nhớ và trừu tượng hóa xuất hiện trong cả hệ thống sinh học và nhân tạo, vẽ ra các kết nối giữa các kiến trúc AI hiện đại và các câu hỏi lâu đời trong khoa học nhận thức và triết lý của tâm trí.
Với một cách tiếp cận khái niệm và phản ánh, Jonas kiểm tra các khuôn khổ như mô hình lý luận, hệ thống đại lý, nhận thức xuất hiện và lý thuyết liên kết, nhằm làm rõ tiến bộ hướng tới AGI thực sự có nghĩa là gì - và những gì nó không có. Thay vì theo đuổi thời gian hoặc sự cường điệu, ông nhấn mạnh các nguyên tắc cơ bản, sự nghiêm ngặt về khái niệm và giới hạn của các mô hình hiện tại.
Các bài viết được viết bởi Jonas Reeve được tạo bởi AI và được xem xét bởi đội ngũ biên tập của Unite.AI để đảm bảo độ chính xác, sự rõ ràng và thảo luận có trách nhiệm về các khái niệm AI tiên tiến.