Mô hình và nền tảng AI
AudioShake ra mắt The Refinery để chuyển các cuộc hội thoại chồng chập thành dữ liệu đào tạo AI

Mọi người cắt lời nhau. Họ cười phá lên câu cuối của người khác, đưa ra một đồng ý nhanh chóng trước khi người nói kết thúc, và tiếp tục nói khi nhạc hoặc tiếng ồn giao thông lấp đầy nền. Đối với nhà phát triển AI giọng nói, sự hỗn loạn hằng ngày này tạo ra một vấn đề dữ liệu khó khăn: một bản ghi có thể chứa chính hành vi hội thoại mà mô hình cần học, nhưng lại xuất hiện dưới dạng một luồng âm thanh hỗn hợp duy nhất.
AudioShake đang nhắm vào khoảng trống đó bằng The Refinery, một hệ thống mới ra mắt chuyển các bản ghi hiện có thành dữ liệu có cấu trúc, tách giọng nói cho việc đào tạo AI. Thay vì yêu cầu các nhà phát triển tạo ra các cuộc hội thoại mới hoặc tạo ra các ví dụ tổng hợp, công ty đang cung cấp một cách để trích xuất các giọng nói cá nhân và các thành phần âm thanh khác từ các bản ghi mà tổ chức đã có quyền sử dụng.
Thông báo này đưa việc tách âm thanh gần hơn tới trung tâm của quy trình phát triển AI giọng nói. Câu hỏi thú vị là liệu các bộ dữ liệu có thể giữ nguyên thời gian và độ phức tạp của cuộc hội thoại thực tế đồng thời trở nên dễ dàng hơn trong việc gán nhãn, kiểm tra và sử dụng.
Biến một bản ghi đã hoàn thành thành các dải giọng riêng biệt
Theo thông báo của AudioShake, The Refinery có thể tách các cuộc hội thoại thành các dải giọng riêng lẻ đồng thời tách lời thoại ra khỏi nhạc và âm thanh nền. Nó hoạt động trực tiếp từ âm thanh đã ghi, mà không cần phiên ghi âm gốc hoặc các stem được ghi riêng. Khi hai người nói cùng lúc, mục tiêu là phục hồi giọng nói của họ một cách riêng biệt đồng thời giữ lại phần giao tiếp chồng chập.
Điều này khác với việc chỉ làm sạch bản ghi cho đến khi chỉ còn lại một giọng nói chi phối. Một sự cắt lời có thể là thông tin đào tạo quan trọng thay vì tiếng ồn không mong muốn. Một lời xác nhận ngắn có thể giúp truyền đạt liệu ai đó đang lắng nghe, đồng ý, hay chuẩn bị lên lời. Việc làm phẳng một cuộc trao đổi thành một luồng duy nhất có thể khiến những hành vi này khó gắn với người nói đúng.
Một cách hữu ích để suy nghĩ về đầu ra là như một tập hợp các dải âm đồng bộ. Một dải mang giọng nói của một người nói cụ thể, dải khác mang giọng nói của người nói thứ hai, và thời gian chung của chúng cho thấy khi nào chúng chồng chập. Bản ghi trở nên dễ kiểm tra hơn mà không cần phải viết lại toàn bộ cuộc hội thoại.
AudioShake cho biết hệ thống không tạo ra hoặc tái tạo giọng nói: các giọng nói đã tách và các tần số tương ứng của chúng xuất phát từ bản ghi gốc. Sự khác biệt này quan trọng đối với các nhà phát triển đang tìm kiếm các ví dụ về hành vi hội thoại thực tế. Quá trình xử lý nhằm mục đích tiết lộ những gì đã được ghi lại, chứ không phải tạo ra một bản biểu diễn mới.
Tại sao việc tách giọng nói vượt ra ngoài Diarization
AudioShake’s trang sản phẩm Multi-Speaker Separation mô tả một sự kết hợp giữa việc tách giọng nói và diarization. Diarization xác định khi nào các người nói khác nhau đang hoạt động; tách giọng tạo ra các tín hiệu âm thanh riêng lẻ. Gán nhãn một khoảng thời gian là chứa hai người nói không tự nó cung cấp cho nhà phát triển hai dải giọng có thể sử dụng độc lập.
Sản phẩm cũng phân biệt mức độ tin cậy trong việc gán âm thanh cho người nói đúng với mức độ tin cậy trong chất lượng của việc tách. Những điều này giải quyết các vấn đề khác nhau: một giọng nói có thể được phân bổ đúng nhưng vẫn chứa âm thanh của người khác. AudioShake mô tả hệ thống nền tảng là âm học, thay vì phụ thuộc vào mô hình ngôn ngữ, và hỗ trợ các bản ghi với các tốc độ mẫu và điều kiện ghi âm khác nhau.
Đối với một quy trình đào tạo, việc tách các chức năng này có thể làm cho việc rà soát chính xác hơn. Một nhóm có thể cần kiểm tra danh tính người nói, độ rõ ràng của một dải cụ thể, hoặc độ chính xác của bản chuyển ngữ được tạo ra sau đó. Xem ba yếu tố này như một thành công hoặc thất bại duy nhất sẽ làm mờ đi vị trí mà lỗi đã xâm nhập vào bộ dữ liệu.
Điểm chất lượng là một phần của quy trình dữ liệu
The Refinery đánh giá các đầu ra về chất lượng và độ tin cậy, cho phép các tổ chức sắp xếp các bộ sưu tập lớn thành tài liệu có thể sử dụng, có thể sửa chữa, hoặc không phù hợp. Đây là một tính năng vận hành quan trọng. Ở quy mô một kho âm thanh đáng kể, việc nghe từng phút một cách thủ công trở thành nút thắt ngay cả khi quá trình tách tự động.
Các điểm số có thể giúp hướng sự chú ý của con người tới các đoạn đáng ngờ. Ví dụ, một nhóm dữ liệu có thể ưu tiên một cuộc hội thoại đông đúc nơi người nói nhẹ nhàng trở nên khó phân biệt, thay vì rà soát một bản ghi một người đơn giản với cùng mức độ tập trung.
Cũng có một sự đánh đổi cần quản lý. Chỉ chọn những đoạn dễ nhất, rõ ràng nhất có thể tạo ra một bộ dữ liệu bỏ lỡ những tình huống khó khăn mà dự án dự định ghi lại. Theo đánh giá của chúng tôi, các nhóm sử dụng loại quy trình này nên đánh giá cả chất lượng đầu ra và sự đa dạng hội thoại còn lại sau khi lọc. Việc bảo tồn các ví dụ thách thức với việc rà soát cẩn thận có thể hữu ích hơn so với việc tối đa hoá một điểm tin cậy tổng hợp duy nhất.
Sự sẵn sàng cho việc đào tạo do đó không chỉ bao gồm việc tạo ra các tệp riêng biệt. Các nhà phát triển vẫn cần xác định cách các dải, bản chuyển ngữ, thời gian, nhãn người nói và siêu dữ liệu chất lượng phù hợp với mục tiêu học tập cụ thể của họ.
Những gì Benchmark của AudioShake cho thấy — và các giới hạn của nó
Trong đánh giá kỹ thuật Multi-Speaker 2.0, AudioShake báo cáo tỷ lệ lỗi từ tối thiểu hoán vị nối tiếp 9.17% trên LibriCSS, so với 37.75% cho checkpoint MERL TF-Locoformer đã được thử nghiệm. Cả hai đều được đánh giá qua cùng một pipeline chuyển đổi Whisper large-v3. Tỷ lệ lỗi thấp hơn cho thấy có ít lỗi chuyển đổi hơn trong đánh giá đó.
Việc xác nhận này quan trọng: checkpoint nền tảng đã được thử nghiệm ngoài miền đào tạo của nó. AudioShake rõ ràng đặt vấn đề này như một so sánh có sẵn, thay vì bằng chứng cho thấy một kiến trúc nào đó vốn tốt hơn dưới các điều kiện đào tạo tương đồng. Đánh giá của họ cũng lưu ý rằng độ chính xác trở nên khó duy trì hơn khi mức độ chồng lấn kéo dài và số lượng người nói tăng lên.
Đây là kết quả do công ty báo cáo, không phải một đánh giá độc lập về mọi triển khai của The Refinery. Chúng hỗ trợ việc thử nghiệm công nghệ trên âm thanh đại diện, thay vì giả định rằng cải tiến tiêu đề sẽ được chuyển giao nguyên vẹn sang bộ dữ liệu khác.
Chất lượng tách âm và hiệu suất mô hình hạ lưu cũng là những kết quả khác nhau. Một tập dữ liệu đào tạo sạch hơn có thể có giá trị, nhưng buổi ra mắt không xác định mức độ cải thiện của một mô hình hội thoại cụ thể sau khi học từ đó. Điều này đòi hỏi một thí nghiệm riêng, với ứng dụng dự định và các điều kiện đánh giá được xác định.
Từ Quy trình Truyền thông đến Hạ tầng Dữ liệu AI
AudioShake mang lại kinh nghiệm từ sản xuất âm nhạc và truyền thông. trang web công ty của họ mô tả việc tách âm thanh cho các nhiệm vụ bao gồm trộn, định vị, phân tích âm thanh và biên tập âm thanh‑hình ảnh, và liệt kê các khách hàng như ESPN, Universal Music Group và Warner Bros. Studios. Trong những bối cảnh đó, việc tách các thành phần từ một bản mix đã hoàn thiện có thể làm cho tài nguyên hiện có hữu ích cho quy trình sản xuất khác.
The Refinery áp dụng ý tưởng tương tự vào phát triển AI: làm cho một bản ghi âm hiện có trở nên hữu ích hơn bằng cách tiết lộ các thành phần của nó. trang dịch vụ dữ liệu của AudioShake cũng mô tả việc chuẩn bị các bộ dữ liệu từ nội dung của khách hàng và phát triển các mô hình tách chuyên biệt cho các danh mục cụ thể.
Điều này không đồng nghĩa với việc mọi kho lưu trữ truyền thông đều là bộ dữ liệu đào tạo phù hợp. Các tổ chức vẫn cần xác định bản ghi nào phù hợp với mục đích sử dụng dự định và thiết lập những gì họ được phép làm với tài liệu đó. Thông báo đặc biệt định vị The Refinery quanh những khách hàng âm thanh đã có quyền sử dụng.
Một Bài Kiểm Tra Thực Tiễn cho Các Nhà Phát Triển Voice AI
Trong blog ra mắt, AudioShake báo cáo đã xử lý hơn 100 triệu phút và cho biết các phiên bản đầu đã được triển khai riêng tư với các phòng thí nghiệm AI tiên phong trong năm qua. Công ty liệt kê Luel và Rime trong số khách hàng, cùng với các phòng thí nghiệm và chợ dữ liệu không được nêu tên. Quy mô này vẫn là con số do công ty báo cáo.
The Refinery có thể xử lý dữ liệu qua API của AudioShake hoặc được triển khai tại chỗ, theo thông báo. Tùy chọn thứ hai nhằm cho phép các tổ chức xử lý các bản ghi nhạy cảm hoặc sở hữu trong môi trường của riêng họ. Khách hàng vẫn giữ quyền sở hữu dữ liệu và kết quả của mình.
Đối với một nhà phát triển đánh giá hệ thống, một thử nghiệm đại diện sẽ quan trọng hơn một buổi trình diễn hoàn hảo sạch sẽ. Những câu hỏi hữu ích bao gồm: liệu các người nói nhẹ nhàng có được tách ra thành công không, liệu các gián đoạn có vẫn được căn chỉnh không, mức độ chỉnh sửa thủ công cần thiết là bao nhiêu, và liệu các ví dụ thu được có cải thiện ứng dụng giọng nói dự định không.
blog ra mắt của AudioShake cung cấp nền tảng bổ sung về cách tiếp cận của họ. Ý nghĩa rộng hơn của The Refinery là đơn giản: cuộc trò chuyện thực tế chứa cấu trúc hữu ích mà một bản ghi âm hỗn hợp có thể che giấu. Khôi phục cấu trúc đó có thể biến âm thanh hiện có thành nguồn tài nguyên thực tế hơn để xây dựng voice AI xử lý cách con người thực sự nói.












