Mô hình và nền tảng AI
aiOla Ra Mắt QUASAR Để Thay Đổi Cách Nhận Diện Giọng Nói Hoạt Động Trong Sản Xuất

aiOla đã giới thiệu QUASAR, một nền tảng được thiết kế để giải quyết một trong những vấn đề dai dẳng nhất trong lĩnh vực giọng nói doanh nghiệp: hiệu suất nhận diện giọng nói không nhất quán trong điều kiện thực tế. Thay vì khóa khách hàng vào một nhà cung cấp nhận diện giọng nói tự động (ASR) duy nhất, QUASAR hoạt động như một cổng thông minh động routes mỗi tương tác âm thanh đến ASR engine có khả năng hoạt động tốt nhất tại thời điểm đó.
Sự thay đổi này rất quan trọng khi giọng nói trở thành một phần nhập liệu cốt lõi cho các quy trình làm việc được điều khiển bởi AI trên các trung tâm liên lạc, tuân thủ, phân tích, tìm kiếm và ngày càng nhiều, các tác nhân AI tự động. Trong khi các điểm chuẩn thường hướng dẫn việc lựa chọn ASR, môi trường sản xuất bị chi phối bởi các yếu tố như giọng nói, tiếng ồn nền, thuật ngữ chuyên ngành và chất lượng mạng thay đổi – những yếu tố có thể thay đổi đáng kể độ chính xác nhận diện từ một tương tác này sang một tương tác khác.
Tại Sao ASR “Một Kích Cỡ Cho Tất Cả” Không Hoạt Động Hiệu Quả Tại Quy Mô Lớn
Hầu hết các doanh nghiệp hiện nay triển khai ASR như một quyết định về cơ sở hạ tầng tĩnh. Một nhà cung cấp được chọn dựa trên điểm chuẩn tổng hợp, sau đó được tích hợp sâu vào các quy trình làm việc. Trong thực tế, điều này tạo ra các điểm mù. Một động cơ có thể hoạt động xuất sắc với giọng nói rõ ràng, sạch sẽ có thể gặp khó khăn với người nói có giọng nói hoặc từ vựng chuyên ngành. Một động cơ khác có thể xử lý tốt âm thanh ồn ào nhưng bỏ lỡ các danh từ riêng hoặc chuỗi số quan trọng cho tuân thủ và hóa đơn.
Việc chuyển đổi nhà cung cấp để giải quyết những khoảng trống này là tốn kém và gây gián đoạn, thường đòi hỏi phải đào tạo lại, xác thực lại và thời gian ngừng hoạt động. Trong khi đó, các mô hình ASR mới và cập nhật được phát hành với tốc độ vượt quá khả năng của hầu hết tổ chức trong việc kiểm tra và áp dụng chúng. Kết quả là tỷ lệ chứa thấp hơn, tóm tắt không chính xác, phân tích yếu hơn và chi phí đảm bảo chất lượng cao hơn – tất cả đều do lỗi chuyển đổi mà có thể đã được tránh.
Kiến Trúc Của QUASAR: Xử Lý ASR Như Một Vấn Đề Động
QUASAR tiếp cận nhận diện giọng nói như một thách thức tối ưu hóa thời gian thực. Mỗi yêu cầu âm thanh đến được đánh giá trước khi chuyển đổi, tính đến các yếu tố như đặc điểm người nói, điều kiện âm thanh và ngữ cảnh lĩnh vực. Dựa trên đánh giá này, hệ thống sẽ routes âm thanh đến ASR engine có khả năng mang lại kết quả chất lượng cao nhất cho tương tác cụ thể đó.
Về mặt kỹ thuật, QUASAR hoạt động như một lớp điều phối có thể làm việc trên các API đám mây thương mại, mô hình tự tổ chức và triển khai ASR tùy chỉnh. Sự trừu tượng này cho phép các doanh nghiệp thử nghiệm với các động cơ mới, cân bằng giữa chi phí và chất lượng, và tránh bị khóa nhà cung cấp lâu dài – tất cả mà không cần thay đổi các ứng dụng hạ nguồn.
Ở lõi là một cơ chế đánh giá và xếp hạng không giám sát, đánh giá các lựa chọn ASR theo thời gian thực. Thay vì chỉ dựa vào giá trị trung bình lịch sử, hệ thống liên tục học hỏi từ điều kiện trực tiếp, cho phép quyết định chuyển đổi thích ứng khi môi trường, người nói và trường hợp sử dụng phát triển.
Hiệu Suất Trên Các Điều Kiện Âm Thanh Thực Tế
Trong các đánh giá nội bộ trên sáu tập dữ liệu chuẩn mực đa dạng – từ giọng nói rõ ràng, sạch sẽ và các bài nói chuyên nghiệp đến âm thanh có giọng, ồn ào và âm thanh tài chính chuyên ngành – QUASAR đã chọn ASR option hoạt động tốt nhất với độ chính xác tổng thể là 88,8%, hoặc lựa chọn hàng đầu khi kết quả gần như ngang nhau. Độ chính xác đạt tới 97% trên giọng nói rõ ràng và vẫn ở mức 79-88% đối với âm thanh thách thức hơn liên quan đến giọng nói, tiếng ồn và từ vựng chuyên ngành.
Những kết quả này nhấn mạnh một nhận xét quan trọng: không có động cơ ASR nào hoạt động nhất quán trên tất cả các kịch bản, nhưng việc định tuyến thông minh có thể tận dụng điểm mạnh của nhiều động cơ.
Kích Hoạt Giọng Nói Như Cơ Sở Hạ Tầng Sống
Bằng cách tách biệt chất lượng nhận diện giọng nói khỏi một nhà cung cấp cố định, QUASAR biến ASR thành những gì aiOla mô tả là “cơ sở hạ tầng sống”. Các doanh nghiệp có được cái nhìn sâu sắc về hiệu suất chuyển đổi tại cấp độ tương tác, cùng với khả năng tối ưu hóa cho độ chính xác, chi phí hoặc độ trễ tùy thuộc vào trường hợp sử dụng.
Cách tiếp cận này cũng đẩy nhanh việc mở rộng sang các khu vực và lĩnh vực mới. Thay vì chờ một nhà cung cấp duy nhất hỗ trợ một ngôn ngữ, giọng nói hoặc từ vựng chuyên ngành, các tổ chức có thể định tuyến lưu lượng đến động cơ phù hợp nhất cho đó thị trường ngày nay – và chuyển đổi khi có các lựa chọn tốt hơn xuất hiện.
Tầm Nhìn Broader Của aiOla Về Các Quy Trình Làm Việc Được Điều Khiển Bởi Giọng Nói
QUASAR xây dựng trên nhiệm vụ rộng lớn hơn của aiOla nhằm biến giọng nói thành giao diện tự nhiên cho các hệ thống doanh nghiệp. Các mô hình được cấp bằng sáng chế của công ty đi vượt ra ngoài nhận diện giọng nói tiêu chuẩn, kết hợp nhận diện giọng nói với trí tuệ quy trình làm việc để chuyển đổi đầu vào giọng nói thành dữ liệu thực thời gian có cấu trúc. Điều này cho phép tự động hóa không cần dùng tay trên các ngành quan trọng nơi nhập dữ liệu thủ công vẫn còn là một điểm nghẽn.
Với sự hỗ trợ từ 58 triệu đô la tiền vốn và một đội ngũ nghiên cứu, aiOla đang định vị giọng nói không chỉ là một phương thức nhập liệu, mà còn là cơ sở hạ tầng cốt lõi cho các hoạt động được điều khiển bởi AI. Với QUASAR, công ty đang mở rộng tầm nhìn này sang lớp ASR chính nó – thách thức những giả định lâu đời về cách nhận diện giọng nói nên được triển khai trên quy mô lớn.
Khi giọng nói trở thành giao diện chính cho các tác nhân AI và hệ thống doanh nghiệp, nhận diện giọng nói động và nhận thức ngữ cảnh có thể chứng minh là thiết yếu. Việc ra mắt QUASAR báo hiệu một sự chuyển đổi từ việc lựa chọn mô hình tĩnh sang điều phối hiệu suất động – một cách tiếp cận có thể thay đổi cách toàn bộ hệ sinh thái AI giọng nói tiêu thụ ASR.












