Gọi vốn

Modulate huy động $25M để xây dựng lớp trí tuệ cho AI giọng nói

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Modulate đã huy động $25 million trong vòng gọi vốn mới khi công ty có trụ sở tại Boston muốn tận dụng một thách thức ngày càng tăng trong trí tuệ nhân tạo: dạy máy móc hiểu không chỉ những gì con người nói, mà còn cách họ nói.

Future Ventures dẫn đầu vòng gọi vốn, với sự tham gia của Hyperplane và Lakestar. Khoản tài trợ này đưa tổng vốn huy động của Modulate lên $60 million và sẽ được dùng để mở rộng nghiên cứu AI, các đội kỹ thuật, công cụ cho nhà phát triển, quan hệ đối tác và các tùy chọn triển khai.

Khoản đầu tư này xuất hiện khi giọng nói ngày càng trở thành giao diện cho các tác nhân AI, nền tảng dịch vụ khách hàng, môi trường trò chơi và hệ thống an ninh. Mặc dù công nghệ chuyển giọng nói thành văn bản đã cải thiện đáng kể, Modulate tin rằng chỉ có bản sao chép văn bản sẽ bỏ lỡ nhiều thông tin chứa trong lời nói của con người.

Công nghệ của họ thay vào đó phân tích âm thanh nền để phát hiện các tín hiệu như cảm xúc, tông giọng, ý định, khoảng dừng, giọng nói tổng hợp và hành vi hội thoại.

Vượt ra ngoài Chuyển Đổi Giọng Nói thành Văn Bản

Phần lớn hệ thống AI giọng nói hiện nay tuân theo một kiến trúc tương đối đơn giản: chuyển đổi giọng nói thành văn bản và sau đó gửi bản sao chép kết quả tới một mô hình ngôn ngữ lớn (LLM).

Cách này hoạt động tốt khi các từ ngữ tự chúng chứa hầu hết thông tin liên quan. Tuy nhiên, nó trở nên hạn chế khi ý nghĩa phụ thuộc vào sự mỉa mai, bực bội, do dự, căng thẳng, gián đoạn hoặc thay đổi tông giọng.

Modulate đã xây dựng nền tảng hàng đầu Velma dựa trên ý tưởng rằng các tín hiệu này nên được phân tích trực tiếp từ âm thanh thay vì được tái tạo sau này từ bản sao chép.

Công ty mô tả Velma là một hệ thống trí tuệ hội thoại gốc âm thanh, có khả năng tạo bản sao chép đồng thời nhận dạng người nói, cảm xúc, chủ đề hội thoại, cảm nhận và hơn 150 hành vi. Các nhà phát triển cũng có thể định nghĩa các hành vi tùy chỉnh bằng mô tả ngôn ngữ tự nhiên.

Điều này mở ra các ứng dụng từ việc xác định khách hàng bực bội trước khi cuộc gọi xấu đi, đến phát hiện hành vi đáng ngờ trong giao dịch tài chính hoặc nhận ra khi một tác nhân AI giọng nói hoạt động không như mong đợi.

Vào tháng 6, Modulate đã mở Velma trực tiếp cho các nhà phát triển thông qua một API, mở rộng quyền truy cập vượt ra ngoài các triển khai doanh nghiệp trước đây.

Modulate đang áp dụng cách tiếp cận Ensemble cho AI âm thanh

Kiến trúc phía dưới Velma là thứ mà Modulate gọi là Ensemble Listening Model, hay ELM.

Thay vì sử dụng một mô hình khổng lồ để thực hiện mọi nhiệm vụ, ELM điều phối hơn 100 mô hình chuyên biệt, với các thành phần riêng lẻ phân tích các đặc điểm khác nhau của luồng âm thanh.

Các mô hình này có thể kiểm tra các thuộc tính cơ bản như thay đổi người nói và khoảng dừng cùng với các tín hiệu cấp cao hơn như cảm xúc, ý định được nhận thức, dấu hiệu giọng nói tổng hợp, sự bối rối hoặc các mẫu hành vi. Một lớp điều phối sau đó kết hợp các quan sát này thành một diễn giải rộng hơn về cuộc hội thoại.

Đây là một triết lý đáng chú ý khác biệt so với chiến lược ngày càng phổ biến là áp dụng các mô hình nền tảng đa phương tiện ngày càng lớn lên cho âm thanh.

Modulate cho rằng việc chuyên môn hoá cho phép kiến trúc của họ cung cấp các kết quả minh bạch hơn đồng thời giảm lượng tính toán cần thiết. Đối với các ứng dụng doanh nghiệp như phát hiện gian lận và tuân thủ, khả năng hiểu lý do tại sao một hệ thống đưa ra cảnh báo có thể gần như quan trọng như chính cảnh báo đó.

Theo công ty, phương pháp này có thể hiệu quả về tính toán gấp tới 1.000 lần so với việc sử dụng một mô hình lớn duy nhất cho một số khối lượng công việc phân tích âm thanh.

AI Giọng Nói Tạo Ra Vấn Đề Giám Sát Mới

Thời điểm của khoản tài trợ cũng phản ánh một sự chuyển đổi rộng hơn đang diễn ra trong AI doanh nghiệp.

Các hệ thống AI ngày càng có khả năng thực hiện các cuộc hội thoại giọng nói hoàn chỉnh với khách hàng. Điều đó có nghĩa là các công ty hiện phải giám sát các tương tác không chỉ bao gồm nhân viên con người mà còn các tác nhân tự động hoạt động trên hàng nghìn hoặc thậm chí hàng triệu cuộc hội thoại.

Một tác nhân giọng nói có thể về mặt kỹ thuật tuân theo kịch bản nhưng vẫn thường xuyên cắt ngang khách hàng, không nhận ra sự bực bội, hiểu sai ý định, hoặc phản hồi kém trong các tình huống cảm xúc.

Modulate nhìn thấy cơ hội trở thành một lớp lắng nghe độc lập nằm bên cạnh các tác nhân đó.

Công nghệ tác nhân giọng nói của họ được thiết kế để nhận diện các tín hiệu như gián đoạn, khoảng dừng, cảm xúc, giọng địa phương và các đặc điểm khác khó nắm bắt chỉ từ văn bản, cho phép các nhà phát triển điều chỉnh hành vi của tác nhân trong khi cuộc hội thoại vẫn đang diễn ra.

Cơ sở hạ tầng tương tự có thể được áp dụng cho các cuộc hội thoại của con người, nơi các tổ chức cần xác định gian lận, rủi ro tuân thủ, quấy rối hoặc các sự kiện tiềm năng quan trọng khác trong thời gian thực.

Từ Kiểm Duyệt Trò Chơi Đến Trí Tuệ Giọng Nói Rộng Hơn

Mục tiêu hiện tại của Modulate đại diện cho một sự mở rộng đáng kể so với việc tập trung trước đây vào trò chơi trực tuyến.

Một trong những sản phẩm nổi tiếng nhất của họ, ToxMod, được phát triển để phân tích các cuộc giao tiếp bằng giọng nói trực tiếp trên các nền tảng trò chơi và xã hội, và xác định các hành vi quấy rối, đe dọa, lạm dụng, cùng các hành vi gây hại khác.

Điều đó vẫn là một phần quan trọng của doanh nghiệp. Modulate cho biết ToxMod có thể tích hợp trực tiếp với hạ tầng giọng nói hiện có, đồng thời chuyển các tương tác có khả năng gây vấn đề tới hệ thống kiểm duyệt hoặc người xem xét.

Công ty đã hợp tác với các công ty game lớn bao gồm Activision, Riot Games, Rockstar Games và Rec Room.

Tuy nhiên, công nghệ nền tảng cần thiết để hiểu độc hại trong một trò chơi đa người chơi cũng có thể được điều chỉnh cho các môi trường khác, nơi ngữ cảnh quan trọng.

Modulate hiện đang định vị công nghệ của mình trong các lĩnh vực phòng ngừa gian lận, trung tâm liên hệ, giám sát AI-agent, phát hiện deepfake, trải nghiệm khách hàng, và an toàn, tin cậy.

Nền tảng dành cho nhà phát triển của họ hiện cung cấp nhiều họ mô hình, bao gồm chuyển đổi giọng nói thành văn bản, phát hiện deepfake, che giấu âm thanh, trí tuệ hội thoại, và các khả năng phân tích âm thanh khác.

Deepfake mang lại một lý do khác để hiểu âm thanh một cách trực tiếp

Giọng nói tổng hợp đang trở thành một phần quan trọng khác của cơ hội đó.

Khi công nghệ sao chép giọng nói ngày càng thuyết phục trở nên khả dụng, các tổ chức xử lý giao dịch tài chính hoặc thông tin nhạy cảm cần xác định không chỉ nội dung người gọi nói gì mà còn liệu giọng nói đó có xác thực hay không.

Do đó, Modulate đã mở rộng sang phát hiện deepfake, kết hợp phân tích giọng nói tổng hợp với thông tin ngữ cảnh rộng hơn mà các mô hình âm thanh của họ cung cấp.

Công ty cho biết công nghệ của họ hiện đang phân tích hơn 10 triệu giờ âm thanh mỗi tháng và đã xử lý hơn 600 triệu giờ tổng cộng.

Việc mở rộng sang các lĩnh vực như phát hiện âm nhạc do AI tạo ra cũng cho thấy kiến trúc tập hợp nền tảng có thể được áp dụng rộng rãi như thế nào. Ví dụ, hệ thống phát hiện âm nhạc của Modulate đánh giá riêng biệt sự hiện diện của âm nhạc, giọng hát do AI tạo và nhạc cụ do AI tạo trước khi kết hợp các tín hiệu lại thành một kết quả có thể giải thích được.

Thách thức tiếp theo cho AI giọng nói là hiểu, không chỉ nói

Khoản đầu tư 25 triệu đô la mang lại cho Modulate nguồn lực bổ sung để mở rộng nghiên cứu, kỹ thuật, công cụ cho nhà phát triển và các mối quan hệ đối tác. Nói chung, nó phản ánh một thách thức ngày càng tăng cho AI giọng nói: nói một cách tự nhiên chỉ là một nửa của cuộc trò chuyện.

Khi các trợ lý giọng nói chuyển sang dịch vụ khách hàng, y tế, dịch vụ tài chính và các lĩnh vực khác, các hệ thống sẽ cần hiểu các tín hiệu mà bản ghi lại thường bỏ sót, bao gồm sự bực bội, do dự, nhấn mạnh, giọng điệu và khả năng có giọng nói tổng hợp.

Điều đó có thể tạo ra một lớp trí tuệ mới quanh các tương tác giọng nói, giúp hệ thống phát hiện gian lận, nhận ra khi khách hàng không hài lòng, hoặc xác định khi một AI-agent hiểu sai hoặc xử lý không đúng một cuộc trò chuyện.

Tuy nhiên, công nghệ này cũng đặt ra các câu hỏi về quyền riêng tư, độ chính xác và thiên vị. Việc suy luận cảm xúc hoặc ý định từ giọng nói mang tính chủ quan hơn so với việc chuyển đổi từ ngữ, đặc biệt là qua các giọng địa phương, ngôn ngữ và văn hoá khác nhau.

Khi AI ngày càng có khả năng nói giống con người, ranh giới tiếp theo có thể là xác định máy móc thực sự nghe tốt đến mức nào — và những khả năng đó được sử dụng một cách có trách nhiệm như thế nào.

Antoine là một nhà lãnh đạo có tầm nhìn và là đối tác sáng lập của Unite.AI, được thúc đẩy bởi niềm đam mê không ngừng nghỉ để định hình và quảng bá tương lai của AI và robot. Là một doanh nhân hàng loạt, ông tin rằng AI sẽ gây ra sự gián đoạn cho xã hội giống như điện, và thường được bắt gặp khi nói về tiềm năng của các công nghệ phá vỡ và AGI.

Là một nhà tương lai học, ông dành để khám phá cách những đổi mới này sẽ định hình thế giới của chúng ta. Ngoài ra, ông là người sáng lập của Securities.io, một nền tảng tập trung vào đầu tư vào các công nghệ tiên tiến đang định nghĩa lại tương lai và thay đổi toàn bộ lĩnh vực.