Mô hình và nền tảng AI

Fish Audio Nhận 52 Triệu Đô La Mỹ Vòng Vốn Hạt Giống Để Chuyển Đổi Mô Hình Giọng Nói Mở thành Doanh Thu

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Fish Audio đã huy động được 52 triệu đô la Mỹ trong một vòng vốn hạt giống do Coreline Ventures và Capital Today đồng dẫn đầu, tiền mà đến với một công ty Palo Alto về chuyển đổi văn bản thành giọng nói đã dành cả năm qua để đưa mô hình của mình miễn phí và thu phí cho mọi thứ xung quanh. Fish Audio cho biết hơn 8 triệu người hiện đang sử dụng những mô hình này thông qua các bản phát hành trọng lượng mở hoặc nền tảng lưu trữ của công ty, và doanh nghiệp đang hoạt động với 21 triệu đô la doanh thu hàng năm.

Vòng vốn này được công bố vào ngày 28 tháng 7 năm 2026, với sự tham gia của 359 Capital, chương trình cư trú của người sáng lập HF0 và năm quỹ khác, và được báo cáo lần đầu bởi TechCrunch. CEO và đồng sáng lập Rissa Cao cho biết công ty đã hoạt động hiệu quả đủ trên phân phối mã nguồn mở và đăng ký của nhà tạo nội dung mà không cần vốn ngoài, và đã đi ra ngoài để tài trợ cho các mô hình tiên tiến hơn và một nỗ lực vào các tài khoản doanh nghiệp. Một vòng vốn 52 triệu đô la vẫn mang nhãn hiệu hạt giống, tại một công ty có doanh thu hàng năm là tám chữ số, đánh dấu tốc độ nhanh chóng mà giọng nói đã chuyển từ một tính năng sản phẩm sang một mục dòng cơ sở hạ tầng.

Từ trọng lượng mở đến API miễn phí

Công ty bắt đầu như một dự án phụ của Shijia Liao, một nhà nghiên cứu cũ của Nvidia (NVDA ) đã đào tạo một mô hình giọng nói trên một GPU duy nhất và xuất bản nó. Kho lưu trữ đó, Fish Speech, hiện có hơn 31.000 ngôi sao và một cộng đồng trong số các nhà phát triển độc lập và các xưởng trò chơi. Liao là nhà khoa học trưởng của Fish Audio, và năm mô hình đã được vận chuyển trong khoảng một năm: bốn bộ tạo giọng nói và một hệ thống chuyển đổi giọng nói thành văn bản.

Ba trong số các bộ tạo giọng nói đang được mở. Fish Audio đã xuất bản trọng lượng của S2 vào ngày 9 tháng 3 năm 2026, cùng với mã tinh chỉnh và một động cơ suy luận trực tuyến. S2 là một mô hình 4 tỷ tham số được đào tạo trên hơn 10 triệu giờ âm thanh trên khoảng 80 ngôn ngữ, được điều khiển bởi các thẻ tự do như [whisper] hoặc [professional broadcast tone] được thả trực tuyến ở cấp độ từ. Công ty tính hơn 15.000 điều khiển như vậy.

Mô hình mới nhất, S2.1 Pro, là mô hình mà nó giữ lại từ bản phát hành mở, và thậm chí mô hình đó hiện đang miễn phí qua API: không có giới hạn ký tự cứng, 83 ngôn ngữ và không có bảo đảm cấp độ dịch vụ, với cửa sổ miễn phí được kéo dài đến ngày 31 tháng 8 năm 2026. Các kế hoạch trả phí mang theo các cam kết độ trễ và thời gian hoạt động, và công ty yêu cầu các sản phẩm trên 1 triệu đô la doanh thu hàng năm phải nói chuyện với nó trước khi xây dựng trên tầng miễn phí. Fish Audio tín nhiệm một ngăn xếp suy luận được xây dựng lại, bao gồm cả thư viện hạt nhân GPU FP8 của riêng nó, để làm cho việc cho đi đó có thể chấp nhận được, và báo cáo khoảng 70 mili giây để âm thanh đầu tiên trên một yêu cầu.

Đó là logic thương mại của doanh nghiệp. Trọng lượng mở và mô hình tiền phong miễn phí mua phân phối giữa các nhà phát triển; doanh thu đến từ các công ty cần độ trễ theo hợp đồng. Fish Audio cho biết khách hàng doanh nghiệp bao gồm HeyGen, Livekit, Retell, Sanas và OpenArt đã chạy trên các API của nó, và Cao mô tả nhu cầu chia theo trường hợp sử dụng: sản phẩm hình đại diện muốn tính thực, xưởng trò chơi muốn giọng nói nhân vật biểu cảm, và công ty đại lý giọng nói muốn độ trễ thấp mà vẫn nghe giống con người. Đoạn cuối cùng là đoạn di chuyển nhanh nhất, khi các trợ lý chính thống thêm giao diện nói — Anthropic đã đưa mô hình Opus và Sonnet của nó vào chế độ giọng nói của Claude vào tháng 7 năm 2026 — và khi các xưởng nhỏ hơn theo đuổi cùng một niều, bao gồm Tryll Engine với đối thoại trò chơi trên thiết bị.

Ai đã viết séc

Hai nhà lãnh đạo là một sự kết hợp không thường thấy cho một công ty công cụ phát triển của Mỹ. Coreline Ventures là một quỹ chéo biên giới nhỏ được tách ra từ DCM Ventures, viết séc sớm trên khắp Mỹ, Nhật Bản và Hàn Quốc từ một danh mục đầu tư có chủ ý nhỏ gọn đã bao gồm một phòng thí nghiệm giọng nói tạo sinh của Nhật Bản. Capital Today là nhượng quyền thương mại tiêu dùng của Trung Quốc mà Kathy Xu thành lập vào năm 2005, với JD.com (JD ), Meituan, ByteDance và Moonshot AI trong số các khoản nắm giữ của nó và một quỹ vĩnh cửu khoảng 2,8 tỷ đô la. 359 Capital, đã tách ra từ Sapphire Ventures vào tháng 11 năm 2025 với khoảng 300 triệu đô la dưới quản lý, đầu tư vào các doanh nghiệp tiêu dùng và các doanh nghiệp liền kề với tiêu dùng. Tiền tiêu dùng,换句话说, đang hỗ trợ một API cho nhà phát triển, dựa trên lý thuyết rằng thư viện giọng nói của cộng đồng là tài sản bền vững.

Osuke Honda, đồng sáng lập và đối tác quản lý của Coreline, đã đặt một điều kiện cho lý thuyết đó. “Một cách tiếp cận lấy cộng đồng làm trung tâm chỉ có thể trở thành một lợi thế bền vững nếu các nhà tạo nội dung tin tưởng nền tảng,” ông nói trong cùng một cuộc phỏng vấn. “Điều đó có nghĩa là sự đồng ý, minh bạch và ghi nhận phải được tích hợp vào sản phẩm chứ không phải được coi là những suy nghĩ sau này.”

Thư viện được cung cấp bởi người dùng. Fish Audio yêu cầu mọi người gửi giọng nói của họ để đào tạo và trả tiền cho họ khi một giọng nói được sử dụng, và thư viện công cộng hiện có hơn hai triệu giọng nói. Mô hình đó đã thu hút các khiếu nại sớm hơn vào năm 2026, khi các nhà tạo nội dung cho biết giọng nói đã được tải lên mà không có sự đồng ý của họ và việc gỡ bỏ di chuyển chậm. Vào ngày 4 tháng 7 năm 2026, công ty đã ghi lại một quy trình tranh chấp quyền sở hữu giọng nói dành riêng thay thế hàng đợi hỗ trợ chung: người khiếu nại nộp từ trang mô hình, gửi giấy tờ tùy thân chính phủ hoặc ủy quyền công ty, và đọc một câu xác minh to. Cao cho biết việc xóa bỏ hiện hoàn thành trong dưới ba phút.

Cái gì sẽ được vận chuyển tiếp theo

Hai mô hình nữa đang trên đường đi: một hệ thống hiểu âm thanh mà công ty dự kiến sẽ ra mắt trong năm nay, và một mô hình giọng nói sang giọng nói vẫn đang được phát triển. Cả hai đều nhắm vào ngăn xếp đại lý giọng nói chứ không phải là tường thuật một chiều. Việc tạo giọng nói đã là một thị trường đông đúc, với ElevenLabs, Cartesia, Speechify và Krisp bán vào các tập hợp chồng chéo của các nhà tạo nội dung và nhà phát triển. Một vòng vốn này không còn là ngoại lệ như nó đã từng hai năm trước; Enigma đã mở một vòng vốn hạt giống 71 triệu đô la cho các giao diện robot sớm hơn vào tháng 7 năm 2026. Bài kiểm tra gần hơn cho Fish Audio là thương mại: cửa sổ miễn phí S2.1 Pro sẽ đóng vào cuối tháng 8 năm 2026, và vốn mới phải chuyển đổi các nhà phát triển mà nó thu hút thành các hợp đồng doanh nghiệp. vào thời điểm gần hơn để kiểm tra Fish Audio là thương mại: cửa sổ miễn phí S2.1 Pro sẽ đóng vào cuối tháng 8 năm 2026, và vốn mới phải chuyển đổi các nhà phát triển mà nó thu hút thành các hợp đồng doanh nghiệp. ger the outlier it would have been two years ago; Enigma opened a $71 million seed for robot interfaces earlier in tháng 7 2026. The nearer test for Fish Audio is commercial: the free S2.1 Pro window closes at the end of tháng 8 2026, and the new capital has to convert the developers it attracted into enterprise contracts.

Evan Mercer là một phóng viên được tạo bởi AI tại Unite.AI, chuyên về các công ty khởi nghiệp AI, vốn đầu tư mạo hiểm và động lực tài trợ định hình thế hệ công nghệ tiếp theo. Các báo cáo của ông tập trung vào sự đổi mới giai đoạn đầu, dòng vốn và quyết định chiến lược mà các nhà sáng lập và nhà đầu tư đưa ra khi các công ty AI mở rộng từ khái niệm đến tác động toàn cầu.
Với một ống kính chiến lược và phân tích, Evan kiểm tra các vòng tài trợ, định vị thị trường và xu hướng mới nổi trên hệ sinh thái khởi nghiệp AI. Ông theo dõi cách vốn đầu tư mạo hiểm, đầu tư doanh nghiệp và thị trường công khai giao nhau với những đột phá trong trí tuệ nhân tạo, tách biệt tín hiệu bền vững khỏi sự cường điệu ngắn hạn.
Các bài viết được viết bởi Evan Mercer được tạo bởi AI và được xem xét bởi nhóm biên tập của Unite.AI để đảm bảo độ chính xác, ngữ cảnh và phạm vi bảo vệ có trách nhiệm của toàn cảnh đầu tư AI toàn cầu