Model dan platform AI
Fish Audio Mengumpulkan $52M Seed untuk Mengubah Model Suara Terbuka Menjadi Pendapatan

Fish Audio telah mengumpulkan $52 juta dalam putaran seed yang dipimpin oleh Coreline Ventures dan Capital Today, uang yang tiba di perusahaan teks-ke-suara Palo Alto yang telah menghabiskan setahun terakhir dengan memberikan modelnya secara gratis dan mengenakan biaya untuk semua yang ada di sekitarnya. Fish Audio mengatakan lebih dari 8 juta orang sekarang menggunakan model tersebut melalui rilis berat terbuka atau platform hostingnya, dan bisnis tersebut berjalan dengan $21 juta dalam pendapatan berulang tahunan.
Putaran tersebut diungkapkan pada 28 Juli 2026, dengan 359 Capital, pendiri HF0 dan lima dana lainnya bergabung, dan pertama kali dilaporkan oleh TechCrunch. CEO dan co-pendiri Rissa Cao mengatakan perusahaan telah berjalan dengan cukup efisien pada distribusi sumber terbuka dan langganan pembuat sehingga tidak memerlukan modal luar, dan pergi untuk mendanai model yang lebih maju dan dorongan ke akun perusahaan. Putaran $52 juta yang masih membawa label seed, di perusahaan dengan pendapatan berulang delapan angka, menandai seberapa cepat suara bergerak dari fitur produk ke item infrastruktur.
Dari Berat Terbuka ke API Gratis
Perusahaan dimulai sebagai proyek sampingan oleh Shijia Liao, seorang peneliti Nvidia (NVDA ) yang sebelumnya melatih model suara pada satu GPU dan menerbitkannya. Repositori tersebut, Fish Speech, sekarang membawa lebih dari 31.000 bintang dan pengikut di antara pengembang indie dan studio game. Liao adalah ilmuwan utama Fish Audio, dan lima model telah dikirim dalam waktu sekitar satu tahun: empat generator suara dan satu sistem teks-ke-suara.
Tiga dari generator suara tersebut ada di luar. Fish Audio menerbitkan berat S2 pada 9 Maret 2026, bersama dengan kode fine-tuning dan mesin inferensi streaming. S2 adalah model 4-miliar-parameter yang dilatih pada lebih dari 10 juta jam audio di lebih dari 80 bahasa, yang diarahkan oleh tag bebas seperti [whisper] atau [professional broadcast tone] yang dimasukkan secara inline pada tingkat kata. Perusahaan tersebut menghitung lebih dari 15.000 kontrol tersebut.
Model terbaru, S2.1 Pro, adalah yang mereka tahan dari rilis terbuka, dan bahkan itu saat ini gratis melalui API: tidak ada batas karakter yang keras, 83 bahasa dan tidak ada jaminan tingkat layanan, dengan jendela gratis diperpanjang hingga 31 Agustus 2026. Rencana berbayar membawa komitmen latensi dan waktu aktif, dan perusahaan meminta produk di atas $1 juta dalam ARR untuk berbicara dengan mereka sebelum membangun di tingkat gratis. Fish Audio mengkreditkan tumpukan inferensi yang dibangun kembali, termasuk perpustakaan kernel GPU FP8 miliknya, untuk membuat pemberian tersebut terjangkau, dan melaporkan sekitar 70 milidetik ke audio pertama pada satu permintaan.
Itulah logika komersial bisnis. Berat terbuka dan model perbatasan gratis membeli distribusi di antara pengembang; pendapatan berasal dari perusahaan yang memerlukan latensi kontraktual. Fish Audio mengatakan pelanggan perusahaan termasuk HeyGen, Livekit, Retell, Sanas dan OpenArt sudah berjalan di API-nya, dan Cao menggambarkan permintaan yang terbagi oleh kasus penggunaan: produk avatar menginginkan realisme, studio game menginginkan suara karakter ekspresif, dan perusahaan agen suara menginginkan latensi rendah yang masih terdengar manusiawi. Segmen terakhir adalah yang bergerak paling cepat, karena asisten utama menambahkan antarmuka yang diucapkan — Anthropic membawa Opus dan Sonnet-nya ke mode suara Claude pada Juli 2026 — dan karena studio yang lebih kecil mengejar niche yang sama, termasuk Tryll Engine dengan dialog game pada perangkat.
Siapa yang Menulis Cek
Dua pemimpin tersebut adalah pasangan yang tidak biasa untuk perusahaan pengembang AS. Coreline Ventures adalah dana lintas batas kecil yang dipisahkan dari DCM Ventures, menulis cek awal di seluruh AS, Jepang dan Korea dari portofolio yang sengaja kompak yang sudah termasuk laboratorium suara generatif Jepang. Capital Today adalah waralaba internet konsumen Tiongkok yang didirikan Kathy Xu pada 2005, dengan JD.com (JD ), Meituan, ByteDance dan Moonshot AI di antara pegangan dan dana abadi sekitar $2,8 miliar. 359 Capital, yang dipisahkan dari Sapphire Ventures pada November 2025 dengan sekitar $300 juta di bawah manajemen, berinvestasi pada bisnis yang terkait konsumen. Uang konsumen, dengan kata lain, mendukung API pengembang, dengan teori bahwa perpustakaan suara komunitas adalah aset yang tahan lama.
Osuke Honda, co-pendiri dan mitra manajemen Coreline, menempatkan kondisi pada teori tersebut. “Pendekatan yang berfokus pada komunitas hanya dapat menjadi keunggulan yang tahan lama jika pembuat mempercayai platform,” katanya dalam wawancara yang sama. “Itu berarti persetujuan, transparansi, dan atribusi harus dibangun ke dalam produk daripada dianggap sebagai hal yang tidak penting.”
Perpustakaan tersebut disediakan oleh pengguna. Fish Audio meminta orang untuk mengirimkan suara mereka sendiri untuk pelatihan dan membayar mereka ketika suara digunakan, dan perpustakaan publik sekarang memegang lebih dari dua juta suara. Model tersebut menarik keluhan sebelumnya pada 2026, ketika pembuat mengatakan suara telah diunggah tanpa persetujuan mereka dan bahwa penghapusan bergerak lambat. Pada 4 Juli 2026 perusahaan mendokumentasikan proses sengketa kepemilikan suara yang menggantikan antrian dukungan umum: pengaju mengajukan dari halaman model, mengirimkan ID pemerintah atau otorisasi perusahaan, dan membaca kalimat verifikasi dengan suara keras. Cao mengatakan penghapusan sekarang selesai dalam waktu kurang dari tiga menit.
Apa yang Dikirim Berikutnya
Dua model lagi ada di peta jalan: sistem pemahaman audio yang diharapkan perusahaan tahun ini, dan model suara-ke-suara yang masih dalam pengembangan. Keduanya bertujuan pada tumpukan agen suara daripada narasi satu arah. Generasi suara sudah menjadi pasar yang padat, dengan ElevenLabs, Cartesia, Speechify dan Krisp menjual ke dalam himpunan pembuat dan pengembang yang tumpang tindih. Penggalangan dana sebesar ini tidak lagi merupakan pengecualian seperti yang pernah terjadi dua tahun yang lalu; Enigma membuka seed $71 juta untuk antarmuka robot lebih awal pada Juli 2026. Ujian yang lebih dekat untuk Fish Audio adalah komersial: jendela gratis S2.1 Pro ditutup pada akhir Agustus 2026, dan modal baru harus mengubah pengembang yang mereka tarik ke dalam kontrak perusahaan. menjadi uji coba yang lebih dekat untuk Fish Audio adalah komersial: jendela gratis S2.1 Pro ditutup pada akhir Agustus 2026, dan modal baru harus mengubah pengembang yang mereka tarik ke dalam kontrak perusahaan.












