Μοντέλα και πλατφόρμες AI
Η Fish Audio συγκεντρώνει 52 εκατ. δολάρια για να μετατρέψει τα ανοιχτά μοντέλα φωνής σε έσοδο

Η Fish Audio έχει συγκεντρώσει 52 εκατ. δολάρια σε μια στροφή σπόρου που συνήψαν οι Coreline Ventures και Capital Today, χρήματα που έφτασαν σε μια εταιρεία text-to-speech στο Palo Alto που έχει περάσει το τελευταίο χρόνο δωρεάν τα μοντέλα της και χρεώνει για όλα γύρω από αυτά. Η Fish Audio λέει ότι περισσότεροι από 8 εκατ. άνθρωποι χρησιμοποιούν αυτά τα μοντέλα μέσω των ανοιχτών weight releases ή της φιλοξενουμένης πλατφόρμας της, και ότι η επιχείρηση λειτουργεί με 21 εκατ. δολάρια ετήσιου ανακυκλοφορητού εσόδου.
Η στροφή ανακοινώθηκε στις 28 Ιουλίου 2026, με την 359 Capital, την HF0 founder residency και πέντε άλλους фонδους που προσχώρησαν, και ήταν πρώτη αναφορά από το TechCrunch. Ο CEO και συνιδρυτής Rissa Cao είπε ότι η εταιρεία λειτουργούσε αποτελεσματικά με την ανοικτή πηγή και τις συνδρομές δημιουργών, ώστε να μην χρειαζόταν εξωτερικό κεφάλαιο, και έβγαλε έξω για να χρηματοδοτήσει πιο προηγμένα μοντέλα και μια ώθηση στις επιχειρηματικές λογαριασμούς. Μια στροφή 52 εκατ. δολαρίων που vẫn φέρει την ετικέτα σπόρου, σε μια εταιρεία με οκτώ ψηφία ανακυκλοφορητού εσόδου, σηματοδοτεί πόσο γρήγορα η φωνή μετακινήθηκε από μια λειτουργία προϊόντος σε μια γραμμή υποδομής.
Από ανοιχτά βάρη σε δωρεάν API
Η εταιρεία ξεκίνησε ως ένα πλάγιο έργο από τον Shijia Liao, einem πρώην ερευνητή της Nvidia (NVDA ) που εκπαίδευσε ένα μοντέλο ομιλίας σε ένα μόνο GPU και το δημοσίευσε. Αυτό το αποθετήριο, Fish Speech, τώρα φέρει περισσότερα από 31.000 αστέρια και μια ακολούθια μεταξύ ανεξάρτητων dévelopers και στούντιο παιχνιδιών. Ο Liao είναι ο αρχισcientist της Fish Audio, και πέντε μοντέλα έχουν αποσταλεί σε περίπου ένα χρόνο: τέσσερις γεννήτορες ομιλίας και ένα σύστημα ομιλίας-σε-κείμενο.
Τρία από τους γεννήτορες ομιλίας είναι έξω στο ανοιχτό. Η Fish Audio δημοσίευσε τα βάρη του S2 στις 9 Μαρτίου 2026, μαζί με τον κώδικα fine-tuning και einen streaming inference engine. Το S2 είναι ένα μοντέλο 4 δισεκατομμυρίων παραμέτρων που εκπαιδεύτηκε σε περισσότερες από 10 εκατ. ώρες ήχου σε περίπου 80 γλώσσες, κατευθυνόμενο από ελεύθερες ετικέτες όπως [whisper] ή [professional broadcast tone] που τοποθετούνται στο επίπεδο του λόγου. Η εταιρεία μετράει περισσότερα από 15.000 από αυτά τα ελέγχους.
Το νεότερο μοντέλο, S2.1 Pro, είναι αυτό που κρατάει πίσω από την ανοιχτή κυκλοφορία, και ακόμη και αυτό είναι τώρα δωρεάν μέσω του API: χωρίς σκληρό όριο χαρακτήρων, 83 γλώσσες και keine υπηρεσιακή εγγύηση, με το δωρεάν παράθυρο να επεκτείνεται μέχρι τις 31 Αυγούστου 2026. Τα πληρωμένα σχέδια φέρουν τις δεσμεύσεις καθυστέρησης και uptime, και η εταιρεία ζητά από τα προϊόντα πάνω από 1 εκατ. δολάρια σε ετήσιο ανακυκλοφορητό έσοδο να μιλήσουν μαζί της πριν να χτίσουν πάνω στο δωρεάν επίπεδο. Η Fish Audio πιστώνει μια ξαναχτισμένη inference στοίβα, συμπεριλαμβανομένης της δικής της FP8 GPU βιβλιοθήκης, για να κάνει αυτή τη δωρεάν δώρο οικονομικά βιώσιμο, και αναφέρει περίπου 70 χιλιοστά του δευτερολέπτου στο πρώτο ήχο σε μια đơnική αίτηση.
Αυτή είναι η εμπορική λογική της επιχείρησης. Ανοιχτά βάρη και ένα δωρεάν μοντέλο αγοράς αγοράζουν διανομή μεταξύ των dévelopers· το έσοδο έρχεται από τις εταιρείες που χρειάζονται συμβατικές καθυστερήσεις. Η Fish Audio λέει ότι επιχειρηματικοί πελάτες συμπεριλαμβανομένων των HeyGen, Livekit, Retell, Sanas και OpenArt ήδη τρέχουν πάνω στα API της, και ο Cao περιγράφει την ζήτηση που χωρίζεται ανάλογα με την περίπτωση χρήσης: τα προϊόντα avatar θέλουν ρεαλισμό, τα στούντιο παιχνιδιών θέλουν εκφραστικές φωνές χαρακτήρων, και οι εταιρείες φωνητικών एजέντων θέλουν χαμηλή καθυστέρηση που ακόμη ακούγεται ανθρώπινη. Αυτό το τελευταίο τμήμα είναι αυτό που κινείται ταχύτερα, καθώς οι mainstream βοηθοί προσθέτουν φωνητικές διεπαφές — Anthropic έφερε τα Opus και Sonnet μοντέλα στο Claude’s φωνητικό τρόπο τον Ιούλιο του 2026 — και καθώς μικρότερα στούντιο κυνηγούν την ίδια νίχη, συμπεριλαμβανομένων Tryll Engine με on-device παιχνίδι διαλόγου.
Ποιος έγραψε τις επιταγές
Οι δύο αρχηγοί είναι ένα ασυνήθιστο ζευγάρι για μια εταιρεία developer-tools στις ΗΠΑ. Η Coreline Ventures είναι ένας μικρός διασυνοριακός φόρος που ξεπήδησε από την DCM Ventures, γράφοντας πρώιμες επιταγές στις ΗΠΑ, την Ιαπωνία και τη Κορέα από ένα σκόπιμα συμπαγές χαρτοφυλάκιο που ήδη περιλαμβάνει ένα ιαπωνικό εργαστήριο γενετικής φωνής. Η Capital Today είναι η κινεζική franchise καταναλωτικών internet που ιδρύθηκε από τον Kathy Xu το 2005, με JD.com (JD ), Meituan, ByteDance και Moonshot AI μεταξύ των participations της και ένα evergreen fund περίπου 2,8 δισεκατομμυρίων δολαρίων. Η 359 Capital, η οποία分离 από την Sapphire Ventures τον Νοέμβριο του 2025 με περίπου 300 εκατ. δολάρια υπό διαχείριση, επενδύει σε καταναλωτικές και καταναλωτικές επιχειρήσεις. Καταναλωτικά χρήματα, με άλλα λόγια, υποστηρίζοντας μια developer API, με την θεωρία ότι η βιβλιοθήκη φωνής της κοινότητας είναι το ανθεκτικό περιουσιακό στοιχείο.
Ο Osuke Honda, συνιδρυτής και managing partner της Coreline, έθεσε μια προϋπόθεση σε αυτή τη θεωρία. “Μια κοινότητα-κεντρική προσέγγιση μπορεί να γίνει ένα ανθεκτικό πλεονέκτημα μόνο αν οι δημιουργοί εμπιστεύονται την πλατφόρμα”, είπε στην ίδια συνέντευξη. “Αυτό σημαίνει ότι η συναίνεση, η διαφάνεια και η αναφορά πρέπει να χτιστούν στο προϊόν και όχι να αντιμετωπίζονται ως μεταγενέστερα.”
Η βιβλιοθήκη είναι προμήθεια χρήστη. Η Fish Audio ζητά από τους ανθρώπους να υποβάλουν τις δικές τους φωνές για εκπαίδευση και τις πληρώνει όταν μια φωνή χρησιμοποιείται, και η δημόσια βιβλιοθήκη τώρα περιέχει περισσότερες από δύο εκατ. φωνές. Αυτό το μοντέλο drew complaints νωρίτερα στο 2026, όταν οι δημιουργοί είπαν ότι φωνές είχαν ανεβεί χωρίς τη συναίνεσή τους και ότι οι λήψεις κινήθηκαν αργά. Στις 4 Ιουλίου 2026 η εταιρεία έγγραφσε μια αφιερωμένη διαδικασία διένεξης ιδιοκτησίας φωνής που αντικαθιστά την γενική ουρά υποστήριξης: οι αιτούντες αρχειοθετούν από τη σελίδα του μοντέλου, υποβάλλουν κυβερνητική ταυτότητα ή εταιρική εξουσιοδότηση, και διαβάζουν μια επαλήθευση πρότασης με φωνή. Ο Cao είπε ότι οι αφαίρεσεις ολοκληρώνονται τώρα σε λιγότερο από τρία λεπτά.
Τι πλέει επόμενο
Δύο ακόμη μοντέλα είναι στο δρόμο: ένα σύστημα κατανόησης ήχου που η εταιρεία περιμένει φέτος, και ένα μοντέλο ομιλίας-σε-ομιλία που είναι ακόμη σε ανάπτυξη. Και τα δύο στοχεύουν στο voice-agent stack και όχι στην的一-way αφήγηση. Η γεννήτρια ομιλίας είναι ήδη μια πολυσύχναστη αγορά, με ElevenLabs, Cartesia, Speechify και Krisp που πωλούν σε перекrýοντας σύνολα δημιουργών και dévelopers. Μια αύξηση αυτού του μεγέθους δεν είναι πλέον ο εξόριστος που θα ήταν πριν από δύο χρόνια· Enigma άνοιξε eine 71 εκατ. σπόρου για διεπαφές ρομπότ νωρίτερα τον Ιούλιο του 2026. Η κοντινότερη δοκιμή για την Fish Audio είναι εμπορική: το δωρεάν παράθυρο S2.1 Pro κλείνει στο τέλος Αυγούστου 2026, και το νέο κεφάλαιο πρέπει να μετατρέψει τους dévelopers που έλκυσαν σε επιχειρηματικές συμβάσεις.












