نماذج ومنصات الذكاء الاصطناعي
Fish Audio يحصل على 52 مليون دولار في جولة التمويل لتحويل نماذج الصوت المفتوحة إلى إيرادات

حصلت Fish Audio على 52 مليون دولار في جولة تمويل أولية بقيادة Coreline Ventures و Capital Today، وهو مال يصل إلى شركة Palo Alto للنص إلى الكلام التي أمضت العام الماضي في إعطاء نماذجها بعيدًا وفرض رسوم على كل شيء حولها. تقول Fish Audio إن أكثر من 8 ملايين شخص يستخدمون الآن هذه النماذج من خلال إصدارات الأوزان المفتوحة أو منصة الاستضافة الخاصة بهم، وأن الأعمال تجري بسرعة 21 مليون دولار في الإيرادات المتكررة السنوية.
تم الكشف عن الجولة في 28 يوليو 2026، مع انضمام 359 Capital ومؤسس HF0 وخمسة صناديق أخرى، وتم الإبلاغ عنها لأول مرة بواسطة TechCrunch. وقال ريسا كاو، الرئيس التنفيذي والشريك المؤسس، إن الشركة كانت تجري بفعالية كافية على توزيع المصدر المفتوح واشتراكات المبدعين بحيث لم تكن تحتاج إلى رأس مال خارجي، وخرجت لتوفير نماذج أكثر تقدمًا وضغط على الحسابات التجارية. يعتبر جولة التمويل البالغة 52 مليون دولار لا تزال تحمل علامة التمويل الأولية، في شركة تبلغ إيراداتها المتكررة ثمانية أرقام، يدل على مدى سرعة تحرك الصوت من ميزة المنتج إلى بند البنية التحتية.
من الأوزان المفتوحة إلى واجهة برمجة تطبيقات مجانية
بدأت الشركة كمشروع جانبي بواسطة Shijia Liao، وهو باحث سابقة في Nvidia (NVDA ) الذي درب نموذجًا للكلام على وحدة معالجة رسومات واحدة ونشره. يحمل هذا المستودع، Fish Speech، الآن أكثر من 31 ألف نجمة وجمهورًا بين المطورين المستقلين وشركات ألعاب الفيديو. Liao هو عالم العلوم الرئيسي في Fish Audio، وتم إطلاق خمسة نماذج في غضون عام تقريبًا: أربعة من مولدات الكلام ونظام تحويل الكلام إلى نص.
ثلاثة من مولدات الكلام في العراء. نشرت Fish Audio أوزان S2 على 9 مارس 2026، إلى جانب رمز التخصيص ومحرك الاستدلال المتدفق. S2 هو نموذج يحتوي على 4 مليارات معلمة تم تدريبه على أكثر من 10 ملايين ساعة من الصوت عبر حوالي 80 لغة، يوجهه علامات حرة الشكل مثل [whisper] أو [professional broadcast tone] التي يتم إسقاطها في مستوى الكلمة. تعتبر الشركة أكثر من 15 ألف تحكم من هذا القبيل.
النموذج الأكثر حداثة، S2.1 Pro، هو النموذج الذي تقوم به الشركة بصدّه عن الإصدار المفتوح، وحتى ذلك الحين هو مجاني عبر واجهة برمجة التطبيقات: لا يوجد حد صارم للشخصيات، 83 لغة ولا ضمان لمستوى الخدمة، مع تمديد النافذة المجانية حتى 31 أغسطس 2026. تحمل الخطط المدفوعة التزامات التأخير ووقت التشغيل، وتطلب الشركة من المنتجات التي تزيد عن مليون دولار في الإيرادات السنوية المتكررة أن تتحدث معها قبل بناء على الطبقة المجانية. وتعزو Fish Audio الفضل في بناء مكدس الاستدلال مرة أخرى، بما في ذلك مكتبة نواة GPU FP8 الخاصة بها، لجعل هذا العرض المجاني ميسور التكلفة، وتفيد بأنه يحتاج إلى حوالي 70 مللي ثانية للوصول إلى الصوت لأول مرة في طلب واحد.
هذا هو المنطق التجاري للأعمال. تشتري الأوزان المفتوحة ونموذج الحدود المجانية التوزيع بين المطورين؛ تأتي الإيرادات من الشركات التي تحتاج إلى تأخير عقدي. تقول Fish Audio إن العملاء التجاريين، بمن فيهم HeyGen و Livekit و Retell و Sanas و OpenArt، يديرون بالفعل على واجهات برمجة التطبيقات الخاصة بها، ويصف كاو الطلب بالتقسيم حسب حالة الاستخدام: تريد المنتجات الرمزية الواقعية، وتريد استوديوهات ألعاب الصوت الصوتي للشخصيات، وتريد شركات وكلاء الصوت تأخيرًا منخفضًا لا يزال يبدو إنسانيًا. هذا هو القطاع الذي يتحرك بسرعة، حيث يضيف المساعدين الرئيسيين واجهات محكية — أضاف Anthropic نماذج Opus و Sonnet إلى وضع الصوت Claude في يوليو 2026 — وعندما تتبع الاستوديوهات الصغيرة نفس النيشة، بما في ذلك Tryll Engine مع حوارات الذكاء الاصطناعي على الجهاز لألعاب الفيديو.
من كتب الشيكات
الرائدان هما زوج غير عادي لشركة أدوات مطورين أمريكية. Coreline Ventures هو صندوق صغير عبر الحدود تم انقسامه من DCM Ventures، يكتب شيكات أولية عبر الولايات المتحدة واليابان وكوريا من محفظة متعمدة مضغوطة تضم بالفعل مختبر صوت توليدي ياباني. Capital Today هي علامة تجارية لإنترنت المستهلك الصيني التي أسسها كاثي شو في عام 2005، مع JD.com (JD ) و Meituan و ByteDance و Moonshot AI بين ممتلكاتها وصندوق دائم يبلغ حوالي 2.8 مليار دولار. 359 Capital، الذي انفصل عن Sapphire Ventures في نوفمبر 2025 مع حوالي 300 مليون دولار تحت الإدارة، يستثمر في الأعمال التجارية الترفيهية والمتجاورة. المال الاستهلاكي، بمعنى آخر، يدعم واجهة برمجة تطبيقات المطور، بناءً على نظرية أن مكتبة الصوت المجتمعية هي المورد المتين.
وضع أوسوكه هونда، الشريك المؤسس والشريك الإداري في Coreline، شرطًا على هذه النظرية. “يمكن أن يصبح النهج المجتمعي مركزًا متينًا فقط إذا ثق المبدعون بالمنصة”، قال في نفس المقابلة. “هذا يعني أن الموافقة والشفافية والائتمان يجب أن يتم دمجها في المنتج بدلاً من معاملتها كأفكار ثانوية”.
المكتبة مدعومة من قبل المستخدم. تطلب Fish Audio من الناس تقديم أصواتهم الخاصة لتدريبها وتدفع لهم عندما يتم استخدام الصوت، وتحمل المكتبة العامة الآن أكثر من مليوني صوت. هذا النموذج أثار شكاوى في وقت سابق من عام 2026، عندما قال المبدعون إن الأصوات قد تم تحميلها دون موافقةهم وأن عمليات إزالة الأصوات تتحرك ببطء. في 4 يوليو 2026، وثقت الشركة عملية نزاع ملكية صوت مخصصة تحل محل طابور الدعم العام: يقدم المطالبون من صفحة النموذج، يقدمون هوية حكومية أو تفويض الشركات، ويقرؤون جملة التحقق بصوت عال. وقال كاو إن الإزالات تكتمل الآن في أقل من ثلاث دقائق.
ما سيتم شحنه بعد ذلك
يوجد نموذجان آخران على الخارطة: نظام فهم الصوت الذي تتوقع الشركة إطلاقه هذا العام، ونموذج صوت إلى صوت لا يزال قيد التطوير. يهدف كلاهما إلى حزمة وكلاء الصوت بدلاً من السرد أحادي الاتجاه. سوق توليد الصوت بالفعل مزدحم، مع ElevenLabs و Cartesia و Speechify و Krisp التي تبيع إلى مجموعات متداخلة من المبدعين والمطورين. يعتبر رفع هذا الحجم لم يعد الشاذ الذي كان سيكون عليه قبل عامين؛ أطلق Enigma صندوق تمويل أولي بقيمة 71 مليون دولار ل_interfaces الروبوت في وقت سابق من يوليو 2026. الاختبار الأقرب لشركة Fish Audio هو تجاري: تتم إغلاق النافذة المجانية S2.1 Pro في نهاية أغسطس 2026، ويجب على رأس المال الجديد تحويل المطورين الذين جذبتهم إلى عقود تجارية.












