โมเดลและแพลตฟอร์ม AI
Fish Audio ได้รับเงิน 52 ล้านเหรียญสหรัฐในการระดมทุนเพื่อเปลี่ยนโมเดลเสียงเปิดให้ใช้งานฟรีเป็นรายได้

Fish Audio ได้ระดมทุนได้ 52 ล้านเหรียญสหรัฐในการระดมทุนรอบที่นำโดย Coreline Ventures และ Capital Today โดยมีเงินเข้ามาในบริษัท Palo Alto ที่ให้บริการแปลงข้อความเป็นเสียง ซึ่งใช้เวลาที่ผ่านมาโดยการแจกจ่ายโมเดลของตนและคิดค่าบริการสำหรับทุกสิ่งที่อยู่รอบๆ โมเดลเหล่านั้น Fish Audio ระบุว่ามีผู้ใช้มากกว่า 8 ล้านคนใช้โมเดลเหล่านี้ผ่านการเผยแพร่แบบเปิดหรือแพลตฟอร์มที่จัดโฮสต์ และธุรกิจนี้มีรายได้ประจำปีประมาณ 21 ล้านเหรียญสหรัฐ
การระดมทุนครั้งนี้ถูกเปิดเผยเมื่อวันที่ 28 กรกฎาคม 2026 โดยมี 359 Capital, HF0, และกองทุนอื่นๆ อีก 5 กองทุนเข้าร่วม และถูกรายงานครั้งแรกโดย TechCrunch ซีอีโอและผู้ร่วมก่อตั้ง Rissa Cao ระบุว่าบริษัทมีประสิทธิภาพในการดำเนินงานโดยใช้การแจกจ่ายแบบเปิดและค่าบริการผู้สร้างที่ไม่ต้องการเงินทุนจากภายนอก และออกไปเพื่อระดมทุนสำหรับโมเดลที่ทันสมัยและขยายสู่บัญชีธุรกิจ การระดมทุน 52 ล้านเหรียญสหรัฐที่ยังคงใช้ฉลากการระดมทุนในบริษัทที่มีรายได้ประจำปีหลายล้านเหรียญสหรัฐ สะท้อนให้เห็นว่าเสียงเปลี่ยนจากคุณสมบัติผลิตภัณฑ์เป็นรายการโครงสร้างพื้นฐานอย่างไร
จากน้ำหนักเปิดไปสู่ API ฟรี
บริษัทเริ่มต้นเป็นโครงการด้านข้างโดย Shijia Liao นักวิจัยจาก Nvidia (NVDA ) ที่ฝึกโมเดลการพูดบน GPU เดียวและเผยแพร่ โครงการนี้มีชื่อว่า Fish Speech และมีผู้ติดตามมากกว่า 31,000 คนใน GitHub และมีผู้ติดตามในหมู่นักพัฒนาและสตูดิโอเกมอิสระ Liao เป็นนักวิทยาศาสตร์หลักของ Fish Audio และมีโมเดล 5 รุ่นที่เผยแพร่ในเวลาประมาณหนึ่งปี: 4 โมเดลการสร้างเสียงและ 1 ระบบการแปลงเสียงเป็นข้อความ
โมเดลการสร้างเสียง 3 ใน 4 โมเดลนี้ถูกเผยแพร่แบบเปิด Fish Audio เผยแพร่น้ำหนักของ S2 เมื่อวันที่ 9 มีนาคม 2026 พร้อมด้วยโค้ดการปรับให้เหมาะสมและเครื่องมือการอนุมานแบบสตรีม S2 เป็นโมเดล 4 พันล้านพารามิเตอร์ที่ฝึกอบรมบนมากกว่า 10 ล้านชั่วโมงของเสียงทั่วประมาณ 80 ภาษา โดยมีการควบคุมแบบอิสระ เช่น [whisper] หรือ [professional broadcast tone] ที่วางไว้ระดับคำ บริษัทมีการควบคุมมากกว่า 15,000 รายการ
โมเดลใหม่ล่าสุด S2.1 Pro เป็นโมเดลที่ถูกเก็บไว้ไม่เผยแพร่แบบเปิด และแม้กระทั่ง API ก็ยังเปิดให้ใช้งานฟรี: ไม่มีขีดจำกัดตัวอักษร 83 ภาษา และไม่มีการรับประกันระดับการบริการ โดยมีการขยายเวลาการใช้งานฟรีจนถึงวันที่ 31 สิงหาคม 2026 แผนการชำระเงินมีการรับประกันความหน่วงและเวลาที่ใช้ในการตอบสนอง และบริษัทขอให้ผลิตภัณฑ์ที่มีรายได้มากกว่า 1 ล้านเหรียญสหรัฐติดต่อเพื่อหารือเกี่ยวกับการใช้งานระดับฟรี Fish Audio ให้เครดิตกับไลบรารีเคอร์เนล GPU FP8 ที่สร้างขึ้นใหม่สำหรับการให้บริการฟรีนี้ และรายงานเวลาประมาณ 70 มิลลิวินาทีในการตอบสนองต่อคำขอแรก
นี่คือตรรกะการค้าของธุรกิจ โมเดลน้ำหนักเปิดและโมเดลฟรีแบบแนวหน้าซื้อการกระจายสู่นักพัฒนา; รายได้มาจากบริษัทที่ต้องการความหน่วงตามสัญญา Fish Audio ระบุว่าลูกค้าธุรกิจ เช่น HeyGen, Livekit, Retell, Sanas และ OpenArt ใช้ API ของบริษัทแล้ว และ Cao อธิบายว่าความต้องการแบ่งออกตามกรณีการใช้งาน: ผลิตภัณฑ์อาวาตาร์ต้องการความสมจริง สตูดิโอเกมต้องการเสียงตัวละครที่มีการแสดงออก และบริษัทตัวแทนเสียงต้องการความหน่วงต่ำที่ยังคงดูเหมือนมนุษย์ ส่วนหลังเป็นส่วนที่เติบโตเร็วที่สุด เนื่องจากผู้ช่วยหลักที่มีหน้าจอแสดงผลเสียง — Anthropic นำโมเดล Opus และ Sonnet มาใช้กับโหมดเสียงของ Claude ในเดือนกรกฎาคม 2026 — และสตูดิโอเล็กๆ ตามหานิชเดียวกัน รวมถึง Tryll Engine ที่มีการพูดคุย AI บนเครื่อง
ใครเขียนเช็ค
ผู้นำทั้งสองเป็นคู่ที่ไม่ธรรมดาสำหรับบริษัทเครื่องมือพัฒนาใน США Coreline Ventures เป็นกองทุนข้ามพรมแดนที่มีขนาดเล็กซึ่งถูกแยกออกจาก DCM Ventures โดยเขียนเช็คแรกๆ ในสหรัฐฯ ญี่ปุ่น และเกาหลีจากพอร์ตโฟลิโอที่มีเจตนาเล็กๆ ซึ่งรวมถึงห้องปฏิบัติการเสียงสร้างสรรค์ของญี่ปุ่นแล้ว Capital Today เป็นแฟรนไชส์เครือข่ายผู้บริโภคของจีนซึ่ง Kathy Xu ก่อตั้งขึ้นในปี 2005 โดยมี JD.com (JD ), Meituan, ByteDance และ Moonshot AI เป็นส่วนหนึ่งของการถือครอง และมีกองทุนแบบ evergreen มูลค่าประมาณ 2.8 พันล้านเหรียญสหรัฐ 359 Capital ซึ่งแยกออกจาก Sapphire Ventures ในเดือนพฤศจิกายน 2025 โดยมีเงิน约 300 ล้านเหรียญสหรัฐภายใต้การบริหารจัดการ ลงทุนในธุรกิจที่เกี่ยวข้องกับผู้บริโภค ในทางกลับกัน เงินของผู้บริโภคสนับสนุน API ของนักพัฒนา โดยอาศัยทฤษฎีว่าห้องสมุดเสียงของชุมชนเป็นสินทรัพย์ที่ทนทาน
Osuke Honda ผู้ร่วมก่อตั้งและหุ้นส่วนผู้จัดการของ Coreline ระบุเงื่อนไขสำหรับทฤษฎีนั้น “การเข้าถึงชุมชนสามารถกลายเป็นข้อได้เปรียบได้ก็ต่อเมื่อนักพัฒนาทรัสต์บนแพลตฟอร์ม” เขากล่าวในการสัมภาษณ์เดียวกัน “ซึ่งหมายความว่าความยินยอม ความโปร่งใส และการอ้างอิงต้องถูกสร้างเข้าไปในผลิตภัณฑ์ ไม่ใช่ถูกมองว่าเป็นเรื่องรอง”
ห้องสมุดเป็นของชุมชน Fish Audio ขอให้ผู้คนส่งเสียงของตนเองเพื่อฝึกอบรมและจ่ายเงินให้เมื่อเสียงถูกใช้ ห้องสมุดสาธารณะมีเสียงมากกว่า 2 ล้านเสียงแล้ว โมเดลนี้ได้รับการร้องเรียนในต้นปี 2026 เมื่อนักพัฒนาบางคนกล่าวว่าเสียงถูกอัปโหลดโดยไม่ได้รับความยินยอม และการถอดออกใช้เวลานาน เมื่อวันที่ 4 กรกฎาคม 2026 บริษัทได้สร้างกระบวนการแก้ไขข้อพิพาทสิทธิ์เสียง ซึ่งแทนที่คิวการสนับสนุนโดยทั่วไป: ผู้อ้างสิทธิ์สามารถยื่นคำร้องจากหน้าโมเดล ส่งเอกสารประจำตัวหรือการอนุญาตองค์กร และอ่านประโยคยืนยันเสียงออกเสียง Cao กล่าวว่าการถอดออกสามารถทำได้ภายในสามนาที
สิ่งที่จะตามมา
มีโมเดลอีกสองโมเดลที่อยู่ในแผนการ: ระบบการเข้าใจเสียงที่คาดว่าจะเปิดตัวในปีนี้ และโมเดลการแปลงเสียงเป็นเสียงที่ยังอยู่ในการพัฒนา ทั้งสองมุ่งเน้นไปที่สแต็คตัวแทนเสียงมากกว่าการบรรยายแบบเดียว การสร้างเสียงเป็นตลาดที่มีการแข่งขันสูง โดยมี ElevenLabs, Cartesia, Speechify และ Krisp ขายให้กับกลุ่มผู้สร้างและนักพัฒนาที่ทับซ้อนกัน การระดมทุนขนาดนี้ไม่ใช่สิ่งที่ไม่ธรรมดาเหมือนเมื่อสองปีที่แล้ว; Enigma เปิดการระดมทุน 71 ล้านเหรียญสหรัฐสำหรับอินเทอร์เฟซหุ่นยนต์ ในเดือนกรกฎาคม 2026 การทดสอบที่ใกล้กว่านี้สำหรับ Fish Audio คือเชิงพาณิชย์: ช่องหน้าต่าง API ฟรีของ S2.1 Pro จะปิดที่สิ้นเดือนสิงหาคม 2026 และทุนใหม่ต้องเปลี่ยนนักพัฒนาที่ดึงดูดมาเป็นสัญญาธุรกิจ












