ความร่วมมือ
เอเจนต์เสียงบนเครื่องเซิร์ฟเวอร์ได้รับเส้นทางฮาร์ดแวร์ใหม่เมื่อ Smallest.ai เข้าร่วมกับ Tenstorrent

Tenstorrent และ Smallest.ai ประกาศ ความร่วมมือเมื่อวันที่ 1 ตุลาคม 2026 เพื่อมอบสแตก AI เสียงระดับการผลิตที่ทำงานบนเครื่องเซิร์ฟเวอร์โดยใช้โมเดลแปลงข้อความเป็นเสียงแบบเรียลไทม์ Lightning V2 ของ Smallest.ai โดยตรงบน Tenstorrent Galaxy Blackhole servers.
Tenstorrent ซึ่งเป็นบริษัทคอมพิวเตอร์ AI และ Smallest.ai ซึ่งเป็นห้องทดลองวิจัย AI ที่สร้างโครงสร้างพื้นฐาน AI เสียงแบบเรียลไทม์ กล่าวว่า สแตกร่วมกันนี้ออกแบบมาเพื่อลดต้นทุนการใช้งานพร้อมยังคงประสิทธิภาพที่จำเป็นสำหรับแอปพลิเคชันเสียงแบบเรียลไทม์ บริษัทต่างกล่าวว่าการรัน Lightning V2 บนสถาปัตยกรรม Blackhole ทำให้องค์กรสามารถดำเนินการเอเจนต์เสียงแบบเรียลไทม์ได้ทั้งหมดบนเครื่องเซิร์ฟเวอร์โดยมีอำนาจข้อมูลเต็มรูปแบบ โดยมุ่งเน้นงานที่มีปริมาณสูงและข้อมูลที่อ่อนไหวในอุตสาหกรรมการเงิน, โทรคมนาคม, การดูแลสุขภาพ และสภาพแวดล้อมองค์กร Lightning V2 พร้อมใช้งานบนฮาร์ดแวร์ของ Tenstorrent ทันที ด้วยการกำหนดราคาแบบใช้ตามการใช้งานและไม่มีข้อผูกมัดล่วงหน้า
“ไม่ควรต้องเลือกระหว่างประสิทธิภาพและต้นทุน – Tenstorrent ได้สร้างคอมพิวเตอร์ที่มีประสิทธิภาพและขยายได้ซึ่งลดต้นทุนของกระบวนการทำงานเดิมและทำให้ภาระงานใหม่ทั้งหมดเป็นไปได้จริง” กล่าวโดย Amr Elashmawi, รองประธานฝ่ายกลยุทธ์และพัฒนาธุรกิจที่ Tenstorrent.
ฮาร์ดแวร์ Galaxy Blackhole
แพลตฟอร์มเซิร์ฟเวอร์ที่ระบุในประกาศสร้างขึ้นโดยใช้ ASIC Blackhole จำนวน 32 ตัว ที่ให้กำลังการคำนวณ Block FP8 ที่ 23 PFLOPS พร้อม SRAM บนชิป 6.2 GB ที่ 2.9 PB/s และหน่วยความจำ GDDR6 ขนาด 1 TB ที่ 16 TB/s ตาม สเปค Galaxy ของ Tenstorrent. แต่ละ ASIC เชื่อมต่อผ่านลิงก์ 400 GbE จำนวนสิบลิงก์เพื่อสร้างโครงข่ายเร่งความเร็ว 32 TB/s และระบบสามารถขยายได้ถึงพอร์ต QSFP‑DD 800 GbE สูงสุด 56 พอร์ต. แชสซี 6U ระบายอากาศด้วยพัดลมจับคู่กับโปรเซสเซอร์โฮสต์ AMD EPYC 9004 พร้อมหน่วยความจำ DDR5 สูงสุด 576 GB, ทำงานบน Ubuntu 22.04, ใช้พลังงานโดยเฉลี่ย 8‑10 kW, และมีราคาตามรายการที่ 160,000 ดอลลาร์
การออกแบบความแม่นยำต่ำและผลลัพธ์ที่วัดได้
วิศวกรรมที่อยู่เบื้องหลังความร่วมมือนี้ได้ถูกบันทึกไว้ในเอกสารวิจัย “เขียนใหม่เรื่องเศรษฐศาสตร์การสรุปผล TTS: Lightning V2 บน Tenstorrent ทำให้ต้นทุนต่ำกว่า NVIDIA L40S ถึง 4 เท่า” โดย Ranjith M S จาก Smallest.ai, วิศวกรประสิทธิภาพการสรุปผล AI ระดับอาวุโส; ประธานเจ้าหน้าที่เทคโนโลยี Akshat Mandloi; และประธานเจ้าหน้าที่บริหาร Sudarshan Kamath. เอกสารฉบับแรกส่งเมื่อ 24 มีนาคม 2026 และปรับปรุงเมื่อ 7 เมษายน 2026.
Ranjith ผู้เขียนคนแรกของเอกสารกล่าวในการประกาศว่า “สถาปัตยกรรมของ Tenstorrent แตกต่างอย่างสิ้นเชิงจากกรอบงานเดิม การทำงานร่วมกับ NoC และ SRAM ขนาดใหญ่ทำให้เราบรรลุผลเพิ่มขึ้น 4 เท่าในต้นทุนที่เป็นเศษส่วนของโครงสร้างพื้นฐาน GPU ที่เทียบได้ ส่งผลให้เกิดการเปลี่ยนแปลงเชิงโครงสร้างในเศรษฐศาสตร์การสรุปผล”
ผู้เขียนระบุว่าโมเดลแปลงข้อความเป็นเสียงมีความเปราะบางเชิงตัวเลขมากกว่าโมเดลภาษาใหญ่ เนื่องจากพวกมันสร้างคลื่นเสียงต่อเนื่องผ่านการปรับปรุงแบบวนซ้ำ ทำให้ข้อผิดพลาดตัวเลขเล็ก ๆ สะสมผ่านขั้นตอนการลดสัญญาณรบกวนและปรากฏเป็นศูนย์เสียงที่ได้ยินได้ ตามข้อจำกัดนี้ เอกสารระบุว่า มากกว่า 95 % ของชั้นของ Lightning V2 ทำงานที่ความแม่นยำการคำนวณ LoFi และมากกว่า 80 % ของโมเดลถูกนำไปใช้ใน BlockFloat8 โดยไม่มีการเสื่อมคุณภาพเสียงที่วัดได้ ผู้เขียนยังรายงานว่าการคำนวณของโมเดลการกระจายเสียงลดลง 4 เท่า, การคำนวณของนิวรัลโวคเดอร์ลดลง 8 เท่า, ขนาดโมเดลลดลงประมาณ 2 เท่า, และปริมาณการถ่ายโอนหน่วยความจำลดลง 1.8 เท่า
ในด้านคุณภาพผลลัพธ์ เอกสารรายงานคะแนนการรับรู้ DNSMOS ที่ 3.872 สำหรับฐานข้อมูล NVIDIA L40S เทียบกับ 3.801 บน P150 ของ Tenstorrent ความแตกต่าง 0.071 นี้ผู้เขียนอธิบายว่าอยู่ในช่วงความแปรปรวนการรับรู้ระดับเล็กน้อย และอัตราความผิดพลาดของคำที่ปรับให้เป็นมาตรฐานอยู่ที่ 0.009 ระหว่างผลลัพธ์ของสองระบบ
ในการทดสอบอุปกรณ์เดี่ยว เอกสารระบุว่า L40S รองรับการทำงานพร้อมกัน 3 งานที่ความหน่วง 300 มิลลิวินาที โดยมีราคาตามรายการที่ 9,000 ดอลลาร์ ในขณะที่ P150 และ P100 ทำงานพร้อมกัน 1 งานที่ความหน่วง 250 มิลลิวินาที โดยมีราคาตามรายการที่ 1,400 ดอลลาร์และ 1,000 ดอลลาร์ ตามลำดับ ส่งให้ได้กำไรด้านต้นทุนที่ 2.6 เท่าและ 3.6 เท่า ตามลำดับ เนื่องจาก Lightning V2 ทำงานบนชิปเดียวโดยไม่มีการขนานหลายชิปหรือการเชื่อมต่อ QSFP ตัวเลขความหน่วงของ P100 จึงถูกยืมมาจากผลลัพธ์ของ P150 ตามที่เอกสารระบุ
ในระดับฟลีต ผู้เขียนจำลองภาระงานที่มีการร้องขอ TTS ระยะเวลา 5 วินาทีพร้อมกัน 550 คำขอที่ใช้งานเต็มที่ พวกเขาคำนวณว่าการรองรับต้องใช้ GPU L40S จำนวน 11 ตัวที่มีค่าใช้จ่ายเร่งความเร็วประมาณ 100,000 ดอลลาร์ เทียบกับเร่งความเร็ว P100 จำนวน 27 ตัวที่ประมาณ 27,000 ดอลลาร์ หรือ P150 จำนวน 27 ตัวที่ประมาณ 37,000 ดอลลาร์ ซึ่งแสดงให้เห็นการลดต้นทุนล่วงหน้า 3‑4 เท่าในแบบจำลองของพวกเขา
เอกสารยังระบุว่าชั้นที่ได้รับการปรับแต่งอย่างหนักประมาณ 6 พันล้านการคูณ-บวกทำงานในเวลาประมาณ 60 ไมโครวินาทีบน L40S เทียบกับประมาณ 31 ไมโครวินาทีบน P150 ผู้เขียนคาดว่าการขยายการปรับแต่งระดับเคอร์เนลนี้ไปยังชั้นเพิ่มเติมอาจให้การปรับปรุงที่เทียบต้นทุนได้ 8‑12 เท่าเหนือฐาน L40S ซึ่งสูงกว่าการเพิ่มประสิทธิภาพระดับระบบปัจจุบันที่ 3.6 เท่า
ผู้เขียนตั้งกรอบการสนับสนุน BlockFloat8 แบบเนทีฟเป็นเส้นแบ่งต้นทุนฮาร์ดแวร์: GPU สมัยใหม่ที่มีความสามารถนี้อยู่ในระดับราคาประมาณ 40,000 ดอลลาร์ต่ออุปกรณ์ ตามที่พวกเขารายงาน ในขณะที่ Tenstorrent ทำให้การทำงาน BlockFloat8 บนฮาร์ดแวร์อยู่ในระดับประมาณ 1,000 ดอลลาร์ ซึ่งเป็นความแตกต่างระดับหนึ่งของลำดับขนาดต้นทุนการได้มาซึ่งพวกเขาอธิบาย
ความเปราะบางเชิงตัวเลขและกรณี PCC
เอกสารนี้บันทึกกรณีศึกษาเกี่ยวกับการดีบักโดยอิงค่า Pearson Correlation Coefficient ซึ่งเป็นเมตริกความคล้ายเชิงตัวเลขมาตรฐาน ผู้เขียนรายงานว่าผลลัพธ์จาก L40S และ CPU AMD EPYC 7352 แสดงค่าสัมประสิทธิ์จากต้นจนจบเพียง 0.72 แม้จะใช้ข้อมูลอินพุตเดียวกัน แต่ยังคงสร้างเสียงที่ไม่แตกต่างกันในเชิงการรับรู้ ในกรณีอื่น ๆ ชั้นที่ค่าสัมประสิทธิ์ปัดเป็น 1.0 ทำให้เกิดการแตกหักของเสียงที่ต้องใช้เวลามากกว่าหนึ่งเดือนในการระบุ ผู้เขียนสรุปว่าเมตริกความคล้ายระดับเทนเซอร์แบบดั้งเดิมไม่เป็นตัวบ่งชี้ที่เชื่อถือได้สำหรับคุณภาพเสียงเชิงการรับรู้ในระบบ TTS และการตรวจสอบเชิงการรับรู้จากต้นจนจบเป็นสิ่งจำเป็นสำหรับการใช้งานแบบความแม่นยำต่ำ
ข้อจำกัดและขั้นตอนต่อไป
ผู้เขียนระบุว่าบางชั้นยังคงมีความไวเชิงตัวเลขเกินกว่าจะใช้การประมวลผลแบบความแม่นยำต่ำหรือการคำนวณแบบบล็อกฟลตติ้งพอยท์โดยไม่ทำให้คุณภาพการรับรู้เสื่อมลง ซึ่งจำกัดการครอบคลุมแบบความแม่นยำต่ำของโมเดลทั้งหมด และการตั้งค่าคอมไพเลอร์และโปรแกรมยังไม่ได้รับการปรับให้เหมาะสมอย่างเต็มที่
ใน โพสต์เชิงเทคนิควันที่ 28 กันยายน 2026 Smallest.ai ระบุว่า Lightning V2 เป็นโมเดล TTS แรกของโลกที่สามารถให้การสังเคราะห์เสียงคุณภาพสูงภายใต้การควอนไทเซชัน BlockFloat8 ร่วมกับการคำนวณความแม่นยำต่ำ บริษัทกล่าวว่า Lightning V3 รุ่นใหม่ของตนได้เหนือกว่า V2 ทั้งในด้านคุณภาพและประสิทธิภาพสถาปัตยกรรมแล้ว และวางแผนจะนำ Lightning V3 ไปใช้งานบนฮาร์ดแวร์ Tenstorrent ด้วยหลักการออกแบบร่วมเดียวกัน โดยมุ่งเป้าหมายให้ได้การประหยัดต้นทุนที่เทียบเท่าหรือดีกว่า












