โมเดลและแพลตฟอร์ม AI

Fireworks AI ทำให้ Training API พร้อมใช้งานทั่วไป

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

Fireworks AI เมื่อวันที่ 31 สิงหาคม 2026 ประกาศให้ Training API และ Fireworks Lab พร้อมให้บริการทั่วไป เปิดโครงสร้างพื้นฐานการฝึกอบรมและการปล่อยรุ่นที่จัดการโดยบริษัทให้กับทีม ML ที่ต้องการรันลูปการฝึกแบบกำหนดเองบนโมเดลเปิด Training API เชื่อมลูปการฝึก Python ของลูกค้าเข้ากับการประมวลผลแบบกระจายที่ Fireworks จัดการ ครอบคลุมทั้งตัวฝึกที่คำนวณเกรเดียนต์และอัปเดตโมเดลและการปล่อยที่สร้างตัวอย่างจากโมเดลนั้น

ตามข้อตกลงที่อธิบายไว้ใน ประกาศ ลูกค้าจะจัดการลูปจากที่ใดก็ได้ที่ต้องการ ควบคุมฟังก์ชัน loss หรือ reward, ข้อมูล, และสภาพแวดล้อม Fireworks จะดูแลการโต้ตอบระหว่างตัวฝึกและการปล่อย รวมถึงการซิงโครไนซ์น้ำหนัก, การกู้คืนการสลับที่ล้มเหลว, และการปรับแนวการฝึก‑ปล่อย บริษัทตั้งตำแหน่ง API นี้เป็นการตอบสนองต่อข้อจำกัดที่ทีม ML รายงานในกระบวนการฝึกปัจจุบัน: ตัวเลือกโมเดลและวิธีการที่จำกัด, การควบคุมพารามิเตอร์และลูปการฝึกที่จำกัด, การคำนวณที่แข็งกราก, และโครงสร้างพื้นฐานการฝึกและการปล่อยที่กระจัดกระจาย

การคำนวณแบบ Serverless และ Dedicated

Training API มีตัวเลือกการคำนวณสองแบบ การฝึกแบบ Serverless ให้ลูกค้าฝึก LoRA adapters บนโครงสร้างพื้นฐานร่วมด้วยการเรียกเก็บเงินต่อโทเค็น พร้อมการสุ่มตัวอย่างทำงานในเซสชันเดียว Fireworks บรรยายว่ามันเหมาะกับการทดลองซ้ำ, ลดความเสี่ยงของการรันขนาดใหญ่, หรือรันลูป reinforcement learning ที่สลับระหว่าง rollout กับ training การฝึกแบบ Dedicated มุ่งเน้นการฝึกเต็มพารามิเตอร์, โมเดลที่อยู่นอกกลุ่ม Serverless, ความยาวคอนเท็กซ์หรือ LoRA rank ที่ใหญ่ขึ้น, และอัตราผ่านที่ต่อเนื่อง โดยเรียกเก็บเงินต่อชั่วโมง GPU บนความจุยืดหยุ่นที่กำหนดตามแต่ละรัน

ระดับ Serverless เชื่อมต่อกับพูลแชร์ที่เปิดให้บริการตลอดเวลา พร้อมรายการโมเดลยอดนิยมที่คัดสรร, ความจุร่วม, และขีดจำกัดอัตราต่อบัญชี ระดับ Dedicated จัดสรรตัวฝึกและการปล่อยต่อรัน, รองรับโหมด LoRA และเต็มพารามิเตอร์จนถึงโมเดล mixture‑of‑experts ขนาดใหญ่ที่สุด, และไม่มีการแย่งใช้หรือขีดจำกัดอัตรา Fireworks กล่าวว่าจุดตรวจที่มีศักยภาพสามารถนำไปใช้ใน inference ของผลิตภัณฑ์ผ่าน UI หรือ API, และการปรับใช้หลาย LoRA ทำให้แต่ละลูกค้าหรือกรณีการใช้งานมีโมเดลที่ปรับแต่งเฉพาะโดยไม่ต้องสร้างโครงสร้างพื้นฐานแยกต่างหาก

สามพื้นผิวการฝึก

Training API ทำงานเคียงข้างสองพื้นผิวอื่นบน แพลตฟอร์มการฝึกของ Fireworks Managed Training ที่มุ่งเป้าไปที่วิศวกร ML จะรันงานในตัวที่ลูกค้าเลือกวิธี — SFT, DPO หรือ RL — และโมเดลฐาน โดยเริ่มจาก UI หรือ API Fireworks Lab ซึ่งเปิดให้ใช้ทั่วไปตั้งแต่การประกาศก็เป็นส่วนหนึ่งแล้ว ฝังนักวิจัยและวิศวกรที่พร้อมทำงานร่วมกับทีมลูกค้า; การทำงานเริ่มด้วยการวินิจฉัยกำหนดความสามารถ, baseline, เกณฑ์ความสำเร็จ, และขอบเขต, จากนั้นเข้าสู่การดำเนินการในช่วงเวลาที่กำหนด, และลูกค้าได้รับโมเดลพร้อมใช้งาน, ระบบประเมิน, ท่อข้อมูล, ลูปการฝึก, และสูตรการฝึก

Training API เองมุ่งเป้าไปที่นักวิจัย ML และรองรับ SFT, DPO, ORPO, RL, และการสกัด (distillation), ตั้งแต่ LoRA บนคอมพิวต์ Serverless ไปจนถึงการฝึกเต็มพารามิเตอร์บนคลัสเตอร์ Dedicated

การเรียนรู้เสริมแรงในระดับใหญ่

Fireworks กล่าวว่าตนเป็นหนึ่งในไม่กี่องค์กรนอกห้องทดลองแนวหน้า ที่ดำเนินการ reinforcement learning บน GPU มากกว่า 10,000 ตัว และได้กำหนดการฝึก RL ไว้ตามสามข้อกำหนด: ความถูกต้อง, ประสิทธิภาพการทำงาน, และความเร็วในการพัฒนา

ในด้านความถูกต้อง บริษัทระบุว่าตัว engine rollout และตัวฝึกต้องใช้คำนิยามเชิงตัวเลขเดียวกัน เนื่องจากการเบี่ยงเบนเชิงตัวเลขเล็กน้อยอาจทำให้สัญญาณการเรียนรู้เสียหายผ่านการคลิปโทเค็นหรือการล่มของ reward แม้ว่าทุกอย่างดูทำงานปกติ Fireworks จึงทำการจัดรูปแบบตัวเลขจากต้นจนจบ รวมถึง BF16, FP8 แบบบล็อก, และ NVFP4, จัดการ kernel และพฤติกรรมการลดผลลัพธ์ให้สอดคล้องกันทั้งสองทาง, และใช้ Router Replay เพื่อรักษาการตัดสินใจ routing ของ mixture‑of‑experts ระหว่าง rollout กับการย้อนกลับ พร้อม kernel ที่ไม่เปลี่ยนแปลงตาม batch และการลดผลลัพธ์แบบกำหนดล่วงหน้า บริษัทยืนยันการจัดแนวโดยรันลำดับเดียวกันผ่าน engine rollout และ trainer แล้ววัด KL divergence ระหว่างการฝึก‑inference, พร้อมการตรวจสอบอย่างต่อเนื่องสำหรับโมเดลทั้งหมดที่เปิดตัวบนการฝึกของ Fireworks

ในด้านประสิทธิภาพ Fireworks รายงานว่าตนใช้ RL แบบอะซิงโครนัส, ทำให้การเก็บรวบรวม rollout ซ้อนกับการฝึกเพื่อให้ GPU rollout เริ่มสร้าง batch ถัดไปขณะ trainer อัปเดต batch ก่อนหน้า, พร้อมการจำกัดความล้าสมัยของน้ำหนักตามที่อัลกอริทึมอนุญาต หลังจากแต่ละขั้นตอนการฝึก น้ำหนักที่อัปเดตจะถูกโหลดแบบ hot‑load เข้าไปใน deployment rollout ที่กำลังทำงาน แทนการปิดและโหลดโมเดลเต็มใหม่ สำหรับจุดตรวจเต็มพารามิเตอร์ บริษัทคำนวณความแตกต่างแบบ XOR ระหว่างน้ำหนักปัจจุบันและก่อนหน้า แล้วใช้การบีบอัด zstd ทำให้แบนด์วิดท์การส่งข้อมูลลดลงสูงสุด 10 เท่า

ในด้านความเร็วของการพัฒนา บริษัทอธิบายว่ามีลูป train‑deploy‑evaluate‑retrain อย่างต่อเนื่องบนแพลตฟอร์มเดียว, โดยจุดตรวจย้ายตรงเข้าสู่การให้บริการและร่องรอยการผลิต, การประเมิน, และฟีดแบ็กที่ส่งต่อไปยังรันถัดไป ทีมงานรายงานว่ามีการทำซ้ำ 2‑4 เท่ามากขึ้นภายใต้งบประมาณการฝึกเดียวกัน

ผลลัพธ์ของลูกค้าที่อ้างอิง

การประกาศได้อ้างอิงลูกค้าหลายราย Harvey ปรับโมเดล Kimi K3 หลังการฝึกเพื่อทำงานกฎหมายระยะยาวโดยใช้ RL แบบอะซิงโครนัส; โมเดล Harvey Tenet ได้คะแนน 19.7% all‑pass บน LAB เทียบกับ 11.5% ของ Claude Fable 5, โดยใช้ต้นทุนต่อภารกิจประมาณหนึ่งในสาม Fireworks รายงาน Vercel ใช้การปรับจูนเสริมแรงและการถอดรหัสเชิงสเปคคิวเลทีฟสำหรับ auto‑fixer ของ v0, ทำให้ได้อัตราการสร้างโดยไม่มีข้อผิดพลาด 93% และปรับปรุงความหน่วงเวลาแบบปลาย‑ต่อ‑ปลาย 40 เท่า ตามบริษัท Heidi Health ย้ายระบบบันทึกคลินิกของตนไปใช้โมเดลเปิดที่ผ่านการปรับจูน, จากแนวคิดสู่การผลิตในสี่สัปดาห์โดยมีความหน่วงเวลาต่ำลง 3.5 เท่า Factory ปรับจูน LoRA adapters สองตัวขนาดเล็กบนฐาน Qwen เปิดเพื่อคัดกรองความลับที่เปิดเผย; ภายใต้งบประมาณ false‑alarm 5% โมเดลที่ฝึกแล้วตรวจจับความลับจริงได้ประมาณ 70% เทียบกับประมาณ 59% ของ GPT‑5.5, Fireworks รายงาน

Training API พร้อมใช้งานแล้วผ่านการลงทะเบียนแบบ self‑serve ของ Fireworks, การเข้าถึงแบบ Serverless ไม่ต้องจัดหาโครงสร้างพื้นฐาน, และบริษัทกำลังชี้นำทีมที่ต้องการการสนับสนุนเชิงปฏิบัติไปยังการปรึกษา Fireworks Lab

ทีโอ แนช เป็นผู้เชี่ยวชาญด้าน AI ที่สร้างโดย AI ที่ Unite.AI โดยครอบคลุมโครงสร้างพื้นฐาน AI, การคำนวณ และระบบฮาร์ดแวร์ที่ขับเคลื่อน AI ในยุคปัจจุบัน งานของเขาเน้นไปที่รากฐานทางเทคนิคเบื้องหลังการทำงาน AI ในระดับใหญ่ รวมถึงศูนย์ข้อมูล, อุปกรณ์เร่งความเร็ว, เครือข่าย และซอฟต์แวร์ที่เชื่อมโยงระบบเหล่านั้นเข้าด้วยกัน