Model dan platform AI
Fireworks AI Membuat API Pelatihan Tersedia Secara Umum

Fireworks AI pada 31 Agustus 2026 mengumumkan ketersediaan umum API Pelatihan dan Fireworks Lab, membuka infrastruktur pelatihan dan peluncuran yang dikelola kepada tim ML yang ingin menjalankan loop pelatihan khusus pada model terbuka. API Pelatihan menghubungkan loop pelatihan Python milik pelanggan ke komputasi terdistribusi yang dikelola oleh Fireworks, mencakup baik pelatih yang menghitung gradien dan memperbarui model maupun penyebaran rollout yang menghasilkan sampel darinya.
Menurut pengaturan yang dijelaskan dalam pengumuman, pelanggan mengatur loop dari mana saja yang mereka pilih, tetap mengendalikan fungsi loss atau reward, data, dan lingkungan. Fireworks mengelola interaksi antara pelatih dan rollout, termasuk sinkronisasi bobot, pemulihan pertukaran yang gagal, dan penyelarasan pelatihan‑rollout. Perusahaan menempatkan API ini sebagai respons terhadap kendala yang diklaim tim ML laporkan dalam alur kerja pelatihan yang ada: pilihan model dan metode yang terbatas, kontrol parameter dan loop pelatihan yang terbatas, komputasi yang kaku, serta infrastruktur pelatihan dan rollout yang terfragmentasi.
Komputasi Serverless dan Dedicated
API Pelatihan menawarkan dua opsi komputasi. Pelatihan serverless memungkinkan pelanggan melatih adaptor LoRA pada infrastruktur bersama dengan penagihan per token, dengan proses sampling berjalan dalam sesi yang sama; Fireworks menyebutnya cocok untuk iterasi eksperimen, mengurangi risiko run yang lebih besar, atau menjalankan loop reinforcement learning yang bergantian antara rollout dan pelatihan. Pelatihan dedicated menargetkan pelatihan full‑parameter, model di luar kumpulan serverless, panjang konteks atau peringkat LoRA yang lebih besar, serta throughput berkelanjutan, dengan penagihan per jam GPU pada kapasitas elastis yang disesuaikan untuk setiap run.
Tingkat serverless terhubung ke pool bersama yang selalu aktif dengan daftar terkurasi model populer, kapasitas bersama, dan batas tarif per akun. Tingkat dedicated menyediakan pelatih dan penyebaran per run, mendukung mode LoRA dan full‑parameter hingga model mixture‑of‑experts terbesar, dan tidak memiliki kontensi atau batas tarif. Titik pemeriksaan yang menjanjikan dapat disebarkan ke inferensi produksi melalui UI atau API, dan penyebaran multi‑LoRA memberi setiap pelanggan atau kasus penggunaan model yang disetel sendiri tanpa infrastruktur terpisah, kata perusahaan.
Tiga Permukaan Pelatihan
API Pelatihan berdampingan dengan dua permukaan lain pada platform pelatihan Fireworks. Managed Training, yang ditujukan untuk insinyur ML, menjalankan pekerjaan bawaan di mana pelanggan memilih metode — SFT, DPO, atau RL — dan model dasar, diluncurkan dari UI atau API. Fireworks Lab, yang juga tersedia secara umum sejak pengumuman, menempatkan peneliti dan insinyur yang ditempatkan di depan bersama tim pelanggan; keterlibatan dimulai dengan diagnosis yang mendefinisikan kemampuan, baseline, kriteria keberhasilan, dan ruang lingkup, kemudian beralih ke implementasi berjangka waktu, dan pelanggan menyimpan model siap produksi, rangka evaluasi, pipeline data, loop pelatihan, serta resepnya.
API Pelatihan sendiri ditujukan untuk peneliti ML dan mendukung SFT, DPO, ORPO, RL, dan distilasi, mulai dari LoRA pada komputasi serverless hingga pelatihan full‑parameter pada klaster dedicated.
Pembelajaran Penguatan pada Skala Besar
Fireworks mengatakan bahwa mereka termasuk di antara sedikit organisasi di luar laboratorium frontier yang telah menjalankan reinforcement learning pada lebih dari 10.000 GPU, dan mereka merumuskan pelatihan RL berdasarkan tiga persyaratan: kebenaran, efisiensi kinerja, dan kecepatan pengembangan.
Berkenaan dengan kebenaran, perusahaan menyatakan bahwa mesin rollout dan pelatih harus berbagi definisi numerik yang sama, karena drift numerik kecil dapat merusak sinyal pembelajaran melalui pemotongan token atau runtuhnya reward meskipun semua tampak berfungsi. Fireworks menyelaraskan format numerik secara ujung‑ke‑ujung, termasuk BF16, FP8 blok‑wise, dan NVFP4, menyelaraskan kernel dan perilaku reduksi di kedua jalur, serta menggunakan Router Replay untuk mempertahankan keputusan routing mixture‑of‑experts antara rollout dan pass mundur bersama kernel yang tidak tergantung batch dan reduksi deterministik. Perusahaan mengatakan mereka memvalidasi penyelarasan dengan menjalankan urutan identik melalui mesin rollout dan pelatih serta mengukur KL divergence antara pelatihan‑inference, dengan validasi berkelanjutan untuk semua model yang diluncurkan pada pelatihan Fireworks.
Berkenaan dengan kinerja, Fireworks menyatakan bahwa mereka menjalankan RL asinkron, menumpuk pengumpulan rollout dengan pelatihan sehingga GPU rollout mulai menghasilkan batch berikutnya sementara pelatih memperbarui batch sebelumnya, dengan keterbatasan kebusukan bobot yang dibatasi sesuai algoritma. Setelah setiap langkah pelatihan, bobot yang diperbarui dimuat secara langsung ke dalam penyebaran rollout yang sedang berjalan alih‑alih menghentikannya dan memuat ulang model penuh. Untuk titik pemeriksaan full‑parameter, perusahaan mengatakan mereka menghitung selisih XOR antara bobot saat ini dan sebelumnya serta menerapkan kompresi zstd, menghasilkan pengurangan hingga 10× pada lebar pita transmisi.
Berkenaan dengan kecepatan pengembangan, perusahaan menggambarkan loop kontinu train‑deploy‑evaluate‑retrain pada satu platform, dengan titik pemeriksaan langsung berpindah ke layanan dan jejak produksi, evaluasi, serta umpan balik yang memberi makan run berikutnya. Mereka melaporkan tim mencatat dua hingga empat kali lebih banyak iterasi dengan anggaran pelatihan yang sama.
Hasil Pelanggan yang Dikutip
Pengumuman tersebut menyebutkan beberapa pelanggan. Harvey melatih ulang Kimi K3 untuk pekerjaan hukum jangka panjang menggunakan RL asinkron; model Harvey Tenet mencatat 19,7 % all‑pass pada LAB dibandingkan 11,5 % untuk Claude Fable 5, dengan biaya per tugas sekitar sepertiga, kata Fireworks. Vercel menggunakan fine‑tuning reinforcement dan decoding spekulatif untuk auto‑fixer v0, mencapai tingkat generasi bebas error 93 % dan peningkatan latensi end‑to‑end 40×, menurut perusahaan. Heidi Health memindahkan scribe klinisnya ke model terbuka yang telah di‑fine‑tune, beralih dari bukti konsep ke produksi dalam empat minggu dengan latensi 3,5× lebih rendah. Factory melakukan fine‑tune dua adaptor LoRA kecil pada basis Qwen terbuka untuk menyaring rahasia yang terekspos; dengan anggaran alarm palsu 5 %, model yang dilatih menangkap sekitar 70 % rahasia nyata dibandingkan kira‑kira 59 % untuk GPT‑5.5, lapor Fireworks.
API Pelatihan kini tersedia melalui pendaftaran swalayan Fireworks, dengan akses serverless yang tidak memerlukan penyediaan, dan perusahaan mengarahkan tim yang menginginkan dukungan langsung ke konsultasi Fireworks Lab.












