AI-modeller og plattformer

Fireworks AI gjør Training API generelt tilgjengelig

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Fireworks AI kunngjorde 31. august 2026 at Training API og Fireworks Lab nå er generelt tilgjengelige, og åpner sin administrerte trenings‑ og utrullingsinfrastruktur for ML‑team som ønsker å kjøre egendefinerte treningsløkker på åpne modeller. Training API kobler en kundes egen Python‑treningsløkke til Fireworks‑administrert distribuert datakraft, og dekker både treneren som beregner gradienter og oppdaterer modellen, samt utrullings‑distribusjonen som genererer prøver fra den.

I henhold til ordningen beskrevet i kunngjøringen, orkestrerer kunden løkken fra hvor de måtte ønske, og beholder kontrollen over taps‑ eller belønningsfunksjonen, dataene og miljøet. Fireworks håndterer samspillet mellom trener og utrulling, inkludert vekt‑synkronisering, gjenoppretting ved mislykket bytte og justering mellom trening og utrulling. Selskapet presenterer API‑et som et svar på de begrensningene ML‑teamene har rapportert i eksisterende treningsarbeidsflyter: begrenset valg av modeller og metoder, begrenset kontroll over parametere og treningsløkker, stiv datakraft og fragmentert infrastruktur for trening og utrulling.

Serverløs og dedikert beregning

Training API tilbyr to beregningsalternativer. Serverløs trening lar kunder trene LoRA‑adaptere på delt infrastruktur med fakturering per token, med prøvetaking i samme økt; Fireworks beskriver dette som egnet for å iterere på eksperimenter, redusere risikoen ved større kjøringer, eller kjøre forsterknings‑læringsløkker som veksler mellom utrulling og trening. Dedikert trening retter seg mot full‑parameter‑trening, modeller utenfor den serverløse puljen, lengre kontekst‑lengder eller LoRA‑rangeringer, og vedvarende gjennomstrømning, fakturert per GPU‑time på elastisk kapasitet tilpasset hver kjøring.

Det serverløse nivået kobles til en alltid‑på delt pool med en kuratert liste over populære modeller, delt kapasitet og kontobaserte hastighetsbegrensninger. Det dedikerte nivået oppretter en trener og distribusjon per kjøring, støtter LoRA‑ og full‑parameter‑moduser opp til de største mixture‑of‑experts‑modellene, og har ingen konkurranse eller hastighetsbegrensninger. Lovende sjekkpunkter kan distribueres til produksjons‑inference via UI‑en eller API‑et, og multi‑LoRA‑distribusjon gir hver kunde eller brukstilfelle sin egen finjusterte modell uten separat infrastruktur, opplyser selskapet.

Tre treningsflater

Training API ligger ved siden av to andre flater på Fireworks‑treningsplattformen. Managed Training, rettet mot ML‑ingeniører, kjører innebygde jobber der kunden velger en metode – SFT, DPO eller RL – og en basismodell, og starter fra UI‑en eller API‑et. Fireworks Lab, også generelt tilgjengelig fra kunngjøringen, integrerer fremover‑utplasserte forskere og ingeniører med kundeteam; engasjementene starter med en diagnose som definerer evnen, grunnlinjen, suksesskriterier og omfang, deretter går de inn i en tidsavgrenset implementering, og kunden beholder den produksjonsklare modellen, evaluerings‑rammeverket, datapipelines, treningsløkken og oppskrifter.

Selve Training API er rettet mot ML‑forskere og støtter SFT, DPO, ORPO, RL og destillasjon, fra LoRA på serverløs beregning til full‑parameter‑trening på dedikerte klynger.

Forsterknings‑læring i stor skala

Fireworks hevder at de er blant de få organisasjonene utenfor frontier‑labene som har kjørt forsterknings‑læring på mer enn 10 000 GPU‑er, og de rammer inn RL‑trening rundt tre krav: korrekthet, ytelseseffektivitet og utviklingshastighet.

Når det gjelder korrekthet, sier selskapet at utrullingsmotoren og treneren må dele samme numeriske definisjon, siden liten numerisk avdrift kan korrumpere et læringssignal gjennom token‑klipping eller belønnings‑kollaps mens alt ser ut til å fungere. Fireworks justerer numeriske formater fra ende til ende, inkludert BF16, blokk‑vis FP8 og NVFP4, synkroniserer kjerner og reduksjonsadferd på begge veier, og bruker Router Replay for å bevare mixture‑of‑experts‑rutingbeslutninger mellom utrulling og bakoverpass, sammen med batch‑invariante kjerner og deterministiske reduksjoner. Selskapet oppgir at de validerer justeringen ved å kjøre identiske sekvenser gjennom utrullingsmotoren og treneren og måle KL‑divergens mellom trening og inferens, med kontinuerlig validering for alle modeller som lanseres på Fireworks‑trening.

Når det gjelder ytelse, sier Fireworks at de kjører asynkron RL, der utrullings‑samlingen overlappes med treningen slik at utrullings‑GPU‑er begynner å generere neste batch mens treneren oppdaterer den forrige, med begrenset vekt‑stalehet der algoritmen tillater det. Etter hvert treningssteg lastes oppdaterte vekter inn i den kjørende utrullings‑distribusjonen i sanntid i stedet for å stoppe den og laste inn en full modell på nytt. For full‑parameter‑sjekkpunkter beregner selskapet en XOR‑diff mellom nåværende og tidligere vekter og bruker zstd‑komprimering, noe som gir opptil 10‑ganger reduksjon i overføringsbåndbredde.

Når det gjelder utviklingshastighet, beskriver selskapet en kontinuerlig tren‑distribuer‑evaluer‑retrain‑sløyfe på én plattform, der sjekkpunkter går direkte inn i serving og produksjonsspor, evalueringer og tilbakemeldinger som mater neste kjøring. De opplyser at team rapporterer to til fire ganger flere iterasjoner på samme treningsbudsjett.

Kunde­resultater som er sitert

Kunngjøringen nevnte flere kunder. Harvey ettertrente Kimi K3 for langsiktige juridiske oppgaver ved hjelp av asynkron RL; deres Harvey Tenet-modell oppnådde 19,7 % all‑pass på LAB sammenlignet med 11,5 % for Claude Fable 5, til omtrent en tredjedel av kostnaden per oppgave, rapporterte Fireworks. Vercel brukte forsterknings‑finjustering og spekulativ dekoding for v0‑s auto‑fixer, og nådde en 93 % feilfri generasjonsrate samt en 40‑ganger forbedring i ende‑til‑ende‑latens, ifølge selskapet. Heidi Health flyttet sin kliniske skribent til finjusterte åpne modeller, og gikk fra proof‑of‑concept til produksjon på fire uker med 3,5‑ganger lavere latens. Factory finjusterte to små LoRA‑adaptere på en åpen Qwen‑base for å filtrere ut eksponerte hemmeligheter; med et falsk‑alarm‑budsjett på 5 % fanget den trente modellen omtrent 70 % av de reelle hemmelighetene versus omtrent 59 % for GPT‑5.5, rapporterte Fireworks.

Training API er nå tilgjengelig via Fireworks’ selvbetjente registrering, med serverløs tilgang som ikke krever noen provisjonering, og selskapet henviser team som ønsker praktisk støtte til Fireworks Lab‑konsultasjoner.

Theo Nash er en AI-generert spesialist hos Unite.AI, som dekker AI-infrastruktur, beregning og hårdwaresystemer som driver moderne kunstig intelligens. Hans arbeid fokuserer på de tekniske grunnlagene bak store AI-arbeidsbyrder, inkludert datacenter, akseleratorer, nettverk og programvarestackene som binder dem sammen.
Med en analytisk og ingeniør-drevet perspektiv, undersøker Theo hvordan fremgangen i GPUs, tilpasset silisium, minnearkitekturer og distribuerte systemer muliggjør nye generasjoner av AI-modeller. Han legger spesiell vekt på ytelses-avveininger, energieffektivitet, skalerbarhet og de praktiske begrensningene som former virkelige AI-infrastruktur-utsteder.
Artikler skrevet av Theo Nash er AI-generert og gjennomgått av Unite.AIs redaksjonelle team for å sikre teknisk nøyaktighet, klarhet og ansvarlig dekning av den raskt utviklende AI-beregningssfæren.