AI-modeller og platforme

Fireworks AI gør Training API generelt tilgængelig

mm
Føj Unite.AI til dine foretrukne kilder på Google

Fireworks AI annoncerede den 31. august 2026 den generelle tilgængelighed af sin Training API og Fireworks Lab, og åbner sin administrerede trænings‑ og udrulningsinfrastruktur for ML‑teams, der ønsker at køre tilpassede træningssløjfer på åbne modeller. Training API’en forbinder en kundes egen Python‑træningssløjfe med Fireworks‑administreret distribueret beregning, og dækker både træneren, som beregner gradienter og opdaterer modellen, samt udrulningsdeploymenten, som genererer prøver fra den.

I henhold til den ordning, der beskrives i meddelelsen, orkestrerer kunden sløjfen fra hvor de vil, og bevarer kontrollen over tab‑ eller belønningsfunktionen, dataene og miljøet. Fireworks håndterer interaktionen mellem træner og udrulning, herunder vægt‑synkronisering, genopretning efter mislykket udskiftning og trænings‑udrulnings‑justering. Virksomheden positionerer API’en som et svar på de begrænsninger, som ML‑teams ifølge dem har rapporteret i eksisterende trænings‑workflows: begrænset valg af modeller og metoder, begrænset kontrol over parametre og træningssløjfer, stiv beregning og fragmenteret trænings‑ og udrulningsinfrastruktur.

Serverløs og dedikeret beregning

Training API’en tilbyder to beregningsmuligheder. Serverløs træning giver kunder mulighed for at træne LoRA‑adaptere på delt infrastruktur med fakturering pr. token, hvor sampling kører i samme session; Fireworks beskriver det som velegnet til at iterere på eksperimenter, mindske risikoen ved større kørsel eller køre forstærknings‑læringssløjfer, der skifter mellem udrulning og træning. Dedikeret træning sigter mod fuld‑parameter‑træning, modeller uden for den serverløse pulje, længere kontekstlængder eller LoRA‑ranger, samt vedvarende gennemløb, faktureret pr. GPU‑time på elastisk kapacitet tilpasset hver kørsel.

Den serverløse tier tilknyttes en altid‑aktiv delt pulje med en udvalgt liste over populære modeller, delt kapacitet og kontobaserede hastighedsgrænser. Den dedikerede tier provisionerer en træner og deployment pr. kørsel, understøtter LoRA‑ og fuld‑parameter‑tilstande op til de største mixture‑of‑experts‑modeller, og har ingen konkurrence‑ eller hastighedsbegrænsninger. Lovende checkpoints kan deployeres til produktions‑inference via UI‑en eller API‑en, og multi‑LoRA‑deployment giver hver kunde eller anvendelsestilfælde sin egen finjusterede model uden separat infrastruktur, siger virksomheden.

Tre træningsflader

Training API’en sidder ved siden af to andre flader på Fireworks træningsplatform. Managed Training, rettet mod ML‑ingeniører, kører indbyggede jobs, hvor kunden vælger en metode — SFT, DPO eller RL — og en grundmodel, og starter fra UI‑en eller API‑en. Fireworks Lab, også generelt tilgængelig fra meddelelsen, indlejrer fremad‑deployede forskere og ingeniører i kundeteams; engagementerne starter med en diagnose, der definerer kapacitet, baseline, succeskriterier og omfang, hvorefter de går over i en tidsbegrænset implementering, og kunden beholder den produktionsklare model, evaluerings‑harness, datapipelines, træningssløjfe og opskrifter.

Training API’en selv er rettet mod ML‑forskere og understøtter SFT, DPO, ORPO, RL og destillation, fra LoRA på serverløs beregning til fuld‑parameter‑træning på dedikerede klynger.

Forstærkningslæring i stor skala

Fireworks siger, at de er blandt de få organisationer uden for frontier‑labs, der har kørt forstærkningslæring på mere end 10.000 GPU‑er, og de indrammer RL‑træning omkring tre krav: korrekthed, ydeevneeffektivitet og udviklingshastighed.

Med hensyn til korrekthed sagde virksomheden, at udrulnings‑motoren og træneren skal dele den samme numeriske definition, da lille numerisk drift kan korrumpere et læringssignal gennem token‑klipning eller belønnings‑kollaps, mens alt ser ud til at fungere. Fireworks justerer numeriske formater fra ende til ende, herunder BF16, blok‑vis FP8 og NVFP4, synkroniserer kerner og reduktionsadfærd på begge veje, og bruger Router Replay til at bevare mixture‑of‑experts‑routeringsbeslutninger mellem udrulning og baglæns pass sammen med batch‑invariante kerner og deterministiske reduktioner. Virksomheden sagde, at de validerer justeringen ved at køre identiske sekvenser gennem udrulnings‑motoren og træneren og måle trænings‑inference KL‑divergens, med løbende validering for alle modeller, der lanceres på Fireworks træning.

Med hensyn til ydeevne sagde Fireworks, at de kører asynkron RL, hvor udrulnings‑indsamling overlappes med træning, så udrulnings‑GPU‑erne begynder at generere den næste batch, mens træneren opdaterer den forrige, med begrænset vægt‑ældning hvor algoritmen tillader det. Efter hvert trænings‑trin indlæses de opdaterede vægte direkte i den kørende udrulnings‑deployment i stedet for at nedlægge den og genindlæse en fuld model. For fuld‑parameter‑checkpoints siger virksomheden, at de beregner en XOR‑diff mellem aktuelle og tidligere vægte og anvender zstd‑komprimering, hvilket giver op til en 10‑gange reduktion i overførsels‑båndbredde.

Med hensyn til udviklingshastighed beskrev virksomheden en kontinuerlig træning‑deploy‑evaluer‑re‑trænings‑sløjfe på én platform, hvor checkpoints flyttes direkte ind i serving og produktions‑spor, evalueringer og feedback, som fodrer den næste kørsel. De siger, at teams rapporterer to til fire gange flere iterationer på samme træningsbudget.

Kunde‑resultater nævnt

Meddelelsen nævnte flere kunder. Harvey eftertrænede Kimi K3 til langsigtet juridisk arbejde ved hjælp af asynkron RL; deres Harvey Tenet‑model opnåede 19,7 % all‑pass på LAB mod 11,5 % for Claude Fable 5, til ca. en tredjedel af omkostningerne pr. opgave, sagde Fireworks. Vercel brugte forstærknings‑finjustering og spekulativ dekodning til v0’s auto‑fixer, og nåede en 93 % fejlfri genereringsrate samt en 40‑gange forbedring af end‑to‑end‑latens, ifølge virksomheden. Heidi Health flyttede sin kliniske skribent til finjusterede åbne modeller, gik fra proof‑of‑concept til produktion på fire uger med 3,5‑gange lavere latens. Factory finjusterede to små LoRA‑adaptere på en åben Qwen‑base for at screene efter eksponerede hemmeligheder; med et 5 % falsk‑alarm‑budget fangede den trænede model omkring 70 % af de reelle hemmeligheder versus ca. 59 % for GPT‑5.5, rapporterede Fireworks.

Training API’en er nu tilgængelig via Fireworks’ selvbetjente tilmelding, hvor serverløs adgang kræver ingen provisionering, og virksomheden henviser teams, der ønsker praktisk support, til Fireworks Lab‑konsultationer.

Theo Nash er en AI-genereret specialist hos Unite.AI, der dækker AI-infrastruktur, beregning og de hardware-systemer, der driver moderne kunstig intelligens. Hans arbejde fokuserer på de tekniske grundlag for store AI-arbejdsbyrder, herunder datacentre, acceleratorer, netværk og software-stacks, der binder dem sammen.
Med en analytisk og ingeniør-dreven perspektiv undersøger Theo, hvordan fremskridt i GPU'er, brugerdefineret silicium, hukommelsesarkitekturer og distribuerede systemer muliggør nye generationer af AI-modeller. Han lægger særlig vægt på ydelses-omkostningsforhold, energoeffektivitet, skalerbarhed og de praktiske begrænsninger, der former den virkelige udvikling af AI-infrastruktur.
Artikler skrevet af Theo Nash er AI-genereret og gennemgået af Unite.AIs redaktionelle team for at sikre teknisk nøjagtighed, klarhed og ansvarlig dækning af den hurtigt udviklende AI-beregningsskala.