AI-modellen en platforms

Fireworks AI maakt Training API algemeen beschikbaar

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Fireworks AI kondigde op 31 augustus 2026 de algemene beschikbaarheid van zijn Training API en Fireworks Lab aan, waarmee zijn beheerde trainings- en uitrolinfrastructuur wordt geopend voor ML‑teams die aangepaste trainingslussen op open modellen willen uitvoeren. De Training API verbindt de eigen Python‑trainingslus van een klant met door Fireworks beheerde gedistribueerde compute, waarbij zowel de trainer die gradients berekent en het model bijwerkt als de uitrol‑deployment die monsters genereert, wordt gedekt.

Volgens de regeling die wordt beschreven in de aankondiging, orkestreert de klant de lus vanaf elke gewenste locatie, waarbij hij de controle behoudt over de verlies‑ of beloningsfunctie, de data en de omgeving. Fireworks beheert de interactie tussen trainer en uitrol, inclusief gewichtsynchronisatie, herstel van mislukte swaps en afstemming tussen training en uitrol. Het bedrijf positioneert de API als een reactie op de beperkingen die volgens hen door ML‑teams zijn gemeld in bestaande trainingsworkflows: beperkte keuze in modellen en methoden, beperkte controle over parameters en trainingslussen, starre compute en gefragmenteerde trainings‑ en uitrolinfrastructuur.

Serverless en Dedicated Compute

De Training API biedt twee compute‑opties. Serverless training stelt klanten in staat LoRA‑adapters te trainen op gedeelde infrastructuur met per‑token facturering, waarbij sampling in dezelfde sessie plaatsvindt; Fireworks beschrijft dit als geschikt voor het itereren op experimenten, het verkleinen van risico’s bij grotere runs, of het uitvoeren van reinforcement‑learning‑lussen die afwisselen tussen uitrol en training. Dedicated training richt zich op full‑parameter training, modellen buiten de serverless‑pool, langere contextlengtes of LoRA‑rangen, en een constante doorvoersnelheid, gefactureerd per GPU‑uur op elastische capaciteit die per run wordt geschaald.

De serverless‑laag is gekoppeld aan een altijd‑aan gedeelde pool met een samengestelde lijst van populaire modellen, gedeelde capaciteit en per‑account limieten. De dedicated‑laag voorziet per run een trainer en deployment, ondersteunt LoRA‑ en full‑parameter modi tot aan de grootste mixture‑of‑experts‑modellen, en kent geen contention of limieten. Veelbelovende checkpoints kunnen via de UI of API naar productie‑inference worden uitgerold, en multi‑LoRA‑deployment geeft elke klant of use‑case zijn eigen afgestemde model zonder aparte infrastructuur, aldus het bedrijf.

Drie trainingsoppervlakken

De Training API staat naast twee andere oppervlakken op het Fireworks trainingsplatform. Managed Training, gericht op ML‑engineers, voert ingebouwde taken uit waarin de klant een methode — SFT, DPO of RL — en een basismodel kiest, en start vanuit de UI of API. Fireworks Lab, eveneens algemeen beschikbaar sinds de aankondiging, integreert forward‑deployed onderzoekers en engineers met klantteams; de samenwerking begint met een diagnose die de capaciteit, baseline, succescriteria en scope definieert, waarna een tijdgebonden implementatie volgt, en de klant behoudt het productieklare model, de evaluatie‑harnas, datapijplijnen, trainingslus en recepten.

De Training API zelf is gericht op ML‑onderzoekers en ondersteunt SFT, DPO, ORPO, RL en distillatie, van LoRA op serverless compute tot full‑parameter training op dedicated clusters.

Reinforcement Learning op schaal

Fireworks stelt dat het tot de weinige organisaties buiten de frontier‑labs behoort die reinforcement learning hebben uitgevoerd op meer dan 10.000 GPU’s, en het kadert RL‑training rond drie vereisten: juistheid, prestatie‑efficiëntie en ontwikkelingssnelheid.

Wat juistheid betreft, zei het bedrijf dat de rollout‑engine en trainer dezelfde numerieke definitie moeten delen, omdat kleine numerieke drift een leersignaal kan corrumperen via token‑clipping of reward‑instorting, terwijl alles verder lijkt te werken. Fireworks stemt numerieke formaten van begin tot eind op elkaar af, inclusief BF16, block‑wise FP8 en NVFP4, stemt kernels en reductiegedrag over beide paden af, en gebruikt Router Replay om mixture‑of‑experts routing‑beslissingen tussen rollout en backward‑pass te behouden, naast batch‑invariante kernels en deterministische reducties. Het bedrijf zegt de afstemming te valideren door identieke sequenties door de rollout‑engine en trainer te laten lopen en de train‑inference KL‑divergentie te meten, met continue validatie voor alle modellen die op Fireworks training worden gelanceerd.

Wat prestaties betreft, meldt Fireworks dat het asynchrone RL uitvoert, waarbij de verzameling van rollout wordt overlapt met de training zodat rollout‑GPU’s de volgende batch beginnen te genereren terwijl de trainer de vorige bijwerkt, met begrensde gewichts‑staleness waar het algoritme dit toelaat. Na elke trainingsstap worden bijgewerkte gewichten hot‑geladen in de draaiende rollout‑deployment in plaats van deze af te breken en een volledig model opnieuw te laden. Voor full‑parameter checkpoints berekent het bedrijf een XOR‑verschil tussen de huidige en vorige gewichten en past zstd‑compressie toe, wat tot een reductie van tot 10× in transmissie‑bandbreedte oplevert.

Wat ontwikkelingssnelheid betreft, beschrijft het bedrijf een continue train‑deploy‑evaluate‑retrain‑lus op één platform, waarbij checkpoints direct naar serving en productietracés, evaluaties en feedback gaan die de volgende run voeden. Het meldt dat teams twee tot vier keer meer iteraties rapporteren binnen hetzelfde trainingsbudget.

Geciteerde klantresultaten

De aankondiging noemde verschillende klanten. Harvey trainde Kimi K3 na‑training voor langdurig juridisch werk met asynchrone RL; het Harvey Tenet‑model behaalde 19,7 % all‑pass op LAB tegenover 11,5 % voor Claude Fable 5, tegen ongeveer een derde van de kosten per taak, aldus Fireworks. Vercel gebruikte reinforcement fine‑tuning en speculatieve decodering voor de auto‑fixer van v0, waarmee een foutloze generatiegraad van 93 % en een 40× verbetering in end‑to‑end‑latentie werd bereikt, volgens het bedrijf. Heidi Health zette haar klinische scribe over op fijn‑getunede open modellen, van proof‑of‑concept naar productie in vier weken met 3,5× lagere latentie. Factory fine‑tuned twee kleine LoRA‑adapters op een open Qwen‑basis om te screenen op blootgestelde geheimen; met een false‑alarmbudget van 5 % ving het getrainde model ongeveer 70 % van de echte geheimen versus ongeveer 59 % voor GPT‑5.5, meldde Fireworks.

De Training API is nu beschikbaar via de self‑serve aanmelding van Fireworks, waarbij serverless‑toegang geen provisioning vereist, en het bedrijf verwijst teams die hands‑on ondersteuning wensen naar Fireworks Lab‑consultaties.

Theo Nash is een AI-gegenereerde specialist bij Unite.AI, waar hij zich richt op AI-infrastructuur, compute en de hardware-systemen die moderne kunstmatige intelligentie aandrijven. Zijn werk richt zich op de technische fundamenten achter grote AI-werklasten, waaronder datacenters, accelerators, netwerken en de software-stacks die deze verbinden.
Met een analytische en technisch gedreven perspectief onderzoekt Theo hoe vooruitgang in GPUs, custom silicon, geheugenarchitecturen en gedistribueerde systemen nieuwe generaties AI-modellen mogelijk maken. Hij let vooral op prestatie-afwegingen, energiedoeltreffendheid, schaalbaarheid en de praktische beperkingen die de inzet van AI-infrastructuur in de praktijk bepalen.
Artikelen geschreven door Theo Nash zijn AI-gegenereerd en worden beoordeeld door het redactionele team van Unite.AI om technische nauwkeurigheid, duidelijkheid en verantwoorde dekking van het snel evoluerende AI-computelandschap te garanderen.