AI-modeller och plattformar

Fireworks AI gör Training API allmänt tillgängligt

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Fireworks AI den 31 augusti 2026 annonserade den allmänna tillgängligheten av sitt Training API och Fireworks Lab, och öppnade sin hanterade tränings‑ och utrullningsinfrastruktur för ML‑team som vill köra anpassade träningsloopar på öppna modeller. Training API kopplar en kunds egna Python‑träningsloop till Fireworks‑hanterad distribuerad beräkning, och omfattar både tränaren som beräknar gradienter och uppdaterar modellen samt utrullningsdistributionen som genererar prover från den.

Enligt arrangemanget som beskrivs i annonsen styr kunden loopen varifrån de vill, och behåller kontrollen över förlust‑ eller belöningsfunktionen, datan och miljön. Fireworks hanterar interaktionen mellan tränare och utrullning, inklusive vikt‑synkronisering, återhämtning vid misslyckade byten och justering mellan träning och utrullning. Företaget positionerar API‑t som ett svar på de begränsningar som ML‑team enligt dem har rapporterat i befintliga träningsarbetsflöden: begränsat modell‑ och metodval, inskränkt kontroll över parametrar och träningsloopar, stel beräkningskapacitet och fragmenterad tränings‑ och utrullningsinfrastruktur.

Serverlös och dedikerad beräkning

Training API erbjuder två beräkningsalternativ. Serverlös träning låter kunder träna LoRA‑adaptrar på delad infrastruktur med fakturering per token, med sampling som körs i samma session; Fireworks beskriver det som lämpligt för att iterera på experiment, minska riskerna för större körningar eller köra förstärkningsinlärningsloopar som växlar mellan utrullning och träning. Dedikerad träning riktar sig mot full‑parameter‑träning, modeller utanför den serverlösa poolen, längre kontextlängder eller LoRA‑rankningar samt hållbar genomströmning, fakturerad per GPU‑timme på elastisk kapacitet anpassad för varje körning.

Den serverlösa nivån är kopplad till en alltid‑på aktiv delad pool med en kuraterad lista över populära modeller, delad kapacitet och kontobaserade hastighetsgränser. Den dedikerade nivån tillhandahåller en tränare och distribution per körning, stödjer LoRA‑ och full‑parameter‑lägen upp till de största mixture‑of‑experts‑modellerna, och har ingen konkurrens eller hastighetsgränser. Lovande checkpoints kan distribueras till produktionsinferenz via UI eller API, och multi‑LoRA‑distribution ger varje kund eller användningsfall sin egen finjusterade modell utan separat infrastruktur, enligt företaget.

Tre träningsytor

Training API finns bredvid två andra ytor på Fireworks träningsplattform. Managed Training, riktad mot ML‑ingenjörer, kör inbyggda jobb där kunden väljer en metod — SFT, DPO eller RL — och en basmodell, och startar från UI eller API. Fireworks Lab, som också är allmänt tillgängligt sedan meddelandet, placerar framåtrullade forskare och ingenjörer i kundteam; samarbeten inleds med en diagnos som definierar förmågan, baslinjen, framgångskriterierna och omfattningen, förflyttas sedan till en tidsbegränsad implementering, och kunden behåller den produktionsklara modellen, utvärderingsramverket, datapipelines, träningsloop och recept.

Training API är i sig riktad mot ML‑forskare och stödjer SFT, DPO, ORPO, RL och destillation, från LoRA på serverlös beräkning till full‑parameter‑träning på dedikerade kluster.

Förstärkningsinlärning i stor skala

Fireworks säger att de är bland de få organisationerna utanför frontier‑labben som har bedrivit förstärkningsinlärning på mer än 10 000 GPU:er, och de strukturerar RL‑träning kring tre krav: korrekthet, prestandaeffektivitet och utvecklingshastighet.

När det gäller korrekthet säger företaget att utrullningsmotorn och tränaren måste dela samma numeriska definition, eftersom liten numerisk drift kan förstöra en lärsignal genom token‑klippning eller belöningskollaps medan allt verkar fungera. Fireworks justerar numeriska format från början till slut, inklusive BF16, block‑vis FP8 och NVFP4, synkroniserar kärnor och reduktionsbeteende i båda vägarna, och använder Router Replay för att bevara mixture‑of‑experts‑routningsbeslut mellan utrullning och bakåtpass, tillsammans med batch‑invarianta kärnor och deterministiska reduceringar. Företaget säger att de validerar justeringen genom att köra identiska sekvenser genom utrullningsmotorn och tränaren och mäta KL‑divergens mellan träning och inferens, med kontinuerlig validering för alla modeller som lanseras på Fireworks‑träning.

När det gäller prestanda säger Fireworks att de kör asynkron RL, där utrullningsinsamling överlappar med träning så att utrullnings‑GPU:er börjar generera nästa batch medan tränaren uppdaterar den föregående, med begränsad vikt‑stagnation där algoritmen tillåter det. Efter varje träningssteg laddas de uppdaterade vikterna in i den pågående utrullningsdistributionen i realtid istället för att riva ner den och ladda om en hel modell. För full‑parameter‑checkpoints säger företaget att de beräknar en XOR‑diff mellan aktuella och tidigare vikter och applicerar zstd‑komprimering, vilket ger upp till 10‑faldig minskning av överföringsbandbredden.

När det gäller utvecklingshastighet beskrev företaget en kontinuerlig trän‑distribuera‑utvärdera‑omträna‑loop på en plattform, där checkpoints flyttas direkt till tjänstgöring och produktionsspår, utvärderingar och återkoppling som matar in i nästa körning. De säger att team rapporterar två till fyra gånger fler iterationer med samma träningsbudget.

Kundresultat som nämns

Meddelandet nämnde flera kunder. Harvey eftertränade Kimi K3 för långsiktigt juridiskt arbete med asynkron RL; deras Harvey Tenet‑modell fick 19,7 % all‑pass på LAB jämfört med 11,5 % för Claude Fable 5, till ungefär en tredjedel av kostnaden per uppgift, enligt Fireworks. Vercel använde förstärknings‑finjustering och spekulativ avkodning för v0:s auto‑fixer, och nådde en 93 % fel‑fri genereringsgrad samt en 40‑gångs förbättring av total latens, enligt företaget. Heidi Health flyttade sin kliniska skrivare till finjusterade öppna modeller, och gick från konceptbevis till produktion på fyra veckor med 3,5‑gångs lägre latens. Factory finjusterade två små LoRA‑adaptrar på en öppen Qwen‑bas för att filtrera bort exponerade hemligheter; med en falsk‑larmbudget på 5 % fångade den tränade modellen cirka 70 % av de verkliga hemligheterna jämfört med ungefär 59 % för GPT‑5.5, rapporterade Fireworks.

Training API är nu tillgängligt via Fireworks självbetjäningsregistrering, där serverlös åtkomst kräver ingen provisionering, och företaget hänvisar team som vill ha praktiskt stöd till Fireworks Lab‑konsultationer.

Theo Nash är en AI-genererad specialist på Unite.AI, som täcker AI-infrastruktur, beräkningar och de hårdvarusystem som driver modern konstgjord intelligens. Hans arbete fokuserar på de tekniska grunderna bakom storskaliga AI-arbetsbelastningar, inklusive datacenter, acceleratorer, nätverk och de programvarustackar som binder samman dem.
Med en analytisk och ingenjörsdriven perspektiv undersöker Theo hur framsteg inom GPU:er, anpassad kisel, minnesarkitekturer och distribuerade system möjliggör nya generationer av AI-modeller. Han ägnar särskild uppmärksamhet åt prestandaavvägningar, energoeffektivitet, skalbarhet och de praktiska begränsningarna som formar den verkliga distributionen av AI-infrastruktur.
Artiklar skrivna av Theo Nash är AI-genererade och granskade av Unite.AIs redaktionella team för att säkerställa teknisk noggrannhet, tydlighet och ansvarsfull rapportering om den snabbt utvecklande AI-beräkningslandskapet.