AI-mallit ja alustat
Fireworks AI tekee Training API:n yleisesti saatavaksi

Fireworks AI ilmoitti 31. elokuuta 2026 Training API:n ja Fireworks Labin yleisestä saatavuudesta, avaten hallinnoidun koulutus- ja käyttöönotto‑infrastruktuurinsa koneoppimistiimeille, jotka haluavat suorittaa räätälöityjä koulutuslooppeja avoimilla malleilla. Training API yhdistää asiakkaan oman Python‑koulutusloopin Fireworksin hallinnoimaan hajautettuun laskentaan, kattaen sekä kouluttajan, joka laskee gradientit ja päivittää mallin, että käyttöönottoasennuksen, joka tuottaa mallista näytteitä.
Ilmoituksen announcement mukaisesti asiakas orkestroi silmukan haluamastaan paikasta, säilyttäen hallinnan häviö- tai palkkiofunktion, datan ja ympäristön suhteen. Fireworks hallinnoi kouluttajan ja käyttöönoton välistä vuorovaikutusta, mukaan lukien painojen synkronointi, epäonnistuneen vaihdon palautus ja koulutus‑käyttöönotto‑yhtenäisyys. Yritys esittelee API:n vastauksena niihin rajoitteisiin, joita ML‑tiimit ovat raportoineet nykyisissä koulutustyönkuluissa: rajoitettu mallien ja menetelmien valikoima, rajoitettu kontrolli parametreihin ja koulutuslooppeihin, jäykkä laskentateho ja hajautettu koulutus‑ ja käyttöönotto‑infrastruktuuri.
Palvelimetön ja omistettu laskenta
Training API tarjoaa kaksi laskentavaihtoehtoa. Palvelimeton koulutus mahdollistaa asiakkaiden kouluttaa LoRA‑adaptereita jaetussa infrastruktuurissa token‑kohtaisella hinnoittelulla, ja näytteenotto tapahtuu samassa istunnossa; Fireworks kuvaa sen sopivaksi kokeiden iterointiin, suurten ajojen riskien vähentämiseen tai vahvistusoppimissilmukoiden suorittamiseen, jotka vuorottelevat käyttöönoton ja koulutuksen välillä. Omistettu koulutus keskittyy täyden parametrin koulutukseen, malleihin, jotka ylittävät palvelimettoman poolin, pidempiin kontekstipituuksiin tai LoRA‑tasoon, sekä jatkuvaan läpimenoon, laskutettuna GPU‑tuntia kohti joustavassa kapasiteetissa, joka on koottu kunkin ajon tarpeisiin.
Palvelimeton taso liitetään aina käynnissä olevaan jaettuun pooliin, jossa on kuratoitu lista suosituista malleista, jaettu kapasiteetti sekä tilikohtaiset nopeusrajoitukset. Omistettu taso varaa kouluttajan ja käyttöönoton jokaiselle ajolle, tukee LoRA‑ ja täyden parametrin tiloja jopa suurimpiin asiantuntijamallien sekoituksiin, eikä siihen liity kilpailua tai nopeusrajoituksia. Lupaukset täydennyspisteet voidaan ottaa tuotantoinferenssiin käyttöliittymän tai API:n kautta, ja monen LoRA:n käyttöönotto antaa jokaiselle asiakkaalle tai käyttötapaukselle oman viritetyn mallin ilman erillistä infrastruktuuria, yritys kertoi.
Kolme koulutuspintaa
Training API sijaitsee kahden muun pinnan rinnalla Fireworksin koulutusalustalla. Hallinnoitu koulutus, joka on suunnattu ML‑insinööreille, suorittaa sisäänrakennettuja tehtäviä, joissa asiakas valitsee menetelmän — SFT, DPO tai RL — ja perusmallin, käynnistäen sen käyttöliittymästä tai API:sta. Fireworks Lab, joka on myös yleisesti saatavilla ilmoituksen jälkeen, sijoittaa etukäteen lähetetyt tutkijat ja insinöörit asiakkaiden tiimeihin; yhteistyöt alkavat diagnoosilla, jossa määritellään kyvykkyys, lähtötaso, onnistumiskriteerit ja laajuus, siirtyvät sitten aikarajoitteiseen toteutukseen, ja asiakas säilyttää tuotantovalmiin mallin, arviointirungon, dataputket, koulutusloopin ja reseptit.
Training API itsessään on suunnattu ML‑tutkijoille ja tukee SFT‑, DPO‑, ORPO‑, RL‑ ja destillaatiomenetelmiä, LoRA‑pohjaisesta palvelimettomasta laskennasta täyden parametrin koulutukseen omistetuilla klustereilla.
Vahvistusoppiminen suuressa mittakaavassa
Fireworks kertoo olevansa harvojen organisaatioiden joukossa, jotka eivät ole frontier‑laboratorioita, mutta ovat toteuttaneet vahvistusoppimista yli 10 000 GPU:n laajuisesti, ja se jäsentää RL‑koulutuksen kolmen vaatimuksen ympärille: oikeellisuus, suorituskyvyn tehokkuus ja kehityksen nopeus.
Oikeellisuuden osalta yritys totesi, että käyttöönotto‑moottorin ja kouluttajan on jaettava sama numeerinen määritelmä, koska pieni numeerinen poikkeama voi turmella oppimissignaalin token‑leikkauksen tai palkkio‑romahduksen kautta, vaikka kaikki näyttäisi toimivan. Fireworks sovittaa numeeriset formaatit päästä päähän, mukaan lukien BF16, lohko‑kohtainen FP8 ja NVFP4, yhtenäistää ytimet ja reduktiokäyttäytymisen molemmissa poluissa, ja käyttää Router Replay -menetelmää säilyttääkseen asiantuntijamallien reitityspäätökset käyttöönoton ja taaksepäin‑propagoinnin välillä yhdessä erä‑riippumattomien ytimien ja determinististen reduktioiden kanssa. Yritys sanoi vahvistavansa yhdenmukaisuuden suorittamalla identtisiä sekvenssejä käyttöönotto‑moottorin ja kouluttajan läpi ja mittaamalla koulutus‑inference‑KL‑divergenssin, jatkuvalla validoinnilla kaikille Fireworks‑koulutuksessa julkaistuille malleille.
Suorituskyvyn osalta Fireworks kertoo suorittavansa asynkronista RL:ää, jossa käyttöönoton keräys päällekkäin koulutuksen kanssa, niin että käyttöönoton GPU:t alkavat tuottaa seuraavan erän, kun kouluttaja päivittää edellistä, algoritmin sallimissa painojen vanhenemisrajoissa. Jokaisen koulutusaskeleen jälkeen päivitetyt painot kuormitetaan suoraan käynnissä olevaan käyttöönotto‑asennukseen sen sijaan, että se purettaisiin ja ladattaisiin kokonaan uudelleen. Täyden parametrin tarkistuspisteille yritys kertoo laskevansa XOR‑erotuksen nykyisten ja edellisten painojen välillä ja soveltavansa zstd‑pakkausta, mikä tuottaa jopa 10‑kertaisen vähennyksen siirtonopeudessa.
Kehitysnopeuden osalta yritys kuvasi jatkuvan koulutus‑, käyttöönotto‑, arviointi‑ ja uudelleenkoulutus‑silmukan yhdellä alustalla, jossa tarkistuspisteet siirtyvät suoraan palveluun ja tuotantojälkeen, arviointeihin ja palautteeseen, jotka syöttävät seuraavan ajon. Yritys kertoi, että tiimit raportoivat kaksinkertaisesta nelinkertaisesta määrästä iteraatioita samalla koulutusbudjetilla.
Asiakkaiden tulokset, joita on mainittu
Ilmoitus mainitsi useita asiakkaita. Harvey koulutti jälkikäteen Kimi K3:n pitkän aikavälin oikeustyöhön käyttäen asynkronista RL:ää; sen Harvey Tenet -malli saavutti 19,7 % kokonaisläpäisyn LAB:ssa verrattuna 11,5 %:iin Claude Fable 5:ssä, noin kolmasosa kustannuksista per tehtävä, Fireworksin mukaan. Vercel käytti vahvistus‑hienosäätöä ja spekulatiivista dekoodausta v0:n automaattikorjaajassa, saavuttaen 93 % virheettömän generoinnin ja 40‑kertaisen kokonaisviiveen parannuksen, yrityksen mukaan. Heidi Health siirsi kliinisen kirjuri‑toimintonsa hienosäädettyihin avoimiin malleihin, siirtyen konseptitestistä tuotantoon neljässä viikossa 3,5‑kertaisella viiveen vähenemisellä. Factory hienosäätää kaksi pientä LoRA‑adapteria avoimella Qwen‑pohjalla suodattamaan paljastuneita salaisuuksia; 5 %:n väärä hälytysbudjetilla koulutettu malli löysi noin 70 % todellisista salaisuuksista verrattuna noin 59 %:iin GPT‑5.5:ssä, Fireworks raportoi.
Training API on nyt saatavilla Fireworksin itsepalvelu‑rekisteröinnin kautta, ja palvelimeton käyttö ei vaadi erillistä resurssien varausprosessia. Yritys ohjaa tiimejä, jotka haluavat käytännön tukea, Fireworks Lab -konsultaatioihin.












