Modely a platformy AI

Fireworks AI uvádí API pro trénování do obecné dostupnosti

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Fireworks AI dne 31. srpna 2026 oznámila obecnou dostupnost svého Training API a Fireworks Lab, čímž otevřela svou spravovanou infrastrukturu pro trénování a nasazení týmům ML, kteří chtějí spouštět vlastní tréninkové smyčky na otevřených modelech. Training API propojuje vlastní Python tréninkovou smyčku zákazníka s distribuovaným výpočtem spravovaným společností Fireworks, zahrnující jak trénéra, který počítá gradienty a aktualizuje model, tak nasazení rollout, které z něj generuje vzorky.

Podle uspořádání popsaného v oznámení zákazník orchestruje smyčku odkudkoli, kde chce, a zachovává kontrolu nad ztrátovou nebo odměnovou funkcí, daty a prostředím. Fireworks spravuje interakci mezi trénérem a rolloutem, včetně synchronizace vah, obnovy po neúspěšné výměně a sladění tréninku s rolloutem. Společnost představuje API jako odpověď na omezení, která podle ní týmy ML hlásí v existujících tréninkových postupech: omezený výběr modelů a metod, omezená kontrola nad parametry a tréninkovými smyčkami, rigidní výpočetní prostředky a roztříštěná infrastruktura pro trénink a rollout.

Serverless a dedikované výpočty

Training API nabízí dvě výpočetní možnosti. Serverless trénink umožňuje zákazníkům trénovat LoRA adaptéry na sdílené infrastruktuře s účtováním za token, přičemž vzorkování probíhá ve stejné relaci; Fireworks to popisuje jako vhodné pro iteraci experimentů, snižování rizika větších běhů nebo provádění smyček posilovaného učení, které střídavě probíhají mezi rolloutem a tréninkem. Dedikovaný trénink cílí na trénink s plnými parametry, modely mimo serverless pool, delší kontextové délky nebo vyšší LoRA ranky a na udržitelný propustnost, účtovanou za GPU hodinu na elastické kapacitě přizpůsobené každému běhu.

Serverless úroveň se připojuje k neustále aktivnímu sdílenému poolu s kurátorským seznamem populárních modelů, sdílenou kapacitou a limity rychlosti na účet. Dedikovaná úroveň zajišťuje trénéra a nasazení pro každý běh, podporuje režimy LoRA i plných parametrů až po největší modely typu mixture-of-experts a neobsahuje žádné konflikty ani limity rychlosti. Slíbené kontrolní body lze nasadit do produkčního inferencování přes uživatelské rozhraní nebo API a nasazení multi-LoRA poskytuje každému zákazníkovi nebo případu použití vlastní vyladěný model bez samostatné infrastruktury, uvádí společnost.

Tři tréninkové povrchy

Training API stojí vedle dvou dalších rozhraní na platformě Fireworks pro trénink. Managed Training, určený pro ML inženýry, spouští vestavěné úlohy, ve kterých si zákazník vybírá metodu — SFT, DPO nebo RL — a základní model, a spouští je z uživatelského rozhraní nebo API. Fireworks Lab, také obecně dostupný od oznámení, začleňuje výzkumníky a inženýry nasazené přímo do zákaznických týmů; spolupráce začíná diagnostikou definující schopnosti, výchozí stav, kritéria úspěchu a rozsah, poté přechází do časově omezené implementace a zákazník si ponechává produkčně připravený model, evaluační rámec, datové pipeline, tréninkovou smyčku a recepty.

Samotné Training API je zaměřeno na ML výzkumníky a podporuje SFT, DPO, ORPO, RL a destilaci, od LoRA na serverless výpočetním prostředí po trénink s plnými parametry na dedikovaných klastrech.

Posilované učení ve velkém měřítku

Fireworks tvrdí, že patří mezi málo organizací mimo špičkové laboratoře, které provozovaly posilované učení na více než 10 000 GPU, a rámuje trénink RL kolem tří požadavků: správnost, efektivitu výkonu a rychlost vývoje.

Co se týče správnosti, společnost uvedla, že engine rollout a trénér musí sdílet stejnou číselnou definici, protože malý číselný drift může narušit učební signál pomocí ořezávání tokenů nebo kolapsu odměny, i když vše vypadá, že funguje. Fireworks sjednocuje číselné formáty od konce do konce, včetně BF16, blokově orientovaného FP8 a NVFP4, sladí jádra a chování redukcí napříč oběma cestami a používá Router Replay k zachování rozhodnutí směrování mixture-of-experts mezi rolloutem a zpětným průchodem spolu s jádry nezávislými na batchi a deterministickými redukcemi. Společnost uvedla, že validuje toto sladění spuštěním identických sekvencí přes engine rollout a trénér a měřením KL divergence mezi tréninkem a inferencí, s kontinuální validací pro všechny modely spuštěné na tréninku Fireworks.

Co se týká výkonu, Fireworks uvedla, že provozuje asynchronní RL, překrývající sběr rolloutů s tréninkem, takže GPU pro rollout začnou generovat další dávku, zatímco trénér aktualizuje předchozí, s omezenou zastaralostí vah tam, kde to algoritmus umožňuje. Po každém tréninkovém kroku jsou aktualizované váhy načteny do běžícího nasazení rolloutu místo jeho vypínání a načítání celého modelu. Pro kontrolní body s plnými parametry společnost říká, že vypočítává XOR rozdíl mezi aktuálními a předchozími vahami a aplikuje kompresi zstd, čímž dosahuje až 10‑násobného snížení přenosové šířky pásma.

Co se týká rychlosti vývoje, společnost popisuje kontinuální smyčku trénovat, nasazovat, hodnotit, pře‑trénovat na jedné platformě, kde kontrolní body přecházejí přímo do servírování a produkčních stop, evaluačních testů a zpětné vazby, která napájí další běh. Uvádí, že týmy hlásí dvou‑ až čtyřnásobný nárůst iterací při stejném tréninkovém rozpočtu.

Uvedené výsledky zákazníků

Oznámení uvádělo několik zákazníků. Harvey po‑trénoval Kimi K3 pro dlouhodobé právní úkoly pomocí asynchronního RL; jeho model Harvey Tenet dosáhl 19,7 % úspěšnosti na LAB oproti 11,5 % pro Claude Fable 5, přičemž náklady na úkol byly přibližně třetinou, uvádí Fireworks. Vercel použil posilované doladění a spekulativní dekódování pro auto‑opravu v0, čímž dosáhl 93 % generování bez chyb a 40‑násobného zlepšení latence end‑to‑end, podle společnosti. Heidi Health přesunula svého klinického zapisovatele na doladěné otevřené modely, přičemž z proof‑of‑conceptu přešla do produkce během čtyř týdnů s 3,5‑násobně nižší latencí. Factory doladil dva malé LoRA adaptéry na otevřeném základě Qwen pro filtraci odhalených tajemství; při rozpočtu 5 % falešných poplachů zachytil trénovaný model přibližně 70 % skutečných tajemství oproti zhruba 59 % pro GPT‑5.5, uvedl Fireworks.

Training API je nyní k dispozici prostřednictvím samostatné registrace Fireworks, přičemž serverless přístup nevyžaduje žádné provisionování, a společnost nasměrovává týmy, které chtějí praktickou podporu, na konzultace ve Fireworks Lab.

Theo Nash je specialista na umělou inteligenci vygenerovaný v Unite.AI, který se zabývá infrastrukturou umělé inteligence, výpočetními systémy a hardwarovými systémy, které pohánějí moderní umělou inteligenci. Jeho práce se zaměřuje na technické základy velkých AI úloh, včetně datových center, akcelerátorů, sítí a softwarových balíčků, které je spojují.
S analytickým a inženýrským přístupem Theo zkoumá, jak pokroky v oblasti GPU, vlastních polovodičových součástek, architektur paměti a distribuovaných systémů umožňují nové generace AI modelů. Zvláštní pozornost věnuje obchodním kompromisům, energetické eficienci, škálovatelnosti a praktickým omezením, které formují reálné nasazení AI infrastruktury.
Články napsané Theo Nashem jsou vygenerovány umělou inteligencí a recenzovány redakčním týmem Unite.AI, aby zajistily technickou přesnost, srozumitelnost a zodpovědné pokrytí rychle se vyvíjejícího AI výpočetního prostředí.