Modele i platformy AI
Fireworks AI udostępnia API treningowe w wersji ogólnej dostępności

Fireworks AI 31 sierpnia 2026 roku ogłosiło ogólną dostępność swojego API treningowego oraz Fireworks Lab, udostępniając zarządzaną infrastrukturę treningową i wdrożeniową zespołom ML, które chcą uruchamiać własne pętle treningowe na otwartych modelach. API treningowe łączy własną pętlę treningową w Pythonie klienta z rozproszonym obliczeniami zarządzanymi przez Fireworks, obejmując zarówno trenera obliczającego gradienty i aktualizującego model, jak i wdrożenie rollout generujące z niego próbki.
Zgodnie z opisanym w ogłoszeniu, klient orkiestruje pętlę z dowolnego miejsca, zachowując kontrolę nad funkcją straty lub nagrody, danymi oraz środowiskiem. Fireworks zarządza interakcją między trenerem a rolloutem, w tym synchronizacją wag, odzyskiwaniem po nieudanej wymianie oraz synchronizacją trening‑rollout. Firma przedstawia API jako odpowiedź na ograniczenia, które według niej zespoły ML zgłaszają w istniejących przepływach treningowych: ograniczony wybór modeli i metod, ograniczona kontrola nad parametrami i pętlami treningowymi, sztywna moc obliczeniowa oraz rozproszona infrastruktura trening‑rollout.
Obliczenia bezserwerowe i dedykowane
API treningowe oferuje dwie opcje obliczeniowe. Trening bezserwerowy pozwala klientom trenować adaptery LoRA na współdzielonej infrastrukturze z rozliczaniem za token, przy czym próbkowanie odbywa się w tej samej sesji; Fireworks opisuje to jako rozwiązanie odpowiednie do iteracji nad eksperymentami, zmniejszania ryzyka większych uruchomień lub prowadzenia pętli uczenia ze wzmocnieniem, które naprzemiennie przechodzą między rolloutem a treningiem. Trening dedykowany skierowany jest na trening pełnych parametrów, modele wykraczające poza pulę bezserwerową, dłuższe konteksty lub wyższe rangi LoRA oraz utrzymany przepustowość, rozliczany za godzinę GPU na elastycznej pojemności dopasowanej do każdego uruchomienia.
Warstwa bezserwerowa łączy się z zawsze dostępną współdzieloną pulą, zawierającą starannie wybraną listę popularnych modeli, współdzieloną pojemność oraz limity szybkości na konto. Warstwa dedykowana przydziela trenera i wdrożenie na każde uruchomienie, obsługuje tryby LoRA i pełnych parametrów aż do największych modeli mieszanki ekspertów i nie nakłada żadnych ograniczeń ani limitów. Obiecujące punkty kontrolne można wdrożyć do produkcyjnego inferencji za pomocą interfejsu UI lub API, a wdrożenie wielokrotnego LoRA zapewnia każdemu klientowi lub przypadkowi użycia własny dostrojony model bez oddzielnej infrastruktury, jak podała firma.
Trzy powierzchnie treningowe
API treningowe znajduje się obok dwóch innych środowisk na platformie treningowej Fireworks. Managed Training, skierowane do inżynierów ML, uruchamia wbudowane zadania, w których klient wybiera metodę — SFT, DPO lub RL — oraz model bazowy, uruchamiane z UI lub API. Fireworks Lab, również dostępny ogólnie od momentu ogłoszenia, włącza badaczy i inżynierów pracujących w terenie do zespołów klientów; współpraca rozpoczyna się od diagnozy definiującej zdolności, bazę, kryteria sukcesu i zakres, po czym przechodzi do realizacji w określonym czasie, a klient zachowuje model gotowy do produkcji, środowisko ewaluacyjne, potoki danych, pętlę treningową i przepisy.
Sam API treningowe jest skierowane do badaczy ML i obsługuje SFT, DPO, ORPO, RL oraz destylację, od LoRA na obliczeniach bezserwerowych po trening pełnych parametrów na dedykowanych klastrach.
Uczenie ze wzmocnieniem w skali
Fireworks twierdzi, że jest jedną z niewielu organizacji spoza laboratoriów frontier, które przeprowadziły uczenie ze wzmocnieniem na ponad 10 000 GPU, i opisuje trening RL wokół trzech wymagań: poprawności, efektywności wydajności oraz szybkości rozwoju.
Jeśli chodzi o poprawność, firma podkreśla, że silnik rollout i trener muszą mieć tę samą definicję numeryczną, ponieważ niewielkie dryftowanie liczbowe może zepsuć sygnał uczenia poprzez przycinanie tokenów lub załamanie nagrody, mimo że wszystko wydaje się działać. Fireworks dopasowuje formaty numeryczne od początku do końca, w tym BF16, blokowy FP8 oraz NVFP4, synchronizuje jądra i zachowanie redukcji w obu ścieżkach oraz używa Router Replay, aby zachować decyzje routingu mieszanki ekspertów między rolloutem a przepływem wstecznym, wraz z jądrami niezmiennymi względem partii i deterministycznymi redukcjami. Firma twierdzi, że weryfikuje zgodność, uruchamiając identyczne sekwencje w silniku rollout i trenerze oraz mierząc dywergencję KL między treningiem a inferencją, przy ciągłej weryfikacji wszystkich modeli uruchamianych na platformie treningowej Fireworks.
Jeśli chodzi o wydajność, Fireworks informuje, że uruchamia asynchroniczne RL, nakładając zbieranie rolloutów na trening, tak że GPU rollout zaczynają generować kolejną partię, gdy trener aktualizuje poprzednią, przy ograniczonym przestarzałością wag, o ile algorytm na to pozwala. Po każdym kroku treningu zaktualizowane wagi są ładowane na gorąco do działającego wdrożenia rollout, zamiast go wyłączać i ładować pełny model. W przypadku punktów kontrolnych pełnych parametrów firma oblicza różnicę XOR między bieżącymi a poprzednimi wagami i stosuje kompresję zstd, co daje nawet 10‑krotne zmniejszenie przepustowości transmisji.
Jeśli chodzi o szybkość rozwoju, firma opisała ciągłą pętlę trenowanie‑wdrażanie‑ewaluacja‑ponowne trenowanie na jednej platformie, w której punkty kontrolne przechodzą bezpośrednio do serwowania i śladów produkcyjnych, ewaluacji oraz informacji zwrotnej zasila kolejny przebieg. Zespoły zgłaszają od dwóch do czterech razy więcej iteracji przy tym samym budżecie treningowym.
Przykłady wyników klientów
W ogłoszeniu przytoczono kilku klientów. Harvey wytrenował ponownie Kimi K3 do długoterminowych zadań prawnych, wykorzystując asynchroniczne RL; model Harvey Tenet uzyskał 19,7 % wszystkich poprawnych wyników w teście LAB, w porównaniu z 11,5 % dla Claude Fable 5, przy kosztach na zadanie wynoszących mniej niż jedną trzecią, jak podaje Fireworks. Vercel zastosował fine‑tuning ze wzmocnieniem i spekulatywne dekodowanie w auto‑naprawiaczu v0, osiągając 93 % generacji wolnej od błędów oraz 40‑krotną poprawę opóźnienia end‑to‑end, według firmy. Heidi Health przeniosło swojego klinicznego stenografa na dostrojone otwarte modele, przechodząc od proof of concept do produkcji w cztery tygodnie przy 3,5‑krotnie niższym opóźnieniu. Factory dostroiło dwa małe adaptery LoRA na otwartym modelu Qwen, aby wykrywać ujawnione sekrety; przy budżecie fałszywych alarmów 5 % wytrenowany model wykrył około 70 % rzeczywistych sekretów w porównaniu z około 59 % dla GPT‑5.5, podało Fireworks.
API treningowe jest już dostępne poprzez samodzielną rejestrację w Fireworks, przy czym dostęp bezserwerowy nie wymaga żadnej konfiguracji, a firma kieruje zespoły potrzebujące wsparcia praktycznego do konsultacji w Fireworks Lab.












