Modelli e piattaforme di IA
Fireworks AI rende l’API di addestramento generalmente disponibile

Fireworks AI, il 31 agosto 2026, ha annunciato la disponibilità generale della sua Training API e di Fireworks Lab, aprendo la sua infrastruttura gestita per l’addestramento e il rollout ai team di ML che desiderano eseguire cicli di addestramento personalizzati su modelli aperti. La Training API collega il ciclo di addestramento Python del cliente all’infrastruttura di calcolo distribuito gestita da Fireworks, coprendo sia il trainer che calcola i gradienti e aggiorna il modello sia il deployment di rollout che genera campioni dal modello.
Secondo l’accordo descritto nell’annuncio, il cliente orchestra il ciclo da qualsiasi luogo scelga, mantenendo il controllo sulla funzione di perdita o ricompensa, sui dati e sull’ambiente. Fireworks gestisce l’interazione tra trainer e rollout, includendo la sincronizzazione dei pesi, il recupero da scambi falliti e l’allineamento tra addestramento e rollout. L’azienda presenta l’API come risposta alle limitazioni che, secondo loro, i team di ML hanno segnalato nei flussi di lavoro di addestramento esistenti: scelta limitata di modelli e metodi, controllo ristretto su parametri e cicli di addestramento, capacità di calcolo rigida e infrastruttura frammentata per addestramento e rollout.
Elaborazione serverless e dedicata
L’API di addestramento offre due opzioni di calcolo. L’addestramento serverless consente ai clienti di addestrare adattatori LoRA su un’infrastruttura condivisa con fatturazione per token, con il campionamento eseguito nella stessa sessione; Fireworks lo descrive come adatto a iterare sugli esperimenti, a ridurre i rischi di esecuzioni più grandi o a eseguire cicli di reinforcement learning che alternano rollout e addestramento. L’addestramento dedicato è mirato all’addestramento a parametro completo, a modelli oltre il pool serverless, a lunghezze di contesto o ranghi LoRA più ampi e a una larghezza di banda sostenuta, fatturato per ora GPU su capacità elastica dimensionata per ogni esecuzione.
Il livello serverless si collega a un pool condiviso sempre attivo con un elenco curato di modelli popolari, capacità condivisa e limiti di velocità per account. Il livello dedicato fornisce un trainer e un deployment per ogni esecuzione, supporta le modalità LoRA e a parametro completo fino ai più grandi modelli mixture-of-experts, e non presenta conflitti né limiti di velocità. I checkpoint promettenti possono essere distribuiti in inferenza di produzione tramite l’interfaccia utente o l’API, e il deployment multi-LoRA offre a ciascun cliente o caso d’uso il proprio modello ottimizzato senza infrastruttura separata, ha dichiarato l’azienda.
Tre superfici di addestramento
L’API di addestramento si affianca a due altre superfici sulla piattaforma di addestramento Fireworks. Managed Training, destinato agli ingegneri ML, esegue lavori integrati in cui il cliente sceglie un metodo — SFT, DPO o RL — e un modello di base, avviandoli dall’interfaccia utente o dall’API. Fireworks Lab, anch’esso generalmente disponibile a partire dall’annuncio, integra ricercatori e ingegneri operativi direttamente nei team dei clienti; gli incarichi iniziano con una diagnosi che definisce la capacità, la baseline, i criteri di successo e l’ambito, per poi passare a un’implementazione a tempo limitato, e il cliente conserva il modello pronto per la produzione, il framework di valutazione, i flussi di dati, il ciclo di addestramento e le ricette.
L’API di addestramento è rivolta ai ricercatori ML e supporta SFT, DPO, ORPO, RL e distillazione, dal LoRA su calcolo serverless all’addestramento a parametro completo su cluster dedicati.
Reinforcement Learning su larga scala
Fireworks afferma di essere tra le poche organizzazioni al di fuori dei laboratori d’avanguardia ad aver operato reinforcement learning su più di 10.000 GPU, e inquadra l’addestramento RL attorno a tre requisiti: correttezza, efficienza delle prestazioni e velocità di sviluppo.
Sulla correttezza, l’azienda ha dichiarato che il motore di rollout e il trainer devono condividere la stessa definizione numerica, poiché una piccola deriva numerica può corrompere il segnale di apprendimento tramite il clipping dei token o il collasso della ricompensa, anche se tutto sembra funzionare. Fireworks allinea i formati numerici end-to-end, includendo BF16, FP8 a blocchi e NVFP4, allinea i kernel e il comportamento di riduzione su entrambi i percorsi, e utilizza Router Replay per preservare le decisioni di routing del mixture-of-experts tra rollout e passaggio all’indietro, insieme a kernel batch-invarianti e riduzioni deterministiche. L’azienda afferma di convalidare l’allineamento eseguendo sequenze identiche attraverso il motore di rollout e il trainer e misurando la divergenza KL tra addestramento e inferenza, con validazione continua per tutti i modelli lanciati su Fireworks training.
Sulla performance, Fireworks ha dichiarato di eseguire RL asincrono, sovrapponendo la raccolta del rollout all’addestramento in modo che le GPU di rollout inizino a generare il batch successivo mentre il trainer aggiorna quello precedente, con una stagnazione dei pesi limitata dove l’algoritmo lo consente. Dopo ogni passo di addestramento, i pesi aggiornati vengono caricati a caldo nel deployment di rollout in esecuzione anziché smontarlo e ricaricare un modello completo. Per i checkpoint a parametro completo, l’azienda ha affermato di calcolare una differenza XOR tra i pesi attuali e quelli precedenti e di applicare la compressione zstd, ottenendo una riduzione fino a 10 volte della larghezza di banda di trasmissione.
Sulla velocità di sviluppo, l’azienda ha descritto un ciclo continuo di addestramento, distribuzione, valutazione e riaddestramento su un’unica piattaforma, con i checkpoint che passano direttamente al servizio e alle tracce di produzione, alle valutazioni e al feedback che alimentano la successiva esecuzione. Ha riferito che i team segnalano da due a quattro volte più iterazioni con lo stesso budget di addestramento.
Risultati dei clienti citati
L’annuncio ha citato diversi clienti. Harvey ha post-addestrato Kimi K3 per lavori legali a lungo orizzonte utilizzando RL asincrono; il suo modello Harvey Tenet ha ottenuto il 19,7% di superamento totale su LAB contro l’11,5% per Claude Fable 5, a circa un terzo del costo per task, ha affermato Fireworks. Vercel ha utilizzato il fine-tuning con reinforcement e il decoding speculativo per l’auto-correttore di v0, raggiungendo un tasso di generazione senza errori del 93% e un miglioramento della latenza end-to-end di 40 volte, secondo l’azienda. Heidi Health ha trasferito il suo scriba clinico su modelli aperti fine‑tuned, passando da prova di concetto a produzione in quattro settimane con una latenza 3,5 volte inferiore. Factory ha fine‑tuned due piccoli adattatori LoRA su una base Qwen aperta per filtrare segreti esposti; con un budget di falsi allarmi del 5%, il modello addestrato ha rilevato circa il 70% dei segreti reali rispetto a circa il 59% per GPT‑5.5, ha riportato Fireworks.
L’API di addestramento è ora disponibile tramite la registrazione self‑serve di Fireworks, con accesso serverless che non richiede provisioning, e l’azienda sta indirizzando i team che desiderano supporto pratico alle consulenze di Fireworks Lab.












