Modele și platforme AI

Fireworks AI face API-ul de instruire disponibil în mod general

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Fireworks AI a anunțat, pe 31 august 2026, disponibilitatea generală a API-ului său de instruire și a Fireworks Lab, deschizând infrastructura sa de antrenare și implementare gestionată pentru echipele de ML care doresc să ruleze bucle de antrenare personalizate pe modele deschise. API-ul de instruire conectează bucla proprie de antrenare în Python a clientului la calculul distribuit gestionat de Fireworks, acoperind atât antrenorul care calculează gradientele și actualizează modelul, cât și implementarea de rulare care generează mostre din acesta.

Conform aranjamentului descris în anunț, clientul orchestrează bucla de oriunde alege, menținând controlul asupra funcției de pierdere sau recompensă, a datelor și a mediului. Fireworks gestionează interacțiunea dintre antrenor și rulare, inclusiv sincronizarea greutăților, recuperarea în caz de eșec al schimbului și alinierea antrenament‑rulare. Compania poziționează API-ul ca răspuns la constrângerile pe care, conform declarațiilor sale, echipele de ML le-au raportat în fluxurile de lucru de antrenament existente: opțiuni limitate de modele și metode, control restricționat asupra parametrilor și buclelor de antrenament, calcul rigid și infrastructură fragmentată de antrenament și rulare.

Calcul fără server și dedicat

API-ul de instruire oferă două opțiuni de calcul. Antrenamentul serverless permite clienților să antreneze adaptoare LoRA pe o infrastructură partajată, cu facturare per token, iar eșantionarea rulează în aceeași sesiune; Fireworks îl descrie ca fiind potrivit pentru iterarea experimentelor, reducerea riscurilor pentru execuții mai mari sau rularea buclelor de învățare prin recompensă care alternează între rulare și antrenament. Antrenamentul dedicat vizează antrenamentul cu parametri compleți, modele dincolo de pool‑ul serverless, lungimi de context mai mari sau ranguri LoRA și debit susținut, facturat pe oră de GPU pe capacitate elastică dimensionată pentru fiecare execuție.

Nivelul serverless se conectează la un pool partajat permanent, cu o listă selectată de modele populare, capacitate partajată și limite de rată per cont. Nivelul dedicat alocă un antrenor și o implementare pentru fiecare execuție, suportă modurile LoRA și cele cu parametri compleți până la cele mai mari modele de tip mixture‑of‑experts și nu are restricții de concurență sau limite de rată. Punctele de control promițătoare pot fi implementate în inferența de producție prin interfața UI sau API, iar implementarea multi‑LoRA oferă fiecărui client sau caz de utilizare propriul model ajustat fără infrastructură separată, conform companiei.

Trei suprafețe de antrenament

API-ul de instruire se află alături de alte două suprafețe pe platforma de antrenament Fireworks. Antrenamentul gestionat, destinat inginerilor ML, rulează sarcini încorporate în care clientul alege o metodă — SFT, DPO sau RL — și un model de bază, lansându‑se din UI sau API. Fireworks Lab, de asemenea disponibil în mod general de la anunț, încorporează cercetători și ingineri cu experiență în echipele clienților; colaborările încep cu o diagnoză care definește capacitatea, linia de bază, criteriile de succes și domeniul de aplicare, apoi trec la o implementare cu termen limită, iar clientul păstrează modelul pregătit pentru producție, cadrul de evaluare, conductele de date, bucla de antrenament și rețetele.

API-ul de instruire în sine este destinat cercetătorilor ML și suportă SFT, DPO, ORPO, RL și distilare, de la LoRA pe calcul serverless la antrenament cu parametri compleți pe clustere dedicate.

Învățare prin recompensă la scară

Fireworks afirmă că se numără printre puținele organizații, în afara laboratoarelor de frontieră, care au operat învățarea prin recompensă pe peste 10.000 de GPU‑uri și cărora le structurează antrenamentul RL în jurul a trei cerințe: corectitudine, eficiență a performanței și viteză de dezvoltare.

În ceea ce privește corectitudinea, compania a declarat că motorul de rulare și antrenorul trebuie să împărtășească aceeași definiție numerică, deoarece o mică deviere numerică poate corupe semnalul de învățare prin tăierea token‑urilor sau prăbușirea recompensei, chiar dacă totul pare să funcționeze. Fireworks aliniază formatele numerice de la cap la cap, inclusiv BF16, FP8 pe blocuri și NVFP4, aliniază nucleele și comportamentul de reducere pe ambele căi și utilizează Router Replay pentru a păstra deciziile de rutare ale mixture‑of‑experts între rulare și pasul înapoi, alături de nuclee invariante la batch și reduceri deterministe. Compania a afirmat că validează alinierea prin rularea de secvențe identice prin motorul de rulare și antrenor și măsurarea divergenței KL între antrenament și inferență, cu validare continuă pentru toate modelele lansate pe platforma de antrenament Fireworks.

În ceea ce privește performanța, Fireworks a declarat că rulează RL asincron, suprapunând colectarea rulărilor cu antrenamentul, astfel încât GPU‑urile de rulare încep să genereze următorul lot în timp ce antrenorul actualizează pe cel anterior, cu o vechime limitată a greutăților acolo unde algoritmul permite. După fiecare pas de antrenament, greutățile actualizate sunt încărcate în timp real în implementarea de rulare în curs, în loc să fie închise și să se reîncarce un model complet. Pentru punctele de control cu parametri compleți, compania a precizat că calculează o diferență XOR între greutățile curente și cele anterioare și aplică compresia zstd, obținând o reducere de până la 10 ori a lățimii de bandă de transmisie.

În ceea ce privește viteza de dezvoltare, compania a descris un ciclu continuu de antrenare, implementare, evaluare și reantrenare pe o singură platformă, cu puncte de control care trec direct în servire și în trasările de producție, evaluări și feedback care alimentează următoarea execuție. A declarat că echipele raportează de două până la patru ori mai multe iterații cu același buget de antrenament.

Rezultatele clienților citate

Anunțul a menționat mai mulți clienți. Harvey a antrenat ulterior Kimi K3 pentru lucrări juridice pe termen lung utilizând RL asincron; modelul său Harvey Tenet a obținut un scor de 19,7 % all‑pass pe LAB, comparativ cu 11,5 % pentru Claude Fable 5, la aproximativ o treime din costul pe sarcină, potrivit lui Fireworks. Vercel a folosit ajustarea fină prin recompensă și decodare speculativă pentru auto‑corectorul v0, atingând o rată de generare fără erori de 93 % și o îmbunătățire a latenței de 40 de ori de la capăt la capăt, conform companiei. Heidi Health a mutat scribe‑ul său clinic pe modele deschise ajustate fin, trecând de la probă de concept la producție în patru săptămâni cu o latență cu 3,5 ori mai mică. Factory a ajustat fin două adaptoare LoRA mici pe o bază Qwen deschisă pentru a filtra secretele expuse; cu un buget de alarmă falsă de 5 %, modelul antrenat a detectat aproximativ 70 % din secretele reale, comparativ cu circa 59 % pentru GPT‑5.5, a raportat Fireworks.

API-ul de instruire este disponibil acum prin înscrierea auto‑servită a Fireworks, cu acces serverless care nu necesită provizionare, iar compania direcționează echipele care doresc suport practic către consultații Fireworks Lab.

Theo Nash este un specialist generat de inteligență artificială la Unite.AI, care acoperă infrastructura de inteligență artificială, calcul și sistemele hardware care alimentează inteligența artificială modernă. Lucrarea sa se concentrează pe fundamentele tehnice ale sarcinilor de lucru cu inteligență artificială la scară largă, incluzând centre de date, acceleratoare, rețele și stivele de software care le leagă împreună.
Cu o perspectivă analitică și inginerice, Theo examinează modul în care progresele în domeniul unităților de procesare grafică, siliciului personalizat, arhitecturilor de memorie și sistemelor distribuite permit noi generații de modele de inteligență artificială. El acordă o atenție deosebită schimburilor de performanță, eficienței energetice, scalabilității și constrângerilor practice care influențează implementarea în lumea reală a infrastructurii de inteligență artificială.
Articolele scrise de Theo Nash sunt generate de inteligență artificială și revizuite de echipa editorială a Unite.AI pentru a asigura acuratețea tehnică, claritatea și o acoperire responsabilă a peisajului de calcul cu inteligență artificială în evoluție rapidă.