Моделі та платформи ШІ
Fireworks AI оголошує про загальну доступність API навчання

Fireworks AI 31 серпня 2026 року оголосив про загальну доступність свого Training API та Fireworks Lab, відкривши свою керовану інфраструктуру навчання та розгортання для команд машинного навчання, які хочуть запускати власні цикли навчання на відкритих моделях. Training API підключає власний Python‑цикл навчання клієнта до розподілених обчислень, якими керує Fireworks, охоплюючи як тренер, що обчислює градієнти та оновлює модель, так і розгортання, що генерує зразки.
Відповідно до умов, описаних у оголошенні, клієнт оркеструє цикл з будь‑якого місця, зберігаючи контроль над функцією втрати або винагороди, даними та середовищем. Fireworks керує взаємодією між тренером і розгортанням, включаючи синхронізацію ваг, відновлення після невдалих обмінів та вирівнювання процесу навчання‑розгортання. Компанія позиціонує API як відповідь на обмеження, які, за її словами, повідомляють команди ML у існуючих робочих процесах навчання: обмежений вибір моделей і методів, обмежений контроль над параметрами та циклами навчання, жорстка обчислювальна інфраструктура та фрагментована інфраструктура навчання і розгортання.
Безсерверні та виділені обчислення
Training API пропонує два варіанти обчислень. Безсерверне навчання дозволяє клієнтам тренувати LoRA‑адаптери на спільній інфраструктурі з оплатою за токен, при цьому семплювання виконується в тому самому сеансі; Fireworks описує його як підходящий для ітерацій над експериментами, зниження ризиків великих запусків або запуску циклів підкріплювального навчання, які чергуються між розгортанням і навчанням. Виділене навчання орієнтоване на повно‑параметричне навчання, моделі, що виходять за межі безсерверного пулу, довші контекстні довжини або LoRA‑ранги та стабільну пропускну здатність, з оплатою за годину GPU на еластичній потужності, підлаштованій під кожен запуск.
Безсерверний рівень підключається до постійно активного спільного пулу з підбіркою популярних моделей, спільною потужністю та обмеженнями швидкості на обліковий запис. Виділений рівень створює тренера та розгортання для кожного запуску, підтримує LoRA та повно‑параметричні режими до наймасштабніших моделей mixture‑of‑experts і не має конкуренції чи обмежень швидкості. Перспективні контрольні точки можна розгорнути у виробничу інференцію через інтерфейс або API, а багатократне розгортання LoRA дає кожному клієнту або випадку використання власну налаштовану модель без окремої інфраструктури, повідомляє компанія.
Три поверхні навчання
Training API розташований поряд з двома іншими поверхнями на платформі навчання Fireworks. Managed Training, орієнтований на інженерів ML, запускає вбудовані завдання, у яких клієнт обирає метод — SFT, DPO або RL — та базову модель, ініціуючи запуск через інтерфейс або API. Fireworks Lab, також загальнодоступний з моменту оголошення, вбудовує дослідників і інженерів, що працюють у передовій, у команди клієнтів; співпраця починається з діагностики, що визначає можливості, базовий рівень, критерії успіху та обсяг, після чого переходить у часово обмежену реалізацію, а клієнт зберігає готову до виробництва модель, інструментарій оцінки, конвеєри даних, цикл навчання та рецепти.
Саме Training API орієнтоване на дослідників ML і підтримує SFT, DPO, ORPO, RL та дистиляцію, від LoRA на безсерверних обчисленнях до повно‑параметричного навчання на виділених кластерах.
Посилювальне навчання у масштабі
Fireworks стверджує, що є однією з небагатьох організацій поза передовими лабораторіями, які працювали з підкріплювальним навчанням на більш ніж 10 000 GPU, і формулює навчання RL навколо трьох вимог: правильність, ефективність продуктивності та швидкість розробки.
Щодо правильності, компанія зазначила, що рушій розгортання та тренер мають мати однакове числове визначення, оскільки навіть невелика числова відхилення може спотворити навчальний сигнал через обрізання токенів або колапс винагороди, хоча все здається працюючим. Fireworks вирівнює числові формати від початку до кінця, включаючи BF16, блоковий FP8 та NVFP4, синхронізує ядра та поведінку редукції в обох напрямках і використовує Router Replay для збереження рішень маршрутизації mixture‑of‑experts між розгортанням і зворотним проходом разом із пакетно‑незалежними ядрами та детермінованими редукціями. Компанія стверджує, що перевіряє вирівнювання, запускаючи ідентичні послідовності через рушій розгортання та тренер і вимірюючи KL‑відхилення між навчанням і інференцією, з постійною валідацією для всіх моделей, запущених у Fireworks training.
Щодо продуктивності, Fireworks зазначає, що використовує асинхронне RL, накладаючи збір розгортання на навчання, так що GPU розгортання починають генерувати наступну партію, поки тренер оновлює попередню, з обмеженою «застарілістю» ваг, коли це дозволяє алгоритм. Після кожного кроку навчання оновлені ваги «гарячо» завантажуються у працююче розгортання, а не зупиняються і перезавантажуються повністю. Для повно‑параметричних контрольних точок компанія обчислює XOR‑різницю між поточними та попередніми вагами та застосовує стиснення zstd, що дає до 10‑разового зменшення пропускної здатності передачі.
Щодо швидкості розробки, компанія описала безперервний цикл «навчити‑розгорнути‑оцінити‑перенавчити» на одній платформі, коли контрольні точки переходять безпосередньо у обслуговування та виробничі трасування, оцінки та зворотний зв’язок, що живить наступний запуск. За словами компанії, команди повідомляють про вдвічі‑чотири рази більше ітерацій за той самий бюджет навчання.
Наведені результати клієнтів
У оголошенні було зазначено кілька клієнтів. Harvey після навчання Kimi K3 для довгострокових юридичних завдань за допомогою асинхронного RL; модель Harvey Tenet досягла 19,7 % успішних проходжень у LAB проти 11,5 % у Claude Fable 5, при приблизно третій частині вартості за завдання, повідомляє Fireworks. Vercel використав підкріплювальне доопрацювання та спекулятивне декодування для авто‑виправлювача v0, досягнувши 93 % генерації без помилок та 40‑разового покращення кінцевої затримки, за даними компанії. Heidi Health перенесла свого клінічного стенографа на доопрацьовані відкриті моделі, перейшовши від прототипу до виробництва за чотири тижні зі скороченням затримки в 3,5 рази. Factory доопрацювала два невеликі LoRA‑адаптери на відкритій базі Qwen для виявлення відкритих секретів; при бюджеті хибних тривог у 5 % навчена модель виявила близько 70 % реальних секретів порівняно з приблизно 59 % у GPT‑5.5, повідомляє Fireworks.
Training API вже доступний через самостійний реєстраційний процес Fireworks, при цьому безсерверний доступ не потребує попереднього налаштування, а компанія спрямовує команди, які потребують практичної підтримки, до консультацій Fireworks Lab.












