Модели и платформы ИИ
Fireworks AI объявила о широком доступе к API обучения

31 августа 2026 года Fireworks AI объявила о широком доступе к своему Training API и Fireworks Lab, предоставив управляемую инфраструктуру обучения и развертывания командам машинного обучения, желающим запускать пользовательские циклы обучения на открытых моделях. Training API соединяет собственный Python‑цикл обучения клиента с распределёнными вычислениями, управляемыми Fireworks, охватывая как тренер, вычисляющий градиенты и обновляющий модель, так и развертывание rollout, генерирующее образцы.
В соответствии с условиями, описанными в анонсе, клиент оркестрирует цикл из любой удобной ему среды, сохраняя контроль над функцией потерь или вознаграждения, данными и окружением. Fireworks управляет взаимодействием между тренером и rollout, включая синхронизацию весов, восстановление после неудачной замены и согласование обучения‑rollout. Компания позиционирует API как ответ на ограничения, о которых, по её словам, сообщали команды ML в существующих рабочих процессах обучения: ограниченный выбор моделей и методов, ограниченный контроль над параметрами и циклами обучения, жёсткие вычислительные ресурсы и фрагментарная инфраструктура обучения и развертывания.
Бессерверные и выделенные вычисления
Training API предлагает два варианта вычислений. Бессерверное обучение позволяет клиентам обучать LoRA‑адаптеры на совместной инфраструктуре с оплатой за каждый токен, при этом генерация образцов происходит в той же сессии; Fireworks описывает его как подходящий для итераций над экспериментами, снижения риска крупных запусков или выполнения циклов обучения с подкреплением, чередующихся между rollout и обучением. Выделенное обучение ориентировано на полные параметры, модели, выходящие за пределы бессерверного пула, более длинные контекстные окна или ранги LoRA, а также на стабильную пропускную способность, оплата за час работы GPU на эластичной мощности, подбираемой под каждый запуск.
Бессерверный уровень подключается к постоянно работающему общему пулу с отобранным списком популярных моделей, совместной ёмкостью и ограничениями скорости на каждый аккаунт. Выделенный уровень выделяет тренера и развертывание для каждого запуска, поддерживает режимы LoRA и полные параметры вплоть до крупнейших моделей mixture‑of‑experts и не имеет конфликтов или ограничений скорости. Перспективные контрольные точки можно развернуть в продакшн‑инференс через UI или API, а многократное развертывание LoRA даёт каждому клиенту или кейсу собственную настроенную модель без отдельной инфраструктуры, как сообщает компания.
Три поверхности обучения
Training API располагается рядом с двумя другими поверхностями на платформе обучения Fireworks. Managed Training, ориентированный на инженеров ML, запускает встроенные задачи, в которых клиент выбирает метод — SFT, DPO или RL — и базовую модель, начиная работу из UI или API. Fireworks Lab, также ставший общедоступным с момента анонса, встраивает исследователей и инженеров, работающих в полевых условиях, в команды клиентов; взаимодействие начинается с диагностики, определяющей возможности, базовый уровень, критерии успеха и объём, затем переходит к ограниченной по времени реализации, а клиент сохраняет готовую к продакшн модели, набор оценок, конвейеры данных, цикл обучения и рецепты.
Сам Training API ориентирован на исследователей ML и поддерживает SFT, DPO, ORPO, RL и дистилляцию, от LoRA на бессерверных вычислениях до полного параметрического обучения на выделенных кластерах.
Обучение с подкреплением в масштабе
Fireworks заявляет, что является одной из немногих организаций вне передовых лабораторий, которые провели обучение с подкреплением на более чем 10 000 GPU, и формулирует обучение RL вокруг трёх требований: корректность, эффективность производительности и скорость разработки.
Что касается корректности, компания отметила, что движок rollout и тренер должны использовать одинаковое числовое определение, поскольку небольшие числовые отклонения могут испортить обучающий сигнал через обрезку токенов или коллапс вознаграждения, хотя всё кажется работающим. Fireworks согласует числовые форматы от начала до конца, включая BF16, блочный FP8 и NVFP4, синхронно выравнивает ядра и поведение редукций по обоим путям и использует Router Replay для сохранения решений маршрутизации mixture‑of‑experts между rollout и обратным проходом, наряду с ядрами, инвариантными к батчам, и детерминированными редукциями. Компания подтверждает согласованность, запуская идентичные последовательности через движок rollout и тренер и измеряя KL‑дивергенцию между обучением и инференсом, с постоянной проверкой всех моделей, запущенных на Fireworks training.
Что касается производительности, Fireworks сообщает, что использует асинхронный RL, накладывая сбор rollout на обучение, так что GPU, отвечающие за rollout, начинают генерировать следующую партию, пока тренер обновляет предыдущую, с ограниченной «застарелостью» весов, допускаемой алгоритмом. После каждого шага обучения обновлённые веса «горячо» загружаются в работающий rollout‑деплой, а не отключаются и перезагружаются полностью. Для полных контрольных точек компания вычисляет XOR‑разницу между текущими и предыдущими весами и применяет сжатие zstd, достигая до 10‑кратного снижения объёма передаваемых данных.
Что касается скорости разработки, компания описывает непрерывный цикл «train → deploy → evaluate → retrain» на единой платформе, где контрольные точки сразу попадают в сервис и производственные трассы, оценки и обратную связь, подпитывающую следующий запуск. По словам компании, команды сообщают о двух‑четырёхкратном увеличении количества итераций при том же бюджете обучения.
Указанные результаты клиентов
В анонсе упомянули нескольких клиентов. Harvey дообучил Kimi K3 для долгосрочных юридических задач, используя асинхронный RL; их модель Harvey Tenet набрала 19,7 % «all‑pass» в LAB против 11,5 % у Claude Fable 5, при примерно трёхкратном снижении стоимости за задачу, сообщает Fireworks. Vercel применил дообучение с подкреплением и спекулятивную декодировку для авто‑исправления v0, достигнув 93 % генерации без ошибок и 40‑кратного улучшения сквозной задержки, согласно компании. Heidi Health перенесла своего клинического стенографа на дообученные открытые модели, перейдя от прототипа к продакшн за четыре недели с 3,5‑кратным снижением задержки. Factory дообучила два небольших LoRA‑адаптера на открытой базе Qwen для выявления раскрытых секретов; при бюджете ложных срабатываний 5 % обученная модель обнаружила около 70 % реальных секретов против примерно 59 % у GPT‑5.5, сообщает Fireworks.
Training API уже доступен через самостоятельную регистрацию Fireworks, при этом бессерверный доступ не требует предварительного выделения ресурсов, а компания направляет команды, желающие получить практическую поддержку, к консультациям Fireworks Lab.












