AI 모델 및 플랫폼
Fireworks AI, 교육 API를 일반 제공

Fireworks AI는 2026년 8월 31일에 교육 API와 Fireworks Lab의 일반 제공을 발표했으며, 오픈 모델에 대한 맞춤형 학습 루프를 실행하려는 머신러닝 팀에게 관리형 학습 및 롤아웃 인프라를 열었습니다. 교육 API는 고객이 직접 작성한 Python 학습 루프를 Fireworks가 관리하는 분산 컴퓨팅에 연결하여, 그래디언트를 계산하고 모델을 업데이트하는 트레이너와 샘플을 생성하는 롤아웃 배포를 모두 포괄합니다.
위 announcement에 설명된 방식에 따라, 고객은 원하는 위치에서 루프를 오케스트레이션하면서 손실 또는 보상 함수, 데이터, 환경에 대한 제어권을 유지합니다. Fireworks는 트레이너와 롤아웃 간의 상호작용을 관리하며, 가중치 동기화, 실패 스와프 복구, 학습-롤아웃 정렬 등을 포함합니다. 회사는 기존 학습 워크플로에서 머신러닝 팀이 보고한 제약—모델 및 방법 선택의 제한, 파라미터와 학습 루프에 대한 제어 제한, 경직된 컴퓨팅, 그리고 단편화된 학습 및 롤아웃 인프라—에 대한 대응으로 이 API를 포지셔닝하고 있습니다.
Serverless and Dedicated Compute
교육 API는 두 가지 컴퓨팅 옵션을 제공합니다. 서버리스 학습은 고객이 공유 인프라에서 LoRA 어댑터를 토큰당 청구 방식으로 학습하도록 허용하며, 샘플링도 동일 세션에서 실행됩니다. Fireworks는 이를 실험 반복, 대규모 실행 위험 감소, 혹은 롤아웃과 학습을 교대로 수행하는 강화 학습 루프에 적합하다고 설명합니다. 전용 학습은 전체 파라미터 학습, 서버리스 풀을 벗어난 모델, 더 긴 컨텍스트 길이 또는 LoRA 차수, 지속적인 처리량을 목표로 하며, 각 실행에 맞춘 탄력적 용량에 대해 GPU 시간당 청구됩니다.
서버리스 티어는 항상 켜져 있는 공유 풀에 연결되며, 인기 모델 목록이 선별되어 제공되고, 공유 용량 및 계정당 속도 제한이 적용됩니다. 전용 티어는 실행마다 트레이너와 배포를 프로비저닝하고, 가장 큰 혼합 전문가 모델까지 LoRA와 전체 파라미터 모드를 지원하며, 경쟁이나 속도 제한이 없습니다. 유망한 체크포인트는 UI 또는 API를 통해 프로덕션 추론에 배포될 수 있으며, 멀티 LoRA 배포를 통해 각 고객이나 사용 사례마다 별도 인프라 없이 자체 튜닝 모델을 제공한다고 회사는 밝혔습니다.
Three Training Surfaces
교육 API는 Fireworks training platform의 다른 두 환경과 함께 제공됩니다. ML 엔지니어를 대상으로 하는 Managed Training은 고객이 방법(SFT, DPO, RL)과 기본 모델을 선택해 UI 또는 API에서 실행하는 내장 작업을 수행합니다. 발표 시점부터 일반 제공된 Fireworks Lab은 고객 팀에 현장 연구원과 엔지니어를 배치합니다; 참여는 역량, 베이스라인, 성공 기준, 범위를 정의하는 진단으로 시작해 제한된 기간의 구현 단계로 진행되며, 고객은 프로덕션 준비 모델, 평가 프레임워크, 데이터 파이프라인, 학습 루프 및 레시피를 보유하게 됩니다.
교육 API 자체는 ML 연구자를 대상으로 하며, SFT, DPO, ORPO, RL 및 증류를 지원하고, 서버리스 컴퓨팅에서 LoRA부터 전용 클러스터에서 전체 파라미터 학습까지 포괄합니다.
Reinforcement Learning at Scale
Fireworks는 최첨단 연구소 외부에서 10,000개 이상의 GPU를 활용해 강화 학습을 수행한 몇 안 되는 조직 중 하나라고 밝히며, 강화 학습을 세 가지 요구 사항—정확성, 성능 효율성, 개발 속도—에 맞춰 설계했습니다.
정확성 측면에서, 회사는 롤아웃 엔진과 트레이너가 동일한 수치 정의를 공유해야 한다고 말합니다. 작은 수치 드리프트가 토큰 클리핑이나 보상 붕괴를 일으켜 학습 신호를 손상시킬 수 있기 때문입니다. Fireworks는 BF16, 블록 단위 FP8, NVFP4 등 수치 포맷을 엔드투엔드로 정렬하고, 양 경로의 커널 및 축소 동작을 일치시키며, Router Replay를 사용해 롤아웃과 역전파 사이의 혼합 전문가 라우팅 결정을 보존하고, 배치 불변 커널과 결정적 축소를 적용합니다. 회사는 동일한 시퀀스를 롤아웃 엔진과 트레이너에 각각 실행해 학습-추론 KL 발산을 측정함으로써 정렬을 검증하고, Fireworks 학습에 출시되는 모든 모델에 대해 지속적인 검증을 수행한다고 밝혔습니다.
성능 측면에서, Fireworks는 비동기 강화 학습을 실행해 롤아웃 수집과 학습을 겹치게 함으로써 롤아웃 GPU가 이전 단계의 트레이너 업데이트가 진행되는 동안 다음 배치를 생성하도록 합니다. 알고리즘이 허용하는 경우 가중치 오래됨을 제한합니다. 각 학습 단계 후에는 업데이트된 가중치를 전체 모델을 재로드하거나 배포를 중단하지 않고 실행 중인 롤아웃 배포에 즉시 로드합니다. 전체 파라미터 체크포인트의 경우, 현재와 이전 가중치 간 XOR 차이를 계산하고 zstd 압축을 적용해 전송 대역폭을 최대 10배까지 감소시킨다고 회사는 설명했습니다.
개발 속도 측면에서, 회사는 하나의 플랫폼에서 지속적인 학습·배포·평가·재학습 루프를 구현하고, 체크포인트가 직접 서비스와 프로덕션 트레이스, 평가 및 피드백으로 이동해 다음 실행에 반영된다고 설명했습니다. 이를 통해 팀은 동일한 학습 예산으로 두 배에서 네 배까지 더 많은 반복을 수행한다고 보고했습니다.
Customer Results Cited
발표에서는 여러 고객 사례가 인용되었습니다. Harvey는 비동기 강화 학습을 활용해 장기 법률 작업용 Kimi K3를 사후 학습시켰으며, Harvey Tenet 모델이 LAB에서 19.7% 전체 통과율을 기록해 Claude Fable 5의 11.5%를 크게 앞섰고, 작업당 비용은 약 1/3 수준이라고 Fireworks는 전했습니다. Vercel은 v0의 자동 수정기를 위해 강화 파인튜닝과 추측 디코딩을 사용해 93% 오류 없는 생성률과 40배의 종단 간 지연 개선을 달성했다고 회사는 밝혔습니다. Heidi Health는 임상 기록 담당자를 파인튜닝된 오픈 모델로 전환해 개념 증명 단계에서 프로덕션까지 4주 만에 진행했으며, 지연 시간이 3.5배 감소했습니다. Factory는 오픈 Qwen 기반에 두 개의 작은 LoRA 어댑터를 파인튜닝해 노출된 비밀 정보를 탐지했으며, 5% 오경보 예산 하에서 학습된 모델은 실제 비밀의 약 70%를 포착했으며, GPT-5.5의 약 59%와 비교됐다고 Fireworks는 보고했습니다.
교육 API는 현재 Fireworks의 셀프 서비스 가입을 통해 이용 가능하며, 서버리스 접근은 별도 프로비저닝 없이 사용할 수 있습니다. 또한 실무 지원을 원하는 팀은 Fireworks Lab 상담으로 안내하고 있습니다.












