Mô hình và nền tảng AI
Fireworks AI công bố API Đào tạo chính thức khả dụng

Fireworks AI vào ngày 31 tháng 8 năm 2026 đã công bố việc API Đào tạo và Fireworks Lab chính thức khả dụng, mở cơ sở hạ tầng đào tạo và triển khai được quản lý của mình cho các nhóm ML muốn chạy các vòng lặp đào tạo tùy chỉnh trên các mô hình mở. API Đào tạo kết nối vòng lặp đào tạo Python của khách hàng với hệ thống tính toán phân tán do Fireworks quản lý, bao gồm cả bộ đào tạo tính gradient và cập nhật mô hình và triển khai rollout tạo mẫu từ mô hình.
The arrangement described in the announcement cho phép khách hàng điều phối vòng lặp từ bất kỳ đâu họ chọn, đồng thời giữ quyền kiểm soát hàm mất mát hoặc hàm thưởng, dữ liệu và môi trường. Fireworks quản lý sự tương tác giữa bộ huấn luyện và quá trình chạy sinh dữ liệu, bao gồm đồng bộ trọng số, khôi phục khi việc chuyển đổi thất bại và bảo đảm sự ăn khớp giữa huấn luyện với quá trình chạy. Công ty định vị API này là giải pháp cho những hạn chế mà các nhóm học máy cho biết họ gặp trong quy trình huấn luyện hiện tại: ít lựa chọn về mô hình và phương pháp, hạn chế quyền kiểm soát tham số và vòng lặp huấn luyện, tài nguyên tính toán thiếu linh hoạt, cùng hạ tầng huấn luyện và chạy sinh dữ liệu bị phân mảnh.
Tính toán Không máy chủ và Dành riêng
API Đào tạo cung cấp hai tùy chọn tính toán. Đào tạo không máy chủ cho phép khách hàng đào tạo các bộ điều hợp LoRA trên hạ tầng chia sẻ với thanh toán theo token, và việc lấy mẫu diễn ra trong cùng một phiên; Fireworks mô tả nó phù hợp cho việc lặp lại các thí nghiệm, giảm rủi ro cho các chạy lớn hơn, hoặc chạy các vòng lặp học tăng cường luân phiên giữa rollout và đào tạo. Đào tạo dành riêng nhắm tới việc đào tạo toàn tham số, các mô hình vượt ra ngoài pool không máy chủ, độ dài ngữ cảnh lớn hơn hoặc hạng LoRA cao hơn, và thông lượng ổn định, tính phí theo giờ GPU trên dung lượng đàn hồi được điều chỉnh cho mỗi lần chạy.
Tầng không máy chủ gắn vào một pool chia sẻ luôn hoạt động với danh sách được tuyển chọn các mô hình phổ biến, dung lượng chia sẻ và giới hạn tốc độ cho mỗi tài khoản. Tầng dành riêng cung cấp một bộ đào tạo và triển khai cho mỗi lần chạy, hỗ trợ các chế độ LoRA và toàn tham số lên tới các mô hình mixture‑of‑experts lớn nhất, và không có sự tranh chấp hay giới hạn tốc độ. Các checkpoint tiềm năng có thể được triển khai vào suy luận sản xuất qua giao diện người dùng hoặc API, và việc triển khai đa LoRA cho phép mỗi khách hàng hoặc trường hợp sử dụng có mô hình được tinh chỉnh riêng mà không cần hạ tầng riêng biệt, công ty cho biết.
Ba Bề mặt Đào tạo
API Đào tạo nằm cạnh hai bề mặt khác trên nền tảng đào tạo Fireworks training platform. Managed Training, hướng tới các kỹ sư ML, chạy các công việc tích hợp sẵn trong đó khách hàng chọn một phương pháp — SFT, DPO hoặc RL — và một mô hình cơ sở, khởi chạy từ giao diện người dùng hoặc API. Fireworks Lab, cũng đã chính thức khả dụng kể từ thông báo, nhúng các nhà nghiên cứu và kỹ sư được triển khai trước vào các đội khách hàng; các dự án mở đầu bằng một chẩn đoán xác định khả năng, baseline, tiêu chí thành công và phạm vi, sau đó chuyển sang triển khai trong thời gian giới hạn, và khách hàng giữ lại mô hình sẵn sàng sản xuất, khung đánh giá, pipeline dữ liệu, vòng lặp đào tạo và các công thức.
API Đào tạo tự nó hướng tới các nhà nghiên cứu ML và hỗ trợ SFT, DPO, ORPO, RL và distillation, từ LoRA trên tính toán không máy chủ đến đào tạo toàn tham số trên các cụm dành riêng.
Học Tăng Cường ở Quy Mô Lớn
Fireworks cho biết mình là một trong số ít các tổ chức ngoài các phòng thí nghiệm tiên tiến đã vận hành học tăng cường trên hơn 10.000 GPU, và họ đặt khung đào tạo RL dựa trên ba yêu cầu: độ chính xác, hiệu suất và tốc độ phát triển.
Về độ chính xác, công ty cho biết engine rollout và bộ đào tạo phải chia sẻ cùng một định nghĩa số học, vì sự trôi dạt số nhỏ có thể làm hỏng tín hiệu học thông qua việc cắt token hoặc sụp đổ phần thưởng trong khi mọi thứ có vẻ hoạt động bình thường. Fireworks đồng bộ các định dạng số từ đầu đến cuối, bao gồm BF16, FP8 theo khối, và NVFP4, đồng bộ kernel và hành vi giảm tổng qua cả hai đường, và sử dụng Router Replay để bảo tồn quyết định định tuyến mixture‑of‑experts giữa rollout và quá trình lan truyền ngược cùng với các kernel không phụ thuộc batch và các phép giảm tổng xác định. Công ty cho biết họ xác thực sự đồng bộ này bằng cách chạy các chuỗi giống hệt qua engine rollout và bộ đào tạo và đo lường độ lệch KL giữa đào tạo và suy luận, với việc xác thực liên tục cho tất cả các mô hình được triển khai trên Fireworks training.
Về hiệu suất, Fireworks cho biết họ chạy RL bất đồng bộ, chồng chéo việc thu thập rollout với đào tạo sao cho các GPU rollout bắt đầu tạo lô tiếp theo trong khi bộ đào tạo cập nhật lô trước, với độ lỗi trọng số có giới hạn theo thuật toán. Sau mỗi bước đào tạo, trọng số đã cập nhật được tải nóng vào triển khai rollout đang chạy thay vì tắt và tải lại toàn bộ mô hình. Đối với các checkpoint toàn tham số, công ty cho biết họ tính toán sự khác biệt XOR giữa trọng số hiện tại và trước đó và áp dụng nén zstd, giảm tới 10 lần băng thông truyền tải.
Về tốc độ phát triển, công ty mô tả một vòng lặp liên tục đào tạo, triển khai, đánh giá, tái đào tạo trên một nền tảng, với các checkpoint chuyển thẳng vào dịch vụ và các dấu vết sản xuất, đánh giá và phản hồi cung cấp cho lần chạy tiếp theo. Họ cho biết các đội báo cáo số vòng lặp tăng từ hai đến bốn lần so với cùng ngân sách đào tạo.
Kết Quả Khách Hàng Được Trích Dẫn
Thông báo đã trích dẫn một số khách hàng. Harvey đã đào tạo lại Kimi K3 cho công việc pháp lý dài hạn bằng cách sử dụng RL bất đồng bộ; mô hình Harvey Tenet của họ đạt 19,7% all‑pass trên LAB so với 11,5% của Claude Fable 5, với chi phí mỗi nhiệm vụ khoảng một phần ba, Fireworks cho biết. Vercel đã sử dụng tinh chỉnh tăng cường và giải mã suy đoán cho auto‑fixer phiên bản v0, đạt tỷ lệ tạo ra không lỗi 93% và cải thiện độ trễ đầu cuối gấp 40 lần, theo công ty. Heidi Health đã chuyển bộ ghi chép lâm sàng sang các mô hình mở đã được tinh chỉnh, từ bằng chứng khái niệm đến sản xuất trong bốn tuần với độ trễ thấp hơn 3,5 lần. Factory đã tinh chỉnh hai bộ điều hợp LoRA nhỏ trên nền tảng Qwen mở để sàng lọc các bí mật bị lộ; với ngân sách 5% cảnh báo sai, mô hình đã bắt được khoảng 70% các bí mật thực tế so với khoảng 59% của GPT‑5.5, Fireworks báo cáo.
API Đào tạo hiện đã khả dụng thông qua đăng ký tự phục vụ của Fireworks, với quyền truy cập không máy chủ không cần chuẩn bị, và công ty đang hướng các đội muốn hỗ trợ thực tế tới các buổi tư vấn Fireworks Lab.












