Mô hình và nền tảng AI

Fireworks AI công bố API Đào tạo chính thức khả dụng

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Fireworks AI vào ngày 31 tháng 8 năm 2026 đã công bố việc API Đào tạo và Fireworks Lab chính thức khả dụng, mở cơ sở hạ tầng đào tạo và triển khai được quản lý của mình cho các nhóm ML muốn chạy các vòng lặp đào tạo tùy chỉnh trên các mô hình mở. API Đào tạo kết nối vòng lặp đào tạo Python của khách hàng với hệ thống tính toán phân tán do Fireworks quản lý, bao gồm cả bộ đào tạo tính gradient và cập nhật mô hình và triển khai rollout tạo mẫu từ mô hình.

The arrangement described in the announcement allows the customer to orchestrate the loop from any location they choose, keeping control over the loss or reward function, the data, and the environment. Fireworks manages the interaction between trainer and rollout, including weight synchronization, failed‑swap recovery, and train‑rollout alignment. The company positions the API as a response to constraints it says ML teams have reported in existing training workflows: limited model and method choice, restricted control over parameters and training loops, rigid compute, and fragmented training and rollout infrastructure.

Tính toán Không máy chủ và Dành riêng

API Đào tạo cung cấp hai tùy chọn tính toán. Đào tạo không máy chủ cho phép khách hàng đào tạo các bộ điều hợp LoRA trên hạ tầng chia sẻ với thanh toán theo token, và việc lấy mẫu diễn ra trong cùng một phiên; Fireworks mô tả nó phù hợp cho việc lặp lại các thí nghiệm, giảm rủi ro cho các chạy lớn hơn, hoặc chạy các vòng lặp học tăng cường luân phiên giữa rollout và đào tạo. Đào tạo dành riêng nhắm tới việc đào tạo toàn tham số, các mô hình vượt ra ngoài pool không máy chủ, độ dài ngữ cảnh lớn hơn hoặc hạng LoRA cao hơn, và thông lượng ổn định, tính phí theo giờ GPU trên dung lượng đàn hồi được điều chỉnh cho mỗi lần chạy.

Tầng không máy chủ gắn vào một pool chia sẻ luôn hoạt động với danh sách được tuyển chọn các mô hình phổ biến, dung lượng chia sẻ và giới hạn tốc độ cho mỗi tài khoản. Tầng dành riêng cung cấp một bộ đào tạo và triển khai cho mỗi lần chạy, hỗ trợ các chế độ LoRA và toàn tham số lên tới các mô hình mixture‑of‑experts lớn nhất, và không có sự tranh chấp hay giới hạn tốc độ. Các checkpoint tiềm năng có thể được triển khai vào suy luận sản xuất qua giao diện người dùng hoặc API, và việc triển khai đa LoRA cho phép mỗi khách hàng hoặc trường hợp sử dụng có mô hình được tinh chỉnh riêng mà không cần hạ tầng riêng biệt, công ty cho biết.

Ba Bề mặt Đào tạo

API Đào tạo nằm cạnh hai bề mặt khác trên nền tảng đào tạo Fireworks training platform. Managed Training, hướng tới các kỹ sư ML, chạy các công việc tích hợp sẵn trong đó khách hàng chọn một phương pháp — SFT, DPO hoặc RL — và một mô hình cơ sở, khởi chạy từ giao diện người dùng hoặc API. Fireworks Lab, cũng đã chính thức khả dụng kể từ thông báo, nhúng các nhà nghiên cứu và kỹ sư được triển khai trước vào các đội khách hàng; các dự án mở đầu bằng một chẩn đoán xác định khả năng, baseline, tiêu chí thành công và phạm vi, sau đó chuyển sang triển khai trong thời gian giới hạn, và khách hàng giữ lại mô hình sẵn sàng sản xuất, khung đánh giá, pipeline dữ liệu, vòng lặp đào tạo và các công thức.

API Đào tạo tự nó hướng tới các nhà nghiên cứu ML và hỗ trợ SFT, DPO, ORPO, RL và distillation, từ LoRA trên tính toán không máy chủ đến đào tạo toàn tham số trên các cụm dành riêng.

Học Tăng Cường ở Quy Mô Lớn

Fireworks cho biết mình là một trong số ít các tổ chức ngoài các phòng thí nghiệm tiên tiến đã vận hành học tăng cường trên hơn 10.000 GPU, và họ đặt khung đào tạo RL dựa trên ba yêu cầu: độ chính xác, hiệu suất và tốc độ phát triển.

Về độ chính xác, công ty cho biết engine rollout và bộ đào tạo phải chia sẻ cùng một định nghĩa số học, vì sự trôi dạt số nhỏ có thể làm hỏng tín hiệu học thông qua việc cắt token hoặc sụp đổ phần thưởng trong khi mọi thứ có vẻ hoạt động bình thường. Fireworks đồng bộ các định dạng số từ đầu đến cuối, bao gồm BF16, FP8 theo khối, và NVFP4, đồng bộ kernel và hành vi giảm tổng qua cả hai đường, và sử dụng Router Replay để bảo tồn quyết định định tuyến mixture‑of‑experts giữa rollout và quá trình lan truyền ngược cùng với các kernel không phụ thuộc batch và các phép giảm tổng xác định. Công ty cho biết họ xác thực sự đồng bộ này bằng cách chạy các chuỗi giống hệt qua engine rollout và bộ đào tạo và đo lường độ lệch KL giữa đào tạo và suy luận, với việc xác thực liên tục cho tất cả các mô hình được triển khai trên Fireworks training.

Về hiệu suất, Fireworks cho biết họ chạy RL bất đồng bộ, chồng chéo việc thu thập rollout với đào tạo sao cho các GPU rollout bắt đầu tạo lô tiếp theo trong khi bộ đào tạo cập nhật lô trước, với độ lỗi trọng số có giới hạn theo thuật toán. Sau mỗi bước đào tạo, trọng số đã cập nhật được tải nóng vào triển khai rollout đang chạy thay vì tắt và tải lại toàn bộ mô hình. Đối với các checkpoint toàn tham số, công ty cho biết họ tính toán sự khác biệt XOR giữa trọng số hiện tại và trước đó và áp dụng nén zstd, giảm tới 10 lần băng thông truyền tải.

Về tốc độ phát triển, công ty mô tả một vòng lặp liên tục đào tạo, triển khai, đánh giá, tái đào tạo trên một nền tảng, với các checkpoint chuyển thẳng vào dịch vụ và các dấu vết sản xuất, đánh giá và phản hồi cung cấp cho lần chạy tiếp theo. Họ cho biết các đội báo cáo số vòng lặp tăng từ hai đến bốn lần so với cùng ngân sách đào tạo.

Kết Quả Khách Hàng Được Trích Dẫn

Thông báo đã trích dẫn một số khách hàng. Harvey đã đào tạo lại Kimi K3 cho công việc pháp lý dài hạn bằng cách sử dụng RL bất đồng bộ; mô hình Harvey Tenet của họ đạt 19,7% all‑pass trên LAB so với 11,5% của Claude Fable 5, với chi phí mỗi nhiệm vụ khoảng một phần ba, Fireworks cho biết. Vercel đã sử dụng tinh chỉnh tăng cường và giải mã suy đoán cho auto‑fixer phiên bản v0, đạt tỷ lệ tạo ra không lỗi 93% và cải thiện độ trễ đầu cuối gấp 40 lần, theo công ty. Heidi Health đã chuyển bộ ghi chép lâm sàng sang các mô hình mở đã được tinh chỉnh, từ bằng chứng khái niệm đến sản xuất trong bốn tuần với độ trễ thấp hơn 3,5 lần. Factory đã tinh chỉnh hai bộ điều hợp LoRA nhỏ trên nền tảng Qwen mở để sàng lọc các bí mật bị lộ; với ngân sách 5% cảnh báo sai, mô hình đã bắt được khoảng 70% các bí mật thực tế so với khoảng 59% của GPT‑5.5, Fireworks báo cáo.

API Đào tạo hiện đã khả dụng thông qua đăng ký tự phục vụ của Fireworks, với quyền truy cập không máy chủ không cần chuẩn bị, và công ty đang hướng các đội muốn hỗ trợ thực tế tới các buổi tư vấn Fireworks Lab.

Theo Nash là một chuyên gia được tạo bởi trí tuệ nhân tạo tại Unite.AI, chuyên về cơ sở hạ tầng trí tuệ nhân tạo, tính toán và các hệ thống phần cứng hỗ trợ trí tuệ nhân tạo hiện đại. Công việc của ông tập trung vào các nền tảng kỹ thuật đằng sau các công việc trí tuệ nhân tạo quy mô lớn, bao gồm trung tâm dữ liệu, tăng tốc, mạng và các phần mềm liên kết chúng lại với nhau.
Với quan điểm phân tích và kỹ thuật, Theo nghiên cứu cách các tiến bộ trong GPU, silicon tùy chỉnh, kiến trúc bộ nhớ và hệ thống phân tán cho phép tạo ra các mô hình trí tuệ nhân tạo mới. Ông đặc biệt chú ý đến việc trao đổi hiệu suất, hiệu quả năng lượng, khả năng mở rộng và các hạn chế thực tế định hình việc triển khai cơ sở hạ tầng trí tuệ nhân tạo trong thế giới thực.
Các bài viết được viết bởi Theo Nash được tạo bởi trí tuệ nhân tạo và được nhóm biên tập của Unite.AI xem xét để đảm bảo độ chính xác kỹ thuật, sự rõ ràng và phạm vi bao quát có trách nhiệm về tính toán trí tuệ nhân tạo đang phát triển nhanh chóng.