एआई मॉडल और प्लेटफ़ॉर्म

Fireworks AI ने प्रशिक्षण API को सामान्य उपलब्धता प्रदान की

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

Fireworks AI ने 31 अगस्त, 2026 को अपने प्रशिक्षण API और Fireworks Lab की सामान्य उपलब्धता की घोषणा की, जिससे वह प्रबंधित प्रशिक्षण और रोलआउट बुनियादी ढांचे को उन एमएल टीमों के लिए खोल रहा है जो खुले मॉडलों पर कस्टम प्रशिक्षण लूप चलाना चाहती हैं। प्रशिक्षण API ग्राहक के अपने पायथन प्रशिक्षण लूप को Fireworks‑प्रबंधित वितरित कंप्यूट से जोड़ती है, जिसमें ग्रेडिएंट की गणना करने और मॉडल को अपडेट करने वाला ट्रेनर तथा उससे नमूने उत्पन्न करने वाला रोलआउट डिप्लॉयमेंट दोनों शामिल हैं।

उक्त घोषणा में वर्णित व्यवस्था के तहत, ग्राहक लूप को अपनी पसंद के स्थान से संचालित करता है, जिससे वह नुकसान या रिवॉर्ड फ़ंक्शन, डेटा और पर्यावरण पर नियंत्रण रखता है। Fireworks ट्रेनर और रोलआउट के बीच अंतःक्रिया का प्रबंधन करता है, जिसमें वज़न समकालिकरण, विफल‑स्वैप पुनर्प्राप्ति, और ट्रेन‑रोलआउट संरेखण शामिल हैं। कंपनी इस API को मौजूदा प्रशिक्षण कार्यप्रवाहों में रिपोर्ट की गई सीमाओं के जवाब में प्रस्तुत करती है: सीमित मॉडल और विधि चयन, पैरामीटर और प्रशिक्षण लूप पर प्रतिबंधित नियंत्रण, कठोर कंप्यूट, और बिखरा हुआ प्रशिक्षण व रोलआउट बुनियादी ढांचा।

सर्वरलेस और समर्पित कंप्यूट

Training API दो कंप्यूट विकल्प प्रदान करती है। सर्वरलेस प्रशिक्षण ग्राहकों को साझा बुनियादी ढांचे पर LoRA एडेप्टर को प्रति‑टोकन बिलिंग के साथ प्रशिक्षित करने देता है, और सैंपलिंग उसी सत्र में चलती है; Fireworks इसे प्रयोगों पर पुनरावृति, बड़े रन के जोखिम को कम करने, या रोलआउट और प्रशिक्षण के बीच वैकल्पिक रहने वाले रिइन्फोर्समेंट लर्निंग लूप चलाने के लिए उपयुक्त बताता है। समर्पित प्रशिक्षण पूर्ण‑पैरामीटर प्रशिक्षण, सर्वरलेस पूल से बाहर के मॉडल, बड़े संदर्भ लंबाई या LoRA रैंक, तथा निरंतर थ्रूपुट को लक्षित करता है, और प्रत्येक रन के अनुसार आकारित इलास्टिक क्षमता पर GPU घंटे के आधार पर बिल किया जाता है।

सर्वरलेस स्तर हमेशा‑सक्रिय साझा पूल से जुड़ा होता है जिसमें लोकप्रिय मॉडलों की चयनित सूची, साझा क्षमता, और प्रति‑खाते दर सीमाएँ होती हैं। समर्पित स्तर प्रत्येक रन के लिए एक ट्रेनर और डिप्लॉयमेंट प्रदान करता है, सबसे बड़े मिश्रित‑विशेषज्ञ मॉडलों तक LoRA और पूर्ण‑पैरामीटर मोड का समर्थन करता है, और कोई प्रतिस्पर्धा या दर सीमाएँ नहीं रखता। आशाजनक चेकपॉइंट्स को UI या API के माध्यम से प्रोडक्शन इन्फ़रेंस में डिप्लॉय किया जा सकता है, और मल्टी‑LoRA डिप्लॉयमेंट प्रत्येक ग्राहक या उपयोग‑केस को अलग बुनियादी ढांचे के बिना अपना ट्यून किया हुआ मॉडल देता है, कंपनी ने कहा।

तीन प्रशिक्षण सतहें

Training API Fireworks प्रशिक्षण मंच पर दो अन्य सतहों के साथ स्थित है। मैनेज्ड ट्रेनिंग, जो एमएल इंजीनियरों के लिए लक्षित है, अंतर्निहित जॉब चलाती है जिसमें ग्राहक एक विधि — SFT, DPO, या RL — और एक बेस मॉडल चुनता है, और UI या API से लॉन्च करता है। Fireworks Lab, जो घोषणा के समय से सामान्य उपलब्ध है, ग्राहक टीमों के साथ अग्रिम‑तैनात शोधकर्ताओं और इंजीनियरों को सम्मिलित करता है; सहभागिता एक निदान से शुरू होती है जो क्षमता, बेसलाइन, सफलता मानदंड और दायरा निर्धारित करता है, फिर समय‑सीमित कार्यान्वयन में जाता है, और ग्राहक उत्पादन‑तैयार मॉडल, मूल्यांकन फ्रेमवर्क, डेटा पाइपलाइन, प्रशिक्षण लूप और रेसिपी रखता है।

Training API स्वयं एमएल शोधकर्ताओं के लिए लक्षित है और SFT, DPO, ORPO, RL, तथा डिस्टिलेशन का समर्थन करती है, सर्वरलेस कंप्यूट पर LoRA से लेकर समर्पित क्लस्टरों पर पूर्ण‑पैरामीटर प्रशिक्षण तक।

स्केल पर रिइन्फोर्समेंट लर्निंग

Fireworks कहता है कि वह फ्रंटियर लैब्स के बाहर कुछ ही संगठनों में से एक है जिसने 10,000 से अधिक GPUs पर रिइन्फोर्समेंट लर्निंग चलाया है, और वह RL प्रशिक्षण को तीन आवश्यकताओं के इर्द‑गिर्द व्यवस्थित करता है: शुद्धता, प्रदर्शन दक्षता, और विकास गति।

शुद्धता के संदर्भ में, कंपनी ने कहा कि रोलआउट इंजन और ट्रेनर को समान संख्यात्मक परिभाषा साझा करनी चाहिए, क्योंकि छोटी संख्यात्मक विचलन टोकन क्लिपिंग या रिवॉर्ड पतन के माध्यम से सीखने संकेत को बिगाड़ सकता है जबकि सब कुछ काम करता दिखता है। Fireworks संख्यात्मक स्वरूपों को अंत‑से‑अंत संरेखित करता है, जिसमें BF16, ब्लॉक‑वाइज FP8, और NVFP4 शामिल हैं, दोनों मार्गों में कर्नेल और रिडक्शन व्यवहार को संरेखित करता है, और Router Replay का उपयोग करके रोलआउट और बैकवर्ड पास के बीच मिश्रित‑विशेषज्ञ रूटिंग निर्णयों को बैच‑इनवेरिएंट कर्नेल और निर्धारक रिडक्शन के साथ संरक्षित करता है। कंपनी ने कहा कि वह रोलआउट इंजन और ट्रेनर के माध्यम से समान क्रम चलाकर और ट्रेन‑इन्फ़रेंस KL विचलन मापकर संरेखण को सत्यापित करती है, और Fireworks प्रशिक्षण पर लॉन्च किए गए सभी मॉडलों के लिए निरंतर सत्यापन करती है।

प्रदर्शन के संदर्भ में, Fireworks ने कहा कि वह असिंक्रोनस RL चलाता है, जिसमें रोलआउट संग्रह को प्रशिक्षण के साथ ओवरलैप किया जाता है ताकि रोलआउट GPUs अगली बैच उत्पन्न करना शुरू कर दें जबकि ट्रेनर पिछले पर अपडेट करता है, और जहाँ एल्गोरिदम अनुमति देता है वहाँ सीमित वज़न पुरातनता रहती है। प्रत्येक प्रशिक्षण चरण के बाद, अपडेटेड वज़न को चल रहे रोलआउट डिप्लॉयमेंट में हॉट‑लोड किया जाता है, बजाय इसे बंद करके पूर्ण मॉडल को पुनः लोड करने के। पूर्ण‑पैरामीटर चेकपॉइंट्स के लिए, कंपनी ने कहा कि वह वर्तमान और पिछले वज़न के बीच XOR अंतर की गणना करता है और zstd संपीड़न लागू करता है, जिससे ट्रांसमिशन बैंडविड्थ में लगभग 10 गुना तक कमी आती है।

विकास गति के संदर्भ में, कंपनी ने एक ही प्लेटफ़ॉर्म पर निरंतर ट्रेन, डिप्लॉय, इवैल्यूएट, री‑ट्रेन लूप का वर्णन किया, जिसमें चेकपॉइंट्स सीधे सर्विंग और प्रोडक्शन ट्रेस, इवैल्यूएशन और फीडबैक में प्रवाहित होते हैं और अगले रन को प्रेरित करते हैं। उन्होंने कहा कि टीमें समान प्रशिक्षण बजट पर दो से चार गुना अधिक इटरशन की रिपोर्ट करती हैं।

उल्लेखित ग्राहक परिणाम

घोषणा ने कई ग्राहकों का उल्लेख किया। Harvey ने असिंक्रोनस RL का उपयोग करके दीर्घकालिक कानूनी कार्यों के लिए Kimi K3 को पोस्ट‑ट्रेन किया; उसका Harvey Tenet मॉडल ने LAB पर 19.7% ऑल‑पास स्कोर हासिल किया, जबकि Claude Fable 5 ने 11.5% स्कोर किया, और कार्य प्रति लागत लगभग एक‑तीहाई थी, Fireworks ने कहा। Vercel ने v0 के ऑटो‑फ़िक्सर के लिए रिइन्फोर्समेंट फाइन‑ट्यूनिंग और स्पेक्यूलेटिव डिकोडिंग का उपयोग किया, जिससे 93% त्रुटि‑रहित जनरेशन दर और 40 गुना एंड‑टू‑एंड लेटेंसी सुधार प्राप्त हुआ, कंपनी के अनुसार। Heidi Health ने अपने क्लिनिकल स्क्राइब को फाइन‑ट्यून्ड ओपन मॉडलों पर स्थानांतरित किया, चार हफ्तों में प्रूफ़‑ऑफ़‑कॉन्सेप्ट से प्रोडक्शन तक पहुँचा और लेटेंसी 3.5 गुना कम हुई। Factory ने खुले Qwen बेस पर दो छोटे LoRA एडेप्टर को फाइन‑ट्यून किया ताकि उजागर रहस्यों को स्क्रीन किया जा सके; 5% फॉल्स‑अलार्म बजट पर, प्रशिक्षित मॉडल ने वास्तविक रहस्यों का लगभग 70% पकड़ा, जबकि GPT‑5.5 ने लगभग 59% पकड़े, Fireworks ने रिपोर्ट किया।

Training API अब Fireworks के सेल्फ‑सर्व साइन‑अप के माध्यम से उपलब्ध है, जहाँ सर्वरलेस एक्सेस के लिए कोई प्रोविजनिंग आवश्यक नहीं है, और कंपनी उन टीमों को जो हाथ‑से‑हाथ समर्थन चाहते हैं, Fireworks Lab परामर्श की ओर निर्देशित कर रही है।

थियो नैश यूनाइट.एआई में एक एआई-जनरेटेड विशेषज्ञ है, जो एआई इंफ्रास्ट्रक्चर, कंप्यूट, और आधुनिक कृत्रिम बुद्धिमत्ता को शक्ति प्रदान करने वाले हार्डवेयर सिस्टम को कवर करता है। उनका काम बड़े पैमाने पर एआई कार्यभार के पीछे के तकनीकी आधारों पर केंद्रित है, जिसमें डेटा सेंटर, एक्सेलरेटर, नेटवर्किंग, और सॉफ्टवेयर स्टैक शामिल हैं जो उन्हें एक साथ जोड़ते हैं।
एक विश्लेषणात्मक और इंजीनियरिंग-चालित दृष्टिकोण के साथ, थियो जीपीयू, कस्टम सिलिकॉन, मेमोरी आर्किटेक्चर, और वितरित प्रणालियों में प्रगति का अध्ययन करता है कि वे नए पीढ़ी के एआई मॉडल को कैसे सक्षम बनाते हैं। वह प्रदर्शन व्यापार-ऑफ, ऊर्जा दक्षता, स्केलेबिलिटी, और व्यावहारिक प्रतिबंधों पर विशेष ध्यान देता है जो एआई इंफ्रास्ट्रक्चर के वास्तविक दुनिया के तैनाती को आकार देते हैं।
थियो नैश द्वारा लिखित लेख एआई-जनरेटेड हैं और यूनाइट.एआई की संपादकीय टीम द्वारा तकनीकी सटीकता, स्पष्टता, और तेजी से विकसित हो रहे एआई कंप्यूट लैंडस्केप के जिम्मेदार कवरेज को सुनिश्चित करने के लिए समीक्षा की जाती है।