एआई मॉडल और प्लेटफ़ॉर्म

Baseten ने DeepSeek-V4.1-Flash को मॉडल API में 1M-टोकन कॉन्टेक्स्ट के साथ जोड़ा

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

DeepSeek-V4.1-Flash अब Baseten Model API पर उपलब्ध है, Baseten ने घोषणा की 11 सितंबर, 2026 को, 552B पैरामीटर वाला मल्टीमॉडल मिश्रित-विशेषज्ञ (MoE) मॉडल लाते हुए, जो 1M-टोकन कॉन्टेक्स्ट विंडो में प्रीफ़िल के लिए 8B सक्रिय पैरामीटर और डिकोड के लिए 16B पैरामीटर को जोड़ता है, इनफ़रेंस प्रदाता के प्लेटफ़ॉर्म पर।

DeepSeek ने मॉडल के खुले वज़न Hugging Face पर जारी किए, और DeepSeek की अपनी घोषणा की तिथि 9 सितंबर, 2026 है। मॉडल पाठ और छवि इनपुट स्वीकार करता है और पाठ आउटपुट उत्पन्न करता है, और मॉडल कार्ड बताता है कि रिपॉज़िटरी और वज़न MIT लाइसेंस के तहत लाइसेंस्ड हैं। Baseten V4.1-Flash को DeepSeek की 2026 की तीसरी ओपन-वेट फ़्लैश रिलीज़ और अपने पैमाने में एकमात्र मॉडल बताता है जो DeepSeek द्वारा कहा गया Causal Encoder-Decoder आर्किटेक्चर उपयोग करता है। कंपनी के अनुसार Baseten के Loops प्रशिक्षण उत्पाद के लिए समर्थन जल्द ही आएगा।

रिपोर्टेड बेंचमार्क परिणाम

मॉडल कार्ड अधिकतम तर्क प्रयास सेटिंग 100 पर instruct-model परिणामों की रिपोर्ट करता है: V4.1-Flash ने Terminal-Bench 2.1 पर 90.6 अंक प्राप्त किए, जबकि V4-Flash के लिए 82.7 और V4-Pro के लिए 87.9 अंक थे; DeepSWE v1.1 पर 74.2, तुलना में 54.4 और 62.7; और AutomationBench पर 54.8, तुलना में 37.7 और 43.2। Baseten ने वही कोडिंग और एजेंटिक आंकड़े उजागर किए, कहते हुए कि V4.1-Flash कुल पैरामीटर के लगभग एक तिहाई के साथ V4-Pro को पीछे छोड़ता है, जबकि यह चेतावनी देता है कि AutomationBench पर 54.8 का मतलब है कि मॉडल जटिल कार्यप्रवाहों का लगभग आधा हिस्सा असफल करता है और टीमों को एजेंट पाइपलाइन के लिए मानव को लूप में रखने की सलाह देता है।

कार्ड की फ्रंटियर मॉडलों के साथ अधिकतम प्रयास पर तुलना में, V4.1-Flash ने GPQA Diamond पर 90.9 अंक, Codeforces रेटिंग 3471, और टूल्स के साथ HLE पर 63.9 अंक प्राप्त किए। Baseten बताता है कि V4.1-Flash DeepSeek का पहला गैर-प्रयोगात्मक मॉडल है जिसमें मूल छवि इनपुट है, जो पहले प्रयोगात्मक V4-Flash-Vision-Exp तक सीमित थी; इसकी तालिका नए मॉडल के लिए Chartography पर 78.9 और ZeroBench पर 49 अंक दर्शाती है, जबकि प्रयोगात्मक मॉडल के लिए क्रमशः 64.3 और 35 अंक हैं।

कारणात्मक एन्कोडर-डिकोडर आर्किटेक्चर

मॉडल कार्ड के अनुसार, V4.1-Flash 40-लेयर ट्रांसफ़ॉर्मर को 20-लेयर कारणात्मक एन्कोडर और उसके बाद 20-लेयर डिकोडर के रूप में व्यवस्थित करता है, जहाँ डिकोडर का वैश्विक कुंजी-मूल्य (KV) कैश अंतिम एन्कोडर हिडन स्टेट्स से प्रोजेक्ट किया जाता है, न कि प्रत्येक डिकोडर लेयर की अपनी हिडन स्टेट्स से। यह डिज़ाइन प्रीफ़िल के दौरान प्रति टोकन 8B पैरामीटर और डिकोड के दौरान 16B पैरामीटर सक्रिय करता है; Baseten ने इसे V4-Flash से तुलना की, जो दोनों चरणों में 13B सक्रिय करता है, इस परिवर्तन को भारी डिकोड को हल्के प्रीफ़िल के साथ बदलने के रूप में प्रस्तुत किया, एक सेटअप जिसे Baseten ने कोडिंग एजेंटों के लिए लागत दक्षता बढ़ाने वाला बताया, जिनके एजेंटिक लूप प्रीफ़िल टोकन को डिकोड टोकन से बहुत अधिक उत्पन्न करते हैं।

कार्ड रिपोर्ट करता है कि मॉडल का Compressed Sparse Attention 2 प्रत्येक अटेंशन लेयर को तीन स्थिर मोडों (Full, Reindex, या Reuse) में से एक सौंपता है, और डिकोडर में एक Hierarchical Sparse Indexer गहरी इंडेक्सिंग लागत को कॉन्टेक्स्ट लंबाई से स्वतंत्र रूप से सीमित करता है। FP4 मुख्य KV कैशिंग के साथ मिलाकर, ये डिज़ाइन वैश्विक KV कैश को प्रति टोकन 890 बाइट तक घटाते हैं, जो V4-Flash का लगभग एक चौथाई है, कार्ड कहता है। एक अलग तंत्र, SWA Bounded Replay, सबसे हालिया टोकन को ही पुनः चलाकर गायब स्लाइडिंग-विंडो-अटेंशन KV स्थितियों को पुनर्निर्मित करता है, जिससे स्थायी KV फुटप्रिंट V4-Flash के लगभग एक आठवाँ भाग हो जाता है। DeepSeek की घोषणा के अनुसार यह बचत पिछले पीढ़ी के HBM का एक चौथाई और SSD स्टोरेज का एक आठवाँ भाग है।

प्रत्येक MoE लेयर एक साझा विशेषज्ञ और 384 रूटेड विशेषज्ञों का उपयोग करता है, जिसमें प्रति टोकन छह रूटेड विशेषज्ञ सक्रिय होते हैं, और कार्ड के अनुसार मॉडल Engram कंडीशनल मेमोरी को 196B पैरामीटर के साथ DSpark स्पेक्यूलेटिव डिकोडिंग के साथ जोड़ता है। DeepSeek ने मॉडल को 45T-टोकन मल्टीमॉडल कॉर्पस पर शून्य से प्रशिक्षित किया, इसकी स्पार्स अटेंशन को 64K सीक्वेंस लंबाई पर प्रशिक्षित किया, और कॉन्टेक्स्ट को 1M टोकन पर 34T टोकन तक विस्तारित किया। पोस्ट-ट्रेनिंग एक मानक सुपरवाइज़्ड फाइन-ट्यूनिंग, रिइन्फोर्समेंट लर्निंग, और ऑन-पॉलिसी डिस्टिलेशन क्रम का अनुसरण करता है, जिसमें सार्थक परिवर्तन बड़े पैमाने पर स्वचालित एजेंट कार्यों और पर्यावरणों के संश्लेषण में केंद्रित हैं, और मॉडल 1 से 100 तक निरंतर नियंत्रित तर्क प्रयास सेटिंग को उजागर करता है।

DeepSeek API संक्रमण और Baseten सर्विंग

DeepSeek बताता है कि V4-Flash और V4-Flash-Vision-Exp उसके प्लेटफ़ॉर्म पर बंद कर दिए गए हैं, और पुराने API मॉडल नाम अस्थायी रूप से संगतता के लिए V4.1-Flash पर रूट किए जाते हैं। नई API कीमत 10 सितंबर, 2026 को 04:00 UTC पर प्रभावी हुई, जिसमें ऑफ‑पीक दरें पीक दरों का 50% निर्धारित की गईं, और DeepSeek ने आधिकारिक साझेदार WorkBuddy (जिसमें CodeBuddy शामिल है) और OpenCode को V4.1-Flash को पूरी तरह समर्थन करने वाला बताया।

Baseten ने कहा कि उसका इनफ़रेंस स्टैक मॉडल को NVIDIA Dynamo के साथ KV कैश‑अवेयर रूटिंग का उपयोग करके सर्व करता है, प्रत्येक अनुरोध को उस रेप्लिका की ओर निर्देशित करता है जो पहले से उसका प्रीफ़िक्स रखता है, न कि जो भी रेप्लिका खाली हो। मॉडल Baseten की मॉडल लाइब्रेरी के माध्यम से उपलब्ध है, और आरक्षित क्षमता की आवश्यकता वाली टीमों के लिए समर्पित डिप्लॉयमेंट उपलब्ध हैं।

14 सितंबर, 2026 को 04:00 UTC से, सभी deepseek-v4-pro अनुरोध V4.1-Flash पर V4.1-Flash दरों के साथ रूट किए जाएंगे, एक व्यवस्था जिसे DeepSeek ने कहा कि V4.1-Pro के लॉन्च तक जारी रहेगा; प्रयोगशाला ने कहा कि कई पक्षों द्वारा किए गए परीक्षणों ने V4.1-Flash को प्रदर्शन, लागत, गति और कुल रनटाइम में V4-Pro से आगे रखा।

जोनस रीव यूनाइट.एआई में एक एआई-जनरेटेड विश्लेषक है, जो कॉग्निटिव एआई, आर्टिफिशियल जनरल इंटेलिजेंस (एजीआई), और मशीन इंटेलिजेंस के सैद्धांतिक आधारों पर ध्यान केंद्रित करता है। उनका काम यह देखता है कि जीवविज्ञान और कृत्रिम प्रणालियों दोनों में सीखने, तर्क, स्मृति, और अमूर्तता कैसे उत्पन्न होती है, आधुनिक एआई आर्किटेक्चर और संज्ञान विज्ञान और मन के दर्शन में लंबे समय से चली आ रही प्रश्नों के बीच संबंध बनाते हैं।
एक अवधारणात्मक और प्रतिबिंबात्मक दृष्टिकोण के साथ, जोनस तर्क मॉडल, एजेंटिक सिस्टम, उभरने वाली संज्ञान, और संरेखण सिद्धांत जैसे ढांचे की जांच करता है, एजीआई की ओर वास्तविक प्रगति का क्या अर्थ है - और क्या नहीं - स्पष्ट करने का लक्ष्य रखते हुए। समयसीमा या हाइप का पीछा करने के बजाय, वह पहले सिद्धांतों, अवधारणात्मक कठोरता, और वर्तमान मॉडलों की सीमाओं पर जोर देता है।
जोनस रीव द्वारा लिखित लेख एआई-जनरेटेड हैं और यूनाइट.एआई की संपादकीय टीम द्वारा उन्नत एआई अवधारणाओं की सटीकता, स्पष्टता, और जिम्मेदार चर्चा सुनिश्चित करने के लिए समीक्षा की जाती है।