Modele și platforme AI

Baseten adaugă DeepSeek-V4.1-Flash la API-urile de modele cu context de 1M de tokeni

mm
Adaugă Unite.AI la sursele tale preferate pe Google

DeepSeek-V4.1-Flash este disponibil acum pe API-urile de modele Baseten, Baseten a anunțat pe 11 septembrie 2026, aducând modelul multimodal cu 552 de miliarde de parametri și arhitectură mixture-of-experts (MoE), care combină 8 miliarde de parametri activi pentru preumplere cu 16 miliarde pentru decodare pe o fereastră de context de 1M de tokeni, pe platforma furnizorului de inferență.

DeepSeek a lansat greutățile deschise ale modelului pe Hugging Face, iar anunțul propriu al DeepSeek este datat pe 9 septembrie 2026. Modelul acceptă intrări de text și imagine și generează ieșire de text, iar fișa modelului afirmă că depozitul și greutățile sunt licențiate sub Licența MIT. Baseten descrie V4.1-Flash ca fiind a treia lansare flash cu greutate deschisă a DeepSeek din 2026 și ca singurul model de această scară care folosește ceea ce DeepSeek numește o arhitectură Causal Encoder-Decoder. Suportul pentru produsul de antrenament Loops de la Baseten va fi disponibil în curând, conform companiei.

Rezultatele benchmark raportate

Fișa modelului raportează rezultate instruct-model la setarea maximă de efort de raționament de 100: V4.1-Flash obține 90,6 la Terminal-Bench 2.1, comparativ cu 82,7 pentru V4-Flash și 87,9 pentru V4-Pro; 74,2 la DeepSWE v1.1, comparativ cu 54,4 și 62,7; și 54,8 la AutomationBench, comparativ cu 37,7 și 43,2. Baseten a evidențiat aceleași cifre pentru codare și agenție, afirmând că V4.1-Flash depășește V4-Pro cu aproximativ o treime din totalul parametrilor, în timp ce avertizează că un scor de 54,8 la AutomationBench înseamnă că modelul eșuează în aproximativ jumătate din fluxurile de lucru complexe și sfătuiește echipele să mențină un om în buclă pentru conductele de agenți.

În comparația din fișă cu modelele de frontieră la efort maxim, V4.1-Flash înregistrează 90,9 la GPQA Diamond, un rating Codeforces de 3471, și 63,9 la HLE cu instrumente. Baseten afirmă că V4.1-Flash este primul model non-experimental al DeepSeek cu intrare de imagine nativă, o capacitate anterior limitată la versiunea experimentală V4-Flash-Vision-Exp; tabelul său raportează 78,9 la Chartography și 49 la ZeroBench pentru noul model, comparativ cu 64,3 și 35 pentru cel experimental.

Arhitectura Causal Encoder-Decoder

Conform fișei modelului, V4.1-Flash organizează un Transformer de 40 de straturi ca un encoder cauzal de 20 de straturi urmat de un decoder de 20 de straturi, cu cache-ul global cheie-valoare (KV) al decoderului proiectat din stările ascunse finale ale encoderului, în loc să fie derivat din stările ascunse ale fiecărui strat al decoderului. Designul activează 8 miliarde de parametri pe token în timpul preumplerii și 16 miliarde în timpul decodării; Baseten contrastează acest lucru cu V4-Flash, care activează 13 miliarde pentru ambele etape, prezentând schimbarea ca o înlocuire a unei decodări mai grele cu o preumplere mult mai ușoară, o configurație pe care Baseten a afirmat că sporește eficiența costurilor pentru agenții de codare ale căror bucle agențiale generează mult mai mulți tokeni de preumplere decât tokeni de decodare.

Fișa raportează că Compressed Sparse Attention 2 al modelului atribuie fiecărui strat de atenție unul dintre cele trei moduri statice (Full, Reindex sau Reuse), cu un Hierarchical Sparse Indexer în decoder care limitează costul de indexare mai profund independent de lungimea contextului. Combinate cu cache-ul principal KV FP4, aceste designuri reduc cache-ul global KV la 890 de bytes pe token, aproximativ un sfert din V4-Flash, conform fișei. Un mecanism separat, SWA Bounded Replay, reconstruiește stările KV de atenție cu fereastră glisantă lipsă prin redarea doar a celor mai recente tokeni, reducând amprenta KV persistentă la aproximativ o optime din V4-Flash. Anunțul DeepSeek indică economiile la un sfert din HBM și o optime din stocarea SSD a generației anterioare.

Fiecare strat MoE utilizează un expert partajat și 384 de experți rutati, cu șase experți rutati activi pe token, iar modelul adaugă memorie condițională Engram cu 196 de miliarde de parametri alături de decodarea speculativă DSpark, conform fișei. DeepSeek a antrenat modelul de la zero pe un corpus multimodal de 45 de trilioane de tokeni, a antrenat atenția sa rară la o lungime de secvență de 64K și a extins contextul la 1M de tokeni la 34 de trilioane de tokeni. Post-antrenarea urmează o reglare fină supravegheată standard, învățare prin recompensă, și o secvență de distilare pe politică, cu modificări substanțiale concentrate în sinteza automată la scară largă a sarcinilor și mediilor agenților, iar modelul expune o setare de efort de raționament controlabilă continuu de la 1 la 100.

Tranziția API DeepSeek și Servirea Baseten

DeepSeek afirmă că V4-Flash și V4-Flash-Vision-Exp sunt retrase de pe platforma sa, iar denumirile vechi ale modelelor API sunt redirecționate temporar către V4.1-Flash pentru compatibilitate. Noua tarifare a API-ului a intrat în vigoare la ora 04:00 UTC pe 10 septembrie 2026, cu tarifele în afara orelor de vârf stabilite la 50% din tarifele de vârf, iar DeepSeek numește partenerii oficiali WorkBuddy (inclusiv CodeBuddy) și OpenCode ca susținători deplini ai V4.1-Flash.

Baseten a declarat că Inference Stack servește modelul utilizând NVIDIA Dynamo cu rutare conștientă de cache-ul KV, direcționând fiecare cerere către replica care deține deja prefixul său în loc de replica liberă. Modelul este oferit prin Biblioteca de modele Baseten, cu implementări dedicate disponibile pentru echipele care necesită capacitate rezervată.

Începând cu ora 04:00 UTC pe 14 septembrie 2026, toate cererile deepseek-v4-pro vor fi redirecționate către V4.1-Flash la tarifele V4.1-Flash, o aranjare pe care DeepSeek a declarat că va continua până la lansarea V4.1-Pro; laboratorul a afirmat că testele realizate de mai multe părți plasează V4.1-Flash înaintea V4-Pro în ceea ce privește performanța, costul, viteza și timpul total de execuție.

Jonas Reeve este un analist generat de IA la Unite.AI, axat pe inteligența artificială cognitivă, inteligența artificială generală (AGI) și fundamentele teoretice ale inteligenței mașinilor. Lucrările sale explorează modul în care învățarea, raționamentul, memoria și abstractizarea emerg în sisteme atât biologice, cât și artificiale, stabilind legături între arhitecturile moderne de IA și întrebările de lungă durată din știința cognitivă și filosofia minții.
Cu o abordare conceptuală și reflexivă, Jonas examinează cadre precum modelele de raționament, sistemele agenților, cogniția emergentă și teoria alinierii, având ca scop clarificarea progresului către AGI și a ceea ce nu reprezintă. Mai degrabă decât a urmări termene limită sau a fi influențat de tendințe, el subliniază principiile de bază, rigurozitatea conceptuală și limitele modelelor actuale.
Articolele scrise de Jonas Reeve sunt generate de IA și revizuite de echipa editorială a Unite.AI pentru a asigura acuratețea, claritatea și discuția responsabilă a conceptelor avansate de IA.