Modelli e piattaforme di IA
Baseten aggiunge DeepSeek-V4.1-Flash alle API dei modelli con contesto di 1 M di token

DeepSeek-V4.1-Flash è ora disponibile su Baseten Model APIs, Baseten ha annunciato l’11 settembre 2026, portando il modello multimodale a 552 B parametri mixture-of-experts (MoE), che combina 8 B di parametri attivi per il prefill con 16 B per il decode su una finestra di contesto di 1 M di token, sulla piattaforma del provider di inferenza.
DeepSeek ha rilasciato i pesi aperti del modello su Hugging Face, e l’annuncio di DeepSeek è datata 9 settembre 2026. Il modello accetta input di testo e immagine e genera output di testo, e la scheda del modello afferma che il repository e i pesi sono concessi in licenza sotto la MIT License. Baseten descrive V4.1-Flash come la terza release flash a peso aperto di DeepSeek del 2026 e come l’unico modello della sua scala a utilizzare quella che DeepSeek chiama un’architettura Causal Encoder-Decoder. Il supporto per il prodotto di addestramento Loops di Baseten arriverà presto, secondo l’azienda.
Risultati di benchmark segnalati
La model card riporta i risultati del modello instruct al livello massimo di sforzo di ragionamento impostato a 100: V4.1-Flash ottiene 90,6 su Terminal-Bench 2.1, rispetto a 82,7 per V4-Flash e 87,9 per V4-Pro; 74,2 su DeepSWE v1.1, rispetto a 54,4 e 62,7; e 54,8 su AutomationBench, rispetto a 37,7 e 43,2. Baseten ha evidenziato le stesse cifre per la programmazione e le capacità agentiche, affermando che V4.1-Flash supera V4-Pro con circa un terzo del totale dei parametri, avvertendo però che un 54,8 su AutomationBench indica che il modello fallisce circa la metà dei flussi di lavoro complessi e consigliando ai team di mantenere un umano nel ciclo per le pipeline agent.
Nel confronto della card con i modelli all’avanguardia al massimo sforzo, V4.1-Flash registra 90,9 su GPQA Diamond, una valutazione Codeforces di 3471, e 63,9 su HLE con strumenti. Baseten afferma che V4.1-Flash è il primo modello non sperimentale di DeepSeek con input immagine nativo, capacità prima limitata al modello sperimentale V4-Flash-Vision-Exp; la sua tabella riporta 78,9 su Chartography e 49 su ZeroBench per il nuovo modello, contro 64,3 e 35 per quello sperimentale.
Architettura Causal Encoder-Decoder
Secondo la model card, V4.1-Flash organizza un Transformer a 40 strati come un encoder causale a 20 strati seguito da un decoder a 20 strati, con la cache globale chiave‑valore (KV) del decoder proiettata dallo stato nascosto finale dell’encoder anziché derivata dallo stato nascosto di ciascun strato del decoder. Il design attiva 8 B parametri per token durante il prefill e 16 B durante il decode; Baseten confronta ciò con V4-Flash, che attiva 13 B per entrambi i passaggi, inquadrando il cambiamento come uno scambio di un decode più pesante per un prefill molto più leggero, una configurazione che, secondo Baseten, aumenta l’efficienza dei costi per gli agenti di programmazione i cui loop agentici generano molti più token di prefill rispetto ai token di decode.
La card riporta che il Compressed Sparse Attention 2 del modello assegna a ciascun strato di attenzione una delle tre modalità statiche (Full, Reindex o Reuse), con un Hierarchical Sparse Indexer nel decoder che limita il costo di indicizzazione più profonda indipendentemente dalla lunghezza del contesto. In combinazione con la cache KV principale FP4, tali progetti riducono la cache KV globale a 890 byte per token, circa un quarto di V4-Flash, secondo la card. Un meccanismo separato, SWA Bounded Replay, ricostruisce gli stati KV di attenzione a finestra scorrevole mancanti riproducendo solo i token più recenti, riducendo l’impronta KV persistente a circa un ottavo di V4-Flash. L’annuncio di DeepSeek indica che il risparmio corrisponde a un quarto della memoria HBM e a un ottavo dello spazio SSD della generazione precedente.
Ogni strato MoE utilizza un esperto condiviso e 384 esperti instradati con sei esperti instradati attivi per token, e il modello aggiunge memoria condizionale Engram con 196 B parametri accanto al decoding speculativo DSpark, secondo la card. DeepSeek ha addestrato il modello da zero su un corpus multimodale di 45 T token, ha addestrato la sua attenzione sparsa con una lunghezza di sequenza di 64 K e ha esteso il contesto a 1 M di token su 34 T token. Il post‑training segue un fine‑tuning supervisionato standard, apprendimento per rinforzo, e una sequenza di distillazione on‑policy, con modifiche sostanziali concentrate nella sintesi automatizzata su larga scala di compiti e ambienti per agenti, e il modello espone un’impostazione di sforzo di ragionamento continuamente controllabile da 1 a 100.
Transizione API DeepSeek e Servizio Baseten
DeepSeek dichiara che V4-Flash e V4-Flash-Vision-Exp sono ritirati sulla sua piattaforma, con i vecchi nomi dei modelli API temporaneamente reindirizzati a V4.1-Flash per compatibilità. Il nuovo prezzo dell’API è entrato in vigore alle 04:00 UTC del 10 settembre 2026, con tariffe fuori picco impostate al 50 % delle tariffe di picco, e DeepSeek indica i partner ufficiali WorkBuddy (incluso CodeBuddy) e OpenCode come pienamente a supporto di V4.1-Flash.
Baseten ha dichiarato che il suo Inference Stack fornisce il modello utilizzando NVIDIA Dynamo con routing consapevole della cache KV, indirizzando ogni richiesta alla replica che già contiene il suo prefisso anziché a quella libera. Il modello è offerto tramite la Model Library di Baseten, con distribuzioni dedicate disponibili per i team che necessitano di capacità riservata.
A partire dalle 04:00 UTC del 14 settembre 2026, tutte le richieste deepseek-v4-pro saranno reindirizzate a V4.1-Flash alle tariffe V4.1-Flash, un accordo che DeepSeek ha dichiarato continuerà fino al lancio di V4.1-Pro; il laboratorio ha affermato che i test di più parti hanno posizionato V4.1-Flash al di sopra di V4-Pro in termini di prestazioni, costi, velocità e tempo di esecuzione totale.












