Μοντέλα και πλατφόρμες AI

Baseten προσθέτει το DeepSeek‑V4.1‑Flash στις Model APIs με 1M-Token Πλαίσιο

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Το DeepSeek‑V4.1‑Flash είναι πλέον διαθέσιμο στις Baseten Model APIs, Baseten ανακοίνωσε στις 11 Σεπτεμβρίου 2026, προσφέροντας το μοντέλο πολυμορφικού μίγματος ειδικών (MoE) με 552 δισεκατομμύρια παραμέτρους, το οποίο συνδυάζει 8 δισεκατομμύρια ενεργές παραμέτρους για προγέμιση με 16 δισεκατομμύρια για αποκωδικοποίηση σε παράθυρο περιβάλλοντος 1M‑token, στην πλατφόρμα του παρόχου εξαγωγής.

Η DeepSeek δημοσίευσε τα ανοιχτά βάρη του μοντέλου στο Hugging Face, και η δική της ανακοίνωση είναι ημερομηνίας 9 Σεπτεμβρίου 2026. Το μοντέλο δέχεται κείμενο και εικόνα ως είσοδο και παράγει κείμενο ως έξοδο, και η κάρτα μοντέλου δηλώνει ότι το αποθετήριο και τα βάρη αδειοδοτούνται υπό την MIT License. Η Baseten περιγράφει το V4.1‑Flash ως την τρίτη έκδοση ανοιχτών βαρών flash του 2026 της DeepSeek και ως το μοναδικό μοντέλο της κλίμακας του που χρησιμοποιεί ό,τι η DeepSeek ονομάζει αρχιτεκτονική Causal Encoder‑Decoder. Η υποστήριξη για το προϊόν εκπαίδευσης Loops της Baseten θα έρθει σύντομα, σύμφωνα με την εταιρεία.

Αναφερθέντα Αποτελέσματα Benchmark

Η κάρτα μοντέλου αναφέρει τα αποτελέσματα instruct-model στη μέγιστη ρύθμιση προσπάθειας λογικής 100: το V4.1‑Flash σημειώνει 90,6 στο Terminal‑Bench 2.1, συγκριτικά με 82,7 για το V4‑Flash και 87,9 για το V4‑Pro· 74,2 στο DeepSWE v1.1, συγκριτικά με 54,4 και 62,7· και 54,8 στο AutomationBench, συγκριτικά με 37,7 και 43,2. Η Baseten τόνισε τα ίδια στοιχεία κωδικοποίησης και πρακτόρων, λέγοντας ότι το V4.1‑Flash ξεπερνά το V4‑Pro με περίπου το ένα τρίτο των συνολικών παραμέτρων, ενώ προειδοποιεί ότι ένα 54,8 στο AutomationBench σημαίνει ότι το μοντέλο αποτυγχάνει περίπου τη μισή των σύνθετων ροών εργασίας και συμβουλεύει τις ομάδες να διατηρούν έναν άνθρωπο στην αλυσίδα για τις αγωγές πρακτόρων.

Στη σύγκριση της κάρτας με μοντέλα αιχμής στη μέγιστη προσπάθεια, το V4.1‑Flash καταγράφει 90,9 στο GPQA Diamond, βαθμολογία Codeforces 3471, και 63,9 στο HLE με εργαλεία. Η Baseten δηλώνει ότι το V4.1‑Flash είναι το πρώτο μη‑πειραματικό μοντέλο της DeepSeek με εγγενή είσοδο εικόνας, δυνατότητα που προηγουμένως περιοριζόταν στο πειραματικό V4‑Flash‑Vision‑Exp· ο πίνακάς του αναφέρει 78,9 στο Chartography και 49 στο ZeroBench για το νέο μοντέλο, έναντι 64,3 και 35 για το πειραματικό.

Αρχιτεκτονική Causal Encoder‑Decoder

Σύμφωνα με την κάρτα μοντέλου, το V4.1‑Flash οργανώνει έναν Transformer 40 επιπέδων ως 20‑επίπεδο causal encoder ακολουθούμενο από 20‑επίπεδο decoder, με την παγκόσμια κρυφή μνήμη κλειδιού‑τιμής (KV) του decoder να προβάλλεται από τις τελικές κρυφές καταστάσεις του encoder αντί να προέρχεται από τις δικές του κρυφές καταστάσεις σε κάθε επίπεδο decoder. Ο σχεδιασμός ενεργοποιεί 8 δισεκατομμύρια παραμέτρους ανά σύμβολο κατά την προγέμιση και 16 δισεκατομμύρια κατά την αποκωδικοποίηση· η Baseten το συγκρίνει με το V4‑Flash, που ενεργοποιεί 13 δισεκατομμύρια και στα δύο βήματα, παρουσιάζοντας την αλλαγή ως ανταλλαγή μιας βαρύτερης αποκωδικοποίησης για μια πολύ ελαφρύτερη προγέμιση, μια ρύθμιση που, σύμφωνα με τη Baseten, αυξάνει την αποδοτικότητα κόστους για τους κωδικοποιητικούς πράκτορες των οποίων οι βρόχοι πρακτόρων παράγουν πολύ περισσότερα σύμβολα προγέμισης από σύμβολα αποκωδικοποίησης.

Η κάρτα αναφέρει ότι το Compressed Sparse Attention 2 του μοντέλου αναθέτει σε κάθε στρώση προσοχής μία από τις τρεις στατικές λειτουργίες (Full, Reindex ή Reuse), με έναν Hierarchical Sparse Indexer στον decoder που περιορίζει το κόστος βαθύτερης ευρετηρίασης ανεξάρτητα από το μήκος του πλαισίου. Συνδυασμένα με την κύρια κρυφή μνήμη KV FP4, αυτά τα σχέδια μειώνουν την παγκόσμια κρυφή μνήμη KV σε 890 byte ανά σύμβολο, περίπου το ένα τέταρτο του V4‑Flash, όπως δηλώνει η κάρτα. Ένας ξεχωριστός μηχανισμός, SWA Bounded Replay, ανακατασκευάζει τις ελλιπείς καταστάσεις KV της κυλιόμενης παραθύρου‑προσοχής επαναλαμβάνοντας μόνο τα πιο πρόσφατα σύμβολα, μειώνοντας το μόνιμο αποτύπωμα KV σε περίπου το ένα όγδοο του V4‑Flash. Η ανακοίνωση της DeepSeek υπολογίζει τις εξοικονομήσεις ως ένα τέταρτο του HBM και ένα όγδοο της αποθήκευσης SSD της προηγούμενης γενιάς.

Κάθε στρώση MoE χρησιμοποιεί έναν κοινό ειδικό και 384 δρομολογημένους ειδικούς, με έξι δρομολογημένους ειδικούς ενεργούς ανά σύμβολο, και το μοντέλο προσθέτει Engram conditional memory με 196 δισεκατομμύρια παραμέτρους παράλληλα με το DSpark speculative decoding, σύμφωνα με την κάρτα. Η DeepSeek εκπαίδευσε το μοντέλο από το μηδέν σε ένα πολυμορφικό σώμα 45 τρισεκατομμυρίων συμβόλων, εκπαίδεψε την αραίωση προσοχής σε μήκος ακολουθίας 64 Κ, και επεκτάθηκε το πλαίσιο σε 1 M σύμβολα σε 34 τρισεκατομμύρια σύμβολα. Μετά την εκπαίδευση ακολουθεί τυπική εποπτευόμενη λεπτομερή εκπαίδευση, ενισχυτική μάθηση, και ακολουθία αποσταλτικού σε πολιτική (on‑policy) διαλογής, με ουσιαστικές αλλαγές συγκεντρωμένες στη μεγαλοπρέπεια αυτοματοποιημένης σύνθεσης εργασιών και περιβαλλόντων πρακτόρων, και το μοντέλο εκθέτει μια συνεχώς ελεγχόμενη ρύθμιση προσπάθειας λογικής από 1 έως 100.

Μετάβαση API DeepSeek και Παροχή Baseten

Η DeepSeek δηλώνει ότι τα V4‑Flash και V4‑Flash‑Vision‑Exp έχουν αποσυρθεί από την πλατφόρμα της, με τα παλιά ονόματα μοντέλων API να δρομολογούνται προσωρινά στο V4.1‑Flash για συμβατότητα. Η νέα τιμολόγηση API τέθηκε σε ισχύ στις 04:00 UTC στις 10 Σεπτεμβρίου 2026, με τιμές εκτός αιχμής στο 50 % των τιμών αιχμής, και η DeepSeek ορίζει τους επίσημους συνεργάτες WorkBuddy (συμπεριλαμβανομένου του CodeBuddy) και OpenCode ως πλήρως υποστηρίζοντες το V4.1‑Flash.

Η Baseten δήλωσε ότι η Inference Stack εξυπηρετεί το μοντέλο χρησιμοποιώντας το NVIDIA Dynamo με δρομολόγηση που λαμβάνει υπόψη την κρυφή μνήμη KV, κατευθύνοντας κάθε αίτημα στη αντίγραφο που ήδη διαθέτει το πρόθεμά του αντί σε οποιοδήποτε ελεύθερο αντίγραφο. Το μοντέλο προσφέρεται μέσω της Model Library της Baseten, με αφιερωμένες αναπτύξεις διαθέσιμες για ομάδες που χρειάζονται δεσμευμένη χωρητικότητα.

Από τις 04:00 UTC στις 14 Σεπτεμβρίου 2026, όλα τα αιτήματα deepseek‑v4‑pro θα δρομολογούνται στο V4.1‑Flash με τιμές V4.1‑Flash, μια διάταξη που η DeepSeek δήλωσε ότι θα συνεχιστεί μέχρι την κυκλοφορία του V4.1‑Pro· το εργαστήριο ανέφερε ότι δοκιμές από πολλαπλά μέρη τοποθετούν το V4.1‑Flash μπροστά από το V4‑Pro όσον αφορά την απόδοση, το κόστος, την ταχύτητα και το συνολικό χρόνο εκτέλεσης.

Ο Jonas Reeve είναι ένας αναλυτής που δημιουργείται από AI στη Unite.AI, με επίκεντρο την γνωστική AI, την τεχνητή γενική νοημοσύνη (AGI) και τις θεωρητικές βάσεις της μηχανικής νοημοσύνης. Το έργο του εξετάζει πώς η μάθηση, ο συλλογισμός, η μνήμη και η αφαίρεση εμφανίζονται και σε βιολογικά και τεχνητά συστήματα, δημιουργώντας συνδέσεις μεταξύ σύγχρονων αρχιτεκτονικών AI και μακροχρόνιων ερωτημάτων στις γνωστικές επιστήμες και τη φιλοσοφία του νου. Με μια концепτουαλιστική και αναστοχαστική προσέγγιση, ο Jonas εξετάζει πλαισιά όπως τα μοντέλα συλλογισμού, τα συστήματα agentic, η αναδυόμενη γνωστική και η θεωρία ευθυγράμμισης, με στόχο να αποσαφηνίσει τι σημαίνει πραγματικά η πρόοδος προς την AGI - και τι όχι. Αντί να κυνηγά χρονοδιαγράμματα ή υπεροπτικές εκφράσεις, τονίζει τις αρχές, τη концепτουαλιστική αυστηρότητα και τα όρια των τρεχόντων μοντέλων. Τα άρθρα που γράφονται από τον Jonas Reeve δημιουργούνται από AI και αναθεωρούνται από την редакτική ομάδα της Unite.AI για να διασφαλιστεί η ακρίβεια, η σαφήνεια και η υπεύθυνη συζήτηση για προηγμένα концеп AI.