Μοντέλα και πλατφόρμες AI

NVIDIA Vera Rubin NVL72 δημοσιεύει τα πρώτα αποτελέσματα προεπισκόπησης του MLPerf Inference

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η NVIDIA στις 16 Σεπτεμβρίου 2026 δημοσίευσε τα αποτελέσματα υποβολής MLPerf Inference v6.1, με επικεφαλίδα την πρώτη προεπισκόπηση υποβολής του MLPerf Inference του συστήματος Vera Rubin NVL72, το οποίο, σύμφωνα με την εταιρεία, παρείχε έως και 3,7 φορές μεγαλύτερη απόδοση σε σχέση με το σύστημα GB300 NVL72 στο benchmark Qwen3-VL.

Το MLPerf Inference: Datacenter είναι ένα σύνολο benchmark του Συστήματος MLCommons που μετρά πόσο γρήγορα τα συστήματα επεξεργάζονται εισροές και παράγουν αποτελέσματα χρησιμοποιώντας ένα εκπαιδευμένο μοντέλο. Σύμφωνα με τους δημοσιευμένους ορισμούς του MLCommons, η κατηγορία Closed — η κατηγορία που ανέφερε η NVIDIA για τα κύρια νούμερα — απαιτεί τη χρήση του ίδιου μοντέλου με την αναφορά υλοποίησης ώστε οι πλατφόρμες υλικού και τα λογισμικά πλαίσια να συγκρίνονται “μήλο με μήλο”, ενώ τα συστήματα στην κατηγορία διαθεσιμότητας Preview πρέπει να είναι υποβάλλονται ως Available στον επόμενο κύκλο υποβολής.

Αποτελέσματα προεπισκόπησης DeepSeek-R1 και Qwen3-VL

Η NVIDIA υπέβαλε τα αποτελέσματα προεπισκόπησης Vera Rubin NVL72 για τα DeepSeek-R1 και Qwen3-VL, τα οποία περιέγραψε ως δύο από τα πιο απαιτητικά benchmarks στη σειρά v6.1. Στο Qwen3-VL, η εταιρεία ανέφερε έως και 3,7 φορές μεγαλύτερη απόδοση σε σχέση με το GB300 NVL72 σε όλα τα σενάρια offline, server και interactive, χρησιμοποιώντας το vLLM με το ανοιχτού κώδικα πλαίσιο inference NVIDIA Dynamo. Στο DeepSeek-R1, χρησιμοποιώντας τη βιβλιοθήκη NVIDIA TensorRT-LLM, η NVIDIA ανέφερε απόδοση έως και 2,5 φορές υψηλότερη από το GB300 NVL72.

Τα αναφερόμενα νούμερα της κατηγορίας Closed ελήφθησαν από το mlcommons.org στις 16 Σεπτεμβρίου 2026 και προέρχονται από τις υποβολές 6.1-0106 και 6.1-0074, σύμφωνα με την παραπομπή που δημοσιεύτηκε μαζί με τα αποτελέσματα. Η NVIDIA δήλωσε ότι η απόδοση σημαίνει ότι κάθε ράφι Vera Rubin NVL72 παρέχει σημαντικά περισσότερα tokens, εξυπηρετεί περισσότερους χρήστες και δημιουργεί περισσότερα έσοδα σε σχέση με ένα ράφι GB300 NVL72, ενώ μειώνει το κόστος ανά token.

Η Nebius υπέβαλε επίσης τα αποτελέσματα προεπισκόπησης Vera Rubin NVL72 στην ίδια σειρά· η NVIDIA περιέγραψε αυτά τα αποτελέσματα ως αποδεδειγμένη εξαιρετική απόδοση.

Συνεργατικός σχεδιασμός υλικού-λογισμικού και δοκιμές πράκτορα

Η NVIDIA αποδίδει τα αποτελέσματα στον πλήρη συνεργατικό σχεδιασμό υλικού και λογισμικού. Η εταιρεία δήλωσε ότι τα βελτιωμένα Tensor Cores και το Transformer Engine του Vera Rubin επιταχύνουν τόσο τα στάδια prefill όσο και decode της inference, ενώ η ακρίβεια NVFP4 μειώνει το αποτύπωμα μνήμης των βαρών μοντέλου, της προσοχής και της κρυφής μνήμης KV, αυξάνοντας την απόδοση με ό,τι η NVIDIA περιέγραψε ως ελάχιστη απώλεια στην ποιότητα εξόδου.

Οι υποβολές χρησιμοποίησαν διαχωρισμένη εξυπηρέτηση, η οποία διαχωρίζει τα στάδια prefill και decode, μαζί με μεγάλου μεγέθους παράλληλο εμπειροσύστημα στα επίπεδα mixture-of-experts που χρησιμοποιούν μοντέλα όπως το DeepSeek-R1 και το Qwen3-VL. Η NVIDIA δήλωσε ότι ο τομέας κλιμάκωσης NVL72, χτισμένος στην έκτη γενιά NVLink και NVLink Switch, προσφέρει 10 φορές υψηλότερους ρυθμούς πακέτων και 3 φορές χαμηλότερη καθυστέρηση από το τυπικό Ethernet, παρέχοντας τη βάση διασύνδεσης για αυτές τις τεχνικές σε κλίμακα ραφίου.

Η εταιρεία ανέφερε επίσης ότι το Vera Rubin NVL72 παρείχε 30 φορές καλύτερη απόδοση σε σχέση με το GB300 NVL72 σε δοκιμές προεπισκόπησης στο benchmark SemiAnalysis AgentX, το οποίο έχει σχεδιαστεί για τη μέτρηση εργασιών πράκτορα. Η NVIDIA δήλωσε ότι το επερχόμενο benchmark MLPerf Endpoints θα φέρει τυποποιημένη μέτρηση σε εργασίες inference πράκτορα πέρα από ό,τι καταγράφουν τα παραδοσιακά benchmarks απόδοσης.

Κλιμάκωση GB300 NVL72, κερδισμένο λογισμικό και αποτελέσματα συνεργατών

Στην ίδια σειρά, η υποβολή DeepSeek-R1 της NVIDIA κλιμακώθηκε από ένα μόνο ράφι GB300 NVL72 με 72 GPU σε τέσσερα ράφια συνολικά 288 GPU, επιτυγχάνοντας 99% αποδοτικότητα κλιμάκωσης στο σενάριο offline, με την απόδοση να αυξάνεται σχεδόν ανάλογα με το προστιθέμενο υλικό· η εταιρεία ανέφερε τις καταχωρίσεις 6.1-0073 και 6.1-0074. Στο benchmark WAN 2.2 text-to-video, το GB300 NVL72 πέτυχε 0,65 βίντεο 720p ανά δευτερόλεπτο με 5,7 δευτερόλεπτα ανά βίντεο, το οποίο, σύμφωνα με τη NVIDIA, αντιστοιχεί σε 9 φορές μεγαλύτερη απόδοση και 7,5 φορές χαμηλότερη καθυστέρηση σε σχέση με έναν μόνο κόμβο.

Η NVIDIA ανέφερε ότι η απόδοση του GB300 NVL72 στο Qwen3-VL βελτιώθηκε έως και 1,6 φορές στη v6.1 σε σχέση με τα αποτελέσματα της v6.0, αποδίδοντας την βελτίωση σε χαμηλότερη ακρίβεια KV cache, πρόσθετη συγχώνευση πυρήνων, καλύτερους πυρήνες και διαχωρισμένη εξυπηρέτηση με vLLM και NVIDIA Dynamo. Η εταιρεία δήλωσε ότι η βελτιστοποίηση συνεχίστηκε μετά την προθεσμία υποβολής της v6.1, και ότι τα αποτελέσματα μετά την υποβολή για τα GPT-OSS-120B και DLRMv3 δείχνουν περαιτέρω κέρδη, αν και αυτά τα νούμερα δεν έχουν ακόμη επαληθευτεί από το MLCommons.

Πέρα από τις πλατφόρμες κλίμακας ραφίου, η NVIDIA υπέβαλε τα αποτελέσματα Jetson AGX Thor χρησιμοποιώντας τη βιβλιοθήκη TensorRT Edge-LLM στο νεοεισαγμένο benchmark Edge-Agentic με το μοντέλο Qwen3.6-27B. Η εταιρεία δήλωσε ότι 19 συνεργάτες συμμετείχαν στη σειρά, οκτώ από αυτούς υπέβαλαν σε συστήματα multi-node Blackwell NVL72: ASUS, Azure, Cisco, CoreWeave, Crusoe, Dell Technologies, Fujitsu, Giga Computing, HPE, Inventec, Lambda, MiTAC Computing, Nebius, Oracle Cloud Infrastructure, Quanta Cloud Technology, Red Hat, ScitiX, Supermicro και Wiwynn.

Το MLCommons σημειώνει στη σελίδα benchmark του ότι τα δημοσιευμένα αποτελέσματα ενίοτε τροποποιούνται ή ακυρώνονται μετά την αρχική δημοσίευση, με τυχόν αλλαγές να καταγράφονται στο αρχείο αλλαγών του.

Ο Theo Nash είναι ένας ειδικός που δημιουργήθηκε από AI στο Unite.AI, που καλύπτει την υποδομή AI, τον υπολογισμό και τα συστήματα υλικού που τροφοδοτούν την σύγχρονη τεχνητή νοημοσύνη. Το έργο του επικεντρώνεται στις τεχνικές βάσεις πίσω από τις μεγάλες εργασίες AI, συμπεριλαμβανομένων των κέντρων δεδομένων, των επιταχυντών, των δικτύων και των στοιχείων λογισμικού που τα συνδέουν.
Με μια αναλυτική και μηχανική προοπτική, ο Theo εξετάζει πώς οι προόδους στις GPU, το εξειδικευμένο σιλικόνιο, τις αρχιτεκτονικές μνήμης και τα κατανεμημένα συστήματα επιτρέπουν новые γενιές μοντέλων AI. Δίνει ιδιαίτερη προσοχή στις ανταλλαγές απόδοσης, την ενεργειακή αποτελεσματικότητα, την κλιμακωσιμότητα και τις πρακτικές περιορισμοί που διαμορφώνουν την ανάπτυξη της υποδομής AI στον πραγματικό κόσμο.
Οι άρθρα που γράφονται από τον Theo Nash δημιουργούνται από AI και αναθεωρούνται από την редакτική ομάδα του Unite.AI για να διασφαλίσουν την τεχνική ακρίβεια, τη σαφήνεια και την υπεύθυνη κάλυψη του ταχέως εξελισσόμενου τοπίου υπολογισμού AI.