Μοντέλα και πλατφόρμες AI
Η AWS λανσάρει το SageMaker HyperPod Inference Gateway για δρομολόγηση με επίγνωση GPU

Η Amazon Web Services ανακοίνωσε Amazon SageMaker HyperPod Inference Gateway στις 18 Σεπτεμβρίου 2026, ένα σύστημα δρομολόγησης εγγενές στο Kubernetes και με επίγνωση GPU για την επεξεργασία μεγάλων γλωσσικών μοντέλων, το οποίο αναπτύσσεται ως ένα ενιαίο διαχειριζόμενο πρόσθετο για το Amazon EKS σε υπάρχουσα υποδομή HyperPod. Η AWS δήλωσε ότι η πύλη μπορεί να μειώσει τη λανθάνουσα ώρα του πρώτου διακριτικού έως και 82 %.
Το πρόβλημα δρομολόγησης πίσω από την πύλη
Σύμφωνα με την AWS, οι προεπιλεγμένοι αλγόριθμοι εξισορρόπησης φορτίου του Kubernetes όπως round-robin και least-connections δεν έχουν καμία ορατότητα στην κατάσταση των GPU: ποια pods έχουν κορεσμένες κρυφές μνήμες KV, ποια βρίσκονται στη μέση δημιουργίας μεγάλου πλαισίου, και ποια έχουν ήδη φορτωμένο στη μνήμη τον προσαρμογέα LoRA που απαιτεί το αίτημα. Η εταιρεία ανέφερε ότι τα αιτήματα συσσωρεύονται πίσω από τα απασχολημένα pods ενώ η αδρανής χωρητικότητα παραμένει αχρησιμοποίητη, η λανθάνουσα ώρα του πρώτου διακριτικού αυξάνεται πάνω από τέσσερα δευτερόλεπτα κατά τις αιχμές κίνησης, η αξιοποίηση γίνεται άνιση και απρόβλεπτη, και οι διαχειριστές υπερπρομηθεύουν για να αντισταθμίσουν. Η AWS περιέγραψε ένα σενάριο όπου ένας χρήστης chatbot που περίμενε 4,4 δευτερόλεπτα για το πρώτο διακριτικό το βλέπει αντίθετα σε λιγότερο από 800 χιλιοστά του δευτερολέπτου.
Αρχιτεκτονική Δυο-Στρωμάτων
Η πύλη χρησιμοποιεί σχεδίαση δύο επιπέδων βασισμένη σε πρωτότυπα του Kubernetes. Η AWS δήλωσε ότι χρησιμοποιεί σήματα GPU σε πραγματικό χρόνο για να τοποθετεί κάθε αίτημα επεξεργασίας στο πιο κατάλληλο pod. Το Επίπεδο 1 εγκαθίσταται απευθείας σε κάθε HyperPod ή σύμπλεγμα EKS ως το πρόσθετο amazon-sagemaker-hyperpod-inference και αποτελείται από τρία συστατικά, όλα βασισμένα στην ανοιχτού κώδικα επέκταση Gateway API Inference. Το Envoy Gateway, ένας διακομιστής μεσολάβησης επιπέδου‑7, τερματίζει την εισερχόμενη κίνηση HTTPS και εκθέτει ένα ενιαίο ιδιωτικό σημείο πρόσβασης ανά σύμπλεγμα. Ο δρομολογητής βασισμένος στο σώμα (Body‑Based Router) εξετάζει κάθε εισερχόμενο αίτημα συμβατό με OpenAI, εξάγει το πεδίο μοντέλου και δρομολογεί το αίτημα στη σωστή δεξαμενή μοντέλων, ώστε μία πύλη να μπορεί να εξυπηρετήσει πολλαπλά μοντέλα.
Ο Επιλογέας Σημείου Τέλους (Endpoint Picker) καταναλώνει μετρήσεις Prometheus σε πραγματικό χρόνο από κάθε pod που εξυπηρετεί μοντέλο και εφαρμόζει έναν αλγόριθμο βαρυπολογημένης αξιολόγησης μεταξύ αξιολογητών που καλύπτουν τη χρήση της κρυφής μνήμης KV, το βάθος ουράς, την κατοίκηση του προσαρμογέα LoRA, το ποσοστό επιτυχίας της προεγκατεστημένης κρυφής μνήμης προθέματος, και τα τρέχοντα αιτήματα. Κάθε αξιολογητής φέρει ρυθμιζόμενο βάρος, επιτρέποντας την προσαρμογή της συμπεριφοράς δρομολόγησης για συγκεκριμένο φορτίο εργασίας, όπως συνομιλία ευαίσθητη στην καθυστέρηση έναντι παρτίδας βελτιστοποιημένης απόδοσης.
Το Επίπεδο 2, ο Παγκόσμιος Δρομολογητής Επεξεργασίας (Global Inference Router), αναφέρεται ότι θα κυκλοφορήσει σύντομα. Η AWS δήλωσε ότι θα προσθέσει συντονισμό σε όλο το στόλο μεταξύ πολλαπλών συμπλεγμάτων και περιοχών, με εναλλαγή αποτυχίας μεταξύ συμπλεγμάτων, παγκόσμιο περιορισμό ρυθμού και διαμόρφωση κίνησης με γνώση κόστους. Το Επίπεδο 2 χτίζεται πάνω στο Επίπεδο 1, ενώ η πύλη ανά σύμπλεγμα του κάθε συμπλέγματος συνεχίζει να διαχειρίζεται την τοπική δρομολόγηση.
Ανάπτυξη, Διαχείριση Αποτυχιών και Παρατηρησιμότητα
Η ανάπτυξη αποτελείται από μία εντολή aws eks create-addon και έναν δηλωτικό προσαρμοσμένο πόρο InferenceGatewayConfig που ορίζει τα μοντέλα και τη συμπεριφορά δρομολόγησης, με τις υπάρχουσες αναπτύξεις διακομιστών μοντέλων να εντοπίζονται μέσω ετικετών pod. Η AWS δήλωσε ότι η εγκατάσταση δεν απαιτεί sidecars, κανένα service mesh και καμία αλλαγή στον κώδικα εφαρμογής. Η πύλη εκθέτει ένα τυπικό σημείο πρόσβασης συμβατό με OpenAI μέσω HTTP· σύμφωνα με την AWS, ο υπάρχων κώδικας πελάτη λειτουργεί αμετάβλητος, χωρίς αλλαγές στο SDK και χωρίς υπογραφή SigV4 για την κίνηση επεξεργασίας.
Για φορτία εργασίας που εξυπηρετούν προσαρμογείς LoRA με λεπτομερή ρύθμιση πάνω σε ένα κοινό βασικό μοντέλο, ο LoRA Affinity Scorer του Endpoint Picker δρομολογεί τα αιτήματα προσαρμογέα στα pods που έχουν ήδη τον ζητούμενο προσαρμογέα κατοικημένο στη μνήμη GPU. Εάν κανένα pod δεν το έχει φορτωμένο, το αίτημα πηγαίνει στο pod με τη μεγαλύτερη διαθέσιμη χωρητικότητα. Η AWS δήλωσε ότι αυτό εξαλείφει τη λανθάνουσα ώρα ανταλλαγής προσαρμογέα.
Οι τεκμηριωμένες συμπεριφορές αποτυχίας καλύπτουν αποτυχία pod, εξάντληση δεξαμενής, αποτυχία συμπλέγματος και αποτυχία περιοχής. Σε περίπτωση αποτυχίας pod, ο Endpoint Picker αποκλείει τα pods με παλαιές μετρήσεις και δρομολογεί σε υγιή pods, ανακτώντας αυτόματα όταν οι μετρήσεις επανέλθουν. Σε περίπτωση εξάντλησης δεξαμενής, η πύλη επιστρέφει HTTP 429 με κεφαλίδα Retry‑After ενώ η αυτόματη κλιμάκωση προσθέτει χωρητικότητα. Σε περίπτωση αποτυχίας συμπλέγματος, ο Παγκόσμιος Δρομολογητής Επεξεργασίας (Global Inference Router) εντοπίζει έναν παλιό σήμα καρδιάς και ανακατευθύνει την κίνηση εντός 35 δευτερολέπτων, με σταδιακή αύξηση όταν το σύμπλεγμα επανεισάγεται. Σε περίπτωση αποτυχίας περιοχής, η δρομολόγηση μεταξύ περιοχών ενεργοποιείται αυτόματα, κάτι που, σύμφωνα με την AWS, επιφέρει υψηλότερη λανθάνουσα ώρα αλλά χωρίς επίπτωση στη διαθεσιμότητα.
Η πύλη εκδίδει μετρήσεις στα επίπεδα pod, δεξαμενής, συμπλέγματος και στόλου: χρήση κρυφής μνήμης KV, βάθος ουράς, τρέχοντα αιτήματα και κατοίκηση προσαρμογέα μέσω Prometheus στο επίπεδο pod· συνολικά αιτήματα, ιστογράμματα διάρκειας και αριθμούς διακριτικών μέσω Prometheus και Grafana στο επίπεδο δεξαμενής· μέσο όρο κρυφής μνήμης KV, ποσοστό σφαλμάτων και λανθάνουσα ώρα P99 μέσω Amazon CloudWatch στο επίπεδο συμπλέγματος· καθώς και αποφάσεις δρομολόγησης, γεγονότα εναλλαγής αποτυχίας και επιτυχίες περιορισμού ρυθμού μέσω CloudWatch στο επίπεδο στόλου.
Αποτελέσματα Benchmark που Αναφέρει η AWS
Η AWS δήλωσε ότι έκαναν benchmark σε τέσσερα μοντέλα με παραμέτρους από 8 δισεκατομμύρια έως 235 δισεκατομμύρια σε instances p5.48xlarge με GPU H100 και instances g5 με GPU A10G. Όλη η κίνηση δρομολογήθηκε μέσω εσωτερικών Application Load Balancers, αντιστοιχίζοντας τη διαδρομή που ακολουθεί ένα αίτημα παραγωγής, με μια αφιερωμένη ομάδα κόμβων πελάτη που δημιουργεί ελεγχόμενο φορτίο και διακομιστές μοντέλων απομονωμένους σε ξεχωριστή ομάδα κόμβων διακομιστή. Κάθε αποτέλεσμα χρησιμοποιεί τη προεπιλεγμένη διαμόρφωση δρομολόγησης της πύλης χωρίς ρύθμιση και μετριέται σε σχέση με μια βάση round‑robin του Kubernetes στα ίδια αντίγραφα μοντέλου, σύμφωνα με την AWS.
Στα αναφερόμενα αποτελέσματα, ένας στόλος GPU μικτής γενιάς μείωσε το latency έως το πρώτο token (P95 και P99) κατά 97% για το Llama-3.1-8B, με αύξηση της απόδοσης κατά 8%, και κατά 98% και 97% για το Qwen3-32B, με αύξηση της απόδοσης κατά 50%. Σε κυματική κίνηση, το Llama-3.1-70B παρουσίασε μειώσεις P95 και P99 κατά 94% και 98% με 12% υψηλότερη απόδοση, ενώ το Qwen3-235B παρουσίασε συγκρίσιμο latency P95 και P99 χαμηλότερο κατά 89%. Με κοινά πρόθεμα προτροπής, το latency P95 και P99 του Llama-3.1-8B μειώθηκε κατά 26% και 43%.
Η AWS δήλωσε ότι σε έναν πλήρως ομοιόμορφο στόλο υπό σταθερή κίνηση η πύλη αποδίδει ισότιμα με το round-robin, και ορίστηκε ότι τα συγκρίσιμα αποτελέσματα είναι διαφορές εντός της διακύμανσης μεταξύ εκτελέσεων. Η εταιρεία ανέφερε ότι οι βελτιώσεις είναι μεγαλύτερες εκεί που το round-robin αντιμετωπίζει τις μεγαλύτερες δυσκολίες: μεικτό υλικό, κυματική ζήτηση και κοινά πρόθεμα προτροπής.
Διαθεσιμότητα και Οδικός Χάρτης
Η AWS περιγράφει την πύλη ως συμβατή με το Kubernetes Gateway API και την Επέκταση Inference, ρυθμιζόμενη μέσω ενός μοναδικού custom resource definition, και συμβατή με οποιονδήποτε διακομιστή μοντέλων συμβατό με OpenAI, συμπεριλαμβανομένων των vLLM, SGLang και TGI. Η διαχείριση λειτουργεί μέσω kubectl, GitOps, Helm και ArgoCD, με την εγκατάσταση, τις αναβαθμίσεις και την επαναφορά να διαχειρίζονται μέσω του κύκλου ζωής του πρόσθετου EKS.
Η δρομολόγηση Tier 1 ανά‑συστάδα είναι διαθέσιμη από τις 18 Σεπτεμβρίου 2026, σε περιοχές όπου είναι διαθέσιμο το πρόσθετο inference. Πέρα από το Global Inference Router, τα ονομασμένα στοιχεία του χάρτη πορείας της AWS περιλαμβάνουν το canary traffic splitting, το οποίο θα δρομολογεί ένα ποσοστό της κίνησης σε νέες εκδόσεις μοντέλων χρησιμοποιώντας custom resources InferenceModelRewrite, και τον έλεγχο ροής που ταξινομεί τα αιτήματα ως Critical, Standard ή Sheddable με έλεγχο εισόδου ανά‑ζώνη.












