AI-mallit ja alustat

AWS julkaisee SageMaker HyperPod Inference Gatewayn GPU-tietoiseen reititykseen

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Amazon Web Services ilmoitti Amazon SageMaker HyperPod Inference Gateway 18. syyskuuta 2026, Kubernetes-native, GPU-tietoinen reititysjärjestelmä suurten kielimallien inferenssiin, joka asennetaan yhtenä hallittuna lisäosana Amazon EKS:ään olemassa olevaan HyperPod‑infrastruktuuriin. AWS kertoi, että yhdyskäytävä voi vähentää ensimmäisen tokenin viivettä jopa 82 %.

Reititysongelma yhdyskäytävän takana

AWS:n mukaan oletus Kubernetes -kuormantasausalgoritmit, kuten pyöröjakelu ja vähiten yhteyksiä, eivät näe GPU-tilaa: mitkä podit ovat täyttäneet KV‑välimuistit, mitkä ovat kesken pitkän kontekstin generoinnin, ja mitkäillä on jo LoRA‑adapteri, jonka pyyntö tarvitsee ladattuna muistiin. Yritys kertoi, että pyynnöt kasaantuvat kiireisten podien taakse, kun taas käyttämätön kapasiteetti jää käyttämättä, ensimmäisen tokenin viive piikitsee yli neljän sekunnin yli liikenteen piikeissä, käyttöasteesta tulee epätasainen ja ennustamaton, ja operaattorit ylisuunnittelevat kompensoidakseen. AWS kuvasi tilanteen, jossa chatbotin käyttäjä odottaa 4,4 sekuntia ensimmäistä tokenia, mutta näkee sen alle 800 millisekunnissa.

Kaksitasoinen arkkitehtuuri

Yhdyskäytävä käyttää kaksitasoista suunnittelua, joka on rakennettu Kubernetes-native peruskomponenttien päälle. AWS kertoi käyttävänsä reaaliaikaisia GPU‑signaaleja sijoittaakseen jokaisen inferenssipyyntö parhaaseen podiin. Taso 1 asennetaan suoraan jokaiselle HyperPod- tai EKS‑klusterille amazon-sagemaker-hyperpod-inference -lisäosana, ja se koostuu kolmesta komponentista, jotka kaikki perustuvat avoimen lähdekoodin Gateway API Inference Extension -laajennukseen. Envoy Gateway, taso‑7‑välityspalvelin, lopettaa saapuvan HTTPS‑liikenteen ja tarjoaa yhden yksityisen päätepisteen per klusteri. Body-Based Router tarkastelee kutakin saapuvaa OpenAI‑yhteensopivaa pyyntörunkoa, poimii mallikentän ja reitittää pyynnön oikeaan mallialtaaseen, jolloin yksi yhdyskäytävä voi palvella useita malleja.

Endpoint Picker hyödyntää reaaliaikaisia Prometheus‑mittareita jokaisesta mallia palvelevasta podista ja soveltaa painotettua pisteytysalgoritmia eri pisteytysjärjestelmille, jotka kattavat KV‑välimuistin käyttöasteen, jonon syvyyden, LoRA‑adapterin asuinpaikan, etuliitevälimuistin osumatason ja käynnissä olevat pyynnöt. Jokaisella pisteytysjärjestelmällä on säädettävä paino, mikä mahdollistaa reitityskäyttäytymisen hienosäätämisen tietylle työkuormalle, kuten viiveherkälle chatille tai läpimenoa optimoidulle eräajolle.

Taso 2, Global Inference Router, on ilmoitettu tulossa pian. AWS kertoi lisäävänsä laajavälineen koordinaatiota useiden klustereiden ja alueiden välillä, sisältäen klusterien välisten failover‑ominaisuuksien, globaalin nopeusrajoituksen ja kustannustietoisen liikenteen muokkaamisen. Taso 2 rakentuu Tason 1 päälle, ja jokaisen klusterin perusklusterin yhdyskäytävä jatkaa paikallisen reitityksen hoitamista.

Käyttöönotto, virheiden käsittely ja havainnollisuus

Käyttöönotto koostuu yhdestä aws eks create-addon -komennosta ja yhdestä deklaratiivisesta InferenceGatewayConfig‑mukautetusta resurssista, joka määrittelee mallit ja reitityskäyttäytymisen, ja olemassa olevat mallipalvelimen käyttöönotot löydetään podien tunnisteiden avulla. AWS kertoi, että asennus ei vaadi sivukontteja, palveluverkkotukea eikä sovelluskoodin muutoksia. Yhdyskäytävä tarjoaa standardin OpenAI‑yhteensopivan päätepisteen HTTP:n kautta; AWS:n mukaan olemassa oleva asiakaskoodi toimii muuttumattomana, ilman SDK‑muutoksia eikä SigV4‑allekirjoitusta inferenssiliikenteelle.

Kun työkuormat tarjoavat hienosäädettyjä LoRA‑adaptereita jaetussa perusmallissa, Endpoint Pickerin LoRA Affinity Scorer reitittää adapteripyynnöt podiin, jossa pyydetty adapteri on jo asennettuna GPU-muistiin; jos mikään podi ei ole ladannut sitä, pyyntö ohjataan podiin, jossa on eniten vapaata kapasiteettia. AWS kertoi, että tämä poistaa adapterin vaihtoviiveen.

Dokumentoituja virhekäyttäytymisiä kattavat podin vika, altaan ehtyminen, klusterin vika ja alueellinen vika. Podin vian sattuessa Endpoint Picker sulkee pois podit, joilla on vanhentuneet mittarit, ja reitittää terveisiin podiin, palautuen automaattisesti kun mittarit palaavat. Altaan ehtyessä yhdyskäytävä palauttaa HTTP‑429:n Retry-After‑otsikolla, kun automaattinen skaalaus lisää kapasiteettia. Klusterin vian sattuessa Global Inference Router havaitsee vanhentuneen sydämenlyönnin ja ohjaa liikenteen uudelleen 35 sekunnin sisällä, ja kapasiteetti kasvaa vähitellen, kun klusteri otetaan takaisin käyttöön. Alueellisen vian sattuessa alueiden välinen reititys aktivoituu automaattisesti, mikä AWS:n mukaan aiheuttaa suuremman viiveen, mutta ei vaikuta saatavuuteen.

Yhdyskäytävä lähettää mittareita podin, altaan, klusterin ja laivaston tasoilla: KV‑välimuistin käyttöaste, jonon syvyys, käynnissä olevat pyynnöt ja adapterin asuinpaikka Prometheuksen kautta poditasolla; pyyntöjen kokonaismäärät, keston histogrammit ja token‑määrät Prometheuksen ja Grafanan kautta altaatasolla; keskimääräinen KV‑välimuisti, virheprosentti ja P99‑viive Amazon CloudWatchin kautta klusteritasolla; sekä reitityspäätökset, failover‑tapahtumat ja nopeusrajoituksen osumat CloudWatchin kautta laivastotasolla.

AWS:n raportoimat suorituskykyvertailutulokset

AWS kertoi, että se suoritti neljän mallin vertailut, joiden parametrit vaihtelevat 8 miljardiin – 235 miljardiin, p5.48xlarge‑instansseilla, joissa on H100‑GPU:t, sekä g5‑instansseilla, joissa on A10G‑GPU:t. Kaikki liikenne reititettiin sisäisten Application Load Balancer -laitteiden kautta, mikä vastaa tuotantopyynnön kulkureittiä, omistautuneen asiakassolmuryhmän tuottaessa hallittua kuormitusta ja mallipalvelimet eristettynä erilliseen palvelinsolmuryhmään. Kaikki tulokset käyttävät yhdyskäytävän oletusreitityskonfiguraatiota ilman hienosäätöä, ja ne mitataan Kubernetes‑pyöröjakelun peruslinjan perusteella samoilla mallireplikoilla, AWS:n mukaan.

Raportoituissa tuloksissa sekoitetun sukupolven GPU‑laivasto lyhensi Llama-3.1-8B:n ensimmäisen tokenin P95- ja P99‑viiveitä 97 % kummallakin, lisäten läpimenoa 8 %, ja Qwen3-32B:n viiveitä 98 % ja 97 % vastaavasti, lisäten läpimenoa 50 %. Kuormituksen räjähdyksissä Llama-3.1-70B:n P95‑ ja P99‑lyhennykset olivat 94 % ja 98 % ja läpimeno 12 % korkeampi, kun taas Qwen3-235B:n P95‑viive oli verrattavissa ja P99‑viive 89 % alhaisempi. Jaetut kehotteiden etuliitteet vähensivät Llama-3.1-8B:n P95‑ ja P99‑viiveitä 26 % ja 43 %.

AWS:n mukaan täysin yhtenäisellä laivastolla tasaisessa liikenteessä yhdyskäytävä toimii yhtä hyvin kuin round‑robin, ja se määritteli vertailukelpoiset tulokset eroiksi, jotka pysyvät suorituksen sisäisen vaihtelun rajoissa. Yritys totesi, että parannukset ovat suurimpia juuri siellä, missä round‑robin kamppailee eniten: sekoitetussa laitteistossa, räjähtävässä kysynnässä ja jaetuissa kehotteiden etuliitteissä.

Saatavuus ja tiekartta

AWS kuvaa yhdyskäytävän olevan yhteensopiva Kubernetes Gateway API:n ja sen Inference Extension -laajennuksen kanssa, konfiguroitavissa yhden mukautetun resurssimääritelmän kautta, ja yhteensopiva minkä tahansa OpenAI‑yhteensopivan mallipalvelimen kanssa, mukaan lukien vLLM, SGLang ja TGI. Hallinta tapahtuu kubectl‑, GitOps‑, Helm‑ ja ArgoCD‑työkalujen avulla, ja asennus, päivitykset sekä palautukset hoidetaan EKS‑lisäosan elinkaaren kautta.

Tier 1 -klusterikohtainen reititys on saatavilla 18 syyskuuta 2026 alkaen niissä alueissa, joissa inference‑lisäosa on käytettävissä. Global Inference Routerin lisäksi AWS:n nimettyihin tiekarttakohtiin kuuluvat canary‑liikenteen jakaminen, joka ohjaa osan liikenteestä uusiin malliversioihin InferenceModelRewrite‑mukautettujen resurssien avulla, sekä virtausohjaus, joka luokittelee pyynnöt kriittisiksi, vakio‑ tai hylättäviksi ja toteuttaa kaistanpääsy‑hallinnan kullekin luokalle.

Theo Nash on tekoälygeneroitu asiantuntija Unite.AI:ssa, joka kattaa tekoälyinfrastruktuurin, laskennan ja modernin tekoälyä voimistavat laitteistojärjestelmät. Hänen työnsä keskittyy suurten tekoälykuormien taustalla oleviin teknisiin perusteisiin, mukaan lukien datakeskukset, kiihdyttimet, verkkotiet ja ohjelmistopinot, jotka sitoutuvat niihin.
Analyytisesta ja insinöörijohtoisesta näkökulmasta Theo tarkastelee, miten GPU:n, mukautetun piirin, muistiarkkitehtuurien ja hajautettujen järjestelmien edistysaskeleet mahdollistavat uusia tekoälymallien sukupolvia. Hän kiinnittää erityistä huomiota suorituskyky-yhteyksiin, energiatehokkuuteen, skaalautuvuuteen ja käytännön rajoituksiin, jotka muokkaavat tekoälyinfrastruktuurin todellista käyttöönottoa.
Artikkelit, joita Theo Nash on kirjoittanut, on tekoälygeneroitu ja Unite.AI:n toimittajatiimi on tarkastanut ne varmistaakseen teknisen tarkkuuden, selkeyden ja vastuullisen kattavuuden nopeasti kehittyvässä tekoälylaskennan maisemassa.