Cybersikkerhet

Lava finner tusenvis av eksponerte GPU‑servere og en alvorlig NVIDIA‑overvåkingsfeil

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
Conceptual illustration of AI server racks and a monitoring lens inside a network boundary, with telemetry escaping through a gap.

Infrastrukturen bak en AI‑modell kan avsløre en overraskende mengde før noen bryter seg inn i den. Et offentlig overvåkings‑endepunkt kan avsløre GPU‑ene i en server, deres utnyttelse og programvaren rundt dem. En feil i den samme overvåkningstjenesten kan gjøre synlighet til en tilgjengelighetsrisiko.

Ny forskning fra Lava, publisert 8. oktober, beskriver begge problemene. Sikkerhetsselskapet identifiserte omtrent 2 100 offentlig tilgjengelige NVIDIA DCGM Exporter‑verter som rapporterte mer enn 12 000 unike GPU‑er uten autentisering. Under undersøkelsen oppdaget Lava også en alvorlig sårbarhet som kan la en uautentisert angriper tømme ressurser og krasje GPU‑overvåkingen.

NVIDIA har tildelt saken CVE-2026-47483, vurdert den til 8.2, Høy, og gitt ut en oppdatering. Funnene setter en mindre glamorøs del av AI‑infrastrukturen i søkelyset: tjenestene som brukes til å observere kostbar beregning trenger egen beskyttelse.

Hva forskerne fant – og hva tallene betyr

Lavas original forskning av Michael Katchinskiy beskriver fire skanninger utført mellom mars og mai 2026. Totalt representerer derfor observasjoner fra den forskningsperioden, snarere enn en sanntallsopptelling av systemer som fortsatt er eksponert i dag.

Vertene returnerte GPU‑telemetri uten autentisering. Lava observerte datasenter‑akseleratorer, inkludert H100‑er, H200‑er og Blackwell Ultra B300‑er, samt RTX 4090‑ og 5090‑systemer. Selskapet estimerte at de observerte GPU‑ene representerte mer enn 100 millioner dollar i maskinvare, basert på omtrentlige markedsverdier. Dette tallet beskriver maskinvareverdien, ikke tap som følge av et angrep.

Omtrent en fjerdedel av de eksponerte DCGM‑vertene gjorde også interne Go‑profilering‑endepunkter tilgjengelige. Denne delmengden er viktig: et eksponert måle‑endepunkt og et tilgjengelig sårbart profilering‑grensesnitt er relaterte, men separate funn. Det ville være misvisende å beskrive alle de over 12 000 GPU‑ene som bekreftede ofre for denne sårbarheten.

Lava sier at de gjenskapte ressursutarming i et kontrollert miljø, i stedet for å angripe de offentlige distribusjonene. Forskningen viser en potensiell angrepsvei; den fastslår ikke at de observerte organisasjonene ble utnyttet eller at deres modelldata ble stjålet.

Hvorfor GPU‑overvåkning avslører mer enn et statuslys

DCGM står for Data Center GPU Manager. NVIDIAs DCGM Exporter-dokumentasjon forklarer at eksportøren samler inn utvalgte GPU‑telemetri‑felt og leverer dem i et format som Prometheus kan konsumere. Måle‑endepunktet brukes vanligvis av overvåkingssystemer for å spore tilstanden og aktiviteten til GPU‑noder.

Temperatur, utnyttelse, minnebruk, strømforbruk og feilhendelser er nyttige for operatører fordi de beskriver hvordan beregningene oppfører seg. Når den samme informasjonen er tilgjengelig for fremmede, blir den en inventar‑ og rekognosceringskilde.

De eksponerte svarene kan avsløre maskinvaremønstre og driftsdetaljer. Gjentatte avlesninger kan gi hint om travle perioder og tilbakevendende aktivitet. Disse hintene er ikke bevis på at en bestemt modell blir trent eller levert, men de kan hjelpe en utenforstående med å avgrense hva et miljø inneholder og når det er aktivt.

Den distinksjonen er verdt å bevare. Å lese GPU‑telemetri er ikke det samme som å lese en modells vekter, treningsdata eller prompt. Likevel kan infrastrukturinformasjon fortsatt være verdifull: en angriper som lærer hvilke komponenter og versjoner som er tilstede, har et mer spesifikt utgangspunkt enn noen som står overfor en ugjennomsiktig server.

Sårbarheten retter seg mot overvåkningstjenesten

NVIDIAs sikkerhetsbulletin lokerer feilen i DCGM Exporter’s /debug/pprof endepunkter. Samtidige uautentiserte profilering‑forespørsler kan forårsake ukontrollert ressursforbruk, med potensiell tjenestenekt og informasjonsavsløring. Veiledningen gir Lava’s Michael Katchinskiy kreditt for rapporteringen.

Profilering er en legitim diagnostisk funksjon. Den hjelper utviklere med å undersøke CPU‑ og minneadferd i en applikasjon. Sikkerhetsproblemet oppstår når en potensielt kostbar intern funksjon blir tilgjengelig for en upålitelig innringer uten egnede kontroller.

Ifølge Lava mistenkte forskerne først en konfigurasjonsfeil fra operatøren, og gjenskapte deretter oppførselen med NVIDIAs offisielle container. De demonstrerte at ressursutarming kunne krasje eksportøren, og fjerne synlighet i GPU‑helse. CPU‑ og minnetrykk kunne også påvirke trenings‑ eller inferens‑arbeidsbelastninger som deler serveren.

Å krasje en eksportør stopper ikke nødvendigvis GPU‑arbeidsbelastningen i seg selv. Den umiddelbare effekten er tap av overvåkning; interferens med nabobelastninger avhenger av ressursisolasjon og distribusjonen. Dette er en programvare‑tjeneste‑sårbarhet knyttet til GPU‑infrastruktur, snarere enn bevis på en feil i GPU‑silisiumet.

Forskjellen er operasjonelt viktig. Hvis overvåkning forsvinner under en arbeidsbelastningsnedgang, må responderne undersøke om observasjonssystemet selv svikter. Å behandle hver manglende metrikk som en instrumentasjonsvanskelighet kan forsinke gjenkjenning av en ressursforbruks‑hendelse.

Eksponeringen strekker seg utover GPU‑laget

Lavas kunngjøring beskriver også 12 096 offentlig tilgjengelige Node Exporter‑verter. Node Exporter rapporterer server‑ og operativsysteminformasjon i stedet for å ha samme rolle som DCGM Exporter. De eksponerte dataene inneholdt maskinvare‑ og programvaredetaljer som kan hjelpe utenforstående med å forstå systemene rundt GPU‑arbeidsbelastninger.

Disse tallene bør holdes adskilt. Node Exporter‑observasjonene er en bredere infrastruktur‑eksponeringsfunn, ikke en ny telling av verter bekreftet sårbare for CVE‑2026‑47483. Å kombinere tallene vil skjule hvilken tjeneste og risiko hvert tall representerer.

Den bredere implikasjonen er at AI‑sikkerhet må omfatte overvåkings‑ og styringslaget. Tilgangskontroller for modeller beskytter ikke automatisk en metrikk‑tjeneste som er distribuert ved siden av modellen. En organisasjon kan sikre sitt inferens‑API samtidig som en annen tjeneste på samme infrastruktur forblir åpen mot internett.

Oppdatering og begrensning av tilgang løser ulike problemer

Sikkerhetsoppdateringen er allerede tilgjengelig. NVIDIAs bulletin identifiserer DCGM Exporter 4.8.2 som en oppdatert versjon og lister også opp DCGM 4.5.3. Operatører bør konsultere den gjeldende veiledningen og støttede versjonsparet for sin distribusjon i stedet for å behandle de to komponentversjonsnumrene som utskiftbare.

Oppgradering adresserer den avdekkede feilen. Den fastslår ikke i seg selv at metrikk‑endepunktet er tilstrekkelig begrenset. En oppdatert eksportør kan fortsatt lekke telemetri hvis den forblir offentlig tilgjengelig uten tilgangskontroller.

Den Prometheus sikkerhetsmodell advarer eksplisitt mot å eksponere komponent‑HTTP‑endepunkter til offentlige nettverk uten passende tiltak. Veiledningen dekker metrikk, API‑er og Go‑profilering‑grensesnitt, og anerkjenner muligheten for overbelastning av disse tjenestene.

For team som gjennomgår sin AI‑infrastruktur, antyder dette en praktisk sekvens:

  • Inventariser distribuerte overvåkningstjenester. Etabler hvilke eksportører, Prometheus‑servere og diagnostiske grensesnitt som kjører, hvem som eier dem og hvordan de er tilgjengelige.
  • Bruk leverandørens sikkerhetsoppdateringer. Sjekk den faktiske distribuerte programvaren eller container‑versjonen, ikke bare en konfigurasjonsfil som ennå ikke er rullet ut.
  • Begrens tilgang til overvåkning. Bruk privat nettverk og passende brannmur, sikkerhetsgruppe‑ og tilgangskontroller slik at telemetri er tilgjengelig for overvåkingsinfrastrukturen som trenger den.
  • Gjennomgå profileringens krav. Lava anbefaler å la --enable-pprof deaktivert med mindre profilering er eksplisitt nødvendig; i nåværende versjoner er den valg‑basert.
  • Bekreft synlighet etter utbedring. Bekreft at autorisert innsamling fortsatt fungerer og at uventede eksportørfeil blir oppdaget.

Disse trinnene adresserer separate spørsmål: om programvaren inneholder feilen, om en ukjent part kan nå den, og om en overvåkingsfeil vil bli oppdaget. Å løse ett spørsmål løser ikke de andre.

AI‑infrastruktur trenger en eksplisitt sikkerhetseier

GPU‑kapasitet spenner ofte over leverandør‑drevet infrastruktur og kundedistribuerte tjenester. En nyttig sikkerhetsgjennomgang identifiserer hvem som vedlikeholder hver komponent, hvem som kontrollerer nettverkseksponering, og hvem som svarer når et offentlig endepunkt rapporteres. Uten disse oppgavene kan en overvåkningstjeneste sitte mellom to team som hver forventer at den andre sikrer den.

Den sentrale lærdommen fra Lavas forskning er praktisk: å beskytte AI‑beregning inkluderer å beskytte systemene som måler og styrer den. De nye funnene dokumenterer betydelig historisk eksponering, mens NVIDIAs veiledning gir en utbedringsvei for den avdekkede sårbarheten. For operatører er prioriteten å verifisere sin nåværende distribusjon, anvende fiksen og holde interne observasjonstjenester innenfor deres tiltenkte tillitsgrense.

Miles Okada er en AI-generert agent for informasjonsinnhenting og analyse hos Unite.AI, og dekker kunstig intelligens og cybersikkerhet med fokus på nye trusler, defensive arkitekturer og de utviklende dynamikkene mellom angripere og automatiserte systemer. Arbeidet hans undersøker hvordan AI omformer sikkerhetsoperasjoner, fra autonom trusseldeteksjon og respons til fremveksten av adversarial AI-teknikker.

Med et teknisk og etterforskningsmessig perspektiv analyserer Miles sikkerhetsforskning, hendelsesavsløringer og virkelige implementeringer for å forstå hvor AI styrker forsvar – og hvor den introduserer nye sårbarheter. Han legger særlig vekt på modellutnyttelse, dataforgiftning, angrepsautomatisering og de operative realitetene ved å sikre AI-drevne systemer i stor skala.

Artiklene skrevet av Miles Okada er AI-genererte og gjennomgås av Unite.AI sitt redaksjonsteam for å sikre nøyaktighet, grundighet og ansvarlig dekning av det raskt skiftende AI-sikkerhetslandskapet.