Cybersikkerhed
Lava finder tusindvis af eksponerede GPU‑servere og en høj‑severitets‑NVIDIA‑overvågningsfejl

Infrastrukturen bag en AI‑model kan afsløre en overraskende mængde, før nogen bryder ind i den. Et offentligt overvågnings‑endpoint kan afsløre GPU‑erne i en server, deres udnyttelse og den omkringliggende software. En fejl i den samme overvågningstjeneste kan gøre synlighed til en tilgængelighedsrisiko.
Ny forskning fra Lava, udgivet den 8. oktober, beskriver begge problemer. Sikkerhedsfirmaet identificerede cirka 2,100 offentligt tilgængelige NVIDIA DCGM Exporter‑værter, som rapporterede mere end 12,000 unikke GPU‑er uden godkendelse. Under sin undersøgelse opdagede Lava også en høj‑severitets sårbarhed, der kunne lade en uautentificeret angriber udtømme ressourcer og få GPU‑overvågning til at gå ned.
NVIDIA har tildelt problemet CVE-2026-47483, vurderet det til 8.2, Høj og udgivet en opdatering. Resultaterne bringer en mindre glamourøs del af AI‑infrastrukturen i fokus: de tjenester, der bruges til at observere dyr compute, har brug for egen beskyttelse.
Hvad forskerne fandt – og hvad tallene betyder
Lava’s original forskning af Michael Katchinskiy beskriver fire scanninger udført mellem marts og maj 2026. Tallene repræsenterer derfor observationer fra den forskningsperiode frem for en live‑tælling af systemer, der stadig er eksponeret i dag.
Værterne returnerede GPU‑telemetri uden godkendelse. Lava observerede datacenter‑acceleratorer, herunder H100‑erne, H200‑erne og Blackwell Ultra B300‑erne, samt RTX 4090‑ og 5090‑systemer. Virksomheden anslog, at de observerede GPU‑er udgjorde mere end $100 millioner i hardware baseret på omtrentlige markedspriser. Det tal beskriver hardware‑værdien, ikke tab som følge af et angreb.
Omkring en fjerdedel af de eksponerede DCGM‑værter gjorde også interne Go‑profilering‑endpoints tilgængelige. Dette delmængde er vigtig: et eksponeret metrics‑endpoint og et tilgængeligt sårbart profilering‑interface er relaterede, men separate fund. Det ville være misvisende at beskrive alle de over 12,000 GPU‑er som bekræftede ofre for denne sårbarhed.
Lava siger, at de reproducerede ressource‑udtømning i et kontrolleret miljø i stedet for at angribe de offentlige implementeringer. Undersøgelsen viser en potentiel angrebsvej; den fastslår ikke, at de observerede organisationer blev udnyttet, eller at deres modeldata blev stjålet.
Hvorfor GPU‑overvågning afslører mere end et statuslys
DCGM står for Data Center GPU Manager. NVIDIA’s DCGM Exporter dokumentation forklarer, at eksportøren indsamler udvalgte GPU‑telemetri‑felter og leverer dem i et format, som Prometheus kan indlæse. Dens metrics‑endpoint bruges typisk af overvågningssystemer til at spore tilstanden og aktiviteten på GPU‑noder.
Temperatur, udnyttelse, hukommelsesforbrug, strømforbrug og fejl‑begivenheder er nyttige for operatører, fordi de beskriver, hvordan beregning opfører sig. Når den samme information er tilgængelig for fremmede, bliver den en lager‑ og rekognosceringskilde.
De eksporterede svar kan afsløre hardwaremodeller og driftsdetaljer. Gentagne aflæsninger kan give spor om travle perioder og tilbagevendende aktivitet. Disse spor er ikke bevis for, at en bestemt model trænes eller serviceres, men de kan hjælpe en udenforstående med at indsnævre, hvad et miljø indeholder, og hvornår det er aktivt.
Den sondring er værd at bevare. At læse GPU‑telemetri er ikke det samme som at læse en models vægte, træningsdata eller prompts. Alligevel kan infrastrukturinformation stadig være værdifuld: En angriber, der lærer, hvilke komponenter og versioner der er til stede, har et mere specifikt udgangspunkt end nogen, der står over for en uigennemsigtig server.
Sårbarheden målretter overvågningstjenesten
NVIDIA’s sikkerhedsbulletin placerer fejlen i DCGM Exporter’s /debug/pprof endpoints. Samtidige uautentificerede profilering‑anmodninger kan forårsage ukontrolleret ressourceforbrug med potentiel serviceafvisning og informationsafsløring. Rådgivningen giver kredit til Lava’s Michael Katchinskiy for at have rapporteret den.
Profilering er en legitim diagnostisk funktion. Den hjælper udviklere med at undersøge CPU‑ og hukommelsesadfærd i en applikation. Sikkerhedsproblemet opstår, når en potentielt ressourcekrævende intern funktion bliver tilgængelig for en ikke‑tillidshvervendt kaldende uden passende kontrol.
Ifølge Lava mistænkte forskerne oprindeligt en operatorkonfigurationsfejl, hvorefter de reproducerede adfærden med NVIDIA’s officielle container. De demonstrerede, at ressource‑udtømning kunne få eksportøren til at gå ned, hvilket fjerner synligheden af GPU‑sundhed. CPU‑ og hukommelsesbelastning kunne også påvirke trænings‑ eller inferens‑arbejdsbelastninger, der deler serveren.
At få en eksportør til at gå ned stopper ikke nødvendigvis selve GPU‑arbejdsbelastningen. Den umiddelbare effekt er tab af overvågning; interferens med nabobelastninger afhænger af ressourceisolation og implementeringen. Dette er en software‑service‑sårbarhed omkring GPU‑infrastruktur, snarere end bevis på en fejl i GPU‑siliciet.
Forskellen er operationelt vigtig. Hvis overvågning forsvinder under en arbejdsbelastningsnedlukning, skal responderne undersøge, om observationssystemet selv fejler. At betragte hver manglende metrik som en instrumenteringsirritation kan forsinke genkendelsen af en ressourceforbrugs‑hændelse.
Eksponeringen strækker sig ud over GPU‑laget
Lavas meddelelse beskriver også 12.096 offentligt tilgængelige Node Exporter‑værter. Node Exporter rapporterer server‑ og operativsystemoplysninger i stedet for at udfylde samme rolle som DCGM Exporter. De eksponerede data indeholdt hardware‑ og softwaredetaljer, som kunne hjælpe udenforstående med at forstå systemerne omkring GPU‑arbejdsbelastninger.
Disse tal skal holdes adskilt. Node Exporter‑observationerne er et bredere infrastruktur‑eksponeringsfund, ikke endnu et tal på værter bekræftet sårbare over for CVE‑2026‑47483. At kombinere tallene ville sløre, hvilken tjeneste og hvilken risiko hvert tal repræsenterer.
Den bredere implikation er, at AI‑sikkerhed skal omfatte overvågnings‑ og administrationslaget. Model‑adgangskontroller beskytter ikke automatisk en metrik‑tjeneste, der er implementeret ved siden af modellen. En organisation kan sikre sit inference‑API, mens en anden tjeneste på samme infrastruktur forbliver åben for internettet.
Patchning og begrænsning af adgang løser forskellige problemer
Sikkerhedsopdateringen er allerede tilgængelig. NVIDIAs bulletin identificerer DCGM Exporter 4.8.2 som en opdateret version og lister også DCGM 4.5.3. Operatører bør konsultere den aktuelle advisory og den understøttede udgivelses‑parring for deres implementering i stedet for at betragte de to komponentversionsnumre som udskiftelige.
Opgradering adresserer den afslørede fejl. Den etablerer dog ikke i sig selv, at metrik‑endepunktet er korrekt begrænset. En patchet exporter kan stadig afsløre telemetri, hvis den forbliver offentligt tilgængelig uden adgangskontroller.
Den Prometheus‑sikkerhedsmodel advarer eksplicit mod at eksponere komponent‑HTTP‑endepunkter til offentlige netværk uden passende foranstaltninger. Dens vejledning dækker metrik, API’er og Go‑profilering‑grænseflader og anerkender muligheden for overbelastning af disse tjenester.
For teams, der gennemgår deres AI‑infrastruktur, antyder det en praktisk sekvens:
- Inventariser implementerede overvågningstjenester. Fastlæg hvilke eksportører, Prometheus‑servere og diagnostiske grænseflader der kører, hvem der ejer dem, og hvordan de er tilgængelige.
- Påfør leverandørens sikkerhedsopdateringer. Tjek den faktiske implementerede software‑ eller container‑version, ikke kun en konfigurationsfil, der endnu ikke er rullet ud.
- Begræns adgang til overvågning. Brug privat netværk samt passende firewall‑, sikkerhedsgruppe‑ og adgangskontroller, så telemetri kun er tilgængelig for den overvågningsinfrastruktur, der har brug for den.
- Gennemgå profileringens krav. Lava anbefaler at lade
--enable-pprofdeaktiveret, medmindre profilering udtrykkeligt er påkrævet; i de aktuelle versioner er den valgfri. - Bekræft synlighed efter afhjælpning. Verificér, at autoriseret indsamling stadig fungerer, og at uventede eksportør‑fejl bemærkes.
Disse trin adresserer separate spørgsmål: om softwaren indeholder fejlen, om en uautoriseret part kan nå den, og om en overvågningsfejl vil blive opdaget. At løse ét spørgsmål løser ikke de andre.
AI‑infrastruktur har brug for en eksplicit sikkerhedsejer
GPU‑kapacitet spænder ofte over leverandør‑drevet infrastruktur og kundes‑implementerede tjenester. En nyttig sikkerhedsgennemgang identificerer, hvem der vedligeholder hver komponent, hvem der kontrollerer netværkseksponering, og hvem der reagerer, når et offentligt endepunkt rapporteres. Uden disse ansvarsfordelinger kan en overvågningstjeneste ligge mellem to teams, som hver forventer, at den anden sikrer den.
Den centrale lektie fra Lavas forskning er praktisk: beskyttelse af AI‑beregning inkluderer beskyttelse af de systemer, der måler og styrer den. De nye fund dokumenterer betydelig historisk eksponering, mens NVIDIAs advisory giver en afhjælpningsvej for den afslørede sårbarhed. For operatører er prioriteten at bekræfte deres nuværende implementering, anvende rettelsen og holde interne observations‑tjenester inden for deres tilsigtede tillidsgrænse.












