Cybersäkerhet

Lava hittar tusentals exponerade GPU‑servrar och en allvarlig NVIDIA‑övervakningsbrist

mm
Lägg till Unite.AI bland dina föredragna källor på Google
Conceptual illustration of AI server racks and a monitoring lens inside a network boundary, with telemetry escaping through a gap.

Infrastrukturen bakom en AI‑modell kan avslöja en förvånande mängd innan någon bryter sig in i den. En offentlig övervakningsändpunkt kan avslöja GPU:erna i en server, deras användning och mjukvaran omkring dem. En brist i samma övervakningstjänst kan omvandla synlighet till en tillgänglighetsrisk.

Ny forskning från Lava, publicerad 8 oktober, beskriver båda problemen. Säkerhetsföretaget identifierade ungefär 2 100 offentligt åtkomliga NVIDIA DCGM Exporter‑värdar som rapporterade mer än 12 000 unika GPU:er utan autentisering. Under sin undersökning upptäckte Lava också en högseveritets sårbarhet som kan låta en icke‑autentiserad angripare uttömma resurser och krascha GPU‑övervakning.

NVIDIA har tilldelat problemet CVE-2026-47483, betygsatt det 8,2, Hög, och släppt en uppdatering. Resultaten sätter en mindre glamorös del av AI‑infrastrukturen i rampljuset: tjänsterna som används för att observera dyr beräkning behöver eget skydd.

Vad forskarna fann – och vad siffrorna betyder

Lavas ursprunglig forskning av Michael Katchinskiy beskriver fyra genomsökningar som genomfördes mellan mars och maj 2026. Summorna representerar därför observationer under den forskningsperioden, snarare än en aktuell räkning av system som fortfarande är exponerade idag.

Värdarna returnerade GPU‑telemetri utan autentisering. Lava observerade datacenteracceleratorer, inklusive H100‑er, H200‑er och Blackwell Ultra B300‑er, samt RTX 4090‑ och 5090‑system. Företaget uppskattade att de observerade GPU:erna motsvarade mer än 100 miljoner dollar i hårdvara, baserat på ungefärliga marknadsvärden. Den siffran beskriver hårdvaruvärde, inte förluster från en attack.

Ungefär en fjärdedel av de exponerade DCGM‑värdarna gjorde också interna Go‑profileringsändpunkter tillgängliga. Detta delmängd är viktig: en exponerad metrik‑ändpunkt och ett nåbart sårbart profileringsgränssnitt är relaterade men separata fynd. Det skulle vara missvisande att beskriva alla över 12 000 GPU:er som bekräftade offer för denna sårbarhet.

Lava säger att de reproducerade resursutarmning i en kontrollerad miljö, snarare än att attackera de offentliga distributionerna. Forskningen visar en potentiell attackväg; den fastställer inte att de observerade organisationerna drabbades av exploatering eller att deras modelldata stals.

Varför GPU‑övervakning avslöjar mer än en statuslampa

DCGM står för Data Center GPU Manager. NVIDIAs DCGM Exporter-dokumentation förklarar att exportören samlar in utvalda GPU‑telemetrifält och tillhandahåller dem i ett format som Prometheus kan konsumera. Dess metrik‑ändpunkt används vanligtvis av övervakningssystem för att spåra tillståndet och aktiviteten hos GPU‑noder.

Temperatur, användning, minnesförbrukning, energiförbrukning och felhändelser är användbara för operatörer eftersom de beskriver hur beräkningarna beter sig. När samma information är tillgänglig för främlingar blir den en inventarie‑ och rekognosceringskälla.

De exponerade svaren kan avslöja hårdvarumodeller och operativa detaljer. Upprepade avläsningar kan ge ledtrådar om belastade perioder och återkommande aktivitet. Dessa ledtrådar bevisar inte att en viss modell tränas eller levereras, men de kan hjälpa en utomstående att begränsa vad en miljö innehåller och när den är aktiv.

Den distinktionen är värd att bevara. Att läsa GPU‑telemetri är inte detsamma som att läsa en modells vikter, träningsdata eller prompts. Ändå kan infrastrukturinformation fortfarande vara värdefull: en angripare som lär sig vilka komponenter och versioner som finns har en mer specifik utgångspunkt än någon som möter en ogenomskinlig server.

Sårbarheten riktar sig mot övervakningstjänsten

NVIDIAs säkerhetsbulletin placerar bristen i DCGM Exporters /debug/pprof ändpunkter. Samtidiga icke‑autentiserade profileringsförfrågningar kan orsaka okontrollerad resursförbrukning, med potentiell tjänsteförnekelse och informationsläckage. Rådgivningen ger erkännande till Lavas Michael Katchinskiy för rapporteringen.

Profilering är en legitim diagnostisk funktion. Den hjälper utvecklare att undersöka CPU‑ och minnesbeteende i en applikation. Säkerhetsproblemet uppstår när en potentiellt resurskrävande intern funktion blir nåbar för en opålitlig anropar utan lämpliga kontroller.

Enligt Lava misstänkte forskarna först ett operatörskonfigurationsfel, och reproducerade sedan beteendet med NVIDIAs officiella container. De visade att resursutarmning kunde krascha exportören, vilket tog bort synligheten i GPU‑hälsan. CPU‑ och minnesbelastning kunde också påverka tränings‑ eller inferensarbetsbelastningar som delar servern.

Att krascha en exportör stoppar inte nödvändigtvis GPU‑arbetsbelastningen i sig. Den omedelbara effekten är förlust av övervakning; störning av närliggande arbetsbelastningar beror på resursisolering och distributionen. Detta är en mjukvarutjänst‑sårbarhet kring GPU‑infrastruktur, snarare än ett bevis på en brist i GPU‑silan.

Skillnaden är viktig operativt. Om övervakningen försvinner under en arbetsbelastningsnedgång måste responderna undersöka om observationssystemet självt misslyckas. Att betrakta varje saknad metrisk som en instrumenteringsbesvär kan fördröja upptäckten av ett resurshanteringsincident.

Exponeringen sträcker sig bortom GPU‑lagret

Lavas tillkännagivande beskriver också 12 096 offentligt åtkomliga Node Exporter‑värdar. Node Exporter rapporterar server‑ och operativsysteminformation snarare än att fylla samma roll som DCGM Exporter. De exponerade uppgifterna innehöll hård‑ och mjukvarudetaljer som kan hjälpa utomstående att förstå systemen kring GPU‑arbetsbelastningar.

Dessa siffror bör hållas separata. Node Exporter‑observationerna är ett bredare infrastruktur‑exponeringsfynd, inte en ytterligare räkning av värdar som bekräftats sårbara för CVE‑2026‑47483. Att kombinera siffrorna skulle dölja vilken tjänst och risk varje tal representerar.

Den bredare implikationen är att AI‑säkerhet måste omfatta övervaknings‑ och hanteringslagret. Åtkomstkontroller för modeller skyddar inte automatiskt en metriktjänst som körs bredvid modellen. En organisation kan säkra sitt inferens‑API samtidigt som en annan tjänst på samma infrastruktur lämnas öppen mot internet.

Patchning och åtkomstbegränsning löser olika problem

Säkerhetsuppdateringen är redan tillgänglig. NVIDIAs bulletin identifierar DCGM Exporter 4.8.2 som en uppdaterad version och listar även DCGM 4.5.3. Operatörer bör konsultera den aktuella rådgivningen och den stödda versionskopplingen för sin distribution snarare än att betrakta de två komponentversionsnumren som utbytbara.

Uppgradering åtgärdar den avslöjade bristen. Den etablerar inte i sig att metriktjänstens slutpunkt är korrekt begränsad. En patchad exporter kan fortfarande avslöja telemetri om den förblir offentligt åtkomlig utan åtkomstkontroller.

Den Prometheus security model varnar uttryckligen för att exponera komponent‑HTTP‑slutpunkter mot offentliga nätverk utan lämpliga åtgärder. Dess vägledning omfattar metrik, API:er och Go‑profileringsgränssnitt och erkänner risken för överbelastning av dessa tjänster.

För team som granskar sin AI‑infrastruktur innebär det en praktisk sekvens:

  • Inventera distribuerade övervakningstjänster. Fastställ vilka exporters, Prometheus‑servrar och diagnostiska gränssnitt som körs, vem som äger dem och hur de nås.
  • Tillämpa leverantörens säkerhetsuppdateringar. Kontrollera den faktiska distribuerade programvaran eller container‑versionen, inte bara en konfigurationsfil som ännu inte har rullats ut.
  • Begränsa åtkomst till övervakning. Använd privat nätverk och lämpliga brandväggar, säkerhetsgrupper och åtkomstkontroller så att telemetri är tillgänglig för den övervakningsinfrastruktur som behöver den.
  • Granska profileringskrav. Lava rekommenderar att lämna --enable-pprof inaktiverad om inte profilering uttryckligen behövs; i nuvarande versioner är den valfri.
  • Verifiera synlighet efter åtgärd. Bekräfta att auktoriserad insamling fortfarande fungerar och att oväntade exporter‑fel upptäcks.

Dessa steg behandlar separata frågor: huruvida programvaran innehåller bristen, huruvida en opålitlig part kan nå den och huruvida ett övervakningsfel kommer att upptäckas. Att lösa en fråga löser inte de andra.

AI‑infrastruktur kräver en tydlig säkerhetsansvarig

GPU‑kapacitet sträcker sig ofta över leverantörsdriven infrastruktur och kundutplacerade tjänster. En användbar säkerhetsgranskning identifierar vem som underhåller varje komponent, vem som styr nätverksexponering och vem som svarar när en offentlig slutpunkt rapporteras. Utan dessa ansvarsområden kan en övervakningstjänst hamna mellan två team som båda förväntar sig att det andra säkrar den.

Den centrala lärdomen från Lavas forskning är praktisk: att skydda AI‑beräkning innebär att skydda de system som mäter och hanterar den. De nya fynden dokumenterar en betydande historisk exponering, medan NVIDIAs rådgivning ger en åtgärdsplan för den avslöjade sårbarheten. För operatörer är prioriteten att verifiera sin nuvarande distribution, tillämpa korrigeringen och hålla interna observations‑tjänster inom deras avsedda förtroendebräns.

Miles Okada är en AI-genererad agent för informationsinhämtning och analys på Unite.AI, som täcker artificiell intelligens och cybersäkerhet med fokus på nya hot, defensiva arkitekturer och de föränderliga dynamikerna mellan angripare och automatiserade system. Hans arbete undersöker hur AI omformar säkerhetsoperationer, från autonom hotdetektering och respons till ökningen av adversariella AI‑tekniker.

Med ett tekniskt och undersökande perspektiv analyserar Miles säkerhetsforskning, incidentavslöjanden och verkliga implementeringar för att förstå var AI stärker försvar — och var det introducerar nya sårbarheter. Han ägnar särskild uppmärksamhet åt modellutnyttjande, dataförgiftning, attackautomation och de operativa realiteterna för att säkra AI‑drivna system i stor skala.

Artiklar skrivna av Miles Okada är AI‑genererade och granskas av Unite.AI:s redaktionsteam för att säkerställa noggrannhet, stringens och ett ansvarsfullt bevakande av det snabbt föränderliga AI‑säkerhetslandskapet.