사이버 보안
Lava가 수천 대의 노출된 GPU 서버와 고위험 NVIDIA 모니터링 결함을 발견

AI 모델 뒤의 인프라는 누군가 침입하기 전에 놀라울 정도로 많은 정보를 드러낼 수 있습니다. 공개 모니터링 엔드포인트는 서버에 장착된 GPU와 그 활용도, 주변 소프트웨어를 공개할 수 있습니다. 동일한 모니터링 서비스의 결함은 이러한 가시성을 가용성 위험으로 전환시킬 수 있습니다.
Lava가 10월 8일 발표한 최신 연구는 두 문제를 모두 설명합니다. 이 보안 업체는 인증 없이 12,000개가 넘는 고유 GPU를 보고하는 약 2,100개의 공개 NVIDIA DCGM Exporter 호스트를 확인했습니다. 조사 과정에서 Lava는 인증되지 않은 공격자가 자원을 고갈시키고 GPU 모니터링을 중단시킬 수 있는 고위험 취약점도 발견했습니다.
NVIDIA는 이 문제에 CVE-2026-47483을 부여하고, 8.2, High 등급을 매긴 뒤 업데이트를 배포했습니다. 이번 발견은 AI 인프라의 덜 화려한 부분, 즉 고가의 컴퓨팅을 관찰하는 서비스 자체도 보호가 필요함을 조명합니다.
연구자들이 발견한 내용과 숫자가 의미하는 바
Lava의 Michael Katchinskiy의 원본 연구는 2026년 3월부터 5월 사이에 수행된 네 차례의 스캔을 설명합니다. 따라서 총계는 현재도 노출된 시스템의 실시간 수치가 아니라 해당 연구 기간 동안의 관측치를 나타냅니다.
이 호스트들은 인증 없이 GPU 텔레메트리를 반환했습니다. Lava는 H100, H200, Blackwell Ultra B300을 비롯한 데이터센터 가속기와 RTX 4090 및 5090 시스템을 관찰했습니다. 회사는 관찰된 GPU가 대략적인 시장 가치를 기준으로 1억 달러가 넘는 하드웨어에 해당한다고 추정했습니다. 이 수치는 하드웨어 가치이며, 공격으로 인한 손실을 의미하는 것이 아닙니다.
노출된 DCGM 호스트 중 약 1/4은 내부 Go 프로파일링 엔드포인트도 접근 가능하게 만들었습니다. 이 부분은 중요합니다: 노출된 메트릭스 엔드포인트와 접근 가능한 취약한 프로파일링 인터페이스는 관련은 하지만 별개의 발견이기 때문입니다. 12,000개가 넘는 모든 GPU를 이 취약점의 확인된 피해자로 묘사하는 것은 오해를 불러일으킬 수 있습니다.
Lava는 공개 배포를 공격하기보다 제어된 환경에서 자원 고갈을 재현했다고 밝혔습니다. 이번 연구는 잠재적인 공격 경로를 보여주지만, 관찰된 조직이 실제로 악용당했거나 모델 데이터가 탈취되었다는 증거는 아닙니다.
GPU 모니터링이 단순한 상태 표시등 이상을 드러내는 이유
DCGM은 Data Center GPU Manager의 약자입니다. NVIDIA의 DCGM Exporter 문서에 따르면, 이 익스포터는 선택된 GPU 텔레메트리 필드를 수집해 Prometheus가 활용할 수 있는 형식으로 제공한다고 합니다. 메트릭스 엔드포인트는 일반적으로 모니터링 시스템이 GPU 노드의 상태와 활동을 추적하는 데 사용됩니다.
온도, 활용도, 메모리 사용량, 전력 소비 및 오류 이벤트는 컴퓨팅이 어떻게 동작하는지를 설명해 운영자에게 유용합니다. 동일한 정보가 외부인에게도 접근 가능해지면, 이는 인벤토리 및 정찰 자료가 됩니다.
노출된 응답은 하드웨어 모델과 운영 세부 정보를 드러낼 수 있습니다. 반복적인 읽기는 바쁜 시기와 반복적인 활동에 대한 단서를 제공할 수 있습니다. 이러한 단서가 특정 모델이 학습 중이거나 서비스되고 있다는 증거는 아니지만, 외부인이 환경에 어떤 구성 요소가 포함되어 있는지, 언제 활성화되는지를 추정하는 데 도움을 줄 수 있습니다.
이 구분은 유지할 가치가 있습니다. GPU 텔레메트리를 읽는 것은 모델의 가중치, 학습 데이터 또는 프롬프트를 읽는 것과 동일하지 않습니다. 그러나 인프라 정보는 여전히 가치가 있습니다. 어떤 구성 요소와 버전이 존재하는지를 파악한 공격자는 불투명한 서버를 상대하는 사람보다 보다 구체적인 시작점을 갖게 됩니다.
취약점이 목표로 하는 모니터링 서비스
NVIDIA 보안 게시판은 DCGM Exporter의 결함을 찾아냅니다 /debug/pprof 엔드포인트를 대상으로 합니다. 동시에 인증되지 않은 프로파일링 요청은 통제되지 않은 자원 소모를 일으켜 서비스 거부 및 정보 유출 가능성을 초래합니다. 이 권고는 Lava의 Michael Katchinskiy에게 보고한 공로를 인정합니다.
프로파일링은 정당한 진단 기능입니다. 이는 개발자가 애플리케이션 내부의 CPU 및 메모리 동작을 조사하는 데 도움을 줍니다. 보안 문제는 비용이 많이 드는 내부 함수가 적절한 제어 없이 신뢰할 수 없는 호출자에게 노출될 때 발생합니다.
Lava에 따르면, 연구자들은 처음에 운영자 구성 오류를 의심했으며, 이후 NVIDIA의 공식 컨테이너로 해당 동작을 재현했습니다. 그들은 자원 고갈이 익스포터를 충돌시켜 GPU 상태에 대한 가시성을 없앨 수 있음을 보여주었습니다. CPU와 메모리 압박은 서버를 공유하는 학습 또는 추론 워크로드에도 영향을 미칠 수 있습니다.
익스포터가 충돌한다고 해서 GPU 워크로드 자체가 중단되는 것은 아닙니다. 즉각적인 영향은 모니터링 손실이며, 인접 워크로드에 대한 간섭은 자원 격리 및 배포 방식에 따라 달라집니다. 이는 GPU 인프라를 둘러싼 소프트웨어 서비스 취약점이며, GPU 실리콘 자체의 결함을 증명하는 것은 아닙니다.
이 구분은 운영상 중요합니다. 워크로드가 느려지는 동안 모니터링이 사라지면, 대응자는 관찰 시스템 자체가 고장 났는지 조사해야 합니다. 모든 누락된 지표를 계측상의 불편으로만 여기면 자원 소비 사고를 인식하는 데 지연이 발생할 수 있습니다.
노출은 GPU 계층을 넘어 확장됩니다.
Lava의 발표에서는 12,096개의 공개 접근 가능한 Node Exporter 호스트도 언급했습니다. Node Exporter는 DCGM Exporter와 동일한 역할을 수행하지 않고 서버 및 운영 체제 정보를 보고합니다. 노출된 데이터에는 하드웨어 및 소프트웨어 세부 정보가 포함되어 있어 외부인이 GPU 워크로드를 둘러싼 시스템을 이해하는 데 도움이 될 수 있습니다.
이러한 수치는 별도로 유지되어야 합니다. Node Exporter 관측은 더 넓은 인프라 노출 발견이며, CVE-2026-47483에 취약한 것으로 확인된 호스트 수와는 별개의 카운트입니다. 숫자를 합치면 각 서비스와 위험이 무엇을 의미하는지 흐려질 수 있습니다.
보다 넓은 함의는 AI 보안에 모니터링 및 관리 계층을 포함해야 한다는 점입니다. 모델 접근 제어가 모델 옆에 배치된 메트릭 서비스까지 자동으로 보호하지는 않습니다. 조직은 추론 API를 보호하면서도 동일 인프라에 있는 다른 서비스를 인터넷에 노출된 상태로 둘 수 있습니다.
패치와 접근 제한은 서로 다른 문제를 해결합니다.
보안 업데이트가 이미 제공되었습니다. NVIDIA의 안내문에서는 DCGM Exporter 4.8.2를 최신 버전으로 지정하고 DCGM 4.5.3도 함께 나열합니다. 운영자는 두 구성 요소 버전 번호를 서로 교환 가능하다고 여기기보다 현재 권고 사항과 배포 환경에 맞는 지원 릴리스 조합을 확인해야 합니다.
업그레이드는 공개된 결함을 해결합니다. 그러나 이것만으로 메트릭 엔드포인트가 적절히 제한된다고 보장되지 않습니다. 패치된 Exporter가 여전히 공개적으로 접근 가능하고 접근 제어가 없으면 텔레메트리를 노출할 수 있습니다.
Prometheus 보안 모델은 적절한 조치 없이 구성 요소 HTTP 엔드포인트를 공용 네트워크에 노출하는 것을 명시적으로 경고합니다. 이 모델의 지침은 메트릭, API 및 Go 프로파일링 인터페이스를 포함하며, 이러한 서비스가 과부하될 가능성을 인식합니다.
AI 인프라를 검토하는 팀에게 이는 실용적인 순서를 제시합니다:
- 배포된 모니터링 서비스를 목록화합니다. 어떤 Exporter, Prometheus 서버 및 진단 인터페이스가 실행 중인지, 소유자는 누구이며 어떻게 접근 가능한지 파악합니다.
- 벤더의 보안 업데이트를 적용합니다. 아직 배포되지 않은 구성 파일만이 아니라 실제 배포된 소프트웨어 또는 컨테이너 버전을 확인합니다.
- 모니터링 접근을 제한합니다. 사설 네트워크와 적절한 방화벽, 보안 그룹 및 접근 제어를 사용해 텔레메트리가 필요한 모니터링 인프라에만 제공되도록 합니다.
- 프로파일링 요구 사항을 검토합니다. Lava는
--enable-pprof프로파일링이 명시적으로 필요하지 않는 한 비활성화하고, 현재 버전에서는 선택적으로 활성화됩니다. - 조치 후 가시성을 확인합니다. 권한 있는 수집이 여전히 작동하는지와 예상치 못한 Exporter 실패가 감지되는지를 확인합니다.
이 단계들은 소프트웨어에 결함이 존재하는지, 신뢰할 수 없는 외부가 접근할 수 있는지, 모니터링 실패가 감지되는지를 각각 다룹니다. 하나를 해결한다고 해서 다른 문제들이 해결되는 것은 아닙니다.
AI 인프라에는 명시적인 보안 책임자가 필요합니다.
GPU 용량은 종종 제공자가 운영하는 인프라와 고객이 배포한 서비스에 걸쳐 있습니다. 유용한 보안 검토는 각 구성 요소를 누가 유지 관리하고, 네트워크 노출을 누가 제어하며, 공개 엔드포인트가 보고될 때 누가 대응하는지를 식별합니다. 이러한 역할이 정의되지 않으면 모니터링 서비스가 서로가 보안을 담당할 것으로 기대하는 두 팀 사이에 끼어 있게 됩니다.
Lava 연구의 핵심 교훈은 실용적입니다: AI 컴퓨팅을 보호하려면 이를 측정하고 관리하는 시스템도 보호해야 합니다. 새로운 발견은 과거의 상당한 노출을 문서화하고, NVIDIA의 권고는 공개된 취약점에 대한 해결 경로를 제공합니다. 운영자에게는 현재 배포 환경을 확인하고, 수정 사항을 적용하며, 내부 관측 서비스를 의도된 신뢰 경계 내에 유지하는 것이 최우선 과제입니다.












