Keamanan siber
Lava Menemukan Ribuan Server GPU yang Terbuka dan Kerentanan Pemantauan NVIDIA dengan Tingkat Keparahan Tinggi

Infrastruktur di balik model AI dapat mengungkapkan sejumlah informasi yang mengejutkan sebelum ada yang membobolnya. Titik akhir pemantauan publik dapat mengungkapkan GPU dalam sebuah server, pemanfaatannya, dan perangkat lunak di sekitarnya. Celah dalam layanan pemantauan yang sama dapat mengubah visibilitas menjadi risiko ketersediaan.
Penelitian baru dari Lava, yang dirilis 8 Oktober, menjelaskan kedua masalah tersebut. Perusahaan keamanan tersebut mengidentifikasi sekitar 2.100 host NVIDIA DCGM Exporter yang dapat diakses publik yang melaporkan lebih dari 12.000 GPU unik tanpa otentikasi. Selama penyelidikannya, Lava juga menemukan kerentanan tingkat keparahan tinggi yang dapat memungkinkan penyerang tanpa otentikasi menghabiskan sumber daya dan menghentikan pemantauan GPU.
NVIDIA telah menetapkan masalah ini CVE-2026-47483, menilainya 8.2, Tinggi, dan merilis pembaruan. Temuan ini menyoroti bagian infrastruktur AI yang kurang glamor: layanan yang digunakan untuk mengamati komputasi mahal memerlukan perlindungan tersendiri.
Apa yang Ditemukan Peneliti—dan Apa Arti Angkanya
Lava’s penelitian asli oleh Michael Katchinskiy menjelaskan empat pemindaian yang dilakukan antara Maret dan Mei 2026. Oleh karena itu, total tersebut mewakili pengamatan selama periode penelitian itu, bukan hitungan langsung sistem yang masih terbuka saat ini.
Host-host tersebut mengembalikan telemetri GPU tanpa otentikasi. Lava mengamati akselerator pusat data, termasuk H100, H200, dan Blackwell Ultra B300, serta sistem RTX 4090 dan 5090. Perusahaan memperkirakan bahwa GPU yang diamati mewakili lebih dari $100 juta dalam perangkat keras, berdasarkan perkiraan nilai pasar. Angka tersebut menggambarkan nilai perangkat keras, bukan kerugian akibat serangan.
Sekitar seperempat dari host DCGM yang terbuka juga membuat endpoint profiling Go internal dapat diakses. Subset ini penting: endpoint metrik yang terbuka dan antarmuka profiling yang rentan namun dapat dijangkau merupakan temuan yang terkait namun berbeda. Akan menyesatkan jika menggambarkan semua GPU lebih dari 12.000 sebagai korban terkonfirmasi dari kerentanan ini.
Lava mengatakan bahwa mereka mereproduksi kehabisan sumber daya dalam lingkungan terkendali, bukan menyerang penyebaran publik. Penelitian ini menunjukkan jalur serangan potensial; namun tidak membuktikan bahwa organisasi yang diamati mengalami eksploitasi atau bahwa data model mereka dicuri.
Mengapa Pemantauan GPU Mengungkap Lebih dari Sekadar Lampu Status
DCGM merupakan singkatan dari Data Center GPU Manager. NVIDIA’s dokumentasi DCGM Exporter menjelaskan bahwa exporter mengumpulkan bidang telemetri GPU terpilih dan menyajikannya dalam format yang dapat dikonsumsi oleh Prometheus. Endpoint metriknya biasanya digunakan oleh sistem pemantauan untuk melacak kondisi dan aktivitas node GPU.
Suhu, pemanfaatan, penggunaan memori, konsumsi daya, dan kejadian error berguna bagi operator karena mereka menggambarkan bagaimana komputasi berperilaku. Ketika informasi yang sama dapat diakses oleh orang asing, hal itu menjadi sumber inventaris dan pengintaian.
Respons yang terbuka dapat mengungkap model perangkat keras dan detail operasional. Pembacaan berulang dapat memberikan petunjuk tentang periode sibuk dan aktivitas berulang. Petunjuk tersebut bukan bukti bahwa model tertentu sedang dilatih atau dilayani, namun dapat membantu pihak luar mempersempit apa yang ada dalam lingkungan tersebut dan kapan ia aktif.
Pembedaan itu penting untuk dipertahankan. Membaca telemetri GPU tidak sama dengan membaca bobot model, data pelatihan, atau prompt. Namun informasi infrastruktur tetap berharga: penyerang yang mengetahui komponen dan versi apa yang ada memiliki titik awal yang lebih spesifik dibandingkan seseorang yang menghadapi server yang tidak transparan.
Kerentanan Menargetkan Layanan Pemantauan
buletin keamanan NVIDIA menemukan celah pada DCGM Exporter /debug/pprof endpoint. Permintaan profiling tanpa otentikasi yang bersamaan dapat menyebabkan konsumsi sumber daya yang tidak terkendali, dengan potensi penolakan layanan dan pengungkapan informasi. Pemberitahuan ini memberi penghargaan kepada Michael Katchinskiy dari Lava atas pelaporannya.
Profiling adalah kemampuan diagnostik yang sah. Ini membantu pengembang menyelidiki perilaku CPU dan memori di dalam aplikasi. Masalah keamanan muncul ketika fungsi internal yang berpotensi mahal dapat diakses oleh pemanggil yang tidak tepercaya tanpa kontrol yang memadai.
Menurut Lava, peneliti awalnya mencurigai adanya kesalahan konfigurasi operator, kemudian mereproduksi perilaku tersebut dengan kontainer resmi NVIDIA. Mereka menunjukkan bahwa kehabisan sumber daya dapat menghentikan exporter, menghilangkan visibilitas terhadap kesehatan GPU. Tekanan CPU dan memori juga dapat memengaruhi beban kerja pelatihan atau inferensi yang berbagi server.
Menghentikan exporter tidak serta merta menghentikan beban kerja GPU itu sendiri. Efek langsungnya adalah hilangnya pemantauan; interferensi dengan beban kerja tetangga tergantung pada isolasi sumber daya dan penyebaran. Ini adalah kerentanan layanan perangkat lunak pada infrastruktur GPU, bukan bukti adanya cacat pada silikon GPU.
Perbedaan ini penting secara operasional. Jika pemantauan menghilang selama penurunan beban kerja, responder harus menyelidiki apakah sistem observasi itu sendiri mengalami kegagalan. Menganggap setiap metrik yang hilang sebagai ketidaknyamanan instrumentasi dapat menunda pengenalan insiden konsumsi sumber daya.
Paparan melampaui lapisan GPU
Lava mengumumkan juga adanya 12.096 host Node Exporter yang dapat diakses publik. Node Exporter melaporkan informasi server dan sistem operasi, bukan berfungsi sama seperti DCGM Exporter. Data yang terbuka mencakup detail perangkat keras dan perangkat lunak yang dapat membantu pihak luar memahami sistem di sekitar beban kerja GPU.
Jumlah tersebut harus tetap dipisahkan. Observasi Node Exporter merupakan temuan paparan infrastruktur yang lebih luas, bukan lagi hitungan host yang dikonfirmasi rentan terhadap CVE-2026-47483. Menggabungkan angka-angka itu akan menyamarkan layanan dan risiko yang diwakili masing‑masing.
Implikasi yang lebih luas adalah keamanan AI harus mencakup lapisan pemantauan dan manajemen. Kontrol akses model tidak secara otomatis melindungi layanan metrik yang ditempatkan di samping model. Sebuah organisasi dapat mengamankan API inferensinya sementara layanan lain pada infrastruktur yang sama tetap terbuka ke internet.
Pembaruan dan pembatasan akses menyelesaikan masalah yang berbeda
Pembaruan keamanan sudah tersedia. Buletin NVIDIA mengidentifikasi DCGM Exporter 4.8.2 sebagai versi yang diperbarui dan juga mencantumkan DCGM 4.5.3. Operator harus merujuk pada advisory terkini dan pasangan rilis yang didukung untuk deployment mereka, alih-alih memperlakukan kedua nomor versi komponen tersebut sebagai dapat dipertukarkan.
Peningkatan versi memperbaiki kelemahan yang diungkapkan. Namun, hal itu tidak serta merta memastikan bahwa titik akhir metrik telah dibatasi dengan tepat. Exporter yang telah dipatch masih dapat mengungkapkan telemetri jika tetap dapat diakses publik tanpa kontrol akses.
Model keamanan model keamanan Prometheus secara eksplisit memperingatkan agar tidak mengekspos endpoint HTTP komponen ke jaringan publik tanpa langkah yang tepat. Panduannya mencakup metrik, API, dan antarmuka profil Go, serta mengakui kemungkinan beban berlebih pada layanan tersebut.
Bagi tim yang meninjau infrastruktur AI mereka, hal itu menyarankan urutan praktis:
- Inventarisasi layanan pemantauan yang diterapkan. Tentukan exporter, server Prometheus, dan antarmuka diagnostik yang berjalan, siapa pemiliknya, dan bagaimana cara mengaksesnya.
- Terapkan pembaruan keamanan dari vendor. Periksa versi perangkat lunak atau kontainer yang sebenarnya diterapkan, bukan hanya file konfigurasi yang belum diterapkan.
- Batasi akses pemantauan. Gunakan jaringan privat serta firewall, grup keamanan, dan kontrol akses yang tepat sehingga telemetri hanya tersedia bagi infrastruktur pemantauan yang membutuhkannya.
- Tinjau kebutuhan profiling. Lava merekomendasikan membiarkan
--enable-pprofdinonaktifkan kecuali profiling memang diperlukan; pada versi saat ini, fitur ini bersifat opt‑in. - Verifikasi visibilitas setelah remediasi. Pastikan pengumpulan yang diotorisasi masih berfungsi dan kegagalan exporter yang tidak terduga terdeteksi.
Langkah‑langkah ini menjawab pertanyaan terpisah: apakah perangkat lunak mengandung kelemahan, apakah pihak tidak terpercaya dapat mengaksesnya, dan apakah kegagalan pemantauan akan terdeteksi. Menyelesaikan satu tidak menyelesaikan yang lain.
Infrastruktur AI memerlukan pemilik keamanan yang eksplisit
Kapasitas GPU seringkali mencakup infrastruktur yang dioperasikan penyedia serta layanan yang dipasang oleh pelanggan. Tinjauan keamanan yang berguna mengidentifikasi siapa yang memelihara setiap komponen, siapa yang mengendalikan eksposur jaringan, dan siapa yang merespons ketika sebuah endpoint publik dilaporkan. Tanpa penetapan tersebut, layanan pemantauan dapat berada di antara dua tim yang masing‑masing mengharapkan tim lain mengamankannya.
Pelajaran utama dari riset Lava bersifat praktis: melindungi komputasi AI mencakup melindungi sistem yang mengukur dan mengelolanya. Temuan baru mendokumentasikan paparan historis yang signifikan, sementara advisory NVIDIA menyediakan jalur remediasi untuk kerentanan yang diungkapkan. Bagi operator, prioritasnya adalah memverifikasi deployment saat ini, menerapkan perbaikan, dan menjaga layanan observasi internal tetap berada dalam batas kepercayaan yang dimaksud.












