Кібербезпека
Lava виявила тисячі відкритих GPU‑серверів і вразливість високої тяжкості у моніторингу NVIDIA

Інфраструктура, що стоїть за моделлю ШІ, може розкрити значну кількість інформації ще до того, як хтось спробує її зламати. Публічний кінцевий пункт моніторингу може розкрити GPU у сервері, їхнє використання та програмне забезпечення навколо них. Вразливість у цьому ж сервісі моніторингу може перетворити видимість на ризик доступності.
Нове дослідження Lava, опубліковане 8 жовтня, описує обидві проблеми. Компанія з безпеки виявила приблизно 2 100 публічно доступних хостів NVIDIA DCGM Exporter, які повідомляли про понад 12 000 унікальних GPU без автентифікації. Під час розслідування Lava також виявила вразливість високої тяжкості, яка може дозволити неавтентифікованому зловмиснику вичерпати ресурси та зламати моніторинг GPU.
NVIDIA присвоїла проблемі CVE-2026-47483, оцінила її як 8.2, High і випустила оновлення. Ці результати підняли на передній план менш привабливу частину інфраструктури ШІ: сервіси, що використовуються для спостереження за дорогим обчисленням, потребують власного захисту.
Що виявили дослідники — і що означають цифри
У оригінальному дослідженні Майкла Качкінського Lava описано чотири сканування, проведені між березнем і травнем 2026 року. Тому підсумки представляють спостереження за цей дослідницький період, а не актуальний підрахунок систем, які залишаються відкритими сьогодні.
Хости передавали телеметрію GPU без автентифікації. Lava спостерігала прискорювачі дата‑центрів, включаючи H100, H200 та Blackwell Ultra B300, а також системи RTX 4090 і 5090. Компанія оцінила, що виявлені GPU вартують понад 100 млн доларів апаратного забезпечення, спираючись на приблизні ринкові ціни. Це число описує вартість обладнання, а не збитки від атаки.
Близько чверті відкритих хостів DCGM також надали доступ до внутрішніх кінцевих точок профілювання Go. Цей підмножина важлива: відкритий кінцевий пункт метрик і вразливий інтерфейс профілювання — це пов’язані, але окремі результати. Було б вводити в оману, називаючи всі понад 12 000 GPU підтвердженими жертвами цієї вразливості.
Lava стверджує, що відтворила вичерпання ресурсів у контрольованому середовищі, а не атакувала публічні розгортання. Дослідження демонструє потенційний шлях атаки; воно не підтверджує, що спостережувані організації зазнали експлуатації або що їхні дані моделей були викрадені.
Чому моніторинг GPU розкриває більше, ніж лише індикатор стану
DCGM означає Data Center GPU Manager. документація DCGM Exporter від NVIDIA пояснює, що експортёр збирає вибрані поля телеметрії GPU і надає їх у форматі, який може споживати Prometheus. Його кінцева точка метрик зазвичай використовується системами моніторингу для відстеження стану та активності вузлів GPU.
Температура, використання, споживання пам’яті, енергоспоживання та події помилок корисні операторам, оскільки вони описують, як працює обчислення. Коли та сама інформація доступна стороннім особам, вона стає джерелом інвентаризації та розвідки.
Відкриті відповіді можуть розкрити моделі апаратного забезпечення та операційні деталі. Повторювані показники можуть дати підказки про пікові періоди та повторювану активність. Ці підказки не є доказом того, що конкретна модель навчається або обслуговується, але вони можуть допомогти сторонньому користувачу уточнити, що містить середовище і коли воно активне.
Ця різниця варта збереження. Читання телеметрії GPU не те саме, що читання ваг моделі, даних навчання чи підказок. Проте інформація про інфраструктуру все ж може бути цінною: зловмисник, який дізнається, які компоненти та версії присутні, має більш конкретну відправну точку, ніж той, хто стикається з непрозорим сервером.
Вразливість націлена на сервіс моніторингу
повідомлення про безпеку NVIDIA розташовує вразливість у DCGM Exporter /debug/pprof кінцевих точках. Одночасні неавтентифіковані запити профілювання можуть викликати неконтрольоване споживання ресурсів, що може призвести до відмови в обслуговуванні та розкриття інформації. У повідомленні вказується, що за повідомлення про вразливість відповідає Майкл Качкінський з Lava.
Профілювання — це легітимна діагностична можливість. Воно допомагає розробникам досліджувати поведінку процесора та пам’яті всередині застосунку. Проблема безпеки виникає, коли потенційно витратна внутрішня функція стає доступною недовіреному виклику без належного контролю.
За даними Lava, дослідники спочатку підозрювали помилку конфігурації оператора, а потім відтворили поведінку за допомогою офіційного контейнера NVIDIA. Вони продемонстрували, що вичерпання ресурсів може зламати експортёр, позбавивши можливості моніторингу стану GPU. Навантаження на процесор та пам’ять також може впливати на навантаження навчання або інференції, що спільно використовують сервер.
Зламання експортера не обов’язково зупиняє саму роботу GPU. Негайний ефект — втрата моніторингу; вплив на суміжні навантаження залежить від ізоляції ресурсів та розгортання. Це вразливість програмного сервісу, пов’язана з інфраструктурою GPU, а не доказ дефекту в кремнії GPU.
Різниця має операційне значення. Якщо моніторинг зникає під час уповільнення навантаження, реагувальники повинні з’ясувати, чи сама система спостереження не виходить з ладу. Ставлення кожної відсутньої метрики до незручності інструментування може затримати виявлення інциденту споживання ресурсів.
Витік виходить за межі рівня GPU
У повідомленні Lava також описано 12 096 публічно доступних хостів Node Exporter. Node Exporter повідомляє про інформацію про сервер і операційну систему, а не виконує ту ж роль, що й DCGM Exporter. Відкриті дані включали апаратні та програмні деталі, які могли допомогти стороннім особам зрозуміти системи, що оточують навантаження GPU.
Ці підрахунки слід залишати окремо. Спостереження Node Exporter є ширшим виявленням витоку інфраструктури, а не ще одним підрахунком хостів, підтверджено вразливих до CVE-2026-47483. Поєднання цифр затемнює, який сервіс і який ризик представляє кожне число.
Ширша наслідок полягає в тому, що безпека ШІ повинна включати шар моніторингу та управління. Контроль доступу до моделей не автоматично захищає сервіс метрик, розгорнутий поруч із моделлю. Організація може захистити свій API інференції, залишаючи інший сервіс на тій самій інфраструктурі відкритим до інтернету.
Виправлення та обмеження доступу вирішують різні проблеми
Оновлення безпеки вже доступне. У бюлетені NVIDIA зазначено DCGM Exporter 4.8.2 як оновлену версію і також перелічено DCGM 4.5.3. Операторам слід консультуватися з поточним рекомендаційним документом і підтримуваною парою випусків для їхнього розгортання, а не розглядати ці два номери версій компонентів як взаємозамінні.
Оновлення виправляє виявлену вразливість. Воно саме по собі не гарантує, що кінцева точка метрик належним чином обмежена. Патчений експортер може й надалі розкривати телеметрію, якщо залишиться публічно доступним без контролю доступу.
Модель безпеки Prometheus security model явно застерігає від розкриття HTTP‑кінцевих точок компонентів у публічних мережах без належних заходів. Її рекомендації охоплюють метрики, API та інтерфейси профілювання Go і визнають можливість перевантаження цих сервісів.
Для команд, які переглядають свою інфраструктуру ШІ, це передбачає практичну послідовність:
- Інвентаризація розгорнутих сервісів моніторингу. Визначте, які експортери, сервери Prometheus та діагностичні інтерфейси працюють, хто їх власник і як вони доступні.
- Застосування оновлень безпеки від постачальника. Перевірте фактичну розгорнуту версію програмного забезпечення або контейнера, а не лише файл конфігурації, який ще не був впроваджений.
- Обмеження доступу до моніторингу. Використовуйте приватні мережі та відповідні правила брандмауера, груп безпеки та контролі доступу, щоб телеметрія була доступна лише інфраструктурі моніторингу, якій це потрібно.
- Перегляд вимог до профілювання. Lava радить залишати
--enable-pprofвимкненим, якщо профілювання не є явно необхідним; у поточних версіях це опція за запитом. - Перевірка видимості після виправлення. Підтвердіть, що уповноважений збір даних все ще працює і що несподівані збої експортерів помічені.
Ці кроки відповідають окремим питанням: чи містить програмне забезпечення вразливість, чи може її досягти недовірена сторона, і чи буде виявлено збій моніторингу. Вирішення одного питання не вирішує інші.
Інфраструктура ШІ потребує явного власника безпеки
Ємність GPU часто охоплює інфраструктуру, керовану провайдером, і сервіси, розгорнуті клієнтом. Корисний огляд безпеки визначає, хто підтримує кожен компонент, хто контролює мережеву експозицію і хто реагує, коли повідомляється про публічну кінцеву точку. Без цих призначень сервіс моніторингу може опинитися між двома командами, які кожна очікує, що інша його захистить.
Центральний висновок дослідження Lava практичний: захист обчислень ШІ включає захист систем, які їх вимірюють і керують. Нові результати документують значний історичний витік, тоді як рекомендація NVIDIA надає шлях усунення виявленої вразливості. Для операторів пріоритетом є перевірка поточного розгортання, застосування виправлення та утримання внутрішніх сервісів спостереження в межах їхньої передбаченої довірчої зони.












