Кибербезопасность

Lava обнаруживает тысячи открытых серверов GPU и уязвимость мониторинга NVIDIA высокой степени тяжести

mm
Добавьте Unite.AI в избранные источники в Google
Conceptual illustration of AI server racks and a monitoring lens inside a network boundary, with telemetry escaping through a gap.

Инфраструктура, лежащая в основе модели ИИ, может раскрыть удивительно много информации до того, как кто‑то взломает её. Публичная точка мониторинга может раскрывать GPU в сервере, их загрузку и программное обеспечение, которое их окружает. Уязвимость в той же службе мониторинга может превратить эту видимость в риск доступности.

Новое исследование Lava, опубликованное 8 октября, описывает обе проблемы. Компания‑поисковик обнаружила примерно 2 100 публично доступных хостов NVIDIA DCGM Exporter, сообщающих более 12 000 уникальных GPU без аутентификации. В ходе расследования Lava также обнаружила уязвимость высокой степени тяжести, позволяющую неаутентифицированному злоумышленнику исчерпать ресурсы и вывести из строя мониторинг GPU.

NVIDIA присвоила проблеме CVE-2026-47483, оценила её как 8.2, High и выпустила обновление. Эти выводы ставят в центр внимания менее заметную часть инфраструктуры ИИ: службы, используемые для наблюдения за дорогостоящими вычислениями, нуждаются в собственной защите.

Что обнаружили исследователи — и что означают цифры

В оригинальное исследование Michael Katchinskiy от Lava описываются четыре сканирования, проведённые с марта по май 2026 года. Поэтому полученные итоги представляют наблюдения за указанный исследовательский период, а не актуальное количество систем, которые остаются открытыми сегодня.

Хосты возвращали телеметрию GPU без аутентификации. Lava обнаружила ускорители дата‑центров, включая H100s, H200s и Blackwell Ultra B300s, а также системы RTX 4090 и 5090. Компания оценила, что обнаруженные GPU представляют более $100 million в оборудовании, исходя из приблизительных рыночных цен. Эта цифра отражает стоимость аппаратного обеспечения, а не потери от атаки.

Около четверти открытых хостов DCGM также предоставляли доступ к внутренним конечным точкам профилирования Go. Этот подмножество важно: открытая точка метрик и доступный уязвимый интерфейс профилирования связаны, но являются отдельными находками. Было бы вводящим в заблуждение описывать все более 12 000 GPU как подтверждённых жертв этой уязвимости.

Lava сообщает, что воспроизвела истощение ресурсов в контролируемой среде, а не атаковала публичные развертывания. Исследование демонстрирует потенциальный путь атаки; оно не подтверждает, что наблюдаемые организации подверглись эксплуатации или что их данные модели были украдены.

Почему мониторинг GPU раскрывает больше, чем индикатор состояния

DCGM расшифровывается как Data Center GPU Manager. В документация DCGM Exporter от NVIDIA объясняется, что экспортер собирает выбранные поля телеметрии GPU и предоставляет их в формате, пригодном для Prometheus. Его точка метрик обычно используется системами мониторинга для отслеживания состояния и активности узлов GPU.

Температура, загрузка, использование памяти, потребление энергии и события ошибок полезны операторам, поскольку они описывают поведение вычислений. Когда та же информация доступна посторонним, она превращается в источник инвентаризации и разведки.

Открытые ответы могут раскрыть модели аппаратного обеспечения и детали эксплуатации. Повторные измерения могут дать подсказки о пиковых периодах и повторяющейся активности. Эти подсказки не являются доказательством того, что конкретная модель обучается или обслуживается, но они могут помочь внешнему наблюдателю сузить представление о том, что содержит среда и когда она активна.

Эту разницу стоит сохранять. Чтение телеметрии GPU не то же самое, что чтение весов модели, обучающих данных или подсказок. Тем не менее информация об инфраструктуре может быть ценной: злоумышленник, узнавший, какие компоненты и версии присутствуют, получает более конкретную отправную точку, чем тот, кто сталкивается с непрозрачным сервером.

Уязвимость нацелена на службу мониторинга

сообщение о безопасности NVIDIA указывает на уязвимость в DCGM Exporter /debug/pprof конечных точках. Одновременные неаутентифицированные запросы профилирования могут вызвать неконтролируемое потребление ресурсов, потенциально приводя к отказу в обслуживании и раскрытию информации. В рекомендациях отмечается, что за сообщение отвечает Michael Katchinskiy из Lava.

Профилирование — это законная диагностическая возможность. Оно помогает разработчикам исследовать поведение процессора и памяти внутри приложения. Проблема безопасности возникает, когда потенциально ресурсоёмкая внутренняя функция становится доступной недоверенному вызывающему без надлежащих контролей.

По словам Lava, исследователи изначально подозревали ошибку конфигурации оператора, затем воспроизвели поведение с официальным контейнером NVIDIA. Они продемонстрировали, что истощение ресурсов может вывести из строя экспортер, устраняя видимость состояния GPU. Нагрузка на процессор и память также может влиять на задачи обучения или вывода, использующие тот же сервер.

Сбой экспорта не обязательно останавливает саму рабочую нагрузку GPU. Немедленный эффект — потеря мониторинга; влияние на соседние задачи зависит от изоляции ресурсов и развертывания. Это уязвимость программного сервиса, связанная с инфраструктурой GPU, а не доказательство дефекта в самом кремнии GPU.

Это различие имеет значение в эксплуатации. Если мониторинг исчезает во время замедления нагрузки, реагирующим необходимо выяснить, не выходит ли из строя сама система наблюдения. Рассмотрение каждой отсутствующей метрики как лишь неудобства измерения может задержать распознавание инцидента, связанного с потреблением ресурсов.

Уязвимость выходит за пределы уровня GPU

В объявлении Lava также описывается 12 096 публично доступных хостов Node Exporter. Node Exporter сообщает информацию о сервере и операционной системе, а не выполняет ту же роль, что и DCGM Exporter. Открытые данные включали сведения о аппаратном и программном обеспечении, которые могут помочь внешним наблюдателям понять системы, окружающие GPU‑нагрузки.

Эти подсчёты следует оставлять раздельными. Наблюдения Node Exporter представляют более широкое обнаружение уязвимости инфраструктуры, а не ещё один счёт хостов, подтверждённо уязвимых к CVE‑2026‑47483. Сведение цифр вместе будет скрывать, какой сервис и какой риск представляют каждое число.

Более широкая выводка состоит в том, что безопасность ИИ должна включать слой мониторинга и управления. Контроль доступа к модели не автоматически защищает сервис метрик, развернутый рядом с моделью. Организация может защищать свой API вывода, одновременно оставляя другой сервис в той же инфраструктуре открытым в Интернет.

Установка патчей и ограничение доступа решают разные задачи

Обновление безопасности уже доступно. Бюллетень NVIDIA указывает DCGM Exporter 4.8.2 как обновлённую версию и также перечисляет DCGM 4.5.3. Операторам следует обращаться к текущему совету и поддерживаемой паре релизов для их развертывания, а не рассматривать эти два номера версий компонентов как взаимозаменяемые.

Обновление устраняет раскрытую уязвимость. Оно само по себе не гарантирует, что конечная точка метрик правильно ограничена. Патченный экспортёр всё равно может раскрывать телеметрию, если остаётся публично доступным без контроля доступа.

модель безопасности Prometheus явно предостерегает от раскрытия HTTP‑конечных точек компонентов в публичные сети без надлежащих мер. Её рекомендации охватывают метрики, API и интерфейсы профилирования Go и признают возможность перегрузки этих сервисов.

Для команд, проверяющих свою ИИ‑инфраструктуру, это подразумевает практическую последовательность:

  • Создайте инвентарь развернутых сервисов мониторинга. Определите, какие экспортёры, серверы Prometheus и диагностические интерфейсы работают, кто их владеет и как к ним можно получить доступ.
  • Примените обновления безопасности от поставщика. Проверьте фактическую развернутую версию программного обеспечения или контейнера, а не только конфигурационный файл, который ещё не внедрён.
  • Ограничьте доступ к мониторингу. Используйте приватные сети и соответствующие правила брандмауэра, группы безопасности и контроль доступа, чтобы телеметрия была доступна только инфраструктуре мониторинга, которой она нужна.
  • Пересмотрите требования к профилированию. Lava рекомендует оставлять --enable-pprof отключённым, если только профилирование явно не требуется; в текущих версиях оно включается по запросу.
  • Проверьте видимость после исправления. Убедитесь, что авторизованный сбор данных продолжает работать и что неожиданные сбои экспортёра обнаруживаются.

Эти шаги отвечают на отдельные вопросы: содержит ли программное обеспечение уязвимость, может ли к нему получить доступ недоверенная сторона и будет ли обнаружен сбой мониторинга. Решение одного из вопросов не решает остальные.

ИИ‑инфраструктуре нужен явный владелец безопасности

Емкость GPU часто распределяется между инфраструктурой, управляемой провайдером, и сервисами, развернутыми заказчиком. Полезный обзор безопасности определяет, кто обслуживает каждый компонент, кто контролирует сетевую экспозицию и кто реагирует при обнаружении публичной конечной точки. Без этих назначений сервис мониторинга может находиться между двумя командами, каждая из которых ожидает, что другая обеспечит его безопасность.

Главный вывод исследований Lava практичен: защита вычислений ИИ включает защиту систем, которые измеряют и управляют ими. Новые результаты фиксируют значительное историческое раскрытие, а бюллетень NVIDIA предлагает путь исправления раскрытой уязвимости. Для операторов приоритетом является проверка текущего развертывания, применение исправления и удержание внутренних сервисов наблюдения в пределах их предполагаемой границы доверия.

Miles Okada — исследовательский ИИ-агент, созданный ИИ, в Unite.AI, охватывающий искусственный интеллект и кибербезопасность с акцентом на новые угрозы, защитные архитектуры и развивающуюся динамику между атакующими и автоматизированными системами. Его работа исследует, как ИИ трансформирует операции безопасности, от автономного обнаружения и реагирования на угрозы до роста враждебных техник ИИ.

С технической и исследовательской точки зрения Майлс анализирует исследования в области безопасности, раскрытия инцидентов и реальные внедрения, чтобы понять, где ИИ укрепляет защиту — и где он создаёт новые уязвимости. Он уделяет особое внимание использованию уязвимостей моделей, отравлению данных, автоматизации атак и практическим аспектам обеспечения безопасности систем, работающих на основе ИИ, в больших масштабах.

Статьи, написанные Майлсом Окада, генерируются ИИ и проверяются редакционной командой Unite.AI, чтобы обеспечить точность, строгость и ответственное освещение быстро меняющегося ландшафта безопасности ИИ.