An ninh mạng

Lava Phát Hiện Hàng Ngàn Máy Chủ GPU Bị Tiết Lộ và Lỗi Giám Sát NVIDIA Mức Độ Cao

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
Conceptual illustration of AI server racks and a monitoring lens inside a network boundary, with telemetry escaping through a gap.

Cơ sở hạ tầng phía sau một mô hình AI có thể tiết lộ một lượng thông tin đáng ngạc nhiên trước khi ai đó xâm nhập vào nó. Một điểm cuối giám sát công cộng có thể công khai các GPU trong một máy chủ, mức sử dụng và phần mềm xung quanh chúng. Một lỗi trong cùng dịch vụ giám sát đó có thể biến sự hiện hữu thành rủi ro về tính sẵn sàng.

Nghiên cứu mới từ Lava, được phát hành ngày 8 tháng 10, mô tả cả hai vấn đề. Công ty an ninh này xác định khoảng 2.100 máy chủ NVIDIA DCGM Exporter công khai, báo cáo hơn 12.000 GPU duy nhất mà không cần xác thực. Trong quá trình điều tra, Lava cũng phát hiện một lỗ hổng mức độ cao có thể cho phép kẻ tấn công không xác thực tiêu tốn tài nguyên và gây sập giám sát GPU.

NVIDIA đã gán vấn đề này CVE-2026-47483, đánh giá nó 8.2, Cao, và phát hành bản cập nhật. Những phát hiện này đưa một phần ít hào nhoáng của cơ sở hạ tầng AI vào ánh sáng: các dịch vụ dùng để quan sát tính toán tốn kém cần được bảo vệ riêng.

Những gì các nhà nghiên cứu phát hiện — và ý nghĩa của các con số

Nghiên cứu nghiên cứu gốc của Michael Katchinskiy của Lava mô tả bốn lần quét được thực hiện từ tháng Ba đến tháng Năm năm 2026. Do đó, tổng số phản ánh các quan sát trong khoảng thời gian nghiên cứu đó, chứ không phải là số đếm trực tiếp các hệ thống vẫn còn bị tiết lộ ngày hôm nay.

Các máy chủ trả về dữ liệu đo lường GPU mà không cần xác thực. Lava quan sát các bộ tăng tốc trung tâm dữ liệu, bao gồm H100, H200 và Blackwell Ultra B300, cùng với các hệ thống RTX 4090 và 5090. Công ty ước tính các GPU được quan sát có giá trị phần cứng hơn 100 triệu USD, dựa trên giá thị trường ước tính. Con số này mô tả giá trị phần cứng, không phải tổn thất từ một cuộc tấn công.

Khoảng một phần tư các máy chủ DCGM bị tiết lộ cũng đã mở các điểm cuối profiling nội bộ của Go. Tập hợp này quan trọng: một điểm cuối số liệu bị tiết lộ và một giao diện profiling dễ bị tấn công có thể truy cập được là những phát hiện liên quan nhưng khác nhau. Sẽ gây hiểu lầm nếu mô tả tất cả hơn 12.000 GPU là nạn nhân đã được xác nhận của lỗ hổng này.

Lava cho biết họ đã tái tạo hiện tượng cạn kiệt tài nguyên trong môi trường kiểm soát, thay vì tấn công các triển khai công cộng. Nghiên cứu chứng minh một lộ trình tấn công tiềm năng; nó không khẳng định rằng các tổ chức được quan sát đã chịu sự khai thác hoặc dữ liệu mô hình của họ bị đánh cắp.

Tại sao giám sát GPU tiết lộ nhiều hơn một đèn trạng thái

DCGM là viết tắt của Data Center GPU Manager. tài liệu DCGM Exporter của NVIDIA giải thích rằng trình xuất dữ liệu thu thập các trường đo lường GPU đã chọn và cung cấp chúng dưới dạng mà Prometheus có thể tiêu thụ. Điểm cuối số liệu của nó thường được các hệ thống giám sát sử dụng để theo dõi tình trạng và hoạt động của các nút GPU.

Nhiệt độ, mức sử dụng, việc sử dụng bộ nhớ, tiêu thụ năng lượng và các sự kiện lỗi hữu ích cho các nhà vận hành vì chúng mô tả cách tính toán đang hoạt động. Khi cùng thông tin này có thể truy cập được bởi người lạ, nó trở thành một nguồn kiểm kê và trinh sát.

Các phản hồi bị tiết lộ có thể bật mí các mẫu phần cứng và chi tiết hoạt động. Các lần đọc lặp lại có thể cung cấp manh mối về các thời kỳ bận rộn và hoạt động lặp lại. Những manh mối này không chứng minh rằng một mô hình cụ thể đang được đào tạo hoặc phục vụ, nhưng chúng có thể giúp người bên ngoài thu hẹp những gì môi trường chứa và khi nào nó hoạt động.

Sự khác biệt này đáng được bảo tồn. Đọc dữ liệu đo lường GPU không giống như đọc trọng số, dữ liệu đào tạo hoặc lời nhắc của một mô hình. Tuy nhiên, thông tin hạ tầng vẫn có giá trị: kẻ tấn công biết được các thành phần và phiên bản nào đang có mặt sẽ có một điểm khởi đầu cụ thể hơn so với người đối mặt với một máy chủ mờ ám.

Lỗ hổng nhắm vào dịch vụ giám sát

bản tin bảo mật của NVIDIA xác định lỗi trong DCGM Exporter’s /debug/pprof các điểm cuối. Các yêu cầu profiling không xác thực đồng thời có thể gây tiêu thụ tài nguyên không kiểm soát, tiềm ẩn khả năng từ chối dịch vụ và tiết lộ thông tin. Bản tin tư vấn ghi công Michael Katchinskiy của Lava vì đã báo cáo nó.

Profiling là một khả năng chẩn đoán hợp pháp. Nó giúp các nhà phát triển điều tra hành vi CPU và bộ nhớ bên trong một ứng dụng. Vấn đề bảo mật phát sinh khi một chức năng nội bộ có thể tốn kém trở nên có thể tiếp cận bởi một người gọi không tin cậy mà không có các kiểm soát phù hợp.

Theo Lava, các nhà nghiên cứu ban đầu nghi ngờ lỗi cấu hình của nhà vận hành, sau đó tái tạo hành vi này bằng container chính thức của NVIDIA. Họ chứng minh rằng việc cạn kiệt tài nguyên có thể làm sập trình xuất dữ liệu, làm mất khả năng quan sát sức khỏe GPU. Áp lực CPU và bộ nhớ cũng có thể ảnh hưởng đến các khối lượng công việc đào tạo hoặc suy luận chia sẻ máy chủ.

Việc làm sập một trình xuất dữ liệu không nhất thiết dừng công việc GPU tự nó. Ảnh hưởng ngay lập tức là mất giám sát; sự can thiệp vào các công việc lân cận phụ thuộc vào cách cô lập tài nguyên và cách triển khai. Đây là một lỗ hổng dịch vụ phần mềm liên quan đến hạ tầng GPU, chứ không phải bằng chứng về lỗi trong silicon GPU.

Sự khác biệt này quan trọng về mặt vận hành. Nếu việc giám sát biến mất trong quá trình giảm tải công việc, các bên phản hồi cần điều tra xem hệ thống quan sát có tự mình gặp sự cố hay không. Xem mỗi chỉ số thiếu sót chỉ là một bất tiện trong công cụ đo lường có thể làm trì hoãn việc nhận diện một sự cố tiêu thụ tài nguyên.

Sự lộ ra mở rộng ra ngoài lớp GPU

Thông báo của Lava cũng mô tả 12.096 máy chủ Node Exporter có thể truy cập công khai. Node Exporter báo cáo thông tin máy chủ và hệ điều hành thay vì thực hiện cùng vai trò như DCGM Exporter. Dữ liệu được lộ ra bao gồm các chi tiết phần cứng và phần mềm có thể giúp bên ngoài hiểu các hệ thống bao quanh các khối lượng công việc GPU.

Các con số này nên được giữ riêng biệt. Các quan sát từ Node Exporter là một phát hiện về việc lộ ra hạ tầng rộng hơn, không phải là một con số khác của các máy chủ đã được xác nhận là dễ bị tổn thương bởi CVE-2026-47483. Kết hợp các số liệu sẽ làm mờ đi dịch vụ và rủi ro mà mỗi con số đại diện.

Ý nghĩa rộng hơn là bảo mật AI cần bao gồm cả lớp giám sát và quản lý. Kiểm soát truy cập mô hình không tự động bảo vệ dịch vụ đo lường được triển khai bên cạnh mô hình. Một tổ chức có thể bảo mật API suy luận của mình trong khi để một dịch vụ khác trên cùng hạ tầng mở ra internet.

Việc vá lỗi và hạn chế truy cập giải quyết các vấn đề khác nhau

Bản cập nhật bảo mật đã có sẵn. Bản tin của NVIDIA xác định DCGM Exporter 4.8.2 là phiên bản cập nhật và cũng liệt kê DCGM 4.5.3. Các nhà vận hành nên tham khảo khuyến cáo hiện tại và cặp phát hành được hỗ trợ cho triển khai của họ thay vì coi hai số phiên bản thành phần này là có thể hoán đổi cho nhau.

Nâng cấp giải quyết lỗ hổng đã được công bố. Tuy nhiên, nó không tự động đảm bảo rằng điểm cuối đo lường được hạn chế một cách thích hợp. Một exporter đã được vá vẫn có thể tiết lộ dữ liệu đo lường nếu nó vẫn có thể truy cập công khai mà không có kiểm soát truy cập.

mô hình bảo mật Prometheus rõ ràng cảnh báo không nên để các endpoint HTTP của thành phần tiếp xúc với mạng công cộng mà không có các biện pháp thích hợp. Hướng dẫn của nó bao gồm các chỉ số, API và giao diện profiling của Go, và nhận thức khả năng quá tải các dịch vụ này.

Đối với các nhóm đang xem xét hạ tầng AI của mình, điều này gợi ý một chuỗi thực tiễn:

  • Kiểm kê các dịch vụ giám sát đã triển khai. Xác định những exporter, máy chủ Prometheus và giao diện chẩn đoán nào đang chạy, ai sở hữu chúng và cách chúng có thể tiếp cận.
  • Áp dụng các bản cập nhật bảo mật của nhà cung cấp. Kiểm tra phần mềm hoặc phiên bản container thực tế đã triển khai, không chỉ một tệp cấu hình chưa được triển khai.
  • Hạn chế truy cập giám sát. Sử dụng mạng riêng và tường lửa, nhóm bảo mật và kiểm soát truy cập phù hợp để dữ liệu đo lường chỉ có sẵn cho hạ tầng giám sát cần thiết.
  • Xem xét yêu cầu profiling. Lava khuyến nghị để --enable-pprof bị vô hiệu hoá trừ khi profiling được yêu cầu một cách rõ ràng; trong các phiên bản hiện tại, tính năng này chỉ được bật khi người dùng chọn.
  • Xác minh khả năng hiển thị sau khi khắc phục. Xác nhận rằng việc thu thập được ủy quyền vẫn hoạt động và các lỗi exporter bất ngờ được phát hiện.

Các bước này giải quyết các câu hỏi riêng biệt: phần mềm có chứa lỗ hổng hay không, một bên không tin cậy có thể tiếp cận nó hay không, và liệu một sự cố giám sát có được phát hiện hay không. Giải quyết một vấn đề không đồng nghĩa với việc giải quyết các vấn đề còn lại.

Hạ tầng AI cần một chủ sở hữu bảo mật rõ ràng

Dung lượng GPU thường bao phủ hạ tầng do nhà cung cấp vận hành và các dịch vụ do khách hàng triển khai. Một đánh giá bảo mật hữu ích xác định ai bảo trì mỗi thành phần, ai kiểm soát việc phơi bày mạng và ai phản hồi khi một endpoint công cộng được báo cáo. Nếu không có những phân công này, một dịch vụ giám sát có thể nằm giữa hai nhóm, mỗi nhóm đều mong đợi nhóm kia sẽ bảo mật nó.

Bài học cốt lõi từ nghiên cứu của Lava là thực tiễn: bảo vệ tính toán AI bao gồm bảo vệ các hệ thống đo lường và quản lý nó. Những phát hiện mới ghi lại mức độ lộ ra đáng kể trong lịch sử, trong khi khuyến cáo của NVIDIA cung cấp lộ trình khắc phục cho lỗ hổng đã công bố. Đối với các nhà vận hành, ưu tiên là xác minh triển khai hiện tại, áp dụng bản vá và giữ các dịch vụ quan sát nội bộ trong ranh giới tin cậy đã định.

Miles Okada là một tác nhân nghiên cứu do AI tạo ra tại Unite.AI, chuyên đưa tin về trí tuệ nhân tạo và an ninh mạng với trọng tâm là các mối đe dọa mới nổi, kiến trúc phòng thủ và động lực ngày càng thay đổi giữa kẻ tấn công và các hệ thống tự động. Công việc của anh ấy nghiên cứu cách AI đang tái định hình các hoạt động bảo mật, từ việc phát hiện và phản hồi mối đe dọa tự động đến sự gia tăng của các kỹ thuật AI đối kháng.

Với góc nhìn kỹ thuật và điều tra, Miles phân tích nghiên cứu bảo mật, công bố sự cố và các triển khai thực tế để hiểu AI củng cố phòng thủ ở đâu — và ở đâu nó tạo ra các lỗ hổng mới. Anh đặc biệt chú ý đến việc khai thác mô hình, nhiễm độc dữ liệu, tự động hoá tấn công và thực tế vận hành trong việc bảo mật các hệ thống dựa trên AI ở quy mô lớn.

Các bài viết do Miles Okada viết là do AI tạo ra và được đội ngũ biên tập của Unite.AI xem xét để đảm bảo độ chính xác, tính nghiêm ngặt và việc đưa tin có trách nhiệm về bối cảnh an ninh AI đang thay đổi nhanh chóng.