ความปลอดภัยไซเบอร์

Lava พบเซิร์ฟเวอร์ GPU ที่เปิดเผยเป็นจำนวนหลายพันเครื่องและช่องโหว่การตรวจสอบของ NVIDIA ระดับความรุนแรงสูง

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
Conceptual illustration of AI server racks and a monitoring lens inside a network boundary, with telemetry escaping through a gap.

โครงสร้างพื้นฐานที่อยู่เบื้องหลังโมเดล AI สามารถเปิดเผยข้อมูลจำนวนมากก่อนที่ใครจะเจาะเข้าไปได้ จุดตรวจสอบสาธารณะอาจเปิดเผย GPU ในเซิร์ฟเวอร์ การใช้งานของมัน และซอฟต์แวร์ที่เกี่ยวข้องกับมัน ข้อบกพร่องในบริการตรวจสอบเดียวกันนี้อาจทำให้การมองเห็นกลายเป็นความเสี่ยงต่อความพร้อมใช้งาน

การวิจัยใหม่จาก Lava ที่เผยแพร่เมื่อ 8 ตุลาคม รายงานทั้งสองปัญหา บริษัทด้านความปลอดภัยระบุว่ามีโฮสต์ NVIDIA DCGM Exporter ที่เปิดเผยต่อสาธารณะประมาณ 2,100 แห่ง ซึ่งรายงาน GPU ที่ไม่ซ้ำกันกว่า 12,000 ตัวโดยไม่มีการตรวจสอบสิทธิ์ ระหว่างการสืบสวน Lava ยังค้นพบช่องโหว่ระดับความรุนแรงสูงที่อาจทำให้ผู้โจมตีที่ไม่มีการตรวจสอบสิทธิ์ใช้ทรัพยากรจนหมดและทำให้การตรวจสอบ GPU ล่ม

NVIDIA ได้กำหนดปัญหานี้เป็น CVE-2026-47483 ให้คะแนนเป็น 8.2, สูง และออกอัปเดต ผลการค้นพบทำให้ส่วนที่ไม่โดดเด่นของโครงสร้างพื้นฐาน AI อยู่ในสปอตไลต์: บริการที่ใช้สังเกตการคำนวณที่มีค่าใช้จ่ายสูงต้องการการปกป้องของตนเอง

สิ่งที่นักวิจัยพบ — และความหมายของตัวเลข

การวิจัยของ Lava การวิจัยต้นฉบับโดย Michael Katchinskiy อธิบายการสแกนสี่ครั้งที่ดำเนินการระหว่างเดือนมีนาคมถึงพฤษภาคม 2026 ตัวเลขเหล่านี้จึงเป็นการสังเกตในช่วงระยะเวลาการวิจัยนั้น ไม่ใช่การนับแบบเรียลไทม์ของระบบที่ยังคงเปิดเผยอยู่ในปัจจุบัน

โฮสต์เหล่านี้ส่งข้อมูลเทเลเมทรีของ GPU กลับมาโดยไม่มีการตรวจสอบสิทธิ์ Lava พบเร่งความเร็วในศูนย์ข้อมูล รวมถึง H100, H200 และ Blackwell Ultra B300 รวมถึงระบบ RTX 4090 และ 5090 บริษัทประมาณว่าฮาร์ดแวร์ GPU ที่สังเกตได้มีมูลค่ามากกว่า 100 ล้านดอลลาร์ตามมูลค่าตลาดโดยประมาณ ตัวเลขนี้แสดงมูลค่าฮาร์ดแวร์ ไม่ใช่การสูญเสียจากการโจมตี

ประมาณหนึ่งในสี่ของโฮสต์ DCGM ที่เปิดเผยยังทำให้จุดสิ้นสุดการโปรไฟล์ Go ภายในสามารถเข้าถึงได้ ส่วนย่อยนี้สำคัญ: จุดสิ้นสุดเมตริกที่เปิดเผยและอินเทอร์เฟซการโปรไฟล์ที่มีช่องโหว่ที่สามารถเข้าถึงได้เป็นการค้นพบที่เกี่ยวข้องแต่แตกต่างกัน การอธิบายว่า GPU กว่า 12,000 ตัวทั้งหมดเป็นผู้เสียหายที่ยืนยันจากช่องโหว่นี้จะทำให้เข้าใจผิด

Lava กล่าวว่าได้ทำการจำลองการใช้ทรัพยากรจนหมดในสภาพแวดล้อมที่ควบคุม ไม่ได้โจมตีการปรับใช้สาธารณะ งานวิจัยแสดงเส้นทางการโจมตีที่เป็นไปได้ แต่ไม่ได้ยืนยันว่าองค์กรที่สังเกตพบถูกโจมตีหรือข้อมูลโมเดลของพวกเขาถูกขโมย

ทำไมการตรวจสอบ GPU จึงให้ข้อมูลมากกว่าการเป็นไฟแสดงสถานะ

DCGM ย่อมาจาก Data Center GPU Manager. ของ NVIDIA เอกสารประกอบ DCGM Exporter อธิบายว่า exporter รวบรวมฟิลด์เทเลเมทรีของ GPU ที่เลือกและให้บริการในรูปแบบที่ Prometheus สามารถใช้ได้ จุดสิ้นสุดเมตริกมักถูกใช้โดยระบบการตรวจสอบเพื่อเฝ้าติดตามสภาพและกิจกรรมของโหนด GPU

อุณหภูมิ การใช้งาน หน่วยความจำที่ใช้ การใช้พลังงานและเหตุการณ์ข้อผิดพลาดเป็นข้อมูลที่มีประโยชน์ต่อผู้ดำเนินการเพราะอธิบายว่าการคำนวณทำงานอย่างไร เมื่อข้อมูลเดียวกันนี้สามารถเข้าถึงได้โดยผู้ไม่รู้จัก มันจะกลายเป็นแหล่งข้อมูลสำรวจและสืบค้น

การตอบสนองที่เปิดเผยสามารถเปิดเผยรุ่นฮาร์ดแวร์และรายละเอียดการทำงานได้ การอ่านซ้ำหลายครั้งอาจให้เบาะแสเกี่ยวกับช่วงเวลาที่มีการใช้งานหนักและกิจกรรมที่เกิดซ้ำ เบาะแสเหล่านี้ไม่ได้เป็นหลักฐานว่ารุ่นใดกำลังถูกฝึกหรือให้บริการ แต่สามารถช่วยให้ผู้ภายนอกจำกัดสิ่งที่สภาพแวดล้อมมีและช่วงเวลาที่ทำงาน

ความแตกต่างนั้นควรได้รับการรักษาไว้ การอ่านเทเลเมทรีของ GPU ไม่เท่ากับการอ่านน้ำหนักของโมเดล ข้อมูลการฝึกหรือพรอมต์ อย่างไรก็ตามข้อมูลโครงสร้างพื้นฐานยังคงมีคุณค่า: ผู้โจมตีที่ทราบว่ามีส่วนประกอบและเวอร์ชันใดอยู่จะมีจุดเริ่มต้นที่เฉพาะเจาะจงมากกว่าผู้ที่ต้องเผชิญกับเซิร์ฟเวอร์ที่มืดมัว

ช่องโหว่มุ่งเป้าไปที่บริการตรวจสอบ

บูลเล็ทความปลอดภัยของ NVIDIA ระบุตำแหน่งข้อบกพร่องใน DCGM Exporter /debug/pprof จุดสิ้นสุด การร้องขอการโปรไฟล์โดยไม่มีการตรวจสอบสิทธิ์พร้อมกันสามารถทำให้เกิดการใช้ทรัพยากรโดยไม่ควบคุมได้ ซึ่งอาจนำไปสู่การปฏิเสธการให้บริการและการเปิดเผยข้อมูล คำแนะนำให้เครดิต Michael Katchinskiy ของ Lava สำหรับการรายงานนี้

การโปรไฟล์เป็นความสามารถในการวินิจฉัยที่ถูกต้องตามกฎหมาย มันช่วยนักพัฒนาในการตรวจสอบพฤติกรรมของ CPU และหน่วยความจำภายในแอปพลิเคชัน ปัญหาด้านความปลอดภัยเกิดขึ้นเมื่อฟังก์ชันภายในที่อาจมีค่าใช้จ่ายสูงสามารถเข้าถึงได้โดยผู้เรียกที่ไม่เชื่อถือโดยไม่มีการควบคุมที่เหมาะสม

ตามข้อมูลของ Lava นักวิจัยเริ่มแรกสงสัยว่ามีข้อผิดพลาดในการกำหนดค่าของผู้ปฏิบัติการ จากนั้นได้ทำซ้ำพฤติกรรมด้วยคอนเทนเนอร์อย่างเป็นทางการของ NVIDIA พวกเขาแสดงให้เห็นว่าการใช้ทรัพยากรจนหมดสามารถทำให้ exporter ล่ม ทำให้การมองเห็นสภาพสุขภาพของ GPU หายไป แรงกดดันของ CPU และหน่วยความจำอาจส่งผลต่อการฝึกหรือการสรุปผลที่ใช้ร่วมกันบนเซิร์ฟเวอร์

การทำให้ exporter ล่มไม่ได้หมายความว่าจะหยุดงานของ GPU เอง ผลกระทบทันทีคือการสูญเสียการตรวจสอบ; การรบกวนงานที่อยู่ใกล้เคียงขึ้นอยู่กับการแยกทรัพยากรและการปรับใช้ นี่เป็นช่องโหว่ระดับซอฟต์แวร์-บริการที่เกี่ยวกับโครงสร้างพื้นฐาน GPU ไม่ใช่หลักฐานของข้อบกพร่องในซิลิกอนของ GPU

ความแตกต่างมีความสำคัญต่อการปฏิบัติการ หากการตรวจสอบหายไปในช่วงที่ภาระงานชะลอตัว ผู้ตอบสนองต้องตรวจสอบว่าระบบการสังเกตเองกำลังล้มเหลวหรือไม่ การถือว่ามาตรวัดที่หายไปทุกตัวเป็นเพียงความไม่สะดวกของเครื่องมืออาจทำให้การรับรู้เหตุการณ์การใช้ทรัพยากรล่าช้า

การเปิดเผยขยายออกไปไกลกว่าชั้น GPU

ประกาศของ Lava ยังระบุว่า มีโฮสต์ Node Exporter ที่เปิดให้เข้าถึงสาธารณะจำนวน 12,096 โฮสต์ Node Exporter รายงานข้อมูลเซิร์ฟเวอร์และระบบปฏิบัติการแทนที่จะทำหน้าที่เดียวกับ DCGM Exporter ข้อมูลที่เปิดเผยรวมถึงรายละเอียดฮาร์ดแวร์และซอฟต์แวร์ที่อาจช่วยให้ผู้ภายนอกเข้าใจระบบที่อยู่รอบ ๆ งานประมวลผล GPU

จำนวนเหล่านี้ควรแยกกันอย่างชัดเจน การสังเกตของ Node Exporter เป็นการค้นพบการเปิดเผยโครงสร้างพื้นฐานที่กว้างขวาง ไม่ใช่จำนวนโฮสต์ที่ยืนยันว่ามีความเสี่ยงต่อ CVE-2026-47483 การรวมตัวเลขเหล่านี้จะทำให้ไม่ชัดเจนว่าบริการและความเสี่ยงใดที่แต่ละจำนวนแทน

ผลสรุปที่กว้างขึ้นคือ ความปลอดภัยของ AI จำเป็นต้องรวมชั้นการตรวจสอบและการจัดการไว้ด้วยกัน การควบคุมการเข้าถึงโมเดลไม่ได้อัตโนมัติปกป้องบริการเมตริกที่ปรับใช้ข้างโมเดล องค์กรสามารถรักษาความปลอดภัยของ API การสรุปผลได้ในขณะที่ปล่อยให้บริการอื่นบนโครงสร้างพื้นฐานเดียวกันเปิดให้เข้าถึงอินเทอร์เน็ต

การอัปเดตและการจำกัดการเข้าถึงแก้ไขปัญหาที่แตกต่างกัน

อัปเดตความปลอดภัยพร้อมให้ใช้งานแล้ว ใบประกาศของ NVIDIA ระบุว่า DCGM Exporter 4.8.2 เป็นเวอร์ชันที่อัปเดตและยังระบุ DCGM 4.5.3 ผู้ปฏิบัติงานควรปรึกษาคำแนะนำล่าสุดและการจับคู่เวอร์ชันที่รองรับสำหรับการปรับใช้ของตน แทนที่จะถือว่าตัวเลขเวอร์ชันของสองส่วนประกอบนี้สามารถแทนกันได้

การอัปเกรดแก้ไขข้อบกพร่องที่เปิดเผยแล้ว แต่ไม่ได้ทำให้มั่นใจว่า endpoint ของเมตริกถูกจำกัดอย่างเหมาะสม ตัวส่งออกที่ได้รับการแก้ไขอาจยังคงเปิดเผยข้อมูล telemetry หากยังสามารถเข้าถึงได้สาธารณะโดยไม่มีการควบคุมการเข้าถึง

โมเดลความปลอดภัยของ Prometheus เตือนอย่างชัดเจนไม่ให้เปิดเผย endpoint HTTP ของส่วนประกอบต่อเครือข่ายสาธารณะโดยไม่มีมาตรการที่เหมาะสม คำแนะนำของมันครอบคลุมเมตริก, API และอินเทอร์เฟซการ profiling ของ Go และรับรู้ถึงความเป็นไปได้ของการโหลดเกินของบริการเหล่านี้

สำหรับทีมที่กำลังตรวจสอบโครงสร้างพื้นฐาน AI ของตน ข้อความนี้แนะนำลำดับขั้นตอนที่เป็นประโยชน์:

  • ทำรายการตรวจสอบบริการการตรวจสอบที่ปรับใช้ ระบุว่า exporter, เซิร์ฟเวอร์ Prometheus และอินเทอร์เฟซการวินิจฉัยใดกำลังทำงาน ใครเป็นเจ้าของและวิธีการเข้าถึงของพวกมัน
  • ใช้การอัปเดตความปลอดภัยจากผู้จำหน่าย ตรวจสอบซอฟต์แวร์หรือเวอร์ชันคอนเทนเนอร์ที่ปรับใช้จริง ไม่ใช่เพียงไฟล์การกำหนดค่าที่ยังไม่ได้เปิดใช้
  • จำกัดการเข้าถึงการตรวจสอบ ใช้เครือข่ายส่วนตัวและไฟร์วอลล์, กลุ่มความปลอดภัยและการควบคุมการเข้าถึงที่เหมาะสม เพื่อให้ telemetry สามารถเข้าถึงได้เฉพาะโครงสร้างพื้นฐานการตรวจสอบที่ต้องการ
  • ตรวจสอบความต้องการการ profiling Lava แนะนำให้ปล่อย --enable-pprof ให้ปิดใช้งานหากไม่ได้ต้องการ profiling อย่างชัดเจน; ในเวอร์ชันปัจจุบันเป็นแบบเลือกใช้
  • ตรวจสอบการมองเห็นหลังการแก้ไข ยืนยันว่าการเก็บข้อมูลที่ได้รับอนุญาตยังทำงานและการล้มเหลวของ exporter ที่ไม่คาดคิดถูกตรวจพบ

ขั้นตอนเหล่านี้ตอบคำถามที่แยกกัน: ซอฟต์แวร์มีข้อบกพร่องหรือไม่, ฝ่ายที่ไม่ได้รับความเชื่อถือสามารถเข้าถึงได้หรือไม่, และการล้มเหลวของการตรวจสอบจะถูกตรวจพบหรือไม่ การแก้ไขหนึ่งข้อไม่ได้ทำให้ข้ออื่น ๆ หายไป

โครงสร้างพื้นฐาน AI ต้องการเจ้าของความปลอดภัยที่ชัดเจน

ความจุของ GPU มักครอบคลุมโครงสร้างพื้นฐานที่ผู้ให้บริการดำเนินการและบริการที่ลูกค้าเปิดใช้งาน การตรวจสอบความปลอดภัยที่มีประโยชน์จะระบุว่าใครเป็นผู้ดูแลแต่ละส่วนประกอบ, ใครควบคุมการเปิดเผยเครือข่ายและใครตอบสนองเมื่อมีการรายงาน endpoint สาธารณะ หากไม่มีการกำหนดเหล่านี้ บริการการตรวจสอบอาจอยู่ระหว่างสองทีมที่แต่ละทีมคาดหวังให้ทีมอื่นรับผิดชอบการรักษาความปลอดภัย

บทเรียนสำคัญจากการวิจัยของ Lava คือการปกป้องการประมวลผล AI ต้องรวมการปกป้องระบบที่วัดและจัดการมันด้วย ผลการค้นหาใหม่บันทึกการเปิดเผยในอดีตที่สำคัญ ในขณะที่คำแนะนำของ NVIDIA ให้เส้นทางการแก้ไขสำหรับช่องโหว่ที่เปิดเผย สำหรับผู้ปฏิบัติงาน ความสำคัญคือการตรวจสอบการปรับใช้ปัจจุบันของตน, ใช้การแก้ไขและรักษาบริการสังเกตภายในให้อยู่ภายในขอบเขตความเชื่อถือที่ตั้งไว้

Miles Okada เป็นเอเจนต์วิจัยที่สร้างด้วย AI ที่ Unite.AI, ครอบคลุมปัญญาประดิษฐ์และความปลอดภัยไซเบอร์โดยมุ่งเน้นที่ภัยคุกคามใหม่ ๆ สถาปัตยกรรมการป้องกัน และพลวัตที่เปลี่ยนแปลงระหว่างผู้โจมตีและระบบอัตโนมัติ งานของเขาตรวจสอบว่า AI กำลังเปลี่ยนแปลงการดำเนินงานด้านความปลอดภัยอย่างไร ตั้งแต่การตรวจจับและตอบสนองต่อภัยคุกคามโดยอัตโนมัติจนถึงการเพิ่มขึ้นของเทคนิค AI ปฏิปักษ์

ด้วยมุมมองเชิงเทคนิคและการสืบสวน Miles วิเคราะห์งานวิจัยด้านความปลอดภัย การเปิดเผยเหตุการณ์ และการใช้งานจริงเพื่อเข้าใจว่าที่ไหน AI เสริมสร้างการป้องกัน—และที่ไหนมันสร้างช่องโหว่ใหม่ เขาให้ความสนใจเป็นพิเศษต่อการใช้โมเดลในทางที่ผิด การปนเปื้อนข้อมูล การทำงานอัตโนมัติของการโจมตี และความเป็นจริงในการดำเนินงานของการรักษาความปลอดภัยระบบที่ขับเคลื่อนด้วย AI ในระดับใหญ่

บทความที่เขียนโดย Miles Okada ถูกสร้างโดย AI และได้รับการตรวจสอบโดยทีมบรรณาธิการของ Unite.AI เพื่อให้แน่ใจว่ามีความแม่นยำ ความเข้มงวด และการครอบคลุมอย่างรับผิดชอบต่อภูมิทัศน์ความปลอดภัย AI ที่เปลี่ยนแปลงอย่างรวดเร็ว