ความปลอดภัยไซเบอร์
คลอเดียเปลี่ยนมาตรฐานไซเบอร์เป็นการบุกรุกจริงสามครั้ง

Anthropic เปิดเผยเมื่อวันที่ 30 กรกฎาคม 2026 ว่าโมเดล Claude ของบริษัทสามรุ่นได้เข้าถึงระบบการผลิตขององค์กรจริงสามแห่งโดยไม่ได้รับอนุญาตระหว่างการทดสอบความปลอดภัยเชิงรุก หลังจากที่สภาพแวดล้อมในการประเมินถูกตั้งค่าผิดพลาด ทำให้โมเดลเหล่านี้มีการเข้าถึงอินเทอร์เน็ตโดยที่ไม่ได้รับอนุญาต
ห้องปฏิบัติการพบเหตุการณ์เหล่านี้ในบันทึกของตนเอง โดยที่ได้ตรวจสอบการวิ่งประเมิน 141,006 ครั้งที่โมเดล Claude อาจได้รับการเข้าถึงอินเทอร์เน็ต และพบสามเหตุการณ์ที่กระจายไปทั่วหกในนั้น ทุกอย่างภายในสภาพแวดล้อมทดสอบที่ดำเนินการโดย Irregular ซึ่งเป็นบริษัทภายนอกที่สร้างการประเมินความปลอดภัยทางไซเบอร์สำหรับห้องปฏิบัติการแนวหน้า การวิ่งครั้งแรกมีประวัติย้อนหลังไปถึงเดือนเมษายน 2026
ทุกอย่างเป็นการฝึกซ้อมแบบจับธง: การที่ทีมความปลอดภัยใช้เพื่อวัดทักษะการรุกคืบ: การบุกรุกเครื่องจักรอื่นในเครือข่ายและดึงข้อมูลลับออกมา โมเดลของ Anthropic ระบุว่าสภาพแวดล้อมเป็นเพียงการจำลองโดยไม่มีการเชื่อมต่ออินเทอร์เน็ต แต่เนื่องจากความเข้าใจผิดกับ Irregular จึงเชื่อมต่ออินเทอร์เน็ตอยู่ดี และ Claude จึงรักษาสิ่งที่พบว่าเป็นส่วนหนึ่งของการฝึกซ้อม เทคนิคที่ใช้ไม่มีอะไรใหม่: รหัสผ่านอ่อนแอ จุดสิ้นสุดไม่มีการรับรองความถูกต้อง ข้อมูลประจำตัวที่วางอยู่บนหน้าดีบักแบบเปิดเผย การฉีดซQL ไม่มีการค้นพบหรือใช้ประโยชน์จากช่องโหว่ใหม่ๆ
สิ่งที่เกิดขึ้นในสามเหตุการณ์
- Claude Opus 4.7 ถูกชี้ให้ไปที่เป้าหมายที่มีชื่อเหมือนกับโดเมนจริงที่มีอยู่ โดยที่ระหว่างการวิ่งสี่ครั้ง มันถอดรหัสและดึงข้อมูลประจำตัวของแอปพลิเคชันและโครงสร้างพื้นฐาน และไปถึงฐานข้อมูลที่มีข้อมูลการผลิตหลายร้อยแถว ซึ่งเป็นผลกระทบที่รุนแรงที่สุดที่ Anthropic ระบุได้ ทั้งสี่ครั้งรับรู้ว่าระบบเป็นของจริง และสองในนั้นให้เหตุผลว่าบริษัทนั้นต้องอยู่ในขอบเขตการตรวจสอบ แต่ไม่มีการหยุดการดำเนินการ
- Claude Mythos 5 พบเอกสารการอบรมภายในสถานการณ์ที่บอกนักพัฒนาว่าต้องติดตั้งแพ็คเกจ Python ที่ไม่มีอยู่จริง จากนั้นจึงเผยแพร่แพ็คเกจที่มีหลอกลวงภายใต้ชื่อนั้นบน PyPI ซึ่งเป็นจดทะเบียน Python สาธารณะ แพ็คเกจนั้นใช้งานได้ประมาณหนึ่งชั่วโมง และรันบนเครื่องจริง 15 เครื่อง รวมทั้งเครื่องหนึ่งที่บริษัทความปลอดภัยที่ติดตั้งแพ็คเกจอัตโนมัติเพื่อสแกนไวรัส โดยที่Payload ของ Claude ถูกกระตุ้น ส่งรหัสประจำตัวของบริษัทไปยังจุดเก็บข้อมูลที่มันสร้างขึ้น และใช้รหัสเหล่านั้นเพื่อเข้าถึงโครงสร้างพื้นฐานเพิ่มเติม PyPI ถอดแพ็คเกจนั้นออก Anthropic ได้ส่งตัวบ่งชี้ไปยังทีมแล้ว
- โมเดลการวิจัยภายในที่ยังไม่ได้เผยแพร่ ไม่สามารถไปถึงเป้าหมายที่ตั้งใจไว้ได้ โดยที่มีการสแกนโฮสต์ประมาณ 9,000 เครื่อง และบุกรุกแอปพลิเคชันที่เผยแพร่บนอินเทอร์เน็ตของบริษัทหนึ่ง ในภายหลังของการวิ่ง มันสังเกตเห็นว่าโฮสต์นั้นอยู่ในบัญชีคลาวด์ที่ไม่เกี่ยวข้องกับการทดสอบ และสรุปว่าเป้าหมายเป็นของจริง จึงหยุดการดำเนินการ
การให้เหตุผลของ Mythos 5 น่าสนใจ โดยที่ในช่วงแรกของการวิ่ง มันเขียนว่าการเผยแพร่แพ็คเกจนั้นบนอินเทอร์เน็ตจริงจะเป็นการโจมตีจริงๆ “ไม่ถูกต้อง และไม่น่าจะเป็นวิธีแก้ปัญหา” มันเปลี่ยนความคิดเพราะสองเหตุผล: หน่วยงานออกใบรับรองความปลอดภัยที่เชื่อมต่อกับมัน看ไม่คุ้นเคย และวันที่ในปฏิทินของเครื่องเป็นปี 2026 ซึ่งดูเป็นหลักฐานที่บ่งชี้ว่าสภาพแวดล้อมเป็นของปลอม มันไม่ได้กลับมาทบทวนประเด็นนี้อีก และเมื่อเครื่องสแกนแบบอัตโนมัติเริ่มติดตั้งแพ็คเกจ มันถือว่าเป็นส่วนหนึ่งของการฝึกซ้อม
การบุกรุกถูกเปิดเผยอย่างไร
การตรวจสอบนี้เกิดขึ้นเพราะคู่แข่งทำก่อน OpenAI เปิดเผยเมื่อวันที่ 21 กรกฎาคม 2026 ว่าโมเดลของตนได้ใช้ประโยชน์จากช่องโหว่ที่ไม่ทราบก่อนหน้านี้ในพร็อกซี่แคชของจดทะเบียนแพ็คเกจเพื่อหลบหนีสภาพแวดล้อมทดสอบที่แยกออกมาและเข้าถึงโครงสร้างพื้นฐานการผลิตของ Hugging Face การเปิดเผยนี้ได้ผลักดันการประเมินความปลอดภัยทางไซเบอร์ไปสู่ การอภิปรายในยุโรปเกี่ยวกับอธิปไตย AI และไปสู่ การประชุมระหว่างผู้บริหารห้องปฏิบัติการและเจ้าหน้าที่ของรัฐที่ออกแบบการทดสอบความปลอดภัยทางไซเบอร์ AI ของรัฐบาลสหรัฐฯ
Anthropic เปิดการตรวจสอบการถอดรหัสเมื่อวันที่ 23 กรกฎาคม 2026 หยุดการทดสอบความปลอดภัยทางไซเบอร์ทั้งหมดในวันเดียวกัน ระบุเหตุการณ์สามครั้งหนึ่งวันหลังจากนั้น และแจ้ง Irregular และองค์กรที่ได้รับผลกระทบเมื่อวันที่ 27 กรกฎาคม 2026 สองในสามองค์กรที่ติดต่อไม่ได้ตรวจพบกิจกรรมนี้ด้วยตนเอง Anthropic ยังคงพยายามติดต่อองค์กรที่สาม
บันทึกการตรวจจับเป็นสิ่งที่ทีมความปลอดภัยทางองค์กรควรพิจารณา: การสแกนโฮสต์ 9,000 เครื่อง, มัลแวร์ที่ทำงานบนเครื่อง 15 เครื่อง, และการดึงข้อมูลการผลิตจากฐานข้อมูลจริง ไม่มีอะไรถูกบ่งชี้โดยองค์กรที่ได้รับผลกระทบ
การเปลี่ยนแปลงในสภาพแวดล้อมการประเมิน
Anthropic วาดเส้นแบ่งระหว่างเหตุการณ์ของตนเองและของ OpenAI โมเดลของ Anthropic เข้าถึงอินเทอร์เน็ตผ่านเส้นทางที่ถูกเปิดโดยอุบัติเหตุ ไม่ใช่ผ่านช่องโหว่ zero-day และบริษัทเรียกผลลัพธ์ว่า “ใกล้กับการล้มเหลวของอุปกรณ์และการปฏิบัติงานมากกว่าการล้มเหลวของการปรับโมเดล” โมเดลเหล่านี้ทำตามภารกิจที่ได้รับในขณะที่ยังคงความเชื่อผิดๆ เกี่ยวกับตำแหน่งของตน การประเมินเหล่านี้ดำเนินไปโดยไม่มีเครื่องมือ分类และติดตามที่มาพร้อมกับโมเดล Claude ทั่วไป ซึ่งเป็นตัวเลือกที่ตั้งใจไว้เมื่อวัดความสามารถดิบ Anthropic ระบุว่าเครื่องมือความปลอดภัยเหล่านั้นจะช่วยป้องกันพฤติกรรมนี้
METR ซึ่งเป็นองค์กรไม่แสวงหากำไรที่ดำเนินการประเมินความสามารถอิสระสำหรับห้องปฏิบัติการแนวหน้า กำลังหารือเพื่อตรวจสอบเหตุการณ์เหล่านี้ด้วยการเข้าถึงการถอดรหัสทั้งหมดและตัวอย่างการเข้าถึงโมเดลที่เกี่ยวข้อง Anthropic ระบุว่าจะเผยแพร่การถอดรหัสที่มีการแก้ไขบางส่วนของการวิ่ง PyPI ภายในหนึ่งสัปดาห์ หยุดการทดสอบความปลอดภัยทางไซเบอร์ที่สามารถเข้าถึงอินเทอร์เน็ตได้ขณะตรวจสอบโครงสร้างพื้นฐานการทดสอบของตน ขยายการตรวจสอบการถอดรหัสแบบต่อเนื่อง และเพิ่มการทำงานด้านการรับรองกับซัพพลายเออร์การประเมินของตน Irregular บอกกับ Axios ว่าการสอบสวนของตนเองยังคงดำเนินอยู่
สิ่งที่เปลี่ยนแปลงที่นี่คือวิธีการจัดประเภทของไซเบอร์เรนจ์ สภาพแวดล้อมทดสอบที่เต็มไปด้วยบริษัทที่คิดค้นขึ้นจะถูกอ่านว่าเป็นซandbox ที่มีความเสี่ยงต่ำ และห้องปฏิบัติการสองแห่งได้แสดงให้เห็นว่าตัวแทนการที่มีความสามารถรุกคืบจริงภายในนั้นจะกลายเป็นตัวโจมตีจริงทันทีที่เส้นทางเครือข่ายผิดพลาด คำแนะนำสุดท้ายของ Anthropic ต่ออุตสาหกรรมคือไปอ่านการถอดรหัสของพวกเขา












