โมเดลและแพลตฟอร์ม AI
OpenAI เปิดตัว GPT-Red ระบบ AI ที่พัฒนาเพื่อเสริมสร้าง GPT-5.6

OpenAI ได้เปิดตัว GPT-Red ระบบ AI ภายในที่ได้รับการฝึกฝนเพื่อโจมตีโมเดลของบริษัทเอง เพื่อเปิดเผยจุดอ่อนและสร้างข้อมูลที่สามารถใช้เพื่อเสริมสร้างโมเดลในอนาคต
GPT-Red ไม่ได้ทำงานเหมือนช่องแชทปกติ แต่ทำงานเหมือน ทีมแดง ที่ส่งคำสั่งอันตรายหรือหลอกลวงไปยังโมเดลเป้าหมาย และปรับกลยุทธ์จนกว่าจะสำเร็จหรือหมดทางโจมตี OpenAI ระบุว่าระบบนี้มุ่งเน้นไปที่ การฉีดคำสั่ง ซึ่งเป็นปัญหาความปลอดภัยที่เพิ่มขึ้นสำหรับเอเจนต์ AI ที่โต้ตอบกับอีเมล เว็บไซต์ ไฟล์ โค้ด และแอปพลิเคชันที่เชื่อมต่อ
ทำไมการฉีดคำสั่งจึงเป็นอันตรายมากขึ้น
การฉีดคำสั่งเกิดขึ้นเมื่อผู้โจมตีใส่คำสั่งภายในข้อมูลที่ระบบ AI คาดว่าจะอ่าน คำสั่งอันตรายอาจซ่อนอยู่ในอีเมล เว็บไซต์ ไฟล์ หรือซอฟต์แวร์
ระบบ AI อาจเข้าใจข้อมูลภายนอกนี้เป็นคำสั่งแท้จริง และดำเนินการตามคำสั่งนั้นแทนการทำงานตามที่ผู้ใช้ตั้งใจไว้
ปัญหานี้จะเพิ่มขึ้นเมื่อระบบ AI มีความสามารถในการดำเนินการแทนผู้ใช้ และมีการเข้าถึงข้อมูลที่สำคัญ
GPT-Red เรียนรู้ผ่านการฝึกฝนแบบตนเอง
GPT-Red ได้รับการพัฒนาโดยใช้เทคนิค การฝึกฝนแบบตนเอง โดยที่โมเดลโจมตีและโมเดลป้องกันจะปรับปรุงตนเองโดยการแข่งขันกัน
โมเดลโจมตีจะได้รับรางวัลเมื่อสามารถโจมตีโมเดลป้องกันสำเร็จ และโมเดลป้องกันจะได้รับรางวัลเมื่อสามารถป้องกันการโจมตีได้
เมื่อโมเดลป้องกันปรับปรุงตนเอง GPT-Red จะต้องค้นหาวิธีการโจมตีที่ซับซ้อนและหลากหลายมากขึ้น
GPT-Red โจมตีโมเดลของมนุษย์ได้ดีกว่า
ในการทดสอบ GPT-Red สามารถโจมตีโมเดล GPT-5.1 ได้สำเร็จใน 84% ของสถานการณ์ ในขณะที่ทีมโจมตีของมนุษย์สามารถโจมตีได้สำเร็จใน 13% ของสถานการณ์
ผลลัพธ์นี้ไม่ได้หมายความว่าทีมโจมตีของมนุษย์ไม่จำเป็นต้องมีอีกต่อไป แต่ GPT-Red มีความสามารถในการทดสอบและปรับปรุงกลยุทธ์อย่างรวดเร็ว
เครื่องขายของอัตโนมัติกลายเป็นเป้าหมายในโลกแห่งความเป็นจริง
OpenAI ทดสอบ GPT-Red กับเครื่องขายของอัตโนมัติที่สร้างโดย Andon Labs และติดตั้งในสำนักงานของ OpenAI
GPT-Red สามารถโจมตีเครื่องขายของอัตโนมัติได้สำเร็จ และสามารถลดราคาสินค้าให้ถูกกว่า 50% และสั่งซื้อสินค้าใหม่ในราคา 100 ดอลลาร์
วิธีการที่ GPT-Red เปลี่ยน GPT-5.6
GPT-Red ค้นพบเทคนิคการโจมตีใหม่ที่เรียกว่า “การโจมตีด้วยการสร้างห่วงโซ่ความคิดปลอม” ซึ่งสามารถหลอกลวงโมเดลให้เชื่อว่าคำสั่งอันตรายได้รับการตรวจสอบและอนุมัติแล้ว
เทคนิคนี้สามารถโจมตีโมเดล GPT-5.1 ได้สำเร็จใน 95% ของกรณี แต่หลังจากการฝึกฝนแบบกันเอง GPT-5.6 Sol สามารถป้องกันการโจมตีนี้ได้สำเร็จใน 90% ของกรณี
ทำไม OpenAI ไม่เปิดตัว GPT-Red
GPT-Red จะยังคงเป็นระบบภายในของ OpenAI และจะไม่เปิดตัวสู่สาธารณะ
การตัดสินใจนี้เป็นเพราะ GPT-Red มีความสามารถในการโจมตีที่สามารถใช้เพื่อประโยชน์ของผู้โจมตีได้
การโจมตีแบบอัตโนมัติยังคงมีจุดอ่อน
แม้ว่า GPT-Red จะมีความสามารถในการโจมตีที่ดี แต่ก็ยังคงมีจุดอ่อนในหลายด้าน
ระบบนี้ยังคงไม่สามารถโจมตีโมเดลที่มีการป้องกันอย่างดี และยังคงต้องการการปรับปรุงอย่างต่อเนื่อง
การแข่งขันความปลอดภัยใหม่ระหว่างผู้โจมตีและผู้ป้องกัน AI
GPT-Red เป็นตัวอย่างของการแข่งขันความปลอดภัยใหม่ระหว่างผู้โจมตีและผู้ป้องกัน AI
การแข่งขันนี้จะทำให้ระบบ AI มีความสามารถในการป้องกันตัวเองและโจมตีได้ดีขึ้น แต่ก็จะทำให้ผู้โจมตีมีความสามารถในการโจมตีได้ดีขึ้นด้วย
GPT-Red จึงเป็นเครื่องมือที่สำคัญในการพัฒนาความปลอดภัยของระบบ AI ในอนาคต












