โมเดลและแพลตฟอร์ม AI

OpenAI เปิดตัว GPT-Red ระบบ AI ที่พัฒนาเพื่อเสริมสร้าง GPT-5.6

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

OpenAI ได้เปิดตัว GPT-Red ระบบ AI ภายในที่ได้รับการฝึกฝนเพื่อโจมตีโมเดลของบริษัทเอง เพื่อเปิดเผยจุดอ่อนและสร้างข้อมูลที่สามารถใช้เพื่อเสริมสร้างโมเดลในอนาคต

GPT-Red ไม่ได้ทำงานเหมือนช่องแชทปกติ แต่ทำงานเหมือน ทีมแดง ที่ส่งคำสั่งอันตรายหรือหลอกลวงไปยังโมเดลเป้าหมาย และปรับกลยุทธ์จนกว่าจะสำเร็จหรือหมดทางโจมตี OpenAI ระบุว่าระบบนี้มุ่งเน้นไปที่ การฉีดคำสั่ง ซึ่งเป็นปัญหาความปลอดภัยที่เพิ่มขึ้นสำหรับเอเจนต์ AI ที่โต้ตอบกับอีเมล เว็บไซต์ ไฟล์ โค้ด และแอปพลิเคชันที่เชื่อมต่อ

ทำไมการฉีดคำสั่งจึงเป็นอันตรายมากขึ้น

การฉีดคำสั่งเกิดขึ้นเมื่อผู้โจมตีใส่คำสั่งภายในข้อมูลที่ระบบ AI คาดว่าจะอ่าน คำสั่งอันตรายอาจซ่อนอยู่ในอีเมล เว็บไซต์ ไฟล์ หรือซอฟต์แวร์

ระบบ AI อาจเข้าใจข้อมูลภายนอกนี้เป็นคำสั่งแท้จริง และดำเนินการตามคำสั่งนั้นแทนการทำงานตามที่ผู้ใช้ตั้งใจไว้

ปัญหานี้จะเพิ่มขึ้นเมื่อระบบ AI มีความสามารถในการดำเนินการแทนผู้ใช้ และมีการเข้าถึงข้อมูลที่สำคัญ

GPT-Red เรียนรู้ผ่านการฝึกฝนแบบตนเอง

GPT-Red ได้รับการพัฒนาโดยใช้เทคนิค การฝึกฝนแบบตนเอง โดยที่โมเดลโจมตีและโมเดลป้องกันจะปรับปรุงตนเองโดยการแข่งขันกัน

โมเดลโจมตีจะได้รับรางวัลเมื่อสามารถโจมตีโมเดลป้องกันสำเร็จ และโมเดลป้องกันจะได้รับรางวัลเมื่อสามารถป้องกันการโจมตีได้

เมื่อโมเดลป้องกันปรับปรุงตนเอง GPT-Red จะต้องค้นหาวิธีการโจมตีที่ซับซ้อนและหลากหลายมากขึ้น

GPT-Red โจมตีโมเดลของมนุษย์ได้ดีกว่า

ในการทดสอบ GPT-Red สามารถโจมตีโมเดล GPT-5.1 ได้สำเร็จใน 84% ของสถานการณ์ ในขณะที่ทีมโจมตีของมนุษย์สามารถโจมตีได้สำเร็จใน 13% ของสถานการณ์

ผลลัพธ์นี้ไม่ได้หมายความว่าทีมโจมตีของมนุษย์ไม่จำเป็นต้องมีอีกต่อไป แต่ GPT-Red มีความสามารถในการทดสอบและปรับปรุงกลยุทธ์อย่างรวดเร็ว

เครื่องขายของอัตโนมัติกลายเป็นเป้าหมายในโลกแห่งความเป็นจริง

OpenAI ทดสอบ GPT-Red กับเครื่องขายของอัตโนมัติที่สร้างโดย Andon Labs และติดตั้งในสำนักงานของ OpenAI

GPT-Red สามารถโจมตีเครื่องขายของอัตโนมัติได้สำเร็จ และสามารถลดราคาสินค้าให้ถูกกว่า 50% และสั่งซื้อสินค้าใหม่ในราคา 100 ดอลลาร์

วิธีการที่ GPT-Red เปลี่ยน GPT-5.6

GPT-Red ค้นพบเทคนิคการโจมตีใหม่ที่เรียกว่า “การโจมตีด้วยการสร้างห่วงโซ่ความคิดปลอม” ซึ่งสามารถหลอกลวงโมเดลให้เชื่อว่าคำสั่งอันตรายได้รับการตรวจสอบและอนุมัติแล้ว

เทคนิคนี้สามารถโจมตีโมเดล GPT-5.1 ได้สำเร็จใน 95% ของกรณี แต่หลังจากการฝึกฝนแบบกันเอง GPT-5.6 Sol สามารถป้องกันการโจมตีนี้ได้สำเร็จใน 90% ของกรณี

ทำไม OpenAI ไม่เปิดตัว GPT-Red

GPT-Red จะยังคงเป็นระบบภายในของ OpenAI และจะไม่เปิดตัวสู่สาธารณะ

การตัดสินใจนี้เป็นเพราะ GPT-Red มีความสามารถในการโจมตีที่สามารถใช้เพื่อประโยชน์ของผู้โจมตีได้

การโจมตีแบบอัตโนมัติยังคงมีจุดอ่อน

แม้ว่า GPT-Red จะมีความสามารถในการโจมตีที่ดี แต่ก็ยังคงมีจุดอ่อนในหลายด้าน

ระบบนี้ยังคงไม่สามารถโจมตีโมเดลที่มีการป้องกันอย่างดี และยังคงต้องการการปรับปรุงอย่างต่อเนื่อง

การแข่งขันความปลอดภัยใหม่ระหว่างผู้โจมตีและผู้ป้องกัน AI

GPT-Red เป็นตัวอย่างของการแข่งขันความปลอดภัยใหม่ระหว่างผู้โจมตีและผู้ป้องกัน AI

การแข่งขันนี้จะทำให้ระบบ AI มีความสามารถในการป้องกันตัวเองและโจมตีได้ดีขึ้น แต่ก็จะทำให้ผู้โจมตีมีความสามารถในการโจมตีได้ดีขึ้นด้วย

GPT-Red จึงเป็นเครื่องมือที่สำคัญในการพัฒนาความปลอดภัยของระบบ AI ในอนาคต

อองตวนเป็นผู้นำที่มีวิสัยทัศน์และเป็นหุ้นส่วนผู้ก่อตั้งของ Unite.AI โดยมีความหลงใหลที่ไม่สั่นคลอนในการ塑造และ推廣อนาคตของ AI และหุ่นยนต์ เขาเป็นผู้ประกอบการซีรีย์ที่เชื่อว่า AI จะมีผลกระทบต่อสังคมมากเท่ากับไฟฟ้า และมักจะพูดถึงศักยภาพของเทคโนโลยีที่เป็นนวัตกรรมและ AGI

ในฐานะ นักอนาคต เขาได้ทำการสำรวจว่านวัตกรรมเหล่านี้จะเปลี่ยนแปลงโลกของเราอย่างไร นอกจากนี้เขายังเป็นผู้ก่อตั้ง Securities.io ซึ่งเป็นแพลตฟอร์มที่มุ่งเน้นในการลงทุนในเทคโนโลยีที่ทันสมัยที่สุดซึ่งกำลังเปลี่ยนแปลงอนาคตและเปลี่ยนแปลงอุตสาหกรรมทั้งหมด