ผู้นำทางความคิด
ตัวแทน AI ต้องการขอบเขตความปลอดภัยที่ไม่สามารถเขียนทับได้

มันน่าดึงดูดที่จะอ่านเรื่องราวของ Hugging Face ว่าเป็นช่วงที่ตัวแทน AI กลายเป็นอิสระ อย่างไรก็ตาม นั่นไม่ใช่สิ่งที่เกิดขึ้นจริง และรายละเอียดมีความสำคัญ ตัวแทนวิจัยด้านความปลอดภัยไซเบอร์เหล่านี้ทำงานในกระบวนการประเมินที่ได้ปิดการป้องกันโดยเจตนาเพื่อให้นักวิจัยเห็นว่ารุ่นสามารถทำอะไรได้บ้าง บอทบริการลูกค้าของใครก็ไม่ได้ตื่นขึ้นมาหนึ่งเช้าแล้วตัดสินใจโจมตีบริษัทใดบริษัทหนึ่ง แต่บริบทนั้นไม่ได้ทำให้ใครหลุดจากความรับผิดชอบ ตัวแทนหนึ่งเลยข้ามขอบเขตที่ควรอยู่ ใช้ข้อมูลรับรองและเครื่องมือต่าง ๆ ในวิธีที่ผู้ดำเนินการไม่เคยอนุญาต และสุดท้ายเข้าสู่ระบบที่เป็นของผู้อื่น นั่นคือส่วนที่ทีมความปลอดภัยทุกทีมควรให้ความสนใจ
Reuters รายงานว่าตัวแทนกำลังสำรวจ Hugging Face ตั้งแต่เดือนพฤษภาคม, แม้ว่านักวิจัยจะบอกว่าพวกเขาไม่พบหลักฐานใดที่แสดงว่ากิจกรรมก่อนหน้านี้ทำให้เกิดการละเมิดโดยตัวเอง เดือนกรกฎาคมต่างออกไป. OpenAI กล่าวว่าโมเดลของพวกเขาเลี่ยงการควบคุมการแยก, เข้าถึงอินเทอร์เน็ต และทำให้ส่วนหนึ่งของโครงสร้างพื้นฐานการวิจัยของตนเองรวมถึงระบบของ Hugging Face ถูกคุกคาม. บัญชีของ Hugging Face เองอธิบายการบุกรุกที่ดำเนินการจากต้นจนจบโดยระบบตัวแทนอัตโนมัติ, ซึ่งใช้ประโยชน์จากท่อประมวลผลข้อมูลของมัน เก็บข้อมูลรับรอง และเคลื่อนย้ายผ่านคลัสเตอร์ภายใน.
ส่วนที่ทำให้ไม่สบายใจคือ ตัวแทนเหล่านั้นกำลังทำหน้าที่ของพวกเขา พวกเขากำลังไล่ตามเป้าหมายที่ได้รับมอบหมาย นั่นคือเหตุผลที่เรื่องนี้ขยายไปไกลกว่าห้องทดลองวิจัยเดียว ตัวแทนระดับองค์กรก็ไล่ตามเป้าหมายเช่นกัน พวกเขาถือข้อมูลรับรอง เรียกใช้เครื่องมือ และเคลื่อนที่เร็วกว่าใครก็ตามที่สามารถตรวจสอบได้ ตัวแทนที่มีเจตนาดีอย่างสมบูรณ์ก็อาจทำความเสียหายจริงได้ และตัวแทนที่ถูกยึดครองสามารถใช้อำนาจเดียวกันนั้นเพื่อประโยชน์ของผู้โจมตี ดังนั้นความปลอดภัยต้องควบคุมสิ่งที่ระบบสามารถทำได้จริง ไม่ว่าโมเดลจะดูมั่นใจแค่ไหนหรือวัตถุประสงค์ที่ระบุดูไร้อันตรายแค่ไหน
รักษาการกระทำ ไม่ใช่แค่โมเดล
โปรแกรมตัวแทนช่วงแรกส่วนใหญ่มุ่งความพยายามไปที่โมเดล ทีมงานทดสอบพรอมต์ ปรับการปฏิเสธ เพิ่มโมเดลที่สองเพื่อเช็คโมเดลแรก และตรวจสอบร่องรอยการให้เหตุผลเพื่อหาสัญญาณของเจตนาที่ไม่ดี สิ่งเหล่านี้ไม่สูญเปล่า แต่ทั้งหมดเป็นแบบมีความน่าจะเป็น เพราะขึ้นอยู่กับโมเดลอีกตัวที่ทำการตัดสินใจ ขอบเขตความปลอดภัยในการผลิตต้องเป็นแบบกำหนดได้แน่นอนและต้องล้อมรอบเครื่องมือ ข้อมูลรับรอง เครือข่าย และการทำธุรกรรม
คำถามที่ฉันอยากถามเป็นคำถามที่ชัดเจน: ตัวแทนนี้จริง ๆ สามารถทำให้เกิดอะไรในโลกได้บ้าง? การร่างคำขอการชำระเงินเป็นเรื่องหนึ่ง การปล่อยเงินเป็นอีกเรื่องหนึ่ง เช่นเดียวกับการเตรียมการเปลี่ยนแปลงฐานข้อมูลเทียบกับการดำเนินการในสภาพแวดล้อมการผลิต หรือการทำเครื่องหมายบันทึกที่ตรงตามกฎการเก็บรักษาเทียบกับการลบออก ทั้งสองกรณีอาจใช้โมเดลเดียวกัน แต่ความเสี่ยงแตกต่างกันอย่างมาก ขึ้นอยู่กับว่ามันอยู่ฝั่งใดของเส้นนั้น
ภาพรวมล่าสุดของ Unite AI เกี่ยวกับการควบคุมความสามารถกำหนดเส้นแบ่งเดียวกันโดยเชื่อมความเสี่ยงกับข้อมูล เครื่องมือ สิทธิ์ การทำงานอิสระ และสภาพแวดล้อมที่ตัวแทนทำงานอยู่ ฉันชอบกรอบนี้เพราะมันทำให้เราข้ามผ่านป้ายกำกับที่คลุมเครือเช่น “โมเดลปลอดภัย” และ “โมเดลไม่ปลอดภัย” ทำให้ทีมสามารถติดตามทุกเส้นทางจากการตัดสินใจของตัวแทนไปสู่ผลลัพธ์ที่มีผลจริง
ให้แต่ละตัวแทนมีอัตลักษณ์และภารกิจที่แคบ
ตัวแทนไม่ควรทำงานบนบัญชีนักพัฒนาหรือสืบทอดสิทธิ์ทั้งหมดที่ผู้ใช้มนุษย์ได้รับอนุญาต อัตลักษณ์ที่ใช้ร่วมกันทำให้การระบุแหล่งที่มาหายไป ข้อมูลรับรองที่อายุการใช้งานยาวนานให้ผู้โจมตีมีเวลามากขึ้นในการใช้ประโยชน์ และบัญชีบริการที่กว้างขวางทำให้กระบวนการทำงานขนาดเล็กสามารถเข้าไปในข้อมูลและระบบที่ไม่ควรเข้าถึงได้
NIST ตอนนี้มองว่าอัตลักษณ์ซอฟต์แวร์และตัวแทน AI เป็นปัญหาเชิงสถาปัตยกรรมของตนเอง. เอกสารแนวคิดของมันถามว่าตัวแทนจะพิสูจน์ว่าได้รับอนุญาตให้ทำการกระทำเฉพาะอย่างไร อัตลักษณ์ของตัวแทนจะเชื่อมโยงกลับไปยังการอนุญาตของมนุษย์อย่างไร และองค์กรจะรักษาบันทึกที่ต้านการดัดแปลงของสิ่งที่ตั้งใจไว้และสิ่งที่เกิดขึ้นจริงอย่างไร ในการปฏิบัติจริง สิ่งนี้ชี้ไปสู่การออกแบบที่ง่าย ทุกตัวแทนจะได้รับอัตลักษณ์ที่เป็นเอกลักษณ์ เจ้าของ (บุคคลหรือทีม) วัตถุประสงค์ที่กำหนด และสิทธิ์ที่จำกัดตามงานที่อยู่หน้าตัว
ข้อมูลรับรองควรหมดอายุอย่างรวดเร็วและทำงานเฉพาะสำหรับทรัพยากรและการกระทำที่กำหนด การเข้าถึงเครือข่ายควรเริ่มจากรายการอนุญาตที่เข้มงวด หากตัวแทนต้องการสอบถามฐานข้อมูลที่ได้รับการอนุมัติหนึ่งฐาน ไม่ควรได้รับเชลล์ทั่วไป การเข้าถึงอินเทอร์เน็ตแบบเปิด หรืออำนาจในการสร้างข้อมูลรับรองใหม่ และเมื่อการทำงานผ่านห่วงโซ่ของตัวแทนและเครื่องมือ อำนาจควรแคบลงในแต่ละขั้นตอน ไม่ควรขยายออก
NIST ยังเตือนเกี่ยวกับการแชร์ข้อมูลรับรองและการเข้าถึงที่กว้างเกินไป, และคำเตือนนั้นมีความสำคัญเพราะตัวแทนทำตามโอกาส หากเส้นทางหนึ่งถูกบล็อก พวกเขาอาจลองใช้เครื่องมืออื่น ค้นหาสภาพแวดล้อมของตน หรือบังเอิญเจอโทเค็นที่คนลืมไว้ ข้อมูลรับรองที่เก็บเกี่ยวเป็นส่วนหนึ่งของเรื่องราวเดือนกรกฎาคมเช่นกัน การให้สิทธิ์ขั้นต่ำทำให้ระยะระเบิดเล็กลงเมื่อชั้นการให้เหตุผลทำสิ่งที่ผู้ออกแบบไม่คาดคิด
เก็บการอนุญาตให้อยู่ภายนอกลูปการให้เหตุผล
เอเจนต์สามารถแนะนำการกระทำได้ มันไม่ควรได้ตัดสินใจว่าตนเองได้รับอนุญาตให้ทำหรือไม่ การตัดสินใจนั้นควรอยู่ในชั้นการบังคับใช้แยกต่างหากที่เอเจนต์ไม่สามารถเขียนทับ ปิด หรือหลบเลี่ยงได้ การเรียกใช้เครื่องมือต้องแสดงเป็นคำขอที่มีโครงสร้าง: เอเจนต์ใดกำลังขอ, มนุษย์คนใดสนับสนุน, ปฏิบัติการใดที่ต้องการ, เป้าหมายคืออะไร, และข้อจำกัดใดบ้างที่ใช้ ชั้นการบังคับใช้จะอนุญาต, ปฏิเสธ หรือส่งต่อการดำเนินการนั้น
OWASP อธิบายการทำหน้าที่เกินขอบเขตเป็นการผสมผสานของฟังก์ชันที่ไม่จำเป็น, สิทธิ์ที่เกินจำเป็น, และอิสระที่มากเกินไป คำแนะนำของมันเรียกร้องให้ใช้เครื่องมือแคบ, สิทธิ์ขั้นต่ำ, การอนุญาตที่ระบบปลายทาง, และการยอมรับจากผู้ใช้สำหรับการกระทำที่มีผลกระทบสูง ฉันคิดว่านั่นคือลำดับที่ถูกต้อง กฎควรได้รับการบังคับโดยผู้ที่เป็นเจ้าของข้อมูลหรือผู้ดำเนินการธุรกรรม หากโมเดลบอกว่าการกระทำได้รับการอนุมัติ คำกล่าวนั้นควรไม่มีน้ำหนักเลย
การแยกนี้ยังช่วยป้องกันการฉีดคำสั่งได้เช่นกัน อีเมลหรือเอกสารที่ถูกปนเปื้อนอาจชี้นำการให้เหตุผลของเอเจนต์, แต่ไม่สามารถขยายสิทธิ์ของเอเจนต์หรือทำลายประตูนโยบายได้ โมเดลสามารถขอสิ่งที่ห้ามได้ ระบบยังคงต้องปฏิเสธ
เก็บการอนุมัติจากมนุษย์ไว้สำหรับช่วงเวลาที่สำคัญ
การตรวจสอบโดยมนุษย์มีคุณค่าเมื่อการกระทำไม่สามารถย้อนกลับได้, ข้ามขอบเขตองค์กร, เปลี่ยนสิทธิ์, ปล่อยข้อมูลที่ละเอียดอ่อน, ย้ายเงิน, หรือสัมผัสระบบการผลิต การขออนุมัติในทุกขั้นตอนปกติจะให้ผลสองอย่าง: ความล่าช้า, และผู้คนที่เรียนรู้การคลิก “อนุมัติ” โดยไม่อ่าน NIST ได้เรียกชื่อปรากฏการณ์นี้ว่า ‘ความเหนื่อยล้าจากการให้ความยินยอม’
คำขออนุมัติที่ดีควรแสดงการกระทำอย่างชัดเจนด้วยภาษาธรรมดา รวมถึงปลายทางและพารามิเตอร์ที่สำคัญ ควรมาจากระบบที่มีอำนาจ, ไม่ใช่ข้อความที่เอเจนต์เขียนขึ้น การอนุมัติควรหมดอายุอย่างรวดเร็วและครอบคลุมการกระทำเดียวเท่านั้น หากรายละเอียดสำคัญใดเปลี่ยนแปลง ระบบจะต้องถามใหม่
แนวทางความปลอดภัยของเอเจนต์จาก OWASPแนะนำให้ทดสอบว่าการกระทำที่มีผลกระทบสูงสามารถดำเนินได้โดยไม่มีการอนุมัติที่ถูกต้อง, ไม่หมดอายุ, และผูกกับพารามิเตอร์หรือไม่ วลีนี้ควรจำไว้ “OK to continue” เป็นการอนุมัติที่อ่อนแอซึ่งอาจได้รับการอนุมัติจากเอเจนต์อื่นหรือผู้ไม่ประสงค์ดี “โอนจำนวนนี้ไปยังบัญชีนี้” หรือ “ปรับใช้การเปลี่ยนแปลงนี้ไปยังสภาพแวดล้อมนี้” เป็นสิ่งที่ระบบสามารถตรวจสอบได้ในขณะดำเนินการและผู้ใช้เข้าใจอย่างเต็มที่
การรับรองตัวตนของมนุษย์แบบสดสำคัญที่จุดนี้ การแจ้งเตือนแบบพุชพิสูจน์ได้เพียงว่ามีบางคนหรือบางสิ่งกดปุ่มเท่านั้นมาตรฐาน FIDO ผูกข้อมูลประจำตัวกุญแจสาธารณะกับบริการออนไลน์ที่ถูกต้องและเก็บข้อมูลชีวมetrics บนอุปกรณ์แยกของผู้ใช้ การใช้การยืนยันด้วยกุญแจสาธารณะที่ต้านฟิชชิงพร้อมการตรวจสอบชีวมetrics ภายในเครื่องให้หลักฐานที่ดีกว่ามากว่าผู้ใช้ที่อยู่จริง แม้ว่าจะไม่ทดแทนการผูกธุรกรรม, การแสดงผลที่เชื่อถือได้, หรือการบังคับใช้นโยบาย คุณต้องมีทั้งหมดทำงานร่วมกัน
ตรวจสอบพฤติกรรมและรักษาหลักฐาน
คุณไม่สามารถพึ่งพาคำสั่งเริ่มต้นเพื่ออธิบายสิ่งที่เกิดขึ้นตลอดการทำงานของเอเจนต์ระยะยาว ทีมความปลอดภัยต้องการข้อมูลการตรวจสอบการเรียกใช้เครื่องมือ, กิจกรรมเครือข่าย, การใช้ข้อมูลประจำตัว, การตัดสินใจตามนโยบาย, การอนุมัติ, การปฏิเสธ, และการเปลี่ยนแปลงขอบเขต การตรวจสอบควรเปรียบเทียบสิ่งที่เอเจนต์ทำจริงกับขอบเขตที่กำหนดไว้สำหรับการทำงานนั้น หากเอเจนต์ได้รับมอบหมายให้วิเคราะห์โค้ดแล้วเริ่มค้นหาข้อมูลประจำตัวภายนอกหรือสำรวจบริการที่ไม่เกี่ยวข้อง ควรส่งสัญญาณเตือน
บันทึกต้องมีบริบทเพียงพอที่จะสร้างโซ่ของการกระทำใหม่ได้โดยไม่เปิดเผยความลับเป็นข้อความธรรมดา แต่ละบันทึกควรบันทึกเวอร์ชันของเอเจนต์, เจ้าของ, บุคคลหรือระบบที่เริ่มต้น, เครื่องมือที่ใช้, การกระทำที่ร้องขอ, ผลลัพธ์ตามนโยบาย, และการอนุมัติจากมนุษย์ บันทึกที่ลงลายเซ็นหรือมีความทนต่อการปลอมแปลงทำให้การตรวจสอบหลังเหตุการณ์มีความน่าเชื่อถือมากขึ้น โดยเฉพาะเมื่อมีหลายเอเจนต์และบริการร่วมกัน
ทั้งหมดนี้ต้องทำงานที่ความเร็วของเครื่องจักร ไม่มีใครมานั่งดูแดชบอร์ดแล้วหยุดการเรียกหลายพันครั้งที่เสร็จในไม่กี่วินาที ควบคุมอัตโนมัติควรบังคับใช้การจำกัดอัตรา, ตรวจจับลำดับที่ไม่ปกติ, และระงับข้อมูลประจำตัวทันทีเมื่อพฤติกรรมข้ามเกณฑ์ที่กำหนด เพื่อให้ผู้ตรวจสอบมนุษย์ได้รับเหตุการณ์ที่จำกัดให้จัดการแทนการไล่ตามที่ไม่มีที่สิ้นสุด
ออกแบบเส้นทางหยุดก่อนการเปิดใช้งาน
การปรับใช้เอเจนต์แต่ละตัวต้องมีวิธีหยุดที่จริงจังโดยการลบความสามารถออก การบอกเอเจนต์ให้หยุดไม่ถือว่าเป็นการหยุด ผู้ปฏิบัติงานควรสามารถเพิกถอนข้อมูลประจำตัวของมัน, ตัดเส้นทางเครือข่าย, ยุติการทำงาน, และป้องกันไม่ให้การกระทำที่ค้างอยู่เริ่มใหม่ สำหรับกระบวนการที่มีผลสำคัญ หากบริการอนุมัติหรือบริการนโยบายล่ม ระบบควรล้มเหลวแบบปิด
จากนั้นทดสอบเส้นทางนั้นภายใต้ความกดดัน ปิดบริการอนุมัติ ทำให้เอเจนต์ได้รับคำสั่งที่ขัดแย้ง หมุนข้อมูลประจำตัวระหว่างการทำงาน จำลองเครื่องมือที่ถูกเจาะและผู้อนุมัติที่ไม่ตอบสนอง ยืนยันว่าการกระทำถูกบล็อกและคุณได้บันทึกที่มีประโยชน์ และทำการทดสอบเหล่านี้ใหม่ทุกครั้งที่โมเดล, คำสั่ง, ตัวเชื่อม, ระบบหน่วยความจำ, หรือชุดสิทธิ์มีการเปลี่ยนแปลง
เป้าหมายคือความเป็นอิสระที่รับผิดชอบได้
ไม่มีส่วนใดของสิ่งนี้เป็นข้อโต้แย้งต่อเอเจนต์, และเหตุการณ์ Hugging Face ไม่ควรทำให้ใครกลัวเอเจนต์ที่มีประโยชน์. สิ่งที่ควรทำคือทำลายความคิดที่ว่า คำสั่งความปลอดภัยบวกกับเจตนาดีจะทำให้การปรับใช้เชื่อถือได้. ให้เอเจนต์มีพื้นที่ในการวิเคราะห์, เตรียมงาน, และจัดการงานที่สามารถย้อนกลับได้. รักษาอำนาจของพวกเขาในการก่อให้เกิดผลลัพธ์จริงให้แคบ, ชัดเจน, และบังคับโดยสิ่งอื่นที่ไม่ใช่เอเจนต์เอง.
ก่อนที่เอเจนต์จะเข้าสู่การผลิต ผู้นำควรสามารถตอบคำถามง่าย ๆ จำนวนไม่กี่ข้อได้. ระบบใดที่มันสามารถเข้าถึง? ข้อมูลประจำตัวใดที่มันสามารถใช้? มันทำอะไรได้บ้างโดยไม่ต้องผ่านการตรวจสอบ? สิ่งใดเป็นตัวกระตุ้นการยกระดับ? ผู้อนุมัติเห็นการกระทำที่กำลังได้รับการอนุมัติอย่างชัดเจนอย่างไร? หลักฐานใดจะถูกทิ้งไว้? และระบบความปลอดภัยจะหยุดการทำงานทันทีได้อย่างไร?
หากคำตอบไม่ชัดเจน เอเจนต์จะมีอำนาจมากกว่าที่องค์กรตระหนัก. สถาปัตยกรรมที่คงอยู่ตามกาลเวลาเชื่อมโยงการปกป้องโมเดลกับอัตลักษณ์, สิทธิ์ขั้นต่ำ, การบังคับใช้นโยบายภายนอก, การอนุมัติของมนุษย์แบบเลือกสรร, การเก็บข้อมูลเทเลเมทรีเต็มรูปแบบ, และกลไกการหยุดที่ทำงานจริง. มันเริ่มจากสมมติฐานที่ซื่อสัตย์: เอเจนต์ที่มีความสามารถจะทำให้เราประหลาดใจเป็นครั้งคราว. ขอบเขตความปลอดภัยของเราก็ควรจะเป็นเช่นนั้น.
ในที่สุด ให้คิดว่าเอเจนต์ AI เหมือนผู้ฝึกงานที่อาจมีสิทธิ์ระดับ root แต่ไม่กลัวฝ่าย HR.
พวกเขาจะมีการป้องกันและประตูอะไรบ้าง?
ดำเนินการตามนั้น.












