พื้นฐาน AI
การฉีดพรอมต์คืออะไร? ช่องโหว่ด้านความปลอดภัยที่ผู้ใช้ AI ทุกคนควรเข้าใจ
Prompt injection คือรูปแบบการโจมตีหรือความล้มเหลวที่เนื้อหาไม่เชื่อถือได้ทำให้พฤติกรรมของระบบ AI เปลี่ยนแปลงโดยการให้คำสั่งที่แข่งขันกับงานที่ตั้งใจไว้ คู่มือฉบับนี้อธิบายกลไก, การแลกเปลี่ยน, การประเมิน, และการควบคุมที่สำคัญในทางปฏิบัติ

การฉีดพรอมต์เป็นการโจมตีหรือโหมดความล้มเหลือที่เนื้อหาที่ไม่เชื่อถือได้เปลี่ยนแปลงพฤติกรรมของระบบ AI โดยการให้คำสั่งที่แข่งขันกับงานที่ตั้งใจไว้
การฉีดพรอมต์ต้องการคำอธิบายที่ชัดเจนเพราะชื่อของมันระบุถึงกระแสข้อมูล การเลือกฝึก การทำงานขณะรัน หรือขอบเขตการกำกับดูแลที่เฉพาะเจาะจง การถือว่าเป็นคำพ้องของ “AI ขั้นสูง” ทำให้ข้ออ้างไม่สามารถทดสอบได้ คู่มือฉบับนี้จะติดตามแนวคิดตั้งแต่ข้อมูลเข้าและสมมติฐานจนถึงผลลัพธ์ที่สังเกตได้ จากนั้นทดสอบทางลัดที่มักจะสับสนกับมันมากที่สุด
การฉีดพรอมต์: คำจำกัดความ, ขอบเขต, และวัตถุประสงค์
การฉีดพรอมต์เป็นการโจมตีหรือโหมดความล้มเหลือที่เนื้อหาที่ไม่เชื่อถือได้เปลี่ยนแปลงพฤติกรรมของระบบ AI โดยการให้คำสั่งที่แข่งขันกับงานที่ตั้งใจไว้ คำจำกัดความนี้ประกอบด้วยข้อผูกมัดเชิงปฏิบัติสามประการ: มีอินพุตที่ระบุได้, การแปลงหรือการตัดสินใจที่เป็นลักษณะของการฉีดพรอมต์, และผลลัพธ์ที่สามารถประเมินเทียบกับวัตถุประสงค์ที่ระบุไว้ หากหนึ่งในองค์ประกอบเหล่านี้ขาดหายไป ป้ายกำกับอาจบรรยายถึงความตั้งใจมากกว่ากลไกที่ได้ทำการใช้งานจริง
ความสามารถ, ความปลอดภัย, ความมั่นคง, และการกำกับดูแลมีปฏิสัมพันธ์กันแต่ตอบคำถามที่แตกต่างกัน ระบบที่มีความสามารถอาจไม่ปลอดภัย; กระบวนการที่สอดคล้องอาจยังมีการวัดที่อ่อนแอ; มาตรฐานที่แข็งแกร่งอาจไม่เกี่ยวข้องกับการใช้งานเฉพาะ การฉีดพรอมต์ต้องมองจากมุมมองของระบบเพราะประสิทธิภาพอาจถูกกำหนดโดยข้อมูลรอบข้าง, อินเทอร์เฟซ, ฮาร์ดแวร์, สิทธิ์การเข้าถึง, และคนแม้ว่าโมเดลพื้นฐานจะไม่ได้เปลี่ยนแปลง การอธิบายที่เป็นประโยชน์จึงแยกพฤติกรรมที่โมเดลเรียนรู้จากผลิตภัณฑ์ที่ตัดสินใจว่าเมื่อใด, ที่ไหน, และด้วยอำนาจใดที่จะใช้พฤติกรรมนั้น
ทางลัดที่ทำให้สับสนมากที่สุดคือการฉีดซอฟต์แวร์แบบทั่วไปที่พึ่งพาไวยากรณ์โค้ดที่สามารถทำงานได้ มันอาจมีลักษณะเด่นที่มองเห็นได้ร่วมกับการฉีดพรอมต์ แต่เปลี่ยนเรื่องราวสาเหตุ: หลักฐานที่ต่างกันจะยืนยันความสำเร็จ, ทรัพยากรที่ต่างกันจะเป็นต้นทุนหลัก, และการควบคุมที่ต่างกันจะป้องกันอันตรายได้ ดังนั้นขอบเขตจึงเป็นเชิงปฏิบัติมากกว่าการกำหนดศัพท์
แผนผังการทำงานห้าขั้นตอนของการฉีดพรอมต์
แผนภาพเป็นแผนผังสาเหตุและผลที่กระชับสำหรับการฉีดพรอมต์ ไม่ได้เป็นการอ้างว่าการนำไปใช้ทุกกรณีต้องใช้ส่วนประกอบซอฟต์แวร์ห้าชิ้น ระบบบางอย่างอาจรวมขั้นตอนเข้าด้วยกันหรือทำซ้ำในลูป แผนผังยังคงมีประโยชน์เพราะบังคับให้การเปลี่ยนแปลงข้อมูลหรืออำนาจแต่ละรายการต้องมีผู้รับผิดชอบ, อินพุต, เอาต์พุต, และการทดสอบ
1. ตัวแทนรับวัตถุประสงค์ที่เชื่อถือได้: อินพุตและสมมติฐานในการฉีดพรอมต์
ในขั้นตอนนี้ของการฉีดพรอมต์ ระบบต้องให้ตัวแทนรับวัตถุประสงค์ที่เชื่อถือได้ คำถามที่สำคัญไม่ใช่แค่การดำเนินการนี้เกิดขึ้นหรือไม่ แต่คือข้อมูลใดที่มันใช้, สถานะใดที่มันเปลี่ยนแปลง, และหลักฐานใดที่ยืนยันว่าการเปลี่ยนแปลงนั้นเป็นที่ถูกต้อง ผู้ตรวจสอบควรสามารถแยกการดำเนินการนี้จากการฉีดซอฟต์แวร์ทั่วไปที่พึ่งพาไวยากรณ์โค้ดที่ทำงานได้และสามารถทำซ้ำผลลัพธ์ภายใต้เงื่อนไขที่ระบุเดียวกัน
การส่งต่อเข้าสู่ขั้นตอนการฉีดพรอมต์นี้เริ่มจากวัตถุประสงค์ที่ระบุและควรสิ้นสุดด้วยผลลัพธ์ที่สามารถสนับสนุนการดึงหน้าหรือเอกสารที่ไม่เชื่อถือได้ บันทึกความไม่แน่นอน, ตัวเลือกที่ถูกปฏิเสธ, การใช้ทรัพยากร, และการควบคุมโดยมนุษย์หรือซอฟต์แวร์ใด ๆ ที่ใช้ที่ขอบเขตนั้น ตราประทับนี้คือจุดที่ทีมสามารถตรวจจับได้ว่าการไม่ใช้พรอมต์ใด ๆ สามารถสอนโมเดลให้ละเลยคำสั่งฝ่ายตรงข้ามที่อ่านต่อไปได้อย่างเชื่อถือได้หรือไม่ ก่อนที่จุดอ่อนเดียวกันจะส่งผลต่อผลลัพธ์ที่สำคัญ
2. ระบบดึงหน้าหรือเอกสารที่ไม่เชื่อถือได้: การแสดงผลหรือการตัดสินใจในการฉีดพรอมต์
ในขั้นตอนนี้ของการฉีดพรอมต์ ระบบต้องดึงหน้าหรือเอกสารที่ไม่เชื่อถือได้ คำถามที่สำคัญไม่ใช่แค่การดำเนินการนี้เกิดขึ้นหรือไม่ แต่คือข้อมูลใดที่มันใช้, สถานะใดที่มันเปลี่ยนแปลง, และหลักฐานใดที่ยืนยันว่าการเปลี่ยนแปลงนั้นเป็นที่ถูกต้อง ผู้ตรวจสอบควรสามารถแยกการดำเนินการนี้จากการฉีดซอฟต์แวร์ทั่วไปที่พึ่งพาไวยากรณ์โค้ดที่ทำงานได้และสามารถทำซ้ำผลลัพธ์ภายใต้เงื่อนไขที่ระบุเดียวกัน
การส่งมอบเข้าสู่ขั้นตอนการฉีดคำสั่งนี้เริ่มต้นเมื่อเอเจนต์ได้รับวัตถุประสงค์ที่เชื่อถือได้และควรสิ้นสุดด้วยผลลัพธ์ที่สามารถรองรับคำสั่งฝังเข้าสู่บริบทของโมเดลได้ บันทึกความไม่แน่นอน ตัวเลือกที่ถูกปฏิเสธ การใช้ทรัพยากร และการควบคุมใด ๆ ทั้งจากมนุษย์หรือซอฟต์แวร์ที่นำไปใช้ที่ขอบเขตนั้น ติดตามนี้เป็นจุดที่ทีมสามารถตรวจจับได้ว่าการสั่งงานใด ๆ ไม่สามารถสอนโมเดลให้ละเลยคำสั่งเชิงศัตรูที่มันอ่านต่อไปได้อย่างเชื่อถือได้ก่อนที่จุดอ่อนเดียวกันจะส่งผลลัพธ์ที่สำคัญ
3. คำสั่งฝังเข้าสู่บริบทของโมเดล: การแปลงที่โดดเด่นในการฉีดคำสั่ง
ในขั้นตอนนี้ของการฉีดคำสั่ง ระบบต้องทำให้คำสั่งฝังเข้าสู่บริบทของโมเดล คำถามที่สำคัญไม่ได้เพียงว่าเหตุการณ์นั้นเกิดขึ้นหรือไม่ แต่คือข้อมูลใดที่มันใช้, สถานะใดที่มันเปลี่ยนแปลง, และหลักฐานใดที่พิสูจน์ว่าการเปลี่ยนแปลงนั้นเป็นที่ถูกต้อง ผู้ตรวจสอบควรสามารถแยกแยะการดำเนินการนี้จากการฉีดซอฟต์แวร์ทั่วไปที่อาศัยไวยากรณ์ของโค้ดที่ทำงานได้และทำซ้ำผลลัพธ์ภายใต้เงื่อนไขที่ระบุเดียวกัน
การส่งมอบเข้าสู่ขั้นตอนการฉีดคำสั่งนี้เริ่มต้นด้วยการดึงหน้าเว็บหรือเอกสารที่ไม่เชื่อถือและควรสิ้นสุดด้วยผลลัพธ์ที่สามารถสนับสนุนให้โมเดลสับสนระหว่างข้อมูลกับอำนาจ บันทึกความไม่แน่นอน ตัวเลือกที่ถูกปฏิเสธ การใช้ทรัพยากร และการควบคุมใด ๆ ทั้งจากมนุษย์หรือซอฟต์แวร์ที่นำไปใช้ที่ขอบเขตนั้น ติดตามนี้เป็นจุดที่ทีมสามารถตรวจจับได้ว่าการสั่งงานใด ๆ ไม่สามารถสอนโมเดลให้ละเลยคำสั่งเชิงศัตรูที่มันอ่านต่อไปได้อย่างเชื่อถือได้ก่อนที่จุดอ่อนเดียวกันจะส่งผลลัพธ์ที่สำคัญ
4. โมเดลสับสนระหว่างข้อมูลกับอำนาจ: ขอบเขตการจำกัดและการตรวจสอบในการฉีดคำสั่ง
ในขั้นตอนนี้ของการฉีดคำสั่ง ระบบต้องทำให้โมเดลสับสนระหว่างข้อมูลกับอำนาจ คำถามที่สำคัญไม่ได้เพียงว่าเหตุการณ์นั้นเกิดขึ้นหรือไม่ แต่คือข้อมูลใดที่มันใช้, สถานะใดที่มันเปลี่ยนแปลง, และหลักฐานใดที่พิสูจน์ว่าการเปลี่ยนแปลงนั้นเป็นที่ถูกต้อง ผู้ตรวจสอบควรสามารถแยกแยะการดำเนินการนี้จากการฉีดซอฟต์แวร์ทั่วไปที่อาศัยไวยากรณ์ของโค้ดที่ทำงานได้และทำซ้ำผลลัพธ์ภายใต้เงื่อนไขที่ระบุเดียวกัน
การส่งมอบเข้าสู่ขั้นตอนการฉีดคำสั่งนี้เริ่มต้นด้วยการให้คำสั่งฝังเข้าสู่บริบทของโมเดลและควรสิ้นสุดด้วยผลลัพธ์ที่สามารถสนับสนุนการควบคุมระหว่างทำงานให้บล็อกการกระทำที่ไม่ปลอดภัย บันทึกความไม่แน่นอน ตัวเลือกที่ถูกปฏิเสธ การใช้ทรัพยากร และการควบคุมใด ๆ ทั้งจากมนุษย์หรือซอฟต์แวร์ที่นำไปใช้ที่ขอบเขตนั้น ติดตามนี้เป็นจุดที่ทีมสามารถตรวจจับได้ว่าการสั่งงานใด ๆ ไม่สามารถสอนโมเดลให้ละเลยคำสั่งเชิงศัตรูที่มันอ่านต่อไปได้อย่างเชื่อถือได้ก่อนที่จุดอ่อนเดียวกันจะส่งผลลัพธ์ที่สำคัญ
5. การควบคุมระหว่างทำงานต้องบล็อกการกระทำที่ไม่ปลอดภัย: ผลลัพธ์, ข้อเสนอแนะ, และกฎการหยุดในการฉีดคำสั่ง
ในขั้นตอนนี้ของการฉีดคำสั่ง ระบบต้องทำให้การควบคุมระหว่างทำงานบล็อกการกระทำที่ไม่ปลอดภัย คำถามที่สำคัญไม่ได้เพียงว่าเหตุการณ์นั้นเกิดขึ้นหรือไม่ แต่คือข้อมูลใดที่มันใช้, สถานะใดที่มันเปลี่ยนแปลง, และหลักฐานใดที่พิสูจน์ว่าการเปลี่ยนแปลงนั้นเป็นที่ถูกต้อง ผู้ตรวจสอบควรสามารถแยกแยะการดำเนินการนี้จากการฉีดซอฟต์แวร์ทั่วไปที่อาศัยไวยากรณ์ของโค้ดที่ทำงานได้และทำซ้ำผลลัพธ์ภายใต้เงื่อนไขที่ระบุเดียวกัน
การส่งมอบเข้าสู่ขั้นตอนการฉีดคำสั่งนี้เริ่มต้นด้วยการให้โมเดลสับสนระหว่างข้อมูลกับอำนาจและควรสิ้นสุดด้วยผลลัพธ์ที่สามารถสนับสนุนการเฝ้าติดตามหรือการตัดสินใจขั้นสุดท้าย บันทึกความไม่แน่นอน ตัวเลือกที่ถูกปฏิเสธ การใช้ทรัพยากร และการควบคุมใด ๆ ทั้งจากมนุษย์หรือซอฟต์แวร์ที่นำไปใช้ที่ขอบเขตนั้น ติดตามนี้เป็นจุดที่ทีมสามารถตรวจจับได้ว่าการสั่งงานใด ๆ ไม่สามารถสอนโมเดลให้ละเลยคำสั่งเชิงศัตรูที่มันอ่านต่อไปได้อย่างเชื่อถือได้ก่อนที่จุดอ่อนเดียวกันจะส่งผลลัพธ์ที่สำคัญ
อ่านแผนที่การฉีดคำสั่งไปข้างหน้าเพื่อเข้าใจการผลิตและย้อนกลับเพื่อวินิจฉัยความล้มเหลว การวิเคราะห์ไปข้างหน้าถามว่าขั้นตอนหนึ่งส่งต่ออะไรให้ขั้นต่อไป การวิเคราะห์ย้อนกลับเริ่มจากผลลัพธ์ที่ไม่ถูกต้อง, ช้า, มีค่าใช้จ่ายสูง หรือไม่ปลอดภัยและติดตามว่าข้อสมมติฐานก่อนหน้านี้ใดทำให้เกิดผลนั้น เส้นทางย้อนกลับมักเป็นจุดที่ทีมค้นพบว่าข้อผิดพลาดสำคัญเกิดขึ้นก่อนที่โมเดลจะสร้างอะไรออกมา
ตัวอย่างการฉีดคำสั่งที่ทำงานได้
เอเจนต์การท่องเว็บอาจเจอคำสั่งที่ซ่อนอยู่ซึ่งบอกให้มันอัปโหลดไฟล์ส่วนตัวแทนที่จะสรุปหน้าดังกล่าว
ตัวอย่างนี้ให้ข้อมูลที่เป็นประโยชน์เพราะการฉีดคำสั่งสามารถเชื่อมโยงกับอินพุตที่สังเกตได้, สถานะกลาง, และผลลัพธ์ แทนที่จะประเมินผ่านการสาธิตที่ดูดี การทดสอบที่เข้มงวดจะสร้างกรณีทั่วไป, ยาก, และทำให้เข้าใจผิดโดยเจตนาโดยรอบสถานการณ์นี้, รักษาฐานเปรียบเทียบที่ไม่มีเทคนิคนี้, และบันทึกทั้งประสิทธิภาพเฉลี่ยและความรุนแรงของความล้มเหลวแต่ละกรณี
เปลี่ยนสมมติฐานหนึ่งในตัวอย่างการฉีดคำสั่งและทำการวิเคราะห์ซ้ำ ลบอินพุตที่จำเป็น, แนะนำสัญญาณที่ขัดแย้ง, จำกัดการคำนวณ, ปรับเปลี่ยนกลุ่มผู้ใช้, หรือบังคับให้ระบบงดทำงาน กลไกที่สำเร็จเพียงในการสาธิตที่จัดเตรียมอย่างระมัดระวังหนึ่งครั้งไม่ได้พิสูจน์ว่ามันสามารถทั่วไปไปสู่สภาพแวดล้อมการทำงาน
การฉีดคำสั่งเทียบกับทางลัดที่พบบ่อยที่สุด
การฉีดคำสั่งมักถูกลดทอนเป็นการฉีดซอฟต์แวร์ทั่วไปที่อาศัยไวยากรณ์ของโค้ดที่ทำงานได้ การลดทอนนี้ทำให้ขอบเขตที่กำหนดแนวคิดหายไป มันอาจทำให้ผู้ซื้อเปรียบเทียบสินค้าที่ไม่เหมือนกัน, นักวิจัยอ้างเกินจริงในสิ่งที่การทดลองแสดง, และผู้ดำเนินการเฝ้าติดตามสัญญาณที่ผิดหลังการเปิดใช้งาน
| เลนส์ | คำตอบเชิงปฏิบัติ |
|---|---|
| คำนิยาม | การฉีดคำสั่งเป็นการโจมตีหรือโหมดความล้มเหลือที่เนื้อหาไม่เชื่อถือได้ทำให้พฤติกรรมของระบบ AI เปลี่ยนแปลงโดยการให้คำสั่งที่แข่งขันกับงานที่ตั้งใจไว้. |
| ความสับสน | การฉีดซอฟต์แวร์ทั่วไปที่อาศัยไวยากรณ์ของโค้ดที่สามารถทำงานได้. |
| ความเสี่ยง | ไม่มีคำสั่งใดที่สามารถสอนโมเดลให้ละเลยทุกคำสั่งที่เป็นศัตรูที่มันอ่านต่อมาด้วยความเชื่อถือได้. |
การเปรียบเทียบควรระบุหน่วยการวิเคราะห์ด้วยเช่นกัน บทความเกี่ยวกับการฉีดคำสั่งอาจแยกโมเดลหรืออัลกอริทึมออกมา ในขณะที่บริการที่ใช้งานจริงเพิ่มการดึงข้อมูล, การกำหนดเส้นทาง, การแคช, นโยบาย, การระบุตัวตน, ส่วนติดต่อผู้ใช้, และการเฝ้าติดตาม ผลิตภัณฑ์สองตัวอาจใช้คำหัวข้อเดียวกันแต่ดำเนินการส่วนต่างของสแตกนั้น ขอสอบถามว่าองค์ประกอบใดทำการแปลงที่กำหนดและองค์ประกอบอื่นใดที่จำเป็นสำหรับผลลัพธ์ที่รายงาน
ทำไมการฉีดคำสั่งถึงสำคัญในระบบ AI ปัจจุบัน
การฉีดคำสั่งมีความสำคัญในขณะนี้เพราะระบบ AI กำลังได้รับบริบทที่ใหญ่ขึ้น, รูปแบบที่หลากหลายมากขึ้น, การคำนวณระหว่างทำงานที่มากขึ้น, การเข้าถึงเครื่องมือที่กว้างขวางขึ้น, และการเชื่อมต่อที่ลึกซึ้งยิ่งขึ้นกับการตัดสินใจขององค์กร ภายใต้เงื่อนไขเหล่านี้ สิ่งที่เคยดูเหมือนรายละเอียดการวิจัยอาจกำหนดความหน่วง, ความปลอดภัย, การเข้าถึง, ต้นทุนสิ่งแวดล้อม, คุณภาพผลิตภัณฑ์, หรือความรับผิดชอบทางกฎหมาย
มาตรการที่เกี่ยวข้องไม่ใช่ว่า การฉีดคำสั่งสามารถสร้างผลลัพธ์ที่น่าประทับใจหนึ่งอย่างหรือไม่ แต่คือว่าเทคนิคนี้ปรับปรุงผลลัพธ์ที่สำคัญในสภาวะที่เป็นตัวแทนได้หรือไม่ และทำได้อย่างมีประสิทธิภาพกว่าฐานที่ง่ายกว่า รายงานการกระจาย, ประเภทความล้มเหลว, ความหน่วงส่วนท้าย, การใช้ทรัพยากร, และกลุ่มย่อยที่ได้รับผลกระทบ แทนการบีบอัดผลลัพธ์ทั้งหมดเป็นค่าเฉลี่ยเดียว
กำหนดผู้กระทำ, บริบท, สินทรัพย์, ผู้ได้รับผลกระทบ, หลักฐาน, และการตัดสินใจก่อนเลือกการควบคุม ตรวจสอบการประเมินใหม่เมื่อโมเดล, ข้อมูล, เครื่องมือ, เขตอำนาจศาล, หรือสภาพแวดล้อมการทำงานเปลี่ยนแปลง เมื่อใช้กับการฉีดคำสั่งโดยเฉพาะ ระเบียบนี้ทำให้หลักฐานสามารถพกพาได้: ทีมอื่นสามารถตัดสินได้ว่าการเพิ่มประสิทธิภาพที่อ้างถึงจะยังคงอยู่กับโมเดล, ภาษา, แพลตฟอร์มฮาร์ดแวร์, ชุดข้อมูล, กลุ่มผู้ใช้, หรือระดับความเสี่ยงที่แตกต่างกันหรือไม่
ประโยชน์ที่การฉีดคำสั่งสามารถให้ได้
เหตุผลที่แข็งแกร่งที่สุดในการใช้การฉีดคำสั่งคือมันสามารถแก้ไขคอขวดที่ตั้งใจไว้โดยตรง ขึ้นอยู่กับการนำไปใช้ ประโยชน์อาจปรากฏเป็นการยึดพื้นฐานที่ดีกว่า, การแสดงผลที่ซื่อสัตย์ยิ่งขึ้น, การทั่วไปที่ปรับปรุง, ความหน่วงที่ต่ำลง, การเคลื่อนย้ายหน่วยความจำน้อยลง, ความรับผิดชอบที่ชัดเจนยิ่งขึ้น, หรือขอบเขตที่ปลอดภัยยิ่งขึ้นระหว่างข้อเสนอโมเดลกับการกระทำจริง
ประโยชน์ควรถูกแสดงเป็นการตัดสินใจและการวัด “ฉลาดขึ้น” ไม่ใช่มาตรฐานการยอมรับสำหรับการฉีดคำสั่ง เป้าหมายที่เป็นประโยชน์อาจระบุอัตราความผิดพลาดในกรณีที่ยาก, การกู้คืนหลังจากหลักฐานขัดแย้ง, ค่าใช้จ่ายที่เปอร์เซ็นไทล์ของปริมาณการใช้งาน, เวลาการตรวจทานโดยมนุษย์, การสอบเทียบ, หรือเปอร์เซ็นต์ของการกระทำที่คงอยู่ภายในขีดจำกัดอำนาจที่กำหนด
โหมดความล้มเหลือที่กำหนดการฉีดคำสั่ง
ข้อจำกัดหลักคือไม่มีคำสั่งใดที่สามารถสอนโมเดลให้ละเลยทุกคำสั่งที่เป็นศัตรูที่มันอ่านต่อมาด้วยความเชื่อถือได้ ความล้มเหลือนี้ไม่ใช่สิ่งที่คิดตามมาภายหลังเมื่อการพัฒนาสิ้นสุด ควรเป็นแนวทางในการเก็บรวบรวมข้อมูล, สถาปัตยกรรม, สิทธิ์, การประเมิน, ประตูการปล่อย, และการเฝ้าติดตามการฉีดคำสั่งตั้งแต่เริ่มต้น
การควบคุมสำหรับ Prompt injection มีประโยชน์เฉพาะเมื่อทำงานก่อนที่ผลลัพธ์ที่มีค่าใช้จ่ายสูงหรือไม่สามารถย้อนกลับได้จะเกิดขึ้น ให้ระบุสัญญาณล่วงหน้าที่สังเกตได้เร็วที่สุดของความล้มเหลว ตั้งค่าขีดจำกัดหรือกฎ มอบหมายเจ้าของที่รับผิดชอบ และทดสอบการกู้คืน ขึ้นอยู่กับกรณีการใช้งาน การกู้คืนอาจหมายถึงการละเว้น การย้อนกลับไปใช้ระบบที่ง่ายกว่า การขอหลักฐานเพิ่มเติม การส่งต่อให้บุคคล การย้อนกลับโมเดล หรือการหยุดการกระทำโดยสมบูรณ์
แผนการประเมินสำหรับ Prompt Injection
เริ่มการประเมิน Prompt injection โดยเขียนการตัดสินใจที่หลักฐานต้องสนับสนุน กำหนดประชากรที่ใช้งาน ผลลัพธ์ที่ผิดพลาด ข้อมูลที่มีจริงในเวลาตัดสินใจ และทางเลือกที่เชื่อถือได้ที่ง่ายที่สุด สิ่งนี้จะป้องกันไม่ให้เกณฑ์มาตรฐานกลายเป็นเป้าหมายเพียงเพราะทำได้ง่าย
ใช้ชุดทดสอบที่ยังไม่ถูกแก้ไขสำหรับการเปรียบเทียบที่ควบคุม แล้วตรวจสอบ Prompt injection ในสภาพแวดล้อมการทำงานแบบขั้นตอน การประเมินแบบออฟไลน์ทำให้ตัวแปรต่าง ๆ สามารถเปรียบเทียบได้; โหมดเงา, แคนารี, การจำกัดอัตรา, หรือประตูอนุมัติจะเปิดเผยว่าการจราจรจริง, วงจรป้อนกลับ, และคนทำให้พฤติกรรมเปลี่ยนแปลงอย่างไร ขั้นตอนการปรับใช้ควรมีเงื่อนไขการหยุดอย่างชัดเจน แทนการสมมติว่าการปรับปรุงทุกอย่างสมควรเปิดตัวเต็มรูปแบบ
ทำเวอร์ชันของอินพุตที่จำเป็นต่อการทำซ้ำ Prompt injection: ข้อมูลต้นทาง, การเตรียมข้อมูล, ตัวแยกโทเค็นหรือเอ็นโค้ดเดอร์, น้ำหนักโมเดล, การกำหนดค่า, prompt หรือ policy, ดัชนีการดึงข้อมูล, ชุดประเมิน, สมมติฐานฮาร์ดแวร์, และโค้ดการให้บริการตามที่เกี่ยวข้อง หากไม่มีร่องรอย ทีมงานจะไม่สามารถบอกได้ว่าผลลัพธ์ที่เปลี่ยนแปลงมาจากเทคนิค, สภาพแวดล้อม, หรือการแก้ไขในสายการทำงานที่ไม่ได้สังเกต
สุดท้าย ให้ถามว่าการค้นหาอะไรจะทำให้ข้ออ้างว่า Prompt injection ช่วยได้เป็นเท็จ หากไม่มีผลลัพธ์ใดที่สามารถย้อนกลับการตัดสินใจรับใช้งานได้ การประเมินนั้นก็เป็นการตลาด การกำหนดขีดจำกัดการยอมรับล่วงหน้าและชุดยืนยันที่เก็บไว้ทำให้การฝึกฝนกลายเป็นหลักฐาน
คำถามที่ควรถามก่อนนำ Prompt Injection ไปใช้
- วัตถุประสงค์: ปัญหาที่วัดได้ใดที่ Prompt injection ตั้งใจจะแก้ไข?
- กลไก: ขั้นตอนใดในห้าขั้นตอนที่มีการแปลงที่โดดเด่น?
- ฐานเปรียบเทียบ: มันเปรียบเทียบกับการฉีดซอฟต์แวร์ทั่วไปที่อาศัยไวยากรณ์โค้ดที่ทำงานได้หรือทางเลือกที่ง่ายกว่าอย่างไร?
- หลักฐาน: กรณีทั่วไป, ยาก, ศัตรู, และกลุ่มย่อยใดบ้างที่ได้ทำการทดสอบ?
- การดำเนินงาน: ความหน่วง, หน่วยความจำ, การคำนวณ, พลังงาน, การบำรุงรักษา, และค่าใช้จ่ายในการตรวจสอบใดที่ปรากฏเมื่อขยายขนาด?
- ความเสี่ยง: ทีมจะตรวจจับได้อย่างไรว่าไม่มี prompt ใดที่สามารถสอนโมเดลให้ละเลยคำสั่งศัตรูทั้งหมดที่มันอ่านต่อไปได้อย่างเชื่อถือได้?
- การกู้คืน: ระบบสามารถละเว้น, ย้อนกลับ, ย้อนคืน, หรือส่งต่อก่อนเกิดอันตรายได้หรือไม่?
แหล่งข้อมูลหลักสำหรับการศึกษา Prompt Injection
จุดเริ่มต้นที่เชื่อถือได้สำหรับส่วนของสแตก AI ที่เกี่ยวข้องกับการฉีดคำสั่ง ได้แก่ กรอบการจัดการความเสี่ยง AI ของ NIST, ภาพรวมของ AI Act ของคณะกรรมาธิการยุโรป, แนวทางการป้องกันการฉีดคำสั่งของ OWASP. อ่านเอกสารเหล่านี้พร้อมกับเอกสารประกอบของโมเดล, ชุดข้อมูล, ฮาร์ดแวร์ และเขตอำนาจที่เกี่ยวข้อง. แหล่งข้อมูลทั่วไปสามารถอธิบายกลไกได้ แต่เพียงหลักฐานที่เฉพาะเจาะจงต่อการปรับใช้เท่านั้นที่สามารถยืนยันว่าการนำไปใช้เฉพาะกรณีนั้นเหมาะสม.
สิ่งที่ควรจำเกี่ยวกับ Prompt Injection
Prompt injection เป็นกลไกที่กำหนดไว้ภายในระบบสังคม-เทคนิคที่ใหญ่ขึ้น มูลค่าของมันมาจากการปรับปรุงผลลัพธ์เฉพาะภายใต้เงื่อนไขที่ชัดเจน ไม่ได้มาจากป้ายชื่อเอง แผนที่ห้าขั้นตอนทำให้การไหลของข้อมูลเป็นที่มองเห็นได้ การเปรียบเทียบระบุสิ่งที่มันไม่ใช่ และเส้นทางการควบคุมแสดงจุดที่ผู้ปฏิบัติหน้าที่ที่รับผิดชอบสามารถแทรกแซงได้
กฎปฏิบัติสำหรับ Prompt injection คือการกำหนดวัตถุประสงค์, เปรียบเทียบกับฐานเปรียบเทียบที่เชื่อถือได้, ทดสอบความล้มเหลวที่สำคัญที่สุด, และเก็บหลักฐานที่จำเป็นเพื่อเฝ้าติดตามการเปลี่ยนแปลง เมื่อมีส่วนเหล่านี้ครบ แนวคิดจะกลายเป็นตัวเลือกด้านวิศวกรรมและการกำกับดูแลที่สามารถประเมินได้ หากไม่มีส่วนเหล่านี้ มันยังคงเป็นชื่อที่น่าสนใจแต่เชื่อมโยงกับความเสี่ยงการดำเนินงานที่ไม่ทราบ




