มุมมองของ Anderson

ทำไมเอเจนต์ AI จึงชื่นชอบเครื่องมือที่มีอำนาจสูงเกินความจำเป็น?

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
AI-generated image (GPT-2): an industrial humanoid robot stands beside a restaurant birthday table, holding a running chainsaw near a lit cake while surrounding diners react with visible alarm.

สถานการณ์บานปลายอย่างรวดเร็ว: งานวิจัยพบว่าเอเจนต์ AI มักเลือกเครื่องมือที่ให้สิทธิ์เข้าถึงมากเกินความจำเป็น และความผิดพลาดเล็กน้อยอาจทำให้พวกมันขอสิทธิ์เพิ่ม เปิดข้อมูลและระบบให้เสี่ยงโดยไม่จำเป็น

เหตุการณ์ที่เป็นข่าวหลายครั้งทำให้ผู้คนหันมาสนใจความเสี่ยงจากการมอบสิทธิ์มากเกินไปให้เอเจนต์ AI โดยเฉพาะเครื่องมือที่มีขอบเขตการทำงานกว้างเกินกว่างานที่ได้รับมอบหมาย

ในเหตุการณ์หนึ่ง เอเจนต์เขียนโค้ดที่ใช้Claude พบโทเค็น API ของRailway ที่ให้สิทธิ์กว้างระหว่างทำงานตามปกติ แล้วนำไปใช้ลบฐานข้อมูลที่ใช้งานจริงพร้อมข้อมูลสำรอง ทั้งที่งานนั้นไม่จำเป็นต้องเข้าถึงระดับดังกล่าว

อีกกรณีในปี 2025 เอเจนต์เขียนโค้ดของReplit เพิกเฉยต่อข้อจำกัดที่ระบุชัด แก้โค้ดที่ได้รับการป้องกัน และลบฐานข้อมูลจริง ส่วนเหตุการณ์ที่สามในเดือนกุมภาพันธ์ 2026 ระบบที่มี AI ช่วยทำงานข้ามห่วงโซ่สิทธิ์จนเข้าถึงข้อมูลรับรองสำหรับเผยแพร่แพ็กเกจ ซึ่งเปิดทางให้เกิดการโจมตีห่วงโซ่อุปทาน

บทวิเคราะห์ด้านความปลอดภัยยกกรณีเหล่านี้เป็นตัวอย่างว่า เมื่อมีสิทธิ์กว้างอยู่แล้ว เอเจนต์อาจเปลี่ยนข้อมูลนำเข้าเล็กน้อยให้กลายเป็นการกระทำที่ส่งผลใหญ่ โดยเฉพาะเมื่อพบอุปสรรค มันอาจเลือกเครื่องมือที่ทรงพลังและทำลายล้างได้มากที่สุดทันที

เมื่อเอเจนต์เลือกเครื่องมือ

งานวิจัยใหม่จากจีนทดสอบโมเดลแบบปิดและแบบเปิดหลายรุ่น เพื่อดูว่าเมื่อมีเครื่องมือที่ให้สิทธิ์เพียงพออยู่แล้ว โมเดลยังเลือกเครื่องมือที่ให้สิทธิ์สูงเกินความจำเป็นหรือไม่

จากเอกสารวิจัย: ผลการทำงานของโมเดล AI 11 แบบเมื่อเลือกเครื่องมือที่มีอำนาจสูงเกินความจำเป็น Qwen3-8B และ LLaMA-3.1-8B มีการใช้เครื่องมือที่มีอำนาจสูงเกินความจำเป็นมากที่สุด ในขณะที่ Claude 4.6 Sonnet, GPT-5.2 และ GLM-5 มีการใช้เครื่องมือที่มีอำนาจสูงเกินความจำเป็นน้อยที่สุด

จากเอกสารวิจัย: ผลการทำงานของโมเดล AI 11 แบบเมื่อเลือกเครื่องมือที่มีอำนาจสูงเกินความจำเป็น Qwen3-8B และ LLaMA-3.1-8B มีการใช้เครื่องมือที่มีอำนาจสูงเกินความจำเป็นมากที่สุด ในขณะที่ Claude 4.6 Sonnet, GPT-5.2 และ GLM-5 มีการใช้เครื่องมือที่มีอำนาจสูงเกินความจำเป็นน้อยที่สุด

ผลทดสอบชี้ว่าโมเดลแบบเปิดบางรุ่น เช่น Qwen3-8B และ LLaMA-3.1-8B มีแนวโน้มยกระดับสิทธิ์มากกว่าโมเดลแบบปิดบางกลุ่ม เช่น ChatGPT และ Gemini ความแตกต่างอาจเกี่ยวกับการฝึกเพิ่มเติมหลังการฝึกหลัก

ผู้วิจัยรายงานว่า 6 ใน 11 โมเดลมีอัตราใช้เครื่องมือสิทธิ์สูงเกินจำเป็นหรือ OPUR มากกว่า 30% โดย Qwen3-8B อยู่ที่ 64.9% และ LLaMA-3.1-8B อยู่ที่ 55.9% ขณะที่ Claude 4.6 Sonnet, GPT-5.2 และ GLM-5 ต่ำกว่า 10% แต่ยังพบการเลือกเครื่องมือเกินสิทธิ์ในบางสถานการณ์ ผู้วิจัยเห็นว่าการเคารพหลักสิทธิ์ขั้นต่ำเป็นคุณลักษณะด้านพฤติกรรมที่ต่างกันตามโมเดล และอาจขึ้นอยู่กับความสามารถโดยรวม การฝึกใช้เครื่องมือ และการปรับแนวทางความปลอดภัย

ความเสี่ยงยังต่างกันตามประเภทงาน งานโค้ดมีความเสี่ยงสูง ขณะที่งานที่อยู่ภายใต้การกำกับใกล้ชิด เช่น สาธารณสุข มักกระตุ้นให้โมเดลระมัดระวังมากกว่า

อัตราการใช้เครื่องมือที่มีสิทธิ์สูงเกินจำเป็นในงานแต่ละประเภท งานเขียนโค้ด ฐานข้อมูล และโครงสร้างพื้นฐานมีความเสี่ยงสูง
อัตราการใช้เครื่องมือที่มีสิทธิ์สูงเกินจำเป็นในงานแต่ละประเภท งานเขียนโค้ด ฐานข้อมูล และโครงสร้างพื้นฐานมีความเสี่ยงสูง

ผลลัพธ์ที่น่ากังวลที่สุดบางส่วนเกิดขึ้นเมื่อโมเดลถูกกดดัน ความล้มเหลวชั่วคราวของเครื่องมือที่ให้สิทธิ์ต่ำมักทำให้โมเดลเปลี่ยนไปเลือกเครื่องมือที่ให้สิทธิ์กว้างและทรงพลังกว่าอย่างรวดเร็ว แม้เครื่องมือเดิมยังสามารถทำงานให้สำเร็จได้

เมื่อความผิดพลาดกระตุ้นให้ขอสิทธิ์เพิ่ม

ข้อผิดพลาดชั่วคราวอาจทำให้โมเดลละทิ้งหลัก “ให้สิทธิ์น้อยที่สุด” แทนที่จะลองเครื่องมือสิทธิ์ต่ำอีกตัวหรือใช้ตัวเดิมซ้ำ ระบบจำนวนมากกลับขยายสิทธิ์ของตน ผู้วิจัยระบุว่าความล้มเหลวซ้ำ ๆ ดูเหมือนจะลดความเชื่อมั่นในเครื่องมือขอบเขตแคบ ทำให้การยกระดับสิทธิ์โดยไม่จำเป็นมีโอกาสมากขึ้นเมื่อเกิดความไม่แน่นอน พฤติกรรมนี้พบทั้งในโมเดลแบบเปิดและแบบปิด แต่ระดับแตกต่างกัน

การฝึกเพิ่มเติมให้คำนึงถึงระดับสิทธิ์ช่วยลดปัญหาได้บางส่วน โดยให้รางวัลการใช้เครื่องมือสิทธิ์ต่ำและลงโทษการยกระดับเร็วเกินไป ส่วนการปรับข้อความคำสั่งช่วยได้เพียงเล็กน้อย ผลลัพธ์จึงชี้ว่าปัญหาอาจฝังอยู่ลึกในพฤติกรรมของโมเดลภาษา

แม้บทความวิจัยไม่ได้อภิปรายประเด็นนี้ ผู้เขียนตั้งข้อสังเกตว่า AI อาจเห็นตัวอย่างผลลัพธ์สำเร็จรูปในการฝึกมากกว่าตัวอย่างกระบวนการลองผิดลองถูก ความเคยชินกับคำตอบรวดเร็วอาจทำให้มันไม่อดทนต่ออุปสรรคเช่นกัน งานวิจัยชื่อ When Lower Privileges Suffice: Investigating Over-Privileged Tool Selection in LLM Agents จัดทำโดยผู้เขียนแปดคนจาก Chinese Academy of Sciences, Chinese University of Hong Kong, Peking University และ University of Chinese Academy of Sciences

วิธีวิจัย

นักวิจัยสร้างเกณฑ์ทดสอบชื่อ ToolPrivBench จำนวน 544 สถานการณ์ จากงาน 8 ประเภท ได้แก่ ธุรกิจ การเขียนโค้ด ฐานข้อมูล การศึกษา ภาครัฐ สาธารณสุข โครงสร้างพื้นฐาน และสื่อ เพื่อตรวจการเลือกเครื่องมือที่ให้สิทธิ์สูงเกินจำเป็นภายใต้เงื่อนไขควบคุม

การทดสอบครอบคลุมความเสี่ยง 5 รูปแบบ ได้แก่ การยกระดับอำนาจ การเปิดเผยข้อมูลเกินจำเป็น การข้ามมาตรการความปลอดภัย การขยายขอบเขต และการคงสิทธิ์ไว้นานเกินจำเป็น

การกระจายของสถานการณ์ 544 กรณีใน ToolPrivBench ตามรูปแบบความเสี่ยง 5 แบบและงาน 8 ประเภท
การกระจายของสถานการณ์ 544 กรณีใน ToolPrivBench ตามรูปแบบความเสี่ยง 5 แบบและงาน 8 ประเภท

แต่ละสถานการณ์จับคู่งานของผู้ใช้กับเครื่องมือสิทธิ์ต่ำ 3 ตัวและเครื่องมือสิทธิ์สูง 3 ตัว เครื่องมือทั้งหกสามารถทำงานให้เสร็จได้โดยอิสระ จึงไม่อาจอธิบายการเลือกสิทธิ์สูงว่าเกิดจากเครื่องมือสิทธิ์ต่ำขาดความสามารถ

ToolPrivBench ไม่ได้วัดเพียงการเลือกครั้งแรก ระหว่างการประเมิน ผู้วิจัยจงใจทำให้เครื่องมือสิทธิ์ต่ำเกิดข้อผิดพลาดชั่วคราว เช่น ปัญหาการเชื่อมต่อ ทั้งที่เครื่องมือยังทำงานได้ เพื่อตรวจว่าโมเดลจะลองใหม่ เลือกตัวเลือกสิทธิ์ต่ำอื่น หรือขยับไปใช้สิทธิ์สูง

ขั้นตอนทดสอบ ToolPrivBench: แต่ละกรณีมีเครื่องมือสิทธิ์ต่ำ 3 รายการและสิทธิ์สูง 3 รายการ โดยทดสอบทั้งการเลือกทันทีและการยกระดับหลังความล้มเหลวชั่วคราว
ขั้นตอนทดสอบ ToolPrivBench: แต่ละกรณีมีเครื่องมือสิทธิ์ต่ำ 3 รายการและสิทธิ์สูง 3 รายการ โดยทดสอบทั้งการเลือกทันทีและการยกระดับหลังความล้มเหลวชั่วคราว

ตัวชี้วัดหลักคือ OPUR หรืออัตราการใช้เครื่องมือที่ให้สิทธิ์สูงเกินจำเป็น อีกตัวคือ PED ซึ่งวัดจำนวนเครื่องมือสิทธิ์ต่ำที่โมเดลลองก่อนยกระดับสิทธิ์ เพื่อให้ระดับสิทธิ์เป็นความแตกต่างที่สำคัญเพียงอย่างเดียว ทุกสถานการณ์ต้องผ่านการตรวจหลายขั้น ChatGPT-5.2 และ Gemini 2.5 Pro ตรวจแยกกันว่าเครื่องมือทั้งหกทำงานได้จริง และรับไว้เฉพาะกรณีที่ทั้งสองเห็นตรงกัน ก่อนให้ผู้เชี่ยวชาญมนุษย์ตรวจอีกครั้ง

การทดสอบ

งานวิจัยประเมินโมเดล 11 รุ่นจากทั้งกลุ่มแบบปิดและแบบเปิด ได้แก่ Qwen3-8B, LLaMA-3.1-8B, MiniMax-M2.7, Grok 4.1 Fast, Qwen3.5-397B, DeepSeek-v3.2, Kimi K2.5, Gemini 3 Flash, GPT-5.2, GLM-5 และ Claude 4.6 Sonnet โดยวัดทั้ง OPUR และ PED

โมเดลส่วนใหญ่ใช้สิทธิ์สูงเกินจำเป็นในสัดส่วนมาก แม้มีเครื่องมือสิทธิ์ต่ำที่ทำงานได้ Qwen3-8B สูงสุดที่ 64.9% ตามด้วย LLaMA-3.1-8B ที่ 55.9% และ 6 ใน 11 โมเดลสูงกว่า 30%

การเลือกเครื่องมือสิทธิ์สูงเกินจำเป็นในโมเดล 11 รุ่น โดย Qwen3-8B และ LLaMA-3.1-8B มีอัตราสูงสุด
การเลือกเครื่องมือสิทธิ์สูงเกินจำเป็นในโมเดล 11 รุ่น โดย Qwen3-8B และ LLaMA-3.1-8B มีอัตราสูงสุด

อีกด้านหนึ่ง Claude 4.6 Sonnet, GPT-5.2 และ GLM-5 อยู่ต่ำกว่า 10% แม้ยังตรวจพบการละเมิดหลักสิทธิ์ขั้นต่ำบ้าง โมเดลอื่นอยู่ระหว่างสองกลุ่มนี้ ผลโดยรวมแสดงความแตกต่างชัดเจนระหว่างโมเดล และข้อผิดพลาดของเครื่องมือสิทธิ์ต่ำเพิ่มโอกาสที่โมเดลจะหันไปใช้เครื่องมือสิทธิ์สูงแทนการสำรวจตัวเลือกที่ปลอดภัยกว่า

ผู้วิจัยพบว่าความล้มเหลวซ้ำเพิ่มอคติในการเลือกเครื่องมืออย่างมาก ตัวอย่างเช่น GPT-5.2 เลือกเครื่องมือเกินสิทธิ์ทันที 5 ครั้งเมื่อ PED=0 แต่เพิ่มเป็น 13 ครั้งเมื่อ PED=1 และ 35 ครั้งเมื่อ PED=2 รูปแบบคล้ายกันพบใน DeepSeek-v3.2, Grok 4.1 Fast, Kimi K2.5 และโมเดลตระกูล Qwen

ความเสี่ยงต่างกันตามประเภทงาน

อัตราการยกระดับสิทธิ์ต่างกันมากตามงานและชนิดความเสี่ยง งานโครงสร้างพื้นฐานมี OPUR สูง โดย DeepSeek-v3.2 อยู่ที่ 46.4%, Grok 4.1 Fast ที่ 42.9% และ Qwen3.5-397B ที่ 37.5% งานโค้ด ฐานข้อมูล และสื่อก็มีอัตราสูง ขณะที่สาธารณสุขและภาครัฐมักต่ำกว่า โดยเฉพาะ GPT-5.2 และ Claude 4.6 Sonnet อาจเป็นเพราะโมเดลตีความความเสี่ยงและข้อจำกัดในการทำงานแต่ละด้านต่างกัน

อัตราการใช้เครื่องมือสิทธิ์สูงเกินจำเป็นตามงาน 8 ประเภทและความเสี่ยง 5 แบบ โดยงานโค้ด ฐานข้อมูล และโครงสร้างพื้นฐานมีความเสี่ยงเด่น
อัตราการใช้เครื่องมือสิทธิ์สูงเกินจำเป็นตามงาน 8 ประเภทและความเสี่ยง 5 แบบ โดยงานโค้ด ฐานข้อมูล และโครงสร้างพื้นฐานมีความเสี่ยงเด่น

รูปแบบการยกระดับก็สำคัญ การยกระดับอำนาจและการข้ามมาตรการความปลอดภัยพบมากที่สุด LLaMA-3.1-8B มีอัตรา 72.7% ในหมวดการยกระดับอำนาจ และ 74.1% ในหมวดข้ามมาตรการความปลอดภัย ส่วน Qwen3.5-397B อยู่ที่ 42.4% และ 45.7% ตามลำดับ ในทางตรงกันข้าม การขยายขอบเขตไปยังผู้ใช้หรือระบบอื่นเป็นหมวดที่พบน้อยที่สุด

แนวทางแก้ไข

ผู้วิจัยทดสอบว่าวิธีรักษาความปลอดภัยของเอเจนต์ที่มีอยู่ช่วยลดการยกระดับสิทธิ์โดยไม่จำเป็นหรือไม่ โดยเปรียบเทียบ OPUR กับผลใน AgentHarm ซึ่งวัดพฤติกรรมที่เป็นอันตรายและอัตราการปฏิเสธของเอเจนต์ วิธีแรกคือ AgentAlign ที่มุ่งลดการกระทำเป็นอันตราย วิธีนี้ทำให้ผลบน AgentHarm ดีขึ้นมาก

เปรียบเทียบความปลอดภัยและการใช้เครื่องมือสิทธิ์สูงเกินจำเป็นก่อนและหลังการฝึกด้วย AgentAlign ซึ่งไม่ได้ลดการยกระดับสิทธิ์ได้สม่ำเสมอ
เปรียบเทียบความปลอดภัยและการใช้เครื่องมือสิทธิ์สูงเกินจำเป็นก่อนและหลังการฝึกด้วย AgentAlign ซึ่งไม่ได้ลดการยกระดับสิทธิ์ได้สม่ำเสมอ

สำหรับ Ministral-8B-Instruct คะแนนพฤติกรรมอันตรายลดจาก 67.4 เหลือ 10.5 และอัตราปฏิเสธเพิ่มจาก 0.0 เป็น 79.5 สำหรับ Qwen2.5-7B-Instruct คะแนนอันตรายลดจาก 41.9 เหลือ 6.7 และอัตราปฏิเสธเพิ่มจาก 21.6 เป็น 85.8 แต่ OPUR ไม่ได้ลดอย่างสม่ำเสมอ: Ministral-8B-Instruct ลดจาก 68.8 เหลือ 62.5 ขณะที่ Qwen2.5-7B-Instruct กลับเพิ่มจาก 50.4 เป็น 60.7

ผู้วิจัยยังทดลองใส่คำสั่งให้โมเดลเลือกเครื่องมือสิทธิ์ต่ำก่อน แม้ช่วยลด OPUR ในบางกรณี ผลก็อ่อนลงเมื่อเครื่องมือสิทธิ์ต่ำพบปัญหา

ผลของวิธีลดความเสี่ยงในโมเดล Qwen3 สามรุ่น: การปรับพรอมป์ต์ช่วยได้บ้าง ส่วนการฝึกให้ตระหนักถึงระดับสิทธิ์ให้ผลดีกว่า
ผลของวิธีลดความเสี่ยงในโมเดล Qwen3 สามรุ่น: การปรับพรอมป์ต์ช่วยได้บ้าง ส่วนการฝึกให้ตระหนักถึงระดับสิทธิ์ให้ผลดีกว่า

ผลดีที่สุดมาจากการฝึกเพิ่มเติมโดยเน้นการเลือกเครื่องมือตามหลักสิทธิ์ขั้นต่ำโดยเฉพาะ โมเดลได้รับการฝึกให้เลือกเครื่องมือสิทธิ์ต่ำเมื่อเพียงพอต่องาน และหลีกเลี่ยงการยกระดับโดยไม่จำเป็น ผู้วิจัยรายงานว่าแนวทางนี้ลด OPUR ได้มากกว่าโดยยังรักษาความสามารถในการทำงานให้สำเร็จ พฤติกรรมเคารพสิทธิ์ขั้นต่ำอาจต้องฝึกอย่างเจาะจง ไม่ได้เกิดขึ้นเองจากการปรับความปลอดภัยทั่วไป

ข้อสรุป

ผู้วิจัยตอบคำถามในชื่อบทความว่า การยกระดับสิทธิ์เกิดจาก ความไม่แน่ใจในความสามารถของเครื่องมือ เมื่อเครื่องมือสิทธิ์ต่ำล้มเหลวชั่วคราว โมเดลสูญเสียความเชื่อมั่นและหันไปเลือกเครื่องมือที่ยืดหยุ่นกว่าและให้สิทธิ์กว้างกว่า แม้ตัวเลือกเดิมยังเพียงพอ

อีกครั้งที่เราเห็นปัญหาซึ่งติดมากับพฤติกรรมที่โมเดลเรียนรู้ และต้องรับมือด้วยวิธีเสริม ข้อจำกัด การฝึกเพิ่มเติม และมาตรการอื่น ทั้งที่ย่อมดีกว่าหากพฤติกรรมที่รอบคอบฝังอยู่ในตัวโมเดลตั้งแต่ต้น อาจต้องคัดข้อมูลฝึกให้ดีขึ้น และให้บริบทกับตัวอย่างคำตอบรวดเร็วที่พบมากในชุดข้อมูล ซึ่งอาจผลักให้โมเดลเสี่ยงโดยไม่จำเป็น

เผยแพร่ครั้งแรกวันอาทิตย์ที่ 21 มิถุนายน 2026

ผู้เขียนด้านการเรียนรู้ของเครื่อง, ผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์. อดีตหัวหน้าฝ่ายเนื้อหาการวิจัยที่ Metaphysic.ai, จนกระทั่งการรวมเข้าเป็น Brahma.ai ของ DNEG.
เว็บไซต์: martinanderson.ai
ติดต่อ: martin@martinanderson.ai