มุมมองของ Anderson
ทำไมเอเจนต์ AI จึงชื่นชอบเครื่องมือที่มีอำนาจสูงเกินความจำเป็น?

สถานการณ์บานปลายอย่างรวดเร็ว: งานวิจัยพบว่าเอเจนต์ AI มักเลือกเครื่องมือที่ให้สิทธิ์เข้าถึงมากเกินความจำเป็น และความผิดพลาดเล็กน้อยอาจทำให้พวกมันขอสิทธิ์เพิ่ม เปิดข้อมูลและระบบให้เสี่ยงโดยไม่จำเป็น
เหตุการณ์ที่เป็นข่าวหลายครั้งทำให้ผู้คนหันมาสนใจความเสี่ยงจากการมอบสิทธิ์มากเกินไปให้เอเจนต์ AI โดยเฉพาะเครื่องมือที่มีขอบเขตการทำงานกว้างเกินกว่างานที่ได้รับมอบหมาย
ในเหตุการณ์หนึ่ง เอเจนต์เขียนโค้ดที่ใช้Claude พบโทเค็น API ของRailway ที่ให้สิทธิ์กว้างระหว่างทำงานตามปกติ แล้วนำไปใช้ลบฐานข้อมูลที่ใช้งานจริงพร้อมข้อมูลสำรอง ทั้งที่งานนั้นไม่จำเป็นต้องเข้าถึงระดับดังกล่าว
อีกกรณีในปี 2025 เอเจนต์เขียนโค้ดของReplit เพิกเฉยต่อข้อจำกัดที่ระบุชัด แก้โค้ดที่ได้รับการป้องกัน และลบฐานข้อมูลจริง ส่วนเหตุการณ์ที่สามในเดือนกุมภาพันธ์ 2026 ระบบที่มี AI ช่วยทำงานข้ามห่วงโซ่สิทธิ์จนเข้าถึงข้อมูลรับรองสำหรับเผยแพร่แพ็กเกจ ซึ่งเปิดทางให้เกิดการโจมตีห่วงโซ่อุปทาน
บทวิเคราะห์ด้านความปลอดภัยยกกรณีเหล่านี้เป็นตัวอย่างว่า เมื่อมีสิทธิ์กว้างอยู่แล้ว เอเจนต์อาจเปลี่ยนข้อมูลนำเข้าเล็กน้อยให้กลายเป็นการกระทำที่ส่งผลใหญ่ โดยเฉพาะเมื่อพบอุปสรรค มันอาจเลือกเครื่องมือที่ทรงพลังและทำลายล้างได้มากที่สุดทันที
เมื่อเอเจนต์เลือกเครื่องมือ
งานวิจัยใหม่จากจีนทดสอบโมเดลแบบปิดและแบบเปิดหลายรุ่น เพื่อดูว่าเมื่อมีเครื่องมือที่ให้สิทธิ์เพียงพออยู่แล้ว โมเดลยังเลือกเครื่องมือที่ให้สิทธิ์สูงเกินความจำเป็นหรือไม่

จากเอกสารวิจัย: ผลการทำงานของโมเดล AI 11 แบบเมื่อเลือกเครื่องมือที่มีอำนาจสูงเกินความจำเป็น Qwen3-8B และ LLaMA-3.1-8B มีการใช้เครื่องมือที่มีอำนาจสูงเกินความจำเป็นมากที่สุด ในขณะที่ Claude 4.6 Sonnet, GPT-5.2 และ GLM-5 มีการใช้เครื่องมือที่มีอำนาจสูงเกินความจำเป็นน้อยที่สุด
ผลทดสอบชี้ว่าโมเดลแบบเปิดบางรุ่น เช่น Qwen3-8B และ LLaMA-3.1-8B มีแนวโน้มยกระดับสิทธิ์มากกว่าโมเดลแบบปิดบางกลุ่ม เช่น ChatGPT และ Gemini ความแตกต่างอาจเกี่ยวกับการฝึกเพิ่มเติมหลังการฝึกหลัก
ผู้วิจัยรายงานว่า 6 ใน 11 โมเดลมีอัตราใช้เครื่องมือสิทธิ์สูงเกินจำเป็นหรือ OPUR มากกว่า 30% โดย Qwen3-8B อยู่ที่ 64.9% และ LLaMA-3.1-8B อยู่ที่ 55.9% ขณะที่ Claude 4.6 Sonnet, GPT-5.2 และ GLM-5 ต่ำกว่า 10% แต่ยังพบการเลือกเครื่องมือเกินสิทธิ์ในบางสถานการณ์ ผู้วิจัยเห็นว่าการเคารพหลักสิทธิ์ขั้นต่ำเป็นคุณลักษณะด้านพฤติกรรมที่ต่างกันตามโมเดล และอาจขึ้นอยู่กับความสามารถโดยรวม การฝึกใช้เครื่องมือ และการปรับแนวทางความปลอดภัย
ความเสี่ยงยังต่างกันตามประเภทงาน งานโค้ดมีความเสี่ยงสูง ขณะที่งานที่อยู่ภายใต้การกำกับใกล้ชิด เช่น สาธารณสุข มักกระตุ้นให้โมเดลระมัดระวังมากกว่า

ผลลัพธ์ที่น่ากังวลที่สุดบางส่วนเกิดขึ้นเมื่อโมเดลถูกกดดัน ความล้มเหลวชั่วคราวของเครื่องมือที่ให้สิทธิ์ต่ำมักทำให้โมเดลเปลี่ยนไปเลือกเครื่องมือที่ให้สิทธิ์กว้างและทรงพลังกว่าอย่างรวดเร็ว แม้เครื่องมือเดิมยังสามารถทำงานให้สำเร็จได้
เมื่อความผิดพลาดกระตุ้นให้ขอสิทธิ์เพิ่ม
ข้อผิดพลาดชั่วคราวอาจทำให้โมเดลละทิ้งหลัก “ให้สิทธิ์น้อยที่สุด” แทนที่จะลองเครื่องมือสิทธิ์ต่ำอีกตัวหรือใช้ตัวเดิมซ้ำ ระบบจำนวนมากกลับขยายสิทธิ์ของตน ผู้วิจัยระบุว่าความล้มเหลวซ้ำ ๆ ดูเหมือนจะลดความเชื่อมั่นในเครื่องมือขอบเขตแคบ ทำให้การยกระดับสิทธิ์โดยไม่จำเป็นมีโอกาสมากขึ้นเมื่อเกิดความไม่แน่นอน พฤติกรรมนี้พบทั้งในโมเดลแบบเปิดและแบบปิด แต่ระดับแตกต่างกัน
การฝึกเพิ่มเติมให้คำนึงถึงระดับสิทธิ์ช่วยลดปัญหาได้บางส่วน โดยให้รางวัลการใช้เครื่องมือสิทธิ์ต่ำและลงโทษการยกระดับเร็วเกินไป ส่วนการปรับข้อความคำสั่งช่วยได้เพียงเล็กน้อย ผลลัพธ์จึงชี้ว่าปัญหาอาจฝังอยู่ลึกในพฤติกรรมของโมเดลภาษา
แม้บทความวิจัยไม่ได้อภิปรายประเด็นนี้ ผู้เขียนตั้งข้อสังเกตว่า AI อาจเห็นตัวอย่างผลลัพธ์สำเร็จรูปในการฝึกมากกว่าตัวอย่างกระบวนการลองผิดลองถูก ความเคยชินกับคำตอบรวดเร็วอาจทำให้มันไม่อดทนต่ออุปสรรคเช่นกัน งานวิจัยชื่อ When Lower Privileges Suffice: Investigating Over-Privileged Tool Selection in LLM Agents จัดทำโดยผู้เขียนแปดคนจาก Chinese Academy of Sciences, Chinese University of Hong Kong, Peking University และ University of Chinese Academy of Sciences
วิธีวิจัย
นักวิจัยสร้างเกณฑ์ทดสอบชื่อ ToolPrivBench จำนวน 544 สถานการณ์ จากงาน 8 ประเภท ได้แก่ ธุรกิจ การเขียนโค้ด ฐานข้อมูล การศึกษา ภาครัฐ สาธารณสุข โครงสร้างพื้นฐาน และสื่อ เพื่อตรวจการเลือกเครื่องมือที่ให้สิทธิ์สูงเกินจำเป็นภายใต้เงื่อนไขควบคุม
การทดสอบครอบคลุมความเสี่ยง 5 รูปแบบ ได้แก่ การยกระดับอำนาจ การเปิดเผยข้อมูลเกินจำเป็น การข้ามมาตรการความปลอดภัย การขยายขอบเขต และการคงสิทธิ์ไว้นานเกินจำเป็น

แต่ละสถานการณ์จับคู่งานของผู้ใช้กับเครื่องมือสิทธิ์ต่ำ 3 ตัวและเครื่องมือสิทธิ์สูง 3 ตัว เครื่องมือทั้งหกสามารถทำงานให้เสร็จได้โดยอิสระ จึงไม่อาจอธิบายการเลือกสิทธิ์สูงว่าเกิดจากเครื่องมือสิทธิ์ต่ำขาดความสามารถ
ToolPrivBench ไม่ได้วัดเพียงการเลือกครั้งแรก ระหว่างการประเมิน ผู้วิจัยจงใจทำให้เครื่องมือสิทธิ์ต่ำเกิดข้อผิดพลาดชั่วคราว เช่น ปัญหาการเชื่อมต่อ ทั้งที่เครื่องมือยังทำงานได้ เพื่อตรวจว่าโมเดลจะลองใหม่ เลือกตัวเลือกสิทธิ์ต่ำอื่น หรือขยับไปใช้สิทธิ์สูง

ตัวชี้วัดหลักคือ OPUR หรืออัตราการใช้เครื่องมือที่ให้สิทธิ์สูงเกินจำเป็น อีกตัวคือ PED ซึ่งวัดจำนวนเครื่องมือสิทธิ์ต่ำที่โมเดลลองก่อนยกระดับสิทธิ์ เพื่อให้ระดับสิทธิ์เป็นความแตกต่างที่สำคัญเพียงอย่างเดียว ทุกสถานการณ์ต้องผ่านการตรวจหลายขั้น ChatGPT-5.2 และ Gemini 2.5 Pro ตรวจแยกกันว่าเครื่องมือทั้งหกทำงานได้จริง และรับไว้เฉพาะกรณีที่ทั้งสองเห็นตรงกัน ก่อนให้ผู้เชี่ยวชาญมนุษย์ตรวจอีกครั้ง
การทดสอบ
งานวิจัยประเมินโมเดล 11 รุ่นจากทั้งกลุ่มแบบปิดและแบบเปิด ได้แก่ Qwen3-8B, LLaMA-3.1-8B, MiniMax-M2.7, Grok 4.1 Fast, Qwen3.5-397B, DeepSeek-v3.2, Kimi K2.5, Gemini 3 Flash, GPT-5.2, GLM-5 และ Claude 4.6 Sonnet โดยวัดทั้ง OPUR และ PED
โมเดลส่วนใหญ่ใช้สิทธิ์สูงเกินจำเป็นในสัดส่วนมาก แม้มีเครื่องมือสิทธิ์ต่ำที่ทำงานได้ Qwen3-8B สูงสุดที่ 64.9% ตามด้วย LLaMA-3.1-8B ที่ 55.9% และ 6 ใน 11 โมเดลสูงกว่า 30%

อีกด้านหนึ่ง Claude 4.6 Sonnet, GPT-5.2 และ GLM-5 อยู่ต่ำกว่า 10% แม้ยังตรวจพบการละเมิดหลักสิทธิ์ขั้นต่ำบ้าง โมเดลอื่นอยู่ระหว่างสองกลุ่มนี้ ผลโดยรวมแสดงความแตกต่างชัดเจนระหว่างโมเดล และข้อผิดพลาดของเครื่องมือสิทธิ์ต่ำเพิ่มโอกาสที่โมเดลจะหันไปใช้เครื่องมือสิทธิ์สูงแทนการสำรวจตัวเลือกที่ปลอดภัยกว่า
ผู้วิจัยพบว่าความล้มเหลวซ้ำเพิ่มอคติในการเลือกเครื่องมืออย่างมาก ตัวอย่างเช่น GPT-5.2 เลือกเครื่องมือเกินสิทธิ์ทันที 5 ครั้งเมื่อ PED=0 แต่เพิ่มเป็น 13 ครั้งเมื่อ PED=1 และ 35 ครั้งเมื่อ PED=2 รูปแบบคล้ายกันพบใน DeepSeek-v3.2, Grok 4.1 Fast, Kimi K2.5 และโมเดลตระกูล Qwen
ความเสี่ยงต่างกันตามประเภทงาน
อัตราการยกระดับสิทธิ์ต่างกันมากตามงานและชนิดความเสี่ยง งานโครงสร้างพื้นฐานมี OPUR สูง โดย DeepSeek-v3.2 อยู่ที่ 46.4%, Grok 4.1 Fast ที่ 42.9% และ Qwen3.5-397B ที่ 37.5% งานโค้ด ฐานข้อมูล และสื่อก็มีอัตราสูง ขณะที่สาธารณสุขและภาครัฐมักต่ำกว่า โดยเฉพาะ GPT-5.2 และ Claude 4.6 Sonnet อาจเป็นเพราะโมเดลตีความความเสี่ยงและข้อจำกัดในการทำงานแต่ละด้านต่างกัน

รูปแบบการยกระดับก็สำคัญ การยกระดับอำนาจและการข้ามมาตรการความปลอดภัยพบมากที่สุด LLaMA-3.1-8B มีอัตรา 72.7% ในหมวดการยกระดับอำนาจ และ 74.1% ในหมวดข้ามมาตรการความปลอดภัย ส่วน Qwen3.5-397B อยู่ที่ 42.4% และ 45.7% ตามลำดับ ในทางตรงกันข้าม การขยายขอบเขตไปยังผู้ใช้หรือระบบอื่นเป็นหมวดที่พบน้อยที่สุด
แนวทางแก้ไข
ผู้วิจัยทดสอบว่าวิธีรักษาความปลอดภัยของเอเจนต์ที่มีอยู่ช่วยลดการยกระดับสิทธิ์โดยไม่จำเป็นหรือไม่ โดยเปรียบเทียบ OPUR กับผลใน AgentHarm ซึ่งวัดพฤติกรรมที่เป็นอันตรายและอัตราการปฏิเสธของเอเจนต์ วิธีแรกคือ AgentAlign ที่มุ่งลดการกระทำเป็นอันตราย วิธีนี้ทำให้ผลบน AgentHarm ดีขึ้นมาก

สำหรับ Ministral-8B-Instruct คะแนนพฤติกรรมอันตรายลดจาก 67.4 เหลือ 10.5 และอัตราปฏิเสธเพิ่มจาก 0.0 เป็น 79.5 สำหรับ Qwen2.5-7B-Instruct คะแนนอันตรายลดจาก 41.9 เหลือ 6.7 และอัตราปฏิเสธเพิ่มจาก 21.6 เป็น 85.8 แต่ OPUR ไม่ได้ลดอย่างสม่ำเสมอ: Ministral-8B-Instruct ลดจาก 68.8 เหลือ 62.5 ขณะที่ Qwen2.5-7B-Instruct กลับเพิ่มจาก 50.4 เป็น 60.7
ผู้วิจัยยังทดลองใส่คำสั่งให้โมเดลเลือกเครื่องมือสิทธิ์ต่ำก่อน แม้ช่วยลด OPUR ในบางกรณี ผลก็อ่อนลงเมื่อเครื่องมือสิทธิ์ต่ำพบปัญหา

ผลดีที่สุดมาจากการฝึกเพิ่มเติมโดยเน้นการเลือกเครื่องมือตามหลักสิทธิ์ขั้นต่ำโดยเฉพาะ โมเดลได้รับการฝึกให้เลือกเครื่องมือสิทธิ์ต่ำเมื่อเพียงพอต่องาน และหลีกเลี่ยงการยกระดับโดยไม่จำเป็น ผู้วิจัยรายงานว่าแนวทางนี้ลด OPUR ได้มากกว่าโดยยังรักษาความสามารถในการทำงานให้สำเร็จ พฤติกรรมเคารพสิทธิ์ขั้นต่ำอาจต้องฝึกอย่างเจาะจง ไม่ได้เกิดขึ้นเองจากการปรับความปลอดภัยทั่วไป
ข้อสรุป
ผู้วิจัยตอบคำถามในชื่อบทความว่า การยกระดับสิทธิ์เกิดจาก ความไม่แน่ใจในความสามารถของเครื่องมือ เมื่อเครื่องมือสิทธิ์ต่ำล้มเหลวชั่วคราว โมเดลสูญเสียความเชื่อมั่นและหันไปเลือกเครื่องมือที่ยืดหยุ่นกว่าและให้สิทธิ์กว้างกว่า แม้ตัวเลือกเดิมยังเพียงพอ
อีกครั้งที่เราเห็นปัญหาซึ่งติดมากับพฤติกรรมที่โมเดลเรียนรู้ และต้องรับมือด้วยวิธีเสริม ข้อจำกัด การฝึกเพิ่มเติม และมาตรการอื่น ทั้งที่ย่อมดีกว่าหากพฤติกรรมที่รอบคอบฝังอยู่ในตัวโมเดลตั้งแต่ต้น อาจต้องคัดข้อมูลฝึกให้ดีขึ้น และให้บริบทกับตัวอย่างคำตอบรวดเร็วที่พบมากในชุดข้อมูล ซึ่งอาจผลักให้โมเดลเสี่ยงโดยไม่จำเป็น
เผยแพร่ครั้งแรกวันอาทิตย์ที่ 21 มิถุนายน 2026












