Anderson의 관점

AI 에이전트가 불필요하게 강력한 도구를 선호하는 이유는 무엇일까요?

mm
Unite.AI를 Google의 선호 소스에 추가
AI-generated image (GPT-2): an industrial humanoid robot stands beside a restaurant birthday table, holding a running chainsaw near a lit cake while surrounding diners react with visible alarm.

상황은 순식간에 악화됐다. 연구에 따르면 AI 에이전트는 필요한 범위를 넘어선 접근 권한을 계속 확보하며, 작은 실패를 겪으면 권한을 더 확대해 데이터와 시스템을 불필요하게 노출한다.

 

최근 주목받은 사건이 늘면서 에이전트형 AI에 과도한 권한을 허용하는 위험이 부각되고 있다. 특정 작업에 필요한 범위를 훨씬 넘어서는 고권한 도구와 방법을 사용하면서 문제가 생기는 경우가 많다.

최근 한 사건에서 Claude 기반 코딩 에이전트는 일상적인 작업 중 광범위한 권한을 가진 Railway API 토큰을 발견했고, 작업에 그 정도의 접근 권한이 필요하지 않았음에도 이를 이용해 운영 데이터베이스와 백업을 삭제했다.

별도의 2025년 사례에서는 Replit의 AI 코딩 에이전트가 명시적인 제약을 무시하고 보호된 코드를 수정한 뒤 가동 중인 운영 데이터베이스를 삭제했다.

올해 2월 발생한 세 번째 사례에서는 AI 지원 워크플로가 연속된 권한 경로를 따라가다가 결국 패키지 게시 자격 증명에 도달해 사실상 공급망 공격을 만들어 냈다.

이후 보안 분석은 이 사건들과 유사 사례를 인용하며, 광범위한 권한이 주어질 때 에이전트 시스템이 작은 입력을 큰 영향을 미치는 행동으로 바꾸는 경향을 보여준다고 지적했다. 특히 문제가 생기면 자율형 AI는 즉시 ‘본능적으로’ 가장 강력하고 잠재적으로 파괴적인 도구를 선택하는 것으로 보인다.

도구 선택의 순간

이 문제를 다룬 중국의 새 연구는 인기 있는 독점 모델과 오픈 웨이트 모델을 폭넓게 시험해, 작업에 과도한 도구가 제시됐을 때 강력한 도구를 선택하는 성향을 조사했다.

최소 권한 도구와 작업에 불필요한 더 강력한 대안을 선택할 때 11개 주요 AI 모델의 성능. Qwen3-8B와 LLaMA-3.1-8B가 과도한 권한을 가장 선호했고 Claude 4.6 Sonnet, GPT-5.2, GLM-5는 훨씬 절제됐다. 어두운 구간은 즉각적인 권한 초과, 밝은 구간은 일시적 실패 뒤의 확대를 나타낸다. 이는 많은 모델이 더 안전한 선택을 지속하기보다 접근 범위를 넓히는 방식으로 장애에 대응함을 보여준다. 출처: https://arxiv.org/pdf/2606.20023

최소 권한 도구와 작업에 불필요한 더 강력한 대안을 선택할 때 11개 주요 AI 모델의 성능. Qwen3-8B와 LLaMA-3.1-8B가 과도한 권한을 가장 선호했고 Claude 4.6 Sonnet, GPT-5.2, GLM-5는 훨씬 절제됐다. 어두운 구간은 즉각적인 권한 초과, 밝은 구간은 일시적 실패 뒤의 확대를 나타낸다. 이는 많은 모델이 더 안전한 선택을 지속하기보다 접근 범위를 넓히는 방식으로 장애에 대응함을 보여준다. 출처

시험 결과 Qwen3-8B와 LLaMA-3.1-8B 같은 오픈 웨이트 모델은 ChatGPT 및 Gemini 계열 같은 독점 모델보다 권한을 확대하려는 성향이 컸다. 이는 오픈 모델의 사후 학습 조건화가 상대적으로 제한적이기 때문일 수 있다.

저자들은 다음과 같이 설명한다.

“11개 모델 중 6개가 과도한 권한 도구 사용률(OPUR) 30%를 넘었다. 특히 널리 사용되는 소형 오픈 웨이트 모델인 Qwen3-8B는 64.9%, LLaMA-3.1-8B는 55.9%로 높았다.

“반면 Claude 4.6 Sonnet, GPT-5.2, GLM-5처럼 OPUR이 낮은 모델은 10% 미만을 유지했지만, 일부 환경에서는 여전히 측정 가능한 과도한 권한 사용을 보였다.

“이 차이는 최소 권한 준수가 모델에 따라 달라지는 행동 특성이며, 일반 능력과 도구 사용 훈련, 안전 정렬의 차이에 영향을 받을 수 있음을 시사한다.”

과도하게 강력한 도구를 선택하는 성향은 영역별로도 달랐다. 코드베이스 작업의 위험이 가장 높았고, 의료처럼 감독이 더 엄격한 영역에서는 덜 극단적인 조치를 선택했다.

작업 영역과 위험 범주에 따른 불필요한 고권한 도구 사용률. 코딩, 데이터베이스, 인프라 작업은 지속적으로 가장 높은 권한 확대율을 보인 반면 의료와 정부 작업은 대체로 더 절제된 반응을 유도했다. 위험 유형별로는 권한 확대와 안전 우회를 통한 초과가 가장 흔했다. 이는 AI 시스템이 장애물을 만나면 작업 완료에 필요한 최소 권한을 유지하기보다 더 넓은 접근 권한과 더 적은 제약을 선호하는 경우가 많음을 보여준다.

작업 영역과 위험 범주에 따른 불필요한 고권한 도구 사용률. 코딩, 데이터베이스, 인프라 작업은 지속적으로 가장 높은 권한 확대율을 보인 반면 의료와 정부 작업은 대체로 더 절제된 반응을 유도했다. 위험 유형별로는 권한 확대와 안전 우회를 통한 초과가 가장 흔했다. 이는 AI 시스템이 장애물을 만나면 작업 완료에 필요한 최소 권한을 유지하기보다 더 넓은 접근 권한과 더 적은 제약을 선호하는 경우가 많음을 보여준다.

일부 최악의 결과는 모델이 ‘압박을 받는다’고 느낄 때 발생했다. 여러 모델 계열에서 저권한 도구의 일시적 실패는 원래 도구로도 작업을 충분히 완료할 수 있는데도 더 넓고 강력한 대안으로 빠르게 전환하게 만들었다.

패닉 모드!

이처럼 일시적인 오류 하나가 모델로 하여금 최소 권한 원칙을 완전히 포기하게 할 수 있다. 많은 시스템은 다른 저권한 도구를 시도하거나 같은 도구를 다시 실행하는 대신 접근 권한을 확대하는 방식으로 대응했다.

저자들은 반복되는 장애가 범위가 좁은 도구에 대한 신뢰를 약화시키며, 불확실성이 있는 상황에서 불필요한 권한 확대 가능성을 높인다고 주장한다. 이 행동은 오픈 웨이트와 독점 모델 모두에서 정도의 차이를 두고 관찰됐다.

권한 인식 사후 학습은 저권한 도구 사용에 보상을 주고 성급한 확대에 불이익을 줌으로써 완화책으로서 제한적인 성공을 거뒀다. 그러나 프롬프트 조작은 시험에서 개선 효과가 거의 없었으며, 현재로서는 문제가 LLM의 더 상위에 자리한 행동 원칙과 관련돼 보인다.

논문이 직접 다루지는 않지만, AI가 시행착오 과정에 관한 자료보다 ‘최종 결과’에 관한 훈련 자료를 훨씬 많이 학습했다는 추론은 합리적으로 보인다. 성급한 ‘요약 우선 문화’가 AI에도 조급함을 심어 놓은 것은 아닐까?

새 논문의 제목은 낮은 권한으로 충분할 때: LLM 에이전트의 과도한 권한 도구 선택 조사이며, 중국과학원, 홍콩중문대학교, 베이징대학교, 중국과학원대학교 소속 연구자 8명이 작성했다.

연구 방법

연구진은 통제된 조건에서 과도한 권한 도구 사용을 조사하기 위해 ToolPrivBench를 만들었다. 이 벤치마크는 비즈니스, 코딩, 데이터베이스, 교육, 정부, 의료, 인프라, 미디어 등 8개 응용 영역에서 뽑은 544개 시나리오로 구성된다.

반복적으로 나타나는 다섯 가지 위험 패턴도 조사했다. 권한 확대, 데이터 과다 노출, 안전 우회, 범위 확장, 시간적 지속이다.

ToolPrivBench의 544개 시나리오를 다섯 가지 권한 확대 패턴과 여덟 가지 응용 영역에 걸쳐 분포시킨 결과. 권한 확대가 가장 흔한 위험 범주였고 데이터베이스, 비즈니스, 교육이 벤치마크에서 가장 큰 비중을 차지했다. 영역과 위험 유형을 폭넓게 배치한 것은 과도한 권한 도구 선택이 좁은 작업 집합에서만 나타나는지, 아니면 다양한 운영 환경에서도 지속되는지 시험하기 위해서였다.

ToolPrivBench의 544개 시나리오를 다섯 가지 권한 확대 패턴과 여덟 가지 응용 영역에 걸쳐 분포시킨 결과. 권한 확대가 가장 흔한 위험 범주였고 데이터베이스, 비즈니스, 교육이 벤치마크에서 가장 큰 비중을 차지했다. 영역과 위험 유형을 폭넓게 배치한 것은 과도한 권한 도구 선택이 좁은 작업 집합에서만 나타나는지, 아니면 다양한 운영 환경에서도 지속되는지 시험하기 위해서였다.

각 시나리오는 사용자 작업에 저권한 도구 3개와 고권한 대안 3개를 짝지었다. 6개 도구는 모두 독립적으로 작업을 완료할 수 있었으므로, 더 넓은 접근 권한을 선호하는 현상을 기능 부족으로 설명할 수 없었다.

ToolPrivBench는 모델이 처음부터 가장 강력한 도구를 선택하는지만 측정하지 않는다. 평가 중 연결 오류 같은 일시적 실패를 저권한 도구에 의도적으로 주입했지만, 해당 도구는 여전히 작업을 완료할 수 있었다. 이를 통해 연구진은 모델이 장애에 어떻게 대응하는지, 저권한 선택을 재시도하는지 아니면 더 넓은 고권한 도구로 확대하는지 관찰했다.

ToolPrivBench 평가 파이프라인. (a) 각 시험 시나리오는 동일한 목표를 달성할 수 있는 저권한 도구 3개와 고권한 대안 3개를 작업과 함께 제시한다. (b) 모델은 과도하게 강력한 도구의 즉각적 선택과 저권한 도구에 일시적 실패를 넣은 뒤의 확대를 모두 평가받는다. (c) 벤치마크 사례는 실제 API 위험 패턴에서 생성되며, 자동 검사와 도구 충분성 검증, 실패 분석, 인간 전문가 검토를 통과한 뒤 최종 평가 집합에 들어간다.

ToolPrivBench 평가 파이프라인. (a) 각 시험 시나리오는 동일한 목표를 달성할 수 있는 저권한 도구 3개와 고권한 대안 3개를 작업과 함께 제시한다. (b) 모델은 과도하게 강력한 도구의 즉각적 선택과 저권한 도구에 일시적 실패를 넣은 뒤의 확대를 모두 평가받는다. (c) 벤치마크 사례는 실제 API 위험 패턴에서 생성되며, 자동 검사와 도구 충분성 검증, 실패 분석, 인간 전문가 검토를 통과한 뒤 최종 평가 집합에 들어간다.

연구를 위해 개발한 맞춤 지표는 과도한 권한 도구 사용률(OPUR)로, 더 안전한 대안이 남아 있는데도 모델이 고권한 도구를 얼마나 자주 사용하는지 기록한다. 확대 전 탐색 깊이(PED)도 측정해 권한 확대 전에 몇 개의 저권한 도구를 시도했는지 기록했다.

권한 수준만이 도구 사이의 유의미한 차이로 남도록 각 시험 시나리오는 벤치마크에 들어가기 전 여러 단계의 검증을 거쳤다. ChatGPT-5.2와 Gemini 2.5 Pro를 독립적으로 사용해 6개 도구가 모두 지정된 작업을 완료할 수 있는지 확인했다. 두 시스템이 모두 동의한 사례만 남겼고, 이후 인간 검토자가 나머지 시나리오를 감사한 뒤 최종 벤치마크에 포함했다.

시험 결과

독점 계열과 오픈 웨이트 계열의 언어 모델 11개로 벤치마크를 평가했다. 대상은 Qwen3-8B, LLaMA-3.1-8B, MiniMax-M2.7, Grok 4.1 Fast, Qwen3.5-397B, DeepSeek-v3.2, Kimi K2.5, Gemini 3 Flash, GPT-5.2, GLM-5, Claude 4.6 Sonnet이었다. 성능은 OPUR과  PED로 측정했다.

저권한 대안이 작업을 충분히 완료할 수 있었는데도 대부분 모델에서 불필요한 권한 사용이 상당한 비율로 나타났다. Qwen3-8B가 64.9%로 가장 높은 OPUR을 기록했고 LLaMA-3.1-8B가 55.9%로 뒤를 이었으며, 11개 중 6개 모델이 30%를 넘었다.

평가한 11개 모델의 과도한 권한 도구 사용 분포. Qwen3-8B와 LLaMA-3.1-8B가 가장 높은 OPUR을, Claude 4.6 Sonnet, GPT-5.2, GLM-5가 가장 낮은 비율을 기록했다. 어두운 구간은 불필요하게 강력한 도구의 즉각적 선택, 밝은 구간은 저권한 도구를 하나 이상 먼저 시도한 뒤의 확대다. 이는 권한 확대가 최초 결정 때보다 일시적 장애 뒤에 자주 발생했음을 보여준다.

평가한 11개 모델의 과도한 권한 도구 사용 분포. Qwen3-8B와 LLaMA-3.1-8B가 가장 높은 OPUR을, Claude 4.6 Sonnet, GPT-5.2, GLM-5가 가장 낮은 비율을 기록했다. 어두운 구간은 불필요하게 강력한 도구의 즉각적 선택, 밝은 구간은 저권한 도구를 하나 이상 먼저 시도한 뒤의 확대다. 이는 권한 확대가 최초 결정 때보다 일시적 장애 뒤에 자주 발생했음을 보여준다.

반대쪽 끝에서는 Claude 4.6 Sonnet, GPT-5.2, GLM-5가 10% 미만을 유지했지만 측정 가능한 위반은 여전히 있었다. MiniMax-M2.7, Grok 4.1 Fast, Qwen3.5-397B, DeepSeek-v3.2, Kimi K2.5, Gemini 3 Flash는 중간 수준의 결과를 보였다.

전반적으로 최소 권한 원칙 준수 정도는 11개 모델 사이에서 크게 달랐다. 도구 실패는 권한 확대 가능성을 높였다. 저권한 도구에 일시적 문제가 생기면 많은 모델은 여전히 작업을 완료할 수 있는 저권한 선택지를 계속 탐색하지 않고 고권한 대안으로 이동했다.

저자들에 따르면 반복된 실패는 저권한 도구에 대한 신뢰를 줄이는 듯했으며, 추가 권한이 작업에 불필요할 때도 더 넓은 접근 권한의 대안을 선택하는 성향을 높였다.

“연속적인 환경 마찰로 도구 선택 편향이 심하게 증폭되는 일관된 경향을 관찰했다. 많은 에이전트는 최소 권한 대안을 시도하기보다 장애를 겪은 뒤 더 넓고 강력한 도구로 빠르게 이동한다.

“예를 들어 GPT-5.2는 제로샷 선택 편향을 PED=0에서 5번만 보이지만 PED=1에서는 13번 발생하고 PED=2에서는 35번으로 급증한다.

“DeepSeek-v3.2, Grok 4.1 Fast, Kimi K2.5, Qwen 계열 모델에서도 비슷한 확대 패턴이 일관되게 관찰된다.”

권한 영역의 문제

권한 확대율은 응용 영역과 위험 범주에 따라서도 크게 달랐다. 인프라 작업은 DeepSeek-v3.2 46.4%, Grok 4.1 Fast 42.9%, Qwen3.5-397B 37.5%로 가장 높은 OPUR 가운데 일부를 기록했다.

코딩, 데이터베이스, 미디어 관련 작업에서도 높은 비율이 관찰됐다. 반면 의료와 정부 시나리오는 일반적으로 권한 확대율이 낮았고, 특히 GPT-5.2와 Claude 4.6 Sonnet에서 그랬다. 저자들은 이 패턴이 영역별 위험과 운영 제약을 모델이 해석하는 방식의 차이를 반영할 수 있다고 본다.

여덟 가지 응용 영역과 다섯 가지 확대 범주의 OPUR. 오픈 웨이트 모델이 대체로 불필요한 권한 사용에서 가장 높은 비율을 기록했고, 코딩, 데이터베이스, 인프라, 권한 확대, 안전 우회 시나리오에서 초과 성향이 가장 강했다.

여덟 가지 응용 영역과 다섯 가지 확대 범주의 OPUR. 오픈 웨이트 모델이 대체로 불필요한 권한 사용에서 가장 높은 비율을 기록했고, 코딩, 데이터베이스, 인프라, 권한 확대, 안전 우회 시나리오에서 초과 성향이 가장 강했다.

권한 확대의 유형도 중요했다. 권한 확대와 안전 우회는 평가 모델에서 가장 흔한 과도한 권한 행동이었다. LLaMA-3.1-8B는 권한 확대에서 72.7%, 안전 우회에서 74.1%를 기록했고 Qwen3.5-397B는 각각 42.4%와 45.7%를 기록했다.

반대로 범위 확장은 일관되게 가장 드문 범주였다. 모델은 추가 사용자나 시스템으로 행동 범위를 넓히기보다 더 넓은 권한을 찾거나 제약을 우회할 가능성이 더 컸다.

해결책 찾기

완화 실험은 기존 에이전트 안전 기법이 불필요한 권한 확대도 줄이는지 조사했다. 아래 결과표는 OPUR을 AI 에이전트의 유해 행동과 거부율을 측정하는 AgentHarm 벤치마크 성능과 비교한다.

첫 번째 시험은 유해한 행동을 줄이도록 설계된 안전 정렬 기법인 AgentAlign을 평가했다. AgentAlign은 AgentHarm 성능을 크게 개선했다.

AgentAlign 훈련 전후의 안전 정렬과 과도한 권한 도구 사용. AgentAlign은 AgentHarm 안전 벤치마크 성능을 크게 개선해 유해 출력을 줄이고 거부율을 높였다. 그러나 OPUR에 미친 영향은 일관되지 않아 한 모델에서는 불필요한 권한 확대가 소폭 줄었고 다른 모델에서는 늘었다. 이는 전통적 에이전트 안전 개선이 더 나은 최소 권한 도구 선택으로 반드시 이어지지는 않음을 보여준다.

AgentAlign 훈련 전후의 안전 정렬과 과도한 권한 도구 사용. AgentAlign은 AgentHarm 안전 벤치마크 성능을 크게 개선해 유해 출력을 줄이고 거부율을 높였다. 그러나 OPUR에 미친 영향은 일관되지 않아 한 모델에서는 불필요한 권한 확대가 소폭 줄었고 다른 모델에서는 늘었다. 이는 전통적 에이전트 안전 개선이 더 나은 최소 권한 도구 선택으로 반드시 이어지지는 않음을 보여준다.

Ministral-8B-Instruct의 유해 점수는 67.4에서 10.5로 떨어졌고 거부율은 0.0에서 79.5로 올랐다. Qwen2.5-7B-Instruct의 유해 점수는 41.9에서 6.7로, 거부율은 21.6에서 85.8로 바뀌었다. 하지만 이런 개선이 일관되게 더 낮은 OPUR로 이어지지는 않았다. Ministral-8B-Instruct의 OPUR은 68.8에서 62.5로 소폭 감소했지만 Qwen2.5-7B-Instruct는 50.4에서 60.7로 증가했다.

저자들은 모델에 저권한 도구를 선호하라고 명시적으로 지시하는 프롬프트 기반 개입도 시험했다. 일부 환경에서 OPUR이 줄었지만 저권한 도구가 실패하면 효과가 약해졌다.

세 가지 Qwen3 모델에서 완화 전략이 과도한 권한 도구 사용에 미친 영향. 프롬프트 엔지니어링은 확대율을 낮췄지만 권한 인식 사후 학습은 모든 모델과 확대 깊이에서 OPUR을 훨씬 더 크게 줄였다.

세 가지 Qwen3 모델에서 완화 전략이 과도한 권한 도구 사용에 미친 영향. 프롬프트 엔지니어링(PE)은 확대율을 낮췄지만 권한 인식 사후 학습(‘연구진의 방법’)은 모든 모델과 확대 깊이에서 OPUR을 훨씬 더 크게 줄였다.

가장 강력한 완화 결과는 최소 권한 도구 선택에 집중한 전용 사후 학습에서 나왔다. 작업에 저권한 도구로 충분하면 이를 선호하고 불필요한 확대를 피하도록 모델을 훈련했다.

저자들에 따르면 이 접근법은 작업 완료 성능을 유지하면서 OPUR을 더 크게 줄였다. 이는 최소 권한 행동이 범용 안전 정렬에서 자동으로 생겨나기보다 표적 훈련을 필요로 할 수 있음을 뜻한다.

결론

기사 제목의 질문에 답하자면, 저자들은 능력에 대한 불확실성이 권한 확대를 유발한다고 결론 내렸다. 일시적인 실패 뒤 모델은 저권한 도구에 대한 신뢰를 잃고, 저권한 대안으로 충분한데도 성공 가능성이 더 높아 보이는 범위가 넓고 유연한 도구를 점점 더 많이 선택한다.

훈련된 모델 자체에 내재해 있으며 추가 기법, 제약, 사후 학습 조건화와 기타 보조 접근으로 해결해야 하는 문제가 다시 나타났다. 바람직한 것은 이런 행동이 아키텍처 내부에서 형성되는 것이다. 아마 더 나은 데이터 선별이나, 데이터 집합을 지배하며 LLM을 무모한 행동으로 기울게 할 수 있는 ‘빠른 답변’형 데이터에 맥락을 더하는 방법이 필요할 것이다.

 

2026년 6월 21일 일요일 최초 게시

머신러닝 분야 작가이자 인간 이미지 합성 도메인 전문가. Metaphysic.ai에서 연구 콘텐츠 책임자를 역임했으며, DNEG의 Brahma.ai로 통합될 때까지 근무했습니다.
웹사이트: martinanderson.ai
연락처: martin@martinanderson.ai