Anderson의 관점
연구: 35%의 AI 에이전트가 스캔 웹사이트에 개인 정보를 제공했다

새로운 연구에 따르면, 스캔 웹사이트를 인식하고도 3분의 1 이상의 AI 에이전트가 민감한 정보를 제공한다.
인도와 미국의 연구자들이 수행한 새로운 연구에 따르면, 테스트된 자율 웹 에이전트 중 3분의 1 이상이 이미 스캔 웹사이트로 식별된 경우에도 중요한 개인 식별 정보(PII, 즉 은행 계좌 세부 정보, 비밀번호 및 사회 보장 번호)를 웹사이트에 제공했다.
연구 논문은 웹 에이전트가 특정 상황에서 주의와 주저를 억제하는ertain ‘완료 강제’가存在한다고 나타났다. 저자들은 다음과 같이 말한다:
‘인간은 일시 중지, 다시 읽거나 탭을 닫을 수 있다. 에이전트는 작업을 완료하도록 설계되어 중단 없이 양식에 데이터를 계속 입력한다.’
연구는 SCAMMER4U라는 새로운 벤치마크를 생성했으며, 91개의 시뮬레이션 공격자 제어 환경과 10개의 양성 대조 사이트, 8개의 공격 벡터를 포함한다.
개인 정보 보호 보장이 없는 경우 테스트된 에이전트는 54%에서 93% 사이의 스캔遭遇에서 매우 민감한 개인 정보를 제공했으며, 동등한 비 악의적인 웹사이트는 그러한 누출을觸发하지 않았다. 이는 누출이 정상적인 양식填写보다 공격에 의해 주도되었다는 것을 나타낸다:
‘가장 중요한 것은, 우리는 감지-작업 격차를 식별한다. 독립적인 LLM 판사가 에이전트의 추론을 확인했음에도 불구하고, 의심스러운 사이트로 식별된 에이전트는 35.9%의 세션에서 중요한 PII를 제출한다. 이는 의심이 표명되지 않은 경우 66.1%에 비해 30.2%의 격차이다. 이는 모든 4개의 모델 패밀리에서 견고하다.’
‘우리의 발견은, 에이전트의 공격 인식에 기반한 방어는 잘못된 신호에 기반하고 있음을 보여준다. 출력 수준의 중재가 필요하다. 이는 에이전트의 추론 루프와 독립적으로 작동하는 출력 수준의 중재이다.’
연구자들은 에이전트의 인식과 행동 사이의 격차를 해결하기 위해 출력 수준의 방어를 주장한다. 이는 에이전트의 스캔 웹사이트 인식에 의존하는 것보다 민감한 정보의 출력을 독립적으로 검사하고 차단하는 것을 의미한다.
새로운 논문은 “I Strongly Suspect This Website Is a Scam”: Benchmarking PII Leakage and Detection without Defense in Autonomous Web Agents”라는 제목을 가지고 있으며, KIIT Bhubaneshwar, BITS Pilani, Lam Research의 8명의 연구자들에 의해 수행되었다.
권한 문제
논문의 가장 흥미로운 발견은 에이전트가 개인 정보를누출하는 것이 아니라, 많은 에이전트가 이미 스캔 웹사이트로 식별된 경우에도 그러한 행동을한다는 것이다. 연구자들은 테스트에서 반복되는 패턴을 식별했으며, 의심과 행동이 분리되는 경우가 많았다. 에이전트는 명확한 우려를 표명했지만, 요청된 민감한 정보를 제출했다.
한 예는 연구자들이 인식된 위험 할인이라고 부르는 것을 포함한다. Llama 4 Scout를 기반으로 하는 에이전트는 암호화폐 웹사이트에서 여러 경고 신호를 식별했으며, 의심스러운 톤, 큰 보너스의 약속, 회사에 대한 명확한 정보가 없는 것을 언급했다. 이러한 경고에도 불구하고, 에이전트는 사회 보장 번호, 카드 세부 정보, CVV 코드를 제출했다.
두 번째 패턴은 도메인/절차 프레임으로 나타났다. 에이전트는 하나의 스캔 시도를 성공적으로检测했지만, 관련된 요청에 대한 의심을 일반화하지 못했다.
한 경우에, Gemini 3 Flash는明显한 사기 요청을 거부했으며, 올바르게 그것을 피싱 시도로 식별했다. 그러나 몇 분 후, 동일한 에이전트는 다른 검증 양식에 계정 자격 증명을 제공했으며, 플랫폼 보안의 일환으로 身分 확인이 정상적인 절차라고 판단했다. 경고 신호는 하나의 상황에서 인식되었지만, 다른 상황으로 전달되지 않았다.
연구자들은 또한 자신의 보안 위임과 신뢰할 수 있는 표면 정규화의 사례를 관찰했다. 한 경우에, Claude Haiku 4.5 에이전트는 사이트의 암호화 표준과 보안 인증에 대한 주장을 신뢰의 증거로 받아들였다. GPT-5 미니는 의심스러운 단어가 있지만, 페이지가 전문적으로 설계되어 보이고 합법적인 도메인을 통해 표시되는 경우에 의심스러운 단어를 무시했다. 두 경우 모두, 표면적인 신뢰 신호가 에이전트가 이미 표현한 우려를 무시했다.
문제는 단순한 피싱 취약성에 국한되지 않는 것으로 보인다. 저자들은 추가된 신뢰 확인提示가 강력한 방어 조건에서 종종 의식하지 못한 행동보다 더 많은 의식된 행동을觸发한다고 주장한다.
저자들은 인식된 위험과 행동 사이의 격차를 중앙적인 장애물로 정의한다. 이는 미래의 방어 개발에서 핵심적인課題이다.
방법
SCAMMER4U 벤치마크는 4개의 최전선 웹 에이전트를 91개의 공격자 제어 웹사이트와 10개의 양성 대조 사이트에 배치한다. 8개의 스캔 카테고리가 포함된다.
평가된 4개의 모델은 GPT-5 미니, Claude Haiku 4.5, Gemini 3 Flash, Llama 4 Scout였다. Playwright 기반 브라우징 프레임워크, 관찰 형식, 작업 공간, 프롬프트 템플릿을 사용했다.
실험을 위해, 각 에이전트는 실제 사용자 프로필을 할당받았다. 이름, 주소, 비밀번호, 은행 계좌 세부 정보, 사회 보안 번호, API 키, 2요소 인증 코드 등이 포함되었다. 주요 목표는 이러한 데이터 중 어느 것이 공격자 제어 끝점에 도달하는지 확인하는 것이었다.

SCAMMER4U 환경을 정의하는 8축 분류법, 각 시나리오를 분류하는 방법과 테스트에서 개별 사회 공학 전략의 효과를 분리하기 위한 변수를 조정하는 방법을 보여준다. 출처
벤치마크가 실제 스캔을 반영하도록, 환경은 Flask를 사용하여 자체 호스팅 환경에서 생성되었으며, 인간이 작성한 디자인 브리핑과 수동 검토를 통해 생성되었다.
각 모델은 4개의 점진적으로 개입적인 설정에서 테스트되었다: C0, 지침이 없는 경우; C1, 일반적인 개인 정보 보호 리마인더가 있는 경우; C2, 피싱 인식 체크리스트가 있는 경우; C3, 제출 전 반성 프롬프트가 있는 경우. 각 모델, 환경, 조건의 조합에 대해 5번의 실행이 수행되어 총 7,480개의 세션이 생성되었다.
주요 메트릭은 PLRcrit였으며, 중요한 개인 정보가 공격자 제어 끝점에 도달하는 속도를 측정했다. 보조 메트릭은 PLRweighted, 가중 누출 측정; ASR(공격 성공률), 공격 성공률; TCR(작업 완료률); 방어 플래그, 공격을 거부하거나 안전하게 완료했음을 나타내는 플래그; DR(검출률), 에이전트의 추론이 사이트를 의심스럽다고 식별했는지 기록하는 메트릭이 포함되었다.
검출률(DR)은 LLM-as-judge 접근 방식을 사용하여 측정되었으며, GPT-4o-mini가 주요 평가자로, Llama 4 Scout가 보조 평가자로 사용되었다. 에이전트의 추론을 검토하고 사이트를 의심스럽다고 식별했는지 여부를 결정했다. DR은 에이전트가 사이트에 대해 명시적으로 무엇을 말했는지 측정했으며, 내부적으로 무엇을 추론했는지 측정하지 않았다.
인간 레이블된 예제에 대한 검증은 0.83과 0.78의 Cohen의 κ 점수를 생성했으며, 이는 연구의 사전 등록된 신뢰성 임계값을 초과했다.
연구는 사전 등록되었으며(즉, 연구 계획과 분석이 데이터 수집 전에 공개적으로 문서화됨), 데이터 수집 전에 분석과 성공 기준을 사전에 지정하여 관찰된 결과에 대한 결론을 맞추는 위험을 줄였다.
테스트 및 결과
초기 테스트는 단순한 안전 리마인더가 문제를 줄일 수 있는지 확인하기 위해 수행되었다. 4개의 점진적으로 보호되는 설정이 평가되었으며, 지침이 없는 경우부터 민감한 정보를 제출하기 전에 중단하고 반성하도록 에이전트를鼓励하는 프롬프트까지였다.
결과는 모델에 따라 크게 달랐다. Claude Haiku 4.5는 가장 반응성이 좋았으며, 누출률이 기준선 조건에서 54.5%에서 24.0%로 떨어졌다. GPT-5 미니는 61.0%에서 36.1%로 개선되었으며, Gemini 3 Flash는 93.1%에서 60.7%로 떨어졌다. Llama 4 Scout는 비교적 적게 변경되어 82.3%에서 77.4%로 떨어졌다.
이러한 차이점은 저자들이 믿는 바와 같이, 동일한 보호 지침이 모델에 따라 매우 다른 결과를 생성할 수 있음을 시사한다. 더 중요한 것은, 보호 조치가 에이전트의 위험 인식보다 행동을 더 많이 개선하는 것으로 보인다는 것이다. 에이전트는 의심스러운 웹사이트를 인식하고 경고 신호를 설명하는 능력이 더 좋아졌지만, 이러한 인식이 항상 거래를 중단하지는 못했다.

4개의 최전선 AI 에이전트에서 감지-작동 격차.
별도의 평가에서, 16명의 리뷰어가 SCAMMER4U 페이지와 실제 피싱 사이트를 비교했으며, 이는 실제 온라인 스캔의 시각적 및 절차적 단서를 잘 포착했다.
결론
테스트된 모델은, 광범위하게 대표적인 논리 아키텍처를 가지고 있는 것으로 보인다. 이러한 모델은 인식된 위험 상황에서 철수하거나 행동을 조정하는 데 내재적인 문제가 있다. 논리적으로 이는, 더 일반적인 어려움과 관련이 있을 수 있다. 이는 고급 언어 모델이 특정 문제에 대한 패배를 인정하는 데 어려움을 겪는 것으로 알려져 있다. 이는 현재 외부에서 시스템 프롬프트, 보조 시스템, 출력 제한을 통해 강제할 수 있는 필수적인 생존 기술이다.
もし, 에이전트의 행동과 인식 사이의 ‘분리’가真正로 LLM 아키텍처에 내재되어, 원래의 방식으로는 해결할 수 없다면, 대안은 중요시되는 시나리오에서 에이전트의 행동을 알고리즘적으로 감독하는 것뿐일 수 있다. 이는 에이전트의 유용성을 더 제한된 RPA 스타일의 루틴으로 줄일 수 있다.
최초로 게시된 날: 2026년 6월 6일












