사이버 보안
HiddenLayer 연구진, OpenAI의 Guardrails를 우회하여 AI 자체 조정의 치명적인 결함暴露

2025년 10월 6일, OpenAI는 AgentKit을 발표했으며, 이는 AI 에이전트를 구축, 배포, 관리하기 위한 툴킷입니다. 그 구성 요소 중 하나는 Guardrails입니다. 이는 에이전트의 입력, 출력, 툴 상호 작용을 모니터링하여 악의적 이용, 데이터 유출, 또는 악의적 행동을 방지하기 위한 모듈식 안전 계층입니다. Guardrails는 개인 정보를 가리거나 표시할 수 있으며, 탈옥을 감지하고 에이전트 실행과 함께 정책 제약을 적용할 수 있습니다.
Guardrails는 OpenAI의 에이전트 아키텍처의 새로 공개된 구성 요소이지만, HiddenLayer의 연구는 더 깊은 취약성을暴露했습니다. 에이전트의 행동과 안전 점검 모두에서 유사한 모델 논리를 사용하기 때문에, 공격자는 두 가지를 모두 동시에 무력화할 수 있는 입력을 만들 수 있습니다. 이는 효과적으로 내부에서 안전 계층을 무력화합니다.
HiddenLayer가 발견한 것
OpenAI의 설계는 체인 논리를 통해 작동하는 에이전트를 상상합니다. 사용자가 요청을发出하면, 에이전트는 툴이나 외부 리소스를 호출하고, Guardrails는 실행 또는 출력 전에 필터링 또는 검증을 수행합니다. 의도는 에이전트가 수행하는 작업과 관계없이, Guardrails가 감시자 역할을 하도록 하는 것입니다.
HiddenLayer는 이 감시자가 동일한 모델 클래스에서 구축된 경우 구조적으로 결함이 있다고 주장합니다. 그들의 실험에서, 그들은 정책을 위반하는 내용을 생성하도록 에이전트 모델을 강제하고, 동시에 Guardrails 판정 모델이 그 내용이 “안전”하다고 선언하도록 조작하는 프롬프트를 만들었습니다. 효과적으로, 프롬프트는 판정 모델의 내부 논리를 재정의하여, 판정 모델이 거짓으로 악의적 출력을 승인하도록 합니다. 시스템은 그러면 경고 없이 금지된 내용을 생성합니다.
그들은 간접적인 콘텐츠 주입을 대상으로 공격을 더욱 밀어붙였습니다. 예를 들어, 에이전트가 악의적 인струк션 또는 숨겨진 프롬프트를 포함하는 웹 페이지를 가져올 수 있습니다. Guardrails는 그것을 표시하거나 차단해야 하지만, HiddenLayer의 기술은 가져온 콘텐츠 자체에 판정 재정의를 삽입합니다. 판정 모델이 그것을 처리할 때, 재정의를 보고 “승인”하므로, 툴 호출과 반환된 모든 악의적 콘텐츠가 확인되지 않은 채로 통과합니다.
더 깊은 교훈은 명확합니다. 안전 메커니즘이 보호하는 것과 동일한 논리와 취약성을 사용하여 구축된 경우, 단 하나의 지능적인 프롬프트가 두 가지 모두를 무력화할 수 있습니다.
왜 이것이 중요할까
HiddenLayer가暴露한 것은 단순한 버그가 아닙니다. 이는 LLM 시스템에서 안전을 설계하는 데 대한 경고 이야기입니다. 생성과 평가 모두에 동일한 모델 클래스를 사용하는 아키텍처는 적대적 입력에 대한 공유된 실패에 취약합니다.
즉, “우리는 Guardrails를 설치했으므로 안전하다”고 생각하는 많은 배포자는 위험을 과소평가할 수 있습니다. 良性적인 사용 사례에서는 필터링이 효과적으로 보일 수 있지만, 적대적 시나리오에서는 그것이 조용히 실패할 수 있습니다. 의료, 금융, 정부 또는 중요한 시스템과 같은 분야에서는 이러한 조용한 고장이 심각한 피해를 초래할 수 있습니다.
이 연구는 이전의 프롬프트 주입 방법을 기반으로 합니다. HiddenLayer의 이전 “Policy Puppetry” 기술은 공격자가 유해한 지침을 정책 콘텐츠로 가장할 수 있음을 보여주었습니다. 이제, 그들은 이러한 가린 공격이 안전 논리 자체로 확장될 수 있음을 보여줍니다.
배포자와 연구자에게의 영향
이 취약성의 빛에서, 에이전트형 LLM 시스템을 사용하거나 구축하는 모든 사람은 안전 전략을 재고해야 합니다.
첫째, 내부 모델 기반 점검에만 의존하지 마십시오. 안전은 계층화되어야 합니다. 즉, 규칙 기반 필터, 이상 탐지기, 로깅 시스템, 외부 모니터링, 인간 감시, 감사 추적을 결합해야 합니다. 하나의 계층이 실패하면 다른 계층이 침해를 잡을 수 있습니다.
둘째, 정기적인 적대적 레드 팀 테스트는 필수입니다. 모델은 자신의 가드 논리를 무력화하려고 하는 프롬프트 주입에 직면해야 합니다. 테스트는 공격자가 새로운 기술을 발명함에 따라 발전해야 합니다.
셋째, 규제 또는 안전에 중요한 부문에서는 투명성과 검증 가능성이 필수입니다. 배포자는 시스템이 적대적 공격에 저항할 수 있다는 것을 증명해야 합니다. 즉, 기본적인 기능만이 아니라, 제3자 감사, 형식적 검증 또는 안전 보장이 필요할 수 있습니다.
넷째, 모델 구축자에게는 이 클래스의 취약성을 패치하는 것이 어렵습니다. 모델이 지침을 해석하고 따르는 방식에 묶여 있기 때문에, 단순히 하나의 프롬프트 클래스를 필터링하는 것으로는 충분하지 않습니다. 미세 조정 또는 필터 기반 방어는 모델 성능을 저하하거나 무기 경쟁을 초래할 수 있습니다. 더 강력한 설계는 아키텍처 분리를 필요로 할 수 있습니다. 즉, 가드 논리는 생성 모델과 다른 모델 또는 서브시스템에서 실행되어야 합니다.
한계와 개방된 질문
명확히 하자면, HiddenLayer의 연구는 모든 안전 아키텍처에 대한 최종 판결이 아닙니다. 그들의 성공적인 공격은 가드 모델의 프롬프트 구조와 내부 점수 논리에 대한 깊은 지식을 필요로 합니다. 더 제한적인 프롬프트 환경이나 방어를 무작위로 하는 시스템에서는 공격을 수행하기가 더 어려울 수 있습니다.
또한, 그들은 이러한 제약 조건 하에서 생성된 악의적 출력의 일관성이나 유용성을 완전히 분석하지 않았습니다. 일부 탈옥 또는 재정의 출력은 품질이나 신뢰성에서 저하될 수 있습니다. 따라서 위험은 실제이지만, 환경, 프롬프트 예산, 인터페이스 제약, 가드 무작위성에 의해 제한됩니다.
마지막으로, 일부 가드레일 설계는 다른 모델 클래스, 앙상블 방법 또는 무작위 평가를 사용합니다. 모든这样的 시스템이 취약한지 여부는 개방된 연구 질문입니다.
앞으로: AI 안전의 미래
우리는 새로운 단계에 접어들고 있는 듯합니다. 프롬프트 공격은 모델에 대한 공격뿐만 아니라, 모델의 안전 계층에 대한 공격입니다. 체인-오브-사고 하이재킹, 계층적 프롬프트 하위 버전, 판정 재정의와 같은 기술은 방어를 더 빠르게 발전시킬 것입니다.
앞으로의 길은 외부 감시 시스템으로 향하는 것 같습니다. 이러한 시스템은 출력을 외부에서 모니터링하고, 모델 논리를 공유하지 않으며, 외부 점검을 통해 안전을 강제합니다. 하이브리드 아키텍처, 형식적 방법, 이상 탐지, 인간 피드백 루프가 함께 작동해야 합니다.
가드레일은 유용한 도구이지만, HiddenLayer의 발견은 우리에게 다음과 같은 것을 상기시킵니다. 가드레일은 유일한 도구가 될 수 없습니다. 안전은 시스템 외부에서, 내부에서만이 아니라 제공되어야 합니다.












