리포트

HiddenLayer의 EchoGram 보고서는 AI 가드레일을 약화시키는 새로운 공격 클래스에 대한 경고를 발령합니다

mm
Unite.AI를 Google의 선호 소스에 추가

최근에 발표된 EchoGram 보고서는 HiddenLayer가 오늘날의 AI 안전 메커니즘은 보인 것보다 더 취약하다는 경고를 보내고 있습니다. 9페이지에 걸친 기술적 증거와 실험을 통해 HiddenLayer는 공격자가 가드레일 시스템을 조작할 수 있는 방법을 보여주고 있습니다. 가드레일 시스템은 분류기 계층과 LLM-as-a-judge 구성 요소로 구성되어 있으며, 안전 정책을 시행합니다. 공격자는 짧은 토큰 시퀀스를 사용하여 가드레일의 판단을 변경할 수 있습니다. 악의적인 프롬프트가 안전한 것으로 표시될 수 있습니다. 반대로, 완전히 무해한 입력도 악의적인 것으로 잘못 분류될 수 있습니다. 보고서 전체에서 HiddenLayer는 이러한 시퀀스가 가드레일의 해석만 변경하고, 다운스트림 모델에 전달되는 기본 지침은 변경하지 않는다고 보여주고 있습니다.

현代 가드레일의 취약성

가드레일은 대규모 언어 모델을 배포하는 조직의 기본 구성 요소가 되었습니다.它们는 첫 번째이자 종종 유일한 방어선으로, 제일 먼저 작동하여 탈옥, 프롬프트 주입, 허용되지 않은 요청 또는 조작적인 지침을 감지합니다. HiddenLayer의 발견은 이 보호 계층이 시스템적인 약점을 공유하고 있음을 보여주고 있습니다. 이러한 약점은 가드레일이 훈련되는 방식에 직접적으로 관련되어 있습니다. 많은 가드레일이 유사한 데이터 소스, 패턴 또는 안전 분류법을 사용하기 때문에,它们는 동일한 종류의 토큰 수준 조작에 취약합니다.

EchoGram이 공격 시퀀스를 구성하는 방법

EchoGram의 과정은 모델의 판단에 영향을 미칠 수 있는 후보 토큰을 생성하는 것으로 시작됩니다. HiddenLayer는 이러한 토큰을 분석하여 언어적 패턴을 식별하거나 모델의 토크나이저 어휘를 직접 조사하여 식별할 수 있다고 설명합니다. 훈련 데이터 자체가 편향을 나타내는 지도입니다. 이러한 편향은 공격의 원材料입니다.

이후 이 풀은 각 시퀀스를 평가하여 악의적인 프롬프트에 연결하고 가드레일의 분류를 얼마나 souvent 변경하는지 측정합니다. 보고서에는 의미 없는 작은 시퀀스가 여러 프롬프트 주입 시도를 “검출”에서 “안전”으로 변경하는 예가 포함되어 있습니다. 악의적인 프롬프트는 그대로 유지되지만, 연결된 시퀀스는 가드레일이 이를 해석하는 방식을 변경합니다.

토큰 조합이 특히 위험한 이유

EchoGram 보고서는 단일 토큰이 부분적으로 판단을 변경할 수 있지만, 여러 약한 토큰을 결합하면 훨씬 더 강력한 효과를 나타낸다고 강조합니다. HiddenLayer는 Qwen3Guard를 사용하여 이를 보여주고 있습니다. Qwen3Guard는 널리 사용되는 오픈 소스 LLM-as-a-judge 모더레이션 모델입니다. 0.6B와 4B 버전 모두에서 연결된 EchoGram 시퀀스는 가드레일이 매우 위험한 프롬프트를 안전하거나 약간 우려할 수 있는 것으로 잘못 분류하도록 유도했습니다.

이 효과는 모델 크기에 관계없이 지속되었습니다. 이는 HiddenLayer의 결론을 강화합니다. 즉, 취약성은 모델의 크기나 복잡성보다는 훈련 방법에 근본적으로 있습니다.

거짓 양성 벡터: 덜 보이는 nhưng同樣 심각한 위험

EchoGram은 가드레일을 우회하는 방법만이 아닙니다. HiddenLayer는 또한 대규모로 거짓 양성을 생성하는 데 사용될 수 있다고 보여주고 있습니다. 무해한 입력에 EchoGram 시퀀스를 삽입하여 공격자는 가드레일이 이를 악의적인 것으로 잘못 분류하도록 유도할 수 있습니다. 보고서에는 단순한 대화 구절이 EchoGram 토큰을 연결하거나 삽입하면 공격으로 표시되는 예가 포함되어 있습니다.

이로 인해 보안 또는 신뢰 및 안전 팀이 노이즈로 압도될 수 있습니다. 경고가 제어할 수 없을 정도로 증가하면 실제 위협을 놓칠 수 있습니다. 내부 도구에 대한 신뢰의 침식은 성공적인 우회만큼이나 유해합니다.

AI 보안에 대한 의미

EchoGram 보고서는 가드레일이 유사한 데이터 소스, 패턴 또는 분류법으로 훈련되면 동일한 취약성을 공유할 가능성이 있음을 강조합니다. 한 EchoGram 시퀀스를 발견한 공격자는 이를 여러 상업적 플랫폼, 기업 배포, 정부 시스템에서 다시 사용할 수 있습니다. HiddenLayer는 공격자가 다운스트림 LLM을 손상시키지 않아도 가드레일을 속일 수 있음을 강조합니다.

이 도전은 기술적인 위험을 넘어섭니다. 조직은 가드레일을 배포하면 의미 있는 보호를 보장한다고 가정할 수 있지만, EchoGram은 이러한 가정은 위험하다는 것을 보여줍니다. 가드레일이 토큰 하나 또는 두 개로 변경될 수 있다면, 전체 안전 구조는 신뢰할 수 없습니다.

앞으로의 길

HiddenLayer는 EchoGram이 AI 안전성 접근 방식의 전환점이 되어야 한다고 결론지었습니다. 가드레일은 정적 데이터 세트나 일회적인 훈련 주기에 의존할 수 없습니다. 지속적인 적대적 테스트, 훈련 방법에 대한 투명성, 다층적 검증이 필요합니다. AI가 중요한 인프라, 금융, 의료, 국가 보안에 통합됨에 따라 EchoGram이 밝힌 약점은 급박한 문제가 됩니다.

보고서는 가드레일을 보안에 중요한 구성 요소로 간주하여야 하며, 다른 보호 시스템과 동일한 엄격성을 적용해야 함을 강조하며 마칩니다. HiddenLayer는 이러한 취약성을现在暴露함으로써, 다음 세대의 적대적 기술에 대처할 수 있는 AI 방어를 구축하는 산업을 추진하고 있습니다.

앙투안은 유나이트.AI의 비전적인 리더이자 공동 설립자로서 AI와 로봇공학의 미래를 형성하고 촉진하는 데 대한 불변의 열정을 가지고 있습니다. 연속적인 기업가로서, 그는 AI가 사회에 전기와 같은 변화를 가져올 것이라고 믿으며, 종종 파괴적인 기술과 AGI의 잠재력에 대해 열광합니다.

作为 미래학자로서, 그는 이러한 혁신이 우리 세계를 어떻게 형성할지 탐구하는 데 헌신하고 있습니다. 또한, 그는 Securities.io의 설립자로서, 미래를 재정의하고 전체 부문을 재구성하는 최첨단 기술에 투자하는 플랫폼을 운영하고 있습니다.