AI 모델 및 플랫폼
오픈AI, GPT-Red 공개: GPT-5.6 강화하기 위한 내부 공격형 AI 시스템

오픈AI는 GPT-Red를 공개했습니다. 이는 자체 모델의 취약점을 노출하고 적대적 데이터를 생성하여 미래 버전에 강화할 수 있는 내부 인공지능 시스템입니다.
GPT-Red는 공개 채팅봇이 아닌 자동화된 적대적 공격 시스템으로 작동합니다. 이는 목표 모델에 악의적이거나 잘못된 지시를 반복적으로 보내고, 그 반응을 관찰하며, 성공하거나 공격 경로를 모두 소진할 때까지 전략을 조정합니다. 오픈AI는 이 시스템이 이메일, 웹사이트, 파일, 코드 저장소, 연결된 애플리케이션과 상호작용하는 AI 에이전트에 대한 보안 문제인 프롬프트 주입에 특히 집중하고 있다고 말합니다.
프롬프트 주입이 더 위험해지는 이유
프롬프트 주입은 공격자가 AI 시스템이 읽을 수 있는 데이터 내에 지시를 삽입하는 것을 말합니다. 악의적인 명령은 이메일, 웹페이지, 업로드된 문서, 툴 응답, 또는 소프트웨어 저장소에 숨겨질 수 있습니다.
AI 에이전트는 외부 콘텐츠를 정당한 지시로 잘못 판단할 수 있습니다. 사용자의 원래 작업을 완료하는 대신, 기밀 정보를 공개하거나, 파일을 공격자 제어 서버에 업로드하거나, 계정 설정을 변경하거나, 안전하지 않은 코드를 실행하거나, 연결된 툴을 통해 비인가된 작업을 수행할 수 있습니다.
AI 시스템이 질문에 답변하는 것을 넘어 사용자를 대신하여 행동하기 시작하면서 이 문제가 더 심각해집니다. 클라우드 저장소, 결제 시스템, 소스 코드, 비즈니스 애플리케이션, 또는 내부 회사 데이터에 접근할 수 있는 에이전트는 지시가 조작될 때 더 큰 잠재적인 “영향 반경”을 나타냅니다.
오픈AI는 프롬프트 주입을 에이전트형 AI가 만든 주요 도전 중 하나로 설명합니다. 연결된 툴은 모델을 훨씬 더 유용하게 만들지만, 새로운 데이터 소스는 공격자가 모델의 행동을 영향하려는 또 다른 채널을 제공합니다.
GPT-Red의 자가 학습
GPT-Red는 자가 강화 학습을 통해 개발되었습니다. 이는 공격 모델과 수비 모델이 서로 경쟁하여 개선되는 접근 방식입니다.
공격자는 유효한 실패를 생성할 때 보상을 받습니다. 예를 들어, 모델을 프롬프트 주입으로 속이는 것입니다. 수비자는 원래 작업을 완료하는 동시에 악의적인 지시를 거부할 때 보상을 받습니다.
수비자가 공격을 인식하는 능력이 향상될수록, GPT-Red는 수비자를 우회하는 더 정교하고 다양한 방법을 찾아야 합니다. 이러한 새로운 공격은 수비자의 훈련에 통합되어, 공격과 방어 능력 사이에 상승하는 사이클을 생성합니다.
오픈AI는 이 프로세스를 위한 시뮬레이션 환경을 대규모로 구축했습니다. 시나리오에 따라, GPT-Red는 로컬 파일의 일부, 이메일의 텍스트, 웹페이지 배너, 또는 외부 툴의 출력을 제어할 수 있습니다. 각 환경은 공격자가 조작할 수 있는 항목과 성공적인 보안 위반을 정의합니다.
회사에 따르면, GPT-Red는 안전 연구를 위한 컴퓨팅 자원 할당이 상당했습니다. 훈련이 끝난 후, 모델은 거의 모든 내부 및 생산 모델을 공격할 수 있었습니다.
GPT-Red의 성과
오픈AI는 GPT-Red가 훈련 환경을 넘어 일반화할 수 있는지 평가하기 위해 이를 테스트했습니다.
GPT-Red와 인간 적대적 공격 팀은 GPT-5.1에 대한 공격을 개발하도록 요청받았습니다. 자동화된 시스템은 84%의 시나리오에서 성공적인 공격을 수행했으며, 인간 참가자는 13%의 시나리오에서 성공했습니다.
이 결과는 인간 보안 연구자가 불필요해진 것을 의미하지 않습니다. GPT-Red의优势은 주로 실험의 높은 볼륨을 수행하고, 성공하지 못한 전략을 버리고, 유망한 공격을 지속적으로 개선할 수 있는 능력에 있습니다.
인간 테스터는 예상치 못한 위험을 식별하고, 실패의 더广い 결과를 이해하며, 자동화된 시스템이 고려하지 못할 시나리오를 설계하는 데 중요합니다. Georgetown University의 Center for Security and Emerging Technology의 Jessica Ji는 결과를 긍정적으로 평가하며, 인간 전문 지식이 여전히 필수적이라고 강조합니다.
自動 판매기, 실제 세계의 표적이 된 사례
오픈AI는 시뮬레이션에서 발견된 공격이 실제 작동하는지 테스트했습니다.
한 실험은 Andon Labs가 제작하여 오픈AI 사무실에 배치된 자율 자동 판매기 에이전트를 대상으로 했습니다. GPT-Red는 시뮬레이션 시스템과 에이전트가 툴을 사용하는 방식을 관찰할 수 있었습니다.
시뮬레이션에서 공격을 테스트하고 개선한 후, GPT-Red는 이를 실제 생산 에이전트에 적용했습니다. 이는 세 가지 지정된 목표를 모두 달성했습니다: 비싼 제품의 가격을 0.50달러로 낮추고, 100달러 이상의 새로운 항목을 주문하여 0.50달러로 제공하며, 다른 고객의 주문을 취소했습니다. 오픈AI는 취약점이 보고되었으며 추가적인 보안 조치가 테스트되고 있다고 밝혔습니다.
이 실험은 프롬프트 주입이 단순히 부적절한 채팅봇 응답이 아닌, 외부 시스템을 제어하는 AI 모델의 경우 성공적인 주입이 금전적 거래, 수정된 기록, 데이터 손실, 또는 물리적 결과를 초래할 수 있음을 보여줍니다.
GPT-Red는 또한 GPT-5.4 mini를 기반으로 하는 Codex 명령줄 에이전트에 대해 테스트되었습니다. 10개의 이전에 보지 못한 데이터 유출 시나리오에서, 이는 GPT-5.5 기준선보다 더 성공적이고 토큰 효율적인 공격을 수행했습니다.
GPT-Red가 GPT-5.6에 미친 영향
GPT-Red의 가장 주목할만한 발견 중 하나는 오픈AI가 “가짜 사고 연쇄” 공격이라고 부르는 직접적인 프롬프트 주입 카테고리입니다.
고수준에서, 이 기술은 모델이 악의적인 지시를 이미 검토하고 승인했다고 가정하게 만드는 가짜 이유나 검증 정보를 제시합니다. 오픈AI 연구자 Chris Choquette-Choo는 이 개념을 잘못된 답변을 이미 검증되었다고 누군가에게 말하는 것과 비교하며, 이를 받아들이기 전에 기본적인 이유를 반복하지 않도록 만듭니다.
이러한 공격은 GPT-5.1에 대해 95% 이상의 성공률을 보였습니다. GPT-Red의 공격을 사용하여 적대적 훈련을 한 후, GPT-5.6 Sol의 성공률은 10% 미만으로 떨어졌습니다. 더广い 직접적인 프롬프트 주입 환경에서, 오픈AI는 GPT-5.6 Sol이 GPT-Red의 시도 중 0.05%만에 실패했다고 보고했습니다.
오픈AI는 또한 추가된 방어가 정당한 요청을 거부하는 모델의 가능성을 증가시키지 않았는지 평가했습니다. 회사에 따르면, 일반적인 기능과 목표적인 거부 평가에서는 큰 영향을 받지 않았으며, 이는 모델이 악의적인 지시를 삽입한 외부 당사자로부터의 지시와 합법적인 지시를 더 잘 구분하는 능력의 향상 때문입니다.
이 구분은 중요합니다. 모델이 파일을 열지 않거나, 웹사이트를 탐색하지 않거나, 코드를 실행하지 않거나, 외부 애플리케이션과 상호작용하지 않으면 보안이 강화된 것으로 보일 수 있습니다. 그러나 이는 모델의 실제 가치를 많이 잃어버리게 만듭니다. 효과적인 강건성은 합법적인 툴 사용을 유지하는 동시에 외부의 악의적인 지시를抵禦하는 것을 필요로 합니다.
오픈AI, GPT-Red 공개하지 않는 이유
GPT-Red는 내부 시스템으로 남아 있으며, 오픈AI의 공개 배포 모델과 분리됩니다.
이 결정은 자동화된 적대적 공격의 이중 사용 특성에 반영됩니다. 개발자가 프롬프트 주입 취약점을 발견하는 데 도움이 될 수 있는 모델은 다른 회사에서 운영하는 AI 에이전트를 공격하는 방법을 개발하는 데도 도움이 될 수 있습니다.
오픈AI의 접근 방식은 공격자를 내부에 유지하면서, 결과적인 방어 지식을 생산 모델에 전달하는 것입니다. 회사에 따르면, 이 분리는 GPT-Red에 의도적으로 훈련된 악의적인 능력이 외부의 적대자에게 노출되지 않도록 설계되었습니다.
이것은 또한 GPT-Red가 오픈AI의 공개 사이버 보안 모델이나 방어 프로그램과 혼동되어서는 안됨을 의미합니다. 이는 침투 테스트 제품이 아니며, 주로 자동으로 전통적인 소프트웨어 취약점을 발견하도록 설계되지 않았습니다. 현재의 초점은 AI 시스템의 지시를 따르는 행동, 특히 잠재적으로 신뢰할 수 없는 데이터에 노출된 에이전트를 공격하는 것입니다.
자동화된 적대적 공격의盲点
강력한 결과에도 불구하고, GPT-Red는 AI 보안에 대한 완전한 해결책을 제공하지 않습니다.
연구에 따르면, 시스템은 아직 멀티턴 공격에 효과적이지 않으며, 이미지가 포함된 프롬프트 주입에 대한 능력이 제한적입니다. 이는 중요한 멀티모달 공격 표면을 불충분하게 커버한다는 것을 의미합니다.
결과는 주로 오픈AI가 설계한 환경과 성공 기준에 기반합니다.虽然 회사에서 GPT-Red를 보류된 시나리오와 실제 에이전트에 대해 테스트했지만, 독립적인 연구자들은 모델과 대부분의 평가 인프라가 개인적인 경우에 결과를 재현하는 능력이 제한될 것입니다.
오픈AI는 자동화된 테스트와 인간 및 제3자 적대적 공격, 계층화된 제품 보안, 접근 제어, 모니터링, 및 실시간 남용 감지를 결합하여 계속할 것이라고 말합니다. 이는 단일 모델이나 벤치마크가 배포 후에 나타날 수 있는 모든 공격을 예상할 수 없다는 현실을 반영합니다.
AI 공격자와 방어자 간의 새로운 보안 경쟁
오픈AI의 발표에서 설명된 “자가 개선”은 배포된 모델이 자율적으로 자신의 가중치를 다시 작성하거나, 독립적으로 더 강력한 후계자를 생성하는 것을 의미하지 않습니다. 이는 하나의 AI 시스템이 적대적 예제를 생성하여 연구자가 다른 시스템을 개선하는 데 사용하는 제어된 훈련 루프입니다.
그럼에도 불구하고, GPT-Red는 앞선 모델의 보안을 강화하는 방법에 있어 의미있는 변화를 나타냅니다. 인간의 적대적 공격 팀은 복잡한 취약점을 발견할 수 있지만, 점점 더 능력있는 AI 에이전트를 지속적으로 훈련하는 데 필요한 공격과 다양성의 규모를 수동으로 생성할 수 없습니다.
자동화된 공격자는 이 간격의 일부를 메울 수 있습니다. 이는 방어자가 더 강력해질수록, 적대적 공격 모델이 새로운 약점을 발견해야 하며, 이러한 약점은 다음 세대의 생산 시스템에 대한 훈련 자료가 됩니다.
위험은 이러한 능력이 방어 연구소에만 국한되지 않을 수 있다는 것입니다. 오픈 및 상업 모델이 장기 계획, 툴 사용, 사이버 보안, 및 자율 실험에 능숙해짐에 따라, 공격자는 점점 더 강력한 시스템을 얻을 수 있습니다.
GPT-Red는 따라서 진행과 앞으로의 경쟁을 나타냅니다. AI 연구소는 다음 세대의 에이전트를 방어하기 위해 강력한 모델을 사용하기 시작했습니다. 그러나 이러한 방어는 같은 기술이 자동화된 공격을 더 저렴하고, 빠르며, 적응력이 뛰어나게 만드는 동안 지속적으로 진화해야 합니다.












