사이버 보안

오픈AI, 데이브레이크 확장 및 새로운 사이버 보안 모델 출시

mm
Unite.AI를 Google의 선호 소스에 추가

오픈AI는 사이버 보안 프로그램을 두 개의 접근 계층으로 분할하고 새로운 목적 훈련 모델인 GPT-5.6-Cyber를 함께 출시했다고 2026년 8월 10일 발표했다. 데이브레이크 블루는 일반 목적 모델인 GPT-5.6 Sol을 포함하여 승인된 방어자에게 일반적인 보안 작업을 위한 프론티어 모델을 개방하며, 데이브레이크 레드는 새로운 GPT-5.6-Cyber 모델을 취약점 연구, 악성 코드 검증, 보안 테스트를 위한 더 엄격한 검증 뒤에 두고 있다.

이 구조는 오픈AI가 생산에서 관리해 왔던 긴장감을 해결한다. GPT-5.6 Sol에서 실행되는 시스템 수준의 안전 장치들은 사이버 보안 관련 요청을 차단하여 악용을 방지하지만, 이 차단은 합법적인 방어 작업을 차단한다. 데이브레이크 블루는 검증된 사용자에게 이러한 차단을 제거한다. 높은 이중 용도 프롬프트(예: 침투 테스트 생산 시스템)는 여전히 거부되지만, 데이브레이크 블루에서조차도, 여기서 GPT-5.6-Cyber가 등장한다: GPT-5.6 Sol의 버전으로, 고급 사이버 보안 작업에서 거부를 줄이고, 제로데이 취약점 발견 및 악성 코드 체인 개발과 같은 전문 작업을 개선하기 위해 훈련되었다.

평가에서 측정한 내용

새 모델이 얼마나 더 허용적인지 측정하기 위해, 오픈AI는 고급 사이버 보안 완료 率라고 하는 내부 평가를 구축했으며, 악성 코드 체인 개발, 인증 우회, 특권 상승과 같은 시나리오를 포함하는 요청에 대한 모델의 응답 빈도를 측정했다. 이 벤치마크에서, GPT-5.6-Cyber는 95.0%의 요청을 완료하는 반면, 표준 안전 장치下的 GPT-5.6 Sol은 1.5%, 데이브레이크 블루下的 GPT-5.6 Sol은 2.0%를 완료한다. 이전의 목적 훈련 모델인 GPT-5.5-Cyber는 57.3%를 완료했으며, 이는 보안 연구자로부터 지속적인 불만을 유발했다고 회사 측은 밝혔다.

기능 평가에서는 더 세부적인 이야기를 बत는다. ExploitGym에서, 에이전트가 알려진 취약점을 작동하는 악성 코드로 변환하여 제어된 환경에서 코드 실행을 달성할 수 있는지 테스트하는 곳에서, 오픈AI는 GPT-5.6-Cyber가 GPT-5.6 Sol과 GPT-5.5-Cyber를 능가한다고 밝혔다. 회사 내부의 취약점 발견 및 보고서 작성 평가에서, GPT-5.6-Cyber는 GPT-5.5-Cyber보다 개선되었지만 GPT-5.6 Sol보다 낮은 성능을 보였으며, 이는 모델이 더 짧고 자세하지 않은 보고서를 생성한 결과라고 회사 측은 설명했다. ExploitBench에서, 더 어려운 악용 작업에서, V8 샌드박스가 활성화되고 에이전트에게 더少한 정보가 주어지는 경우, 일반 목적의 GPT-5.6 Sol이 표준 300턴 한계 내에서 최고의 성능을 보였으며, 실행이 600턴으로 연장되면 격차가 좁혀진다. 이러한 모든 수치는 벤더가 보고한 것으로, 외부 평가자가 복제하지 않은 내부 벤치마크에서 나온 것이다.

가장 많은 무게를 가진 주장은 벤치마크가 아니다. 오픈AI는 GPT-5.6-Cyber를 사용하여 Chrome 내의 자바스크립트 엔진인 V8를 조사하여, 이전에 알려지지 않은 두 개의 취약점을 발견했으며, 이는 메모리를 손상시키고 V8 힙 샌드박스를 탈출할 수 있는 체인을 형성할 수 있다고 밝혔다. 첫 번째 취약점은 컴파일러 버그로, 건너뛴 안전 점검으로 공격자가 크롬의 샌드박스 내에서 메모리를 읽거나 덮어쓸 수 있는 취약점이었으며, 협조된 공개를 통해 구글에 보고되었으며, 수정되었으며, CVE-2026-15903으로 지정되었다. 또한, 회사 측은 영향을 받은 소프트웨어를 명시하지 않으며, 인기 있는 모바일 운영 체제에서 권한 상승 체인을 포함하여 최소 5개의 취약점과, 원격 코드 실행을 허용하는 인기 있는 데이터베이스에서 3개의 致命 취약점, 및 인기 있는 운영 체제 커널에서 400개 이상의 권한 상승 취약점을 발견했으며, 이러한 취약점은 데이브레이크 파트너와 오픈 소스 유지 관리자와의 공개를 통해 진행 중이라고 밝혔다.

SpecterOps의 CTO인 Jared Atkinson이 모델을 초기에 테스트한 결과를 설명하면서, “이 모델은 이전 모델이 몇 주 동안 간헐적으로 작업을 수행하지 못한 작업을 하루 미만으로 완료했다”고 말했다.

두 계층이 어떻게 관리되는가

두 계층 모두의 접근은 身分 인증, 계정 보안 요구 사항, 모니터링, 승인된 사용 제한, 법적 확인을 통해 이루어지며, 개인과 조직을 위한 별도의 신청 경로가 있다. 오픈AI는 코덱스 코딩 에이전트를 사용하는 데이브레이크 고객을 완전한 접근 모드에서 자동 검토 모드로 전환하고 있으며, 이 모드에서는 승인된 사용자에게 더 높은 권한이 필요한 작업을 실행하기 전에 평가한다. 또한, 2026년 9월 1일부터 모든 개인 데이브레이크 계정에 하드웨어 보안 키를 요구할 계획이다. GPT-5.6-Cyber에 대한 추가 평가가 포함된 시스템 카드는 나중에 계획되어 있다.

오픈AI의 준비도 프레임워크에 따르면, GPT-5.6 Sol과 GPT-5.6-Cyber는 모두 사이버 보안 능력에서 높은 등급을 받았으며, 致命 임계값 아래에 있다. 이 평가 결과는 Unite.AI가 오픈AI의 예정된 Astra 모델이 致命 사이버 보안 임계값을 초과할 수 있다고 보도한 지 며칠 후에 나왔다. 회사 측은 이 발표를 이용하여 이전에 밝힌 내용을 다시 강조했다: GPT-5.6-Cyber는 Hugging Face의 악용에 관여하지 않았으며, 그와 관련된 모델은 출시 예정에 없다.

이번 출시 이전의 데이브레이크 상황

계층 구조는 이전에 확장되어 왔던 프로그램을 통합한다. 오픈AI는 2026년 6월 22일, 데이브레이크 사이버 파트너 프로그램과 함께 GPT-5.5-Cyber의 전체 버전을 출시했으며, 이 프로그램에는 Accenture, CrowdStrike, Cisco, IBM, 및 Palo Alto Networks가 참가했다. 또한, Patch the Planet이라는 오픈 소스 보안 업데이트를 Trail of Bits와 함께 설립했다. 이전 출시에서, 오픈AI는 GPT-5.5-Cyber가 CyberGym에서 85.6%의 성능을 보였으며, GPT-5.5는 81.8%의 성능을 보였으며, ExploitGym에서 39.5%의 성능을 보였으며, GPT-5.5는 25.95%의 성능을 보였다.

6월 22일 게시글에 따르면, 30개 이상의 오픈 소스 프로젝트가 참가하기로 했으며, 초기 5일간의 스프린트에서 수백 개의 문제가 발견되었으며, 수십 개의 패치가 적용되었다. 데이브레이크 블루와 레드는 이전의 단일 트러스트된 접근 트랙을 대체하며, 일반적인 목적의 프론티어 모델과, 거부가 적은 전문 모델을 제공한다:广泛한 방어자들을 위한 일반적인 목적의 프론티어, 완화된 가드레일, 및 악성 코드 개발 및 레드 팀을 위한 더 작은 그룹을 위한 거부가 적은 전문 모델.

Jonas Reeve는 Unite.AI의 AI 생성 분석가로, 인지 AI, 인공 일반 지능(AGI), 기계 지능의 이론적 기초에 중점을 둡니다. 그의 연구는 학습, 추론, 기억, 추상화가 생물학적 및 인공 시스템에서 어떻게 나타나는지 탐구하며, 현대적인 AI 아키텍처와 인지 과학 및 마음의 철학의 오래된 질문 사이의 연결을 그립니다.
개념적이고 반성적인 접근 방식을 통해 Jonas는 추론 모델, 에이전트 시스템, 출현적 인지, 정렬 이론과 같은 프레임워크를 조사하여 AGI로의 진보가 실제로 무엇을 의미하는지 및 무엇을 의미하지 않는지 명확히 합니다. 그는 타임라인이나 호재를 추구하는 대신 첫 번째 원칙, 개념적 엄격성, 현재 모델의 한계를 강조합니다.
Jonas Reeve가 작성한 기사들은 AI로 생성되어 Unite.AI의 편집 팀에 의해 검토되어 고급 AI 개념에 대한 정확성, 명확성, 책임있는 논의를 보장합니다.