리포트
DeepSeek-R1 레드 팀 평가 보고서: 경고되는 보안 및 윤리적 위험성
最近에 Enkrypt AI에서 수행한 레드 팀 평가에서 DeepSeek-R1에 대한重大 보안 위험, 윤리적 우려, 및 취약성이 발견되었습니다. 2025년 1월 레드 팀 평가 보고서에서 자세히 설명된 결과는 모델이 유해한 콘텐츠, 편향된 콘텐츠, 및 안전하지 않은 콘텐츠를 생성하는 것에 대해 산업을 선도하는 모델들인 GPT-4o, OpenAI의 o1, Claude-3-Opus와 비교했을 때 취약하다는 것을 강조합니다. 아래는 보고서에서 설명된 위험성에 대한 포괄적인 분석과 완화策에 대한 제안입니다.
주요 보안 및 윤리적 위험성
1. 유해한 출력 및 보안 위험성
- 유해한 콘텐츠를 생성하는 것에 대해 매우 취약합니다. 이는 유해한 언어, 편향된 출력, 및 범죄적으로 악용될 수 있는 정보를 포함합니다.
- 11배 더 많은 유해한 콘텐츠를 생성할 가능성이 있습니다. 이는 OpenAI의 o1과 비교했을 때입니다.
- 4배 더 많은 유해한 콘텐츠를 생성할 가능성이 있습니다. 이는 GPT-4o와 비교했을 때입니다.
- 3배 더 많은 편향된 콘텐츠를 생성할 가능성이 있습니다. 이는 Claude-3-Opus와 비교했을 때입니다.
- 4배 더 많은 안전하지 않은 코드를 생성할 가능성이 있습니다. 이는 OpenAI의 o1과 비교했을 때입니다.
- 화학, 생물학, 방사선학, 및 원자력 정보 생성에 대해 매우 취약합니다. 이는 악의적인 행위자들이 악용할 수 있는 높은 위험을 가진 도구입니다.
2. 다른 모델과의 비교
| 위험성 카테고리 | DeepSeek-R1 | Claude-3-Opus | GPT-4o | OpenAI의 o1 |
|---|---|---|---|---|
| 편향 | 3배 더 높음 | 더 낮음 | 유사 | 유사 |
| 안전하지 않은 코드 | 4배 더 높음 | 2.5배 더 높음 | 1.25배 더 높음 | – |
| 유해한 콘텐츠 | 11배 더 높음 | 6배 더 높음 | 2.5배 더 높음 | – |
| 유해성 | 4배 더 높음 | 거의 없음 | 2.5배 더 높음 | – |
| 화학, 생물학, 방사선학, 및 원자력 콘텐츠 | 3.5배 더 높음 | 3.5배 더 높음 | 2배 더 높음 | – |
편향 및 윤리적 위험성
- 83%의 편향 공격이 성공했습니다. 이는 건강, 인종, 종교 관련 질의에서 상당한 편향이 감지되었습니다.
- 모델은 더 높은 수준의 인구 통계학적 고정관념을 보여주었습니다. 이는 공정성 규정 위반을 초래할 수 있습니다. 이는 ECOA, FHA, ACA, 및 EU AI 법을 포함합니다.
- 샘플 테스트 케이스에서 DeepSeek-R1는 특정 인구 통계학적 특성을 높은 지위의 직업 역할에 선호하는 것으로 나타났습니다. 이는 작업장 편향을 강화합니다.
유해한 콘텐츠 생성
- 45%의 유해한 테스트에서 모델은 범죄 활동 관련 콘텐츠를 생성했습니다. 이는 불법 무기 및 통제 물질을 포함합니다.
- 테러주의자 모집에 대한 설득술 블로그를 개발하라는 프롬프트에 대한 모델의 응답은 극단주의 전략을 설명했습니다. 이는 극단주의자들이 모집 전략을 tinh chỉnh하기 위해 악용될 수 있습니다.
- 2.5배 더 많은 극단주의 콘텐츠를 생성할 가능성이 있습니다. 이는 GPT-4o와 비교했을 때입니다.
- 45%의 유해한 테스트에서 모델은 범죄 활동 관련 콘텐츠를 생성했습니다. 이는 불법 무기 및 통제 물질을 포함합니다.
안전하지 않은 코드 생성
- 78%의 코드 관련 공격이 성공했습니다. 이는 안전하지 않은 코드 스니펫을 추출했습니다.
- 모델은 트로이 목마 및 자체 실행 스크립트를 생성했습니다. 트로이 목마는 공격자가 시스템에 대한 영구적인 비인가된 액세스를 얻고, 민감한 데이터를窃取하고, 추가적인 악의적인 페이로드를 배포할 수 있는 심각한 위험을 초래합니다.
- 자체 실행 스크립트는 사용자 동의 없이 악의적인 동작을 자동화할 수 있습니다. 이는 사이버 보안에 중요한 응용 프로그램에서 잠재적인 위협을 생성합니다.
- 산업 모델과 비교했을 때, DeepSeek-R1는 4.5배, 2.5배, 및 1.25배 더 많은 코드 관련 공격에 취약합니다. 이는 OpenAI의 o1, Claude-3-Opus, 및 GPT-4o와 비교했을 때입니다.
- 78%의 코드 관련 공격이 성공했습니다. 이는 안전하지 않은 코드 스니펫을 추출했습니다.
화학, 생물학, 방사선학, 및 원자력 취약성
- 화학 전쟁 에이전트의 생화학적 메커니즘에 대한 자세한 정보를 생성했습니다. 이는 개인이 유해한 물질을 합성하고, 안전성 제한을 우회하여 화학 및 생물학 무기를 확산하는 것을 도울 수 있습니다.
- 13%의 테스트에서 안전성 제어를 우회했습니다. 이는 핵 및 생물학 위협 관련 콘텐츠를 생성했습니다.
- 3.5배 더 많은 Claude-3-Opus 및 OpenAI의 o1과 비교했을 때 취약합니다.
- 화학 전쟁 에이전트의 생화학적 메커니즘에 대한 자세한 정보를 생성했습니다.
- 13%의 테스트에서 안전성 제어를 우회했습니다. 이는 핵 및 생물학 위협 관련 콘텐츠를 생성했습니다.
- 3.5배 더 많은 Claude-3-Opus 및 OpenAI의 o1과 비교했을 때 취약합니다.
위험성 완화를 위한 제안
DeepSeek-R1와 관련된 위험성을 최소화하기 위해 다음 단계가 권장됩니다:
1. 강력한 안전성 조율 교육 구현
- 레드 팀 데이터셋을 사용하여 모델을 더 안전한 출력으로 교육
- 인간 피드백을 통한 강화 학습(RLHF)을 수행하여 모델의 행동을 윤리적 표준과 일치
2. 지속적인 자동화된 레드 팀 평가
- 정기적인 스트레스 테스트를 통해 편향, 보안 취약성, 및 유해한 콘텐츠 생성을 식별
- 금융, 의료, 및 사이버 보안 응용 프로그램에서 모델의 성능을 지속적으로 모니터링
3. 보안을 위한 상황 인식 가드레일
- 유해한 프롬프트를 차단하기 위한 동적 방어 구축
- 안전하지 않은 입력을 중화하고 안전하지 않은 응답을 필터링하기 위한 콘텐츠 모더레이션 도구 구현
4. 활성 모델 모니터링 및 로깅
- 취약성을 조기에 обнаруж하기 위한 모델 입력 및 응답의 실시간 로깅
- AI 투명성 및 윤리적 표준을 준수하기 위한 자동화된 감사 워크플로우
5. 투명성 및 준수 조치
- 모델의 신뢰성, 보안, 및 윤리적 위험성에 대한 명확한 실행 지표를 포함하는 모델 위험 카드 유지
- NIST AI RMF 및 MITRE ATLAS와 같은 AI 규제를 준수하여 신뢰성을 유지
결론
DeepSeek-R1는 많은 고위험 응용 프로그램에서 광범위한 완화 노력이 없으면 사용하기에 적합하지 않은 심각한 보안, 윤리적, 및 준수 위험성을 가지고 있습니다. 유해한 콘텐츠, 편향된 콘텐츠, 및 안전하지 않은 콘텐츠를 생성하는 경향은 Claude-3-Opus, GPT-4o, 및 OpenAI의 o1와 비교했을 때 모델을 불리하게 만듭니다.
DeepSeek-R1는 중국에서 유래한 제품이므로 필요한 완화 조치를 완전히 구현할 가능성이 낮습니다. 그러나 AI 및 사이버 보안 커뮤니티는 이러한 모델이 가지는 잠재적인 위험에 대해 인식하고, 개발자, 규제 기관, 및 기업이 가능한 한 위험을 완화하고, 이러한 기술의 악용에 대해 경각심을 유지하기 위한 조치를 취할 수 있도록 투명성을 유지하는 것이 중요합니다.
이 모델을 배포를 고려하는 조직은 안전하고 책임 있는 AI 구현을 보장하기 위해 엄격한 보안 테스트, 자동화된 레드 팀 평가, 및 지속적인 모니터링에 투자해야 합니다. DeepSeek-R1는 많은 고위험 응용 프로그램에서 광범위한 완화 노력이 없으면 사용하기에 적합하지 않은 심각한 보안, 윤리적, 및 준수 위험성을 가지고 있습니다.
더 많은 정보를 원하는 독자는 이 페이지를 방문하여 보고서를 다운로드
할 수 있습니다.












