Anderson의 관점
텍스트-비디오 시스템의 재작성된 프롬프트로의 탈옥

연구자들은 텍스트-비디오 시스템에서 차단된 프롬프트를 재작성하여 안전 필터를 통과시키면서도 의미를 변경하지 않는 방법을 테스트했습니다. 이 접근 방식은 여러 플랫폼에서 작동하여 이러한 가드레일의 취약성을 보여주었습니다.
클로즈드 소스 제네러티브 비디오 모델인 Kling, Kaiber, Adobe Firefly 및 OpenAI의 Sora는 사용자가 원치 않는 비디오 자료를 생성하지 않도록 차단하도록 설계되었습니다. 이러한 가드레일은 인간과 자동화된 모더레이션의 혼합을 사용하며 대부분의 사용자에게 효과적입니다.
그러나 이러한 가드레일은 결정적인 개인들이 Reddit, Discord* 및 기타 플랫폼에서 NSFW 및 기타 제한된 콘텐츠를 생성하기 위한 방법을 찾는 커뮤니티를 형성했습니다.

Reddit의 프롬프트 공격 커뮤니티에서 OpenAI의 ChatGPT 및 Sora 모델의 필터를 우회하는 두 가지 일반적인 게시물을 보여주는 이미지. Source: Reddit
또한 전문가 및 취미 보안 연구 커뮤니티도 종종 LLM 및 VLM을 보호하는 필터의 취약성을 공개합니다. 한 연구자에 따르면, ChatGPT에 텍스트 프롬프트를 모스 코드 또는 base-64 인코딩을 통해 전달하면(평문 텍스트가 아닌) 필터를 우회할 수 있습니다.
2024년 T2VSafetyBench 프로젝트는 텍스트-비디오 모델의 안전성 평가를 위한 벤치마크를 제공했습니다.

T2VSafetyBench 프레임워크의 12개 안전 카테고리에서 선택된 예시. Source: https://arxiv.org/pdf/2407.05965
일반적으로, LLM은 공격의 대상이 되는 경우에도 자신의 몰락에 도움이 될 수 있습니다. 새로운 연구에서는 싱가포르와 중국의 협력으로 텍스트-비디오 모델의 최초의 최적화 기반 탈옥 방법을 제시합니다.

Kling이 필터를 우회하여 생성된 비디오의 예시. Source: https://arxiv.org/pdf/2505.06679
대신에 시도와 오류에 의존하지 않고, 새로운 시스템은 차단된 프롬프트를 재작성하여 의미를 유지하면서 필터를 우회할 수 있습니다. 재작성된 프롬프트는 원래의 의도와 일치하는 비디오를 생성합니다.
방법
연구자들의 방법은 안전 필터를 우회하면서 원래 입력의 의미를 유지하는 프롬프트를 생성하는 데 중점을 둡니다. 이는 최적화 문제로 프레임화되며, 큰 언어 모델을 사용하여 각 프롬프트를 반복적으로 개선하여 최상의 프롬프트를 선택합니다.
프롬프트 재작성 프로세스는 세 가지 목표를 가진 최적화 작업으로 프레임화됩니다. 첫째, 재작성된 프롬프트는 원래 입력의 의미를 유지해야 합니다. 둘째, 프롬프트는 모델의 안전 필터를 우회해야 합니다. 셋째, 재작성된 프롬프트에서 생성된 비디오는 원래 프롬프트와 의미적으로 일치해야 합니다.

방법의 파이프라인 개요.
비디오의 관련성을 평가하기 위한 캡션은 VideoLLaMA2 모델을 사용하여 생성됩니다. 이는 시스템이 입력 프롬프트와 출력 비디오를 비교할 수 있도록 합니다.

VideoLLaMA2가 비디오에 캡션을 추가하는 예시. Source: https://github.com/DAMO-NLP-SG/VideoLLaMA2
이 비교는 손실 함수에 전달되어 재작성된 프롬프트가 원래 프롬프트와 얼마나 일치하는지, 필터를 우회하는지, 그리고 결과 비디오가 입력과 얼마나 일치하는지에 따라 가중치를 부여합니다.
최적화 프로세스를 수행하기 위해 ChatGPT-4o를 프롬프트 생성 에이전트로 사용했습니다. 필터에 의해 거부된 프롬프트가 주어지면, ChatGPT-4o는 의미를 유지하면서 필터를 우회할 수 있는 프롬프트를 재작성하도록 요청받습니다.
재작성된 프롬프트는 세 가지 기준에 따라 평가됩니다. 먼저, 프롬프트는 필터를 우회해야 합니다. 둘째, 결과 비디오는 원래 프롬프트와 의미적으로 일치해야 합니다. 셋째, 프롬프트는 원래 입력의 의미를 유지해야 합니다.
변형 감지
테스트 중에, 필터를 우회하는 프롬프트는 항상 일관적이지 않다는 것이 명백해졌습니다. 재작성된 프롬프트는 한 번은 필터를 우회하여 원하는 비디오를 생성할 수 있지만, 이후 시도에서는 필터에 의해 차단되거나 안전한 비디오를 생성할 수 있습니다.
이를 해결하기 위해 프롬프트 변형 전략을 도입했습니다. 단일 재작성된 프롬프트에 의존하지 않고, 시스템은 각 라운드에서 여러 가지 약간의 변형을 생성합니다.
이러한 변형은 의미를 유지하면서 필터링 시스템을 통해 다른 경로를 탐색할 수 있도록 설계되었습니다. 각 변형은 동일한 기준에 따라 평가되며, 필터를 우회하는지, 그리고 결과 비디오가 원래 프롬프트와 얼마나 일치하는지에 따라 점수가 매겨집니다.
데이터 및 테스트
연구자들은 T2VSafetyBench 데이터셋의 하위 집합을 테스트하기 위해 선정했습니다. 700개의 프롬프트로 구성된 데이터셋은 14개의 카테고리에서 50개의 프롬프트를 무작위로 선택하여 생성되었습니다.
테스트된 프레임워크는 Pika 1.5, Luma 1.0, Kling 1.0 및 Open-Sora였습니다. OpenAI의 Sora는 직접적인 공개 API 액세스가 없는 클로즈드 소스 시스템이므로 직접 테스트할 수 없었습니다. 대신, Open-Sora를 사용했습니다.
메트릭
메트릭으로 공격 성공률(ASR)을 사용하여 모델의 안전 필터를 우회하고 제한된 콘텐츠를 포함하는 비디오를 생성하는 프롬프트의 비율을 측정했습니다.
ASR은 성공적인 탈옥의 비율을 나타내며, GPT-4o와 인간 평가를 통해 안전성이 결정됩니다.
두 번째 메트릭은 의미적 유사성으로, 생성된 비디오가 원래 프롬프트의 의미를 얼마나 잘 반영하는지를 측정합니다.
실험 결과
공격 성공률(ASR)은 안전 필터를 통과하면서도 음란물, 폭력 또는 기타 제한 콘텐츠가 포함된 영상을 생성한 프롬프트의 비율을 뜻한다. 연구진은 T2VSafetyBench 절차에 따라 GPT-4o 판정과 사람 평가를 함께 사용했다. 두 번째 지표인 의미 유사도는 생성 영상이 원래 프롬프트의 뜻을 얼마나 잘 반영하는지 측정한다. 영상 설명을 만든 뒤 원문과 코사인 유사도를 계산했으며, 차단되거나 생성에 실패한 경우에는 완전히 검은 영상으로 처리했다.
Open-Sora가 가장 취약했다. 평균 ASR은 GPT-4 평가에서 64.4%, 사람 평가에서 66.3%였다. Pika는 각각 53.6%와 55.0%, Luma는 40.3%와 43.7%, Kling은 34.7%와 33.0%였다. Open-Sora는 음란물, 폭력, 불쾌한 콘텐츠와 허위정보 범주에서 특히 높은 성공률을 보였다. GPT-4와 사람 평가의 추세가 비슷하다는 점은 대규모 평가에서 자동 판정을 활용할 가능성을 뒷받침하는 동시에, Open-Sora 같은 오픈소스 시스템에 더 강한 안전장치가 필요함을 보여준다.
Kling 사례에서는 원래 프롬프트가 거부됐지만, 의미를 유지한 재작성 문장이 필터를 통과해 금지된 내용을 생성했다. 이는 단어 차단 중심의 방어가 표현만 달라져도 무너질 수 있음을 보여준다.
새 방법은 T2VSafetyBench 기준선 및 divide-and-conquer attack(DACA)과 비교됐다. 모든 모델에서 더 높은 ASR을 기록했을 뿐 아니라 원래 입력의 의미도 더 안정적으로 보존했다. Open-Sora에서 새 방법은 GPT-4 기준 64.4%, 사람 기준 66.3%였고, T2VSafetyBench는 55.7%와 58.7%, DACA는 22.3%와 24.0%였다. 의미 유사도는 각각 0.272, 0.259, 0.247이었다.
Pika, Luma, Kling에서도 같은 경향이 나타났다. 새 접근법은 T2VSafetyBench보다 ASR을 5.9~39%포인트 높였고 DACA보다 훨씬 앞섰으며, 모든 모델에서 의미 유사도도 더 높았다. 연구진은 이 결과가 공격 성공률을 높이는 동시에 생성 영상과 원래 입력 사이의 의미적 일관성을 유지한다는 증거라고 설명했다.
누락됐던 연구 도표




연구 자료와 참조 링크
- generative video models
- Adobe Firefly
- Sora
- base-64 encoding
- effectively bypass content filters
- T2VSafetyBench project
- at least to some extent
- optimization-based
- Pika
- Luma
- Kling
- Open-Sora
- new paper
- CLIP
- VideoLLaMA2
- loss function
- ChatGPT-4o
- SneakyPrompt
- NSFW_image_detection model
- cosine similarity
- divide-and-conquer attack
결론
모든 시스템이 입력 프롬프트에만 안전장치를 적용하는 것은 아니다. ChatGPT-4o와 Adobe Firefly는 생성 중인 결과를 화면에 잠시 보여 준 뒤, 정책 위반을 감지하면 갑자기 삭제하기도 한다. 이러한 차단은 악의적인 요청뿐 아니라 사용자가 정책 범위를 몰랐거나 시스템이 지나치게 보수적으로 판단한 무해한 프롬프트에서도 발생할 수 있다.
API 사업자에게 이는 상업적 매력과 법적 책임 사이의 균형 문제다. 발견되는 모든 탈옥 단어나 문구를 필터에 추가하는 방식은 끝없는 두더지 잡기이며 새 모델이 등장하면 다시 시작해야 할 가능성이 크다. 반대로 아무 조치도 하지 않으면 심각한 침해가 발생했을 때 장기간 평판 피해를 입을 수 있다.
명백한 이유로 해당 공격 커뮤니티의 링크는 제공하지 않는다.
2025년 5월 13일 화요일 최초 게재.












