Anderson의 관점
텍스트-비디오 시스템의 재작성된 프롬프트로의 탈옥

연구자들은 텍스트-비디오 시스템에서 차단된 프롬프트를 재작성하여 안전 필터를 통과시키면서도 의미를 변경하지 않는 방법을 테스트했습니다. 이 접근 방식은 여러 플랫폼에서 작동하여 이러한 가드레일의 취약성을 보여주었습니다.
클로즈드 소스 제네러티브 비디오 모델인 Kling, Kaiber, Adobe Firefly 및 OpenAI의 Sora는 사용자가 원치 않는 비디오 자료를 생성하지 않도록 차단하도록 설계되었습니다. 이러한 가드레일은 인간과 자동화된 모더레이션의 혼합을 사용하며 대부분의 사용자에게 효과적입니다.
그러나 이러한 가드레일은 결정적인 개인들이 Reddit, Discord* 및 기타 플랫폼에서 NSFW 및 기타 제한된 콘텐츠를 생성하기 위한 방법을 찾는 커뮤니티를 형성했습니다.

Reddit의 프롬프트 공격 커뮤니티에서 OpenAI의 ChatGPT 및 Sora 모델의 필터를 우회하는 두 가지 일반적인 게시물을 보여주는 이미지. Source: Reddit
또한 전문가 및 취미 보안 연구 커뮤니티도 종종 LLM 및 VLM을 보호하는 필터의 취약성을 공개합니다. 한 연구자에 따르면, ChatGPT에 텍스트 프롬프트를 모스 코드 또는 base-64 인코딩을 통해 전달하면(평문 텍스트가 아닌) 필터를 우회할 수 있습니다.
2024년 T2VSafetyBench 프로젝트는 텍스트-비디오 모델의 안전성 평가를 위한 벤치마크를 제공했습니다.

T2VSafetyBench 프레임워크의 12개 안전 카테고리에서 선택된 예시. Source: https://arxiv.org/pdf/2407.05965
일반적으로, LLM은 공격의 대상이 되는 경우에도 자신의 몰락에 도움이 될 수 있습니다. 새로운 연구에서는 싱가포르와 중국의 협력으로 텍스트-비디오 모델의 최초의 최적화 기반 탈옥 방법을 제시합니다.

Kling이 필터를 우회하여 생성된 비디오의 예시. Source: https://arxiv.org/pdf/2505.06679
대신에 시도와 오류에 의존하지 않고, 새로운 시스템은 차단된 프롬프트를 재작성하여 의미를 유지하면서 필터를 우회할 수 있습니다. 재작성된 프롬프트는 원래의 의도와 일치하는 비디오를 생성합니다.
방법
연구자들의 방법은 안전 필터를 우회하면서 원래 입력의 의미를 유지하는 프롬프트를 생성하는 데 중점을 둡니다. 이는 최적화 문제로 프레임화되며, 큰 언어 모델을 사용하여 각 프롬프트를 반복적으로 개선하여 최상의 프롬프트를 선택합니다.
프롬프트 재작성 프로세스는 세 가지 목표를 가진 최적화 작업으로 프레임화됩니다. 첫째, 재작성된 프롬프트는 원래 입력의 의미를 유지해야 합니다. 둘째, 프롬프트는 모델의 안전 필터를 우회해야 합니다. 셋째, 재작성된 프롬프트에서 생성된 비디오는 원래 프롬프트와 의미적으로 일치해야 합니다.

방법의 파이프라인 개요.
비디오의 관련성을 평가하기 위한 캡션은 VideoLLaMA2 모델을 사용하여 생성됩니다. 이는 시스템이 입력 프롬프트와 출력 비디오를 비교할 수 있도록 합니다.

VideoLLaMA2가 비디오에 캡션을 추가하는 예시. Source: https://github.com/DAMO-NLP-SG/VideoLLaMA2
이 비교는 손실 함수에 전달되어 재작성된 프롬프트가 원래 프롬프트와 얼마나 일치하는지, 필터를 우회하는지, 그리고 결과 비디오가 입력과 얼마나 일치하는지에 따라 가중치를 부여합니다.
최적화 프로세스를 수행하기 위해 ChatGPT-4o를 프롬프트 생성 에이전트로 사용했습니다. 필터에 의해 거부된 프롬프트가 주어지면, ChatGPT-4o는 의미를 유지하면서 필터를 우회할 수 있는 프롬프트를 재작성하도록 요청받습니다.
재작성된 프롬프트는 세 가지 기준에 따라 평가됩니다. 먼저, 프롬프트는 필터를 우회해야 합니다. 둘째, 결과 비디오는 원래 프롬프트와 의미적으로 일치해야 합니다. 셋째, 프롬프트는 원래 입력의 의미를 유지해야 합니다.
변형 감지
테스트 중에, 필터를 우회하는 프롬프트는 항상 일관적이지 않다는 것이 명백해졌습니다. 재작성된 프롬프트는 한 번은 필터를 우회하여 원하는 비디오를 생성할 수 있지만, 이후 시도에서는 필터에 의해 차단되거나 안전한 비디오를 생성할 수 있습니다.
이를 해결하기 위해 프롬프트 변형 전략을 도입했습니다. 단일 재작성된 프롬프트에 의존하지 않고, 시스템은 각 라운드에서 여러 가지 약간의 변형을 생성합니다.
이러한 변형은 의미를 유지하면서 필터링 시스템을 통해 다른 경로를 탐색할 수 있도록 설계되었습니다. 각 변형은 동일한 기준에 따라 평가되며, 필터를 우회하는지, 그리고 결과 비디오가 원래 프롬프트와 얼마나 일치하는지에 따라 점수가 매겨집니다.
데이터 및 테스트
연구자들은 T2VSafetyBench 데이터셋의 하위 집합을 테스트하기 위해 선정했습니다. 700개의 프롬프트로 구성된 데이터셋은 14개의 카테고리에서 50개의 프롬프트를 무작위로 선택하여 생성되었습니다.
테스트된 프레임워크는 Pika 1.5, Luma 1.0, Kling 1.0 및 Open-Sora였습니다. OpenAI의 Sora는 직접적인 공개 API 액세스가 없는 클로즈드 소스 시스템이므로 직접 테스트할 수 없었습니다. 대신, Open-Sora를 사용했습니다.
메트릭
메트릭으로 공격 성공률(ASR)을 사용하여 모델의 안전 필터를 우회하고 제한된 콘텐츠를 포함하는 비디오를 생성하는 프롬프트의 비율을 측정했습니다.
ASR은 성공적인 탈옥의 비율을 나타내며, GPT-4o와 인간 평가를 통해 안전성이 결정됩니다.
두 번째 메트릭은 의미적 유사성으로, 생성된 비디오가 원래 프롬프트의 의미를 얼마나 잘 반영하는지를 측정합니다.
결론
시스템은 공격 성공률과 의미적 유사성을 평가했습니다. 결과는 T2VSafetyBench와 divide-and-conquer attack(DACA)와 비교하여 새로운 접근 방식의 우수성을 보여주었습니다.
연구자들은 이 결과가 텍스트-비디오 모델의 안전성 메커니즘을 강화할 필요성을 강조합니다.
또한, 연구자들은 이 방법이 공격 성공률을 향상시키면서도 생성된 비디오가 원래 프롬프트와 의미적으로 일치하는 것을 보장한다고 주장합니다.












