Anderson의 관점

AI 모델의 검열은 잘 작동하지 않는다, 연구 결과가 밝히다

mm
Unite.AI를 Google의 선호 소스에 추가
ChatGPT-4o, Krita (Flux/Flux Koncept Dev), Firefly.

AI 이미지 생성기를 검열하기 위해 훈련된 모델에서 금지된 콘텐츠(예: 포르노, 폭력, 저작권 있는 스타일)를 삭제하는 시도가 부족한 것으로 나타났습니다. 새로운 연구에 따르면 현재의 개념 삭제 방법은 금지된 속성이 무관련한 이미지에 유출되는 것을 허용하며, 또한 삭제된 콘텐츠의 밀접한 버전이 나타나는 것을 방지하지 못합니다.

 

기반 AI 모델을 만드는 기업은 모델이 부적절하거나 불법적인 콘텐츠를 생성하지 못하도록 막지 못하면 기소되거나 폐쇄될 수 있습니다. 반면 모델을 API로만 제공하는 업체는 사용자의 프롬프트와 결과물을 모두 검사하고 정제할 수 있기 때문에 모델이 생성하는 콘텐츠를 직접 걱정할 필요가 적습니다.

Adobe의 Firefly 시스템, Photoshop와 같은 도구에서 사용됨, 생성 요청을 즉시 차단하거나 생성 후 검토 후 결과를 차단합니다. 이와 같은 중간 거부는 ChatGPT에서도 발생할 수 있습니다.

Adobe의 Firefly 시스템, Photoshop와 같은 도구에서 사용됨, 생성 요청을 즉시 차단하거나 생성 후 검토 후 결과를 차단합니다. 이와 같은 중간 거부는 ChatGPT에서도 발생할 수 있습니다.

그러나, 이러한 API 스타일의 필터는 일반적으로 로컬에 설치된 모델에서 중화될 수 있습니다. 이는 사용자가 모델을 사용자 정의하기 위해 로컬에서 데이터에 대한 훈련을 수행할 수 있기 때문입니다.

대부분의 경우, 이러한 작업을 비활성화하는 것은 Python에서 함수 호출을 주석 처리하는 것과 같이 간단합니다. 그러나, 이러한 해킹은 일반적으로 프레임워크 업데이트 후에 반복되거나 재창조되어야 합니다.

비즈니스 관점에서, 이것이 문제가 되는 이유를 이해하기는 어렵습니다. API 접근 방식은 사용자 워크플로우에 대한 기업의 통제를 최대화하기 때문입니다. 그러나, 사용자 관점에서, API 전용 모델의 비용과 잘못된 또는 과도한 검열의 위험은 사용자를 오픈 소스 대안의 로컬 설치로 유도할 것입니다. 특히, FOSS 라이선스가 유리한 경우입니다.

Stable Diffusion V1.5는 자체 검열을 시도하지 않은 채 출시된 마지막 주요 모델로, 출시된 지 거의 3년이 됐습니다. 이후 모델의 학습 데이터에 CSAM이 포함됐다는 사실이 드러나면서 사용을 금지해야 한다는 요구가 커졌고, 결국 2024년 Hugging Face 저장소에서 삭제됐습니다.

검열!

비판가들은 로컬에서 설치할 수 있는 생성적 AI 모델의 검열에 대한 회사의 관심은 법적 책임에 대한 우려에 기반한 것이라고 주장합니다. 즉, 회사의 프레임워크가 불법 또는 부적절한 콘텐츠를 생성하는 데 사용될 경우, 회사는 기소되고 폐쇄될 수 있습니다.

실제로, 일부 ‘로컬 친화적’ 오픈 소스 모델은 검열을 해제하기가 쉽습니다(예: Stable Diffusion 1.5 및 DeepSeek R1).

반면, Black Forest Lab의 Flux Kontext 모델 시리즈는 회사의 모델 전체에 대한 검열에 대한 노력으로 특징지어졌습니다. 이는 데이터 큐레이션과 훈련 후 모델의 미세 조정을 통해 달성되었습니다.

이 분야에서 연구의 초점은 지난 2-3년 동안 모델의 후처리 수정에 있었습니다. 이러한 시도에는 UCE, RECE, MACE, SPM이 포함됩니다.

2024년 논문 'Unified Concept Editing in Diffusion Models'은 텍스트-이미지 모델에서 다중 개념 편집을 위한 닫힌 형식 편집을 제공했습니다. 그러나, 이 방법은 검증을 받았는가?

2024년 논문 ‘Unified Concept Editing in Diffusion Models’은 텍스트-이미지 모델에서 다중 개념 편집을 위한 닫힌 형식 편집을 제공했습니다. 그러나, 이 방법은 검증을 받았는가?

이 접근 방식은 효율적이지만, 필수는 아닙니다. 새로운 미국 연구에 따르면, 이러한 편집 절차는 잘 작동하지 않는다고 합니다.

연구자들은 이러한 개념 삭제 기술(CET)이 일반적으로 쉽게 우회될 수 있으며, 효과적인 경우에도 상당한 부작용이 있음을 발견했습니다.

텍스트-이미지 모델에서 개념 삭제의 효과. 각 열은 프롬프트와 삭제된 개념을 표시하며, 편집 전후의 생성된 출력을 표시합니다. 계층 구조는 개념 간의 부모-자식 관계를 나타냅니다. 예제는 일반적인 부작용을 강조합니다.

텍스트-이미지 모델에서 개념 삭제의 효과. 각 열은 프롬프트와 삭제된 개념을 표시하며, 편집 전후의 생성된 출력을 표시합니다. 계층 구조는 개념 간의 부모-자식 관계를 나타냅니다. 예제는 일반적인 부작용을 강조합니다.

연구자들은 이러한 기술이 조합 프롬프트(예: ‘빨간 자동차’ 또는 ‘작은 나무 의자’); 삭제된 개념의 하위 클래스(예: ‘자동차’ 또는 ‘버스’); 그리고 삭제된 개념의 속성 유출(예: ‘파란 소파’를 삭제하면 다른 객체가 파란색으로 생성됨)을 차단하지 못한다는 것을 발견했습니다.

테스트의 80% 이상에서, 광범위한 개념(예: ‘차량’)을 삭제하면 모델이 더 구체적인 차량 인스턴스(예: 자동차 또는 버스)를 생성하는 것을 막지 못했습니다.

편집은 또한 모델의 출력 품질을 약화시키는 주의를 산란시킵니다.

연구자들은 삭제된 관련 개념을 하나씩 삭제하는 것이 모두 삭제하는 것보다 더 효과적임을 발견했습니다. 그러나, 이는 연구에서 조사한 편집 방법의 모든 결함을 제거하지는 못했습니다.

진행적이고 한 번에 삭제하는 전략의 비교. '테디 베어'의 모든 변형을 동시에 삭제하면 모델이 여전히 테디 베어와 같은 객체를 생성합니다. 반면, 변형을 하나씩 삭제하면 모델이 대상 개념을 더 신뢰성 있게 억제합니다.

진행적이고 한 번에 삭제하는 전략의 비교. ‘테디 베어’의 모든 변형을 동시에 삭제하면 모델이 여전히 테디 베어와 같은 객체를 생성합니다. 반면, 변형을 하나씩 삭제하면 모델이 대상 개념을 더 신뢰성 있게 억제합니다.

연구자들은 현재 이러한 문제에 대한 해결책을 제공할 수 없지만, 모델이 예상대로 작동하는지 여부를 이해하는 데 도움이 될 수 있는 새로운 데이터셋과 벤치마크를 개발했습니다.

연구진은 다음과 같이 설명합니다.

‘이전 평가에서는 단지 몇 개의 대상 및 보존 클래스만을 고려했습니다. 예를 들어, ‘차량’을 삭제하는 경우, 모델이 차량을 생성하는 능력만을 테스트합니다. 우리는 이 접근 방식이 근본적으로 불충분하다는 것을 보여주며, 개념 삭제 평가에서는 더 포괄적이어야 합니다.’

‘우리는 다양한 데이터셋을 도입하여 조합 변형과 관련된 효과를 체계적으로 분석하고, 개념 삭제의 상당한 제한과 부작용을 발견했습니다. 우리의 벤치마크는 모델에 구애받지 않으며, 쉽게 통합할 수 있으며, 새로운 개념 삭제 기술의 개발을 지원하기에 적합합니다.’

CET가 대상 개념 '새'를 삭제하지만, 조합 변형 '빨간 새'를 삭제하지 못합니다. '파란 소파'를 삭제한 후, 모든 방법이 파란 의자를 생성하지 못합니다. 성공한 결과는 녹색 체크 표시로 표시되며, 실패한 결과는 빨간 엑스 표시로 표시됩니다.

CET가 대상 개념 ‘새’를 삭제하지만, 조합 변형 ‘빨간 새’를 삭제하지 못합니다. ‘파란 소파’를 삭제한 후, 모든 방법이 파란 의자를 생성하지 못합니다. 성공한 결과는 녹색 체크 표시로 표시되며, 실패한 결과는 빨간 엑스 표시로 표시됩니다.

연구는 모델의 잠재 공간에 훈련된 개념이 어떻게 얽혀 있는지, 그리고 개념 삭제가 얼마나 어려운지에 대한 흥미로운 통찰력을 제공합니다.

새로운 논문은 확산 모델에서 개념 삭제의 부작용이라고 제목이 붙여졌으며, 메릴랜드 대학교의 4명의 연구자에 의해 수행되었습니다.

방법과 데이터

연구자들은 이전 연구에서 개념 삭제 주장을 충분히 입증하지 못했다고 주장합니다.

‘삭제 주장은 더 강력하고 포괄적인 평가를 필요로 합니다. 예를 들어, ‘차량’을 삭제하는 경우, ‘차’ 또는 ‘빨간 차’와 같은 하위 개념과 조합 개념도 삭제되어야 합니다.

‘그러나, 이러한 개념 계층과 구성성은 기존 평가 프로토콜에서 고려되지 않았습니다. 기존 프로토콜은 단지 삭제된 개념의 정확성만을 중점으로 두었습니다.’

연구자들은 향후 프로젝트에 대한 벤치마크 데이터를 제공하기 위해 Side Effect Evaluation(SEE) 데이터셋을 생성했습니다. 이는 텍스트 프롬프트의 큰 컬렉션으로, 개념 삭제 방법이 얼마나 잘 작동하는지 테스트하기 위한 것입니다.

프롬프트는 객체를 크기, 색상, 재질의 속성으로 설명하는 단순한 템플릿을 따릅니다. 예를 들어, 작은 빨간 나무 자동차입니다.

객체는 MS-COCO 데이터셋에서 가져오며, 상위 클래스(예: 차량)와 하위 클래스(예: 차 또는 버스)의 계층 구조로 구성됩니다. 이 구조는 다양한 의미 수준에서 삭제를 테스트할 수 있도록 합니다.

각 프롬프트는 예/아니요 질문과 함께 제공되며, 이미지 분류 모델에 대한 클래스 레이블로도 사용됩니다.

SEE 데이터셋에서 크기, 색상, 재질 속성을 변경하여 생성된 프롬프트 조합.

SEE 데이터셋에서 크기, 색상, 재질 속성을 변경하여 생성된 프롬프트 조합.

연구자들은 두 가지 평가 방법을 사용하여 각 개념 삭제 방법의 성능을 측정했습니다. 하나는 삭제된 개념이 여전히 생성된 이미지에 나타나는지 추적하는 대상 정확도입니다. 다른 하나는 모델이 삭제되지 않은 콘텐츠를 계속 생성하는지 추적하는 보존 정확도입니다.

두 점수의 균형은 방법이 금지된 개념을 성공적으로 삭제하면서 모델의 더 넓은 출력을 손상시키지 않는지 여부를 나타냅니다.

연구자들은 세 가지 실패 모드를 평가했습니다. 첫 번째는 삭제된 개념이 근처 또는 무관련 개념을 어떻게 방해하는지 측정했습니다. 두 번째는 삭제된 개념의 하위 클래스나 조합 변형을 프롬프트로 사용하여 삭제를 우회할 수 있는지 테스트했습니다.

마지막으로, 삭제된 개념의 속성이 다른 객체에 유출되는지 확인했습니다(예: ‘소파’를 삭제하면 다른 객체가 소파의 색상이나 재질을 상속받을 수 있습니다).

테스트

테스트된 이전 프레임워크는 UCE, RECE, MACE, SPM이었습니다. 연구자들은 원래 프로젝트의 기본 설정을 사용하고, 모든 모델을 NVIDIA RTX 6000 GPU에서 48GB의 VRAM과 함께 미세 조정했습니다.

Stable Diffusion 1.4는 테스트에 사용된 가장 오래된 모델 중 하나였습니다. 이는 초기 SD 모델이 거의 또는 전혀 개념적 제약이 없었기 때문입니다.

SEE 데이터셋의 각 프롬프트는 수정되지 않은 모델과 수정된 모델의 두 버전으로 실행되었습니다. 각 프롬프트는 고정된 난수 시드를 사용하여 4개의 이미지를 생성했습니다. 이는 삭제 효과가 여러 출력에 걸쳐 일관성이 있는지 테스트하기 위해 사용되었습니다. 각 수정된 모델은 총 20,224개의 이미지를 생성했습니다.

보존된 개념의 존재는 이전의 텍스트-이미지 삭제 절차에 대한 방법을 사용하여 평가되었습니다. VQA 모델인 BLIP, QWEN 2.5 VL, Florence-2base를 사용했습니다.

인접한 개념에 대한 영향

첫 번째 테스트는 삭제된 개념이 근처의 개념에 영향을 미치는지 측정했습니다. 예를 들어, ‘차’를 삭제하면 모델이 ‘빨간 차’ 또는 ‘큰 차’를 생성하지 않아야 하지만, 관련된 개념인 ‘버스’ 또는 ‘트럭’, 그리고 무관련한 개념인 ‘포크’를 생성해야 합니다.

분석은 CLIP 임베딩 유사성과 속성 기반 편집 거리를 사용하여 삭제된 대상과 얼마나 가까운지 추정했습니다.

대상 정확도(왼쪽)와 보존 정확도(오른쪽)를 의미적 유사성(상단)과 구성적 거리(하단)와 함께 플로팅한 결합된 결과. 이상적인 개념 삭제 방법은 모든 거리에서 낮은 대상 정확도와 높은 보존 정확도를 나타낼 것입니다. 그러나, 결과는 현재 기술이 깨끗하게 일반화되지 못하고, 근처의 개념이 불충분하게 삭제되거나 과도하게 방해받는다는 것을 보여줍니다.

대상 정확도(왼쪽)와 보존 정확도(오른쪽)를 의미적 유사성(상단)과 구성적 거리(하단)와 함께 플로팅한 결합된 결과. 이상적인 개념 삭제 방법은 모든 거리에서 낮은 대상 정확도와 높은 보존 정확도를 나타낼 것입니다. 그러나, 결과는 현재 기술이 깨끗하게 일반화되지 못하고, 근처의 개념이 불충분하게 삭제되거나 과도하게 방해받는다는 것을 보여줍니다.

이 결과에 대해 연구진은 다음과 같이 설명합니다.

‘모든 CET는 대상 개념을 삭제했음에도 불구하고, 조합 또는 의미적으로 먼 변형을 계속 생성합니다. 이는 이상적으로 발생해서는 안 됩니다. UCE는 다른 CET 방법보다 [보존 집합]에서 더 높은 정확도를 일관되게 달성하여, 의미적으로 관련된 개념에 대한 최소한의 의도하지 않은 영향을 나타냅니다.’

‘반면, SPM은 가장 낮은 정확도를 달성하여, 개념 유사성에 대한 편집 전략이 더 취약하다는 것을 시사합니다.’

테스트된 네 가지 방법 중, RECE는 대상 개념을 차단하는 데 가장 효과적이었습니다. 그러나, 위의 이미지의 왼쪽에 표시된 바와 같이, 모든 방법이 조합 변형을 차단하지 못했습니다. ‘새’를 삭제한 후, 모델은 여전히 빨간 새를 생성했습니다. 이는 개념이 부분적으로 여전히 존재한다는 것을 의미합니다.

‘파란 소파’를 삭제하면 모델이 파란 의자를 생성하지 못하게 되며, 이는 근처의 개념에 손상을 입힌다는 것을 나타냅니다.

RECE는 조합 변형을 더 잘 처리했으며, UCE는 관련된 개념을 보존하는 데 더 잘 작동했습니다.

삭제 침입

삭제 우회 테스트는 모델이 상위 클래스를 삭제한 후에도 하위 클래스 개념을 생성할 수 있는지 평가했습니다. 예를 들어, ‘차량’을 삭제하면 모델은 여전히 ‘자전거’ 또는 ‘빨간 차’를 생성할 수 있어야 합니다.

프롬프트는 직접적인 하위 클래스와 조합 변형을 모두 대상으로 하여, 개념 삭제 작업이 전체 계층 구조를 진정으로 삭제했는지, 또는 더 구체적인 설명을 통해 우회할 수 있는지 확인했습니다.

Stable Diffusion v1.4에서 삭제된 상위 클래스의 하위 클래스와 조합 변형을 통해 우회. 더 높은 정확도는 더 큰 우회를 나타냅니다.

Stable Diffusion v1.4에서 삭제된 상위 클래스의 하위 클래스와 조합 변형을 통해 우회. 더 높은 정확도는 더 큰 우회를 나타냅니다.

수정되지 않은 모델은 모든 상위 클래스에서 높은 정확도를 유지하여, 실제로 대상 개념을 삭제하지 않았음을 확인했습니다. CET 중에서 MACE는 가장 낮은 하위 클래스 정확도를 보였으며, 테스트된 대부분의 카테고리에서 가장 낮은 하위 클래스 정확도를 달성했습니다. RECE도 잘 작동했으며, 특히 ‘악세사리’, ‘스포츠’, ‘전자’ 그룹에서 잘 작동했습니다.

반면, UCE와 SPM은 더 높은 하위 클래스 정확도를 보였으며, 삭제된 개념을 관련된 또는 중첩된 프롬프트를 통해 우회할 수 있음을 나타냅니다.

연구진은 다음과 같이 설명합니다.

‘모든 CET는 대상 상위 클래스 개념(‘음식’)을 성공적으로 억제합니다. 그러나, 음식 계층 구조의 속성 기반 자식(‘큰 피자’)을 프롬프트로 사용하면, 모든 방법이 음식 항목을 생성합니다.’

“마찬가지로 ‘차량’ 범주에서는 모든 모델이 자전거를 생성합니다. 이는 ‘차량’을 삭제했는데도 모델이 여전히 차량과 관련된 개념을 생성할 수 있음을 보여줍니다.”

속성 유출

세 번째 테스트는 삭제된 개념의 속성이 다른 객체에 유출되는지 확인했습니다.

예를 들어, ‘소파’를 삭제하면 모델은 소파의 일반적인 속성(예: 색상 또는 재질)을 무관련한 객체에 적용하지 않아야 합니다. 이는 모델에 쌍으로 된 객체를 프롬프트로 제공하여, 삭제된 속성이 보존된 개념에 잘못 적용되는지 여부를 확인했습니다.

속성 토큰에 대한 주의 지도 после 개념 삭제. 왼쪽: '벤치'를 삭제하면 '나무' 토큰이 새로 이동하여, 나무 새를 생성합니다. 오른쪽: '소파'를 삭제하면 소파 생성을 차단하지 못하며, '큰' 토큰이 도넛에 잘못 할당됩니다.

속성 토큰에 대한 주의 지도 после 개념 삭제. 왼쪽: ‘벤치’를 삭제하면 ‘나무’ 토큰이 새로 이동하여, 나무 새를 생성합니다. 오른쪽: ‘소파’를 삭제하면 소파 생성을 차단하지 못하며, ‘큰’ 토큰이 도넛에 잘못 할당됩니다.

RECE는 대상 속성을 삭제하는 데 가장 효과적이었습니다. 그러나, 보존된 프롬프트에서 가장 많은 속성 유출을 도입했습니다. 이는 수정되지 않은 모델을 초과했습니다. UCE는 다른 방법보다 속성 유출을 덜 유도했습니다.

연구자들은 이러한 결과가 강력한 삭제와 잘못된 속성 전이를 위한 내재된 트레이드오프를 나타낸다고 제안합니다.

결론

모델의 잠재 공간은 훈련 중에 질서정연하게 채워지지 않습니다. 훈련된 임베딩은 내용과 그 컨테이너가 분리되지 않으며, 서로에 의해 영향을 받습니다. 이는 삭제를 어렵게 만듭니다.

지능적이고 진화하는 시스템에서는 초기 사건이 이후에 형성되는 행동 및 연관성과 얽힙니다. 따라서 중심에 있는 잠재적 ‘금지’ 개념의 여파가 남으며, 그 개념 자체를 담지 않은 모델을 만들기도 어려워집니다.

 

* 저자의 인라인 인용을 하이퍼링크로 변환한 것입니다.

최초에 2025년 8월 22일 게시되었습니다.

머신러닝 분야 작가이자 인간 이미지 합성 도메인 전문가. Metaphysic.ai에서 연구 콘텐츠 책임자를 역임했으며, DNEG의 Brahma.ai로 통합될 때까지 근무했습니다.
웹사이트: martinanderson.ai
연락처: martin@martinanderson.ai