Anderson의 관점

‘바이브’ 기반 이미지 주석의 위험성

mm
Unite.AI를 Google의 선호 소스에 추가
A patron in the museum of banned artifacts. SDXL; Flux; Flux.1 Kontext; Firefly.

그들이 받는 돈은 몇 달러에 불과하고, 어떤 경우에는 아무런 대가도 받지 못하지만, ‘유해한’ 콘텐츠를 평가하는 사람들은 그들이 내리는 결정 하나로 당신의 인생을 바꿀 수 있습니다. 구글의 새로운 논문은 이러한 주석자가 정해진 기준과 상관없이 자신만의 규칙을 만들고 있다고 제안하는 것으로 보입니다. 무엇이 잘못될 수 있을까요?

 

의견 이번 주에 구글 리서치와 구글 마인드의 협력을 통해 13명의 기여자가 새로운 논문을 발표했습니다. 이 논문은 알고리즘에 대한 이미지 평가 시 주석자의 ‘본능적인 감정’을 고려해야 하는지 탐구합니다. 심지어 그들의 반응이 확립된 평가 기준과 일치하지 않는다 하더라도 말입니다.

이것은 당신에게 중요합니다. 왜냐하면 평가자와 주석자가 규칙에 따라 불쾌한 것으로 판단하는 것은 자동화된 검열 및 모더레이션 시스템, 그리고 법률에서 ‘음란’ 또는 ‘받아들일 수 없는’ 자료의 기준에 포함될 것이기 때문입니다. 예를 들어, 영국의 새로운 NSFW 방화벽*과 같이, 그리고 곧 오스트레일리아에도 도입될 예정입니다. 또한 소셜 미디어 플랫폼의 콘텐츠 평가 시스템 등에서도 마찬가지입니다.

이러한 기준이 더 광범위해질수록 검열의 수준도 더 높아질 것입니다.

바이브 검열

새로운 논문은 단 하나의 관점만을 제시하는 것이 아니라 여러 관점을 제시합니다. 또한 이 논문은 사람들이 자신에게 불쾌한 이미지를 평가할 때 다른 사람에게 불쾌할 이미지를 평가할 때보다 더 엄격한 기준을 적용하는 경향이 있다고 발견했습니다. 또한 저화질 이미지는 안전에 대한 우려를 불러일으키는 경우가 많지만, 이미지의 품질은 콘텐츠와는 관련이 없습니다.

논문의 결론에서는 이러한 두 가지 발견을 강조합니다. 마치 논문의 중심적인 입장이 실패한 것처럼 보이지만, 연구자들은 어쩔 수 없이 발표해야만 했습니다.

이런 상황 자체는 흔하지만, 논문을 자세히 읽으면 더 불길한 함의가 드러납니다. 주석 작업자가 정해진 규칙 대신 자신의 감정이나 개인적 반응에 따라 판단하는 이른바 “바이브 주석”을 채택할 수 있다는 점입니다.

‘우리의 발견은 기존 프레임워크가 주관적이고 맥락적인 차원, 즉 감정적 반응, 암시적 판단, 그리고 해석의 차이를 고려해야 함을 시사합니다. 주석자의 빈번한 감정 언어 사용과 미리 정의된 해로운 레이블에서 벗어난 것은 현재 평가 관행의 격차를 강조합니다. ‘

‘다양한 문화적 및 감정적 해석의 예시를 포함하는 주석 지침을 확장하면 이러한 격차를 해결할 수 있습니다.’

새로운 논문은 거의 설명이 없는 예시를 제시합니다. 평균적인 독자에게는 동정할 수 있지만, 실제 핵심 자료는 더 많은 질문을 불러일으킵니다. 여기서 각 이미지 아래에 주석자의 감정 반응을 표시했습니다. 출처: https://arxiv.org/pdf/2507.16033

새로운 논문은 거의 설명이 없는 예시를 제시합니다. 평균적인 독자에게는 동정할 수 있지만, 실제 핵심 자료는 더 많은 질문을 불러일으킵니다. 여기서 각 이미지 아래에 주석자의 감정 반응을 표시했습니다. 출처: https://arxiv.org/pdf/2507.16033

처음에는 이것이 ‘해로운’ 이미지를 정의하고 측정하는 것을 확장하고 정교화하는 제안으로 보입니다. 하지만 이 논문은 이러한 접근이 바람직하지도 않고 필요하지도 않다고 반복적으로 강조합니다.

‘우리의 발견은 기존 프레임워크가 주관적이고 맥락적인 차원, 즉 감정적 반응, 암시적 판단, 그리고 해석의 차이를 고려해야 함을 시사합니다. 주석자의 빈번한 감정 언어 사용과 미리 정의된 해로운 레이블에서 벗어난 것은 현재 평가 관행의 격차를 강조합니다. ‘

‘다양한 문화적 및 감정적 해석의 예시를 포함하는 주석 지침을 확장하면 이러한 격차를 해결할 수 있습니다 […]

‘[…] 주석자가 모호한 이미지를 평가하는 과정은 종종 개인적, 문화적, 감정적 관점을 반영하는데, 이러한 관점은 어려워서 표준화하기 어렵습니다.’

이것은 합리적인 평가 시스템에 어떻게 적합할 수 있는지 이해하기 어렵습니다. 저자는 이 점을 명확히 하거나 구체적인 이론을 제시하지 못합니다. 이 논문의 중심적인 주제 자체가 ‘바이브’로 생성된 것으로 보입니다. 즉, 감정적이고 개인적인 반응에 기반한 것입니다.

간단히 말해, 주석자들이 자신의 감정이나 개인적인 반응에 따라 규칙을 만들 수 있는 시스템을 만들면, 임의의 기준에 따라 어떤 콘텐츠든지 제한할 수 있습니다.

이진 판단

이미지와 텍스트가 해를 끼칠 수 있는 정도는 실제로 측정하기 어렵습니다. 왜냐하면 고문화와 저문화가 교차하기 때문입니다. 예를 들어, 예술과 소설이 그렇습니다. 따라서 초기의 ‘바이브’ 기반 검열 기준이 등장했습니다. 즉, 음란한 콘텐츠가 정확하게 정의되지는 않지만, 그것을 볼 때 알 수 있습니다.

새로운 논문의 광범위한 토론 아래에는 공감과 질적 미묘함에 대한 탐구가 있지만, 이는 중앙집중식 표준화된 분류 체계의 권위를 공격하는 것으로 보입니다. 즉, ‘폭력’, ‘누드’, ‘혐오’ 등과 같은 분류 체계를 공격하는 것입니다. 이러한 체계는 플랫폼이 검열과 모더레이션을 수행할 수 있도록 합니다.

제시되는 논증은 인간의 피드백만이 제네릭 AI의 출력을 올바르게 판단할 수 있다는 것입니다.

하지만 이것은 확장할 수 없습니다. 왜냐하면 ‘바이브’와 경험에 기반한 이미지 필터 파이프라인을 실행할 수 없기 때문입니다. 해를 끼치는 것을 다양한 속성으로 정의하고, 필터링 시스템의 범위를 제한해야 합니다. 그리고 새로운 지침이 나오기까지 기다려야 합니다.

대신에, 새로운 논문은 자동화된 모더레이션 파이프라인을 제시합니다. 이 파이프라인은 자동으로 확장되고, 주의 깊게 운영됩니다. 즉, 주석자의 반응에 따라 이미지에 페널티를 줄 수 있습니다.

도덕적 확장

이 논문은 탐구에 중점을 두고 있지만, 과학적 방법론을 포함합니다. 즉, 주석자의 반응을 식별하고 분석하는 프레임워크를 개발했습니다. 또한 이러한 반응이 성별과 다른 인구통계학적 요인에 따라 어떻게 변하는지 조사했습니다.

테스트의 분석은 ‘해로운’ 콘텐츠에 대한 주석자의 반응을 조사했으며, 추가적으로 주석자의 도덕적 판단을 조사했습니다. 즉, 주석자들이 수정된 테스트 데이터셋에 대한 주석을 작성할 때 나타난 도덕적 가치관을 조사했습니다.

이 ‘도덕적 감정 자율 평가기’는 도덕적 기초 이론에서 정의한 도덕적 가치인 ‘배려’, ‘공정성’, ‘비례성’, ‘충성’, ‘권위’, ‘순수성’을 포착하도록 설계되었습니다. 하지만 이 이론은 유동적이고 계속 발전하기 때문에 대규모 인간 평가 체계에 필요한 구체적인 정의를 만들기에는 적합하지 않습니다.

추가적으로, 저자들은 안전성의 새로운 차원을 분류했습니다. 즉, ‘공포’, ‘분노’, ‘슬픔’, ‘혐오’, ‘혼란’, ‘불쾌’를 포함합니다.

저자들은 첫 번째 항목인 ‘공포’에 대해 다음과 같이 설명합니다.

‘많은 주석자가 “무서운”이라는 용어를 사용했으며(예를 들어, 왜곡된 얼굴이나 폭력적인 이미지를 나타내는 총이 있는 이미지), “불쾌한”이라는 용어를 사용했으며(예를 들어, “절대적으로 역겨워 보인다” 또는 “불쾌하고 혐오스럽다”라고 적었다), 또는 “불쾌한”이라는 용어를 사용했습니다(예를 들어, “그 아이의 얼굴은 많이 왜곡되어 있다. 나는 그것을 싫어한다”).

‘[아래 그래프는] “공포”를 가장 자주 언급된 감정으로 나타냅니다(233회 언급). 거의 절반이 폭력적인 콘텐츠와 관련이 있습니다. 해로운 콘텐츠로 간주되지 않는 콘텐츠도 두 번째로 높은 빈도로 공포를 언급합니다.’

해로운 카테고리별 감정 관련 용어의 분포, 막대 높이는 비율을 나타내고, 막대 안의 숫자는 각 카테고리의 총 댓글 수를 나타내며, 각 카테고리 위의 숫자는 총 댓글 수를 나타냅니다.

해로운 카테고리별 감정 관련 용어의 분포, 막대 높이는 비율을 나타내고, 막대 안의 숫자는 각 카테고리의 총 댓글 수를 나타내며, 각 카테고리 위의 숫자는 총 댓글 수를 나타냅니다.

저자들은 이러한 새로운 안전성 차원을 포함하는 것에 대해 다음과 같이 말합니다.

‘이러한 새로운 주제는 감정적, 지각적 요소를 포함하여 AI 이미지 평가 프레임워크를 풍부하게 하는 데 대한 중요한 필요성을 강조합니다.’

이것은 위험한 길을 걷는 것처럼 보입니다. 즉, 주석 과정에서 임의의 규칙을 추가할 수 있습니다. 즉, 어떤 주석자에게든지 반응을 일으킬 수 있는 콘텐츠에 대해 규칙을 만들 수 있습니다.

이 아이디어에 대한 경제적 명분을 부여한다면, 이는 ‘초과 규모의 인간 주석’을 가능하게 합니다. 즉, 과정은 마찰이 없고, 참여자는 자율적으로 규칙과 경계를 결정합니다.

표준 주석 아래에서 규칙은 인간의 합의에 의해 결정되고 인간 주석자에 의해 따릅니다. 하지만 이 논문에서 제시하는 시나리오에서는 초기의 감독 계층이 제거되거나 낮아집니다. 즉, 어떤 이미지도 주석자에게 불쾌할 수 있다면 플래그될 수 있습니다.

로르샤흐 판단

주석의 목적은 전문가의 감독, 여러 주석자 간의 공통된 합의, 또는 이상적으로는 둘 다를 통해 정확한 설명이나 정의에 도달하는 것입니다. 하지만 주석을 확장하여 주관적이고 개인적인 해석을 포함하는 것은 로르샤흐 테스트를 주석하는 것과 같습니다.

예를 들어, 일부 주석자는 저화질 이미지를 ‘불쾌한’ 또는 ‘해로운’ 것으로 해석했습니다.

‘이것은 작업에서 이미지 품질에 대한 지침이 생략되었음에도 불구하고 발생했습니다. 또한 주석자는 이러한 품질 결함을 의미 있는 것으로 해석했습니다.’

‘한 주석자는 “이미지는 전혀 해롭지 않습니다. 그는 단지 약간의 왜곡된 얼굴을 가지고 있을 뿐입니다”라고 댓글을 달았습니다. 마찬가지로, 일부 주석자는 이미지의 왜곡된 얼굴을 “고통의 징조”로 해석했습니다.’

주관적이고 감정적인 반응을 미리 정의된 안전성 카테고리보다 우위에 두는 이러한 아이디어는 임의로 무엇이든지 해로운 것으로 플래그될 수 있는 체제를 열어줍니다. 즉, 특별한 이해관계 그룹에게 불쾌할 수 있는 콘텐츠에 대한 ‘차갑게 하는’ 효과가 실제로 발생할 수 있습니다.

 

 

논문 “그냥 이상한 사진”: 다양한 주석자의 관점에서 제네릭 AI 이미지 안전 주석 작업의 평가은 아카이브에서 이용 가능합니다.

* 단축키입니다. 새로운 법률에 따르면, 범법적인 사이트는 스스로를 경찰하거나, 복잡하고 비싼 검토 시스템과 연령 확인 기술을 구현해야 하거나, 영국 관객에게 자신의 도메인을 차단해야 합니다(다시 말해, 자신의 비용으로).

† ‘아이들을 생각하라’는 밈이 간단히 보여 주듯, 표면적으로 이타적인 목적을 위해 다른 사람의 도덕적 판단을 대신하려는 태도를 풍자합니다.

 

처음으로 2025년 7월 25일에 게시되었습니다.

머신러닝 분야 작가이자 인간 이미지 합성 도메인 전문가. Metaphysic.ai에서 연구 콘텐츠 책임자를 역임했으며, DNEG의 Brahma.ai로 통합될 때까지 근무했습니다.
웹사이트: martinanderson.ai
연락처: martin@martinanderson.ai