Anderson의 관점
DALL-E 2의 고유한 이중 의미 해결 방법

이탈리아어를 배우는 누구든지 broom이라는 단어를 설명할 때 맥락을 주의해야 한다. 왜냐하면 이탈리아어로 이 평범한 가정 용품을 나타내는 단어가 매우 성적인 두 번째 의미를 가진 동사로 사용되기 때문이다*. 우리는 단어의 의미적 매핑과 적용성을 분리하는 법을 일찍부터 배우지만, 이것은 DALL-E 2와 Stable Diffusion과 같은 하이퍼스케일 이미지 합성 시스템에 전달하기 어렵다. 왜냐하면它们는 OpenAI의 Contrastive Language-Image Pre-training (CLIP) 모듈을 사용하기 때문이다. CLIP 모듈은 객체와 그 속성을 비교적 느슨하게 처리한다. 그러나 이는 점점 더 많은 지면을 얻고 있다.
이 결함을 연구한 바일란 대학교와 알렌 인공 지능 연구소의 새로운 연구 협력은 DALL-E 2가 이러한 의미적 오류에 취약한 정도에 대한 광범위한 연구를 제공한다:

DALL-E 2에서 이중 의미가 여러 해석으로 분할됨 – 그러나 모든 잠재 확산 시스템이 이러한 예를 생성할 수 있음. 상단 오른쪽 이미지에서 ‘gold’를 프롬프트에서 제거하면 물고기의 종이 변경되고, ‘zebra crossing’의 경우 도로 표면을 명시적으로 지정해야 복제된 연관성이 제거됨. 출처: https://export.arxiv.org/pdf/2210.10606
연구자들은 이 단어와 구의 이중 해석 경향이 모든 CLIP 지향 확산 모델에서 공통적이며, 모델이 더 많은 데이터로 훈련될수록 더 심해진다는 것을 발견했다. 연구진은 DALL-E Mini(현재 Craiyon)와 같은 ‘감소된’ 텍스트-이미지 모델이 이러한 종류의 오류를 훨씬 적게 생성한다고 지적하며, Stable Diffusion도 덜 오류를 생성하지만, 이는 종종 프롬프트를 전혀 따르지 않기 때문이다.

단순한 프롬프트 ‘date’가 DALL-E 2에서 단어의 여러 의미를 호출하며, ‘fan’이라는 단어도 두 가지 의미로 분할되고, 세 번째 이미지에서 ‘cone’라는 구가 지정되지 않은 음식을 아이스크림으로 변경하며, ‘cone’와 관련이 있음.
효율적인 어휘 분리를 수행하는 방법에 대해 설명하면서, 연구진은 다음과 같이 말한다:
‘기호와 문장 구조는 모호할 수 있지만, 해석이 구성되면 이 모호성은 이미 해결된다. 예를 들어, ‘flying bat’에서 ‘bat’라는 기호는 나무 조각이나 동물로 해석될 수 있지만, 우리의 해석은 나무 조각이나 동물 중 하나만을 포함할 수 있다. ‘bat’라는 단어가 해석에서 객체를 나타내는 데 사용되면(예: 나무 조각), 동일한 해석에서 다른 객체(동물)를 나타내는 데 다시 사용할 수 없다.’
DALL-E 2는 이러한 제약을 받지 않는다:

‘a bat is flying over a baseball stadium’ – 첫 번째 이미지는 논문에서, 나머지 세 개는 단순히 DALL-E 2에 동일한 프롬프트를 입력한 결과.
이 속성은 자원 민감성이라고 명명되었다.
연구진은 DALL-E 2에서 세 가지 비정상적인 행동을 발견했다: 단어가 두 개의 별개 개체로 해석되고 효과적으로 분할되어 동일한 장면에 각 개체를 렌더링하는 경우; 단어가 두 개의 개체를 수정하는 것으로 해석되는 경우(위의 ‘goldfish’와 같은 예시 참조); 단어가 동시에 수정자와 대체 개체로 해석되는 경우 – 예를 들어, 프롬프트 ‘a seal is opening a letter’:

‘a seal is opening a letter’ – 첫 번째 일러스트는 논문에서, 인접한 세 개는 DALL-E 2에서 생성한 동일한 재현. 아래의 사진 예시는 추가 텍스트 ‘photo, Canon50, 85mm, F5.6, award-winning photo’를 포함.
연구자들은 이러한 측면에서 확산 모델의 두 가지 오류 모드를 식별했다: 사용자 프롬프트의 결과가 의미적으로 모호한 단어를 포함할 때, 결과는 종종 구체화된 단어와 어떤 개념의 прояв으로 나타날 수 있다; 그리고 개념 누출, जह서 한 개체의 속성이 다른 렌더링된 개체로 누출된다.
‘우리가 조사한 현상은 DALL-E 2의 언어 능력의 한계를 보여주며, 이러한 한계가 텍스트 인코딩, 생성 모델, 또는 둘 다의 문제인지 밝혀내기 위한 미래 연구를 위한 길을 열어준다. 더 일반적으로, 제안된 접근 방식은 텍스트-이미지 모델의 귀납적 편향과 약점을 발견하는 데 사용될 수 있는 다른 시나리오로 확장될 수 있다.’
DALL-E 2에서 입력을 여러 개의 출력으로 분할하는 17개의 단어가 사용되었을 때, 연구자들은 동의어 복제가 216개의 이미지 중 80% 이상에서 발생한다는 것을 관찰했다.
연구자들은 특정 언어가 이러한 복제를 방지하기 위해 필요한 정도를 조사하기 위해 자극-대조 쌍을 사용했다. 개체-속성 테스트를 위해 10개의这样的 쌍이 생성되었으며, 연구자들은 자극 프롬프트가 92.5%의 경우에 공유된 속성을 호출하는 반면, 대조 프롬프트는 6.6%의 경우에만 호출한다고 주장한다.
‘예를 들어, 한 썰매와 한 거리가 여기 있다. 여기서, 썰매는 개체이지만, 그것은 거리를 수정한다. 그리고 DALL-E 2는 지속적으로 보행자를 생성한다. 아마도 썰매 줄무늬가 보행자와 유사하기 때문일 것이다. 그리고 우리의 추측과 일치하여, 썰매와 자갈 거리는 보통 보행자가 없는 유형의 거리를 지정하며, 실제로 이 프롬프트에 대한 우리의 모든 대조 샘플에는 보행자가 포함되지 않는다.’













