Anderson의 관점

DALL-E 2, 단순히 물건을 붙여놓는 것일까? 관계를 이해하지 못하는 것일까?

mm
Unite.AI를 Google의 선호 소스에 추가

하버드 대학의 새로운 연구 논문에 따르면, OpenAI의 주목받는 텍스트-이미지 프레임워크인 DALL-E 2는 합성된 사진에 포함된 요소 간의 관계를 재현하는 데 어려움을 겪고 있다. 이는 DALL-E 2의 출력이 매우 정교하더라도如此이다.

연구자들은 169명의 크라우드소싱 참여자를 대상으로 사용자 연구를 진행하였다. 참여자들은 DALL-E 2 이미지와 함께 가장 기본적인 인간의 원리인 관계 의미론을 기반으로 생성된 텍스트 프롬프트를 받았다. 이미지와 프롬프트가 관련이 있는지 묻자, 22% 미만의 이미지가 관련이 있다고 판단되었다.

새로운 논문에 대한 시연에서 가져온 스크린샷. 참여자들은 프롬프트와 일치하는 모든 이미지를 선택하도록 요청받았다. 인터페이스의 하단에 있는免責 조항에도 불구하고, 모든 이미지는 실제로 표시된 관련 프롬프트에서 생성되었다.

새로운 논문에 대한 시연에서 가져온 스크린샷. 참여자들은 프롬프트와 일치하는 모든 이미지를 선택하도록 요청받았다. 출처: https://arxiv.org/pdf/2208.00005.pdf

결과는 또한 DALL-E의 분리된 요소를 결합하는 능력이 요소들이 실제 데이터에 나타날 가능성이 낮을수록 감소할 수 있음을 시사한다.

예를 들어, ‘아이가 볼을 만지는’ 프롬프트에 대한 이미지는 87%의 동의率를 얻었지만, 유사한 사진적 렌더링의 ‘원숭이가 이구아나를 만지는’ 이미지는 11%의 동의율만을 얻었다.

DALL-E는 매우 어색한 이벤트인 '원숭이가 이구아나를 만지는' 이미지를 생성하는 데 어려움을 겪는다. 이는 이러한 이벤트가 훈련 세트에 거의 없기 때문일 수 있다.

DALL-E는 매우 어색한 이벤트인 ‘원숭이가 이구아나를 만지는’ 이미지를 생성하는 데 어려움을 겪는다.

DALL-E의 분리된 이미지 요소를 결합하는 어려움은 시스템이 요소를 단순히 하나의 이미지에 粘着시키는 것일 수 있다.

DALL-E 2의 공식 예제에서 粘着 합성.

DALL-E 2의 공식 예제에서 粘着 합성. 출처: https://openai.com/dall-e-2/

새로운 논문은 다음과 같이 말한다*:

‘인간 지능의 기본 구성 요소인 관계 이해는 초기에 발달하며, 인식에서 빠르고 자동적으로 계산된다.’

‘DALL-E 2의 기본적인 공간 관계(예: in, on, under)에 대한 어려움은 시스템이 인간이世界를 구조화하는 방식으로 나타나는 종류의 표현을 아직 학습하지 못했음을 시사한다.’

‘직접적인 해석은 DALL-E 2와 같은 시스템이 아직 관계적 구성성을 가지고 있지 않다는 것이다.’

연구자들은 텍스트-이미지 생성 시스템인 DALL-E 시리즈가 로봇공학에서 사용되는 알고리즘을 활용하여 동시에 身份와 관계를 모델링할 수 있다고 제안한다.

이러한 접근 방식 중 하나는 CLIPort로, DALL-E 2에서 품질 평가 요소로 사용되는 동일한 CLIP 메커니즘을 사용한다.

CLIPort, 2021년 워싱턴 대학교와 NVIDIA의 협력. CLIP을 실제로 사용하여 시스템이 물리적인 관계를 이해하도록 개발해야 한다.

CLIPort, 2021년 워싱턴 대학교와 NVIDIA의 협력. 출처: https://arxiv.org/pdf/2109.12098.pdf

연구자들은 이미지 합성 시스템의 아키텍처에 곱셈 효과를 하나의 계산 層에 통합하여 관계를 계산할 수 있도록 제안한다.

새로운 논문은 Testing Relational Understanding in Text-Guided Image Generation으로, 하버드 대학 심리학과의 Colin Conwell과 Tomer D. Ullman이 작성하였다.

초기 비판을 넘어서

연구자들은 DALL-E 2의 출력의 현실성과完整性背后的 ‘마술’에 대해 논평하며, 이전 연구에서 DALL-E 스타일의 생성 이미지 시스템의 결점을 발견했다.

이번 년도 6월, 버클리 대학교는 DALL-E가 반사와 그림자를 처리하는 데 어려움을 겪는다는 것을 발견했다. 같은 달, 한국의 한 연구는 DALL-E 2 스타일의 출력의 고유성과 원创性을 비판적으로 조사했다. DALL-E 2 이미지를 분석한 예비 분석에서는 구성성과 다른 요인에서 여러 문제를 발견했다. 그리고 지난 달, 일리노이 대학교와 MIT의 공동 연구는 이러한 시스템의 구성성 개선에 대한 제안을 제공했다.

연구자들은 또한 DALL-E의 유명한 연구자인 Aditya Ramesh가 시스템의 결합, 상대적 크기, 텍스트 및 기타挑戰에 대한 문제를 인정했다.

구글의 경쟁 이미지 합성 시스템인 Imagen의 개발자는 DrawBench라는 새로운 비교 시스템을 제안했다. 이는 다양한 메트릭을 사용하여 여러 프레임워크의 이미지 정확도를 측정한다.

대신에, 새로운 논문의 저자들은 인간의 추정이 알고리즘 메트릭보다 더 나은 결과를 가져올 수 있다고 제안한다.

연구

이를 위해 새로운 프로젝트는 심리학적 원리를 기반으로 접근 방식을 개발하고, 현재 DALL-E 2의 결점을 보완하는 ‘prompt 공학’에 대한 관심에서 벗어나 관계 이해의 한계를 조사하고 해결하려고 한다.

논문은 다음과 같이 말한다*:

‘현재 연구는 이전에記述된, 조사된 또는 제안된 15가지 기본 관계에 중점을 둔다. 이 집합에는 공간 관계(예: ‘X on Y’)와 더 추상적인 에이전트 관계(예: ‘X가 Y를 도와주는’)가 포함된다.’

‘프롬프트는 의도적으로 단순하다. 속성의 복잡성이나 세부 사항이 없다. 즉, ‘donkey와 octopus가 게임을 하는’ 대신 ‘box on a knife’를 사용한다.’

‘이러한 관계는 인간 심리학의 다양한 하위 도메인에서 넓은 범위의 관계를 포착하며, 모델의 실패를 더 두드러지게 만든다.’

연구자들은 169명의 참여자를 모집했으며, 평균 나이는 33세, 여성은 59%였다.

참여자들은 18개의 이미지를 3×6 격자로 배열한 후, 상단에 프롬프트와 하단에 免責 조항이 있는 인터페이스를 보았다. 그런 다음 참여자들은 이러한 이미지가 관련이 있다고 생각하는 이미지를 선택하도록 요청받았다.

개별들에게 제시된 이미지는 언어적, 발달적, 인지적 문헌을 기반으로 하여 8개의 물리적 관계와 7개의 에이전트 관계로 구성되었다.

물리적 관계
in, on, under, covering, near, occluded by, hanging over, tied to.

에이전트 관계
pushing, pulling, touching, hitting, kicking, helping, hindering.

이러한 관계는 모두 이전에 언급된 비-CS 분야의 연구에서 가져온 것이다.

프롬프트에 사용된 12개의 개체는 6개의 물체와 6개의 에이전트로 구성되었다:

물체
box, cylinder, blanket, bowl, teacup, knife.

에이전트
man, woman, child, robot, monkey, iguana.

(연구자들은 이구아나를 포함한 것은 ‘선물’이라고 인정한다.)

각 관계에 대해 5개의 서로 다른 프롬프트를 생성하기 위해 2개의 개체를 5번 무작위로 샘플링하여 총 75개의 프롬프트를 생성하였다. 각 프롬프트는 DALL-E 2에 제출되었으며, 각 프롬프트에 대해 초기 18개의 이미지를 사용하였다.

결과

논문은 다음과 같이 말한다*:

‘참여자들은 평균적으로 DALL-E 2의 이미지와 생성에 사용된 프롬프트 간의 낮은 일치도를 보고했다. 75개의 서로 다른 프롬프트에 걸쳐 평균은 22.2% [18.3, 26.6]이었다.’

‘에이전트 프롬프트는 평균 28.4% [22.8, 34.2]로 물리적 프롬프트보다 높은 일치도를 보였다. 물리적 프롬프트는 평균 16.9% [11.9, 23.0]이었다.’

연구의 결과. 검은색 점은 모든 프롬프트를 나타내며, 각 점은 개별 프롬프트이다. 색상은 프롬프트의 주제가 에이전트인지 물리적인지에 따라 구분된다.

연구의 결과.

인간과 알고리즘의 이미지 인식 차이를 비교하기 위해 연구자들은 OpenAI의 오픈 소스 ViT-L/14 CLIP 기반 프레임워크를 통해 렌더링을 실행했다. 평균 점수를 계산하면 두 집합의 결과 간에 중간 정도의 상관관계가 있음을 발견했다.

CLIP (ViT-L/14) 비교 결과.

CLIP (ViT-L/14) 비교 결과.

연구자들은 이러한 결과가 DALL-E 2의 한계를 인식할 수 있지만 모든 경우에 문제를 해결할 수 없는 다른 메커니즘 또는 아키텍처 내의 데이터 부족으로 인해 발생할 수 있다고 제안한다.

저자들은 DALL-E 2가 관계 이해를 재현하는 능력이 없거나 거의 없으며, 이는 인간 지능의 기본적인 측면이다.

‘DALL-E 2의 어려움은 단순히 물건을 붙여놓는 것이 아니라, 물건을 결합하는 규칙을 이해하는 것이다. 관계는 이러한 규칙이다.’

인간이 공룡을 물다

의견 OpenAI가 DALL-E 2에 대한 접근을 확대하고, 이제 대부분의 생성에 대해 비용을 지불해야 하는 상황에서, DALL-E 2의 관계 이해의 결점은 더 명확해질 수 있다. 각 ‘실패한’ 시도에는 금전적인 비용이 있기 때문이다.

초기 초대받은 사람들은 시스템을 더 자유롭게 사용할 수 있었기 때문에 DALL-E 2의 ‘관계 결함’을 관찰할 수 있었다.

예를 들어, ジュラ기 공원 팬에게는 공룡이 사람을追う 이미지를 얻는 것이 매우 어렵다. 이는 ‘추적’ 개념이 DALL-E 2의 검열 시스템에 포함되지 않았으며, 공룡 영화의 긴 역사(至少 트레일러와 홍보 사진으로)는 이러한 불가능한 만남에 대한 충분한 훈련 예를 제공해야 한다.

DALL-E 2의 'A color photo of a T-Rex chasing a man down a road' 프롬프트에 대한 일반적인 응답.

DALL-E 2의 ‘A color photo of a T-Rex chasing a man down a road’ 프롬프트에 대한 일반적인 응답. 출처: DALL-E 2

이미지 위는 ‘[공룡]이 [사람]을追う’ 프롬프트의 변형에 대한 일반적인 응답이다. 어떤 프롬프트의 세부사항도 공룡이 실제로 사람을追う 이미지를 생성할 수 없다.

이는 DALL-E 2가 훈련 데이터에 접근할 수 있었던 唯一한 데이터가 ‘인간이 공룡을 물다’와 같은 영화의 홍보 사진일 수 있으며, 제프 골드블룸의 유명한 공룡으로부터의 도피는 이러한 작은 데이터 집합에서 ngoại lệ일 수 있다.

 

* 저자의 인라인 인용을 하이퍼링크로 변환한 것입니다.

最初에 2022년 8월 4일에 게시되었습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai