Anderson의 관점

AI가 대화에서 이미지 이해 및 사용을 배우는 방법

mm
Unite.AI를 Google의 선호 소스에 추가

한국의 연구자들은 인간이 대화에서 이미지 사용 방식을 이해하고 자연어 모델이 이러한 최근의 인간 커뮤니케이션 개발에 참여할 수 있도록 도와주는 데이터셋을 개발했습니다.

KAIST의 Daedeok Innopolis에서 발표된 논문에 따르면, 지난 10년 동안의 다중 모달 대화 시스템 연구는 주제와 관련이 없는 학문에 중점을 둔 데이터셋과 방법론으로 인해 제한적이었습니다. 예를 들어, 시각적 질문 답변이미지 캡션과 같은 분야입니다.

이러한 이전 접근 방식에서는 이미지들이 대화의 어휘적 맥락에서 평가되며, 이미지 응답으로 대화가 향상되고 개발되는 방식을 이해하지 못합니다. 또한, 시각적 기여가 담론에 미치는 영향을 해석하기 위한 교차 도메인 스키마도 없습니다.

대화의 1차적 요소로서의 이미지

지금까지의 많은 접근 방식은 Microsoft의 AI 연구 부문에서 시작된 것으로, 2017년에도 연구에서 이미지로 시작하는 다중 모달 대화를 조사했습니다. 그러나 이미지들을 자유롭게 대화의 구성 요소로 사용하는 방식은 아니었습니다.

연구 데이터의 부족을 해결하기 위해, 한국의 연구자들은 45,000개의 대화 인스턴스를 포함하는 데이터셋을 개발했습니다. 이 데이터셋은 이미지 사용을 중심으로 하는 ad hoc 방식의 대화 인스턴스를 포함하며, 바이러스성 ‘미ーム’ 이미지에 중점을 두지 않았습니다. 이러한 이미지는 언어 연구에서 관심 분야이지만, 더 큰 도전이 아닙니다. 왜냐하면 소셜 미디어 플랫폼에서 수천 번의 사용을 통해 바이러스성 미ーム의 의미를 더 쉽게 추론할 수 있기 때문입니다.

텍스트 대신 일러스트레이션 개발

한국의 연구자들은 텍스트-이미지 양방향 변환을 위한 방법론을 개발하기 위해 기계 학습 시스템을 훈련시켰습니다. 이 시스템은 대화의 일부를 의미적으로 관련된 이미지 콘텐츠로 대체합니다.

한국의 다중 모달 대화 연구를 위한 데이터셋 생성 시스템 아키텍처. 출처: https://arxiv.org/pdf/2107.08685.pdf

한국의 다중 모달 대화 연구를 위한 데이터셋 생성 시스템 아키텍처. 출처: https://arxiv.org/pdf/2107.08685.pdf

대상 문구의 전처리에는 예측을 방해할 수 있는 정지 단어를 삭제하고, 문맥적 유사성 필터를 통해 질이 낮은 교환을 제거하는 것이 포함되었습니다.

시스템의 유용성을 테스트하기 위해, 연구자들은 대화의 맥락과 이미지들을 고려하여 대화의 다음 ‘턴’을 예측하도록 모듈을 설정했습니다.

연구에서 사용된 인간 평가 GUI.

연구에서 사용된 인간 평가 GUI.

45k 데이터셋은 5개의 외부 데이터셋을 기본 자료로 사용했습니다. 세 개는 텍스트 기반 요소입니다: DailyDialog, 2017년의 수동으로 주석이 달린 다중 턴 텍스트 기반 세트; 그리고 Facebook의 EmpatheticDialoguesPersonaChat, 모두 2018년의 것입니다. 두 개의 이미지 기반 데이터셋은 MS-COCO와 Flicker30k입니다.

이미지/텍스트 쌍 - 데이터셋의 문구와 이미지(이 예에서는 Microsoft의 COCO 이미지 데이터베이스에서)와 관련된 JSON 스키마.

이미지/텍스트 쌍 – 데이터셋의 문구와 이미지(이 예에서는 Microsoft의 COCO 이미지 데이터베이스에서)와 관련된 JSON 스키마.

시스템의 텍스트-이미지 대체는 2019년 Northeastern University at Boston에서 개발된 사전 훈련된 Visual Semantic Reasoning Network(VSRN)에 의해 구동되었습니다. VSRN은 수동으로 선택된 문구에서 작동하도록 설정되었습니다.

일관성 확립

데이터셋의 일관성을 확립하기 위해, 연구자들은 각 대화 데이터셋과 이미지 데이터셋의 6개의 조합을 개발하고 여러 라운드로 인간에 의해 평가했습니다.

인간의 평가 기준은 세 가지였습니다: 교환의 맥락에 대한 일관성; 이미지의 핵심 개념을 표현하는 이미지의 관련성; 그리고 이미지에 포함된 핵심 객체의 정도.

이러한 기준을 고려하면, 연구자들이 선택한 스키마는 이미지의 의미에 대한 유머, 풍자, 추상적 또는 형이상학적 가능성을 크게 무시한 것으로 볼 수 있습니다.

그러나 이것은 선구적인 연구이며, 자연어 처리(NLP) 분야에서 유머, 풍자 등과 같은 이미지-텍스트 관계의 더 추상적인 예를 매핑하기 위해 많은 노력이 투자되고 있습니다.

테스트

데이터 생성 프레임워크를 테스트하기 위해, 연구자들은 Facebook의 2020년 Image-Chat 연구에 기반한 3부분 검색 모델을 사용했습니다. 모듈은 Resnext-101을 이미지 인코더로 사용하며, Google의 BERT를 텍스트 인코더로 사용합니다. 또한, 이러한 두 가지를 위한 사용자 지정 퓨전 모듈을 포함합니다.

시스템은 현재 및 다음 문장 예측 작업에서 50.35와 14.38의 성능을 보였으며, 각 작업의 기준을超越했습니다.

나중에, 두 명의 연구자가 수동으로 100개의 다중 모달 대화를 생성하고 시스템을 이러한 ‘유기적’ 다중 모달 대화에 대해 실행했습니다. 시스템은 이러한 ad hoc 예에서 높은 맥락 인식으로 현재 및 다음 턴의 교환을 예측할 수 있었습니다.

한국의 다중 모달 데이터셋 생성 시스템에 대한 테스트 결과, 텍스트-이미지 유사성과 인간 기반 질문 점수 간의 일관된 상관관계를 보여줌.

한국의 다중 모달 데이터셋 생성 시스템에 대한 테스트 결과, 텍스트-이미지 유사성과 인간 기반 질문 점수 간의 일관된 상관관계를 보여줌.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai