AI 모델 및 플랫폼

SHOW-O: 다중 모드 이해와 생성을 통합하는 단일 트랜스포머

mm
Unite.AI를 Google의 선호 소스에 추가

대규모 언어 모델의 발전은 다중 모드 대규모 언어 모델의 개발을 영감했습니다. 초기 다중 모드 대규모 언어 모델(MLLM) 연구는 LLaVA, MiniGPT-4, InstructBLIP와 같은 모델이 시각-언어 작업에서 뛰어난 다중 모드 이해 능력을 보여주었습니다. 이러한 연구는 다중 모드 이해와 추론을 가능하게 하기 위해 사전 훈련된 모달리티 특정 인코더의 기능을 대규모 언어 모델의 입력 공간으로 투영하는 것을 탐색했습니다. 다중 모드 대규모 언어 모델의 다양한 설계 선택이 존재하지만, 이러한 모델의 대부분은 자동 회귀 생성 패러다임을 따르며, 이는 대규모 언어 모델에서 텍스트 생성에 효과적임이 입증되었습니다. 이러한 모델은 강력한 다중 모드 이해 능력을 가지고 있지만, 주로 시각적 인식에 중점을 두고 텍스트를 넘어서 다중 모드 출력을 생성하는 능력이 부족합니다.

트랜스포머 모델은 자연어 처리에서 자동 회귀 모델링에서 큰 성공을 거두었습니다. 이러한 발전으로 인해 이전 연구에서는 이미지와 비디오 생성을 위해 자동 회귀 모델링을 직접 적용했습니다. 예를 들어, VideoPoet은 디코더 전용 트랜스포머 아키텍처를 사용하여 다중 모드 입력에서 높은 품질의 비디오를 합성합니다. 최근에, LlamaGen은 대규모 언어 모델 아키텍처를 사용하여 자동 회귀적으로 이미지 토큰을 모델링할 수 있으며, 클래스 조건부 이미지 생성에서 괜찮은 성능을 보입니다.

이 문서에서는 Show-O, 다중 모드 이해와 생성을 통합하는 단일 트랜스포머에 대해 논의합니다. 자동 회귀 모델과 달리 Show-O는 자동 회귀와 이산 확산 모델링을 통합하여 다양한 모달리티의 입력과 출력을 적응적으로 처리합니다. 통합 모델은 시각 질문 답변, 텍스트-이미지 생성, 텍스트-이미지 인페인팅/엑스트라폴레이션 및 혼합 모달리티 생성과 같은 다양한 비전-언어 작업을 유연하게 지원합니다. 다양한 벤치마크에서 Show-O는 동일하거나 더 큰 수의 매개변수를 가진 기존 개별 모델과 비교하여 유사하거나 더 나은 성능을 보여주며, 이는 다음 세대 기본 모델로서의 잠재력을 강조합니다.

이 프레임워크에서 모델은 연속적인 잠재 표현에 추가된 가우시안 노이즈를 예측하는任务를 수행합니다. 다른 모델과 달리 D3PM, Mask-predict, ARDM 및 MaskGIT는 가우시안 확산 대신 이산 노이즈 프로세스를 사용합니다. 특히, 이미지 토큰화기는 256×256 해상도의 이미지를 16×16 이산 토큰으로 인코딩합니다. Show-O는 시각적 생성을 위해 이산 확산 모델링을 채택합니다.

SHOW-O: 다중 모드 이해와 생성을 통합하는 단일 트랜스포머

최근 몇 년 동안 다중 모드 이해와 생성을 가능한 단일 모델로 통합하는 연구가 증가하고 있습니다. 다중 모드 이해에서는 Multimodal Large Language Models (MLLMs)와 같은 LLaVA가 시각 질문 답변과 같은 비전-언어 작업에서 뛰어난 능력을 보여주었습니다. 시각적 생성에서는 노이즈 확산 확률 모델이 전통적인 생성 패러다임을 혁신적으로 발전시켰습니다.

이러한 개별 분야의 성과를 고려하여 두 분야를 연결하는 잠재성을 탐색하는 것이 자연스럽습니다. 최근 연구에서는 두 분야의 전문가 모델을 하나의 통합 시스템으로 조합하여 다중 모드 이해와 생성을 모두 처리할 수 있는 모델을 만들었습니다. 그러나 기존의 시도는 이해와 생성을 위한 별도의 모델을 사용합니다. 예를 들어, NExT-GPT는 다중 모드 이해를 위한 기본 언어 모델을 사용하지만 이미지 생성을 위한 추가 사전 훈련된 확산 모델이 필요합니다. 따라서 하나의 트랜스포머가 다중 모드 이해와 생성을 모두 처리할 수 있는지에 대한 질문이 남아 있습니다.

최근에 Chameleon은 이러한 것이 가능하다는 것을 보여주었습니다. 특히, Chameleon은 텍스트와 이미지 토큰을 모두 생성하기 위해 다양한 모달리티를 융합하는 것을 가능하게 합니다. 그러나 이미지 패치나 픽셀을 자동 회귀적으로 모델링하는 것이 최적인지 불분명합니다. 이미지의 자동 회귀 예측에는 특히 높은 해상도 이미지의 경우 많은 샘플링 단계가 필요합니다. 연속적인 확산 모델은 시각적 생성에서 자동 회귀 모델보다 더 나은 성능을 보여주었습니다.

이로 인해 자동 회귀와 확산 모델링을 하나의 트랜스포머로 통합하는 방법을 탐색하게 되었습니다. Show-O는 새로운 패러다임을 제안합니다. 여기서 텍스트는 이산 토큰으로 모델링되고 자동 회귀적으로 처리되며, 연속적인 이미지 픽셀은 노이즈 확산을 사용하여 모델링됩니다. 그러나 이러한 두 가지不同的 기술을 하나의 네트워크로 통합하는 것은 비중입니다. 확산 모델은 일반적으로 두 가지不同的 모델을 필요로 합니다. 하나는 텍스트 인코더이고, 다른 하나는 노이즈 제거 네트워크입니다.

이를 해결하기 위해 Show-O는 다중 모드 이해와 생성 작업을 모두 처리할 수 있는 새로운 통합 모델을 제안합니다. Show-O는 사전 훈련된 언어 모델을 기반으로 하며, 텍스트 기반 추론을 위한 자동 회귀 모델링 능력을 활용합니다. 다른 연구에서 영감을 받은 Show-O는 이미지 토큰을 모델링하기 위해 이산 노이즈 확산을 사용합니다. 또한, Show-O는 텍스트 조건부 정보를 내부적으로 인코딩하여 추가적인 텍스트 인코더가 필요하지 않습니다. 텍스트와 이미지 토큰화기를 사용하여 Show-O는 다양한 입력 데이터와 작업을 처리할 수 있으며, 비전-언어 작업에 대한 답변을 자동 회귀적으로 생성하고, 이산 노이즈 확산을 사용하여 이미지를 생성합니다.

Show-O는 다양한 벤치마크에서 동일하거나 더 큰 수의 매개변수를 가진 기존 모델과 비교하여 유사하거나 더 나은 성능을 보여주었습니다. 자동 회귀 이미지 생성과 달리, Show-O 프레임워크는 약 20배 더 적은 샘플링 단계가 필요하여 내在地 더 빠릅니다. 또한, Show-O 프레임워크는 미세조정을 요구하지 않고 텍스트 기반 인페인팅 및 엑스트라폴레이션과 같은 다운스트림 응용 프로그램을 지원합니다.

Show-O는 또한 혼합 모달리티 생성에 대한 잠재력을 가지고 있으며, 예를 들어 비디오 키프레임 생성과 텍스트 설명의 교대로 생성을 보여줍니다. 이는 장기 형식의 비디오 생성에 대한 가능성을 나타냅니다. 또한, Show-O 프레임워크는 다중 모드 이해에 대한 이미지 표현의 영향에 대해 조사하며, 미래의 통합 모델 설계를 위한 통찰력을 제공합니다.

다음 그림은 Show-O 프레임워크와 기존 방법의 모델 특성을 비교합니다.

요약하면, 이 논문의 주요 기여는 다음과 같습니다.

  • Show-O는 통합 모델입니다. 다중 모드 이해와 생성을 단일 트랜스포머로 통합합니다.
  • Show-O는 자동 회귀와 이산 확산 모델링을 하나의 트랜스포머 내에서 통합하여 텍스트와 이미지를 효과적으로 처리합니다.
  • Show-O 프레임워크는 다중 모드 이해와 생성 벤치마크에서 동일하거나 더 큰 수의 매개변수를 가진 기존 모델과 비교하여 유사하거나 더 나은 성능을 보여줍니다.
  • Show-O는 다운스트림 응용 프로그램을 지원합니다. 미세조정을 요구하지 않고 텍스트 기반 인페인팅 및 엑스트라폴레이션을 지원하며, 혼합 모달리티 생성에 대한 잠재력을 가지고 있습니다.
  • Show-O는 다양한 표현의 영향에 대해 조사하며, 다중 모드 이해를 위한 통합 모델의 개선을 위한 통찰력을 제공합니다.

최근 몇 년 동안 다중 모드 언어 모델이 이해와 생성을 모두 처리할 수 있는 모델로 발전하고 있습니다. 일부 연구에서는 이미지 토큰과 함께 연속적인 이미지 표현을 사용하여 자동 회귀 모델링을 통해 이미지를 생성합니다. SEED-X는 다중 모드 이해와 생성 작업을 모두 처리할 수 있는 통합 모델을 제안합니다. Chameleon은 이미지와 텍스트를 모두 생성할 수 있는 토큰 기반 모델을 제안합니다. Show-O는 또한 이산 토큰을 사용하여 모든 모달리티를 표현하지만, 시각적 생성을 위한 자동 회귀 모델링 대신 이산 확산 프로세스를 사용합니다.

SHOW-O: 방법론과 아키텍처

Show-O 프레임워크의 주요 목표는 자동 회귀와 확산 모델링을 통합하여 다중 모드 이해와 생성을 위한 통합 모델을 개발하는 것입니다. 이러한 통합 모델을 개발하는 것은 많은 도전을 제기합니다. 핵심 문제는 모델의 입력/출력 공간을 정의하는 것, 다양한 모달리티의 입력 데이터를 통합하는 것, 자동 회귀와 확산 모델링을 하나의 트랜스포머로 통합하는 것, 그리고 이러한 통합 모델을 효과적으로 훈련하는 것입니다.

Show-O는 이러한 도전을 해결하기 위해 다음과 같은 솔루션을 제안합니다.

  • Show-O는 입력/출력 공간을 구성하기 위해 텍스트와 이미지 데이터를 이산 토큰으로 토큰화합니다.
  • Show-O는 기본 아키텍처와 통합 프롬프팅 전략을 도입하여 입력 데이터와 모달리티를 구조화합니다.
  • Show-O는 하나의 트랜스포머 내에서 자동 회귀와 확산 모델링을 통합하는 방법을 보여줍니다.
  • Show-O는 통합 모델을 효과적으로 훈련하기 위한 3단계 훈련 파이프라인을 제안합니다.

토큰화

Show-O는 사전 훈련된 언어 모델을 기반으로 하기 때문에, 통합 학습을 위한 이산 공간에서 수행하는 것이 자연스럽습니다. Show-O는 텍스트와 이미지 토큰을 모두 포함하는 통합 어휘를 유지하며, 이산 토큰을 예측하는 동일한 학습 목표를 가지고 있습니다.

텍스트 토큰화

Show-O는 사전 훈련된 언어 모델을 기반으로 하며, 텍스트 데이터 토큰화에는 동일한 토큰화기를 사용합니다.

이미지 토큰화

MAGVIT-v2를 따라 Show-O는 약 35M 이미지 데이터를 사용하여 룩업-프리 쿼ντ라이저를 훈련합니다. 쿼ντ라이저는 8,192개의 코드북을 유지하며 256×256 해상도의 이미지를 16×16 이산 토큰으로 인코딩합니다. MAGVIT-v2는 미세조정을 쉽게 하기 때문에 비디오 토큰화기로서 시간 압축 능력이 있으며, Show-O는 将来 이를 탐색할 계획입니다. 대체 접근법은 이해와 생성을 위한 별도의 토큰화기를 사용하는 것입니다. 기존 연구에서 영감을 받은 Show-O는 또한 CLIP-ViT 인코더에서 연속적인 이미지 표현을 추출하여 다중 모드 이해 능력을 향상시키는 것을 탐색합니다.

아키텍처

Show-O는 기존 언어 모델의 아키텍처를 그대로继承하며, 각 주의층에 QK-Norm 연산을 추가하는 것을 제외하고는 아키텍처 수정이 없습니다. Show-O는 사전 훈련된 언어 모델의 가중치를 초기화하며, 8,192개의 새로운 학습 가능한 임베딩을 추가하여 이산 이미지 토큰을 통합합니다. 상태-of-the-art 확산 모델과 달리 Show-O는 텍스트-이미지 생성을 위한 추가적인 텍스트 인코더가 필요하지 않습니다.

통합 프롬프팅

다중 모드 이해와 생성을 위한 통합 학습을 수행하기 위해 Show-O는 통합 프롬프팅 전략을 사용하여 다양한 입력 데이터를 구조화합니다. 이미지-텍스트 쌍 (x, y)이 주어지면, 이를 이미지 토큰화기와 텍스트 토큰화기를 사용하여 M개의 이미지 토큰과 N개의 텍스트 토큰으로 토큰화합니다. 그런 다음 토큰은 작업 유형에 따라 입력 시퀀스로 구성됩니다.

이 프롬프팅 설계를 사용하여 Show-O는 다양한 입력 데이터를 시퀀스로 구조화할 수 있으며, 이는 다양한 작업을 위한 통합 학습을 가능하게 합니다. 훈련 후, Show-O는 시각 질문 답변, 텍스트-이미지 생성 및 혼합 모달리티 생성과 같은 다양한 비전-언어 작업을 처리할 수 있습니다.

오미 어텐션 메커니즘

기존 연구와 달리 Show-O는 다양한 신호를 다른 방식으로 모델링할 수 있는 오미 어텐션 메커니즘을 도입합니다. 이 어텐션 메커니즘은 입력 시퀀스의 형식에 따라 인과적 어텐션과 전체 어텐션을 적응적으로 전환합니다.

특히, Show-O는 시퀀스 내의 텍스트 토큰을 인과적 어텐션을 사용하여 처리하며, 이미지 토큰은 전체 어텐션을 사용하여 처리합니다. 이는 텍스트-이미지 생성에서 텍스트 토큰이 이전의 모든 이미지 토큰에 어텐션을 줄 수 있으며, 다중 모드 이해에서 이미지 토큰이 모든 이전 텍스트 토큰과 상호작용할 수 있습니다. 오미 어텐션은 텍스트 추론 지식을 유지하며, 샘플링 단계를 줄임으로써 이미지 생성의 효율성을 향상시킵니다. 또한, 미세조정을 요구하지 않고 인페인팅 및 엑스트라폴레이션과 같은 다운스트림 응용 프로그램을 지원합니다.

SHOW-O: 실험 및 결과

다음 표는 Show-O의 다중 모드 이해 능력을 공개 벤치마크에서 보여줍니다.

현재 버전의 Show-O는 Phi-1.5를 기반으로 하며, 따라서 Show-O의 이해 전용 대응 모델은 LLaVA-v1.5-Phi-1.5입니다. Show-O는 모든 평가 지표에서 기준선 LLaVA-v1.5-Phi-1.5와 비교하여 유사한 성능을 보여주며, 이는 Show-O 프레임워크가 다중 모드 이해와 생성을 통합하는 데 큰 잠재력을 가지고 있음을 시사합니다. 이해 전용 모델과 비교했을 때, Show-O는 더 작은 모델 크기에도 불구하고 POPE, MME, Flickr30k 및 VQAv2 벤치마크에서 경쟁력 있는 성능을 보여주며, GQA 벤치마크에서 더 나은 성능을 보여줍니다.

이러한 결과는 Show-O가 다음 세대 기본 모델로서의 잠재력을 강조하며, 이는 Show-O를 확장하여 최첨단 성능을 달성할 수 있음을 시사합니다.

질적 비교

다음 그림은 확산 기반 모델과 자동 회귀 기반 모델과 비교하여 Show-O의 질적 비교를 보여줍니다.

Show-O는 짧은 텍스트 프롬프트와 긴 텍스트 프롬프트 모두에서 일관된 콘텐츠를 가진 실제 이미지를 생성하는 능력을 보여줍니다. SDv1.5와 LlamaGen과 비교했을 때, Show-O는 더 나은 시각적 품질과 더 강한 이미지-텍스트 정렬을 보여줍니다.

텍스트 기반 인페인팅 및 엑스트라폴레이션

Show-O는 미세조정을 요구하지 않고 텍스트 기반 인페인팅 및 엑스트라폴레이션을 지원합니다.

위의 그림에서, Show-O는 입력 이미지와 인페인팅 마스크가 주어지면, 사용자 제공 텍스트 프롬프트에 따라 빨간色 트롤리 자동차를 파란색 스포츠카로 변환할 수 있습니다. Show-O는 또한 원본 이미지를 가로 또는 세로로 확장할 수 있습니다.

최종 생각

이 문서에서 우리는 Show-O, 다중 모드 이해와 생성을 통합하는 단일 트랜스포머에 대해 논의했습니다. 자동 회귀 모델과 달리 Show-O는 자동 회귀와 이산 확산 모델링을 통합하여 다양한 모달리티의 입력과 출력을 적응적으로 처리합니다. 통합 모델은 시각 질문 답변, 텍스트-이미지 생성, 텍스트-이미지 인페인팅/엑스트라폴레이션 및 혼합 모달리티 생성과 같은 다양한 비전-언어 작업을 유연하게 지원합니다. 다양한 벤치마크에서 Show-O는 동일하거나 더 큰 수의 매개변수를 가진 기존 모델과 비교하여 유사하거나 더 나은 성능을 보여주며, 이는 다음 세대 기본 모델로서의 잠재력을 강조합니다. 이 프레임워크에서 모델은 연속적인 잠재 표현에 추가된 가우시안 노이즈를 예측하는任务를 수행합니다. 다른 모델과 달리 D3PM, Mask-predict, ARDM 및 MaskGIT는 가우시안 확산 대신 이산 노이즈 프로세스를 사용합니다. Show-O는 시각적 생성을 위한 이산 확산 모델링을 채택합니다. Show-O는 자동 회귀와 이산 확산 모델링을 통합하여 다양한 모달리티를 다른 방식으로 처리할 수 있으며, 이는 다중 모드 이해와 생성을 위한 통합 모델로서의 잠재력을 강조합니다. 광범위한 실험 결과는 Show-O가 개별 전문가 모델과 비교하여 유사하거나 더 나은 성능을 보여주며, 이는 다음 세대 기본 모델로서의 잠재력을 강조합니다.

전문직으로서의 엔지니어, 마음으로서의 작가입니다. Kunal은 AI와 ML에 대한 깊은 사랑과 이해를 가진 기술 작가로, 이러한 분야의 복잡한 개념을 흥미롭고 정보적인 문서를 통해 단순화하는데 헌신하고 있습니다.