Anderson의 관점
RAG-증강 이미지 생성의 미래

안정적인 확산 모델과 같은 생성 확산 모델은 Stable Diffusion, Flux 및 비디오 모델과 같이 Hunyuan과 같은 단일 리소스 집약적인 훈련 세션에서 얻은 지식을 사용합니다. 이 훈련 세션 이후에 도입된 모든 개념은 훈련 세션에서 얻은 지식이 없는 모델에서 사용할 수 없습니다. 이러한 지식은 미세 조정 또는 외부 적응 기술을 통해 모델에 제공될 수 있습니다.
이미지 또는 비디오를 생성하는 생성 시스템이 온라인 소스에 접근하여 생성 프로세스에서 필요한 정보를 가져올 수 있다면 이상적일 것입니다. 예를 들어, 최신 Apple 또는 Tesla 제품에 대해 아무런 지식도 없는 확산 모델은 이러한 새로운 제품을 포함하는 이미지를 생성할 수 있습니다.
언어 모델의 경우, 대부분의 사람들은 Perplexity, Notebook LM 및 ChatGPT-4o와 같은 시스템을 사용하여 외부 정보를 통합할 수 있습니다. 이러한 시스템은 RAG(검색 증강 생성) 모델을 사용하여 외부 정보를 통합합니다.

RAG 프로세스가 ChatGPT 4o의 응답을 더 관련성 있게 만듭니다. 출처: https://chatgpt.com/
그러나 이미지 생성의 경우, 이러한 기능은 드뭅니다. ChatGPT는 이러한 기능이 없는 자신의 한계를 인정합니다.

ChatGPT 4o는 새로운 시계 출시에 대한 일반적인 라인과 설명을 해석하여 좋은 추측을 하지만, DALL-E 기반 생성에 새로운 이미지를 통합할 수 없습니다.
외부에서 검색된 데이터를 생성된 이미지에 통합하는 것은 어려운 일입니다. 검색된 이미지는 먼저 토큰과 임베딩으로 분해되어야 하며, 이러한 임베딩은 모델의 가장 가까운 훈련된 도메인 지식에 매핑되어야 합니다.
이러한 프로세스는 ControlNet과 같은 후처리 도구에서 효과적으로 작동하지만, 이러한 조작은 표면적인 것으로서, 검색된 이미지를 렌더링 파이프라인을 통해 전달하지만, 모델의 내부 표현에 깊이 통합하지는 않습니다.
따라서 모델은 새로운 관점을 생성하는 능력이 부족합니다. 이는 NeRF와 같은 신경 렌더링 시스템에서 볼 수 있는 바와 같이, 실제 공간적 및 구조적 이해를 통해 장면을 구성할 수 없습니다.
성숙한 논리
이러한 한계는 대규모 언어 모델(Large Language Models, LLMs)에서 사용되는 RAG 기반 쿼리에도 적용됩니다. 이러한 모델은 외부에서 검색된 데이터를 처리할 때, 성인들이 일생 동안의 지식을 사용하여 주제에 대한 확률을 추론하는 것과 유사하게 작동합니다.
그러나,一个人은 새로운 정보를 자신의 인식 체계에 역으로 통합할 수 없습니다. 이러한 모델도 새로운 지식을 자신의 내부 구조에无缝하게 통합할 수 없습니다.
대신, 모델은 새로운 데이터를 기존의 내부화된 지식에 대조하여 분석하고 추론합니다. 이러한 접근 방식은 생성된 이미지에서보다 언어 기반 생성에서 더 명확하게 나타납니다.
RAG-가능한 이미지 생성의 숨겨진 위험
RAG 스타일로 검색된 인터넷 이미지를 새로운 합성 이미지에无缝하게 통합할 수 있다 하더라도, 안전성 관련 제한이 추가적인 도전이 됩니다.
생성 모델을 위한 많은 데이터셋은 명시적, 인종차별적 또는 폭력적인 콘텐츠의 존재를 최소화하기 위해 큐레이션됩니다. 그러나 이러한 프로세스는 완벽하지 않으며, 잔여 연관성이 지속될 수 있습니다. 이러한 문제를 완화하기 위해 DALL·E와 Adobe Firefly와 같은 시스템은 입력 프롬프트와 생성된 출력을 위한 보조 필터링 메커니즘을 사용합니다.
따라서, 단순한 성인 콘텐츠 필터는 검색된 RAG 기반 데이터의 허용성을 평가하기에 충분하지 않습니다. 이러한 콘텐츠는 모델의 사전 정의된 모더레이션 매개변수 외부에서 공격적이거나 유해할 수 있습니다.
RAG를 위한 이미지 생성
이러한 도전 과제와 정치적 측면에도 불구하고, 새로운 데이터를 시각적 생성에 통합하는 시도를 하는 여러 프로젝트가 있습니다.
ReDi
2023年の 검색 기반 확산(ReDi) 프로젝트는 사전 계산된 지식 베이스에서 유사한 트레이저리를 검색하여 확산 모델 추론을 가속화하는 학습 자유 프레임워크입니다.

데이터셋의 값이 새로운 생성을 위해 ReDi에서借用될 수 있습니다. 출처: https://arxiv.org/pdf/2302.02285
확산 모델에서 트레이저리는 모델이純粋한 노이즈에서 이미지를 생성하기 위해 취하는 단계별 경로입니다. 일반적으로, 이러한 프로세스는 여러 단계에 걸쳐서 점진적으로 발생하며, 각 단계에서 이미지를 조금 더 정련합니다.
ReDi는 이러한 단계 중 일부를 건너뛰어 계산을 줄여 확산 기반 이미지 생성을 더 빠르게 만듭니다.
RDM
또 다른 초기 시도는 검색 증강 확산 모델(RDM)입니다. 이는 반-매개 변수 접근 방식을 사용하여 외부 이미지 데이터베이스에서 검색된 이미지에 따라 생성 프로세스를 안내합니다.

RDM*의 가상 쿼리에서 검색된最近.neighbors.
이 프로세스는 CLIP 임베딩을 사용하여 의미적으로 유사한 이미지를 검색하고, 생성 프로세스를 안내합니다.
이 접근 방식은 모델의 매개 변수에 대한 의존도를 줄여, 더 작은 모델이 경쟁력 있는 결과를 달성할 수 있도록 합니다.
ReMoDiffuse
ReMoDiffuse는 3D 인간 동작 생성을 위한 검색 증강 확산 모델입니다. 전통적인 동작 생성 모델과 달리, ReMoDiffuse는 대규모 동작 데이터셋에서 관련 동작 샘플을 검색하여 생성 프로세스에 통합합니다.

ReMoDiffuse와 이전 방법의 비교. 출처: https://arxiv.org/pdf/2304.01116
이 모델은 사용자 텍스트 프롬프트에 대한 더 자연스럽고 다양한 동작 시퀀스를 생성합니다.
RA-CM3
Stanford의 2023년 연구는 검색 증강 멀티모달 언어 모델링(RA-CM3)을 제안합니다. 이 모델은 실제 세계 정보에 접근하여 생성 프로세스를 개선합니다.

Stanford의 검색 증강 멀티모달 언어 모델링(RA-CM3) 모델. 출처: https://cs.stanford.edu/~myasu/files/RACM3_slides.pdf
RA-CM3는 검색된 텍스트와 이미지를 생성 프로세스에 통합하여, 텍스트-이미지 및 이미지-텍스트 생성을 모두 개선합니다.
RealRAG
RealRAG는 실제 이미지의 검색을 통해 생성된 이미지의 품질을 개선하는 새로운 접근 방식입니다. 이 모델은 외부 이미지 데이터베이스에서 관련 이미지를 검색하여 생성 프로세스에 통합합니다.

RealRAG에서 외부 이미지를 검색하여 생성 프로세스에 통합합니다. 출처: https://arxiv.o7rg/pdf/2502.00848
RealRAG는 실제 이미지의 검색을 통해 생성된 이미지의 품질을 개선합니다.
결론
이미지 검색을 통한 멀티모달 생성 시스템의 대표적인 예입니다. 일부 시스템은 시각적 이해나 데이터 큐레이션을 개선하기 위해 검색을 사용합니다. 다른 시스템은 이미지 생성을 목표로 하지 않습니다.
많은 RAG 통합 프로젝트는 아직 공개되지 않았습니다. 일부 프로토タイプ는 공개된 연구만 있으며, 사용자에게 공개되지 않은 상태입니다.
이미지 생성을 위한 RAG 기반 증강은 사용자 참여와 인터넷 소스 이미지의 직접 통합을 허용하는 시스템에 초점이 맞춰질 것입니다. 그러나, 이러한 시스템의 개발은 여전히 도전적입니다.
이미지 생성을 위한 RAG 기반 증강의 개발은 사용자 참여와 인터넷 소스 이미지의 직접 통합을 허용하는 시스템에 초점이 맞춰질 것입니다. 그러나, 이러한 시스템의 개발은 여전히 도전적입니다.
이미지 생성을 위한 RAG 기반 증강의 개발은 사용자 참여와 인터넷 소스 이미지의 직접 통합을 허용하는 시스템에 초점이 맞춰질 것입니다. 그러나, 이러한 시스템의 개발은 여전히 도전적입니다.
이미지 생성을 위한 RAG 기반 증강의 개발은 사용자 참여와 인터넷 소스 이미지의 직접 통합을 허용하는 시스템에 초점이 맞춰질 것입니다. 그러나, 이러한 시스템의 개발은 여전히 도전적입니다.
이미지 생성을 위한 RAG 기반 증강의 개발은 사용자 참여와 인터넷 소스 이미지의 직접 통합을 허용하는 시스템에 초점이 맞춰질 것입니다. 그러나, 이러한 시스템의 개발은 여전히 도전적입니다.












