AI 모델 및 플랫폼
StreamDiffusion: 실시간 상호작용 이미지 생성을 위한 파이프라인 수준의 솔루션

메타버스는 현재 가장 빠르게 성장하는 기술 중 하나이며, 특히 게임, 방송, 비디오 스트리밍 등에서 상업화 기회가 크기 때문에 주목을 받고 있습니다. 현대의 메타버스 애플리케이션은 컴퓨터 비전과 확산 모델을 포함한 AI 프레임워크를 사용하여 현실감을 높입니다. 메타버스 애플리케이션의 주요課題는 낮은 지연 시간과 높은 처리량을 제공하는 다양한 확산 파이프라인을 통합하는 것입니다.
오늘날의 확산 기반 AI 프레임워크는 이미지 생성에 탁월하지만 실시간 상호작용에는 약합니다. 이는 연속적인 입력과 높은 처리량이 필요한 비디오 게임 그래픽스, 메타버스 애플리케이션, 방송, 라이브 비디오 스트리밍 등의 작업에서 특히 두드러집니다.
이 글에서는 StreamDiffusion, 즉 연속적인 입력이 필요한 작업에서 현재 확산 기반 프레임워크의 한계를 해결하기 위해 개발된 실시간 확산 파이프라인에 대해 논의할 것입니다. StreamDiffusion은 혁신적인 접근 방식으로 원본 이미지의 순차적 노이즈를 배치 노이즈로 변환하여 높은 처리량과 유동적인 스트림을 가능하게 합니다. 이 접근 방식은 기존 확산 기반 프레임워크에서 사용하는 전통적인 대기 및 상호작용 방법에서 벗어납니다. 다음 섹션에서 StreamDiffusion 프레임워크의 작동, 아키텍처, 비교 결과 등을 자세히 살펴보겠습니다.
StreamDiffusion: 실시간 상호작용 이미지 생성 소개
메타버스는 성능 집약적인 애플리케이션으로, 사용자에게 상호작용 인터페이스와 경험을 제공하기 위해 실시간으로大量의 데이터를 처리합니다. 현대의 메타버스 애플리케이션은 컴퓨터 비전, 이미지 처리, 확산 모델을 포함한 AI 기반 프레임워크를 사용하여 낮은 지연 시간과 높은 처리량을 달성합니다. 현재 대부분의 메타버스 애플리케이션은 확산 프로세스를 재구성하거나 다단계 확산 모델을 단일 단계로 축소하여 높은 처리량과 상호작용 능력을 향상시키기 위해 노이즈 반복의 빈도를 줄이는 전략을 사용합니다. 이러한 접근 방식은 만족스러운 결과를 제공하지만 유연성과 계산 비용이 높은 등의 제한이 있습니다.
StreamDiffusion은 파이프라인 수준의 솔루션으로, 원본 입력을 노이즈로 변환하는 대신 노이즈를 배치로 처리하는 단순한 전략을 사용합니다. 이 전략은 비동기 처리에서 영감을 얻었으며, 프레임워크가 첫 번째 노이즈 반복 단계를 완료하기를 기다릴 필요가 없습니다. StreamDiffusion 프레임워크는 또한 입력과 출력을 캐시하기 위해 큐 전략을 구현하여 U-Net 처리 빈도와 입력 빈도 사이의 불일치를 해결합니다.

StreamDiffusion은 기존 확산 기반 파이프라인과 달리 GPU 병렬성을 사용하여 단일 U-Net 구성 요소를 사용하여 노이즈를 배치로 처리할 수 있습니다. 또한 StreamDiffusion은 기존 확산 기반 파이프라인에서 발생하는 계산 오버헤드를 줄이기 위해 잔여 분류자 자유 가이드(RCFG) 접근 방식을 구현합니다. 이 접근 방식은 가상 잔여 노이즈를 사용하여 음성 조건을 근사화하여 초기 단계에서 음성 노이즈 조건을 계산할 수 있습니다.
StreamDiffusion은 또한 전통적인 확산 파이프라인의 계산 요구를 줄이기 위해 확률적 유사성 필터링 전략을 구현하여 입력 이미지 사이의 유사성을 계산하여 파이프라인이 입력 이미지를 처리해야 하는지 여부를 결정합니다.
StreamDiffusion: 작동 및 아키텍처
StreamDiffusion 파이프라인은 실시간 확산 파이프라인으로, 6개의 주요 구성 요소로 구성됩니다. RCFG, 스트림 배치 전략, 확률적 유사성 필터, 입력-출력 큐, 모델 가속 도구 및 미리 계산 절차가 있습니다. 이러한 구성 요소를 자세히 살펴보겠습니다.
스트림 배치 전략
전통적인 확산 모델에서 노이즈 반복 단계는 순차적으로 수행되어 U-Net 처리 시간이 증가합니다. 그러나 높은忠實도 이미지를 생성하기 위해 처리 단계를 증가시키는 것이 중요합니다. StreamDiffusion 프레임워크는 스트림 배치 전략을 도입하여 상호작용 확산 프레임워크에서 높은 지연 시간을 해결합니다.
스트림 배치 전략에서는 순차적 노이즈 반복 단계를 배치 처리로 재구성하여 각 배치가 노이즈 반복 단계의 사전 정의된 수에 해당합니다. 이 접근 방식으로 각 배치의 요소는 단일 패스스루 U-Net을 사용하여 노이즈 반복 순서에서 한 단계进一步 진행할 수 있습니다. 스트림 배치 전략을 반복적으로 구현하여 입력 이미지의 시간 “t”에 대한 이미지-이미지 결과를 시간 “t+n”에 변환할 수 있습니다.
잔여 분류자 자유 가이드
CFG 또는 분류자 자유 가이드는 원래 조건부 항과 음성 조건부 항 사이의 벡터 계산을 수행하여 원래 조건의 효과를增强합니다. 그러나 음성 조건부 노이즈를 계산하기 위해 개별 입력 잠재 변수를 음성 조건부 임베딩과 결합하고 U-Net을 통해 전달해야 합니다.
StreamDiffusion 프레임워크는 음성 조건부 임베딩에 대한 추가 U-Net 간섭의 계산 비용을 줄이기 위해 잔여 분류자 자유 가이드 알고리즘을 구현합니다. 먼저, 인코딩된 잠재 입력을 노이즈 분포로 전환하여 노이즈 스케줄러에 의해 결정된 값으로 전환합니다. 한 번 잠재 일관성 모델이 구현되면 알고리즘은 데이터 분포를 예측하고 CFG 잔여 노이즈를 사용하여 다음 단계의 노이즈 분포를 생성할 수 있습니다.

입력-출력 큐
고속 이미지 생성 프레임워크의 주요課題는 신경망 구성 요소인 U-Net과 VAE입니다. 효율성을 최대화하고 출력 속도를 높이기 위해 이미지 처리 프레임워크는 신경망 구성 요소에 의해 처리되지 않는 이미지 전처리와 후처리 과정을 파이프라인 외부로 이동하고 병렬로 처리합니다. 또한 입력 이미지를 처리할 때 특정 작업을 수행합니다.
StreamDiffusion 파이프라인은 모델 처리 빈도와 인간 입력 빈도 사이의 불일치를 해결하기 위해 입력-출력 큐 전략을 구현합니다.

처리된 입력 텐서는 Diffusion 모델을 위해 정렬된 큐에 저장됩니다. 각 프레임에서 모델은 입력 큐에서 가장 최근의 텐서를 검색하고 텐서를 VAE 인코더로 전달하여 이미지 생성 과정을 시작합니다.同時에, VAE 디코더의 텐서 출력은 출력 큐로 전달됩니다. 최종적으로 처리된 이미지 데이터는 렌더링 클라이언트로 전송됩니다.
확률적 유사성 필터
정적인 환경이나 사용자 상호작용 없이 이미지에 거의 변화가 없거나 동일한 이미지가 반복적으로 입력되는 경우, 유사한 이미지가 반복적으로 U-Net과 VAE 구성 요소를 통해 전달되어 거의 동일한 이미지를 생성하고 추가로 GPU 자원을 소모합니다. StreamDiffusion 파이프라인은 이러한 문제를 해결하기 위해 확률적 유사성 필터 구성 요소를 구현합니다.
확률적 유사성 필터는 참조 이미지와 입력 이미지 사이의 코사인 유사성을 계산하고 유사성 점수를 사용하여 후속 U-Net과 VAE 프로세스를 건너뛰는 확률을 계산합니다.
미리 계산
U-Net 아키텍처는 조건부 임베딩과 입력 잠재 변수가 모두 필요합니다. 전통적으로 조건부 임베딩은 프롬프트 임베딩에서 파생되며 프레임 간에 일정합니다. StreamDiffusion 파이프라인은 이러한 프롬프트 임베딩을 미리 계산하여 캐시에 저장하고 스트리밍 또는 상호작용 모드에서 호출합니다.
모델 가속 및 Tiny AutoEncoder
StreamDiffusion 파이프라인은 VAE와 U-Net 엔진을 구축하기 위해 Nvidia의 TensorRT를 사용하여 추론 속도를 가속화합니다. 이를 위해 TensorRT 구성 요소는 효율성을 높이고 딥 러닝 프레임워크 및 애플리케이션의 처리량을 향상시키기 위해 신경망에 대한 여러 최적화를 수행합니다.
StreamDiffusion은 속도를 최적화하기 위해 고정 입력 차원과 정적 배치 크기를 사용하여 특정 입력 크기에 대한 최적의 메모리 할당과 계산 그래프를 보장합니다.

StreamDiffusion: 실험 및 결과
StreamDiffusion 파이프라인의 능력을 평가하기 위해 LCM과 SD-turbo 프레임워크에서 구현되었습니다. Nvidia의 TensorRT를 모델 가속기로 사용하고, 가벼운 효율성을 위해 VAE에 TAESD 구성 요소를 사용합니다. StreamDiffusion 파이프라인이 현재 상태의 최첨단 프레임워크와 비교했을 때 어떻게 수행하는지 살펴보겠습니다.
양적 평가
다음 그림은 파이프라인의 순차적 U-Net과 노이즈 배치 구성 요소의 효율성을 비교하여, 노이즈 배치 접근 방식을 구현하면 처리 시간을 약 50% 줄일 수 있음을 보여줍니다.

또한 다양한 노이즈 반복 단계에서 평균 추론 시간도 상당히 개선되었습니다.

최종 생각
이 글에서는 StreamDiffusion, 즉 연속적인 입력이 필요한 작업에서 현재 확산 기반 프레임워크의 한계를 해결하기 위해 개발된 실시간 확산 파이프라인에 대해 논의했습니다. StreamDiffusion은 순차적 노이즈를 배치 노이즈로 변환하여 높은 처리량과 유동적인 스트림을 가능하게 하는 단순한 접근 방식입니다. StreamDiffusion은 기존 확산 기반 프레임워크에서 사용하는 전통적인 대기 및 상호작용 방법에서 벗어난 파이프라인 수준의 솔루션입니다. 효율성의 잠재적 인 가인은 StreamDiffusion 파이프라인의 상업적 애플리케이션에 대한 잠재력을 강조하며, 높은 성능 컴퓨팅과 생성적 AI를 위한 매력적인 솔루션을 제공합니다.












