AI 기초
AI에서 확산 모델 – 알아야 할 모든 것
AI 생태계에서 확산 모델은 기술 발전의 방향과 속도를 결정하고 있습니다. 복잡한 생성적 AI 작업에 대한 접근 방식을 혁신하고 있습니다. 이러한 모델은 가우시안 원리, 분산, 미분 방정식 및 생성 시퀀스의 수학에 기반을 두고 있습니다. (아래에서 기술 용어를 설명하겠습니다)
최근에 Nvidia (NVDA ), Google (GOOGL ), Adobe (ADBE ) 및 OpenAI가 개발한 현대적인 AI 중심 제품 및 솔루션은 확산 모델을 주목할 만한 위치에 두었습니다. DALL.E 2, 안정 확산 및 Midjourney는 최근 인터넷에서 주목받고 있는 확산 모델의 대표적인 예입니다. 사용자는 간단한 텍스트 프롬프트를 입력하면 이러한 모델은 현실적인 이미지로 변환할 수 있습니다.

Midjourney v5를 사용하여 생성된 이미지: 입력 프롬프트 – ‘칼리포니아 팝피의 생동감’ 출처: Midjourney
확산 모델의 기본 작동 원리와它们가 오늘날 우리가 보는 세계의 방향과 규범을 어떻게 변경하는지 살펴보겠습니다.
확산 모델이란 무엇인가?
연구 논문 “확산 확률 모델“에 따르면, 확산 모델은 다음과 같이 정의됩니다.
“확산 모델 또는 확률 확산 모델은 매개변수화된 마르코프 체인으로, 변분 추론을 사용하여 유한 시간 후에 데이터와 일치하는 샘플을 생성하는 모델입니다”
간단히 말해, 확산 모델은 훈련 데이터와 유사한 데이터를 생성할 수 있습니다. 모델이 고양이 이미지에 훈련되면, 유사한 현실적인 고양이 이미지를 생성할 수 있습니다.
위에서 언급한 기술적 정의를 분해해 보겠습니다. 확산 모델은 시간이 지남에 따라 변하는 시스템의 행동을 분석하고 예측할 수 있는 확률 모델의 작동 원리와 수학적 기초에서 영감을 얻었습니다.
정의에 따르면, 확산 모델은 매개변수화된 마르코프 체인으로, 변분 추론을 사용하여 훈련됩니다. 마르코프 체인은 시스템이 시간이 지남에 따라 다른 상태로 전환하는 수학적 모델입니다. 시스템의 현재 상태는 시스템이 취할 수 있는 가능한 상태를 결정합니다.
변분 추론을 사용하여 모델을 훈련하는 것은 복잡한 계산을 포함합니다. 목표는 모델의 손실 함수를 최소화하는 매개변수를 찾는 것입니다. 손실 함수는 예측된 상태와 관찰된 상태 사이의 차이입니다.
훈련이 완료되면, 모델은 관찰된 데이터와 일치하는 샘플을 생성할 수 있습니다. 이러한 샘플은 시스템이 시간이 지남에 따라 취할 수 있는 가능한 궤적 또는 상태를 나타냅니다. 각 궤적에는 발생할 가능성이 다르며, 모델은 이러한 샘플을 생성하여 시스템의 미래 행동을 예측할 수 있습니다.
AI에서 확산 모델을 어떻게 해석하는가?
확산 모델은 깊은 생성 모델로, 가우시안 노이즈(가우시안 노이즈)를 사용하여 훈련 데이터에 노이즈를 추가한 후(전방 확산 과정) 노이즈를 제거하여 데이터를 복원하는 역방향 확산 과정을 사용합니다. 모델은 점차적으로 노이즈를 제거하는 것을 학습합니다. 이 학습된 노이즈 제거 과정은 랜덤한 시드(랜덤한 노이즈 이미지)에서 새로운 고화질 이미지를 생성합니다.

역방향 확산 과정: 훈련된 확산 모델을 통해 노이즈 이미지에서 원래 이미지를 복원하는 과정 출처: 확산 확률 모델
확산 모델의 3가지 카테고리
확산 모델背后的 과학을支える 세 가지 기본적인 수학적 프레임워크가 있습니다. 모두 노이즈를 추가하고 제거하여 새로운 샘플을 생성하는 동일한 원리를 따릅니다. 아래에서 이러한 프레임워크에 대해 논의하겠습니다.

확산 모델이 이미지에서 노이즈를 추가하고 제거하는 과정 출처: 시각에서 확산 모델: 조사
1. 확산 확률 모델(Denoising Diffusion Probabilistic Models, DDPMs)
위에서 설명한 대로, DDPMs는 주로 시각적 또는 오디오 데이터에서 노이즈를 제거하는 생성 모델입니다. 이미지 및 오디오 노이즈 제거 작업에서 인상적인 결과를 보여주었습니다. 예를 들어, 영화 산업은 현대적인 이미지 및 비디오 처리 도구를 사용하여 제작 품질을 향상시킵니다.
2. 노이즈 조건부 점수 기반 생성 모델(Noise-Conditioned Score-Based Generative Models, SGMs)
SGMs는 주어진 분포에서 새로운 샘플을 생성할 수 있습니다. 로그 密度 추정(log density estimation)을 통해 대상 분포의 점수 함수를 학습하여 새로운 데이터 포인트를 생성합니다.
예를 들어, 딥페이크는 유명인사의 가짜 비디오 및 오디오를 생성하는 것으로 악명 높습니다. 그러나 이러한 기술은 주로 생성적 적대적 네트워크(GANs)에 기인합니다. 그러나 SGMs는 유사한 능력을 보여주었으며 때때로 더 나은 성능을 발휘하여 고화질의 유명인사 얼굴을 생성할 수 있습니다. 또한 SGMs는 의료 데이터셋을 확장하는 데 도움이 될 수 있습니다. 이러한 데이터셋은 규제와 산업 표준으로 인해大量으로 사용할 수 없습니다.
3. 확률적 미분 방정식(Stochastic Differential Equations, SDEs)
SDEs는 시간에 따른 무작위한 과정의 변화를 설명합니다. 물리학 및 금융 시장에서 무작위한 요인들이 시장 결과에重大한 영향을 미치는 경우에 널리 사용됩니다.
예를 들어, 商品의 가격은 매우 동적이며 다양한 무작위한 요인에 의해 영향을 받습니다. SDEs는 금융 파생상품(원유 계약과 같은)을 계산하여 정확한 가격을 계산할 수 있습니다.
AI에서 확산 모델의 주요 응용
확산 모델의 널리 사용되는 몇 가지 주요 응용 분야를 살펴보겠습니다.
고화질 비디오 생성
깊은 학습을 사용하여 고화질 비디오를 생성하는 것은 비디오 프레임의 연속성이 높기 때문에 어렵습니다. 여기서 확산 모델이 유용하게 쓰입니다. 확산 모델은 누락된 프레임을 생성하여 고화질의 매끄러운 비디오를 생성할 수 있습니다.
연구자들은 유연한 확산 모델 및 잔차 비디오 확산과 같은 기술을 개발했습니다. 이러한 모델은 실제 프레임 사이에 AI 생성 프레임을 추가하여 현실적인 비디오를 생성할 수 있습니다.
이러한 모델은 저프레임 레이트 비디오의 프레임 속도(FPS)를 높여서 더 나은 화질을 제공할 수 있습니다. 이러한 프레임워크는 거의 프레임 손실 없이 실제 프레임에서 학습한 패턴을 추가하여 깊은 학습 기반 모델이 원본처럼 보이는 고화질 비디오를 생성하는 데 도움이 될 수 있습니다.
2023년에 비디오 콘텐츠 생성 및 편집을 빠르고 간단하게 만드는 다양한 인상적인 AI 비디오 생성기가 있습니다.
텍스트-이미지 생성
텍스트-이미지 모델은 입력 프롬프트를 사용하여 고화질 이미지를 생성합니다. 예를 들어, “접시 위에 빨간 사과”라는 입력을 주면 현실적인 사과 이미지를 생성할 수 있습니다. 블렌DED 확산 및 unCLIP은 이러한 모델의 두 가지 대표적인 예입니다. 이러한 모델은 사용자 입력에 따라 정확한 이미지를 생성할 수 있습니다.
GLIDE는 OpenAI에서 2021년에 발표한 또 다른 잘 알려진 솔루션으로, 사용자 입력을 통해 현실적인 이미지를 생성할 수 있습니다. 이후 OpenAI는 가장 최신의 이미지 생성 모델인 DALL.E-2를 발표했습니다.
구글도 대규모 언어 모델을 사용하여 입력 텍스트의 깊은 텍스트적 이해를 개발하여 현실적인 이미지를 생성하는 이미지 생성 모델을 개발했습니다.
위에서 언급한 Midjourney 및 Stable Diffusion(DreamStudio)와 같은 다른 인기 있는 이미지 생성 도구도 있습니다. 아래에서 Stable Diffusion을 사용하여 생성된 이미지를 확인하십시오.

Stable Diffusion 1.5를 사용하여 생성된 이미지: 프롬프트 – ‘콜라주, 초현실적, 많은 변형, 매우 오래된 톰 요크, 프로필, 다양한 연령, 매크로 렌즈, 임계 영역, 리 버메조, 알폰스 무차, 그레그 루트코프스키, 회색 수염, 매끄러운 얼굴, 광대뼈’
AI에서 확산 모델 – 미래에 무엇을 기대할 수 있나?
확산 모델은 복잡한 이미지 및 비디오 데이터셋에서 고화질 샘플을 생성하는 강력한 접근 방식으로 나타났습니다. 데이터를 사용하고 조작하는 인간의 능력을 향상시키는 확산 모델은 오늘날 우리가 보는 세계를 혁신할 수 있습니다. 확산 모델의 응용 분야가 더 많이 나타날 것으로 예상됩니다.
그러나 확산 모델은 생성적 AI 기술의 유일한 방법이 아닙니다. 연구자들은 또한 생성적 적대적 네트워크(GANs), 변분 오토인코더 및 흐름 기반 깊은 생성 모델을 사용하여 AI 콘텐츠를 생성합니다. 확산 모델과 다른 생성 모델을 구별하는 근본적인 특성을 이해하면 더 효과적인 솔루션을 개발하는 데 도움이 될 수 있습니다.
AI 기반 기술에 대해 더 알아보려면 Unite.ai를 방문하십시오. 아래에서 생성적 AI 도구에 대한 우리의 큐레이션된 리소스를 확인하십시오.












