AI 모델 및 플랫폼

DiffSeg : Stable Diffusion을 이용한 비지도 제로샷 세그멘테이션

mm
Unite.AI를 Google의 선호 소스에 추가

컴퓨터 비전 모델에서 고품질의 세그멘테이션 마스크를 생성하는 것은 핵심적인 도전 과제 중 하나입니다. 최근 대규모 지도 학습의 발전으로 다양한 이미지 스타일에서 제로샷 세그멘테이션을 가능하게 하였습니다. 또한, 비지도 학습은 세그멘테이션을 위한 광범위한 주석의 필요성을 줄였습니다. 이러한 발전에도 불구하고, 주석 없이 제로샷 설정에서 모든 것을 세그먼트할 수 있는 컴퓨터 비전 프레임워크를 구축하는 것은 여전히 복잡한 작업입니다. 컴퓨터 비전 모델에서 기본적인 개념인 시맨틱 세그멘테이션은 이미지의 작은 영역으로 나누어 유사한 의미를 가진 영역으로 나누는 것을 포함합니다. 이 기술은 의료 이미지, 이미지 편집, 자율 주행 자동차 등 다양한 다운스트림 작업의 기초를 제공합니다.

컴퓨터 비전 모델의 발전을 위해서는 이미지 세그멘테이션이 고정된 데이터셋과 제한된 카테고리로 제한되어서는 안 됩니다. 대신, 다양한 다른 응용 프로그램을 위한 유연한 기초 작업으로 작동해야 합니다. 그러나, 픽셀 단위로 레이블을 수집하는 비용은 높은 것으로, 주석이 없는 제로샷 및 지도 학습 세그멘테이션 방법의 발전에 제한을 두고 있습니다. 이 문서에서는 안정적인 확산 모델의 자기 주의 계층이 주석 없이 제로샷 설정에서 모든 입력을 세그먼트할 수 있는 모델을 생성하는 데 어떻게 도움이 될 수 있는지에 대해 논의합니다. 이러한 자기 주의 계층은 사전 학습된 안정적인 확산 모델에서 학습된 객체 개념을 내재적으로 이해합니다.

DiffSeg : 향상된 제로샷 세그멘테이션 알고리즘

시맨틱 세그멘테이션은 이미지의 다양한 섹션으로 나누는 프로세스입니다. 각 섹션은 유사한 의미를 공유합니다. 이 기술은 다양한 다운스트림 작업의 기초를 형성합니다. 전통적으로, 제로샷 컴퓨터 비전 작업은 지도 학습 시맨틱 세그멘테이션에 의존하여 큰 데이터셋과 주석이 달린 카테고리를 사용했습니다. 그러나, 제로샷 설정에서 비지도 시맨틱 세그멘테이션을 구현하는 것은 여전히 도전입니다. 전통적인 지도 방법은 효과적이지만, 픽셀 단위로 레이블링하는 비용은 종종 금지적입니다. 이는 비지도 세그멘테이션 방법을 개발하는 필요성을 강조합니다. 이러한 방법은 제한된 제로샷 설정에서 주석이 필요하지 않으며, 데이터에 대한 사전 지식이 필요하지 않습니다.

이 제한을 해결하기 위해, DiffSeg은 안정적인 확산 프레임워크를 사용하여 제로샷 전송이 가능한 일반적인 세그멘테이션 모델을 구축하는 새로운 후처리 전략을 소개합니다. 안정적인 확산 프레임워크는 프롬프트 조건에 따라 고해상도 이미지를 생성하는 데 효율적입니다. 생성된 이미지의 경우, 이 프레임워크는 해당 텍스트 프롬프트를 사용하여 세그멘테이션 마스크를 생성할 수 있습니다. 이러한 마스크는 일반적으로 전경 객체만 포함합니다.

반대로, DiffSeg은 자기 주의 텐서를 사용하여 세그멘테이션 마스크를 생성하는 새로운 후처리 방법입니다. DiffSeg 알고리즘은 세 가지 주요 구성 요소로 구성됩니다. 자기 주의 병합, 자기 주의 집계, 및 비최대 억제입니다. 다음 이미지는 이러한 구성 요소를 보여줍니다.

DiffSeg 알고리즘은 여러 해상도에서 시각적 정보를 보존하기 위해 4차원 자기 주의 텐서를 공간적 일관성을 갖도록 집계합니다. 또한, 자기 주의 마스크를 병합하기 위해 앵커 포인트를 샘플링하는 반복적인 병합 과정을 사용합니다. 이러한 앵커는 마스크를 병합하는 출발점으로 사용됩니다. DiffSeg 프레임워크는 KL 발산 방법을 사용하여 두 자기 주의 맵 사이의 유사성을 측정하여 병합 과정을 제어합니다.

클러스터링 기반 비지도 세그멘테이션 방법과 비교할 때, DiffSeg 알고리즘은 클러스터의 수를事先 지정할 필요가 없습니다. 또한, 추가 자원이나 사전 지식 없이 세그멘테이션을 생성할 수 있습니다. 전반적으로, DiffSeg 알고리즘은 “사전 학습된 안정적인 확산 모델을 사용하여 자율적으로 세그멘테이션을 수행하는 새로운 비지도 및 제로샷 세그멘테이션 방법입니다. 이 방법은 추가 자원이나 사전 지식 없이 이미지를 세그먼트할 수 있습니다.”

DiffSeg : 기본 개념

DiffSeg은 확산 모델, 비지도 세그멘테이션, 및 제로샷 세그멘테이션의 학습을 기반으로 하는 새로운 알고리즘입니다.

확산 모델

DiffSeg 알고리즘은 사전 학습된 확산 모델의 학습을 기반으로 합니다. 확산 모델은 컴퓨터 비전 모델에서 가장 인기 있는 생성 프레임워크 중 하나입니다. 이 모델은 이미지에서 노이즈를 추가하여 노이즈가 있는 이미지로 만들고, 노이즈를 제거하여 원래 이미지를 복원하는 과정을 학습합니다. 안정적인 확산은 확산 모델의 가장 인기 있는 변형입니다. 이 모델은 지도 세그멘테이션, 제로샷 분류, 시맨틱 대응 매칭, 레이블 효율적인 세그멘테이션, 및 오픈 보카버러리 세그멘테이션과 같은 다양한 작업을 수행할 수 있습니다. 그러나, 확산 모델은 고차원 시각적 특징에 의존하여 이러한 작업을 수행합니다. 이러한 특징을 완전히 활용하기 위해 추가적인 훈련이 필요합니다.

비지도 세그멘테이션

DiffSeg 알고리즘은 비지도 세그멘테이션과密接 관련되어 있습니다. 비지도 세그멘테이션은 주석 없이 픽셀 단위로 세그멘테이션 마스크를 생성하는 현대적인 AI 기법입니다. 그러나, 좋은 성능을 발휘하기 위해, 비지도 세그멘테이션 모델은 목표 데이터셋에서 비지도 학습을 필요로 합니다. 비지도 세그멘테이션 기반 AI 프레임워크는 두 가지 범주로 분류할 수 있습니다. 사전 학습된 모델을 사용하여 분별 특징을 학습하는 프레임워크와, 불변성을 기반으로 클러스터링을 수행하는 프레임워크입니다.

제로샷 세그멘테이션

DiffSeg 알고리즘은 제로샷 세그멘테이션 프레임워크와密接 관련되어 있습니다. 제로샷 세그멘테이션 모델은 사전 훈련이나 데이터에 대한 지식 없이 세그멘테이션을 수행할 수 있습니다. 이러한 모델은 텍스트 입력과 프롬프트가 필요합니다. 반대로, DiffSeg 알고리즘은 확산 모델을 사용하여 세그멘테이션을 생성합니다. 이 모델은 노이즈가 있는 이미지나 참조 이미지 없이 세그멘테이션을 수행할 수 있습니다.

DiffSeg : 방법 및 아키텍처

DiffSeg 알고리즘은 사전 학습된 안정적인 확산 모델의 자기 주의 계층을 사용하여 고품질의 세그멘테이션 작업을 생성합니다.

안정적인 확산 모델

안정적인 확산은 DiffSeg 프레임워크의 기본 개념 중 하나입니다. 안정적인 확산은 생성 AI 프레임워크 중 하나입니다. 확산 모델의 주요 특징은 전방 및 역방향 패스입니다. 전방 패스에서는 이미지에 노이즈를 추가하여 노이즈가 있는 이미지로 만듭니다. 역방향 패스에서는 노이즈가 있는 이미지를 복원하여 원래 이미지를 복원합니다. 안정적인 확산 프레임워크는 인코더-디코더 아키텍처와 U-Net 디자인을 사용합니다. 이 아키텍처는 모듈러 블록의 스택으로 구성되며, 각 블록은 트랜스포머 계층 또는 ResNet 계층으로 구성됩니다.

자기 주의 계층은 확산 모델에서 내재된 객체 정보를 공간적 자기 주의 맵으로 그룹화합니다. DiffSeg은 자기 주의 텐서를 유효한 세그멘테이션 마스크로 병합하는 새로운 후처리 방법입니다. 이 방법은 세 가지 주요 구성 요소로 구성됩니다. 자기 주의 집계, 비최대 억제, 및 반복적인 자기 주의 병합입니다.

자기 주의 집계

입력 이미지가 U-Net 계층과 인코더를 통과하면, 안정적인 확산 모델은 16개의 자기 주의 텐서를 생성합니다. 각 차원에 5개의 텐서가 있습니다. 이 텐서를 집계하여 가장 높은 해상도의 텐서를 생성하는 것이 주요 목표입니다. 이를 위해, DiffSeg 알고리즘은 4차원 텐서를 다르게 처리합니다.

4차원 중 마지막 2차원은 공간적으로 일관성이 있지만, 다른 해상도를 갖습니다. DiffSeg 프레임워크는 이 두 차원을 모두 최고 해상도인 64 x 64로 샘플링합니다. 반면, 첫 번째 2차원은 자기 주의 맵의 위치 참조를 나타냅니다.

이 차원은 자기 주의 맵의 위치를 나타내므로, 이 맵을 해당 위치에 따라 집계해야 합니다. 또한, 집계된 자기 주의 맵이 유효한 분포를 갖도록 하기 위해, 집계 후에 분포를 정규화합니다. 각 자기 주의 맵은 해상도에 비례하는 가중치를 할당받습니다.

반복적인 자기 주의 병합

자기 주의 집계의 주요 목표는 자기 주의 텐서를 계산하는 것이었습니다. 그러나, 주요 목표는 자기 주의 맵을 객체 제안의 스택으로 병합하는 것입니다. 각 제안은 하나의 객체 또는 스태프 카테고리의 활성화만 포함합니다. 이를 달성하기 위해, 자기 주의 텐서의 유효한 분포에서 클러스터를 찾는 K-평균 알고리즘을 구현할 수 있습니다. 그러나, K-평균 클러스터링은 사용자가 클러스터의 수를事先 지정해야 하므로, 최적의 해결책은 아닙니다. 또한, K-평균 알고리즘의 초기화에 따라 결과가 달라질 수 있습니다. 이를 극복하기 위해, DiffSeg 프레임워크는 제안을 생성하기 위해 자기 주의 맵을 반복적으로 병합하는 샘플링 그리드를 제안합니다.

비최대 억제

반복적인 자기 주의 병합의 이전 단계는 객체 제안의 목록을 생성합니다. 각 객체 제안은 하나의 객체의 활성화만 포함합니다. 비최대 억제를 사용하여 이 목록을 유효한 세그멘테이션 마스크로 변환합니다. 이 과정은 효과적인 접근법입니다. 각 공간 위치에서, 알고리즘은 가장 높은 확률의 인덱스를 취하고, 해당 맵의 인덱스에 따라 멤버십을 할당합니다.

DiffSeg : 실험 및 결과

비지도 세그멘테이션을 위한 프레임워크는 일반적으로 두 가지 세그멘테이션 벤치마크를 사용합니다. Cityscapes와 COCO-stuff-27입니다. Cityscapes 벤치마크는 27개의 중간 수준 카테고리를 갖는 자율 주행 데이터셋입니다. COCO-stuff-27 벤치마크는 원래 COCO-stuff 데이터셋의 80개 사물과 91개의 카테고리를 27개의 카테고리로 병합한 것입니다. 또한, 세그멘테이션 성능을 분석하기 위해, DiffSeg 프레임워크는 평균 교차 구간과 픽셀 정확도를 사용합니다. DiffSeg 알고리즘은 의미적 레이블을 제공할 수 없으므로, 헝가리안 매칭 알고리즘을 사용하여 예측된 마스크와 실제 마스크를 할당합니다. 예측된 마스크의 수가 실제 마스크의 수를 초과하는 경우, 프레임워크는 일치하지 않는 예측된 마스크를 잘못된 음성으로 간주합니다.

또한, DiffSeg 프레임워크는 세 가지 작업을 강조합니다. 언어 의존성, 비지도 적응, 및 보조 이미지입니다. 언어 의존성은 세그멘테이션을 위한 서술적 텍스트 입력이 필요함을 의미합니다. 비지도 적응은 목표 데이터셋에서 비지도 학습이 필요함을 의미합니다. 보조 이미지란 추가 입력이 필요함을 의미합니다.

결과

COCO 벤치마크에서, DiffSeg 프레임워크는 두 가지 K-평균 기준선을 포함합니다. K-평균-S와 K-평균-C입니다. K-평균-C 기준선은 6개의 클러스터를 사용하며, 이는 평가하는 이미지의 객체 수를 평균하여 계산합니다. K-평균-S 기준선은 각 이미지의 실제 객체 수에 따라 클러스터의 수를 지정합니다. 두 기준선의 결과는 다음 이미지를 참조하십시오.

K-평균 기준선이 기존 방법을 능가하는 것을 볼 수 있습니다. 이는 자기 주의 텐서를 사용하는 이점을 보여줍니다. 또한, K-평균-S 기준선이 K-평균-C 기준선을 능가하는 것을 볼 수 있습니다. 이는 클러스터의 수가 중요한 하이퍼 파라미터이며, 각 이미지에 대해 조정하는 것이 중요하다는 것을 나타냅니다. 또한, DiffSeg 프레임워크는 K-평균 기준선을 능가하여, 더 좋은 세그멘테이션을 제공할 수 있으며, K-평균 기준선의 단점을 피할 수 있습니다.

Cityscapes 데이터셋에서, DiffSeg 프레임워크는 320-해상도 입력을 사용하는 프레임워크와 유사한 결과를 제공합니다. 또한, 512-해상도 입력을 사용하는 프레임워크를 능가합니다.

DiffSeg 프레임워크는 여러 하이퍼 파라미터를 사용합니다. 다음 이미지를 참조하십시오.

자기 주의 집계는 DiffSeg 프레임워크에서 사용되는 기본 개념 중 하나입니다. 다음 이미지는 다른 집계 가중치를 사용하는 효과를 보여줍니다.

고해상도 맵은 더 자세한 세그멘테이션을 제공하지만, 일부 가시적인 파열이 있습니다. 반면, 저해상도 맵은 세세한 세그멘테이션을 제공하지 못하지만, 일관된 세그멘테이션을 제공합니다. 또한, 저해상도 맵은 세그멘테이션을 생성하지 못할 수 있습니다. 마지막으로, 비례 집계 전략을 사용하면 세세한 세그멘테이션과 일관성을 제공할 수 있습니다.

최종 생각

비지도 제로샷 세그멘테이션은 여전히 컴퓨터 비전 프레임워크에서 가장 큰 도전 중 하나입니다. 기존 모델은 비 제로샷 비지도 적응 또는 외부 자원을 사용합니다. 이를 극복하기 위해, 안정적인 확산 모델의 자기 주의 계층을 사용하여 주석 없이 제로샷 설정에서 모든 입력을 세그먼트할 수 있는 모델을 구축하는 방법에 대해 논의했습니다. 또한, DiffSeg에 대해 논의했습니다. DiffSeg은 안정적인 확산 프레임워크를 사용하여 제로샷 전송이 가능한 일반적인 세그멘테이션 모델을 구축하는 새로운 후처리 전략입니다. 이 알고리즘은 자기 주의 맵을 반복적으로 병합하여 유효한 세그멘테이션 마스크를 생성합니다. 이는 인기 있는 벤치마크에서 최첨단 성능을 달성합니다.

전문직으로서의 엔지니어, 마음으로서의 작가입니다. Kunal은 AI와 ML에 대한 깊은 사랑과 이해를 가진 기술 작가로, 이러한 분야의 복잡한 개념을 흥미롭고 정보적인 문서를 통해 단순화하는데 헌신하고 있습니다.