AI 모델 및 플랫폼

YOLO-World: 실시간 오픈 어휘 객체 감지

mm
Unite.AI를 Google의 선호 소스에 추가

객체 감지는 컴퓨터 비전 산업에서 근본적인 도전 과제 중 하나로, 로봇 공학, 이미지 이해, 자율 주행 자동차, 및 이미지 인식 등의 분야에서 응용되고 있습니다. 최근 몇 년 동안 AI, 특히 심층 신경망을 통한 혁신적인 연구가 객체 감지를 크게 발전시켰습니다. 그러나 이러한 모델은 고정된 어휘를 가지며, COCO 데이터셋의 80개 범주 내에서만 객체를 감지할 수 있습니다. 이러한 제한은 객체 감지器가 특정 범주만을 인식하도록 훈련되기 때문에 발생합니다.

이를 극복하기 위해, 우리는 YOLO-World를 소개합니다. 이는 대규모 데이터셋을 사용하여 사전 훈련하고, 시각-언어 모델링 접근 방식을 구현하여 YOLO 프레임워크를 오픈 어휘 감지 능력으로 향상시키는 혁신적인 접근 방식입니다. 특히, YOLO-World는 RepVL-PAN(Re-parameterizable Vision-Language Path Aggregation Network)과 지역-텍스트 대조적 손실을 사용하여 언어적 및 시각적 정보 간의 상호 작용을 촉진합니다. RepVL-PAN과 지역-텍스트 대조적 손실을 통해, YOLO-World는 제로 샷 설정에서 광범위한 객체를 정확하게 감지할 수 있습니다.

이 기사에서는 YOLO-World의 기술적 기반, 모델 아키텍처, 훈련 과정, 및 응용 시나리오에 대한 철저한 이해를 제공하는 것을 목표로 합니다. 자세히 살펴보겠습니다.

YOLO-World: 실시간 오픈 어휘 객체 감지

YOLO 또는 You Only Look Once는 현대의 객체 감지에서 가장 인기 있는 방법 중 하나입니다.驚異的な 속도와 효율성을 갖춘 YOLO 메커니즘의 출현은 기계가 이미지와 비디오 내의 특정 객체를 감지하고 해석하는 방식을 혁신적으로 변화시켰습니다. 전통적인 객체 감지 프레임워크는 두 단계의 객체 감지 접근 방식을 구현합니다. 첫 번째 단계에서는 프레임워크가 객체를 포함할 수 있는 지역을 제안하고, 두 번째 단계에서는 객체를 분류합니다. 반면에, YOLO 프레임워크는 이러한 두 단계를 단일 신경망 모델로 통합하여, 프레임워크가 이미지와 객체의 위치를 한 번만 본 후에 객체와 그 위치를 예측할 수 있습니다.

さらに, YOLO 프레임워크는 객체 감지를 회귀 문제로 다루며, 전체 이미지에서 직접 클래스 확률과 경계 상자를 예측합니다. 이러한 방법의 구현은 감지 과정을 가속화하며, 모델이 복잡하고 다양한 데이터에서 일반화하는 능력을 향상시킵니다. 이는 실시간으로 작동하는 응용 프로그램에서 유용합니다. 최근 몇 년 동안 심층 신경망의 발전도 객체 감지 프레임워크의 개발에 크게 기여했습니다. 그러나 객체 감지 프레임워크의 성공은 여전히 제한적입니다. 이는 객체 감지器가 특정 범주만을 인식할 수 있기 때문입니다.

최근 개발된 시각-언어 모델은 언어 인코더에서 추출한 어휘 지식을 사용하여 오픈 어휘 감지를 해결하려고 합니다. 이러한 프레임워크는 전통적인 객체 감지 모델보다 오픈 어휘 감지에서 더 나은 성능을 보이지만, 어휘 다양성이 제한된 훈련 데이터의 부족으로 인해 여전히 제한적입니다. 일부 프레임워크는 오픈 어휘 객체 감지器를 대규모로 훈련하고, 지역 수준의 시각-언어 사전 훈련으로 분류합니다. 그러나 이러한 접근 방식은 복잡한 배포 과정과 높은 계산 요구로 인해 실시간으로 객체를 감지하는 데 어려움을 겪습니다.

YOLO-World 프레임워크는 효율적인 오픈 어휘 객체 감지를 달성하고, 전통적인 YOLO 감지器를 오픈 어휘 객체 감지에 대한 대규모 사전 훈련 접근 방식의 효율성을 높이는 가능성을 탐색하는 것을 목표로 합니다. 이전 연구와 달리, YOLO-World 프레임워크는 높은 추론 속도와 효율성을 보여주며, 다운스트림 응용 프로그램에 쉽게 배포할 수 있습니다. YOLO-World 모델은 전통적인 YOLO 아키텍처를 따르며, 입력 텍스트를 인코딩하기 위해 사전 훈련된 CLIP 텍스트 인코더를 사용합니다.

YOLO-World 프레임워크는 또한 시각-언어적 표현을 강화하기 위해 이미지와 텍스트 특징을 연결하는 RepVL-PAN 구성 요소를 포함합니다. 추론 단계에서, 프레임워크는 텍스트 인코더를 제거하고, 오프라인 어휘 임베딩을 RepVL-PAN 가중치로 재 매개변수화하여 효율적인 배포를 가능하게 합니다. 또한, 프레임워크는 지역-텍스트 대조적 학습을 포함하여 전통적인 YOLO 모델을 위한 오픈 어휘 사전 훈련 방법을 연구합니다.

다음 이미지는 전통적인 객체 감지器가 고정된 어휘의 닫힌 집합을 감지하는 반면, 오픈 어휘 감지器는 사용자 프롬프트를 텍스트 인코더로 인코딩하여 오픈 어휘를 감지하는 것을 보여줍니다. YOLO-World의 프롬프트-감지 접근 방식은 오프라인 어휘를 빌드하여 감지器가 실시간으로 프롬프트를 재인코딩할 필요가 없도록 합니다.

YOLO-World : 방법 및 아키텍처

지역-텍스트 쌍

전통적인 객체 감지 프레임워크,包括 YOLO 계열의 객체 감지器,는 인스턴스 주석을 사용하여 훈련되며, 이는 범주 레이블과 경계 상자를 포함합니다. 반면에, YOLO-World 프레임워크는 인스턴스 주석을 지역-텍스트 쌍으로 재정의합니다. 여기서 텍스트는 객체의 설명, 명사구, 또는 범주 이름일 수 있습니다.

모델 아키텍처

YOLO-World 모델의核心에는 텍스트 인코더, YOLO 감지器, 및 RepVL-PAN 구성 요소가 있습니다. 다음 이미지는 이러한 구성 요소를 보여줍니다.

입력 텍스트에 대해, 텍스트 인코더는 텍스트를 임베딩으로 인코딩하며, YOLO 감지器는 입력 이미지에서 다중 스케일 특징을 추출합니다. RepVL-PAN 구성 요소는 텍스트와 특징 임베딩 사이의 교차 모달리티 퓨전을 활용하여 텍스트와 이미지 표현을 강화합니다.

YOLO 감지器

YOLO-World 모델은 기존 YOLOv8 프레임워크를 기반으로 하며, Darknet 백본 구성 요소, 객체 임베딩 및 경계 상자 회귀를 위한 헤드, 및 다중 스케일 특징 피라미드를 위한 PAN 또는 경로 집적 네트워크를 포함합니다.

텍스트 인코더

사전 훈련된 CLIP 트랜스포머 텍스트 인코더를 사용하여, YOLO-World 모델은 입력 텍스트를 임베딩으로 인코딩합니다. 이는 시각-어휘적 성능을 향상시키기 위해 텍스트와 시각적 객체를 연결하는 데 도움이 됩니다.

텍스트 대조적 헤드

YOLO-World 모델은 텍스트 대조적 헤드를 사용하여 객체-텍스트 유사성을 얻습니다. 이는 L2 정규화 접근 방식과 텍스트 임베딩을 사용합니다.

온라인 어휘 훈련

훈련 단계에서, YOLO-World 모델은 모자이크 샘플마다 온라인 어휘를 구성합니다. 이는 각 샘플에서 포함된 양성 명사와 임의로 선택된 음성 명사로 구성됩니다.

오프라인 어휘 추론

추론 단계에서, YOLO-World 모델은 오프라인 어휘를 사용하여 모델의 효율성을 더욱 향상시킵니다. 사용자는 사용자 정의 프롬프트를 정의하며, 이는 범주 또는 캡션을 포함할 수 있습니다. YOLO-World 모델은 이러한 프롬프트를 사용하여 오프라인 어휘 임베딩을 얻습니다.

재매개화 가능한 시각-언어 경로 집적 네트워크 (RevVL-PAN)

다음 그림은 제안된 RevVL-PAN의 구조를 보여줍니다. 이는 상위-하위 경로를 따라 다중 스케일 특징 피라미드를 구성합니다.

이미지-풀링 어텐션과 텍스트-가이드 CSPLayer를 사용하여, YOLO-World 모델은 시각-어휘적 표현을 향상시키기 위해 텍스트와 이미지 특징 사이의 상호 작용을 강화합니다. 추론 단계에서, YOLO-World 모델은 오프라인 어휘 임베딩을 RepVL-PAN의 가중치로 재 매개변수화하여 효율적인 배포를 가능하게 합니다.

사전 훈련 方案

YOLO-World 모델은 두 가지 주요 사전 훈련 方案을 따릅니다. 첫 번째 方案은 지역-텍스트 대조적 손실을 사용하며, 두 번째 方案은 이미지-텍스트 데이터를 사용하여 의사 레이블링을 수행합니다.

YOLO-World : 결과

YOLO-World 모델이 사전 훈련된 후, LVIS 데이터셋에서 제로 샷 설정으로 평가됩니다. 다음 그림은 YOLO-World 모델과 다른 상태-of-the-아트 객체 감지 프레임워크의 성능을 보여줍니다.

YOLO-World 모델은 다른 프레임워크보다 높은 추론 속도와 제로 샷 성능을 보여줍니다. 이는 YOLO-World-S와 같은 작은 객체 감지 모델이 오픈 어휘 감지에 대한 사전 훈련에서 탁월한 성능을 발휘할 수 있음을 보여줍니다.

최종 생각

이 기사에서, 우리는 YOLO-World에 대해 논의했습니다. 이는 대규모 데이터셋을 사용하여 사전 훈련하고, 시각-언어 모델링 접근 방식을 구현하여 YOLO 프레임워크를 오픈 어휘 감지 능력으로 향상시키는 혁신적인 접근 방식입니다. YOLO-World 모델은 RepVL-PAN과 지역-텍스트 대조적 손실을 사용하여 언어적 및 시각적 정보 간의 상호 작용을 촉진합니다. 이는 제로 샷 설정에서 광범위한 객체를 정확하게 감지할 수 있습니다.

전문직으로서의 엔지니어, 마음으로서의 작가입니다. Kunal은 AI와 ML에 대한 깊은 사랑과 이해를 가진 기술 작가로, 이러한 분야의 복잡한 개념을 흥미롭고 정보적인 문서를 통해 단순화하는데 헌신하고 있습니다.