AI 모델 및 플랫폼
SAM 2 공개: 이미지 및 비디오의 실시간 객체 분할을 위한 메타의 새로운 오픈소스 기초 모델
최근 몇 년 동안 AI 세계는 텍스트 처리를 위한 기초 AI에서 놀라운 발전을 보았으며, 고객 서비스에서 법률 분석까지 다양한 산업을 변革했습니다. 그러나 이미지 처리의 경우에는 아직 표면적인 발전만 있었습니다. 시각적 데이터의 복잡성과 이미지의 해석 및 분석을 위한 모델 훈련의 어려움은 상당한 장벽을 제시했습니다. 연구자들이 이미지 및 비디오를 위한 기초 AI를 계속 탐색함에 따라, 이미지 처리의 미래는 의료, 자율 주행 차량, 및 그 너머의 혁신을 위한 잠재력을 가지고 있습니다.
객체 분할, 즉 관심 객체에 해당하는 이미지의 정확한 픽셀을 찾는 것은 컴퓨터 비전에서 중요한 작업입니다. 전통적으로 이는 특수한 AI 모델을 생성하는 것을 의미했으며, 이는 광범위한 인프라와大量의 주석이 된 데이터를 필요로 합니다. 메타는 지난 해 Segment Anything Model (SAM)을介绍했습니다. SAM은 기초 AI 모델로서, 사용자가 간단한 프롬프트로 이미지 분할을 가능하게 하여 이过程을 단순화합니다. 이 혁신은 전문가의 필요성을 줄이고 광범위한 컴퓨팅 자원을 필요로 하는 것을 줄여 이미지 분할을 더 쉽게 만들었습니다.
이제 메타는 SAM 2로这一 발전을 더욱 앞으로 밀어붙이고 있습니다. SAM 2는 SAM의 기존 이미지 분할 능력을 강화하고 비디오 처리까지 확장합니다. SAM 2는 이미지와 비디오에서 任意의 객체를 분할할 수 있으며, 이전에遭遇하지 못한 객체도 포함합니다. 이 발전은 컴퓨터 비전과 이미지 처리의 영역에서 큰 도약이며, 시각적 콘텐츠를 분석하기 위한 더 유연하고 강력한 도구를 제공합니다. 아래에서 우리는 SAM 2의 흥미로운 발전과 컴퓨터 비전 분야를 재정의할 수 있는 잠재력을 탐색합니다.
SAM 소개
전통적인 분할 방법은 수동으로 정교화하거나 미리 정의된 카테고리로 자동 분할을 위해 광범위한 주석이 된 데이터를 필요로 합니다. SAM은 사용자 입력을 처리하는 프롬프트 인코더와 이미지 인코더로 구성된 기초 AI 모델로서, 사용자 입력을 처리하는 프롬프트 인코더와 이미지 인코더로 구성됩니다. SAM은 10억 개 이상의 다양한 이미지 주석으로 훈련되어 새로운 객체와 이미지에 대해 사용자 정의 데이터 수집이나 미세 조정을 필요로 하지 않습니다.
SAM은 두 가지 주요 구성 요소로 작동합니다: 이미지 인코더와 프롬프트 인코더. 이러한 구성 요소는 경량 디코더와 함께 분할 마스크를 예측하기 위해 협력합니다. SAM은 이미지 처리 후 50 밀리초 만에 분할을 생성할 수 있으며, 이는 웹 브라우저에서 실시간 인터랙티브 작업을 위한 강력한 도구입니다. SAM을 구축하기 위해 연구자들은 세 단계의 데이터 수집 프로세스를 개발했습니다: 모델 지원 주석, 자동 및 보조 주석의 혼합, 및 완전 자동 마스크 생성. 이 프로세스의 결과는 SA-1B 데이터셋으로, 1.1억 개 이상의 마스크와 1100만 개의 라이선스된 개인 정보 보호 이미지로 구성되어 있으며, 이는 기존 데이터셋보다 400배 더 큽니다. SAM의 인상적인 성능은 이 광범위하고 다양한 데이터셋에서 비롯됩니다.
SAM 2 공개: 이미지에서 비디오 분할로의 도약
SAM의 기반을 바탕으로 SAM 2는 이미지와 비디오에서 실시간 객체 분할을 위한 프롬프트 가능한 모델입니다. SAM과 달리 SAM 2는 비디오를 연속적인 시퀀스의 각 프레임으로 처리하여 동적 장면과 변경되는 콘텐츠를 더 효과적으로 처리할 수 있습니다. SAM 2는 SAM의 이미지 분할 능력을 강화하고 인터랙티브 작업에서 3배 더 빠르게 작동합니다.
SAM 2는 SAM과 동일한 아키텍처를 유지하지만 비디오 처리를 위한 메모리 메커니즘을 도입했습니다. 이 기능은 SAM 2가 이전 프레임의 정보를 유지하여 객체 분할을 일관성 있게 유지할 수 있도록 합니다. 이전 프레임을 참조하여 SAM 2는 비디오 전체에서 마스크 예측을 개선할 수 있습니다.
SAM 2는 새로운 데이터셋인 SA-V 데이터셋으로 훈련되었습니다. 이 데이터셋은 47개국에서 수집된 51,000개의 비디오에 대한 60만 개 이상의 마스크릿 주석으로 구성되어 있습니다. 이 다양한 데이터셋은 전체 객체와 객체의 부분을 모두 포함하여 SAM 2의 실제 비디오 분할 정확도를 향상합니다.
SAM 2는 Apache 2.0 라이선스下的 오픈소스 모델로 제공되며, 이는 다양한 용도로 사용할 수 있게 합니다. 메타는 또한 SAM 2를 위한 데이터셋을 CC BY 4.0 라이선스 下에서 공유하고 있습니다. 또한 웹 기반 데모를 통해 사용자가 모델을 탐색하고 성능을 확인할 수 있습니다.
잠재적 용례
SAM 2의 이미지와 비디오에서 실시간 객체 분할 능력은 다양한 분야에서 혁신적인 응용 프로그램을 가능하게 합니다. 예를 들어, 이러한 응용 프로그램은 다음과 같습니다:
- 의료 진단: SAM 2는 수술 중 실시간으로 해부학적 구조를 분할하고 이상을 식별하여 수술 지원을 개선할 수 있습니다. 또한 의료 영상 분석에서 장기 또는 종양을 정확하게 분할하여 분석을 개선할 수 있습니다.
- 자율 주행 차량: SAM 2는 자율 주행 차량 시스템에서 객체 감지 정확도를 개선하여 보행자, 차량, 및 도로 표지를 비디오 프레임에서 연속적으로 분할하고 추적할 수 있습니다. 동적 장면을 처리하는 능력은 실시간으로 환경의 변경을 인식하고 반응하여 충돌 방지 시스템을 지원합니다.
- 인터랙티브 미디어 및 엔터테인먼트: SAM 2는 증강 현실(AR) 애플리케이션에서 객체를 실시간으로 분할하여 가상 요소를 실제 세계와 더 쉽게 결합할 수 있습니다. 또한 비디오 편집에서 객체 분할을 자동화하여 배경 제거 및 객체 대체와 같은 프로세스를 간소화합니다.
- 환경 모니터링: SAM 2는 동물들을 비디오에서 분할하고 추적하여 야생 동물 연구와 서식지 연구를 지원할 수 있습니다. 재난 응답에서 SAM 2는 영향을 받은 지역과 객체를 비디오에서 분할하여 응답 노력을 평가하고 안내할 수 있습니다.
- 소매 및 전자상거래: SAM 2는 제품 시각화를 개선하여 이미지와 비디오에서 제품을 인터랙티브하게 분할할 수 있습니다. 이는 고객이 제품을 다양한 각도와 상황에서 볼 수 있도록 합니다. 재고 관리에서 SAM 2는 실시간으로 제품을 분할하고 추적하여 재고를 확인하고 관리를 개선할 수 있습니다.
SAM 2의 한계 극복: 실제 해결책과 미래 개선
SAM 2는 이미지와 짧은 비디오에서 잘 작동하지만, 실제 사용에는 몇 가지 한계가 있습니다. SAM 2는 큰 시점 변경, 긴 가려짐, 또는 혼잡한 장면에서 객체를 추적하는 것을 어려워할 수 있습니다. 인터랙티브 클릭을 통해 이러한 문제를 해결할 수 있습니다.
혼잡한 환경에서 유사한 객체가 있는 경우, SAM 2는 때때로 대상 객체를 잘못 식별할 수 있지만, 이후 프레임에서 추가 프롬프트를 통해 이를 해결할 수 있습니다. SAM 2는 여러 객체를 분할할 수 있지만, 각 객체를 개별적으로 처리하기 때문에 효율성이 떨어질 수 있습니다. 미래의 업데이트에서는 공유된 컨텍스트 정보를 통합하여 성능을 향상시킬 수 있습니다.
SAM 2는 빠르게 움직이는 객체의 세부 사항을 놓칠 수 있으며, 예측이 프레임 간에 불안정할 수 있습니다. 그러나 추가적인 훈련을 통해 이러한 한계를 해결할 수 있습니다. 자동 주석 생성이 개선되었지만, 품질 검사와 프레임 선택을 위한 인간 주석자가 여전히 필요하며, 추가적인 자동화를 통해 효율성을 향상시킬 수 있습니다.
결론
SAM 2는 이미지와 비디오에서 실시간 객체 분할을 위한 중요한 발전을 나타내며, 이를 통해 의료, 자율 주행 차량, 인터랙티브 미디어, 및 소매와 같은 다양한 분야를 변혁할 수 있습니다.虽然 SAM 2는 여전히 몇 가지 한계를 가지고 있지만, 오픈소스 모델로서의 특성과 강력한 성능은 이를 컴퓨터 비전과 그 너머의 혁신을 위한 강력한 도구로 만듭니다.












