AI 모델 및 플랫폼

SAM 2 공개: 이미지 및 비디오의 실시간 객체 분할을 위한 메타의 새로운 오픈소스 기초 모델

mm
Unite.AI를 Google의 선호 소스에 추가

최근 몇 년 동안 AI 세계는 텍스트 처리를 위한 기초 AI에서 놀라운 발전을 보았으며, 고객 서비스에서 법률 분석까지 다양한 산업을 변革했습니다. 그러나 이미지 처리의 경우에는 아직 표면적인 발전만 있었습니다. 시각적 데이터의 복잡성과 이미지의 해석 및 분석을 위한 모델 훈련의 어려움은 상당한 장벽을 제시했습니다. 연구자들이 이미지 및 비디오를 위한 기초 AI를 계속 탐색함에 따라, 이미지 처리의 미래는 의료, 자율 주행 차량, 및 그 너머의 혁신을 위한 잠재력을 가지고 있습니다.

객체 분할, 즉 관심 객체에 해당하는 이미지의 정확한 픽셀을 찾는 것은 컴퓨터 비전에서 중요한 작업입니다. 전통적으로 이는 특수한 AI 모델을 생성하는 것을 의미했으며, 이는 광범위한 인프라와大量의 주석이 된 데이터를 필요로 합니다. 메타는 지난 해 Segment Anything Model (SAM)을介绍했습니다. SAM은 기초 AI 모델로서, 사용자가 간단한 프롬프트로 이미지 분할을 가능하게 하여 이过程을 단순화합니다. 이 혁신은 전문가의 필요성을 줄이고 광범위한 컴퓨팅 자원을 필요로 하는 것을 줄여 이미지 분할을 더 쉽게 만들었습니다.

이제 메타는 SAM 2로这一 발전을 더욱 앞으로 밀어붙이고 있습니다. SAM 2는 SAM의 기존 이미지 분할 능력을 강화하고 비디오 처리까지 확장합니다. SAM 2는 이미지와 비디오에서 任意의 객체를 분할할 수 있으며, 이전에遭遇하지 못한 객체도 포함합니다. 이 발전은 컴퓨터 비전과 이미지 처리의 영역에서 큰 도약이며, 시각적 콘텐츠를 분석하기 위한 더 유연하고 강력한 도구를 제공합니다. 아래에서 우리는 SAM 2의 흥미로운 발전과 컴퓨터 비전 분야를 재정의할 수 있는 잠재력을 탐색합니다.

SAM 소개

전통적인 분할 방법은 수동으로 정교화하거나 미리 정의된 카테고리로 자동 분할을 위해 광범위한 주석이 된 데이터를 필요로 합니다. SAM은 사용자 입력을 처리하는 프롬프트 인코더와 이미지 인코더로 구성된 기초 AI 모델로서, 사용자 입력을 처리하는 프롬프트 인코더와 이미지 인코더로 구성됩니다. SAM은 10억 개 이상의 다양한 이미지 주석으로 훈련되어 새로운 객체와 이미지에 대해 사용자 정의 데이터 수집이나 미세 조정을 필요로 하지 않습니다.

SAM은 두 가지 주요 구성 요소로 작동합니다: 이미지 인코더와 프롬프트 인코더. 이러한 구성 요소는 경량 디코더와 함께 분할 마스크를 예측하기 위해 협력합니다. SAM은 이미지 처리 후 50 밀리초 만에 분할을 생성할 수 있으며, 이는 웹 브라우저에서 실시간 인터랙티브 작업을 위한 강력한 도구입니다. SAM을 구축하기 위해 연구자들은 세 단계의 데이터 수집 프로세스를 개발했습니다: 모델 지원 주석, 자동 및 보조 주석의 혼합, 및 완전 자동 마스크 생성. 이 프로세스의 결과는 SA-1B 데이터셋으로, 1.1억 개 이상의 마스크와 1100만 개의 라이선스된 개인 정보 보호 이미지로 구성되어 있으며, 이는 기존 데이터셋보다 400배 더 큽니다. SAM의 인상적인 성능은 이 광범위하고 다양한 데이터셋에서 비롯됩니다.

SAM 2 공개: 이미지에서 비디오 분할로의 도약

SAM의 기반을 바탕으로 SAM 2는 이미지와 비디오에서 실시간 객체 분할을 위한 프롬프트 가능한 모델입니다. SAM과 달리 SAM 2는 비디오를 연속적인 시퀀스의 각 프레임으로 처리하여 동적 장면과 변경되는 콘텐츠를 더 효과적으로 처리할 수 있습니다. SAM 2는 SAM의 이미지 분할 능력을 강화하고 인터랙티브 작업에서 3배 더 빠르게 작동합니다.

SAM 2는 SAM과 동일한 아키텍처를 유지하지만 비디오 처리를 위한 메모리 메커니즘을 도입했습니다. 이 기능은 SAM 2가 이전 프레임의 정보를 유지하여 객체 분할을 일관성 있게 유지할 수 있도록 합니다. 이전 프레임을 참조하여 SAM 2는 비디오 전체에서 마스크 예측을 개선할 수 있습니다.

SAM 2는 새로운 데이터셋인 SA-V 데이터셋으로 훈련되었습니다. 이 데이터셋은 47개국에서 수집된 51,000개의 비디오에 대한 60만 개 이상의 마스크릿 주석으로 구성되어 있습니다. 이 다양한 데이터셋은 전체 객체와 객체의 부분을 모두 포함하여 SAM 2의 실제 비디오 분할 정확도를 향상합니다.

SAM 2는 Apache 2.0 라이선스下的 오픈소스 모델로 제공되며, 이는 다양한 용도로 사용할 수 있게 합니다. 메타는 또한 SAM 2를 위한 데이터셋을 CC BY 4.0 라이선스 下에서 공유하고 있습니다. 또한 웹 기반 데모를 통해 사용자가 모델을 탐색하고 성능을 확인할 수 있습니다.

잠재적 용례

SAM 2의 이미지와 비디오에서 실시간 객체 분할 능력은 다양한 분야에서 혁신적인 응용 프로그램을 가능하게 합니다. 예를 들어, 이러한 응용 프로그램은 다음과 같습니다:

  • 의료 진단: SAM 2는 수술 중 실시간으로 해부학적 구조를 분할하고 이상을 식별하여 수술 지원을 개선할 수 있습니다. 또한 의료 영상 분석에서 장기 또는 종양을 정확하게 분할하여 분석을 개선할 수 있습니다.
  • 자율 주행 차량: SAM 2는 자율 주행 차량 시스템에서 객체 감지 정확도를 개선하여 보행자, 차량, 및 도로 표지를 비디오 프레임에서 연속적으로 분할하고 추적할 수 있습니다. 동적 장면을 처리하는 능력은 실시간으로 환경의 변경을 인식하고 반응하여 충돌 방지 시스템을 지원합니다.
  • 인터랙티브 미디어 및 엔터테인먼트: SAM 2는 증강 현실(AR) 애플리케이션에서 객체를 실시간으로 분할하여 가상 요소를 실제 세계와 더 쉽게 결합할 수 있습니다. 또한 비디오 편집에서 객체 분할을 자동화하여 배경 제거 및 객체 대체와 같은 프로세스를 간소화합니다.
  • 환경 모니터링: SAM 2는 동물들을 비디오에서 분할하고 추적하여 야생 동물 연구와 서식지 연구를 지원할 수 있습니다. 재난 응답에서 SAM 2는 영향을 받은 지역과 객체를 비디오에서 분할하여 응답 노력을 평가하고 안내할 수 있습니다.
  • 소매 및 전자상거래: SAM 2는 제품 시각화를 개선하여 이미지와 비디오에서 제품을 인터랙티브하게 분할할 수 있습니다. 이는 고객이 제품을 다양한 각도와 상황에서 볼 수 있도록 합니다. 재고 관리에서 SAM 2는 실시간으로 제품을 분할하고 추적하여 재고를 확인하고 관리를 개선할 수 있습니다.

SAM 2의 한계 극복: 실제 해결책과 미래 개선

SAM 2는 이미지와 짧은 비디오에서 잘 작동하지만, 실제 사용에는 몇 가지 한계가 있습니다. SAM 2는 큰 시점 변경, 긴 가려짐, 또는 혼잡한 장면에서 객체를 추적하는 것을 어려워할 수 있습니다. 인터랙티브 클릭을 통해 이러한 문제를 해결할 수 있습니다.

혼잡한 환경에서 유사한 객체가 있는 경우, SAM 2는 때때로 대상 객체를 잘못 식별할 수 있지만, 이후 프레임에서 추가 프롬프트를 통해 이를 해결할 수 있습니다. SAM 2는 여러 객체를 분할할 수 있지만, 각 객체를 개별적으로 처리하기 때문에 효율성이 떨어질 수 있습니다. 미래의 업데이트에서는 공유된 컨텍스트 정보를 통합하여 성능을 향상시킬 수 있습니다.

SAM 2는 빠르게 움직이는 객체의 세부 사항을 놓칠 수 있으며, 예측이 프레임 간에 불안정할 수 있습니다. 그러나 추가적인 훈련을 통해 이러한 한계를 해결할 수 있습니다. 자동 주석 생성이 개선되었지만, 품질 검사와 프레임 선택을 위한 인간 주석자가 여전히 필요하며, 추가적인 자동화를 통해 효율성을 향상시킬 수 있습니다.

결론

SAM 2는 이미지와 비디오에서 실시간 객체 분할을 위한 중요한 발전을 나타내며, 이를 통해 의료, 자율 주행 차량, 인터랙티브 미디어, 및 소매와 같은 다양한 분야를 변혁할 수 있습니다.虽然 SAM 2는 여전히 몇 가지 한계를 가지고 있지만, 오픈소스 모델로서의 특성과 강력한 성능은 이를 컴퓨터 비전과 그 너머의 혁신을 위한 강력한 도구로 만듭니다.

Dr. Tehseen Zia는 COMSATS University Islamabad의 정교수이며, 오스트리아 비엔나 기술대학교에서 인공지능 박사학위를 취득했습니다. 인공지능, 기계학습, 데이터 과학, 컴퓨터 비전을 전문으로 하며, 유명한 과학 저널에 발표된 논문으로 знач적인 기여를 했습니다. Dr. Tehseen은 주요 연구자로서 다양한 산업 프로젝트를 이끌었으며, 인공지능 컨설턴트로도 활동했습니다.