AI 모델 및 플랫폼
세그먼트 에니씽 모델 – 컴퓨터 비전의 거대한 도약
컴퓨터 비전(CV)은 10년 만에 50%에서 99%의 정확도로 발전했습니다. 이 기술은 현대적인 알고리즘과 이미지 세그먼테이션 기법으로 더욱 발전할 것으로 예상됩니다. 최근에 Meta의 FAIR 연구소는 세그먼트 에니씽 모델(SAM)을 발표했습니다. 이는 이미지 세그먼테이션 분야에서 게임 체인저입니다. 이 모델은 입력 프롬프트에서詳細한 객체 마스크를 생성할 수 있으며, 컴퓨터 비전을 새로운 높이로 끌어올릴 수 있습니다. 이는 디지털 기술과 상호작용하는 방식을 혁신할 수 있습니다.
이미지 세그먼테이션과 SAM이 컴퓨터 비전에 미치는 영향을 간략히 살펴보겠습니다.
이미지 세그먼테이션과 그 유형은 무엇인가?
이미지 세그먼테이션은 컴퓨터 비전에서 이미지의 여러 영역이나 세그먼트로 나누는 프로세스입니다. 각 세그먼트는 이미지의 다른 객체나 영역을 나타냅니다. 이 접근 방식으로 전문가들은 이미지의 특정 부분을 분리하여 의미 있는 정보를 얻을 수 있습니다.
이미지 세그먼테이션 모델은 중요한 이미지 세부 사항을 인식하고 복잡성을 줄임으로써 출력을 개선하도록 훈련됩니다. 이러한 알고리즘은 색상, 텍스처, 대조, 그림자, 경계선과 같은 특징에 따라 이미지의 다양한 영역을 효과적으로 구분합니다.
이미지를 세그먼트하면 분석에 관심 있는 영역에 초점을 맞추어 통찰력 있는 세부 사항을 얻을 수 있습니다. 아래는 다양한 이미지 세그먼테이션 기술입니다.
- 시맨틱 세그먼테이션은 픽셀을 시맨틱 클래스로 레이블링합니다.
- 인스턴스 세그먼테이션은 각 객체를 감지하고 이미지에서 구분합니다.
- 판옵틱 세그먼테이션은 개별 객체 픽셀에 고유한 인스턴스 ID를 할당하여 이미지의 모든 객체에 대한 더 포괄적이고 문맥적인 레이블링을 제공합니다.
세그먼테이션은 이미지 기반의 딥 러닝 모델을 사용하여 구현됩니다. 이러한 모델은 훈련 세트에서 모든 유용한 데이터 포인트와 특징을 가져옵니다. 그런 다음 이러한 데이터를 벡터와 행렬로 변환하여 복잡한 특징을 이해합니다. 이미지 세그먼테이션을 위한 일반적으로 사용되는 딥 러닝 모델은 다음과 같습니다.
- 컨볼루셔널 뉴럴 네트워크(CNN)
- 전체 연결 네트워크(FCN)
- 리커런트 뉴럴 네트워크(RNN)
이미지 세그먼테이션은 어떻게 작동하는가?
컴퓨터 비전에서 대부분의 이미지 세그먼테이션 모델은 인코더-디코더 네트워크로 구성됩니다. 인코더는 입력 데이터의 잠재 공간 표현을 인코딩하고 디코더는 세그먼트 맵, 즉 각 객체의 위치를 나타내는 맵을 디코딩합니다.
일반적으로 세그먼테이션 프로세스는 3단계로 구성됩니다.
- 이미지 인코더는 입력 이미지를 수학적 모델(벡터와 행렬)로 변환하여 처리합니다.
- 인코더는 여러 수준에서 벡터를 집계합니다.
- 패스트 마스크 디코더는 이미지 임베딩을 입력으로 받아 이미지의 개별 객체를 구분하는 마스크를 생성합니다.
이미지 세그먼테이션의 현재 상태
2014년부터 딥 러닝 기반의 세그먼테이션 알고리즘이 등장하여 CNN+CRF와 FCN이 분야에서 큰 발전을 이루었습니다. 2015년에는 U-Net과 디컨볼루션 네트워크가 등장하여 세그먼테이션 결과의 정확성을 개선했습니다.
2016년에는 인스턴스 어웨어 세그먼테이션, V-Net, 리파인 네트워크가 등장하여 세그먼테이션의 정확성과 속도를 개선했습니다. 2017년에는 마크-RCNN과 FC-DenseNet이 객체 감지와 밀도 예측을 세그먼테이션 작업에 도입했습니다.
2018년에는 판옵틱 세그먼테이션, 마스크 랩, 컨텍스트 인코딩 네트워크가 중심이 되었으며, 이러한 접근 방식은 인스턴스 수준의 세그먼테이션을 위한 필요성을 해결했습니다. 2019년에는 판옵틱 FPN, HRNet, 크리스 크로스 어텐션이 인스턴스 수준의 세그먼테이션을 위한 새로운 접근 방식을 제시했습니다.
2020년에는 디텍토 RS, 판옵틱 딥 랩, 폴라 마스크, 센터 마스크, DC-NAS, 에프фици언트 넷 + NAS-FPN이 등장했습니다. 마지막으로 2023년에는 SAM이 등장했습니다.
세그먼트 에니씽 모델(SAM) – 일반적인 이미지 세그먼테이션
세그먼트 에니씽 모델(SAM)은 단일 모델에서 상호작용 및 자동 세그먼테이션 작업을 수행할 수 있는 새로운 접근 방식입니다. 이전에는 상호작용 세그먼테이션은任意 객체 클래스를 세그먼트할 수 있지만, 반복적으로 마스크를 재구성하는 사람의 지침이 필요했습니다.
SAM의 자동 세그먼테이션은 미리 정의된 특정 객체 범주를 세그먼트할 수 있습니다. 프로모터블 인터페이스는 매우 유연합니다. 따라서 SAM은 클릭, 박스, 텍스트 등과 같은 적절한 프롬프트를 사용하여 다양한 세그먼테이션 작업을 처리할 수 있습니다.
SAM은 10억 개 이상의 마스크로 구성된 다양한 데이터셋에서 훈련되므로 훈련 세트에 없는 새로운 객체와 이미지를 인식할 수 있습니다. 이 현대적인 프레임워크는 자율 주행 자동차, 보안, 증강 현실과 같은 CV 모델을 적용하는 분야에서 혁신을 일으킬 것입니다.
SAM은 자율 주행 자동차에서 자동차 주변의 객체를 감지하고 세그먼트할 수 있습니다. 증강 현실에서 SAM은 실제 환경을 세그먼트하여 가상 객체를 적절한 위치에 배치하여 더 실제적이고 매력적인 사용자 경험을 제공할 수 있습니다.
2023년 이미지 세그먼테이션의 도전
이미지 세그먼테이션의 연구 및 개발이 증가함에 따라 상당한 도전도 함께합니다. 2023년 이미지 세그먼테이션의 주요 도전은 다음과 같습니다.
- 데이터셋의 복잡성, 특히 3D 이미지 세그먼테이션의 증가
- 해석 가능한 딥 모델의 개발
- 인간의 개입을 최소화하는 비지도 학습 모델의 사용
- 실시간 및 메모리 효율적인 모델의 필요
- 3D 포인트 클라우드 세그먼테이션의 병목 현상을 제거
컴퓨터 비전의 미래
전 세계적인 컴퓨터 비전 시장은 여러 산업에 영향을 미치고 있으며 2030년까지 410억 달러에 이를 것으로 예상됩니다. SAM과 같은 현대적인 이미지 세그먼테이션 기술과 다른 딥 러닝 알고리즘은 디지털 환경에서 컴퓨터 비전의 구조를 더욱 강화할 것입니다. 따라서 우리는 더 강력한 컴퓨터 비전 모델과 지능형 애플리케이션을 보게 될 것입니다.
AI와 ML에 대해 더 알아보려면 Unite.ai를 방문하세요. 이는 기술과 그 현대적인 상태에 대한 모든 질의에 대한 하나의 해결책입니다.













