AI 기초

컴퓨터 비전이란 무엇인가?

mm
Unite.AI를 Google의 선호 소스에 추가

컴퓨터 비전은 이미지와 비디오에서 유용한 정보를 추출하는 시스템을 구축하는 분야이다. 비전 모델은 전체 이미지를 분류하거나, 객체를 찾고, 각 픽셀에 라벨을 붙이며, 텍스트를 읽고, 자세를 추정하고, 움직임을 추적하거나, 시각 콘텐츠를 언어와 연결할 수 있다.

현대 비전 시스템은 인간 인지의 초기 에지 검출 과정을 단순히 재현하지 않는다. 이들은 데이터로부터 작업에 특화된 표현을 학습하며, 종종 합성곱 신경망, 비전 트랜스포머, 혹은 멀티모달 기반 모델을 사용한다.

핵심 요점

  • 분류, 탐지, 세그멘테이션, OCR, 추적, 그리고 생성은 서로 구별되는 비전 작업이다.
  • CNN은 지역성 및 가중치 공유를 내재하고; 비전 트랜스포머는 이미지 패치 전역에 걸친 어텐션을 사용한다.
  • 라벨은 인간, 약한 지도학습, 합성 데이터, 혹은 자체 지도학습 목표에서 얻을 수 있다.
  • 정확도만으로는 충분하지 않다: 견고성, 지연 시간, 프라이버시, 편향, 그리고 실패 비용이 중요하다.
One street scene illustrated as image classification, object detection, semantic segmentation, pose estimation, OCR, and tracking
같은 이미지가 작업에 따라 서로 다른 컴퓨터 비전 출력 결과를 지원한다.

주요 컴퓨터 비전 작업

  • 이미지 분류는 이미지에 하나 이상의 라벨을 할당한다. 이미지 분류가 어떻게 작동하는지를 보려면 여기를 참고한다.
  • 객체 탐지는 여러 객체에 대한 카테고리와 경계 상자를 예측한다.
  • 시맨틱 세그멘테이션은 각 픽셀에 클래스를 라벨링하고, 인스턴스 세그멘테이션은 개별 객체를 구분한다.
  • 광학 문자 인식(OCR)은 텍스트를 감지하고 전사한다.
  • 포즈 추정은 신체 혹은 객체의 랜드마크를 예측한다.
  • 추적은 비디오 프레임 간에 탐지를 연결한다.
  • 이미지 생성 및 편집은 시각 콘텐츠를 생성하거나 변환하며, 종종 확산 모델을 사용한다.

이미지가 모델 입력이 되는 과정

디지털 이미지는 이미 수치 데이터이며, 공간 차원과 채널에 걸친 픽셀 값을 포함하는 텐서이다. 전처리 과정에서는 이미지를 리사이즈하거나, 정규화하거나, 크롭하거나, 증강할 수 있다. 비디오는 시간 차원을 추가하고, 의료 및 과학 이미지에서는 깊이, 파장 또는 기타 모달리티가 추가될 수 있다.

고전적인 컴퓨터 비전은 손으로 설계한 에지, 코너, 텍스처 특징을 사용했다. 현대의 딥 모델은 일반적으로 작업과 함께 특징을 학습하지만, 데이터가 제한되거나 규칙이 명확히 이해되거나 연산량을 최소화해야 할 경우 고전적인 방법이 여전히 유용하다.

CNN과 학습된 지역 특징

CNN은 학습된 커널을 지역 이웃에 적용한다. 초기 층은 지역 패턴에 반응할 수 있고, 이후 블록은 이를 작업에 관련된 표현으로 결합한다. 풀링이나 스트라이드 연산은 공간 해상도를 낮추며, 잔차 연결은 깊은 네트워크를 최적화하기 쉽게 만든다.

현대의 CNN 분류기는 종종 다수의 완전 연결 층 대신 전역 풀링을 사용한다. 탐지기와 세그멘테이션 네트워크는 공간 정보를 보존하는 특수 헤드나 디코더 경로를 추가한다.

비전 트랜스포머와 기반 모델

비전 트랜스포머는 이미지를 패치로 나누고, 임베딩한 뒤 어텐션을 사용해 이들 간의 관계를 모델링한다. 트랜스포머는 대규모 데이터셋과 사전 학습을 통해 효율적으로 확장될 수 있지만, CNN은 작은 규모에서 더 강력한 내재 가정과 효율성을 제공한다.

멀티모달 모델은 이미지를 텍스트와 정렬하여 사용자가 검색, 캡션 작성, 질문에 답변하거나 언어를 사용해 세그멘테이션을 안내할 수 있게 한다. 이러한 모델은 기능을 확장하지만, 스테레오타입, 저작권이 있는 자료, 인구와 환경에 대한 불균형된 커버리지 등 웹 규모 데이터의 약점을 함께 물려받는다.

라벨, 자체 지도학습, 그리고 합성 데이터

경계 상자, 마스크, 랜드마크, 캡션을 만드는 데는 비용이 많이 든다. 자체 지도학습은 이미지 자체에서 목표를 도출하고, 약한 지도학습은 노이즈가 있거나 간접적인 라벨을 사용한다. 합성 데이터는 희귀 상황을 추가할 수 있지만, 시뮬레이션 격차 때문에 합성 성능이 실제 세계로 전이되지 않을 수 있다.

주석 품질을 측정해야 한다. 모호한 라벨, 일관되지 않은 경계, 누락된 객체는 성능의 한계를 만들고 하위 그룹의 실패를 숨길 수 있다.

비전 시스템 평가 방법

분류는 정확도, 정밀도, 재현율, F1, 그리고 캘리브레이션과 같은 지표를 사용한다. 탐지는 일반적으로 Intersection over Union과 평균 정밀도(mean average precision)를 사용한다. 세그멘테이션은 IoU 또는 Dice 형태의 측정을 사용한다. 추적은 정체성 및 궤적 지표를 추가한다.

지표는 실제 적용 환경에 맞아야 한다. 모델이 정제된 벤치마크에서 높은 점수를 받더라도 비, 저조도, 특이한 카메라 각도, 새로운 장치, 혹은 익숙하지 않은 인구에서는 실패할 수 있다. 평가는 분포 변화, 적대적 조건, 그리고 운영 지연 시간을 포함해야 한다.

프라이버시, 편향, 그리고 배포

얼굴, 번호판, 주택, 의료 스캔, 그리고 작업장 비디오는 민감한 정보를 드러낼 수 있다. 수집 및 보관은 정의된 법적·윤리적 근거를 따라야 하며, 접근 제어와 데이터 최소화를 적용해야 한다. 얼굴 분석 및 생체인식은 오류와 감시가 불평등한 피해를 초래할 수 있기 때문에 특별히 면밀히 검토해야 한다.

엣지 배포는 지연 시간과 데이터 전송을 줄일 수 있다. Edge AI, 양자화, 프루닝, 그리고 특수 가속기는 카메라, 차량, 로봇, 모바일 디바이스에서 비전 시스템을 실용화할 수 있지만, 압축은 정확도와 편향을 위해 재평가되어야 한다.

픽셀에서 시각 작업으로

컴퓨터 비전은 이미지나 비디오를 분류, 탐지, 세그멘테이션, 추적, 포즈, 깊이, 광학 흐름, 텍스트 인식 등과 같은 작업 출력으로 변환한다. 작업 정의는 주석 방식을 결정한다: 이미지 라벨만으로는 정밀한 위치 추정을 학습할 수 없으며, 경계 상자만으로는 세그멘테이션 마스크를 완전히 설명할 수 없다. 카메라 기하학, 렌즈, 노출, 조명, 움직임, 압축, 시점 등이 데이터 분포를 형성한다. 모델을 선택하기 전에 운영 환경과 오류 결과를 정의해야 한다. 벤치마크 이미지 컬렉션이 실제 배치된 센서나 장면을 대변하지 않을 수 있기 때문이다.

파이프라인은 미디어를 디코딩하고 방향을 맞춘 뒤, 리사이즈하거나 타일링하고, 값을 정규화하며, 라벨을 보존하는 증강을 적용하고, 모델을 실행한 뒤 로짓, 박스, 마스크, 트랙을 후처리한다. 객체 탐지기는 신뢰도 임계값과 억제를 사용하고; 트래커는 시간에 따라 탐지를 연결한다; 세그멘테이션은 형태학적 정리가 필요할 수 있다. 좌표 변환을 보존하여 출력이 원본 이미지와 일치하도록 한다. 사람, 카메라, 위치, 혹은 촬영 세션별로 데이터를 분할하여 거의 동일한 프레임이 학습과 테스트 세트에 동시에 포함되지 않도록 한다.

평가, 편향, 프라이버시, 그리고 운영

지표는 작업과 사용 목적에 맞아야 한다. 분류는 클래스별 정밀도와 재현율이 필요하고; 탐지는 IoU와 임계값별 평균 정밀도를 사용한다; 세그멘테이션은 IoU 또는 Dice를 사용한다; 추적은 정체성 전환을 추가한다; 비디오에서는 지연 시간과 놓친 이벤트 지속 시간이 중요하다. 조명, 거리, 디바이스, 가림, 피부톤, 연령 등 관련 조건별로 결과를 보고한다. 캘리브레이션과 고신뢰도 오류를 점검한다. 합성 또는 증강 데이터는 격차를 메울 수 있지만 실제 배포 데이터와 비교해야 하며 테스트 장면이 유출되지 않도록 해야 한다.

비전 시스템은 주변인, 위치, 생체정보, 민감한 행동을 수집할 수 있다. 캡처와 보관을 최소화하고, 스트림을 안전하게 보호하며, 2차 사용을 제한하고, 필요시 고지나 동의를 제공한다. 적대적 패치, 재생, 가림, 카메라 고장, 도메인 이동을 테스트한다. 센서 상태, 입력 통계, 출력 비율, 확인된 결과를 모니터링하고, 중요한 결정에는 인간 검토를 유지한다. 블러 처리나 크롭은 노출을 줄일 수 있지만 증거를 제거할 수도 있다. 높은 실험실 점수가 검증된 작업을 넘어 신원, 감정, 의도에 대한 주장을 정당화하지 않는다.

실제 예시: 창고 교차로에서 보행자 탐지

카메라는 제한된 차량 통로를 감시하며, 모델은 사람을 식별하는 것이 아니라 탐지한다. 데이터는 낮과 밤, 날씨, 복장, 가림, 휠체어 이용자, 카메라 위치, 빈 장면 등을 포함하며, 녹화 세션별로 분할된다. 탐지기는 이벤트 재현율, 오경보, 위치 정확도, 경고 선행 시간, 거리별 성능을 평가받는다. 안전 엔지니어링은 허용 가능한 최대 지연 시간과 독립적인 물리적 제어를 정의한다.

비전 알림은 차량을 감속시킬 수 있지만, 비상 정지와 차단 장치는 학습된 모델에 의존하지 않는다. 카메라 가림, 정지된 프레임, 네트워크 손실, 모델 타임아웃은 명시적인 오류를 발생시킨다. 원본 비디오 보관은 최소화하고 접근을 기록한다. 모니터링은 센서 상태, 알림 비율, 검토된 사건, 조건별 근접 사고를 추적한다. 카메라 위치 이동이나 레이아웃 변경은 겉보기 이미지 유사성이 동일한 기하학이나 위험을 보장하지 않으므로 재검증을 트리거한다.

구현 증거와 운영 준비성

프로덕션 결정을 내리기 위해서는 성공적인 시연 이상의 것이 필요하다. 의도된 사용자, 운영 환경, 입력, 출력, 종속성, 책임자, 그리고 각 주요 실패의 결과를 정의한다. 튜닝 전에 재현 가능한 기준선과 버전 관리된 평가 세트를 구축한다. 일반적인 경우, 경계 조건, 잘못된 혹은 누락된 입력, 분포 이동, 종속성 장애, 오용, 그리고 소외될 가능성이 높은 그룹이나 환경을 테스트한다. 작업 품질을 캘리브레이션·불확실성, 지연 시간, 처리량, 자원 비용, 접근성, 프라이버시, 보안과 함께 측정한다. 모든 변환과 임계값을 기록하여 독립 검토자가 결과를 재현하고 매력적인 프로토타입과 증거를 구분할 수 있게 한다.

출시 전에 릴리스, 예외, 변경, 롤백, 폐기에 대한 권한을 지정한다. 단계적 롤아웃을 사용하고 안전한 폴백을 유지하며, 의도적으로 삽입된 실패를 통해 모니터링을 검증한다. 운영 텔레메트리는 입력 품질, 출력 동작, 모델·규칙 버전, 종속성 상태, 인간 개입, 확인된 결과를 보여주어야 하며 불필요한 민감 데이터는 수집하지 않는다. 알림 임계값과 대응 담당자를 정의한 뒤, 오프라인 성능이 지속될 것이라 가정하지 말고 배포 후 실제 증거를 검토한다. 데이터 소스, 사용자, 모델, 공급업체, 정책, 하드웨어, 목표가 변할 때마다 재평가한다. 유지되는 시스템은 문서화된 복구, 사고 학습, 삭제·보관 절차, 그리고 비활성화 또는 교체 시점을 명확히 해야 한다.

자주 묻는 질문

컴퓨터 비전은 이미지 인식과 동일한가?

아니오. 이미지 인식은 일반적으로 분류 또는 식별을 의미한다. 컴퓨터 비전은 위치 추정, 세그멘테이션, 측정, 추적, 재구성, 생성, 그리고 시각 정보에 대한 추론까지 포함한다.

비전 시스템은 인간처럼 보는가?

아니오. 모델은 자신의 아키텍처와 학습 목표에 따라 수치 입력을 처리한다. 좁은 벤치마크에서는 사람보다 뛰어날 수 있지만, 사람이 쉽게 처리하는 작은 변화에서는 실패한다.

주요 참고문헌

블로거이자 프로그래머로 Machine Learning과 Deep Learning 주제에 전문가입니다. 다니엘은 다른 사람들이 AI의 힘을 사회적善으로 사용하는 것을 돕기를 희망합니다.