AI 기초

컴퓨터 비전이란 무엇인가?

mm
Unite.AI를 Google의 선호 소스에 추가

컴퓨터 비전이란 무엇인가?

컴퓨터 비전 알고리즘은 현재 세계에서 가장 변革적이고 강력한 AI 시스템 중 하나입니다. 컴퓨터 비전 시스템은 자율 주행 자동차, 로봇 탐색, 얼굴 인식 시스템 등에 사용됩니다. 그러나 컴퓨터 비전 알고리즘은 정확히 무엇일까요?它们는 어떻게 작동합니까? 이러한 질문에 답하기 위해 우리는 컴퓨터 비전의 이론, 컴퓨터 비전 알고리즘, 컴퓨터 비전 시스템의 응용 프로그램에 대해 깊이 다루어 보겠습니다.

컴퓨터 비전 시스템은 어떻게 작동합니까?

컴퓨터 비전 시스템이 작동하는 방식을 완전히 이해하기 위해 먼저 인간이 객체를 인식하는 방식을 обсужд아 보겠습니다. 신경 심리학에서 객체 인식의 초기 단계를 설명하는 모델은 객체의 기본 구성 요소인 형태, 색상, 깊이를 해석하는 것으로 설명됩니다. 눈에서 뇌로 들어오는 신호는 객체의 가장자리를 먼저 분리하고, 이러한 가장자리를 더 복잡한 표현으로 결합하여 객체의 형태를 완성합니다.

컴퓨터 비전 시스템은 인간의 시각 시스템과 매우 유사하게 작동하여 객체의 가장자리를 먼저 분리하고, 이러한 가장자리를 객체의 형태로 결합합니다. 그러나 컴퓨터는 이미지의 개별 픽셀을 숫자로 해석하기 때문에 컴퓨터 비전 시스템은 이러한 픽셀을 해석하는 방법이 필요합니다. 컴퓨터 비전 시스템은 이미지의 픽셀에 값을 할당하고, 한 영역의 픽셀과 다른 영역의 픽셀 사이의 값의 차이를 분석하여 가장자리를 분리할 수 있습니다. 예를 들어, 이미지의 색상이 회색인 경우, 값은 검은색(0)에서 흰색(255)까지의 범위를 가집니다. 근처 픽셀의 값 범위가 급격히 변경되면 가장자리가 나타납니다.

이 기본 원리는 색상 이미지에서도 적용될 수 있으며, 컴퓨터는 다양한 RGB 색상 채널 사이의 차이를 비교할 수 있습니다. 이제 컴퓨터 비전 시스템이 픽셀 값을 해석하여 이미지에 대한 정보를 얻는 방식을 알았으므로, 컴퓨터 비전 시스템의 구조를 살펴보겠습니다.

컨볼루션 신경 네트워크 (CNN)

컴퓨터 비전 작업에서 사용되는 주요 AI 유형은 컨볼루션 신경 네트워크에 기반한 것입니다. 컨볼루션은 무엇일까요?

컨볼루션은 네트워크가 픽셀 사이의 값의 차이를 결정하는 수학적 과정입니다. 픽셀 값의 격자를 상상해 보세요. 작은 격자가 주 격자 위를 이동하는 것을 상상해 보세요. 네트워크는 두 번째 격자 아래의 값을 분석하므로, 네트워크는 한 번에 몇 개의 픽셀만을 분석합니다. 이것을 “슬라이딩 윈도우” 기술이라고 합니다. 슬라이딩 윈도우에서 분석되는 값은 네트워크에 의해 요약되어 이미지의 복잡성을 줄이고 패턴을 추출하기 쉽게 합니다.

컨볼루션 신경 네트워크는 두 개의 섹션으로 나뉩니다. 컨볼루션 섹션과 완전히 연결된 섹션입니다. 네트워크의 컨볼루션 계층은 특징 추출기로서, 이미지 내의 픽셀을 분석하고, 밀집 연결 계층이 패턴을 학습할 수 있는 표현을 형성하는 역할을 합니다. 컨볼루션 계층은 픽셀을 분석하여 이미지의 낮은 수준의 특징을 추출하기 시작합니다. 나중에 컨볼루션 계층은 가장자리를 더 복잡한 모양으로 결합합니다. 마지막으로, 네트워크는 이미지의 가장자리와 세부 사항에 대한 표현을 완전히 연결된 계층에 전달할 수 있습니다.

이미지 주석

컨볼루션 신경 네트워크는 이미지에서 패턴을 추출할 수 있지만, 이미지 주석을 추가하여 컴퓨터 비전 시스템의 정확도를 크게提高할 수 있습니다. 이미지 주석은 이미지에 중요한 객체를 감지하기 위해 분류기에 도움을 주는 메타데이터를 추가하는 과정입니다. 이미지 주석은 자율 주행 자동차 또는 로봇을 제어하는 경우와 같이 컴퓨터 비전 시스템이 매우 정확해야 하는 경우에 중요합니다.

이미지 주석은 컴퓨터 비전 분류기의 성능을 향상시키기 위해 다양한 방법으로 수행될 수 있습니다. 이미지 주석은 일반적으로 목표 객체의 가장자리를 둘러싼 바운딩 박스를 사용하여 수행됩니다. 목표 객체에 집중할 것을 컴퓨터에 지시합니다. 시맨틱 세그멘테이션은 또 다른 유형의 이미지 주석으로, 이미지의 각 픽셀에 이미지 클래스를 할당하여 작동합니다. 즉, “풀” 또는 “나무”로 간주될 수 있는 모든 픽셀은 해당 클래스에 할당됩니다. 이 기술은 픽셀 수준의 정밀도를 제공하지만, 단순한 바운딩 박스를 생성하는 것보다 시맨틱 세그멘테이션 주석을 생성하는 것이 더 복잡하고 시간이 많이 걸립니다. 다른 주석 방법으로는 선과 점이 있습니다.

블로거이자 프로그래머로 Machine Learning Deep Learning 주제에 전문가입니다. 다니엘은 다른 사람들이 AI의 힘을 사회적善으로 사용하는 것을 돕기를 희망합니다.