AI 모델 및 플랫폼

비전 트랜스포머, 새로운 ‘패치-클러스터 어텐션’ 방법으로 도전 극복

mm
Unite.AI를 Google의 선호 소스에 추가

인공지능(AI) 기술, 특히 비전 트랜스포머(ViTs)는 이미지에서 객체를 식별하고 분류하는 능력에서 엄청난 잠재력을 보여주었습니다. 그러나 실제 적용은 두 가지 주요 도전으로 인해 제한되었습니다: 높은 계산 요구와 투명성 결여. 이제 연구자들은 이러한 문제를 해결하는 혁신적인 방법을 개발했습니다. “패치-클러스터 어텐션” (PaCa)라는 새로운 방법론은 ViTs의 이미지 객체 식별, 분류, 세분화 능력을 향상시키는 동시에 계산 요구와 의사 결정 명확성의 오랜 문제를 해결합니다.

비전 트랜스포머의 도전 극복: 새로운 솔루션의 일瞥

트랜스포머는 우수한 능력으로 인해 AI 세계에서 가장 영향력 있는 모델 중 하나입니다. 이러한 모델의 힘은 시각 데이터를 통해 확장되어 비전 트랜스포머(ViTs)라는 클래스를 형성했습니다. 비전 트랜스포머는 이미지 해석과 이해에서 엄청난 잠재력을 제공하지만, 두 가지 주요 문제로 인해 제한되었습니다.

첫째, 이미지에는大量의 데이터가 포함되어 있기 때문에 비전 트랜스포머는 상당한 계산 능력과 메모리가 필요합니다. 이러한 복잡성은 특히 고해상도 이미지를 처리할 때 많은 시스템에서 압도적일 수 있습니다. 둘째, 비전 트랜스포머 내부의 의사 결정 과정은 souvent 복잡하고 불투명합니다. 사용자는 비전 트랜스포머가 이미지 내의 다양한 객체 또는 기능을 어떻게 구별하는지 이해하기 어렵습니다. 이는 많은 응용 분야에서 중요합니다.

그러나 혁신적인 PaCa 방법론은 이러한 두 가지 도전을 모두 해결합니다. “우리는 클러스터링 기술을 사용하여 트랜스포머 아키텍처가 이미지 내의 객체를 더 잘 식별하고 집중할 수 있도록 합니다”라고 Tianfu Wu는 설명합니다. 그는 PaCa에 대한 논문의 저자 중 한 명이며 노스 캐롤라이나 주립 대학교의 전기 및 컴퓨터 공학 부교수입니다.

PaCa에서 클러스터링 기술을 사용하면 계산 요구가 크게 감소하여 문제가 二次過程에서 관리 가능한 線形過程으로 변환됩니다. Wu는 과정에 대해 자세히 설명합니다. “클러스터링을 통해 이 과정을 線形過程으로 만들 수 있습니다. 각 작은 단위는 미리 정의된 클러스터 수만큼 비교하면 됩니다.”

클러스터링은 또한 비전 트랜스포머 내부의 의사 결정 과정을 명확하게 합니다. 클러스터를 형성하는 과정은 비전 트랜스포머가 이미지 데이터의 섹션을 함께 그룹화하는 데 중요하다고 생각하는 기능을 어떻게 결정하는지 보여줍니다. AI가 생성하는 클러스터는 제한적이므로 사용자는 쉽게 이해하고 검토할 수 있습니다. 이는 모델의 해석 가능성을 크게 향상합니다.

PaCa 방법론, 다른 최첨단 비전 트랜스포머를 능가

전면적인 테스트를 통해 연구자들은 PaCa 방법론이 여러 면에서 다른 비전 트랜스포머를 능가한다는 것을 발견했습니다. Wu는 “우리는 PaCa가 SWin과 PVT를 모든 면에서 능가한다는 것을 발견했습니다”라고 설명합니다. 테스트 과정에서 PaCa는 이미지 내의 객체를 분류하고 식별하는 데 탁월함을 보여주었으며, 또한 효율적으로 이미지 내의 객체 경계를 세분화했습니다. 또한 다른 비전 트랜스포머보다 더 빠른 속도로 작업을 수행했습니다.

PaCa의 성공에 고무된 연구 팀은 더 큰 기초 데이터셋에서 훈련하여 개발을 계속하고자 합니다. 이를 통해 현재 가능한 이미지 기반 AI의 한계를 더 넓히고자 합니다.

연구 논문 “PaCa-ViT: 비전 트랜스포머에서 패치-클러스터 어텐션 학습“은 即將開催의 IEEE/CVF 컴퓨터 비전 및 패턴 인식 회의에서 발표될 예정입니다. 이는 더 효율적이고 투명하며 접근 가능한 AI 시스템을 위한 중요한 里程碑이 될 수 있습니다.

Alex McFarland은 인공 지능의 최신 개발을 탐구하는 AI 저널리스트이자 작가입니다. 그는 전 세계의 수많은 AI 스타트업과 출판물들과 협력했습니다.