AI 모델 및 플랫폼
SEER: 컴퓨터 비전 모델에서 자율 주도 학습의 돌파구

過去 10년 동안, 인공 지능(AI)와 기계 학습(ML)은 엄청난 발전을 이루었습니다. 오늘날, 그들은 이전보다 더 정확하고 효율적이며 능력이 뛰어납니다. 현대의 AI와 ML 모델은 이미지나 비디오 파일에서 객체를 무결하게 인식할 수 있으며, 인간 지능과 유사한 텍스트와 음성을 생성할 수 있습니다.
오늘날의 AI 및 ML 모델은 주로 레이블이 지정된 데이터 세트에 대한 훈련에 크게 의존합니다. 이러한 데이터 세트는 모델이 텍스트 블록을 해석하고 이미지 또는 비디오 프레임에서 객체를 식별하는 방법을 가르칩니다.
그러나 이러한 모델은 완벽하지 않으며, 과학자들은 레이블이나 주석이 없는 데이터에서 학습할 수 있는 모델을 개발하기 위해 노력하고 있습니다. 이러한 접근 방식은 자율 주도 학습으로 알려져 있으며, 현재 AI 모델의 능력을 넘어서는 문제를 해결할 수 있는 “상식” 또는 배경 지식을 가진 ML 및 AI 모델을 구축하는 가장 효율적인 방법 중 하나입니다.
자율 주도 학습은 이미 자연어 처리에서 성과를 보였으며, 개발자가大量의 데이터와 함께 작동할 수 있는 대형 모델을 훈련할 수 있도록 해주었습니다. 이는 자연어 추론, 기계 번역, 질문 답변 등 여러 분야에서 돌파구를 이루었습니다.
컴퓨터 비전에서 자율 주도 학습의 필요성
데이터 주석 또는 데이터 레이블링은 기계 학습 및 인공 지능 모델 개발의 전처리 단계입니다. 데이터 주석 프로세스는 원시 데이터를 식별하고 데이터에 레이블을 추가하여 모델이 데이터를 예측할 수 있도록 합니다. (META )
컴퓨터 비전 모델을 개발할 때 개발자가 직면하는 가장 큰 장애물 중 하나는 높은 품질의 주석이 된 데이터를 찾는 것입니다. 현재의 컴퓨터 비전 모델은 이러한 레이블이 된 데이터 세트에 의존하여 객체를 인식하는 패턴을 학습합니다.
데이터 주석 및 컴퓨터 비전 모델에서 데이터 사용은 다음과 같은 문제를 제기합니다.
일관된 데이터 세트 품질 관리
개발자가 직면하는 가장 큰 장애물은 일관된 높은 품질의 데이터 세트에 접근하는 것입니다. 높은 품질의 데이터 세트와 명확한 이미지로 모델을 훈련하면 더 나은 학습과 정확한 모델이 생성됩니다.
인력 관리
데이터 레이블링은 주로大量의 작업자가 필요하기 때문에 인력 관리 문제를 수반합니다. 따라서 개발자는 데이터 레이블링에서 품질과 양의 균형을 맞추는 것이 중요합니다.
재정 제약
가장 큰 장애물은 데이터 레이블링 과정이 수반하는 재정 제약입니다. 대부분의 경우 데이터 레이블링 비용은 전체 프로젝트 비용의 상당한 비율입니다.
컴퓨터 비전 모델 개발에서 데이터 주석은 특히大量의 훈련 데이터를 다루는 복잡한 모델을 개발할 때 주요 장애물입니다. 이것이 컴퓨터 비전 산업이 복잡하고 고급 컴퓨터 비전 모델을 개발하기 위해 자율 주도 학습이 필요한 이유입니다.
이미 제어된 환경에서 작동하는 자율 주도 학습 모델이 많지만, 이러한 모델은 주로 ImageNet 데이터 세트에서 작동하며, 컴퓨터 비전에서 자율 주도 학습의 주요 조건을 충족하지 않습니다. 이상적으로 구현된 자율 주도 학습은 더 정확하고 비용 효율적인 컴퓨터 비전 모델을 개발하는 데 도움이 될 수 있습니다.
SEER 또는 SElf-supERvised 모델: 소개
최근의 AI 및 ML 산업 동향은 반감독, 약하게 감독, 자율 주도 학습과 같은 사전 훈련 접근 방식이 대부분의 깊은 학습 모델의 다운스트림 작업 성능을 크게 향상시킬 수 있음을 나타내고 있습니다.
이러한 깊은 학습 모델의 성능 향상을 크게 기여한 두 가지 주요 요인이 있습니다.
대규모 데이터 세트에 대한 사전 훈련
대규모 데이터 세트에 대한 사전 훈련은 일반적으로 더 나은 정확도와 성능을 제공합니다. 대규모 데이터 세트는 모델이 데이터의 패턴을 더 잘 이해할 수 있도록 해주며, 궁극적으로 모델이 실제 시나리오에서 더 잘 작동하도록 합니다.
일부 최고의 성능을 보이는 모델인 GPT-3 언어 모델과 Wav2vec 2.0 음성 인식 모델은 대규모 데이터 세트에서 훈련됩니다. GPT-3 언어 모델은 30억 단어가 넘는 사전 훈련 데이터 세트를 사용하는 반면, Wav2vec 2.0 음성 인식 모델은 5.3만 시간이 넘는 오디오 데이터 세트를 사용합니다.
대규모 용량 모델
더 많은 매개 변수를 가진 모델은 일반적으로 더 정확한 결과를 제공합니다. 더 많은 매개 변수를 가진 모델은 데이터의 간섭이나 노이즈에 집중하는 대신 데이터에서 필요한 객체에만 집중할 수 있기 때문입니다.
과거에는 개발자가 비레이블 또는 비정리된 데이터에서 자율 주도 학습 모델을 훈련하려고 시도했지만, 데이터 세트는 몇백만 개의 이미지로 구성되었습니다. 그러나 비레이블 및 비정리된大量의 데이터에서 자율 주도 학습 모델을 훈련하면 높은 정확도를 달성할 수 있을까요? 이것이 SEER 모델이 답변하려고 하는 질문입니다.
SEER 모델은 깊은 학습 프레임워크로, 인터넷에 있는 이미지에 대한 등록을 위한 것입니다. SEER 프레임워크는 개발자가 감독이 없는 상태에서大量의 데이터에서 복잡하고 큰 ML 모델을 훈련할 수 있도록 해줍니다.
SEER 모델의 궁극적인 목표는 사전 훈련 프로세스에서 비정리된 데이터를 사용하여 최첨단 성능을 제공하는 전이 학습에서 최상의 성능을 제공하는 전략을 개발하는 것입니다. 또한, SEER 모델은 지속적으로 데이터의 끝없는 흐름에서 자율 주도 학습 방식으로 학습할 수 있는 시스템을 만들고자 합니다.
SEER 프레임워크는 인터넷에서 추출한 랜덤하고 제한이 없는 이미지에서 높은 용량 모델을 훈련합니다. 이러한 이미지에서 훈련된 모델은 이미지 메타데이터나 주석을 사용하여 모델을 훈련하거나 데이터를 필터링하지 않습니다.
SEER 프레임워크와 RegNet: 연결
SEER 모델을 분석하기 위해, RegNet 아키텍처에 중점을 둡니다. 이는 SEER의 자율 주도 학습 목표를 위한 두 가지 주요 이유로 인해 7억 개 이상의 매개 변수를 가지고 있습니다.
- 성능과 효율성 사이에서 완벽한 균형을 제공합니다.
- 매개 변수 수를 조정할 수 있습니다.

SEER 프레임워크: 다른 영역에서의 선행 연구
SEER 프레임워크는 비정리된 또는 레이블이 없는 데이터 세트에서 큰 모델 아키텍처를 훈련하는 자율 주도 학습의 한계를 탐색하는 것을 목표로 합니다. 이 모델은 다양한 분야에서 선행 연구에서 영감을 얻습니다.
비감독된 시각적 특징의 사전 훈련
자율 주도 학습은 컴퓨터 비전에서 이미 구현되어 있으며, 오토인코더, 인스턴스 수준의 차별화, 클러스터링과 같은 방법을 사용합니다. 최근에는 대조적 학습을 사용하는 방법이 다운스트림 작업에서 사전 훈련된 모델의 성능을 향상시킬 수 있음을 보여주었습니다.
비감독된 시각적 특징 학습의 주요 결론은 필터링된 데이터에 훈련하는 경우 감독 레이블이 필요하지 않다는 것입니다. SEER 모델은 대규모 모델 아키텍처가 비정리된, 레이블이 없는, 랜덤한 이미지에서 정확한 표현을 학습할 수 있는지 탐색합니다.
대규모 시각적 특징 학습
이전 모델은 약한 감독, 감독, 반감독 학습을 사용하여 대규모 레이블이 된 데이터 세트에서 사전 훈련을 통해 이점을 얻었습니다. 또한, 모델 분석은 사전 훈련 모델을 이미지에서 훈련하는 것이_scratch에서 훈련하는 것보다 더 나은 정확도를 제공함을 보여주었습니다.
대규모로 훈련하는 경우 일반적으로 모델이 대상 개념과 일치하도록 이미지를 필터링하는 단계가 필요합니다. 이러한 필터링 단계는 사전 훈련된 분류기의 예측 또는 ImageNet 클래스의 하시태그를 사용합니다. SEER 모델은 다르게 작동하며, 任意의 이미지에서 특징을 학습하려고 합니다. 따라서 SEER 모델의 훈련 데이터는 미리 정의된 특징이나 개념과 일치하도록 큐레이션되지 않습니다.
이미지 인식 아키텍처 확장
모델은 일반적으로 대규모 데이터 세트에서 사전 훈련될 때 더 나은 성능을 제공합니다. 이는 모델이 데이터의 패턴을 더 잘 이해할 수 있기 때문입니다. 이는 특히 대조적 학습과 함께 사전 훈련할 때 중요합니다. 이 경우 모델은 데이터 세트의 인스턴스를 구별하여 더 나은 시각적 표현을 학습해야 합니다.
이미지 인식의 경우 아키텍처 확장은 단순히 모델의 깊이와 너비를 변경하는 것보다 더 복잡합니다. 규모 효율적인 모델을 구축하려면 많은 문헌이 필요합니다. SEER 모델은 대규모에서 자율 주도 학습을 구현하기 위한 RegNets 모델 패밀리의 이점을 보여줍니다.
SEER: 방법 및 구성 요소
SEER 프레임워크는 시각적 특징을 학습하기 위해 사전 훈련하는 모델에 다양한 방법과 구성 요소를 사용합니다. SEER 프레임워크에서 사용되는 주요 방법과 구성 요소는 다음과 같습니다.
SwAV를 사용한 자율 주도 사전 훈련
SEER 프레임워크는 SwAV라는 온라인 자율 주도 학습 접근 방식을 사용하여 사전 훈련됩니다. SwAV는 온라인 클러스터링 방법으로, 주석이 없는 상태에서 ConvNet 프레임워크를 훈련하는 데 사용됩니다.
SwAV 프레임워크는 동일한 이미지의 서로 다른 뷰에서 일관되게 클러스터 할당을 생성하여 작동합니다. 시스템은 데이터 증강에 대한 불변성을 갖는 클러스터를 마이닝하여 의미 있는 표현을 학습합니다.
실제로 SwAV 프레임워크는 이미지의 서로 다른 뷰의 특징을 비교하여 독립적인 클러스터 할당을 사용합니다. 이러한 할당이 동일한 또는 유사한 특징을 캡처하는 경우, 하나의 이미지 뷰에서 다른 뷰의 할당을 예측할 수 있습니다.
SEER 모델은 K개의 클러스터를 고려하며, 각 클러스터는 학습 가능한 d차원 벡터 vk와 연결됩니다. 이미지 B개의 배치에 대해, 각 이미지 i는 두 개의 다른 뷰로 변환됩니다.xi1 과 xi2. 이 뷰는 ConvNet으로 특징화되어 두 개의 특징 세트를 생성합니다.
SEER 모델은 Optimal Transport 솔버를 사용하여 각 특징 세트에 클러스터 할당을 독립적으로 할당합니다. Optimal Transport 솔버는 특징이 클러스터에 고르게 분산되어 모든 표현이 하나의 프로토타입에 매핑되지 않도록 합니다.
SEER 모델은 클러스터 할당 y를 두 개의 세트 사이에서 교환합니다.xi1 의 뷰에서 클러스터 할당 y를 사용하여 xi2 의 뷰에서 특징 표현 f를 예측해야 합니다.
SEER 모델은 프로토타입 가중치와 ConvNet을 모든 예제에 대해 손실을 최소화하여 훈련합니다. 클러스터 예측 손실 l 은 특징 f와 클러스터 할당 사이의 소프트맥스와 도트 제품의 교차 엔트로피입니다.
RegNetY: 규모 효율적인 모델 패밀리
SEER 프레임워크는 RegNetY 아키텍처에 중점을 둡니다. 이는 규모 효율적인 모델 패밀리로, 메모리와 런타임 효율성을 제공합니다.
RegNetY 아키텍처는 4개의 스테이지로 구성되며, 각 스테이지에는 동일한 블록이 포함됩니다. SEER 모델은 RegNetY 아키텍처에 Squeeze-and-Excitation 을 추가하여 성능을 향상합니다.
SEER 모델은 RegNetY 아키텍처를 사용하여 자율 주도 사전 훈련을 수행합니다. RegNetY 아키텍처는 5개의 매개 변수를 사용하여 좋은 인스턴스를 검색하는 데 도움이 됩니다.
RegNetY 256GF 아키텍처
SEER 모델은 주로 RegNetY 패밀리에서 RegNetY 256GF 아키텍처에 중점을 둡니다. RegNetY 256GF 아키텍처는 4개의 스테이지로 구성되며, 각 스테이지에는 다른 너비와 깊이가 있습니다.
SEER 모델은 RegNetY 256GF 아키텍처를 사용하여 1억 개 이상의 이미지에서 자율 주도 학습을 수행합니다. 모델은 512개의 NVIDIA V100 GPU에서 8,704개의 이미지 배치 크기로 훈련됩니다.
SEER 모델은 122,000번의 반복으로 훈련되며, 총 8일이 소요됩니다.
최적화 및 대규모 훈련
SEER 모델은 자율 주도 학습 방법을 대규모로 적용하고 이러한 방법을 대규모로 조정하는 데 몇 가지 조정을 제안합니다.
- 학습률 스케줄.
- GPU당 메모리 소비량 줄이기.
- 훈련 속도 최적화.
- 대규모 사전 훈련 데이터.
학습률 스케줄
SEER 모델은 두 가지 학습률 스케줄을 탐색합니다.코사인 파형 학습률 스케줄 과 고정 학습률 스케줄.
코사인 파형 학습률 스케줄은 모델을 공정하게 비교하는 데 사용됩니다. 그러나 대규모 훈련에는 적합하지 않습니다.
고정 학습률 스케줄링은 학습률을 고정하고 손실이 증가하면 학습률을 2로 나눕니다.
GPU당 메모리 소비량 줄이기
SEER 모델은 혼합 정밀도와 그라디언트 체크포인팅을 사용하여 GPU당 메모리 소비량을 줄입니다.
SEER 모델은 또한 중간 활성화를 버리고, 전방 및 후방 전달에서 활성화를 재계산합니다.
훈련 속도 최적화
혼합 정밀도를 사용하여 메모리 사용량을 최적화하면 훈련 속도가 빨라집니다.
SEER 모델은 또한 BatchNorm 레이어를 GPU 전체에서 동기화하고, 프로세스 그룹을 생성하여 전역 동기화를 피합니다.
SEER 모델은 또한 데이터 로더를 사용하여 더 많은 훈련 배치를 미리 가져옵니다.
대규모 사전 훈련 데이터
SEER 모델은 1억 개 이상의 이미지에서 사전 훈련을 수행합니다.
SEER 모델은 데이터를 미리 처리하거나 큐레이션하지 않고, 인터넷과 인스타그램에서 직접 랜덤한 이미지를 샘플링합니다.
데이터 세트는 정적이지 않으며, 이미지들은 3개월마다 새로 고쳐집니다.
SEER 모델 구현
SEER 모델은 RegNetY 256GF 아키텍처를 사용하여 SwAV와 함께 사전 훈련을 수행합니다.
SEER 모델은 6개의 크롭과 2×224 + 4×96의 해상도를 사용합니다.
SEER 모델은 3개의 MLP 레이어를 사용하여 사전 훈련을 수행합니다.
SEER 모델은 16,000개의 프로토타입과 0.1의 온도를 사용합니다.
SEER 모델은 10개의 Sinkhorn 반복을 수행합니다.
SEER 모델은 BatchNorm 통계를 GPU 전체에서 동기화하고, 프로세스 그룹을 생성하여 전역 동기화를 피합니다.
SEER 모델은 LARS 최적화와 10^-5의 가중치 감소를 사용합니다.
SEER 모델은 512개의 NVIDIA V100 GPU에서 8,704개의 이미지 배치 크기로 훈련됩니다.
SEER 모델은 122,000번의 반복으로 훈련되며, 총 8일이 소요됩니다.
SEER 프레임워크: 결과
자율 주도 사전 훈련 접근 방식의 품질은 다양한 벤치마크와 다운스트림 작업에서 연구되고 분석됩니다.
대규모 사전 훈련 모델의 미세 조정
SEER 모델은 ImageNet 벤치마크에서 객체 분류를 위해 미세 조정을 수행합니다.
SEER 모델은 6개의 RegNet 아키텍처를 사용하여 사전 훈련을 수행합니다.
SEER 모델은 1.28백만개의 이미지와 50,000개의 검증 이미지를 사용합니다.
SEER 모델은 SGD 최적화와 0.0125의 학습률을 사용합니다.
SEER 모델은 35개의 에포크로 훈련되며, 30에포크 이후에 학습률을 10으로 나눕니다.
SEER 모델은 0.9의 모멘텀과 10^-4의 가중치 감소를 사용합니다.
다른 자율 주도 사전 훈련 접근 방식과 비교
SEER 모델은 다른 자율 주도 사전 훈련 접근 방식과 비교됩니다.
SEER 모델은 84.2%의 top-1 정확도를 달성하며, SimCLRv2를 1%超过합니다.
SEER 모델은 다른 모델과 비교하여 더 나은 성능을 보입니다.
모델 용량의 영향
SEER 모델은 모델 용량이 성능에 미치는 영향을 분석합니다.
SEER 모델은 모델 용량이 증가할수록 성능이 향상됨을 보여줍니다.
SEER 모델은 모델 용량이 성능에 미치는 영향을 분석합니다.
저샷 러닝
SEER 모델은 저샷 러닝 환경에서 성능을 평가합니다.
SEER 모델은 Places205와 ImageNet 데이터 세트에서 저샷 러닝을 수행합니다.
SEER 모델은 1%에서 10%의 이미지에서 저샷 러닝을 수행합니다.
SEER 모델은 80%의 top-1 정확도를 달성하며, 다른 모델과 비교하여 더 나은 성능을 보입니다.
모델 용량의 영향
SEER 모델은 모델 용량이 성능에 미치는 영향을 분석합니다.
SEER 모델은 모델 용량이 증가할수록 성능이 향상됨을 보여줍니다.
SEER 모델은 모델 용량이 성능에 미치는 영향을 분석합니다.
다른 벤치마크로의 전이
SEER 모델은 다른 벤치마크로의 전이를 평가합니다.
SEER 모델은 Open-Images, iNaturalist, Places205, Pascal VOC 데이터 세트에서 전이를 수행합니다.
SEER 모델은 다른 모델과 비교하여 더 나은 성능을 보입니다.
이미지 분류의 선형 평가
SEER 모델은 이미지 분류의 선형 평가를 수행합니다.
SEER 모델은 다른 모델과 비교하여 더 나은 성능을 보입니다.
SEER 모델은 84.2%의 top-1 정확도를 달성하며, SimCLRv2를 1%超过합니다.
검출 및 분할
SEER 모델은 검출 및 분할을 평가합니다.
SEER 모델은 다른 모델과 비교하여 더 나은 성능을 보입니다.
SEER 모델은 1.5에서 2 AP 포인트의 성능을 달성합니다.
약한 감독 사전 훈련과 비교
SEER 모델은 약한 감독 사전 훈련과 비교됩니다.
SEER 모델은 다른 모델과 비교하여 더 나은 성능을 보입니다.
SEER 모델은 84.2%의 top-1 정확도를 달성하며, SimCLRv2를 1%超过합니다.
제거 연구
SEER 모델은 제거 연구를 수행합니다.
SEER 모델은 모델 아키텍처가 성능에 미치는 영향을 분석합니다.
SEER 모델은 모델 용량이 성능에 미치는 영향을 분석합니다.
SEER 모델은 사전 훈련 데이터가 성능에 미치는 영향을 분석합니다.
모델 아키텍처의 영향
SEER 모델은 모델 아키텍처가 성능에 미치는 영향을 분석합니다.
SEER 모델은 모델 아키텍처가 성능에 미치는 영향을 분석합니다.
SEER 모델은 모델 용량이 성능에 미치는 영향을 분석합니다.
사전 훈련 데이터의 확장
SEER 모델은 사전 훈련 데이터가 성능에 미치는 영향을 분석합니다.
SEER 모델은 사전 훈련 데이터가 성능에 미치는 영향을 분석합니다.
SEER 모델은 모델 용량이 성능에 미치는 영향을 분석합니다.
고유 이미지 수의 증가
SEER 모델은 고유 이미지 수가 성능에 미치는 영향을 분석합니다.
SEER 모델은 고유 이미지 수가 성능에 미치는 영향을 분석합니다.
SEER 모델은 모델 용량이 성능에 미치는 영향을 분석합니다.
더 많은 매개 변수
SEER 모델은 더 많은 매개 변수가 성능에 미치는 영향을 분석합니다.
SEER 모델은 더 많은 매개 변수가 성능에 미치는 영향을 분석합니다.
SEER 모델은 모델 용량이 성능에 미치는 영향을 분석합니다.
자율 주도 컴퓨터 비전의 실제 세계
SEER 모델은 실제 세계에서 자율 주도 컴퓨터 비전을 위한 미래를 열어줍니다.
SEER 모델은 자연어 처리에서 높은 성능을 보이는 모델과 비교할 수 있습니다.
SEER 모델은 실제 세계에서 자율 주도 컴퓨터 비전을 위한 미래를 열어줍니다.
SEER 모델은 데이터를 미리 처리하거나 큐레이션하지 않고, 인터넷과 인스타그램에서 직접 랜덤한 이미지를 샘플링합니다.
SEER 모델은 1억 개 이상의 이미지에서 자율 주도 사전 훈련을 수행합니다.
SEER 모델은 실제 세계에서 자율 주도 컴퓨터 비전을 위한 미래를 열어줍니다.
결론: 자율 주도 학습의 미래
자율 주도 학습은 AI와 ML 산업에서 중요한 역할을 합니다.
SEER 모델은 자율 주도 학습의 미래를 열어줍니다.
SEER 모델은 실제 세계에서 자율 주도 컴퓨터 비전을 위한 미래를 열어줍니다.
SEER 모델은 데이터를 미리 처리하거나 큐레이션하지 않고, 인터넷과 인스타그램에서 직접 랜덤한 이미지를 샘플링합니다.
SEER 모델은 실제 세계에서 자율 주도 컴퓨터 비전을 위한 미래를 열어줍니다.












