AI 모델 및 플랫폼

DINOv3와 컴퓨터 비전의 미래: 대규모 자율 학습

mm
Unite.AI를 Google의 선호 소스에 추가
DINOv3 and the Future of Computer Vision: Self-Supervised Learning at Scale

이미지 레이블링은 많은 컴퓨터 비전 프로젝트에서 비용이 많이 들고 시간이 오래 걸리는 과정입니다. 이는 종종 편향을 도입하고 대규모 데이터셋을 확장하는 능력을 감소시킵니다. 따라서 연구자들은 수동 레이블링의 필요성을 제거하는 접근 방식을 찾고 있습니다. 이러한 도전에 대응하여 Meta AI는 2025년에 DINOv3를 도입했습니다. 이는 17억 개의 레이블이 없는 이미지에서 직접 학습할 수 있는 자율 학습된 비전 기초 모델입니다.

モデル은 7억 개의 매개 변수가 있는 광범위한 교사 네트워크로 훈련됩니다. 이러한 설정을 통해 단일 고정 백본에서 높은 품질의 전역 및 밀집 특징을 생성할 수 있습니다. 결과적으로 모델은 이미지의 세부 사항과 더 넓은 맥락 정보를 모두 캡처할 수 있습니다.

또한 DINOv3는 비용이 많이 들지 않는 미세 조정을 필요로 하지 않는 많은 비전 작업에서 강력한 성능을 보여줍니다. 이는 기술적인 관점에서뿐만 아니라 자원과 시간이 제한된 연구자, 엔지니어 및 산업 리더에게도 유용합니다.

이러한 방식으로 DINOv3는 컴퓨터 비전에서 중요한 발전을 나타냅니다. 대규모 학습, 효율성 및 광범위한 사용 가능성을 결합하여 학술 연구 및 산업 응용 분야 모두에서 강력한 잠재력을 가진 기초 모델입니다.

자율 학습된 비전의 진화

전통적인 컴퓨터 비전은 오랫동안 감독 학습에 의존했습니다. 이 방법은 사람們이 주의 깊게 주석을 달아야 하는 큰 레이블이 있는 데이터셋을 필요로 합니다. 이 과정은 비용이 많이 들고 시간이 오래 걸리며 레이블이 희박하거나 비용이 많이 드는 분야에서는 종종 비실용적입니다. 이러한 이유로 자율 학습은 중요한 접근 방식이 되었습니다. 이는 모델이 원시, 레이블이 없는 데이터에서 유용한 시각적 특징을 직접 학습할 수 있도록 합니다.

초기 자율 학습 방법, 즉 Momentum Contrast (MoCo) 및 Bootstrap Your Own Latent (BYOL)은 모델이 레이블이 없는 데이터에서 강력한 시각적 특징을 학습할 수 있음을 보여주었습니다. 이러한 방법은 자율 감독의 가치를 입증하고 더 발전된 접근 방식을 열어주었습니다.

2021年に Meta는 DINO를 도입했습니다. 이는 자율 학습된 훈련을 사용하여 경쟁력 있는 성능을 달성한 중요한 단계였습니다. 이후 DINOv2는 훈련을 확대하고 학습된 특징의 전이 가능성을 향상시켜 이 발전을 더욱 발전시켰습니다.

이러한 개선은 2025년에 출시된 DINOv3의 기초를 마련했습니다. DINOv3는 훨씬 더 큰 모델과 거대한 데이터셋을 사용하여 새로운 성능 벤치마크를 설정할 수 있었습니다.

2025년까지 자율 학습은 더 이상 선택 사항이 아니었습니다. 이는 수십억 개의 이미지에 대한 훈련을 인간의 레이블링 없이 가능하게 하여 많은 작업에 걸쳐 일반화할 수 있는 기초 모델을 구축할 수 있게 되었습니다. 이러한 모델의 사전 훈련된 백본은 유연한 특징을 제공하며 작은 작업 특정 헤드를 추가하여 적응할 수 있습니다. 이 방법은 비용을 절감하고 컴퓨터 비전 시스템의 개발을 가속화합니다.

또한 자율 학습은 연구 주기를 줄입니다. 팀은 빠른 테스트 및 평가를 위해 사전 훈련된 모델을 재사용할 수 있으며 이는 빠른 프로토 타이핑에 도움이 됩니다. 대규모 및 레이블 효율적인 학습으로의 이동은 많은 산업에서 컴퓨터 비전 시스템을 구축하고 적용하는 방식을 변경하고 있습니다.

DINOv3가 자율 학습된 컴퓨터 비전을 재정의하는 방법

DINOv3는 Meta AI의 가장 발전된 자율 학습된 비전 기초 모델입니다. 이는 컴퓨터 비전에서 대규모 훈련의 새로운 단계를 나타냅니다. 이전 버전과는 달리 7억 개의 매개 변수가 있는 광범위한 교사 네트워크와 17억 개의 레이블이 없는 이미지로 훈련됩니다. 이러한 규모는 모델이 더 강력하고 더 적응 가능한 특징을 학습할 수 있게 합니다.

DINOv3의 한 가지 주요 개선은 밀도 특징 학습의 안정성입니다. 이전 모델, 즉 DINOv2는 종종 장기 훈련 동안 패치 수준의 특징에서 세부 사항을 잃었습니다. 이는 분할 및 깊이 추정과 같은 작업에서 모델의 신뢰성을 감소시켰습니다. DINOv3는 Gram Anchoring이라는 방법을 도입하여 이 문제를 해결합니다. 훈련 동안 패치 간의 유사성 구조를 일관되게 유지하여 특징의 붕괴를 방지하고 세부 사항을 보존합니다.

또 다른 기술적인 발전은 높은 해상도 이미지 자르기입니다. 더 큰 이미지 섹션에서 작업함으로써 모델은 지역 구조를 더 정확하게 캡처할 수 있습니다. 이는 더 자세하고 정교한 밀도 특징 맵을 생성하여 픽셀 수준의 정확도가 중요한 응용 분야에서 성능을 향상시킵니다.

모델은 또한 Rotary Positional Embeddings (RoPE)를 사용하여 혜택을 받습니다. 이러한 임베딩은 해상도 및 자르기 전략과 결합되어 모델이 다양한 크기 및 모양의 이미지를 처리할 수 있도록 합니다. 이는 모델을 실제 시나리오에서 더 안정적으로 만듭니다. 여기서 입력 이미지는 종종 품질 및 형식이 다를 수 있습니다.

다양한 배포 요구 사항을 지원하기 위해 Meta AI는 DINOv3를 더 작은 모델家族으로蒸發했습니다. 이러한 모델에는 여러 비전 트랜스포머 (ViT) 크기 및 ConvNeXt 버전이 포함됩니다. 더 작은 모델은 에지 디바이스에 더 적합하며 더 큰 모델은 연구 또는 서버 사용에 더 적합합니다. 이러한 유연성으로 인해 DINOv3는 다양한 환경에서 중요한 성능 손실 없이 적용될 수 있습니다.

결과는 이러한 접근 방식의 강점을 확인합니다. DINOv3는 60개 이상의 벤치마크에서 최상위 결과를 달성합니다. 분류, 분할, 깊이 추정 및 3D 작업에서 모두 잘 수행됩니다. 이러한 결과 중 많은 부분은 백본을 동결한 상태에서 달성되므로 추가적인 미세 조정이 필요하지 않습니다.

성능 및 벤치마크 우수성

DINOv3는 신뢰할 수 있는 비전 기초 모델로 자리 잡았습니다. 다양한 컴퓨터 비전 작업에서 강력한 결과를 달성했습니다. 하나의 필수적인 강점은 동결된 백본이 이미 풍부한 특징을 캡처한 것입니다. 따라서 대부분의 응용 분야에서는 선형 프로브 또는 경량 디코더만 필요합니다. 이는 전이를 더 빠르고 비용 효율적이며 쉽게 만듭니다.

ImageNet-1K 분류에서 DINOv3는 동결된 특징으로 약 84.5%의 상위 1개 정확도를 달성했습니다. 이는 이전의 많은 자율 학습 모델 및 일부 감독된 기준선보다 더 높았습니다. ADE20K의 의미론적 분할에서 ViT-L 백본을 사용하여 약 63.0의 mIoU를 달성했습니다. 이러한 결과는 모델이 작업 특정 훈련 없이 미세한 공간 정보를 보존한다는 것을 보여줍니다.

COCO의 객체 감지에서 DINOv3는 동결된 특징으로 약 66.1의 mAP를 달성했습니다. 이는 복잡한 장면에서 객체를 식별하는 모델의 밀도 표현의 강점을 보여줍니다. 모델은 또한 깊이 추정에서 잘 수행되었습니다. 예를 들어, NYU-Depth V2에서 모델은 이전의 많은 감독된 및 자율 학습 방법보다 더 정확한 예측을 생성했습니다.

이러한 것 외에도 DINOv3는 세부 분류 및 분포 외부 테스트에서 강력한 결과를 보여주었습니다. 많은 경우에 모델은 이전의 자율 학습 모델 및 전통적인 감독된 훈련을 모두 능가했습니다.

실험 중에 명확한 이점은 전이 비용이 낮다는 것이었습니다. 대부분의 작업은 약간의 추가 훈련만으로 해결되었습니다. 이는 계산을 줄이고 배포 시간을 단축했습니다.

Meta AI와 다른 연구자들은 60개 이상의 벤치마크에서 DINOv3를 검증했습니다. 이러한 평가에는 분류, 분할, 감지, 깊이 추정, 검색 및 기하학적 매칭이 포함되었습니다. 이러한 광범위한 평가에서 모델은 일관되게 최첨단 또는 최첨단에 근접한 결과를 제공했습니다. 이는 모델이 다재다능하고 신뢰할 수 있는 시각적 인코더라는 역할을 확인합니다.

DINOv3가 컴퓨터 비전 워크플로우를 변환하는 방법

오래된 워크플로우에서는 팀이 많은 작업 특정 모델을 훈련해야 했습니다. 각 작업에는 자신의 데이터셋과 조정이 필요했습니다. 이는 비용과 유지 관리 노력을 모두 증가시켰습니다.

DINOv3와 함께 팀은 이제 단일 백본을 표준화할 수 있습니다. 동일한 동결 모델은 다양한 작업 특정 헤드를 지원합니다. 이는 사용 중인 기초 모델의 수를 줄이고 통합 파이프라인을 단순화하며 비전 기능의 릴리스 주기를 단축합니다.

개발자에게 DINOv3는 실제적인 자원을 제공합니다. Meta AI는 GitHub에서 체크포인트, 훈련 스크립트 및 모델 카드를 제공합니다. Hugging Face는 예제 노트북과 함께 蒸發된 변형을 호스팅합니다. 이러한 자원은 모델을 실제 프로젝트에서 실험하고 채택하는 것을 더 쉽게 만듭니다.

개발자가 이러한 자원을 사용하는 일반적인 방법은 특징 추출입니다. 동결된 DINOv3 모델은 다운스트림 작업에 입력으로 사용할 수 있는 임베딩을 제공합니다. 개발자는 затем 선형 헤드 또는 작은 어댑터를 특정 요구 사항을 해결하기 위해 연결할 수 있습니다. 추가적인 적응이 필요할 때 매개 변수 효율적인 방법, 즉 LoRA 또는 경량 어댑터를 사용하여 미세 조정을 수행할 수 있습니다.

蒸發된 변형은 이러한 워크플로우에서 필수적인 역할을 합니다. 더 작은 버전은 제한된 용량의 디바이스에서 실행할 수 있으며 더 큰 버전은 연구 랩 및 프로덕션 서버에 더 적합합니다. 이러한 범위는 팀이 빠르게 테스트를 시작하고 필요에 따라 더 요구 사항이 높은 설정으로 확장할 수 있도록 합니다.

DINOv3는 재사용 가능한 체크포인트, 간단한 훈련 헤드 및 확장 가능한 모델 크기를 결합하여 컴퓨터 비전 워크플로우를 재정의하고 있습니다. 이는 비용을 절감하고 훈련 주기를 단축하며 산업 전반에서 기초 모델의 사용을 더 실용적으로 만듭니다.

DINOv3의 도메인 특정 응용

DINOv3를 사용할 수 있는 여러 도메인이 있습니다:

의료 영상

의료 데이터는 종종 명확한 레이블이 없으며 전문가 주석은 시간이 오래 걸리고 비용이 많이 듭니다. DINOv3는 분할 및 방사선과 같은 작업에 잘 전이되는 밀도 특징을 생성하여 도움을 줄 수 있습니다. 예를 들어, 한 연구에서 저랭크 어댑터를 사용하여 DINOv3를 미세 조정하여 미토스 피규어 분류에서 0.8871의 균형된 정확도를 달성했습니다. 이는 제한된 레이블이 있는 데이터로도 높은 품질의 결과가 가능하다는 것을 보여주었습니다. 더 간단한 헤드는 이상 감지에 사용되어 대규모 레이블이 있는 임상 데이터셋의 필요성을 줄일 수 있습니다. 그러나 임상 배포에는 엄격한 검증이仍然 필요합니다.

위성 및 지리공간 영상

Meta는 약 4,930만 개의 위성 자르기를 포함하는 대규모 코퍼스에서 DINOv3 변형을 훈련했습니다. 이러한 모델은 캐니오피 높이 추정 및 분할 작업을 개선했습니다. 일부 경우에蒸發된 위성 ViT-L은 전체 7B 교사와 일치하거나 능가했습니다. 이는 도메인 특정 자율 학습의 가치를 확인했습니다. 유사하게, 실무자는 도메인 데이터에서 DINOv3를 사전 훈련하거나 蒸發된 변형을 미세 조정하여 원격 감지에서 레이블링 비용을 줄일 수 있습니다.

자율 주행 차량 및 로봇

DINOv3의 특징은 차량 및 로봇의 인식 모듈을 강화합니다. 다양한 날씨 및 조명 조건에서 감지 및 대응을 개선합니다. 연구에 따르면 DINOv3 백본은 시각 운동 정책 및 확산 컨트롤러를 지원하여 로봇 조작 작업에서 샘플 효율성 및 성공률을 향상시킵니다. 로봇 팀은 안전에 중요한 시스템에서는 주의 깊게 미세 조정하고 도메인 데이터를 결합하여 DINOv3를 사용할 수 있습니다.

소매 및 물류

비즈니스 환경에서 DINOv3는 품질 관리 및 시각적 재고 시스템을 지원할 수 있습니다. 이는 다양한 제품 라인 및 카메라 설정에 걸쳐 적응하여 제품당 재훈련의 필요성을 줄입니다. 이는 빠르게 움직이는 산업에서 시각적 환경이 다양할 때 실제로 유용합니다.

도전, 편향 및 앞으로의 길

7B 매개 변수의 규모로 비전 기초 모델, 즉 DINOv3를 훈련하는 것은 광범위한 컴퓨팅 자원을 필요로 합니다. 이는 전면 훈련을 몇 개의 잘 자금이 되는 조직으로 제한합니다. 蒸發은 추론 비용을 줄이고 더 작은 학생 모델을 배포할 수 있게 하지만 원래의 전면 훈련 비용을 제거하지는 않습니다. 이러한 이유로 대부분의 연구자 및 엔지니어는 공개적으로 출시된 체크포인트에 의존하는 것보다 모델을 처음부터 훈련하는 것을 선호하지 않습니다.

또 다른 중요한 도전은 데이터셋 편향입니다. 웹에서 수집된 대규모 이미지 컬렉션은 종종 지역적, 문화적 및 사회적 불균형을 반영합니다. 이러한 데이터셋에서 훈련된 모델은 이러한 편향을 물려받거나 심지어 증가시킬 수 있습니다. 동결된 백본을 사용하더라도 미세 조정은 다시 차이를 reintroduce할 수 있습니다. 따라서 데이터셋 감사, 공정성 확인 및 배포 전에 주의 깊은 평가가 필요합니다. 라이선스 및 출시 관행과 관련된 윤리적 문제도 중요합니다. 공개 모델은 책임 있는 채택을 지원하기 위해 명확한 사용 지침, 안전 주의 및 법적 위험 평가와 함께 제공되어야 합니다.

앞으로 나아가며 몇 가지 트렌드가 DINOv3 및 유사한 시스템의 역할을 형성할 것입니다. 첫째, 비전 및 언어를 연결하는 다중 모드 시스템은 이미지-텍스트 정렬을 개선하기 위해 강력한 인코더, 즉 DINOv3와 같은 인코더에 의존할 것입니다. 둘째, 에지 컴퓨팅 및 로봇은 더 작은 蒸發된 변형의 이점을 받을 것입니다. 이는 제한된 하드웨어에서 고급 인식을 가능하게 합니다. 셋째, 설명 가능한 AI는 더 중요해질 것입니다. 팀은 높은 위험 도메인의 감사, 디버깅 및 신뢰를 위해 밀도 특징을 더 해석 가능하게 만듭니다. 또한 진행 중인 연구는 분포 이동 및 적대적 입력에 대한 강건성의 향상을 계속해서 보장하여 실제 환경에서 신뢰할 수 있는 사용을 보장합니다.

결론

DINOv3의 동결된 특징은 잘 전이되므로 분류, 분할, 감지 및 깊이 추정과 같은 작업을 미세 조정 없이 지원할 수 있습니다.同時에 蒸發된 변형은 모델을 가벼운 디바이스와 강력한 서버 모두에서 실행할 수 있도록ufficient하게 만듭니다. 이러한 강점은 의료, 지리공간 모니터링, 로봇 및 소매와 같은 다양한 분야에서 실제적인 응용 분야를 가지고 있습니다.

그러나 사전 훈련에 필요한 많은 컴퓨팅 및 데이터셋 편향의 위험은 계속되는 도전입니다. 따라서 미래의 진행은 DINOv3의 능력을 조심스러운 검증, 공정성 모니터링 및 책임 있는 배포와 결합하여 연구 및 산업에서 신뢰할 수 있는 사용을 보장하는 데 달려 있습니다.

Dr. Assad Abbas, COMSATS University Islamabad, 파키스탄의 정교수는 North Dakota State University, USA에서 박사학위를 취득했습니다. 그의 연구는 클라우드, 포그, 에지 컴퓨팅, 빅데이터 분석, AI를 포함한 고급 기술에 중점을 두고 있습니다. Dr. Abbas는 유명한 과학 저널 및 컨퍼런스에 게재된 논문으로 상당한 기여를 했습니다. 그는 또한 MyFastingBuddy의 창립자입니다.