AI 모델 및 플랫폼

데이터2벡: 자율학습의 중요한 이정표

mm
Unite.AI를 Google의 선호 소스에 추가

기계 학습 모델은 전통적으로 레이블이 지정된 데이터에 크게 의존해 왔으며, 레이블이 지정된 데이터를 사용하여 모델을 훈련하면 정확한 결과가 나온다. 그러나 레이블이 지정된 데이터를 사용하는 주요 단점은 훈련 데이터의 크기가 증가함에 따라 레이블 지정 비용이 높아진다는 것이다. 높은 레이블 지정 비용은 개발자에게 큰 장벽이 되며, 특히大量의 훈련 데이터를 가진 큰 프로젝트에서 더욱 그렇다.

레이블 지정 문제를 해결하기 위해 개발자들은 SSL 또는 자율학습이라는 개념을 도입했다. 자율학습은 모델이 입력의 일부를 사용하여 입력의 다른 부분을 학습하는 기계 학습 과정이다. 자율학습 모델은 감독 신호를 사용하는 레이블이 지정된 데이터와 달리 데이터 간의 관계를 활용한다.

자율학습 외에도 레이블이 지정된 데이터를 사용하지 않고 기계 학습 모델을 훈련하는 다른 방법과 모델이 있다. 그러나 이러한 방법에는 두 가지 주요 문제가 있다.

  1. 이미지나 텍스트와 같은 단일 모달리티에 특화되어 있다.
  2. 大量의 계산 능력이 필요하다.

이러한 제한은 평균적인 인간의 마음이 단일 유형의 데이터에서 훨씬 더 효과적으로 학습할 수 있는 반면, 이미지, 텍스트, 음성과 같은 다양한 모달리티를 구별하기 위해 별도의 모델과 훈련 데이터를 사용하는 AI 모델이 있는 주요 이유이다.

단일 모달리티 문제를 해결하기 위해 메타 AI는 데이터2벡, 최초의 자율학습 고성능 알고리즘을 출시했다. 이 알고리즘은 이미지, 텍스트, 음성의 세 가지 다른 모달리티에서 패턴 정보를 학습하는 것을 목표로 한다. 데이터2벡 알고리즘을 구현하면 텍스트 이해를 이미지 분할 문제에 적용하거나 음성 인식 작업에 배포할 수 있다.

이 기사에서는 데이터2벡 모델에 대해 자세히 설명할 것이다. 모델의 방법 개요, 관련 연구, 아키텍처, 결과에 대해 자세히 논의하여 데이터2벡 알고리즘에 대한 명확한 이해를 제공할 것이다.

데이터2벡 소개: 핵심 아이디어

자율학습의 기본 개념은 모달리티 전체에 적용되지만, 실제 목표와 알고리즘은 단일 모달리티에 대해 설계되었기 때문에 서로 다르다. 단일 모달리티에 대한 모델을 설계하는 것이 동일한 자율학습 알고리즘이 다른 유형의 훈련 데이터에서 효과적으로 작동하지 않는 이유이다.

단일 모달리티 모델과 알고리즘의 도전을 극복하기 위해 메타 AI는 데이터2벡을 출시했다. 이는 컴퓨터 비전, NLP 또는 음성에 대해 동일한 학습 방법론을 사용하는 알고리즘이다.

데이터2벡 알고리즘의 핵심 아이디어는 표준 트랜스포머 아키텍처를 사용하여 입력 데이터의 마스킹된 뷰를 예측하여 입력 데이터의 잠재적 표현을 예측하는 것이다. 즉, 이미지, 텍스트 또는 음성과 같은 지역적인 모달리티 특정 객체 대신 데이터2벡 알고리즘은 전체 훈련 또는 입력 데이터의 정보를 포함하는 잠재적 표현을 예측한다.

AI 산업이 데이터2벡 알고리즘을 필요로 하는 이유

자율학습 모델은 인간이 주석을 단 레이블을 사용하여 훈련 데이터의 표현을 구축하며, 이는 NLP 및 컴퓨터 비전 기술의 발전에 큰 역할을 한다. 이러한 자율학습 표현은 음성 인식 및 기계 학습과 같은 작업에서 무감독 학습을 사용하는 이유이다.

지금까지 이러한 자율학습 알고리즘은 개별 모달리티에 초점을 맞추고 있으며, 이는 학습 편향과 모델의 특정 디자인을 초래한다. 개별 모달리티의 자율학습 알고리즘은 컴퓨터 비전 및 NLP를 포함한 다양한 AI 응용에서 도전을 제기한다.

예를 들어, 음성 처리에서 음성 단위의 어휘가 존재하며, 이는 NLP에서 자율학습 작업을 정의할 수 있다. 마찬가지로 컴퓨터 비전에서 개발자는 입력을 회귀시키거나, 이산 시각 토큰을 학습하거나, 데이터 증강에 대한 표현을 학습할 수 있다. 이러한 학습 편향은 유용하지만, 다른 모달리티에 일반화할 수 있는지 확인하기 어렵다.

데이터2벡 알고리즘은 자율학습 산업에서 중요한 이정표이며, 단일 모달리티가 아닌 여러 모달리티를 개선하는 것을 목표로 한다. 또한 데이터2벡 알고리즘은 입력을 재구성하거나 대조적 학습에 의존하지 않는다.

따라서 데이터2벡이 필요한 이유는 데이터2벡 알고리즘이 AI의 발전을 가속화하고, 주변 환경의 다양한 측면을 무리없이 학습할 수 있는 AI 및 ML 모델을 개발하는 데 기여할 수 있기 때문이다. 과학자들은 데이터2벡 알고리즘이 현재의 AI 모델이 수행할 수 있는 것보다 훨씬 더 고급 작업을 수행할 수 있는 더 적응性 있는 AI 및 ML 모델을 개발할 수 있도록 할 것이라고 기대한다.

데이터2벡 알고리즘

데이터2벡은 이미지, 음성, 텍스트와 같은 다양한 데이터 모달리티에서 자율학습을 구현하는 것을 목표로 하는 통일된 프레임워크이다.

데이터2벡 알고리즘은 일반적인 패턴을 더 잘 학습할 수 있는 ML 모델을 개발하는 것을 목표로 하며, 이를 위해 다양한 모달리티에서 학습 목표를 균일하게 유지한다. 데이터2벡 모델은 학습 알고리즘을 통일하지만, 각 모달리티에 대한 표현을 개별적으로 학습한다.

데이터2벡 알고리즘의 도입으로 메타 AI는 멀티모달 학습을 효과적이고 더 간단하게 만들 수 있기를 희망한다.

데이터2벡 알고리즘의 작동 방식

데이터2벡 알고리즘은 잠재적 표현을 예측하는 것을 목표로 하며, 이는 마스킹된 입력 뷰를 사용하여 수행된다. 모델은 표준 트랜스포머 네트워크를 훈련하며, 이는 교사 또는 학생 모드에서 사용된다.

교사 모드에서 모델은 입력 데이터의 표현을 구축하며, 이는 학습 작업에서 목표로 사용된다. 학생 모드에서 모델은 마스킹된 입력 데이터의 编码을 수행하며, 이는 전체 데이터의 표현을 예측하는 데 사용된다.

위의 그림은 데이터2벡 모델이 다양한 모달리티에서 동일한 학습 프로세스를 사용하는 것을 나타낸다. 첫 번째 단계에서 모델은 입력 데이터의 표현을 생성한다(교사 모드). 모델은 затем 마스킹된 입력 뷰를 사용하여 이러한 표현을 회귀한다.

또한 데이터2벡 알고리즘은 입력 데이터의 잠재적 표현을 사용하므로, 입력을 정규화하거나 고정된 시각 토큰 집합을 학습하는 것과 같은 모달리티 특정 디자인의 단순화된 버전으로 볼 수 있다. 그러나 데이터2벡과 다른 알고리즘 간의 핵심 차이점은 데이터2벡 알고리즘이 목표 표현을 컨텍스트화하고 연속적으로 만드는 데 자기 주의를 사용한다는 것이다. 다른 자율학습 모델은 지역적 컨텍스트를 기반으로 하는 고정된 목표 집합을 사용한다.

데이터2벡: 모델 방법

데이터2벡 모델은 부분적인 입력 뷰를 사용하여 입력 데이터의 모델 표현을 예측하는 것을 목표로 하며, 이는 마스킹된 입력 샘플을 사용하여 수행된다. 아래 그림에서 볼 수 있듯이, 개의 얼굴은 마스킹되어 있으며, 특정 음성 노트 섹션이 마스킹되어 있으며, 텍스트에서 “with”라는 단어가 마스킹되어 있다.

모델은 먼저 마스킹된 훈련 샘플(학생 모드)을 인코딩하며, 모델은 동일한 모델이지만 파라미터화된 교사 모드에서 입력의 비마스킹된 버전을 인코딩하여 훈련 목표를 생성한다. 또한 목표 표현은 훈련 샘플에 있는 정보를 인코딩하며, 학생 모드에서 학습 작업은 부분적인 입력 뷰가 주어졌을 때 이러한 표현을 예측하는 데 사용된다.

모델 아키텍처

데이터2벡 모델은 표준 트랜스포머 아키텍처를 사용하며, 이는 입력 데이터의 모달리티 특정 인코딩을 사용한다. 컴퓨터 비전과 관련된 작업에서는 모델이 16×16 픽셀의 패치로 이미지를 인코딩하며, 각 패치는 선형 변환을 통해 처리된다.

さらに, 음성 인식과 관련된 데이터에서는 모델이 16 kHz의 파형을 입력으로 사용하며, 이는 특징 인코더를 통해 처리되며, 512개의 채널, 너비(10, 3, 3, 3, 3, 2, 2), 스트라이드(5, 2, 2, 2, 2, 2, 2)를 갖는 시간적 컨볼루션을 포함한다.

마스킹

모델이 입력 데이터를 토큰 시퀀스로 인코딩한 후, 모델은 일부 단위를 마스킹함으로써 이를 대체하며, 이는 임베딩 토큰을 사용하여 수행된다. 그런 다음 시퀀스를 트랜스포머 네트워크에 공급한다. 컴퓨터 비전의 경우 모델은 블록별 마스킹 전략을 사용한다. 잠재적 음성 표현은 음성 데이터의 구간을 마스킹하는 데 사용되며, 언어 관련 작업에서는 토큰이 마스킹된다.

훈련 목표

데이터2벡 모델은 마스킹된 샘플의 인코딩을 기반으로 비마스킹된 훈련 샘플의 모델 표현을 예측하는 것을 목표로 한다. 모델은 마스킹된 시간 단계에 대해서만 표현을 예측한다.

모델은 컨텍스트화된 표현을 예측하며, 이는 특정 시간 단계를 인코딩할 뿐만 아니라 샘플의 다른 정보를 также 인코딩한다. 이는 트랜스포머 네트워크에서 자기 주의를 사용하기 때문이다. 컨텍스트화된 표현과 트랜스포머 네트워크의 사용은 데이터2벡 모델을 기존의 BERT, wav2vec, BEiT, SimMIM, MAE, MaskFeat 모델과 구별한다. 이러한 모델은 컨텍스트 정보를 사용하지 않고 목표를 예측한다.

다음은 데이터2벡 모델이 교사 모드를 파라미터화하여 네트워크 표현을 예측하는 방법이다. 이는 목표로 사용된다.

교사 파라미터화

데이터2벡 모델은 비마스킹된 훈련 샘플의 인코딩을 EMA(지수 이동 평균)를 사용하여 파라미터화한다. 여기서 모델의 가중치는 θ이며, 목표 모드의 가중치는 이다.

                                           ∆ ← τ∆ + (1 − τ ) θ

 

さらに, 모델은 τ를 스케줄링하며, 이는 τ0에서 τe(목표 값)까지 선형적으로 증가하며, 이는 첫 번째 τn 업데이트에서 수행된다. 이후 업데이트에서는 값을 일정하게 유지한다.

교사 모델이 업데이트되는 빈도는 초기에 더 자주 업데이트되며, 모델이 무작위로 초기화된 경우에 더 자주 업데이트된다. 훈련이 진행되고 좋은 파라미터가 학습되면 교사가 덜 자주 업데이트된다.

목표

훈련 목표의 생성은 교사 네트워크의 상위 K블록의 출력에 의존한다. 이는 학생 모드에서 마스킹된 시간 단계에 해당한다. 블록 l의 출력은 시간 단계 t에서 alt로 표시된다. 모델은 각 블록에 대해 정규화를 적용하여 alt를 얻은 후, 상위 K블록을 평균화하여 시간 단계 t의 훈련 목표 yt를 얻는다.

  

 

이것은 학생 모드에서 회귀하는 훈련 목표를 생성한다. 초기 실험에서 데이터2벡 모델은 각 블록을 개별적으로 예측하는 데 전용 투영을 사용하여 훨씬 더 효율적이었으며, 이는 더 효율적이었다.

さらに, 목표를 정규화하면 데이터2벡 모델이 상수 표현으로 붕괴하는 것을 방지하며, 높은 정규화를 가진 레이어가 목표 데이터셋의 특징을 지배하는 것을 방지한다. 음성 인식의 경우 모델은 현재 입력 샘플에 대해 학습된 파라미터가 없는 인스턴스 정규화를 사용한다. 이는 입력 샘플의 스트라이드가 작기 때문에 인접한 표현이 고도로 상관되기 때문이다.

또한, 연구자들은 컴퓨터 비전 및 NLP에서 매개변수 없는 정규화가 충분히 잘 작동한다는 것을 발견했다. 그러나 위에서 언급한 전략은 추가 매개변수가 필요하지 않으며 충분히 잘 작동한다.

목적

컨텍스트화된 훈련 목표 yt에 대해, 모델은 스무스 L1 손실을 사용하여 목표를 회귀한다.

여기서 β는 모델 예측 ft(x)와 시간 단계 t에서의 간격 크기에 따라 제어된다. 이 손실의 이점은 아웃라이어에 상대적으로 덜 민감하며, β의 설정을 조정할 필요가 없다.

실험 설정

데이터2벡 모델은 두 가지 모델 크기에서 실험된다: 데이터2벡 라지데이터2벡 베이스. 수치적 안정성을 위해 EMA 업데이트는 fp32에서 수행되며, 모델은 L=12 또는 L=24 트랜스포머 블록을 포함하며, 숨겨진 차원(H)은 768 또는 H=1024이다.

다음은 다양한 모달리티와 목적을 위한 실험 설정에 대한 자세한 설명이다.

컴퓨터 비전

데이터2벡 모델은 224×224 픽셀의 이미지를 16×16 픽셀의 패치로 인코딩하며, 각 패치는 선형적으로 변환된다. 이는 196개의 표현을 포함하는 시퀀스를 트랜스포머에 공급한다.

모델은 BEiT를 따르며, 인접한 패치가 있는 블록을 마스킹한다. 각 블록에는 최소 16개의 패치가 있으며, 무작위의 종횡비가 있다. 그러나 원래 BEiT 모델에서 40%의 패치를 마스킹한 것과 달리, 데이터2벡 모델은 60%의 패치를 마스킹하여 더 나은 정확도를 얻는다.

さらに, 모델은 이미지 크롭을 무작위로 조정하고, 수평 플립 및 색조 변화를 적용한다. 마지막으로, 데이터2벡 모델은 교사 모드와 학생 모드에서 동일한 수정된 이미지를 사용한다.

ViT-B 모델은 800 에포크 동안 사전 훈련되며, 데이터2벡 모델은 ViT-L 모델의 경우 8,192의 배치 크기와 ViT-B 모델의 경우 2,048의 배치 크기를 사용한다. 데이터2벡 모델은 또한 코사인과 아담 스케줄을 사용하여 학습률을 0.001까지 80 에포크 동안 ViT-L의 경우와 40 에포크 동안 ViT-B의 경우에 걸쳐서 온도를 올린다.

ViT-B와 ViT-L 모두에서 데이터2벡 모델은 β = 2, K = 6τ = 0.9998를 사용하며, 이는 스케줄 없이 일정하다. 모델은 또한 0.2의 스토캐스틱 깊이 비율을 사용한다.

さらに, ViT-L의 경우 모델은 1,600 에포크 동안 훈련되며, 처음 800 에포크는 학습률이 0.9998이고, 이후에 학습률 스케줄을 재설정하고, 마지막 800 에포크는 학습률이 0.9999인 채로 계속한다.

이미지 분류를 위해 모델은 마지막 트랜스포머 블록의 출력의 평균을 사용하며, 이를 소프트맥스 정규화된 분류기에 공급한다. 모델은 затем ViT-L을 50 에포크 동안 및 ViT-B를 100 에포크 동안 코사인 및 아담을 사용하여 온도를 올리며, 학습률을 조정한다.

음성 처리

음성 처리를 위해 데이터2벡 모델은 Fairseq를 사용한다. 이는 사용자 지정 모델을 요약, 번역 및 텍스트 생성을 위해 훈련하는 시퀀스 모델링 키트이다. 모델은 16 kHz의 파형을 입력으로 사용하며, 이를 특징 인코더를 통해 처리한다.

위의 결과는 출력 频率가 50Hz이고, 각 샘플 사이의 스트라이드가 20ms인 특징 인코더를 생성한다. 수신 필드는 400개의 입력 샘플 또는 25ms의 오디오를 포함한다.

인코더에 공급되는 원시 파형은 단위 분산 및 영 평균으로 정규화된다.

데이터2벡의 베이스 모델을 위한 마스킹 전략은 Baevski 프레임워크에서 자율학습 음성 인식에서 사용되는 것과 유사하다. 모델은 p = 0.065를 모든 시간 단계에서 시작 인덱스로 샘플링하며, 다음 10개의 시간 단계를 마스킹한다. 일반적인 훈련 시퀀스의 경우, 이 프로세스는 거의 49%의 총 시간 단계를 마스킹한다.

훈련 중에 데이터2벡 모델은 τo = 0.999, τe = 0.9999, τn = 30,000를 사용하여 τ를 선형적으로 어닌다. 데이터2벡 모델은 아담 최적화를 사용하며, 베이스 모델의 피크 학습률은 5×10^-4이다. 또한, 베이스 모델은 3단계 스케줄러를 사용하며, 이는 학습률을 첫 번째 3%의 업데이트에서 선형적으로 올린 후, 다음 90%에서 유지하며, 나머지 7%에서 선형적으로 감소시킨다.

자연어 처리

데이터2벡 모델은 50K 유형의 바이트 페어 인코딩을 사용하여 입력을 토큰화하며, 모델은 각 유형에 대한 임베딩을 학습한다. 데이터가 인코딩된 후, 모델은 15%의 토큰을 무작위로 선택하여 마스킹하며, 이는 80%는 학습된 마스크 토큰으로, 10%는 무작위로 선택된 어휘 토큰으로, 나머지 10%는 변경되지 않는다.

사전 훈련 중에 모델은 τo = 0.999, τe = 0.9999, τn = 100,000, K = 10, β = 4를 사용한다. 모델은 아담 최적화를 사용하며, 이는 학습률을 첫 번째 5%의 업데이트에서 선형적으로 올린 후, 다음 80%에서 유지하며, 나머지 15%에서 선형적으로 감소시킨다. 피크 학습률은 2×10^-4이다.

さらに, 모델은 16개의 GPU에서 훈련되며, 각 시퀀스는 약 512개의 토큰을 포함한다. 하위 작업을 위해 모델은 4개의 다른 학습률에서 사전 훈련된다: 1×10^-4, 2×10^-4, 3×10^-4, 4×10^-4. 가장 잘 수행되는 것이 선택되어 추가적인 NLP 하위 작업을 위해 사용된다.

결과

다음은 데이터2벡 모델이 다양한 모달리티에서 위에서 논의한 전략을 구현할 때의 성능이다.

컴퓨터 비전

컴퓨터 비전을 평가하기 위해 데이터2벡 모델은 이미지넷-1K 데이터셋에서 사전 훈련된다. 결과 모델은 동일한 벤치마크의 레이블이 지정된 데이터를 사용하여 미세 조정된다. 표준적인 관행에 따라 모델은 검증 데이터에서 최상위 1 정확도로 평가된다.

결과는 단일 자율학습 모델과 별도의 시각적 토큰화기를 추가 데이터에서 훈련하거나 다른 자율학습 모델과 비교하여 구분된다.

다음 표는 데이터2벡 모델의 컴퓨터 비전 성능을 다른 기존 모델과 비교한다: ViT-L 및 ViT-B.

위의 표에서 결과를 요약하면 다음과 같다.

  • 데이터2벡 모델은 단일 모델 설정에서 ViT-L 및 ViT-B 모델 모두에서 이전 작업을 능가한다.
  • 데이터2벡 알고리즘에서 사용되는 마스킹된 예측 설정은 지역적 목표를 예측하는 것과 비교하여 더 나은 성능을 제공한다.
  • 데이터2벡 모델은 또한 두 개의 다른 증강된 이미지 버전을 입력으로 사용하여 학생 네트워크의 최종 레이어를 회귀하는 자율학습 방법을 능가한다.

오디오 및 음성 처리

음성 및 오디오 처리를 위해 데이터2벡 모델은 약 960시간의 오디오 데이터를 포함하는 리브리스피치(LS-960) 데이터셋에서 훈련된다. 데이터셋은 영어 오디오북에서 깨끗한 음성 오디오를 포함하며, 이는 음성 및 오디오 처리 산업에서 표준 벤치마크이다.

다양한 리소스 설정에서 모델의 성능을 분석하기 위해 연구자들은 데이터2벡 모델을 미세 조정하여 자동 음성 인식에 대한 레이블이 지정된 데이터(수분에서 수시간까지)를 사용한다. 모델의 성능을 분석하기 위해 데이터2벡은 HuBERTwav2vec 2.0와 비교된다. 이는 음성 및 오디오 표현 학습에 의존하는 두 가지 인기 있는 알고리즘이다.

위의 표는 데이터2벡의 음성 인식 성능을 다른 기존 모델과 비교한다.

  • 데이터2벡 모델은 대부분의 레이블이 지정된 데이터 설정에서 개선된 성능을 제공한다.
  • 대형 모델의 경우 데이터2벡 모델은 작은 레이블이 지정된 데이터셋에서 훨씬 더 나은 성능을 제공하며, 100시간 이상의 레이블이 지정된 데이터셋에서는 성능이 비교적 같다.
  • 분석한 결과, 데이터2벡이 사용하는 풍부한 컨텍스트화된 목표를 사용하여 이산 단위를 학습할 필요가 없다는 것을 알 수 있다.
  • 컨텍스트화된 목표를 훈련하는 것은 전체 성능을 크게 향상시킨다.

さらに, 데이터2벡의 접근 방식을 음성 인식에 대해 검증하기 위해 모델은 오디오셋 벤치마크에서 훈련된다. 오디오셋의 사전 훈련 설정은 리브리스피치와 유사하지만, 모델은 K = 12 및 200,000 업데이트에서 훈련되며, 배치 크기는 94.5분이다.

모델은 딥노름 프레임워크와 레이어 노멀라이제이션을 목표에 적용하여 훈련을 안정화하는 데 도움이 된다. 또한, 모델은 21.3분의 배치 크기로 13,000 업데이트에서 균형 있는 하위 집합에서 미세 조정된다. 모델은 선형 소프트맥스 풀링 및 확률 0.7의 믹스업을 사용한다. 모델은 527개의 고유한 오디오 클래스로의 단일 선형 투영을 추가하며, 투영 학습률2e-4로 설정된다.

さらに, 사전 훈련된 파라미터는 3e-5의 학습률을 가지며, 모델은 데이터셋을 미세 조정하는 데 마스킹 기술을 사용한다. 다음 표는 결과를 요약한다.

자연어 처리

데이터2벡 모델의 텍스트 성능을 분석하기 위해 모델은 GLUE 또는 일반 언어 이해 평가 벤치마크와 같은 텍스트에서 훈련된다. 이는 자연어 추론(다중 장르 자연어 추론), 문장 유사성(쿼라 질문 페어 벤치마크, 마이크로소프트 연구 단락 코퍼스, 의미적 텍스트 유사성 벤치마크), 감정 분석(스탠퍼드 감정 트리뱅크), 및 문법(콜라)을 포함한다.

さらに, 모델은 각 작업에서 제공되는 레이블이 지정된 데이터를 사용하여 미세 조정되며, 개발 세트에서 평균 정확도를 보고한다. 다음 표는 데이터2벡 모델의 자연어 처리 작업 성능을 요약하며, 다른 모델과 비교한다.

  • 위의 데이터는 데이터2벡 모델이 랜덤한 목표를 사용하지 않는다는 전략으로 인해 베이스라인 RoBERTa 모델을 능가한다는 것을 보여준다.
  • 데이터2벡 모델은 처음으로 성공적인 사전 훈련된 NLP 모델이며, 이는 문자, 단어 또는 하위 단어와 같은 이산 단위를 훈련 목표로 사용하지 않는다. 대신, 데이터2벡 프레임워크는 전체 비마스킹된 텍스트 시퀀스에 대한 컨텍스트화된 잠재적 표현을 예측한다.
  • 이는 모델이 특정 속성을 갖는 목표를 예측하도록 요구하는 학습 작업을 생성하며, 이는 텍스트의 각 단위에 대한 일반적인 표현을 예측하는 것과는 다르다.
  • さらに, 목표 집합은 고정되어 있지 않으며, 모델은 새로운 목표를 정의할 수 있으며, 이는 열린 어휘 설정이다.

데이터2벡: 절단 연구

절단은 AI 및 ML 시스템에서 구성 요소를 제거하는 것을 의미한다. 절단 연구는 모델의 성능을 조사하는 데 사용되며, 이는 모델에서 특정 구성 요소를 제거하여 수행된다. 이는 제거된 구성 요소가 전체 시스템에 기여하는 것을 이해하는 데 도움이 된다.

레이어 평균 목표

데이터2벡과 다른 자율학습 모델之间의 주요 차이점은 데이터2벡 모델이 교사 네트워크의 여러 레이어를 평균화하여 목표를 생성한다는 것이다. 이는 wav2vec 2.0 모델의 상위 레이어가 하위 레이어와 비교하여 다운스트림 작업에서 더 나쁨을 보여준的事実에서 비롯된다.

다음 실험에서 모든 모달리티의 성능이 측정되며, 이는 K = 1, 2, …, 12 레이어를 평균화하여 수행된다. 여기서 K = 1은 최상위 레이어만을 예측한다. 그러나 데이터2벡은 12개의 레이어를 포함하는 베이스 모델을 훈련하며, 이는 더 빠른 반전 시간을 제공한다.

위의 그림은 여러 레이어를 기반으로 하는 목표가 일반적으로 모든 모달리티에서 K = 1을 사용하는 것보다 더 나은 성능을 제공한다는 것을 보여준다. 모든 사용 가능한 레이어를 사용하는 것은 좋은 관행이다. 이는 신경망이 여러 유형의 특징을 구축하며, 이러한 특징은 여러 레이어에서 추출되기 때문이다.

여러 레이어에서 특징을 사용하면 정확도를 향상시키고, 자율학습 프로세스를 강화하는 데 도움이 된다.

목표 특징 유형

데이터2벡 모델의 트랜스포머 블록에는 목표로 사용할 수 있는 여러 레이어가 있다. 다른 레이어가 성능에 미치는 영향을 분석하기 위해 모델은 리브리스피치의 음성 모델에서 다른 레이어를 목표 특징으로 사용한다.

다음 그림은 피드 포워드 네트워크 또는 FFN의 출력이 이상적으로 작동하는 반면, 자기 주의 블록의 출력은 사용할 수 없는 모델을 생성한다는 것을 명확하게 나타낸다.

목표 컨텍스트화

데이터2벡 모델의 교사 표현은 전체 입력에 대한 자기 주의를 사용하여 컨텍스트화된 목표를 생성한다. 이는 데이터2벡을 다른 자율학습 모델과 구별하며, 이는 입력의 지역적 부분을 재구성하거나 예측하여 학습 작업을 생성한다.

이것은 데이터2벡 모델이 잘 작동하기 위해 컨텍스트화된 목표가 필요한지에 대한 질문을 제기한다.

이 질문에 답하기 위해 연구자들은 목표 표현을 생성하는 교사 자기 주의를 제한하여, 교사가 입력의 일부만 액세스할 수 있도록 한다. 모델이 훈련된 후, 모델은 전체 컨텍스트 크기에 액세스하도록 미세 조정된다.

다음 그림은 더 큰 컨텍스트 크기가 일반적으로 더 나은 성능을 제공하며, 입력 샘플 전체가可視화되면 가장 좋은 정확도를 제공한다는 것을 보여준다. 이는 더 풍부한 목표 표현이 더 나은 성능을 제공할 수 있다는 것을 입증한다.

모달리티 특정 피처 추출기 및 마스킹

데이터2벡의 주요 목표는 다양한 모달리티에서 작동할 수 있는 단순한 학습 메커니즘을 설계하는 것이다. 이는 현재 모델과 프레임워크가 통일된 학습 체제를 갖추고 있지만, 여전히 모달리티 특정 마스킹 및 피처 추출기를 사용하기 때문이다.

이것은 주로 입력 데이터의 특성이 서로 크게 다르기 때문에 대부분의 프레임워크가 단일 모달리티와 함께 작동한다는 事実에 의한 것이다. 예를 들어, 음성 인식 모델은 높은 해상도 입력(예: 10 kHz 파형)을 사용하며, 이는 수천 개의 샘플을 포함한다. 파형은 이후 멀티 레이어 컨볼루션 네트워크를 통해 처리되어 50 Hz의 피처 시퀀스를 생성한다.

구조화된 및 컨텍스트화된 목표

데이터2벡과 다른 마스킹된 예측 모델之间의 주요 차이점은 데이터2벡 모델에서 훈련 목표의 특징이 컨텍스트화되어 있다는 것이다. 이는 교사 모드에서 전체 마스킹된 입력에 대한 자기 주의를 사용하여 구축된다.

다른 프레임워크인 BYOL(Bootstrap Your Own Latent) 또는 DINO도 데이터2벡과 유사한 잠재적 표현을 사용하지만, 그들의 주요 초점은 변환 불변 표현을 학습하는 것이다.

최종 생각

최근의 연구는 통일된 모델 아키텍처가 여러 모달리티를 다루는 효과적인 접근 방식일 수 있음을 시사한다. 데이터2벡 모델은 음성, 이미지 및 언어의 세 가지 모달리티에서 작동하는 자율학습 접근 방식을 사용한다.

데이터2벡 모델의 핵심 개념은 부분적인 입력 뷰를 사용하여 입력 데이터를 회귀하는 것이다. 데이터2벡 프레임워크에서 사용되는 접근 방식은 효과적이며, 모델은 이전의 자율학습 모델보다 이미지넷-1K 데이터셋에서 ViT-B 및 ViT-L 단일 모델 모두에서 더 나은 성능을 제공한다.

데이터2벡은 자율학습 산업에서 중요한 이정표이며, 여러 모달리티를 학습하는 단일 학습 방법이 모달리티 간에 모델을 더 쉽게 학습할 수 있도록 할 수 있음을 보여준다.

전문직으로서의 엔지니어, 마음으로서의 작가입니다. Kunal은 AI와 ML에 대한 깊은 사랑과 이해를 가진 기술 작가로, 이러한 분야의 복잡한 개념을 흥미롭고 정보적인 문서를 통해 단순화하는데 헌신하고 있습니다.