AI-modellen en platforms

data2vec: een mijlpaal in zelfsupervisioned leren

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Machinaal leren-modellen zijn sterk afhankelijk van gelabelde gegevens voor training, en traditioneel gezien levert training van modellen op gelabelde gegevens nauwkeurige resultaten op. Echter, het belangrijkste nadeel van het gebruik van gelabelde gegevens is de hoge annotatiekosten die stijgen met een toename van de grootte van de trainingsgegevens. Hoge annotatiekosten vormen een grote hindernis voor ontwikkelaars, vooral wanneer ze werken aan een groot project met een aanzienlijke hoeveelheid trainingsgegevens.

Om het annotatieprobleem aan te pakken, bedachten ontwikkelaars het concept van SSL of Zelfsupervisioned Leren. Zelfsupervisioned Leren is een machinaal leren-proces waarbij het model zichzelf traint om een deel van de invoer te leren van een ander deel van de invoer. Een Zelfsupervisioned Leren-model heeft als doel de relatie tussen de gegevens te benutten in plaats van gebruik te maken van gelabelde gegevens met gesuperviseerde signalen.

Naast Zelfsupervisioned Leren zijn er verschillende andere methoden en modellen om machinaal leren-modellen te trainen zonder het gebruik van gelabelde gegevens. Echter, de meeste van deze methoden hebben twee grote problemen

  1. Ze zijn vaak gespecialiseerd voor een enkele modaliteit, zoals een afbeelding of tekst.
  2. Ze vereisen een grote hoeveelheid rekenkracht.

Deze beperkingen vormen een groot probleem waarom een gemiddeld menselijk brein in staat is om veel effectiever te leren van een enkel type gegevens in vergelijking met een AI-model dat afhankelijk is van separate modellen en trainingsgegevens om onderscheid te maken tussen een afbeelding, tekst en spraak.

Om het probleem van enkele modaliteit aan te pakken, heeft Meta AI de data2vec, de eerste van zijn soort, zelfsupervisioned high-performance algoritme, uitgebracht om patroneninformatie te leren van drie verschillende modaliteiten: afbeeldingen, tekst en spraak. Met de implementatie van het data2vec-algoritme kunnen tekstbegrip worden toegepast op een afbeeldingssegmentatieprobleem of het kan ook worden ingezet in een spraakherkenningstaak.

In dit artikel zullen we dieper ingaan op het data2vec-model. We zullen de methode-overzicht, gerelateerde werk, architectuur en resultaten van het model bespreken zodat u een duidelijk begrip heeft van het data2vec-algoritme.

data2vec Inleiding: Het Kernidee

Hoewel het fundamentele concept van Zelfsupervisioned Leren wordt toegepast over modaliteiten, verschillen de werkelijke doelstellingen en algoritmen van elkaar omdat ze zijn ontworpen met betrekking tot een enkele modaliteit. Het ontwerpen van een model voor een enkele modaliteit is de reden waarom hetzelfde zelfsupervisioned leren-algoritme niet effectief kan werken over verschillende soorten trainingsgegevens.

Om de uitdaging die wordt gepresenteerd door modellen en algoritmen voor enkele modaliteiten aan te pakken, heeft Meta AI de data2vec uitgebracht, een algoritme dat hetzelfde leerproces gebruikt voor computer visie, NLP of spraak.

Het kernidee achter het data2vec-algoritme is om de gemaskeerde weergave van de invoer te gebruiken om latent representations van de volledige invoergegevens te voorspellen in een zelfdistillatie-opstelling met behulp van standaard Transformer-architectuur. Dus, in plaats van modality-specifieke objecten zoals afbeeldingen, tekst of spraak die lokaal van aard zijn, voorspelt het data2vec-algoritme latent representations met informatie uit de volledige trainings- of invoergegevens.

Waarom Heeft de AI-Industrie het data2Vec-Algoritme Nodig?

Zelfsupervisioned Leren-modellen bouwen representaties van de trainingsgegevens op met behulp van door de mens geannoteerde labels, en het is een van de belangrijkste redenen achter de vooruitgang van de NLP of Natuurlijke Taalverwerking en de Computer Visie-technologie. Deze zelfsupervisioned leren-representaties zijn de reden waarom taken zoals spraakherkenning en machinaal leren ongezien leren in hun modellen gebruiken.

Tot nu toe zijn deze zelfsupervisioned leren-algoritmen gericht op individuele modaliteiten, wat resulteert in leerbiases en specifieke ontwerpen in de modellen. De individuele modaliteit van zelfsupervisioned leren-algoritmen creëert uitdagingen in verschillende AI-toepassingen, waaronder computer visie en NLP.

Bijvoorbeeld, zijn er vocabulaires van spraakeenheden in spraakverwerking die een zelfsupervisioned leren-taak in NLP kunnen definiëren. Vergelijkbaar, in computer visie, kunnen ontwikkelaars ofwel de invoer regresseren, discrete visuele tokens leren of representaties leren die invariant zijn voor gegevensaugmentatie. Hoewel deze leerbiases handig zijn, is het moeilijk om te bevestigen of deze biases zullen generaliseren naar andere modaliteiten.

Het data2vec-algoritme is een belangrijke mijlpaal in de zelfsupervisioned leren-industrie omdat het gericht is op het verbeteren van meerdere modaliteiten in plaats van slechts één. Bovendien is het data2vec-algoritme niet afhankelijk van het reconstrueren van de invoer of contrastief leren.

Dus, de reden waarom de wereld data2vec nodig heeft, is omdat het data2vec-algoritme het potentieel heeft om vooruitgang in AI te versnellen en bij te dragen aan de ontwikkeling van AI-modellen die kunnen leren over verschillende aspecten van hun omgeving naadloos. Wetenschappers hopen dat het data2vec-algoritme hen in staat zal stellen om meer aanpasbare AI- en ML-modellen te ontwikkelen die in staat zijn om zeer geavanceerde taken uit te voeren die verder gaan dan wat de huidige AI-modellen kunnen doen.

Wat is het data2Vec-Algoritme?

Het data2vec is een uniform kader dat gericht is op het implementeren van zelfsupervisioned machinaal leren over verschillende gegevensmodaliteiten, waaronder afbeeldingen, spraak en tekst.

Het data2vec-algoritme is gericht op het ontwikkelen van ML-modellen die de algemene patronen in de omgeving beter kunnen leren door het leerdoel uniform te houden over verschillende modaliteiten. Het data2vec-model uniformeert het leer-algoritme, maar het leert nog steeds representaties voor elke modaliteit afzonderlijk.

Met de introductie van het data2vec-algoritme, hoopt Meta AI dat het multimodaal leren effectief en veel eenvoudiger zal maken.

Hoe Werkt het data2Vec-Algoritme?

Het data2vec-algoritme combineert het leren van latent doelrepresentaties met gemaskeerde voorspelling, hoewel het meerdere netwerklaag gebruikt als doelen om de latent representaties te generaliseren. Het model traint specifiek een standaard Transformer-netwerk dat wordt gebruikt in de leraar- of studentmodus.

In de leraar-modus, bouwt het model eerst de representaties van de invoergegevens die dienen als doelen in de leertaak. In de student-modus, codeert het model een gemaskeerde versie van de invoergegevens die vervolgens wordt gebruikt om voorspellingen te doen over volledige gegevensrepresentaties.

De bovenstaande afbeelding toont hoe het data2vec-model hetzelfde leerproces gebruikt voor verschillende modaliteiten. In de eerste stap, produceert het model representaties van de invoergegevens (leraar-modus). Het model regressieert vervolgens deze representaties op basis van een gemaskeerde versie van de invoer.

Bovendien, aangezien het data2vec-algoritme latent representaties van de invoergegevens gebruikt, kan het worden gezien als een vereenvoudigde versie van de modality-specifieke ontwerpen zoals het creëren van geschikte doelen door de invoer te normaliseren of het leren van een vaste set van visuele tokens.

data2vec: Model Methode

Het data2vec-model wordt getraind door de modelrepresentaties van de invoergegevens te voorspellen op basis van een gedeeltelijke weergave van de invoer. Zoals u kunt zien in de gegeven figuur, is het gezicht van de hond gemaskeerd, een bepaald gedeelte van de spraakopname is gemaskeerd en het woord “met” is gemaskeerd in de tekst.

Het model codeert eerst een gemaskeerde versie van het trainingsmonster (student-modus), en codeert vervolgens de ongemaskeerde versie van de invoer om trainingsdoelen te construeren met hetzelfde model, maar alleen wanneer het is parameterized als de exponentiële gemiddelde van de modelgewichten (leraar-modus).

Model Architectuur

Het data2vec-model gebruikt een standaard Transformer-architectuur met modality-specifieke codering van de invoergegevens. Voor taken gerelateerd aan computer visie, gebruikt het model de ViT-strategie om een afbeelding te coderen als een reeks patches waar elke afbeelding een grootte van 16×16 pixels heeft, en voedt deze als een lineaire transformatie.

Bovendien, voor spraakherkenning, codeert het model de gegevens met behulp van een multi-laag 1-D convolutioneel neuronaal netwerk dat de 16 kHz waveform omzet in 50 Hz-representaties. Om tekstgegevens te verwerken, voorspelt het model de gegevens om subwoord-eenheden te extraheren en embedt de gegevens in een distributieve ruimte via embedding-vektoren.

Masking

Zodra het model de invoergegevens embedt als een reeks tokens, maskeert het model delen van deze eenheden door ze te vervangen door een embedding-token, en voedt de reeks vervolgens aan het Transformer- netwerk. Voor computer visie, gebruikt het model een block-wise masking-strategie.

Trainingsdoelen

Het data2vec-model is gericht op het voorspellen van de modelrepresentaties van de ongemaskeerde trainingsmonster op basis van een codering van de gemaskeerde monster die oorspronkelijk aan het model is gevoerd.

Het model voorspelt contextualized representaties die niet alleen de specifieke tijdstap coderen, maar ook andere informatie uit het monster omdat het zelfaandacht gebruikt in het Transformer-netwerk.

Hier is hoe het data2vec-model de leraar-modus parameteriseert om de netwerkrepresentaties te voorspellen die vervolgens dienen als doelen.

Leraar Parameterisatie

Het data2vec-model parameteriseert de codering van de ongemaskeerde trainingsmonster met behulp van EMA of Exponentiële Gemiddelde van de modelparameters (θ) waar de gewichten van het model in de doelmodus (△) als volgt zijn

                                           ∆ ← τ∆ + (1 − τ ) θ

 

Bovendien, plannen de onderzoekers τ dat lineair toeneemt van τ0 tot τe (doelwaarde) over de eerste τn updates. Na deze updates, houdt het model de waarde constant totdat de training is voltooid.

De resultaten laten zien dat het model efficiënter en nauwkeuriger is wanneer het de parameters van de functie-encoder en positionele encoder deelt tussen de student- en leraar-modus.

Doelen

De constructie van de trainingsdoelen is afhankelijk van de uitvoer van de top K blokken van het leraar-netwerk voor tijdstappen die gemaskeerd zijn in de student-modus.

Het model past normalisatie toe op elk blok om âlt te verkrijgen voordat het de top K-blokken gemiddeld om de trainingsdoel yt voor tijdstap t. te verkrijgen.

Het model creëert trainingsdoelen die het model regressieert wanneer het in student-modus is.

Bovendien, normaliseren de doelen ook het data2vec-model van het instorten in constante representaties voor tijdstappen, en voorkomen lagen met hoge normalisatie om de functies in de doelgegevens te domineren.

Doel

Voor contextualized trainingsdoelen yt, gebruikt het model een Smoth L1-verlies om de doelen te regresseren zoals hieronder vermeld

Hier, β is in controle van het overgangen van een kwadratisch verlies naar een L1-verlies, en het hangt zwaar af van de grootte van de kloof tussen de modelvoorspelling ft(x) op tijdstap t. Het voordeel van dit verlies is dat het vergelijkbaar minder gevoelig is voor uitbijters, met de noodzaak om de instelling van β te tunen.

Experimentele Opstelling

Het data2vec-model wordt geëxperimenteerd met twee modelgroottes: data2vec Large en data2vec Base. Voor numerieke stabiliteit, worden de EMA-updates gedaan in fp32, en de modellen bevatten L= 12 of L= 24 Transformer-blokken met verborgen dimensies(H) = 768 of H= 1024.

Computer Visie

Het data2vec-model embedt afbeeldingen van 224×224 pixels als patches van 16×16 pixels. Elke patch wordt lineair getransformeerd, en een reeks met 196 representaties wordt gevoerd aan de standaard Transformer.

Het model volgt BEiT om blokken te maskeren met aangrenzende patches met elk blok dat minstens 16 patches heeft met een willekeurige aspectverhouding.

Bovendien, randomiseert het model de afbeeldingsoogsten, horizontale flips en kleurjittering.

Het ViT-B-model wordt voor 800 epochs voorgetraind, en het data2vec-model gebruikt een batchgrootte van 8,192 voor het ViT-L-model en 2,048 voor het ViT-B-model.

Het data2vec-model gebruikt ook een cosinus en een Adam-schedule met een enkele cyclus om de leercurve op te warmen voor 80 epochs tot 0.001 voor ViT-L en voor 40 epochs tot 0.001 voor ViT-B.

Spraakverwerking

Voor spraak- en audioverwerking, wordt het data2vec-model getraind op ongeveer 960 uur aan audio-gegevens verkregen uit de Librispeech(LS-960) dataset.

Om de prestaties van het model te analyseren in verschillende resource-instellingen, hebben onderzoekers het data2vec-model gefinetuned om verschillende hoeveelheden gelabelde gegevens te gebruiken (van een paar minuten tot enkele uren) voor automatische spraakherkenning.

Natuurlijke Taalverwerking

Het data2vec-model gebruikt de byte-pair-encoding van 50K typen om de invoer te tokeniseren, en het model leert vervolgens een embedding voor elk type.

Tijdens voortraining, gebruikt het model τo = 0.999, τe = 0.9999, en τn = 100,000, K= 10, en β = 4.

Resultaten

Laten we eens kijken hoe het data2vec-model presteert wanneer het de strategieën implementeert die hierboven zijn besproken voor verschillende modaliteiten.

Computer Visie

Om de resultaten voor computer visie te evalueren, wordt het data2vec-model voorgetraind op afbeeldingen verkregen uit de ImageNet-1K dataset.

Het resulterende model wordt gefinetuned met behulp van de gelabelde gegevens van dezelfde benchmark.

De resultaten worden vervolgens onderscheiden op basis van een enkel zelfsupervisioned model en het trainen van een apart visueel tokeniseerder op extra gegevens of andere zelfsupervisioned leren-modellen.

Audio & Spraakverwerking

Voor spraak- en audioverwerking, wordt het data2vec-model getraind op ongeveer 960 uur aan audio-gegevens verkregen uit de Librispeech(LS-960) dataset.

Om de prestaties van het model te analyseren in verschillende resource-instellingen, hebben onderzoekers het data2vec-model gefinetuned om verschillende hoeveelheden gelabelde gegevens te gebruiken (van een paar minuten tot enkele uren) voor automatische spraakherkenning.

Natuurlijke Taalverwerking

Om de prestaties van het data2vec-model voor tekst te analyseren, volgt het model dezelfde trainingsopstelling als BERT en voortraining van het model op de Engelse Wikipedia-dataset met meer dan 1M updates en een batchgrootte van 256 sequenties.

Het model wordt geëvalueerd op de GLUE of Algemene Taalbegripsbeoordeling benchmark die natuurlijke taalinterferentietaken omvat (MNLI of Multi-Genre Natuurlijke Taalinterferentie), zinsgelijkenis (QQP of Quora Vraagparen benchmark, MRPC of Microsoft (MSFT ) Research Alinea Corpus, en STS-B of Semantische Tekstuele Gelijkenisbenchmark), sentimentanalyse (SST-2 of Stanford Sentiment Boom), en grammatica (CoLA).

data2Vec: Ablatie-Studie

Ablatie is een term die wordt gebruikt om de verwijdering van een component in de AI- en ML-systemen te definiëren.

Laag-Gemiddelde Doelen

Een belangrijk verschil tussen data2vec en andere zelfsupervisioned leren-modellen is dat het data2vec-model doelen gebruikt die zijn gebaseerd op het gemiddelen van meerdere lagen van het leraar-netwerk.

In het volgende experiment, wordt de prestatie van alle drie de modaliteiten gemeten door het gemiddelen van K= 1, 2, …, 12 lagen waar K= 1 alleen de top-laag voorspelt.

Doel-Kenmerktype

De Transformer-blokken in het data2vec-model hebben meerdere lagen die allemaal als doelen kunnen dienen.

Om te analyseren hoe verschillende lagen de prestatie beïnvloeden, wordt het model voorgetraind op Librispeech’s spraakmodellen die verschillende lagen gebruiken als doelkenmerken.

Doel-Contextualisatie

Leraar-representaties in het data2vec-model gebruiken zelfaandacht over de hele invoer om contextualized doelen te produceren.

Dit roept de vraag op: heeft het data2vec-model contextualized doelen nodig om goed te werken?

Modality-Specifieke Functie-Extractors en Masking

Het primaire doel van data2vec is om een eenvoudig leermechanisme te ontwerpen dat kan werken met verschillende modaliteiten.

Gestructureerde en Contextualized Doelen

Het belangrijkste onderscheidende punt tussen het data2vec en andere gemaskeerde voorspellingsmodellen is dat in het data2vec-model de functies van de trainingsdoelen contextualized zijn.

Slotgedachten

Recente werk in de AI- en ML-industrie heeft aangetoond dat uniforme modelarchitecturen een effectieve benadering kunnen zijn om meerdere modaliteiten aan te pakken.

Het data2vec-model gebruikt een zelfsupervisioned leren-benadering voor het werken met drie modaliteiten: spraak, afbeeldingen en taal.

Het data2vec-model is echt een mijlpaal in de zelfsupervisioned leren-industrie omdat het demonstreert dat een enkele leerwijze voor het leren van meerdere modaliteiten het gemakkelijker kan maken voor modellen om over modaliteiten te leren.

Een ingenieur van beroep, een schrijver van hart. Kunal is een technisch schrijver met een diepe liefde en begrip voor AI en ML, toegewijd aan het vereenvoudigen van complexe concepten in deze gebieden door middel van zijn boeiende en informatieve documentatie.