AI-modeller og platforme

data2vec: En Milepæl i Selvstyret Læring

mm
Føj Unite.AI til dine foretrukne kilder på Google

Maskinlæringsmodeller har traditionelt været afhængige af labelede data til træning, og det har generelt givet præcise resultater. Men det største problem med at bruge labelede data er de høje omkostninger til annotation, der stiger med størrelsen af træningsdataen. Høje omkostninger til annotation er et stort problem for udviklere, især når de arbejder på et stort projekt med store mængder træningsdata.

For at tackle dette problem opfandt udviklerne begrebet SSL eller Selvstyret Læring. Selvstyret Læring er en maskinlæringsproces, hvor modellen træner sig selv til at lære en del af input fra en anden del af input. En Selvstyret Læring-model sigter mod at udnytte relationen mellem data i stedet for at bruge labelede datas overvågede signaler.

Ud over Selvstyret Læring findes der flere andre metoder og modeller til at træne maskinlæringsmodeller uden brug af labelede data. Men de fleste af disse metoder har to store problemer

  1. De er ofte specialiseret til en enkelt modalitet, som et billede eller en tekst.
  2. De kræver en stor mængde beregningskraft.

Disse begrænsninger er et stort problem, fordi et gennemsnitligt menneskeligt sind kan lære fra en enkelt type data langt mere effektivt sammenlignet med en AI-model, der afhænger af separate modeller og træningsdata til at skelne mellem et billede, tekst og tale.

For at tackle problemet med enkelt modalitet udgav Meta AI data2vec, den første af sin art, selvstyret højpræstationsalgoritme til at lære mønstreinformation fra tre forskellige modaliteter: billede, tekst og tale. Med implementeringen af data2vec-algoritmen kan tekstforståelse anvendes på et billede-segmenteringsproblem eller kan også anvendes i en talegenkendelsestask.

I denne artikel vil vi diskutere data2vec-modellen i dybden. Vi vil diskutere metodeoversigten, relateret arbejde, arkitektur og resultaterne af modellen i større dybde, så du har en klar forståelse af data2vec-algoritmen.

Data2vec Introduktion: Kerneideen

Selv om den grundlæggende koncept af Selvstyret Læring anvendes på tværs af modaliteter, forskellige objekter og algoritmer, da de blev designede i forhold til en enkelt modalitet. At designe en model til en enkelt modalitet er årsagen til, at den samme selvstyret læringosalgoritme ikke kan fungere effektivt på tværs af forskellige typer træningsdata.

For at overvinde udfordringen, der præsenteres af enkelt modalitet modeller og algoritmer, udgav Meta AI data2vec, en algoritme, der bruger den samme læringsmetode til enten computer vision, NLP eller tale.

Kerneideen bag data2vec-algoritmen er at bruge den maskerede visning af input til at forudsige latent repræsentation af den fulde inputdata i en selv-destillationsopsætning med hjælp af standard Transformer-arkitektur. Så, i stedet for modalitets-specifikke objekter som billeder, tekst eller stemmer, der er lokale i naturen, forudsiger data2vec-algoritmen latent repræsentationer med information fra den fulde trænings- eller inputdata.

Hvorfor Har AI-Branchen Brug For Data2Vec-Algoritmen?

Selvstyret Læring-modeller bygger repræsentationer af træningsdata ved hjælp af menneske-annoterede mærker, og det er en af de største årsagerne bag fremgangen i NLP eller Naturlig Sprogbehandling og Computer Vision-teknologi. Disse selvstyret læring-repræsentationer er årsagen til, at opgaver som talegenkendelse og maskinlæring anvender usuperviseret læring i deres modeller.

Indtil nu har disse selvstyret læring-algoritmer fokuseret på enkelt modalitet, hvilket resulterer i læringsskævheder og specifikke designs i modellerne. Den enkelt modalitet af selvstyret læring-algoritmer skaber udfordringer i forskellige AI-anvendelser, herunder computer vision og NLP.

For eksempel findes der en vokabular af taleenheder i talebehandling, der kan definere en selvstyret læring-opgave i NLP. Ligeledes i computer vision kan udviklere enten regressere input, lære diskrete visuelle tokens eller lære repræsentationer, der er invariant over for data-forstærkning. Selv om disse læringsskævheder er nyttige, er det svært at bekræfte, om disse skævheder vil generalisere til andre modaliteter.

Data2vec-algoritmen er en stor milepæl i selvstyret læring-industrien, da den sigter mod at forbedre multiple modaliteter i stedet for kun en. Derudover er data2vec-algoritmen ikke afhængig af at genskabe input eller kontrastiv læring.

Så årsagen til, at verden har brug for data2vec, er, at data2vec-algoritmen har potentialet for at accelerere fremgangen i AI og bidrager til udviklingen af AI-modeller, der kan lære om forskellige aspekter af deres omgivelser uden problemer. Forskere håber, at data2vec-algoritmen vil tillade dem at udvikle mere tilpasningsdygtige AI- og ML-modeller, der kan udføre meget avancerede opgaver ud over, hvad i dagens AI-modeller kan gøre.

Hvad Er Data2Vec-Algoritmen?

Data2vec er en samlet ramme, der sigter mod at implementere selvstyret maskinlæring på tværs af forskellige data-modaliteter, herunder billeder, tale og tekst.

Data2vec-algoritmen sigter mod at udvikle ML-modeller, der kan lære generelle mønstre i omgivelserne meget bedre ved at holde læringsobjektivet ensartet på tværs af forskellige modaliteter. Data2vec-modellen samler læringsobjektivet, men den lærer stadig repræsentationer for hver modalitet individuelt.

Med introduktionen af data2vec-algoritmen håber Meta AI, at det vil gøre multimodal læring effektiv og meget simplere.

Hvordan Fungerer Data2Vec-Algoritmen?

Data2vec-algoritmen kombinerer læringen af latent repræsentation med maskeret forudsigelse, selv om den bruger multiple netværksskikt som mål til at generalisere de latente repræsentationer. Modellen træner specifikt en standard Transformer-netværk, der derefter bruges enten i lærer- eller elevtilstand.

I lærertilstanden bygger modellen først repræsentationer af inputdata, der fungerer som mål i læringsopgaven. I elevtilstanden kodificerer modellen en maskeret version af inputdata, der derefter bruges til at gøre forudsigelser om fulde datarepræsentationer.

Billedet ovenfor repræsenterer, hvordan data2vec-modellen bruger den samme læringsproces til forskellige modaliteter. I det første trin producerer modellen repræsentationer af inputdata (lærertilstand). Modellen regresser derefter disse repræsentationer på basis af en maskeret version af input.

Derudover, da data2vec-algoritmen bruger latente repræsentationer af inputdata, kan den ses som en simplificeret version af modalitets-specifikke designs som oprettelse af passende mål ved at normalisere input eller læring af en fast mængde visuelle tokens. Men den afgørende forskellende punkt mellem data2vec og andre algoritmer er, at data2vec-algoritmen bruger selv-opmærksomhed til at gøre målrepræsentationen kontekstualiseret og kontinuerlig. På den anden side bruger andre selvstyret læring-modeller en fast mængde mål, der er baseret på en lokal kontekst.

Data2vec: Modelmetode

Data2vec-modellen trænes ved at forudsige modellens repræsentationer af inputdata givet en delvis visning af input. Som du kan se i figuren, er hundens ansigt maskeret, en bestemt del af talenoten er maskeret, og ordet “med” er maskeret i teksten.

Modellen kodificerer først en maskeret version af træningseksemplet (elevtilstand) og derefter kodificerer den umaskerede version af input til at konstruere træningsmål med samme model, men kun når den er parameteriseret som den eksponentielle gennemsnit af modellens vægte (lærertilstand).

Modelarkitektur

Data2vec-modellen bruger en standard Transformer-arkitektur med modalitets-specifik encoding af inputdata. Til opgaver relateret til computer vision bruger modellen ViT-strategien til at kodificere et billede som en sekvens af patches, hvor hver patch dækker 16×16 pixels, og fødes som en lineær transformation.

Derudover, for talegenkendelse, kodificerer modellen data ved hjælp af en multi-lag 1-D convolutional neural network, der mapper 16 kHz waveform til 50 Hz repræsentationer. Til at behandle tekstdata preprocesser modellen data til at trække sub-ord enheder og embedder data i distributionsrum via embeddingsvektorer.

Maskering

Når modellen embedder inputdata som en sekvens af tokens, maskerer modellen dele af disse enheder ved at erstatte dem med en embeddings-token og derefter føder sekvensen til Transformer-netværket. Til computer vision praktiserer modellen block-vis maskeringsstrategi. Latente talerepræsentationer bruges til at maskere spans af taledata, og til sprog-relaterede opgaver maskeres tokens.

Træningsmål

Data2vec-modellen sigter mod at forudsige modellens repræsentationer af den umaskerede træningseksemplet baseret på en kodificering af den maskerede eksemplet, der oprindeligt blev fødet til modellen. Modellen forudsiger kun repræsentationer for maskerede tidssteg.

Modellen forudsiger kontekstualiserede repræsentationer, der ikke kun kodificerer den specifikke tidssteg, men også kodificerer andre informationer fra eksemplet, da den bruger selv-opmærksomhed i Transformer-netværket. De kontekstualiserede repræsentationer og brugen af Transformer-netværk er, hvad der adskiller data2vec-modellen fra eksisterende BERT, wav2vec, BEiT, SimMIM, MAE og MaskFeat-modeller, der forudsiger mål uden kontekstinformation.

Her er, hvordan data2vec-modellen parameteriserer lærertilstanden til at forudsige netværksrepræsentationer, der derefter fungerer som mål.

Lærerparameterisering

Data2vec-modellen parameteriserer kodificeringen af den umaskerede træningseksemplet med brug af EMA eller Eksponentiel Gennemsnit af modellens parametre (θ), hvor vægtene af modellen i måtilstanden (△) er følgende

                                           ∆ ← τ∆ + (1 − τ ) θ

 

Derudover planlægger modellen for τ, der lineært øger parameteren fra τ0 til τe (mål-værdi) over de første τn opdateringer. Efter disse opdateringer holder modellen værdien konstant, indtil træningen er færdig. Brugen af EMA-strategien opdaterer læreren meget oftere i begyndelsen, når træningen starter, når modellen er tilfældig. Da træningen skrider frem og gode parametre er lært, opdateres læreren mindre hyppigt.

Resultaterne viser, at modellen er mere effektiv og præcis, når den deler parametrene for funktion-encoderen og position-encoderen mellem elev- og lærertilstanden.

Mål

Konstruktionen af træningsmål afhænger af outputtet af de øverste K-blokke af lærer-netværket for tidssteg, der er maskeret i elevtilstanden. Outputtet af blok l på ethvert tidssteg t er betegnet som alt. Modellen anvender derefter normalisering til hver blok for at opnå âlt før den gennemsnitter de øverste K-blokke 

  

 

for at opnå træningsmålet yt for tidssteg t for et netværk med L-blokke i alt.

Det skaber træningsmål, som modellen regresser, når den er i elevtilstand. I de første eksperimenter fungerede data2vec-modellen bedst i at forudsige hver blok separat med en dedikeret projection og var samtidig mere effektiv.

Derudover tillader normaliseringen af målene også data2vec-modellen fra at kollapsere til konstante repræsentationer for tidssteg og forhindrer lag med høj normalisering i at dominere funktionerne i måldatasættet. Til talegenkendelse bruger modellen instans-normalisering over den aktuelle input-eksemplet uden nogen lærte parametre.

Desuden fandt forskerne, at når de arbejdede med computer vision og NLP, fungerede parameterløs normalisering tilstrækkeligt. Problemet kan også løses med Varians-Invarians-Kovarians-regularisering, men den ovennævnte strategi fungerer tilstrækkeligt og kræver ikke yderligere parametre.

Mål

For kontekstualiserede træningsmål yt, bruger modellen en Smooth L1-tab til at regressere målene, som nævnt nedenfor

Her er β under kontrol af overgangen fra en kvadreret tab til en L1-tab, og det afhænger stærkt af størrelsen af gapet mellem modellens forudsigelse ft(x) på tidssteg t. Fordelen ved denne tab er, at den er komparativt mindre følsom over for outliers, med behov for at justere indstillingen af β.

Eksperimentel Opsætning

Data2vec-modellen eksperimenteres med to modelstørrelser: data2vec Large og data2vec Base. Til numerisk stabilitet udføres EMA-opdateringer i fp32, og modellerne indeholder L= 12 eller L= 24 Transformer-blokke med skjulte dimensioner (H) = 768 eller H= 1024.

Computer Vision

Data2vec-modellen embedder billeder af 224×224 pixels som patches af 16×16 pixels. Hver af disse patches transformeres lineært, og en sekvens med 196 repræsentationer fødes til den standard Transformer.

Modellen følger BEiT til at maskere blokke med tilstødende patches med hver blok, der har en minimum af 16 patches med en tilfældig aspektforhold. Men i stedet for at maskere 40% af patchen, som i den oprindelige BEiT-model, maskerer data2vec-modellen 60% af patchen for bedre nøjagtighed.

Derudover maskerer modellen tilfældigt billedudskæringer, horisontale flips og farve-jittering. Endelig bruger data2vec-modellen den samme modificerede billede i både lærer- og elevtilstanden.

ViT-B-modellerne er fortrænet i 800 epocher, og data2vec-modellen bruger en batch-størrelse på 8.192 til ViT-L-modellen og 2.048 til ViT-B-modellen. Data2vec-modellen bruger også en cosinus- og en Adam-tidsplan med en enkelt cyklus til at varme op læringssatsen i 80 epocher til 0,001 for ViT-L og i 40 epocher til 0,001 for ViT-B.

Til både ViT-B og ViT-L bruger data2vec-modellen β = 2, K = 6 og τ = 0,9998 som konstant uden tidsplan. Modellen bruger desuden en stokastisk dybderate på 0,2.

Derudover træner data2vec-modellen for 1.600 epocher, hvor de første 800 epocher har en læringssats på 0,9998, og derefter nulstiller modellen læringssats-tidsplanen og fortsætter med en læringssats på 0,9999 i de sidste 800 epocher.

Til billedklassifikation bruger modellen middel-poolen af outputtet af den sidste Transformer-blok og føder det til en softmax-normaliseret klassifikator. Modellen finjusterer derefter ViT-L i 50 epocher og ViT-B i 100 epocher ved hjælp af cosinus- og Adam-tidsplan til at varme op læringssatsen.

Talebehandling

Til talebehandling bruger data2vec-modellen Fairseq, en sekvens-model-kit brugt til at træne brugerdefinerede modeller til sammenfatning, oversættelse og tekstgenerering. Modellen tager 16 kHz waveform som input, der behandles ved hjælp af en funktion-encoder, der indeholder tidsmæssige konvolutioner med 512 kanaler, kernel-bredde (10,3,3,3,3,2,2) og strides (5,2,2,2,2,2,2).

Det resulterer i, at outputfrekvensen af encoderen er 50 Hz, og den har en stride på 20 ms mellem hver prøve. Modtagerfeltet består af 400 inputprøver eller 25 ms af lyd.

Den rå waveform, der fødes til encoderen, er normaliseret til enhedsvarians og nul middelværdi.

Maskeringsstrategien, der bruges af data2vec til Base-modellen, ligner Baevski-rammen for selvstyret læring i talegenkendelse. Modellen sampler p = 0,065 for alle tidssteg til at være startindekser og fortsætter med at markere de følgende ti tidssteg. For en typisk træningseksemplet tillader processen, at næsten 49% af de samlede tidssteg er maskeret.

Under træning lineært annealer data2vec-modellen τ ved hjælp af τo = 0,999, τe = 0,9999 og τn = 30.000. Data2vec-modellen bruger Adam-optimizeren med den maksimale læringssats på 5×10-4 til Base-modellen. Derudover bruger Base-modellen en tri-stage-tidsplan, der varmer op læringssatsen lineært i de første 3% af opdateringer, vedligeholder den i de næste 90% og derefter aftager den lineært i de sidste 7%.

Naturlig Sprogbehandling

Data2vec-modellen bruger byte-pair-encoding af 50K typer til at tokenisere input og lærer derefter en embedding til hver type. Efter at data er kodificeret, anvender modellen BERT-maskeringsstrategien til 15% af ensartet valgte tokens, hvor 80% erstattes af lærte mask-tokens, 10% erstattes af tilfældige vokabulartokens og de resterende 10% forbliver uændrede.

Under fortræning bruger modellen τo = 0,999, τe = 0,9999 og τn = 100.000, K= 10 og β = 4. Modellen bruger Adam-optimizeren med en tri-stage-læringssats-tidsplan, der varmer op læringssatsen lineært i de første 5% af opdateringer, vedligeholder den i de næste 80% og derefter aftager den lineært i de sidste 15%, med den maksimale læringssats på 2×10-4.

Derudover træner modellen på 16 GPU‘er med en batch-størrelse på 256 sekvenser, og hver sekvens indeholder omkring 512 tokens. Til downstreaming træner modellen på fire forskellige læringssatser: 1×10-4, 2×10-4, 3×10-4 og 4×10-4, og den bedste udgave vælges til yderligere NLP-downstreaming-opgaver.

Resultater

Lad os se, hvordan data2vec-modellen fungerer, når den implementerer strategierne ovenfor til forskellige modaliteter.

Computer Vision

Til at evaluere resultaterne for computer vision er data2vec-modellen fortrænet på billeder fra ImageNet-1K-datasættet. Den resulterende model er finjusteret ved hjælp af mærket data fra samme benchmark. Ifølge standardpraksis evalueres modellen derefter i forhold til top-1-nøjagtighed på valideringsdata.

Resultaterne er derefter forskellige på basis af en enkelt selvstyret model og træning af en separat visuel tokenizer på yderligere data eller andre selvstyret læring-modeller.

Tabellen nedenfor sammenligner data2vec-modellens præstation på computer vision og andre eksisterende modeller: ViT-L og ViT-B.

Resultaterne fra tabellen ovenfor kan sammenfattes som følger.

  • Data2vec-modellen overgår tidligere arbejde med både ViT-L- og ViT-B-modeller i enkeltmodel-indstilling.
  • Den maskerede forudsigelsesopsætning, der bruges i data2vec-algoritmen til at forudsige kontekstualiserede latente repræsentationer, fungerer bedre sammenlignet med metoder, der forudsiger lokale mål som f.eks. at konstruere billedfunktioner, input-pixels eller visuelle tokens.
  • Data2vec-modellen overgår også selv-destillationsmetoder, der regresser den sidste lag af elev-netværket, mens de tager to forskellige forstærkede versioner af et billede som input.

Audio & Talebehandling

Til tale- og audio-behandling er data2vec-modellen trænet på omkring 960 timers audio-data fra Librispeech(LS-960)-datasættet. Datasættet indeholder rent tale-audio fra lydbøger på engelsk og behandles som en standard-benchmark i tale- og audio-behandlingsindustrien.

For at analysere modellens præstation i forskellige ressource-indstillinger har forskerne finjusteret data2vec-modellen til at bruge forskellige mængder mærket data (fra få minutter til flere timer) til automatisk talegenkendelse. For at analysere modellens præstation sammenlignes data2vec med HuBERT og wav2vec 2.0, to af de mest populære algoritmer til tale- og audio-repræsentationslæring, der afhænger af diskrete tale-enheder.

Tabellen ovenfor sammenligner data2vec-modellens præstation i forhold til ordhastighed for talegenkendelse med andre eksisterende modeller.

Naturlig Sprogbehandling

For at analysere data2vec-modellens præstation på tekst følger modellen den samme træningssætning som BERT og fortræner modellen på den engelske Wikipedia-datasæt med over 1M opdateringer og en batch-størrelse på 256 sekvenser. Modellen evalueres på GLUE eller Generel Sprogforståelsesevaluering-benchmark, der indeholder naturlig sprogforståelsesopgaver (MNLI eller Multi Genre Naturlig Sprogforståelse), sætningslighed (QQP eller Quora Spørgsmål Par benchmark, MRPC eller Microsoft (MSFT ) Research Paragraph Corpus og STS-B eller Semantisk Tekstlig Lighed Benchmark), sentimentanalyse (SST-2 eller Stanford Sentiment Træ) og grammatik (CoLA).

Derudover til at finjustere data2vec-modellen gives mærket data af hver opgave, og den gennemsnitlige nøjagtighed rapporteres på udviklingssættene med 5 finjusteringskørsler. Tabellen nedenfor sammenfatter data2vec-modellens præstation på naturlig sprogbehandlingsopgaver og sammenligner den med andre modeller.

  • Tabellen ovenfor viser, at data2vec-modellen overgår baseline RoBERTa-modellen, da strategien i data2vec-modellen ikke bruger tilfældige mål.
  • Data2vec-modellen er den første succesfulde fortrænet NLP-model, der ikke bruger diskrete enheder som tegn, ord eller underord som træningsmål. I stedet forudsiger data2vec-rammen kontekstualiserede latente repræsentationer over den fulde umaskerede tekstsekvens.
  • Det hjælper med at skabe en læringsopgave, hvor modellen kræves at forudsige mål med bestemte egenskaber fra den aktuelle sekvens i stedet for at forudsige repræsentationer, der er generiske til hver tekstenhed med bestemt diskretion.
  • Derudover er træningsmål-sættet ikke fast, og modellen er fri til at definere nye mål, og det er åbent for vokabulær-indstillinger.

Data2Vec: Ablationsstudie

Ablation er en term, der bruges til at definere fjernelse af en komponent i AI- og ML-systemer. En ablationsstudie bruges til at undersøge eller analysere præstationen af en AI- eller ML-model ved at fjerne bestemte nøglekomponenter fra modellen, hvilket giver forskerne mulighed for at forstå bidraget fra denne komponent i det samlede system.

Layer-gennemsnitlige Mål

En stor forskel mellem data2vec og andre selvstyret læring-modeller er, at data2vec-modellen bruger mål, der er baseret på gennemsnit af multiple lag fra lærer-netværket. Ideen kommer fra, at de øverste lag af wav2vec 2.0-modellen ikke fungerer så godt til downstream-opgaver sammenlignet med midterste lag af modellen.

I følgende eksperiment måles præstationen af alle tre modaliteter ved at gennemsnitte K= 1, 2, …, 12 lag, hvor K= 1 forudsiger kun det øverste lag. Men for at få en hurtigere omgangstræning træner data2vec-modellen Basen med 12 lag i alt. Til talegenkendelse er modellen fortrænet på over 200.000 opdateringer på Librispeech og derefter finjusteret på en 10 timers mærket split af Libri-light. Til naturlig sprogbehandling rapporterer modellen den gennemsnitlige GLUE-score for valideringssættet og fortræner modellen i 300 epocher til computer vision og rapporterer derefter top-1-nøjagtigheden, der opnås på ImageNet-datasættet.

Figuren ovenfor viser, at mål baseret på multiple lag generelt forbedrer sig, når kun det øverste lag K=1 bruges til alle modaliteter. At bruge alle tilgængelige lag er en god praksis, da neurale netværk bygger funktioner over forskellige typer funktioner og mange lag, der derefter udtrækkes som funktionlag.

At bruge funktioner fra multiple lag hjælper med at forbedre nøjagtigheden og beriger den selvstyret læring-proces.

Mål-Funktionstype

Transformer-blokkene i data2vec-modellen har flere lag, der alle kan fungere som mål. For at analysere, hvordan forskellige lag påvirker præstationen, er modellen fortrænet på Librispeechs talemodeller, der bruger forskellige lag som mål-funktioner.

Figuren nedenfor viser tydeligt, at outputtet af feed-forward-netværket eller FFN fungerer ideelt, mens outputtet af selv-opmærksomhedsblokkene ikke resulterer i en brugbar model.

Mål-Kontekstualisering

Lærer-repræsentationer i data2vec-modellen bruger selv-opmærksomhed over hele input til at producere kontekstualiserede mål. Det adskiller data2vec fra andre selvstyret læring-modeller, der konstruerer en læringsopgave ved at genskabe eller forudsige lokale dele af input.

For at besvare spørgsmålet, om data2vec-modellen kræver kontekstualiserede mål for at fungere godt, konstruerer forskerne mål-repræsentationer, der ikke har adgang til hele input-datasættet, men kun en brøkdel af det, der er forudbestemt.

Figuren nedenfor indikerer, at større kontekst-størrelser ofte fører til bedre præstation, og når hele input-eksemplet er synligt, giver det den bedste nøjagtighed.

Modalitets-Specifikke Funktion-Extractorer og Maskering

Det primære mål med data2vec er at designe en enkel læringsmekanisme, der kan fungere med forskellige modaliteter. Det skyldes, at selv om de nuværende modeller og rammer har en samlet læringsregime, bruger de stadig modalitets-specifikke maskering og funktion-extraktorer.

Det giver mening, at rammer hovedsageligt fungerer med en enkelt modalitet, da naturen af input-data varierer kraftigt fra den ene til den anden. F.eks. bruger talegenkendelsesmodeller en høj opløsning input (som 10 kHz waveform), der normalt har tusinder af prøver.

Strukturerede og Kontekstualiserede Mål

Den vigtigste forskel mellem data2vec og andre maskerede forudsigelsesmodeller er, at i data2vec-modellen er træningsmål-funktionerne kontekstualiserede.

Disse funktioner bygges ved hjælp af selv-opmærksomhed over hele input i lærertilstand.

Afsluttende Tanker

Nylig arbejde i AI- og ML-industrien har indikeret, at ensartede modelarkitekturer kan være en effektiv tilgang til at tackle multiple modaliteter. Data2vec-modellen bruger en selvstyret læring-tilgang til at fungere med tre modaliteter: tale, billeder og sprog.

Kerneideen bag data2vec-modellen er at bruge en delvis visning af input til at regressere kontekstualiserede information eller input-data.

Tilgangen, der bruges af data2vec-rammen, er effektiv, da modellen fungerer bedre end tidligere selvstyret læring-modeller på ImageNet-1K-datasættet for både ViT-B- og ViT-L-enkeltmodeller.

Data2vec er virkelig en milepæl i selvstyret læring-industrien, da den demonstrerer, at en enkelt læringsmetode til at lære multiple modaliteter kan gøre det lettere for modeller at lære på tværs af modaliteter.

En ingeniør af profession, en forfatter af hjerte. Kunal er en teknisk forfatter med en dyb kærlighed og forståelse af AI og ML, dedikeret til at forenkle komplekse koncepter inden for disse felter gennem sin engagerende og informative dokumentation.