AI-modellen en platforms
SEER: Een Doorbraak in Zelf-Supervisionele Computer Vision Modellen?

In het afgelopen decennium hebben Artificial Intelligence (AI) en Machine Learning (ML) enorme vooruitgang geboekt. Vandaag zijn ze nauwkeuriger, efficiënter en krachtiger dan ooit tevoren. Moderne AI- en ML-modellen kunnen objecten in afbeeldingen of videobestanden naadloos en nauwkeurig herkennen. Bovendien kunnen ze tekst en spraak genereren die gelijkwaardig is aan menselijke intelligentie.
AI- en ML-modellen van vandaag zijn sterk afhankelijk van training op gelabelde datasets die hen leren hoe ze een blok tekst moeten interpreteren, objecten in een afbeelding of videoframe moeten identificeren en diverse andere taken moeten uitvoeren.
Ondanks hun mogelijkheden zijn AI- en ML-modellen niet perfect, en werken wetenschappers aan het ontwikkelen van modellen die in staat zijn om te leren van de informatie die ze krijgen, zonder noodzakelijkerwijs te vertrouwen op gelabelde of geannoteerde gegevens. Deze benadering wordt zelf-supervisioneel leren genoemd, en het is een van de meest efficiënte methoden om ML- en AI-modellen te bouwen die “gezond verstand” of achtergrondkennis hebben om problemen op te lossen die buiten de mogelijkheden van AI-modellen van vandaag liggen.
Zelf-supervisioneel leren heeft al zijn resultaten laten zien in Natural Language Processing, aangezien het ontwikkelaars in staat heeft gesteld om grote modellen te trainen die kunnen werken met een enorme hoeveelheid gegevens en heeft geleid tot diverse doorbraken op het gebied van natuurlijke taal inferentie, machinevertaling en vraagbeantwoording.
Het SEER-model van Facebook (META ) AI is gericht op het maximaliseren van de mogelijkheden van zelf-supervisioneel leren in het veld van computer vision. SEER of SElf SupERvised is een zelf-supervisioneel computer vision leermodel dat meer dan een miljard parameters heeft en in staat is om patronen te vinden of te leren, zelfs van een willekeurige groep afbeeldingen die op internet worden gevonden zonder adequate annotaties of labels.
De Behoefte aan Zelf-Supervisioneel Leren in Computer Vision
Gegevensannotatie of gegevenslabeling is een voorverwerkingsfase in de ontwikkeling van machine learning- en artificial intelligence-modellen. Het gegevensannotatieproces identificeert ruwe gegevens zoals afbeeldingen of videoframes en voegt labels toe aan de gegevens om de context van de gegevens voor het model te specificeren. Deze labels stellen het model in staat om nauwkeurige voorspellingen over de gegevens te doen.
Een van de grootste hindernissen en uitdagingen die ontwikkelaars tegenkomen bij het werken aan computer vision-modellen is het vinden van hoogwaardige geannoteerde gegevens. Computer Vision-modellen van vandaag vertrouwen op deze gelabelde of geannoteerde datasets om de patronen te leren die hen in staat stellen om objecten in de afbeelding te herkennen.
Gegevensannotatie en het gebruik ervan in het computer vision-model stellen de volgende uitdagingen:
Consistente Datasetkwaliteit Beheren
Waarschijnlijk is de grootste hindernis voor ontwikkelaars het verkrijgen van toegang tot hoogwaardige datasets op een consistente manier, omdat hoogwaardige datasets met adequate labels en duidelijke afbeeldingen resulteren in beter leren en nauwkeurigere modellen. Echter, het verkrijgen van toegang tot hoogwaardige datasets op een consistente manier heeft zijn eigen uitdagingen.
Workforce Management
Gegevenslabeling komt vaak met workforce management-problemen, voornamelijk omdat een groot aantal werknemers nodig is om grote hoeveelheden ongestructureerde en ongelabelde gegevens te verwerken en te labelen, terwijl er voor wordt gezorgd dat de kwaliteit wordt gewaarborgd. Het is dus essentieel voor ontwikkelaars om een balans te vinden tussen kwaliteit en kwantiteit bij gegevenslabeling.
Financiële Beperkingen
Waarschijnlijk is de grootste hindernis de financiële beperkingen die samenhangen met het gegevenslabelingproces, en meestal is de kosten van gegevenslabeling een aanzienlijk percentage van de totale projectkosten.
Zoals u kunt zien, is gegevensannotatie een grote hindernis bij de ontwikkeling van geavanceerde computer vision-modellen, vooral bij het ontwikkelen van complexe modellen die te maken hebben met een grote hoeveelheid trainingsgegevens. Het is de reden waarom de computer vision-industrie zelf-supervisioneel leren nodig heeft om geavanceerde en complexe computer vision-modellen te ontwikkelen die in staat zijn om taken uit te voeren die buiten de mogelijkheden van huidige modellen liggen.
Met dat gezegd hebbende, zijn er al veel zelf-supervisionele leermodellen die goed presteren in een gecontroleerde omgeving, en voornamelijk op de ImageNet-dataset. Hoewel deze modellen mogelijk goed presteren, voldoen ze niet aan de primaire voorwaarde van zelf-supervisioneel leren in computer vision: om te leren van elke onbegrensde dataset of willekeurige afbeelding, en niet alleen van een goed gedefinieerde dataset. Wanneer ideaal geïmplementeerd, kan zelf-supervisioneel leren helpen bij het ontwikkelen van nauwkeurigere en krachtigere computer vision-modellen die kostenefficiënt en haalbaar zijn.
SEER of SElf-supERvised Model: Een Introductie
Recente trends in de AI- en ML-industrie hebben aangetoond dat model pre-training benaderingen zoals semi-supervisioneel, zwak-supervisioneel en zelf-supervisioneel leren de prestaties van de meeste diepe leermodellen voor downstream taken aanzienlijk kunnen verbeteren.
Er zijn twee belangrijke factoren die in grote mate hebben bijgedragen tot de verbetering van de prestaties van deze diepe leermodellen.
Pre-Training op Grote Datasets
Pre-training op grote datasets resulteert meestal in betere nauwkeurigheid en prestaties, omdat het het model blootstelt aan een brede variëteit aan gegevens. Grote datasets stellen de modellen in staat om de patronen in de gegevens beter te begrijpen, en uiteindelijk resulteert dit in betere prestaties in real-life scenario’s.
Sommige van de best presterende modellen, zoals het GPT-3-model en het Wav2vec 2.0-model, zijn getraind op grote datasets. Het GPT-3-taalmodel gebruikt een pre-training dataset met meer dan 300 miljard woorden, terwijl het Wav2vec 2.0-model voor spraakherkenning een dataset met meer dan 53 duizend uur aan audiogegevens gebruikt.
Modellen met Grote Capaciteit
Modellen met een groter aantal parameters leveren vaak nauwkeurigere resultaten op, omdat een groter aantal parameters het model in staat stelt om zich te concentreren op de objecten in de gegevens die noodzakelijk zijn, in plaats van zich te concentreren op de storing of ruis in de gegevens.
Ontwikkelaars hebben in het verleden pogingen gedaan om zelf-supervisionele leermodellen te trainen op niet-gelabelde of ongecurateerde gegevens, maar met kleinere datasets die slechts een paar miljoen afbeeldingen bevatten. Maar kunnen zelf-supervisionele leermodellen hoge nauwkeurigheid opleveren wanneer ze getraind worden op een grote hoeveelheid ongelabelde en ongecurateerde gegevens? Het is precies de vraag die het SEER-model probeert te beantwoorden.
Het SEER-model is een diep leerframework dat ernaar streeft om afbeeldingen op internet te registreren, onafhankelijk van geannoteerde of gelabelde datasets. Het SEER-framework stelt ontwikkelaars in staat om grote en complexe ML-modellen te trainen op willekeurige gegevens zonder enige supervisie, d.w.z. het model analyseert de gegevens en leert de patronen of informatie op eigen kracht zonder enige handmatige invoer.
Het uiteindelijke doel van het SEER-model is om te helpen bij het ontwikkelen van strategieën voor het pre-trainingproces dat ongecurateerde gegevens gebruikt om state-of-the-art-prestaties te leveren in transfer learning. Bovendien streeft het SEER-model ernaar om systemen te creëren die kunnen blijven leren van een eindeloze stroom van gegevens op een zelf-supervisionele manier.
Het SEER-framework traint hoogcapaciteitsmodellen op miljarden willekeurige en ongecurateerde afbeeldingen die van internet zijn gehaald.
SEER Framework en RegNet: Wat is de Connectie?
Om het SEER-model te analyseren, richt het zich op de RegNet-architectuur met meer dan 700 miljoen parameters, die aansluit bij het doel van het SEER-model om zelf-supervisioneel te leren op ongecurateerde gegevens om twee belangrijke redenen:
- Ze bieden een perfecte balans tussen prestaties en efficiëntie.
- Ze zijn zeer flexibel en kunnen worden geschaald voor een aantal parameters.
SEER Framework: Eerder Werk uit Verschillende Gebieden
Het SEER-framework streeft ernaar om de grenzen van het trainen van grote modelarchitecturen in ongecurateerde of ongelabelde datasets met zelf-supervisioneel leren te verkennen, en het model zoekt inspiratie in eerder werk op het gebied.
Onbegeleid Pre-Training van Visuele Kenmerken
Zelf-supervisioneel leren is al enige tijd geleden geïmplementeerd in computer vision met methoden die gebruikmaken van auto-encoders, instance-niveau discriminatie of clustering.
Visuele Kenmerken Leren op Schaal
Eerder modellen hebben geprofiteerd van pre-training op grote gelabelde datasets met zwakke supervisie, supervisie en semi-supervisie op miljoenen gefilterde afbeeldingen.
Schaalbare Architecturen voor Afbeeldingsherkenning
Modellen profiteren meestal van het trainen van grote architecturen op betere kwaliteit resulterende visuele kenmerken.
SEER: Methoden en Componenten
Het SEER-framework gebruikt een verscheidenheid aan methoden en componenten om het model voor te trainen om visuele representaties te leren.
Zelf-Supervisioneel Pre-Training met SwAV
Het SEER-framework wordt voorgetraind met SwAV, een online zelf-supervisioneel leerbenadering.
RegNetY: Schaal-Efficiënte Model Familie
Het SEER-framework richt zich op de RegNetY-architectuur en voegt een Squeeze-and-Excitation toe aan de standaard RegNets-architectuur in een poging om hun prestaties te verbeteren.
De RegNetY 256GF Architectuur
Het SEER-model richt zich voornamelijk op de RegNetY 256GF-architectuur in de RegNetY-familie, en de parameters gebruiken de schaalregel van de RegNets-architectuur.
Optimalisatie en Training op Schaal
Het SEER-model stelt verschillende aanpassingen voor om zelf-supervisionele methoden te trainen en deze methoden aan te passen aan een grote schaal.
Leer Tempo Schema
Het SEER-model onderzoekt de mogelijkheid om twee leer tempo schema’s te gebruiken: de cosinusgolfleringschema en het vaste leertempo schema.
Verlagen van Geheugenverbruik per GPU
Het model streeft ernaar om de hoeveelheid GPU die nodig is tijdens de trainingsperiode te verminderen door gebruik te maken van gemengde precisie en gradatie van checkpoints.
Optimaliseren van Trainingsnelheid
Het gebruik van gemengde precisie voor het optimaliseren van geheugenverbruik heeft extra voordelen, aangezien accelerators profiteren van de verkleinde grootte van FP16 in vergelijking met FP32.
Grote Schaal Pre-Training Gegevens
Het SEER-model gebruikt meer dan een miljard afbeeldingen tijdens pre-training en overweegt een data loader die willekeurige afbeeldingen rechtstreeks van internet en Instagram samplet.
SEER Model Implementatie
Het SEER-model pretraint een RegNetY 256GF met SwAV met zes gewassen per afbeelding, met elke afbeelding een resolutie van 2×224 + 4×96.
SEER Framework: Resultaten
De kwaliteit van de kenmerken gegenereerd door de zelf-supervisionele pre-training benadering wordt bestudeerd en geanalyseerd op een verscheidenheid aan benchmarks en downstream taken.
Fine-Tuning van Grote Voorgetrainde Modellen
Het meet de kwaliteit van modellen die zijn voorgetraind op willekeurige gegevens door ze over te dragen naar de ImageNet-benchmark voor objectclassificatie.
Experimentele Instellingen
Het model pretraint zes RegNet-architecturen met verschillende capaciteiten, namelijk RegNetY-{8,16,32,64,128,256}GF, op meer dan een miljard willekeurige en openbare Instagram-afbeeldingen met SwAV.
Impact van de Model Capaciteit
Modelcapaciteit heeft een aanzienlijke invloed op de prestaties van het model bij pre-training, en de onderstaande figuur vergelijkt dit met de invloed wanneer getraind vanaf scratch.
Laag-Shot Leren
Laag-shot leren verwijst naar het evalueren van de prestaties van het SEER-model in een laag-shot setting, d.w.z. gebruikmakend van slechts een fractie van de totale gegevens bij downstream taken.
Resultaten op Place205 Dataset
De onderstaande figuur toont de impact van het pre-trainen van het model op verschillende delen van de Place205-dataset.
Resultaten op ImageNet
De onderstaande tabel vergelijkt de benadering van het SEER-model met zelf-supervisionele pre-training benaderingen en semi-supervisionele benaderingen op laag-shot leren.
Impact van de Model Capaciteit
De figuur hieronder bespreekt de impact van modelcapaciteit op laag-shot leren: bij 1%, 10% en 100% van de ImageNet-dataset.
Overdracht naar Andere Benchmarks
Om het SEER-model verder te evalueren en de prestaties te analyseren, worden de voorgetrainde kenmerken overgedragen naar andere downstream taken.
Lineaire Evaluatie van Afbeeldingsclassificatie
De onderstaande tabel vergelijkt de kenmerken van SEER’s voorgetrainde RegNetY-256GF en RegNetY128-GF, voorgetraind op de ImageNet-dataset met dezelfde architectuur met en zonder supervisie.
Detectie en Segmentatie
De onderstaande figuur vergelijkt de voorgetrainde kenmerken op detectie en segmentatie en evalueert ze.
Vergelijking met Zwak-Supervisioneel Pre-Training
De meeste afbeeldingen die beschikbaar zijn op internet hebben meestal een meta-omschrijving of een alt-tekst, of beschrijvingen, of geolocaties die een voordeel kunnen bieden tijdens pre-training.
Afleidingsstudies
Een afleidingsstudie wordt uitgevoerd om de impact van een bepaald onderdeel op de algehele prestaties van het model te analyseren.
Impact van de Model Architectuur
De modelarchitectuur heeft een aanzienlijke invloed op de prestaties van het model, vooral wanneer het model wordt geschaald of wanneer de specificaties van de pre-training gegevens worden gewijzigd.
Schaal van de Pre-Training Gegevens
Er zijn twee belangrijke redenen waarom het trainen van een model op een grotere dataset de algehele kwaliteit van de visuele kenmerken die het model leert kan verbeteren: meer unieke afbeeldingen en meer parameters.
Verhoging van het Aantal Unieke Afbeeldingen
De onderstaande figuur vergelijkt twee verschillende architecturen, de RegNet8 en de RegNet16, die hetzelfde aantal parameters hebben, maar getraind worden op een verschillend aantal unieke afbeeldingen.
Meer Parameters
De onderstaande figuur toont de prestaties van een model dat getraind wordt op een miljard afbeeldingen met de RegNet-128GF-architectuur.
Zelf-Supervisioneel Computer Vision in de Echte Wereld
Tot nu toe hebben we besproken hoe zelf-supervisioneel leren en het SEER-model voor computer vision werken in theorie.
Conclusie: Een Zelf-Supervisioneel Toekomst
Zelf-supervisioneel leren is een belangrijk onderwerp in de AI- en ML-industrie, omdat het AI-modellen in staat stelt om informatie rechtstreeks te leren uit een grote hoeveelheid gegevens die beschikbaar zijn op internet, in plaats van te vertrouwen op zorgvuldig geannoteerde en gelabelde datasets.
Zelf-supervisioneel leren is een essentieel concept voor de toekomst van AI en ML, omdat het de mogelijkheid biedt om AI-modellen te creëren die goed aansluiten bij real-life scenario’s en meerdere toepassingen hebben, in plaats van een specifiek doel te hebben.
Het SEER-model is een mijlpaal in de implementatie van zelf-supervisioneel leren in de computer vision-industrie.
De implementatie van SEER is vooral nuttig voor ontwikkelaars die werken aan modellen die te maken hebben met gebieden met beperkte afbeeldingen of metadata, zoals de medische industrie.
Bovendien zal het elimineren van menselijke annotaties ontwikkelaars in staat stellen om modellen sneller te ontwikkelen en te implementeren, waardoor ze sneller en nauwkeuriger kunnen reageren op snel evoluerende situaties.












