AI-modeller og platforme
YOLOv7: Den mest avancerede objektgenkendelsesalgoritme?

6. juli 2022 vil blive markeret som en milepÃĶl i AI-historien, da det var pÃĨ denne dag, at YOLOv7 blev frigivet. Siden dens lancering har YOLOv7 vÃĶret det hotteste emne i Computer Vision-udviklerfÃĶllesskabet, og det er ikke uden grund. YOLOv7 bliver allerede betragtet som en milepÃĶl i objektgenkendelsesindustrien.
Kort efter, at YOLOv7-papiret blev offentliggjort, dukkede det op som den hurtigste og mest nÃļjagtige realtidsobjektgenkendelsesmodel. Men hvordan udgÃļr YOLOv7 sine forgÃĶngere? Hvad gÃļr YOLOv7 sÃĨ effektiv til at udfÃļre computer vision-opgaver?
I denne artikel vil vi forsÃļge at analysere YOLOv7-modellen og forsÃļge at finde svaret pÃĨ, hvorfor YOLOv7 nu bliver branchestandard. Men fÃļr vi kan besvare det, mÃĨ vi have et kig pÃĨ den korte historie om objektgenkendelse.
Hvad er objektgenkendelse?
Objektgenkendelse er en gren af computer vision, der identificerer og lokaliserer objekter i et billede eller en video-fil. Objektgenkendelse er byggestenene for utallige anvendelser, herunder selvkÃļrende biler, overvÃĨgning og selv robotter.
En objektgenkendelsesmodel kan klassificeres i to forskellige kategorier, single-shot-detectorer og multi-shot-detectorer.
Realtidsobjektgenkendelse
For at forstÃĨ, hvordan YOLOv7 fungerer, er det essentiel for os at forstÃĨ YOLOv7âs hovedformÃĨl, âRealtidsobjektgenkendelseâ. Realtidsobjektgenkendelse er en nÃļglekomponent i moderne computer vision. Realtidsobjektgenkendelsesmodellerne forsÃļger at identificere og lokalisere objekter af interesse i realtid. Realtidsobjektgenkendelsesmodeller har gjort det meget effektivt for udviklere at spore objekter af interesse i en bevÃĶgelig ramme, som en video eller en live-overvÃĨgningsindtastning.

Realtidsobjektgenkendelsesmodeller er essentielt et skridt foran de konventionelle billedgenkendelsesmodeller. Mens den fÃļrstnÃĶvnte bruges til at spore objekter i video-filer, lokaliserer og identificerer den sidstnÃĶvnte objekter inden for en stationÃĶr ramme, som et billede.
Som fÃļlge heraf er realtidsobjektgenkendelsesmodeller meget effektive til videoanalyse, selvkÃļrende kÃļretÃļjer, objekt-tÃĶlling, multi-objekt-sporing og meget mere.
Hvad er YOLO?
YOLO eller âYou Only Look Onceâ er en familie af realtidsobjektgenkendelsesmodeller. YOLO-konceptet blev fÃļrste gang introduceret i 2016 af Joseph Redmon, og det var straks en sensation, da det var meget hurtigere og mere nÃļjagtigt end de eksisterende objektgenkendelsesalgoritmer. Det tog ikke lang tid, fÃļr YOLO-algoritmen blev en standard i computer vision-industrien.

Det grundlÃĶggende koncept, som YOLO-algoritmen foreslÃĨr, er at bruge et end-to-end neuralt netvÃĶrk med begrÃĶnsningsbokse og klasse-sandsynligheder til at gÃļre forudsigelser i realtid. YOLO var anderledes end den forrige objektgenkendelsesmodel, da den foreslog en anden tilgang til at udfÃļre objektgenkendelse ved at ombruge klassificatorer.
Ãndringen i tilgangen virkede, da YOLO snart blev branchestandarden, og performancesforskellen mellem sig selv og andre realtidsobjektgenkendelsesalgoritmer var betydelig. Men hvad var ÃĨrsagen til, at YOLO var sÃĨ effektiv?
NÃĨr det sammenlignes med YOLO, brugte objektgenkendelsesalgoritmerne pÃĨ det tidspunkt Region Proposal Networks til at detektere mulige omrÃĨder af interesse. Genkendelsesprocessen blev derefter udfÃļrt pÃĨ hvert omrÃĨde separat. Som fÃļlge heraf udfÃļrte disse modeller ofte multiple iterationer pÃĨ samme billede, og derfor manglede nÃļjagtighed og havde en hÃļjere eksekveringstid. PÃĨ den anden side bruger YOLO-algoritmen en enkelt fuldt forbundet lag til at udfÃļre forudsigelsen pÃĨ ÃĐn gang.
Hvordan fungerer YOLO?
Der er tre skridt, der forklarer, hvordan en YOLO-algoritme fungerer.
Omdefinering af objektgenkendelse som et enkelt regressionproblem
YOLO-algoritmen forsÃļger at omdefinere objektgenkendelse som et enkelt regressionproblem, herunder billedpixels, til klasse-sandsynligheder og begrÃĶnsningsboks-koordinater. Derfor behÃļver algoritmen kun at se pÃĨ billedet ÃĐn gang for at forudsige og lokalisere mÃĨlobjektet i billedet.
Begrundelse af billedet globalt
Desuden, nÃĨr YOLO-algoritmen gÃļr forudsigelser, begrunder den billedet globalt. Det er anderledes end region-proposal-baserede og glide-teknikker, da YOLO-algoritmen ser pÃĨ det fulde billede under trÃĶning og testning pÃĨ datasÃĶttet og kan kode kontekstuel information om klasserne og hvordan de optrÃĶder.
FÃļr YOLO var Fast R-CNN en af de mest populÃĶre objektgenkendelsesalgoritmer, der ikke kunne se den stÃļrre kontekst i billedet, da den brugte til at forveksle baggrundspunkter i et billede med et objekt. NÃĨr det sammenlignes med Fast R-CNN-algoritmen, er YOLO 50% mere nÃļjagtigt, nÃĨr det kommer til baggrundfejl.
Generalisering af objektreprÃĶsentationer
Til sidst forsÃļger YOLO-algoritmen ogsÃĨ at generalisere reprÃĶsentationerne af objekter i et billede. Som fÃļlge heraf, nÃĨr en YOLO-algoritme blev kÃļrt pÃĨ en datasÃĶt med naturlige billeder og testet for resultaterne, overgik YOLO eksisterende R-CNN-modeller med et stort margin. Det er, fordi YOLO er hÃļjtydigt generaliserbar, og sandsynligheden for, at den bryder sammen, nÃĨr den implementeres pÃĨ uventede input eller nye domÃĶner, er lille.
YOLOv7: Hvad er nyt?
Nu, hvor vi har en grundlÃĶggende forstÃĨelse af, hvad realtidsobjektgenkendelsesmodeller er, og hvad YOLO-algoritmen er, er det tid til at diskutere YOLOv7-algoritmen.
Optimering af trÃĶningsprocessen
YOLOv7-algoritmen forsÃļger ikke kun at optimere modellens arkitektur, men den forsÃļger ogsÃĨ at optimere trÃĶningsprocessen. Den forsÃļger at bruge optimeringsmoduler og -metoder til at forbedre nÃļjagtigheden af objektgenkendelse, styrke omkostningerne for trÃĶning, samtidig med at den opretholder interferensomkostningerne. Disse optimeringsmoduler kan henvises til som en trÃĶnbar pose af gratisvarer.
Groft til fin led-guideret mÃĶrkeafdeling
YOLOv7-algoritmen planlÃĶgger at bruge en ny groft til fin led-guideret mÃĶrkeafdeling i stedet for den konventionelle Dynamic Label Assignment. Det er, fordi med dynamisk mÃĶrkeafdeling, trÃĶning af en model med multiple output-lag pÃĨfÃļrer nogle problemer, det mest almindelige af dem er, hvordan man tildeler dynamiske mÃĨl for forskellige grene og deres output.
Model-reparametrisering
Model-reparametrisering er et vigtigt koncept i objektgenkendelse, og dets brug fÃļlges ofte med nogle problemer under trÃĶning. YOLOv7-algoritmen planlÃĶgger at bruge konceptet om gradient-propagationsvej til at analysere model-reparametriseringspolitikkerne, der er anvendelige pÃĨ forskellige lag i netvÃĶrket.
Udvidelse og sammensat skala
YOLOv7-algoritmen introducerer ogsÃĨ udvidede og sammensatte skala-metoder til at udnytte og effektivt bruge parametre og beregninger til realtidsobjektgenkendelse.

YOLOv7: Relateret arbejde
Realtidsobjektgenkendelse
YOLO er nu branchestandarden, og de fleste realtidsobjektgenkendelsesmodeller deployer YOLO-algoritmer og FCOS (Fully Convolutional One-Stage Object-Detection). En state-of-the-art realtidsobjektgenkendelsesmodel har normalt fÃļlgende karakteristika
- StÃĶrkere og hurtigere netvÃĶrksarkitektur.
- En effektiv funktionssammensÃĶtningsmetode.
- En nÃļjagtig objektgenkendelsesmetode.
- En robust tab-funktion.
- En effektiv mÃĶrkeafdelingsmetode.
- En effektiv trÃĶningsmetode.
YOLOv7-algoritmen bruger ikke selv-supervised lÃĶring og destillationsmetoder, der ofte krÃĶver store mÃĶngder data. I stedet bruger YOLOv7-algoritmen en trÃĶnbar pose af gratisvarer-metode.
Model-reparametrisering
Model-reparametriseringsteknikker betragtes som en ensemble-teknik, der kombinerer multiple beregningsmoduler i en interferens-fase. Teknikken kan yderligere deles op i to kategorier, model-niveau ensemble og modul-niveau ensemble.
For at opnÃĨ den endelige interferensmodel, bruger model-niveau reparametriseringsteknikken to praksisser. Den fÃļrste praksis bruger forskellige trÃĶningsdata til at trÃĶne multiple identiske modeller og derefter gennemsnitligger vÃĶgtene af de trÃĶnede modeller. Alternativt bruger den anden praksis vÃĶgtene af modeller under forskellige iterationer.
Modul-niveau reparametrisering er ved at vinde stor popularitet, da den splitter en modul op i forskellige modul-grene eller forskellige identiske grene under trÃĶningsfasen og derefter integrerer disse forskellige grene i en ÃĶkvivalent modul under interferens.
Men reparametriseringsteknikker kan ikke anvendes pÃĨ alle typer af arkitektur. Det er derfor, YOLOv7-algoritmen bruger nye model-reparametriseringsteknikker til at designe relaterede strategier, der er egnet for forskellige arkitekturer.
Model-skala
Model-skala er processen med at skala en eksisterende model op eller ned, sÃĨ den passer til forskellige beregningsenheder. Model-skala bruger normalt en rÃĶkke faktorer som antallet af lag (dybde), stÃļrrelsen af input-billeder (oplÃļsning), antallet af funktionspyramider (stadie) og antallet af kanaler (bredde). Disse faktorer spiller en afgÃļrende rolle i at sikre en balanceret afvejning mellem netvÃĶrksparametre, interferenshastighed, beregning og modellens nÃļjagtighed.
En af de mest almindeligt brugte skala-metoder er NAS eller Network Architecture Search, der automatisk sÃļger efter passende skala-faktorer fra sÃļgemaskiner uden nogen komplicerede regler. Den stÃļrste ulempe ved at bruge NAS er, at det er en dyrekÃļbsmetode til at sÃļge efter passende skala-faktorer.
NÃĶsten hver model-reparametriseringsmodel analyserer individuelle og unikke skala-faktorer uafhÃĶngigt og optimerer derefter disse faktorer uafhÃĶngigt. Det er, fordi NAS-arkitekturen arbejder med ikke-korrelerede skala-faktorer.
Det er vÃĶrd at bemÃĶrke, at konkateneringsbaserede modeller som VoVNet eller DenseNet ÃĶndrer input-bredde af nogle lag, nÃĨr modellens dybde skalaeres. YOLOv7 arbejder pÃĨ en foreslÃĨet konkateneringsbaseret arkitektur og bruger derfor en sammensat skala-metode.

Figuren ovenfor sammenligner udvidede effektive lag-aggregationsnetvÃĶrk (E-ELAN) af forskellige modeller. Den foreslÃĨede E-ELAN-metode opretholder gradient-transmissionsvejen af den originale arkitektur, men forsÃļger at Ãļge kardinaliteten af de tilfÃļjede funktioner ved hjÃĶlp af gruppe-konvolution. Processen kan forbedre funktionerne, der lÃĶres af forskellige kort, og kan yderligere gÃļre brugen af beregninger og parametre mere effektiv.
YOLOv7-arkitektur
YOLOv7-modellen bruger YOLOv4-, YOLO-R- og Scaled YOLOv4-modellerne som grundlag. YOLOv7 er resultatet af eksperimenterne, der er udfÃļrt pÃĨ disse modeller for at forbedre resultaterne og gÃļre modellen mere nÃļjagtig.
Udvidet effektiv lag-aggregationsnetvÃĶrk eller E-ELAN
E-ELAN er den grundlÃĶggende byggesten i YOLOv7-modellen og er afledt af allerede eksisterende modeller pÃĨ netvÃĶrks-effektivitet, primÃĶrt ELAN.
De vigtigste overvejelser, nÃĨr man designer en effektiv arkitektur, er antallet af parametre, beregnings-tÃĶthed og mÃĶngden af beregning. Andre modeller overvejer ogsÃĨ faktorer som indflydelsen af input/output-kanal-forhold, grene i arkitektur-netvÃĶrket, netvÃĶrks-interferenshastighed, antallet af elementer i tensorerne af konvolutionsnetvÃĶrket og mere.
CSPVoNet-modellen overvejer ikke kun ovennÃĶvnte parametre, men analyserer ogsÃĨ gradient-paden for at lÃĶre mere diverse funktioner ved at aktivere vÃĶgtene af forskellige lag. Tilgangen tillader interferenserne at vÃĶre meget hurtigere og mere nÃļjagtige. ELAN-arkitekturen forsÃļger at designe et effektivt netvÃĶrk til at kontrollere den korteste lÃĶngste gradient-paden, sÃĨ netvÃĶrket kan vÃĶre mere effektivt i lÃĶring og konvergering.
ELAN har allerede nÃĨet en stabil fase uanset antallet af stabile komponent-blokke og gradient-paden. Den stabile tilstand kan ÃļdelÃĶgges, hvis komponent-blokke stablet ubegrÃĶnset, og parameter-udnyttelsesraten vil formindskes. Den foreslÃĨede E-ELAN-arkitektur kan lÃļse problemet, da den bruger udvidelse, ombytning og sammensÃĶtning af kardinalitet til at kontinuerligt forbedre netvÃĶrkets lÃĶrings-evne, samtidig med at den opretholder den originale gradient-paden.
Desuden, nÃĨr man sammenligner E-ELAN-arkitekturen med ELAN, er den eneste forskel i komponent-blokken, mens overgangslagets arkitektur er uÃĶndret.
E-ELAN foreslÃĨr at udvide kardinaliteten af komponent-blokke og udvide kanalen ved hjÃĶlp af gruppe-konvolution. Funktionen vil derefter blive beregnet og ombyttet i grupper efter gruppe-parametrene og derefter sammensat. Antallet af kanaler i hver gruppe vil forblive det samme som i den originale arkitektur. Til sidst vil grupperne af funktioner blive tilfÃļjet for at udfÃļre kardinalitet.
Model-skala for konkateneringsbaserede modeller
Model-skala hjÃĶlper med at justere attributter af modellerne, der hjÃĶlper med at generere modeller efter behov og i forskellige skalaer for at opfylde forskellige interferenshastigheder.

Figuren ovenfor diskuterer model-skala for forskellige konkateneringsbaserede modeller. Som du kan se i figur (a) og (b), Ãļges output-bredde af komponent-blokken med en Ãļgning i modellens dybde-skala. Resultatet er, at input-bredde af transmissions-lagene Ãļges. Hvis disse metoder implementeres pÃĨ konkateneringsbaseret arkitektur, udfÃļres skala-processen i dybde, og det er afbildet i figur (c).
Det kan derfor konkluderes, at det ikke er muligt at analysere skala-faktorerne uafhÃĶngigt for konkateneringsbaserede modeller, og de skal derfor overvejes eller analyseres sammen. Derfor er det passende at bruge den tilsvarende sammensatte model-skala-metode for en konkateneringsbaseret model. Desuden, nÃĨr dybde-faktoren skalaeres, skal output-kanalen af blokken ogsÃĨ skalaeres.
TrÃĶnbar pose af gratisvarer
En pose af gratisvarer er en term, der bruges af udviklere til at beskrive en samling af metoder eller teknikker, der kan ÃĶndre trÃĶningsstrategien eller omkostningerne i et forsÃļg pÃĨ at forbedre modellens nÃļjagtighed. SÃĨ hvad er disse trÃĶnbare poser af gratisvarer i YOLOv7? Lad os se.
Planlagt reparametriseret konvolution
YOLOv7-algoritmen bruger gradient-propagationsvej til at bestemme, hvordan man kombinerer en netvÃĶrks-reparametriseret konvolution. Denne tilgang af YOLOv7 er et forsÃļg pÃĨ at modstÃĨ RepConv-algoritmen, der selvom den har udfÃļrt serenely pÃĨ VGG-modellen, udfÃļrer dÃĨrligt, nÃĨr den anvendes direkte pÃĨ DenseNet- og ResNet-modellerne.
For at identificere forbindelserne i en konvolutionslag, kombinerer RepConv-algoritmen 3Ã3-konvolution og 1Ã1-konvolution.

Billedet ovenfor afbilder en planlagt reparametriseret model. Det kan ses, at YOLOv7-algoritmen fandt, at et lag i netvÃĶrket med konkatenerings- eller residuelle forbindelser ikke skulle have en identitets-forbindelse i RepConv-algoritmen. Resultatet er, at det er acceptabelt at skifte med RepConvN uden identitets-forbindelse.
Groft for auxiliÃĶr og fin for led-forluster
Dybe supervision er en gren af datalogi, der ofte finder sin anvendelse i trÃĶningsprocessen af dybe netvÃĶrk. Det grundlÃĶggende princip i dyb supervision er, at det tilfÃļjer en ekstra auxiliÃĶr-hoved i midten af netvÃĶrket sammen med de flade netvÃĶrks-vÃĶgte med assistent-tab som vejleder. YOLOv7-algoritmen henviser til hovedet, der er ansvarligt for den endelige output, som led-hoved, og auxiliÃĶr-hoved er hovedet, der assisterer i trÃĶningen.
Yderligere bruger YOLOv7 en anden metode til mÃĶrkeafdeling. Konventionelt er mÃĶrkeafdeling blevet brugt til at generere mÃĶrker ved at henviser direkte til grund-sandheden og pÃĨ baggrund af en given sÃĶt af regler. Imidlertid spiller fordelingen og kvaliteten af forudsigelses-input en vigtig rolle i at generere et pÃĨlideligt mÃĶrke. YOLOv7 genererer et blÃļdt mÃĶrke for objektet ved at bruge forudsigelserne af begrÃĶnsningsboks og grund-sandhed.
Desuden bruger YOLOv7-algoritmens nye mÃĶrkeafdelingsmetode led-hovedets forudsigelses-resultater til at vejlede bÃĨde led- og auxiliÃĶr-hoved. MÃĶrkeafdelingsmetoden har to foreslÃĨede strategier.
Led-hoved-vejledt mÃĶrkeafdelings-assigner
Strategien udfÃļrer beregninger pÃĨ baggrund af led-hovedets forudsigelses-resultater og grund-sandheden og derefter bruger optimering til at generere blÃļde mÃĶrker. Disse blÃļde mÃĶrker bruges derefter som trÃĶningsmodel for bÃĨde led-hoved og auxiliÃĶr-hoved.
Strategien fungerer pÃĨ antagelsen af, at da led-hoved har en stÃļrre lÃĶrings-evne, skal mÃĶrkerne, det genererer, vÃĶre mere reprÃĶsentative og korrelerer mellem kilde- og mÃĨl.
Groft-til-fin led-hoved-vejledt mÃĶrkeafdelings-assigner
Denne strategi udfÃļrer ogsÃĨ beregninger pÃĨ baggrund af led-hovedets forudsigelses-resultater og grund-sandheden og derefter bruger optimering til at generere blÃļde mÃĶrker. Imidlertid er der en vÃĶsentlig forskel. I denne strategi er der to sÃĶt af blÃļde mÃĶrker, groft niveau og fin mÃĶrke.
Det grofte mÃĶrke genereres ved at afslappe begrÃĶnsningerne for den positive prÃļve-tildegningsprocessen, der behandler flere gitter som positive mÃĨl. Det gÃļres for at undgÃĨ risikoen for at miste information pÃĨ grund af auxiliÃĶr-hovedets svagere lÃĶrings-styrke.

Figuren ovenfor forklarer brugen af en trÃĶnbar pose af gratisvarer i YOLOv7-algoritmen. Det afbilder groft for auxiliÃĶr-hoved og fin for led-hoved. NÃĨr vi sammenligner en model med auxiliÃĶr-hoved (b) med en normal model (a), vil vi observere, at skemaet i (b) har et auxiliÃĶr-hoved, mens det ikke er i (a).
Figuren (c) afbilder den almindelige uafhÃĶngige mÃĶrkeafdelings-assigner, mens figur (d) og figur (e) henholdsvis reprÃĶsenterer led-vejledt assigner og groft-til-fin led-vejledt assigner, der bruges af YOLOv7.
Andre trÃĶnbare poser af gratisvarer
Ud over de ovennÃĶvnte bruger YOLOv7-algoritmen yderligere trÃĶnbare poser af gratisvarer, selvom de ikke blev foreslÃĨet af dem oprindeligt. De er
- Batch-normalisering i Conv-Bn-Activation-teknologi: Denne strategi bruges til at tilslutte en konvolutionslag direkte til batch-normaliseringslaget.
- Implicit viden i YOLOR: YOLOv7 kombinerer strategien med konvolutionsfunktionen.
- EMA-model: EMA-modellen bruges som en slut-reference-model i YOLOv7, selvom dens primÃĶre brug er til at blive brugt i den gennemsnitlige lÃĶrer-metode.
YOLOv7: Eksperimenter
Eksperimentel opsÃĶtning
YOLOv7-algoritmen bruger Microsoft (MSFT ) COCO-datasÃĶttet til trÃĶning og validering af deres objektgenkendelsesmodel, og ikke alle disse eksperimenter bruger en fortrÃĶnet model. Udviklerne brugte 2017-trÃĶningsdatasÃĶttet til trÃĶning og brugte 2017-valideringsdatasÃĶttet til at vÃĶlge hyperparametrene. Til sidst sammenlignes YOLOv7-objektgenkendelsesresultaterne med state-of-the-art-algoritmer for objektgenkendelse.
Udviklerne designede en basis-model for kant-GPU (YOLOv7-tiny), normal GPU (YOLOv7) og cloud-GPU (YOLOv7-W6). Desuden bruger YOLOv7-algoritmen ogsÃĨ en basis-model til model-skala efter forskellige service-krav og fÃĨr forskellige modeller. For YOLOv7-algoritmen udfÃļres stak-skala pÃĨ halsen, og foreslÃĨede sammensatte er brugt til at skala op dybde og bredde af modellen.
Baseline
YOLOv7-algoritmen bruger tidligere YOLO-modeller og YOLOR-objektgenkendelsesalgoritmen som baseline.

Figuren ovenfor sammenligner baseline af YOLOv7-modellen med andre objektgenkendelsesmodeller, og resultaterne er ret ÃĨbenlyse. NÃĨr det sammenlignes med YOLOv4-algoritmen, bruger YOLOv7 ikke kun 75% fÃĶrre parametre, men det bruger ogsÃĨ 15% fÃĶrre beregning og har 0,4% hÃļjere nÃļjagtighed.Â
Sammenligning med state-of-the-art objektgenkendelsesmodeller

Figuren ovenfor viser resultaterne, nÃĨr YOLOv7 sammenlignes med state-of-the-art objektgenkendelsesmodeller for mobile og generelle GPUâer. Det kan observeres, at metoden foreslÃĨet af YOLOv7-algoritmen har den bedste hastighed-nÃļjagtigheds-handel.
Ablationsstudie: ForeslÃĨet sammensat skala-metode

Figuren ovenfor sammenligner resultaterne af at bruge forskellige strategier til at skala op modellen. Skala-strategien i YOLOv7-modellen skalaer op dybden af komponent-blokken med 1,5 gange og skalaer bredde med 1,25 gange.
NÃĨr det sammenlignes med en model, der kun skalaer op dybden, udfÃļrer YOLOv7-modellen bedre med 0,5%, mens den bruger fÃĶrre parametre og beregning. PÃĨ den anden side, nÃĨr det sammenlignes med modeller, der kun skalaer op dybden, forbedrer YOLOv7âs nÃļjagtighed med 0,2%, men antallet af parametre skal skalaeres med 2,9%, og beregning med 1,2%.
ForeslÃĨet planlagt reparametriseret model
For at verificere almenheden af dens foreslÃĨede reparametriserede model, bruger YOLOv7-algoritmen den pÃĨ residual-baserede og konkateneringsbaserede modeller til verificering. Til verificeringsprocessen bruger YOLOv7-algoritmen 3-stacked ELAN til konkateneringsbaseret model og CSPDarknet til residual-baseret model.
For konkateneringsbaseret model erstatter algoritmen 3Ã3-konvolutionslagene i 3-stacked ELAN med RepConv. Figuren nedenfor viser den detaljerede konfiguration af Planlagt RepConv og 3-stacked ELAN.

Desuden, nÃĨr det kommer til residual-baseret model, bruger YOLOv7-algoritmen en omvendt mÃļrk blok, da den originale mÃļrke blok ikke har en 3Ã3-konvolutionsblok. Figuren nedenfor viser arkitekturen af den omvendte CSPDarknet, der omvender positionerne af 3Ã3- og 1Ã1-konvolutionslagene.

Forelagt assistent-tab for auxiliÃĶr-hoved
For assistent-tab for auxiliÃĶr-hoved sammenligner YOLOv7-modellen den uafhÃĶngige mÃĶrkeafdeling for auxiliÃĶr-hoved og led-hoved-metoder.

Figuren ovenfor indeholder resultaterne af studiet om den foreslÃĨede auxiliÃĶr-hoved. Det kan ses, at den samlede prÃĶstation af modellen Ãļger med en Ãļgning i assistent-tab. Desuden udfÃļrer led-vejledt mÃĶrkeafdeling foreslÃĨet af YOLOv7-modellen bedre end uafhÃĶngige led-tildegningsstrategier.
YOLOv7-resultater
Basert pÃĨ ovennÃĶvnte eksperimenter, her er resultaterne af YOLOv7âs prÃĶstation, nÃĨr det sammenlignes med andre objektgenkendelsesalgoritmer.

Figuren ovenfor sammenligner YOLOv7-modellen med andre objektgenkendelsesalgoritmer, og det kan tydeligt ses, at YOLOv7 overgÃĨr andre objektgenkendelsesmodeller i forhold til Gennemsnitlig PrÃĶcision (AP) v/s batch-interferens.
Desuden sammenligner figuren nedenfor YOLOv7âs prÃĶstation med andre realtidsobjektgenkendelsesalgoritmer. Endnu en gang overgÃĨr YOLOv7 andre modeller i forhold til den samlede prÃĶstation, nÃļjagtighed og effektivitet.

Her er nogle yderligere observationer fra YOLOv7-resultater og -prÃĶstationer.
- YOLOv7-Tiny er den mindste model i YOLO-familien, med over 6 millioner parametre. YOLOv7-Tiny har en gennemsnitlig prÃĶcision pÃĨ 35,2%, og det overgÃĨr YOLOv4-Tiny-modellerne med sammenlignelige parametre.
- YOLOv7-modellen har over 37 millioner parametre og overgÃĨr modeller med hÃļjere parametre som YOLov4.
- YOLOv7-modellen har den hÃļjeste mAP og FPS-rate i omrÃĨdet fra 5 til 160 FPS.
Konklusion
YOLO eller You Only Look Once er den mest avancerede objektgenkendelsesmodel i moderne computer vision. YOLO-algoritmen er kendt for sin hÃļje nÃļjagtighed og effektivitet og finder derfor udstrakt anvendelse i realtidsobjektgenkendelsesindustrien. Siden den fÃļrste YOLO-algoritme blev introduceret tilbage i 2016, har eksperimenter gjort det muligt for udviklere at forbedre modellen kontinuerligt.
YOLOv7-modellen er den seneste tilfÃļjelse til YOLO-familien og er den mest kraftfulde YOLO-algoritme til dato. I denne artikel har vi talt om grundlÃĶggende principper for YOLOv7 og forsÃļgt at forklare, hvad der gÃļr YOLOv7 sÃĨ effektiv.












