AI-modeller og plattformer

YOLOv7: Den mest avanserte objektgjenkjenning-algoritmen?

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

6. juli 2022 vil bli husket som en milepæl i AI-historien, for det var på denne dagen at YOLOv7 ble lansert. Siden lanseringen har YOLOv7 vært det heteste temaet i Computer Vision-utviklermiljøet, og med god grunn. YOLOv7 regnes allerede som en milepæl i objektgjenkjenningindustrien.

Kort tid etter at YOLOv7-papiret ble publisert, viste det seg å være den raskeste og mest nøyaktige sanntidsobjektgjenkjenningmodellen. Men hvordan overgår YOLOv7 sine forgjengere? Hva gjør YOLOv7 så effektiv i å utføre datavisjonsoppgaver?

I denne artikkelen vil vi prøve å analysere YOLOv7-modellen og finne svaret på hvorfor YOLOv7 nå blir bransjestandard. Men før vi kan svare på det, må vi se på den korte historien om objektgjenkjenning.

Hva er objektgjenkjenning?

Objektgjenkjenning er en gren i datavisjon som identifiserer og lokaliserer objekter i et bilde eller en videofil. Objektgjenkjenning er byggesteinen for mange applikasjoner, inkludert selvkjørende biler, overvåket overvåking og selv robotikk.

En objektgjenkjenningmodell kan deles inn i to forskjellige kategorier, single-shot-detectorer og multi-shot-detectorer.

Sanntidsobjektgjenkjenning

For å virkelig forstå hvordan YOLOv7 fungerer, er det essensielt for oss å forstå YOLOv7s hovedmål, “sanntidsobjektgjenkjenning”. Sanntidsobjektgjenkjenning er en nøkkelkomponent i moderne datavisjon. Sanntidsobjektgjenkjenningmodellene prøver å identifisere og lokalisere objekter av interesse i sanntid. Sanntidsobjektgjenkjenningmodellene gjorde det mulig for utviklere å spore objekter av interesse i en flytende ramme, som en video eller en direkte overvåkingsinnputt.

Sanntidsobjektgjenkjenningmodellene er essensielt et skritt foran de konvensjonelle bilde-gjenkjenningmodellene. Mens den førstnevnte brukes til å spore objekter i videofiler, lokaliserer og identifiserer den sistnevnte objekter i en stasjonær ramme, som et bilde.

Som resultat er sanntidsobjektgjenkjenningmodellene svært effektive for videoanalyse, autonome kjøretøy, objekt-telling, multi-objekt-sporing og mye mer.

Hva er YOLO?

YOLO eller “You Only Look Once” er en familie av sanntidsobjektgjenkjenningmodeller. YOLO-konseptet ble først introdusert i 2016 av Joseph Redmon, og det var snart et tema i byen, fordi det var mye raskere og mer nøyaktig enn de eksisterende objektgjenkjenning-algoritmene. Det tok ikke lang tid før YOLO-algoritmen ble en standard i datavisjonsindustrien.

Det grunnleggende konseptet som YOLO-algoritmen foreslår, er å bruke en end-to-end neural nettverk som bruker avgrensning og klassifikasjonssannsynlighet til å gjøre prediksjoner i sanntid. YOLO var forskjellig fra de tidligere objektgjenkjenning-modellene i den forstand at det foreslo en annen tilnærming til å utføre objektgjenkjenning ved å omgjøre klassifikatorer.

Endringen i tilnærmingen fungerte, og YOLO ble snart bransjestandarden, da ytelsesgapet mellom seg selv og andre sanntidsobjektgjenkjenning-algoritmer var betydelig. Men hva var grunnen til at YOLO var så effektiv?

Når det sammenlignes med YOLO, brukte objektgjenkjenning-algoritmene tidligere Region Proposal Networks til å detektere mulige områder av interesse. Gjenkjenningen ble utført på hvert område separat. Som resultat, utførte disse modellene ofte flere iterasjoner på samme bilde, og derfor mangelen på nøyaktighet og høyere eksekveringstid. På den andre siden, bruker YOLO-algoritmen en enkelt fullt koblet lag til å utføre prediksjonen på en gang.

Hvordan fungerer YOLO?

Det finnes tre trinn som forklarer hvordan en YOLO-algoritme fungerer.

Omdefinere objektgjenkjenning som et enkelt regresjonsproblem

YOLO-algoritmen prøver å omdefinere objektgjenkjenning som et enkelt regresjonsproblem, inkludert bilde-piksler, til klassifikasjonssannsynlighet og avgrensning-koordinater. Derfor må algoritmen bare se på bildet en gang for å prediktere og lokalisere målobjektene i bildene.

Grunner bildet globalt

Videre, når YOLO-algoritmen gjør prediksjoner, grunner den bildet globalt. Det er forskjellig fra region-forlagte og glidende-teknikker, da YOLO-algoritmen ser hele bildet under trening og testing på datasettet, og kan kode kontekstuell informasjon om klassene og hvordan de opptrer.

Før YOLO, var Fast R-CNN en av de mest populære objektgjenkjenning-algoritmene som ikke kunne se den større konteksten i bildet, fordi det brukte å forveksle bakgrunns-patcher i et bilde med et objekt.

Generaliserer representasjonen av objekter

Til slutt, prøver YOLO-algoritmen også å generalisere representasjonen av objekter i et bilde. Som resultat, når en YOLO-algoritme ble kjørt på et datasett med naturlige bilder og testet for resultater, overgikk YOLO eksisterende R-CNN-modeller med en stor margin. Det er fordi YOLO er svært generaliserbar, og sjansene for at den bryter sammen når den implementeres på uventede innputt eller nye domener, er små.

YOLOv7: Hva er nytt?

Nå som vi har en grunnleggende forståelse av hva sanntidsobjektgjenkjenning-modeller er, og hva YOLO-algoritmen er, er det på tide å diskutere YOLOv7-algoritmen.

Optimerer treningprosessen

YOLOv7-algoritmen prøver ikke bare å optimere modell-arkitekturen, men den prøver også å optimere treningprosessen. Den prøver å bruke optimeringsmoduler og -metoder til å forbedre nøyaktigheten av objektgjenkjenning, styrke kostnadene for trening, samtidig som den opprettholder interferens-kostnadene. Disse optimeringsmodulene kan kalles en “treningbar pose med gratisvarer”.

Grovt til fin lead-guidet label-tilordning

YOLOv7-algoritmen planlegger å bruke en ny grovt til fin lead-guidet label-tilordning i stedet for den konvensjonelle dynamiske label-tilordningen.

Modell-re-parametrisering

Modell-re-parametrisering er et viktig konsept i objektgjenkjenning, og dens bruk er vanligvis fulgt av noen problemer under trening. YOLOv7-algoritmen planlegger å bruke konseptet gradient-propagasjon-spor til å analysere modell-re-parametriseringspolitikkene som er anvendelige på forskjellige lag i nettverket.

Utvid og sammensatt skala

YOLOv7-algoritmen innfører også utvidede og sammensatte skala-metoder for å utnytte og effektivt bruke parameterne og beregningene for sanntidsobjektgjenkjenning.

YOLOv7: Relatert arbeid

Sanntidsobjektgjenkjenning

YOLO er nå bransjestandarden, og de fleste sanntidsobjektgjenkjenning-modellene deployer YOLO-algoritmer og FCOS (Fullt konvolusjonelt ett-trinns objektgjenkjenning). En state-of-the-art sanntidsobjektgjenkjenning-modell har vanligvis følgende karakteristika

  • Sterkere og raskere nettverksarkitektur.
  • En effektiv metode for å integrere funksjoner.
  • En nøyaktig objektgjenkjenning-metode.
  • En robust tap-funksjon.
  • En effektiv label-tilordningsmetode.
  • En effektiv trening-metode.

YOLOv7-algoritmen bruker ikke selv-overvåket læring og destillasjonsmetoder som ofte krever store mengder data. I stedet bruker YOLOv7-algoritmen en treningbar pose med gratisvarer-metode.

Modell-re-parametrisering

Modell-re-parametriseringsteknikker regnes som en ensemble-teknikk som kombinerer flere beregningsmoduler i en interferens-fase. Teknikken kan deles inn i to kategorier, modell-nivå ensemble og modul-nivå ensemble.

Nå, for å få den endelige interferens-modellen, bruker modell-nivå re-parametriseringsteknikken to praksiser. Den første praksisen bruker forskjellige trening-data til å trene flere identiske modeller, og deretter gjennomsnittlig vekter av de trenede modellene. Alternativt, den andre praksisen gjennomsnittlig vekter av modeller under forskjellige iterasjoner.

Modul-nivå re-parametrisering er i ferd med å bli svært populær, og den deler en modul inn i forskjellige modul-grener eller forskjellige identiske grener under trening-fasen, og deretter integrerer disse forskjellige grenene i en ekvivalent modul under interferens.

Likevel, re-parametriseringsteknikker kan ikke brukes på alle typer arkitektur. Det er grunnen til at YOLOv7-algoritmen bruker nye modell-re-parametriseringsteknikker til å designe relaterte strategier som er egnet for forskjellige arkitekturer.

Modell-skala

Modell-skala er prosessen med å skala opp eller ned en eksisterende modell så den passer over forskjellige datamaskiner. Modell-skala bruker vanligvis en rekke faktorer som antall lag (dybde), størrelse på inndata-bilder (oppløsning), antall funksjons-pyramider (trinn) og antall kanaler (bredde). Disse faktorene spiller en avgjørende rolle i å sikre en balansert avveining for nettverksparametere, interferens-hastighet, beregning og nøyaktighet av modellen.

En av de mest vanlige skala-metodene er NAS eller Network Architecture Search, som automatisk søker etter egnet skala-faktorer fra søkemotorer uten noen kompliserte regler. Den største ulemper med å bruke NAS er at det er en dyr tilnærming til å søke etter egnet skala-faktorer.

Nærmest hver modell-re-parametriseringsmodell analyserer individuelle og unike skala-faktorer uavhengig, og videre, selv om de også optimaliserer disse faktorene uavhengig. Det er fordi NAS-arkitekturen arbeider med ikke-korrelerte skala-faktorer.

Det er verdt å merke seg at konkatenerings-baserte modeller som VoVNet eller DenseNet endrer inndata-bredde på noen lag når modell-dybden skaleres. YOLOv7 arbeider på en foreslått konkatenerings-basert arkitektur, og derfor bruker en sammensatt skala-metode.

Figuren over sammenligner de utvidede effektive lag-aggregationsnettverkene (E-ELAN) for forskjellige modeller. Den foreslåtte E-ELAN-metoden opprettholder gradient-overførings-stien til den opprinnelige arkitekturen, men prøver å øke kardinaliteten av de lagte funksjonene ved å bruke gruppe-konvolusjon. Prosessen kan forbedre funksjonene som er lært av forskjellige kart, og kan videre gjøre bruk av beregninger og parametere mer effektivt.

YOLOv7-arkitektur

YOLOv7-modellen bruker YOLOv4-, YOLO-R- og Scaled YOLOv4-modellene som sin basis. YOLOv7 er et resultat av eksperimentene som ble utført på disse modellene for å forbedre resultater og gjøre modellen mer nøyaktig.

Utvidet effektivt lag-aggregationsnettverk eller E-ELAN

E-ELAN er den grunnleggende byggesteinen for YOLOv7-modellen, og den er avledet fra eksisterende modeller på nettverkseffektivitet, hovedsakelig ELAN.

De viktigste overveielser ved å designe en effektiv arkitektur er antall parametere, beregnings-tetthet og mengden beregning. Andre modeller overveier også faktorer som innvirkningen av inndata/utdata-kanal-forhold, grener i arkitektur-nettverket, nettverks-interferens-hastighet, antall elementer i tensorer av konvolusjonsnettverk og mer.

CSPVoNet-modellen overveier ikke bare ovennevnte parametere, men den analyserer også gradient-stien for å lære mer diverse funksjoner ved å aktivere vekter av forskjellige lag. Tilnærmingen tillater interferensene å være mye raskere og mer nøyaktige. ELAN-arkitekturen prøver å designe et effektivt nettverk for å kontrollere den korteste lengste gradient-stien, så nettverket kan være mer effektivt i å lære og konvergere.

ELAN har allerede nådd en stabil fase uavhengig av antall stabile komputasjons-blokker og gradient-sti-lengde. Den stabile tilstanden kan bli ødelagt hvis komputasjons-blokkene stabler ubegrenset, og parameter-utnyttelses-raten vil bli redusert. Den foreslåtte E-ELAN-arkitekturen kan løse problemet, da den bruker utvidelse, shuffling og sammenslåing av kardinalitet for å kontinuerlig forbedre nettverkets lærings-evne samtidig som den opprettholder den opprinnelige gradient-stien.

Videre, når vi sammenligner arkitekturen til E-ELAN med ELAN, er den eneste forskjellen i komputasjons-blokken, mens overgangs-lagets arkitektur er uendret.

E-ELAN foreslår å utvide kardinaliteten av komputasjons-blokkene og utvide kanalen ved å bruke gruppe-konvolusjon. Funksjons-kartet vil deretter bli beregnet og shufflet inn i grupper etter gruppe-parameter, og deretter koblet sammen. Antall kanaler i hver gruppe vil forbli det samme som i den opprinnelige arkitekturen. Til slutt vil gruppen av funksjons-kart bli lagt til for å utføre kardinalitet.

Modell-skala for konkatenerings-baserte modeller

Modell-skala hjelper i å justere attributter av modellene som hjelper i å generere modeller etter behov og i forskjellige skalaer for å møte forskjellige interferens-hastigheter.

Figuren ovenfor diskuterer modell-skala for forskjellige konkatenerings-baserte modeller. Som du kan se i figur (a) og (b), øker utgangs-bredde av komputasjons-blokken med en økning i modell-dybden. Resultatet er at inndata-bredde av overførings-lagene øker. Hvis disse metodene implementeres på konkatenerings-basert arkitektur, utføres skala-prosessen i dybde, og det er avbildet i figur (c).

Det kan derfor konkluderes at det ikke er mulig å analysere skala-faktorene uavhengig for konkatenerings-baserte modeller, og at de må være sammenhengende. Derfor er det egnet å bruke den tilhørende sammensatte modell-skala-metoden for en konkatenerings-basert modell. I tillegg, når dybde-faktoren skaleres, må utgangs-kanalen av blokken også skaleres.

Treningsbar pose med gratisvarer

En pose med gratisvarer er en betegnelse som utviklere bruker for å beskrive en samling metoder eller tekniker som kan endre trening-strategien eller kostnaden i et forsøk på å forbedre modell-nøyaktigheten. Hva er disse treningsbare posene med gratisvarer i YOLOv7?

Planlagt re-parametrisert konvolusjon

YOLOv7-algoritmen bruker gradient-flux-propagasjon-spor til å bestemme hvordan å kombinere en nettverks-re-parametrisert konvolusjon. Denne tilnærmingen til YOLOv7 er et forsøk på å motvirke RepConv-algoritmen som, selv om den har fungert godt på VGG-modellen, fungerer dårlig når den brukes direkte på DenseNet- og ResNet-modellene.

For å identifisere forbindelsene i en konvolusjons-lag, kombinerer RepConv-algoritmen 3×3 konvolusjon og 1×1 konvolusjon. Hvis vi analyserer algoritmen, dens ytelse og arkitekturen, vil vi observere at RepConv ødelegger konkateneringen i DenseNet og residualen i ResNet.

Bildet ovenfor avbilder en planlagt re-parametrisert modell. Det kan sees at YOLOv7-algoritmen fant ut at et lag i nettverket med konkatenerings- eller residual-forbindelser ikke skulle ha en identitets-forbindelse i RepConv-algoritmen. Resultatet er at det er akseptabelt å bytte med RepConvN uten identitets-forbindelse.

Grovt for hjelpe- og fin for ledende tap

Dyp overvåking er en gren i datavitenskap som ofte finner sin anvendelse i trening-prosessen av dype nettverk. Den grunnleggende prinsippet for dyp overvåking er at den legger til en ekstra hjelpe-hode i midten av nettverket sammen med de grunnleggende nettverks-vektene med hjelpe-tap som guide. YOLOv7-algoritmen refererer til hodet som er ansvarlig for den endelige utgangen som ledende-hodet, og hjelpe-hodet er hodet som hjelper i treningen.

Videre, YOLOv7 bruker en annen metode for label-tilordning. Konvensjonelt har label-tilordning vært brukt til å generere labels ved å referere direkte til grunn-sannheten og på basis av en gitt sett med regler. Imidlertid, i de senere årene, spiller distribusjonen og kvaliteten av prediksjons-inndata en viktig rolle i å generere en pålitelig label.

YOLOv7 genererer en myk label av objektet ved å bruke prediksjonene av avgrensning og grunn-sannhet. Videre, den nye label-tilordnings-metoden til YOLOv7-algoritmen bruker ledende-hodets prediksjoner til å guide både ledende- og hjelpe-hodet.

Ledende-hode-guidet label-tilordner

Strategien gjør beregninger basert på ledende-hodets prediksjons-resultater og grunn-sannheten, og deretter bruker optimalisering til å generere myke labels. Disse myke labelene brukes deretter som trening-modell for både ledende- og hjelpe-hodet.

Strategien fungerer på antagelsen at, fordi ledende-hodet har en større lærings-evne, skal labelene det genererer være mer representative og korrelere mellom kilde og mål.

Grovt til fin ledende-hode-guidet label-tilordner

Denne strategien gjør også beregninger basert på ledende-hodets prediksjons-resultater og grunn-sannheten, og deretter bruker optimalisering til å generere myke labels. Imidlertid, det er en viktig forskjell. I denne strategien, er det to sett med myke labels, grovt nivå og fin label.

Det grove labelen genereres ved å slappe av begrensningene av den positive prøve-tilordnings-prosessen som behandler flere ruter som positive mål. Dette gjøres for å unngå risikoen for å miste informasjon på grunn av hjelpe-hodets svakere lærings-styrke.

Figuren ovenfor forklarer bruken av en treningsbar pose med gratisvarer i YOLOv7-algoritmen. Den avbilder grovt for hjelpe-hodet og fin for ledende-hodet. Når vi sammenligner en modell med hjelpe-hode (b) med en normal modell (a), vil vi observere at skjemaet i (b) har en hjelpe-hode, mens det ikke er i (a).

Figuren (c) avbilder den vanlige uavhengige label-tilordner, mens figur (d) og figur (e) henholdsvis representerer ledende-hodets guidet tilordner og grovt til fin ledende-hodets guidet tilordner brukt av YOLOv7.

Andre treningsbare poser med gratisvarer

I tillegg til de ovennevnte, bruker YOLOv7-algoritmen andre treningsbare poser med gratisvarer, selv om de ikke ble foreslått av dem opprinnelig. Disse inkluderer

  • Batch-normalisering i Conv-Bn-aktivasjonsteknologi: Denne strategien brukes til å koble en konvolusjons-lag direkte til en batch-normaliserings-lag.
  • Implisitt kunnskap i YOLOR: YOLOv7 kombinerer strategien med konvolusjons-funksjons-kartet.
  • EMA-modell: EMA-modellen brukes som en sluttfunksjonell modell i YOLOv7, selv om dens primære bruk er å brukes i den gjennomsnittlige lærings-metoden.

YOLOv7: Eksperimenter

Eksperimentell oppsett

YOLOv7-algoritmen bruker Microsoft COCO-datasettet for trening og validering av sin objektgjenkjenning-modell, og ikke alle disse eksperimentene bruker en forhånds-trent modell. Utviklerne brukte 2017-trening-datasettet for trening og brukte 2017-validerings-datasettet for å velge hyper-parametere. Til slutt, sammenlignes ytelsen av YOLOv7-objektgjenkjenning-resultatene med state-of-the-art-algoritmer for objektgjenkjenning.

Utviklerne designet en grunn-modell for kant-GPU (YOLOv7-tiny), normal GPU (YOLOv7) og sky-GPU (YOLOv7-W6). Videre, YOLOv7-algoritmen bruker også en grunn-modell for modell-skala etter forskjellige tjeneste-krav og får forskjellige modeller. For YOLOv7-algoritmen, skjer stakk-skala på halsen, og foreslåtte sammensatte modeller brukes til å skala opp dybden og bredden av modellen.

Baselinjer

YOLOv7-algoritmen bruker tidligere YOLO-modeller og YOLOR-objektgjenkjenning-algoritmen som sin baseline.

Figuren ovenfor sammenligner baseline av YOLOv7-modellen med andre objektgjenkjenning-modeller, og resultater er ganske tydelige. Når sammenlignet med YOLOv4-algoritmen, bruker YOLOv7 ikke bare 75% færre parametere, men den bruker også 15% mindre beregning og har 0,4% høyere nøyaktighet.

Sammenligning med state-of-the-art objektgjenkjenning-modeller

Figuren ovenfor viser resultater når YOLOv7 sammenlignes mot state-of-the-art objektgjenkjenning-modeller for mobile og generelle GPU-er. Det kan observeres at metoden foreslått av YOLOv7-algoritmen har den beste hastighet-nøyaktighet-avveining-scoren.

Ablasjon-studie: Foreslått sammensatt skala-metode

Figuren ovenfor sammenligner resultater av å bruke forskjellige strategier for å skala opp modellen. Skala-strategien i YOLOv7-modellen skalerer opp dybden av komputasjons-blokken med 1,5 ganger og skalerer bredden med 1,25 ganger.

Når sammenlignet med en modell som bare skalerer opp dybden, fungerer YOLOv7-modellen bedre med 0,5% mens den bruker færre parametere og beregnings-kraft. På den andre siden, når sammenlignet med modeller som bare skalerer opp dybden, er nøyaktigheten til YOLOv7 forbedret med 0,2%, men antall parametere må skaleres med 2,9% og beregning med 1,2%.

Foreslått planlagt re-parametrisert modell

For å verifisere generaliteten av sin foreslåtte re-parametriserte modell, bruker YOLOv7-algoritmen den på residual-baserte og konkatenerings-baserte modeller for verifisering. For verifiserings-prosessen, bruker YOLOv7-algoritmen 3-stakk ELAN for konkatenerings-basert modell og CSPDarknet for residual-basert modell.

For konkatenerings-basert modell, erstatter algoritmen 3×3 konvolusjons-lagene i 3-stakk ELAN med RepConv. Figuren nedenfor viser den detaljerte konfigurasjonen av Planlagt RepConv og 3-stakk ELAN.

Videre, når det gjelder residual-basert modell, bruker YOLOv7-algoritmen en omvendt mørk blokk, fordi den opprinnelige mørke blokken ikke har en 3×3 konvolusjons-blokk. Figuren nedenfor viser arkitekturen til den omvendte CSPDarknet som omvender posisjonene til 3×3 og 1×1 konvolusjons-lagene.

Proposed Assistant Loss for Auxiliary Head

For assistent-tap for hjelpe-hodet, sammenligner YOLOv7-modellen den uavhengige label-tilordningen for hjelpe-hodet og ledende-hodet-metodene.

Figuren ovenfor inneholder resultater av studien på den foreslåtte hjelpe-hodet. Det kan sees at den overordnede ytelsen til modellen øker med en økning i assistent-tap. Videre, den ledende-hode-guidede label-tilordningen foreslått av YOLOv7-modellen fungerer bedre enn uavhengige ledende-hode-tilordnings-strategier.

YOLOv7-resultater

Basert på ovennevnte eksperimenter, her er resultatet av YOLOv7s ytelse når sammenlignet med andre objektgjenkjenning-algoritmer.

Figuren ovenfor sammenligner YOLOv7-modellen med andre objektgjenkjenning-algoritmer, og det kan tydelig sees at YOLOv7 overstiger andre objektgjenkjenning-modeller i forhold til gjennomsnittlig presisjon (AP) versus batch-interferens.

Videre, figuren nedenfor sammenligner ytelsen til YOLOv7 versus andre sanntidsobjektgjenkjenning-algoritmer. Igjen, YOLOv7 overgår andre modeller i forhold til den overordnede ytelsen, nøyaktigheten og effektiviteten.

Her er noen ekstra observasjoner fra YOLOv7-resultatene og ytelsen.

  1. YOLOv7-Tiny er den minste modellen i YOLO-familien, med over 6 millioner parametere. YOLOv7-Tiny har en gjennomsnittlig presisjon på 35,2%, og den overgår YOLOv4-Tiny-modellene med sammenlignbare parametere.
  2. YOLOv7-modellen har over 37 millioner parametere, og den overgår modeller med flere parametere som YOLOv4.
  3. YOLOv7-modellen har den høyeste mAP og FPS-raten i rekkevidden 5 til 160 FPS.

Konklusjon

YOLO eller “You Only Look Once” er den mest avanserte objektgjenkjenning-modellen i moderne datavisjon. YOLO-algoritmen er kjent for sin høye nøyaktighet og effektivitet, og som resultat, finner den omfattende anvendelse i sanntidsobjektgjenkjenning-industrien. Siden den første YOLO-algoritmen ble introdusert tilbake i 2016, har eksperimenter tillatt utviklere å forbedre modellen kontinuerlig. YOLOv7-modellen er den siste tillegget i YOLO-familien, og den er den mest kraftfulle YOLO-algoritmen til dags dato. I denne artikkelen har vi diskutert grunnleggende prinsipper om YOLOv7, og prøvd å forklare hva som gjør YOLOv7 så effektiv.

YOLOv7-modellen er den siste tillegget i YOLO-familien, og den er den mest kraftfulle YOLO-algoritmen til dags dato. I denne artikkelen har vi diskutert grunnleggende prinsipper om YOLOv7, og prøvd å forklare hva som gjør YOLOv7 så effektiv.

En ingeniør av yrke, en forfatter av hjerte. Kunal er en teknisk forfatter med en dyp kjærlighet og forståelse av AI og ML, dedikert til å forenkle komplekse konsepter i disse feltene gjennom sin engasjerende og informerende dokumentasjon.