AI-modeller og plattformer
YOLO-World: Sanntids åpen-vokabular objekt-deteksjon
Objekt-deteksjon har vært en grunnleggende utfordring i datavisjon-industrien, med anvendelser i robotikk, bildeforståelse, autonome kjøretøy og bildeforskjell. I de senere årene har banebrytende arbeid i AI, særlig gjennom dybe neurale nettverk, betydelig fremmet objekt-deteksjon. Imidlertid har disse modellene en begrenset vokabular, begrenset til å detektere objekter innenfor de 80 kategoriene i COCO-datasettet. Denne begrensningen skyldes treningsprosessen, der objekt-detektorer trenes til å gjenkjenne bare bestemte kategorier, og dermed begrenser deres anvendelighet.
For å overvinne dette, presenterer vi YOLO-World, en innovativ tilnærming som har til hensikt å forbedre YOLO-rammeverket (You Only Look Once) med åpen-vokabular-deteksjonsfunksjoner. Dette oppnås ved å for-treningsrammeverket på store datasett og implementere en visuelt-språklig modelleringstilnærming. Spesifikt bruker YOLO-World en Re-parameterizable Vision-Language Path Aggregation Network (RepVL-PAN) og region-tekst-kontrastiv tap for å fremme samspill mellom språklig og visuell informasjon. Gjennom RepVL-PAN og region-tekst-kontrastiv tap kan YOLO-World nøyaktig detektere et bredt spekter av objekter i en null-skudd-innstilling, og viser bemerkelsesverdig ytelse i åpen-vokabular-segmentering og objekt-deteksjonsoppgaver.
Denne artikkelen har til hensikt å gi en grundig forståelse av YOLO-Worlds tekniske grunnlag, modellarkitektur, treningsprosess og anvendelsesscenarier. La oss dykke ned i det.
YOLO-World: Sanntids åpen-vokabular objekt-deteksjon
YOLO eller You Only Look Once er en av de mest populære metodene for moderne objekt-deteksjon i datavisjon-industrien. Kjent for sin utrolige hastighet og effisiens, har introduksjonen av YOLO-mekanismen revolusjonert måten maskiner tolker og detekterer bestemte objekter i bilder og videoer i sanntid. Tradisjonelle objekt-deteksjonsrammeverk implementerer en to-trinns objekt-deteksjonsmetode: i det første trinnet foreslår rammeverket regioner som kan inneholde objektet, og klassifiserer objektet i neste trinn. YOLO-rammeverket på den andre siden integrerer disse to trinnene i ett enkelt neuralt nettverksmodell, en tilnærming som tillater rammeverket å se på bildet bare en gang for å forutsi objektet og dets plassering i bildet, og derfor navnet YOLO eller You Only Look Once.
Videre behandler YOLO-rammeverket objekt-deteksjon som et regresjonsproblem, og forutsier klasse-sannsynlighet og avgrensningsskjermer direkte fra hele bildet i ett enkelt blikk. Implementeringen av denne metoden øker ikke bare hastigheten på detekteringsprosessen, men også evnen til å generalisere fra komplekse og mangfoldige data, noe som gjør det til et egnet valg for applikasjoner som opererer i sanntid, som autonome kjøretøy, hastighetsdeteksjon eller nummerplatedeteksjon. Videre har den betydelige fremgangen i dybe neurale nettverk de siste årene også bidratt betydelig til utviklingen av objekt-deteksjonsrammeverk, men suksessen til objekt-deteksjonsrammeverk er fortsatt begrenset siden de bare kan detektere objekter med begrenset vokabular. Det skyldes hovedsakelig at når objekt-kategoriene er definert og merket i datasettet, er trenede detektorer i rammeverket i stand til å gjenkjenne bare disse bestemte kategoriene, og dermed begrenser deres anvendelighet og evne til å deployere objekt-deteksjonsmodeller i sanntid og åpne scenarioer.
Nylig utviklede visuelt-språklige modeller bruker destillert vokabular-kunnskap fra språk-kodere for å håndtere åpen-vokabular-deteksjon. Selv om disse rammeverkene utfører bedre enn tradisjonelle objekt-deteksjonsmodeller på åpen-vokabular-deteksjon, har de fortsatt begrenset anvendelighet på grunn av den knappe tilgjengeligheten av treningsdata med begrenset vokabular-mangfold. Videre foreslår noen rammeverk å treningsåpne-vokabular-detektorer i stor skala, og kategoriserer treningsobjekt-detektorer som region-nivå visuelt-språklig for-treningsprosess. Imidlertid sliter tilnærmingen fortsatt med å detektere objekter i sanntid på grunn av to primære årsaker: kompleks deploy-prosess for kant-enheter, og tungt beregningskrav. På den positive siden har disse rammeverkene vist positive resultater fra for-treningsstore detektorer for å bruke dem med åpen-gjenkjenningsfunksjoner.
YOLO-World-rammeverket har til hensikt å oppnå høyt effektiv åpen-vokabular-objekt-deteksjon, og utforske muligheten for stor-skala for-trenings-tilnærming til å forbedre effektiviteten til tradisjonelle YOLO-detektorer for åpen-vokabular-objekt-deteksjon. I motsetning til tidligere arbeid i objekt-deteksjon, viser YOLO-World-rammeverket bemerkelsesverdig effisiens med høye inferens-hastigheter, og kan deployes på nedstrøms-applikasjoner med lett. YOLO-World-modellen følger den tradisjonelle YOLO-arkitekturen, og koder innputt-tekster ved å utnytte evnene til en for-trent CLIP-tekst-koder. Videre inkluderer YOLO-World-rammeverket en Re-parameterizable Vision-Language Path Aggregation Network (RepVL-PAN)-komponent i sin arkitektur for å koble bilde- og tekst-egenskaper for å forbedre visuelt-semantiske representasjoner. Under inferens-fasen fjerner rammeverket tekst-koderen, og om-parametriserer tekst-embeddings til RepVL-PAN-vektorer, noe som resulterer i effektiv deploy. Rammeverket inkluderer også region-tekst-kontrastiv læring i sin rammeverk for å studere åpen-vokabular-for-treningsmetoder for tradisjonelle YOLO-modeller. Region-tekst-kontrastiv læring-metoden forener bilde-tekst-data, grunnings-data og detekterings-data i region-tekst-par. Bygget på dette, viser YOLO-World-rammeverket, som er for-trent på region-tekst-par, bemerkelsesverdig evne til åpen og stor vokabular-deteksjon. Videre utforsker YOLO-World-rammeverket også en prompt-then-detekt-paradigme med målet å forbedre effektiviteten til åpen-vokabular-objekt-deteksjon i sanntid og sanntids-scenarier.
Som vist i følgende bilde, fokuserer tradisjonelle objekt-detektorer på en lukket mengde av fast vokabular-deteksjon med forhåndsdefinerte kategorier, mens åpen-vokabular-detektorer detekterer objekter ved å kode bruker-forespørsler med tekst-kodere for åpen vokabular. I sammenligning, bygger YOLO-Worlds prompt-then-detekt-tilnærming først en offline-vokabular (varierende vokabular for varierende behov) ved å kode bruker-forespørsler, noe som tillater detektorer å tolke offline-vokabular i sanntid uten å måtte re-kode forespørsler.

YOLO-World : Metode og Arkitektur
Region-tekst-par
Tradisjonelt er objekt-deteksjonsrammeverk, inkludert YOLO-familien av objekt-detektorer, trenet med instans-annotasjoner som inneholder kategori-merker og avgrensningsskjermer. I motsetning reformulerer YOLO-World-rammeverket instans-annotasjoner som region-tekst-par, hvor teksten kan være beskrivelsen av objektet, substantiver eller kategori-navn. Det er verdt å merke seg at YOLO-World-rammeverket både tar tekst og bilder som inn- og ut-data og forutsier avgrensningsskjermer med tilhørende objekt-embeddings.
Modell-arkitektur
I kjernen består YOLO-World-modellen av en tekst-koder, en YOLO-detektor og Re-parameterizable Vision-Language Path Aggregation Network (RepVL-PAN)-komponenten, som vist i følgende bilde.

For en inn-tekst, koder tekst-koder-komponenten teksten til tekst-embeddings, etterfulgt av uttrekk av multi-skala-egenskaper fra inn-bildet ved bilde-detektorer i YOLO-detektor-komponenten. Re-parameterizable Vision-Language Path Aggregation Network (RepVL-PAN)-komponenten utnytter deretter kryss-modalt fusjon mellom tekst- og egenskaps-embeddings for å forbedre tekst- og bilde-representasjoner.
YOLO-detektor
YOLO-World-modellen er bygget på toppen av den eksisterende YOLOv8-rammeverket, som inneholder en Darknet-ryggrad-komponent som bilde-koder, et hode for objekt-embeddings og avgrensningsskjerme-regresjon, og en PAN eller Path Aggression Network for multi-skala-egenskaps-pyramider.
Tekst-koder
For en gitt tekst, trekker YOLO-World-modellen ut tilhørende tekst-embeddings ved å bruke en for-trent CLIP-Transformer-tekst-koder med et bestemt antall substantiver og embedding-dimensjon. Hovedårsaken til at YOLO-World-rammeverket bruker en CLIP-tekst-koder, er at den tilbyr bedre visuelt-semantisk ytelse for å koble tekst med visuelle objekter, og overstiger betydelig tradisjonelle tekst-bare språk-kodere. Imidlertid, hvis inn-teksten er enten en undertittel eller en henvisning, velger YOLO-World-modellen en enklere n-gram-algoritme for å trekke ut fraser. Disse frasene blir deretter matet til tekst-koderen.
Tekst-kontrastiv hode
Decoupled hode er en komponent brukt av tidligere objekt-deteksjonsmodeller, og YOLO-World-rammeverket bruker en decoupled hode med doble 3×3-konvolusjoner for å regresse objekt-embeddings og avgrensningsskjermer for et fast antall objekter. YOLO-World-rammeverket bruker en tekst-kontrastiv hode for å få objekt-tekst-lignhet ved å bruke L2-normalisering-tilnærming og tekst-embeddings. Videre bruker YOLO-World-modellen også en affin-transformasjons-tilnærming med en forskyvingsfaktor og en lærbart skaleringsfaktor, med L2-normalisering og affin-transformasjon som forbedrer stabiliteten til modellen under region-tekst-treningsprosessen.
Online-vokabular-treningsprosess
Under treningsfasen, konstruerer YOLO-World-modellen en online-vokabular for hver mosaikk-eksempel bestående av 4 bilder hver. Modellen sampler alle positive substantiver inkludert i mosaikk-bildene, og sampler noen negative substantiver tilfeldig fra det tilhørende datasettet. Vokabularet for hver eksempel består av et maksimum av n substantiver, med standardverdien 80.
Offline-vokabular-inferens
Under inferens-fasen, presenterer YOLO-World-modellen en prompt-then-detekt-strategi med offline-vokabular for å ytterligere forbedre effektiviteten til modellen. Brukeren definerer først en rekke tilpassede forespørsler som kan inkludere kategorier eller undertitler. YOLO-World-modellen trekker deretter offline-vokabular-embeddings ved å bruke tekst-koderen for å kode disse forespørsler. Som resultat, hjelper offline-vokabularet under inferens modellen til å unngå beregninger for hver inn-data, og tillater også modellen å justere vokabularet fleksibelt i henhold til kravene.
Re-parameterizable Vision-Language Path Aggression Network (RevVL-PAN)
Følgende figur illustrerer strukturen til den foreslåtte Re-parameterizable Vision-Language Path Aggregation Network, som følger topp-ned og bunn-opp-patene for å etablere egenskaps-pyramiden med multi-skala-egenskaps-bilder.

For å forbedre interaksjonen mellom tekst- og bilde-egenskaper, foreslår YOLO-World-modellen en Image-Pooling Attention og en Text-guided CSPLayer (Cross-Stage Partial Layers) med målet å forbedre visuelt-semantiske representasjoner for åpen-vokabular-kapasiteter. Under inferens-fasen, om-parametriserer YOLO-World-modellen offline-vokabular-embeddings til vekter i lineære eller konvolusjonelle lag for effektiv deploy.
Som det kan ses i figuren ovenfor, bruker YOLO-World-modellen CSPLayer etter topp-ned eller bunn-opp-fusjon, og inkorporerer tekst-veiledning i multi-skala-bilde-egenskaper, og danner Text-Guided CSPLayer, og utvider dermed CSPLayer. For en gitt bilde-egenskap og dens tilhørende tekst-embedding, bruker modellen maks-sigmoid-oppmerksomhet etter siste bottleneck-blokke for å aggregere tekst-egenskaper i bilde-egenskaper. Den oppdaterte bilde-egenskapen blir deretter konkatenerert med cross-stage-egenskaper, og presenteres som utdata.
Videre aggregater YOLO-World-modellen bilde-egenskaper for å oppdatere tekst-embedding ved å introdusere Image Pooling Attention-laget for å forbedre tekst-embeddings med bilde-bevisst informasjon. I stedet for å bruke cross-attention direkte på bilde-egenskaper, utnytter modellen maks-pooling på multi-skala-egenskaper for å få 3×3-regioner, noe som resulterer i 27 patch-tokens, og modellen oppdaterer tekst-embeddings i neste trinn.
For-trenings-skemata
YOLO-World-modellen følger to primære for-trenings-skemata: Læring fra Region-tekst-kontrastiv tap og Pseudo-merking med bilde-tekst-data. For det primære for-trenings-schemat, utsteder modellen objekt-forutsigelser sammen med annotasjoner for en gitt tekst og mosaikk-eksempler. YOLO-World-rammeverket matcher forutsigelser med grunn-sannhet-annotasjoner ved å følge og utnytte oppgave-tildelt-etikett-tildeling, og tildeler enkelt-positive forutsigelser med en tekst-indeks som tjener som klassifiserings-etikett. På den andre siden, foreslår Pseudo-merking med bilde-tekst-data for-trenings-schemat å bruke en automatisert merking-tilnærming i stedet for å bruke bilde-tekst-par for å generere region-tekst-par. Den foreslåtte merking-tilnærmingen består av tre trinn: uttrekk substantiver, pseudo-merking, og filtrering. Det første trinnet bruker n-gram-algoritmen for å uttrekke substantiver fra inn-teksten, det andre trinnet bruker en for-trent åpen-vokabular-detektor for å generere pseudo-bokser for den gitte substantivet for enkelt-bilder, mens det tredje og siste trinnet bruker en for-trent CLIP-rammeverk for å evaluere relevansen av region-tekst- og tekst-bilde-par, og modellen filtrerer lav-relevans pseudo-bilder og annotasjoner.
YOLO-World : Resultater
Når YOLO-World-modellen er for-trent, blir den evaluert direkte på LVIS-datasettet i en null-skudd-innstilling, med LVIS-datasettet bestående av over 1200 kategorier, betydelig mer enn for-trenings-datasettene brukt av eksisterende rammeverk for å teste deres ytelse på stor-vokabular-deteksjon. Følgende figur demonstrerer ytelsen til YOLO-World-rammeverket sammen med noen av de eksisterende statiske objekt-deteksjons-rammeverk på LVIS-datasettet i en null-skudd-innstilling.

Som det kan observeres, overstiger YOLO-World-rammeverket de fleste eksisterende rammeverk i forhold til inferens-hastigheter og null-skudd-ytelse, selv med rammeverk som Grounding DINO, GLIP og GLIPv2 som inkorporerer mer data. Samlet sett demonstrerer resultater at små objekt-deteksjons-modeller som YOLO-World-S med bare 13 millioner parametre kan brukes for for-trenings-oppgaver med åpen-vokabular-kapasiteter.
Slutt-tanker
I denne artikkelen har vi diskutert YOLO-World, en innovativ tilnærming som har til hensikt å forbedre YOLO-rammeverket med åpen-vokabular-deteksjonsfunksjoner ved å for-treningsrammeverket på store datasett og implementere en visuelt-språklig modelleringstilnærming. For å være mer spesifik, foreslår YOLO-World-rammeverket å implementere en Re-parameterizable Vision Language Path Aggregation Network eller RepVL-PAN sammen med region-tekst-kontrastiv tap for å fremme interaksjon mellom språklig og visuell informasjon. Ved å implementere RepVL-PAN og region-tekst-kontrastiv tap, er YOLO-World-rammeverket i stand til å nøyaktig og effektivt detektere et bredt spekter av objekter i en null-skudd-innstilling.












