AI-modeller og platforme
YOLO-Verden: Real-Time Open-Vocabulary Objektdetektion
Objektdetektion har været en grundlæggende udfordring i computer vision-industrien, med anvendelser i robotteknologi, billedforståelse, selvstændige køretøjer og billedgenkendelse. I de seneste år har banebrydende arbejde med kunstig intelligens, især gennem dybe neurale netværk, betydeligt fremmet objektdetektion. Men disse modeller har en fast vokabular, begrænset til at detektere objekter inden for de 80 kategorier i COCO-datasættet. Denne begrænsning skyldes træningsprocessen, hvor objektdetektorer trænes til at genkende kun bestemte kategorier, og dermed begrænser deres anvendelighed.
For at overvinde dette introducerer vi YOLO-Verden, en innovativ tilgang, der sigter mod at forbedre YOLO-rammeverket (You Only Look Once) med åbent vokabular-detektionsfunktioner. Dette opnås ved at fortræne rammeverket på store datasæt og implementere en vision-sprog-modelleringstilgang. Specifikt anvender YOLO-Verden en Re-parameterizable Vision-Language Path Aggregation Network (RepVL-PAN) og region-tekst kontrastiv tab til at fremme samspillet mellem sproglig og visuel information. Gennem RepVL-PAN og region-tekst kontrastiv tab kan YOLO-Verden nøjagtigt detektere et bredt udvalg af objekter i en zero-shot-indstilling, og viser bemærkelsesværdig præstation i åbent vokabular-segmentering og objektdetektion.
Denne artikel sigter mod at give en grundig forståelse af YOLO-Verdens tekniske grundlag, modelarkitektur, træningsproces og anvendelsesscenarier. Lad os dykke ned i det.
YOLO-Verden: Real-Time Open-Vocabulary Objektdetektion
YOLO eller You Only Look Once er en af de mest populære metoder til moderne objektdetektion inden for computer vision-industrien. Kendt for sin utrolige hastighed og effektivitet, har YOLO-mekanismens opdukken revolutioneret, hvordan maskiner fortolker og detekterer bestemte objekter inden for billeder og videoer i realtid. Traditionelle objektdetektionsrammeverk implementerer en to-trins objektdetektionsmetode: i det første trin foreslår rammeverket regioner, der måske indeholder objektet, og rammeverket klassificerer objektet i det næste trin. YOLO-rammeverket integrerer disse to trin i en enkelt neuralt netværksmodel, en tilgang, der tillader rammeverket at se på billedet kun én gang for at forudsige objektet og dets placering inden for billedet, og derfor navnet YOLO eller You Only Look Once.
Desuden behandler YOLO-rammeverket objektdetektion som et regressionsproblem og forudsiger klasse-sandsynligheder og begrænsningsbokse direkte fra det fulde billede i ét blik. Implementeringen af denne metode øger ikke kun hastigheden af detektionsprocessen, men forbedrer også modellens evne til at generalisere fra komplekse og forskelligartede data, hvilket gør det til en egnet valg til anvendelser, der opererer i realtid, som f.eks. selvstændig kørsel, hastighedsdetektion eller nummerpladegenkendelse. Desuden har den betydelige fremgang i dybe neurale netværk i de seneste år også bidraget væsentligt til udviklingen af objektdetektionsrammeverk, men succesen med objektdetektionsrammeverk er stadig begrænset, da de kun kan detektere objekter med begrænset vokabular. Det skyldes primært, at når objektkategorierne er defineret og mærket i datasættet, er trænede detektorer i rammeverket kun i stand til at genkende disse bestemte kategorier, og dermed begrænser deres anvendelighed og evne til at udvikle objektdetektionsmodeller i realtid og åbne scenarier.
Ved at gå videre har nyligt udviklede vision-sprog-modeller udnyttet destilleret vokabular-kendskab fra sprog-encodere til at adresse åbent vokabular-detektion. Selvom disse rammeverk performer bedre end traditionelle objektdetektionsmodeller på åbent vokabular-detektion, har de stadig begrænset anvendelighed på grund af den knappe tilgængelighed af træningsdata med begrænset vokabular-mangfoldighed. Desuden træner udvalgte rammeverk åbent vokabular-detektorer i stor skala og kategoriserer træningsobjektdetektorer som region-niveau vision-sprog-fortræning. Men tilgangen kæmper stadig med at detektere objekter i realtid på grund af to primære årsager: kompleks installationsproces for kantenheder og tungt beregningskrævende krav. På den positive side har disse rammeverk dog vist positive resultater fra fortræning af store detektorer til at anvende dem med åbent genkendelsesfunktioner.
YOLO-Verden-rammeverket sigter mod at opnå højeffektiv åbent vokabular-objektdetektion og udforske muligheden for stor-skala-fortræningsmetoder til at forbedre effektiviteten af traditionelle YOLO-detektorer til åbent vokabular-objektdetektion. I modsætning til tidligere arbejde i objektdetektion viser YOLO-Verden-rammeverket bemærkelsesværdig effektivitet med høje inferenshastigheder og kan deployes på downstream-anvendelser med letthed. YOLO-Verden-modellen følger den traditionelle YOLO-arkitektur og kodificerer input-tekster ved at udnytte evnerne i en fortrænet CLIP-tekst-encoder. Desuden indeholder YOLO-Verden-rammeverket en Re-parameterizable Vision-Language Path Aggregation Network (RepVL-PAN)-komponent i sin arkitektur for at forbinde billed- og tekstfunktioner til forbedrede visuelt-semantiske repræsentationer. Under inferensfasen fjerner rammeverket tekst-encoderen og re-parametrerer tekst-embeddingene til RepVL-PAN-vægte, hvilket resulterer i effektiv deployment. Rammeverket indeholder også region-tekst kontrastiv læring i sin struktur for at studere åbent vokabular-fortræningsmetoder til traditionelle YOLO-modeller. Region-tekst kontrastiv læringmetoden samler billed-tekst-data, grundlæggende data og detektionsdata i region-tekst-par. Bygget på dette viser YOLO-Verden-rammeverket, der er fortrænet på region-tekst-par, bemærkelsesværdige evner til åbent og stort vokabular-detektion. Desuden udforsker YOLO-Verden-rammeverket også en prompt-then-detect-paradigme med det formål at forbedre effektiviteten af åbent vokabular-objektdetektion i realtid og realverden-scenarier.
Som vist i følgende billede fokuserer traditionelle objektdetektorer på en lukket samling af fast vokabular-detektion med foruddefinerede kategorier, hvorimod åbent vokabular-detektorer detekterer objekter ved at kodificere brugerprompts med tekst-encodere til åbent vokabular. I sammenligning bygger YOLO-Verdens prompt-then-detect-tilgang først en offline-vokabular (varierende vokabular for varierende behov) ved at kodificere brugerprompts, hvilket tillader detektorerne at fortolke det offline-vokabular i realtid uden at skulle gen-kodificere prompts.

YOLO-Verden: Metode og Arkitektur
Region-Tekst-Par
Traditionelt trænes objektdetektionsrammeverk, herunder YOLO-familien af objektdetektorer, ved hjælp af instans-annotationer, der indeholder kategorimærker og begrænsningsbokse. I modsætning hertil omformulerer YOLO-Verden-rammeverket instans-annotationer som region-tekst-par, hvor teksten kan være beskrivelsen af objektet, substantiver eller kategorinavn. Det er værd at bemærke, at YOLO-Verden-rammeverket antager både tekster og billeder som input og output forudsigelser af bokse med deres respektive objektembedding.
Modelarkitektur
I sin kerne består YOLO-Verden-modellen af en tekst-encoder, en YOLO-detektor og Re-parameterizable Vision-Language Path Aggregation Network (RepVL-PAN)-komponenten, som vist i følgende billede.

Til en given tekst kodificerer tekst-encoder-komponenten teksten til tekst-embedding, efterfulgt af extraction af multi-skala-funktioner fra input-billedet af billed-detektor-komponenten i YOLO-detektoren. Re-parameterizable Vision-Language Path Aggregation Network (RepVL-PAN)-komponenten udnytter herefter krydsmodalt fusion mellem tekst- og funktion-embedding til at forbedre tekst- og billed-repræsentationer.
YOLO-Detektor
YOLO-Verden-modellen er bygget oven på den eksisterende YOLOv8-ramme, der indeholder en Darknet-baggrundskomponent som billed-encoder, et hoved til objektembedding og begrænsningsboks-regression, og en PAN eller Path Aggression Network til multi-skala-funktion-pyramider.
Tekst-Encoder
Til en given tekst extractor YOLO-Verden-modellen de respektive tekst-embedding ved at antage en fortrænet CLIP-Transformer-tekst-encoder med et bestemt antal substantiver og embedding-dimension. Den primære grund til, at YOLO-Verden-rammeverket antager en CLIP-tekst-encoder, er, at det tilbyder bedre visuelt-semantisk præstation til at forbinde tekster med visuelle objekter, og overgår betydeligt traditionelle tekst-kun-sprog-encodere. Men hvis input-teksten er enten en undertekst eller en henvisning, vælger YOLO-Verden-modellen en mere enkel n-gram-algoritme til at extrahere fraser. Disse fraser indføres herefter i tekst-encoderen.
Tekst-Kontrastiv-Hoved
Decoupled-hoved er en komponent, der anvendes af tidligere objektdetektionsmodeller, og YOLO-Verden-rammeverket antager et decoupled-hoved med dobbelt 3×3-konvolutioner til at regrediere objektembedding og begrænsningsbokse for et fast antal objekter. YOLO-Verden-rammeverket anvender et tekst-kontrastiv-hoved til at opnå objektekst-lighed ved hjælp af L2-normaliserings-tilgangen og tekst-embedding. Desuden anvender YOLO-Verden-modellen også affin-transformation-tilgangen med en skiftfaktor og en lærbart skaleringsfaktor, hvor L2-normalisering og affin-transformation forbedrer stabiliteten af modellen under region-tekst-træning.
Online-Vokabular-Træning
Under træningsfasen konstruerer YOLO-Verden-modellen en online-vokabular for hver mosaik-prøve bestående af 4 billeder hver. Modellen sampler alle positive substantiver, der er inkluderet i mosaik-billederne, og sampler nogle negative substantiver tilfældigt fra det respektive datasæt. Vokabularet for hver prøve består af et maksimum af n substantiver, med standardværdien 80.
Offline-Vokabular-Inferens
Under inferens præsenterer YOLO-Verden-modellen en prompt-then-detect-strategi med offline-vokabular for at yderligere forbedre effektiviteten af modellen. Brugeren definerer først en række brugerdefinerede prompts, der kan inkludere kategorier eller selv undertekster. YOLO-Verden-modellen erhverver herefter offline-vokabular-embedding ved at anvende tekst-encoderen til at kodificere disse prompts. Som resultat hjælper offline-vokabularet under inferens modellen med at undgå beregninger for hver input og tillader modellen at justere vokabularet fleksibelt efter behov.
Re-parameterizable Vision-Language Path Aggregation Network (RevVL-PAN)
Følgende figur illustrerer strukturen af den foreslåede Re-parameterizable Vision-Language Path Aggregation Network, der følger top-down- og bottom-up-stier for at etablere funktion-pyramiden med multi-skala-funktion-billeder.

For at forbedre samspillet mellem tekst og billedfunktioner foreslår YOLO-Verden-modellen en Image-Pooling-Attention og en Text-guided CSPLayer (Cross-Stage Partial Layers) med det ultimative mål at forbedre visuelt-semantiske repræsentationer for åbent vokabular-kapaciteter. Under inferens re-parametrerer YOLO-Verden-modellen offline-vokabular-embeddingene til vægte af lineære eller konvolutionslag for effektiv deployment.
Som det kan ses i ovenstående figur, anvender YOLO-Verden-modellen CSPLayer efter top-down- eller bottom-up-fusion og inkorporerer tekst-vejledning i multi-skala-billedfunktioner, hvilket danner Text-Guided CSPLayer, og udvider således CSPLayer. For en given billedfunktion og dens respektive tekst-embedding antager modellen max-sigmoid-attention efter den sidste bottleneck-blok for at aggregere tekstfunktioner i billedfunktioner. Den opdaterede billedfunktion konkateneres herefter med cross-stage-funktioner og præsenteres som output.
Herefter samler YOLO-Verden-modellen billedfunktioner for at opdatere tekst-embedding ved at introducere Image Pooling Attention-laget for at forbedre tekst-embedding med billed-bevidst information. I stedet for at anvende cross-attention direkte på billedfunktioner, udnytter modellen max-pooling på multi-skala-funktioner for at opnå 3×3-regioner, hvilket resulterer i 27 patch-tokens, og modellen opdaterer tekst-embedding i næste trin.
Fortrænings-Skemaer
YOLO-Verden-modellen følger to primære fortrænings-skemaer: Læring fra Region-Tekst Kontrastiv Tab og Pseudo-Mærkning med Billede-Tekst-Data. For det primære fortrænings-skema outputter modellen objektforsudsigelser sammen med annotationer for en given tekst og mosaik-prøver. YOLO-Verden-rammeverket matcher forudsigelserne med grundsandssæt-annotationer ved at følge og udnytte opgave-tildelt mærke-tilknytning og tildeler enkelt positive forudsigelser med en tekst-index, der fungerer som klassifikationsmærke. På den anden side foreslår Pseudo-Mærkning med Billede-Tekst-Data-fortrænings-skemaet at anvende en automatiseret mærknings-tilgang i stedet for at anvende billed-tekst-par til at generere region-tekst-par. Den foreslåede mærknings-tilgang består af tre trin: extraher substantiver, pseudo-mærkning og filtrering. Det første trin anvender n-gram-algoritmen til at extrahere substantiver fra input-teksten, det andet trin antager en fortrænet åbent vokabular-detektor til at generere pseudo-bokse for den given substantiv for enkelt billeder, mens det tredje og sidste trin anvender en fortrænet CLIP-ramme til at evaluere relevansen af region-tekst- og tekst-billede-par, hvorefter modellen filtrerer lav-relevans pseudo-billeder og annotationer.
YOLO-Verden: Resultater
Når YOLO-Verden-modellen er fortrænet, evalueres den direkte på LVIS-datasættet i en zero-shot-indstilling, hvor LVIS-datasættet består af over 1200 kategorier, hvilket er betydeligt mere end de fortræningsdatasæt, der anvendes af eksisterende rammeverk til at teste deres præstation på stor vokabular-detektion. Følgende figur demonstrerer YOLO-Verden-rammeverkets præstation sammen med nogle af de eksisterende state-of-the-art-objektdetektionsrammeverk på LVIS-datasættet i en zero-shot-indstilling.

Som det kan observeres, overgår YOLO-Verden-rammeverket de fleste eksisterende rammeverk i forhold til inferenshastigheder og zero-shot-præstation, selv med rammeverk som Grounding DINO, GLIP og GLIPv2, der inkorporerer mere data. Samlet set viser resultaterne, at små objektdetektionsmodeller som YOLO-Verden-S med kun 13 millioner parametre kan anvendes til fortræning på vision-sprog-opgaver med bemærkelsesværdige åbne vokabular-kapaciteter.
Endelige Tanker
I denne artikel har vi talt om YOLO-Verden, en innovativ tilgang, der sigter mod at forbedre YOLO- eller You Only Look Once-rammeverkets evner med åbent vokabular-detektionsfunktioner ved at fortræne rammeverket på store datasæt og implementere en vision-sprog-modelleringstilgang. For at være mere specifik foreslår YOLO-Verden-rammeverket at implementere en Re-parameterizable Vision-Language Path Aggregation Network eller RepVL-PAN sammen med region-tekst kontrastiv tab for at fremme samspillet mellem sproglig og visuel information. Ved at implementere RepVL-PAN og region-tekst kontrastiv tab kan YOLO-Verden-rammeverket nøjagtigt og effektivt detektere et bredt udvalg af objekter i en zero-shot-indstilling.












