AI-modeller och plattformar
YOLO-World: Real-Tids Öppen Vokabulär Objekt Detektion
Objekt detektion har varit en grundläggande utmaning inom datorseende-industrin, med tillämpningar inom robotik, bildförståelse, autonoma fordon och bildigenkänning. Under de senaste åren har banbrytande arbete inom AI, särskilt genom djupa neurala nätverk, avsevärt förbättrat objekt detektion. Men dessa modeller har ett fast vokabulär, begränsat till att upptäcka objekt inom de 80 kategorierna i COCO-databasen. Denna begränsning härrör från träningsprocessen, där objekt detektorer tränas för att känna igen endast specifika kategorier, vilket begränsar deras tillämpbarhet.
För att övervinna detta introducerar vi YOLO-World, en innovativ approach som syftar till att förbättra YOLO-ramverket (You Only Look Once) med öppet vokabulär detekteringsförmåga. Detta uppnås genom att förträna ramverket på stora databaser och implementera en vision-språklig modelleringstillvägagångssätt. Specifikt använder YOLO-World en omparametrerbar vision-språklig vägaggregeringsnätverk (RepVL-PAN) och region-text kontrastiv förlust för att främja interaktion mellan lingvistisk och visuell information. Genom RepVL-PAN och region-text kontrastiv förlust kan YOLO-World exakt och effektivt upptäcka ett brett utbud av objekt i en zero-shot-inställning, vilket visar en imponerande prestation i öppet vokabulär segmentering och objekt detektion.
Den här artikeln syftar till att ge en grundlig förståelse för YOLO-Worlds tekniska grunder, modellarkitektur, träningsprocess och tillämpningsscenarier. Låt oss dyka in.
YOLO-World: Real-Tids Öppen Vokabulär Objekt Detektion
YOLO eller You Only Look Once är en av de mest populära metoderna för modern objekt detektion inom datorseende-industrin. Känd för sin otroliga hastighet och effektivitet, har införandet av YOLO-mekanismen revolutionerat sättet maskiner tolkar och upptäcker specifika objekt inom bilder och videor i realtid. Traditionella objekt detektionsramverk implementerar en tvåstegsobjekt detektionsapproach: i det första steget föreslår ramverket regioner som kan innehålla objektet, och ramverket klassificerar objektet i nästa steg. YOLO-ramverket integrerar dessa två steg i en enda neurala nätverksmodell, en approach som tillåter ramverket att titta på bilden bara en gång för att förutsäga objektet och dess plats inom bilden, och därför namnet YOLO eller You Only Look Once.
Dessutom behandlar YOLO-ramverket objekt detektion som ett regressionsproblem och förutsäger klasssannolikheterna och begränsningsboxarna direkt från den fullständiga bilden i en enda blick. Implementeringen av denna metod inte bara ökar hastigheten på detektionsprocessen, utan förbättrar också modellens förmåga att generalisera från komplexa och varierande data, vilket gör det till ett lämpligt val för tillämpningar som körs i realtid, som autonom körning, hastighetsdetektering eller nummerplåtsigenkänning. Dessutom har den betydande utvecklingen av djupa neurala nätverk under de senaste åren också bidragit avsevärt till utvecklingen av objekt detektionsramverk, men framgången för objekt detektionsramverk är fortfarande begränsad eftersom de bara kan upptäcka objekt med begränsat vokabulär. Det är primärt för att när objektkategorierna definieras och märks i databasen, tränade detektorer i ramverket kan bara känna igen dessa specifika kategorier, vilket begränsar deras tillämpbarhet och förmåga att distribuera objekt detektionsmodeller i realtid och öppna scenarier.
När vi fortsätter, har nyligen utvecklade vision-språkliga modeller använt destillerat vokabulärkunskap från språkencoder för att hantera öppet vokabulär detektering. Även om dessa ramverk presterar bättre än traditionella objekt detektionsmodeller på öppet vokabulär detektering, har de fortfarande begränsad tillämpbarhet på grund av den knappa tillgången på träningsdata med begränsad vokabulärdiversitet. Dessutom tränar vissa ramverk öppet vokabulär objekt detektorer i stor skala och kategoriserar träningsobjekt detektorer som regionnivå vision-språklig förträning. Men tillvägagångssättet kämpar fortfarande med att upptäcka objekt i realtid på grund av två primära skäl: komplex distributionsprocess för edge-enheter och tunga beräkningskrav. På den positiva sidan har dessa ramverk visat positiva resultat från förträning av stora detektorer för att använda dem med öppen erkänningsförmåga.
YOLO-World-ramverket syftar till att uppnå högeffektiv öppet vokabulär objekt detektion och undersöka möjligheten att använda storskalig förträning för att förbättra effektiviteten hos traditionella YOLO-detektorer för öppet vokabulär objekt detektion. Till skillnad från tidigare arbeten inom objekt detektion visar YOLO-World-ramverket en imponerande effektivitet med höga inferenshastigheter och kan distribueras på nedströmsapplikationer med lätthet. YOLO-World-modellen följer den traditionella YOLO-arkitekturen och kodar inmatningstexter genom att utnyttja förmågan hos en förtränad CLIP-textencoder. Dessutom innehåller YOLO-World-ramverket en omparametrerbar vision-språklig vägaggregeringsnätverkskomponent (RepVL-PAN) i sin arkitektur för att koppla bild- och textfunktioner för förbättrade visuell-semantiska representationer. Under inferensfasen tar ramverket bort textencodern och omparametrerar textinbäddningarna till RepVL-PAN-vikter, vilket resulterar i en effektiv distribution. Ramverket innehåller också region-text kontrastiv inlärning i sitt ramverk för att studera öppet vokabulär förträning för traditionella YOLO-modeller. Region-text kontrastiv inlärningsmetoden förenar bild-textdata, grundningsdata och detektionsdata i region-textpar. Utifrån detta visar YOLO-World-ramverket, som förtränats på region-textpar, en imponerande förmåga för öppet och stort vokabulär detektering. Dessutom undersöker YOLO-World-ramverket också en prompt-then-detect-paradigm för att förbättra effektiviteten för öppet vokabulär objekt detektion i realtid och realvärldsscenarier.
Som visas i följande bild fokuserar traditionella objekt detektorer på en sluten uppsättning av fast vokabulär detektering med fördefinierade kategorier, medan öppet vokabulär detektorer upptäcker objekt genom att koda användarprompt med textencoder för öppet vokabulär. I jämförelse med YOLO-Worlds prompt-then-detect-approach bygger den först en offline-vokabulär (varierande vokabulär för varierande behov) genom att koda användarprompt, vilket tillåter detektorerna att tolka den offline-vokabulären i realtid utan att behöva omkoda prompten.

YOLO-World : Metod och Arkitektur
Region-Text Par
Traditionellt tränas objekt detektionsramverk, inklusive YOLO-familjen av objekt detektorer, med hjälp av instansannotationer som innehåller kategorietiketter och begränsningsboxar. I kontrast omformulerar YOLO-World-ramverket instansannotationer som region-textpar, där texten kan vara beskrivningen av objektet, substantivfraser eller kategorinamn. Det är värt att notera att YOLO-World-ramverket antar både texter och bilder som indata och utdata förutsagda boxar med deras motsvarande objektembryon.
Modellarkitektur
I kärnan består YOLO-World-modellen av en textencoder, en YOLO-detektor och en omparametrerbar vision-språklig vägaggregeringsnätverkskomponent (RepVL-PAN), som visas i följande bild.

För en given text kodar textencodern texten till textinbäddningar, följt av extrahering av multi-skalfunktioner från inmatningsbilden av bilderna i YOLO-detektorn. Omparametrerbar vision-språklig vägaggregeringsnätverkskomponenten (RepVL-PAN) utnyttjar sedan den tvärmodala fusionen mellan text- och funktionsembryon för att förbättra text- och bildrepresentationerna.
YOLO-Detektor
YOLO-World-modellen byggs på den befintliga YOLOv8-ramen som innehåller en Darknet-bakbenskomponent som dess bildencoder, ett huvud för objektembryon och begränsningsboxregression, och ett PAN eller Path Aggression Network för multi-skalfunktionspyramider.
Textencoder
För en given text extraherar YOLO-World-modellen motsvarande textinbäddningar genom att anta en förtränad CLIP-Transformertextencoder med ett visst antal substantiv och inbäddningsdimension. Den primära anledningen till att YOLO-World-ramverket antar en CLIP-textencoder är att den erbjuder bättre visuell-semantisk prestanda för att koppla texter med visuella objekt, vilket avsevärt överträffar traditionella textbaserade språkencoder.
Text Kontrastiv Huvud
Decoupled huvud är en komponent som används av tidigare objekt detektionsmodeller, och YOLO-World-ramverket antar ett decoupled huvud med dubbla 3×3 konvolutioner för att regressera objektembryon och begränsningsboxar för ett fast antal objekt. YOLO-World-ramverket använder ett text kontrastivt huvud för att erhålla objektextlikheten med hjälp av L2-normaliseringsmetoden och textinbäddningar. Dessutom använder YOLO-World-modellen också affintransformationstillvägagångssättet med en skiftfaktor och en lärande skalningsfaktor, med L2-normalisering och affintransformation som förbättrar modellens stabilitet under region-textträning.
Online Vokabulär Träning
Under träningsfasen konstruerar YOLO-World-modellen en online-vokabulär för varje mosaikprover som består av 4 bilder vardera. Modellen provar alla positiva substantiv som ingår i mosaikbilderna och provar några negativa substantiv slumpmässigt från den motsvarande databasen. Vokabulären för varje prov består av ett maximalt antal n substantiv, med standardvärdet 80.
Offline Vokabulär Inferens
Under inferens presenterar YOLO-World-modellen en prompt-then-detect-strategi med offline-vokabulär för att ytterligare förbättra modellens effektivitet. Användaren definierar först en serie anpassade prompt som kan innehålla kategorier eller till och med beskrivningar. YOLO-World-modellen erhåller sedan offline-vokabulärinbäddningar genom att använda textencodern för att koda prompten. Som ett resultat hjälper den offline-vokabulären under inferens modellen att undvika beräkningar för varje indata och tillåter modellen att anpassa vokabulären flexibelt enligt behoven.
Re-parametrerbar Vision-Språklig Vägaggregeringsnätverk (RevVL-PAN)
Följande figur illustrerar strukturen på det föreslagna re-parametrerbara vision-språkliga vägaggregeringsnätverket som följer top-down- och bottom-up-vägarna för att etablera en funktionell pyramid med multi-skalfunktionsbilder.

För att förbättra interaktionen mellan text och bildfunktioner föreslår YOLO-World-modellen en Image-Pooling Attention och en Text-guidad CSPLayer (Cross-Stage Partial Layers) med det ultimata målet att förbättra de visuell-semantiska representationerna för öppet vokabulär kapacitet. Under inferens re-parametrerar YOLO-World-modellen de offline-vokabulärinbäddningarna till vikterna i de linjära eller konvolutionslager för effektiv distribution.
Som det kan ses i figuren ovan använder YOLO-World-modellen CSPLayer efter top-down- eller bottom-up-fusionen och inkorporerar textguidning i multi-skalfunktionsbilder, vilket bildar Text-Guided CSPLayer, och utökar därmed CSPLayer. För en given bildfunktion och dess motsvarande textinbäddning antar modellen max-sigmoid attention efter den sista flaskhalsblocken för att aggregera textfunktioner i bildfunktioner. Den uppdaterade bildfunktionen konkateneras sedan med cross-stage-funktionerna och presenteras som utdata.
När vi fortsätter, aggregerar YOLO-World-modellen bildfunktioner för att uppdatera textinbäddningen genom att introducera Image Pooling Attention-lagret för att förbättra textinbäddningarna med bildmedveten information. Istället för att använda cross-attention direkt på bildfunktioner, använder modellen max-pooling på multi-skalfunktioner för att erhålla 3×3-regioner, vilket resulterar i 27 patch-token, och uppdaterar textinbäddningarna i nästa steg.
FörträningsSchema
YOLO-World-modellen följer två primära förtränings-schema: Lärande från Region-Text Kontrastiv Förlust och Pseudo Etikettering med Bild-Text Data. För det primära förtränings-schemat utdata modellen objekt förutsägelser tillsammans med annotationer för en given text och mosaikprover. YOLO-World-ramverket matchar förutsägelserna med markeringar för att följa och utnyttja uppgiftstilldelad etikett tilldelning, och tilldelar enskilda positiva förutsägelser med en textindex som fungerar som klassificeringsetikett. Å andra sidan föreslår Pseudo Etikettering med Bild-Text Data förtränings-schemat att använda en automatiserad etiketteringsapproach istället för att använda bild-textpar för att generera region-textpar. Den föreslagna etiketteringsapproachen består av tre steg: extrahera substantivfraser, pseudo-etikettering och filtrering. Det första steget använder n-gramalgoritmen för att extrahera substantivfraser från inmatningstexten, det andra steget antar en förtränad öppen vokabulär detektor för att generera pseudo-boxar för den givna substantivfrasen för enskilda bilder, medan det tredje och sista steget använder en förtränad CLIP-ram för att utvärdera relevansen för region-text och text-bildpar, och modellen filtrerar låg-relevans pseudo-bilder och annotationer.
YOLO-World : Resultat
När YOLO-World-modellen har förtränats utvärderas den direkt på LVIS-databasen i en zero-shot-inställning, med LVIS-databasen som består av över 1200 kategorier, vilket är betydligt fler än de förträningsdatabaser som används av befintliga ramverk för att testa deras prestanda på stor vokabulär detektering. Följande figur visar prestandan för YOLO-World-ramverket med några av de befintliga state-of-the-art-objekt detektionsramverken på LVIS-databasen i en zero-shot-inställning.

Som det kan observeras, överträffar YOLO-World-ramverket de flesta befintliga ramverk när det gäller inferenshastighet och zero-shot-prestanda, även med ramverk som Grounding DINO, GLIP och GLIPv2 som inkorporerar mer data. Sammantaget visar resultaten att små objekt detektionsmodeller som YOLO-World-S med endast 13 miljoner parametrar kan användas för förträning på vision-språkliga uppgifter med imponerande öppet vokabulär kapacitet.
Slutliga Tankar
I den här artikeln har vi talat om YOLO-World, en innovativ approach som syftar till att förbättra YOLO-ramverkets (You Only Look Once) förmåga med öppet vokabulär detektering genom att förträna ramverket på stora databaser och implementera en vision-språklig modelleringstillvägagångssätt. Specifikt föreslår YOLO-World-ramverket att implementera en Re-parametrerbar Vision-Språklig Vägaggregeringsnätverk (RepVL-PAN) tillsammans med region-text kontrastiv förlust för att främja interaktion mellan lingvistisk och visuell information. Genom att implementera RepVL-PAN och region-text kontrastiv förlust kan YOLO-World-ramverket exakt och effektivt upptäcka ett brett utbud av objekt i en zero-shot-inställning, vilket visar en imponerande prestanda i öppet vokabulär segmentering och objekt detektion.












