Modely a platformy AI

YOLO-World: Reálná časová detekce objektů s otevřenou slovní zásobou

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Detekce objektů byla vždy základní výzvou v oblasti počítačového vidění, s aplikacemi v robotice, porozumění obrazům, autonomních vozidlech a rozpoznávání obrazů. V posledních letech došlo k průlomovým pracím v oblasti umělé inteligence, zejména prostřednictvím hlubokých neuronových sítí, které významně pokročily v detekci objektů. Nicméně, tyto modely mají pevnou slovní zásobu, omezenou na detekci objektů v 80 kategoriích datové sady COCO. Tento limit vyplývá z procesu školení, kde detektory objektů jsou školeny k rozpoznání pouze specifických kategorií, a tím omezují jejich použitelnost.

Abychom tento limit překonali, představujeme YOLO-World, inovativní přístup, který má za cíl vylepšit rámec YOLO (You Only Look Once) o detekci objektů s otevřenou slovní zásobou. To je dosaženo pomocí předškolování rámce na velkých datových sadách a implementace modelu vidění-jazyka. Konkrétně, YOLO-World využívá Re-parameterizovatelnou síť agregace vidění-jazyka (RepVL-PAN) a region-textovou kontrastivní ztrátu, aby umožnil interakci mezi lingvistickými a vizuálními informacemi. Díky RepVL-PAN a region-textové kontrastivní ztrátě může YOLO-World přesně a účinně detekovat širokou škálu objektů v nulové shotové situaci, přičemž ukazuje pozoruhodné výsledky v otevřené slovní zásobě segmentace a detekce objektů.

Tento článek má za cíl poskytnout komplexní pochopení technických základů YOLO-World, architektury modelu, školicího procesu a aplikací. Pojďme se ponořit do toho.

YOLO-World: Reálná časová detekce objektů s otevřenou slovní zásobou

YOLO nebo You Only Look Once je jednou z nejpopulárnějších metod pro moderní detekci objektů v oblasti počítačového vidění. Proslulý svou úžasnou rychlostí a efektivitou, příchod YOLO mechanismu revolucionalizoval způsob, jakým stroje interpretují a detekují specifické objekty v obrazech a videích v reálném čase. Tradiční rámce detekce objektů implementují dvoustupňový přístup detekce objektů: v prvním stupni navrhuje rámec oblasti, které by mohly obsahovat objekt, a v druhém stupni klasifikuje objekt. Rámec YOLO na druhé straně integruje tyto dva stupně do jediné neuronové sítě, což umožňuje rámcu prohlédnout obraz pouze jednou, aby předpověděl objekt a jeho umístění v obraze, a proto název YOLO nebo You Only Look Once.

Navíc, rámec YOLO zachází s detekcí objektů jako regresním problémem a předpovídá klasifikační pravděpodobnosti a bounding boxy přímo z celého obrazu v jediném pohledu. Implementace této metody nejenom zvyšuje rychlost detekčního procesu, ale také zlepšuje schopnost modelu generalizovat z komplexních a rozmanitých dat, což z něj činí vhodnou volbu pro aplikace, které fungují v reálném čase, jako je autonomní řízení, detekce rychlosti nebo rozpoznávání číselných značek. Navíc, významný pokrok hlubokých neuronových sítí v posledních letech také významně přispěl k vývoji rámců detekce objektů, ale úspěch rámců detekce objektů je stále omezen, protože jsou schopny detekovat objekty pouze s omezenou slovní zásobou. Je to primárně proto, že jednou, když jsou kategorie objektů definovány a označeny v datové sadě, školené detektory v rámcu jsou schopny rozpoznat pouze tyto specifické kategorie, a tím omezují jejich použitelnost a schopnost nasazení modelů detekce objektů v reálném čase a otevřených scénářích.

Pokračujeme, nedávno vyvinuté modely vidění-jazyka využívají destilovanou slovní zásobu znalostí z jazykových encoderů, aby řešily detekci objektů s otevřenou slovní zásobou. Ačkoli tyto rámce fungují lépe než tradiční modely detekce objektů v detekci objektů s otevřenou slovní zásobou, stále mají omezenou použitelnost kvůli nedostatku školicích dat se slovní zásobou omezenou na specifické kategorie. Navíc, vybrané rámce školuji detektory objektů s otevřenou slovní zásobou ve velkém měřítku a kategorizují školicí detektory objektů jako regionální předškolování vidění-jazyka. Nicméně, přístup stále zápasí s detekcí objektů v reálném čase kvůli dvěma hlavním důvodům: komplexnímu procesu nasazení pro hraniční zařízení a těžkým výpočetním požadavkům. Na pozitivní straně, tyto rámce prokázaly pozitivní výsledky z předškolování velkých detektorů, aby je využívaly s otevřenou rozpoznávací schopností.

Rámec YOLO-World má za cíl dosáhnout vysoce efektivní detekce objektů s otevřenou slovní zásobou a prozkoumat možnost velkých předškolování, aby zvýšil efektivitu tradičních detektorů YOLO pro detekci objektů s otevřenou slovní zásobou. Na rozdíl od předchozích prací v detekci objektů, rámec YOLO-World ukazuje pozoruhodnou efektivitu s vysokou rychlostí inference a může být nasazen v downstream aplikacích s lehkostí. Model YOLO-World následuje tradiční architekturu YOLO a kóduje vstupní texty využíváním schopností předškolovaného encoderu CLIP. Navíc, rámec YOLO-World zahrnuje komponent Re-parameterizovatelné sítě agregace vidění-jazyka (RepVL-PAN) ve své architektuře, aby spojil obrazové a textové rysy pro vylepšené vizuální-semanticické reprezentace. Během fáze inference, rámec odstraní textový encoder a re-parametrizuje textové embeddingy do RepVL-PAN váh, což vede k efektivnímu nasazení. Rámec také zahrnuje region-textovou kontrastivní učenou metodu ve svém rámci, aby prozkoumal metody předškolování s otevřenou slovní zásobou pro tradiční modely YOLO. Region-textová kontrastivní metoda sjednocuje obraz-textová data, data založená na regionech a detekční data do region-textových párů. Na základě toho, rámec YOLO-World předškolovaný na region-textových párech prokázal pozoruhodné schopnosti pro otevřenou a velkou slovní zásobu detekce. Navíc, rámec YOLO-World také prozkoumá paradigma “prompt-then-detect” s cílem vylepšit efektivitu detekce objektů s otevřenou slovní zásobou v reálném čase a reálných scénářích.

Jak je ukázáno na následující obrazu, tradiční detektory objektů se zaměřují na uzavřenou množinu pevné slovní zásoby s předdefinovanými kategoriemi, zatímco detektory objektů s otevřenou slovní zásobou detekují objekty kódováním uživatelských promptů s textovými encodery pro otevřenou slovní zásobu. V porovnání, přístup “prompt-then-detect” YOLO-World nejprve vytváří offline slovní zásobu (různou slovní zásobu pro různé potřeby) kódováním uživatelských promptů, což umožňuje detektorům interpretovat offline slovní zásobu v reálném čase bez nutnosti re-kódování promptů.

YOLO-World: Metoda a architektura

Region-textové páry

Tradičně, rámce detekce objektů, včetně rodiny detektorů YOLO, jsou školeny pomocí instancí anotací, které obsahují kategorie a bounding boxy. Na rozdíl od toho, rámec YOLO-World reformuluje instancí anotací jako region-textové páry, kde text může být popis objektu, podstatné jméno nebo kategorie. Je důležité poznamenat, že rámec YOLO-World přijímá både texty a obrazy jako vstup a předpovídá boxy s odpovídajícími objektovými embeddingy.

Architektura modelu

V jádru, model YOLO-World se skládá z textového encoderu, detektoru YOLO a komponenty Re-parameterizovatelné sítě agregace vidění-jazyka (RepVL-PAN), jak je znázorněno na následující obrazu.

Pro vstupní text, komponent textového encoderu kóduje text do textových embeddingů, následovaný extrakcí multi-škálových rysů z vstupního obrazu detektory YOLO. Komponent Re-parameterizovatelné sítě agregace vidění-jazyka (RepVL-PAN) poté využívá fúzi mezi textovými a obrazovými rysy, aby vylepšil textové a obrazové reprezentace.

Detektor YOLO

Model YOLO-World je postaven na existujícím rámci YOLOv8, který obsahuje komponent Darknet backbone jako obrazový encoder, hlavu pro objektové embeddingy a regresi bounding boxů a síť Path Aggression (PAN) pro multi-škálové feature pyramidy.

Textový encoder

Pro daný text, model YOLO-World extrahuje odpovídající textové embeddingy přijetím předškolovaného Transformer encoderu CLIP s určitým počtem podstatných jmen a dimenzí embeddingu. Hlavním důvodem, proč rámec YOLO-World přijímá encoder CLIP, je to, že nabízí lepší vizuální-semanticické výkony pro spojení textů s vizuálními objekty, což významně překonává tradiční textové encodery.

Textová kontrastivní hlava

Decoupled hlava je komponent, který je využíván dříve objekty detekce, a rámec YOLO-World přijímá decoupled hlavu s duálními 3×3 konvolucemi, aby regresní objektové embeddingy a bounding boxy pro pevný počet objektů. Rámec YOLO-World využívá textovou kontrastivní hlavu, aby získal objekt-textovou podobnost pomocí L2 normalizace a textových embeddingů. Navíc, model YOLO-World také využívá afinní transformaci s posunutím a učitelným škálovacím faktorem, s L2 normalizací a afinní transformací, které vylepšují stabilitu modelu během region-textového školení.

Online slovní zásoba školení

Během fáze školení, model YOLO-World konstruuje online slovní zásobu pro každou mozaikovou ukázku, skládající se z 4 obrazů. Model vzorkuje všechny pozitivní podstatná jména zahrnutá v mozaikových obrazech a vzorkuje některé negativní podstatná jména náhodně z odpovídající datové sady. Slovní zásoba pro každou ukázku se skládá z maximálně n podstatných jmen, s výchozím hodnotám 80.

Offline slovní zásoba inference

Během fáze inference, model YOLO-World představuje strategii “prompt-then-detect” s offline slovní zásobou, aby dále vylepšil efektivitu modelu. Uživatel nejprve definuje řadu vlastních promptů, které mohou zahrnovat kategorie nebo dokonce popisy. Model YOLO-World poté získá offline slovní zásobu embeddingy využíváním textového encoderu pro kódování těchto promptů. Jako výsledek, offline slovní zásoba pro inference pomáhá modelu vyhnout se výpočtům pro každý vstup a také umožňuje modelu přizpůsobit slovní zásobu flexibilně podle požadavků.

Re-parameterizovatelná síť agregace vidění-jazyka (RevVL-PAN)

Následující obraz znázorňuje strukturu navrhované Re-parameterizovatelné sítě agregace vidění-jazyka, která následuje horní-dolní a dolní-horní cesty, aby vytvořila feature pyramidu s multi-škálovými featuremi.

Aby se vylepšila interakce mezi textovými a obrazovými rysy, model YOLO-World navrhuje Image-Pooling Attention a Text-guided CSPLayer (Cross-Stage Partial Layers) s konečným cílem vylepšit vizuální-semanticické reprezentace pro otevřenou slovní zásobu. Během fáze inference, model YOLO-World re-parametrizuje offline slovní zásobu embeddingy do váh lineárních nebo konvolučních vrstev pro efektivní nasazení.

Jak je vidět na výše uvedeném obrazu, model YOLO-World využívá CSPLayer po horní-dolní nebo dolní-horní fúzi a zahrnuje textovou navigaci do multi-škálových obrazových rysů, tvořící Text-Guided CSPLayer, a tím rozšiřuje CSPLayer. Pro jakýkoli dán obrazový rys a odpovídající textové embeddingy, model přijímá max-sigmoid pozornost po posledním bottleneck bloku, aby agregoval textové rysy do obrazových rysů. Aktualizovaný obrazový rys je poté sloučen s cross-stage rysy a je prezentován jako výstup.

Pokračujeme, model YOLO-World agreguje obrazové rysy, aby aktualizoval textové embeddingy, zavedením Image Pooling Attention vrstvy, aby vylepšil textové embeddingy s obrazově-aware informacemi. Místo přímého použití cross-pozornosti na obrazových rysů, model využívá max pooling na multi-škálových rysů, aby získal 3×3 regiony, což vede k 27 patch tokenům, s modelem aktualizujícím textové embeddingy v dalším kroku.

Předškolovací schéma

Model YOLO-World následuje dvě primární předškolovací schéma: Učení z region-textové kontrastivní ztráty a Pseudo Labeling s obraz-textovými daty. Pro primární předškolovací schéma, model výstupuje objektové předpovědi spolu s anotacemi pro daný text a mozaikové ukázky. Rámec YOLO-World odpovídá předpovědím s ground truth anotacemi, následujícím a využívajícím úkol-přiřazenou label asignaci, a přiřazuje jednotlivé pozitivní předpovědi s textovým indexem, který slouží jako klasifikační label. Na druhé straně, schéma Pseudo Labeling s obraz-textovými daty navrhuje použití automatizovaného labelovacího přístupu místo použití obraz-textových párů pro generování region-textových párů. Navrhovaný labelovací přístup se skládá ze tří kroků: extrakce podstatných jmen, pseudo-labeling a filtrování.

YOLO-World: Výsledky

Jakmile je model YOLO-World předškolován, je hodnocen přímo na datové sadě LVIS v nulové shotové situaci, s datovou sadou LVIS, která obsahuje více než 1200 kategorií, což je výrazně více než datové sady, které byly použity pro testování výkonu existujících rámců pro detekci objektů s velkou slovní zásobou. Následující obraz demonstruje výkon rámce YOLO-World s některými stávajícími špičkovými rámci detekce objektů na datové sadě LVIS v nulové shotové situaci.

Jak je vidět, rámec YOLO-World překonává většinu existujících rámců z hlediska rychlosti inference a nulové shotové výkony, dokonce i s rámci, jako je Grounding DINO, GLIP a GLIPv2, které zahrnují více dat. Celkově, výsledky ukazují, že malé modely detekce objektů, jako je YOLO-World-S s pouze 13 miliony parametrů, mohou být využity pro předškolování na úkolech vidění-jazyka s pozoruhodnými otevřenými slovními zásobami.

Závěrečné myšlenky

V tomto článku, jsme mluvili o YOLO-World, inovativním přístupu, který má za cíl vylepšit rámec YOLO o detekci objektů s otevřenou slovní zásobou, předškolováním rámce na velkých datových sadách a implementací modelu vidění-jazyka. Konkrétně, rámec YOLO-World navrhuje implementaci Re-parameterizovatelné sítě agregace vidění-jazyka (RepVL-PAN) a region-textové kontrastivní ztráty, aby umožnil interakci mezi lingvistickými a vizuálními informacemi. Díky RepVL-PAN a region-textové kontrastivní ztrátě, rámec YOLO-World může přesně a účinně detekovat širokou škálu objektů v nulové shotové situaci, přičemž ukazuje pozoruhodné výsledky v otevřené slovní zásobě segmentace a detekce objektů.

Inženýr z povolání, spisovatel ze srdce. Kunal je technický spisovatel s hlubokou láskou a porozuměním pro AI a ML, který se věnuje zjednodušování složitých konceptů v těchto oblastech prostřednictvím svých přitažlivých a informačních dokumentací.