Modele și platforme AI

YOLO-World: Detectare în timp real a obiectelor cu vocabular deschis

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Detectarea obiectelor a fost o provocare fundamentală în industria viziunii computaționale, cu aplicații în robotică, înțelegerea imaginilor, vehicule autonome și recunoașterea imaginilor. În ultimii ani, lucrările de pionierat în domeniul inteligenței artificiale, în special prin rețelele neuronale profunde, au avansat semnificativ detectarea obiectelor. Cu toate acestea, aceste modele au un vocabular fix, limitat la detectarea obiectelor din cele 80 de categorii ale setului de date COCO. Această limitare provine din procesul de antrenare, în care detectoarele de obiecte sunt antrenate să recunoască numai categoriile specifice, limitând astfel aplicabilitatea lor.

Pentru a depăși această limitare, introducem YOLO-World, o abordare inovatoare menită să îmbunătățească cadrul YOLO (You Only Look Once) cu capacități de detectare a obiectelor cu vocabular deschis. Acest lucru se realizează prin antrenarea cadrului pe seturi de date la scară largă și implementarea unei abordări de modelare a limbajului și a viziunii. În special, YOLO-World utilizează o rețea de agregare a căilor de limbaj și viziune reparametrizabilă (RepVL-PAN) și o pierdere contrastivă de regiune-text pentru a facilita interacțiunea dintre informațiile lingvistice și vizuale. Prin implementarea RepVL-PAN și a pierderii contrastive de regiune-text, YOLO-World poate detecta cu acuratețe o gamă largă de obiecte într-un mediu cu zero împușcături, demonstrând performanțe remarcabile în segmentarea și detectarea obiectelor cu vocabular deschis.

Acest articol își propune să ofere o înțelegere aprofundată a fundamentelor tehnice ale YOLO-World, a arhitecturii modelului, a procesului de antrenare și a scenariilor de aplicare. Să intrăm în detalii.

YOLO-World: Detectare în timp real a obiectelor cu vocabular deschis

YOLO sau You Only Look Once este una dintre cele mai populare metode de detectare a obiectelor în industria viziunii computaționale. Renowned pentru viteza și eficiența sa incredibilă, apariția mecanismului YOLO a revoluționat modul în care mașinile interpretează și detectează obiecte specifice în imagini și videoclipuri în timp real. Cadrul tradițional de detectare a obiectelor implementează o abordare de detectare a obiectelor în două etape: în prima etapă, cadrul propune regiuni care ar putea conține obiectul, iar în a doua etapă, cadrul clasifică obiectul. Cadrul YOLO, pe de altă parte, integrează aceste două etape într-un singur model de rețea neuronală, o abordare care permite cadrului să vadă imaginea doar o dată pentru a prezice obiectul și locația sa în imagine, și de aceea, numele YOLO sau You Only Look Once.

Mai mult, cadrul YOLO tratează detectarea obiectelor ca o problemă de regresie și prezice direct probabilitățile de clasă și cutiile de delimitare din imaginea completă într-o singură privire. Implementarea acestei metode nu numai că crește viteza procesului de detectare, dar îmbunătățește și capacitatea modelului de a generaliza din date complexe și diverse, făcându-l o alegere potrivită pentru aplicații care funcționează în timp real, cum ar fi conducerea autonomă, detectarea vitezei sau recunoașterea plăcuțelor de înmatriculare. Mai mult, progresul semnificativ al rețelelor neuronale profunde în ultimii ani a contribuit și el în mod semnificativ la dezvoltarea cadrului de detectare a obiectelor, dar succesul cadrului de detectare a obiectelor este încă limitat, deoarece acestea pot detecta obiecte doar cu un vocabular limitat. Acest lucru se datorează în principal faptului că, odată ce categoriile de obiecte sunt definite și etichetate în setul de date, detectoarele antrenate în cadrul pot recunoaște numai aceste categorii specifice, limitând astfel aplicabilitatea și capacitatea de a dezvolta modele de detectare a obiectelor în timp real și în scenarii deschise.

În continuare, modelele de viziune și limbaj recent dezvoltate utilizează cunoștințe de vocabular distilate din encodatori de limbaj pentru a aborda detectarea cu vocabular deschis. Deși aceste cadre performează mai bine decât modelele tradiționale de detectare a obiectelor în detectarea cu vocabular deschis, ele au încă o aplicabilitate limitată datorită lipsei de date de antrenare cu diversitate de vocabular limitată. Mai mult, anumite cadre antrenează detectoare de obiecte cu vocabular deschis la scară largă și categorizează detectoarele de obiecte de antrenare ca o pre-antrenare a viziunii și limbajului la nivel de regiune. Cu toate acestea, abordarea încă se confruntă cu dificultăți în detectarea obiectelor în timp real din două motive principale: procesul complex de implementare pentru dispozitivele de margine și cerințele computaționale grele. Pe de altă parte, aceste cadre au demonstrat rezultate pozitive prin antrenarea detectoarelor mari pentru a le utiliza cu capacități de recunoaștere deschisă.

Cadrul YOLO-World își propune să atingă o detectare eficientă a obiectelor cu vocabular deschis și să exploreze posibilitatea abordărilor de pre-antrenare la scară largă pentru a îmbunătăți eficiența detectoarelor tradiționale YOLO pentru detectarea obiectelor cu vocabular deschis. În contrast cu lucrările anterioare în domeniul detectării obiectelor, cadrul YOLO-World prezintă o eficiență remarcabilă, cu viteze de inferență ridicate, și poate fi implementat cu ușurință în aplicații downstream. Modelul YOLO-World urmează arhitectura tradițională YOLO și encodifică textele de intrare prin utilizarea capacităților unui encodator de text CLIP pre-antrenat. Mai mult, cadrul YOLO-World include o componentă Re-parameterizable Vision-Language Path Aggregation Network (RepVL-PAN) în arhitectura sa pentru a conecta caracteristicile de imagine și text pentru reprezentări vizuale-semantice îmbunătățite. În timpul fazei de inferență, cadrul elimină encodatorul de text și reparametrizează încorporările de text în greutățile RepVL-PAN, rezultând o implementare eficientă. Cadrul include, de asemenea, o învățare contrastivă de regiune-text în cadrul său pentru a studia metodele de pre-antrenare cu vocabular deschis pentru modelele YOLO tradiționale. Metoda de învățare contrastivă de regiune-text unifică datele de imagine-text, datele de ancorare și datele de detectare în perechi de regiune-text. Pe baza acestui fapt, cadrul YOLO-World pre-antrenat pe perechi de regiune-text demonstrează capacități remarcabile pentru detectarea cu vocabular deschis și larg.

După cum se arată în imaginea de mai jos, detectoarele tradiționale de obiecte se concentrează pe detectarea unui set închis de vocabular fix cu categorii predefinite, în timp ce detectoarele cu vocabular deschis detectează obiecte prin encodarea promt-urilor utilizatorului cu encodatori de text pentru vocabular deschis. În comparație, abordarea prompt-then-detect a YOLO-World construiește mai întâi un vocabular offline (un vocabular variabil pentru nevoi variate) prin encodarea promt-urilor utilizatorului, permițând detectoarelor să interpreteze vocabularul offline în timp real fără a fi nevoie să re-encodeze promt-urile.

YOLO-World: Metodă și Arhitectură

Perechi de Regiune-Text

Tradițional, cadrele de detectare a obiectelor, inclusiv familia de detectoare YOLO, sunt antrenate utilizând anotări de instanță care conțin etichete de categorie și cutii de delimitare. În contrast, cadrul YOLO-World reformulează anotările de instanță ca perechi de regiune-text, unde textul poate fi descrierea obiectului, frazele nominale sau numele categoriei. Este important de remarcat că cadrul YOLO-World adoptă atât textul, cât și imaginile ca intrări și iese cu cutii prezise împreună cu încorporările corespunzătoare ale obiectelor.

Arhitectură a Modelului

La nivelul său central, modelul YOLO-World constă dintr-un encodator de text, un detector YOLO și componenta Re-parameterizable Vision-Language Path Aggregation Network (RepVL-PAN), așa cum se arată în imaginea de mai jos.

Pentru un text de intrare, componenta encodatorului de text encodifică textul în încorporări de text, urmată de extragerea caracteristicilor multi-scală din imaginea de intrare de către detectoarele de imagine din componenta detectorului YOLO. Componenta RepVL-PAN exploatează apoi fuziunea cross-modală între încorporările de text și caracteristicile pentru a îmbunătăți reprezentările textului și imaginii.

Detector YOLO

Modelul YOLO-World se bazează pe cadrul existent YOLOv8, care conține o componentă de spate Darknet, o capă pentru încorporări de obiecte și regresie de cutie de delimitare, și o rețea de agregare a căilor (PAN) pentru piramide de caracteristici multi-scală.

Encodator de Text

Pentru un text dat, modelul YOLO-World extrage încorporările de text corespunzătoare prin adoptarea unui encodator de text CLIP pre-antrenat cu un anumit număr de substantive și dimensiune de încorporare. Motivul principal pentru care cadrul YOLO-World adoptă un encodator de text CLIP este acela că oferă o performanță vizual-semantică mai bună pentru conectarea textelor cu obiectele vizuale, depășind semnificativ encodatorii de text tradiționali. Cu toate acestea, dacă textul de intrare este fie o legendă, fie o expresie de referință, modelul YOLO-World optează pentru un algoritm de n-gram mai simplu pentru a extrage frazele. Aceste fraze sunt apoi alimentate în encodatorul de text.

Cap de Contrast Text

Capul decuplat este o componentă utilizată de modelele anterioare de detectare a obiectelor, iar cadrul YOLO-World adoptă un cap decuplat cu convoluții duale 3×3 pentru a regresa încorporările de obiecte și cutiile de delimitare pentru un număr fix de obiecte. Cadrul YOLO-World utilizează un cap de contrast text pentru a obține similaritatea obiect-text utilizând abordarea de normalizare L2 și încorporările de text. În plus, modelul YOLO-World utilizează și abordarea de transformare afinită cu un factor de deplasare și un factor de scalare învățabil, normalizarea L2 și transformarea afinită îmbunătățind stabilitatea modelului în timpul antrenării region-text.

Antrenare de Vocabular Online

În timpul fazei de antrenare, modelul YOLO-World construiește un vocabular online pentru fiecare mostră de mozaic, constând din 4 imagini. Modelul eșantionează toți substanții pozitive incluse în imaginile de mozaic și eșantionează unele substantive negative aleator din setul de date corespunzător. Vocabularul pentru fiecare mostră constă dintr-un număr maxim de n substantive, cu valoarea implicită fiind 80.

Inferență de Vocabular Offline

În timpul fazei de inferență, modelul YOLO-World prezintă o strategie prompt-then-detect cu vocabular offline pentru a îmbunătăți și mai mult eficiența modelului. Utilizatorul definește mai întâi o serie de promt-uri personalizate care ar putea include categorii sau chiar legende. Modelul YOLO-World obține apoi încorporări de vocabular offline prin utilizarea encodatorului de text pentru a encoda aceste promt-uri. Ca rezultat, vocabularul offline pentru inferență ajută modelul să evite calculele pentru fiecare intrare și să ajusteze vocabularul în mod flexibil în funcție de cerințe.

Rețea de Agregare a Căilor de Viziune și Limbaj Reparametrizabilă (RevVL-PAN)

Figura de mai jos ilustrează structura rețelei de agregare a căilor de viziune și limbaj propuse, care urmează căile de sus în jos și de jos în sus pentru a stabili o piramidă de caracteristici multi-scală.

Pentru a îmbunătăți interacțiunea dintre caracteristicile de text și imagine, modelul YOLO-World propune o atenție de pooling de imagine și o capă CSPL (Cross-Stage Partial Layers) ghidată de text, cu scopul final de a îmbunătăți reprezentările vizual-semantice pentru capacitățile de vocabular deschis. În timpul fazei de inferență, modelul YOLO-World reparametrizează încorporările de vocabular offline în greutățile straturilor liniare sau convoluționale pentru o implementare eficientă.

După cum se poate vedea în figura de mai sus, modelul YOLO-World utilizează capă CSPL după fuziunea de sus în jos sau de jos în sus și incorporează ghidarea de text în caracteristicile de imagine multi-scală, formând capă CSPL ghidată de text, extinzând astfel capă CSPL. Pentru o caracteristică de imagine dată și încorporarea de text corespunzătoare, modelul adoptă atenția max-sigmoid după ultimul bloc de gâtuire pentru a agrega caracteristicile de text în caracteristicile de imagine. Caracteristica de imagine actualizată este apoi concatenată cu caracteristicile cross-stage și este prezentată ca ieșire.

În continuare, modelul YOLO-World agregă caracteristicile de imagine pentru a actualiza încorporarea de text prin introducerea stratului de atenție de pooling de imagine pentru a îmbunătăți încorporările de text cu informații conștiente de imagine. În loc de a utiliza atenția directă pe caracteristicile de imagine, modelul utilizează pooling-ul maxim pe caracteristici multi-scală pentru a obține regiuni 3×3, rezultând 27 de tokeni de patch, modelul actualizând încorporările de text în următoarea etapă.

Scheme de Pre-antrenare

Modelul YOLO-World urmează două scheme de pre-antrenare principale: Învățarea din Pierderea Contrastivă de Regiune-Text și Etichetarea Pseudo cu Date de Imagine-Text. Pentru schema de pre-antrenare principală, modelul iese cu predicții de obiecte împreună cu anotări pentru un text și mostre de mozaic date. Cadrul YOLO-World asociază predicțiile cu anotările de ground truth urmând și utilizând o atribuire de etichetă bazată pe sarcină, și asociază predicțiile pozitive individuale cu un indice de text care servește ca etichetă de clasificare. Pe de altă parte, schema de pre-antrenare de Etichetare Pseudo cu Date de Imagine-Text propune să utilizeze o abordare de etichetare automată în loc de a utiliza perechi de imagine-text pentru a genera perechi de regiune-text. Abordarea de etichetare propusă constă din trei etape: extragerea frazelor nominale, etichetarea pseudo și filtrarea. extragerea frazelor nominale, etichetarea pseudo și filtrarea.Prima etapă utilizează algoritmul de n-gram pentru a extrage frazele nominale din textul de intrare, a doua etapă adoptă un detector de vocabular deschis pre-antrenat pentru a genera cutii pseudo pentru fraza nominală dată pentru imagini individuale, în timp ce a treia și ultima etapă utilizează un cadru CLIP pre-antrenat pentru a evalua relevanța perechilor de regiune-text și text-imagine, după care modelul filtrează imaginile și anotările cu relevanță scăzută.

YOLO-World: Rezultate

Odată ce modelul YOLO-World a fost pre-antrenat, el este evaluat direct pe setul de date LVIS într-un mediu cu zero împușcături, setul de date LVIS conținând peste 1200 de categorii, semnificativ mai mult decât seturile de date de pre-antrenare utilizate de cadrele existente pentru testarea performanței lor în detectarea cu vocabular larg. Figura de mai jos demonstrează performanța cadrului YOLO-World față de unele dintre cadrele de detectare a obiectelor actuale pe setul de date LVIS într-un mediu cu zero împușcături.

După cum se poate observa, cadrul YOLO-World depășește majoritatea cadrului existent în ceea ce privește vitezele de inferență și performanța în zero împușcături, chiar și cu cadre precum Grounding DINO, GLIP și GLIPv2, care incorporează mai multe date. În general, rezultatele demonstrează că modelele mici de detectare a obiectelor, cum ar fi YOLO-World-S, cu doar 13 milioane de parametri, pot fi utilizate pentru pre-antrenarea pe sarcini de viziune și limbaj cu capacități remarcabile de vocabular deschis.

Gânduri Finale

În acest articol, am discutat despre YOLO-World, o abordare inovatoare care își propune să îmbunătățească capacitățile cadrului YOLO cu detectare de obiecte cu vocabular deschis prin pre-antrenarea cadrului pe seturi de date la scară largă și implementarea abordării de modelare a limbajului și viziunii. Mai specific, cadrul YOLO-World propune să implementeze o Rețea de Agregare a Căilor de Viziune și Limbaj Reparametrizabilă (RepVL-PAN) împreună cu o pierdere contrastivă de regiune-text pentru a facilita interacțiunea dintre informațiile lingvistice și vizuale. Prin implementarea RepVL-PAN și a pierderii contrastive de regiune-text, cadrul YOLO-World poate detecta cu acuratețe o gamă largă de obiecte într-un mediu cu zero împușcături, demonstrând performanțe remarcabile în segmentarea și detectarea obiectelor cu vocabular deschis.

"Un inginer de profesie, un scriitor din inimă". Kunal este un scriitor tehnic cu o dragoste și o înțelegere profundă a inteligenței artificiale și a învățării automate, dedicat simplificării conceptelor complexe din aceste domenii prin documentația sa captivantă și informativă.