Modele i platformy AI
Świat YOLO: Wykrywanie Obiektów w Czasie Rzeczywistym z Otwartą Wokabularzem
Wykrywanie obiektów było podstawowym wyzwaniem w branży komputerowego widzenia, z aplikacjami w robotyce, rozumieniu obrazów, pojazdach autonomicznych i rozpoznawaniu obrazów. W ostatnich latach przełomowa praca w dziedzinie sztucznej inteligencji, w szczególności za pomocą głębokich sieci neuronowych, znacznie przyczyniła się do rozwoju wykrywania obiektów. Niemniej jednak, te modele mają ograniczony słownik, ograniczony do wykrywania obiektów w 80 kategoriach zestawu danych COCO. Ograniczenie to wynika z procesu szkolenia, gdzie wykrywacze obiektów są szkolone w celu rozpoznania tylko określonych kategorii, ograniczając tym samym ich przydatność.
Aby przezwyciężyć to, wprowadzamy Świat YOLO, innowacyjne podejście mające na celu udoskonalenie ramy YOLO (You Only Look Once) z możliwościami wykrywania obiektów o otwartym słowniku. To osiągane jest poprzez wstępne szkolenie ramy na dużych zbiorach danych i wdrożenie podejścia modelowania języka i widzenia. Konkretnie, Świat YOLO wykorzystuje sieć agregacji ścieżek języka i widzenia (RepVL-PAN) i region-text kontrastowy strat, aby ułatwić interakcję między informacjami językowymi i wizualnymi. Dzięki RepVL-PAN i region-text kontrastowemu strat, Świat YOLO może dokładnie i skutecznie wykrywać szeroki zakres obiektów w ustawieniu zero-shot, pokazując znaczące wyniki w zadaniach segmentacji i wykrywania obiektów o otwartym słowniku.
Ten artykuł ma na celu zapewnienie dogłębnego zrozumienia podstaw technicznych Świata YOLO, architektury modelu, procesu szkolenia i scenariuszy zastosowań. Zanurzmy się.
Świat YOLO: Wykrywanie Obiektów w Czasie Rzeczywistym z Otwartą Wokabularzem
YOLO lub You Only Look Once jest jedną z najpopularniejszych metod wykrywania obiektów w branży komputerowego widzenia. Słynie z niesamowitej szybkości i wydajności, a pojawienie się mechanizmu YOLO YOLO rewolucjonizowało sposób, w jaki maszyny interpretują i wykrywają określone obiekty w obrazach i filmach w czasie rzeczywistym. Tradycyjne ramy wykrywania obiektów implementują dwuetapowe podejście do wykrywania obiektów: w pierwszym etapie, rama proponuje regiony, które mogą zawierać obiekt, a w następnym etapie rama klasyfikuje obiekt. Rama YOLO łączy te dwa etapy w jeden model sieci neuronowej, co pozwala ramie na spojrzenie na obraz tylko raz, aby przewidzieć obiekt i jego położenie w obrazie, stąd nazwa YOLO lub You Only Look Once.
Ponadto, rama YOLO traktuje wykrywanie obiektów jako problem regresji i przewiduje prawdopodobieństwa klas i prostokąty ograniczające bezpośrednio z pełnego obrazu w jednym spojrzeniu. Wdrożenie tego podejścia nie tylko zwiększa szybkość procesu wykrywania, ale także poprawia zdolność modelu do uogólniania złożonych i różnorodnych danych, co czyni go odpowiednim wyborem dla aplikacji działających w czasie rzeczywistym, takich jak jazda autonomiczna, wykrywanie prędkości lub rozpoznawanie tablic rejestracyjnych. Ponadto, znaczący postęp sieci neuronowych w ciągu ostatnich kilku lat również przyczynił się do rozwoju ram wykrywania obiektów, ale sukces ram wykrywania obiektów jest nadal ograniczony, ponieważ mogą one wykrywać obiekty tylko z ograniczonym słownikiem. Jest to głównie spowodowane tym, że raz gdy kategorie obiektów są zdefiniowane i oznaczone w zestawie danych, wykrywacze obiektów w ramie są w stanie rozpoznać tylko te określone kategorie, ograniczając tym samym ich przydatność i zdolność do wdrożenia modeli wykrywania obiektów w czasie rzeczywistym i otwartych scenariuszach.
Idąc dalej, ostatnio opracowane modele języka i widzenia wykorzystują destylowany słownik z językowych encoderów, aby rozwiązać problem wykrywania obiektów o otwartym słowniku. Chociaż te ramy wykonują lepiej niż tradycyjne modele wykrywania obiektów w zadaniach wykrywania obiektów o otwartym słowniku, nadal mają ograniczoną przydatność ze względu na rzadkie dostępne dane szkoleniowe z ograniczonym słownikiem. Ponadto, wybrane ramy szkolą wykrywacze obiektów o otwartym słowniku w skali, i klasyfikują wykrywacze obiektów w ramach wstępnego szkolenia na poziomie regionu. Niemniej jednak, podejście to nadal ma trudności z wykrywaniem obiektów w czasie rzeczywistym z dwóch głównych powodów: złożonego procesu wdrożenia na urządzeniach krawędziowych i ciężkich wymagań obliczeniowych. Z drugiej strony, te ramy wykazały pozytywne wyniki z wstępnego szkolenia dużych wykrywaczy, aby zastosować je z otwartymi możliwościami rozpoznawania.
Rama Świat YOLO ma na celu osiągnięcie wysoce wydajnego wykrywania obiektów o otwartym słowniku i zbadanie możliwości podejść wstępnego szkolenia w skali, aby zwiększyć wydajność tradycyjnych wykrywaczy YOLO w zadaniach wykrywania obiektów o otwartym słowniku. W przeciwieństwie do poprzednich prac nad wykrywaniem obiektów, rama Świat YOLO wykazuje znaczącą wydajność z wysokimi szybkościami inferencji i może być wdrożona w dalszych aplikacjach z łatwością. Model Świat YOLO podąża za tradycyjną architekturą YOLO i koduje dane wejściowe za pomocą zdolności pre-trenowanego encodera tekstu CLIP. Ponadto, rama Świat YOLO obejmuje składnik sieci agregacji ścieżek języka i widzenia (RepVL-PAN) w swojej architekturze, aby połączyć cechy obrazu i tekstu w celu uzyskania lepszych reprezentacji wizualno-semantycznych. Podczas fazy inferencji, rama usuwa encoder tekstu i re-parametryzuje osadzanie tekstu w wagach RepVL-PAN, co skutkuje wydajnym wdrożeniem. Rama również obejmuje region-text kontrastowe uczenie, aby zbadać metody wstępnego szkolenia dla tradycyjnych modeli YOLO. Metoda region-text kontrastowego uczenia łączy dane obrazu i tekstu, dane osadzania i dane wykrywania w pary region-text. Opierając się na tym, rama Świat YOLO wstępnie szkolona na parach region-text wykazuje znaczące zdolności do wykrywania obiektów o otwartym i dużym słowniku. Dodatkowo, rama Świat YOLO również bada paradygmat prompt-then-detect, aby zwiększyć wydajność wykrywania obiektów o otwartym słowniku w czasie rzeczywistym i rzeczywistych scenariuszach.
Jak pokazano na poniższym obrazie, tradycyjne wykrywacze obiektów koncentrują się na zamkniętym zestawie wykrywania obiektów o ustalonym słowniku z predefiniowanymi kategoriami, podczas gdy wykrywacze obiektów o otwartym słowniku wykrywają obiekty, kodując prompty użytkownika za pomocą encoderów tekstu dla otwartego słownika. W porównaniu, podejście Świat YOLO prompt-then-detect najpierw tworzy słownik offline (różne słowniki dla różnych potrzeb), kodując prompty użytkownika, co pozwala wykrywaczom na interpretację słownika offline w czasie rzeczywistym bez konieczności ponownego kodowania prompty.

Świat YOLO: Metoda i Architektura
Pary Region-Text
Tradycyjnie, ramy wykrywania obiektów, w tym rodzina wykrywaczy YOLO, są szkolone przy użyciu adnotacji instancji, które zawierają etykiety kategorii i prostokąty ograniczające. W przeciwieństwie do tego, rama Świat YOLO reformuluje adnotacje instancji jako pary region-text, gdzie tekst może być opisem obiektu, frazą rzeczownikową lub nazwą kategorii. Warto zauważyć, że rama Świat YOLO przyjmuje zarówno tekst, jak i obraz jako dane wejściowe i wyjściowe, przewidując pudełka z odpowiednimi osadzeniami obiektów.
Architektura Modelu
W swojej istocie, model Świat YOLO składa się z encodera tekstu, wykrywacza YOLO i składnika sieci agregacji ścieżek języka i widzenia (RepVL-PAN), jak pokazano na poniższym obrazie.

Dla danego tekstu, składnik encodera tekstu koduje tekst w osadzania tekstu, a następnie wykrywacz YOLO wyodrębnia cechy wieloskalowe z obrazu wejściowego. Składnik sieci agregacji ścieżek języka i widzenia (RepVL-PAN) wykorzystuje fuzję między tekstami i osadzeniami cech, aby poprawić reprezentacje tekstu i obrazu.
Wykrywacz YOLO
Model Świat YOLO jest zbudowany na podstawie istniejącej ramy YOLOv8, która zawiera składnik Darknet jako encoder obrazu, głowę do osadzania obiektów i regresji prostokątów ograniczających, oraz sieć Path Aggression (PAN) do piramidy cech wieloskalowych.
Encoder Tekstu
Dla danego tekstu, model Świat YOLO wyodrębnia odpowiednie osadzania tekstu, przyjmując pre-trenowany encoder tekstu CLIP Transformer z określoną liczbą rzeczowników i wymiarem osadzania. Głównym powodem, dla którego rama Świat YOLO przyjmuje encoder tekstu CLIP, jest to, że oferuje lepsze wyniki wizualno-semantyczne dla łączenia tekstów z obiektami wizualnymi, znacznie przewyższając tradycyjne encodery tekstu.
Głowa Kontrastowa Tekstu
Głowa odłączona jest składnikiem wykorzystywanym przez wcześniejsze modele wykrywania obiektów, a rama Świat YOLO przyjmuje głowę odłączoną z podwójnymi konwolucjami 3×3, aby regresować osadzania obiektów i prostokąty ograniczające dla określonej liczby obiektów. Rama Świat YOLO wykorzystuje głowę kontrastową tekstu, aby uzyskać podobieństwo obiektu i tekstu za pomocą podejścia L2 i osadzania tekstu. Dodatkowo, model Świat YOLO wykorzystuje również podejście transformacji afrykatywnej z czynnikiem przesunięcia i uczonym czynnikiem skalowania, z L2 normalizacją i transformacją afrykatywną, poprawiając stabilność modelu podczas szkolenia region-text.
Szkolenie Słownika Online
Podczas fazy szkolenia, model Świat YOLO konstruuje słownik online dla każdego próbki mozaikowej, składającej się z 4 obrazów. Model próbkuje wszystkie pozytywne rzeczowniki zawarte w obrazach mozaikowych i próbkuje niektóre negatywne rzeczowniki losowo z odpowiedniego zestawu danych. Słownik dla każdej próbki składa się z maksymalnie n rzeczowników, z wartością domyślną równą 80.
Wnioskowanie Słownika Offline
Podczas fazy inferencji, model Świat YOLO prezentuje strategię prompt-then-detect z słownikiem offline, aby dalej poprawić wydajność modelu. Użytkownik najpierw definiuje serię niestandardowych prompty, które mogą zawierać kategorie lub nawet opisy. Model Świat YOLO następnie uzyskuje osadzania słownika offline, wykorzystując encoder tekstu do kodowania tych prompty. W rezultacie, słownik offline dla fazy inferencji pomaga modelowi uniknąć obliczeń dla każdego wejścia i pozwala modelowi dostosować słownik elastycznie do wymagań.
Sieć Agregacji Ścieżek Języka i Widzenia (RevVL-PAN)
Poniższy rysunek ilustruje strukturę proponowanej sieci agregacji ścieżek języka i widzenia, która podąża za ścieżkami top-down i bottom-up, aby utworzyć piramidę cech wieloskalowych.

Aby poprawić interakcję między cechami tekstu i obrazu, model Świat YOLO proponuje uwagę Image-Pooling i warstwę Text-Guided CSPLayer (Cross-Stage Partial Layers) z ostatecznym celem poprawy reprezentacji wizualno-semantycznych dla możliwości otwartego słownika. Podczas fazy inferencji, model Świat YOLO re-parametryzuje osadzania słownika offline w wagach liniowych lub warstwach konwolucyjnych dla skutecznego wdrożenia.
Jak widać na powyższym rysunku, model Świat YOLO wykorzystuje warstwę CSPLayer po fuzji top-down lub bottom-up, i wprowadza tekstową kontrolę do cech obrazu wieloskalowego, tworząc warstwę Text-Guided CSPLayer, rozszerzając tym samym warstwę CSPLayer. Dla danego obrazu i jego odpowiedniego osadzania tekstu, model przyjmuje uwagę max-sigmoid po ostatnim bloku bottleneck, aby agregować cechy tekstu w cechy obrazu. Zaktualizowana cecha obrazu jest następnie łączona z cechami cross-stage, i jest przedstawiana jako wyjście.
Przechodząc dalej, model Świat YOLO agreguje cechy obrazu, aby zaktualizować osadzanie tekstu, wprowadzając warstwę Image Pooling Attention, aby poprawić osadzania tekstu z informacjami świadomymi obrazu. Zamiast używać bezpośredniej uwagi krzyżowej na cechach obrazu, model wykorzystuje max-pooling na cechach wieloskalowych, aby uzyskać 3×3 regiony, skutkując 27 tokenami patch, z modelem aktualizującym osadzania tekstu w następnym kroku.
Schematy Wstępnego Szkolenia
Model Świat YOLO podąża za dwoma głównymi schematami wstępnego szkolenia: uczeniem z region-text kontrastowym strat i etykietowaniem pseudo z danymi obrazu i tekstu. Dla głównego schematu wstępnego szkolenia, model wyjściowy przewiduje obiekty wraz z adnotacjami dla danego tekstu i próbek mozaikowych. Rama Świat YOLO dopasowuje przewidywania z adnotacjami podstawowymi, podążając za przypisaniem etykiet zadanym, i przypisuje indywidualne pozytywne przewidywania z indeksem tekstu, który służy jako etykieta klasyfikacji. Z drugiej strony, schemat wstępnego szkolenia z etykietowaniem pseudo z danymi obrazu i tekstu proponuje wykorzystanie automatycznego podejścia etykietowania zamiast wykorzystania par obrazu i tekstu do generowania par region-text. Proponowane podejście etykietowania składa się z trzech kroków: wyodrębnianie fraz rzeczownikowych, etykietowanie pseudo i filtrowanie. Pierwszy krok wykorzystuje algorytm n-gram, aby wyodrębnić frazy rzeczownikowe z tekstu wejściowego, drugi krok przyjmuje pre-trenowany wykrywacz obiektów o otwartym słowniku, aby wygenerować pseudo-pudełka dla danej frazy rzeczownikowej dla poszczególnych obrazów, natomiast trzeci i ostatni krok wykorzystuje pre-trenowaną ramę CLIP, aby ocenić relewantność par region-text i tekst-obraz, po czym model filtrowuje niskorelewantne pseudo-obrazy i adnotacje.
Świat YOLO: Wyniki
Po wstępnym szkoleniu modelu Świat YOLO, jest on oceniany bezpośrednio na zestawie danych LVIS w ustawieniu zero-shot, z zestawem danych LVIS składającym się z ponad 1200 kategorii, znacznie więcej niż zestawy danych szkoleniowych wykorzystywane przez istniejące ramy do testowania ich wydajności w zadaniach wykrywania obiektów o dużym słowniku. Poniższy rysunek pokazuje wyniki ramy Świat YOLO w porównaniu z niektórymi istniejącymi ramami wykrywania obiektów na zestawie danych LVIS w ustawieniu zero-shot.

Jak można zauważyć, rama Świat YOLO przewyższa większość istniejących ram w zakresie szybkości inferencji i wyników zero-shot, nawet z ramami takimi jak Grounding DINO, GLIP i GLIPv2, które wykorzystują więcej danych. Ogólnie, wyniki pokazują, że małe modele wykrywania obiektów, takie jak Świat YOLO-S z tylko 13 milionami parametrów, mogą być wykorzystane do wstępnego szkolenia na zadaniach języka i widzenia z znaczącymi możliwościami otwartego słownika.
Końcowe Myśli
W tym artykule, omówiliśmy Świat YOLO, innowacyjne podejście, które ma na celu udoskonalenie ramy YOLO z możliwościami wykrywania obiektów o otwartym słowniku poprzez wstępne szkolenie ramy na dużych zbiorach danych i wdrożenie podejścia modelowania języka i widzenia. Konkretnie, rama Świat YOLO proponuje wdrożenie sieci agregacji ścieżek języka i widzenia (RepVL-PAN) wraz z region-text kontrastowym strat, aby ułatwić interakcję między informacjami językowymi i wizualnymi. Dzięki wdrożeniu RepVL-PAN i region-text kontrastowego strat, rama Świat YOLO może dokładnie i skutecznie wykrywać szeroki zakres obiektów w ustawieniu zero-shot, pokazując znaczące wyniki w zadaniach segmentacji i wykrywania obiektów o otwartym słowniku.












