KI-Modelle und Plattformen
YOLO-Welt: Echtzeit-Objekterkennung mit offener Vokabular
Die Objekterkennung ist eine grundlegende Herausforderung in der Computer-Vision-Industrie, mit Anwendungen in der Robotik, Bildverständnis, autonomen Fahrzeugen und Bilderkennung. In den letzten Jahren hat die bahnbrechende Arbeit im Bereich KI, insbesondere durch tiefe neuronale Netze, die Objekterkennung erheblich vorangetrieben. Allerdings haben diese Modelle ein festes Vokabular, das auf die Erkennung von Objekten in den 80 Kategorien des COCO-Datensatzes beschränkt ist. Diese Einschränkung resultiert aus dem Trainingsprozess, bei dem Objekterkennungsmodelle nur auf die Erkennung bestimmter Kategorien trainiert werden, was ihre Anwendbarkeit einschränkt.
Um dies zu überwinden, stellen wir YOLO-Welt vor, einen innovativen Ansatz, der darauf abzielt, das YOLO-Frame-work (You Only Look Once) mit offener Vokabular-Erkennungsfähigkeit zu erweitern. Dies wird durch das Vor-Trainieren des Frame-works auf großen Datensätzen und die Implementierung eines visuell-linguistischen Modellierungsansatzes erreicht. Insbesondere verwendet YOLO-Welt ein reparametrisierbares visuell-linguistisches Pfad-Aggregations-Netzwerk (RepVL-PAN) und region-text-kontrastives Lernen, um die Interaktion zwischen linguistischer und visueller Information zu fördern. Durch RepVL-PAN und region-text-kontrastives Lernen kann YOLO-Welt eine breite Palette von Objekten in einer Zero-Shot-Einstellung genau und effektiv erkennen, was eine bemerkenswerte Leistung in der offenen Vokabular-Segmentierung und Objekterkennung zeigt.
Dieser Artikel zielt darauf ab, ein umfassendes Verständnis der technischen Grundlagen, der Modellarchitektur, des Trainingsprozesses und der Anwendungsszenarien von YOLO-Welt zu vermitteln. Lassen Sie uns eintauchen.
YOLO-Welt: Echtzeit-Objekterkennung mit offener Vokabular
YOLO oder You Only Look Once ist eine der beliebtesten Methoden für die moderne Objekterkennung in der Computer-Vision-Industrie. Bekannt für seine unglaubliche Geschwindigkeit und Effizienz, hat die Einführung des YOLO-Mechanisms die Art und Weise, wie Maschinen Objekte in Bildern und Videos in Echtzeit interpretieren und erkennen, revolutioniert. Traditionelle Objekterkennungs-Frame-works implementieren einen zweistufigen Ansatz für die Objekterkennung: Im ersten Schritt schlägt das Frame-work Regionen vor, die das Objekt enthalten könnten, und im nächsten Schritt klassifiziert das Frame-work das Objekt. Das YOLO-Frame-work integriert diese beiden Schritte in ein einziges neuronales Netzwerk-Modell, ein Ansatz, der es dem Frame-work ermöglicht, das Bild nur einmal anzusehen, um das Objekt und seine Position im Bild vorherzusagen, und daher der Name YOLO oder You Only Look Once.
Darüber hinaus behandelt das YOLO-Frame-work die Objekterkennung als Regressionsproblem und prognostiziert die Klassenwahrscheinlichkeiten und die Begrenzungsboxen direkt aus dem vollständigen Bild in einem einzigen Blick. Die Implementierung dieser Methode erhöht nicht nur die Geschwindigkeit des Erkennungsprozesses, sondern verbessert auch die Fähigkeit des Modells, von komplexen und vielfältigen Daten zu generalisieren, was es zu einer geeigneten Wahl für Anwendungen macht, die in Echtzeit wie autonomes Fahren, Geschwindigkeitsmessung oder Nummernschilderkennung arbeiten. Darüber hinaus hat die erhebliche Weiterentwicklung tiefer neuronaler Netze in den letzten Jahren auch zur Entwicklung von Objekterkennungs-Frame-works beigetragen, aber der Erfolg von Objekterkennungs-Frame-works ist immer noch begrenzt, da sie nur Objekte mit begrenztem Vokabular erkennen können. Dies liegt hauptsächlich daran, dass, sobald die Objektkategorien definiert und im Datensatz beschriftet sind, die trainierten Detektoren im Frame-work nur diese bestimmten Kategorien erkennen können, was ihre Anwendbarkeit und Fähigkeit, Objekterkennungsmodelle in Echtzeit und offenen Szenarien zu deployen, einschränkt.
Weiterhin haben kürzlich entwickelte visuell-linguistische Modelle destillierte Vokabular-Kenntnisse aus Sprachencodierern verwendet, um die offene Vokabular-Erkennung zu bewältigen. Obwohl diese Frame-works besser als traditionelle Objekterkennungsmodelle auf offener Vokabular-Erkennung funktionieren, haben sie immer noch begrenzte Anwendbarkeit aufgrund der knappen Verfügbarkeit von Trainingsdaten mit begrenzter Vokabular-Vielfalt. Darüber hinaus trainieren einige Frame-works offene Vokabular-Detektoren im großen Maßstab und kategorisieren Trainings-Objekt-Detektoren als regionale visuell-linguistische Vor-Trainierung. Allerdings kämpft der Ansatz immer noch darum, Objekte in Echtzeit zu erkennen, aus zwei Hauptgründen: komplexer Deploy-Prozess für Edge-Geräte und hohe Rechenanforderungen. Auf der positiven Seite haben diese Frame-works positive Ergebnisse von der Vor-Trainierung großer Detektoren gezeigt, um sie mit offener Erkennungsfähigkeit zu verwenden.
Das YOLO-Welt-Frame-work zielt darauf ab, eine hoch effiziente offene Vokabular-Objekterkennung zu erreichen und die Möglichkeit von groß angelegten Vor-Trainierungsansätzen zu erkunden, um die Effizienz traditioneller YOLO-Detektoren für die offene Vokabular-Objekterkennung zu steigern. Im Gegensatz zu früheren Arbeiten in der Objekterkennung zeigt das YOLO-Welt-Frame-work eine bemerkenswerte Effizienz mit hoher Inferenzgeschwindigkeit und kann leicht auf Downstream-Anwendungen deployt werden. Das YOLO-Welt-Modell folgt der traditionellen YOLO-Architektur und codiert Eingabetexte, indem es die Fähigkeiten eines vor-trainierten CLIP-Text-Coders nutzt. Darüber hinaus umfasst das YOLO-Welt-Frame-work ein reparametrisierbares visuell-linguistisches Pfad-Aggregations-Netzwerk (RepVL-PAN) in seiner Architektur, um Bild- und Text-Funktionen für verbesserte visuell-semantische Darstellungen zu verbinden. Während der Inferenz-Phase entfernt das Frame-work den Text-Coder und parametrisiert die Text-Embeddings in RepVL-PAN-Gewichte um, was zu einer effizienten Deploy führt. Das Frame-work umfasst auch region-text-kontrastives Lernen in seinem Frame-work, um offene Vokabular-Vor-Trainierungs-Methoden für traditionelle YOLO-Modelle zu untersuchen. Die region-text-kontrastive Lern-Methode vereint Bild-Text-Daten, Grounding-Daten und Erkennungs-Daten in region-text-Paare. Basierend darauf zeigt das YOLO-Welt-Frame-work, das auf region-text-Paaren vor-getrainiert wurde, bemerkenswerte Fähigkeiten für offene und große Vokabular-Erkennung. Darüber hinaus erkundet das YOLO-Welt-Frame-work auch ein prompt-then-detect-Paradigma, um die Effizienz der offenen Vokabular-Objekterkennung in Echtzeit und realen Szenarien zu verbessern.
Wie in dem folgenden Bild gezeigt, konzentrieren sich traditionelle Objekterkennungs-Modelle auf eine geschlossene Menge von festem Vokabular mit vordefinierten Kategorien, während offene Vokabular-Detektoren Objekte erkennen, indem sie Benutzereingaben mit Text-Codierern für offenes Vokabular codieren. Im Vergleich dazu verwendet das YOLO-Welt-Frame-work einen prompt-then-detect-Ansatz, der zuerst ein offline-Vokabular (variierendes Vokabular für variierende Bedürfnisse) aufbaut, indem es Benutzereingaben codiert, was es den Detektoren ermöglicht, das offline-Vokabular in Echtzeit zu interpretieren, ohne die Eingaben neu codieren zu müssen.

YOLO-Welt: Methode und Architektur
Region-Text-Paare
Traditionell werden Objekterkennungs-Frame-works, einschließlich der YOLO-Familie von Objekterkennungs-Modellen, mit Instanz-Annotierungen trainiert, die Klassen-Labels und Begrenzungsboxen enthalten. Im Gegensatz dazu formuliert das YOLO-Welt-Frame-work die Instanz-Annotierungen als region-text-Paare um, wobei der Text die Beschreibung des Objekts, Nomen-Phrasen oder Kategorien-Namen sein kann. Es ist erwähnenswert, dass das YOLO-Welt-Frame-work sowohl Texte als auch Bilder als Eingabe und Ausgabe vorhergesagte Boxen mit entsprechenden Objekt-Embeddings verwendet.
Modell-Architektur
Im Kern besteht das YOLO-Welt-Modell aus einem Text-Coder, einem YOLO-Detektor und dem reparametrisierbaren visuell-linguistischen Pfad-Aggregations-Netzwerk (RepVL-PAN)-Komponent, wie in dem folgenden Bild gezeigt.

Für einen Eingabetext codiert die Text-Coder-Komponente den Text in Text-Embeddings, gefolgt von der Extraktion von multi-skalierten Funktionen aus dem Eingabe-Bild durch die Bild-Detektoren in der YOLO-Detektor-Komponente. Die reparametrisierbare visuell-linguistische Pfad-Aggregations-Netzwerk (RepVL-PAN)-Komponente nutzt dann die cross-modale Fusion zwischen Text- und Funktion-Embeddings, um die Text- und Bild-Darstellungen zu verbessern.
YOLO-Detektor
Das YOLO-Welt-Modell basiert auf dem bestehenden YOLOv8-Frame-work, das eine Darknet-Backbone-Komponente als Bild-Coder, einen Kopf für Objekt-Embeddings und Begrenzungsboxen-Regression und ein Pfad-Aggregations-Netzwerk (PAN) für multi-skalierte Funktion-Pyramiden enthält.
Text-Coder
Für einen gegebenen Text extrahiert das YOLO-Welt-Modell die entsprechenden Text-Embeddings, indem es einen vor-getrainierten CLIP-Transformer-Text-Coder mit einer bestimmten Anzahl von Nomen und Embedding-Dimension verwendet. Der Hauptgrund, warum das YOLO-Welt-Frame-work einen CLIP-Text-Coder verwendet, liegt darin, dass es bessere visuell-semantische Leistung für die Verbindung von Texten mit visuellen Objekten bietet, was traditionelle Text-Only-Sprach-Coder erheblich übertrifft. Allerdings verwendet das YOLO-Welt-Modell für Eingabetexte, die entweder eine Bildunterschrift oder eine referenzielle Ausdruck sind, einen einfacheren n-gramm-Algorithmus, um Phrasen zu extrahieren. Diese Phrasen werden dann dem Text-Coder zugeführt.
Text-Kontrastive-Kopf
Ein decouplter Kopf ist eine Komponente, die von früheren Objekterkennungs-Modellen verwendet wird, und das YOLO-Welt-Frame-work verwendet einen decouplten Kopf mit dualen 3×3-Konvolutionen, um Objekt-Embeddings und Begrenzungsboxen für eine feste Anzahl von Objekten zu regressieren. Das YOLO-Welt-Frame-work verwendet einen text-kontrastiven Kopf, um die Objekt-Text-Ähnlichkeit unter Verwendung des L2-Normierungs-Ansatzes und Text-Embeddings zu erhalten. Darüber hinaus verwendet das YOLO-Welt-Modell auch den affinen Transformations-Ansatz mit einem Verschiebungs-Faktor und einem lernbaren Skalierungs-Faktor, wobei die L2-Normierung und affine Transformation die Stabilität des Modells während der region-text-Trainierung verbessern.
Online-Vokabular-Trainierung
Während der Trainierungs-Phase konstruiert das YOLO-Welt-Modell ein online-Vokabular für jeden Mosaik-Sample, der aus 4 Bildern besteht. Das Modell sampelt alle positiven Nomen, die in den Mosaik-Bildern enthalten sind, und sampelt einige negative Nomen zufällig aus dem entsprechenden Datensatz. Das Vokabular für jeden Sample besteht aus maximal n Nomen, wobei der Standardwert 80 ist.
Offline-Vokabular-Inferenz
Während der Inferenz-Phase verwendet das YOLO-Welt-Modell eine prompt-then-detect-Strategie mit offline-Vokabular, um die Effizienz des Modells weiter zu verbessern. Der Benutzer definiert zunächst eine Reihe von benutzerdefinierten Eingaben, die Kategorien oder sogar Bildunterschriften enthalten können. Das YOLO-Welt-Modell erhält dann offline-Vokabular-Embeddings, indem es den Text-Coder verwendet, um diese Eingaben zu codieren. Als Ergebnis hilft das offline-Vokabular für die Inferenz dem Modell, Berechnungen für jede Eingabe zu vermeiden, und ermöglicht es dem Modell, das Vokabular flexibel an die Anforderungen anzupassen.
Reparametrisierbares visuell-linguistisches Pfad-Aggregations-Netzwerk (RevVL-PAN)
Das folgende Bild zeigt die Struktur des vorgeschlagenen reparametrisierbaren visuell-linguistischen Pfad-Aggregations-Netzwerks, das die top-down- und bottom-up-Pfade verfolgt, um die Funktion-Pyramide mit multi-skalierten Funktion-Bildern zu erstellen.

Um die Interaktion zwischen Text- und Bild-Funktionen zu verbessern, schlägt das YOLO-Welt-Modell ein Image-Pooling-Attention und ein Text-guided CSPLayer (Cross-Stage Partial Layers) vor, um die visuell-semantischen Darstellungen für offene Vokabular-Fähigkeiten zu verbessern. Während der Inferenz-Phase parametrisiert das YOLO-Welt-Modell die offline-Vokabular-Embeddings in die Gewichte der linearen oder konvolutiven Schichten für eine effiziente Deploy um.
Wie im oben gezeigten Bild zu sehen ist, verwendet das YOLO-Welt-Modell den CSPLayer nach der top-down- oder bottom-up-Fusion und integriert Text-Anleitung in multi-skalierte Bild-Funktionen, um den Text-Guided CSPLayer zu bilden, was den CSPLayer erweitert. Für ein gegebenes Bild-Funktion und dessen entsprechendes Text-Embedding verwendet das Modell die max-sigmoid-Attention nach dem letzten Bottleneck-Block, um Text-Funktionen in Bild-Funktionen zu aggregieren. Die aktualisierte Bild-Funktion wird dann mit den cross-stage-Funktionen verkettet und als Ausgabe präsentiert.
Weiterhin aggregiert das YOLO-Welt-Modell Bild-Funktionen, um das Text-Embedding zu aktualisieren, indem es die Image-Pooling-Attention-Schicht einführt, um die Text-Embeddings mit bild-bewusster Information zu verbessern. Anstatt die cross-Attention direkt auf Bild-Funktionen zu verwenden, verwendet das Modell max-Pooling auf multi-skalierten Funktionen, um 3×3-Regionen zu erhalten, was 27 Patch-Tokens ergibt, wobei das Modell die Text-Embeddings im nächsten Schritt aktualisiert.
Vor-Trainierungs-Schemata
Das YOLO-Welt-Modell folgt zwei primären Vor-Trainierungs-Schemata: Lernen aus region-text-kontrastivem Verlust und Pseudo-Beschriftung mit Bild-Text-Daten. Für das primäre Vor-Trainierungs-Schema gibt das Modell Objekt-Vorhersagen zusammen mit Annotierungen für einen gegebenen Text und Mosaik-Samples aus. Das YOLO-Welt-Frame-work entspricht den Vorhersagen mit Ground-Truth-Annotierungen, indem es die task-assigned-Label-Zuweisung verfolgt und einzelne positive Vorhersagen mit einem Text-Index zuweist, der als Klassifikations-Label dient. Andererseits schlägt das Pseudo-Beschriftung mit Bild-Text-Daten-Vor-Trainierungs-Schema vor, eine automatisierte Beschriftung zu verwenden, anstatt Bild-Text-Paare zu verwenden, um region-text-Paare zu generieren. Der vorgeschlagene Beschriftungs-Ansatz besteht aus drei Schritten: Nomen-Phrasen extrahieren, Pseudo-Beschriftung und Filtern. Der erste Schritt verwendet den n-gramm-Algorithmus, um Nomen-Phrasen aus dem Eingabetext zu extrahieren, der zweite Schritt verwendet einen vor-getrainierten offenen Vokabular-Detektor, um Pseudo-Boxen für den gegebenen Nomen-Phrasen für einzelne Bilder zu generieren, während der dritte und letzte Schritt einen vor-getrainierten CLIP-Frame-work verwendet, um die Relevanz der region-text- und Text-Bild-Paare zu bewerten, woraufhin das Modell low-Relevanz-Pseudo-Bilder und Annotierungen filtert.
YOLO-Welt: Ergebnisse
Sobald das YOLO-Welt-Modell vor-getrainiert wurde, wird es direkt auf dem LVIS-Datensatz in einer Zero-Shot-Einstellung ausgewertet, wobei der LVIS-Datensatz über 1200 Kategorien enthält, was erheblich mehr ist als die Vor-Trainierungs-Datensätze, die von bestehenden Frame-works für die Bewertung ihrer Leistung bei der großen Vokabular-Erkennung verwendet werden. Das folgende Bild zeigt die Leistung des YOLO-Welt-Frame-works im Vergleich zu einigen der bestehenden State-of-the-Art-Objekterkennungs-Frame-works auf dem LVIS-Datensatz in einer Zero-Shot-Einstellung.

Wie zu sehen ist, übertrifft das YOLO-Welt-Frame-work die meisten bestehenden Frame-works in Bezug auf Inferenz-Geschwindigkeit und Zero-Shot-Leistung, sogar im Vergleich zu Frame-works wie Grounding DINO, GLIP und GLIPv2, die mehr Daten verwenden. Insgesamt zeigen die Ergebnisse, dass kleine Objekterkennungs-Modelle wie YOLO-Welt-S mit nur 13 Millionen Parametern für die Vor-Trainierung auf visuell-linguistischen Aufgaben mit bemerkenswerten offenen Vokabular-Fähigkeiten verwendet werden können.
Letzte Gedanken
In diesem Artikel haben wir über YOLO-Welt gesprochen, einen innovativen Ansatz, der darauf abzielt, die Fähigkeiten des YOLO- oder You-Only-Look-Once-Frame-works mit offener Vokabular-Erkennungsfähigkeit zu erweitern, indem es das Frame-work auf großen Datensätzen vor-trainiert und den visuell-linguistischen Modellierungs-Ansatz implementiert. Um spezifischer zu sein, schlägt das YOLO-Welt-Frame-work vor, ein reparametrisierbares visuell-linguistisches Pfad-Aggregations-Netzwerk (RepVL-PAN) zusammen mit region-text-kontrastivem Lernen zu implementieren, um die Interaktion zwischen linguistischer und visueller Information zu fördern. Durch die Implementierung von RepVL-PAN und region-text-kontrastivem Lernen kann das YOLO-Welt-Frame-work eine breite Palette von Objekten in einer Zero-Shot-Einstellung genau und effektiv erkennen.












