Моделі та платформи ШІ
YOLO-World: Реальний час відкритої лексики виявлення об’єктів
Виявлення об’єктів було фундаментальною проблемою в галузі комп’ютерного зору, з застосуваннями в робототехніці, розумінні зображень, автономних транспортних засобах та визначенні зображень. В останні роки революційні роботи в галузі штучного інтелекту, зокрема за допомогою глибоких нейронних мереж, суттєво просунули виявлення об’єктів. Однак ці моделі мають фіксований словник, обмежений до виявлення об’єктів у 80 категоріях набору даних COCO. Це обмеження походить від процесу навчання, де детектори об’єктів навчаються розпізнавати лише певні категорії, тим самим обмежуючи їх застосування.
Щоб подолати це, ми представляємо YOLO-World, інноваційний підхід, спрямований на підвищення можливостей.framework YOLO (You Only Look Once) з відкритим словником виявлення об’єктів. Це досягається шляхом попереднього навчання.framework на великомасштабних наборах даних та реалізації підходу моделювання мови та зору. Зокрема, YOLO-World використовує мережу агрегації шляхів мови та зору (RepVL-PAN) та регіонально-текстову контрастивну втрату для взаємодії між лінгвістичною та візуальною інформацією. За допомогою RepVL-PAN та регіонально-текстової контрастивної втрати YOLO-World може точно виявляти широкий спектр об’єктів у нульовому режимі, демонструючи видатні результати у відкритому словнику сегментації та виявленні об’єктів.
Ця стаття має на меті надати глибоке розуміння технічних основ, архітектури моделі, процесу навчання та сценаріїв застосування YOLO-World. Давайте глибше зануримося.
YOLO-World: Реальний час відкритої лексики виявлення об’єктів
YOLO або You Only Look Once є одним з найпопулярніших методів сучасного виявлення об’єктів у галузі комп’ютерного зору. Відомий своєю неймовірною швидкістю та ефективністю, появу механізму YOLO революціонізувала спосіб, яким машини інтерпретують та виявляють певні об’єкти у зображеннях та відео в реальному часі. Традиційні.framework виявлення об’єктів реалізують двоступеневий підхід виявлення об’єктів: на першому етапі.framework пропонує регіони, які можуть містити об’єкт, а на другому етапі.framework класифікує об’єкт. Framework YOLO, з іншого боку, інтегрує ці два етапи в одну нейронну мережу, підхід, який дозволяє.framework дивитися на зображення лише один раз, щоб передбачити об’єкт та його розташування у зображенні, і тому назва YOLO або You Only Look Once.
Крім того, framework YOLO розглядає виявлення об’єктів як проблему регресії та передбачає ймовірності класів та обмежувальні рамки безпосередньо з повного зображення в одному погляді. Реалізація цього методу не тільки збільшує швидкість процесу виявлення, але також підвищує здатність моделі узагальнювати з складних та різноманітних даних, роблячи її підходящою для застосунків, що працюють у реальному часі, таких як автономне водіння, виявлення швидкості або розпізнавання номерних знаків. Крім того, суттєвий прогрес глибоких нейронних мереж за останні роки також суттєво внесли свій внесок у розвиток.framework виявлення об’єктів, але успіх.framework виявлення об’єктів все ще обмежений, оскільки вони можуть виявляти об’єкти лише з обмеженим словником. Це в першу чергу тому, що після визначення та маркування категорій об’єктів у наборі даних навчені детектори у.framework можуть розпізнавати лише ці конкретні категорії, тим самим обмежуючи їх застосування та можливість розгортання моделей виявлення об’єктів у реальному часі та відкритих сценаріях.
Далі, недавно розроблені моделі мови та зору використовують знання словника з мовних кодувальників для відкритого словника виявлення. Хоча ці.framework виконують краще традиційних моделей виявлення об’єктів у відкритому словнику, вони все ще мають обмежене застосування через нестачу навчальних даних з обмеженою різноманітністю словника. Крім того, вибрані.framework навчають відкритого словника детекторів об’єктів у великомасштабі та категоризують навчальні детектори об’єктів як регіональне попереднє навчання мови та зору. Однак підхід все ще стикається з труднощами у виявленні об’єктів у реальному часі через дві основні причини: складний процес розгортання для пристроїв краю та великі обчислювальні вимоги. З позитивної сторони, ці.framework продемонстрували позитивні результати від попереднього навчання великих детекторів для застосування відкритого розпізнавання.
Framework YOLO-World має на меті досягти високоефективного відкритого словника виявлення об’єктів та дослідити можливість великомасштабного попереднього навчання для підвищення ефективності традиційних детекторів YOLO для відкритого словника виявлення об’єктів. На відміну від попередніх робіт у галузі виявлення об’єктів, framework YOLO-World демонструє видатну ефективність з високими швидкостями висновку та може бути розгорнутий у застосунках з легкістю. Модель YOLO-World слідує традиційній архітектурі YOLO та кодує вхідні тексти, використовуючи можливості попередньо навченого кодувальника тексту CLIP. Крім того, framework YOLO-World включає компонент Re-parameterizable Vision-Language Path Aggregation Network (RepVL-PAN) у своїй архітектурі для зв’язку функцій зображення та тексту для підвищення візуально-семантичних представлень. Під час висновку.framework видалить кодувальник тексту та перепараметризує текстові вкладення у ваги RepVL-PAN, що призводить до ефективного розгортання. Framework також включає регіонально-текстове контрастивне навчання у своєму.framework для вивчення методів попереднього навчання відкритого словника для традиційних моделей YOLO. Регіонально-текстовий контрастивний метод об’єднує дані зображення-текст, дані ґрунтуючих даних та дані виявлення у регіонально-текстові пари. Будуючи на цьому, попередньо навчена модель YOLO-World на регіонально-текстових парах демонструє видатні можливості для відкритого та великомасштабного словника виявлення.
Як показано на наступному зображенні, традиційні детектори об’єктів фокусуються на закритому наборі фіксованого словника виявлення з попередньо визначеними категоріями, тоді як детектори відкритого словника виявляють об’єкти, кодуючи користувацькі підказки за допомогою кодувальників тексту для відкритого словника. На відміну від цього, підхід YOLO-World “підказка-потім-виявлення” спочатку будує офлайн-словник (різноманітний словник для різноманітних потреб) за допомогою кодування користувацьких підказок, що дозволяє детекторам інтерпретувати офлайн-словник у реальному часі без необхідності перекодування підказок.

YOLO-World: Метод і архітектура
Регіонально-текстові пари
Традиційно,.framework виявлення об’єктів, включаючи сімейство детекторів YOLO, навчаються за допомогою анотацій екземплярів, які містять мітки категорій та обмежувальні рамки. Натомість.framework YOLO-World переформулює анотації екземплярів як регіонально-текстові пари, де текст може бути описом об’єкта, іменними фразами або назвою категорії. Варто зазначити, що.framework YOLO-World приймає як тексти, так і зображення як вхідні дані та передбачає обмежувальні рамки з відповідними вкладеннями об’єктів.
Архітектура моделі
У своєму ядрі модель YOLO-World складається з кодувальника тексту, детектора YOLO та компонента Re-parameterizable Vision-Language Path Aggregation Network (RepVL-PAN), як показано на наступному зображенні.

Для вхідного тексту кодувальник тексту кодує текст у текстові вкладення, а потім витягує багатомасштабні функції з вхідного зображення за допомогою детектора зображень у компоненті детектора YOLO. Компонент RepVL-PAN потім використовує跨-модальну фузію між текстовими та функціональними вкладеннями для підвищення текстових та зображеньних представлень.
Детектор YOLO
Модель YOLO-World побудована на основі існуючої.framework YOLOv8, яка містить компонент Darknet як кодувальник зображення, голову для вкладень об’єктів та регресії обмежувальних рамок, а також мережу шляхів агрегації (PAN) для багатомасштабних пірамід функцій.
Кодувальник тексту
Для заданого тексту модель YOLO-World витягує відповідні текстові вкладення, приймаючи попередньо навчений трансформерний кодувальник тексту CLIP з певною кількістю іменників та розміром вкладення. Основна причина, по якій.framework YOLO-World приймає кодувальник тексту CLIP, полягає в тому, що він пропонує кращу візуально-семантичну продуктивність для зв’язку текстів з візуальними об’єктами, суттєво перевершуючи традиційні кодувальники тексту лише для мови.
Текстова контрастивна голова
Від’єднана голова є компонентом, використовуваним раніше моделями виявлення об’єктів, а.framework YOLO-World приймає від’єднану голову з подвійними 3×3 конволюціями для регресії вкладень об’єктів та обмежувальних рамок для фіксованої кількості об’єктів. Framework YOLO-World використовує текстову контрастивну голову для отримання подібності об’єкт-текст за допомогою підходу L2-нормалізації та текстових вкладень. Крім того, модель YOLO-World також використовує підхід афінної трансформації з зсувним коефіцієнтом та навченим масштабним коефіцієнтом, з L2-нормалізацією та афінною трансформацією, які підвищують стабільність моделі під час регіонально-текстового навчання.
Онлайн-навчання словника
Під час фази навчання модель YOLO-World будує онлайн-словник для кожного мозаїчного зразка, що складається з 4 зображень кожен. Модель вибірково витягує всі позитивні іменники, включені у мозаїчні зображення, та вибірково вибірково негативні іменники з відповідного набору даних. Словник для кожного зразка складається з максимальної кількості n іменників, з замовчуванням значенням 80.
Офлайн-виявлення словника
Під час висновку модель YOLO-World пропонує стратегію “підказка-потім-виявлення” з офлайн-словником для подальшого підвищення ефективності моделі. Користувач спочатку визначає серію користувацьких підказок, які можуть включати категорії або навіть підписи. Модель YOLO-World потім отримує офлайн-словникові вкладення, використовуючи кодувальник тексту для кодування цих підказок. В результаті офлайн-словник для висновку допомагає моделі уникнути обчислень для кожного входу та дозволяє моделі гнучко регулювати словник відповідно до вимог.
Re-parameterizable Vision-Language Path Aggregation Network (RevVL-PAN)
Наступна фігура ілюструє структуру запропонованої мережі Re-parameterizable Vision-Language Path Aggregation, яка слідує зверху вниз та знизу вгору шляхам для встановлення піраміди багатомасштабних функцій зображень.

Щоб підвищити взаємодію між текстовими та зображеньними функціями, модель YOLO-World пропонує Image-Pooling Attention та текстово-керовану CSPLayer (Cross-Stage Partial Layers) з кінцевою метою підвищення візуально-семантичних представлень для відкритого словника можливостей. Під час висновку модель YOLO-World перепараметризує офлайн-словникові вкладення у ваги лінійних або конволюційних шарів для ефективного розгортання.
Як можна побачити на вищезазначеній фігурі, модель YOLO-World використовує CSPLayer після зверху-вниз або знизу-вгору фузії та включає текстове керівництво у багатомасштабні функції зображень, формуючи Text-Guided CSPLayer, тим самим розширюючи CSPLayer. Для будь-якого даного зображення функції та відповідного текстового вкладення модель приймає макс-сігмоїдну увагу після останнього блоку бутльнека для агрегації текстових функцій у зображенні функції. Оновлена функція зображення потім конкатенується з функціями між стадіями та представляється як вихід.
Далі, модель YOLO-World агрегує функції зображень для оновлення текстового вкладення, вводячи шар Image Pooling Attention для підвищення текстових вкладень з інформацією, залежною від зображення. Натомість ніж використовувати прямий крос-аттенцію на функціях зображень, модель використовує макс-пулінг на багатомасштабних функціях для отримання 3×3 регіонів, що призводить до 27 токенів патчів, з моделлю, яка оновлює текстові вкладення на наступному етапі.
Схеми попереднього навчання
Модель YOLO-World слідує двом основним схемам попереднього навчання: Навчання з регіонально-текстовою контрастивною втратою та псевдо-маркування з даними зображення-текст. Для першої схеми попереднього навчання модель видає передбачення об’єктів разом з анотаціями для заданого тексту та мозаїчних зразків. Framework YOLO-World збігається передбачення з анотаціями фактичних даних, слідуючи та використовуючи призначення міток завдання, та призначає індивідуальні позитивні передбачення з індексом тексту, який служить міткою класифікації. З іншого боку, схема попереднього навчання псевдо-маркування з даними зображення-текст пропонує використовувати автоматичний підхід маркування замість використання пар зображення-текст для генерації регіонально-текстових пар. Запропонований підхід маркування складається з трьох етапів: витягування іменних фраз, псевдо-маркування та фільтрація.
YOLO-World: Результати
Як тільки модель YOLO-World була попередньо навчена, її оцінюють безпосередньо на наборі даних LVIS у нульовому режимі, з набором даних LVIS, який складається з понад 1200 категорій, суттєво більше, ніж попередньо навчальні набори даних, використані існуючими.framework для тестування їх продуктивності у великомасштабному словнику виявлення. Наступна фігура демонструє продуктивність.framework YOLO-World з деякими існуючими моделями виявлення об’єктів на наборі даних LVIS у нульовому режимі.

Як можна побачити,.framework YOLO-World перевершує більшість існуючих.framework за швидкістю висновку та нульовою продуктивністю, навіть з.framework, такими як Grounding DINO, GLIP та GLIPv2, які включають більше даних. Загалом, результати демонструють, що маленькі моделі виявлення об’єктів, такі як YOLO-World-S з лише 13 мільйонами параметрів, можуть бути використані для попереднього навчання на завданнях мови та зору з видатними відкритими словниковими можливостями.
Фінальні думки
У цій статті ми говорили про YOLO-World, інноваційний підхід, спрямований на підвищення можливостей.framework YOLO з відкритим словником виявлення об’єктів шляхом попереднього навчання.framework на великомасштабних наборах даних та реалізації підходу моделювання мови та зору. Зокрема,.framework YOLO-World пропонує реалізацію мережі Re-parameterizable Vision Language Path Aggregation (RepVL-PAN) разом з регіонально-текстовою контрастивною втратою для взаємодії між лінгвістичною та візуальною інформацією. Реалізуючи RepVL-PAN та регіонально-текстову контрастивну втрату,.framework YOLO-World може точно виявляти широкий спектр об’єктів у нульовому режимі, демонструючи видатні результати у відкритому словнику сегментації та виявлення об’єктів.












