Моделі та платформи ШІ
AnomalyGPT: Виявлення промислових аномалій за допомогою моделей LVLM
Нещодавно великі моделі мови та зору (LVLM) такі як LLava та MiniGPT-4 продемонстрували можливість розуміти зображення та досягати високої точності та ефективності в декількох візуальних завданнях. Хоча LVLM добре розпізнають звичайні об’єкти завдяки своїм великим навчальним наборам даних, їм бракує конкретних знань у певній галузі та обмеженого розуміння локалізованих деталей у зображеннях. Це обмежує їх ефективність у завданнях виявлення промислових аномалій (IAD). З іншого боку, існуючі рамки IAD можуть лише визначити джерела аномалій та вимагають ручної настройки порогових значень для розрізнення між нормальними та аномальними зразками, що обмежує їх практичну реалізацію.
Основною метою рамки IAD є виявлення та локалізація аномалій у промислових сценаріях та зображеннях продуктів. Однак через непередбачуваність та рідкість реальних зразків зображень, моделі зазвичай тренуються лише на нормальних даних. Вони розрізняють аномальні зразки від нормальних на основі відхилень від типових зразків. Наразі рамки IAD та моделі в основному забезпечують оцінки аномалій для тестових зразків. Крім того, розрізнення між нормальними та аномальними екземплярами для кожного класу предметів вимагає ручної вказівки порогових значень, що робить їх непридатними для реальних застосунків.

Для вивчення використання та реалізації великих моделей мови та зору у вирішенні проблем, пов’язаних з рамками IAD, було введено AnomalyGPT, новий підхід IAD на основі LVLM. AnomalyGPT може виявляти та локалізувати аномалії без потреби ручної настройки порогових значень. Крім того, AnomalyGPT також може надавати відповідну інформацію про зображення для взаємодії з користувачами, дозволяючи їм ставити додаткові питання на основі аномалії чи їхніх конкретних потреб.
Виявлення промислових аномалій та великі моделі мови та зору
Існуючі рамки IAD можна розділити на дві категорії.
- Рамки IAD на основі реконструкції.
- Рамки IAD на основі вкладення ознак.
У рамці IAD на основі реконструкції основною метою є реконструкція аномальних зразків у їхні відповідні нормальні зразки, та виявлення аномалій шляхом розрахунку похибки реконструкції. SCADN, RIAD, AnoDDPM та InTra використовують різні рамки реконструкції, починаючи від генеративних адверсарних мереж (GAN) та автоенкодерів, до моделей дифузії та трансформерів.
З іншого боку, у рамці IAD на основі вкладення ознак основною мотивацією є фокусування на моделюванні вкладення ознак нормальних даних. Методи, такі як PatchSSVD, намагаються знайти гіперсферу, яка може щільно охопити нормальні зразки, тоді як рамки, такі як PyramidFlow та Cfl, проєктують нормальні зразки на гаусівське розподілення за допомогою нормалізуючих потоків. CFA та PatchCore встановили пам’ять нормальних зразків з вкладення патчів та використовують відстань між вкладенням тестового зразка та нормальним вкладенням для виявлення аномалій.
Обидва ці методи слідують за парадигмою “один клас – одна модель”, яка вимагає великої кількості нормальних зразків для вивчення розподілу кожного класу об’єктів. Вимога великої кількості нормальних зразків робить її непрактичною для нових категорій об’єктів та обмежує застосування у динамічних середовищах продукції. З іншого боку, рамка AnomalyGPT використовує парадигму навчання в контексті для категорій об’єктів, що дозволяє їй здійснювати інтерференцію лише з декількома нормальними зразками.
Далі, у нас є великі моделі мови та зору або LVLM. LLM або великі мовні моделі мали величезний успіх у галузі NLP, та зараз досліджуються для їхніх застосунків у візуальних завданнях. Рамка BLIP-2 використовує Q-former для введення візуальних ознак з Vision Transformer у модель Flan-T5. Крім того, рамка MiniGPT з’єднує зображення сегмента рамки BLIP-2 та модель Vicuna лінійним шаром та здійснює двостадійний процес тонкої настройки за допомогою даних зображення-текст. Ці підходи вказують на те, що моделі LLM можуть мати деякі застосування для візуальних завдань. Однак ці моделі були треновані на загальних даних та їм бракує необхідної галузевої експертизи для широких застосунків.
Як працює AnomalyGPT?
AnomalyGPT у своїй основі є новою розмовною моделлю IAD великої мови та зору, призначеною в основному для виявлення промислових аномалій та визначення їхнього точного місця розташування за допомогою зображень. Рамка AnomalyGPT використовує LLM та попередньо тренований зображувальний кодувач для вирівнювання зображень з їхніми відповідними текстовими описами за допомогою стимульованих аномальних даних. Модель вводить декодувальний модуль та модуль навчання промптерів для покращення продуктивності систем IAD та досягнення результатів локалізації на рівні пікселів.
Архітектура моделі

Вище зображення показує архітектуру AnomalyGPT. Модель спочатку передає запитуване зображення до замороженого зображувального кодувача. Модель потім витягує ознаки рівня патчів з проміжних шарів та подає ці ознаки до зображувального декодера для розрахунку їхньої схожості з аномальними та нормальними текстами для отримання результатів локалізації. Модуль навчання промптерів потім перетворює їх у промптерні вкладення, які можна використовувати як вхідні дані до LLM поряд з текстовими вхідними даними користувача. Модель LLM потім використовує промптерні вкладення, зображувальні вхідні дані та текстові вхідні дані користувача для виявлення аномалій, визначення їхнього місця розташування та створення кінцевих відповідей для користувача.
Декодер
Для досягнення локалізації аномалій на рівні пікселів модель AnomalyGPT розгортає легкий декодер зображень на основі відповідності ознак, який підтримує як рамки IAD з декількома зразками, так і рамки IAD без нагляду. Дизайн декодера, використаного в AnomalyGPT, надихнутий рамками WinCLIP, PatchCore та APRIL-GAN. Модель розділяє зображувальний кодувач на 4 стадії та витягує проміжні ознаки рівня патчів на кожній стадії.
Однак ці проміжні ознаки не пройшли остаточне вирівнювання зображення-текст, тому їх не можна порівнювати безпосередньо з ознаками. Для вирішення цієї проблеми модель AnomalyGPT вводить додаткові шари для проєктування проміжних ознак та вирівнювання їх з текстовими ознаками, які представляють нормальні та аномальні семантики.
Модуль навчання промптерів
Рамка AnomalyGPT вводить модуль навчання промптерів, який намагається перетворити результат локалізації у промптерні вкладення для використання тонких семантик з зображень та підтримання семантичної узгодженості між виходами декодера та LLM. Крім того, модель включає навчальні промптерні вкладення, не пов’язані з виходами декодера, до модуля навчання промптерів для надання додаткової інформації для завдання IAD. Нарешті, модель подає вкладення та оригінальну інформацію про зображення до LLM.
Модуль навчання промптерів складається з навчальних базових промптерних вкладень та конволюційної нейронної мережі. Мережа перетворює результат локалізації у промптерні вкладення та формує набір промптерних вкладень, які потім поєднуються з вкладеннями зображень у LLM.
Симуляція аномалій
Модель AnomalyGPT приймає метод NSA для симуляції аномальних даних. Метод NSA використовує техніку вирізання-вставлення за допомогою методу редагування зображень Пуассона для пом’якшення розриву, введеного при вставці сегментів зображень. Вирізання-вставлення – це поширена техніка у рамках IAD для генерації симульованих аномальних зображень.
Техніка вирізання-вставлення включає вирізання блокової області з зображення випадково та вставлення її у випадкове місце в іншому зображенні, тим самим створюючи частину симульованої аномалії. Ці симульовані аномальні зразки можуть покращити продуктивність моделей IAD, але існує недолік, оскільки вони часто можуть виробляти помітні розриви. Метод редагування Пуассона спрямований на безшовне клонування об’єкта з одного зображення в інше шляхом розв’язання рівнянь Пуассона.

Вище зображення показує порівняння між методами Пуассона та вирізання-вставлення. Як видно, існують помітні розриви у методі вирізання-вставлення, тоді як результати методу Пуассона виглядають більш природними.
Зміст питання та відповіді
Для проведення налаштування промптера на великій моделі мови та зору модель AnomalyGPT генерує відповідний текстовий запит на основі аномального зображення. Кожен запит складається з двох основних компонентів. Перша частина запиту складається з опису вхідного зображення, який надає інформацію про об’єкти, присутні на зображенні, разом з їхніми очікуваними атрибутами. Друга частина запиту полягає у виявленні присутності аномалій у об’єкті або перевірці, чи існує аномалія на зображенні.
Модель LLM спочатку відповідає на запит про наявність аномалії на зображенні. Якщо модель виявляє аномалії, вона продовжує вказувати місце розташування та кількість аномальних областей. Модель ділить зображення на 3х3 сітку окремих регіонів, щоб дозволити LLM вказувати місце розташування аномалій вербально, як показано на наступному зображенні.

Модель LLM надходить із описовими знаннями вхідних даних разом із основними знаннями про вхідне зображення, які допомагають моделі краще зрозуміти компоненти зображення.
Дані та метрики оцінювання
Модель проводить свої експерименти в основному на наборах даних VisA та MVTec-AD. Набір даних MVTech-AD складається з 3629 зображень для тренування та 1725 зображень для тестування, розділених на 15 різних категорій, що робить його одним з найпопулярніших наборів даних для рамок IAD. Тренувальні зображення містять лише нормальні зображення, тоді як тестові зображення містять як нормальні, так і аномальні зображення. З іншого боку, набір даних VisA складається з 9621 нормальних зображень та майже 1200 аномальних зображень, розділених на 12 різних категорій.
Далі, як і існуючі рамки IAD, модель AnomalyGPT використовує AUC або площу під кривою приймання-відхилення як метрику оцінювання, з використанням локалізації аномалій на рівні пікселів та рівня зображення для оцінювання продуктивності локалізації аномалій та виявлення аномалій відповідно. Однак модель також використовує точність рівня зображення для оцінювання продуктивності запропонованого підходу, оскільки це дозволяє визначити присутність аномалій без потреби ручної настройки порогових значень.
Результати
Кількісні результати
Виявлення промислових аномалій з декількома зразками
Модель AnomalyGPT порівнює свої результати з попередніми рамками IAD з декількома зразками, включаючи PaDiM, SPADE, WinCLIP та PatchCore як базові моделі.

Вище зображення порівнює результати моделі AnomalyGPT у порівнянні з рамками IAD з декількома зразками. По обидва набори даних метод, прийнятий AnomalyGPT, перевершує підходи попередніх моделей за показником AUC рівня зображення та повертає добру точність.
Виявлення промислових аномалій без нагляду
У режимі тренування без нагляду з великою кількістю нормальних зразків модель AnomalyGPT тренує одну модель на зразках, отриманих з усіх класів у наборі даних. Розробники моделі AnomalyGPT обрали рамку UniAD, оскільки вона тренується у тому самому режимі та буде служити базовою моделлю для порівняння. Крім того, модель також порівнюється з рамками JNLD та PaDim за допомогою того самого уніфікованого режиму.

Вище зображення порівнює продуктивність моделі AnomalyGPT у порівнянні з іншими рамками.
Якісні результати

Вище зображення показує продуктивність моделі AnomalyGPT у методі виявлення аномалій без нагляду, тоді як наступне зображення демонструє продуктивність моделі у методі навчання з одним зразком у контексті.

Модель AnomalyGPT здатна вказувати присутність аномалій, позначати їхнє місце розташування та надавати результати локалізації на рівні пікселів. Коли модель знаходиться у режимі навчання з одним зразком у контексті, продуктивність локалізації моделі дещо нижча у порівнянні з режимом без нагляду через відсутність тренування.
Висновок
AnomalyGPT – це нова розмовна модель IAD великої мови та зору, призначена для використання потужних можливостей великих моделей мови та зору. Вона не лише може виявляти аномалії у зображенні, але й вказувати їхнє точне місце розташування. Крім того, AnomalyGPT дозволяє проводити багаторазові діалоги, зосереджені на виявленні аномалій, та демонструє видатну продуктивність у навчанні з декількома зразками у контексті. AnomalyGPT досліджує потенційні застосування моделей LVLM у виявленні аномалій, вводячи нові ідеї та можливості для галузі IAD.












