Модели и платформы ИИ
AnomalyGPT: Обнаружение промышленных аномалий с помощью моделей LVLM
Недавно модели Large Vision Language (LVLM), такие как LLava и MiniGPT-4, продемонстрировали способность понимать изображения и достигать высокой точности и эффективности в нескольких визуальных задачах. Хотя LVLM отлично справляются с распознаванием обычных объектов благодаря своим обширным наборам данных для обучения, они лишены конкретных знаний в определенной области и имеют ограниченное понимание локализованных деталей внутри изображений. Это ограничивает их эффективность в задачах обнаружения промышленных аномалий (IAD). С другой стороны, существующие рамки IAD могут только выявлять источники аномалий и требуют ручных настроек порогов для различия между нормальными и аномальными образцами, что ограничивает их практическую реализацию.
Основная цель рамки IAD – обнаружить и локализовать аномалии в промышленных сценариях и изображениях продукции. Однако из-за непредсказуемости и редкости реальных образцов изображений модели обычно обучаются только на нормальных данных. Они различают аномальные образцы от нормальных на основе отклонений от типичных образцов. В настоящее время рамки IAD и модели в основном предоставляют баллы аномалий для тестовых образцов. Кроме того, различие между нормальными и аномальными экземплярами для каждого класса предметов требует ручного указания порогов, что делает их непригодными для реальных приложений.

Для изучения использования и реализации моделей Large Vision Language в решении задач, поставленных рамками IAD, была представлена новая подход IAD на основе LVLM, называемый AnomalyGPT. AnomalyGPT может обнаруживать и локализовать аномалии без необходимости ручных настроек порогов. Кроме того, AnomalyGPT также может предоставлять соответствующую информацию об изображении для интерактивного взаимодействия с пользователями, позволяя им задавать дополнительные вопросы на основе аномалии или их конкретных потребностей.
Обнаружение промышленных аномалий и модели Large Vision Language
Существующие рамки IAD можно разделить на две категории.
- Рамки IAD на основе реконструкции.
- Рамки IAD на основе вложения функций.
В рамке IAD на основе реконструкции основная цель – реконструировать аномальные образцы в их соответствующие нормальные образцы, и обнаруживать аномалии путем расчета ошибки реконструкции. SCADN, RIAD, AnoDDPM и InTra используют различные рамки реконструкции, от сетей Ган и автоэнкодеров до моделей диффузии и трансформеров.
С другой стороны, в рамке IAD на основе вложения функций основная цель – сосредоточиться на моделировании вложения функций нормальных данных. Методы, такие как PatchSSVD, пытаются найти гиперсферу, которая может плотно охватить нормальные образцы, тогда как рамки, такие как PyramidFlow и Cfl, проецируют нормальные образцы на гауссовское распределение с помощью нормализующих потоков. CFA и PatchCore создали память нормальных образцов из вложений патчей и используют расстояние между вложением тестового образца и нормальным вложением для обнаружения аномалий.
Оба этих метода следуют парадигме “один класс – одна модель”, которая требует большого количества нормальных образцов для изучения распределений каждого класса объектов. Требование большого количества нормальных образцов делает его непрактичным для новых категорий объектов и имеет ограниченное применение в динамичных средах продукции. С другой стороны, рамка AnomalyGPT использует парадигму обучения в контексте для категорий объектов, что позволяет ей включать интерференцию только с небольшим количеством нормальных образцов.
Двигаясь вперед, у нас есть модели Large Vision Language или LVLM. Модели Large Language (LLM) добились огромного успеха в отрасли NLP, и теперь они исследуются для их применения в визуальных задачах. Рамка BLIP-2 использует Q-former для ввода визуальных функций из Vision Transformer в модель Flan-T5. Кроме того, рамка MiniGPT соединяет изображение сегмента рамки BLIP-2 и модель Vicuna с помощью линейного слоя и выполняет двухэтапный процесс тонкой настройки с помощью данных изображения и текста. Эти подходы указывают на то, что рамки LLM могут иметь некоторые применения для визуальных задач. Однако эти модели были обучены на общих данных и лишены необходимой экспертизы в конкретной области для широкого применения.
Как работает AnomalyGPT?
AnomalyGPT в своей основе – это новая разговорная модель IAD на основе LVLM, предназначенная в основном для обнаружения промышленных аномалий и определения их точного местоположения с помощью изображений. Рамка AnomalyGPT использует LLM и предварительно обученный кодировщик изображений для выравнивания изображений с их соответствующими текстовыми описаниями с помощью стимулированных аномальных данных. Модель вводит модуль декодера и модуль обучения подсказок для повышения производительности систем IAD и достижения выхода локализации на уровне пикселей.
Архитектура модели

Вышеизображенная архитектура AnomalyGPT. Модель сначала передает запросное изображение в предварительно обученный кодировщик изображений. Затем модель извлекает функции уровня патчей из промежуточных слоев и подает эти функции в декодер изображения для расчета их сходства с аномальными и нормальными текстами для получения результатов локализации. Модуль обучения подсказок затем преобразует их в вложения подсказок, которые могут быть использованы в качестве входных данных в LLM вместе с текстовыми входными данными пользователя. Модель LLM затем использует вложения подсказок, входные данные изображения и текстовые входные данные пользователя для обнаружения аномалий, определения их местоположения и создания окончательных ответов для пользователя.
Декодер
Для достижения локализации аномалий на уровне пикселей модель AnomalyGPT развертывает легкий декодер изображения на основе сопоставления функций, который поддерживает как рамки IAD с несколькими выстрелами, так и рамки IAD без надзора. Дизайн декодера, используемого в AnomalyGPT, вдохновлен рамками WinCLIP, PatchCore и APRIL-GAN. Модель делит кодировщик изображения на 4 этапа и извлекает промежуточные функции уровня патчей на каждом этапе.
Однако эти промежуточные функции не прошли окончательное выравнивание изображения и текста, поэтому они не могут быть напрямую сравнены с функциями. Для решения этой проблемы модель AnomalyGPT вводит дополнительные слои для проектирования промежуточных функций и их выравнивания с функциями текста, представляющими нормальные и аномальные семантики.
Обучение подсказок
Рамка AnomalyGPT вводит модуль обучения подсказок, который пытается преобразовать результат локализации в вложения подсказок для использования тонкой семантики из изображений и поддержания семантической последовательности между выходами декодера и LLM. Кроме того, модель включает в себя обучаемые вложения подсказок, не связанные с выходами декодера, в модуль обучения подсказок для предоставления дополнительной информации для задачи IAD. Наконец, модель подает вложения и исходную информацию об изображении в LLM.
Модуль обучения подсказок состоит из обучаемых базовых вложений подсказок и сверточной нейронной сети. Сеть преобразует результат локализации в вложения подсказок и формирует набор вложений подсказок, которые затем объединяются с вложениями изображения в LLM.
Симуляция аномалий
Модель AnomalyGPT принимает метод NSA для симуляции аномальных данных. Метод NSA использует технику Cut-paste с помощью метода редактирования изображений Пуассона для смягчения разрыва, введенного путем вставки сегментов изображений. Cut-paste – это часто используемая техника в рамках IAD для генерации симулированных аномальных изображений.
Метод Cut-paste включает в себя обрезку блочного региона из изображения случайным образом и вставку его в случайное место в другом изображении, создавая часть симулированной аномалии. Эти симулированные аномальные образцы могут повысить производительность моделей IAD, но есть недостаток, поскольку они часто производят заметные разрывы. Метод редактирования Пуассона направлен на бесшовное клонирование объекта из одного изображения в другое, решая уравнения Пуассона.

Вышеизображенное сравнение между методами Пуассона и Cut-paste. Как видно, есть заметные разрывы в методе Cut-paste, тогда как результаты метода Пуассона кажутся более естественными.
Вопросы и ответы
Для проведения настройки подсказок на модели Large Vision Language модель AnomalyGPT генерирует соответствующий текстовый запрос на основе аномального изображения. Каждый запрос состоит из двух основных компонентов. Первая часть запроса состоит из описания входного изображения, которое предоставляет информацию об объектах, присутствующих в изображении, вместе с их ожидаемыми атрибутами. Вторая часть запроса – обнаружить присутствие аномалий внутри объекта или проверить, есть ли аномалия в изображении.
Модель LLM сначала реагирует на запрос о том, есть ли аномалия в изображении. Если модель обнаруживает аномалии, она продолжает указывать местоположение и количество аномальных областей. Модель делит изображение на 3×3 сетку из отдельных регионов, чтобы позволить модели LLM указать положение аномалий устно, как показано на рисунке ниже.

Модель LLM подается знаниями о входном изображении с основными знаниями о входном изображении, которые помогают модели лучше понять компоненты изображения.
Данные и метрики оценки
Модель проводит свои эксперименты в основном на наборах данных VisA и MVTec-AD. Набор данных MVTec-AD состоит из 3629 изображений для обучения и 1725 изображений для тестирования, разделенных на 15 разных категорий, что делает его одним из наиболее популярных наборов данных для рамок IAD. Обучение изображений содержит только нормальные изображения, тогда как тестовые изображения содержат как нормальные, так и аномальные изображения. С другой стороны, набор данных VisA состоит из 9621 нормальных изображений и почти 1200 аномальных изображений, разделенных на 12 разных категорий.
Двигаясь дальше, как и существующие рамки IAD, модель AnomalyGPT использует AUC (площадь под кривой оперативной характеристики) в качестве метрики оценки, с использованием AUC на уровне пикселей и изображения для оценки производительности локализации аномалий и обнаружения аномалий соответственно. Однако модель также использует точность на уровне изображения для оценки производительности предложенного подхода, поскольку она уникально позволяет определить присутствие аномалий без необходимости ручных настроек порогов.
Результаты
Количественные результаты
Обнаружение промышленных аномалий с несколькими выстрелами
Модель AnomalyGPT сравнивает свои результаты с предыдущими рамками IAD с несколькими выстрелами, включая PaDiM, SPADE, WinCLIP и PatchCore, в качестве базовых линий.

Вышеизображенное сравнение результатов модели AnomalyGPT с рамками IAD с несколькими выстрелами. На обоих наборах данных метод, используемый AnomalyGPT, превосходит подходы, принятые предыдущими моделями, в плане AUC на уровне изображения и также возвращает хорошую точность.
Обнаружение промышленных аномалий без надзора
В настройке обучения без надзора с большим количеством нормальных образцов модель AnomalyGPT обучает одну модель на образцах, полученных из всех классов в наборе данных. Разработчики модели AnomalyGPT выбрали рамку UniAD, поскольку она обучается в той же настройке и будет служить базовой линией для сравнения. Кроме того, модель также сравнивает с рамками JNLD и PaDim, используя ту же объединенную настройку.

Вышеизображенное сравнение производительности модели AnomalyGPT с другими рамками.
Качественные результаты

Вышеизображенное иллюстрирует производительность модели AnomalyGPT в методе обнаружения аномалий без надзора, тогда как рисунок ниже демонстрирует производительность модели в методе обучения с одним выстрелом в контексте.

Модель AnomalyGPT способна указывать присутствие аномалий, отмечать их местоположение и предоставлять результаты локализации на уровне пикселей. Когда модель находится в методе обучения с одним выстрелом в контексте, производительность локализации модели немного ниже по сравнению с методом без надзора из-за отсутствия обучения.
Заключение
AnomalyGPT – это новая разговорная модель IAD на основе LVLM, предназначенная для использования мощных возможностей моделей Large Vision Language. Она не только может обнаруживать аномалии в изображении, но и указывать их точное местоположение. Кроме того, AnomalyGPT облегчает многоходовые диалоги, сосредоточенные на обнаружении аномалий, и демонстрирует исключительную производительность в обучении с несколькими выстрелами в контексте. AnomalyGPT исследует потенциальные применения моделей LVLM в обнаружении аномалий, вводя новые идеи и возможности для отрасли IAD.












