Модели и платформы ИИ
DiffSeg: Улучшенный алгоритм сегментации без предварительной подготовки с использованием стабильной диффузии
Одной из основных проблем в моделях компьютерного зрения является генерация высококачественных масок сегментации. Недавние достижения в области крупномасштабной обучения с учителем позволили осуществлять сегментацию без предварительной подготовки на различных стилях изображений. Кроме того, обучение без учителя упростило сегментацию, исключив необходимость обширных аннотаций. Несмотря на эти достижения, создание компьютерного зрения, способного сегментировать все в условиях отсутствия предварительной подготовки и аннотаций, остается сложной задачей. Семантическая сегментация, фундаментальная концепция в моделях компьютерного зрения, предполагает деление изображения на более мелкие регионы с единообразной семантикой. Этот метод закладывает основу для различных последующих задач, таких как медицинская визуализация, редактирование изображений, автономное вождение и многое другое.
Чтобы продвинуть разработку моделей компьютерного зрения, важно, чтобы сегментация изображений не ограничивалась фиксированным набором данных с ограниченными категориями. Вместо этого она должна служить универсальной основной задачей для различных других приложений. Однако высокая стоимость сбора меток на пиксельной основе представляет собой значительную проблему, ограничивающую прогресс методов сегментации без предварительной подготовки и с учителем, которые требуют отсутствия аннотаций и предварительного доступа к целевому объекту. В этой статье мы обсудим, как можно использовать само-внимание в стабильных моделях диффузии для создания модели, способной сегментировать любой вход в условиях отсутствия предварительной подготовки, даже без надлежащих аннотаций. Эти само-внимания по своей сути понимают понятия объектов, изученные предварительно обученной стабильной моделью диффузии.
DiffSeg: Улучшенный алгоритм сегментации без предварительной подготовки
Семантическая сегментация представляет собой процесс, который делит изображение на различные секции, каждая из которых имеет схожую семантику. Этот метод формирует основу для различных последующих задач. Традиционно задачи компьютерного зрения без предварительной подготовки полагались на обучение с учителем для семантической сегментации, используя крупные наборы данных с аннотированными и помеченными категориями. Однако реализация не-supervised семантической сегментации в условиях отсутствия предварительной подготовки остается проблемой. Хотя традиционные методы обучения с учителем эффективны, их стоимость меток на пиксельной основе часто запретительна, подчеркивая необходимость разработки методов не-supervised сегментации в менее ограничительных условиях отсутствия предварительной подготовки, где модель не требует аннотированных данных и не имеет предварительных знаний о данных.
Чтобы устранить это ограничение, DiffSeg вводит новую стратегию пост-обработки, используя возможности стабильной модели диффузии для создания универсальной модели сегментации, способной осуществлять передачу без предварительной подготовки на любом изображении. Стабильные модели диффузии доказали свою эффективность в генерации изображений высокого разрешения на основе условий подсказки. Для сгенерированных изображений эти модели могут производить маски сегментации, используя соответствующие текстовые подсказки, обычно включающие только доминирующие объекты переднего плана.
Напротив, DiffSeg представляет собой инновационный метод пост-обработки, создающий маски сегментации, используя тензоры внимания из само-внимательных слоев в модели диффузии. Алгоритм DiffSeg состоит из трех основных компонентов: итеративного слияния внимания, агрегации внимания и подавления не-максимальных значений, как показано на следующем изображении.

Алгоритм DiffSeg сохраняет визуальную информацию на нескольких разрешениях, агрегируя 4D тензоры внимания с пространственной последовательностью и используя итеративный процесс слияния путем выборки якорных точек. Эти якорные точки служат отправной точкой для слияния масок внимания с одинаковыми якорными точками объектов, которые в конечном итоге поглощаются. Рамка DiffSeg контролирует процесс слияния с помощью метода различия Кульбака-Лейблера для измерения сходства между двумя картами внимания.
Когда сравнивается с методами не-supervised сегментации на основе кластеризации, разработчикам не нужно указывать количество кластеров заранее в алгоритме DiffSeg, и даже без каких-либо предварительных знаний алгоритм DiffSeg может производить сегментацию без использования дополнительных ресурсов. В целом, алгоритм DiffSeg представляет собой “новый не-supervised и без предварительной подготовки метод сегментации, который использует предварительно обученную стабильную модель диффузии и может сегментировать изображения без каких-либо дополнительных ресурсов или предварительных знаний.”
DiffSeg: Основные концепции
DiffSeg представляет собой новый алгоритм, который основан на знаниях, полученных из моделей диффузии, не-supervised сегментации и сегментации без предварительной подготовки.
Модели диффузии
Алгоритм DiffSeg основан на знаниях, полученных из предварительно обученных моделей диффузии. Модели диффузии являются одним из наиболее популярных генеративных каркасов для моделей компьютерного зрения и учатся прямому и обратному процессу диффузии от образца изотропического гауссовского шума до генерации изображения. Стабильная диффузия является наиболее популярной вариацией моделей диффузии и используется для выполнения широкого спектра задач, включая обучение с учителем для сегментации, классификацию без предварительной подготовки, соответствие семантики, метко-эффективную сегментацию и открытую сегментацию словаря. Однако единственной проблемой с моделями диффузии является то, что они полагаются на высокоразмерные визуальные особенности для выполнения этих задач и часто требуют дополнительной подготовки для полного использования этих особенностей.
Не-supervised сегментация
Алгоритм DiffSeg тесно связан с не-supervised сегментацией, современной практикой ИИ, целью которой является генерация плотных масок сегментации без использования каких-либо аннотаций. Однако для обеспечения хорошей производительности модели не-supervised сегментации все же требуют некоторой предварительной не-supervised подготовки на целевом наборе данных. Модели не-supervised сегментации на основе ИИ можно классифицировать на две категории: кластеризация с использованием предварительно обученных моделей и кластеризация на основе инвариантности. В первой категории каркасы используют дискриминационные особенности, изученные предварительно обученными моделями, для генерации масок сегментации, тогда как каркасы, относящиеся ко второй категории, используют общий алгоритм кластеризации, который оптимизирует взаимную информацию между двумя изображениями для сегментации изображений в семантические кластеры и избегает вырожденной сегментации.
Сегментация без предварительной подготовки
Алгоритм DiffSeg тесно связан с каркасами сегментации без предварительной подготовки, методом, который может сегментировать все без какой-либо предварительной подготовки или знаний данных. Модели сегментации без предварительной подготовки продемонстрировали исключительные возможности передачи без предварительной подготовки в последнее время, хотя они требуют некоторого текстового ввода и подсказок. Напротив, алгоритм DiffSeg использует модель диффузии для генерации сегментации без запроса и синтеза нескольких изображений и без знаний содержания объекта.
DiffSeg: Метод и архитектура
Алгоритм DiffSeg использует само-внимательные слои в предварительно обученной стабильной модели диффузии для генерации высококачественных задач сегментации.
Стабильная модель диффузии
Стабильная диффузия является одним из фундаментальных концепций в каркасе DiffSeg. Стабильная диффузия представляет собой генеративный каркас ИИ и одну из наиболее популярных моделей диффузии. Одной из основных характеристик модели диффузии является прямой и обратный проход. На прямом проходе небольшое количество гауссовского шума добавляется к изображению на каждом временном шаге до тех пор, пока изображение не станет изотропическим гауссовским шумом. Напротив, на обратном проходе модель диффузии итеративно удаляет шум в изотропическом гауссовском шуме для восстановления исходного изображения без гауссовского шума.
Каркас стабильной диффузии использует кодировщик-декодировщик и архитектуру U-Net с слоем внимания, где он использует кодировщик для сжатия изображения в латентное пространство с меньшими пространственными размерами и использует декодировщик для декомпрессии изображения. Архитектура U-Net состоит из стека модульных блоков, где каждый блок состоит из одного из следующих двух компонентов: слоя трансформера и слоя ResNet.
Компоненты и архитектура
Само-внимательные слои в моделях диффузии группируют информацию о внутренних объектах в форме пространственных карт внимания, и DiffSeg представляет собой новый метод пост-обработки для слияния тензоров внимания в действительную маску сегментации с трубопроводом, состоящим из трех основных компонентов: агрегации внимания, подавления не-максимальных значений и итеративного внимания.
Агрегация внимания
Для входного изображения, которое проходит через слои U-Net и кодировщик, стабильная модель диффузии генерирует в общей сложности 16 тензоров внимания, по 5 тензоров для каждого измерения. Основной целью генерации 16 тензоров является агрегация этих тензоров внимания с разными разрешениями в тензор с наивысшим возможным разрешением. Для этого алгоритм DiffSeg рассматривает 4 измерения по-разному.
Из четырех измерений последние 2 измерения в тензорах внимания имеют разные разрешения, но они пространственно последовательны, поскольку 2D пространственная карта каркаса DiffSeg соответствует корреляции между местоположениями и пространственными местоположениями. Следовательно, каркас DiffSeg выборочно отбирает эти два измерения всех карт внимания до наивысшего разрешения из всех, 64 x 64. С другой стороны, первые 2 измерения указывают на местоположение ссылки карт внимания, как показано на следующем изображении.

Поскольку эти измерения относятся к местоположению карт внимания, карты внимания необходимо агрегировать соответствующим образом. Кроме того, для обеспечения того, чтобы агрегированная карта внимания имела действительное распределение, каркас нормализует распределение после агрегации, причем каждой карте внимания присваивается вес, пропорциональный ее разрешению.
Итеративное слияние внимания
Хотя основной целью агрегации внимания было вычисление тензора внимания, основной целью является слияние карт внимания в стек предложений объектов, где каждое отдельное предложение содержит либо категорию “вещи”, либо активацию единственного объекта. Предлагаемое решение для достижения этой цели заключается в реализации алгоритма K-Means на действительном распределении тензоров для нахождения кластеров объектов. Однако использование алгоритма K-Means не является оптимальным решением, поскольку кластеризация K-Means требует от пользователей указать количество кластеров заранее. Кроме того, реализация алгоритма K-Means может привести к разным результатам для одного и того же изображения, поскольку она стохастически зависит от инициализации. Чтобы преодолеть это препятствие, каркас DiffSeg предлагает генерировать сетку выборки для создания предложений путем итеративного слияния карт внимания.
Подавление не-максимальных значений
Предыдущий шаг итеративного слияния внимания приводит к списку предложений объектов в форме вероятностных карт внимания, где каждое предложение объекта содержит активацию объекта. Каркас использует подавление не-максимальных значений для преобразования списка предложений объектов в действительную маску сегментации, и этот процесс является эффективным подходом, поскольку каждый элемент в списке уже является картой распределения вероятности. Для каждого пространственного местоположения во всех картах алгоритм принимает индекс наибольшей вероятности и присваивает членство на основе индекса соответствующей карты.
DiffSeg: Эксперименты и результаты
Каркасы, работающие на не-supervised сегментации, используют два набора данных сегментации, а именно Cityscapes и COCO-stuff-27. Набор данных Cityscapes представляет собой набор данных для автономного вождения с 27 средними категориями, тогда как набор данных COCO-stuff-27 представляет собой курированную версию исходного набора данных COCO-stuff, который объединяет 80 вещей и 91 категорию в 27 категорий. Кроме того, для анализа производительности сегментации каркас DiffSeg использует среднее пересечение по объединению или mIoU и точность пикселей или ACC, и поскольку алгоритм DiffSeg не может предоставить семантическую метку, он использует алгоритм венгерского сопоставления для присвоения каждой предсказанной маске метки.
Кроме того, каркас DiffSeg также подчеркивает следующие три работы для запуска интерференции: зависимость от языка или LD, не-supervised адаптация или UA и вспомогательное изображение или AX. Зависимость от языка означает, что метод требует описательных текстовых входных данных для облегчения сегментации изображения, не-supervised адаптация относится к требованию метода использовать не-supervised подготовку на целевом наборе данных, тогда как вспомогательное изображение относится к необходимости дополнительных входных данных, либо в виде синтетических изображений, либо в виде пула ссылочных изображений.
Результаты
На наборе данных COCO каркас DiffSeg включает два базовых варианта K-Means, K-Means-S и K-Means-C. Базовый вариант K-Means-C включает 6 кластеров, рассчитанных путем усреднения количества объектов в изображениях, которые он оценивает, тогда как базовый вариант K-Means-S использует определенное количество кластеров для каждого изображения на основе количества объектов, присутствующих в метке изображения, и результаты на обоих этих базовых вариантах показаны на следующем изображении.

Как можно увидеть, базовый вариант K-Means превосходит существующие методы, демонстрируя преимущество использования тензоров само-внимания. Что интересно, базовый вариант K-Means-S превосходит базовый вариант K-Means-C, что указывает на то, что количество кластеров является фундаментальным гиперпараметром, и его настройка важна для каждого изображения. Кроме того, даже при использовании одних и тех же тензоров внимания каркас DiffSeg превосходит базовые варианты K-Means, что доказывает способность каркаса DiffSeg не только обеспечить лучшую сегментацию, но и избежать недостатков, связанных с использованием базовых вариантов K-Means.
На наборе данных Cityscapes каркас DiffSeg обеспечивает результаты, аналогичные каркасам, использующим входные данные с более низким разрешением 320, превосходя каркасы, которые принимают входные данные с более высоким разрешением 512, по точности и mIoU.

Как упоминалось ранее, каркас DiffSeg использует несколько гиперпараметров, как показано на следующем изображении.

Агрегация внимания является одним из фундаментальных концепций, используемых в каркасе DiffSeg, и эффекты использования разных весов агрегации показаны на следующем изображении с постоянным разрешением изображения.

Как можно наблюдать, высокоразрешающие карты на рис. (б) с разрешением 64 x 64 обеспечивают наиболее детальные сегментации, хотя сегментации и имеют некоторые видимые трещины, тогда как карты с более низким разрешением 32 x 32 склонны к пере-сегментации деталей, хотя и приводят к улучшению согласованности сегментации. На рис. (д) карты с низким разрешением не способны сгенерировать какую-либо сегментацию, поскольку все изображение объединяется в единый объект с существующими гиперпараметрами. Наконец, рис. (а), который использует стратегию пропорциональной агрегации, приводит к улучшению деталей и сбалансированной согласованности.
Окончательные мысли
Сегментация без предварительной подготовки все еще является одной из наиболее значительных проблем для каркасов компьютерного зрения, и существующие модели либо полагаются на не нулевую предварительную подготовку, либо на внешние ресурсы. Чтобы преодолеть это препятствие, мы обсудили, как само-внимательные слои в стабильных моделях диффузии могут позволить создать модель, способную сегментировать любой вход в условиях отсутствия предварительной подготовки без надлежащих аннотаций, поскольку эти само-внимательные слои содержат внутренние понятия объектов, изученные предварительно обученной стабильной моделью диффузии. Мы также обсудили DiffSeg, новый метод пост-обработки, целью которого является использование потенциала стабильной модели диффузии для создания универсальной модели сегментации, способной осуществлять передачу без предварительной подготовки на любом изображении. Алгоритм DiffSeg полагается на меж-внимательное сходство и внутри-внимательное сходство для итеративного слияния карт внимания в действительные маски сегментации для достижения передовых результатов на популярных наборах данных.












