Взгляд Anderson
Улучшение производительности машинного обучения за счет использования CNN для изменения размера изображений

Исследователи из Google предложили новый метод улучшения эффективности и точности обучения компьютерного зрения на основе изображений, оптимизируя процесс изменения размера изображений на этапе предобработки.
В статье Обучение изменению размера изображений для задач компьютерного зрения исследователи Хоссейн Талеби и Пейман Миланфар используют CNN для создания новой гибридной архитектуры изменения размера изображений, которая обеспечивает заметное улучшение результатов распознавания на четырех популярных наборах данных компьютерного зрения.

Предложенная совместная структура для распознавания и изменения размера. Источник: https://arxiv.org/pdf/2103.09950.pdf
Статья отмечает, что методы изменения размера, используемые в автоматических процессах машинного обучения, устарели и часто используют только базовые методы билинейного, бикубического и ближайшего соседа изменения размера – методы, которые рассматривают все пиксели без различия.
Напротив, предложенный метод дополняет данные изображений с помощью CNN и включает эти данные в измененные изображения, которые в конечном итоге будут проходить через архитектуру модели.
Ограничения изображений в обучении ИИ
Для обучения модели, работающей с изображениями, в рамках машинного обучения включается этап предобработки, на котором разнообразные изображения различных размеров, цветовых пространств и разрешений (которые будут вносить вклад в набор данных для обучения) систематически обрезаются и изменяются до постоянных размеров и стабильного формата.
Обычно это предполагает компромисс, основанный на формате PNG, где устанавливается баланс между временем обработки/ресурсами, размером файла и качеством изображения.
В большинстве случаев окончательные размеры обработанного изображения очень малы. Ниже мы видим пример изображения с разрешением 80×80 пикселей, на котором были сгенерированы некоторые из ранних наборов данных deepfake:

Поскольку лица (и другие возможные объекты) редко подходят к необходимому квадратному соотношению, могут потребоваться черные полосы (или разрешение пустого пространства) для гомогенизации изображений, что еще больше снижает фактическое количество полезных данных изображения:

Здесь лицо было извлечено из более крупной области изображения до тех пор, пока оно не было обрезано так экономно, как это возможно, чтобы включить всю область лица. Однако, как видно на правой стороне, большая часть оставшейся области не будет использоваться во время обучения, что добавляет вес важности качества измененного изображения.
По мере улучшения возможностей GPU в последние годы, с новым поколением карт NVIDIA, оснащенных увеличивающимися объемами видеопамяти (VRAM), средние размеры изображений, вносящих вклад в обучение, начинают увеличиваться, хотя 224×224 пикселя все еще является довольно стандартным размером (например, это размер ResNet-50).

Неизмененное изображение размером 224×244 пикселя.
Подгонка пакетов в VRAM
Причина, по которой все изображения должны быть одинакового размера, заключается в том, что градиентный спуск, метод, с помощью которого модель улучшается со временем, требует единообразных данных для обучения.
Причина, по которой изображения должны быть такими маленькими, заключается в том, что они должны быть загружены (полностью распакованы) в VRAM во время обучения в небольших пакетах, обычно от 6 до 24 изображений в пакете. Слишком мало изображений в пакете, и не хватает группового материала для обобщения, помимо продления времени обучения; слишком много, и модель может не получить необходимых характеристик и деталей (см. ниже).
Этот ‘живой’ раздел архитектуры обучения называется латентным пространством. Это место, где извлекаются повторяющиеся особенности (которые в конечном итоге будут распознаваться во время обучения) из одних и тех же данных (т.е. одних и тех же изображений) до тех пор, пока модель не достигнет состояния, в котором она получит все обобщенные знания, необходимые для выполнения преобразований над последующими, не виденными данными подобного типа.
Этот процесс обычно занимает несколько дней, хотя может занять и месяц или более постоянной и беспощадной высокообъемной 24/7 обработки, чтобы достичь полезного обобщения. Увеличение размера VRAM полезно только до определенной точки, поскольку даже незначительные приращения разрешения изображения могут иметь эффект порядка величины на вычислительную мощность и связанные с этим эффекты на точность, которые не всегда могут быть благоприятными.
Использование большей емкости VRAM для размещения более крупных пакетов также является смешанным благословением, поскольку более высокие скорости обучения, полученные таким образом, вероятно, будут компенсированы менее точными результатами.
Следовательно, поскольку архитектура обучения так ограничена, все, что может улучшить существующие ограничения процесса, является заметным достижением.
Как улучшение уменьшения размера помогает
Окончательное качество изображения, которое будет включено в набор данных для обучения, было доказано как фактор, улучшающий результаты обучения, особенно в задачах распознавания объектов. В 2018 году исследователи из Института интеллектуальных систем Макса Планка утверждали, что выбор метода ресэмплирования существенно влияет на производительность обучения и результаты.
Кроме того, предыдущая работа Google (содиректорами которой являются авторы новой статьи) показала, что точность классификации может быть улучшена путем поддержания контроля над артефактами сжатия в изображениях набора данных.
Модель CNN, построенная в новый ресэмплер, объединяет билинейное изменение размера с функцией “skip connection”, которая может включать вывод из обученной сети в измененное изображение.
В отличие от типичной архитектуры кодировщик/декодировщик, новое предложение может действовать не только как прямой бутылочное горлышко, но и как обратное бутылочное горлышко для масштабирования до любого целевого размера и/или соотношения сторон. Кроме того, ‘стандартный’ метод ресэмплирования можно заменить на любой другой подходящий традиционный метод, такой как Ланцос.
Детали высоких частот
Новый метод производит изображения, которые, по сути, ‘запекают’ ключевые особенности (которые в конечном итоге будут распознаваться во время обучения) непосредственно в исходное изображение. С точки зрения эстетики, результаты необычны:

Новый метод, примененный к четырем сетям – Inception V2; DenseNet-121; ResNet-50; и MobileNet-V2. Результаты метода уменьшения размера изображений Google Research производят изображения с очевидной агрегацией пикселей, предвидя ключевые особенности, которые будут различаться во время обучения.
Исследователи отмечают, что эти первоначальные эксперименты исключительно оптимизированы для задач распознавания изображений, и что в тестах их CNN-ресайзер смог достичь улучшенных показателей ошибок в таких задачах. Исследователи намерены в будущем применить этот метод к другим типам приложений компьютерного зрения на основе изображений.











