Взгляд Anderson
Обучение моделей компьютерного зрения на случайном шуме вместо реальных изображений

Исследователи из лаборатории компьютерных наук и искусственного интеллекта MIT (CSAIL) экспериментировали с использованием случайного шума в наборах данных компьютерного зрения для обучения моделей компьютерного зрения и обнаружили, что вместо получения мусора этот метод удивительно эффективен:

Генеративные модели из эксперимента, отсортированные по производительности. Источник: https://openreview.net/pdf?id=RQUl8gZnN7O
Кормление apparent ‘visual trash’ в популярные архитектуры компьютерного зрения не должно приводить к такому результату. На дальнем правом краю изображения выше, черные столбцы представляют точность (на Imagenet-100) для четырех ‘реальных’ наборов данных. Хотя ‘случайные шумовые’ наборы данных, предшествующие им (изображенные в различных цветах, см. индекс в верхнем левом углу), не могут сравниться с этим, они почти все находятся в пределах уважаемых верхних и нижних границ (красные пунктирные линии) для точности.
В этом смысле ‘точность’ не означает, что результат обязательно выглядит как лицо, церковь, пицца или любой другой конкретный домен, для которого вы можете быть заинтересованы в создании системы синтеза изображений, такой как Генеративная сеть противостояния или фреймворк кодирования/декодирования.
РATHER, это означает, что модели CSAIL получили общие, применимые ‘истины’ из изображений, которые, казалось бы, неструктурированы, и не должны были бы давать такие результаты.
Разнообразие против натурализма
Эти результаты также не могут быть объяснены переобучением: живой обсуждение между авторами и рецензентами в Open Review показывает, что смешивание разных содержаний из визуально разнообразных наборов данных (таких как ‘мертвые листья’, ‘фракталы’ и ‘процедурный шум’ – см. изображение ниже) в обучающий набор данных на самом деле улучшает точность в этих экспериментах.
Это предполагает (и это немного революционная идея) новый тип ‘недообучения’, где ‘разнообразие’ превосходит ‘натурализм’.

Проектная страница инициативы позволяет интерактивно просматривать различные типы случайных изображений, использованных в эксперименте. Источник: https://mbaradad.github.io/learning_with_noise/
Результаты, полученные исследователями, ставят под вопрос фундаментальную связь между нейронными сетями, основанными на изображениях, и ‘реальными’ изображениями, которые бросаются в них в тревожно больших объемах каждый год, и подразумевают, что необходимость получения, курирования и иного манипулирования гипермасштабными наборами изображений может в конечном итоге стать излишней. Авторы заявляют:
‘Текущие системы зрения обучаются на огромных наборах данных, и эти наборы данных имеют стоимость: курирование дорого, они наследуют человеческие предубеждения, и есть проблемы с конфиденциальностью и правами использования. Чтобы противостоять этим затратам, интерес к обучению на более дешевых источниках данных, таких как неаннотированные изображения, резко возрос.’
‘В этой работе мы делаем шаг вперед и спрашиваем, можно ли отказаться от реальных наборов изображений полностью, обучаясь на процедурных шумовых процессах.’
Исследователи предлагают, что текущий набор архитектур машинного обучения может выводить что-то гораздо более фундаментальное (или, по крайней мере, неожиданное) из изображений, чем считалось ранее, и что ‘бессмысленные’ изображения потенциально могут передать большую часть этой информации гораздо дешевле, даже с возможным использованием ад hoc синтетических данных, посредством архитектур генерации наборов данных, которые генерируют случайные изображения во время обучения:
‘Мы определили два ключевых свойства, которые делают хорошие синтетические данные для обучения систем зрения: 1) натурализм, 2) разнообразие. Интересно, что наиболее натуралистические данные не всегда являются лучшими, поскольку натурализм может происходить за счет разнообразия.
‘Факт, что натуралистические данные помогают, может не быть удивительным, и это предполагает, что действительно, крупномасштабные реальные данные имеют ценность. Однако мы обнаружили, что то, что важно, не то, что данные являются реальными, а то, что они являются натуралистическими, т. е. они должны захватывать определенные структурные свойства реальных данных.
‘Многие из этих свойств могут быть захвачены в простых моделях шума.’

Визуализация функций, полученная из кодировщика, полученного из AlexNet, на некоторых из различных ‘случайных изображений’ наборов данных, использованных авторами, охватывающих 3-й и 5-й (финальный) свертывающий слой. Методология, использованная здесь, соответствует той, которая была представлена в исследовании Google AI 2017 года.
Статья, представленная на 35-й конференции по обработке нейронной информации (NeurIPS 2021) в Сиднее, озаглавлена Обучение видеть, глядя на шум, и исходит от шести исследователей из CSAIL, с равным вкладом.
Работа была рекомендована консенсусом для выбора в фокусе на NeurIPS 2021, с комментариями рецензентов, характеризующими статью как ‘научный прорыв’, который открывает ‘большую область исследований’, даже если он вызывает столько же вопросов, сколько и ответов.
В статье авторы заключили:
‘Мы показали, что, когда они спроектированы с использованием результатов прошлых исследований по статистике натуральных изображений, эти наборы данных могут успешно обучать визуальные представления. Мы надеемся, что эта статья будет мотивировать изучение новых генеративных моделей, способных производить структурированный шум, достигающий еще более высокой производительности при использовании в различных визуальных задачах.
‘Будет ли возможно сравнить производительность, полученную с помощью предварительного обучения на ImageNet? Может быть, в отсутствие большого обучающего набора, специфичного для определенной задачи, лучшее предварительное обучение может не использовать стандартный реальный набор данных, такой как ImageNet.’












