Погляд Anderson

Навчання моделей комп’ютерного зору на випадковому шумі замість справжніх зображень

mm
Додайте Unite.AI до бажаних джерел у Google

Дослідники з лабораторії комп’ютерних наук та штучного інтелекту Массачусетського технологічного інституту (CSAIL) експериментували з використанням випадкових шумових зображень у наборах даних комп’ютерного зору для навчання моделей комп’ютерного зору, і виявили, що замість того, щоб виробляти сміття, цей метод досить ефективний:

Генеративні моделі з експерименту, відсортовані за продуктивністю. Джерело: https://openreview.net/pdf?id=RQUl8gZnN7O

Генеративні моделі з експерименту, відсортовані за продуктивністю. Джерело: https://openreview.net/pdf?id=RQUl8gZnN7O

Кормлення очевидного “візуального сміття” у популярні архітектури комп’ютерного зору не повинно призводити до такого рівня продуктивності. На дальньому правому боці зображення вище, чорні стовпці представляють точність (на Imagenet-100) для чотирьох “справжніх” наборів даних. Хоча “випадкові шумові” набори даних, що передують їм (зображені різними кольорами, див. індекс зверху ліворуч), не можуть дорівняти цьому, вони майже всі знаходяться в межах прийнятної верхньої та нижньої межі (червоні пунктирні лінії) для точності.

У цьому сенсі “точність” не означає, що результат обов’язково виглядає як обличчя, церква, піца або будь-яка інша конкретна область, для якої ви можете бути зацікавлені у створенні системи синтезу зображень, chẳng hạn як Генеративна суперницька мережа або рамка кодувача/декодувача.

Натомість, це означає, що моделі CSAIL вивели широковживані центральні “істини” з даних зображень, які здаються настільки неструктурованими, що не повинні бути здатними постачати їх.

Різноманітність проти натуралізму

Також ці результати не можуть бути пояснені переобученням: живий обговорення між авторами та рецензентами на Open Review показує, що змішування різних змістів з візуально різноманітних наборів даних (таких як “мертві листя”, “фрактали” та “процедурний шум” – див. зображення нижче) до навчального набору даних справді покращує точність в цих експериментах.

Це свідчить (і це трохи революційна концепція) про новий тип “недообучення”, де “різноманітність” переважає “натуралізм”.

Проектна сторінка ініціативи дозволяє інтерактивно переглядати різні типи випадкових наборів даних зображень, використаних у експерименті. Джерело: https://mbaradad.github.io/learning_with_noise/

Проектна сторінка ініціативи дозволяє інтерактивно переглядати різні типи випадкових наборів даних зображень, використаних у експерименті. Джерело: https://mbaradad.github.io/learning_with_noise/

Результати, отримані дослідниками, ставлять під сумнів фундаментальну взаємозв’язок між нейронними мережами, заснованими на зображеннях, та “реальними” зображеннями, які кидаються на них у все більшій кількості щороку, і свідчать про те, що необхідність отримання, кураторства та іншого використання гіпермасштабних наборів даних зображень може в кінцевому підсумку стати зайвою. Автори заявляють:

‘Поточні системи бачення тренуються на величезних наборах даних, і ці набори даних супроводжуються витратами: кураторство дорого, вони успадковують упередження людини, і існують проблеми щодо конфіденційності та прав на використання. Щоб протидіяти цим витратам, інтерес зріс у вивченні дешевих джерел даних, таких як неназвані зображення.’

‘У цій роботі ми йдемо далі і питаємося, чи можемо ми відмовитися від реальних наборів даних зображень зовсім, вивчаючи процедурні процеси шуму.’

Дослідники припускають, що поточна генерація архітектур машинного навчання може виводити щось значно фундаментальніше (або, принаймні, несподіваніше) з зображень, ніж вважалося раніше, і що “нonsense” зображення можуть потенційно надати багато цієї інформації набагато дешевше, навіть з можливим використанням ад-хок синтетичних даних через архітектури генерації наборів даних, які генерують випадкові зображення під час навчання:

Ми визначаємо два ключових властивості, які роблять добрі синтетичні дані для навчання систем бачення: 1) натуралізм, 2) різноманітність. Цікаво, що найбільш натуралістичні дані не завжди найкращі, оскільки натуралізм може йти за рахунок різноманітності. ‘

‘Той факт, що натуралістичні дані допомагають, не повинен бути дивовижним, і це свідчить про те, що великомасштабні реальні дані мають значення. Однак ми виявили, що те, що важливо, не те, що дані є реальними, а те, що вони є натуралістичними, тобто вони повинні захоплювати певні структурні властивості реальних даних. ‘

‘Багато з цих властивостей можна захопити в простих моделях шуму.’

Візуалізація функцій, отриманих від кодувача, отриманого з AlexNet, на деяких з різних 'випадкових зображень' наборів даних, використаних авторами, що охоплюють 3-й і 5-й (останній) конволюційний шар. Методологія, використана тут, відповідає методології, викладеній у дослідженнях Google AI 2017 року.

Візуалізація функцій, отриманих від кодувача, отриманого з AlexNet, на деяких з різних ‘випадкових зображень’ наборів даних, використаних авторами, що охоплюють 3-й і 5-й (останній) конволюційний шар. Методологія, використана тут, відповідає методології, викладеній у дослідженнях Google AI 2017 року.

Стаття стаття, представлена на 35-ій Конференції з обробки нейронної інформації (NeurIPS 2021) у Сіднеї, називається Навчання бачити, дивлячись на шум, і походить від шести дослідників з CSAIL, з рівним внеском.

Робота була рекомендована консенсусом для вибіркової презентації на NeurIPS 2021, з коментарями рецензентів, які характеризують статтю як “науковий прорив”, який відкриває “велику область дослідження”, навіть якщо вона ставить так nhiều питань, як і відповідає.

У статті автори роблять висновок:

‘Ми показали, що, коли проектуються за результатами попередніх досліджень про статистику природних зображень, ці набори даних можуть успішно тренувати візуальні представлення. Ми сподіваємося, що ця стаття мотивуватиме вивчення нових генеративних моделей, здатних виробляти структурований шум, що досягає ще вищої продуктивності при використанні в різноманітних візуальних завданнях. ‘

‘Чи можливо досягти рівня продуктивності, отриманої з попереднім тренуванням на ImageNet? Можливо, у відсутності великого навчального набору, специфічного для певного завдання, найкраще попереднє тренування може не полягати у використанні стандартного реального набору даних, такого як ImageNet.’

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai