Взгляд Anderson

Переинтерпретация может быть более серьезной и сложной угрозой, чем переобучение

mm
Добавьте Unite.AI в избранные источники в Google

Если ваша хорошая подруга Алиса любит носить желтые свитера, вы будете видеть гораздо больше желтых свитеров, чем средний человек. После некоторого времени возможно, что когда вы увидите другую женщину в желтом свитере, основная концепция Алиса придет на ум.

Если вы увидите женщину в желтом свитере, которая похожа на Алису немного, вы можете даже暂енно принять ее за свою подругу.

Но это не Алиса. В конечном итоге вы осознаете, что желтый свитер не является полезным ключом для идентификации Алисы, поскольку она никогда не носит их летом, и не всегда носит их зимой. Как-то в процессе дружбы вы начнете снижать желтый свитер как возможный Алиса идентификатор, потому что ваш опыт с ним был неудовлетворительным, и когнитивная энергия, используемая для поддержания этого shortcut, не часто вознаграждается.

Если вы являетесь системой распознавания на основе компьютерного зрения, однако, вполне возможно, что вы видите Алису везде, где видите желтый свитер.

Это не ваша вина; вы были поручены идентифицировать Алису любой ценой, из минимально доступной информации, и нет недостатка когнитивных ресурсов для поддержания этого редуктивного Алиса crib.

Необычное различение

Согласно недавней статье из лаборатории компьютерных наук и искусственного интеллекта MIT (CSAIL) и Amazon Web Services, этот синдром, называемый переинтерпретацией, широко распространен в области компьютерного зрения (CV); не может быть смягчен путем устранения переобучения (поскольку это не прямой признак переобучения); часто встречается в исследованиях, которые используют две наиболее влиятельные наборы данных в распознавании и преобразовании изображений, CIFAR-10 и ImageNet; и не имеет простых средств – определенно нет дешевых средств.

Исследователи обнаружили, что когда входные обучающие изображения уменьшаются до 5% их связного содержания, широкий спектр популярных фреймворков продолжает правильно классифицировать изображения, которые, в большинстве случаев, кажутся визуальным бессмыслицей для любого человеческого наблюдателя:

Оригинальные обучающие изображения из CIFAR-10, уменьшенные до 5% от исходного пиксельного содержания, но правильно классифицированные рядом популярных компьютерных фреймворков с точностью между 90-99%.

Оригинальные обучающие изображения из CIFAR-10, уменьшенные до 5% от исходного пиксельного содержания, но правильно классифицированные рядом популярных компьютерных фреймворков с точностью между 90-99%. Источник: https://arxiv.org/pdf/2003.08907.pdf

В некоторых случаях классификационные фреймворки на самом деле находят эти урезанные изображения легче правильно классифицировать, чем полные кадры в исходных обучающих данных, с наблюдением авторов ‘[CNNs] более уверены в этих пиксельных подмножествах, чем в полных изображениях’.

Это указывает на потенциально подрывающий тип “обмана”, который происходит как обычная практика для систем компьютерного зрения, которые используют эталонные наборы данных, такие как CIFAR-10 и ImageNet, и эталонные фреймворки, такие как VGG16, ResNet20 и ResNet18.

Переинтерпретация имеет заметные последствия для автономных транспортных систем на основе компьютерного зрения, которые недавно привлекли внимание с решением Tesla отдать предпочтение интерпретации изображений над LiDAR и другими лучевыми системами обнаружения для алгоритмов самоходных транспортных средств.

Хотя “обучение на сокращениях” является известной проблемой и областью активных исследований в компьютерном зрении, авторы статьи отмечают, что немецко-канадские исследования, которые заметно сформулировали проблему в 2019 году, не признают, что “посторонние” пиксельные подмножества, характерные для переинтерпретации, являются “статистически действительными данными”, которые могут потребовать решения в плане архитектуры и более высоких подходов, а не более тщательной кураторской обработки наборов данных.

Статья называется Переинтерпретация раскрывает патологии моделей классификации изображений и исходит от Брэндона Картера, Сиддхартхи Джайна и Дэвида Гиффорда из CSAIL, в сотрудничестве с Йонасом Мюллером из Amazon Web Services. Код для статьи доступен на https://github.com/gifford-lab/overinterpretation.

Уменьшение данных

Уменьшенные изображения, которые использовали исследователи, называются ими Достаточные входные подмножества (SIS) – по сути, SIS-изображение содержит минимально возможную “внешнюю оболочку”, которая может определить изображение достаточно хорошо, чтобы компьютерная система зрения могла идентифицировать исходный предмет изображения (т.е. собака, корабль и т. д.).

В верхнем ряду мы видим полные изображения валидации ImageNet; ниже, SIS-подмножества, правильно классифицированные моделью Inception V3 с 90% уверенностью, основанной, по-видимому, на всем, что осталось от изображения - фоновом контексте. Естественно, что последний столбец имеет заметные последствия для распознавания знаков в алгоритмах самоходных транспортных средств.

В верхнем ряду мы видим полные изображения валидации ImageNet; ниже, SIS-подмножества, правильно классифицированные моделью Inception V3 с 90% уверенностью, основанной, по-видимому, на всем, что осталось от изображения – фоновом контексте. Естественно, что последний столбец имеет заметные последствия для распознавания знаков в алгоритмах самоходных транспортных средств.

Комментируя результаты, полученные в вышеуказанном изображении, исследователи отмечают:

‘Мы обнаружили, что пиксели SIS концентрируются вне фактического объекта, определяющего метку класса. Например, в изображении “пицца” SIS концентрируется на форме тарелки и фоновом столе, а не на самой пицце, что предполагает, что модель может обобщать плохо на изображениях с разными круглыми предметами на столе. В изображении “большая панда” SIS содержит бамбук, который, вероятно, появился в коллекции фотографий ImageNet для этого класса.

‘В изображениях “трафик-светофор” и “уличный знак” SIS состоит из пикселей в небе, что предполагает, что автономные транспортные системы, которые могут полагаться на эти модели, должны быть тщательно оценены на патологии переинтерпретации.’

SIS-изображения не обрезаются случайным образом, а были созданы для проекта путем пакетной градиентной обратной выборки на Inception V3 и ResNet50 через PyTorch. Изображения получены путем абляционной процедуры, которая учитывает связь между способностью модели точно классифицировать изображение и областями, в которых исходные данные удаляются.

Чтобы подтвердить действительность SIS, авторы протестировали процесс случайного удаления пикселей и обнаружили, что результаты ‘значительно менее информативны’ в тестах, что указывает на то, что SIS-изображения действительно представляют минимальные данные, необходимые для популярных моделей и наборов данных, чтобы сделать приемлемые прогнозы.

Взгляд на любое из уменьшенных изображений предполагает, что эти модели должны терпеть неудачу в соответствии с человеческими уровнями визуального различения, что приведет к медианной точности менее 20%.

С SIS-изображениями, уменьшенными до 5% от исходного пиксельного содержания, люди едва достигают

С SIS-изображениями, уменьшенными до 5% от исходного пиксельного содержания, люди едва достигают “большего, чем случайного” успеха классификации, по сравнению с 90-99% успехом популярных наборов данных и фреймворков, изученных в статье.

За пределами переобучения

Переобучение происходит, когда модель машинного обучения тренируется настолько обширно на наборе данных, что она становится профессионалом в прогнозировании этого конкретного данных, но намного менее эффективна (или даже совершенно неэффективна) на новых данных, которые представляются ей после обучения (данные вне распределения).

Исследователи отмечают, что текущий академический и промышленный интерес к борьбе с переобучением не решит одновременно переинтерпретацию, поскольку урезанные пиксельные подмножества, представляющие идентифицируемые изображения для компьютеров и бессмысленные мазки для людей, на самом деле являются настоящими применимыми данными, а не “заключенным” концентрацией на плохо отобранных или анемичных данных:

‘Переинтерпретация связана с переобучением, но переобучение можно диагностировать с помощью уменьшенной тестовой точности. Переинтерпретация может возникнуть из истинных статистических сигналов в базовом распределении набора данных, которые случайно возникают из определенных свойств источника данных (например, линейки дерматологов).

‘Таким образом, переинтерпретация может быть более трудной для диагностики, поскольку она допускает решения, которые принимаются по статистически действительным критериям, и модели, которые используют такие критерии, могут преуспеть в эталонных тестах.’

Возможные решения

Авторы предлагают, что ансамблирование моделей, где несколько архитектур вносят вклад в процесс оценки и обучения, может способствовать смягчению переинтерпретации. Они также обнаружили, что применение ввода dropout, первоначально разработанного для предотвращения переобучения, привело к ‘небольшому уменьшению’ точности теста CIFAR-10 (что, вероятно, желательно), но ‘заметному’ (∼ 6%) увеличению точности моделей на не виденных данных. Однако низкие цифры предполагают, что любые последующие средства против переобучения вряд ли полностью решат переинтерпретацию.

Авторы признают возможность использования салиентных карт для указания областей изображения, которые имеют отношение для извлечения признаков, но отмечают, что это противоречит цели автоматического разбора изображений и требует человеческой аннотации, которая невозможна в масштабе. Они также отмечают, что салиентные карты были обнаружены как только грубые оценщики в плане понимания операций модели.

Статья заключает:

‘Учитывая существование не-салиентных пиксельных подмножеств, которые сами по себе достаточно для правильной классификации, модель может полагаться только на такие закономерности. В этом случае метод интерпретации, который точно описывает модель, должен выводить эти бессмысленные обоснования, тогда как методы интерпретации, которые предвзято относятся к человеческим априорным знаниям, могут производить результаты, которые вводят пользователей в заблуждение, заставляя их думать, что их модели ведут себя так, как предполагалось.’

 

 

Опубликовано впервые 13 января 2022 года.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai