Модели и платформы ИИ
Новый инструмент может показать исследователям, что GANs оставляют вне изображения
Недавно команда исследователей из MIT-IBM Watson AI Lab создала метод отображения того, что сеть генеративных противостояний (GAN) оставляет вне изображения при генерации изображений. Исследование было названо Что GAN не может сгенерировать, и оно было недавно представлено на Международной конференции по компьютерному зрению.
Сети генеративных противостояний стали более совершенными, сложными и широко используемыми в последние годы. Они стали довольно хорошими в рендеринге изображений, полных деталей, пока изображение ограничено относительно небольшой областью. Однако, когда GANs используются для генерации изображений более крупных сцен и окружений, они не работают так хорошо. В сценариях, когда GANs запрашиваются для рендеринга сцен, полных многих объектов и предметов, таких как оживленная улица, GANs часто оставляют многие важные аспекты изображения.
По данным MIT News, исследование было разработано в частности Дэвидом Бау, аспирантом кафедры электротехники и компьютерных наук в MIT. Бау объяснил, что исследователи обычно сосредотачиваются на совершенствовании того, на что системы машинного обучения обращают внимание, и на определении того, как определенные входные данные могут быть сопоставлены с определенными выходными данными. Однако Бау также объяснил, что понимание того, какие данные игнорируются моделями машинного обучения, часто так же важно, и что команда исследователей надеется, что их инструменты вдохновят исследователей обращать внимание на игнорируемые данные.
Интерес Бау к GANs был вызван тем, что они могут быть использованы для исследования черного ящика нейронных сетей и для получения интуиции о том, как сети могут рассуждать. Бау ранее работал над инструментом, который мог идентифицировать конкретные кластеры искусственных нейронов, помечая их как ответственные за представление реальных объектов, таких как книги, облака и деревья. Бау также имел опыт работы с инструментом под названием GANPaint, который позволяет художникам удалять и добавлять конкретные функции к фотографиям с помощью GANs. По словам Бау, приложение GANPaint показало потенциальную проблему с GANs, проблему, которая стала очевидной, когда Бау проанализировал изображения. Как Бау рассказал MIT News:
«Мой руководитель всегда поощрял нас смотреть за пределы цифр и внимательно изучать фактические изображения. Когда мы посмотрели, явление сразу же стало очевидным: люди были выброшены выборочно».
Хотя системы машинного обучения предназначены для извлечения закономерностей из изображений, они также могут игнорировать релевантные закономерности. Бау и другие исследователи экспериментировали с обучением GANs на различных внутренних и внешних сценах, но во всех типах сцен GANs оставляли важные детали в сценах, такие как машины, дорожные знаки, люди, велосипеды и т. д. Это было верно даже тогда, когда объекты, оставленные без внимания, были важны для сцены.
Команда исследователей предположила, что когда GAN обучается на изображениях, GAN может найти более легкие закономерности изображения, которые легче представить, такие как крупные стационарные объекты, такие как пейзажи и здания. Он учится этим закономерностям над другими, более трудными для интерпретации закономерностями, такими как машины и люди. Это было общим знанием, что GANs часто опускают важные, осмысленные детали при генерации изображений, но исследование команды MIT может быть первым случаем, когда GANs были продемонстрированы как опускающие целые классы объектов внутри изображения.
Команда исследователей отмечает, что GANs могут достигать своих числовых целей даже тогда, когда они оставляют объекты, которые люди заботятся, когда смотрят на изображения. Если изображения, сгенерированные GANs, будут использоваться для обучения сложных систем, таких как автономные транспортные средства, изображения должны быть внимательно изучены, поскольку существует реальная проблема, что критические объекты, такие как знаки, люди и другие машины, могут быть оставлены вне изображений. Бау объяснил, что их исследование показывает, почему производительность модели не должна основываться только на точности:
«Нам нужно понять, что сети делают и не делают, чтобы убедиться, что они принимают решения, которые мы хотим, чтобы они принимали».












