Взгляд Anderson

Оценка исторической точности ImageNet

mm
Добавьте Unite.AI в избранные источники в Google

Новое исследование Google Research и UC Berkeley добавляет к давней критике в отношении зависимости сектора исследований компьютерного зрения (CV) от известной базы данных ImageNet и ее многочисленных производных. После большого количества ручной оценки авторы приходят к выводу, что почти 50% предполагаемых ошибок, которые лучшие модели совершают на многоэтажной оценке ImageNet (где лучшие модели достигают более 97% точности), на самом деле не являются ошибками.

Из статьи:

‘Наш анализ показывает, что почти половина предполагаемых ошибок не являются ошибками вовсе, и мы обнаружили новые действительные многоэтажные метки, демонстрирующие, что без тщательного обзора мы значительно занижаем производительность этих моделей.

‘С другой стороны, мы также обнаружили, что лучшие модели сегодня все еще совершают значительное количество ошибок (40%), которые очевидны для человеческих рецензентов.’

Степень, в которой неправильная маркировка наборов данных – в частности, неквалифицированными работниками краудсорсинга – может искажать сектор, была раскрыта в исследовании путем тщательного подхода к оценке пар “изображение/текст” на большой части истории ImageNet.

В верхнем ряду примеры тяжести ошибок: в первых двух примерах новая модель просто ошибается в предсказанном ярлыке; в третьем примере новая модель определяет ранее отсутствующую многоэтажную метку (метку, которая решает новую категоризацию изображения); в последнем изображении в верхнем ряду предсказание модели неоднозначно, поскольку изображение представляет собой муху-муравья и не муху. Однако средняя муха принадлежит к отряду двукрылых, и поэтому это исключение будет почти невозможно обнаружить, даже для опытного аннотатора. В нижнем ряду четыре категории ошибок с примерами. Источник: https://arxiv.org/pdf/2205.04596.pdf

В верхнем ряду примеры тяжести ошибок: в первых двух примерах новая модель просто ошибается в предсказанном ярлыке; в третьем примере новая модель определяет ранее отсутствующую многоэтажную метку (метку, которая решает новую категоризацию изображения); в последнем изображении в верхнем ряду предсказание модели неоднозначно, поскольку изображение представляет собой муху-муравья и не муху. Однако средняя муха принадлежит к отряду двукрылых, и поэтому это исключение будет почти невозможно обнаружить, даже для опытного аннотатора. В нижнем ряду четыре категории ошибок с примерами. Источник: https://arxiv.org/pdf/2205.04596.pdf

Исследователи использовали небольшое количество посвященных оценщиков для тщательного обзора исторических записей ошибок в оценке набора данных ImageNet, обнаружив, что многие из суждений об ошибках сами по себе являются ошибками – открытие, которое потенциально пересматривает некоторые плохие оценки, которые многие проекты получили на тестах ImageNet за годы.

Поскольку ImageNet укрепляется в культуре CV, исследователи утверждают, что улучшения точности, как полагают, дают уменьшающиеся доходы, и что новые модели, которые превышают установленную точность меток и которые предлагают новые (т.е. дополнительные) метки, могут быть наказаны, по сути, за несовместимость.

‘Например,’ авторы отмечают. ‘должны ли мы наказывать модели за то, что они первыми предсказывают, что предварительно запеченный бублик может быть бубликом, как одна из моделей, которую мы рассматриваем в этой работе?’

Из статьи, новая модель противоречит предыдущему предсказанию, что объект на фотографии является тестом, и предлагает, что объект на самом деле является бубликом).

Из статьи, новая модель противоречит предыдущему предсказанию, что объект на фотографии является тестом, и предлагает, что объект на самом деле является бубликом).

С точки зрения работника краудсорсинга, которому поручено определить такой объект, это семантическая и даже философская дилемма, которую можно решить только путем многоэтажной маркировки (как часто происходит в более поздних подмножествах и последующих итерациях ImageNet); в вышеуказанном случае объект действительно является и тестом, и至少 зародышевым бубликом.

Большие (выше) и мелкие (ниже) ошибки, которые возникли при тестировании пользовательских моделей в исследовании. Оригинальные метки ImageNet являются первыми изображениями слева.

Большие (выше) и мелкие (ниже) ошибки, которые возникли при тестировании пользовательских моделей в исследовании. Оригинальные метки ImageNet являются первыми изображениями слева.

Два очевидных решения заключаются в том, чтобы назначить больше ресурсов для маркировки (что является проблемой, в пределах бюджетных ограничений большинства проектов компьютерного зрения); и, как подчеркивают авторы, регулярно обновлять наборы данных и подмножества оценки меток (что, среди других препятствий, рискует разрушить историческую непрерывность тестов и засорить новые исследовательские статьи квалификациями и оговорками относительно эквивалентности).

В качестве шага к исправлению ситуации исследователи разработали новый поднабор ImageNet под названием ImageNet-Major (ImageNet-M), который они описывают как ’68-образец “большой ошибки”明显ных ошибок, совершаемых сегодня лучшими моделями – срез, где модели должны достигать почти идеального результата, но сегодня они далеки от этого.’

Статья названа Когда тесто становится бубликом? Анализ оставшихся ошибок в ImageNet и написана четырьмя авторами из Google Research, вместе с Сарой Фридович-Кейл из UC Berkeley.

Технический долг

Результаты важны, потому что оставшиеся ошибки, выявленные (или неправильно выявленные) в ImageNet, за 16 лет с момента его создания, могут представлять собой разницу между развертываемой моделью и моделью, которая достаточно ошибочна, чтобы не могла быть выпущена на живые данные. Как всегда, последняя миля критична.

Сектор исследований компьютерного зрения и синтеза изображений фактически ‘авто-выбрал’ ImageNet в качестве метрики теста, по ряду причин – не в последнюю очередь потому, что ранняя волна последователей, в то время, когда высокообъемные и хорошо помеченные наборы данных были реже, чем сейчас, произвела так много инициатив исследований, что тестирование на ImageNet быстро стало единственной широко применимой исторической ‘стандартной’ метрикой для оценки новых рамок.

Метод

Исследователи использовали стандартную модель ViT (способную достигать точности 89,5%) с 3 миллиардами параметров, Vit-3B, предварительно обученную на JFT-3B и дообученную на ImageNet-1K.

Используя многоэтажный набор данных ImageNet2012, исследователи записали начальную многоэтажную точность (MLA) модели ViT-3B как 96,3%, во время которой модель совершила 676 явных ошибок. Именно эти ошибки (и также ошибки, произведенные моделью Greedy Soups) авторы попытались исследовать.

Для оценки оставшихся 676 ошибок авторы избегали работников краудсорсинга, отметив, что ошибки такого типа могут быть трудными для средних аннотаторов обнаружить, но собрали панель из пяти экспертных рецензентов и создали специальный инструмент, чтобы каждый рецензент мог увидеть предсказанный класс; предсказанный балл; метку ground truth; и само изображение.

Интерфейс, разработанный для проекта.

Интерфейс, разработанный для проекта.

В некоторых случаях дальнейшее исследование было необходимо для разрешения споров среди панели, и поиск Google Image использовался в качестве дополнительного инструмента.

‘[В] одном интересном, но не изолированном случае, предсказание такси (без явных индикаторов такси, кроме желтого цвета) присутствовало в изображении; мы определили предсказание как правильное такси и не просто стандартное транспортное средство, определив знакомый мост на заднем плане, чтобы локализовать город, и последующий поиск изображений такси в этом городе дал изображения того же такси и дизайна номерного знака, подтвердив правильное предсказание модели.’

После первоначального обзора ошибок, найденных на нескольких этапах исследования, авторы сформулировали четыре новых типа ошибок: тонкая ошибка, где предсказанный класс похож на метку ground truth; тонкая ошибка с отсутствием словарного запаса (OOV), где модель определяет объект, чей класс правильный, но не присутствует в ImageNet; ложная корреляция, где предсказанная метка читается вне контекста изображения; и не-прототипная, где объект ground truth является сомнительным примером класса, который похож на предсказанную метку.

В определенных случаях метка ground truth не была сама ‘истинной’:

‘После обзора исходных 676 ошибок [найденных в ImageNet] мы обнаружили, что 298 были либо правильными, либо неясными, либо определили исходную метку ground truth как неправильную или проблематичную.’

После исчерпывающего и сложного раунда экспериментов на различных наборах данных, подмножествах и наборах проверки авторы обнаружили, что две модели, изучаемые в исследовании, на самом деле были признаны правильными (человеческими рецензентами) для половины ‘ошибок’, которые они совершали при обычных методах.

Статья заключается:

‘В этой статье мы проанализировали каждую оставшуюся ошибку, которую модели ViT-3B и Greedy Soups совершают на многоэтажном наборе данных ImageNet.

‘В целом мы обнаружили, что: 1) когда большая, высокоточная модель делает новое предсказание, не сделанное другими моделями, оно оказывается правильной новой многоэтажной меткой почти половину времени; 2) модели с более высокой точностью не демонстрируют очевидного шаблона в наших категориях и тяжести ошибок; 3) модели SOTA сегодня в основном соответствуют или превосходят производительность лучшего человеческого эксперта на многоэтажном подмножестве, оцененном человеком; 4) шумные данные обучения и недоопределенные классы могут быть фактором, ограничивающим эффективную оценку улучшений в классификации изображений.’

 

Опубликовано впервые 15 мая 2022 г.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai