Погляд Anderson
Оцінка історичної точності ImageNet

Нове дослідження від Google Research і UC Berkeley додає до тривалих критичних зауважень щодо залежності сектора досліджень комп’ютерного зору (CV) від відомої бази даних ImageNet та її численних похідних. Після великої кількості ручної оцінки автори висновують, що майже 50% помилок, які роблять найкращі моделі на багатозначному підмножині ImageNet (де найкращі моделі досягли більш ніж 97% точності), насправді не є помилками.
З паперу:
‘Наш аналіз показує, що майже половина передбачуваних помилок насправді не є помилками, і ми відкрили нові дійсні багатозначні мітки, демонструючи, що без ретельного огляду ми суттєво недооцінюємо продуктивність цих моделей. ‘
‘З іншого боку, ми також виявили, що найкращі моделі сьогодні все ще роблять значну кількість помилок (40%), які очевидні для людських рецензентів.’
Ступінь, у якій неправильне позначення наборів даних – особливо через некваліфікованих працівників краудсорсингу – може вплинути на сектор, було виявлено завдяки ретельному підходу до оцінки парів зображень і тексту по великому діапазону історії ImageNet.

У верхньому ряду приклади тяжкості помилок: у перших двох прикладах нова модель просто помилково передбачає мітку; у третьому прикладі нова модель визначає раніше відсутню багатозначну мітку (мітку, яка адресує нову категоризацію зображення); у останньому зображенні верхнього ряду передбачення моделі двозначне, оскільки зображення є бджолою-мухою, а не мухою. Однак середня бджола належить до ряду комах Diptera, тому ця виняток буде майже неможливо помітити, навіть для експертного анотатора. У ряду нижче чотири категорії помилок з прикладами. Джерело: https://arxiv.org/pdf/2205.04596.pdf
Дослідники використовували невелику кількість присвячених оцінювачів для ретельного огляду історичних записів помилок у наборі даних ImageNet, виявивши, що багато з цих помилкових суджень самі по собі є помилковими – відкриття, яке потенційно переглядає деякі погані оцінки, які багато проектів отримали на тестах ImageNet за роки.
Оскільки ImageNet укорінюється в культурі CV, дослідники стверджують, що покращення точності вважаються такими, що дають зменшення доходності, і що нові моделі, які перевершують встановлені мітки точності, і які пропонують нові (тобто додаткові) мітки, можуть бути покарані, по суті, за невідповідність.
‘Наприклад,’ відзначають автори. ‘чи повинні ми покарати моделі за те, що вони першими передбачили, що передebaляжена булочка може бути булочкою, як одна з моделей, яку ми розглядаємо в цій роботі?’

З паперу, новіша модель суперечить попередньому передбаченню, що об’єкт на фотографії є тістом, і пропонує, що об’єкт насправді вже булочкою).
З точки зору працівника краудсорсингу, якому доручено ідентифікувати такий об’єкт, це є семантичною та філософською дилемою, яку можна вирішити лише за допомогою багатозначної мітки (як часто відбувається в пізніших підмножинах і наступних ітераціях ImageNet); у вищезгаданому випадку об’єкт є і тістом, і至少 насіннєвою булочкою.

Помилки вищого рівня (вище) і нижчого рівня (нижче), які виникли під час тестування моделей у дослідженні. Оригінальні мітки ImageNet є першими зображеннями зліва.
Два очевидні рішення полягають у тому, щоб призначити більше ресурсів для міток (що є викликом у рамках бюджетних обмежень більшості проектів комп’ютерного зору); і, як підкреслюють автори, регулярно оновлювати набори даних і підмножини оцінок міток (що, серед інших перешкод, ризикує порушити історичну безперервність тестів і засмічити нові дослідження паперами з кваліфікаціями та застереженнями щодо еквівалентності).
Як крок до вирішення ситуації, дослідники створили нову підмножину ImageNet під назвою ImageNet-Major (ImageNet-M), яку вони описують як ’68-приклад “помилка вищого рівня” очевидних помилок, які роблять сучасні найкращі моделі – сегмент, де моделі повинні досягти майже досконалості, але сьогодні ще не роблять цього.’
Паперу під назвою When does dough become a bagel? Analyzing the remaining mistakes on ImageNet написана чотирма авторами від Google Research разом з Сарою Фрідович-Кейл з UC Berkeley.
Технічний борг
Відкриття важливі, оскільки помилки, визначені (або неправильно визначені) в ImageNet за 16 років з моменту його створення, можуть представляти різницю між розгортним моделлю та моделлю, яка достатньо помилкова, щоб не могла бути випущена на живі дані. Як завжди, остання миля є критичною.
Сектор досліджень комп’ютерного зору та синтезу зображень фактично “автовибрав” ImageNet як метрику тесту, з кількох причин – не в останню чергу тому, що рashes ранніх приймачів, у час, коли великов об’ємні та добре позначені набори даних були рідше, ніж зараз, створили багато дослідницьких ініціатив, які швидко стали єдиною широко застосовуваною історичною “стандартом” для тестування нових кадрів.
Метод
Шукаючи “залишкові помилки” в ImageNet, дослідники використовували стандартну ViT модель (здатну досягти точності 89,5%) з 3 мільярдами параметрів, Vit-3B, попередньо навчену на JFT-3B і дообучену на ImageNet-1K.
Використовуючи ImageNet2012_multilabel набір даних, дослідники записали початкову багатозначну точність (MLA) ViT-3B як 96,3%, під час якої модель зробила 676 очевидних помилок. Саме ці помилки (та помилки, створені моделлю Greedy Soups) автори намагалися дослідити.
Для оцінки залишкових 676 помилок автори уникли працівників краудсорсингу, відзначаючи, що помилки такого типу можуть бути важкими для середніх анотаторів виявити, але зібрали панель з п’яти експертних рецензентів і створили спеціальний інструмент, який дозволяє кожному рецензенту бачити передбачувану класифікацію; передбачувану оцінку; фактичні мітки; і зображення само по собі.

Інтерфейс, створений для проекту.
У деяких випадках подальше дослідження було необхідне для вирішення суперечок серед панелі, і пошук Google зображень використовувався як допоміжний інструмент.
‘[У] одному цікавому, але не ізольованому випадку, передбачення таксі (без явних індикаторів таксі, окрім жовтого кольору) було присутнє на зображенні; ми визначили передбачення як правильно таксі, а не просто стандартний транспортний засіб, ідентифікуючи орієнтирний міст на задньому плані, щоб локалізувати місто, і подальший пошук зображень таксі в цьому місті дав зображення того ж таксійного моделі та дизайну номерного знака, підтверджуючи фактично правильне передбачення моделі.’
Після початкового огляду помилок, виявлених протягом кількох фаз дослідження, автори сформулювали чотири нові типи помилок: тонка помилка, де передбачувана класифікація схожа на фактичну мітку; тонка з поза словником (OOV), де модель ідентифікує об’єкт, чиї класи правильні, але відсутні в ImageNet; спурійна кореляція, де передбачувана мітка читає поза контекстом зображення; і не-прототипна, де фактичний об’єкт є спекулятивним прикладом класу, який нагадує передбачувану мітку.
У певних випадках фактичний результат не був сам по собі “правдивим”:
‘Після огляду оригінальних 676 помилок [виявлених в ImageNet] ми виявили, що 298 були або правильними, або нечіткими, або визначили оригінальну фактичну мітку неправильною або проблематичною.’
Після вичерпного і складного раунду експериментів по різних наборах даних, підмножинам і валідаційним наборам автори виявили, що дві моделі під дослідженням були фактично визнані правильними (людиною-рецензентами) для половини “помилок”, які вони робили за традиційними методами.
Папера закінчується:
‘У цій роботі ми проаналізували кожну залишкову помилку, яку моделі ViT-3B і Greedy Soups роблять на багатозначному валідаційному наборі ImageNet. ‘
‘Загалом, ми виявили, що: 1) коли велика, високоточна модель робить нове передбачення, яке не роблять інші моделі, воно виявляється правильною новою багатозначною майже половину часу; 2) моделі з вищою точністю не демонструють очевидної закономірності в наших категоріях і рівнях помилок, які вони вирішують; 3) сучасні моделі SOTA в основному відповідають або перевершують продуктивність найкращих експертів людини на багатозначному підмножині, оціненому людиною; 4) шумні дані навчання і не повністю визначені класи можуть бути фактором, який обмежує ефективне вимірювання покращень у класифікації зображень.’
Перша публікація 15 травня 2022 року.












