Взгляд Anderson

Иллюзия «Скачать больше меток!» в исследованиях ИИ

mm
Добавьте Unite.AI в избранные источники в Google
ChatGPT-4o: 'A wall on which hundreds of photographs are stuck with thumb-tacks. Each photo depicts a different kind of subject, such as fruit or animals or bridges or buildings or people, etc. Each photo has 2-3 yellow post-it notes attached to it. We are too far away to read anything written on the post-it notes, but we can see that there are dozens and dozens of photos on the wall, and each with several post-it notes tacked on.'

Распространённое мнение в текущих исследованиях машинного обучения заключается в том, что само машинное обучение можно использовать для улучшения качества аннотаций наборов данных ИИ – особенно подписей изображений, предназначенных для использования в моделях видения-языка (VLM). Это направление мысли обусловлено высокой стоимостью ручной аннотации, а также дополнительной нагрузкой надзора за работой аннотаторов.

Возможно, это эквивалентно мему начала 2000-х годов ‘скачать больше ОЗУ’, который высмеивал идею о том, что ограничение аппаратного обеспечения можно решить с помощью программного решения.

Это также малоизвестная проблема; в то время как новые модели ИИ привлекают широкое внимание в общественных и коммерческих сферах, аннотация часто кажется незначительной деталью в трубопроводах машинного обучения, затенённой волнением, окружающим более широкие рамки.

В действительности, способность систем машинного обучения распознавать и воспроизводить закономерности (центральный случай использования почти всех систем ИИ) зависит от качества и последовательности реальных аннотаций – меток и фраз, созданных или рассмотренных реальными людьми, часто делающими субъективные суждения о отдельных данных в неидеальных обстоятельствах.

Неизбежно, системы, которые стремятся наблюдать и воспроизводить закономерности в поведении аннотаторов (и тем самым заменить человеческих аннотаторов и обеспечить точную маркировку в масштабе) не могут хорошо работать с данными, не содержащимися в примерах, взятых из человеческих наблюдателей. Ничто «похожее» не совсем равно, и эквивалентность между доменами остаётся проблематичным в компьютерном зрении.

«Верхний поток данных» должен остановиться где-то, и в данном случае это именно то место, где он останавливается – с человеческим мозжечком, делающим какой-то субъективный различие, чтобы кодифицировать данные для искусственной системы.

Торговля RAG

До недавнего времени неточности, возникающие из-за плохо оформленных аннотаций наборов данных, возможно, считались допустимым побочным эффектом в контексте несовершенных, но всё же рыночных результатов, полученных из генеративных систем ИИ.

Действительно, только в этом году исследование в Сингапуре заключило, что галлюцинации – т. е. случаи, когда системы ИИ изобретают вещи, которые подрывают наши намерения, – неизбежны и связаны с концептуальной архитектурой таких систем.

Чтобы противостоять этому, агенты RAG – которые могут «верифицировать» факты через интернет-поиск – становятся популярными в исследованиях и прикладных коммерческих решениях. Однако они добавляют к стоимости ресурсов и задержке в запросах; кроме того, новая информация, примененная к обученной модели, не может конкурировать с более сложными и глубоко переплетёнными связями, характерными для родных слоёв в обученной модели.

Было бы лучше, если бы данные аннотаций, информирующие эти модели, были значительно менее ошибочными сначала, даже если они не могут быть идеальными (не в последнюю очередь потому, что эта деятельность вторгается в область человеческой субъективности).

RePOPE

Новая статья из Германии подчеркивает проблемы, возникающие из-за использования более старых, широко используемых наборов данных, сосредотачиваясь в частности на точности и надежности их подписей изображений. Результаты исследователей предполагают, что ошибки меток в эталонных наборах данных могут скрыть или исказить галлюцинации в моделях видения-языка.

Из новой статьи, некоторые примеры, где исходные подписи не смогли правильно определить объекты в наборе данных изображений MSCOCO. Ручное пересмотр исследователей эталонного набора данных POPE устраняет эти недостатки, демонстрируя стоимость экономии на курировании аннотаций. Источник: https://arxiv.org/pdf/2504.15707

Из новой статьи, некоторые примеры, где исходные подписи не смогли правильно определить объекты в наборе данных изображений MSCOCO. Ручное пересмотр исследователей эталонного набора данных POPE устраняет эти недостатки, демонстрируя стоимость экономии на курировании аннотаций. Источник: https://arxiv.org/pdf/2504.15707

Представьте себе, что модель показывает изображение уличной сцены и спрашивает, есть ли на нём велосипед. Модель отвечает да. Если эталонный набор данных говорит, что нет велосипеда, модель помечена неправильной. Но если велосипед ясно виден на изображении и был просто пропущен во время аннотации, то ответ модели был правильным, и эталонный набор данных не сработал. Ошибки, подобные этой, могут накапливаться в наборе данных, давая искажённое представление о том, какие модели точны, а какие склонны к галлюцинациям.

Таким образом, когда неправильные или двусмысленные аннотации рассматриваются как эталон, модели могут казаться галлюцинирующими, когда они правильны, или казаться точными, когда они не таковы, искажая как измерение галлюцинации, так и рейтинг производительности модели, и затрудняя диагностику или решение проблемы с уверенностью.

Новая статья пересматривает широко используемый эталонный набор данных, называемый Polling-based Object Probing Evaluation (POPE), который проверяет, могут ли модели видения-языка правильно сказать, что есть или нет в изображении.

POPE основан на метках из влиятельного Microsoft COCO: Common Objects in Context (MSCOCO) набора данных, коллекции аннотированных изображений, которые долгое время считались предлагающими хороший уровень точности аннотаций.

POPE оценивает галлюцинацию объектов в больших моделях видения-языка, переформулируя проблему как бинарную классификационную задачу. Вместо того, чтобы анализировать сгенерированные подписи, система задает простые да/нет вопросы модели о том, присутствуют ли конкретные объекты на изображении, используя шаблоны, такие как ‘Есть ли <объект> на изображении?’.

Примеры галлюцинации объектов в моделях видения-языка. Жирные метки указывают объекты, помеченные как присутствующие в исходных аннотациях, в то время как красные метки показывают объекты, галлюцинируемые моделями. Левый пример отражает традиционную оценку на основе инструкций, в то время как три примера справа взяты из разных вариантов эталонного набора данных POPE.

Примеры галлюцинации объектов в моделях видения-языка. Жирные метки указывают объекты, помеченные как присутствующие в исходных аннотациях, в то время как красные метки показывают объекты, галлюцинируемые моделями. Левый пример отражает традиционную оценку на основе инструкций, в то время как три примера справа взяты из разных вариантов эталонного набора данных POPE. Источник: https://aclanthology.org/2023.emnlp-main.20.pdf

Фактические объекты (ответ: Да) объединяются с выборочными несуществующими объектами (ответ: Нет), выбранными через случайные, частые (популярные) или стратегии, основанные на совместном использовании (враждебные). Этот подход позволяет более стабильно и независимо от подсказки оценивать галлюцинацию без использования сложного анализа подписей на основе правил.

Авторы новой статьи – озаглавленной RePOPE: Влияние ошибок аннотации на эталонный набор данных POPE – оспаривают предполагаемую точность POPE, перепроверив метки на изображениях эталонного набора данных (т. е. MSCOCO) – и обнаружив, что удивительно большое количество из них неверны или неясны.

Примеры из набора данных MSCOCO 2014 года. Источник: https://arxiv.org/pdf/1405.0312

Примеры из набора данных MSCOCO 2014 года. Источник: https://arxiv.org/pdf/1405.0312

Эти ошибки меняют рейтинг моделей, при этом некоторые модели, которые изначально показывали хорошие результаты, отстают, когда оцениваются по исправленным меткам.

В тестах авторы оценили ряд моделей с открытыми весами на исходном эталонном наборе данных POPE и на их переаннотированном варианте RePOPE.

Согласно статье, исправленные аннотации привели к заметным изменениям в рейтинге моделей, особенно в балльных оценках F1, при этом несколько высокопроизводительных моделей, которые изначально показывали хорошие результаты на POPE, отстают при оценке на RePOPE.

Авторы утверждают, что этот сдвиг демонстрирует, в какой степени ошибки аннотации могут скрыть фактическое поведение галлюцинации моделей, и они представляют RePOPE как более надёжный инструмент для оценки уязвимости к галлюцинации.

В другом примере из новой статьи мы видим, как исходные подписи POPE не смогли различить тонкие объекты, такие как человек, сидящий рядом с кабиной трамвая в правом изображении, или стул, скрытый теннисистом во втором изображении слева.

В другом примере из новой статьи мы видим, как исходные подписи POPE не смогли различить тонкие объекты, такие как человек, сидящий рядом с кабиной трамвая в правом изображении, или стул, скрытый теннисистом во втором изображении слева.

Метод и тесты

Исследователи переаннотировали все аннотации в исходном наборе данных MSCOCO, назначив двух человеческих аннотаторов для каждой инстанции данных. Когда возникали неясности относительно качества исходных меток (как в примерах ниже), эти результаты были отложены от раунда тестирования.

Неоднозначные случаи, где несоответствия в метках POPE отражают неясные границы категорий. Например, мишка, помеченный как медведь, мотоцикл как велосипед или аэропортные транспортные средства как автомобили. Эти случаи исключены из RePOPE из-за субъективной природы таких классификаций, а также несоответствий в исходных метках MSCOCO.

Неоднозначные случаи, где несоответствия в метках POPE отражают неясные границы категорий. Например, мишка, помеченный как медведь, мотоцикл как велосипед или аэропортные транспортные средства как автомобили. Эти случаи были исключены из RePOPE из-за субъективной природы таких классификаций, а также несоответствий в исходных метках MSCOCO.

Статья гласит:

‘Исходные аннотаторы пропустили людей на фоне или за стеклом, теннисист закрывает «стулья» на фоне, а салат из капусты содержит только небольшую видимую полоску моркови.

‘Для некоторых объектов аннотации COCO высоко несовместимы, вероятно, из-за различных определений этих объектов, используемых исходными аннотаторами. Классификация «мишки» как «медведя», мотоцикла как «велосипеда» или аэропортного транспортного средства как «автомобиля» зависит от конкретных определений, что приводит к несоответствиям в аннотациях POPE. Поэтому мы аннотируем соответствующие пары изображений и вопросов как «неоднозначные».’

Результаты переаннотации: положительные вопросы общие для всех трех вариантов POPE. Среди тех, которые были помечены как «Да» в POPE, 9,3 процента были найдены неверными, и 13,8 процента были классифицированы как неоднозначные. Для вопросов «Нет» 1,7 процента были неправильно помечены, и 4,3 процента были неоднозначными.

Результаты переаннотации: положительные вопросы общие для всех трех вариантов POPE. Среди тех, которые были помечены как «Да» в POPE, 9,3 процента были найдены неверными, и 13,8 процента были классифицированы как неоднозначные. Для вопросов «Нет» 1,7 процента были неправильно помечены, и 4,3 процента были неоднозначными.

Авторы оценили ряд моделей с открытыми весами на POPE и на RePOPE, в различных архитектурах и размерах моделей. Выбранные модели включали некоторые из ведущих архитектур на лидерборде OpenVLM: InternVL2.5 (8B/26B/38B/78B и 8B-MPO/26B-MPO); LLaVA-NeXT; Vicuna; Mistral 7b; Llama; LLaVA-OneVision; Ovis2 (1B/2B/4B/8B); PaliGemma-3B; и PaliGemma2 (3B/10B).

Первоначальные результаты: высокий уровень ошибок в исходных положительных метках приводит к резкому снижению истинных положительных результатов во всех моделях. Ложные положительные результаты варьируются в разных подмножествах, почти удваиваясь в случайном подмножестве, но оставаясь в основном неизменными в популярном подмножестве и показывая небольшое снижение в враждебном подмножестве. Переаннотация оказывает значительное влияние на рейтинги на основе F1. Модели, такие как Ovis2-4B и Ovis2-8B, которые хорошо показали себя в популярном и враждебном подмножествах POPE, также поднимаются на вершину в случайном подмножестве под RePOPE.

Первоначальные результаты: высокий уровень ошибок в исходных положительных метках приводит к резкому снижению истинных положительных результатов во всех моделях. Ложные положительные результаты варьируются в разных подмножествах, почти удваиваясь в случайном подмножестве, но оставаясь в основном неизменными в популярном подмножестве и показывая небольшое снижение в враждебном подмножестве. Переаннотация оказывает значительное влияние на рейтинги на основе F1. Модели, такие как Ovis2-4B и Ovis2-8B, которые хорошо показали себя в популярном и враждебном подмножествах POPE, также поднимаются на вершину в случайном подмножестве под RePOPE. Пожалуйста, обратитесь к исходному PDF для лучшего разрешения.

Результаты на графиках выше иллюстрируют, как меняется количество истинных положительных и ложных положительных результатов после исправления меток в эталонном наборе данных.

Истинные положительные результаты снизились во всех моделях, показывая, что они часто засчитывались за правильные ответы, когда эти ответы были правильными только при ошибочных метках, в то время как ложные положительные результаты следовали более переменчивому шаблону.

На «случайном» варианте POPE ложные положительные результаты почти удвоились для многих моделей, указывая на то, что значительное количество объектов, помеченных как галлюцинации, на самом деле присутствовали на изображениях, но были пропущены во время исходной аннотации. В этом случае многие предполагаемые ошибки моделей были на самом деле ошибками аннотации набора данных.

Для «враждебного» варианта POPE, где вопросы основаны на объектах, которые часто совместно появляются, ложные положительные результаты снизились. Это, вероятно, отражает более высокую вероятность того, что якобы отсутствующий объект на самом деле присутствовал на изображении, но был оставлен без метки.

Хотя эти сдвиги повлияли на точность и полноту, рейтинги моделей оставались относительно стабильными для обоих показателей.

Балльная оценка F1 – основной показатель оценки POPE – была намного более чувствительной к исправлениям меток. На случайном подмножестве модели, которые изначально занимали высокие позиции при оценке на исходных метках, такие как InternVL2.5-8B и -26B, опустились вниз при оценке на RePOPE. Другие, такие как Ovis2-4B и -8B, поднялись на вершину.

Аналогичный шаблон возник в балльных оценках точности, хотя авторы отмечают, что эти оценки могут быть теперь смещенными, поскольку исправленный набор данных содержит неравное количество положительных и отрицательных примеров.

Авторы утверждают, что сильное влияние ошибок аннотации на результаты эталонного набора данных подчеркивает необходимость высококачественных данных. Чтобы поддержать более надёжную оценку галлюцинации объектов, они опубликовали исправленные метки на GitHub.

Однако они отмечают, что это переаннотирование не полностью устраняет насыщение эталонного набора данных, поскольку многие модели всё ещё достигают истинных положительных и истинных отрицательных результатов выше 90%. Они предлагают, что дополнительные эталонные наборы данных, такие как DASH-B, которые используют более сложный набор отрицательных примеров, должны использоваться вместе с RePOPE.

Вывод

Этот эксперимент был возможен благодаря очень небольшому масштабу набора данных, участвовавшего в нём. Доказательство того же гипотезы на гипермасштабных наборах данных потребовало бы работы с очень ограниченными фрагментами данных; в высоко разнообразных больших наборах данных может оказаться почти невозможно выделить статистически представительные и семантически связанные группы – потенциально искажая результаты.

Даже если бы это было возможно, какое средство было бы под рукой в текущем состоянии искусства? Аргумент неизбежно возвращается к необходимости лучшей и более обильной человеческой аннотации.

В этом отношении «лучшая» и «более обильная» существуют как отдельные проблемы, поскольку можно получить большее количество аннотаций через экономику, основанную на минимизации затрат, такую как Amazon Mechanical Turk (AMT). Очевидно, что эта потенциально эксплуатационная субэкономика часто приводит к худшим результатам.

Альтернативно, можно передать задачи аннотации экономическим регионам, где одинаковые расходы дали бы большее количество аннотаций. Однако, чем дальше аннотатор находится от предполагаемого использования модели, которую он будет формировать, тем менее вероятно, что полученная модель будет соответствовать потребностям или ожиданиям целевого домена.

Это, таким образом, остаётся одной из наиболее постоянных и нерешённых проблем в экономике разработки машинного обучения.

Чем дальше аннотатор находится от предполагаемого использования модели, которую он будет формировать, тем менее вероятно, что полученная модель будет соответствовать потребностям или ожиданиям целевого домена. Это, таким образом, остаётся одной из наиболее постоянных и нерешённых проблем в экономике разработки машинного обучения. Первая публикация – среда, 23 апреля 2025 года.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai