Модели и платформы ИИ

SEER: Прорыв в Самообучаемых Моделях Компьютерного Зрения?

mm
Добавьте Unite.AI в избранные источники в Google
SEER Framework for Self Supervised Learning

За последнее десятилетие искусственный интеллект (ИИ) и машинное обучение (МО) сделали огромный прогресс. Сегодня они более точны, эффективны и способны, чем когда-либо прежде. Современные модели ИИ и МО могут без проблем и точно распознавать объекты на изображениях или видеофайлах. Кроме того, они могут генерировать текст и речь, параллельную человеческому интеллекту.

Модели ИИ и МО сегодня сильно зависят от обучения на помеченных наборах данных, которые учат их интерпретировать блок текста, определять объекты на изображении или видеокадре и многое другое.

Несмотря на их возможности, модели ИИ и МО не идеальны, и ученые работают над созданием моделей, способных учиться из информации, которую они получают, и не полагаться на помеченные или аннотированные данные. Этот подход называется самообучением, и это один из наиболее эффективных методов создания моделей МО и ИИ, которые имеют “здравый смысл” или фоновые знания для решения проблем, которые выходят за рамки возможностей моделей ИИ сегодня.

Самообучение уже показало свои результаты в обработке естественного языка, поскольку оно позволило разработчикам обучать крупные модели, которые могут работать с огромным количеством данных, и привело к нескольким прорывам в области вывода естественного языка, машинного перевода и ответов на вопросы.

Модель SEER от Facebook (META ) AI направлена на максимизацию возможностей самообучения в области компьютерного зрения. SEER или Самообучаемая – это самообучаемая модель компьютерного зрения, которая имеет более миллиарда параметров и способна находить закономерности или учиться даже из случайной группы изображений, найденных в Интернете, без надлежащих аннотаций или меток.

Необходимость Самообучения в Компьютерном Зрении

Аннотация данных или пометка данных – это этап предварительной обработки при разработке моделей машинного обучения и искусственного интеллекта. Процесс аннотации данных определяет сырые данные, такие как изображения или видеокадры, и затем добавляет метки к данным, чтобы указать контекст данных для модели. Эти метки позволяют модели делать точные прогнозы на данных.

Одной из самых больших проблем и препятствий, с которыми сталкиваются разработчики при работе над моделями компьютерного зрения, является поиск высококачественных аннотированных данных. Модели компьютерного зрения сегодня полагаются на эти помеченные или аннотированные наборы данных, чтобы научиться распознавать закономерности, которые позволяют им распознавать объекты на изображении.

Аннотация данных и ее использование в модели компьютерного зрения создают следующие проблемы:

Управление Постоянным Качеством Набора Данных

Самой большой проблемой, с которой сталкиваются разработчики, является получение высококачественных наборов данных постоянно, поскольку высококачественные наборы данных с правильными метками и четкими изображениями приводят к лучшему обучению и более точным моделям. Однако получение высококачественных наборов данных постоянно имеет свои собственные проблемы.

Управление Рабочей Силой

Пометка данных часто сопровождается проблемами управления рабочей силой, в основном потому, что для обработки и пометки больших объемов неструктурированных и неаннотированных данных требуется большое количество работников, гарантируя при этом качество. Поэтому для разработчиков важно найти баланс между качеством и количеством при пометке данных.

Финансовые Ограничения

Самой большой проблемой является финансовое ограничение, которое сопровождает процесс пометки данных, и чаще всего стоимость пометки данных является значительной частью общей стоимости проекта.

Как вы видите, аннотация данных – это серьезная проблема при разработке передовых моделей компьютерного зрения, особенно при разработке сложных моделей, которые требуют большого количества обучающих данных. Это причина, по которой индустрия компьютерного зрения нуждается в самообучении, чтобы разработать сложные и передовые модели компьютерного зрения, способные решать задачи, которые выходят за рамки возможностей текущих моделей.

С учетом этого, уже существует множество моделей самообучения, которые хорошо работают в контролируемой среде, и в основном на наборе данных ImageNet. Хотя эти модели могут работать хорошо, они не удовлетворяют основному условию самообучения в компьютерном зрении: учиться на любом неограниченном наборе данных или случайном изображении, а не только на хорошо определённом наборе данных. Когда он реализуется идеально, самообучение может помочь в разработке более точных и способных моделей компьютерного зрения, которые являются экономически эффективными и жизнеспособными.

SEER или Самообучаемая Модель: Введение

Последние тенденции в индустрии ИИ и МО указывают на то, что подходы к предобучению моделей, такие как полуобучение, слабое обучение и самообучение, могут значительно улучшить производительность большинства глубоких моделей обучения для задач вниз по потоку.

Существует два ключевых фактора, которые внесли значительный вклад в улучшение производительности этих глубоких моделей обучения.

Предобучение на Огромных Наборах Данных

Предобучение на огромных наборах данных обычно приводит к лучшей точности и производительности, поскольку оно знакомит модель с широким разнообразием данных. Большой набор данных позволяет моделям лучше понять закономерности в данных и в конечном итоге приводит к лучшей производительности модели в реальных сценариях.

Некоторые из лучших моделей, таких как модель языка GPT-3 и модель распознавания речи Wav2vec 2.0, обучены на огромных наборах данных. Модель языка GPT-3 использует набор данных для предобучения с более чем 300 миллиардами слов, в то время как модель распознавания речи Wav2vec 2.0 использует набор данных с более чем 53 тысячами часов аудиоданных.

Модели с Огромной Емкостью

Модели с большим количеством параметров часто дают точные результаты, поскольку большее количество параметров позволяет модели сосредоточиться только на объектах в данных, которые необходимы, а не на интерференции или шуме в данных.

В прошлом разработчики пытались обучать модели самообучения на неаннотированных или неотредактированных данных, но с меньшими наборами данных, содержащими только несколько миллионов изображений. Но могут ли модели самообучения давать высокую точность, когда они обучаются на большом количестве неаннотированных и неотредактированных данных? Именно этот вопрос модель SEER стремится ответить.

Модель SEER – это глубокий каркас обучения, который направлен на регистрацию изображений, доступных в Интернете, независимо от отредактированных или помеченных наборов данных. Каркас SEER позволяет разработчикам обучать крупные и сложные модели МО на случайных данных без надзора, т.е. модель анализирует данные и учится на закономерностях или информации самостоятельно, без какого-либо ручного ввода. Конечной целью модели SEER является помощь в разработке стратегий для процесса предобучения, которые используют неотредактированные данные для обеспечения лучшей производительности в обучении с переносом. Кроме того, модель SEER также направлена на создание систем, которые могут непрерывно учиться из бесконечного потока данных в самообучаемом режиме.

Каркас SEER обучает модели с высокой емкостью на миллиардах случайных и неограниченных изображений, извлеченных из Интернета. Модели, обученные на этих изображениях, не полагаются на метаданные изображений или аннотации для обучения модели или фильтрации данных. В последнее время самообучение показало высокий потенциал, поскольку обучение моделей на неотредактированных данных дало лучшие результаты по сравнению с предварительно обученными моделями для задач вниз по потоку.

Каркас SEER и RegNet: Что такое Соединение?

Чтобы проанализировать модель SEER, она фокусируется на архитектуре RegNet с более чем 700 миллионами параметров, что соответствует цели самообучения SEER на неотредактированных данных по двум основным причинам:

  1. Они предлагают идеальный баланс между производительностью и эффективностью.
  2. Они очень гибкие и могут быть использованы для масштабирования количества параметров.

Каркас SEER: Предыдущая Работа из Различных Областей

Каркас SEER направлен на изучение пределов обучения крупных архитектур моделей в неотредактированных или неаннотированных наборах данных с помощью самообучения, и модель черпает вдохновение из предыдущей работы в этой области.

Ненадзорное Предобучение Визуальных Особенностей

Самообучение уже было реализовано в компьютерном зрении в течение некоторого времени с методами, использующими автоэнкодеры, дискриминацию на уровне экземпляров или кластеризацию. В последнее время методы, использующие контрастное обучение, показали, что предобучение моделей с помощью ненадзорного обучения для задач вниз по потоку может работать лучше, чем подход к надзорному обучению.

Основным выводом из обучения визуальных особенностей является то, что пока вы обучаете на отфильтрованных данных, помеченные метки не требуются. Модель SEER направлена на изучение того, может ли модель научиться точным представлениям, когда крупные архитектуры моделей обучаются на большом количестве неотредактированных, неаннотированных и случайных изображений.

Обучение Визуальных Особенностей в Масштабе

Предыдущие модели извлекали пользу из предобучения моделей на крупных помеченных наборах данных с помощью слабого надзора, надзора и полунадзора на миллионах отфильтрованных изображений. Кроме того, анализ моделей также показал, что предобучение моделей на миллиардах изображений часто приводит к лучшей точности по сравнению с обучением модели с нуля.

Кроме того, обучение модели в крупном масштабе обычно полагается на шаги фильтрации данных, чтобы сделать изображения соответствующими целевым понятиям. Эти шаги фильтрации либо используют прогнозы от предварительно обученного классификатора, либо используют хэштеги, которые часто являются синонимами классов ImageNet. Модель SEER работает иначе, поскольку она направлена на обучение особенностей в любом случайном изображении, и поэтому обучающие данные для модели SEER не отредактированы, чтобы соответствовать предварительно определенному набору особенностей или понятий.

Масштабирование Архитектур для Распознавания Изображений

Модели обычно извлекают пользу из обучения крупных архитектур на лучшем качестве визуальных особенностей. Это важно для предобучения на крупном наборе данных, поскольку модель с ограниченной емкостью часто недооценивает. Это имеет еще большее значение, когда предобучение проводится вместе с контрастным обучением, поскольку в таких случаях модель должна научиться различать экземпляры набора данных, чтобы научиться лучшим визуальным представлениям.

Однако для распознавания изображений масштабирование архитектуры включает в себя больше, чем просто изменение глубины и ширины модели, и для построения масштабно-эффективной модели с большей емкостью необходимо посвятить много литературы. Модель SEER показывает преимущества использования семейства моделей RegNets для развертывания самообучения в крупном масштабе.

SEER: Методы и Компоненты

Каркас SEER использует различные методы и компоненты для предобучения модели, чтобы научиться визуальным представлениям. Некоторыми из основных методов и компонентов, используемых каркасом SEER, являются: RegNet и SwAV. Давайте кратко обсудим методы и компоненты, используемые в каркасе SEER.

Самообучение с SwAV

Каркас SEER предварительно обучается с помощью SwAV, онлайн-самообучаемого подхода. SwAV – это онлайн-кластерный метод, используемый для обучения каркаса convnet без аннотаций. Каркас SwAV работает, обучая вложение, которое производит назначения кластеров последовательно между разными представлениями одного и того же изображения. Система затем учится семантическим представлениям, добывая кластеры, которые являются инвариантными к аугментациям данных.

На практике каркас SwAV сравнивает особенности разных представлений изображения, используя их независимые назначения кластеров. Если эти назначения захватывают одни и те же или подобные особенности, возможно предсказать назначение одного изображения, используя представление особенностей другого представления.

Модель SEER учитывает набор K кластеров, и каждый из этих кластеров связан с обучаемым d-размерным вектором vk. Для партии B изображений каждое изображение i преобразуется в два разных представления: xi1 , и xi2. Представления затем обрабатываются с помощью convnet, и в результате получаются два набора особенностей: (f11, …, fB2), и (f12, … , fB2). Каждый набор особенностей затем назначается независимо кластерным прототипам с помощью Оптимального Транспортного решателя.

Решатель Оптимального Транспорта гарантирует, что особенности равномерно распределены по кластерам, и это помогает избежать тривиальных решений, при которых все представления отображаются на один прототип. Результатирующее назначение затем меняется между двумя наборами: назначение кластера yi1 представления xi1 необходимо предсказать, используя представление особенностей xi2 представления xi2, и наоборот.

Веса прототипов и convnet затем обучаются, чтобы минимизировать потерю для всех примеров. Потеря предсказания кластера l по сути является перекрестной энтропией между softmax произведения особенностей и назначения кластера.

RegNetY: Масштабно-Эффективное Семейство Моделей

Масштабирование емкости модели и данных требует архитектур, которые эффективны не только в плане памяти, но и в плане времени выполнения и RegNet – это семейство моделей, разработанных специально для этой цели.

Семейство архитектур RegNet определяется пространством convnet с 4 стадиями, где каждая стадия содержит серию идентичных блоков, гарантируя, что структура их блока остается фиксированной, в основном резидуальный бутылочный блок.

Каркас SEER фокусируется на архитектуре RegNetY и добавляет Squeeze-and-Excitation к стандартной архитектуре RegNets в попытке улучшить их производительность. Кроме того, модель RegNetY имеет 5 параметров, которые помогают в поиске хороших экземпляров с фиксированным количеством операций, потребляющих разумные ресурсы. Модель SEER направлена на улучшение своих результатов, реализуя архитектуру RegNetY напрямую на своей задаче самообучаемого предобучения.

Архитектура RegNetY 256GF: Модель SEER фокусируется в основном на архитектуре RegNetY 256GF в семействе RegNetY, и ее параметры используют правило масштабирования архитектуры RegNets. Параметры описаны следующим образом.

Архитектура RegNetY 256GF имеет 4 стадии с ширинами стадий (528, 1056, 2904, 7392) и глубинами стадий (2,7,17,1), что добавляет более 696 миллионов параметров. При обучении на 512 GPU V100 32GB NVIDIA каждая итерация занимает около 6125 мс для партии из 8704 изображений. Обучение модели на наборе данных с более чем миллиардом изображений, с партией из 8704 изображений на более чем 512 GPU, требует 114890 итераций, и обучение длится около 8 дней.

Оптимизация и Обучение в Масштабе

Модель SEER предлагает несколько корректировок, чтобы обучить самообучаемые методы и применить и адаптировать эти методы в крупном масштабе. Эти методы являются:

  1. График скорости обучения.
  2. Сокращение потребления памяти на GPU.
  3. Оптимизация скорости обучения.
  4. Предобучение на крупном масштабе.

Давайте кратко обсудим их.

График Скорости Обучения

Модель SEER исследует возможность использования двух графиков скорости обучения: косинусоидальный график скорости обучения и фиксированный график скорости обучения.

Косинусоидальный график скорости обучения используется для справедливого сравнения разных моделей, поскольку он адаптируется к количеству обновлений. Однако косинусоидальный график скорости обучения не адаптируется к обучению в крупном масштабе в основном потому, что он взвешивает изображения по-разному на основе того, когда они видны во время обучения, и он также использует полные обновления для планирования.

Фиксированный график скорости обучения сохраняет скорость обучения фиксированной до тех пор, пока потеря не перестает уменьшаться, и затем скорость обучения делится на 2. Анализ показывает, что фиксированный график скорости обучения работает лучше, поскольку он имеет место для большей гибкости в обучении. Однако, поскольку модель обучается только на 1 миллиарде изображений, она использует косинусоидальный график скорости обучения для обучения своей крупнейшей модели, RegNet 256GF.

Сокращение Потребления Памяти на GPU

Модель также направлена на сокращение количества GPU, необходимых во время обучения, путем использования смешанной точности и градиентного чекпоинта. Модель использует библиотеку NVIDIA Apex Library’s O1 Optimization level, чтобы выполнять операции, такие как свертки и GEMMs, в 16-битной точности с плавающей запятой. Модель также использует реализацию градиентного чекпоинта PyTorch, которая торгует вычислениями за память.

Кроме того, модель также удаляет любые промежуточные активации, сделанные во время прямого прохода, и во время обратного прохода она пересчитывает эти активации.

Оптимизация Скорости Обучения

Использование смешанной точности для оптимизации использования памяти имеет дополнительные преимущества, поскольку ускорители используют уменьшенный размер FP16, увеличивая пропускную способность по сравнению с FP32. Это помогает ускорить обучение, улучшая узкое место памяти-ширины.

Модель SEER также синхронизирует BatchNorm слой по всем GPU, чтобы создать группы процессов вместо использования глобальной синхронизации, которая обычно занимает больше времени. Наконец, загрузчик данных, используемый в модели SEER, предварительно загружает больше партий обучающих данных, что приводит к большему количеству пропускаемых данных по сравнению с загрузчиком данных PyTorch.

Предобучение на Крупном Масштабе

Модель SEER использует более 1 миллиарда изображений во время предобучения и учитывает загрузчик данных, который выбирает случайные изображения直接 из Интернета и Instagram. Поскольку модель SEER обучается на этих изображениях в дикой природе и онлайн, она не применяет никакой предварительной обработки к этим изображениям, ни не отредактирует их, используя процессы, такие как дедупликация или фильтрация хэштегов.

Стоит отметить, что набор данных не является статическим, и изображения в наборе данных обновляются каждые три месяца. Однако обновление набора данных не влияет на производительность модели.

Реализация Модели SEER

Модель SEER предварительно обучает RegNetY 256GF с помощью SwAV, используя шесть культур на изображение, с каждым изображением, имеющим разрешение 2×224 + 4×96. Во время фазы предобучения модель использует 3-слой MLP или многослойный перцептрон с головками проекции размером 10444×8192, 8192×8192 и 8192×256.

Вместо использования слоев BatchNorm в голове модель SEER использует 16 тысяч прототипов с температурой t установленной на 0,1. Параметр регуляризации Sinkhorn установлен на 0,05, и он выполняет 10 итераций алгоритма. Модель далее синхронизирует статистику BatchNorm по всем GPU и создает несколько групп процессов размером 64 для синхронизации.

Кроме того, модель использует оптимизатор LARS или слой-адаптивное масштабирование скорости, весовой декай с 10-5, контрольные точки активаций и оптимизацию смешанной точности O1. Модель затем обучается с помощью стохастического градиентного спуска с партией из 8192 случайных изображений, распределенных по 512 GPU NVIDIA, что приводит к 16 изображениям на GPU.

Скорость обучения линейно увеличивается с 0,15 до 9,6 за первые 8000 обновлений обучения. После разогрева модель следует косинусоидальному графику скорости обучения, который затухает до конечного значения 0,0096. В целом модель SEER обучается на более чем 1 миллиарде изображений за 122 тысячи итераций.

Результаты Каркаса SEER

Качество особенностей, сгенерированных подходом к самообучаемому предобучению, изучается и анализируется на различных бенчмарках и задачах вниз по потоку. Модель также учитывает настройку с ограниченным количеством выстрелов, которая предоставляет ограниченный доступ к изображениям и их меткам для задач вниз по потоку.

Настройка Больших Предобученных Моделей

Она измеряет качество моделей, предварительно обученных на случайных данных, путем их переноса на бенчмарк ImageNet для классификации изображений. Результаты настройки крупных предварительно обученных моделей определяются на основе следующих параметров.

Экспериментальные Настройки

Модель предварительно обучает 6 архитектур RegNet с разной емкостью, а именно RegNetY- {8,16,32,64,128,256}GF, на более чем 1 миллиарде случайных и публичных изображений Instagram с помощью SwAV. Модели затем настраиваются для классификации изображений на ImageNet, который использует более 1,28 миллиона стандартных обучающих изображений с правильными метками и имеет стандартный набор данных для оценки с более чем 50 тысяч изображений.

Модель затем применяет те же техники аугментации данных, что и в SwAV, и настраивается в течение 35 эпох с оптимизатором SGD или стохастическим градиентным спуском с партией из 256 и скоростью обучения 0,0125, которая уменьшается в 10 раз после 30 эпох, импульсом 0,9 и весовым декаем 10-4. Модель сообщает точность топ-1 на наборе данных для оценки, используя центральную culture 224×224.

Сравнение с Другими Самообучаемыми Подходами к Предобучению

В следующей таблице крупнейшая предварительно обученная модель в RegNetY-256GF сравнивается с существующими предварительно обученными моделями, которые используют самообучаемый подход.

Как вы видите, модель SEER возвращает точность топ-1 84,2% на ImageNet, и удивляет SimCLRv2, лучшую существующую предварительно обученную модель, на 1%.

Кроме того, следующая фигура сравнивает каркас SEER с моделями разной емкости. Как вы видите, независимо от емкости модели, объединение каркаса RegNet с SwAV дает точные результаты во время предобучения.

Модель SEER предварительно обучается на неотредактированных и случайных изображениях, и они имеют архитектуру RegNet с самообучаемым методом SwAV. Модель SEER сравнивается с SimCLRv2 и моделями ViT с разными сетевыми архитектурами. Наконец, модель настраивается на наборе данных ImageNet, и сообщается точность топ-1.

Влияние Емкости Модели

Емкость модели имеет значительное влияние на производительность модели во время предобучения, и следующая фигура сравнивает ее с влиянием при обучении с нуля.

Очевидно, что точность топ-1 предварительно обученных моделей выше, чем моделей, обученных с нуля, и разница становится все больше с увеличением количества параметров. Это также очевидно, что, хотя емкость модели приносит пользу как предварительно обученным, так и обученным с нуля моделям, влияние больше на предварительно обученных моделях при работе с большим количеством параметров.

Возможной причиной, по которой обучение модели с нуля может переобучиться, является небольшой размер набора данных.

Обучение с Ограниченным Количество Выстрелов

Обучение с ограниченным количество выстрелов относится к оценке производительности модели SEER в настройке с ограниченным количеством выстрелов, т.е. используя только часть общих данных при выполнении задач вниз по потоку.

Экспериментальные Настройки

Каркас SEER использует два набора данных для обучения с ограниченным количеством выстрелов, а именно Places205 и ImageNet. Кроме того, модель предполагает, что у нее ограниченный доступ к набору данных во время переноса обучения как в плане изображений, так и в плане их меток. Эта настройка с ограниченным доступом отличается от настроек, используемых для самообучения, где модель имеет доступ ко всему набору данных, и только доступ к меткам изображений ограничен.

Результаты на Наборе Данных Places205

Следующая фигура показывает влияние предобучения модели на разных частях набора данных Places205.

Подход, используемый в модели, сравнивается с предобучением модели на наборе данных ImageNet под надзором с той же архитектурой RegNetY-128 GF. Результаты сравнения удивительны, поскольку можно наблюдать, что существует стабильная прибыль около 2,5% в точности топ-1, независимо от части набора данных, доступного для настройки на наборе данных Places205.

Разница, наблюдаемая между надзорным и самообучаемым предобучением, может быть объяснена, учитывая разницу в характере обучающих данных, поскольку особенности, выученные моделью из случайных изображений в дикой природе, могут быть более подходящими для классификации сцены. Кроме того, неравномерное распределение лежащих в основе понятий может оказаться полезным для предобучения на несбалансированном наборе данных, таком как Places205.

Результаты на ImageNet

Вышеуказанная таблица сравнивает подход, используемый в модели SEER, с самообучаемыми подходами к предобучению и полунадзорными подходами на обучении с ограниченным количеством выстрелов. Стоит отметить, что все эти методы используют все 1,2 миллиона изображений в наборе данных ImageNet для предобучения и ограничивают только доступ к меткам. С другой стороны, подход, используемый в модели SEER, позволяет ей видеть только 1-10% изображений в наборе данных.

Как вы видите, хотя модель SEER видит только 1-10% набора данных ImageNet, она все еще способна достичь точности топ-1 около 80%, что немного ниже точности подходов, обсуждаемых в таблице выше.

Влияние Емкости Модели

Фигура ниже обсуждает влияние емкости модели на обучение с ограниченным количеством выстрелов: при 1%, 10% и 100% набора данных ImageNet.

Очевидно, что увеличение емкости модели может улучшить точность модели, поскольку оно уменьшает доступ как к изображениям, так и к меткам в наборе данных.

Перенос на Другие Бенчмарки

Чтобы оценить модель SEER дальше и проанализировать ее производительность, предварительно обученные особенности переносятся на другие задачи вниз по потоку.

Линейная Оценка Классификации Изображений

Вышеуказанная таблица сравнивает особенности из предварительно обученной модели RegNetY-256GF и RegNetY128-GF, предварительно обученной на наборе данных ImageNet с той же архитектурой с и без надзора. Чтобы проанализировать качество особенностей, модель замораживает веса и использует линейный классификатор на вершине особенностей, используя обучающий набор для задач вниз по потоку. Следующие бенчмарки учитываются для этого процесса: Open-Images (OpIm), iNaturalist (iNat), Places205 (Places) и Pascal VOC (VOC).

Обнаружение и Сегментация

Фигура ниже сравнивает предварительно обученные особенности на обнаружении и сегментации и оценивает их.

Каркас SEER обучает модель Mask-RCNN на бенчмарке COCO с предварительно обученными RegNetY-64GF и RegNetY-128GF в качестве строительных блоков. Для обеих архитектур, а также для задач вниз по потоку, самообучаемый подход к предобучению модели SEER превосходит обучение с надзором на 1,5 до 2 баллов AP.

Сравнение с Слабо Надзорным Предобучением

Большинство изображений, доступных в Интернете, обычно имеют мета-описание или альтернативный текст, или описания, или геолокации, которые могут предоставить преимущество во время предобучения. Предыдущая работа показала, что предсказание отредактированного или помеченного набора хэштегов может улучшить качество предсказываемых визуальных особенностей. Однако этот подход требует фильтрации изображений, и он работает лучше всего только тогда, когда присутствует текстовая метаинформация.

Фигура ниже сравнивает предобучение архитектуры ResNetXt101-32dx8d, обученной на случайных изображениях, с той же архитектурой, обученной на помеченных изображениях с хэштегами и метаинформацией, и сообщает точность топ-1 для обоих.

Очевидно, что хотя каркас SEER не использует метаинформацию во время предобучения, его точность сопоставима с моделями, которые используют метаинформацию для предобучения.

Анализ Выпадения

Анализ выпадения выполняется, чтобы проанализировать влияние конкретного компонента на общую производительность модели. Анализ выпадения выполняется, удаляя компонент из модели совсем, и понимая, как модель работает. Это дает разработчикам краткий обзор влияния этого конкретного компонента на производительность модели.

Влияние Архитектуры Модели

Архитектура модели имеет значительное влияние на производительность модели, особенно когда модель масштабируется или спецификации предобучения изменяются.

Следующая фигура обсуждает влияние изменения архитектуры на качество предварительно обученных особенностей, оцениваемое линейно на наборе данных ImageNet. Предварительно обученные особенности можно直接 проникнуть в этом случае, поскольку оценка не благоприятствует модели, которая возвращает высокую точность при обучении с нуля на наборе данных ImageNet.

Очевидно, что для ResNeXts и ResNet архитектур особенности, полученные из предпоследнего слоя, работают лучше с текущими настройками. С другой стороны, архитектура RegNet превосходит другие архитектуры.

В целом можно заключить, что увеличение емкости модели имеет положительное влияние на качество особенностей, и существует логарифмическая прибыль в производительности модели.

Масштабирование Предобучения Данных

Существует две основные причины, почему обучение модели на более крупном наборе данных может улучшить общее качество визуальных особенностей, которые модель учит: больше уникальных изображений и больше параметров. Давайте кратко рассмотрим, как эти причины влияют на производительность модели.

Увеличение Количество Уникальных Изображений

Вышеуказанная фигура сравнивает две разные архитектуры, RegNet8 и RegNet16, которые имеют одинаковое количество параметров, но обучаются на разных количествах уникальных изображений. Каркас SEER обучает модели для обновлений, соответствующих 1 эпохе для 1 миллиарда изображений или 32 эпохам для 32 уникальных изображений, и с единой полуволновой косинусоидальной скоростью обучения.

Очевидно, что для того, чтобы модель работала хорошо, количество уникальных изображений, поданных в модель, должно быть больше. В этом случае модель работает хорошо, когда она подается уникальными изображениями, превышающими количество изображений в наборе данных ImageNet.

Больше Параметров

Фигура ниже указывает на производительность модели, когда она обучается на 1 миллиарде изображений, используя архитектуру RegNet-128GF. Очевидно, что производительность модели увеличивается стабильно, когда количество параметров увеличивается.

Самообучаемое Компьютерное Зрение в Реальном Мире

До сих пор мы обсуждали, как самообучение и модель SEER для компьютерного зрения работают в теории. Теперь давайте посмотрим, как самообучаемое компьютерное зрение работает в реальных сценариях и почему SEER – это будущее самообучаемого компьютерного зрения.

Модель SEER соперничает с работой, проделанной в области обработки естественного языка, где высококачественные модели используют триллионы наборов данных и параметров, а также триллионы слов текста во время предобучения модели. Производительность на задачах вниз по потоку обычно увеличивается с увеличением количества входных данных для обучения модели, и то же самое верно для задач компьютерного зрения.

Но использование самообучения для обработки естественного языка отличается от использования самообучения для компьютерного зрения. Это потому, что, когда вы работаете с текстом, семантические понятия обычно разбиваются на отдельные слова, но когда вы работаете с изображениями, модель должна решить, какой пиксель принадлежит какому понятию.

Кроме того, разные изображения имеют разные представления, и даже если несколько изображений имеют один и тот же объект, понятие может варьироваться значительно. Например, рассмотрим набор данных с изображениями кошки. Хотя основной объект, кошка, общий для всех изображений, понятие может варьироваться значительно, поскольку кошка может стоять на месте на одном изображении, а на другом изображении она может играть с мячом, и так далее. Поскольку изображения часто имеют разные понятия, важно, чтобы модель увидела значительное количество изображений, чтобы понять различия вокруг одного и того же понятия.

Масштабирование модели успешно, чтобы она работала эффективно с высокоразмерными и сложными изображениями, требует двух компонентов:

  1. Свёрточная нейронная сеть или CNN, которая достаточно велика, чтобы захватить и научиться визуальным понятиям из очень большого набора изображений.
  2. Алгоритм, который может научиться закономерностям из большого количества изображений без каких-либо меток, аннотаций или метаинформации.

Модель SEER направлена на применение этих компонентов к области компьютерного зрения. Модель SEER направлена на использование достижений, сделанных SwAV, самообучаемым каркасом, который использует онлайн-кластеризацию для группировки или пары изображений с параллельными визуальными понятиями, и использования этих сходств, чтобы лучше определить закономерности.

С помощью архитектуры SwAV модель SEER может сделать самообучение в компьютерном зрении более эффективным и сократить время обучения до 6 раз.

Кроме того, обучение моделей в крупном масштабе, в этом масштабе, более 1 миллиарда изображений, требует модели архитектуры, которая эффективна не только в плане времени выполнения и памяти, но и в плане точности. Это где модели RegNet вступают в игру, поскольку эти модели ConvNet могут масштабироваться до триллионов параметров и могут быть оптимизированы в соответствии с ограничениями памяти и времени выполнения.

Заключение: Самообучаемое Будущее

Самообучение было важной темой в индустрии ИИ и МО в течение некоторого времени, поскольку оно позволяет моделям ИИ учиться напрямую из большого количества данных, доступных случайно в Интернете, вместо того, чтобы полагаться на тщательно отредактированные и помеченные наборы данных, которые имеют целью обучение моделей ИИ.

Самообучение является важной концепцией для будущего ИИ и МО, поскольку оно имеет потенциал позволить разработчикам создавать модели ИИ, которые адаптируются хорошо к реальным сценариям и имеют множество вариантов использования, а не имеют конкретную цель, и SEER – это веха в реализации самообучения в индустрии компьютерного зрения.

Модель SEER делает первый шаг в трансформации индустрии компьютерного зрения и сокращении нашей зависимости от помеченных наборов данных. Модель SEER направлена на устранение необходимости аннотации набора данных, что позволит разработчикам работать с разнообразными и большими наборами данных. Реализация модели SEER особенно полезна для разработчиков, работающих над моделями, которые занимаются областями с ограниченными изображениями или метаинформацией, такими как медицинская промышленность.

Кроме того, устранение человеческих аннотаций позволит разработчикам разработать и развернуть модель быстрее, что позволит им реагировать на быстро меняющиеся ситуации быстрее и с большей точностью.

Kunal Kejriwal — backend‑инженер, специализирующийся на Python, PostgreSQL, Redis и облачной инфраструктуре в GCP и AWS. Имея три года опыта в построении и масштабировании производственных систем, он пишет об инфраструктуре ИИ, распределённых системах и архитектуре развертывания нагрузок машинного обучения.