Модели и платформы ИИ
data2vec: Веха в области самообучения

Модели машинного обучения сильно полагаются на помеченные данные для обучения, и традиционно говоря, обучение моделей на помеченных данных дает точные результаты. Однако основным недостатком использования помеченных данных является высокая стоимость аннотации, которая увеличивается с ростом размера обучающих данных. Высокие затраты на аннотацию являются серьезным препятствием для разработчиков, особенно при работе над большими проектами с значительными объемами обучающих данных.
Чтобы решить проблему аннотации, разработчики придумали концепцию Самообучения (SSL) или Самостоятельного обучения. Самообучение – это процесс машинного обучения, в котором модель обучает себя на части входных данных из другой части входных данных. Модель самообучения стремится использовать взаимосвязь между данными, а не использовать помеченные данные.
Помимо самообучения, существуют другие методы и модели для обучения моделей машинного обучения без использования помеченных данных. Однако большинство этих методов имеют две основные проблемы
- Они часто специализированы для одной модальности, такой как изображение или текст.
- Они требуют большого количества вычислительной мощности.
Эти ограничения являются серьезной проблемой, поскольку обычный человеческий ум может учиться на одном типе данных намного более эффективно по сравнению с моделью ИИ, которая полагается на отдельные модели и обучающие данные для различения изображения, текста и речи.
Чтобы решить проблему единой модальности, Meta AI выпустила data2vec, первый в своем роде самообучаемый алгоритм высокого уровня, который может учиться на трех разных модальностях: изображении, тексте и речи. С помощью реализации алгоритма data2vec понимание текста может быть применено к задаче сегментации изображений или может быть использовано в задаче распознавания речи.
В этой статье мы будем говорить о модели data2vec более подробно. Мы обсудим обзор метода, связанную работу, архитектуру и результаты модели более подробно, чтобы у вас было четкое понимание алгоритма data2vec.
Введение в data2vec: Основная идея
Хотя фундаментальная концепция самообучения применяется к разным модальностям, фактические цели и алгоритмы различаются, поскольку они были разработаны с учетом одной модальности. Разработка модели для одной модальности является причиной, по которой один и тот же алгоритм самообучения не может работать эффективно на разных типах обучающих данных.
Чтобы преодолеть проблему моделей и алгоритмов для одной модальности, Meta AI выпустила data2vec, алгоритм, который использует один и тот же метод обучения для компьютерного зрения, NLP или речи.
Основная идея за алгоритмом data2vec заключается в использовании маскированного вида входных данных для предсказания латентных представлений полных входных данных в настройке самообучения с помощью стандартной архитектуры Transformer. Итак, вместо модальности-специфических объектов, таких как изображения, текст или голос, которые являются локальными по своей природе, алгоритм data2vec предсказывает латентные представления с информацией из полных обучающих или входных данных.

Почему отрасли ИИ нужен алгоритм data2vec?
Модели самообучения строят представления обучающих данных, используя помеченные данные, и это одна из основных причин прогресса в области NLP и компьютерного зрения. Эти представления самообучения являются причиной, по которой задачи, такие как распознавание речи и машинное обучение, используют самообучение в своих моделях.
До сих пор эти алгоритмы самообучения фокусируются на индивидуальных модальностях, что приводит к обучению предвзятостей и специфическим конструкциям в моделях. Индивидуальная модальность алгоритмов самообучения создает проблемы в различных приложениях ИИ, включая компьютерное зрение и NLP.
Например, в обработке речи существует словарь единиц речи, который может определить задачу самообучения в NLP. Аналогично, в компьютерном зрении разработчики могут либо регрессировать входные данные, либо учиться дискретным визуальным токенам, либо учиться представлениям, инвариантным к аугментации данных. Хотя эти предвзятости обучения полезны, трудно подтвердить, что эти предвзятости будут обобщаться на другие модальности.
Алгоритм data2vec является значительным этапом в области самообучения, поскольку он направлен на улучшение нескольких модальностей, а не только одной. Кроме того, алгоритм data2vec не полагается на реконструкцию входных данных или контрастное обучение.
Итак, причина, по которой миру нужен data2vec, заключается в том, что алгоритм data2vec имеет потенциал ускорить прогресс в ИИ и способствовать разработке моделей ИИ, которые могут учиться на разных аспектах окружающей среды без проблем. Ученые надеются, что алгоритм data2vec позволит им разработать более адаптивные модели ИИ и ML, которые могут выполнять высокоавансырованные задачи, выходящие за рамки того, что могут делать современные модели ИИ.
Что такое алгоритм data2vec?
Data2vec – это унифицированная структура, направленная на реализацию самообучения на разных типах данных, включая изображения, речь и текст.
Алгоритм data2vec направлен на разработку моделей ML, которые могут учиться на общих закономерностях в окружающей среде, сохраняя цель обучения единообразной на разных модальностях. Модель data2vec унифицирует алгоритм обучения, но она все еще учит представления для каждой модальности индивидуально.
С введением алгоритма data2vec Meta AI надеется, что он сделает многомодальное обучение эффективным и намного проще.
Как работает алгоритм data2vec?
Алгоритм data2vec объединяет обучение латентных представлений с предсказанием маски, хотя он использует несколько сетевых слоев в качестве целей для обобщения латентных представлений. Модель конкретно тренирует готовую сеть Transformer, которая затем используется либо в режиме учителя, либо в режиме ученика.
В режиме учителя модель сначала строит представления входных данных, которые служат целями в задаче обучения.

Вышеуказанное изображение представляет, как модель data2vec использует один и тот же процесс обучения для разных модальностей. На первом этапе модель производит представления входных данных (режим учителя). Затем модель регрессирует эти представления на основе маскированной версии входных данных.
Кроме того, поскольку алгоритм data2vec использует латентные представления входных данных, он может быть рассмотрен как упрощенная версия модальности-специфических конструкций, таких как создание подходящих целей путем нормализации входных данных или обучение фиксированного набора визуальных токенов. Однако ключевым различием между data2vec и другими алгоритмами является то, что алгоритм data2vec использует самообучение для того, чтобы сделать представление цели контекстуализированным и непрерывным. С другой стороны, другие модели самообучения используют фиксированный набор целей, основанных на локальном контексте.
Метод модели data2vec
Модель data2vec тренируется путем предсказания представлений входных данных, данного частичного вида входных данных. Как вы можете видеть на данном рисунке, лицо собаки маскируется, определенный участок голосовой заметки маскируется, и слово “с” маскируется в тексте.

Модель сначала кодирует маскированную версию образца обучения (режим ученика), а затем кодирует немаскированную версию входных данных для построения целей обучения с той же моделью, но только когда она параметризуется как экспоненциальное среднее весов модели (режим учителя). Кроме того, представления целей кодируют информацию, присутствующую в образце обучения, и в режиме ученика задача обучения используется для предсказания этих представлений, когда дан частичный вид входных данных.
Архитектура модели
Модель data2vec использует стандартную архитектуру Transformer с модальности-специфической кодировкой входных данных. Для задач, связанных с компьютерным зрением, модель использует стратегию ViT для кодирования изображения как последовательности патчей, каждая из которых имеет размер 16×16 пикселей, и подается в виде линейного преобразования.
Кроме того, для задач распознавания речи модель кодирует данные, используя многослойную одномерную свёрточную нейронную сеть, которая отображает 16-кГц волновые формы в 50-Гц представления. Для обработки текстовых данных модель предварительно обрабатывает данные для извлечения субсловных единиц и затем встраивает данные в распределительное пространство с помощью векторов встраивания.
Маскирование
Как только модель кодирует входные данные как последовательность токенов, модель маскирует части этих единиц, заменяя их на токен встраивания, и затем подает последовательность в сеть Transformer. Для компьютерного зрения модель использует блоковую стратегию маскирования. Латентные представления речи используются для маскирования участков речевых данных, а для задач, связанных с языком, токены маскируются.
Цели обучения
Модель data2vec направлена на предсказание представлений немаскированного образца обучения на основе кодирования маскированного образца, который изначально подается в модель. Модель предсказывает представления только для маскированных временных шагов.
Модель предсказывает контекстуализированные представления, которые не только кодируют конкретный временной шаг, но также кодируют другую информацию из образца, поскольку она использует самообучение в сети Transformer. Контекстуализированные представления и использование сети Transformer отличают модель data2vec от существующих моделей BERT, wav2vec, BEiT, SimMIM, MAE и MaskFeat, которые предсказывают цели без контекстной информации.
Вот как модель data2vec параметризирует режим учителя для предсказания представлений сети, которые затем служат целями.
Параметризация учителя
Модель data2vec параметризирует кодирование немаскированного образца обучения, используя EMA (Экспоненциальное среднее) весов модели (θ), где веса модели в режиме цели (△) следующие
∆ ← τ∆ + (1 − τ ) θ
Кроме того, модель планирует τ, который линейно увеличивает параметр от τ0 до τe (целевое значение) за первые τn обновлений. После этих обновлений модель сохраняет значение постоянным до конца обучения. Использование стратегии EMA обновляет учителя гораздо чаще в начале, когда обучение начинается, когда модель случайна. По мере продолжения обучения и обучения хороших параметров учитель обновляется реже.
Результаты показывают, что модель более эффективна и точна, когда она делится параметрами кодировщика функций и позиционного кодировщика между режимом ученика и режимом учителя.
Цели
Строительство целей обучения зависит от вывода верхних K блоков сети учителя для временных шагов, маскированных в режиме ученика. Вывод блока l на любом временном шаге t обозначается как alt. Затем модель применяет нормализацию к каждому блоку, чтобы получить alt, прежде чем усреднить верхние K блоков

для получения цели обучения yt для временного шага t для сети с L блоками в общей сложности.
Это создает цели обучения, которые модель регрессирует, когда она находится в режиме ученика. В первых экспериментах модель data2vec хорошо работала на предсказании каждого блока отдельно с помощью посвященного проектирования и была намного более эффективной.
Кроме того, нормализация целей также позволяет модели data2vec избежать коллапса в постоянные представления для временных шагов и предотвращает слои с высокой нормализацией, чтобы доминировать в функциях набора целей. Для распознавания речи модель использует нормализацию экземпляра по текущему входному образцу без обученных параметров. Это связано с тем, что, поскольку шаг над входными данными небольшой, соседние представления высоко коррелированы.
Дополнительно, исследователи обнаружили, что при работе с компьютерным зрением и NLP параметр-менее нормализация делает работу достаточно хорошо и не требует дополнительных параметров.
Цель
Для контекстуализированных целей обучения yt модель использует гладкую функцию L1 для регрессии целей, как указано ниже

Здесь β контролирует переход от квадратичной функции потерь к функции L1, и он сильно зависит от размера разрыва между предсказанием модели ft(x) на временном шаге t. Преимущество этой функции потерь заключается в том, что она менее чувствительна к выбросам, без необходимости настройки настройки β.












