Моделі та платформи ШІ
data2vec: Веха в Самостійному Навчанні

Моделі машинного навчання сильно залежали від відмічених даних для навчання, і традиційно кажучи, навчання моделей на відмічених даних дає точні результати. Однак основним недоліком використання відмічених даних є високі витрати на анотацію, які зростають із збільшенням розміру навчальних даних. Високі витрати на анотацію є великою перешкодою для розробників, особливо при роботі над великим проєктом з великою кількістю навчальних даних.
Щоб подолати проблему анотації, розробники прийшли до концепції SSL або Самостійного Навчання. Самостійне навчання – це процес машинного навчання, в якому модель навчається сама передбачати частину вхідних даних з іншої частини вхідних даних. Модель Самостійного Навчання спрямована на використання відносин між даними замість використання нагляду за сигналами відмічених даних.
Крім Самостійного Навчання, існують інші методи та моделі для навчання моделей машинного навчання без використання відмічених даних. Однак більшість цих методів мають дві великі проблеми
- Вони часто спеціалізовані для однієї модальності, наприклад, зображення або текст.
- Вони вимагають великої кількості обчислювальної потужності.
Ці обмеження є великою проблемою, оскільки звичайний людський розум здатний навчатися з одного типу даних набагато ефективніше порівняно з моделлю штучного інтелекту, яка залежить від окремих моделей та навчальних даних для розрізнення між зображенням, текстом та мовою.
Щоб подолати проблему однієї модальності, Meta AI випустила data2vec, перший у своєму роді, високопродуктивний алгоритм Самостійного Навчання, який дозволяє навчатися з трьох різних модальностей: зображення, текст та мова. З допомогою реалізації алгоритму data2vec, розуміння тексту можна застосувати до задачі сегментації зображень або розгорнути в задачі розпізнавання мови.
У цій статті ми будемо говорити про модель data2vec докладніше. Ми обговоримо метод огляду, пов’язану роботу, архітектуру та результати моделі більш докладно, щоб ви мали чітке розуміння алгоритму data2vec.
Введення data2vec: Основна Ідея
Хоча фундаментальна концепція Самостійного Навчання застосовується до різних модальностей, фактичні цілі та алгоритми відрізняються один від одного, оскільки вони були розроблені з урахуванням однієї модальності. Розробка моделі для однієї модальності є причиною, чому одна й та сама модель Самостійного Навчання не може працювати ефективно з різними типами навчальних даних.
Щоб подолати проблему моделей та алгоритмів однієї модальності, Meta AI випустила data2vec, алгоритм, який використовує одну й ту саму методологію навчання для комп’ютерного зору, NLP або мови.
Основна ідея за алгоритмом data2vec полягає в тому, щоб використовувати маскований вигляд вхідних даних для передбачення латентних представлень повних вхідних даних у самодистиляційній установці з допомогою стандартної архітектури Transformer. Тому, замість модальності-специфічних об’єктів, таких як зображення, текст або голос, які є локальними за своєю природою, алгоритм data2vec передбачає латентні представлення з інформацією з повних навчальних даних.

Чому Індустрія Штучного Інтелекту Потребує Алгоритм data2vec?
Моделі Самостійного Навчання будують представлення навчальних даних, використовуючи людські анотовані мітки, і це одна з основних причин прогресу технологій NLP та комп’ютерного зору. Ці представлення Самостійного Навчання є причиною, чому завдання, такі як розпізнавання мови та машинне навчання, використовують несупервізоване навчання у своїх моделях.
До цього часу ці алгоритми Самостійного Навчання зосереджені на окремих модальностях, що призводить до навчання偏ень та спеціальних конструкцій у моделях. Індивідуальна модальність алгоритмів Самостійного Навчання створює проблеми у різних додатках штучного інтелекту, включаючи комп’ютерний зір та NLP.
Наприклад, існують словники мовних одиниць у мовній обробці, які можуть визначити завдання Самостійного Навчання у NLP. Аналогічно, у комп’ютерному зорі розробники можуть або регресувати вхідні дані, вивчати дискретні візуальні токени або вивчати представлення, інваріантні до даних аугментації. Хоча ці навчання偏ень корисні, складно підтвердити, чи ці偏ень будуть узагальнюватися до інших модальностей.
Алгоритм data2vec є великою вехою в галузі Самостійного Навчання, оскільки він спрямований на поліпшення декількох модальностей, а не тільки однієї. Крім того, алгоритм data2vec не залежить від реконструкції вхідних даних або контрастного навчання.
Тому причина, чому світ потребує data2vec, полягає в тому, що алгоритм data2vec має потенціал прискорити прогрес у галузі штучного інтелекту та сприяє розробці моделей штучного інтелекту, які можуть навчатися про різні аспекти свого оточення безперешкодно. Ученні сподіваються, що алгоритм data2vec дозволить їм розробити більш адаптивні моделі штучного інтелекту, які здатні виконувати високорозвинені завдання, які перевершують можливості сучасних моделей штучного інтелекту.
Що Таке Алгоритм data2vec?
Алгоритм data2vec – це уніфікована структура, яка спрямована на реалізацію Самостійного Навчання через різні модальності даних, включаючи зображення, мову та текст.
Алгоритм data2vec спрямований на розвиток моделей машинного навчання, які можуть вивчати загальні закономірності в середовищі набагато краще, зберігаючи навчальну мету однаковою для різних модальностей. Модель data2vec уніфікує алгоритм навчання, але вона все ж вивчає представлення для кожної модальності окремо.
З допомогою впровадження алгоритму data2vec, Meta AI сподівається, що це зробить багатомодальне навчання ефективним та простішим.
Як Працює Алгоритм data2vec?
Алгоритм data2vec поєднує вивчення латентних представлень з маскованим передбаченням, хоча він використовує декілька мережевих шарів як цілі для узагальнення латентних представлень. Модель спеціально тренується з використанням стандартної мережі Transformer, яка потім використовується або в вчителі, або в учні.
У режимі вчителя модель спочатку будує представлення вхідних даних, які служать цілями в навчальному завданні. У режимі учня модель кодує масковану версію вхідних даних, яку потім використовує для передбачення повних представлень даних.

Вище зображення представляє, як модель data2vec використовує одну й ту саму навчальну процедуру для різних модальностей. На першому етапі модель створює представлення вхідних даних (режим вчителя). Потім модель регресує ці представлення на основі маскованої версії вхідних даних.
Крім того, оскільки алгоритм data2vec використовує латентні представлення вхідних даних, його можна розглядати як спрощену версію модальності-специфічних конструкцій, таких як створення відповідних цілей шляхом нормалізації вхідних даних або вивчення фіксованого набору візуальних токенів. Однак ключова відмінність між алгоритмом data2vec та іншими полягає в тому, що алгоритм data2vec використовує самоуваження для того, щоб зробити свої цілі контекстуалізованими та безперервними. Навпаки, інші моделі Самостійного Навчання використовують фіксований набір цілей, які базуються на локальному контексті.
Метод Моделі data2vec
Модель data2vec тренується шляхом передбачення представлень вхідних даних на основі часткової версії вхідних даних. Як ви можете побачити на зображенні, обличчя собаки маскуються, певна частина голосової ноти маскується, і слово “з” маскується в тексті.

Модель спочатку кодує масковану версію навчального зразка (режим учня), а потім кодує не масковану версію вхідних даних для побудови навчальних цілей з тією ж моделлю, але тільки коли вона параметризована як експоненціальне середнє вагових коефіцієнтів моделі (режим вчителя). Крім того, цілі представлення кодують інформацію, присутню в навчальному зразку, а в режимі учня навчальне завдання використовується для передбачення цих представлень при наданні часткової версії вхідних даних.
Архітектура Моделі
Модель data2vec використовує стандартну архітектуру Transformer з модальністю-специфічною кодуванням вхідних даних. Для завдань, пов’язаних з комп’ютерним зором, модель використовує стратегію ViT для кодування зображення як послідовності патчів, кожний з яких складається з 16х16 пікселів, і подається як лінійне перетворення.
Крім того, для завдань мовної обробки дані кодуються за допомогою багаторівневої одновимірної卷олюційної нейронної мережі, яка перетворює 16-кГц вхідні дані у 50-Гц представлення. Для обробки текстових даних модель попередньо обробляє дані для виділення субсловних одиниць, а потім вкладає дані у розподільний простір за допомогою векторів вкладення.
Маскування
Після того, як модель вкладає вхідні дані як послідовність токенів, модель маскує частини цих одиниць, заміняючи їх на токен вкладення, а потім подаючи послідовність у мережу Transformer. Для комп’ютерного зору модель використовує блок-чергову стратегію маскування. Латентні мовні представлення використовуються для маскування проміжків мовних даних, а для завдань, пов’язаних з мовою, токени маскуються.
Навчальні Цілі
Модель data2vec спрямована на передбачення представлень не маскованого навчального зразка на основі кодування маскованого зразка, який спочатку подається моделі. Модель передбачає представлення тільки для маскованих часових кроків.
Модель передбачає контекстуалізовані представлення, які не тільки кодують конкретний часовий крок, але також кодують інші дані з зразка, оскільки вона використовує самоуваження у мережі Transformer. Контекстуалізовані представлення та використання мережі Transformer відрізняють модель data2vec від вже існуючих моделей BERT, wav2vec, BEiT, SimMIM, MAE, і MaskFeat, які передбачають цілі без контекстної інформації.
Ось як модель data2vec параметризує режим вчителя для передбачення мережевих представлень, які потім служать цілями.
Параметризація Вчителя
Модель data2vec параметризує кодування не маскованого навчального зразка за допомогою EMA (Експоненціальне Середнє) вагових коефіцієнтів моделі (θ), де ваги моделі у режимі цілі (△) визначаються наступним чином
∆ ← τ∆ + (1 − τ ) θ
Крім того, модель розкладає τ, який лінійно збільшується від τ0 до τe (цільове значення) за перші τn оновлень. Після цих оновлень модель зберігає значення постійним до закінчення навчання. Використання стратегії EMA оновлює вчителя набагато частіше на початку, коли навчання починається, коли модель випадкова. Коли навчання проходить та добрі параметри вивчені, вчитель оновлюється рідше.
Результати показують, що модель більш ефективна та точна, коли вона спільно використовує параметри кодувальника особливостей та позиційного кодувальника між режимами учня та вчителя.
Цілі
Будування навчальних цілей залежить від виходу верхніх K блоків мережі вчителя для часових кроків, які маскуються у режимі учня. Вихід блоку l на будь-якому часовому кроку t позначається як alt. Модель потім застосовує нормалізацію до кожного блоку, щоб отримати âlt, перш ніж вона усереднює верхні K блоків

щоб отримати навчальну ціль yt для часового кроку t для мережі з L блоками загалом.
Це створює навчальні цілі, які модель регресує, коли вона знаходиться у режимі учня. У початкових експериментах модель data2vec добре працювала при передбаченні кожного блоку окремо з присвяченим проєкцією, і була набагато більш ефективною при цьому.
Крім того, нормалізація цілей також дозволяє моделі data2vec уникнути колапсу в постійні представлення для часових кроків, і запобігти шарам з високою нормалізацією, щоб домінувати над особливостями у наборі цілей. Для мовної обробки модель використовує інстанс-нормалізацію над поточним вхідним зразком без жодних вивчених параметрів. Це відбувається тому, що, оскільки крок над вхідними даними малий, сусідні представлення високо корельовані.
Додатково, дослідники виявили, що при роботі з комп’ютерним зором та NLP, параметр-менша нормалізація робить свою роботу достатньо. Цю проблему також можна вирішити за допомогою Варіанса-Інваріантна-Коваріаційна регуляризації, але вищеописана стратегія працює достатньо добре і не вимагає жодних додаткових параметрів.
Ціль
Для контекстуалізованих навчальних цілей yt, модель використовує Гладку L1-втрату, щоб регресувати цілі, як зазначено нижче

Тут β контролює перехід від квадратичної втрати до L1-втрати, і залежить сильно від розміру розриву між передбаченням моделі ft(x) на часовому кроку t. Перевага цієї втрати полягає в тому, що вона порівняно менш чутлива до аутлієрів, без необхідності налаштовувати налаштування β.
Експериментальна Установка
Модель data2vec експериментується з двома розмірами моделей: data2vec Large і data2vec Base. Для числової стабільності оновлення EMA здійснюються у fp32, і моделі містять L= 12 або L= 24 блоки Transformer з прихованими розмірами (H) = 768 або H= 1024. Давайте розглянемо докладніше експериментальну установку для різних модальностей та цілей.
Комп’ютерний Зір
Модель data2vec вкладає зображення розміром 224×224 пікселів як патчі розміром 16×16 пікселів. Кожен з цих патчів перетворюється лінійно, і подається як послідовність з 196 представлень у стандартну мережу Transformer.
Модель слідує BEiT для маскування блоків з сусідніми патчами, кожний блок містить мінімум 16 патчів з випадковим аспектним співвідношенням. Однак, замість маскування 40% патчу, як у початковій моделі BEiT, модель data2vec маскує 60% патчу для кращої точності.
Крім того, модель випадково змінює розмір вхідних зображень, робить горизонтальні перевороти та колірні джиттеринги. Нарешті, модель data2vec використовує одну й ту саму модифіковану зображення у режимі вчителя та у режимі учня.
Моделі ViT-B попередньо тренуються протягом 800 епох, і модель data2vec використовує розмір пакету 8,192 для моделі ViT-L, і 2,048 для моделі ViT-B. Модель data2vec також використовує косинусний графік та графік Адама для розігріву швидкості навчання протягом 80 епох до 0,001 для ViT-L, і протягом 40 епох до 0,001 для ViT-B.
Для обох моделей ViT-B та ViT-L модель data2vec використовує β = 2, K = 6 і τ = 0,9998 як постійну без розкладу. Модель далі використовує стохастичну глибину 0,2.
Крім того, для моделі ViT-L модель тренується протягом 1,600 епох, де перші 800 епох мають швидкість навчання 0,9998, а потім модель скидає графік швидкості навчання, і продовжує тренування протягом наступних 800 епох зі швидкістю навчання 0,9999.
Для класифікації зображень модель використовує середнє значення виходу останнього блоку Transformer, і подається у softmax-нормалізований класифікатор. Модель потім до тренує модель ViT-L протягом 50 епох, і модель ViT-B протягом 100 епох, використовуючи косинусний графік та графік Адама для розігріву швидкості навчання.
Мовна Обробка
Для мовної обробки модель data2vec використовує Fairseq, послідовну модель, використовувану для тренування моделей для підсумовування, перекладу та генерації тексту. Модель приймає 16-кГц вхідні дані, які обробляються за допомогою кодувальника особливостей, який містить тимчасові конволюції з 512 каналами, шириною ядра (10,3,3,3,3,2,2), і кроками (5,2,2,2,2,2,2).
Вище результати у виході кодувальника частоти 50 Гц, і має крок 20 мс між кожним зразком. Часовий прийом кодувальника складається з 400 вхідних зразків або 25 мс аудіо. Сировий вхідний сигнал, поданий кодувальнику, нормалізується до одиниці дисперсії, і нульового середнього.
Маскуюча стратегія, використовувана моделлю data2vec для моделі Base, нагадує.framework Baevski для Самостійного Навчання у мовній обробці. Модель вибірково маскує p = 0,065 для всіх часових кроків як початкові індекси, і продовжує маскувати наступні десять часових кроків. Для типового навчального зразка цей процес дозволяє майже 49% від загальної кількості часових кроків бути маскованими.
Під час тренування модель data2vec лінійно анулює τ, використовуючи τo = 0,999, τe = 0,9999, і τn = 30,000. Модель data2vec використовує оптимізатор Адама з піковою швидкістю навчання 5×10-4 для моделі Base. Крім того, модель Base використовує три-етапний графік розкладу, який розігріває швидкість навчання лінійно протягом перших 3% оновлень, підтримує її протягом наступних 90%, і потім знижує її лінійно протягом останніх 7%.
Природньо-Мовна Обробка
Модель data2vec використовує кодування байтових пар типу з 50 тисячами типів для токенізації вхідних даних, і потім вивчає вкладення для кожного типу. Після кодування даних модель застосовує стратегію маскування BERT до 15% однаково вибраних токенів, з яких 80% замінюються на вивчені токени маскування, 10% замінюються на випадкові токени словника, і 10% залишаються без змін.
Під час попереднього тренування модель використовує τo = 0,999, τe = 0,9999, і τn = 100,000, K= 10, і β = 4. Модель використовує оптимізатор Адама з три-етапним графіком швидкості навчання, який розігріває швидкість навчання лінійно протягом перших 5% оновлень, підтримує її протягом наступних 80%, і потім знижує її лінійно протягом останніх 15%, з піковою швидкістю навчання 2×10-4.
Крім того, модель тренується на 16 GPU, з розміром пакету 256 послідовностей, і кожна послідовність містить близько 512 токенів. Для подальшого тренування модель попередньо тренується протягом чотирьох різних швидкостей навчання: 1×10-4, 2×10-4, 3×10-4, 4×10-4, і вибирає ту, яка працює найкраще, для подальшого тренування задач NLP.
Результати
Давайте розглянемо, як модель data2vec працює, коли вона реалізує стратегії, описані вище, для різних модальностей.
Комп’ютерний Зір
Для оцінки результатів комп’ютерного зору модель data2vec попередньо тренується на зображеннях з набору даних ImageNet-1K . Результатна модель до тренується за допомогою позначених даних того ж бенчмарку. За стандартною практикою, модель потім оцінюється за точністю топ-1 на валідаційному наборі даних.
Результати потім розрізняються за однією самою моделлю Самостійного Навчання, і тренуванням окремого візуального токенізаційного модуля на додаткових даних, або іншими моделями Самостійного Навчання.
Нижче наведена таблиця порівнює продуктивність моделі data2vec для комп’ютерного зору, і інших існуючих моделей: ViT-L, і ViT-B.

Результати з вище зазначеної таблиці можна підсумувати наступним чином.
- Модель data2vec перевершує попередні роботи з обома моделями ViT-L, і ViT-B у налаштуванні однієї моделі.
- Маскована передбачувальна установка, використовувана в алгоритмі data2vec для передбачення контекстуалізованих латентних представлень, працює краще, ніж методи, які передбачають локальні цілі, такі як інженерія зображень, вхідні пікселі, або візуальні токени.
- Модель data2vec також перевершує методи самодистиляції, які регресують останній шар мережі учня, приймаючи два різні аугментовані версії зображення як вхідні дані.
Аудіо та Мовна Обробка
Для аудіо- та мовної обробки модель data2vec тренується на близько 960 годинах аудіоданих з набору даних Librispeech(LS-960) . Набір даних містить чисту мовну аудіо з аудіокниг англійською мовою, і вважається стандартним бенчмарком у галузі аудіо- та мовної обробки.
Щоб проаналізувати продуктивність моделі в різних умовах ресурсів, дослідники до тренували модель data2vec для використання різних кількостей позначених даних (від декількох хвилин до декількох годин) для автоматичного розпізнавання мови. Щоб проаналізувати продуктивність моделі, data2vec порівнюється з HuBERT і wav2vec 2.0, двома з найбільш популярних алгоритмів для навчання мовних представлень, які залежать від дискретних мовних одиниць.

Вище зазначена таблиця порівнює продуктивність моделі data2vec у термінах швидкості слова для мовної обробки з іншими існуючими моделями. LM представляє мовну модель, використовувану для декодування. Результати можна підсумувати наступним чином.
- Модель data2vec показує покращення для більшості налаштувань позначених даних з найбільшим виграшем у 10 хвилин позначених даних для моделей Base.
- Для великих моделей модель працює значно краще на малих позначених наборах даних, і продуктивність порівнянна з багатими позначеними наборами даних з понад 100 та 960 годинами позначених даних. Це відбувається тому, що продуктивність загалом насичується на багатих позначених наборах даних для більшості моделей.
- Після аналізу продуктивності можна зробити висновок, що коли модель використовує багаті контекстуалізовані цілі, не обов’язково вивчати дискретні одиниці.
- Вивчення контекстуалізованих цілей під час тренування допомагає покращити загальну продуктивність значно.
Крім того, для підтвердження підходу data2vec для мовної обробки, модель також тренується на AudioSet бенчмарку. Хоча попереднє тренування для AudioSet подібне до Librispeech, модель тренується для K= 12, і протягом понад 200 тисяч оновлень, де розмір кожного пакету становить 94,5 хвилин.
Модель потім застосовує DeepNorm фреймворку, і шарову нормалізацію до цілей, щоб допомогти стабілізувати тренування. Крім того, модель також до тренується на збалансованих підмножинах з розміром пакету 21,3 хвилини протягом 13 тисяч оновлень. Модель також використовує Лінійну Софтмакс-Пулінг і міксап з імовірністю 0,7. Модель потім додає один лінійний проєкційний шар у 527 унікальних класів аудіо, і встановлює швидкість навчання проєкційного шару на 2e-4.
Крім того, попередньо треновані параметри мають швидкість навчання 3e-5, і модель використовує техніку маскування для до тренування набору даних. Таблиця нижче підсумовує результати, і можна побачити, що модель data2vec здатна перевершити порівнянний налаштування з тим же до тренуванням і попереднім тренуванням.

Природньо-Мовна Обробка
Щоб проаналізувати продуктивність моделі data2vec на тексті, модель слідує тому ж тренувальному налаштуванню, що і BERT і попередньо тренується на англійському Вікіпедії з понад 1 мільйоном оновлень, і розміром пакету 256 послідовностей. Модель оцінюється на GLUE бенчмарку, який включає завдання природньо-мовної інтерференції (MNLI або Мультіжанрова Природньо-Мовна Інтерференція), подібності речень (QQP або Quora Question Pairs бенчмарку, MRPC або Microsoft (MSFT ) Research Paragraph Corpus, і STS-B або Семантична Текстова Подібність Бенчмарку), аналіз настрою (SST-2 або Стенфордський Бенчмарк Настрою), і граматику (CoLA).
Крім того, для до тренування моделі data2vec, позначені дані надаються для кожного завдання, і повідомляється середня точність на валідаційних наборах з п’ятьма до тренування запусками. Нижче наведена таблиця підсумовує продуктивність моделі data2vec для завдань NLP, і порівнює її з іншими моделями.

- Вище зазначені дані показують, що модель data2vec перевершує базову модель RoBERTa, оскільки стратегія моделі data2vec не використовує випадкові цілі.
- Модель data2vec є першою успішною попередньо тренованою моделлю NLP, яка не використовує дискретні одиниці, такі як символи, слова або субслова, як навчальні цілі. Замість цього, фреймворк data2vec передбачає контекстуалізовані латентні представлення над повною не маскованою текстовою послідовністю.
- Це допомагає у створенні навчального завдання, в якому модель вимагається передбачити цілі з конкретними властивостями з поточної послідовності, а не передбачати представлення, які є загальними для кожної текстової одиниці з певною дискрецією.
- Крім того, навчальний набір цілей не фіксований, і модель вільна визначати нові цілі, і відкрита для налаштувань словника.
Вивчення Абляцій data2vec
Абляція – це термін, який використовується для позначення видалення компонента в системах штучного інтелекту та машинного навчання. Дослідження абляції використовується для дослідження або аналізу продуктивності моделі штучного інтелекту чи машинного навчання шляхом видалення певних ключових компонентів з моделі, що дозволяє дослідникам зрозуміти внесок цього компонента у загальну систему.
Цілі, Усереднені за Шарами
Одна з основних відмінностей між моделями data2vec та іншими моделями Самостійного Навчання полягає в тому, що модель data2vec використовує цілі, які базуються на усередненні декількох шарів з мережі вчителя. Ця ідея походить з того факту, що верхні шари моделі wav2vec 2.0 не працюють добре для завдань після тренування, порівняно з середніми шарами моделі.
У наступному експерименті продуктивність усіх трьох модальностей вимірюється шляхом усереднення K= 1, 2, …, 12 шарів, де K= 1 передбачає тільки верхній шар. Однак, щоб витягнути швидшу швидкість звернення, модель data2vec тренується з базовою моделлю з 12 шарами загалом. Для мовної обробки модель тренується на понад двісті тисяч оновлень на наборі даних Librispeech, і потім до тренується на 10-годинному позначеному розрізі Libri-light. Для завдань NLP, модель повідомляє середній бал GLUE для валідаційного набору, і попередньо тренується протягом 300 епох для комп’ютерного зору, і потім повідомляє точність топ-1, отриману на наборі даних ImageNet.

Вище зображення показує, що цілі, засновані на декількох шарах, загалом покращують, коли використовується тільки верхній шар K=1 для всіх модальностей. Використання всіх доступних шарів є хорошою практикою, оскільки нейронні мережі будують особливості через різні типи особливостей, і численні шари, які потім витягуються як шари особливостей.
Використання особливостей з декількох шарів допомагає підвищити точність, і збагачує процес Самостійного Навчання.
Тип Цілі
Блоки Transformer у моделі data2vec мають декілька шарів, які всі можуть служити цілями. Щоб проаналізувати, як різні шари впливають на продуктивність, модель попередньо тренується на мовних моделях Librispeech, які використовують різні шари як цілі особливості.
Вище зображення чітко показує, що вихід мережі зворотного зв’язку або FFN працює ідеально, тоді як вихід блоків самоуваження не приводить до корисної моделі.

Контекстуалізація Цілі
Використання самоуваження у мережі вчителя для побудови контекстуалізованих цілей є тим, що відрізняє модель data2vec від інших моделей Самостійного Навчання, які будують навчальне завдання шляхом реконструкції або передбачення локальних частин вхідних даних. Це явно ставить питання: чи модель data2vec потребує контекстуалізованих цілей для ефективної роботи?
Щоб відповісти на це питання, дослідники будують цілі представлення, які не мають доступу до всього вхідного набору даних, а тільки до частини його, яка заздалегідь визначена. Модель потім обмежує механізм самоуваження вчителя, який дозволяє йому доступ до тільки частини навколишнього середовища вхідних даних. Після того, як модель була тренована, її до тренують для доступу до повного контекстного розміру.
Вище зображення показує, що більші контекстні розміри часто приводять до кращої продуктивності, і коли весь вхідний зразок видимий, це дає найкращу точність. Це далі доводить, що багатші цілі представлення можуть привести до кращої продуктивності.

Модальна Специфічна Витягування Особливостей та Маскування
Основна мета моделі data2vec полягає в тому, щоб розробити просту навчальну процедуру, яка може працювати з різними модальностями. Це відбувається тому, що, хоча поточні моделі та фреймворки мають уніфікований навчальний режим, вони все ж використовують модальна-специфічне маскування та витягування особливостей.
Це має сенс, оскільки фреймворки в основному працюють з однією модальністю, враховуючи природу вхідних даних, які сильно відрізняються одна від одної. Наприклад, моделі мовної обробки використовують високорозірнене вхідне значення (наприклад, 10-кГц вхідний сигнал), яке зазвичай має тисячі зразків. Вхідний сигнал потім обробляється фреймворком за допомогою багаторівневої одновимірної卷олюційної нейронної мережі для отримання послідовностей особливостей 50 Гц.
Структуровані та Контекстуалізовані Цілі
Основна відмінність між моделями data2vec та іншими моделями маскованого передбачення полягає в тому, що в моделі data2vec цілі представлення контекстуалізовані. Ці особливості будуються за допомогою самоуваження всього маскованого вхідного сигналу у режимі вчителя.
Деякі інші фреймворки, такі як BYOL (Bootstrap Your Own Latent) або DINO, також використовують латентні представлення, подібні до моделі data2vec, але їх основний фокус полягає у вивченні трансформаційно-інваріантних представлень.
Завершальні Думки
Недавні роботи в галузі штучного інтелекту та машинного навчання показали, що уніфіковані архітектури моделей можуть бути ефективним підходом для роботи з декількома модальностями. Модель data2vec використовує підхід Самостійного Навчання для роботи з трьома модальностями: мовою, зображеннями та текстом.
Ключова ідея за моделлю data2vec полягає в тому, щоб використовувати часткову версію вхідних даних для регресії контекстуалізованої інформації або вхідних даних. Підхід, використовуваний фреймворком data2vec, є ефективним, оскільки модель працює краще, ніж попередні моделі Самостійного Навчання на наборі даних ImageNet-1K для обох моделей ViT-B та ViT-L.
Модель data2vec є真正ю вехою в галузі Самостійного Навчання, оскільки вона демонструє, що один навчальний метод для вивчення декількох модальностей може справді зробити навчання між модальностями легшим для моделей.












