Моделі та платформи ШІ

MINT-1T: Масштабування відкритих багатомодальних даних у 10 разів

mm
Додайте Unite.AI до бажаних джерел у Google

Для навчання великих багатомодальних моделей (LMM) потрібні великомасштабні набори даних з чергуванням послідовностей зображень і тексту у вільній формі. Хоча відкриті багатомодальні моделі швидко розвиваються, все ще існує велика нестача багатомодальних інтерлейвних наборів даних у відкритому доступі. Загальна кількість цих наборів даних не можна переоцінити, оскільки вони утворюють основу для створення передових систем штучного інтелекту, здатних розуміти та генерувати вміст у різних режимах. Без достатнього постачання повних інтерлейвних наборів даних потенціал розробки більш досконалих і потужних LMM значно обмежений. Ці набори даних дозволяють моделям навчатися на різноманітних вхідних даних, роблячи їх більш універсальними та ефективними у різних застосуваннях. Крім того, нестача таких наборів даних становить виклик для відкритої спільноти, яка покладаєся на спільні ресурси для розвитку інновацій та співробітництва.

Відкриті багатомодальні моделі зробили значний крок уперед за останні роки, але їхній розвиток обмежений через обмежену доступність великомасштабних інтерлейвних наборів даних. Для подолання цього обмеження потрібні злагоджені зусилля для кураторства, анотації та випуску більш повних наборів даних, які можуть підтримувати подальший розвиток і удосконалення багатомодальних моделей. Крім того, створення та поширення цих наборів даних включають подолання декількох технічних і логістичних перешкод. Збір даних повинен бути широким і репрезентативним для різних контекстів, у яких будуть використовуватися LMM. Анотація вимагає ретельного розгляду, щоб забезпечити, що чергування послідовностей зображень і тексту виконується у спосіб, який підвищує можливості навчання моделі. Крім того, забезпечення відкритого доступу до цих наборів даних включає вирішення питань, пов’язаних з приватністю даних та правами на використання. Розширення доступності високоякісних великомасштабних багатомодальних інтерлейвних наборів даних є важливим для майбутнього досліджень та розробок штучного інтелекту. Подолання поточної нестачі дозволить спільноті штучного інтелекту сприяти більшим інноваціям та співробітництву, що призведе до створення більш потужних і універсальних LMM, здатних вирішувати складні реальні проблеми.

Розробляючи цю думку, MINT-1T є найбільшим і найрізноманітнішим відкритим багатомодальним інтерлейвним набором даних на сьогодні. MINT-1T: у 10 разів більший за масштабом, включаючи один трильйон текстових токенів та 3,4 мільярда зображень порівняно з існуючими відкритими наборами даних. Набір даних MINT-1T також вводить раніше не використані джерела, такі як файли PDF та статті ArXiv. Оскільки багатомодальні інтерлейвні набори даних не масштабуються легко, важливо, щоб набір даних MINT-1T поділяв процес кураторства даних, щоб інші також могли проводити експерименти над такими інформаційно-багатими варіантами. Набір даних MINT-1T демонструє, що його метод; моделі, навчені на MINT-1T, є конкурентоспроможними (хоча й частково) до попередніх найкращих відкритих наборів даних OBELICS.

MINT-1T: Багатомодальний набір даних з одним трильйоном токенів

Відкриті великомасштабні набори даних для попереднього навчання були важливими для дослідницької спільноти у вивченні інженерії даних та навчання прозорих відкритих моделей. У текстовому домені ранній роботи, такі як C4 та The Pile, відігравали важливу роль у дозволі відкритій спільноті тренувати перші відкриті великі мови моделей, такі як GPT-J, GPT-Neo та інші. Ці фундаментальні зусилля також проклали шлях для подальших удосконалень методів фільтрації даних та масштабування. Аналогічно, у сфері зображень і тексту великомасштабні відкриті набори даних сприяли інноваціям у кращих методах кураторства даних, таких як фільтраційні мережі та T-MARS. Відчувається помітний зсув від лабораторій-лідерів до тренування великих багатомодальних моделей (LMM), які вимагають великомасштабних багатомодальних інтерлейвних наборів даних, що складаються з вільних послідовностей зображень і тексту. По мірі того, як можливості передових моделей швидко розвиваються, виникає значний розрив у багатомодальних тренувальних даних між закритими та відкритими моделями.

Для подолання цього розриву був створений MINT-1T як найбільший і найрізноманітніший відкритий багатомодальний інтерлейвний набір даних на сьогодні. MINT-1T містить загалом один трильйон текстових токенів і три мільярди зображень, отриманих з різних джерел, таких як HTML, PDF та ArXiv. До MINT-1T найбільшим відкритим набором даних у цій галузі був OBELICS, який містив 115 мільярдів текстових токенів і 353 мільйони зображень, всі отримані з HTML.

Вклад MINT-1T полягає в наступному:

  • Інженерія даних: Масштабування цих багатомодальних інтерлейвних даних представляє більший інженерний виклик, ніж побудова текстових або пар зображень і тексту. Обробка великих розмірів документів та збереження оригінального порядку зображень і тексту є важливими.
  • Різноманітність: MINT-1T є першим у сфері багатомодальних інтерлейвних даних, який збирає високоякісні багатомодальні документи у великому масштабі з джерел, таких як файли PDF та статті ArXiv.
  • Експерименти з моделями: Експерименти показують, що LMM, навчені на MINT-1T, не тільки дорівнюють, але й потенційно перевершують продуктивність моделей, навчених на найкращому існуючому відкритому наборі даних OBELICS, при цьому забезпечуючи десятикратне збільшення масштабу.

MINT-1T: Будування набору даних

MINT-1T кураторить великомасштабний відкритий набір даних, який використовує більш різноманітні джерела інтерлейвних документів, таких як файли PDF та статті ArXiv. Ця секція деталізує методи MINT-1T для джерел багатомодальних документів, фільтрації низькоякісного вмісту, дедуплікації даних та видалення не безпечного для роботи або нежаданого матеріалу. Остаточний набір даних складається з 922 мільярдів (Б) токенів HTML, 106 мільярдів токенів PDF та 9 мільярдів токенів ArXiv.

Джереління великих кількостей багатомодальних документів

Потік HTML

MINT-1T слідує методу OBELICS для видобутку інтерлейвних багатомодальних документів з файлів CommonCrawl WARC, розбираючи DOM-дерево кожного запису WARC. Хоча OBELICS обробляв документи лише з лютого 2020 року по лютий 2023 року з CommonCrawl, MINT-1T розширив пул документів, включаючи HTML-документи з травня 2017 року по квітень 2024 року (з повними дампами з жовтня 2018 року по квітень 2024 року та частковими дампами з попередніх років). Аналогічно OBELICS, MINT-1T фільтрує документи, які не містять зображень, мають більше тридцяти зображень або зображень з URL, які містять недоречні підстроки, такі як логотип, аватар, порнографія та інші.

Потік PDF

MINT-1T джерелить документи PDF з файлів CommonCrawl WAT з лютого 2023 року по квітень 2024 року. Спочатку всі посилання на PDF-документи витягуються з цих дампів. MINT-1T потім намагається завантажити та прочитати PDF-документи, виключивши ті, які перевищують 50 МБ (ймовірно, містять великі зображення) та ті, які мають понад 50 сторінок. Сторінки без тексту виключаються, а порядок читання встановлюється для залишених сторінок. Порядок читання визначається шляхом визначення обмежувальної рамки всіх текстових блоків на сторінці, кластеризації блоків за стовпцями та впорядкування їх з верхнього лівого до нижнього правого. Зображення інтегруються в послідовність на основі їх близькості до текстових блоків на тій же сторінці.

Потік ArXiv

MINT-1T будує інтерлейвні документи ArXiv з коду LaTeX, використовуючи TexSoup для знаходження тегів фігур та чергування зображень з текстом статті. Для документів з кількох файлів MINT-1T визначає основний файл TeX та замінює теги вводу вмістом файлів. Код LaTeX очищується шляхом видалення імпортів, бібліографії, таблиць та тегів цитат. Оскільки ArXiv вже є висококураторованим джерелом даних, додаткова фільтрація та дедуплікація не проводиться.

Фільтрація якості тексту

MINT-1T уникає використання моделей, заснованих на моделях, для фільтрації тексту, слідуючи практикам, встановленим RefinedWeb, Dolma та FineWeb. Спочатку документи, які не є англійськими, виключаються за допомогою моделі ідентифікації мови Fasttext (з порогом довіри 0,65). Документи з URL, які містять підстроки NSFW, також видаляються для виключення порнографічного та нежаданого вмісту. Методи фільтрації тексту з RefinedWeb застосовуються, зокрема видаляються документи з надмірними дублікатами n-грам або ті, які ідентифікуються як низької якості за допомогою правил MassiveText.

Фільтрація зображень

Після кураторства PDF-документів та файлів HTML MINT-1T намагається завантажити всі посилання на зображення в наборі даних HTML, виключаючи недоступні посилання та видаляючи документи без дійсних посилань на зображення. Зображення менші за 150 пікселів видаляються, щоб уникнути шумових зображень, таких як логотипи та іконки, а зображення більші за 20 000 пікселів також видаляються, оскільки вони зазвичай відповідають зображенням, не пов’язаним з темою. Для документів HTML зображення з співвідношенням сторін більше двох видаляються для фільтрації низькоякісних зображень, таких як баннерні оголошення. Для PDF-документів поріг встановлюється на три для збереження наукових фігур та таблиць.

Вищезазначена фігура представляє, як MINT-1T унікально включає дані з PDF-документів та статей ArXiv, крім джерел HTML.

Фільтрація безпеки

  • Фільтрація зображень NSFW: MINT-1T застосовує детектор зображень NSFW до всіх зображень у наборі даних. Якщо документ містить хоча б одне зображення NSFW, весь документ видаляється.
  • Видалення особистої ідентифікаційної інформації: Для мінімізації ризику витоку особистих даних електронні адреси та IP-адреси у текстових даних анонімізуються. Електронні адреси замінюються шаблонами, такими як “[email protected]”, а IP-адреси заміняються випадковими недіючими IP-адресами.

Дедуплікація

MINT-1T проводить дедуплікацію текстових документів та зображень для видалення повторюваних, неінформативних зображень, таких як іконки та логотипи. Усі кроки дедуплікації проводяться окремо для кожного джерела даних.

Дедуплікація абзаців та документів

Слідуючи методології Dolma, MINT-1T використовує фільтр Блума для ефективної дедуплікації тексту, встановлюючи рівень хибного позитиву 0,01 та видаляючи дублікати абзаців (позначені подвійними роздільниками рядків) з кожного документа. Якщо понад 80% абзаців документа є дублікатами, весь документ видаляється.

Видалення загальних текстів-шаблонів

Після дедуплікації абзаців MINT-1T видаляє короткі загальні тексти-шаблони в документах HTML, такі як “Перейти до змісту” або “Архів блогу”. Це здійснюється шляхом виконання точної дедуплікації абзаців на 2% кожного снимку CommonCrawl, у відповідності з практиками CCNet, що забезпечує в основному видалення загальних текстів-шаблонів.

Вищезазначена фігура демонструє процес фільтрації для MINT-1T та показує, як токени видаляються протягом процесу обробки даних для HTML, PDF-документів та статей ArXiv.

Дедуплікація зображень

В межах кожного снимку CommonCrawl MINT-1T видаляє часто повторювані зображення на основі хешів SHA256. Замість суворої дедуплікації видаляються лише зображення, які з’являються понад десять разів у снімку, слідуючи практикам Multimodal-C4. У відповідності з OBELICS, повторювані зображення в межах одного документа видаляються, залишаючи лише перше входження.

Інфраструктура

Під час обробки даних MINT-1T мав доступ до середнього значення 2350 ядер CPU з суміші вузлів на 190 процесорів та вузлів на 90 процесорів. Загалом було використано близько 4,2 мільйона годин CPU для побудови цього набору даних.

Порівняння складу документів у MINT-1T з OBELICS

При оцінці складу інтерлейвних наборів даних розглядаються два ключових показники: розподіл текстових токенів на документ та кількість зображень на документ. Для цього аналізу було випадково вибрано 50 000 документів з OBELICS та кожного джерела даних у MINT-1T. Токенізація GPT-2 була використана для розрахунку кількості текстових токенів. Аутлієри були видалені шляхом виключення документів, які потрапили за межі 1,5 міжквартильного діапазону для кількості текстових токенів та зображень. Як показано на наступній фігурі, підмножина HTML у MINT-1T збігається з розподілом токенів, спостережуваним у OBELICS. Однак документи, отримані з PDF-документів та статей ArXiv, як правило, довші за документи HTML у середньому, що підкреслює переваги джерел даних з різних джерел. Фігура 5 досліджує густину зображень по всіх документах, показуючи, що PDF-документи та статті ArXiv містять більше зображень порівняно з документами HTML, а зразки ArXiv є найбільш густими зображеннями.

Як різні джерела даних покращують різноманітність документів?

Одним із важливих мотивів для розширення джерел багатомодальних документів за межі HTML є покращення покриття доменів. Для кількісної оцінки різноманітності та глибини цього покриття була навчена модель Латентного Діріхле-алокування (LDA) на 100 000 документах, вибраних з набору даних OBELICS, підмножини HTML у MINT-1T та підмножини PDF (крім ArXiv) з MINT-1T, щоб отримати 200 тем. GPT-4 була використана для класифікації набору слів для визначення домінантних доменів – таких як Охорона здоров’я та медицина, Наука, Бізнес, Гуманітарні науки, Історія тощо – на основі доменів MMMU. Аналіз показує відмінні тенденції у розподілі доменів:

  • OBELICS: Цей набір даних демонструє виражену концентрацію в галузі “Гуманітарних та соціальних наук”. Це можна пояснити процесом кураторства даних, який включає фільтрацію документів, які не схожі на статті Вікіпедії, що потенційно змінює розподіл у бік більш загальних знань та гуманітарних наук.
  • Підмножина HTML у MINT-1T: На відміну від OBELICS, підмножина HTML у MINT-1T не має сильної упередженості щодо будь-якого конкретного домену, що свідчить про ширше та більш збалансоване представлення доменів.
  • Підмножина PDF у MINT-1T: Існує більша частка документів “Науки та технологій” у PDF-документах MINT-1T. Ця тенденція, ймовірно, пояснюється природою наукової комунікації, де PDF є переважним форматом для обміну детальними науковими роботами та технічними звітами.

MINT-1T: Результати та експерименти

Для всіх експериментів MINT-1T тренує модель на 50% пар зображень та тексту та 50% багатомодальних інтерлейвних пар. Максимально 2048 багатомодальних токенів вибрано з кожного інтерлейвного документа та 340 токенів з кожного зображення-текстового зразка. Аналогічно Flamingo, до кінця кожного сусіднього зображення-текстового послідовності додається токен “кінець”. Під час тренування 50% документів з одним зображенням випадково видаляються для апсемплінгу документів з кількома зображеннями. Набір даних зображень-тексту складається з суміші внутрішньо кураторованих наборів даних підписей. Можливість моделі міркувати про багатомодальні інтерлейвні послідовності оцінюється через її можливості навчання в контексті та багатомодального розсуду.

Вищезазначена фігура показує відсоток документів з кожного домену в MMMU для OBELICS та підмножин MINT-1T.

Навчання в контексті: Моделі оцінюються на чотирьохзразкових та восьмизразкових можливостях навчання в контексті на різних завданнях підписей (COCO (тест Карпатія) та TextCaps (валідация)) та наборах даних візуального питання-відповідь (VQAv2 (валідация), OK-VQA (валідация), TextVQA (валідация) та VizWiz (валідация)). Демонстрації випадково вибрано з тренувального набору. Бали平均нюються за декілька оціночних проходів з випадковими демонстраціями для урахування чутливості до вибраних підказок. Різні підказки абліються для кожного завдання для вибору тих, які демонструють найкращу продуктивність.

Багатомодальний розсуд: Моделі оцінюються на MMMU (який містить як однозначні, так і багатомодальні питання) та Mantis-Eval (усі багатомодальні питання) для дослідження можливостей багатомодального розсуду за межами оцінок навчання в контексті.

Тренування на документах HTML

Спочатку порівнюється частина HTML MINT-1T з OBELICS, оскільки OBELICS є попереднім лідером серед інтерлейвних наборів даних, також отриманих з документів HTML. Дві моделі тренуються на частинах HTML MINT-1T та OBELICS загалом на 10 мільярдів багатомодальних токенів. Їхні можливості навчання в контексті оцінюються. Наступна таблиця представляє чотирьохзразкові та восьмизразкові результати на спільних завданнях; модель, тренована на частинах HTML MINT-1T, виконує кращу роботу, ніж OBELICS на завданнях VQA, але гірше на завданнях підписей. В середньому OBELICS виконує трохи кращу роботу, ніж MINT-1T (HTML).

Додавання документів PDF та ArXiv

Наступно тренування проводиться на повному джерелі даних MINT-1T, з сумішшю документів HTML, PDF та ArXiv. Інтерлейвні документи вибрано з 50% з HTML, 45% з PDF-документів та 5% з ArXiv. Модель тренується загалом на 10 мільярдів багатомодальних токенів. Як видно з вище вказаної таблиці, модель, тренована на повному джерелі даних MINT-1T, перевершує OBELICS та MINT-1T (HTML) на більшості завдань навчання в контексті. На більш складних багатомодальних завданнях розсуду модель MINT-1T перевершує OBELICS на MMMU, але виконує гіршу роботу на Mantis-Eval.

Деталізовані тенденції

Як можливості навчання в контексті масштабуються з демонстраціями?

Можливості навчання в контексті оцінюються при підказках з однієї до восьми демонстрацій. Один пробний проход проводиться для кожного рахунку демонстрацій на кожному оціночному завданні. Як видно з наступної фігури, модель, тренована на MINT-1T, перевершує модель, треновану на частині HTML MINT-1T, та OBELICS на всіх демонстраціях. Модель MINT-1T (HTML) виконує трохи гіршу роботу, ніж OBELICS.

Продуктивність на завданнях підписей та візуального питання-відповідь

Наступна фігура представляє середню продуктивність навчання в контексті на завданнях підписей та візуального питання-відповідь. OBELICS перевершує всі варіанти MINT-1T на чотирьохзразкових завданнях підписей та виконує трохи гіршу роботу порівняно з MINT-1T на завданнях підписей з восьми демонстраціями. Однак MINT-1T значно перевершує обидва базові варіанти на завданнях VQA. MINT-1T (HTML) також перевершує OBELICS на завданнях VQA.

Продуктивність на різних доменах

Включення різноманітних доменів у MINT-1T спрямовано на покращення узагальнення моделі. Фігура раніше розбиває продуктивність на MMMU для кожного домену. За винятком домену “Бізнес”, MINT-1T перевершує OBELICS та MINT-1T (HTML). Покращення продуктивності у доменах “Наука” та “Технології” для MINT-1T пояснюється поширеністю цих доменів у документах ArXiv та PDF.

Заключні думки

У цій статті ми говорили про MINT-1T, найбільший і найрізноманітніший відкритий багатомодальний інтерлейвний набір даних на сьогодні. MINT-1T: у 10 разів більший за масштабом, включаючи один трильйон текстових токенів та 3,4 мільярда зображень порівняно з існуючими відкритими наборами даних. Набір даних MINT-1T також вводить раніше не використані джерела, такі як файли PDF та статті ArXiv. Оскільки багатомодальні інтерлейвні набори даних не масштабуються легко, важливо, щоб набір даних MINT-1T поділяв процес кураторства даних, щоб інші також могли проводити експерименти над такими інформаційно-багатими варіантами. Набір даних MINT-1T демонструє, що його метод; моделі, навчені на MINT-1T, є конкурентоспроможними (хоча й частково) до попередніх найкращих відкритих наборів даних OBELICS.

Інженер за професією, письменник серцем. Kunal є технічним письменником з глибокою любов'ю та розумінням AI і ML, присвяченим спрощенню складних концепцій у цих галузях завдяки його цікавим та інформативним документам.