Модели и платформы ИИ
MINT-1T: Масштабирование открытых многомодальных данных в 10 раз
Обучение крупномасштабных многомодальных моделей (LMM) требует больших наборов данных с чередующимися последовательностями изображений и текста в свободной форме. Хотя открытые LMM быстро эволюционируют, все еще существует значительный недостаток многомодальных чередующихся наборов данных в масштабе, которые являются открытыми. Важность этих наборов данных нельзя переоценить, поскольку они образуют основу для создания передовых систем ИИ, способных понимать и генерировать контент в разных модальностях. Без достаточного количества полных и чередующихся наборов данных потенциал разработки более совершенных и способных LMM значительно ограничен. Эти наборы данных позволяют моделям учиться на разнообразном наборе входных данных, делая их более универсальными и эффективными в различных приложениях. Кроме того, нехватка таких наборов данных представляет собой проблему для открытого сообщества, которое полагается на общие ресурсы для стимулирования инноваций и сотрудничества.
Открытые LMM сделали значительные шаги в последние годы, но их рост сдерживается ограниченной доступностью крупномасштабных чередующихся наборов данных. Чтобы преодолеть это препятствие, необходимы согласованные усилия для курирования, аннотации и выпуска более полных наборов данных, которые могут поддержать продолжающееся развитие и совершенствование многомодальных моделей. Кроме того, создание и распространение этих наборов данных включают в себя преодоление нескольких технических и логистических препятствий. Сбор данных должен быть обширным и представительным для различных контекстов, в которых будут развернуты LMM. Аннотация требует тщательного рассмотрения, чтобы обеспечить, что чередующиеся последовательности изображений и текста выравниваются таким образом, чтобы улучшить возможности обучения модели. Кроме того, обеспечение того, что наборы данных являются открытыми, предполагает решение юридических и этических вопросов, связанных с конфиденциальностью данных и правами на использование. Расширение доступности высококачественных, крупномасштабных многомодальных чередующихся наборов данных является важным для будущего исследований и разработок ИИ. Решая текущую нехватку, сообщество ИИ может стимулировать большую инновацию и сотрудничество, что приведет к созданию более мощных и универсальных LMM, способных решать сложные реальные проблемы.
Основываясь на этом, MINT-1T – это крупнейший и самый разнообразный открытый многомодальный чередующийся набор данных на сегодняшний день. MINT-1T: в 10 раз больше по масштабу, включая один триллион текстовых токенов и 3,4 миллиарда изображений, чем существующие открытые наборы данных. Набор данных MINT-1T также вводит ранее неиспользованные источники, такие как файлы PDF и статьи ArXiv. Поскольку многомодальные чередующиеся наборы данных не масштабируются легко, важно, чтобы набор данных MINT-1T разделял процесс курирования данных, чтобы другие также могли проводить эксперименты на таких информационно богатых вариантах. Набор данных MINT-1T демонстрирует, что его метод; модели LM, обученные на MINT-1T, являются конкурентоспособными (хотя и несколько) с предыдущими лучшими открытыми наборами данных OBELICS.
MINT-1T: Многомодальный набор данных с одним триллионом токенов
Крупномасштабные открытые наборы данных для предварительного обучения были важными для исследовательского сообщества в изучении инженерии данных и обучения прозрачных, открытых моделей. В текстовом домене ранние работы, такие как C4 и The Pile, сыграли решающую роль в ermögлении сообщества обучать первые открытые крупные языковые модели, такие как GPT-J, GPT-Neo и другие. Эти основополагающие усилия также проложили путь для последующих улучшений в методах фильтрации данных и масштабирования. Аналогично, в пространстве изображения и текста крупномасштабные открытые наборы данных стимулировали инновации в лучших методах фильтрации данных, таких как сети фильтрации данных и T-MARS. Есть заметный сдвиг от передовых лабораторий к обучению крупномасштабных многомодальных моделей (LMM), которые требуют обширных многомодальных чередующихся наборов данных, состоящих из свободных последовательностей изображений и текста. По мере того, как возможности передовых моделей быстро развиваются, значущая разница возникает в многомодальных тренировочных данных между закрытыми и открытыми моделями. Текущие открытые многомодальные чередующиеся наборы данных меньше и менее разнообразны, чем их текстовые аналоги, полученные в основном из документов HTML, что ограничивает широту и разнообразие данных. Это ограничение препятствует разработке прочных открытых LMM и создает дисбаланс между возможностями открытых и закрытых моделей.
Чтобы устранить этот разрыв, MINT-1T был создан как крупнейший и самый разнообразный открытый многомодальный чередующийся набор данных на сегодняшний день. MINT-1T содержит в общей сложности один триллион текстовых токенов и три миллиарда изображений, полученных из различных источников, таких как HTML, PDF и ArXiv. До MINT-1T крупнейшим открытым набором данных в этой области был OBELICS, который включал 115 миллиардов текстовых токенов и 353 миллиона изображений, все полученные из HTML.

Вклад MINT-1T следующий:
- Инженерия данных: Масштабирование этого многомодального чередующегося набора данных представляет собой более инженерную задачу, чем создание текстовых или изображений-текстовых пар наборов данных. Обработка более крупных размеров документов и сохранение исходного порядка изображений и текста имеет решающее значение.
- Разнообразие: MINT-1T является первым в многомодальном чередующемся пространстве, собирающим высококачественные многомодальные документы в крупном масштабе из источников, таких как PDF-файлы CommonCrawl и статьи ArXiv.
- Эксперименты с моделями: Эксперименты показывают, что LMM, обученные на MINT-1T, не только соответствуют, но и потенциально превосходят производительность моделей, обученных на лучшем существующем открытом наборе данных OBELICS, при этом предлагая увеличение масштаба в 10 раз.
MINT-1T: Построение набора данных
MINT-1T курирует крупномасштабный открытый набор данных, который использует более разнообразные источники чередующихся документов, такие как PDF-файлы и статьи ArXiv. Этот раздел описывает методы MINT-1T для получения многомодальных документов, фильтрации низкокачественного контента, дедупликации данных и удаления не подходящих для работы или нежелательного контента. Окончательный набор данных состоит из 922 миллиардов (Б) токенов HTML, 106Б токенов PDF и 9Б токенов ArXiv.
Получение крупных количеств многомодальных документов
Конвейер HTML
MINT-1T следует методу OBELICS для извлечения чередующихся многомодальных документов из файлов WARC CommonCrawl, парсируя дерево DOM каждой записи WARC. Хотя OBELICS обрабатывал только документы из дампов CommonCrawl с февраля 2020 года по февраль 2023 года, MINT-1T расширил пул документов, чтобы включить документы HTML из мая 2017 года по апрель 2024 года (с полными дампами с октября 2018 года по апрель 2024 года и частичными дампами из более ранних лет). Аналогично OBELICS, MINT-1T фильтрует документы, содержащие keine изображения, более тридцати изображений или любые изображения с URL, содержащими недопустимые подстроки, такие как логотип, аватар, порнография и xxx.
Конвейер PDF
MINT-1T получает документы PDF из файлов WAT CommonCrawl из дампов с февраля 2023 года по апрель 2024 года. Сначала все ссылки на PDF-файлы извлекаются из этих дампов. MINT-1T затем пытается скачать и прочитать PDF-файлы с помощью PyMuPDF, отбрасывая PDF-файлы больше 50МБ (вероятно, содержащие крупные изображения) и те, которые больше 50 страниц. Страницы без текста исключаются, и порядок чтения устанавливается для оставшихся страниц. Порядок чтения определяется путем нахождения ограничивающей рамки всех текстовых блоков на странице, кластеризации блоков на основе столбцов и упорядочения их слева направо. Изображения интегрируются в последовательность на основе их близости к текстовым блокам на той же странице.

Конвейер ArXiv
MINT-1T строит чередующиеся документы ArXiv из кода LaTeX, используя TexSoup для нахождения тегов фигур и чередования изображений с текстом статьи. Для документов из нескольких файлов MINT-1T определяет основной файл TeX и заменяет теги ввода содержимым его файлов. Код LaTeX очищается путем удаления импортов, библиографии, таблиц и тегов цитирования. Поскольку ArXiv уже является высоко курируемым источником данных, не выполняется дополнительная фильтрация и дедупликация.
Фильтрация качества текста
MINT-1T избегает использования модельных эвристик для фильтрации текста, следуя практикам, установленным RefinedWeb, Dolma и FineWeb. Сначала исключаются документы на языках, отличных от английского, с помощью модели идентификации языка Fasttext (с порогом уверенности 0,65). Документы с URL, содержащими подстроки NSFW, также удаляются для исключения порнографического и нежелательного контента. Методы фильтрации текста из RefinedWeb применяются, в частности, удаляются документы с чрезмерными дублирующими n-граммами или те, которые идентифицируются как низкокачественные с помощью правил MassiveText.
Фильтрация изображений
После курирования PDF-файлов и документов HTML MINT-1T пытается скачать все URL-адреса изображений в наборе данных HTML, отбрасывая недоступные ссылки и удаляя документы без действительных ссылок на изображения. Изображения размером меньше 150 пикселей отбрасываются, чтобы избежать шумных изображений, таких как логотипы и иконки, и изображения размером больше 20 000 пикселей также удаляются, поскольку они обычно соответствуют неуместным изображениям. Для документов HTML изображения с соотношением сторон больше двух удаляются для фильтрации низкокачественных изображений, таких как баннеры-реклама. Для PDF-файлов порог устанавливается на три, чтобы сохранить научные фигуры и таблицы.

Вышеуказанная фигура представляет, как MINT-1T уникально включает данные из PDF-файлов и документов ArXiv, помимо источников HTML.
Фильтрация безопасности
- Фильтрация изображений NSFW: MINT-1T применяет детектор изображений NSFW ко всем изображениям в наборе данных. Если документ содержит одно изображение NSFW, весь документ отбрасывается.
- Удаление личной идентифицирующей информации: Чтобы смягчить риск утечки личных данных, адреса электронной почты и IP-адреса в текстовых данных анонимизируются. Адреса электронной почты заменяются шаблонами, такими как “email@example.com”, а IP-адреса – случайно сгенерированными нефункциональными IP-адресами.
Дедупликация
MINT-1T выполняет дедупликацию абзацев и документов внутри каждого снимка CommonCrawl и дедупликацию изображений для удаления повторяющихся, неинформативных изображений, таких как иконки и логотипы. Все шаги дедупликации проводятся отдельно для каждого источника данных.
Дедупликация абзацев и документов
Следуя методологии Dolma, MINT-1T использует фильтр Блума для эффективной дедупликации текста, устанавливая скорость ложных положительных результатов на 0,01 и дедуплицируя 13-граммные абзацы (указанные через двойные разделители новой строки) из каждого документа. Если более 80% абзацев документа являются дубликатами, весь документ отбрасывается.
Удаление общего текста-котлета
После дедупликации абзацев MINT-1T удаляет короткие общие предложения-текст-котлеты в документах HTML, такие как “Пропустить содержимое” или “Архив блога”. Это делается путем выполнения точной дедупликации абзацев на 2% каждого снимка CommonCrawl, в соответствии с практиками CCNet, обеспечивая в основном удаление общего текста-котлета.

Вышеуказанная фигура демонстрирует процесс фильтрации для MINT-1T и показывает, как токены удаляются на протяжении всего конвейера данных для HTML, PDF-файлов и документов ArXiv.
Дедупликация изображений
В пределах каждого снимка CommonCrawl MINT-1T удаляет часто встречающиеся изображения на основе хешей SHA256. Вместо строгой дедупликации удаляются только изображения, которые появляются более десяти раз в пределах снимка, в соответствии с практиками Multimodal-C4. Согласно OBELICS, повторяющиеся изображения внутри одного документа удаляются, сохраняя только первое вхождение.
Инфраструктура
На протяжении всего процесса обработки данных MINT-1T имел доступ к среднему количеству 2350 ядер CPU из смеси узлов с 190 процессорами и 90 процессорами. Всего было использовано примерно 4,2 миллиона часов CPU для построения этого набора данных.
Сравнение состава документов в MINT-1T и OBELICS
При оценке состава чередующихся наборов данных изучаются два ключевых характеристика: распределение текстовых токенов на документ и количество изображений на документ. Для этого анализа были случайным образом отобраны 50 000 документов из обоих OBELICS и каждого источника данных в MINT-1T. Токенизатор GPT-2 был использован для расчета количества текстовых токенов. Аутлиеры удалялись путем исключения документов, которые находились вне 1,5 межквартильного диапазона для количества текстовых токенов и изображений. Как показано на следующей фигуре, подмножество HTML MINT-1T тесно соответствует распределению токенов, наблюдаемому в OBELICS. Однако документы, полученные из PDF-файлов и ArXiv, как правило, длиннее документов HTML в среднем, подчеркивая преимущества получения данных из различных источников. Фигура 5 исследует плотность изображений во всех документах, показывая, что PDF-файлы и документы ArXiv содержат больше изображений по сравнению с документами HTML, причем образцы ArXiv являются наиболее плотными по изображениям.

Как разные источники данных улучшают разнообразие документов?
Важной мотивацией для расширения пула многомодальных документов за пределы HTML является улучшение покрытия доменов. Чтобы количественно оценить разнообразие и глубину этого покрытия, модель Латентного распределения Дирихле (LDA) была обучена на 100 000 документах, отобранных из набора данных OBELICS, подмножества HTML MINT-1T и подмножества PDF (исключая ArXiv) из MINT-1T, чтобы получить 200 тем. GPT-4 был затем использован для классификации набора слов для определения доминирующих доменов – таких как Здоровье и медицина, Наука, Бизнес, Гуманитарные науки, История и т. д. – на основе доменов MMMU. Анализ показывает характерные тенденции в распределении доменов:
- OBELICS: Этот набор данных демонстрирует выраженную концентрацию в “Гуманитарных науках и социальных науках”. Это можно отнести к процессу его построения, который включает фильтрацию документов, не похожих на статьи Википедии, что потенциально изменяет распределение в сторону более общих знаний и гуманитарных наук.
- Подмножество HTML MINT-1T: В отличие от OBELICS, подмножество HTML MINT-1T не имеет сильной предвзятости к какому-либо конкретному домену, что указывает на более широкое и сбалансированное представление доменов.
- Подмножество PDF MINT-1T: Существует более высокий процент документов “Наука и технологии” в документах PDF MINT-1T. Эта тенденция, вероятно, обусловлена природой научной коммуникации, где PDF-файлы являются предпочтительным форматом для обмена подробными исследовательскими работами и техническими отчетами.
MINT-1T: Результаты и эксперименты
Для всех экспериментов MINT-1T обучает модель на 50% партий подписей изображений и текста и 50% многомодальных чередующихся партий. Максимально 2048 многомодальных токенов отбирается из каждого чередующегося документа и 340 токенов из каждого образца изображения и текста. Аналогично Flamingo, добавляется токен “конец”, чтобы указать конец соседней последовательности изображения и текста. Во время обучения 50% документов с одним изображением случайным образом удаляются для переуплотнения документов с несколькими изображениями. Набор данных изображения и текста состоит из смеси внутренних наборов данных подписей. Способность модели рассуждать о многомодальных чередующихся последовательностях оценивается через ее возможности контекстного обучения и многомодального рассуждения.

Вышеуказанная фигура иллюстрирует процент документов из каждого домена в MMMU для OBELICS и подмножеств MINT-1T.
Контекстное обучение: Модели оцениваются на четырехвыстрельном и восьмивыстрельном контекстном обучении на различных задачах подписывания (COCO (тест Karpathy) и TextCaps (валидация)) и наборах данных визуального вопроса и ответа (VQAv2 (валидация), OK-VQA (валидация), TextVQA (валидация) и VizWiz (валидация)). Демонстрации случайным образом отбираются из обучающего набора. Оценки усредняются по нескольким запускам оценки, с рандомизированными демонстрациями для учета чувствительности к выбранным подсказкам. Различные подсказки анализируются для каждой задачи, чтобы выбрать лучшие.
Многомодальное рассуждение: Модели оцениваются на MMMU (содержащем как одни, так и несколько изображений вопросов) и Mantis-Eval (все вопросы с несколькими изображениями), чтобы изучить многомодальные рассуждения за пределами оценок контекстного обучения.
Обучение на документах HTML
Сначала сравнивается часть HTML MINT-1T с OBELICS, поскольку OBELICS является предыдущим ведущим чередующимся набором данных, также полученным из документов HTML. Две модели обучаются на частях HTML MINT-1T и OBELICS в общей сложности на 10 миллиардов многомодальных токенов. Их возможности контекстного обучения оцениваются. Следующая таблица представляет четырехвыстрельную и восьмивыстрельную производительность на общих задачах; модель, обученная на документах HTML MINT-1T, работает лучше, чем OBELICS на задачах VQA, но хуже на задачах подписывания. В среднем OBELICS работает немного лучше, чем MINT-1T (HTML).

Добавление документов PDF и ArXiv
Затем обучение проводится на полных источниках данных MINT-1T, с смесью документов HTML, PDF и ArXiv. Чередующиеся документы отбираются с 50% из HTML, 45% из PDF-файлов и 5% из ArXiv. Модель обучается в общей сложности на 10 миллиардов многомодальных токенов. Как показано в таблице выше, модель, обученная на полном наборе данных MINT-1T, превосходит OBELICS и MINT-1T (HTML) на большинстве задач контекстного обучения. На более сложных многомодальных задачах рассуждения модель MINT-1T превосходит OBELICS на MMMU, но работает хуже на Mantis-Eval.
Тонкие тенденции
Как производительность контекстного обучения масштабируется с демонстрациями?
Производительность контекстного обучения оценивается при демонстрации от одного до восьми демонстраций. Один запуск проводится для каждого количества выстрелов для каждой оценочной задачи. Как показано на следующей фигуре, модель, обученная на MINT-1T, превосходит модель, обученную на подмножестве HTML MINT-1T и OBELICS, на всех выстрелах. Модель MINT-1T (HTML) работает немного хуже, чем OBELICS.

Производительность на задачах подписывания и визуального вопроса и ответа
Следующая фигура представляет среднюю производительность контекстного обучения на задачах подписывания и визуального вопроса и ответа. OBELICS превосходит все варианты MINT-1T на четырехвыстрельных задачах подписывания и работает немного хуже, чем MINT-1T, на восьмивыстрельных задачах подписывания. Однако MINT-1T значительно превосходит оба базовых варианта на задачах VQA. MINT-1T (HTML) также превосходит OBELICS на задачах VQA.
Производительность на разных доменах
Включение различных доменов в MINT-1T направлено на улучшение обобщаемости модели. Ранее упомянутая фигура разбивает производительность на MMMU для каждого домена. За исключением домена “Бизнес”, MINT-1T превосходит OBELICS и MINT-1T (HTML). Увеличение производительности в доменах “Наука и технологии” для MINT-1T обусловлено распространением этих доменов в документах ArXiv и PDF.
Окончательные мысли
В этой статье мы говорили о MINT-1T, крупнейшем и самом разнообразном открытом многомодальном чередующемся наборе данных на сегодняшний день. MINT-1T: в 10 раз больше по масштабу, включая один триллион текстовых токенов и 3,4 миллиарда изображений, чем существующие открытые наборы данных. Набор данных MINT-1T также вводит ранее неиспользованные источники, такие как файлы PDF и статьи ArXiv. Поскольку многомодальные чередующиеся наборы данных не масштабируются легко, важно, чтобы набор данных MINT-1T разделял процесс курирования данных, чтобы другие также могли проводить эксперименты на таких информационно богатых вариантах. Набор данных MINT-1T демонстрирует, что его метод; модели LM, обученные на MINT-1T, являются конкурентоспособными (хотя и несколько) с предыдущими лучшими открытыми наборами данных OBELICS.












