AI 모델 및 플랫폼

MINT-1T: 10배 크기인 오픈 소스 멀티모달 데이터 확장

mm
Unite.AI를 Google의 선호 소스에 추가

대규모 오픈 소스 멀티모달 모델을 훈련시키기 위해서는 이미지와 텍스트가 자유 형식으로 인터리브된 큰 규모의 데이터셋이 필요합니다. 오픈 소스 멀티모달 모델은 빠르게 발전하고 있지만, 여전히 대규모의 멀티모달 인터리브된 데이터셋이 부족합니다. 이러한 데이터셋은 고급 인공지능 시스템을 생성하는 데 필요한 기초를 형성하며, 이러한 데이터셋이 충분하지 않으면 더 발전된 멀티모달 모델을 개발하는 잠재력이 크게 제한됩니다. 이러한 데이터셋을 통해 모델은 다양한 입력에서 학습할 수 있으며, 다양한 응용 분야에서 더 유연하고 효과적인 모델을 생성할 수 있습니다. 또한, 이러한 데이터셋의 부족은 오픈 소스 커뮤니티에 도전을 제기하며, 이 커뮤니티는 공동의 자원을 통해 혁신과 협력을 추진합니다.

오픈 소스 멀티모달 모델은 최근 몇 년 동안 큰 발전을 이루었지만, 대규모의 인터리브된 데이터셋이 부족하여 성장에 제한을 받고 있습니다. 이러한 장애물을 극복하기 위해서는 더 많은 데이터셋을 구축하고, 주석을 달고, 공개하여 멀티모달 모델의 개발과 정제를 지원하는 집중적인 노력이 필요합니다. 또한, 이러한 데이터셋의 생성과 배포는 여러 기술적 및 논리적인 장애물을 극복해야 합니다. 데이터 수집은 다양한 컨텍스트에서 모델이 배포될 수 있도록 대표적인 데이터를 수집해야 하며, 주석은 모델의 학습 능력을 향상시키기 위해 이미지와 텍스트의 순서를 고려해야 합니다. 또한, 데이터셋을 오픈 소스로 공개하려면 데이터 개인 정보와 사용 권한에 관련된 법적 및 윤리적인 문제를 해결해야 합니다. 대규모의 멀티모달 인터리브된 데이터셋을 확장하는 것은 인공지능 연구와 개발의 미래를 위한 필수적인 것입니다. 이러한 부족을 해결하면 인공지능 커뮤니티는 더 큰 혁신과 협력을 촉진하여, 더 강력하고 유연한 멀티모달 모델을 생성할 수 있습니다.

이 점을 고려하여, MINT-1T는 현재까지 가장 큰 규모와 가장 다양한 오픈 소스 멀티모달 인터리브된 데이터셋입니다. MINT-1T는 1조개의 텍스트 토큰과 34억개의 이미지로 구성되어 있으며, HTML, PDF, ArXiv 문서에서 수집된 데이터를 포함합니다. MINT-1T 이전의 가장 큰 오픈 소스 데이터셋은 OBELICS로, 1150억개의 텍스트 토큰과 3.53억개의 이미지로 구성되어 있으며, 모두 HTML 문서에서 수집된 데이터입니다.

MINT-1T: 1조개의 토큰을 포함한 멀티모달 데이터셋

대규모의 오픈 소스 사전 훈련 데이터셋은 연구 커뮤니티에서 데이터 엔지니어링과 투명한 오픈 소스 모델을 훈련시키는 데 중요한 역할을 했습니다. 텍스트 도메인에서 초기 연구는 C4와 The Pile을 통해 오픈 소스 대규모 언어 모델을 훈련시키는 데 중요한 역할을 했습니다. 이러한 초기 노력은 이후 데이터 필터링 방법과 확장의 발전에 기여했습니다. 이미지-텍스트 공간에서도 대규모의 오픈 소스 데이터셋은 데이터 필터링 방법의 발전에 기여했습니다. 현재는 대규모의 멀티모달 모델을 훈련시키는 데 필요한 대규모의 멀티모달 인터리브된 데이터셋이 필요합니다.

MINT-1T는 HTML, PDF, ArXiv 문서에서 수집된 데이터를 포함하는 대규모의 오픈 소스 데이터셋을 구축했습니다. 이 섹션에서는 MINT-1T의 멀티모달 문서 수집, 저품질 콘텐츠 필터링, 중복 제거, 안전하지 않은 콘텐츠 제거 등의 방법에 대해 설명합니다. 최종 데이터셋은 9220억개의 HTML 토큰, 1060억개의 PDF 토큰, 90억개의 ArXiv 토큰으로 구성되어 있습니다.

MINT-1T: 데이터셋 구축

MINT-1T는 더 다양한 소스에서 인터리브된 문서를 수집하여 대규모의 오픈 소스 데이터셋을 구축했습니다. 이 섹션에서는 MINT-1T의 멀티모달 문서 수집, 저품질 콘텐츠 필터링, 중복 제거, 안전하지 않은 콘텐츠 제거 등의 방법에 대해 설명합니다.

대규모의 멀티모달 문서 수집

HTML 파이프라인

MINT-1T는 OBELICS의 방법을 따라 CommonCrawl WARC 파일에서 인터리브된 멀티모달 문서를 추출합니다. MINT-1T는 HTML 문서를 2017년 5월부터 2024년 4월까지 수집하여 더 큰 규모의 데이터셋을 구축했습니다.

PDF 파이프라인

MINT-1T는 CommonCrawl WAT 파일에서 PDF 문서를 수집합니다. PDF 문서는 PyMuPDF를 사용하여 읽고, 50MB 이상의 문서와 50페이지 이상의 문서는 제외합니다. 텍스트가 없는 페이지는 제외하고, 남은 페이지의 순서를 정합니다. 이미지와 텍스트의 순서는 페이지의 텍스트 블록과 이미지의 근접성을 고려하여 정합니다.

ArXiv 파이프라인

MINT-1T는 LaTeX 소스 코드에서 인터리브된 문서를 구축합니다. TexSoup를 사용하여 그림 태그를 찾고, 이미지와 텍스트를 인터리브합니다. 여러 파일로 구성된 논문은 주요 Tex 파일을 식별하고, 입력 태그를 파일의 내용으로 대체합니다. LaTeX 코드는 임포트, 서지, 표, 인용 태그를 제거하여 정리합니다. ArXiv는 이미高度로 관리되는 데이터 소스이므로, 추가적인 필터링과 중복 제거는 수행하지 않습니다.

텍스트 품질 필터링

MINT-1T는 모델 기반의 힐리스틱을 사용하지 않고, RefinedWeb, Dolma, FineWeb의 방법을 따릅니다. 먼저, 영어가 아닌 문서는 Fasttext의 언어 식별 모델을 사용하여 제거합니다. URL에 NSFW 서브스트링이 포함된 문서는 제거하여 음란하거나 원치 않는 콘텐츠를 제거합니다. RefinedWeb의 텍스트 필터링 방법을 적용하여, 중복된 n-그램이 많은 문서나 MassiveText 규칙에 따라 저품질로 식별된 문서를 제거합니다.

이미지 필터링

PDF와 HTML 파일에서 이미지 URL을 다운로드하고, 유효하지 않은 링크와 이미지 없는 문서를 제거합니다. 150픽셀 미만의 이미지는 제거하고, 20,000픽셀 이상의 이미지는 제거합니다. HTML 문서의 경우, 종횡비가 2 이상인 이미지는 제거하여 저품질의 이미지를 필터링합니다. PDF의 경우, 종횡비가 3 이상인 이미지는 제거하여 과학적 그림과 표를 보존합니다.

안전 필터링

  • NSFW 이미지 필터링: MINT-1T는 모든 이미지에 대해 NSFW 이미지 감지기를 적용합니다. 문서에 하나의 NSFW 이미지가 포함되면, 전체 문서를 제거합니다.
  • 개인 식별 정보 제거: 개인 데이터 유출의 위험을 완화하기 위해, 이메일 주소와 IP 주소를 익명화합니다. 이메일 주소는 “[email protected]”과 같은 템플릿으로 대체하고, IP 주소는 무작위로 생성된 비기능적인 IP 주소로 대체합니다.

중복 제거

MINT-1T는 각 CommonCrawl 스냅샷에서 문서와 문단의 중복을 제거하고, 이미지 중복을 제거하여 반복적인 이미지와 로고를 제거합니다. 모든 중복 제거 단계는 각 데이터 소스별로 별도로 수행됩니다.

문단과 문서 중복 제거

Dolma의 방법을 따르며, MINT-1T는 블룸 필터를 사용하여 효율적인 텍스트 중복 제거를 수행합니다. 13-그램 문단을 중복 제거하고, 문서의 80% 이상의 문단이 중복되면, 전체 문서를 제거합니다.

보일러플레이트 텍스트 제거

문단 중복 제거 후, MINT-1T는 HTML 문서에서 짧은 보일러플레이트 문장을 제거합니다. CCNet의 방법을 따라, 각 CommonCrawl 스냅샷의 2%에서 정확한 문단 중복 제거를 수행하여, 대부분의 보일러플레이트 텍스트를 제거합니다.

이미지 중복 제거

각 CommonCrawl 스냅샷에서, MINT-1T는 SHA256 해시를 사용하여 자주 발생하는 이미지를 제거합니다. 엄격한 중복 제거 대신, 각 스냅샷에서 10회 이상 발생하는 이미지만 제거합니다. OBELICS와 일관되게, 문서 내의 반복적인 이미지는 제거하고, 첫 번째 발생만 유지합니다.

인프라

데이터 처리 과정에서, MINT-1T는 평균 2350개의 CPU 코어와 190-프로세서와 90-프로세서 노드를 사용하여 총 420만개의 CPU 시간을 사용하여 이 데이터셋을 구축했습니다.

MINT-1T와 OBELICS의 문서 구성 비교

인터리브된 데이터셋의 구성에 대한 평가에서, 두 가지 주요 특성이 검토됩니다. 문서당 텍스트 토큰의 분포와 문서당 이미지의 수입니다. 이 분석을 위해, 50,000개의 문서를 OBELICS와 MINT-1T의 각 데이터 소스에서 무작위로 샘플링합니다. GPT-2의 토크나이저를 사용하여 텍스트 토큰의 수를 계산하고, 아웃라이어를 제거하여, 문서당 텍스트 토큰과 이미지의 수를 계산합니다. 결과는 MINT-1T의 HTML 하위셋이 OBELICS와 유사한 토큰 분포를 보이며, PDF와 ArXiv 문서는 평균적으로 더 긴 문서를 보입니다.

다양한 데이터 소스가 문서 다양성을 어떻게 개선하는가?

도메인 커버리지의 개선을 위해, 데이터 소스를 확장하는 것이 중요합니다. 도메인 분포의 다양성과 깊이를 정량화하기 위해, 100,000개의 문서를 OBELICS, MINT-1T의 HTML 하위셋, MINT-1T의 PDF 하위셋(ArXiv 제외)에서 샘플링하여 200개의 주제를 얻습니다. GPT-4를 사용하여 MMMU 도메인에서 지배적인 도메인을 식별합니다. 분석 결과는 다음과 같은 경향을 보여줍니다.

  • OBELICS: 이 데이터셋은 인문학 및 사회 과학에 강한 집중을 보입니다. 이는 데이터 구축 과정에서 위키백과 문서와 유사한 문서만 필터링하여, 일반적인 지식과 인문학에 중점을 둔 콘텐츠로 분포가 변경될 수 있습니다.
  • MINT-1T의 HTML 하위셋: 반면에, MINT-1T의 HTML 하위셋은 특정 도메인에 강한 편향을 보이지 않습니다. 이는 더 넓고 균형된 도메인 표현을 나타냅니다.
  • MINT-1T의 PDF 하위셋: PDF 문서에는 과학 및 기술 문서의 비중이 더 높습니다. 이는 과학적 연구와 기술 보고서를 공유하는 데 선호되는 형식이기 때문입니다.

MINT-1T: 결과와 실험

모든 실험에서, MINT-1T는 50%의 이미지-텍스트 캡션 배치와 50%의 멀티모달 인터리브된 배치를 사용하여 모델을 훈련시킵니다. 각 인터리브된 문서에서 최대 2048개의 멀티모달 토큰을 샘플링하고, 각 이미지-텍스트 샘플에서 340개의 토큰을 샘플링합니다. Flamingo와 유사하게, 인접한 이미지-텍스트 시퀀스의 끝을 나타내는 “end” 토큰을 추가합니다. 훈련 중에, 50%의 싱글 이미지 인터리브된 문서는 무작위로 삭제하여 멀티 이미지 문서를 업샘플링합니다. 이미지-텍스트 데이터셋은 내부적으로 큐레이션된 캡션 데이터셋의 혼합으로 구성됩니다. 모델의 멀티모달 인터리브된 시퀀스에 대한 추론 능력은 인-콘텍스트 학습 능력과 멀티 이미지 추론 성능을 통해 평가됩니다.

HTML 문서에서 훈련

초기적으로, MINT-1T의 HTML 부분은 OBELICS와 비교됩니다. OBELICS는 이전의 선도적인 인터리브된 데이터셋으로, HTML 문서에서 구축되었습니다. 두 모델은 MINT-1T의 HTML 부분과 OBELICS에서 훈련되며, 총 10B의 멀티모달 토큰으로 구성됩니다. 인-콘텍스트 학습 성능은 평가됩니다. 결과는 MINT-1T의 HTML 문서에서 훈련된 모델이 VQA 태스크에서 OBELICS보다 더 좋은 성능을 보이지만, 캡션 벤치마크에서 더 나쁨을 보여줍니다.

PDF와 ArXiv 문서 추가

그 다음, MINT-1T의 전체 데이터 소스를 사용하여 훈련을 수행합니다. 인터리브된 문서는 50%의 HTML, 45%의 PDF, 5%의 ArXiv에서 샘플링됩니다. 모델은 총 10B의 멀티모달 토큰으로 구성됩니다. 결과는 MINT-1T의 전체 데이터 혼합으로 훈련된 모델이 OBELICS와 MINT-1T의 HTML 부분보다 더 좋은 성능을 보입니다.

세부적인 경향

인-콘텍스트 학습 성능이 데모에 따라 어떻게 확장하는가?

인-콘텍스트 학습 성능은 1부터 8개의 데모를 사용하여 평가됩니다. 각 평가 벤치마크에서 단일 시도를 수행하고, 데모는 무작위로 샘플링됩니다. 결과는 MINT-1T에서 훈련된 모델이 OBELICS와 MINT-1T의 HTML 부분보다 모든 샷에서 더 좋은 성능을 보입니다.

캡션과 시각적 질문 답변 태스크의 성능

결과는 캡션과 시각적 질문 답변 벤치마크에서 평균 인-콘텍스트 학습 성능을 보여줍니다. OBELICS는 4샷 캡션 벤치마크에서 모든 MINT-1T 변형보다 더 좋은 성능을 보이지만, 8샷 캡션에서 약간 더 나쁨을 보여줍니다. 그러나 MINT-1T는 VQA 벤치마크에서 OBELICS와 MINT-1T의 HTML 부분보다 더 좋은 성능을 보입니다.

다양한 도메인의 성능

MINT-1T는 다양한 도메인을 포함하여 모델의 일반화를 향상시키는 것을 목표로 합니다. 이전의 결과는 MMMU에서 각 도메인의 성능을 보여줍니다. 비즈니스 도메인을 제외하고, MINT-1T는 OBELICS와 MINT-1T의 HTML 부분보다 더 좋은 성능을 보입니다. 과학 및 기술 도메인의 성능 향상은 ArXiv와 PDF 문서에서 이러한 도메인의 普遍性에 기인합니다.

최종 생각

이 기사에서 우리는 MINT-1T, 현재까지 가장 큰 규모와 가장 다양한 오픈 소스 멀티모달 인터리브된 데이터셋에 대해 논의했습니다. MINT-1T는 1조개의 텍스트 토큰과 34억개의 이미지로 구성되어 있으며, HTML, PDF, ArXiv 문서에서 수집된 데이터를 포함합니다. 멀티모달 인터리브된 데이터셋은 쉽게 확장되지 않기 때문에, MINT-1T 데이터셋이 데이터 구축 과정을 공유하여 다른 사람들이 이러한 정보豊富한 변형에 대한 실험을 수행할 수 있도록 하는 것이 중요합니다. MINT-1T 데이터셋은 이전의 최고 성능을 보인 OBELICS와 경쟁력 있는 성능을 보입니다.

전문직으로서의 엔지니어, 마음으로서의 작가입니다. Kunal은 AI와 ML에 대한 깊은 사랑과 이해를 가진 기술 작가로, 이러한 분야의 복잡한 개념을 흥미롭고 정보적인 문서를 통해 단순화하는데 헌신하고 있습니다.