AIモデルとプラットフォーム

MINT-1T:オープンソースのマルチモーダルデータを10倍に拡大

mm
Unite.AI を Google の優先ソースに追加

大規模なマルチモーダルモデル(LMM)のトレーニングには、画像とテキストのインターリーブされたシーケンスを含む大規模なデータセットが必要です。オープンソースのLMMは急速に進化していますが、まだオープンソースのマルチモーダルインターリーブされたデータセットが不足しています。これらのデータセットは、さまざまなモダリティのコンテンツを理解および生成できる高度なAIシステムを作成するための基盤を形成するため、その重要性は強調されるべきです。十分なマルチモーダルインターリーブされたデータセットがなければ、より高度で能力のあるLMMの開発の可能性は大きく制限されます。これらのデータセットにより、モデルはさまざまな入力から学習し、さまざまなアプリケーションでより汎用性と有効性が高まります。さらに、オープンソースコミュニティはイノベーションとコラボレーションの推進に共有リソースに依存しているため、これらのデータセットの不足は課題となります。

オープンソースのLMMは近年大きな進歩を遂げてきましたが、その成長は大規模なマルチモーダルインターリーブされたデータセットの限られた入手可能性によって妨げられています。この障害を克服するために、マルチモーダルモデルをサポートするための包括的なデータセットの作成と公開が必要です。また、これらのデータセットの作成と配布には、データの収集、注釈付け、法的および倫理的考慮など、技術的およびロジスティック的な課題が伴います。データの収集は、LMMが展開されるさまざまなコンテキストを代表するものでなければなりません。注釈付けには、モデルが学習する能力を高めるために、画像とテキストのシーケンスが適切に整列するようにするための注意深い考慮が必要です。また、データセットをオープンソースにするには、データのプライバシーと使用権に関する法的および倫理的考慮事項に対処する必要があります。高品質のマルチモーダルインターリーブされた大規模データセットの入手可能性の拡大は、AI研究と開発の将来にとって不可欠です。現在の不足を解消することで、AIコミュニティはイノベーションとコラボレーションの促進につながり、より強力で汎用性の高いLMMの作成につながります。

この点について、MINT-1Tは、現在までで最大かつ最も多様なオープンソースのマルチモーダルインターリーブされたデータセットです。MINT-1T:1兆のテキストトークンと34億の画像を含む、既存のオープンソースデータセットの10倍の規模です。MINT-1Tデータセットは、PDFファイルやarXiv論文などの新たな情報源も導入しています。マルチモーダルインターリーブされたデータセットは簡単に拡張できないため、MINT-1Tデータセットがデータキュレーションプロセスを共有することは重要であり、他者もこれらの情報豊富なバリアントについての実験を実施できるようになります。MINT-1Tデータセットは、その方法が有効であることを実証しており、MINT-1TでトレーニングされたLMモデルは、以前の最先端のOBELICSと比較して競争力があります。

MINT-1T:1兆トークンのマルチモーダルデータセット

大規模なオープンソースの事前トレーニングデータセットは、データエンジニアリングとオープンソースモデルをトレーニングする研究コミュニティにとって重要でした。テキストドメインでは、C4やThe Pileなどの初期の研究は、最初のオープンソースの大規模言語モデルであるGPT-J、GPT-Neoなどのトレーニングを可能にする上で重要な役割を果たしました。これらの基礎的な取り組みは、データフィルタリング方法の改善やスケーリングにも道を開きました。同様に、画像とテキストの空間では、大規模なオープンソースデータセットは、Data Filtering NetworksやT-MARSなどのデータキュレーション方法の改善につながりました。フロンティアラボから大規模なマルチモーダルモデル(LMM)のトレーニングへの移行が見られ、LMMに必要なマルチモーダルインターリーブされたデータセットとクローズドソースモデルの間には、重大なギャップが生じています。現在のオープンソースのマルチモーダルインターリーブされたデータセットは、テキストのみのデータセットよりも小さく、多様性も低く、主にHTMLドキュメントから取得されています。これらのデータセットの限界は、ロバストなオープンソースLMMの開発を妨げ、オープンソースモデルとクローズドソースモデルの間のギャップを生み出しています。

このギャップを解消するために、MINT-1Tは、現在までで最大かつ最も多様なオープンソースのマルチモーダルインターリーブされたデータセットとして作成されました。MINT-1Tには、1兆のテキストトークンと34億の画像が含まれており、HTML、PDF、arXivなどのさまざまな情報源から収集されています。MINT-1Tの前に、オープンソースのマルチモーダルインターリーブされたデータセットの中で最大だったOBELICSには、1150億のテキストトークンと3.53億の画像が含まれており、すべてHTMLから収集されていました。

MINT-1Tの貢献は以下のとおりです:

  • データエンジニアリング: マルチモーダルインターリーブされたデータをスケーリングすることは、テキストのみまたは画像とテキストのペアのデータセットを作成するよりも、エンジニアリング上の課題です。ドキュメントのサイズを処理し、画像とテキストの元の順序を維持することが重要です。
  • 多様性: MINT-1Tは、マルチモーダルインターリーブされたデータセットの中で初めて、CommonCrawlのPDFやarXivなどの情報源から、高品質のマルチモーダルドキュメントを大規模に収集しました。
  • モデル実験: 実験では、MINT-1TでトレーニングされたLMMは、以前の最先端のオープンソースデータセットであるOBELICSと比較して、競争力があります。

MINT-1T:データセットの構築

MINT-1Tは、PDFやarXiv論文などのより多様な情報源から収集された、大規模なオープンソースのマルチモーダルインターリーブされたデータセットです。このセクションでは、MINT-1Tのマルチモーダルドキュメントの収集、低品質コンテンツのフィルタリング、データの重複排除、NSFWコンテンツの除去などの方法について説明します。最終的なデータセットには、9220億のHTMLトークン、1060億のPDFトークン、90億のarXivトークンが含まれています。

大規模なマルチモーダルドキュメントの収集

HTMLパイプライン

MINT-1Tは、CommonCrawlのWARCファイルからHTMLドキュメントを抽出するために、OBELICSと同様の方法を使用しています。ただし、MINT-1Tは、2017年5月から2024年4月までのHTMLドキュメントを収集しています。ドキュメントのフィルタリングでは、画像が含まれないドキュメント、30を超える画像を含むドキュメント、または不適切なサブストリングを含む画像URLのドキュメントを除外します。

PDFパイプライン

MINT-1Tは、CommonCrawlのWATファイルからPDFドキュメントを抽出します。PDFリンクを抽出し、PyMuPDFを使用してPDFをダウンロードして読み取ります。50MBを超えるPDFや50ページを超えるPDFは除外し、テキストが含まれないページも除外します。読み取り順序を決定するために、テキストブロックのバウンディングボックスを検出して、カラムに基づいてクラスタリングし、左上から右下に順序付けます。画像は、同じページのテキストブロックに近接する順序で統合されます。

arXivパイプライン

MINT-1Tは、LaTeXソースコードからarXivのインターリーブされたドキュメントを構築します。TexSoupを使用して、図のタグを見つけ、画像とテキストをインターリーブします。マルチファイルの論文の場合、メインのTeXファイルを特定し、入力タグをそのファイルの内容に置き換えます。LaTeXコードは、インポート、ビブリオグラフィ、表、引用タグを削除することでクリーンアップされます。arXivはすでに高度にキュレーションされた情報源であるため、追加のフィルタリングと重複排除は実行されません。

テキスト品質フィルタリング

MINT-1Tは、モデルベースのヒューリスティックを使用せずに、RefinedWeb、Dolma、FineWebに従ったテキストフィルタリングを実施します。Fasttextの言語識別モデルを使用して、英語以外のドキュメントを除外します。NSFWサブストリングを含むURLのドキュメントも除外します。RefinedWebのテキストフィルタリング方法を適用し、過剰なn-グラムの繰り返しやMassiveTextのルールに基づいて低品質と判断されたドキュメントを除去します。

画像フィルタリング

PDFとHTMLファイルのキュレーション後、MINT-1TはHTMLデータセット内のすべての画像URLのダウンロードを試み、取得できないリンクや有効な画像リンクのないドキュメントを除去します。150ピクセル未満の画像は除去し、20000ピクセルを超える画像も除去します。HTMLドキュメントの場合、2を超えるアスペクト比の画像は除去します。PDFの場合、3を超えるアスペクト比の画像は除去しますが、科学的図表を保存するために調整されています。

上記の図は、MINT-1TがHTML以外の情報源であるPDFやarXivからデータを含むことを示しています。

セーフティフィルタリング

  • NSFW画像フィルタリング:MINT-1Tは、データセット内のすべての画像にNSFW画像検出器を適用します。ドキュメントに1つでもNSFW画像が含まれている場合、そのドキュメント全体を除去します。
  • 個人情報の除去:個人情報の漏洩リスクを軽減するために、テキストデータ内のメールアドレスとIPアドレスを匿名化します。メールアドレスは「example@example.com」のようなテンプレートに置き換え、IPアドレスは機能しないランダムなIPアドレスに置き換えます。

重複排除

MINT-1Tは、各CommonCrawlスナップショット内で段落レベルとドキュメントレベルのテキスト重複排除を実施し、アイコンやロゴのような情報のない画像を除去するために画像重複排除も実施します。すべての重複排除手順は、各情報源ごとに個別に実行されます。

段落とドキュメントの重複排除

Dolmaの方法に従い、MINT-1Tは、段落レベルのテキスト重複排除にBloomフィルタを使用します。偽陽性率を0.01に設定し、各ドキュメントからダブルニューラインデリミタで示される13グラムの段落を重複排除します。ドキュメントの80%以上の段落が重複している場合、そのドキュメント全体を除去します。

共通のボイラープレートテキストの除去

段落レベルの重複排除後、MINT-1Tは、HTMLドキュメントから「Skip to content」や「Blog Archive」のような短い共通のボイラープレート文を除去します。これは、CCNetの慣行に従い、各CommonCrawlスナップショットの2%のドキュメントで段落レベルの重複排除を実行することで実施され、主に共通のボイラープレートテキストの除去を目的としています。

上記の図は、MINT-1Tのフィルタリングプロセスを示し、HTML、PDF、arXivのデータパイプラインを通じてトークンが除去される方法を示しています。

画像の重複排除

各CommonCrawlスナップショット内で、MINT-1TはSHA256ハッシュを使用して画像の重複を除去します。厳密な重複排除ではなく、スナップショット内で10回以上出現する画像のみを除去します。Multimodal-C4の慣行に従い、ドキュメント内で繰り返される画像は除去し、最初の出現のみを保持します。

インフラストラクチャ

データ処理中、MINT-1Tは、平均2,350のCPUコアと、190プロセッサと90プロセッサのノードを使用しました。合計で約420万CPU時間を使用してこのデータセットを構築しました。

MINT-1TとOBELICSのドキュメント構成の比較

インターリーブされたデータセットの構成を評価するために、2つの重要な特性を検討します。ドキュメントあたりのテキストトークンの分布とドキュメントあたりの画像の数です。この分析では、OBELICSとMINT-1Tの各情報源から50,000のドキュメントをランダムにサンプリングしました。GPT-2のトークナイザーを使用してテキストトークンの数を計算します。外れ値は、テキストトークンと画像の数の1.5四分位範囲の外側にあるドキュメントを除外することで除去されます。次の図は、MINT-1TのHTMLサブセットがOBELICSのトークン分布と密接に一致していることを示しています。ただし、PDFやarXivから得られるドキュメントは、平均してHTMLドキュメントよりも長いことを示しています。これは、多様な情報源からデータを収集する利点を強調しています。図5は、ドキュメント全体の画像密度を示し、PDFやarXivのドキュメントがHTMLドキュメントよりも画像が多く含まれていることを示しています。arXivのサンプルは最も画像密度が高いです。

さまざまな情報源がドキュメントの多様性をどのように向上させるか

マルチモーダルドキュメントのプールをHTML以外の情報源に拡大することの重要な動機は、ドメインのカバレッジの向上です。カバレッジの多様性と深さを量化するために、OBELICS、MINT-1TのHTMLサブセット、MINT-1TのPDFサブセット(arXivを除く)から100,000のドキュメントをサンプリングして、200のトピックを取得するためにLatent Dirichlet Allocation(LDA)モデルをトレーニングしました。GPT-4を使用して、MMMUドメインに基づいて、ヘルス&メディシン、サイエンス、ビジネス、ヒューマニティーズ、ヒストリーなどの主要ドメインを識別するために、単語のセットを分類しました。分析では、ドメイン分布に関する明確な傾向が見られます。

  • OBELICS: このデータセットは「ヒューマニティーズと社会科学」に重点を置いています。これは、ウィキペディアの記事に似たドキュメントをフィルタリングするデータ構築プロセスに起因する可能性があり、一般知識とヒューマニティーズに重点を置いたコンテンツの分布が変化する可能性があります。
  • MINT-1TのHTMLサブセット: 一方、MINT-1TのHTMLサブセットは、特定のドメインに強く偏っていません。ドメインの表現がより広範でバランスの取れたものであることを示しています。
  • MINT-1TのPDFサブセット: MINT-1TのPDFドキュメントには、サイエンスとテクノロジーのドキュメントの割合が高いことがわかります。これは、科学的コミュニケーションにおいて、PDFが詳細な研究論文や技術報告を共有するための好まれる形式であるため、arXivやPDFから得られるドキュメントの性質に起因する可能性があります。

MINT-1T:結果と実験

すべての実験では、MINT-1Tは、50%の画像とテキストのキャプションバッチと50%のマルチモーダルインターリーブされたバッチでモデルをトレーニングします。各インターリーブされたドキュメントから最大2048のマルチモーダルトークンをサンプリングし、各画像とテキストのサンプルから340トークンをサンプリングします。Flamingoと同様に、隣接する画像とテキストのシーケンスの終了を示すために「end」トークンを追加します。トレーニング中、単一の画像を持つインターリーブされたドキュメントの50%をランダムにドロップして、マルチ画像ドキュメントをオーバーサンプリングします。画像とテキストのデータセットは、内部でキュレーションされたキャプションデータセットの混合です。モデルのマルチモーダルインターリーブされたシーケンスについての推論能力は、インコンテキストラーニングとマルチ画像推論のパフォーマンスを評価することで評価されます。

上記の図は、MMMUの各ドメインからのドキュメントの割合を、OBELICSとMINT-1Tのサブセットで示しています。

インコンテキストラーニング: モデルは、4ショットと8ショットのインコンテキストラーニングのパフォーマンスを、さまざまなキャプションベンチマーク(COCO(Karpathyテスト)とTextCaps(バリデーション))と視覚的質問回答データセット(VQAv2(バリデーション)、OK-VQA(バリデーション)、TextVQA(バリデーション)、VizWiz(バリデーション))で評価します。デモンストレーションはトレーニングセットからランダムにサンプリングされ、スコアは複数の評価ランを平均して、選択したプロンプトの感度を考慮します。各タスクの最も優れたパフォーマンスを示すプロンプトを選択するために、異なるプロンプトを除去します。

マルチ画像推論: モデルは、MMMU(シングル画像とマルチ画像の質問を含む)とMantis-Eval(すべてマルチ画像の質問)でマルチ画像推論能力を評価します。これは、インコンテキストラーニング評価の外側で行われます。

HTMLドキュメントでのトレーニング

最初に、MINT-1TのHTML部分は、OBELICSと比較されます。OBELICSは、HTMLドキュメントからキュレーションされた以前の最先端のインターリーブされたデータセットです。MINT-1TとOBELICSのHTML部分でトレーニングされた2つのモデルを、10Bのマルチモーダルトークンでトレーニングし、そのインコンテキストラーニングのパフォーマンスを評価します。以下の表は、4ショットと8ショットのパフォーマンスを、共通のベンチマークで示しています。MINT-1TのHTMLドキュメントでトレーニングされたモデルは、VQAタスクでOBELICSを上回りますが、キャプションベンチマークでは劣ります。平均して、OBELICSはMINT-1T(HTML)よりもわずかに優れています。

PDFとarXivドキュメントの追加

その後、MINT-1Tのすべての情報源(HTML、PDF、arXiv)でトレーニングを実施します。インターリーブされたドキュメントは、50%がHTMLから、45%がPDFから、5%がarXivからサンプリングされます。モデルは10Bのマルチモーダルトークンでトレーニングされます。上記の表から、MINT-1Tのフルデータミックスでトレーニングされたモデルは、OBELICSとMINT-1T(HTML)を上回り、ほとんどのインコンテキストラーニングのベンチマークで優れています。より複雑なマルチモーダル推論ベンチマークでは、MINT-1TモデルはMMMUでOBELICSを上回りますが、Mantis-Evalでは劣ります。

詳細な傾向

デモンストレーション数とインコンテキストラーニングのパフォーマンスの関係

インコンテキストラーニングのパフォーマンスは、1から8のデモンストレーション数で評価されます。各ショット数ごとに1回の評価が実行され、各評価ベンチマークのスコアはランダム化されたデモンストレーションに基づいて平均化されます。次の図は、MINT-1Tでトレーニングされたモデルが、すべてのショット数でOBELICSとMINT-1T(HTML)モデルを上回ることを示しています。MINT-1T(HTML)モデルはOBELICSよりもわずかに劣ります。

キャプションと視覚的質問回答タスクのパフォーマンス

次の図は、キャプションと視覚的質問回答(VQA)ベンチマークの平均インコンテキストラーニングのパフォーマンスを示しています。OBELICSは4ショットのキャプションベンチマークでMINT-1Tのすべてのバリアントを上回り、8ショットのキャプションではわずかに劣ります。しかし、MINT-1TはVQAベンチマークでOBELICSとMINT-1T(HTML)を大幅に上回ります。MINT-1T(HTML)もVQAタスクでOBELICSを上回ります。

さまざまなドメインのパフォーマンス

MINT-1Tには、ドメインの多様性を向上させることを目的として、さまざまなドメインが含まれています。以前の図は、MMMUの各ドメインのパフォーマンスを示しています。ビジネスドメインを除いて、MINT-1TはOBELICSとMINT-1T(HTML)を上回ります。サイエンスとテクノロジードメインにおけるMINT-1Tのパフォーマンスの向上は、arXivとPDFドキュメントの存在に起因するものです。

最終的な考え

この記事では、MINT-1Tについて説明しました。MINT-1Tは、現在までで最大かつ最も多様なオープンソースのマルチモーダルインターリーブされたデータセットです。MINT-1T:1兆のテキストトークンと34億の画像を含む、既存のオープンソースデータセットの10倍の規模です。MINT-1Tデータセットは、PDFファイルやarXiv論文などの新たな情報源も導入しています。マルチモーダルインターリーブされたデータセットは簡単に拡張できないため、MINT-1Tデータセットがデータキュレーションプロセスを共有することは重要であり、他者もこれらの情報豊富なバリアントについての実験を実施できるようになります。MINT-1Tデータセットは、その方法が有効であることを実証しており、MINT-1TでトレーニングされたLMモデルは、以前の最先端のOBELICSと比較して競争力があります。

職業はエンジニア、心は作家。クナルは、AIとMLを深く愛し理解しているテクニカルライターで、これらの分野の複雑な概念を魅力的で情報の多いドキュメンテーションを通じて簡素化することに尽力しています。