Modele i platformy AI
MINT-1T: Skalowanie otwartoźródłowych multimodalnych danych o 10 razy
Trening dużych modeli multimodalnych (LMM) wymaga dużych zbiorów danych z przeplatanymi sekwencjami obrazów i tekstu w postaci swobodnej. Chociaż modele LMM otwartoźródłowe ewoluowały szybko, nadal brakuje wielomodalnych zbiorów danych o dużych rozmiarach, które są udostępniane na zasadach otwartego oprogramowania. Znaczenie tych zbiorów danych nie może być przecenione, ponieważ tworzą one podstawę dla tworzenia zaawansowanych systemów sztucznej inteligencji, które mogą rozumieć i generować treści w różnych modalnościach. Bez wystarczającego zaopatrzenia w kompleksowe, przeplatające się zbiory danych, potencjał rozwoju bardziej zaawansowanych i wydajnych modeli LMM jest znacznie ograniczony. Zbiory te umożliwiają modelom naukę z różnorodnego zakresu danych wejściowych, co sprawia, że są one bardziej wszechstronne i skuteczne w różnych aplikacjach. Ponadto, brak takich zbiorów danych stanowi wyzwanie dla społeczności otwartoźródłowej, która opiera się na współdzielonych zasobach, aby napędzać innowacje i współpracę.
Modele LMM otwartoźródłowe dokonały znaczących postępów w ostatnich latach, ale ich rozwój jest hamowany przez ograniczoną dostępność dużych, przeplatających się zbiorów danych. Aby pokonać tę przeszkodę, niezbędne są zintegrowane wysiłki, aby opracować, opisać i udostępnić bardziej kompleksowe zbiory danych, które mogą wspierać ciągły rozwój i udoskonalanie modeli multimodalnych. Ponadto, tworzenie i rozpowszechnianie tych zbiorów danych wymaga pokonania kilku technicznych i logistycznych przeszkód. Zbieranie danych musi być obszernym i reprezentatywnym dla różnorodnych kontekstów, w których modele LMM będą wdrożone. Opis wymaga starannego rozważenia, aby zapewnić, że przeplatające się sekwencje obrazów i tekstu są wyrównane w sposób, który zwiększa możliwości uczenia się modelu. Ponadto, zapewnienie, że zbiory danych są otwartoźródłowe, wymaga rozwiązania kwestii prawnych i etycznych związanych z prywatnością danych i prawami użytkowania. Rozszerzenie dostępności wysokiej jakości, dużych, multimodalnych, przeplatających się zbiorów danych jest niezbędne dla przyszłości badań i rozwoju sztucznej inteligencji. Poprzez rozwiązanie obecnego braku, społeczność sztucznej inteligencji może wspierać większe innowacje i współpracę, prowadząc do stworzenia bardziej potężnych i wszechstronnych modeli LMM, które mogą rozwiązywać złożone, rzeczywiste problemy.
Budując na tym, MINT-1T, największy i najbardziej różnorodny multimodalny, przeplatający się, otwartoźródłowy zbiór danych do tej pory. MINT-1T: 10-krotnie większa skala, obejmująca jeden trylion tokenów tekstu i 3,4 miliarda obrazów w porównaniu z istniejącymi otwartoźródłowymi zbiorami danych. Zbiór danych MINT-1T wprowadza również nigdy nieujawnione źródła, takie jak pliki PDF i arXiv. Ponieważ multimodalne, przeplatające się zbiory danych nie skalują się łatwo, ważne jest, aby zbiór danych MINT-1T udostępnił proces kuracji danych, aby inni mogli również prowadzić eksperymenty na takich informacyjnie bogatych wariantach. Zbiór danych MINT-1T pokazuje, że jego metoda jest skuteczna; modele LM szkolone na MINT-1T są konkurencyjne (choć trochę) w porównaniu z poprzednim stanem sztuki OBELICS.
MINT-1T: Zbiór multimodalny z jednym trylionem tokenów
Duże, otwartoźródłowe zbiory danych przedtreningowych były kluczowe dla społeczności badawczej w eksplorowaniu inżynierii danych i szkolenia transparentnych, otwartoźródłowych modeli. W dziedzinie tekstu, wczesne prace, takie jak C4 i The Pile, odegrały kluczową rolę w umożliwieniu społeczności szkolenia pierwszego zestawu otwartoźródłowych, dużych modeli językowych, takich jak GPT-J, GPT-Neo i innych. Te podstawowe wysiłki również przyprowadziły do późniejszych ulepszeń w metodach filtrowania danych i skalowania. Podobnie, w przestrzeni obrazu i tekstu, duże, otwartoźródłowe zbiory danych wywołały innowacje w lepszych metodach kuracji danych, takich jak sieci filtrowania danych i T-MARS. Jest zauważalna zmiana z laboratoriów na szkolenie dużych modeli multimodalnych (LMM), które wymagają obszernych, multimodalnych, przeplatających się zbiorów danych składających się z sekwencji obrazów i tekstu w postaci swobodnej. W miarę jak możliwości modeli na granicy się rozwijają, pojawia się znacząca luka w danych szkoleniowych między modelem zamkniętym a otwartoźródłowym. Bieżące, otwartoźródłowe, multimodalne, przeplatające się zbiory danych są mniejsze i mniej różnorodne niż ich odpowiedniki tylko tekstowe, pochodzące głównie z dokumentów HTML, co ogranicza szerokość i różnorodność danych. To ograniczenie utrudnia rozwój solidnych, otwartoźródłowych modeli LMM i tworzy dysproporcję między możliwościami modeli otwartoźródłowych i zamkniętych.
… (reszta tłumaczenia)












