Modele i platformy AI

MPT-30B: MosaicML Przewyższa GPT-3 Z Nowym Modelem Językowym, aby Przekroczyć Granice NLP

mm
Dodaj Unite.AI do preferowanych źródeł w Google

MosaicML to firma zajmująca się sztuczną inteligencją generatywną, która dostarcza rozwiązania do wdrożenia i skalowania AI. Ich najnowszy duży model językowy (LLM) MPT-30B wywołuje duże zainteresowanie w społeczności AI.

Podróż MosaicML z modelem LLM rozpoczęła się od wydania MPT-7B (Mosaic Pretrained Transformer) w maju 2023 roku, który miał trzy warianty:

  1. MPT-7B-StoryWriter-65k+ (do generowania długich historii)
  2. MPT-7B-Instruct (do krótkich instrukcji)
  3. MPT-7B-Chat (do generowania dialogów)

Modele te odniosły ogromny sukces w społeczności ML dzięki ich otwartoźródłowemu charakterowi, możliwości komercyjnego wykorzystania oraz wyjątkowej zdolności do radzenia sobie z rozszerzonymi oknami kontekstowymi.

Najważniejsze jest to, że model ten był na równi z innymi porównywalnymi modelami (LLaMA-7B, StableLM 7B itp.) i w niektórych przypadkach ich przewyższał. Do czerwca seria MPT-7B została pobrana ponad 3 miliony razy. 22 czerwca MosaicML wydał MPT-30B, który podniósł poprzeczkę jeszcze wyżej dla modeli podstawowych o otwartym źródle.

MPT-30B: Potężny LLM, który Przewyższa GPT-3

MPT-30B to model LLM o otwartym źródle i komercyjnej licencji, oparty na dekoderze, który jest potężniejszy niż GPT-3-175B przy tylko 17% parametrów GPT-3, czyli 30B. Przewyższa GPT-3 w wielu zadaniach. Oto porównanie między MPT-30B a GPT-3.

MPT-30B opiera się na poprzednim modelu MPT-7B. Jest on komputacyjnie wydajny w treningu w porównaniu z modelami o podobnych rozmiarach. Na przykład, LLaMA-30B użył około 1,44 razy więcej budżetu FLOPs niż MPT-30B, podczas gdy Falcon-40B miał o 1,27 razy wyższy budżet FLOPs niż MPT-30B. Oto ilustracja poprawy MPT-30B w różnych zadaniach w porównaniu z jego poprzednikiem.

Niektóre specjalne funkcje MPT-30B to:

8k Token Context Window

Okno kontekstowe w LLM odnosi się do zakresu tokenów, które model może uwzględnić przed wygenerowaniem danych wyjściowych. MPT-30B miał okno kontekstowe o rozmiarze 8000 tokenów w czasie treningu. Został najpierw wytrenowany na 1T tokenach przy użyciu sekwencji 2k tokenów, a następnie dodatkowo na 50B tokenach sekwencji 8k tokenów (około 6000 słów).

ALiBi Support

Aby wyjaśnić tę funkcję, rozważmy następujące pytanie:

Jak MPT-30B może zrozumieć i dokonać predykcji dla dłuższych sekwencji niż te, na których został wytrenowany?

MPT-30B wykorzystuje technikę Attention with Linear Biases (ALiBi) do zrozumienia dłuższych sekwencji i rozszerzenia okna kontekstowego poza 8k tokenów podczas dostrajania lub inferencji.

Zamiast obliczania osadzeń pozycyjnych, w których przypisujemy wektor do każdego słowa w sekwencji, ALiBi oblicza wyniki uwagi między tokenami kluczowymi a zapytaniami. Gdy tokeny kluczowe i zapytania są blisko siebie, kara jest niska, ale wyższa w przeciwnym przypadku. W rezultacie podstawowa architektura transformatora może ekstrapolować do danych wejściowych o długiej formie.

Wydajna Inferencja i Trening za pomocą FlashAttention

Uwaga, czyli koncentrowanie się na istotnych częściach sekwencji wejściowej, jest krytycznym składnikiem transformatorów, ale może być powolna i wymagać dużej ilości pamięci, szczególnie przy przetwarzaniu długich sekwencji tekstu.

FlashAttention to podejście zaproponowane przez badaczy z Uniwersytetu Cornella, które rozwiązuje ten problem dla MPT-30B. Wykorzystując technikę tilingu, FlashAttention redukuje liczbę razy, gdy model musi odczytać lub zapisać dane w pamięci, przyspieszając przetwarzanie. Stąd model zatrudnia najnowocześniejszą technikę FlashAttention i bibliotekę optymalizacji FasterTransformer od NVIDIA (NVDA ) do wydajnego treningu i inferencji.

Łatwość Treningu i Wdrożenia

Deweloperzy mogą trenować MPT-30B od podstaw lub wykorzystywać punkty kontrolne MosaicML do szybszych wdrożeń. Ponadto może być dostrajany do przypadków użycia w określonym zestawie danych.

Rozmiar modelu został wybrany tak, aby umożliwić łatwe wdrożenie na jednej karcie graficznej, konkretnie 1xA100-80GB w precyzji 16-bitowej lub 1xA100-40GB w precyzji 8-bitowej. Oznacza to, że model został zaprojektowany tak, aby zmieścić się w ograniczeniach pamięciowych tych kart graficznych.

Możliwości Kodowania

MPT-30B oferuje również wyjątkowe możliwości kodowania. HumanEval to zestaw danych wydany przez OpenAI, który zawiera 164 ręcznie opracowane problemy programistyczne. W zestawie danych HumanEval model przewyższa specjalistyczne modele LLM, takie jak seria StarCoder.

Dostrajane Warianty: MPT-30B-Instruct i MPT-30B-Chat

MPT-30B-Instruct

Modele LLM są głównie używane do instrukcji, takich jak odpowiedzi na pytania, podsumowania tekstu, tłumaczenia językowe itp. MPT-30B-Instruct to wariant MPT-30B dostrajany specjalnie do zadań polegających na wykonywaniu instrukcji. Do dostrajania wykorzystano następujące zestawy danych:

  1. FLAN
  2. P3
  3. Alpaca
  4. Dolly-15k

Zestaw danych Dolly został dodatkowo wzbogacony o zestaw danych Anthropic’s Helpful and Harmless do dostrajania instrukcji. Ponadto wykorzystano różnorodne zestawy danych do wzbogacania danych, które są następujące:

  1. CompetitionMath
  2. GradeSchoolMath
  3. DialogSum
  4. DuoRC
  5. QASPER
  6. QuALITY
  7. SummScreen
  8. Spider

MPT-30B-Chat

MPT-30B-Chat to wariant MPT-30B dostrajany do generowania dialogów. Jest to artefakt badawczy wydany na licencji CC-By-NC-SA-4.0, zezwalającej tylko na użytkowanie niekomercyjne. Model został dostrajany przy użyciu różnych zestawów danych językowych, w tym:

  1. Airoboros/GPT4-1.2
  2. Baize
  3. Camel
  4. GPTeacher
  5. Guanaco
  6. LongCoversations
  7. ShareGPT
  8. WizardLM

Modele LLM zajmują dużą część kilkumiliardowego rynku sztucznej inteligencji generatywnej, który doświadczył ogromnego wzrostu w krótkim czasie po tym, jak ChatGPT zrewolucjonizował ten obszar w zeszłym roku. Rodzina MPT jest częścią tej rewolucji. W najbliższej przyszłości możemy spodziewać się komercyjnie dostępnych, otwartoźródłowych modeli, które są o wiele potężniejsze i wydajniejsze niż rodzina MPT.

Aby uzyskać najnowsze wiadomości z dziedziny AI, odwiedź unite.ai.

Haziqa jest naukowcem danych z bogatym doświadczeniem w tworzeniu treści technicznych dla firm AI i SaaS.