Modele i platformy AI
MPT-30B: MosaicML Przewyższa GPT-3 Z Nowym Modelem Językowym, aby Przekroczyć Granice NLP
MosaicML to firma zajmująca się sztuczną inteligencją generatywną, która dostarcza rozwiązania do wdrożenia i skalowania AI. Ich najnowszy duży model językowy (LLM) MPT-30B wywołuje duże zainteresowanie w społeczności AI.
Podróż MosaicML z modelem LLM rozpoczęła się od wydania MPT-7B (Mosaic Pretrained Transformer) w maju 2023 roku, który miał trzy warianty:
- MPT-7B-StoryWriter-65k+ (do generowania długich historii)
- MPT-7B-Instruct (do krótkich instrukcji)
- MPT-7B-Chat (do generowania dialogów)
Modele te odniosły ogromny sukces w społeczności ML dzięki ich otwartoźródłowemu charakterowi, możliwości komercyjnego wykorzystania oraz wyjątkowej zdolności do radzenia sobie z rozszerzonymi oknami kontekstowymi.
Najważniejsze jest to, że model ten był na równi z innymi porównywalnymi modelami (LLaMA-7B, StableLM 7B itp.) i w niektórych przypadkach ich przewyższał. Do czerwca seria MPT-7B została pobrana ponad 3 miliony razy. 22 czerwca MosaicML wydał MPT-30B, który podniósł poprzeczkę jeszcze wyżej dla modeli podstawowych o otwartym źródle.
MPT-30B: Potężny LLM, który Przewyższa GPT-3
MPT-30B to model LLM o otwartym źródle i komercyjnej licencji, oparty na dekoderze, który jest potężniejszy niż GPT-3-175B przy tylko 17% parametrów GPT-3, czyli 30B. Przewyższa GPT-3 w wielu zadaniach. Oto porównanie między MPT-30B a GPT-3.
MPT-30B opiera się na poprzednim modelu MPT-7B. Jest on komputacyjnie wydajny w treningu w porównaniu z modelami o podobnych rozmiarach. Na przykład, LLaMA-30B użył około 1,44 razy więcej budżetu FLOPs niż MPT-30B, podczas gdy Falcon-40B miał o 1,27 razy wyższy budżet FLOPs niż MPT-30B. Oto ilustracja poprawy MPT-30B w różnych zadaniach w porównaniu z jego poprzednikiem.
Niektóre specjalne funkcje MPT-30B to:
8k Token Context Window
Okno kontekstowe w LLM odnosi się do zakresu tokenów, które model może uwzględnić przed wygenerowaniem danych wyjściowych. MPT-30B miał okno kontekstowe o rozmiarze 8000 tokenów w czasie treningu. Został najpierw wytrenowany na 1T tokenach przy użyciu sekwencji 2k tokenów, a następnie dodatkowo na 50B tokenach sekwencji 8k tokenów (około 6000 słów).
ALiBi Support
Aby wyjaśnić tę funkcję, rozważmy następujące pytanie:
Jak MPT-30B może zrozumieć i dokonać predykcji dla dłuższych sekwencji niż te, na których został wytrenowany?
MPT-30B wykorzystuje technikę Attention with Linear Biases (ALiBi) do zrozumienia dłuższych sekwencji i rozszerzenia okna kontekstowego poza 8k tokenów podczas dostrajania lub inferencji.
Zamiast obliczania osadzeń pozycyjnych, w których przypisujemy wektor do każdego słowa w sekwencji, ALiBi oblicza wyniki uwagi między tokenami kluczowymi a zapytaniami. Gdy tokeny kluczowe i zapytania są blisko siebie, kara jest niska, ale wyższa w przeciwnym przypadku. W rezultacie podstawowa architektura transformatora może ekstrapolować do danych wejściowych o długiej formie.
Wydajna Inferencja i Trening za pomocą FlashAttention
Uwaga, czyli koncentrowanie się na istotnych częściach sekwencji wejściowej, jest krytycznym składnikiem transformatorów, ale może być powolna i wymagać dużej ilości pamięci, szczególnie przy przetwarzaniu długich sekwencji tekstu.
FlashAttention to podejście zaproponowane przez badaczy z Uniwersytetu Cornella, które rozwiązuje ten problem dla MPT-30B. Wykorzystując technikę tilingu, FlashAttention redukuje liczbę razy, gdy model musi odczytać lub zapisać dane w pamięci, przyspieszając przetwarzanie. Stąd model zatrudnia najnowocześniejszą technikę FlashAttention i bibliotekę optymalizacji FasterTransformer od NVIDIA (NVDA ) do wydajnego treningu i inferencji.
Łatwość Treningu i Wdrożenia
Deweloperzy mogą trenować MPT-30B od podstaw lub wykorzystywać punkty kontrolne MosaicML do szybszych wdrożeń. Ponadto może być dostrajany do przypadków użycia w określonym zestawie danych.
Rozmiar modelu został wybrany tak, aby umożliwić łatwe wdrożenie na jednej karcie graficznej, konkretnie 1xA100-80GB w precyzji 16-bitowej lub 1xA100-40GB w precyzji 8-bitowej. Oznacza to, że model został zaprojektowany tak, aby zmieścić się w ograniczeniach pamięciowych tych kart graficznych.
Możliwości Kodowania
MPT-30B oferuje również wyjątkowe możliwości kodowania. HumanEval to zestaw danych wydany przez OpenAI, który zawiera 164 ręcznie opracowane problemy programistyczne. W zestawie danych HumanEval model przewyższa specjalistyczne modele LLM, takie jak seria StarCoder.
Dostrajane Warianty: MPT-30B-Instruct i MPT-30B-Chat
MPT-30B-Instruct
Modele LLM są głównie używane do instrukcji, takich jak odpowiedzi na pytania, podsumowania tekstu, tłumaczenia językowe itp. MPT-30B-Instruct to wariant MPT-30B dostrajany specjalnie do zadań polegających na wykonywaniu instrukcji. Do dostrajania wykorzystano następujące zestawy danych:
- FLAN
- P3
- Alpaca
- Dolly-15k
Zestaw danych Dolly został dodatkowo wzbogacony o zestaw danych Anthropic’s Helpful and Harmless do dostrajania instrukcji. Ponadto wykorzystano różnorodne zestawy danych do wzbogacania danych, które są następujące:
- CompetitionMath
- GradeSchoolMath
- DialogSum
- DuoRC
- QASPER
- QuALITY
- SummScreen
- Spider
MPT-30B-Chat
MPT-30B-Chat to wariant MPT-30B dostrajany do generowania dialogów. Jest to artefakt badawczy wydany na licencji CC-By-NC-SA-4.0, zezwalającej tylko na użytkowanie niekomercyjne. Model został dostrajany przy użyciu różnych zestawów danych językowych, w tym:
- Airoboros/GPT4-1.2
- Baize
- Camel
- GPTeacher
- Guanaco
- LongCoversations
- ShareGPT
- WizardLM
Modele LLM zajmują dużą część kilkumiliardowego rynku sztucznej inteligencji generatywnej, który doświadczył ogromnego wzrostu w krótkim czasie po tym, jak ChatGPT zrewolucjonizował ten obszar w zeszłym roku. Rodzina MPT jest częścią tej rewolucji. W najbliższej przyszłości możemy spodziewać się komercyjnie dostępnych, otwartoźródłowych modeli, które są o wiele potężniejsze i wydajniejsze niż rodzina MPT.
Aby uzyskać najnowsze wiadomości z dziedziny AI, odwiedź unite.ai.















