Modele i platformy AI

Najnowszy model Mistral AI Mixture of Experts (MoE) 8x7B

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Mistral AI

to firma z siedzibą w Paryżu, specjalizująca się w modelach open-source, która wyzwała normy, wydając swój najnowszy duży model językowy (LLM), MoE 8x7B, za pomocą prostego łącza torrent. To podejście kontrastuje z tradycyjnym podejściem Google przy wydaniu Gemini, wywołując rozmowy i entuzjazm w społeczności AI.

Podejście Mistral AI do wydań zawsze było niekonwencjonalne. Często rezygnując z tradycyjnych towarzyszących artykułów, blogów lub komunikatów prasowych, ich strategia okazała się wyjątkowo skuteczna w przyciąganiu uwagi społeczności AI.

Niedawno firma osiągnęła imponującą wartość 2 miliardów dolarów po rundzie finansowania prowadzonej przez Andreessen Horowitz. Ta runda finansowania była historyczna, ustanawiając rekord z rundą seed o wartości 118 milionów dolarów, największą w historii Europy. Poza sukcesami finansowymi, Mistral AI aktywnie uczestniczy w dyskusjach na temat unijnego prawa AI, opowiadając się za zmniejszeniem regulacji w przypadku modeli open-source AI.

Dlaczego MoE 8x7B przyciąga uwagę

Opisany jako “zmniejszony GPT-4”, Mixtral 8x7B wykorzystuje ramę Mixture of Experts (MoE) z ośmioma ekspertami. Każdy ekspert ma 111 miliardów parametrów, połączonych z 55 miliardami parametrów uwagi, co daje łącznie 166 miliardów parametrów na model. To podejście jest znaczące, ponieważ pozwala na zaangażowanie tylko dwóch ekspertów w inferencję każdego tokenu, co wskazuje na przesunięcie w kierunku bardziej wydajnego i ukierunkowanego przetwarzania AI.

Jednym z głównych wyróżników Mixtrala jest jego zdolność do zarządzania obszernym kontekstem 32 000 tokenów, zapewniając szeroki zakres do obsługi złożonych zadań. Możliwości wielojęzyczne modelu obejmują solidne wsparcie dla języków angielskiego, francuskiego, włoskiego, niemieckiego i hiszpańskiego, służąc globalnej społeczności deweloperów.

Wstępne szkolenie Mixtrala obejmuje dane pochodzące z otwartego Internetu, z jednoczesnym szkoleniem zarówno ekspertów, jak i routerów. Ten sposób gwarantuje, że model nie tylko jest ogromny w swojej przestrzeni parametrów, ale także starannie dostrojony do niuansów ogromnych danych, którym został poddany.

Mixtral 8x7B osiąga imponujący wynik

Mixtral 8x7B osiąga imponujący wynik

Mixtral 8x7B przewyższa LLaMA 2 70B i rywalizuje z GPT-3.5, szczególnie w zadaniach MBPP z współczynnikiem powodzenia 60,7%, znacznie wyższym niż u jego odpowiedników. Nawet w rygorystycznym teście MT-Bench, przeznaczonym dla modeli instrukcyjnych, Mixtral 8x7B osiąga imponujący wynik, niemal dopasowując się do GPT-3.5

Zrozumienie ramy Mixture of Experts (MoE)

Model Mixture of Experts (MoE), który ostatnio zyskał na popularności dzięki swojemu wdrożeniu w najnowszych modelach językowych, takich jak Mistral AI’s MoE 8x7B, opiera się na podstawowych koncepcjach, które sięgają kilku lat wstecz. Prześledźmy pochodzenie tej idei poprzez przełomowe prace badawcze.

Koncepcja MoE

Mixture of Experts (MoE) reprezentuje zmianę paradygmatu w architekturze sieci neuronowych. W przeciwieństwie do tradycyjnych modeli, które wykorzystują jednorodną sieć do przetwarzania wszystkich typów danych, MoE przyjmuje bardziej wyspecjalizowane i modułowe podejście. Składa się z wielu “ekspertów”, każdy z nich zaprojektowany do obsługi konkretnych typów danych lub zadań, nadzorowanych przez “sieć bramkową”, która dynamicznie kieruje dane wejściowe do najbardziej odpowiedniego eksperta.

Warstwa Mixture of Experts (MoE) osadzona w modelu językowym

Warstwa Mixture of Experts (MoE) osadzona w modelu językowym (Źródło)

 

Powyższy obraz przedstawia ogólny widok warstwy MoE osadzonej w modelu językowym. W swojej istocie warstwa MoE składa się z wielu podsieci feed-forward, określanych jako “eksperci”, z których każdy ma potencjał specjalizacji w przetwarzaniu różnych aspektów danych. Sieć bramkowa, wyróżniona na diagramie, określa, który zespół ekspertów jest zaangażowany dla danego wejścia. To warunkowe aktywowanie pozwala sieci znacznie zwiększyć swoją pojemność bez odpowiedniego wzrostu zapotrzebowania obliczeniowego.

Funkcjonowanie warstwy MoE

W praktyce sieć bramkowa ocenia wejście (oznaczone jako G(x) na diagramie) i wybiera zbiór ekspertów do jego przetworzenia. Ten wybór jest modyfikowany przez dane wyjściowe sieci bramkowej, efektywnie określając “głos” lub wkład każdego eksperta w ostateczne wyjście. Na przykład, jak pokazano na diagramie, tylko dwóch ekspertów może być wybranych do obliczania wyjścia dla każdego konkretnego tokenu wejściowego, co czyni proces wydajnym przez koncentrowanie zasobów obliczeniowych tam, gdzie są one najbardziej potrzebne.

 

Kodujący Transformer z warstwami MoE (Źródło)

Drugi rysunek powyżej kontrastuje tradycyjny kodujący Transformer z tym, który został uzupełniony o warstwę MoE. Architektura Transformer, szeroko znana ze swojej skuteczności w zadaniach związanych z językiem, tradycyjnie składa się z warstw uwagi i feed-forward ułożonych sekwencyjnie. Wprowadzenie warstw MoE zastępuje niektóre z tych warstw feed-forward, umożliwiając modelowi bardziej efektywne skalowanie pod względem pojemności.

W uzupełnionym modelu warstwy MoE są podzielone na wiele urządzeń, prezentując podejście równoległe do modelu. Jest to kluczowe podczas skalowania do bardzo dużych modeli, ponieważ pozwala na rozłożenie obciążenia obliczeniowego i wymagań pamięciowych na klastry urządzeń, takich jak GPU lub TPU. To podzielone przetwarzanie jest niezbędne do efektywnego szkolenia i wdrożenia modeli o setkach miliardów parametrów na dużych klastrach obliczeniowych.

Cienka metoda MoE z dostosowaniem do instrukcji w LLM

Artykuł zatytułowany “Cienka Mixture-of-Experts (MoE) dla skalowalnego modelowania językowego” omawia innowacyjne podejście do poprawy Dużych Modeli Językowych (LLM) poprzez integrację architektury Mixture of Experts z technikami dostosowania do instrukcji.

Wskazuje on na powszechne wyzwanie, w którym modele MoE są gorsze w porównaniu z gęstymi modelami o równym potencjale obliczeniowym, gdy są dostosowywane do konkretnych zadań z powodu rozbieżności między ogólnym wstępnym szkoleniem a dostosowaniem do konkretnych zadań.

Dostosowanie do instrukcji jest metodą szkolenia, w której modele są udoskonalane, aby lepiej postępować zgodnie z naturalnymi instrukcjami językowymi, efektywnie poprawiając ich wydajność w zadaniach. Artykuł sugeruje, że modele MoE wykazują znaczną poprawę, gdy łączy się je z dostosowaniem do instrukcji, bardziej niż ich gęste odpowiedniki. Ta technika dopasowuje pre-trenowane reprezentacje modelu do postępowania zgodnie z instrukcjami w bardziej efektywny sposób, prowadząc do znaczących wzrostów wydajności.

Badacze przeprowadzili studia w trzech eksperymentalnych ustawieniach, ujawniając, że modele MoE początkowo są gorsze w bezpośrednim dostosowaniu do zadań. Jednak gdy zastosowano dostosowanie do instrukcji, modele MoE wyróżniają się, szczególnie gdy są one dodatkowo uzupełnione o dostosowanie do zadań. To sugeruje, że dostosowanie do instrukcji jest kluczowym krokiem dla modeli MoE, aby przewyższyć gęste modele w zadaniach podrzędnych.

Wpływ dostosowania do instrukcji na MOE

Wpływ dostosowania do instrukcji na MOE

Artykuł również wprowadza FLAN-MOE32B, model, który demonstruje pomyślne zastosowanie tych koncepcji. Godne uwagi jest to, że przewyższa FLAN-PALM62B, gęsty model, w zadaniach benchmarkowych, używając tylko jednej trzeciej zasobów obliczeniowych. To pokazuje potencjał cienkich modeli MoE połączonych z dostosowaniem do instrukcji, aby ustalić nowe standardy dla wydajności i efektywności LLM.

Wdrożenie Mixture of Experts w scenariuszach rzeczywistych

Wielofunkcyjność modeli MoE sprawia, że są one idealne do szerokiego zakresu zastosowań:

  • Przetwarzanie języka naturalnego (NLP): Modele MoE mogą lepiej radzić sobie z niuansami i złożonościami języka ludzkiego, co czyni je idealnymi do zaawansowanych zadań NLP.
  • Przetwarzanie obrazów i wideo: W zadaniach wymagających wysokiej rozdzielczości, MoE może zarządzać różnymi aspektami obrazów lub klatek wideo, poprawiając zarówno jakość, jak i szybkość przetwarzania.
  • Dostosowane rozwiązania AI: Firmy i badacze mogą dostosowywać modele MoE do konkretnych zadań, prowadząc do bardziej ukierunkowanych i efektywnych rozwiązań AI.

Wyzwania i rozważania

Chociaż modele MoE oferują wiele korzyści, przedstawiają również unikalne wyzwania:

  • Złożoność w szkoleniu i dostosowaniu: Rozproszona natura modeli MoE może skomplikować proces szkolenia, wymagając starannego balansowania i dostosowania ekspertów i sieci bramkowej.
  • Zarządzanie zasobami: Efektywne zarządzanie zasobami obliczeniowymi na wielu ekspertach jest kluczowe dla maksymalizacji korzyści modeli MoE.

Włączanie warstw MoE do sieci neuronowych, szczególnie w dziedzinie modeli językowych, oferuje ścieżkę do skalowania modeli do rozmiarów, które wcześniej były nieosiągalne z powodu ograniczeń obliczeniowych. Warunkowe obliczenia umożliwione przez warstwy MoE pozwalają na bardziej efektywne rozłożenie zasobów obliczeniowych, umożliwiając szkolenie większych, bardziej zdolnych modeli. W miarę jak będziemy wymagać coraz więcej od naszych systemów AI, architektury takie jak MoE wyposażony Transformer prawdopodobnie staną się standardem dla obsługi złożonych, dużych zadań w różnych dziedzinach.

Przez ostatnie pięć lat zanurzałem się w fascynującym świecie Machine Learning i Deep Learning. Moja pasja i ekspertyza doprowadziły mnie do udziału w ponad 50 różnorodnych projektach inżynierii oprogramowania, ze szczególnym uwzględnieniem AI/ML. Moja nieustanna ciekawość również skierowała mnie w stronę Natural Language Processing, dziedziny, którą chcę dalej eksplorować.