Modele i platformy AI
Mistral AI: Ustawiając nowe standardy poza modelem Llama2 w przestrzeni open-source
Modele językowe (LLM) ostatnio zajęły centralne miejsce, dzięki wyróżniającym się wykonawcom, takim jak ChatGPT. Kiedy Meta wprowadziła swoje modele Llama, wywołało to odnowione zainteresowanie modelem LLM w przestrzeni open-source. Celem było stworzenie przystępnych cenowo, otwartych modeli LLM, które są tak dobre, jak najlepsze modele, takie jak GPT-4, ale bez wysokiej ceny lub złożoności.
Ta kombinacja przystępności i wydajności nie tylko otworzyła nowe możliwości dla badaczy i deweloperów, ale także ustanowiła nową erę postępów technologicznych w przetwarzaniu języka naturalnego.
Ostatnio startupy związane z generatywnym AI były na fali z finansowaniem. Razem podniosły 20 milionów dolarów, aby ukształtować otwarte AI. Anthropic również podniósł imponujące 450 milionów dolarów, a Cohere, w partnerstwie z Google Cloud, zabezpieczył 270 milionów dolarów w czerwcu tego roku.
Wprowadzenie do Mistral 7B: Rozmiar i dostępność
Mistral AI, z siedzibą w Paryżu i założonym przez absolwentów Google DeepMind i Meta, ogłosił swój pierwszy duży model językowy: Mistral 7B. Ten model może być łatwo pobrany przez każdego z GitHub i nawet za pomocą 13,4-gigabajtowego torrentu.
Ten startup zdołał zabezpieczyć rekordowe finansowanie na etapie seed, zanim jeszcze miał produkt. Pierwszy model Mistral AI z 7 miliardami parametrów przewyższa wydajność Llama 2 13B we wszystkich testach i pokonuje Llama 1 34B w wielu metrykach.
W porównaniu z innymi modelami, takimi jak Llama 2, Mistral 7B oferuje podobne lub lepsze możliwości, ale z mniejszym obciążeniem obliczeniowym. Podczas gdy modele podstawowe, takie jak GPT-4, mogą osiągnąć więcej, są one droższe i mniej przyjazne dla użytkownika, ponieważ są głównie dostępne przez API.
Jeśli chodzi o zadania związane z kodowaniem, Mistral 7B daje CodeLlama 7B szansę na równy start. Ponadto jest wystarczająco kompaktowy, aby działać na standardowych maszynach.
Dodatkowo, Mistral 7B Instruct, dostosowany specjalnie do instruktażowych zbiorów danych na Hugging Face, wykazał się wielką wydajnością. Przewyższa inne modele 7B w teście MT-Bench i stoi równo z modelami 13B.

Hugging Face Mistral 7B Przykład
Testowanie wydajności
W szczegółowej analizie wydajności Mistral 7B został porównany z modelem Llama 2. Wyniki były jasne: Mistral 7B znacznie przewyższył Llama 2 13B we wszystkich testach. W rzeczywistości, jego wydajność była porównywalna z Llama 34B, szczególnie wyróżniając się w testach kodu i rozumowania.
Testy zostały podzielone na kilka kategorii, takich jak rozumowanie zdroworozsądkowe, wiedza o świecie, zrozumienie czytania, matematyka i kod, między innymi. Szczególnie godne uwagi było to, że Mistral 7B wykazał się wydajnością podobną do modelu Llama 2 trzykrotnie większego, co oznacza potencjalne oszczędności w pamięci i zwiększenie wydajności. Jednak w testach wiedzy, Mistral 7B był zbliżony do Llama 2 13B, co najprawdopodobniej jest spowodowane ograniczeniami parametrów, wpływającymi na kompresję wiedzy.
Czym Mistral 7B jest lepszy od innych modeli językowych?
Uproszczenie mechanizmów uwagi
Pomysł mechanizmów uwagi jest dość prosty. Wyobraź sobie czytanie książki i podkreślanie ważnych zdań; jest to podobne do tego, jak mechanizmy uwagi “podkreślają” lub nadają wagę określonym punktom danych w sekwencji.
W kontekście modeli językowych, te mechanizmy umożliwiają modelowi skupienie się na najbardziej istotnych częściach danych wejściowych, zapewniając, że dane wyjściowe są spójne i dokładne w kontekście.
W standardowych transformatatorach, wyniki uwagi są obliczane za pomocą wzoru:
Wzór dla tych wyników obejmuje kluczowy krok – mnożenie macierzy Q i K. Wyzwanie polega na tym, że wraz ze wzrostem długości sekwencji, obie macierze rosną odpowiednio, prowadząc do procesu obliczeniowo intensywnego. To jest jeden z głównych powodów, dla których standardowe transformatory mogą być wolne, szczególnie przy radzeniu sobie z długimi sekwencjami.

Uwaga wielu zapytań (MQA) przyspiesza proces, używając jednego zestawu “klucz-wartość” głów, ale czasem poświęca jakość. Teraz możesz się zastanawiać, dlaczego nie połączyć szybkości MQA z jakością uwagi wielogłowej? To jest miejsce, w którym pojawia się uwaga grupowa (GQA).
Uwaga grupowa (GQA)
GQA jest rozwiązaniem kompromisowym. Zamiast używać tylko jednej lub wielu “klucz-wartość” głów, grupuje je. W ten sposób GQA osiąga wydajność zbliżoną do szczegółowej uwagi wielogłowej, ale z szybkością MQA. Dla modeli, takich jak Mistral, oznacza to wydajność efektywną bez kompromisów w jakości.
Uwaga okienkowa (SWA)
Okienko przesuwne jest inną metodą przetwarzania sekwencji uwagi. Metoda ta używa okienka o stałym rozmiarze wokół każdego tokenu w sekwencji. Z wieloma warstwami, które stosują tę uwagę okienkową, warstwy najwyższe ostatecznie zyskują szerszą perspektywę, obejmując informacje z całych danych wejściowych. Mechanizm ten jest analogiczny do pól receptywnych widocznych w sieciach neuronowych typu CNN.
Z drugiej strony, “rozszerzone okienko przesuwne” modelu Longformer, które jest pojęciowo podobne do metody okienka przesuwnego, oblicza tylko kilka przekątnych macierzy . To zmiana powoduje, że użycie pamięci rośnie liniowo, a nie kwadratowo, co czyni ją bardziej efektywną metodą dla dłuższych sekwencji.
Przezroczystość Mistral AI a obawy bezpieczeństwa w decentralizacji
W swoim ogłoszeniu, Mistral AI podkreślił również przejrzystość, stwierdzając: “Bez sztuczek, bez danych własnościowych.” Jednakże, jedyny dostępny model w tej chwili, ‘Mistral-7B-v0.1’, jest modelem podstawowym, który może generować odpowiedzi na każde zapytanie bez moderacji, co podnosi potencjalne obawy bezpieczeństwa. Podczas gdy modele, takie jak GPT i Llama, mają mechanizmy, które pozwalają im rozpoznać, kiedy odpowiedzieć, w pełni zdecentralizowana natura Mistrala może być wykorzystana przez złe podmioty.
Jednak decentralizacja modeli językowych ma swoje zalety. Podczas gdy niektórzy mogą ją wykorzystywać, ludzie mogą wykorzystać jej potencjał dla dobra społecznego i uczynić inteligencję dostępną dla wszystkich.
Elastyczność wdrożeniowa
Jednym z najważniejszych punktów jest to, że Mistral 7B jest dostępny na licencji Apache 2.0. Oznacza to, że nie ma prawdziwych barier dla jego użycia – niezależnie od tego, czy używasz go do celów osobistych, dużego przedsiębiorstwa, czy nawet instytucji rządowej. Wystarczy, że masz odpowiedni system do jego uruchomienia lub możesz zainwestować w zasoby chmurowe.
Chociaż istnieją inne licencje, takie jak prostsza licencja MIT i kooperatywna licencja CC BY-SA-4.0, która wymaga podania źródła i podobnej licencji dla pochodnych, licencja Apache 2.0 zapewnia solidną podstawę dla dużych przedsięwzięć.
Końcowe myśli
Wzrost modeli językowych open-source, takich jak Mistral 7B, oznacza punkt zwrotny w branży AI, czyniąc wysokiej jakości modele językowe dostępnymi dla szerszego audytorium. Innowacyjne podejścia Mistral AI, takie jak uwaga grupowa i okienkowa, obiecują efektywną wydajność bez kompromisów w jakości.
Chociaż zdecentralizowana natura Mistrala stwarza pewne wyzwania, jego elastyczność i otwarta licencja podkreślają potencjał dla demokratyzacji AI. W miarę ewolucji krajobrazu, uwaga będzie skupiona na równoważeniu mocy tych modeli z uwzględnieniem etyki i mechanizmów bezpieczeństwa.
Co dalej dla Mistrala? Model 7B był tylko początkiem. Zespół planuje uruchomić jeszcze większe modele wkrótce. Jeśli te nowe modele będą miały podobną wydajność do 7B, Mistral może szybko awansować jako jeden z czołowych graczy w branży, wszystko w ciągu pierwszego roku.

















