Modele i platformy AI

Wszystko, co musisz wiedzieć o Llama 3 | Najpotężniejszy model open-source | Od pojęć do zastosowań

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Meta niedawno wydała Llama 3, kolejną generację swojego najnowocześniejszego modelu językowego (LLM) open-source. Budując na fundamentach ustanowionych przez swojego poprzednika, Llama 3 ma na celu poprawę możliwości, które umieściły Llama 2 jako znaczącego konkurenta open-source dla ChatGPT, jak opisano w szczegółowej recenzji w artykule Llama 2: Głębokie wprowadzenie do open-source wyzwania dla ChatGPT.

W tym artykule omówimy podstawowe pojęcia za Llama 3, zbadamy jego innowacyjną architekturę i proces szkolenia, oraz zapewnimy praktyczne wskazówki, jak uzyskać dostęp, używać i wdrażać ten przełomowy model w sposób odpowiedzialny. Niezależnie od tego, czy jesteś naukowcem, deweloperem, czy entuzjastą AI, ten post wyposaży Cię w wiedzę i zasoby niezbędne do wykorzystania potencjału Llama 3 w Twoich projektach i aplikacjach.

Ewolucja Llama: Od Llama 2 do Llama 3

CEO Meta, Mark Zuckerberg, ogłosił debiut Llama 3, najnowszego modelu AI opracowanego przez Meta AI. Ten najnowocześniejszy model, teraz open-sourced, ma na celu poprawę różnych produktów Meta, w tym Messenger i Instagram. Zuckerberg podkreślił, że Llama 3 umieszcza Meta AI jako najbardziej zaawansowanego dostępnego asystenta AI.

Przed omówieniem szczegółów Llama 3, cofnijmy się do jego poprzednika, Llama 2. Wprowadzony w 2022 roku, Llama 2 był znaczącym kamieniem milowym w krajobrazie modeli językowych open-source, oferując potężny i wydajny model, który mógł być uruchomiony na sprzęcie konsumenckim.

Jednak Llama 2 miał swoje ograniczenia. Użytkownicy zgłaszali problemy z fałszywymi odmowami (model odmawia odpowiedzi na niewinne polecenia), ograniczoną pomocą i możliwościami poprawy w obszarach takich jak rozumowanie i generowanie kodu.

Wkraczamy w Llama 3: odpowiedź Meta na te wyzwania i opinie społeczności. Z Llama 3, Meta ma na celu zbudowanie najlepszych modeli open-source, porównywalnych z najlepszymi modelami własnościowymi dostępnymi dzisiaj, przy jednoczesnym priorytetowaniu odpowiedzialnych praktyk rozwoju i wdrożenia.

Llama 3: Architektura i szkolenie

Jednym z kluczowych innowacji w Llama 3 jest jego tokenizator, który posiada znacznie rozszerzony słownik 128 256 tokenów (w porównaniu z 32 000 w Llama 2). Ten większy słownik pozwala na bardziej wydajne kodowanie tekstu, zarówno dla wejścia, jak i wyjścia, potencjalnie prowadząc do silniejszego wielojęzyczności i ogólnych poprawień wydajności.

Llama 3 również włącza Grouped-Query Attention (GQA), wydajną technikę reprezentacji, która poprawia skalowalność i pomaga modelowi lepiej radzić sobie z dłuższymi kontekstami. Wersja 8B Llama 3 wykorzystuje GQA, podczas gdy obie wersje 8B i 70B mogą przetwarzać sekwencje do 8 192 tokenów.

Dane szkoleniowe i skalowanie

Dane szkoleniowe użyte dla Llama 3 są kluczowym czynnikiem w jego poprawionej wydajności. Meta opracowała ogromny zestaw danych o ponad 15 trylionach tokenów z publicznie dostępnych źródeł internetowych, siedem razy większy niż zestaw danych użyty dla Llama 2. Ten zestaw danych obejmuje również znaczną część (ponad 5%) wysokiej jakości danych nieangielskich, pokrywających ponad 30 języków, w przygotowaniu do przyszłych aplikacji wielojęzycznych.

Aby zapewnić jakość danych, Meta zastosowała zaawansowane techniki filtrowania, w tym filtry heurystyczne, filtry NSFW, deduplikację semantyczną i klasyfikatory tekstu przeszkolone na Llama 2, aby przewidzieć jakość danych. Zespół przeprowadził również obszerne eksperymenty, aby określić optymalną mieszankę źródeł danych do wstępnego szkolenia, zapewniając, że Llama 3 działa dobrze w szerokim zakresie przypadków użycia, w tym trivii, STEM, kodowaniu i wiedzy historycznej.

Skalowanie wstępnego szkolenia było kolejnym krytycznym aspektem rozwoju Llama 3. Meta opracowała prawa skalowania, które umożliwiły im przewidzieć wydajność ich największych modeli w kluczowych zadaniach, takich jak generowanie kodu, przed ich rzeczywistym szkoleniem. To poinformowało decyzje dotyczące mieszanki danych i alokacji obliczeniowej, ostatecznie prowadząc do bardziej wydajnego i skutecznego szkolenia.

Największe modele Llama 3 były szkolone na dwóch niestandardowych klastrach 24 000 GPU, wykorzystując kombinację paralelizacji danych, paralelizacji modelu i techniki pipeline. Zaawansowany stos szkoleniowy Meta zautomatyzował wykrywanie błędów, obsługę i konserwację, maksymalizując czas pracy GPU i zwiększając wydajność szkolenia o około trzykrotnie w porównaniu z Llama 2.

Dokształcanie instrukcji i wydajność

Aby odblokować pełny potencjał Llama 3 dla aplikacji czatu i dialogu, Meta zainnowowała swój podejście do dokształcania instrukcji. Ich metoda łączy nadzorowane dokształcanie (SFT), próbkowanie odrzucania, optymalizację polityki proximalnej (PPO) i bezpośrednią optymalizację preferencji (DPO).

Jakość poleceń użytych w SFT i rankingów preferencji użytych w PPO i DPO odegrała kluczową rolę w wydajności wyrównanych modeli. Zespół Meta starannie opracował te dane i przeprowadził wiele rund zapewnienia jakości adnotacji dostarczonych przez ludzkich adnotatorów.

Szkolenie na rankingach preferencji za pomocą PPO i DPO znacznie poprawiło wydajność Llama 3 w zadaniach rozumowania i kodowania. Meta stwierdziła, że nawet gdy model ma trudności z odpowiedzią na pytanie rozumowania, może nadal wyprodukować poprawną ślad rozumowania. Szkolenie na rankingach preferencji umożliwiło modelowi nauczenie się, jak wybrać poprawną odpowiedź z tych śladów.

Wyniki Arena

Wyniki mówią same za siebie: Llama 3 przewyższa wiele dostępnych modeli czatu open-source w powszechnych branżowych benchmarkach, ustanawiając nowy stan sztuki wydajności dla modeli językowych w skali parametrów 8B i 70B.

Odpowiedzialny rozwój i zagadnienia bezpieczeństwa

Podczas dążenia do najnowocześniejszej wydajności, Meta również priorytetowo traktowała odpowiedzialne praktyki rozwoju i wdrożenia dla Llama 3. Firma przyjęła podejście systemowe, wyobrażając sobie modele Llama 3 jako część szerszego ekosystemu, który umieszcza deweloperów w centrum, pozwalając im na projektowanie i dostosowywanie modeli do ich konkretnych przypadków użycia i wymagań bezpieczeństwa.

Meta przeprowadziła obszerne ćwiczenia czerwonego zespołu, przeprowadziła oceny przeciwnika i wdrożyła techniki łagodzenia bezpieczeństwa, aby obniżyć pozostałe ryzyka w swoich modelach dostosowanych do instrukcji. Jednak firma uznaje, że pozostałe ryzyka prawdopodobnie pozostaną i zaleca, aby deweloperzy oceniali te ryzyka w kontekście swoich konkretnych przypadków użycia.

Aby wspierać odpowiedzialne wdrożenie, Meta zaktualizowała swoją Przewodnik po odpowiedzialnym użyciu, dostarczając kompleksowy zasób dla deweloperów, aby wdrożyć najlepsze praktyki bezpieczeństwa modelu i systemu dla ich aplikacji. Przewodnik obejmuje tematy takie jak moderowanie treści, ocena ryzyka i użycie narzędzi bezpieczeństwa, takich jak Llama Guard 2 i Code Shield.

Llama Guard 2, zbudowany na podstawie taksonomii MLCommons, jest zaprojektowany do klasyfikacji danych wejściowych LLM (poleceń) i odpowiedzi, wykrywania treści, które mogą być uważane za niebezpieczne lub szkodliwe. CyberSecEval 2 rozszerza swojego poprzednika, dodając środki, aby zapobiec nadużyciu interpretera kodu modelu, zdolności cyberbezpieczeństwa i podatności na ataki wstrzyknięcia poleceń.

Code Shield, nowy dodatek do Llama 3, dodaje filtrowanie czasu inferencji niebezpiecznego kodu wytworzonego przez LLM, łagodząc ryzyka związane z sugestiami niebezpiecznego kodu, nadużyciem interpretera kodu i bezpiecznym wykonywaniem poleceń.

Dostęp i użycie Llama 3

Po wprowadzeniu Llama 3 przez Meta AI, kilka narzędzi open-source zostało udostępnionych do lokalnego wdrożenia na różnych systemach operacyjnych, w tym Mac, Windows i Linux. Ta sekcja szczegółowo opisuje trzy godne uwagi narzędzia: Ollama, Open WebUI i LM Studio, każde oferujące unikalne funkcje do wykorzystania możliwości Llama 3 na urządzeniach osobistych.

Ollama: Dostępny dla Mac, Linux i Windows, Ollama upraszcza działanie Llama 3 i innych dużych modeli językowych na komputerach osobistych, nawet tych z mniej wydajnym sprzętem. Zawiera menedżera pakietów do łatwego zarządzania modelami i obsługuje polecenia na platformach do pobierania i uruchamiania modeli.

Open WebUI z Docker: To narzędzie zapewnia przyjazny, Docker-oparty interfejs zgodny z Mac, Linux i Windows. Zintegrowany jest on bezproblemowo z modelami z rejestru Ollama, pozwalając użytkownikom na wdrożenie i interakcję z modelami takimi jak Llama 3 w lokalnym interfejsie sieciowym.

LM Studio: Skierowany do użytkowników na Mac, Linux i Windows, LM Studio obsługuje szereg modeli i jest zbudowany na projekcie llama.cpp. Zapewnia interfejs czatu i umożliwia bezpośrednią interakcję z różnymi modelami, w tym modelem Llama 3 8B Instruct.

Te narzędzia zapewniają, że użytkownicy mogą wydajnie wykorzystywać Llama 3 na swoich urządzeniach osobistych, dostosowując się do różnych umiejętności technicznych i wymagań. Każda platforma oferuje procesy krok po kroku ustawiania i interakcji z modelem, sprawiając, że zaawansowane AI stają się bardziej dostępne dla deweloperów i entuzjastów.

Wdrożenie Llama 3 w skali

Ponadto Meta zapewniła dostęp do wag modelu, współpracując z różnymi dostawcami chmury, usługami API modelu i platformami sprzętowymi, aby umożliwić bezproblemowe wdrożenie Llama 3 w skali.

Jednym z kluczowych zalet Llama 3 jest jego poprawiona wydajność tokenów, dzięki nowemu tokenizatorowi. Benchmarki pokazują, że Llama 3 wymaga do 15% mniej tokenów w porównaniu z Llama 2, co skutkuje szybszym i bardziej efektywnym wnioskowaniem.

Integracja Grouped Query Attention (GQA) w wersji 8B Llama 3 przyczynia się do utrzymania wydajności wnioskowania na poziomie porównywalnym z wersją 7B Llama 2, pomimo zwiększenia liczby parametrów.

Aby uprościć proces wdrożenia, Meta udostępniła repozytorium Llama Recipes, które zawiera kod open-source i przykłady do szkolenia, wdrożenia, oceny modelu i więcej. To repozytorium służy jako cenny zasób dla deweloperów, którzy chcą wykorzystać możliwości Llama 3 w swoich aplikacjach.

Dla tych, którzy są zainteresowani zbadaniem wydajności Llama 3, Meta zintegrowała swoje najnowsze modele z Meta AI, wiodącym asystentem AI zbudowanym z technologii Llama 3. Użytkownicy mogą wchodzić w interakcje z Meta AI za pośrednictwem różnych aplikacji Meta, takich jak Facebook (META ), Instagram, WhatsApp, Messenger i sieć, aby wykonać zadania, nauczyć się, stworzyć i połączyć się z tym, co jest dla nich ważne.

Co dalej dla Llama 3?

Podczas gdy modele 8B i 70B oznaczają początek wydania Llama 3, Meta ma ambitne plany na przyszłość tego przełomowego modelu językowego.

W nadchodzących miesiącach możemy spodziewać się nowych możliwości, w tym multimodalności (zdolności do przetwarzania i generowania różnych modalności danych, takich jak obrazy i filmy), wielojęzyczności (obsługi wielu języków) i znacznie dłuższych kontekstów okien dla poprawionej wydajności w zadaniach wymagających obszernych kontekstów.

Ponadto Meta planuje wydać większe rozmiary modeli, w tym modele z ponad 400 miliardami parametrów, które są obecnie w trakcie szkolenia i pokazują obiecujące trendy pod względem wydajności i możliwości.

Aby dalej wspierać rozwój tej dziedziny, Meta opublikuje szczegółowy artykuł badawczy na temat Llama 3, dzieląc się swoimi odkryciami i spostrzeżeniami z szerszą społecznością AI.

Jako podgląd tego, co ma nadejść, Meta podzieliła się wczesnymi migawkami wydajności swojego największego modelu LLM w różnych benchmarkach. Chociaż te wyniki opierają się na wczesnym punkcie kontrolnym i mogą ulec zmianie, zapewniają one ekscytujący wgląd w przyszły potencjał Llama 3.

Podsumowanie

Llama 3 reprezentuje znaczący kamień milowy w ewolucji modeli językowych open-source, przesuwając granice wydajności, możliwości i praktyk rozwoju odpowiedzialnego. Z jego innowacyjną architekturą, ogromnym zestawem danych szkoleniowych i najnowocześniejszymi technikami dokształcania, Llama 3 ustanawia nowy stan sztuki benchmarków dla modeli językowych w skali parametrów 8B i 70B.

Jednak Llama 3 to więcej niż tylko potężny model językowy; jest to świadectwem zaangażowania Meta w tworzenie otwartego i odpowiedzialnego ekosystemu AI. Poprzez dostarczanie kompleksowych zasobów, narzędzi bezpieczeństwa i najlepszych praktyk, Meta umożliwia deweloperom wykorzystanie pełnego potencjału Llama 3, zapewniając jednocześnie odpowiedzialne wdrożenie dostosowane do ich konkretnych przypadków użycia i odbiorców.

Podczas gdy Llama 3 kontynuuje swoją drogę, z nowymi możliwościami, rozmiarami modeli i odkryciami badawczymi na horyzoncie, społeczność AI niecierpliwie oczekuje na innowacyjne aplikacje i przełomy, które z pewnością wynikną z tego przełomowego modelu językowego.

Niezależnie od tego, czy jesteś naukowcem, który poszerza granice przetwarzania języka naturalnego, deweloperem budującym następną generację inteligentnych aplikacji, czy entuzjastą AI ciekawym najnowszych postępów, Llama 3 obiecuje być potężnym narzędziem w Twoim arsenale, otwierając nowe drzwi i odblokowując świat możliwości.

Przez ostatnie pięć lat zanurzałem się w fascynującym świecie Machine Learning i Deep Learning. Moja pasja i ekspertyza doprowadziły mnie do udziału w ponad 50 różnorodnych projektach inżynierii oprogramowania, ze szczególnym uwzględnieniem AI/ML. Moja nieustanna ciekawość również skierowała mnie w stronę Natural Language Processing, dziedziny, którą chcę dalej eksplorować.