Modele i platformy AI

W środku DBRX: Databricks uwolnił potężny, otwarty model językowy

mm
Dodaj Unite.AI do preferowanych źródeł w Google

W szybko rozwijającym się obszarze dużych modeli językowych (LLM) pojawił się nowy potężny model – DBRX, otwarty model stworzony przez Databricks. Ten LLM robi furorę ze swoimi wynikami na najwyższym poziomie w szerokim zakresie testów, rywalizując nawet z możliwościami gigantów branży, takich jak GPT-4 od OpenAI.

DBRX reprezentuje znaczący kamień milowy w demokratyzacji sztucznej inteligencji, zapewniając badaczom, deweloperom i przedsiębiorstwom otwarty dostęp do modelu językowego najwyższej klasy. Ale co dokładnie jest DBRX, i co sprawia, że jest tak wyjątkowy? W tym technicznym artykule zagłębimy się w innowacyjną architekturę, proces szkolenia i kluczowe możliwości, które sprawiły, że DBRX znalazł się na czele otwartych LLM.

Narodziny DBRX Stworzenie DBRX było podyktowane misją Databricks, aby uczynić inteligencję danych dostępną dla wszystkich przedsiębiorstw. Jako lider w dziedzinie platform analitycznych, Databricks rozpoznał ogromny potencjał LLM i postanowił stworzyć model, który mógłby dorównać lub nawet przewyższyć wyniki ofert własnych.

Po miesiącach intensywnych badań, rozwoju i inwestycji sięgającej milionów dolarów, zespół Databricks osiągnął przełom z DBRX. Impresjonujące wyniki modelu na szerokim zakresie testów, w tym zrozumienie języka, programowanie i matematykę, solidnie ustanowiły go jako nowy stan sztuki w otwartych LLM.

Innowacyjna Architektura

Potęga Mieszanki Ekspertów W sercu wyjątkowych wyników DBRX leży jego innowacyjna architektura mieszanki ekspertów (MoE). Ten przełomowy projekt reprezentuje odejście od tradycyjnych gęstych modeli, przyjmując rzadką architekturę, która zwiększa wydajność wstępnego szkolenia i szybkość inferencji.

W ramach MoE tylko wybrana grupa komponentów, zwanych “ekspertami”, jest aktywowana dla każdego wejścia. Ta specjalizacja pozwala modelowi na podejście do szerszego zakresu zadań z większą zręcznością, jednocześnie optymalizując zasoby obliczeniowe.

DBRX idzie o krok dalej ze swoją drobną architekturą MoE. W przeciwieństwie do niektórych innych modeli MoE, które używają mniejszej liczby większych ekspertów, DBRX zatrudnia 16 ekspertów, z czterema aktywnymi dla każdego wejścia. Ten projekt zapewnia oszałamiające 65 razy więcej możliwych kombinacji ekspertów, co bezpośrednio przyczynia się do wyższych wyników DBRX.

DBRX wyróżnia się kilkoma innowacyjnymi funkcjami:

  • Kodowanie Pozycji Obrotowych (RoPE): Poprawia zrozumienie pozycji tokenów, co jest kluczowe dla generowania kontekstowo dokładnego tekstu.
  • Jednostki Liniowe Zabezpieczone (GLU): Wprowadza mechanizm zabezpieczający, który poprawia zdolność modelu do nauki złożonych wzorców w sposób bardziej efektywny.
  • Grupowa Uwaga Zapytania (GQA): Poprawia wydajność modelu, optymalizując mechanizm uwagi.
  • Zaawansowana Tokenizacja: Wykorzystuje tokenizator GPT-4 do bardziej efektywnego przetwarzania wejść.

Architektura MoE jest szczególnie odpowiednia dla dużych modeli językowych, ponieważ pozwala na bardziej efektywne skalowanie i lepsze wykorzystanie zasobów obliczeniowych. Rozdzielając proces uczenia się na wiele wyspecjalizowanych podsieci, DBRX może skutecznie przydzielać dane i moc obliczeniową dla każdego zadania, zapewniając zarówno wysokiej jakości dane wyjściowe, jak i optymalną wydajność.

Ogromne Dane Szkoleniowe i Wydajna Optymalizacja Podczas gdy architektura DBRX jest bez wątpienia imponująca, jego prawdziwa siła leży w starannym procesie szkolenia i ogromnej ilości danych, którym został poddany. DBRX został wstępnie wyszkolony na niesamowitych 12 bilionach tokenów danych tekstowych i kodowych, starannie wyselekcjonowanych, aby zapewnić wysoką jakość i różnorodność.

Dane szkoleniowe zostały przetworzone przy użyciu narzędzi Databricks, w tym Apache Spark do przetwarzania danych, Unity Catalog do zarządzania danymi i nadzoru, oraz MLflow do śledzenia eksperymentów. Ten kompletny zestaw narzędzi pozwolił zespołowi Databricks skutecznie zarządzać, eksplorować i udoskonalać ogromny zestaw danych, tworząc podstawę dla wyjątkowych wyników DBRX.

Aby dalej poprawić możliwości modelu, Databricks zastosował dynamiczny program szkolenia, innowacyjnie zmieniając mieszankę danych podczas szkolenia. Ta strategia pozwoliła na skuteczne przetworzenie każdego tokenu przy użyciu aktywnych 36 miliardów parametrów, w efekcie tworząc bardziej wszechstronny i adaptacyjny model.

Ponadto proces szkolenia DBRX został zoptymalizowany pod kątem wydajności, wykorzystując zestaw własnych narzędzi i bibliotek Databricks, w tym Composer, LLM Foundry, MegaBlocks i Streaming. Zastosowanie takich technik, jak curriculum learning i zoptymalizowane strategie optymalizacji, pozwoliło zespołowi osiągnąć niemal czterokrotną poprawę wydajności obliczeniowej w porównaniu z poprzednimi modelami.

Training and Architecture

DBRX został wyszkolony przy użyciu modelu predykcji następnego tokenu na ogromnym zestawie danych liczącym 12 bilionów tokenów, podkreślając zarówno tekst, jak i kod. Ten zestaw danych szkoleniowych uważa się za znacznie bardziej skuteczny niż te używane w poprzednich modelach, zapewniając bogate zrozumienie i możliwość odpowiedzi na różnorodne podpowiedzi.

Architektura DBRX nie jest tylko świadectwem technicznej biegłości Databricks, ale także podkreśla jej zastosowanie w wielu sektorach. Od poprawy interakcji czatbotów po napędzanie złożonych zadań analitycznych, DBRX może być integrowany z różnymi dziedzinami wymagającymi nuansowanego zrozumienia języka.

Niezwykle, DBRX Instruct rywalizuje nawet z niektórymi z najbardziej zaawansowanych zamkniętych modelami na rynku. Według pomiarów Databricks, przewyższa GPT-3.5 i jest konkurencyjny z Gemini 1.0 Pro i Mistral Medium w różnych testach, w tym wiedzy ogólnej, rozumowania zdroworozsądkowego, programowania i rozumowania matematycznego.

Na przykład w teście MMLU, który mierzy zrozumienie języka, DBRX Instruct osiągnął wynik 73,7%, przewyższając wynik GPT-3.5, który wyniósł 70,0%. W teście HellaSwag dotyczącym rozumowania zdroworozsądkowego, DBRX Instruct uzyskał imponujący wynik 89,0%, przewyższając GPT-3.5, który osiągnął 85,5%.

DBRX Instruct naprawdę błyszczy, osiągając niezwykłą dokładność 70,1% w teście HumanEval, przewyższając nie tylko GPT-3.5 (48,1%), ale także specjalizowany model CodeLLaMA-70B Instruct (67,8%).

Te wyjątkowe wyniki podkreślają wszechstronność DBRX i jego zdolność do doskonałych wyników w szerokim zakresie zadań, od zrozumienia języka naturalnego po złożone programowanie i rozwiązywanie problemów matematycznych.

Wydatek Inferencji i Skalowalność Jednym z kluczowych zalet architektury MoE DBRX jest jej wydajność podczas inferencji. Dzięki rzadkiemu aktywowaniu parametrów, DBRX może osiągać wydatek inferencji, który jest nawet dwa do trzech razy szybszy niż gęste modele z tą samą liczbą parametrów.

W porównaniu z LLaMA2-70B, popularnym otwartym modelem LLM, DBRX nie tylko wykazuje wyższą jakość, ale także posiada prawie dwukrotnie szybszą szybkość inferencji, pomimo posiadania około połowy aktywnych parametrów. Ta wydajność sprawia, że DBRX jest atrakcyjnym wyborem do wdrożenia w szerokim zakresie aplikacji, od tworzenia treści po analizę danych i poza.

Ponadto Databricks opracował solidny stos szkoleniowy, który pozwala przedsiębiorstwom szkolić własne modele klasy DBRX od podstaw lub kontynuować szkolenie na podstawie dostarczonych punktów kontrolnych. Ta zdolność umożliwia firmom wykorzystanie pełnego potencjału DBRX i dostosowanie go do ich specyficznych potrzeb, dalej demokratyzując dostęp do najnowszej technologii LLM.

Dostępność i Integracje

Zgodnie ze swoją misją promowania otwartego dostępu do AI, Databricks udostępnił DBRX przez wiele kanałów. Wagi modelu bazowego (DBRX Base) i modelu dostrajania (DBRX Instruct) są hostowane na popularnej platformie Hugging Face, umożliwiając badaczom i deweloperom łatwe pobieranie i pracę z modelem.

Ponadto repozytorium modelu DBRX jest dostępne na GitHub, zapewniając przejrzystość i umożliwiając dalsze eksplorowanie i dostosowywanie kodu modelu.

przepływ inferencji dla różnych konfiguracji modelu na naszej zoptymalizowanej infrastrukturze serwerowej z wykorzystaniem NVIDIA TensorRT-LLM z 16-bitową precyzją i najlepszymi flagami optymalizacji, jakie mogliśmy znaleźć.

Dla klientów Databricks, DBRX Base i DBRX Instruct są łatwo dostępne za pośrednictwem API modeli podstawowych Databricks, umożliwiając bezproblemową integrację z istniejącymi przepływami pracy i aplikacjami. To nie tylko upraszcza proces wdrożenia, ale także zapewnia zarządzanie danymi i bezpieczeństwo dla wrażliwych przypadków użycia.

Ponadto DBRX został już zintegrowany z kilkoma platformami i usługami trzecich, takimi jak You.com i Perplexity Labs, rozszerzając swój zasięg i potencjalne zastosowania. Te integracje pokazują rosnące zainteresowanie DBRX i jego możliwościami, a także coraz większe przyjęcie otwartych LLM w różnych branżach i przypadkach użycia.

Możliwości Kontekstu Długiego i Wzmocnionej Generacji Jedną z wyróżniających się cech DBRX jest jego zdolność do obsługi długich wejść kontekstowych, z maksymalną długością kontekstu 32 768 tokenów. Ta zdolność pozwala modelowi na przetwarzanie i generowanie tekstu na podstawie obszernych informacji kontekstowych, sprawiając, że jest on dobrze przystosowany do zadań, takich jak podsumowanie dokumentów, odpowiedzi na pytania i odzyskiwanie informacji.

W testach oceniających wyniki długiego kontekstu, takich jak KV-Pairs i HotpotQAXL, DBRX Instruct przewyższył GPT-3.5 Turbo w różnych długościach sekwencji i pozycjach kontekstu.

DBRX przewyższa uznane otwarte modele językowe w zrozumieniu języka (MMLU), programowaniu (HumanEval) i matematyce (GSM8K).

DBRX przewyższa uznane otwarte modele językowe w zrozumieniu języka (MMLU), programowaniu (HumanEval) i matematyce (GSM8K).

Ograniczenia i Przyszła Praca

Chociaż DBRX reprezentuje znaczący sukces w dziedzinie otwartych LLM, istotne jest uznanie jego ograniczeń i obszarów do poprawy. Jak każdy model AI, DBRX może produkować niedokładne lub tendencyjne odpowiedzi, w zależności od jakości i różnorodności jego danych szkoleniowych.

Ponadto, chociaż DBRX excels w zadaniach ogólnych, pewne aplikacje specyficzne dla danej dziedziny mogą wymagać dalszego dostrajania lub specjalistycznego szkolenia, aby osiągnąć optymalne wyniki. Na przykład, w sytuacjach, w których dokładność i wierność są najważniejsze, Databricks zaleca stosowanie technik generacji wzmocnionej odzyskiwaniem (RAG), aby poprawić dane wyjściowe modelu.

Ponadto, bieżący zestaw danych szkoleniowych DBRX składa się głównie z treści w języku angielskim, potencjalnie ograniczając jego wyniki w zadaniach nieangielskich. Przyszłe iteracje modelu mogą obejmować rozszerzenie zestawu danych szkoleniowych, aby objąć bardziej zróżnicowany zakres języków i kontekstów kulturowych.

Databricks jest zaangażowany w ciągłe doskonalenie możliwości DBRX i rozwiązywanie jego ograniczeń. Przyszła praca będzie koncentrowała się na poprawie wyników modelu, skalowalności i używalności w różnych aplikacjach i przypadkach użycia, a także na eksplorowaniu technik, aby złagodzić potencjalne tendencyjności i promować etyczne użycie AI.

Ponadto, firma planuje dalej udoskonalać proces szkolenia, wykorzystując zaawansowane techniki, takie jak federacyjne uczenie się i metody zachowania prywatności, aby zapewnić prywatność i bezpieczeństwo danych.

Droga Do Przodu

DBRX reprezentuje znaczący krok w demokratyzacji rozwoju AI. Wyobraża sobie przyszłość, w której każde przedsiębiorstwo ma możliwość kontrolowania swoich danych i swojej przyszłości w świecie generatywnej AI.

Udostępniając DBRX i zapewniając dostęp do tych samych narzędzi i infrastruktury, które posłużyły do jego stworzenia, Databricks upoważnia przedsiębiorstwa i badaczy do stworzenia własnych zaawansowanych modeli Databricks, dostosowanych do ich specyficznych potrzeb.

Za pośrednictwem platformy Databricks, klienci mogą wykorzystać zestaw narzędzi do przetwarzania danych, w tym Apache Spark, Unity Catalog i MLflow, aby wyselekcjonować i zarządzać swoimi danymi szkoleniowymi. Mogą następnie wykorzystać zoptymalizowane biblioteki szkoleniowe Databricks, takie jak Composer, LLM Foundry, MegaBlocks i Streaming, aby szkolić własne modele klasy DBRX w sposób wydajny i na dużą skalę.

Ta demokratyzacja rozwoju AI ma potencjał, aby odblokować nową falę innowacji, ponieważ przedsiębiorstwa zyskają możliwość wykorzystania mocy dużych modeli językowych do szerokiego zakresu aplikacji, od tworzenia treści i analizy danych po wsparcie decyzji i poza.

Ponadto, poprzez promowanie otwartego i współpracującego ekosystemu wokół DBRX, Databricks dąży do przyspieszenia tempa badań i rozwoju w dziedzinie dużych modeli językowych. Im więcej organizacji i osób przyczynia się do swojej wiedzy i spostrzeżeń, tym bardziej zbiorowa wiedza i zrozumienie tych potężnych systemów AI będzie rosło, prowadząc do jeszcze bardziej zaawansowanych i zdolnych modeli w przyszłości.

Podsumowanie

DBRX jest przełomem w świecie otwartych dużych modeli językowych. Z jego innowacyjną architekturą mieszanki ekspertów, ogromnymi danymi szkoleniowymi i wynikami na najwyższym poziomie, ustanowił nowy standard dla tego, co jest możliwe w otwartych LLM.

Demokratyzując dostęp do najnowszej technologii AI, DBRX upoważnia badaczy, deweloperów i przedsiębiorstwa do eksplorowania nowych granic w przetwarzaniu języka naturalnego, tworzeniu treści, analizie danych i poza. Im więcej Databricks udoskonala i rozwija DBRX, tym bardziej potencjalne zastosowania i wpływ tego potężnego modelu są nieograniczone.

Przez ostatnie pięć lat zanurzałem się w fascynującym świecie Machine Learning i Deep Learning. Moja pasja i ekspertyza doprowadziły mnie do udziału w ponad 50 różnorodnych projektach inżynierii oprogramowania, ze szczególnym uwzględnieniem AI/ML. Moja nieustanna ciekawość również skierowała mnie w stronę Natural Language Processing, dziedziny, którą chcę dalej eksplorować.