Podstawy AI
Wzrost Mixture-of-Experts: Jak rzadkie modele AI kształtują przyszłość uczenia maszynowego
Mixture-of-Experts (MoE) modele rewolucjonizują sposób, w jaki skalujemy AI. Aktywując tylko podzbiór składników modelu w danym momencie, MoE oferują nowy sposób zarządzania wymianą między rozmiarem modelu a efektywnością obliczeniową. W przeciwieństwie do tradycyjnych gęstych modeli, które używają wszystkich parametrów dla każdego wejścia, MoE osiągają ogromne liczby parametrów, utrzymując koszty inferencji i szkolenia na rozsądnym poziomie. Ten przełom wywołał falę badań i rozwoju, prowadząc zarówno gigantów technologicznych, jak i startupów do zainwestowania w architektury oparte na MoE.
Jak działają modele Mixture-of-Experts
W swojej istocie, modele MoE składają się z wielu wyspecjalizowanych podsieci zwanych “ekspertami”, nadzorowanych przez mechanizm bramkowy, który decyduje, którzy eksperci powinni obsłużyć każde wejście. Na przykład, zdanie wprowadzone do modelu językowego może aktywować tylko dwóch z ośmiu ekspertów, znacznie redukując obciążenie obliczeniowe.
Ten koncept został wprowadzony do głównego nurtu przez Google’s Switch Transformer i GLaM modele (GOOGL ), gdzie eksperci zastąpili tradycyjne warstwy feed-forward w Transformerach. Switch Transformer, na przykład, kieruje tokeny do jednego eksperta na warstwę, podczas gdy GLaM używa trasowania top-2 dla poprawy wydajności. Te projekty wykazały, że MoE mogą dorównać lub przewyższyć gęste modele, takie jak GPT-3, przy użyciu znacznie mniej energii i obliczeń.
Kluczowa innowacja leży w obliczeniach warunkowych. Zamiast aktywowania całego modelu, MoE aktywują tylko najbardziej istotne części, co oznacza, że model z setkami miliardów lub nawet bilionami parametrów może działać z wydajnością modelu, który jest o rząd wielkości mniejszy. To umożliwia badaczom zwiększać pojemność bez liniowego wzrostu obliczeń, co jest nieosiągalne przy tradycyjnych metodach skalowania.

Rzeczywiste zastosowania MoE
Modele MoE już zaczęły odnosić sukcesy w różnych dziedzinach. Google’s GLaM i Switch Transformer pokazały wyniki na poziomie stanu sztuki w modelowaniu języka z niższymi kosztami szkolenia i inferencji. Microsoft’s (MSFT ) Z-Code MoE jest operacyjny w jego narzędziu Translator, obsługując ponad 100 języków z lepszą dokładnością i efektywnością niż wcześniejsze modele. To nie są tylko projekty badawcze – napędzają one usługi na żywo.
W dziedzinie widzenia komputerowego, Google’s V-MoE architektura poprawiła dokładność klasyfikacji na benchmarkach takich jak ImageNet, a model LIMoE wykazał silne wyniki w zadaniach multimodalnych, obejmujących zarówno obrazy, jak i tekst. Możliwość specjalizacji ekspertów – niektórzy zajmują się tekstem, inni obrazami – dodaje nową warstwę możliwości do systemów AI.
Systemy rekomendacyjne i platformy wielozadaniowe również skorzystały z MoE. Na przykład, silnik rekomendacji YouTube wykorzystuje architekturę podobną do MoE, aby obsłużyć cele takie jak czas odtwarzania i współczynnik klikalności w sposób bardziej efektywny. Przydzielając różnych ekspertów do różnych zadań lub zachowań użytkowników, MoE pomagają budować bardziej solidne silniki personalizacji.
Korzyści i wyzwania
Główną zaletą MoE jest efektywność. Pozwalają one na szkolenie i wdrożenie ogromnych modeli z znacznie mniejszymi kosztami obliczeniowymi. Na przykład, model Mistral AI Mixtral 8×7B ma 47B parametrów, ale aktywuje tylko 12,9B na token, co daje mu efektywność kosztową modelu 13B, przy jednoczesnym konkurowaniu z modelami takimi jak GPT-3.5 pod względem jakości.
MoE również sprzyjają specjalizacji. Ponieważ różni eksperci mogą uczyć się odrębnych wzorców, cały model staje się lepszy w radzeniu sobie z różnorodnymi wejściami. To jest szczególnie przydatne w zadaniach wielojęzycznych, wielodomenowych lub multimodalnych, gdzie gęsty model może nie spełniać oczekiwań.
Jednak MoE wiążą się z wyzwaniami inżynieryjnymi. Ich szkolenie wymaga starannego balansowania, aby zapewnić, że wszyscy eksperci są wykorzystywani efektywnie. Inny problem to nakład pamięci – chociaż tylko ułamek parametrów jest aktywny na inferencję, wszystkie muszą być załadowane do pamięci. Efektywne rozłożenie obliczeń na GPU lub TPU nie jest trywialne i doprowadziło do rozwoju specjalistycznych frameworków, takich jak Microsoft’s DeepSpeed i Google’s GShard.
Pomimo tych przeszkód, korzyści z wydajności i kosztów są na tyle znaczne, że MoE są teraz postrzegane jako kluczowy komponent dużej skali projektowania AI. W miarę dojrzewania narzędzi i infrastruktury, te wyzwania są stopniowo pokonywane.
Jak MoE porównują się do innych metod skalowania
Tradycyjne gęste skalowanie zwiększa rozmiar modelu i obliczenia proporcjonalnie. MoE łamią tę liniowość, zwiększając łączną liczbę parametrów bez zwiększania obliczeń na wejście. To umożliwia szkolenie modeli z bilionami parametrów na tym samym sprzęcie, który wcześniej był ograniczony do dziesiątek miliardów.
W porównaniu z modelami ensemble, które również wprowadzają specjalizację, ale wymagają wielu pełnych przejść do przodu, MoE są znacznie bardziej efektywne. Zamiast uruchamiania kilku modeli równolegle, MoE uruchamiają tylko jeden – ale z korzyścią wielu ścieżek ekspertów.
MoE również uzupełniają strategie, takie jak skalowanie danych szkoleniowych (np. metoda Chinchilla). Podczas gdy Chinchilla podkreśla użycie większych danych z mniejszymi modelami, MoE zwiększają pojemność modelu, utrzymując stałe koszty obliczeniowe, co sprawia, że są one idealne dla przypadków, w których obliczenia są wąskim gardłem.
Wreszcie, podczas gdy techniki, takie jak przycinanie i kwantyzacja, kurczą modele po szkoleniu, MoE zwiększają pojemność modelu podczas szkolenia. Nie są one zastąpieniem kompresji, ale narzędziem ortogonalnym do efektywnego wzrostu.
Firmy prowadzące rewolucję MoE
Giganci technologiczni
Google był pionierem w dziedzinie badań nad MoE. Ich Switch Transformer i GLaM modele osiągnęły 1,6T i 1,2T parametrów odpowiednio. GLaM osiągnął wyniki na poziomie GPT-3, używając tylko jednej trzeciej energii. Google również zastosował MoE w dziedzinie widzenia (V-MoE) i zadaniach multimodalnych (LIMoE), co jest zgodne z ich wizją Pathways dla uniwersalnych modeli AI.
Microsoft zintegrował MoE z produkcją za pomocą swojego modelu Z-Code w Microsoft Translator. Rozwinął również DeepSpeed-MoE, umożliwiający szybkie szkolenie i niską latencję inferencji dla modeli z bilionami parametrów. Ich wkład obejmuje algorytmy trasowania i bibliotekę Tutel do efektywnej obliczeń MoE.
Meta zbadał MoE w dużych modelach językowych i systemach rekomendacyjnych. Ich model MoE o pojemności 1,1T wykazał, że może osiągnąć jakość gęstych modeli, używając 4 razy mniej obliczeń. Chociaż modele LLaMA są gęste, badania Meta nad MoE nadal informują szerszą społeczność.
Amazon (AMZN ) wspiera MoE za pomocą swojej platformy SageMaker i wewnętrznych wysiłków. Umożliwił szkolenie modelu Mistral Mixtral i podobno używa MoE w usługach takich jak Alexa AI. Dokumentacja AWS aktywnie promuje MoE do szkolenia dużych modeli.
Huawei i BAAI w Chinach również opracowali rekordowe modele MoE, takie jak PanGu-Σ (1,085T parametrów). To pokazuje potencjał MoE w zadaniach językowych i multimodalnych oraz podkreśla jego globalny zasięg.
Startupy i wyzwania
Mistral AI jest symbolem innowacji MoE w kodzie otwartym. Ich modele Mixtral 8×7B i 8×22B wykazały, że MoE mogą przewyższyć gęste modele, takie jak LLaMA-2 70B, przy jednoczesnym działaniu przy ułamku kosztów. Z ponad 600 mln euro w finansowaniu, Mistral stawia duże na architektury rzadkie.
xAI, założony przez Elona Muska, podobno bada MoE w swoim modelu Grok. Chociaż szczegóły są ograniczone, MoE oferują sposób dla startupów, takich jak xAI, aby konkurować z większymi graczami bez potrzeby ogromnych obliczeń.
Databricks, za pośrednictwem swojego nabytku MosaicML, wydał DBRX, otwarty model MoE zaprojektowany z myślą o efektywności. Zapewniają również infrastrukturę i przepisy do szkolenia MoE, obniżając barierę dla adopcji.
Inni gracze, tacy jak Hugging Face, zintegrowali wsparcie dla MoE w swoich bibliotekach, ułatwiając deweloperom budowanie na tych modelach. Nawet jeśli nie budują MoE samodzielnie, platformy, które je umożliwiają, są kluczowe dla ekosystemu.
Podsumowanie
Modele Mixture-of-Experts nie są tylko trendem – reprezentują fundamentalną zmianę w tym, jak budujemy i skalujemy systemy AI. Aktywując selektywnie tylko części sieci, MoE oferują moc ogromnych modeli bez ich prohibicyjnych kosztów. W miarę rozwoju infrastruktury oprogramowania i poprawy algorytmów trasowania, MoE są gotowe stać się domyślną architekturą dla wielodomenowych, wielojęzycznych i multimodalnych AI.
Niezależnie od tego, czy jesteś badaczem, inżynierem czy inwestorem, MoE dająblick w przyszłość, w której AI jest bardziej potężna, efektywna i dostosowana niż kiedykolwiek wcześniej.












