Modele i platformy AI

Ai2 wypuszcza Olmo-Core 3, otwartą platformę treningową dla modeli MoE o trylionie parametrów

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Allen Institute for AI wydało Olmo-core 3 1 października 2026 r., aktualizację swojego frameworku do rozwoju dużych modeli językowych, zbudowanego wokół przeprojektowanego otwartego systemu treningowego mieszanki ekspertów, który, jak twierdzi Ai2, został przetestowany przy ponad jednym trylionie łącznych parametrów.

Ai2 twierdzi, że Olmo-core 3 został zaprojektowany tak, aby skalować trening MoE do zakresu trylionu parametrów, zachowując wydajność obliczeniową, i opisuje go jako jeden z kluczowych systemów stojących za następną generacją Olmo. Wydanie jest uzupełnione o raport techniczny, interaktywną demonstrację oraz otwarty kod.

Modele MoE mogą zawierać znacznie więcej parametrów bez konieczności używania ich wszystkich przez każde wejście, ale pełny model musi być nadal przechowywany w pamięci GPU i aktualizowany podczas treningu, a kierowanie wejść do odpowiednich ekspertów w klastrze generuje własne koszty komunikacji i koordynacji. Ai2 twierdzi, że te koszty mogą zniwelować dużą część przewagi obliczeniowej w miarę rozwoju MoE, i że Olmo-core 3 został zaprojektowany, aby zamknąć tę lukę. W jednym benchmarku Ai2 pula ekspertów zwiększyła się z 8 do 128, przy jednoczesnym wyborze czterech ekspertów na token, utrzymując aktywne parametry w przybliżeniu stałe na poziomie około 3,2 miliarda, podczas gdy całkowita pojemność parametrów wzrosła z 4,6 miliarda do 47 miliardów, a wydajność treningu spadła o mniej niż 5 %.

Z FSDP do stosu treningowego opartego na DDP

Wcześniejsza implementacja MoE w Olmo-core wykorzystująca w pełni podzielony równoległy przetwarzanie danych (FSDP) była skonfigurowana do zbierania i ponownego podziału wag modelu dla każdej małej partii danych treningowych. Olmo-core 3 przechodzi na system oparty na rozproszonym równoległym przetwarzaniu danych (DDP), który utrzymuje ekspertów na GPU i kieruje do nich odpowiednie dane, unikając powtarzalnego zbierania wag. W wstępnym teście na ośmiu kartach NVIDIA B300, Ai2 informuje, że MoE o 47 miliardach parametrów przetwarzało 52 000 tokenów na sekundę na GPU przy nowym stosie, w porównaniu z 19 400 przy wcześniejszej implementacji, co według Ai2 stanowi około 2,7‑krotność przepustowości.

Prace Ai2 nad modelami rzadkimi sięgają OlmoE, który wykorzystywał architekturę MoE z 64 kierowanymi ekspertami, podczas gdy Olmo 3 używał architektury gęstej, w której prawie cały model był aktywny dla każdego tokenu. Olmo-core 3 rozszerza framework o system treningowy zaprojektowany dla znacznie większych modeli MoE. Ai2 zauważyło, że Megatron-Core firmy NVIDIA jest uznaną opcją do treningu dużych MoE i opisało Olmo-core 3 jako wprowadzające zintegrowany stos treningowy MoE do frameworku stojącego za Olmo.

Równoległość, precyzja i techniki pamięci

Trzy techniki określają, jak model i jego stan treningowy są rozdzielane pomiędzy sprzętem: równoległość ekspertów rozprasza ekspertów po GPU, równoległość potokowa dzieli warstwy modelu na grupy GPU, a rozproszony optymalizator rozprasza stan optymalizatora po GPU zamiast przechowywać pełną kopię na każdym GPU. Olmo-core 3 dodatkowo zmniejsza koszt kierowania danych do właściwych ekspertów: równoległość ekspertów wierszowa umieszcza kierowane dane bezpośrednio w buforach wejściowych ekspertów, routing utrzymywany na GPU przechowuje metadane routingu na GPU, dzięki czemu CPU może kolejkować zadania bez oczekiwania na ich kopiowanie z powrotem, a grupowane operacje GEMM łączą wiele małych obliczeń ekspertów, aby GPU mogły je wykonywać wydajniej. Raport techniczny opisuje projekt równoległości ekspertów wierszowej oparty na NVSHMEM, który zapisuje każdy token bezpośrednio w buforze odpowiedniego eksperta, z grupowanymi mnożeniami macierzy planowanymi przez urządzenie, co czyni równoległość ekspertów w pełni wolną od synchronizacji.

Olmo-core 3 obsługuje MXFP8, format liczb o niższej precyzji. W kontrolowanym benchmarku na czterech kartach NVIDIA B300, z pracą równomiernie rozdzieloną pomiędzy ekspertów, Ai2 informuje, że przepustowość treningu była o około 21 % wyższa niż przy bazowym BF16, przy jednoczesnym spadku szczytowej aktywnej pamięci z 103 GiB do 95 GiB, przy czym większość zysku pochodziła z obliczeń feed-forward i przenoszenia danych między ekspertami. Raport dodaje, że checkpointy niezależne od topologii zapisują globalne tensory FP32 niezależnie od układu równoległości, dzięki czemu uruchomienie może zostać wznowione na innej topologii, oraz że w kontrolowanym porównaniu ponowne obliczanie aktywacji usunęło prawie dwie trzecie pamięci aktywacji i zmniejszyło szczytową pamięć o około jedną czwartą kosztem około jednej piątej przepustowości.

Benchmarky trylionowych parametrów i podane limity

Ai2 poinformowało, że przeprowadziło benchmarki Olmo-core 3 w różnych konfiguracjach na kartach NVIDIA B300, w tym model o 1,2 tryliona parametrów z 58,36 miliarda parametrów aktywnych na token przy użyciu 512 GPU, gdzie najwyższa zaobserwowana przepustowość wyniosła 858 TFLOP/s na GPU. Ai2 zaznaczyło, że te testy wykorzystywały losowe routowanie w celu pomiaru wydajności systemu, a nie jakości wytrenowanego modelu. Raport techniczny wymienia zmierzone punkty operacyjne od modelu o 12,9 miliarda parametrów na 16 GPU aż do modelu o 1,2 tryliona parametrów na 512 GPU oraz podaje, że podane wskaźniki to odniesienia systemowe zmierzone przy losowym routowaniu, a nie kontrolna krzywa skalowania ani roszczenie o czasie do uzyskania jakości.

Ai2 również eksperymentował z DeepEP v2, alternatywnym zapleczem do komunikacji między ekspertami w różnych GPU, osiągając konfigurację z 2,38 trylionami łącznej liczby parametrów. Ai2 opisuje ten wynik jako test krótkotrwałej pojemności, demonstrujący skalę, jaką Olmo-core 3 może osiągnąć, a nie jako utrzymującą się wydajność treningu. Raport techniczny, zatytułowany „Supercharging Olmo-core for Efficient and Scalable MoE Training”, datowany jest na październik 2026; jego autorami są przedstawiciele Allen Institute for AI oraz University of Washington, przy czym Tianhua Tao jest wymieniony jako główny autor i główny deweloper.

Udokumentowane ustalenia i plany dotyczące kolejnej generacji Olmo

Raport dokumentuje wzorzec awarii, który Ai2 nazywa „token gerrymandering”, w którym wskaźnik mający zachęcać do zrównoważonego routingu może się poprawiać, nawet gdy rzeczywiste obciążenie staje się mniej zrównoważone. Inne udokumentowane ustalenia obejmują: obniżanie współczynników uczenia ekspertów, ponieważ przetwarzają oni mniej tokenów, nie poprawiło wyników w testowanej rodzinie modeli; obliczenia na GPU zajmowały różne czasy, gdy zmieniały się przetwarzane wartości, nawet przy tych samych wymiarach macierzy; oraz nakładanie komunikacji i obliczeń na oddzielnych strumieniach GPU nie zawsze przyspieszało trening i w niektórych testach spowalniało całkowite wykonanie. Raport opisuje także podejścia testowane, ale nie przyjęte, w tym przenoszenie aktywacji na CPU, które nie mogło zostać obsłużone przez łącze hosta, oraz dwa schematy nakładania, które konkurowały z obliczeniami ekspertów o zasoby GPU.

Ai2 powiedział, że jego kolejna generacja Olmo będzie wykorzystywać architekturę MoE i dąży do tego, aby była najpotężniejszym dotychczasowym modelem Olmo, wytrenowanym na największym zestawie danych i z najdłuższym oknem kontekstowym. Organizacja stwierdziła, że Olmo-core 3 jest w pełni otwarty, dzięki czemu badacze i deweloperzy mogą używać go do trenowania własnych MoE, dostosowywać go do różnych platform sprzętowych oraz eksperymentować z routowaniem, równoległością i innymi elementami systemu. repozytorium Olmo-core na GitHubie opisuje projekt jako zestaw komponentów PyTorch dla ekosystemu OLMo, posiada licencję Apache‑2.0 i może być zainstalowany ze źródeł lub z PyPI jako ai2-olmo-core.

Jonas Reeve jest analitykiem generowanym przez SI w Unite.AI, koncentrującym się na kognitywnej SI, sztucznej ogólnej inteligencji (AGI) oraz teoretycznych podstawach inteligencji maszynowej. Jego praca bada, jak uczenie się, rozumowanie, pamięć i abstrakcja wyłaniają się zarówno w systemach biologicznych, jak i sztucznych, tworząc powiązania między współczesnymi architekturami SI a długoletnimi pytaniami w naukach kognitywnych i filozofii umysłu.

Z koncepcyjnym i refleksyjnym podejściem Jonas bada ramy takie jak modele rozumowania, systemy agentowe, emergentna kognicja i teoria zgodności, dążąc do wyjaśnienia, co tak naprawdę oznacza postęp w kierunku AGI — a czego nie. Zamiast gonić za terminami czy hype’em, podkreśla pierwsze zasady, rygor konceptualny oraz ograniczenia obecnych modeli.

Artykuły autorstwa Jonasa Reeve są generowane przez SI i recenzowane przez zespół redakcyjny Unite.AI, aby zapewnić dokładność, przejrzystość i odpowiedzialną dyskusję zaawansowanych koncepcji SI.