Model dan platform AI
Ai2 Merilis Olmo-Core 3, Tumpukan Pelatihan Terbuka untuk MoE dengan Parameter Triliunan

Allen Institute for AI merilis Olmo-core 3 pada 1 Oktober 2026, sebuah peningkatan pada kerangka kerja pengembangan model bahasa besar yang dibangun di sekitar sistem pelatihan campuran ahli (mixture-of-experts) terbuka yang telah didesain ulang, yang menurut Ai2 telah diukur dengan lebih dari satu triliun parameter total.
Ai2 mengatakan Olmo-core 3 dirancang untuk memperluas pelatihan MoE ke kisaran triliunan parameter sambil mempertahankan efisiensi komputasi, dan menggambarkannya sebagai salah satu sistem inti di balik generasi berikutnya dari Olmo. Rilis ini disertai dengan sebuah laporan teknis, demo interaktif, dan kode terbuka.
Model MoE dapat mengandung jauh lebih banyak parameter tanpa mengharuskan setiap input menggunakan semuanya, tetapi model lengkap tetap harus disimpan di seluruh memori GPU dan diperbarui selama pelatihan, serta mengarahkan input ke ahli yang tepat di seluruh klaster menimbulkan biaya komunikasi dan koordinasi tersendiri. Ai2 mengatakan biaya tersebut dapat mengikis banyak keuntungan komputasi seiring pertumbuhan MoE, dan bahwa Olmo-core 3 dibangun untuk menutup kesenjangan itu. Dalam satu benchmark Ai2, kumpulan ahli meningkat dari 8 menjadi 128 sambil tetap memilih empat ahli per token, menjaga parameter aktif kira‑kira tetap pada sekitar 3,2 miliar sementara kapasitas total parameter meningkat dari 4,6 miliar menjadi 47 miliar, dengan throughput pelatihan turun kurang dari 5%.
Dari FSDP ke Tumpukan Pelatihan Berbasis DDP
Implementasi MoE awal Ai2 dalam Olmo-core menggunakan fully sharded data parallelism, yang dikonfigurasi untuk mengumpulkan dan membagi kembali bobot model untuk setiap batch kecil data pelatihan. Olmo-core 3 beralih ke sistem berbasis distributed data parallelism yang menjaga ahli tetap berada di GPU dan mengarahkan data yang relevan kepada mereka, menghindari pengumpulan bobot yang berulang. Dalam uji pendahuluan pada delapan GPU NVIDIA B300, Ai2 melaporkan bahwa MoE dengan 47 miliar parameter memproses 52.000 token per detik per GPU dengan tumpukan baru, dibandingkan dengan 19.400 menggunakan implementasi sebelumnya, yang Ai2 gambarkan sebagai sekitar 2,7 kali throughput.
Pekerjaan Ai2 pada model spars berawal dari OlmoE, yang menggunakan arsitektur MoE dengan 64 ahli yang diarahkan, sementara Olmo 3 menggunakan arsitektur padat di mana hampir seluruh model aktif untuk setiap token. Olmo-core 3 memperluas kerangka kerja dengan sistem pelatihan yang dirancang untuk model MoE yang jauh lebih besar. Ai2 mencatat bahwa Megatron-Core milik NVIDIA merupakan pilihan yang mapan untuk melatih MoE besar, dan menggambarkan Olmo-core 3 sebagai membawa tumpukan pelatihan MoE terintegrasi ke dalam kerangka kerja di balik Olmo.
Paralelisme, Presisi, dan Teknik Memori
Tiga teknik menentukan cara model dan status pelatihannya dibagi di seluruh perangkat keras: paralelisme ahli menyebarkan ahli ke seluruh GPU, paralelisme pipeline membagi lapisan model ke grup GPU, dan optimizer terdistribusi menyebarkan status optimizer ke GPU alih‑alih menyimpan salinan penuh pada setiap GPU. Olmo-core 3 juga mengurangi biaya pengiriman data ke ahli yang tepat: paralelisme ahli baris menempatkan data yang diarahkan langsung ke buffer input ahli, routing yang berada di GPU menyimpan metadata routing pada GPU sehingga CPU dapat menjadwalkan pekerjaan tanpa menunggu data disalin kembali, dan grouped GEMM menggabungkan banyak komputasi ahli kecil sehingga GPU dapat mengeksekusinya lebih efisien. Laporan teknis menjelaskan desain paralelisme ahli baris berbasis NVSHMEM yang menulis setiap token langsung ke buffer ahli masing‑masing, dengan perkalian matriks berkelompok yang dijadwalkan perangkat sehingga paralelisme ahli menjadi sepenuhnya bebas sinkronisasi.
Olmo-core 3 mendukung MXFP8, format angka presisi rendah. Dalam benchmark terkontrol pada empat GPU NVIDIA B300 dengan beban kerja didistribusikan secara merata ke seluruh ahli, Ai2 melaporkan throughput pelatihan sekitar 21% lebih tinggi dibandingkan baseline BF16, sementara memori aktif puncak turun dari 103 GiB menjadi 95 GiB, dengan sebagian besar peningkatan berasal dari komputasi feed‑forward dan pemindahan data antar ahli. Laporan tersebut menambahkan bahwa checkpoint yang tidak bergantung pada topologi merekam tensor FP32 global secara independen dari tata letak paralel, sehingga sebuah run dapat dilanjutkan pada topologi yang berbeda, dan bahwa dalam perbandingan terkontrolnya, penghitungan ulang aktivasi menghilangkan hampir dua pertiga memori aktivasi dan mengurangi memori puncak sekitar seperempat dengan biaya penurunan throughput sekitar seperlima.
Benchmark Parameter Triliunan dan Batas yang Dinyatakan
Ai2 mengatakan bahwa mereka melakukan benchmark Olmo-core 3 pada berbagai konfigurasi GPU NVIDIA B300, termasuk model dengan 1,2 triliun parameter dengan 58,36 miliar parameter aktif per token pada 512 GPU, di mana throughput tertinggi yang diamati mencapai 858 TFLOP/s per GPU. Ai2 menyatakan bahwa tes ini menggunakan routing acak untuk mengukur kinerja sistem daripada kualitas model yang dilatih. Laporan teknis mencantumkan titik operasi yang diukur mulai dari model 12,9 miliar parameter pada 16 GPU hingga model 1,2 triliun parameter pada 512 GPU, dan menyatakan bahwa angka utama merupakan referensi sistem yang diukur di bawah routing acak, bukan kurva skala terkontrol atau klaim waktu‑ke‑kualitas.
Ai2 juga melakukan eksperimen dengan DeepEP v2, sebuah backend alternatif untuk komunikasi antar pakar di seluruh GPU, mencapai konfigurasi dengan total 2,38 triliun parameter. Ai2 menggambarkan hasil tersebut sebagai tes kapasitas singkat yang menunjukkan skala yang dapat dicapai Olmo-core 3 dibandingkan dengan kinerja pelatihan yang berkelanjutan. Laporan teknis, berjudul “Supercharging Olmo-core for Efficient and Scalable MoE Training,” tanggal Oktober 2026; penulisnya berasal dari Allen Institute for AI dan University of Washington, dengan Tianhua Tao tercantum sebagai penulis utama dan pengembang utama.
Temuan yang Didokumentasikan dan Rencana Olmo Generasi Berikutnya
Laporan tersebut mendokumentasikan pola kegagalan yang disebut Ai2 sebagai token gerrymandering, di mana skor yang dimaksudkan untuk mendorong routing seimbang dapat meningkat meskipun beban kerja aktual menjadi kurang seimbang. Temuan lain yang didokumentasikan meliputi: menurunkan laju pembelajaran para pakar karena mereka memproses lebih sedikit token tidak meningkatkan hasil pada keluarga model yang diuji; perhitungan GPU memakan waktu berbeda ketika nilai yang diproses berubah, meskipun dimensi matriks tetap sama; dan tumpang tindih komunikasi serta komputasi pada aliran GPU terpisah tidak selalu mempercepat pelatihan dan pada beberapa pengujian memperlambat eksekusi end-to-end. Laporan tersebut juga menjelaskan pendekatan yang diuji namun tidak diadopsi, termasuk pemindahan beban aktivasi ke CPU yang tidak dapat dibawa oleh tautan host serta dua skema tumpang tindih yang bersaing dengan komputasi pakar untuk sumber daya GPU.
Ai2 mengatakan Olmo generasi berikutnya akan menggunakan arsitektur MoE, dan menargetkan agar menjadi Olmo paling mampu yang pernah ada, dilatih pada dataset terbesar dan dengan jendela konteks terpanjang. Organisasi tersebut menyatakan Olmo-core 3 sepenuhnya terbuka, sehingga peneliti dan pengembang dapat menggunakannya untuk melatih MoE mereka sendiri, menyesuaikannya dengan perangkat keras yang berbeda, dan bereksperimen dengan routing, paralelisme, serta bagian lain dari sistem. Olmo-core GitHub repositori menggambarkan proyek ini sebagai blok bangunan PyTorch untuk ekosistem OLMo, memiliki lisensi Apache-2.0, dan dapat dipasang dari sumber atau dari PyPI sebagai ai2-olmo-core.












