Yapay zeka modelleri ve platformları
Ai2, Trilyon Parametreli MoE’ler için Açık Eğitim Yığını Olmo-Core 3’ü Yayınladı

Allen Institute for AI, 1 Ekim 2026’da Olmo-core 3‘i yayınladı, bu, Ai2’nin yeniden tasarlanmış açık uzman‑karışımı eğitim sistemi etrafında inşa edilen büyük dil modeli geliştirme çerçevesinin bir yükseltmesidir ve Ai2, toplamda bir trilyondan fazla parametreyle benchmarklandığını belirtiyor.
Ai2, Olmo-core 3’ün MoE eğitimini trilyon‑parametre aralığına ölçeklendirecek şekilde tasarlandığını ve hesaplama verimliliğini koruduğunu söyledi ve bunu Olmo’nun bir sonraki neslinin temel sistemlerinden biri olarak tanımladı. Yayın, bir teknik rapor, etkileşimli bir demo ve açık kodla birlikte sunuluyor.
MoE modelleri, her girdi tüm parametreleri kullanmak zorunda kalmadan çok daha fazla parametre içerebilir, ancak tam model hâlâ GPU belleği üzerinde depolanmalı ve eğitim sırasında güncellenmelidir; ayrıca bir küme içinde girdileri doğru uzmanlara yönlendirmek kendi iletişim ve koordinasyon maliyetlerini oluşturur. Ai2, bu maliyetlerin MoE’ler büyüdükçe hesaplama avantajının büyük bir kısmını aşındırabileceğini ve Olmo-core 3’ün bu boşluğu kapatmak için tasarlandığını belirtti. Bir Ai2 benchmarkunda, uzman havuzu 8’den 128’e çıkarılırken hâlâ token başına dört uzman seçildi, aktif parametreler yaklaşık 3,2 milyar sabit tutuldu, toplam parametre kapasitesi 4,6 milyardan 47 milyara yükseldi ve eğitim verimliliği %5’in altında bir düşüş gösterdi.
FSDP’den DDP Tabanlı Eğitim Yığınına
Ai2’nin Olmo-core’daki önceki MoE uygulaması, tam bölünmüş veri paralelizmi (fully sharded data parallelism) kullanıyordu ve her küçük eğitim veri partisi için model ağırlıklarını toplama ve yeniden bölme şekilde yapılandırılmıştı. Olmo-core 3, uzmanları GPU’larda tutan ve ilgili verileri onlara yönlendiren dağıtık veri paralelizmi tabanlı bir sisteme geçiyor, böylece tekrarlanan ağırlık toplama işlemini önlüyor. Sekiz NVIDIA B300 GPU üzerinde yapılan ön testte, Ai2, yeni yığınla 47 milyar parametreli bir MoE’nin GPU başına saniyede 52.000 token işlediğini, önceki uygulama ile karşılaştırıldığında 19.400 olduğunu ve bu oranı yaklaşık 2,7 kat daha yüksek bir verimlilik olarak tanımladığını raporladı.
Ai2’nin seyrek modeller üzerindeki çalışmaları OlmoE’ye dayanıyor; OlmoE, 64 yönlendirilmiş uzmana sahip bir MoE mimarisi kullanırken, Olmo 3, modelin neredeyse tamamının her token için aktif olduğu yoğun bir mimari kullandı. Olmo-core 3, çok daha büyük MoE modelleri için tasarlanmış bir eğitim sistemiyle çerçeveyi genişletiyor. Ai2, NVIDIA’nın Megatron-Core’ının büyük MoE’leri eğitmek için köklü bir seçenek olduğunu belirtti ve Olmo-core 3’ün Olmo’nun arkasındaki çerçeveye bütünleşik bir MoE eğitim yığını getirdiğini açıkladı.
Paralellik, Hassasiyet ve Bellek Teknikleri
Modelin ve eğitim durumunun donanım üzerinde nasıl bölündüğünü belirleyen üç teknik vardır: uzman paralelliği, uzmanları GPU’lar arasında dağıtır; boru hattı paralelliği, model katmanlarını GPU grupları arasında böler; dağıtık bir optimizer ise optimizer durumunu tüm GPU’larda tam bir kopya tutmak yerine GPU’lar arasında yayar. Olmo-core 3 ayrıca veriyi doğru uzmanlara yönlendirme maliyetini azaltır: satır bazlı uzman paralelliği, yönlendirilen veriyi doğrudan uzman giriş tamponlarına yerleştirir, GPU’da bulunan yönlendirme, yönlendirme meta verilerini GPU’larda tutar, böylece CPU veriyi geri kopyalamayı beklemeden işi kuyruğa alabilir, ve gruplanmış GEMM, birçok küçük uzman hesaplamasını birleştirerek GPU’ların bunları daha verimli çalıştırmasını sağlar. Teknik rapor, her tokeni doğrudan ilgili uzmanının tamponuna yazan NVSHMEM tabanlı satır bazlı uzman paralelliği tasarımını ve cihaz tarafından zamanlanan gruplanmış matris çarpımlarının uzman paralelliğini tamamen eşzamanlamasız hâle getirdiğini açıklamaktadır.
Olmo-core 3, daha düşük hassasiyetli bir sayı formatı olan MXFP8’i destekler. Dört NVIDIA B300 GPU üzerinde uzmanlar arasında işi eşit şekilde dağıtan kontrollü bir benchmarkta, Ai2, BF16 temeline göre eğitim verimliliğinin yaklaşık %21 daha yüksek olduğunu, aynı zamanda en yüksek aktif belleğin 103 GiB’den 95 GiB’ye düştüğünü raporladı; kazancın büyük kısmı ileri beslemeli hesaplamalardan ve uzmanlar arasındaki veri taşımasından kaynaklandı. Rapor, topoloji bağımsız kontrol noktalarının paralel düzenlemeden bağımsız olarak global FP32 tensörlerini kaydettiğini, böylece bir çalışmanın farklı bir topolojide devam ettirilebileceğini ekliyor ve kontrollü karşılaştırmasında aktivasyon yeniden hesaplamanın aktivasyon belleğinin neredeyse üçte ikisini ortadan kaldırdığını ve en yüksek belleği yaklaşık dörtte bir oranında azalttığını, bunun da verimliliğin yaklaşık beşte birini kaybetmesi karşılığında gerçekleştiğini belirtiyor.
Trilyon-Parametreli Benchmarklar ve Belirtilen Sınırlamalar
Ai2, Olmo-core 3’ü NVIDIA B300 GPU’lar üzerindeki çeşitli konfigürasyonlarda benchmarkladığını, 512 GPU üzerinde token başına 58,36 milyar aktif parametreye sahip 1,2 trilyon parametreli bir model dahil olmak üzere, en yüksek gözlemlenen verimliliğin GPU başına 858 TFLOP/s olduğunu belirtti. Ai2, bu testlerin sistem performansını ölçmek için rastgele yönlendirme kullandığını, eğitilmiş bir modelin kalitesini ölçmediğini ifade etti. Teknik rapor, 16 GPU üzerindeki 12,9 milyar parametreli bir modelden 512 GPU üzerindeki 1,2 trilyon parametreli modele kadar ölçülen işletim noktalarını listeliyor ve başlık oranlarının rastgele yönlendirme altında ölçülen sistem referansları olduğunu, kontrollü bir ölçekleme eğrisi ya da kaliteye ulaşma süresi iddiası olmadığını belirtiyor.
Ai2 ayrıca DeepEP v2 ile, GPU’lar arasında uzmanlar arasındaki iletişim için alternatif bir arka uç deneyerek, toplam 2,38 trilyon parametreli bir yapılandırmaya ulaştı. Ai2 bu sonucu, Olmo-core 3’ün ulaşabileceği ölçeği gösteren, sürdürülebilir eğitim performansından ziyade kısa kapasiteli bir test olarak tanımlıyor. “Supercharging Olmo-core for Efficient and Scalable MoE Training” başlıklı teknik rapor, Ekim 2026 tarihli; yazarları Allen Institute for AI ve University of Washington’dan, Tianhua Tao baş yazar ve birincil geliştirici olarak listelenmiştir.
Belgelendirilmiş Bulgular ve Nesil Olmo Planları
Rapor, Ai2’nin token gerrymandering (jeton bölgesi) olarak adlandırdığı bir başarısızlık modelini belgelemektedir; bu modelde, dengeli yönlendirmeyi teşvik etmeyi amaçlayan bir skor, gerçek iş yükü daha az dengeli hale gelse bile iyileşebilmektedir. Diğer belgelenen bulgular şunları içerir: uzmanların daha az jeton işlediği için öğrenme oranlarını düşürmenin, test edilen model ailesinde sonuçları iyileştirmediği; aynı matris boyutlarıyla bile işlenen değerler değiştiğinde GPU hesaplamalarının farklı süreler aldığı; ve ayrı GPU akışlarında iletişim ve hesaplamanın üst üste binmesinin her zaman eğitimi hızlandırmadığı, bazı testlerde uçtan uca yürütmeyi yavaşlattığı. Rapor ayrıca, benimsenmeyen test edilen yaklaşımları da açıklamaktadır; bunlar arasında, ana bağlantının taşıyamadığı aktivasyonların CPU’ya aktarılması ve uzman hesaplamasıyla GPU kaynakları için rekabet eden iki üst üste binme şeması yer almaktadır.
Ai2, bir sonraki nesil Olmo’nun bir MoE mimarisi kullanacağını ve bunun şimdiye kadarki en yetkin Olmo olmasını hedeflediğini, en büyük veri kümesi ve en uzun bağlam penceresiyle eğitileceğini söyledi. Organizasyon, Olmo-core 3’ün tamamen açık olduğunu ve araştırmacıların ve geliştiricilerin kendi MoE’lerini eğitmek, farklı donanımlara uyarlamak ve yönlendirme, paralellik ve sistemin diğer bölümleriyle denemeler yapmak için kullanabileceklerini belirtti. Olmo-core GitHub deposu projesini OLMo ekosistemi için PyTorch yapı taşları olarak tanımlıyor, Apache-2.0 lisansına sahip ve kaynak kodundan ya da PyPI üzerinden ai2-olmo-core olarak kurulabiliyor.












