Mô hình và nền tảng AI
Ai2 phát hành Olmo-Core 3, Ngăn xếp Đào tạo Mở cho MoE hàng nghìn tỷ tham số

Viện Allen cho Trí tuệ Nhân tạo đã phát hành Olmo-core 3 vào ngày 1 tháng 10 năm 2026, một bản nâng cấp cho khung phát triển mô hình ngôn ngữ lớn dựa trên hệ thống đào tạo hỗn hợp chuyên gia (mixture-of-experts) mở được thiết kế lại, mà Ai2 cho biết đã được kiểm tra với hơn một nghìn tỷ tham số tổng cộng.
Ai2 cho biết Olmo-core 3 được thiết kế để mở rộng việc đào tạo MoE lên mức hàng nghìn tỷ tham số trong khi vẫn duy trì hiệu quả tính toán, và mô tả nó là một trong những hệ thống cốt lõi phía sau thế hệ tiếp theo của Olmo. Bản phát hành đi kèm với một báo cáo kỹ thuật, một bản demo tương tác, và mã nguồn mở.
Các mô hình MoE có thể chứa nhiều tham số hơn mà không yêu cầu mỗi đầu vào phải sử dụng tất cả chúng, nhưng mô hình đầy đủ vẫn phải được lưu trữ trên bộ nhớ GPU và được cập nhật trong quá trình đào tạo, và việc định tuyến đầu vào tới các chuyên gia phù hợp trên một cụm tạo ra chi phí truyền thông và phối hợp riêng. Ai2 cho biết những chi phí này có thể làm giảm đáng kể lợi thế tính toán khi MoE mở rộng, và Olmo-core 3 được xây dựng để thu hẹp khoảng cách đó. Trong một phép đo chuẩn của Ai2, nhóm chuyên gia đã tăng từ 8 lên 128 trong khi vẫn chọn bốn chuyên gia cho mỗi token, giữ số tham số hoạt động gần như cố định ở khoảng 3,2 tỷ, trong khi dung lượng tham số tổng cộng tăng từ 4,6 tỷ lên 47 tỷ, với tốc độ đào tạo giảm ít hơn 5%.
Từ FSDP sang Ngăn xếp Đào tạo Dựa trên DDP
Triển khai MoE trước đây của Ai2 trong Olmo-core đã sử dụng fully sharded data parallelism, được cấu hình để thu thập và phân mảnh lại trọng số mô hình cho mỗi lô dữ liệu đào tạo nhỏ. Olmo-core 3 chuyển sang một hệ thống dựa trên distributed data parallelism, giữ các chuyên gia trên GPU và định tuyến dữ liệu liên quan tới chúng, tránh việc thu thập trọng số lặp lại. Trong một thử nghiệm sơ bộ trên tám GPU NVIDIA B300, Ai2 báo cáo rằng một MoE 47 tỷ tham số đã xử lý 52,000 token mỗi giây trên mỗi GPU với ngăn xếp mới, so với 19,400 token khi dùng triển khai trước đây, mà Ai2 mô tả là khoảng 2.7 lần tốc độ thông lượng.
Công việc của Ai2 về các mô hình thưa (sparse) bắt nguồn từ OlmoE, sử dụng kiến trúc MoE với 64 chuyên gia được định tuyến, trong khi Olmo 3 sử dụng kiến trúc dày đặc, trong đó hầu hết mô hình đều hoạt động cho mỗi token. Olmo-core 3 mở rộng khung làm việc với một hệ thống đào tạo được thiết kế cho các mô hình MoE lớn hơn nhiều. Ai2 lưu ý rằng Megatron-Core của NVIDIA là một lựa chọn đã được thiết lập để đào tạo các MoE lớn, và mô tả Olmo-core 3 như là việc mang một ngăn xếp đào tạo MoE tích hợp vào khung nền tảng phía sau Olmo.
Song song, Độ chính xác và Kỹ thuật Bộ nhớ
Ba kỹ thuật quyết định cách mô hình và trạng thái đào tạo của nó được chia trên phần cứng: expert parallelism phân tán các chuyên gia trên GPU, pipeline parallelism chia các lớp của mô hình thành các nhóm GPU, và một distributed optimizer phân tán trạng thái tối ưu hoá trên GPU thay vì lưu một bản sao đầy đủ trên mỗi GPU. Olmo-core 3 cũng giảm chi phí định tuyến dữ liệu tới các chuyên gia phù hợp: rowwise expert parallelism đặt dữ liệu đã định tuyến trực tiếp vào bộ đệm đầu vào của chuyên gia, GPU-resident routing giữ siêu dữ liệu định tuyến trên GPU để CPU có thể xếp hàng công việc mà không phải chờ sao chép lại, và grouped GEMM kết hợp nhiều phép tính chuyên gia nhỏ để GPU thực thi chúng hiệu quả hơn. Báo cáo kỹ thuật mô tả thiết kế rowwise expert parallelism dựa trên NVSHMEM, ghi mỗi token trực tiếp vào bộ đệm của chuyên gia, với các phép nhân ma trận nhóm được lên lịch trên thiết bị, làm cho expert parallelism hoàn toàn không cần đồng bộ.
Olmo-core 3 hỗ trợ MXFP8, một định dạng số có độ chính xác thấp hơn. Trong một phép đo chuẩn có kiểm soát trên bốn GPU NVIDIA B300 với công việc được phân phối đồng đều giữa các chuyên gia, Ai2 báo cáo tốc độ đào tạo cao hơn khoảng 21% so với chuẩn BF16, trong khi bộ nhớ hoạt động tối đa giảm từ 103 GiB xuống 95 GiB, với phần lớn lợi nhuận đến từ tính toán feed-forward và việc di chuyển dữ liệu giữa các chuyên gia. Báo cáo bổ sung rằng các checkpoint không phụ thuộc vào topology ghi lại các tensor FP32 toàn cục một cách độc lập với bố cục song song, vì vậy một lần chạy có thể tiếp tục trên một topology khác, và trong so sánh có kiểm soát, việc tính lại kích hoạt đã loại bỏ gần hai phần ba bộ nhớ kích hoạt và giảm bộ nhớ tối đa khoảng một phần tư với chi phí giảm khoảng một phần năm tốc độ thông lượng.
Các Thử nghiệm Hàng nghìn tỷ Tham số và Giới hạn Được Nêu
Ai2 cho biết họ đã thực hiện các thử nghiệm chuẩn cho Olmo-core 3 trên nhiều cấu hình GPU NVIDIA B300, bao gồm một mô hình 1,2 nghìn tỷ tham số với 58,36 tỷ tham số hoạt động cho mỗi token trên 512 GPU, trong đó tốc độ thông lượng cao nhất được ghi nhận là 858 TFLOP/s trên mỗi GPU. Ai2 khẳng định các thử nghiệm này sử dụng định tuyến ngẫu nhiên để đo hiệu năng hệ thống thay vì chất lượng của mô hình đã được đào tạo. Báo cáo kỹ thuật liệt kê các điểm hoạt động đo được từ mô hình 12,9 tỷ tham số trên 16 GPU lên tới mô hình 1,2 nghìn tỷ tham số trên 512 GPU, và nêu rằng các tốc độ tiêu đề là tham chiếu hệ thống được đo dưới định tuyến ngẫu nhiên, không phải một đường cong mở rộng có kiểm soát hay một tuyên bố thời gian đạt chất lượng.
Ai2 cũng đã thử nghiệm DeepEP v2, một nền tảng phụ thay thế để giao tiếp giữa các chuyên gia trên các GPU, đạt được cấu hình với tổng cộng 2,38 nghìn tỷ tham số. Ai2 mô tả kết quả này là một thử nghiệm dung lượng ngắn, nhằm chứng minh quy mô mà Olmo-core 3 có thể đạt được chứ không phải hiệu năng đào tạo kéo dài. Báo cáo kỹ thuật, có tiêu đề “Supercharging Olmo-core for Efficient and Scalable MoE Training,” được đánh ngày tháng tháng 10 năm 2026; các tác giả của nó đến từ Allen Institute for AI và University of Washington, trong đó Tianhua Tao được liệt kê là tác giả chính và nhà phát triển chính.
Các phát hiện được ghi lại và Kế hoạch Olmo Thế hệ tiếp theo
Báo cáo ghi lại một mô hình lỗi mà Ai2 gọi là token gerrymandering, trong đó một điểm số dự định khuyến khích định tuyến cân bằng có thể cải thiện ngay cả khi khối lượng công việc thực tế trở nên kém cân bằng hơn. Các phát hiện khác được ghi lại bao gồm: việc giảm tốc độ học của các chuyên gia vì chúng xử lý ít token hơn không cải thiện kết quả trong họa hệ mô hình đã thử; các phép tính trên GPU mất thời gian khác nhau khi các giá trị được xử lý thay đổi, ngay cả khi kích thước ma trận giống nhau; và việc chồng lấn giao tiếp và tính toán trên các luồng GPU riêng biệt không luôn làm cho quá trình đào tạo nhanh hơn và trong một số thử nghiệm còn làm chậm thực thi toàn bộ. Báo cáo cũng mô tả các phương pháp đã thử nhưng không được áp dụng, bao gồm việc chuyển tải hoạt hoá sang CPU mà liên kết máy chủ không thể truyền và hai sơ đồ chồng lấn cạnh tranh với tính toán của chuyên gia để giành tài nguyên GPU.
Ai2 cho biết thế hệ tiếp theo của Olmo sẽ sử dụng kiến trúc MoE, và họ đang hướng tới việc đây sẽ là Olmo mạnh nhất từng có, được đào tạo trên bộ dữ liệu lớn nhất và với cửa sổ ngữ cảnh dài nhất. Tổ chức cho biết Olmo-core 3 hoàn toàn mở, vì vậy các nhà nghiên cứu và nhà phát triển có thể sử dụng nó để đào tạo các MoE riêng của họ, điều chỉnh cho phần cứng khác nhau, và thử nghiệm với định tuyến, song song hoá và các phần khác của hệ thống. kho mã Olmo-core trên GitHub mô tả dự án như các khối xây dựng PyTorch cho hệ sinh thái OLMo, mang giấy phép Apache-2.0, và có thể được cài đặt từ mã nguồn hoặc từ PyPI dưới tên ai2-olmo-core.












