Mô hình và nền tảng AI

Reflection AI ra mắt Beam, mô hình Open-Weight 501 tỷ tham số

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Reflection AI giới thiệu Beam vào ngày 5 tháng 10 năm 2026, mô hình open-weight đầu tiên của mình: một hệ thống Mixture-of-Experts thưa thớt với tổng số 501 tỷ tham số và 23 tỷ tham số hoạt động, được xây dựng cho các công việc mã hoá, suy luận và tác vụ dạng agent.

Beam đang trải qua giai đoạn red‑teaming và đánh giá cuối cùng, và một phiên bản sớm đang được cung cấp cho một nhóm người dùng được chọn qua danh sách chờ. Reflection mô tả Beam là mô hình đầu tiên trong một loạt và cho biết nó đã bắt đầu đào tạo mô hình tiếp theo.

Các tuyên bố về khả năng và hiệu suất

Reflection cho biết họ đã đào tạo Beam với trọng tâm đặc biệt vào hiệu năng mã hoá và tác vụ dạng agent. Công ty mô tả mô hình này cạnh tranh với các mô hình mở lớn hơn như GLM 5.2 và đang tiến gần tới Qwen 3.8‑Max trong các nhiệm vụ mã hoá và agentic, đồng thời thừa nhận rằng Kimi K3 vẫn dẫn đầu về khả năng thô; họ cho rằng lợi thế của Beam là hiệu quả thời gian suy luận và nói rằng mô hình này đưa tiến bộ lên những gì họ gọi là ranh giới open‑weight phương Tây.

Các điểm số mà Reflection báo cáo từ bộ đánh giá của mình bao gồm 80.1 trên Terminal Bench v2.1, 80.9 trên SWEBench Verified, 77.2 trên SWE Bench Pro v2‑Hard, 97.8 trên AIME 2026, 36.2 trên Humanity’s Last Exam không dùng công cụ, và 90.5 trên GPQA Diamond.

Về hiệu suất, công ty báo cáo rằng Beam đạt các điểm số tương đương với GLM‑5.2 trên các chuẩn đoán suy luận nâng cao trong khi sử dụng ba đến bốn lần ít tính toán suy luận hơn, với lợi thế lớn hơn so với các mô hình có hơn hai nghìn tỷ tham số, như Qwen 3.8‑Max. Theo bài đăng, các ước tính dựa trên dữ liệu của Artificial Analysis và DataCurve và ước tính tính toán sinh ra là gấp đôi số lượng tham số hoạt động nhân với số token trung bình được sinh ra mỗi lần thử; vì các con số không tính bao gồm tiền điền prompt, các phép tính attention và chi phí phục vụ, Reflection mô tả chúng là so sánh tính toán ước tính chứ không phải chi phí suy luận đo lường.

Reflection cho biết họ cũng đã đào tạo Beam với một hình phạt độ dài có thể điều chỉnh, thưởng cho các giải pháp thành công đồng thời ngăn chặn token không cần thiết, và một tham số nỗ lực suy luận dành cho người dùng cho phép người dùng cân bằng việc sử dụng token với hiệu năng, với cài đặt thấp hơn ưu tiên phản hồi ngắn hơn và cài đặt cao hơn cho phép suy luận dài hơn trong các nhiệm vụ đòi hỏi.

Thông báo cho biết các khả năng đã được tổng quát vượt ra ngoài tập hợp đào tạo: trong quá trình học tăng cường về suy luận, kỹ thuật phần mềm và các nhiệm vụ terminal, hiệu suất duyệt web cải thiện mặc dù không có nhiệm vụ duyệt; và với khả năng truy cập web, mô hình tự học cách truy vấn các mô hình ngôn ngữ lớn khác và sử dụng API OCR để đọc tài liệu. Các minh chứng bao gồm một bản đồ tàu điện ngầm New York City cập nhật trực tiếp được xây dựng từ dữ liệu công cộng của MTA, một trò chơi phi hành gia 3D viết bằng p5.js, và một câu đố đất‑hoặc‑nước trong đó Beam phân loại các điểm trên lưới tọa độ toàn cầu gồm 16.200 điểm với độ bao phủ 95,5 %, kết quả này được bài đăng đặt giữa Opus 5 ở mức 92,5 % và Fable 5 ở mức 97,8 %. Trong minh chứng thứ tư, Beam tạo ra một notebook tinh chỉnh mô hình Gemma‑4 nhỏ nhất trên nhiệm vụ Text2SQL, mà Reflection cho biết đã nâng độ chính xác kiểm tra giữ lại của Gemma lên 66,5 %.

Quy trình đào tạo

Tiền đào tạo và Tổ chức dữ liệu

Reflection cho biết họ đã tiền đào tạo Beam trên 23,8 nghìn tỷ token lấy từ web, các nguồn công cộng và các bộ dữ liệu có giấy phép độc quyền, hoàn thành quá trình từ đầu đến cuối trong vòng chưa đầy bốn tuần trên 6.144 GPU NVIDIA GB300 NVL72. Công ty báo cáo có chín lần quay lại bán tự động, do các đỉnh gradient‑norm hoặc nghi ngờ lỗi dữ liệu im lặng, và cho biết goodput, được định nghĩa là tỷ lệ thời gian đồng hồ tường dành cho các bước đào tạo được giữ lại trong mô hình cuối cùng, đạt 92,3 %.

Quy trình dữ liệu đã loại bỏ khoảng 95 % token thô từ internet thông qua việc phân tích, loại bỏ trùng lặp và tổ chức, trong khi Reflection cho biết các kỹ thuật lọc truyền thống sẽ bỏ lỡ khoảng 1,8 nghìn tỷ token chất lượng cao mà họ đã giữ lại, bao gồm 87 % token mã web đã được tổ chức. Một quy trình riêng đã xử lý các tài liệu PDF bằng mô hình OCR thị giác‑ngôn ngữ với bộ phân loại chất lượng nội bộ trên hàng nghìn GPU, và một giai đoạn giữa đào tạo đã mở rộng độ dài ngữ cảnh hiệu quả của Beam lên một triệu token.

Bài đăng mô tả một kiến trúc kết hợp attention cục bộ và toàn cục xen kẽ, các chuyên gia được định tuyến chi tiết, và cân bằng tải không có mất mát phụ trợ với giảm dần cosine của các cập nhật độ lệch chuyên gia, cùng với việc mở rộng dư thừa dựa trên độ sâu, SandwichNorm, gating attention từng phần tử, và tích lũy dư thừa FP32. Reflection báo cáo việc sử dụng chuyên gia gần như đồng đều, với tải của chuyên gia bận rộn trung bình 1,04 lần mức trung bình vào cuối tiền đào tạo, và các chuẩn độ lệch luồng dư thừa được giới hạn trên tất cả 52 lớp.

Học tăng cường với tính toán cao

Chiến dịch học tăng cường đã tạo ra hơn 100 triệu rollout trên 10.500 GPU NVIDIA GB300 trong vòng bốn tuần, với độ dài ngữ cảnh tối đa 256.000 token và khoảng 1,3 tỷ sandbox được sử dụng cho việc đào tạo và chấm điểm. Reflection cho biết họ đã thu thập gần một triệu môi trường mã hoá, agentic và STEM, chủ yếu thông qua các pipeline dữ liệu tổng hợp, và mô tả nỗ lực này là một trong những lần chạy RL lớn nhất mà một phòng thí nghiệm mở đã thực hiện cho đến nay.

Công ty báo cáo duy trì trung bình 110.000 rollout đồng thời và lên tới 170.000 sandbox đồng thời, với hơn một tỷ yêu cầu tạo sandbox đã được xử lý trên hơn 20 cụm, hai đám mây và bốn khu vực. Các trọng số mới đạt được đội ngũ suy luận trong thời gian trung vị khoảng 12 giây, 71 sự cố suy luận đã được xử lý mà không phải dừng công việc đào tạo, và việc đóng gói động giữ các batch đào tạo trung bình đầy 99,99 %. Reflection cho biết hệ thống bất đồng bộ vẫn ổn định ngay cả khi học từ các mẫu lên tới 107 phiên bản trọng số, khoảng một ngày, so với chính sách hiện tại.

An toàn và Định hướng

Đối với việc định hướng, Reflection đã đào tạo một mô hình thứ hai từ cùng một checkpoint đã được tiền huấn luyện bằng một quy trình fine-tuning có giám sát riêng và RL nhắm vào các nguyên tắc hành vi, sau đó hợp nhất nó với giáo viên RL quy mô lớn thông qua việc chưng cất đa giáo viên theo chính sách. Các nguyên tắc được tổ chức thành ba cấp: các quy tắc mà mô hình không được vi phạm, các phẩm chất mà nó nên luôn đáp ứng, và phong cách tương tác mặc định.

Bộ dữ liệu an toàn được xây dựng một cách đối kháng và lặp lại, với các cuộc tấn công thành công của mỗi vòng được đưa trở lại vào vòng đào tạo tiếp theo, và RL an toàn bao phủ các kịch bản một lượt, nhiều lượt, jailbreak và đại lý, trong đó một kẻ thù mô phỏng gây áp lực lên mô hình sử dụng công cụ. Reflection cho biết họ có thể dự đoán lợi nhuận RL tốt hơn so với chỉ sử dụng ngưỡng Best-of-N, với hệ số tương quan 0,79 so với 0,46 cho ngưỡng. Công ty cho biết sẽ công bố kết quả đánh giá an toàn trong báo cáo kỹ thuật của Beam và sẽ mã nguồn mở các đánh giá an toàn nội bộ mà họ đã phát triển.

Khả dụng và Đối tác

Trên trang giới thiệu của mình, Reflection nêu ra các cam kết về việc phát hành trọng số mô hình, công bố nghiên cứu và mã nguồn mở phần mềm, bao gồm các công cụ và môi trường học tăng cường. Trang này cho biết Reflection đã được xác nhận trên Dell AI Factory với NVIDIA, là thành viên liên minh được chứng nhận của Sứ mệnh Genesis của Bộ Năng lượng, phục vụ 17 Phòng thí nghiệm Quốc gia Hoa Kỳ với các mô hình mở, và đang xây dựng một đám mây AI chủ quyền công suất 250 megawatt tại Hàn Quốc cùng Shinsegae, được hỗ trợ bởi chính phủ Hoa Kỳ và Hàn Quốc.

Reflection cho biết họ sẽ phát hành trọng số của Beam dưới giấy phép Apache 2.0 vào cuối tháng 10 năm 2026, kèm theo báo cáo kỹ thuật, thẻ mô hình, tài liệu và toàn bộ ngăn xếp để chạy, đánh giá và tinh chỉnh mô hình, với các đối tác phân phối và tích hợp với các thư viện mã nguồn mở và các công cụ hỗ trợ dự kiến sẽ ra mắt.

Jonas Reeve là một nhà phân tích được tạo ra bằng AI tại Unite.AI, tập trung vào AI nhận thức, trí tuệ nhân tạo chung (AGI), và các nền tảng lý thuyết của trí thông minh máy móc. Công việc của ông khám phá cách mà học tập, suy luận, trí nhớ và trừu tượng xuất hiện trong cả hệ thống sinh học và nhân tạo, tạo ra các mối liên kết giữa kiến trúc AI hiện đại và những câu hỏi lâu đời trong khoa học nhận thức và triết học tâm trí.

Với cách tiếp cận khái niệm và suy ngẫm, Jonas xem xét các khung như mô hình suy luận, hệ thống đại lý, nhận thức nổi lên, và lý thuyết cân chỉnh, nhằm làm rõ tiến bộ hướng tới AGI thực sự có nghĩa là gì — và không phải là gì. Thay vì chạy theo các thời gian biểu hay sự thổi phồng, ông nhấn mạnh các nguyên tắc nền tảng, tính chặt chẽ khái niệm, và giới hạn của các mô hình hiện tại.

Các bài viết do Jonas Reeve viết được tạo ra bằng AI và được đội ngũ biên tập của Unite.AI xem xét để đảm bảo độ chính xác, rõ ràng và thảo luận có trách nhiệm về các khái niệm AI tiên tiến.