โมเดลและแพลตฟอร์ม AI
Reflection AI เปิดตัว Beam โมเดลเปิดน้ำหนักขนาด 501 พันล้านพารามิเตอร์

Reflection AI แนะนำ Beam เมื่อวันที่ 5 ตุลาคม 2026 ซึ่งเป็นโมเดลเปิดน้ำหนักรุ่นแรกของบริษัท: ระบบ Mixture-of-Experts แบบกระจางที่มีพารามิเตอร์ทั้งหมด 501 พันล้านและพารามิเตอร์ที่ใช้งานจริง 23 พันล้าน, สร้างขึ้นสำหรับการเขียนโค้ด, การให้เหตุผล, และงานแบบเอเจนท์
Beam กำลังอยู่ในขั้นตอนการทดสอบ red‑team สุดท้ายและการประเมินผล, และเวอร์ชันเริ่มต้นกำลังเปิดให้กลุ่มผู้ใช้ที่คัดเลือกผ่านรายการรอคอย. Reflection อธิบายว่า Beam เป็นโมเดลแรกในชุดและระบุว่ากำลังฝึกฝนรุ่นต่อไปอยู่แล้ว
ข้ออ้างความสามารถและประสิทธิภาพ
Reflection กล่าวว่ามันฝึก Beam โดยให้ความสำคัญเป็นพิเศษกับการเขียนโค้ดและประสิทธิภาพแบบเอเจนท์. บริษัทอธิบายว่าโมเดลนี้มีการแข่งขันกับโมเดลเปิดขนาดใหญ่เช่น GLM 5.2 และใกล้เคียงกับ Qwen 3.8‑Max ในงานเขียนโค้ดและงานเอเจนท์, ในขณะที่ยอมรับว่า Kimi K3 ยังเหนือกว่าในความสามารถดิบ; บริษัทระบุว่าข้อได้เปรียบของ Beam คือประสิทธิภาพในช่วงเวลาการสรุปผลและกล่าวว่าโมเดลนี้ก้าวหน้าในสิ่งที่บริษัทเรียกว่าแนวหน้าของโมเดลเปิดน้ำหนักในตะวันตก
คะแนนที่ Reflection รายงานจากชุดการประเมินของตนรวมถึง 80.1 บน Terminal Bench v2.1, 80.9 บน SWEBench Verified, 77.2 บน SWE Bench Pro v2‑Hard, 97.8 บน AIME 2026, 36.2 บน Humanity’s Last Exam โดยไม่มีเครื่องมือ, และ 90.5 บน GPQA Diamond
ในด้านประสิทธิภาพ, บริษัทรายงานว่า Beam ได้คะแนนที่เทียบเท่ากับ GLM‑5.2 บนเกณฑ์การให้เหตุผลขั้นสูงในขณะที่ใช้การคำนวณการสรุปผลน้อยกว่าสามถึงสี่เท่า, โดยมีการเพิ่มประสิทธิภาพที่มากขึ้นเมื่อเทียบกับโมเดลที่มีพารามิเตอร์มากกว่าสองล้านล้านเช่น Qwen 3.8‑Max. ตามที่โพสต์ระบุ, การประมาณค่าถูกดึงมาจากข้อมูล Artificial Analysis และ DataCurve และประมาณการคอมพิวต์การสร้างเป็นสองเท่าของจำนวนพารามิเตอร์ที่ใช้งานคูณด้วยค่าเฉลี่ยของโทเคนที่สร้างต่อการพยายาม; เนื่องจากตัวเลขเหล่านี้ไม่รวมการเติมคำสั่งเริ่มต้น, การดำเนินการ attention, และค่าโอเวอร์เฮดของการให้บริการ, Reflection จึงอธิบายว่ามันเป็นการเปรียบเทียบคอมพิวต์โดยประมาณแทนค่าใช้จ่ายการสรุปผลที่วัดได้
Reflection กล่าวว่ามันยังฝึก Beam ด้วยการลงโทษความยาวที่ควบคุมได้ซึ่งให้รางวัลกับวิธีแก้ที่สำเร็จในขณะเดียวกันก็ไม่ส่งเสริมโทเคนที่ไม่จำเป็น, และพารามิเตอร์ความพยายามในการให้เหตุผลที่ผู้ใช้มองเห็นทำให้ผู้ใช้สามารถแลกเปลี่ยนการใช้โทเคนกับประสิทธิภาพได้, โดยการตั้งค่าต่ำจะให้ความสำคัญกับการตอบสั้นและการตั้งค่าสูงจะอนุญาตให้มีการให้เหตุผลที่ยาวขึ้นในงานที่ท้าทาย
การประกาศระบุว่าความสามารถได้ขยายออกไปนอกเหนือจากชุดการฝึก: ระหว่างการเรียนรู้เสริมในงานให้เหตุผล, วิศวกรรมซอฟต์แวร์, และงานเทอร์มินัล, ประสิทธิภาพการท่องเว็บดีขึ้นแม้ไม่มีงานท่องเว็บ, และด้วยการเข้าถึงเว็บโมเดลได้เรียนรู้ด้วยตนเองให้สอบถามโมเดลภาษาใหญ่ตัวอื่นและใช้ API OCR เพื่ออ่านเอกสาร. การสาธิตรวมถึงแผนที่รถไฟใต้ดินนิวยอร์กซิตี้ที่อัปเดตแบบสดจากข้อมูลสาธารณะของ MTA, เกมอวกาศ 3 มิติที่เขียนด้วย p5.js, และปริศนาแยกที่ดินหรือที่น้ำที่ Beam ทำการจัดประเภทจุดบนตารางพิกัดทั่วโลกจำนวน 16,200 จุดด้วยความครอบคลุม 95.5 เปอร์เซ็นต์, ผลลัพธ์ที่โพสต์ระบุว่าอยู่ระหว่าง Opus 5 ที่ 92.5 เปอร์เซ็นต์และ Fable 5 ที่ 97.8 เปอร์เซ็นต์. ในการสาธิตครั้งที่สี่, Beam สร้างโน้ตบุ๊กที่ปรับจูนโมเดล Gemma‑4 ที่เล็กที่สุดบนงาน Text2SQL, ซึ่ง Reflection กล่าวว่าช่วยเพิ่มความแม่นยำของการทดสอบที่เก็บไว้ของ Gemma ขึ้น 66.5 เปอร์เซ็นต์
กระบวนการฝึกโมเดล
การฝึกล่วงหน้าและการคัดสรรข้อมูล
Reflection กล่าวว่ามันได้ทำการฝึกล่วงหน้า Beam ด้วยโทเคนจำนวน 23.8 ล้านล้านโทเคนที่มาจากเว็บ, แหล่งสาธารณะ, และชุดข้อมูลที่มีลิขสิทธิ์เป็นของบริษัท, เสร็จสิ้นการรันจากต้นจนจบภายในสี่สัปดาห์บน GPU จำนวน 6,144 ตัว NVIDIA GB300 NVL72. บริษัทรายงานว่ามีการย้อนกลับกึ่งอัตโนมัติทั้งหมดเก้าครั้ง, ซึ่งสาเหตุจากการพุ่งของ gradient‑norm หรือสงสัยว่ามีการเสียหายข้อมูลแบบเงียบ, และระบุว่า goodup ซึ่งกำหนดเป็นสัดส่วนของเวลานาฬิกาจริงที่ใช้ในขั้นตอนการฝึกที่ยังคงอยู่ในโมเดลสุดท้าย, ถึง 92.3 เปอร์เซ็นต์
กระบวนการข้อมูลได้กำจัดโทเคนอินเทอร์เน็ตดิบประมาณ 95 เปอร์เซ็นต์ผ่านการแยกวิเคราะห์, การกำจัดสำเนาซ้ำ, และการคัดสรร, ในขณะที่ Reflection กล่าวว่ากระบวนการกรองแบบดั้งเดิมจะพลาดโทเคนคุณภาพสูงประมาณ 1.8 ล้านล้านโทเคนที่บริษัทเก็บไว้, รวมถึง 87 เปอร์เซ็นต์ของโทเคนเว็บ‑โค้ดที่คัดสรร. กระบวนการแยกต่างหากได้ประมวลผลไฟล์ PDF ด้วยโมเดล OCR ภาพ‑ภาษา พร้อมตัวจำแนกคุณภาพภายในองค์กรบน GPU จำนวนหลายพันเครื่อง, และขั้นตอนการฝึกกลางได้ขยายความยาวบริบทที่มีประสิทธิภาพของ Beam ไปถึงหนึ่งล้านโทเคน
โพสต์อธิบายสถาปัตยกรรมที่ผสานการใส่ใจแบบท้องถิ่นและทั่วโลกสลับกัน, ผู้เชี่ยวชาญที่กำหนดเส้นทางแบบละเอียด, และการกระจายโหลดที่ไม่มีการสูญเสียเสริมด้วยการลดลงแบบโคไซน์ของการอัปเดตอคติผู้เชี่ยวชาญ, พร้อมกับการสเกลแบบ residual ตามความลึก, SandwichNorm, การกั้น attention แบบองค์ประกอบ, และการสะสม residual แบบ FP32. Reflection รายงานว่าการใช้ผู้เชี่ยวชาญใกล้เคียงกับสม่ำเสมอ, โดยโหลดของผู้เชี่ยวชาญที่ทำงานหนักที่สุดมีค่าเฉลี่ยเท่ากับ 1.04 เท่าของค่าเฉลี่ยเมื่อสิ้นสุดการฝึกล่วงหน้า, และมีการจำกัดค่า norm ของสตรีม residual ทั่วทั้ง 52 ชั้น
การเรียนรู้เสริมด้วยการคำนวณสูง
แคมเปญการเรียนรู้เสริมได้สร้าง rollouts มากกว่า 100 ล้านครั้งบน GPU จำนวน 10,500 ตัว NVIDIA GB300 ภายในสี่สัปดาห์, โดยมีความยาวบริบทสูงสุดที่ 256,000 โทเคนและใช้ sandbox ประมาณ 1.3 พันล้านครั้งสำหรับการฝึกและการให้คะแนน. Reflection กล่าวว่ามันได้รวบรวมสภาพแวดล้อมการเขียนโค้ด, งานเอเจนท์, และ STEM ใกล้หนึ่งล้านรายการ, ส่วนใหญ่ผ่านกระบวนการ ข้อมูลสังเคราะห์, และอธิบายความพยายามนี้ว่าเป็นหนึ่งในรัน RL ที่ใหญ่ที่สุดที่ห้องทดลองเปิดดำเนินการจนถึงปัจจุบัน
บริษัทรายงานว่ารักษาอัตราเฉลี่ยของการ rollout พร้อมกัน 110,000 รายการและสูงสุดถึง 170,000 sandbox พร้อมกัน โดยมีคำขอสร้าง sandbox มากกว่าหนึ่งพันล้านรายการที่ดำเนินการผ่านคลัสเตอร์มากกว่า 20 คลัสเตอร์, สองคลาวด์, และสี่ภูมิภาค น้ำหนักใหม่ถึงระบบ inference ในค่ากลางประมาณ 12 วินาที, 71 เหตุการณ์ inference ถูกจัดการโดยไม่ต้องยุติงานฝึก, และการบรรจุแบบไดนามิกทำให้แบตช์การฝึกเต็ม 99.99 เปอร์เซ็นต์โดยเฉลี่ย. Reflection กล่าวว่า ระบบแบบอะซิงโครนัสยังคงเสถียรแม้เมื่อเรียนรู้จากตัวอย่างที่มีเวอร์ชันน้ำหนักสูงถึง 107 เวอร์ชัน, ประมาณหนึ่งวัน, หลังนโยบายปัจจุบัน.
ความปลอดภัยและการจัดแนว
เพื่อการจัดแนว, Reflection ฝึกโมเดลที่สองจากเช็คพอยต์ pretrained เดียวกันโดยใช้การปรับแต่งที่มีการดูแลและ pipeline RL แยกที่มุ่งเน้นไปที่หลักการพฤติกรรม, จากนั้นผสานกับผู้สอน RL ขนาดใหญ่ผ่านการสกัดความรู้แบบหลายผู้สอนบนนโยบาย. หลักการเหล่านี้จัดเป็นสามระดับ: กฎที่โมเดลต้องไม่ละเมิด, คุณลักษณะที่โมเดลควรปฏิบัติตามอย่างสม่ำเสมอ, และสไตล์การโต้ตอบเริ่มต้น.
ชุดข้อมูลความปลอดภัยถูกสร้างแบบต่อสู้และทำซ้ำหลายครั้ง, โดยการโจมตีที่สำเร็จในแต่ละรอบถูกนำกลับเข้าสู่รอบการฝึกต่อไป, และ RL ด้านความปลอดภัยครอบคลุมสถานการณ์แบบหนึ่งรอบ, หลายรอบ, jailbreak, และ agentic ที่ในนั้นฝ่ายตรงข้ามจำลองกดดันโมเดลที่ใช้เครื่องมือ. Reflection กล่าวว่า มันสามารถทำนายการเพิ่มประสิทธิภาพของ RL ได้ดีกว่าการใช้เพียง Best-of-N ceiling, โดยรายงานความสัมพันธ์ที่ 0.79 เทียบกับ 0.46 สำหรับ ceiling. บริษัทกล่าวว่าจะเผยแพร่ผลการประเมินความปลอดภัยในรายงานเทคนิคของ Beam และจะเปิดซอร์สการประเมินความปลอดภัยภายในที่พัฒนาขึ้น.
ความพร้อมใช้งานและความร่วมมือ
บน หน้าเกี่ยวกับ ของบริษัท, Reflection ระบุพันธสัญญาในการปล่อยน้ำหนักโมเดล, การเผยแพร่งานวิจัย, และการเปิดซอร์สซอฟต์แวร์, รวมถึงเครื่องมือและสภาพแวดล้อม reinforcement learning. หน้าเว็บระบุว่า Reflection ได้รับการตรวจสอบบน Dell AI Factory ร่วมกับ NVIDIA, เป็นสมาชิกสหภาพที่ได้รับการรับรองของโครงการ Genesis Mission ของกระทรวงพลังงานสหรัฐ, ให้บริการ 17 สถาบันวิจัยระดับชาติของสหรัฐด้วยโมเดลเปิดน้ำหนัก, และกำลังสร้างคลาวด์ AI รัฐธรรมนูญขนาด 250-megawatt ในเกาหลีใต้ร่วมกับ Shinsegae, โดยได้รับการสนับสนุนจากรัฐบาลสหรัฐและเกาหลี.
Reflection กล่าวว่า จะปล่อยน้ำหนักของ Beam ภายใต้ใบอนุญาต Apache 2.0 ในช่วงปลายเดือนตุลาคม 2026, พร้อมด้วยรายงานเทคนิค, บัตรโมเดล, เอกสาร, และสแตกเต็มสำหรับการรัน, การประเมิน, และการปรับแต่งโมเดล, พร้อมกับพันธมิตรการจัดจำหน่ายและการผสานรวมกับไลบรารีโอเพ่นซอร์สและฮาร์เนสที่วางแผนจะเปิดตัว.












