AI 모델 및 플랫폼
Reflection AI가 501B 파라미터 오픈-웨이트 모델인 Beam을 공개

Reflection AI가 2026년 10월 5일에 Beam을 소개했습니다. 이는 첫 번째 오픈-웨이트 모델로, 총 5010억 파라미터 중 230억이 활성화된 희소 Mixture-of-Experts 시스템이며 코딩, 추론, 에이전시 작업을 위해 구축되었습니다.
Beam은 현재 최종 레드팀 테스트와 평가를 진행 중이며, 초기 버전이 대기자 명단을 통해 선택된 사용자 그룹에게 제공되고 있습니다. Reflection은 Beam을 시리즈의 첫 번째 모델이라고 설명하고, 이미 다음 모델을 위한 훈련을 진행 중이라고 밝혔습니다.
성능 및 효율성 주장
Reflection은 Beam을 코딩 및 에이전시 성능에 특별히 중점을 두고 훈련했다고 밝혔습니다. 이 회사는 모델이 GLM 5.2와 같은 더 큰 오픈 모델과 경쟁력이 있으며 코딩 및 에이전시 작업에서 Qwen 3.8-Max에 근접한다고 설명했으며, Kimi K3가 원시 능력에서는 앞선다는 점을 인정했습니다. Beam의 장점을 추론 시간 효율성으로 규정하고, 이 모델이 서구 오픈-웨이트 최전선을 앞당긴다고 말했습니다.
Reflection이 평가 스위트에서 보고한 점수는 Terminal Bench v2.1에서 80.1점, SWEBench Verified에서 80.9점, SWE Bench Pro v2-Hard에서 77.2점, AIME 2026에서 97.8점, 도구 없이 진행한 Humanity’s Last Exam에서 36.2점, 그리고 GPQA Diamond에서 90.5점입니다.
효율성 측면에서, 회사는 Beam이 고급 추론 벤치마크에서 GLM-5.2와 비슷한 점수를 얻으면서도 추론 연산량을 3~4배 적게 사용한다고 보고했으며, 2조 파라미터를 초과하는 모델(예: Qwen 3.8-Max) 대비 더 큰 이점을 보인다고 밝혔습니다. 게시물에 따르면, 이 추정치는 Artificial Analysis와 DataCurve 데이터를 기반으로 하며, 생성 연산량을 활성 파라미터 수의 두 배에 시도당 평균 생성 토큰 수를 곱한 값으로 근사합니다; 이 수치는 프롬프트 사전 채우기, 어텐션 연산 및 서비스 오버헤드를 제외했기 때문에, Reflection은 이를 실제 측정된 추론 비용이 아닌 대략적인 연산량 비교라고 설명했습니다.
Reflection은 또한 Beam을 성공적인 해결책을 보상하고 불필요한 토큰을 억제하는 조절 가능한 길이 패널티와 함께 훈련했으며, 사용자에게 제공되는 추론 노력 파라미터를 통해 사용자가 토큰 사용량과 성능을 교환할 수 있게 했다고 밝혔습니다. 낮은 설정은 짧은 응답을 선호하고, 높은 설정은 복잡한 작업에서 더 긴 추론을 가능하게 합니다.
발표에 따르면, 능력이 훈련 혼합을 넘어 일반화되었습니다: 추론, 소프트웨어 엔지니어링, 터미널 작업에 대한 강화 학습 중에 브라우징 작업이 없었음에도 불구하고 브라우징 성능이 향상되었으며, 웹 접근을 통해 모델이 스스로 다른 대형 언어 모델에 질의하고 OCR API를 사용해 문서를 읽는 방법을 학습했습니다. 시연 사례로는 공개 MTA 데이터를 기반으로 실시간 업데이트되는 뉴욕시 지하철 지도, p5.js로 작성된 3D 우주비행사 게임, 그리고 Beam이 16,200점의 전 세계 좌표 격자에서 95.5% 커버리지를 달성하며 포인트를 분류한 육지·수상 퍼즐이 포함되며, 이 결과는 게시물에서 Opus 5(92.5%)와 Fable 5(97.8%) 사이에 위치한다고 설명했습니다. 네 번째 시연에서는 Beam이 가장 작은 Gemma-4 모델을 Text2SQL 작업에 맞춰 파인튜닝하는 노트북을 생성했으며, Reflection에 따르면 이는 Gemma의 보류 테스트 정확도를 66.5% 상승시켰다고 합니다.
훈련 파이프라인
사전 훈련 및 데이터 큐레이션
Reflection은 Beam을 웹, 공개 소스 및 독점 라이선스 데이터셋에서 추출한 23.8조 토큰으로 사전 훈련했으며, 6,144대의 NVIDIA GB300 NVL72 GPU를 사용해 4주 미만에 전체 과정을 완료했다고 밝혔습니다. 회사는 그래디언트 노름 급증이나 잠재적 무음 데이터 손상으로 인한 9회의 반자동 되돌림을 보고했으며, 최종 모델에 남은 훈련 단계에 사용된 실제 시간 비율을 의미하는 goodput이 92.3%에 달했다고 전했습니다.
데이터 파이프라인은 파싱, 중복 제거 및 큐레이션을 통해 원시 인터넷 토큰의 약 95%를 제거했으며, Reflection은 기존 필터링 기법으로는 약 1.8조 개의 고품질 토큰을 놓쳤을 것이라고 밝혔습니다. 여기에는 큐레이션된 웹 코드 토큰의 87%가 포함됩니다. 별도의 파이프라인은 수천 대의 GPU를 활용해 자체 품질 분류기를 갖춘 비전-언어 OCR 모델로 PDF 아티팩트를 처리했으며, 중간 훈련 단계에서 Beam의 실질적인 컨텍스트 길이를 100만 토큰으로 확장했습니다.
게시물은 교차된 로컬 및 글로벌 어텐션, 세밀하게 라우팅된 전문가, 전문가 바이어스 업데이트의 코사인 감쇠와 함께 보조 손실이 없는 부하 균형을 결합한 아키텍처와, 깊이 기반 잔차 스케일링, SandwichNorm, 요소별 어텐션 게이팅, FP32 잔차 누적을 설명합니다. Reflection은 사전 훈련 종료 시 가장 바쁜 전문가의 부하가 평균의 1.04배에 달하는 거의 균일한 전문가 활용률과, 52계층 전체에 걸친 제한된 잔차 스트림 노름을 보고했습니다.
고컴퓨팅 강화 학습
강화 학습 캠페인은 4주 동안 10,500대의 NVIDIA GB300 GPU에서 1억 개 이상의 롤아웃을 생성했으며, 최대 컨텍스트 길이는 256,000 토큰이고 훈련 및 평가에 약 13억 개의 샌드박스를 사용했습니다. Reflection은 거의 백만 개에 달하는 코딩, 에이전시 및 STEM 환경을 주로 합성 데이터 파이프라인을 통해 확보했으며, 이를 현재까지 오픈 랩에서 수행된 가장 큰 강화 학습 실행 중 하나라고 설명했습니다.
회사는 평균 110,000개의 동시 롤아웃과 최대 170,000개의 동시 샌드박스를 유지했으며, 20개 이상의 클러스터, 두 개의 클라우드, 네 개의 지역에 걸쳐 10억 건이 넘는 샌드박스 생성 요청을 처리했다고 보고했습니다. 새로운 가중치는 중앙값 기준 약 12초 만에 추론 플릿에 도달했으며, 71건의 추론 사고가 학습 작업을 중단하지 않고 처리되었고, 동적 패킹 덕분에 학습 배치는 평균 99.99% 가득 찼습니다. Reflection은 비동기 시스템이 현재 정책보다 약 하루 정도 뒤처진 107개의 가중치 버전까지의 샘플 학습에서도 안정적으로 유지됐다고 밝혔습니다.
안전 및 정렬
정렬을 위해 Reflection은 동일한 사전 학습 체크포인트에서 별도의 감독 미세조정 및 행동 원칙을 목표로 하는 강화학습 파이프라인을 사용해 두 번째 모델을 훈련한 뒤, 다중 교사 온‑policy 증류를 통해 대규모 RL 교사와 병합했습니다. 이러한 원칙은 세 단계로 구성됩니다: 모델이 위반해서는 안 되는 규칙, 지속적으로 만족해야 하는 특성, 그리고 기본 상호작용 스타일.
안전 데이터셋은 적대적이고 반복적인 방식으로 구축되었으며, 각 라운드에서 성공한 공격이 다음 라운드 훈련에 다시 반영되었습니다. 안전 강화학습은 단일 턴, 다중 턴, 탈옥, 그리고 도구를 사용하는 모델에 압력을 가하는 시뮬레이션 적대자를 포함한 에이전시 시나리오까지 포괄했습니다. Reflection은 Best‑of‑N 상한만을 사용했을 때보다 RL 향상을 더 잘 예측할 수 있다고 밝혔으며, 상한 대비 0.79의 상관관계를 보고했습니다(상한은 0.46). 회사는 Beam의 기술 보고서에 안전 평가 결과를 발표하고, 자체 개발한 내부 안전 평가를 오픈소스로 공개할 예정이라고 밝혔습니다.
가용성 및 파트너십
자사의 소개 페이지에서 Reflection은 모델 가중치 공개, 연구 발표, 강화학습 도구 및 환경을 포함한 소프트웨어 오픈소스화를 약속하고 있습니다. 페이지는 Reflection이 NVIDIA와 함께 Dell AI Factory에서 검증되었으며, 미국 에너지부의 Genesis Mission 인증 컨소시엄 회원으로 17개 미국 국립 연구소에 오픈‑weight 모델을 제공하고, 신세계와 함께 250메가와트 규모의 주권 AI 클라우드를 한국에 구축 중이며, 미국 및 한국 정부의 지원을 받고 있다고 명시하고 있습니다.
Reflection은 2026년 10월 말에 Beam의 가중치를 Apache 2.0 라이선스로 공개할 예정이며, 기술 보고서, 모델 카드, 문서 및 모델 실행, 평가, 미세조정을 위한 전체 스택을 함께 제공한다고 밝혔습니다. 또한 배포 파트너와 오픈소스 라이브러리 및 하니스와의 통합도 출시 계획에 포함되어 있습니다.












