Modelos e plataformas de IA
Reflection AI apresenta Beam, um modelo de peso aberto com 501 bilhões de parâmetros

Reflection AI introduziu Beam em 5 de outubro de 2026, seu primeiro modelo de peso aberto: um sistema esparso de Mixture-of-Experts com 501 bilhões de parâmetros no total e 23 bilhões ativos, desenvolvido para codificação, raciocínio e cargas de trabalho de agentes.
Beam está passando por testes finais de red‑team e avaliações, e uma versão preliminar está sendo oferecida a um grupo seleto de usuários por meio de uma lista de espera. A Reflection descreveu o Beam como o primeiro modelo de uma série e afirmou que já está treinando o que vem a seguir.
Alegações de Capacidade e Eficiência
A Reflection afirmou que treinou o Beam com foco particular em desempenho de codificação e de agentes. A empresa descreveu o modelo como competitivo com modelos abertos maiores, como o GLM 5.2, e como aproximando‑se do Qwen 3.8‑Max em tarefas de codificação e de agentes, ao mesmo tempo reconhecendo que Kimi K3 ainda está à frente em capacidade bruta; caracterizou a vantagem do Beam como eficiência no tempo de inferência e disse que o modelo avança o que chama de fronteira ocidental de peso aberto.
Pontuações que a Reflection relatou em sua suíte de avaliação incluem 80,1 no Terminal Bench v2.1, 80,9 no SWEBench Verified, 77,2 no SWE Bench Pro v2-Hard, 97,8 no AIME 2026, 36,2 no Humanity’s Last Exam sem ferramentas e 90,5 no GPQA Diamond.
Em termos de eficiência, a empresa informou que o Beam atinge pontuações comparáveis às do GLM‑5.2 em benchmarks avançados de raciocínio, usando de três a quatro vezes menos computação de inferência, com ganhos ainda maiores em relação a modelos com mais de dois trilhões de parâmetros, como o Qwen 3.8‑Max. Segundo a postagem, as estimativas baseiam‑se em dados da Artificial Analysis e da DataCurve e aproximam o custo de geração como duas vezes a contagem de parâmetros ativos multiplicada pela média de tokens gerados por tentativa; como os números excluem o preenchimento do prompt, as operações de atenção e a sobrecarga de serviço, a Reflection descreveu‑os como uma comparação aproximada de computação, e não como custo de inferência medido.
A Reflection afirmou que também treinou o Beam com uma penalidade de comprimento controlável que recompensa soluções bem‑sucedidas ao mesmo tempo que desencoraja tokens desnecessários, e que um parâmetro de esforço de raciocínio voltado ao usuário permite que os usuários troquem o uso de tokens por desempenho, com configurações mais baixas favorecendo respostas mais curtas e configurações mais altas permitindo raciocínio mais longo em tarefas exigentes.
O anúncio relata que as capacidades se generalizaram além da mistura de treinamento: durante o aprendizado por reforço em raciocínio, engenharia de software e tarefas de terminal, o desempenho de navegação melhorou apesar da ausência de tarefas de navegação, e com acesso à web o modelo aprendeu por conta própria a consultar outros grandes modelos de linguagem e a usar APIs de OCR para ler documentos. As demonstrações incluem um mapa do metrô de New York City atualizado em tempo real, construído a partir de dados públicos da MTA, um jogo 3D de astronauta escrito em p5.js e um quebra‑cabeça terra‑ou‑água no qual o Beam classificou pontos em uma grade global de 16.200 pontos com 95,5 % de cobertura, resultado que a postagem posiciona entre o Opus 5, com 92,5 %, e o Fable 5, com 97,8 %. Em uma quarta demonstração, o Beam produziu um notebook afinando o menor modelo Gemma‑4 em uma tarefa Text2SQL, o que a Reflection disse ter elevado a precisão de teste reservada do Gemma em 66,5 %.
Pipeline de Treinamento
Pré‑treinamento e Curadoria de Dados
A Reflection afirmou que pré‑treinou o Beam em 23,8 trilhões de tokens provenientes da web, de fontes públicas e de conjuntos de dados licenciados proprietários, concluindo a execução de ponta a ponta em menos de quatro semanas em 6.144 NVIDIA GB300 NVL72 GPUs. A empresa relatou nove retrocessos semiautomáticos, atribuídos a picos de norma de gradiente ou suspeita de corrupção silenciosa de dados, e disse que o goodput, definido como a parcela do tempo de relógio‑real gasto em etapas de treinamento mantidas no modelo final, atingiu 92,3 %.
A pipeline de dados eliminou cerca de 95 % dos tokens brutos da internet por meio de análise, desduplicação e curadoria, enquanto a Reflection afirmou que técnicas convencionais de filtragem teriam perdido aproximadamente 1,8 trilhão de tokens de alta qualidade que foram retidos, incluindo 87 % dos seus tokens de código web curados. Uma pipeline separada processou artefatos PDF usando um modelo de OCR visão‑linguagem com classificadores de qualidade internos em milhares de GPUs, e uma fase de meio‑treinamento estendeu o comprimento de contexto efetivo do Beam para um milhão de tokens.
A postagem descreve uma arquitetura que combina atenção local e global intercalada, especialistas roteados de granularidade fina e balanceamento de carga sem perdas auxiliares com decaimento cosseno das atualizações de viés dos especialistas, juntamente com escalonamento residual baseado em profundidade, SandwichNorm, controle de atenção elemento a elemento e acumulação residual em FP32. A Reflection relatou utilização quase uniforme dos especialistas, com a carga do especialista mais ocupado média de 1,04 vezes a média ao final do pré‑treinamento, e normas de fluxo residual limitadas em todas as 52 camadas.
Aprendizado por Reforço de Alta Computação
A campanha de aprendizado por reforço gerou mais de 100 milhões de rollouts em 10.500 GPUs NVIDIA GB300 ao longo de quatro semanas, com um comprimento máximo de contexto de 256.000 tokens e aproximadamente 1,3 bilhão de sandboxes usados para treinamento e avaliação. A Reflection afirmou que obteve quase um milhão de ambientes de codificação, agentes e STEM, principalmente por meio de pipelines de dados sintéticos, e descreveu o esforço como, ao seu ver, uma das maiores execuções de RL realizadas por um laboratório aberto até o momento.
A empresa relatou manter uma média de 110.000 rollouts simultâneos e até 170.000 sandboxes simultâneos, com mais de um bilhão de solicitações de criação de sandbox processadas em mais de 20 clusters, duas nuvens e quatro regiões. Os novos pesos chegaram à frota de inferência em uma mediana de aproximadamente 12 segundos, 71 incidentes de inferência foram tratados sem encerrar o trabalho de treinamento, e o empacotamento dinâmico manteve os lotes de treinamento 99,99 % cheios em média. A Reflection afirmou que o sistema assíncrono permaneceu estável mesmo ao aprender a partir de amostras de até 107 versões de peso, aproximadamente um dia, atrás da política atual.
Segurança e Alinhamento
Para o alinhamento, a Reflection treinou um segundo modelo a partir do mesmo checkpoint pré‑treinado usando um pipeline separado de ajuste fino supervisionado e RL focado em princípios comportamentais, e então o mesclou com o professor de RL em larga escala por meio de destilação on‑policy multi‑professor. Os princípios estão organizados em três níveis: regras que o modelo não deve violar, qualidades que deve satisfazer consistentemente e um estilo de interação padrão.
O conjunto de dados de segurança foi construído de forma adversarial e iterativa, com os ataques bem‑sucedidos de cada rodada reincorporados à rodada seguinte de treinamento, e o RL de segurança abrangeu cenários de turno único, multi‑turno, jailbreak e agentes, nos quais um adversário simulado pressiona um modelo que utiliza ferramentas. A Reflection afirmou que pode prever ganhos de RL melhor do que apenas um teto Best‑of‑N, reportando uma correlação de 0,79 contra 0,46 para o teto. A empresa declarou que publicará os resultados de sua avaliação de segurança no relatório técnico do Beam e disponibilizará como código aberto as avaliações internas de segurança que desenvolveu.
Disponibilidade e Parcerias
Em sua página Sobre, a Reflection descreve compromissos de liberar pesos de modelo, publicar sua pesquisa e disponibilizar o software como código aberto, incluindo ferramentas e ambientes de aprendizado por reforço. A página afirma que a Reflection está validada no Dell AI Factory com NVIDIA, que é membro certificado do consórcio da Missão Genesis do Departamento de Energia, atendendo aos 17 Laboratórios Nacionais dos EUA com seus modelos de peso aberto, e que está construindo uma nuvem soberana de IA de 250 megawatts na Coreia do Sul com a Shinsegae, apoiada pelos governos dos EUA e da Coreia.
A Reflection afirmou que lançará os pesos do Beam sob licença Apache 2.0 ainda em outubro de 2026, acompanhados de um relatório técnico, ficha do modelo, documentação e todo o stack para executar, avaliar e ajustar o modelo, com parceiros de distribuição e integrações com bibliotecas de código aberto e harnesses planejados para o lançamento.












