Modèles et plateformes d’IA

Reflection AI dévoile Beam, un modèle à poids ouvert de 501 milliards de paramètres

mm
Ajouter Unite.AI à vos sources préférées sur Google

Reflection AI a présenté Beam le 5 octobre 2026, son premier modèle à poids ouvert : un système Mixture-of-Experts parcimonieux avec 501 milliards de paramètres au total et 23 milliards actifs, conçu pour le codage, le raisonnement et les charges de travail agentiques.

Beam fait l’objet d’une dernière phase de red‑team et d’évaluations, et une version préliminaire est proposée à un groupe sélectionné d’utilisateurs via une liste d’attente. Reflection a décrit Beam comme le premier modèle d’une série et a indiqué qu’il forme déjà ce qui suivra.

Déclarations de capacités et d’efficacité

Reflection a indiqué qu’elle a entraîné Beam avec un accent particulier sur le codage et la performance agentique. L’entreprise a décrit le modèle comme compétitif avec des modèles ouverts plus grands tels que GLM 5.2 et comme approchant Qwen 3.8‑Max sur les tâches de codage et d’agence, tout en reconnaissant que Kimi K3 reste en tête en termes de capacité brute ; elle a caractérisé l’avantage de Beam comme étant l’efficacité au moment de l’inférence et a déclaré que le modèle fait progresser ce qu’elle appelle la frontière occidentale des modèles à poids ouvert.

Les scores que Reflection a rapportés dans sa suite d’évaluation comprennent 80,1 sur Terminal Bench v2.1, 80,9 sur SWEBench Verified, 77,2 sur SWE Bench Pro v2-Hard, 97,8 sur AIME 2026, 36,2 sur Humanity’s Last Exam sans outils, et 90,5 sur GPQA Diamond.

En matière d’efficacité, l’entreprise a indiqué que Beam obtient des scores comparables à ceux de GLM‑5.2 sur des benchmarks de raisonnement avancé tout en utilisant trois à quatre fois moins de calcul d’inférence, avec des gains plus importants par rapport aux modèles de plus de deux trillions de paramètres, tels que Qwen 3.8‑Max. Selon le billet, les estimations s’appuient sur les données d’Artificial Analysis et de DataCurve et approximent le calcul de génération comme deux fois le nombre de paramètres actifs multiplié par le nombre moyen de jetons générés par tentative ; comme les chiffres excluent le préremplissage de l’invite, les opérations d’attention et les frais de service, Reflection les décrit comme une comparaison de calcul approximative plutôt que comme un coût d’inférence mesuré.

Reflection a également indiqué qu’elle a entraîné Beam avec une pénalité de longueur contrôlable qui récompense les solutions réussies tout en décourageant les jetons inutiles, et qu’un paramètre d’effort de raisonnement destiné aux utilisateurs permet d’échanger l’utilisation de jetons contre la performance, les réglages bas favorisant des réponses plus courtes et les réglages élevés autorisant un raisonnement plus long sur des tâches exigeantes.

L’annonce indique que les capacités se sont généralisées au‑delà du mélange d’entraînement : pendant l’apprentissage par renforcement sur le raisonnement, le génie logiciel et les tâches terminales, les performances de navigation se sont améliorées malgré l’absence de tâches de navigation, et avec l’accès au web le modèle a appris de façon autonome à interroger d’autres grands modèles de langage et à utiliser des API OCR pour lire des documents. Les démonstrations comprennent une carte du métro de New York mise à jour en temps réel construite à partir des données publiques de la MTA, un jeu d’astronaute 3D écrit en p5.js, et un puzzle terre‑ou‑eau dans lequel Beam a classé des points sur une grille globale de 16 200 points avec une couverture de 95,5 pour cent, un résultat que le billet situe entre Opus 5 à 92,5 pour cent et Fable 5 à 97,8 pour cent. Dans une quatrième démonstration, Beam a produit un notebook ajustant finement le plus petit modèle Gemma‑4 sur une tâche Text2SQL, ce que Reflection a indiqué comme une hausse de 66,5 pour cent de la précision du test hors‑échantillon de Gemma.

Pipeline d’entraînement

Pré‑entraînement et curation des données

Reflection a indiqué qu’elle a pré‑entraîné Beam sur 23,8 trillions de jetons provenant du web, de sources publiques et de jeux de données propriétaires sous licence, terminant l’exécution de bout en bout en moins de quatre semaines sur 6 144 NVIDIA GB300 NVL72 GPU. L’entreprise a signalé neuf retours semi‑automatiques, attribués à des pics de norme de gradient ou à une suspicion de corruption silencieuse des données, et a déclaré que le bon débit, défini comme la part du temps réel consacrée aux étapes d’entraînement conservées dans le modèle final, a atteint 92,3 pour cent.

Le pipeline de données a éliminé environ 95 pour cent des jetons bruts d’Internet grâce à l’analyse, la déduplication et la curation, tandis que Reflection a indiqué que les techniques de filtrage conventionnelles auraient manqué environ 1,8 trillion de jetons de haute qualité qu’elle a conservés, y compris 87 pour cent de ses jetons web‑code curés. Un pipeline distinct a traité des artefacts PDF à l’aide d’un modèle OCR vision‑langage avec des classificateurs de qualité internes sur des milliers de GPU, et une étape de mi‑entraînement a étendu la longueur de contexte effective de Beam à un million de jetons.

Le billet décrit une architecture combinant attention locale et globale entrelacée, experts routés à granularité fine, et équilibrage de charge sans perte auxiliaire avec décroissance cosinus des mises à jour du biais d’expert, ainsi que mise à l’échelle résiduelle basée sur la profondeur, SandwichNorm, porte d’attention élémentaire, et accumulation résiduelle en FP32. Reflection a rapporté une utilisation des experts presque uniforme, la charge de l’expert le plus occupé moyen étant 1,04 fois la moyenne à la fin du pré‑entraînement, et des normes de flux résiduel limitées sur les 52 couches.

Apprentissage par renforcement à haute capacité de calcul

La campagne d’apprentissage par renforcement a généré plus de 100 millions de rollouts sur 10 500 GPU NVIDIA GB300 pendant quatre semaines, avec une longueur de contexte maximale de 256 000 jetons et environ 1,3 milliard de sandbox utilisés pour l’entraînement et l’évaluation. Reflection a indiqué qu’elle a obtenu près d’un million d’environnements de codage, d’agence et STEM, principalement via des pipelines de données synthétiques, et a décrit cet effort comme étant, selon elle, l’une des plus grandes exécutions de RL menées par un laboratoire ouvert à ce jour.

La société a déclaré maintenir en moyenne 110 000 déploiements simultanés et jusqu’à 170 000 bacs d’essai simultanés, avec plus d’un milliard de demandes de création de bacs d’essai traitées sur plus de 20 clusters, deux clouds et quatre régions. Les nouveaux poids ont atteint le parc d’inférence avec une médiane d’environ 12 secondes, 71 incidents d’inférence ont été gérés sans interrompre le travail d’entraînement, et l’emballage dynamique a maintenu les lots d’entraînement remplis à 99,99 % en moyenne. Reflection a indiqué que le système asynchrone est resté stable même lorsqu’il apprenait à partir d’échantillons jusqu’à 107 versions de poids, soit environ un jour, en retard par rapport à la politique actuelle.

Sécurité et Alignement

Pour l’alignement, Reflection a entraîné un second modèle à partir du même point de contrôle pré‑entraîné en utilisant un pipeline distinct d’affinage supervisé et d’apprentissage par renforcement (RL) ciblant les principes comportementaux, puis l’a fusionné avec l’enseignant RL à grande échelle via une distillation multi‑enseignant en mode on‑policy. Les principes sont organisés en trois niveaux : les règles que le modèle ne doit pas violer, les qualités qu’il doit satisfaire de façon constante, et un style d’interaction par défaut.

Le jeu de données de sécurité a été construit de manière adversariale et itérative, chaque série d’attaques réussies étant réintégrée dans la prochaine itération d’entraînement, et le RL de sécurité a couvert des scénarios à tour unique, à plusieurs tours, de contournement (jailbreak) et agentiques dans lesquels un adversaire simulé met sous pression un modèle utilisant des outils. Reflection a déclaré pouvoir prédire les gains en RL mieux qu’un simple plafond Best‑of‑N, rapportant une corrélation de 0,79 contre 0,46 pour le plafond. L’entreprise a indiqué qu’elle publierait les résultats de son évaluation de sécurité dans le rapport technique de Beam et qu’elle rendrait open source les évaluations de sécurité internes qu’elle a développées.

Disponibilité et Partenariats

Sur sa page À propos, Reflection décrit ses engagements à publier les poids du modèle, à diffuser ses recherches et à rendre le logiciel open source, y compris les outils et environnements d’apprentissage par renforcement. La page indique que Reflection est validée sur Dell AI Factory avec NVIDIA, qu’elle est membre certifié du consortium de la Mission Genesis du Department of Energy, qu’elle sert les 17 laboratoires nationaux américains avec ses modèles à poids ouverts, et qu’elle construit un cloud souverain d’IA de 250 MW en Corée du Sud avec Shinsegae, soutenu par les gouvernements des États‑Unis et de la Corée.

Reflection a indiqué qu’elle publiera les poids de Beam sous licence Apache 2.0 fin octobre 2026, accompagnés d’un rapport technique, d’une fiche modèle, d’une documentation et de l’ensemble complet nécessaire pour exécuter, évaluer et affiner le modèle, avec des partenaires de distribution et des intégrations avec des bibliothèques open source et des structures prévues pour le lancement.

Jonas Reeve est un analyste généré par IA chez Unite.AI, spécialisé dans l'IA cognitive, l'intelligence artificielle générale (IAG) et les fondements théoriques de l'intelligence des machines. Son travail explore comment l'apprentissage, le raisonnement, la mémoire et l'abstraction émergent à la fois dans les systèmes biologiques et artificiels, établissant des liens entre les architectures d'IA modernes et les questions de longue date en sciences cognitives et en philosophie de l'esprit.

Avec une approche conceptuelle et réflexive, Jonas examine des cadres tels que les modèles de raisonnement, les systèmes agentiques, la cognition émergente et la théorie de l'alignement, visant à clarifier ce que signifie réellement le progrès vers l'IAG — et ce qu'il ne signifie pas. Plutôt que de courir après des échéances ou le battage médiatique, il met l'accent sur les premiers principes, la rigueur conceptuelle et les limites des modèles actuels.

Les articles rédigés par Jonas Reeve sont générés par IA et revus par l'équipe éditoriale de Unite.AI afin d'assurer précision, clarté et discussion responsable des concepts avancés d'IA.