Modele și platforme AI

Reflection AI prezintă Beam, un model open-weight cu 501 de miliarde de parametri

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Reflection AI a introdus Beam pe 5 octombrie 2026, primul său model open-weight: un sistem Mixture-of-Experts rar cu 501 de miliarde de parametri în total și 23 de miliarde activi, conceput pentru programare, raționament și sarcini agentice.

Beam trece prin ultimele teste de red‑team și evaluări, iar o versiune timpurie este oferită unui grup select de utilizatori printr‑o listă de așteptare. Reflection a descris Beam ca fiind primul model dintr‑o serie și a declarat că deja antrenează ceea ce urmează.

Afirmări privind capacitatea și eficiența

Reflection a declarat că a antrenat Beam cu un accent deosebit pe programare și performanță agentică. Compania a descris modelul ca fiind competitiv cu modele open mai mari, cum ar fi GLM 5.2, și ca apropiindu-se de Qwen 3.8‑Max în sarcini de programare și agentice, recunoscând în același timp că Kimi K3 rămâne în frunte în ceea ce privește capacitatea brută; a caracterizat avantajul Beam ca fiind eficiența la inferență și a afirmat că modelul avansează ceea ce numește frontiera Western open-weight.

Scorurile raportate de Reflection din suita sa de evaluare includ 80.1 la Terminal Bench v2.1, 80.9 la SWEBench Verified, 77.2 la SWE Bench Pro v2-Hard, 97.8 la AIME 2026, 36.2 la Humanity’s Last Exam fără instrumente și 90.5 la GPQA Diamond.

În ceea ce privește eficiența, compania a raportat că Beam obține scoruri comparabile cu GLM‑5.2 pe benchmark‑uri avansate de raționament, utilizând de trei până la patru ori mai puțină putere de calcul la inferență, cu câștiguri mai mari față de modele cu peste două trilioane de parametri, cum ar fi Qwen 3.8‑Max. Conform postării, estimările se bazează pe datele de la Artificial Analysis și DataCurve și estimează calculul de generare ca dublul numărului de parametri activi înmulțit cu media token‑urilor generate pe încercare; deoarece cifrele exclud completarea promptului, operațiile de atenție și supraîncărcarea de servire, Reflection le‑a descris ca o comparație aproximativă a calculului, nu ca un cost de inferență măsurat.

Reflection a declarat că a antrenat, de asemenea, Beam cu o penalizare de lungime controlabilă care recompensează soluțiile reușite și descurajează token‑urile inutile, și că un parametru de efort de raționament orientat către utilizator permite utilizatorilor să facă schimb între consumul de token‑uri și performanță, setările mai mici favorizând răspunsuri scurte, iar cele mai mari permițând un raționament mai lung în sarcini exigente.

Anunțul raportează că capabilitățile s‑au generalizat dincolo de amestecul de antrenament: în timpul învățării prin consolidare pe raționament, inginerie software și sarcini terminale, performanța de navigare a crescut în ciuda absenței sarcinilor de navigare, iar cu acces la web modelul a învățat de la sine să interogheze alte modele mari de limbaj și să utilizeze API‑uri OCR pentru a citi documente. Demonstrațiile includ o hartă a metroului din New York City, actualizată în timp real și construită din date publice ale MTA, un joc 3D cu astronaut scris în p5.js și un puzzle de tip teren‑sau‑apă în care Beam a clasificat puncte pe o rețea globală de 16.200 de coordonate cu o acoperire de 95.5 %, un rezultat pe care postarea îl situează între Opus 5 la 92.5 % și Fable 5 la 97.8 %. În a patra demonstrație, Beam a generat un notebook pentru ajustarea fină a celui mai mic model Gemma‑4 pe o sarcină Text2SQL, pe care Reflection a declarat că a crescut acuratețea testului de retenție a lui Gemma cu 66.5 %.

Flux de antrenament

Pre‑antrenare și curarea datelor

Reflection a declarat că a pre‑antrenat Beam pe 23.8 trilioane de tokeni preluați de pe web, din surse publice și seturi de date licențiate proprietare, finalizând rularea completă în sub patru săptămâni pe 6,144 NVIDIA GB300 NVL72 GPU‑uri. Compania a raportat nouă reveniri semi‑automate, atribuite vârfurilor de normă a gradientului sau presupuse coruperi silențioase de date, și a precizat că goodput‑ul, definit ca proporția de timp de ceas de perete petrecut în pași de antrenament păstrați în modelul final, a atins 92.3 %.

Fluxul de date a eliminat aproximativ 95 % din tokenii brute de pe internet prin parsare, deduplicare și curare, în timp ce Reflection a declarat că tehnicile convenționale de filtrare ar fi ratat aproximativ 1.8 trilioane de tokeni de înaltă calitate pe care le‑a păstrat, inclusiv 87 % din tokenii de cod web curățați. Un flux separat a procesat artefacte PDF utilizând un model OCR vizual‑lingvistic cu clasificatoare de calitate interne pe mii de GPU‑uri, iar o etapă de antrenament intermediar a extins lungimea de context efectivă a lui Beam la un milion de tokeni.

Postarea descrie o arhitectură care combină atenție locală și globală intercalată, experți rutati fin‑granular, și echilibrare a încărcării fără pierdere auxiliară cu descreștere cosinus a actualizărilor de bias ale experților, alături de scalare reziduală bazată pe adâncime, SandwichNorm, poartă de atenție element‑wise și acumulare reziduală FP32. Reflection a raportat o utilizare aproape uniformă a experților, cu încărcarea celui mai solicitat expert mediată la 1.04 ori media la finalul pre‑antrenamentului, și norme ale fluxului rezidual limitate pe toate cele 52 de straturi.

Învățare prin consolidare cu calcul intens

Campania de învățare prin consolidare a generat peste 100 de milioane de rulări pe 10,500 GPU‑uri NVIDIA GB300 în decurs de patru săptămâni, cu o lungime maximă de context de 256,000 de tokeni și aproximativ 1.3 miliarde de sandbox‑uri utilizate pentru antrenament și evaluare. Reflection a declarat că a obținut aproape un milion de medii de programare, agentice și STEM, în principal prin fluxuri de date sintetice, și a descris efortul ca fiind, în opinia sa, una dintre cele mai mari execuții RL realizate până acum de un laborator deschis.

Compania a raportat menținerea unei medii de 110.000 de rulări concurente și până la 170.000 de sandbox-uri concurente, cu peste un miliard de cereri de creare a sandbox-urilor procesate în peste 20 de clustere, două cloud-uri și patru regiuni. Noile greutăţi au ajuns în flota de inferenţă cu o medie de aproximativ 12 secunde, 71 de incidente de inferenţă au fost gestionate fără a întrerupe jobul de antrenament, iar ambalarea dinamică a menţinut loturile de antrenament în medie 99,99% pline. Reflection a declarat că sistemul asincron a rămas stabil chiar şi atunci când a învăţat din mostre de până la 107 versiuni de greutate, aproximativ o zi, în urma politicii curente.

Siguranță și Aliniere

Pentru aliniere, Reflection a antrenat un al doilea model pornind de la acelaşi punct de control pre-antrenat, utilizând un pipeline separat de fine‑tuning supravegheat și RL orientat spre principii comportamentale, apoi l‑a fuzionat cu profesorul RL de scară largă prin distilare multi‑teacher on‑policy. Principiile sunt organizate în trei niveluri: reguli pe care modelul nu trebuie să le încalce, calităţi pe care ar trebui să le satisfacă în mod constant și un stil de interacţiune implicit.

Setul de date pentru siguranţă a fost construit adversarial şi iterativ, fiecare rundă de atacuri reuşite fiind reintegrată în următoarea rundă de antrenament, iar RL pentru siguranţă a cuprins scenarii de un singur pas, multi‑pas, de evadare şi agentice în care un adversar simulat exercită presiune asupra unui model ce utilizează instrumente. Reflection a declarat că poate prezice câştigurile RL mai bine decât un plafon Best‑of‑N singur, raportând o corelaţie de 0,79 faţă de 0,46 pentru plafon. Compania a anunţat că va publica rezultatele evaluărilor de siguranţă în raportul tehnic al Beam și va face open‑source evaluările interne de siguranţă pe care le‑a dezvoltat.

Disponibilitate și Parteneriate

Pe pagina Despre, Reflection descrie angajamentele de a elibera greutăţile modelului, de a publica cercetările sale și de a face software‑ul open‑source, inclusiv instrumentele și mediile de învățare prin recompensă. Pagina afirmă că Reflection este validat pe Dell AI Factory cu NVIDIA, că este membru certificat al consorţiului Genesis Mission al Departamentului de Energie, servind cele 17 Laboratoare Naţionale din SUA cu modelele sale open‑weight, și că construiește un cloud AI suveran de 250 MW în Coreea de Sud împreună cu Shinsegae, susținut de guvernele SUA și Coreea.

Reflection a declarat că va elibera greutăţile Beam sub licenţa Apache 2.0 în octombrie 2026, însoțite de un raport tehnic, o fișă de model, documentație și întregul stack pentru rulare, evaluare și fine‑tuning, cu parteneri de distribuție și integrări cu biblioteci open‑source și harness‑uri planificate pentru lansare.

Jonas Reeve este un analist generat de AI la Unite.AI, concentrându‑se pe inteligența cognitivă AI, inteligența artificială generală (AGI) și fundamentele teoretice ale inteligenței mașinilor. Munca sa explorează modul în care învățarea, raționamentul, memoria și abstractizarea apar atât în sistemele biologice, cât și în cele artificiale, stabilind legături între arhitecturile moderne de AI și întrebările de lungă durată din știința cognitivă și filosofia minții.

Printr‑o abordare conceptuală și reflexivă, Jonas examinează cadre precum modele de raționament, sisteme agențiale, cogniție emergentă și teoria aliniamentului, vizând să clarifice ce înseamnă cu adevărat progresul către AGI — și ce nu înseamnă. În loc să urmărească termene limită sau hype‑ul, el pune accent pe principii de bază, rigurozitate conceptuală și limitele modelelor actuale.

Articolele scrise de Jonas Reeve sunt generate de AI și revizuite de echipa editorială a Unite.AI pentru a asigura acuratețea, claritatea și discuția responsabilă a conceptelor avansate de AI.