AI-mallit ja alustat

Reflection AI esittelee Beamin, 501 miljardin parametrin avoinpainomalli

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Reflection AI esitteli Beam 5. lokakuuta 2026, ensimmäinen avoinpainomallinsa: harva Mixture-of-Experts -järjestelmä, jossa on yhteensä 501 miljardia parametria ja 23 miljardia aktiivista, rakennettu koodaukseen, päättelyyn ja agenttipainotteisiin työkuormiin.

Beam on viimeistelyvaiheessa punaisen tiimin testauksessa ja arvioinneissa, ja varhainen versio tarjotaan valikoidulle käyttäjäryhmälle odotuslistan kautta. Reflection kuvaili Beamia sarjan ensimmäisenä mallina ja kertoi, että se on jo kouluttamassa seuraavaa versiota.

Kyvykkyys- ja tehokkuusväitteet

Reflection kertoi kouluttaneensa Beamia erityisesti koodaus- ja agenttipainotteiseen suorituskykyyn. Yritys kuvaili mallin kilpailukykyiseksi suurempien avoimien mallien, kuten GLM 5.2, kanssa ja lähestyväksi Qwen 3.8-Maxia koodaus- ja agenttitehtävissä, samalla tunnustaen, että Kimi K3 on edelleen edellä raakakyvykkyydessä; se luonnehti Beamin etua inferenssiajan tehokkuutena ja totesi, että malli edistää sitä, mitä se kutsuu länsimaiseksi avoinpainofrontiksi.

Reflectionin arviointisarjasta raportoimat pisteet sisältävät 80,1 Terminal Bench v2.1:ssä, 80,9 SWEBench Verifiedissä, 77,2 SWE Bench Pro v2-Hardissa, 97,8 AIME 2026:ssa, 36,2 Humanity’s Last Exam -testissä ilman työkaluja, ja 90,5 GPQA Diamondissa.

Tehokkuuden osalta yritys raportoi, että Beam saavuttaa GLM-5.2:n kanssa vertailukelpoisia pisteitä kehittyneissä päättelyvertailuissa käyttäen samalla kolme‑neljä kertaa vähemmän inferenssilaskentaa, ja suurempia hyötyjä malleihin, joilla on yli kaksi biljoonaa parametria, kuten Qwen 3.8-Max. Julkaisun mukaan arviot perustuvat Artificial Analysis- ja DataCurve-tietoihin ja arvioivat generointilaskennan kaksinkertaisena aktiivisten parametrien määränä kerrottuna keskimääräisillä tuotetuilla tokenilla per yritys; koska luvut eivät sisällä kehotteen esitäyttöä, huomion operaatioita eikä palveluylikuormitusta, Reflection kuvaili niitä likimääräiseksi laskentavertailuksi eikä mitatuksi inferenssikustannukseksi.

Reflection kertoi myös kouluttaneensa Beamia säädettävällä pituusrangaistuksella, joka palkitsee onnistuneet ratkaisut samalla kun se estää tarpeettomia tokeneita, ja että käyttäjälle näkyvä päättelyponnistusparametri antaa käyttäjien vaihtaa token-käyttöä suorituskyvyn kanssa, alhaisemmat asetukset suosivat lyhyempiä vastauksia ja korkeammat asetukset mahdollistavat pidemmän päättelyn vaativissa tehtävissä.

Ilmoitus kertoo, että kyvykkyydet yleistyivät koulutusseoksen ulkopuolelle: vahvistusoppimisen aikana päättelyssä, ohjelmistosuunnittelussa ja päätöstehtävissä selaustoiminnan suorituskyky parani, vaikka selaustehtäviä ei ollut, ja verkkoyhteyden avulla malli oppi itsenäisesti kysyä muilta suurilta kielimalleilta ja käyttää OCR-rajapintoja asiakirjojen lukemiseen. Demonstraatioita ovat reaaliaikaisesti päivittyvä New Yorkin metron kartta, joka on rakennettu julkisista MTA-tiedoista, 3D‑astronauttipeli, joka on kirjoitettu p5.js:llä, sekä maa‑tai‑vesi -pulma, jossa Beam luokitteli pisteitä 16 200 pisteen globaalissa koordinaattiruudukossa 95,5 % kattavuudella; tulos sijoittuu 92,5 % Opus 5:n ja 97,8 % Fable 5:n väliin. Neljännessä demonstraatiossa Beam tuotti muistikirjan, jossa hienosäädettiin pienintä Gemma‑4-mallia Text2SQL-tehtävässä, ja Reflection kertoi, että se nosti Gemman testitarkkuuden 66,5 %.

Koulutusputki

Esikoulutus ja datan kuratointi

Reflection kertoi, että se esikoulutti Beamia 23,8 biljoonaa tokenia verkosta, julkisista lähteistä ja omistetuista lisensoiduista tietoaineistoista, suorittaen koko prosessin alle neljässä viikossa 6 144 NVIDIA GB300 NVL72 GPU:lla. Yritys raportoi yhdeksän puoliksi automaattista takaisinkierrosta, jotka johtuvat gradienttinormin piikeistä tai epäillystä hiljaisesta datakorruptiosta, ja totesi, että goodput, määriteltynä se osuus reaaliaikaisesta ajasta, joka kuluu koulutusaskeliin ja säilyy lopullisessa mallissa, saavutti 92,3 %.

Dataputki poisti noin 95 % raakainternet-tokenista jäsentämisen, deduplikaation ja kuratoinnin avulla, kun taas Reflection kertoi, että perinteiset suodatustekniikat olisivat jättäneet huomiotta noin 1,8 biljoonaa korkealaatuista tokenia, jonka se säilytti, mukaan lukien 87 % kuratoiduista web-kooditokeneista. Erillinen putki käsitteli PDF-artefakteja käyttämällä näkö-kieli OCR -mallia, jossa on sisäisiä laatuluokittelijoita tuhansilla GPU:illa, ja keskikoulutusvaihe laajensi Beamin tehokkaan kontekstipituuden miljoonaan tokeniin.

Julkaisu kuvaa arkkitehtuuria, jossa yhdistyvät vuorotellen paikallinen ja globaali huomio, hienojakoisesti reititetyt asiantuntijat ja apuhäviötön kuormantasaus kosinuksen vähenemisen avulla asiantuntijapreferenssien päivityksissä, sekä syvyysperusteinen residualiasteikko, SandwichNorm, elementtikohtainen huomion porttaus ja FP32 residualikertymä. Reflection raportoi lähes tasaisen asiantuntijakäytön, jossa kiireisimmän asiantuntijan kuorma keskimäärin oli 1,04‑kerroin keskiarvosta esikoulutuksen lopussa, ja rajoitetut residualvirran normit kaikissa 52 kerroksessa.

Korkean laskentatehon vahvistusoppiminen

Vahvistusoppimiskampanja tuotti yli 100 miljoonaa rolloutia 10 500 NVIDIA GB300 GPU:lla neljän viikon aikana, maksimikontekstipituus oli 256 000 tokenia ja noin 1,3 miljardia hiekkalaatikkoa käytettiin koulutukseen ja arviointiin. Reflection kertoi hankkineensa lähes miljoona koodaus-, agentti- ja STEM-ympäristöä, pääasiassa synteettisen datan putkien kautta, ja kuvaili ponnistusta yhtenä suurimmista tähän mennessä avoimen laboratorion toteuttamista RL-ajosta.

Yritys raportoi ylläpitävänsä keskimäärin 110 000 samanaikaista käyttöönottoa ja enintään 170 000 samanaikaista hiekkalaatikkoa, yli miljardin hiekkalaatikkojen luontipyynnön käsiteltynä yli 20 klusterissa, kahdessa pilvessä ja neljässä alueessa. Uudet painot saavuttivat inferenssifleetin mediaanissa noin 12 sekunnissa, 71 inferenssi‑tapausta käsiteltiin lopettamatta koulutustehtävää, ja dynaaminen pakkaus piti koulutusbatchit keskimäärin 99,99 % täynnä. Reflection kertoi, että asynkroninen järjestelmä pysyi vakaana jopa oppiessa näytteistä, joissa oli jopa 10⁷ painoversiota, noin yksi päivä, nykyisen politiikan takana.

Turvallisuus ja yhdenmukaisuus

Yhdenmukaisuuden osalta Reflection koulutti toisen mallin samasta esikoulutetusta tarkistuspisteestä käyttäen erillistä valvottua hienosäätöä ja RL-putkea, joka kohdistui käyttäytymisperiaatteisiin, ja yhdisti sen suurimittakaavaiseen RL‑opettajaan monen opettajan on‑policy‑destillaation avulla. Periaatteet on järjestetty kolmeen tasoon: säännöt, joita mallin ei saa rikkoa, ominaisuudet, joita sen tulisi johdonmukaisesti täyttää, ja oletusvuorovaikutustyyli.

Turvallisuusdatajoukko rakennettiin vastustajallisesti ja iteratiivisesti, jokaisen kierroksen onnistuneet hyökkäykset sisällytettiin seuraavan koulutuskierroksen dataan, ja turvallisuus‑RL kattoi yksittäisiä, monivaiheisia, jailbreak‑ ja agenttipohjaisia skenaarioita, joissa simuloitu vastustaja painostaa työkalua käyttävää mallia. Reflection kertoi pystyvänsä ennustamaan RL‑voittoja paremmin kuin pelkkä Best‑of‑N‑katto, raportoiden korrelaation 0,79 verrattuna 0,46:een kattoon. Yritys ilmoitti julkaisevansa turvallisuusarviointinsa Beam‑teknillisessä raportissa ja avaa‑lähdekoodina kehittämänsä sisäiset turvallisuusarviot.

Saatavuus ja kumppanuudet

Sen tietosivulla Reflection esittelee sitoumuksia mallipainojen julkaisemiseen, tutkimuksensa julkaisemiseen ja ohjelmiston avoimen lähdekoodin julkaisemiseen, mukaan lukien vahvistusoppimistyökalut ja -ympäristöt. Sivulla todetaan, että Reflection on validoitu Dell AI Factoryssa NVIDIA:n kanssa, että se on Yhdysvaltain energiaministeriön Genesis‑missio -konsortion sertifioitu jäsen, palvelee 17 Yhdysvaltain kansallista laboratorioa avoin‑painomalleillaan, ja että se rakentaa 250 megawatin suvereenin AI‑pilven Etelä‑Koreassa Shinsegae:n kanssa, jota tukevat Yhdysvaltain ja Korean hallitukset.

Reflection kertoi julkaisevansa Beam‑painot Apache 2.0 -lisenssin alla myöhemmin lokakuussa 2026, teknisen raportin, mallikortin, dokumentaation ja täyden pinon mallin ajamiseen, arviointiin ja hienosäätöön kanssa, jakelukumppaneiden ja avoimen lähdekoodin kirjastojen sekä liitosratkaisujen integraatioiden suunniteltuna lanseeraukseen.

Jonas Reeve on AI‑luotu analyytikko Unite.AI:ssa, keskittyen kognitiiviseen tekoälyyn, yleiseen tekoälyyn (AGI) ja koneälyn teoreettisiin perusteisiin. Hänen työnsä tutkii, miten oppiminen, päättely, muisti ja abstraktio syntyvät sekä biologisissa että keinotekoisissa järjestelmissä, ja luo yhteyksiä nykyaikaisten tekoälyarkkitehtuurien ja kognitiivisen tieteen sekä mielenfilosofian pitkään kestäneisiin kysymyksiin.

Käsitteellisellä ja pohdiskelevalla lähestymistavalla Jonas tarkastelee kehyksiä, kuten päättelymalleja, agenttijärjestelmiä, emergenttiä kognitiota ja sovitus-teoriaa, pyrkien selventämään, mitä edistyminen kohti AGI:ta todella merkitsee – ja mitä se ei merkitse. Sen sijaan, että hän jahdataisiin aikatauluja tai hypeä, hän korostaa perusperiaatteita, käsitteellistä tarkkuutta ja nykyisten mallien rajoja.

Jonas Reeven kirjoittamat artikkelit ovat AI‑luotuja ja Unite.AI:n toimituskunta tarkistaa ne varmistaakseen tarkkuuden, selkeyden ja vastuullisen keskustelun kehittyneistä tekoälykäsitteistä.