AI-mallit ja alustat
Allen AI:n Tülu 3 on yllättäen DeepSeekin kilpailija

Otsikot jatkuvat. DeepSeekin mallit ovat haastaneet mittareita, asettaneet uusia standardeja ja tehneet paljon meteliä. Mutta jotain mielenkiintoista juuri tapahtui tekoälytutkimuksessa, joka on myös arvioitava.
Allen AI julkaisi hiljaisesti uuden Tülu 3 -malliperheensä, ja 405B parametrin versio ei vain kilpaile DeepSeekin kanssa – se vastaa tai ylittää sitä tärkeillä mittareilla.
Asetetaan tämä perspektiiviin.
405B Tülu 3 -malli kilpailee huipputuottajien kanssa, kuten DeepSeek V3, useiden tehtävien parissa. Näemme vertailukelpoista tai parempaa suorituskykyä alueilla, kuten matemaattisissa ongelmissa, koodaushaasteissa ja tarkassa ohjeiden seuraamisessa. Ja he tekevät sen täysin avoimella lähestymistavalla.
He ovat julkaisseet koko koulutusputken, koodin ja jopa uuden vahvistusoppimismenetelmänsä, jota kutsutaan vahvistusoppimiseksi verifioiduilla palkkioilla (RLVR), joka mahdollisti tämän.
Tällaiset kehitykset viimeisten viikkojen aikana muuttavat, miten huipputason tekoälykehitys tapahtuu. Kun täysin avoin lähdekoodi voidaan vastata parhaimmillaan suljettuihin malleihin, se avaa mahdollisuuksia, jotka olivat aiemmin lukittuina yksityisten yritysten muurien taakse.
Tekninen Taistelu
Mitä teki Tülu 3:sta erottuvan? Se johtuu yksilöllisestä nelivaiheisesta koulutusprosessista, joka menee perinteisten lähestymistapojen ohi.
Katsotaan, miten Allen AI rakensi tämän mallin:
Vaihe 1: Strateginen Data Valinta
Tiimi tiesi, että mallin laatu alkaa datan laadusta. He yhdistivät vakiintuneita tietokantoja, kuten WildChat ja Open Assistant, mukautetun sisällön kanssa. Mutta tässä on avainnäkemys: he eivät vain keränneet dataa – he loivat kohdennettuja tietokantoja tiettyjen taitojen, kuten matemaattisen päättelyn ja koodauskyvyn, kehittämiseksi.
Vaihe 2: Vastauksen Parantaminen
Toisessa vaiheessa Allen AI keskittyi opettamaan mallilleen tiettyjä taitoja. He loivat erilaisia koulutusdatajoukkoja – joitain matematiikkaa varten, toisia koodausta varten ja muita yleisiä tehtäviä varten. Testaamalla näitä yhdistelmiä toistuvasti he voivat nähdä tarkalleen, missä malli menestyi ja missä se tarvitsi työtä. Tämä iteraatioprosessi paljasti Tülu 3:n todellisen potentiaalin kussakin alueessa.
Vaihe 3: Vertaileva Oppiminen
Tässä Allen AI sai aikaan luovaa. He rakensivat järjestelmän, joka voisi vertailla Tülu 3:n vastauksia muihin huipputuottajiin. Mutta he myös ratkaisivat yleisen ongelman tekoälyssä – taipumuksen kirjoittaa pitkiä vastauksia pelkästään pituuden vuoksi. Heidän lähestymistapansa, joka käytti pituudenormaalia suoraa preferenssioptimointia (DPO), tarkoitti, että malli oppi arvostamaan laadun määrän sijasta. Tuloksena oli vastaukset, jotka olivat sekä tarkkoja että tarkoituksenmukaisia.
Kun tekoälymallit oppivat preferensseistä (kumpi vastaus on parempi, A vai B?), ne taipuvat kehittämään frustraavan vinouman: ne alkavat ajatella, että pidemmät vastaukset ovat aina parempia. Se on kuin ne yrittäisivät voittaa sanomalla enemmän sen sijaan, että sanovat asiat hyvin.
Pituudenormaali DPO korjaa tämän sopeuttamalla, miten malli oppii preferensseistä. Sen sijaan, että vain katsoisi, kumpi vastaus suositeltiin, se ottaa huomioon kunkin vastauksen pituuden. Ajattele sitä arvioimalla vastauksia laadun mukaan sanan määrässä, ei pelkästään kokonaisvaikutuksen mukaan.
Miksi tämä on merkittävää? Koska se auttaa Tülu 3:ta oppimaan olemaan tarkka ja tehokas. Sen sijaan, että se lisäisi vastauksiin ylimääräisiä sanoja tuntiakseen itsensä kattavamman, se oppii toimittamaan arvoa siinä mitä todella tarvitaan.
Tämä saattaa näyttää pikkuseikalta, mutta se on olennainen tekoälyn luomisessa, joka viestii luonnollisesti. Parhaat ihmisten asiantuntijat tietävät, milloin olla tiivis ja milloin laajentaa – ja se on juuri sitä, mitä pituudenormaali DPO opettaa mallille.
Vaihe 4: RLVR-innovaatio
Tämä on tekninen läpimurto, joka ansaitsee huomion. RLVR korvaa subjektiiviset palkkiomallit konkreettisilla verifiointeilla.
Useimmat tekoälymallit oppivat monimutkaisen palkkiomallijärjestelmän kautta – perustuen koulutettuihin arvioihin siitä, mikä tekee hyvän vastauksen. Mutta Allen AI valitsi toisen tien RLVR:llä.
Ajatellaan, miten koulutamme nykyään tekoälymalleja. Yleensä tarvitsemme muita tekoälymalleja (kutsutaan palkkiomalleiksi) arvioimaan, onko vastaus hyvä tai ei. Se on subjektiivista, monimutkaista ja usein epäjohdonmukaista. Jotkut vastaukset saattavat näyttää hyviltä, mutta sisältävät hienoisia virheitä, jotka pääsevät läpi.
RLVR kääntää tämän lähestymistavan päälaelleen. Sen sijaan, että riippuisi subjektiivisista arvioista, se käyttää konkreettisia, verifioiduissa tuloksia. Kun malli yrittää matemaattista ongelmaa, ei ole harmaata aluetta – vastaus on joko oikein tai väärin. Kun se kirjoittaa koodia, koodi joko toimii oikein tai ei.
Tässä se menee mielenkiintoiseksi:
- Malli saa välittömän, binäärisen palautteen: 10 pistettä oikeista vastauksista, 0 vääristä
- Ei ole tilaa osittaiselle hyväksymiselle tai epämääräiselle arviointiin
- Oppiminen keskittyy ja tarkentuu
- Malli oppii priorisoimaan tarkkuuden uskottavasti kuulostavien, mutta virheellisten vastausten sijaan

RLVR-koulutus (Allen AI)
Tulokset? Tülu 3 osoitti merkittäviä parannuksia tehtävissä, joissa oikeellisuus on tärkeintä. Sen suorituskyky matemaattisessa päättelyssä (GSM8K-benchmark) ja koodaushaasteissa hyppäsi merkittävästi. Jopa sen ohjeiden seuraaminen tuli tarkemmaksi, koska malli oppi arvostamaan konkreettista tarkkuutta epätarkkojen vastausten sijaan.
Mikä tekee tästä erityisen jännittävää, on se, miten se muuttaa peliä avoimen lähdekoodin tekoälylle. Aikaisemmat lähestymistavat usein kamppailivat suljettujen mallien tarkkuuden saavuttamisessa teknisissä tehtävissä. RLVR osoittaa, että oikean koulutuslähestymistavan avulla avoimet lähdekoodimallit voivat saavuttaa saman luotettavuuden tason.
Lukujen Tarkastelu
405B parametrin Tülu 3 kilpailee suoraan kentän huipulla olevien mallien kanssa. Katsotaan, missä se erottuu ja mitä se merkitsee avoimen lähdekoodin tekoälylle.
Matematiikka
Tülu 3 erottuu monimutkaisessa matemaattisessa päättelyssä. Benchmarkkejä kuten GSM8K ja MATH, se vastaa DeepSeekin suorituskykyä. Malli käsittelee monivaiheisia ongelmia ja osoittaa vahvaa matemaattista päättelykykyä.
Koodaus
Koodaus tulokset ovat yhtä vaikuttavia. Kiitos RLVR-koulutukselle, Tülu 3 kirjoittaa koodia, joka ratkaisee ongelmia tehokkaasti. Sen vahvuus on koodausohjeiden ymmärtämisessä ja toimivien ratkaisujen tuottamisessa.
Tarkan Ohjeiden Seuraaminen
Mallin kyky seurata ohjeita erottuu yhtenä sen keskeisenä vahvuutena. Kun monet mallit approksimoivat tai yleistävät ohjeita, Tülu 3 osoittaa huomattavaa tarkkuutta suorittaessaan tarkalleen sitä, mitä pyydetään.
Tekoälykehityksen Mustan Lippaan Avaaminen
Allen AI julkaisi sekä voimakkaan mallin että koko kehitysprosessinsa.
Jokainen koulutusprosessin osa on dokumentoitu ja saatavilla. Nelivaiheisesta lähestymistavasta datakäsittelymenetelmiin ja RLVR-toteutukseen – koko prosessi on avoin tutkimista ja toistamista varten. Tämä avoimuus asettaa uuden standardin korkean suorituskyvyn tekoälykehityksessä.
Kehittäjät saavat kattavat resurssit:
- Koko koulutusputket
- Datakäsittelytyökalut
- Arviointikehykset
- Toteutusspesifikaatiot
Tämä mahdollistaa tiimien:
- Muokata koulutusprosesseja
- Sovittaa menetelmiä tiettyihin tarpeisiin
- Rakentaa vahvistettuihin lähestymistapoihin
- Luo erikoistuneita toteutuksia
Tämä avoin lähestymistapa kiihdyttää innovaatiota koko alalla. Tutkijat voivat rakentaa vahvistetuille menetelmille, kun taas kehittäjät voivat keskittyä parantamiseen aloittamisen sijaan nollasta.
Avoimen Lähdekoodin Huippu
Tülu 3:n menestys on suuri hetki avoimen tekoälykehitykselle. Kun avoin lähdekoodi vastaa tai ylittää yksityisiä vaihtoehtoja, se muuttaa perustavasti alaa. Tutkimusryhmät maailmanlaajuisesti saavat pääsyn vahvistettuihin menetelmiin, kiihdyttäen työtään ja synnyttäen uusia innovaatioita. Yksityiset tekoälylaboratoriot joutuvat sopeutumaan – joko lisäämällä avoimuutta tai työntämällä teknisiä rajoja eteenpäin.
Eteenpäin katsoen Tülu 3:n läpimurto verifioiduilla palkkioilla ja monivaiheisella koulutuksella viittaa siihen, mitä on tulossa. Tiimit voivat rakentaa näiden perustusten päälle, mahdollisesti työntäen suorituskykyä entistä korkeammaksi. Koodi on olemassa, menetelmät on dokumentoitu, ja uusi aalto tekoälykehityksessä on alkanut. Kehittäjille ja tutkijoille mahdollisuus kokeilla ja parantaa näitä menetelmiä merkitsee innostavan luvun alkamista tekoälykehityksessä.
Usein Kysytyt Kysymykset (UKK) Tülu 3:sta
Mikä on Tülu 3 ja mitkä ovat sen avainominaisuudet?
Tülu 3 on Allen AI:n kehittämä avoimen lähdekoodin LLM-perhe, joka perustuu Llama 3.1 -arkkitehtuuriin. Se on saatavilla eri koossa (8B, 70B ja 405B parametriä). Tülu 3 on suunniteltu parantamaan suorituskykyä monissa tehtävissä, mukaan lukien tieto, päättely, matematiikka, koodaus, ohjeiden seuraaminen ja turvallisuus.
Mikä on Tülu 3:n koulutusprosessi ja mitä dataa käytetään?
Tülu 3:n koulutus käsittää useita avainvaiheita. Ensinnäkin tiimi kerää monipuolisen joukon kehotteita sekä julkisista tietokannoista että syntetisoidusta datasta, joka on kohdennettu tiettyihin taitoihin, varmistaen, että data on puhdistettu benchmarkkejä vastaan. Toiseksi, valvottu hienosäätö (SFT) suoritetaan sekoituksella ohjeiden seuraamis-, matematiikka- ja koodausdataa. Seuraavaksi suora preferenssioptimointi (DPO) käytetään preferenssidataa, joka on luotu ihmisten ja LLM-palautteen avulla. Lopuksi vahvistusoppiminen verifioiduilla palkkioilla (RLVR) käytetään tehtävissä, joissa on mitattavissa oleva oikeellisuus. Tülu 3 käyttää kohdennettuja tietokantoja kullekin vaiheelle, mukaan lukien henkilökohtaiset ohjeet, matematiikka ja koodausdata.
Miten Tülu 3 lähestyy turvallisuutta ja mitkä mittarit käytetään sen arviointiin?
Turvallisuus on Tülu 3:n kehityksen keskeinen osa, jota käsitellään koulutusprosessin aikana. Turvallisuuteen liittyvä tietokanta käytetään SFT:ssä, joka on pääosin ortogonaalinen muihin tehtävänorientoituneisiin tietoihin.
Mikä on RLVR?
RLVR on tekniikka, jossa malli koulutetaan optimoimaan verifioidulla palkkiolla, kuten vastauksen oikeellisuudella. Tämä eroaa perinteisestä RLHF:stä, joka käyttää palkkiomallia.













