AI-modeller og plattformer
Allen AI’s Tülu 3 har blitt DeepSeek’s uventede rival

Overskriftene fortsetter å komme. DeepSeek’s modeller har utfordret benchmarkene, satt nye standarder og laget mye støy. Men noe interessant har nettopp skjedd i AI-forskningsfeltet som også er verdt å merke seg.
Allen AI har stille og rolig lansert sin nye Tülu 3-modellfamilie, og deres 405B parameter-versjon konkurrerer ikke bare med DeepSeek – den matcher eller slår den på nøkkel-benchmarkene.
La oss sette dette i perspektiv.
405B Tülu 3-modellen går opp mot topputførerne som DeepSeek V3 over en rekke oppgaver. Vi ser sammenlignbare eller overlegne resultater på områder som matematikkproblemer, kodeutfordringer og nøyaktig instruksjonsfølging. Og de gjør det med en fullstendig åpen tilnærming.
De har lansert den komplette treningspipelinen, koden og selv deres nye forsterkingslæringmetode kalt Forsterkingslæring med verifiserbare belønninger (RLVR) som gjorde dette mulig.
Utviklinger som disse over de siste ukene endrer hvordan topp-nivå AI-utvikling skjer. Når en fullstendig åpen kildekode-modell kan matche de beste lukkede modellene ute, åpner det opp muligheter som tidligere var låst bak private korporative vegger.
Den tekniske kampen
Hva gjorde Tülu 3 spesiell? Det kommer ned til en unik fire-stegs treningsprosess som går utenfor tradisjonelle tilnærminger.
La oss se hvordan Allen AI bygde denne modellen:
Steg 1: Strategisk datautvalg
Teamet visste at modellkvalitet starter med datakvalitet. De kombinerte etablerte datasett som WildChat og Open Assistant med selvgenerert innhold. Men her er den viktige innsikten: de kombinerte ikke bare data – de skapte målrettede datasett for spesifikke ferdigheter som matematisk resonnement og kodekompetanse.
Steg 2: Bygging av bedre svar
I det andre steget, fokuserte Allen AI på å lære modellen spesifikke ferdigheter. De skapte forskjellige sett med treningsdata – noen for matematikk, andre for kode og mer for generelle oppgaver. Ved å teste disse kombinasjonene gjentatte ganger, kunne de se eksakt hvor modellen utmerket seg og hvor den trengte arbeid. Denne iterative prosessen avdekket det sanne potensialet for hva Tülu 3 kunne oppnå i hvert område.
Steg 3: Læring fra sammenligninger
Dette er der Allen AI ble kreative. De bygde et system som kunne øyeblikkelig sammenligne Tülu 3’s svar med andre toppmodeller. Men de løste også et varig problem i AI – tendensen hos modeller til å skrive lange svar bare for lengdens skyld. Deres tilnærming, ved å bruke lengdenormalisert Direkte Preferanse-Optimisering (DPO), betydde at modellen lærte å verdsette kvalitet over kvantitet. Resultatet? Svar som er både presise og hensiktsmessige.
Når AI-modeller lærer av preferanser (hvilket svar er bedre, A eller B?), tenderer de til å utvikle en frustrerende bias: de begynner å tro at lengre svar alltid er bedre. Det er som om de prøver å vinne ved å si mer enn å si ting godt.
Lengdenormalisert DPO fikser dette ved å justere hvordan modellen lærer av preferanser. I stedet for bare å se på hvilket svar som ble foretrukket, tar den hensyn til lengden av hvert svar. Tenk på det som å dømme svar etter kvalitet per ord, ikke bare deres totale effekt.
Hvorfor er dette viktig? Fordi det hjelper Tülu 3 å lære å være presis og effektiv. I stedet for å fylle svar med ekstra ord for å synes mer omfattende, lærer den å levere verdi i hva som faktisk er nødvendig.
Dette kan synes som en liten detalj, men det er avgjørende for å bygge AI som kommuniserer naturlig. De beste menneskelige ekspertene vet når de skal være konsise og når de skal utdype – og det er nettopp hva lengdenormalisert DPO hjelper å lære modellen.
Steg 4: RLVR-innovasjonen
Dette er den tekniske gjennombruddet som fortjener oppmerksomhet. RLVR erstatter subjektive belønningmodeller med konkrete verifiseringer.
De fleste AI-modeller lærer gjennom et komplekst system av belønningmodeller – i realiteten utdannede gjetninger om hva som gjør et godt svar. Men Allen AI tok en annen vei med RLVR.
Tenk på hvordan vi vanligvis trener AI-modeller. Vi trenger vanligvis andre AI-modeller (kalt belønningmodeller) for å dømme om et svar er bra eller ikke. Det er subjektivt, komplekst og ofte inkonsistent. Noen svar kan synes bra, men inneholde subtile feil som glipper gjennom.
RLVR snur denne tilnærmingen på hodet. I stedet for å stole på subjektive vurderinger, bruker den konkrete, verifiserbare resultater. Når modellen forsøker et matematisk problem, er det ingen gråsoner – svaret er enten riktig eller feil. Når den skriver kode, kjører koden enten riktig eller det gjør den ikke.
Her blir det interessant:
- Modellen får umiddelbar, binær tilbakemelding: 10 poeng for korrekte svar, 0 for feil
- Det er ingen rom for delvis kreditt eller fuzzy vurdering
- Læringen blir fokusert og presis
- Modellen lærer å prioritere nøyaktighet over plausibelt lydende, men feil svar

RLVR-trening (Allen AI)
Resultatene? Tülu 3 viste betydelige forbedringer i oppgaver hvor riktighet betyr mest. dens ytelse på matematisk resonnement (GSM8K-benchmark) og kodeutfordringer hoppet merkbar. Selv dens instruksjonsfølging ble mer presis fordi modellen lærte å verdsette konkrete nøyaktighet over approximative svar.
Hva gjør dette spesielt spennende er hvordan det endrer spilleregler for åpen kildekode-AI. Tidligere tilnærminger kjempet ofte for å matche nøyaktigheten til lukkede modeller på tekniske oppgaver. RLVR viser at med riktig treningsmetode kan åpen kildekode-modeller oppnå samme nivå av pålitelighet.
En titt på tallene
405B parameter-versjonen av Tülu 3 konkurrerer direkte med toppmodellene i feltet. La oss se hvor den utmerker seg og hva dette betyr for åpen kildekode-AI.
Matematikk
Tülu 3 utmerker seg på kompleks matematisk resonnement. På benchmarkene som GSM8K og MATH, matcher den DeepSeek’s ytelse. Modellen håndterer flertrinnsproblemer og viser sterk matematisk resonnementsevne.
Kode
Kode-resultatene er like imponerende. Takk til RLVR-trening, skriver Tülu 3 kode som løser problemer effektivt. dens styrke ligger i å forstå kode-instruksjoner og produsere funksjonelle løsninger.
Presis instruksjonsfølging
Modellens evne til å følge instruksjoner utmerker seg som en kjerne-styrke. Mens mange modeller approksimerer eller generaliserer instruksjoner, demonstrerer Tülu 3 merkbar presisjon i å utføre eksakt hva som er bedt.
Åpne svartekassen til AI-utvikling
Allen AI lanserte både en kraftig modell og deres komplette utviklingsprosess.
Hver eneste del av treningsprosessen er dokumentert og tilgjengelig. Fra fire-stegs-tilnærmingen til dataforberedningsmetodene og RLVR-implementeringen – hele prosessen ligger åpen for studie og replikasjon. Denne transparensen setter en ny standard i høy-ytelses AI-utvikling.
Utviklere mottar omfattende ressurser:
- Komplette treningspipeliner
- Dataforberedningsverktøy
- Evalueringssystemer
- Implementeringsspesifikasjoner
Dette muliggjør at teamene kan:
- Modifisere treningsprosesser
- Tilpasse metoder for spesifikke behov
- Bygge på bevarte tilnærminger
- Skape spesialiserte implementeringer
Denne åpne tilnærmingen akselerer innovasjon over hele feltet. Forskere kan bygge på verifiserte metoder, mens utviklere kan fokusere på forbedringer i stedet for å starte fra null.
Oppsvinget til åpen kildekode-ekspertise
Suksessen til Tülu 3 er et stort øyeblikk for åpen kildekode-AI-utvikling. Når åpen kildekode-modeller matcher eller overgår private alternativer, endrer det fundamentalt industrien. Forskningsgrupper over hele verden får tilgang til bevarte metoder, akselerer arbeidet og genererer nye innovasjoner. Private AI-laboratorier må tilpasse seg – enten ved å øke transparensen eller å drive tekniske grenser enda lenger.
Ser fremover, hintet Tülu 3’s gjennombrudd i verifiserbare belønninger og fler-trinns-trening om hva som kommer. Team kan bygge på disse fundamentene, potensielt drive ytelse enda høyere. Koden eksisterer, metodene er dokumentert, og en ny bølge av AI-utvikling har begynt. For utviklere og forskere markerer dette starten på en spennende kapittel i AI-utvikling.
Ofte stilte spørsmål (FAQ) om Tülu 3
Hva er Tülu 3 og hva er dens nøkkel-egenskaper?
Tülu 3 er en familie av åpen kildekode LLM-er utviklet av Allen AI, bygget på Llama 3.1-arkitekturen. Den kommer i forskjellige størrelser (8B, 70B og 405B parametere). Tülu 3 er designet for bedret ytelse over diverse oppgaver, inkludert kunnskap, resonnement, matematikk, kode, instruksjonsfølging og sikkerhet.
Hva er treningsprosessen for Tülu 3 og hva slags data brukes?
Treningsprosessen for Tülu 3 involverer flere nøkkel-steg. Først kuraterer teamet en diversifisert samling av instruksjoner fra både offentlige datasett og syntetisk data rettet mot spesifikke ferdigheter, og sikrer at dataene er dekontaminert mot benchmarkene. Andre, utføres overvåket finjustering (SFT) på en blanding av instruksjonsfølging, matematikk og kode-data. Deretter brukes direkte preferanse-optimisering (DPO) med preferanse-data generert gjennom menneskelig og LLM-tilbakemelding. Til slutt brukes Forsterkingslæring med Verifiserbare Belønninger (RLVR) for oppgaver med målbare riktighet. Tülu 3 bruker kuraterte datasett for hvert steg, inkludert persona-drevne instruksjoner, matematikk og kode-data.
Hvordan nærmer Tülu 3 seg sikkerhet og hva slags metrikker brukes til å evaluere det?
Sikkerhet er en kjernekomponent i Tülu 3’s utvikling, håndtert gjennom hele treningsprosessen. En sikkerhetsspesifikk datasett brukes under SFT, som er funnet å være i stor grad ortogonalt til andre oppgave-orienterte data.
Hva er RLVR?
RLVR er en teknikk hvor modellen trenes til å optimere mot en verifiserbar belønning, som korrektheten av et svar. Dette skiller seg fra tradisjonell RLHF som bruker en belønningmodell.













