AI-modeller och plattformar
Allen AI:s Tülu 3 har blivit DeepSeeks oväntade rival

Rubrikerna fortsätter att komma. DeepSeeks modeller har utmanat benchmark, satt nya standarder och gjort mycket väsen av sig. Men något intressant har just hänt i AI-forskningsvärlden som också är värt din uppmärksamhet.
Allen AI släppte tyst sin nya Tülu 3-modellfamilj, och deras 405B parameter-version tävlar inte bara med DeepSeek – den matchar eller slår den på viktiga benchmark.
Låt oss sätta detta i perspektiv.
405B Tülu 3-modellen tävlar mot topppresterare som DeepSeek V3 över ett brett spektrum av uppgifter. Vi ser jämförbar eller överlägsen prestanda inom områden som matematikproblem, kodningsutmaningar och exakt instruktionsföljande. Och de gör det med en helt öppen ansats.
De har släppt den kompletta utbildningspipelinen, koden och till och med deras nya förstärkt inlärningsmetod som kallas Reinforcement Learning with Verifiable Rewards (RLVR) som gjorde detta möjligt.
Utvecklingar som dessa under de senaste veckorna förändrar verkligen hur toppmodell-AI-utveckling sker. När en helt öppen källkodsmodell kan matcha de bästa stängda modellerna där ute, öppnar det upp möjligheter som tidigare var låsta bakom privata företagsväggar.
Den tekniska striden
Vad gjorde Tülu 3 så utmärkande? Det handlar om en unik fyra-stegs utbildningsprocess som går utöver traditionella tillvägagångssätt.
Låt oss se hur Allen AI byggde denna modell:
Steg 1: Strategisk dataurval
Teamet visste att modellkvalitet börjar med datakvalitet. De kombinerade etablerade dataset som WildChat och Open Assistant med anpassad genererat innehåll. Men här är den viktiga insikten: de kombinerade inte bara data – de skapade riktade dataset för specifika färdigheter som matematiskt resonemang och kodningskompetens.
Steg 2: Bygga bättre svar
I det andra steget fokuserade Allen AI på att lära sin modell specifika färdigheter. De skapade olika uppsättningar av utbildningsdata – vissa för matematik, andra för kodning och fler för allmänna uppgifter. Genom att testa dessa kombinationer upprepade gånger kunde de se exakt var modellen excellerade och var den behövde arbete. Denna iterativa process avslöjade den verkliga potentialen för vad Tülu 3 kunde uppnå i varje område.
Steg 3: Lära av jämförelser
Här blev Allen AI kreativa. De byggde ett system som kunde omedelbart jämföra Tülu 3:s svar mot andra toppmodeller. Men de löste också ett ihållande problem i AI – benägenheten för modeller att skriva långa svar bara för sakens skull. Deras tillvägagångssätt, med längdnormaliserad direkt preferensoptimering (DPO), innebar att modellen lärde sig att värdera kvalitet över kvantitet. Resultatet? Svar som är både precisa och ändamålsenliga.
När AI-modeller lär sig av preferenser (vilket svar är bättre, A eller B?), tenderar de att utveckla en frustrerande bias: de börjar tro att längre svar alltid är bättre. Det är som om de försöker vinna genom att säga mer snarare än att säga saker bra.
Längdnormaliserad DPO åtgärdar detta genom att justera hur modellen lär sig av preferenser. Istället för att bara titta på vilket svar som föredrogs, tar den hänsyn till längden på varje svar. Tänk på det som att bedöma svar efter deras kvalitet per ord, inte bara deras totala inverkan.
Varför är detta viktigt? För att det hjälper Tülu 3 att lära sig att vara exakt och effektiv. Istället för att fylla svar med extra ord för att verka mer omfattande, lär den sig att leverera värde i den längd som faktiskt behövs.
Detta kan tyckas vara en liten detalj, men det är avgörande för att bygga AI som kommunicerar naturligt. De bästa mänskliga experterna vet när de ska vara koncisa och när de ska utveckla – och det är exakt vad längdnormaliserad DPO hjälper modellen att lära sig.
Steg 4: RLVR-innovationen
Detta är den tekniska genombrottet som förtjänar uppmärksamhet. RLVR ersätter subjektiva belöningsmodeller med konkreta verifieringar.
De flesta AI-modeller lär sig genom ett komplext system av belöningsmodeller – i princip utbildade gissningar om vad som gör ett bra svar. Men Allen AI tog en annan väg med RLVR.
Tänk på hur vi vanligtvis tränar AI-modeller. Vi behöver vanligtvis andra AI-modeller (kallade belöningsmodeller) för att bedöma om ett svar är bra eller inte. Det är subjektivt, komplext och ofta inkonsekvent. Vissa svar kan verka bra men innehålla subtila fel som smyger förbi.
RLVR vänder detta tillvägagångssätt upp och ner. Istället för att förlita sig på subjektiva bedömningar, använder den konkreta, verifierbara resultat. När modellen försöker ett matematikproblem, finns det ingen gråzon – svaret är antingen rätt eller fel. När den skriver kod, fungerar koden antingen eller så fungerar den inte.
Här blir det intressant:
- Modellen får omedelbar, binär återkoppling: 10 poäng för korrekta svar, 0 för felaktiga
- Det finns inget utrymme för delvis poäng eller suddig utvärdering
- Inlärningen blir fokuserad och exakt
- Modellen lär sig att prioritera exakthet över trovärdiga men felaktiga svar

RLVR-utbildning (Allen AI)
Resultaten? Tülu 3 visade betydande förbättringar i uppgifter där korrekthet är viktigast. Dess prestanda på matematiskt resonemang (GSM8K-benchmark) och kodningsutmaningar ökade betydligt. Även dess instruktionsföljande blev mer exakt eftersom modellen lärde sig att värdera konkret exakthet över approximativa svar.
Vad som gör detta särskilt spännande är hur det förändrar spelet för öppen källkods-AI. Tidigare tillvägagångssätt kämpade ofta för att matcha precisionen hos stängda modeller på tekniska uppgifter. RLVR visar att med rätt utbildningstillvägagångssätt kan öppna källkodsmodeller uppnå samma nivå av tillförlitlighet.
En titt på siffrorna
405B parameter-versionen av Tülu 3 tävlar direkt med toppmodellerna i fältet. Låt oss undersöka var den excellerar och vad detta betyder för öppen källkods-AI.
Matematik
Tülu 3 excellerar i komplex matematiskt resonemang. På benchmark som GSM8K och MATH matchar den DeepSeeks prestanda. Modellen hanterar multi-stegsproblem och visar starka matematiska resonemangsförmågor.
Kod
Kodningsresultaten är lika imponerande. Tack vare RLVR-utbildning skriver Tülu 3 kod som löser problem effektivt. Dess styrka ligger i att förstå kodningsinstruktioner och producera fungerande lösningar.
Exakt instruktionsföljande
Modellens förmåga att följa instruktioner står ut som en kärnstyrka. Medan många modeller approximerar eller generaliserar instruktioner, visar Tülu 3 en anmärkningsvärd exakthet i att utföra exakt vad som begärs.
Öppna svarta lådan av AI-utveckling
Allen AI släppte både en kraftfull modell och deras kompletta utvecklingsprocess.
Varje aspekt av utbildningsprocessen är dokumenterad och tillgänglig. Från den fyra-stegs-ansatsen till dataförberedningsmetoder och RLVR-implementering – hela processen ligger öppen för studier och replikering. Denna transparens sätter en ny standard i högpresterande AI-utveckling.
Utvecklare får omfattande resurser:
- Kompletta utbildningspipeliner
- Dataförbearbetningsverktyg
- Utvärderingsramverk
- Implementeringsspecifikationer
Detta möjliggör för team att:
- Modificera utbildningsprocesser
- Anpassa metoder för specifika behov
- Bygga på beprövade tillvägagångssätt
- Skapa specialiserade implementationer
Denna öppna ansats accelererar innovation över hela fältet. Forskare kan bygga på beprövade metoder, medan utvecklare kan fokusera på förbättringar snarare än att börja från scratch.
Öppen källkods-excellens på uppgång
Tülu 3:s framgång är en stor stund för öppen AI-utveckling. När öppna källkodsmodeller matchar eller överträffar privata alternativ, förändrar det fundamentalt branschen. Forskningsgrupper världen över får tillgång till beprövade metoder, vilket accelererar deras arbete och ger upphov till nya innovationer. Privata AI-laboratorier måste anpassa sig – antingen genom att öka transparensen eller genom att driva tekniska gränser ännu längre.
Om man ser framåt, Tülu 3:s genombrott inom verifierbara belöningar och multi-stegs-utbildning antyder vad som är på väg. Team kan bygga på dessa grundvalar, potentiellt driva prestanda ännu högre. Koden finns, metoderna är dokumenterade och en ny våg av AI-utveckling har börjat. För utvecklare och forskare markerar möjligheten att experimentera med och förbättra dessa metoder början på ett spännande kapitel i AI-utveckling.
Vanliga frågor (FAQ) om Tülu 3
Vad är Tülu 3 och vad är dess nyckelfunktioner?
Tülu 3 är en familj av öppna källkodsmodeller utvecklade av Allen AI, byggd på Llama 3.1-arkitekturen. Den kommer i olika storlekar (8B, 70B och 405B parametrar). Tülu 3 är utformad för förbättrad prestanda över diverse uppgifter, inklusive kunskap, resonemang, matematik, kodning, instruktionsföljande och säkerhet.
Vad är utbildningsprocessen för Tülu 3 och vilka data används?
Utbildningen av Tülu 3 omfattar flera viktiga steg. Först kuraterar teamet en mångfaldig uppsättning promptrar från både offentliga dataset och syntetisk data inriktad på specifika färdigheter, vilket säkerställer att data är dekontaminerat mot benchmark. Sedan utförs övervakad finjustering (SFT) på en blandning av instruktionsföljande-, matematik- och kodningsdata. Nästa steg är direkt preferensoptimering (DPO) med preferensdata genererad genom mänsklig och LLM-återkoppling. Slutligen används förstärkt inlärning med verifierbara belöningar (RLVR) för uppgifter med mätbar korrekthet. Tülu 3 använder kuraterade dataset för varje steg, inklusive persondrivna instruktioner, matematik och koddata.
Hur närmar sig Tülu 3 säkerhet och vilka mått används för att utvärdera den?
Säkerhet är en kärnkomponent i Tülu 3:s utveckling, som hanteras genom hela utbildningsprocessen. En säkerhets-specifik dataset används under SFT, som visar sig vara till stor del ortogonalt mot andra uppgiftsorienterade data.
Vad är RLVR?
RLVR är en teknik där modellen tränas för att optimera mot en verifierbar belöning, som korrektheten i ett svar. Detta skiljer sig från traditionell RLHF som använder en belöningsmodell.













