AI-modeller og platforme
Allen AI’s Tülu 3 blev pludselig DeepSeek’s uventede rival

Overskrifterne fortsætter. DeepSeek’s modeller har udfordret benchmarks, sat nye standarder og lavet meget støj. Men noget interessant er lige sket i AI-forsknings scenen, som også er værd at lægge mærke til.
Allen AI har stille og roligt udgivet deres nye Tülu 3 familie af modeller, og deres 405B parameter version er ikke bare med i konkurrencen med DeepSeek – det matcher eller slår det på nøgle benchmarks.
Lad os sætte dette i perspektiv.
405B Tülu 3 modellen er op imod top-performere som DeepSeek V3 på en række opgaver. Vi ser sammenlignelige eller overlegne præstationer på områder som matematiske problemer, kodningsudfordringer og præcis instruktionsfølging. Og de gør det med en fuldstændig åben tilgang.
De har udgivet den komplette træningspipeline, koden og endda deres nye forstærkede læringsmetode kaldet Forstærket Læring med Verificerbare Belønninger (RLVR), der gjorde dette muligt.
Udviklinger som disse over de seneste uger ændrer virkeligt, hvordan top-tier AI-udvikling sker. Når en fuldstændig open source model kan matche de bedste lukkede modeller derude, åbner det muligheder, der tidligere var låst bag lukkede virksomhedsporte.
Den Tekniske Kamp
Hvad gjorde Tülu 3 stå ud? Det kommer ned til en unik firetrins træningsproces, der går ud over traditionelle tilgange.
Lad os se, hvordan Allen AI byggede denne model:
Trin 1: Strategisk Dataudvælgelse
Holdet vidste, at modelkvaliteten starter med datakvaliteten. De kombinerede etablerede datasets som WildChat og Open Assistant med selvgenereret indhold. Men her er den vigtige indsigt: de kombinerede ikke bare data – de skabte målrettede datasets for bestemte færdigheder som matematisk resonnering og kodningsdygtighed.
Trin 2: Bygning af Bedre Svar
I andet trin fokuserede Allen AI på at lære deres model bestemte færdigheder. De skabte forskellige sæt af træningsdata – nogle til matematik, andre til kodning og mere til generelle opgaver. Ved at teste disse kombinationer gentagne gange kunne de se præcis, hvor modellen udmærkede sig og hvor den havde brug for arbejde. Denne iterative proces afslørede den sande potentiale for, hvad Tülu 3 kunne opnå i hvert område.
Trin 3: Læring fra Sammenligninger
Her blev Allen AI kreative. De byggede et system, der kunne sammenligne Tülu 3’s svar med andre topmodeller med det samme. Men de løste også et vedvarende problem i AI – tendensen til, at modellerne skriver lange svar blot for længdens skyld. Deres tilgang, der bruger længdenormaliseret Direkte Præferenceoptimering (DPO), betød, at modellen lærte at værdsætte kvalitet over kvantitet. Resultatet? Svar, der både er præcise og formålsspecifikke.
Når AI-modeller lærer af præferencer (hvilket svar er bedre, A eller B?), tenderer de til at udvikle en frustrerende bias: de begynder at tro, at længere svar altid er bedre. Det er, som om de forsøger at vinde ved at sige mere snarere end at sige ting godt.
Længdenormaliseret DPO løser dette ved at justere, hvordan modellen lærer af præferencer. I stedet for blot at se på, hvilket svar der blev foretrukket, tager den også længden af hvert svar i betragtning. Tænk på det som at dømme svar efter deres kvalitet per ord, ikke blot deres samlede effekt.
Hvorfor er dette vigtigt? Fordi det hjælper Tülu 3 med at lære at være præcis og effektiv. I stedet for at fyldte svar med ekstra ord for at synes mere omfattende lærer den at levere værdi i den længde, der faktisk er nødvendig.
Dette kan synes som en lille detalje, men det er afgørende for at bygge AI, der kommunikerer naturligt. De bedste menneskelige eksperter ved, hvornår de skal være korte og hvornår de skal uddybe – og det er præcis, hvad længdenormaliseret DPO hjælper modellen med at lære.
Trin 4: RLVR-innovationen
Dette er den tekniske gennembrud, der fortjener opmærksomhed. RLVR erstatter subjektive belønningsmodeller med konkrete verifikationer.
De fleste AI-modeller lærer gennem et komplekst system af belønningsmodeller – i virkeligheden uddannede gæt om, hvad der gør et godt svar. Men Allen AI tog en anden vej med RLVR.
Tænk på, hvordan vi typisk træner AI-modeller. Vi har brug for andre AI-modeller (kaldet belønningsmodeller) til at dømme, om et svar er godt eller ej. Det er subjektivt, komplekst og ofte inkonsistent. Nogle svar kan synes gode, men indeholde subtile fejl, der slipper igennem.
RLVR vender denne tilgang på hovedet. I stedet for at stole på subjektive vurderinger bruger den konkrete, verificerbare resultater. Når modellen forsøger et matematisk problem, er der ingen gråzone – svaret er enten rigtigt eller forkert. Når den skriver kode, kører koden enten korrekt eller gør det ikke.
Her bliver det interessant:
- Modellen får øjeblikkelig, binær feedback: 10 point for korrekte svar, 0 for forkerte
- Der er ingen plads til delvis kredit eller fuzzy vurdering
- Læring bliver fokuseret og præcis
- Modellen lærer at prioritere nøjagtighed over plausibelt lydende, men forkerte svar

RLVR Træning (Allen AI)
Resultaterne? Tülu 3 viste betydelige forbedringer i opgaver, hvor korrektheden betyder mest. Dets præstation på matematisk resonnering (GSM8K benchmark) og kodningsudfordringer sprang betydeligt. Selv dets instruktionsfølging blev mere præcis, fordi modellen lærte at værdsætte konkrete nøjagtighed over approksimative svar.
Hvad gør dette særligt spændende, er, hvordan det ændrer spillet for open source AI. Tidligere tilgange havde ofte svært ved at matche præcisionen af lukkede modeller på tekniske opgaver. RLVR viser, at med den rette trænings tilgang kan open source-modeller opnå samme niveau af pålidelighed.
Et Kig på Tallene
405B parameter versionen af Tülu 3 konkurrerer direkte med topmodellerne i feltet. Lad os se, hvor det udmærker sig og hvad det betyder for open source AI.
Matematik
Tülu 3 udmærker sig i kompleks matematisk resonnering. På benchmarks som GSM8K og MATH matcher det DeepSeek’s præstation. Modellen håndterer flertrinsproblemer og viser stærke matematiske resonneringsfærdigheder.
Kode
Kodningsresultaterne er lige så imponerende. Takket være RLVR-træning skriver Tülu 3 kode, der løser problemer effektivt. Dets styrke ligger i at forstå kodningsinstruktioner og producere funktionelle løsninger.
Præcis Instruktionsfølging
Modellens evne til at følge instruktioner står ud som en kerne-styrke. Mens mange modeller approksimerer eller generaliserer instruktioner, demonstrerer Tülu 3 bemærkelsesværdig præcision i at udføre præcis, hvad der bedes om.
Åbning af den Sorte Kasse for AI-Udvikling
Allen AI udgav både en kraftfuld model og deres komplette udviklingsproces.
Hver enkelt aspekt af træningsprocessen er dokumenteret og tilgængelig. Fra den firetrins tilgang til dataforberedningsmetoder og RLVR-implementering – hele processen ligger åben for studie og replikation. Denne transparens sætter en ny standard i high-performance AI-udvikling.
Udviklere modtager omfattende ressourcer:
- Komplet træningspipeline
- Dataforarbejdningværktøjer
- Vurderingsrammer
- Implementerings-specifikationer
Dette muliggør, at hold kan:
- Ændre træningsprocesser
- Tilpasse metoder til bestemte behov
- Bygge på bevisede tilgange
- Oprette specialiserede implementationer
Denne åbne tilgang accelererer innovation på tværs af feltet. Forskere kan bygge på verificerede metoder, mens udviklere kan fokusere på forbedringer i stedet for at starte fra scratch.
Opstigen af Open Source-ekspertise
Tülu 3’s succes er et stort øjeblik for open source AI-udvikling. Når open source-modeller matcher eller overgår private alternativer, ændrer det fundamentalt branchen. Forskningshold verden over får adgang til bevisede metoder, hvilket accelererer deres arbejde og fremkalder nye innovationer. Private AI-laboratorier må tilpasse sig – enten ved at øge transparensen eller ved at skubbe tekniske grænser endnu længere.
Når vi ser fremad, antyder Tülu 3’s gennembrud i verificerbare belønninger og multi-trins træning, hvad der er på vej. Hold kan bygge på disse fundament, potentielt skubbe præstationerne endnu højere. Koden findes, metoderne er dokumenterede, og en ny bølge af AI-udvikling er begyndt. For udviklere og forskere markerer muligheden for at eksperimentere med og forbedre disse metoder begyndelsen på en spændende kapitel i AI-udvikling.
Ofte Stillede Spørgsmål (FAQ) om Tülu 3
Hvad er Tülu 3, og hvad er dets nøglefunktioner?
Tülu 3 er en familie af open source LLM’er udviklet af Allen AI, bygget på Llama 3.1-arkitekturen. Det kommer i forskellige størrelser (8B, 70B og 405B parametre). Tülu 3 er designet til forbedret præstation på tværs af diverse opgaver, herunder viden, resonnering, matematik, kodning, instruktionsfølging og sikkerhed.
Hvad er træningsprocessen for Tülu 3, og hvilke data bruges?
Træningen af Tülu 3 involverer flere nøgletrin. Først kuraterer teamet en divers samling af prompts fra både offentlige datasets og syntetisk data rettet mod bestemte færdigheder, sikrer, at data er dekontamineret mod benchmarks. Dernæst udføres supervised finjustering (SFT) på en blanding af instruktionsfølging, matematik og kodningsdata. Herefter bruges direkte præferenceoptimering (DPO) med præference-data genereret gennem menneskelig og LLM-feedback. Til sidst bruges Forstærket Læring med Verificerbare Belønninger (RLVR) til opgaver med målbare korrektheden. Tülu 3 bruger kuraterede datasets til hvert trin, herunder persona-drevne instruktioner, matematik og kode-data.
Hvordan tilgår Tülu 3 sikkerhed, og hvilke metrikker bruges til at evaluere det?
Sikkerhed er en kernekomponent i Tülu 3’s udvikling, adresseret på tværs af træningsprocessen. En sikkerheds-specifik dataset bruges under SFT, som er fundet at være stort set ortogonalt til andre opgave-orienterede data.
Hvad er RLVR?
RLVR er en teknik, hvor modellen trænes til at optimere mod en verificerbar belønning, som korrektheden af et svar. Dette adskiller sig fra traditionel RLHF, der bruger en belønningsmodel.













