AI-modellen en platforms

Allen AI’s Tülu 3 is onverwacht DeepSeek’s rivaal geworden

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

De koppen blijven komen. DeepSeek’s modellen hebben benchmarks uitgedaagd, nieuwe standaarden ingesteld en veel lawaai gemaakt. Maar er is iets interessants gebeurd in de AI-onderzoeksscène dat ook de moeite waard is om te zien.

Allen AI heeft stilzwijgend hun nieuwe Tülu 3 familie van modellen uitgebracht, en hun 405B parameter versie concurreert niet alleen met DeepSeek – het evenaart of overtreft het op belangrijke benchmarks.

Laten we dit in perspectief plaatsen.

Het 405B Tülu 3 model gaat tegen top-presteerders zoals DeepSeek V3 in een reeks taken. We zien vergelijkbare of superieure prestaties in gebieden zoals wiskundige problemen, coderingsuitdagingen en precieze instructievolging. En ze doen dit met een volledig open aanpak.

Ze hebben de complete trainingspijplijn, de code en zelfs hun novum versterking leer methode genaamd Versterking Leer met Verifieerbare Beloningen (RLVR) vrijgegeven die dit mogelijk maakte.

Ontwikkelingen zoals deze in de afgelopen weken veranderen echt hoe top-tier AI-ontwikkeling gebeurt. Wanneer een volledig open source model de beste gesloten modellen kan evenaren, opent dit mogelijkheden die eerder achter private corporate muren waren opgesloten.

De Technische Strijd

Wat maakte Tülu 3 uit? Het komt neer op een unieke vierfasen trainingsproces dat verder gaat dan traditionele benaderingen.

Laten we zien hoe Allen AI dit model heeft gebouwd:

Fase 1: Strategische Gegevensselectie

Het team wist dat modelkwaliteit begint met gegevenskwaliteit. Ze combineerden gevestigde datasets zoals WildChat en Open Assistant met gegenereerde inhoud. Maar hier is het sleutelinzicht: ze hebben de gegevens niet alleen geaggregeerd – ze hebben gerichte datasets voor specifieke vaardigheden zoals wiskundige redenering en coderingsvaardigheid gemaakt.

Fase 2: Betere Antwoorden Bouwen

In de tweede fase richtte Allen AI zich op het onderwijzen van hun model specifieke vaardigheden. Ze hebben verschillende sets trainingsgegevens gemaakt – sommige voor wiskunde, anderen voor codering en meer voor algemene taken. Door deze combinaties herhaaldelijk te testen, konden ze exact zien waar het model uitblonk en waar het verbetering nodig had. Dit iteratieve proces onthulde het ware potentieel van wat Tülu 3 in elk gebied kon bereiken.

Fase 3: Leren van Vergelijkingen

Dit is waar Allen AI creatief werd. Ze hebben een systeem gebouwd dat Tülu 3’s antwoorden onmiddellijk kon vergelijken met andere topmodellen. Maar ze hebben ook een hardnekkig probleem in AI opgelost – de neiging van modellen om lange antwoorden te schrijven alleen voor de lengte. Hun benadering, met behulp van lengte-genormaliseerde Directe VoorkeursOptimisatie (DPO), betekende dat het model leerde om kwaliteit boven kwantiteit te waarderen. Het resultaat? Antwoorden die zowel precies als doelgericht zijn.

Wanneer AI-modellen leren van voorkeuren (welk antwoord is beter, A of B?), ontwikkelen ze vaak een frustrerende bias: ze beginnen te denken dat langere antwoorden altijd beter zijn. Het is alsof ze proberen te winnen door meer te zeggen in plaats van dingen goed te zeggen.

Lengte-genormaliseerde DPO lost dit op door te veranderen hoe het model leert van voorkeuren. In plaats van alleen te kijken naar welk antwoord werd bevoroordeeld, houdt het rekening met de lengte van elk antwoord. Denk hierbij aan het beoordelen van antwoorden op basis van hun kwaliteit per woord, niet alleen hun totale impact.

Waarom is dit belangrijk? Omdat het Tülu 3 helpt om precies en efficiënt te leren. In plaats van antwoorden op te vullen met extra woorden om meer omvattend te lijken, leert het om waarde te leveren in de lengte die werkelijk nodig is.

Dit lijkt misschien een klein detail, maar het is cruciaal voor het bouwen van AI die op een natuurlijke manier communiceert. De beste menselijke experts weten wanneer ze bondig moeten zijn en wanneer ze moeten uitweiden – en dat is precies wat lengte-genormaliseerde DPO het model helpt te leren.

Fase 4: De RLVR Innovatie

Dit is de technische doorbraak die aandacht verdient. RLVR vervangt subjectieve beloningsmodellen met concrete verificatie.

De meeste AI-modellen leren door een complex systeem van beloningsmodellen – in wezen onderwezen gissingen over wat een goed antwoord maakt. Maar Allen AI nam een andere route met RLVR.

Denk aan hoe we momenteel AI-modellen trainen. We hebben meestal andere AI-modellen (genaamd beloningsmodellen) nodig om te beoordelen of een antwoord goed of niet is. Het is subjectief, complex en vaak inconsistent. Sommige antwoorden kunnen goed lijken maar subtiele fouten bevatten die erdoorheen glippen.

RLVR keert deze benadering om. In plaats van te vertrouwen op subjectieve oordelen, gebruikt het concrete, verifieerbare resultaten. Wanneer het model een wiskundig probleem probeert, is er geen grijs gebied – het antwoord is ofwel goed ofwel verkeerd. Wanneer het code schrijft, werkt die code ofwel correct ofwel niet.

Hier wordt het interessant:

  • Het model krijgt onmiddellijke, binaire feedback: 10 punten voor correcte antwoorden, 0 voor onjuiste
  • Er is geen ruimte voor gedeeltelijke credits of vage evaluatie
  • Het leren wordt gefocust en precies
  • Het model leert om nauwkeurigheid te prioriteren boven plausibele maar onjuiste antwoorden

RLVR Training (Allen AI)

De resultaten? Tülu 3 toonde aanzienlijke verbeteringen in taken waar correctheid het meest telt. De prestaties op wiskundige redenering (GSM8K benchmark) en coderingsuitdagingen sprongen opvallend. Zelfs de instructievolging werd preciezer omdat het model leerde om concrete nauwkeurigheid te waarderen boven benaderende antwoorden.

Wat dit bijzonder spannend maakt, is hoe het het spel verandert voor open-source AI. Eerder benaderingen worstelden vaak om de precisie van gesloten modellen op technische taken te evenaren. RLVR toont aan dat met de juiste trainingsaanpak open-source modellen diezelfde niveau van betrouwbaarheid kunnen bereiken.

Een Blik op de Cijfers

De 405B parameter versie van Tülu 3 concurreert rechtstreeks met topmodellen in het veld. Laten we zien waar het uitblonk en wat dit betekent voor open source AI.

Wiskunde

Tülu 3 blonk uit in complexe wiskundige redenering. Op benchmarks zoals GSM8K en MATH, evenaart het DeepSeek’s prestaties. Het model behandelt multi-stap problemen en toont sterke wiskundige redeneringscapaciteiten.

Code

De coderingsresultaten zijn even indrukwekkend. Dankzij RLVR-training schrijft Tülu 3 code die problemen effectief oplost. De kracht ligt in het begrijpen van coderingsinstructies en het produceren van functionele oplossingen.

Precieze Instructievolging

De mogelijkheid van het model om instructies te volgen springt eruit als een kernsterkte. Terwijl veel modellen instructies benaderen of generaliseren, toont Tülu 3 opvallende precisie in het exact uitvoeren van wat wordt gevraagd.

Het Openen van de Black Box van AI-ontwikkeling

Allen AI heeft zowel een krachtig model als hun complete ontwikkelingsproces vrijgegeven.

Elk aspect van het trainingsproces staat gedocumenteerd en toegankelijk. Van de vierfasenbenadering tot gegevensvoorbereidingsmethoden en RLVR-implementatie – het hele proces ligt open voor studie en replicatie. Deze transparantie stelt een nieuwe standaard in high-performance AI-ontwikkeling.

Ontwikkelaars ontvangen uitgebreide bronnen:

  • Complete trainingspijplijnen
  • Gegevensverwerkingsgereedschap
  • Evaluatiekaders
  • Implementatie-specificaties

Dit stelt teams in staat om:

  • Trainingsprocessen aan te passen
  • Methoden aan te passen voor specifieke behoeften
  • Verder te bouwen op bewezen benaderingen
  • Gespecialiseerde implementaties te creëren

Deze open aanpak versnelt innovatie in het hele veld. Onderzoekers kunnen bouwen op bewezen methoden, terwijl ontwikkelaars zich kunnen richten op verbeteringen in plaats van vanaf nul te beginnen.

De Opkomst van Open Source Excellence

Het succes van Tülu 3 is een groot moment voor open AI-ontwikkeling. Wanneer open source modellen private alternatieven evenaren of overtreffen, verandert dit fundamenteel de industrie. Onderzoeksteams wereldwijd krijgen toegang tot bewezen methoden, versnellen hun werk en spawnen nieuwe innovaties. Private AI-labs moeten zich aanpassen – ofwel door transparantie te vergroten of door technische grenzen nog verder te pushen.

Als we vooruitkijken, wijzen de doorbraken van Tülu 3 in verifieerbare beloningen en multi-stap training op wat er komt. Teams kunnen op deze fundamenten bouwen, mogelijk prestaties nog verder pushend. De code bestaat, de methoden zijn gedocumenteerd, en een nieuwe golf van AI-ontwikkeling is begonnen. Voor ontwikkelaars en onderzoekers markeert de kans om te experimenteren met en te verbeteren op deze methoden het begin van een spannend hoofdstuk in AI-ontwikkeling.

Veelgestelde Vragen (FAQ) over Tülu 3

Wat is Tülu 3 en wat zijn zijn sleutelfuncties?

Tülu 3 is een familie van open-source LLM’s ontwikkeld door Allen AI, gebouwd op de Llama 3.1 architectuur. Het komt in verschillende groottes (8B, 70B en 405B parameters). Tülu 3 is ontworpen voor verbeterde prestaties in diverse taken, waaronder kennis, redenering, wiskunde, codering, instructievolging en veiligheid.

Wat is het trainingsproces voor Tülu 3 en welke gegevens worden gebruikt?

De training van Tülu 3 omvat verschillende belangrijke fasen. Eerst selecteert het team een gevarieerde set prompts uit zowel openbare datasets als synthetische data gericht op specifieke vaardigheden, waarbij wordt gezorgd dat de data tegen benchmarks is gecontamineerd. Vervolgens wordt supervised finetuning (SFT) uitgevoerd op een mix van instructievolging, wiskunde en coderingsdata. Daarna wordt directe voorkeursoptimalisatie (DPO) gebruikt met voorkeursdata gegenereerd door menselijke en LLM-feedback. Tenslotte wordt Versterking Leer met Verifieerbare Beloningen (RLVR) gebruikt voor taken met meetbare correctheid. Tülu 3 gebruikt gecureerde datasets voor elke fase, waaronder persona-gedreven instructies, wiskunde en codegegevens.

Hoe benadert Tülu 3 veiligheid en welke metrics worden gebruikt om het te evalueren?

Veiligheid is een kerncomponent van de ontwikkeling van Tülu 3, aangepakt gedurende het hele trainingsproces. Een veiligheidsspecifiek dataset wordt gebruikt tijdens SFT, die grotendeels orthogonaal is aan andere taakgerichte gegevens.

Wat is RLVR?

RLVR is een techniek waarbij het model wordt getraind om te optimaliseren tegen een verifieerbare beloning, zoals de correctheid van een antwoord. Dit verschilt van traditioneel RLHF, dat een beloningsmodel gebruikt.

Alex leidt de door AI‑aangedreven nieuwsoperaties van Unite.AI, waarbij journalistiek, onderzoek en automatisering worden gecombineerd om tijdige en schaalbare berichtgeving over kunstmatige intelligentie te ondersteunen. Zijn werk helpt ervoor te zorgen dat opkomende AI‑ontwikkelingen efficiënt onder de aandacht worden gebracht, terwijl de redactionele normen van de publicatie worden gehandhaafd.