Modely a platformy AI

Allen AI’s Tülu 3 se stal nečekaným rivalem DeepSeeku

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Titulky se stále objevují. Modely DeepSeek vybízejí benchmarky, stanovují nové standardy a dělají hodně hluku. Ale něco zajímavého se právě stalo ve scéně výzkumu umělé inteligence, a to je také hodno vaší pozornosti.

Allen AI tiše vydal novou rodinu modelů Tülu 3, a verze s 405B parametry není jen srovnatelná s DeepSeekem – ale ji dokonce překonává v některých klíčových benchmarcích.

Pochopte to v перспективě.

Model Tülu 3 s 405B parametry se utkává s top performery, jako je DeepSeek V3 v celé řadě úkolů. Vidíme srovnatelné nebo lepší výkony v oblastech, jako jsou matematické problémy, kódovací výzvy a přesné sledování instrukcí. A dělají to s kompletně otevřeným přístupem.

Byli zveřejněni kompletní trénovací proces, kód a dokonce i jejich novou metodu učení s ověřitelnými odměnami, nazvanou Reinforcement Learning with Verifiable Rewards (RLVR), která to ermögnila.

Tento vývoj během posledních týdnů skutečně mění, jak se děje vývoj umělé inteligence nejvyšší úrovně. Když plně otevřený model může být srovnatelný s nejlepšími uzavřeným modely, otevírá se možnosti, které byly dříve uzavřeny za soukromými firemními zdmi.

Technická bitva

Co dělá Tülu 3 výjimečným? To se snižuje na unikátní čtyřfázový trénovací proces, který jde za hranice tradičních přístupů.

Pochopte, jak Allen AI postavil tento model:

Fáze 1: Strategické výběry dat

Tým věděl, že kvalita modelu začíná kvalitou dat. Kombinovali zavedené datové sady, jako je WildChat a Open Assistant, s vlastními generovanými obsahy. Ale zde je klíčový vhled: ne pouze agregovali data – vytvořili cílené datové sady pro specifické dovednosti, jako je matematické myšlení a kódovací zdatnost.

Fáze 2: Vývoj lepších odpovědí

Ve druhé fázi se Allen AI zaměřil na výuku modelu specifických dovedností. Vytvořili různé sady trénovacích dat – některé pro matematiku, jiné pro kódování a další pro obecné úkoly. Testováním těchto kombinací opakovaně mohli vidět přesně, kde model vyniká a kde potřebuje práci. Tento iterativní proces odhalil skutečný potenciál, kterého Tülu 3 mohl dosáhnout v každé oblasti.

Fáze 3: Učení z porovnání

Tady se Allen AI stal kreativním. Postavil systém, který mohl okamžitě porovnat odpovědi Tülu 3 s odpověďmi jiných top modelů. Ale také vyřešil trvalý problém v AI – tendenci modelů psát dlouhé odpovědi jen pro délku. Jejich přístup, který používá normalizovanou délku Direct Preference Optimization (DPO), znamenal, že model se naučil hodnotit kvalitu nad kvantitu. Výsledek? Odpovědi, které jsou både přesné a účelné.

Když modely AI učí se z preferencí (která odpověď je lepší, A nebo B?), tendují k rozčarování – začínají si myslet, že delší odpovědi jsou vždy lepší. Je to, jako by se snažily vyhrát tím, že řeknou více, místo toho, aby řekly věci dobře.

Normalizovaná délka DPO opravuje to, měněním toho, jak model učí se z preferencí. Místo toho, aby se pouze díval na preferovanou odpověď, bere v úvahu délku každé odpovědi. Myslete si to jako hodnocení odpovědí podle kvality na slovo, ne pouze celkového dopadu.

Proč je to důležité? Protože to pomáhá Tülu 3 naučit se být přesný a efektivní. Místo toho, aby odpovědi prodlužoval o další slova, aby se zdál komplexnější, učí se dodávat hodnotu v délce, která je skutečně potřeba.

To se může zdát jako malý detail, ale je to zásadní pro stavbu AI, která komunikuje přirozeně. Nejlepší lidský odborníci vědí, kdy být struční a kdy rozvinout – a to je přesně to, co normalizovaná délka DPO pomáhá modelu naučit.

Fáze 4: Inovace RLVR

To je technický průlom, který si zaslouží pozornost. RLVR nahrazuje subjektivní modely odměn konkrétními ověřitelnými odměnami.

Většina modelů AI se učí prostřednictvím komplexního systému modelů odměn – v podstatě vzdělaných odhadů o tom, co dělá dobrou odpověď. Ale Allen AI zvolil jiný přístup s RLVR.

Zamyslete se, jak目前 trénujeme modely AI. Obvykle potřebujeme jiné modely AI (nazývané modely odměn), aby posoudily, zda odpověď je dobrá nebo ne. Je to subjektivní, komplexní a často nekonzistentní. Některé odpovědi mohou vypadat dobře, ale obsahovat jemné chyby, které projdou.

RLVR otočí tento přístup vzhůru nohama. Místo toho, aby se spoléhal na subjektivní úsudky, používá konkrétní, ověřitelné výsledky. Když model pokusí matematický problém, není žádná šedá zóna – odpověď je buď správná, nebo špatná. Když napíše kód, ten buď funguje správně, nebo ne.

Zde se to stává zajímavým:

  • Model dostává okamžitou, binární zpětnou vazbu: 10 bodů za správné odpovědi, 0 za nesprávné
  • Není prostoru pro částečné kredity nebo fuzzy hodnocení
  • Učení se stává zaměřeným a přesným
  • Model se učí upřednostňovat přesnost před uvěřitelně vypadajícími, ale nesprávnými odpověďmi

RLVR trénink (Allen AI)

Výsledky? Tülu 3 ukázal významné zlepšení v úkolech, kde je důležitá správnost. Jeho výkon v matematickém myšlení (GSM8K benchmark) a kódovacích výzvách skočil znatelně. Dokonce i jeho sledování instrukcí se stalo přesnějším, protože model se naučil hodnotit konkrétní přesnost nad aproximativní odpovědi.

Co dělá to zvlášť vzrušujícím, je to, jak to mění hru pro otevřené zdrojové AI. Předchozí přístupy často bojovaly s tím, aby dosáhly stejné úrovně přesnosti jako uzavřené modely v technických úkolech. RLVR ukazuje, že s správným trénovacím přístupem mohou otevřené modely dosáhnout stejné úrovně spolehlivosti.

Pohled na čísla

Verze Tülu 3 s 405B parametry soutěží přímo s top modely v oboru. Pochopte, kde vyniká a co to znamená pro otevřené zdrojové AI.

Matematika

Tülu 3 vyniká v komplexním matematickém myšlení. Na benchmarcích, jako je GSM8K a MATH, odpovídá výkonu DeepSeeku. Model zvládá vícekrokové problémy a ukazuje silné matematické myšlení.

Kódování

Výsledky kódování jsou stejně působivé. Díky tréninku RLVR píše Tülu 3 kód, který efektivně řeší problémy. Jeho síla spočívá v pochopení kódovacích instrukcí a produkci funkčních řešení.

Přesné sledování instrukcí

Schopnost modelu sledovat instrukce vyniká jako jeho hlavní síla. Zatímco mnoho modelů aproximuje nebo generalizuje instrukce, Tülu 3 ukazuje pozoruhodnou přesnost v provádění přesně toho, co je požadováno.

Otevírání černé skříně vývoje AI

Allen AI vydal nejen silný model, ale také celý vývojový proces.

Každý aspekt trénovacího procesu je zdokumentován a přístupný. Od čtyřfázového přístupu po metody přípravy dat a implementaci RLVR – celý proces leží otevřený pro studium a replikaci. Tato transparentnost nastavuje nový standard ve vývoji vysokovýkonné AI.

Vývojáři dostávají komplexní zdroje:

  • Kompletní trénovací procesy
  • Nástroje pro zpracování dat
  • Hodnoticí rámce
  • Specifikace implementace

To umožňuje týmům:

  • Modifikovat trénovací procesy
  • Přizpůsobit metody pro specifické potřeby
  • Postavit na ověřených přístupech
  • Vytvořit specializované implementace

Tento otevřený přístup urychluje inovace v celém oboru. Výzkumníci mohou stavět na ověřených metodách, zatímco vývojáři se mohou soustředit na zlepšení, místo aby začínali od nuly.

Vzestup otevřené excelence

Úspěch Tülu 3 je velkým okamžikem pro otevřený vývoj AI. Když otevřené modely odpovídají nebo překonávají soukromé alternativy, fundamentálně mění se průmysl. Výzkumné týmy po celém světě získávají přístup k ověřeným metodám, urychlují svou práci a rodí se nové inovace. Soukromé laboratoře AI budou muset se přizpůsobit – buď zvýšením transparentnosti, nebo tlačením technických hranic ještě dále.

Pohledem do budoucna, průlomy Tülu 3 v ověřitelných odměnách a vícefázovém tréninku naznačují, co přijde. Týmy mohou stavět na těchto základech, potenciálně tlačící výkon ještě výše. Kód existuje, metody jsou zdokumentovány, a nová vlna vývoje AI začala. Pro vývojáře a výzkumníky, možnost experimentovat a zlepšovat tyto metody znamená začátek vzrušující kapitoly ve vývoji AI.

Často kladené otázky (FAQ) o Tülu 3

Co je Tülu 3 a jaké jsou jeho klíčové funkce?

Tülu 3 je rodina otevřených LLM, vyvinutá Allen AI, postavená na architektuře Llama 3.1. Je k dispozici ve různých velikostech (8B, 70B a 405B parametrů). Tülu 3 je navržen pro lepší výkon v různých úkolech, včetně znalostí, myšlení, matematiky, kódování, sledování instrukcí a bezpečnosti.

Jaký je trénovací proces pro Tülu 3 a jaké údaje se používají?

Trénování Tülu 3 zahrnuje několik klíčových fází. První, tým připravil rozmanitou sadu podnětů z veřejných datových sad a syntetických dat zaměřených na specifické dovednosti, zajišťující, že data jsou dekontaminována proti benchmarkům. Druhá, provedl se supervizovaný fine-tuning (SFT) na mixu instrukcí, matematiky a kódovacích dat. Třetí, použil se přímá preference optimalizace (DPO) s preferenčními daty generovanými prostřednictvím lidské a LLM zpětné vazby. Nakonec, použil se Reinforcement Learning with Verifiable Rewards (RLVR) pro úkoly s měřitelnou správností. Tülu 3 používá připravené datové sady pro každou fázi, včetně instrukcí, matematiky a kódovacích dat.

Jak Tülu 3 přistupuje k bezpečnosti a jaké metriky se používají k jejímu hodnocení?

Bezpečnost je klíčovou součástí vývoje Tülu 3, řešenou po celý trénovací proces. Během SFT se používá bezpečnostní specifická datová sada, která se ukázala být převážně ortogonální k ostatním úkolům orientovaným datům.

Co je RLVR?

RLVR je technika, při které se model učí optimalizovat proti ověřitelné odměně, jako je správnost odpovědi. To se liší od tradičního RLHF, který používá model odměn.

Alex vede AI‑poháněné zpravodajské operace společnosti Unite.AI, spojující žurnalistiku, výzkum a automatizaci, aby podpořil včasné a škálovatelné pokrytí umělé inteligence. Jeho práce pomáhá zajistit, aby se nové vývoje umělé inteligence rychle objevovaly, a to při zachování redakčních standardů publikace.