Yapay zeka modelleri ve platformları

Allen AI’nin Tülu 3’ü DeepSeek’in Beklenmedik Rakibi Oldu

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Manşetler devam ediyor. DeepSeek’in modelleri benchmark’leri zorluyor, yeni standartlar belirliyor ve çok fazla gürültü çıkarıyor. Ancak AI araştırma sahnesinde ilginç bir şey oldu ve dikkatinizi hak ediyor.

Allen AI sessizce yeni Tülu 3 model ailesini çıkardı ve 405B parametreli versiyonu sadece DeepSeek ile yarışmıyor, aynı zamanda ana benchmark’lerde onu geçiyor veya ona eşit geliyor.

Bunu perspektife koyarak bakalım.

405B Tülu 3 modeli, DeepSeek V3 gibi üst düzey performans gösteren modellerle çeşitli görevlerde yarışıyor. Matematik problemleri, kodlama zorlukları ve precisa talimat takibi gibi alanlarda benzer veya üstün performans görüyoruz. Ve tüm bunları tamamen açık bir yaklaşım ile yapıyorlar.

Eğitim pipeline’ının tamamını, kodu ve yeni bir pekiştirme öğrenimi yöntemi olan Reinforcement Learning with Verifiable Rewards (RLVR) yayınlayarak bunu mümkün kıldılar.

Son birkaç haftadaki gelişmeler, üst düzey AI geliştirmenin nasıl gerçekleştiği konusunda gerçekten bir değişim yaratıyor. Tamamen açık kaynaklı bir modelin en iyi kapalı modellerle eşdeğer performans gösterebileceği ortaya çıkıyor.

Teknik Mücadele

Tülu 3’ü öne çıkaran nedir? Bu, geleneksel yaklaşımların ötesine geçen benzersiz dört aşamalı bir eğitim sürecine dayanır.

Allen AI’nin bu modeli nasıl inşa ettiğine bakalım:

1. Aşama: Stratejik Veri Seçimi

Ekibin model kalitesinin veri kalitesiyle başladığı bilincindeydi. WildChat ve Open Assistant gibi kurulmuş veri setlerini, özel olarak üretilen içeriklerle birleştirdiler. Ancak burada önemli bir nokta var: sadece veri birleştirmekle kalmadılar, matematiksel akıl yürütme ve kodlama becerileri gibi belirli beceriler için hedeflenmiş veri setleri oluşturdular.

2. Aşama: Daha İyi Yanıtlar Oluşturma

İkinci aşamada, Allen AI modelinin belirli becerilerini öğretmeye odaklandı. Matematik, kodlama ve genel görevler için farklı eğitim veri setleri oluşturdular. Bu kombinasyonları tekrar tekrar test ederek, modelin nerede başarılı olduğunu ve nerede çalışması gerektiğini görebildiler. Bu yinelemeli süreç, Tülu 3’ün her alanda neler başarmaya capable olduğunu ortaya çıkardı.

3. Aşama: Karşılaştırmalardan Öğrenme

Burada Allen AI yaratıcı oldu. Tülu 3’ün yanıtlarını anında diğer üst düzey modellerle karşılaştırabilecek bir sistem geliştirdiler. Ancak AI’de kalıcı bir problemi de çözdüler: modellerin sadece uzunluk için uzun yanıtlar yazma eğilimini. Uzunluk normalize edilmiş Direct Preference Optimization (DPO) kullanarak, modelin kaliteyi nicelikten daha önemli görmesini sağladılar. Sonuç? Hem precisa hem de amaçlı yanıtlar.

AI modelleri tercihlerden (hangi yanıt daha iyi, A mı B mi?) öğrendiğinde, genellikle can sıkıcı bir yanlılığa sahip olurlar: daha uzun yanıtların her zaman daha iyi olduğuna inanmaya başlarlar. Bu, daha fazla söylemek yerine iyi şeyler söylemeye çalışmak yerine daha fazla söylemeye çalışmak gibi bir şey.

Uzunluk normalize edilmiş DPO, tercihlerden öğrenirken nasıl öğrendiğini değiştirerek bu sorunu çözer. Sadece hangi yanıtın tercih edildiğine değil, her yanıtın uzunluğuna da dikkat eder. Yanıtları kelime başına kalite ile değerlendirmek gibi düşünün, sadece toplam etkileri ile değil.

Neden bu önemli? Çünkü Tülu 3’ün precisa ve verimli öğrenmesini sağlar. Yanıtları, ekstra kelimelerle doldurmak yerine gerçekten gerekli olan uzunlukta teslim etmesini öğrenir.

Bu, doğal bir şekilde iletişim kuran AI inşa etmek için kritik bir ayrıntıdır. En iyi insan uzmanları, ne zaman kısa ne zaman uzun olacağını bilirler – ve bu tam olarak uzunluk normalize edilmiş DPO’nun modeli öğrettiği şey.

4. Aşama: RLVR İnovasyonu

Bu, dikkat çekmeyi hak eden teknik bir ilerlemedir. RLVR, subjektif ödül modellerini somut bir ödülle değiştirir.

Çoğu AI modeli,Complex bir ödül modeli sistemi aracılığıyla öğrenir – temelde iyi bir yanıtın ne olduğu hakkında eğitimli tahminler. Ancak Allen AI, RLVR ile farklı bir yol izledi.

Şu anda AI modellerini nasıl eğittiğimize bir düşünün. Genellikle bir yanıtın iyi olup olmadığını değerlendirmek için diğer AI modellerine (ödül modelleri olarak adlandırılır) ihtiyacımız vardır. Bu subjektiftir, karmaşıktır ve souvent tutarsızdır. Bazı yanıtlar iyi gibi görünebilir ancak içeride gizli hatalar olabilir.

RLVR bu yaklaşımı başaşağı çevirir. Subjektif değerlendirmelere güvenmek yerine somut, doğrulanabilir sonuçları kullanır. Model bir matematik problemine çalıştığında, gri bir alan yoktur – cevap ya doğrudur ya da yanlıştır. Kod yazdığında, bu kod ya çalışır ya da çalışmaz.

Şimdi ilginç bir şey:

  • Model anında, ikili geri bildirimi alır: doğru cevaplar için 10 puan, yanlışlar için 0 puan
  • Kısmi kredi veya bulanık değerlendirme için yer yoktur
  • Öğrenme odaklanır ve precisa hale gelir
  • Model, inandırıcı ancak yanlış yanıtlardan ziyade doğruluğu önceliklendirmeyi öğrenir

RLVR Eğitim (Allen AI)

Sonuçlar? Tülu 3, doğruluk önemli olan görevlerde önemli gelişmeler gösterdi. Matematiksel akıl yürütme (GSM8K benchmark) ve kodlama zorluklarındaki performansı dikkat çekici bir şekilde arttı. Talimat takibi de daha precisa hale geldi çünkü model somut doğruluğu yaklaşık yanıtlardan daha önemli görmeyi öğrendi.

Bu özellikle heyecan verici çünkü açık kaynaklı AI için oyunu değiştiriyor. Önceki yaklaşımlar genellikle teknik görevlerde kapalı modellerin doğruluğunu eşleştirmekte zorlanıyordu. RLVR, doğru eğitim yaklaşımıyla açık kaynaklı modellerin aynı düzeyde güvenilirlikte olabileceğini gösteriyor.

Rakamlara Bir Bakış

405B parametreli Tülu 3, doğrudan alanda üst düzey modellerle yarışıyor. Nerede öne çıktığını ve açık kaynaklı AI için ne anlama geldiğini inceleyelim.

Matematik

Tülu 3, karmaşık matematiksel akıl yürütmede öne çıkıyor. GSM8K ve MATH gibi benchmark’lerde DeepSeek’in performansını eşliyor. Model, çok adımlı problemleri ele alıyor ve güçlü matematiksel akıl yürütme yetenekleri sergiliyor.

Kodlama

Kodlama sonuçları da aynı derecede etkileyici. RLVR eğitimi sayesinde Tülu 3, sorunları çözen kod yazıyor. Kodlama talimatlarını anlamak ve işlevsel çözümler üretmek konusunda güçlü.

Talimat Takibi

Modelin talimat takibi yeteneği, temel bir güç olarak öne çıkıyor. Çoğu model talimatları yaklaşık veya genelleştirirken, Tülu 3 istendiği şekilde precisa bir şekilde talimatları takip ediyor.

AI Geliştirme Karanlıklarının Ardına Bakmak

Allen AI, sadece güçlü bir modeli değil, tüm geliştirme sürecini de açıkladı.

Eğitim sürecinin her yönü belgelenmiş ve erişilebilirdir. Dört aşamalı yaklaşımdan veri hazırlama yöntemlerine ve RLVR uygulamasına kadar tüm süreç, çalıştırma ve tekrarlanma için açıktır. Bu şeffaflık, yüksek performanslı AI geliştirmesinde yeni bir standardı belirliyor.

Geliştiriciler, kapsamlı kaynaklar alıyorlar:

  • Tam eğitim pipeline’ları
  • Veri işleme araçları
  • Değerlendirme çerçeveleri
  • Uygulama仕様ları

Bu, ekiplere:

  • Eğitim süreçlerini değiştirmeyi
  • Yöntemleri özel ihtiyaçlar için uyarlamayı
  • Kanılıştırılmış yaklaşımlar üzerine inşa etmeyi
  • Özel uygulamalar oluşturmayı

Bu, tüm alan boyunca inovasyonu hızlandırıyor. Araştırmacılar, doğrulanmış yöntemlere dayanabilirken, geliştiriciler geliştirmeye odaklanabiliyor.

Açık Kaynaklı Mükemmelliğin Yükselişi

Tülu 3’ün başarısı, açık AI geliştirmesi için büyük bir an. Açık kaynaklı modeller, özel alternatiflerle eşdeğer veya daha iyi performans gösterdiğinde, endüstriyi temelde değiştiriyor. Araştırma ekipleri worldwide, kanıtlanmış yöntemlere erişiyor, çalışmalarını hızlandırıyor ve yeni inovasyonları doğuruyor. Özel AI laboratuvarları, ya şeffaflığı artırmak ya da teknik sınırları daha da ileriye taşımak zorunda kalacak.

İleriye bakıldığında, Tülu 3’ün verifiable ödüller ve çok aşamalı eğitimdeki atılımları, neler gelebileceğinin ipuçlarını veriyor. Ekipler, bu temel üzerine inşa ederek performansı daha da yükseltebilir. Kod mevcut, yöntemler belgelenmiş ve yeni bir AI geliştirme dalgası başladı. Geliştiriciler ve araştırmacılar için, bu yöntemleri deneyerek ve geliştirerek heyecan verici bir bölüm başladı.

Tülu 3 Hakkında Sıkça Sorulan Sorular (SSS)

Tülu 3 nedir ve ana özellikleri nelerdir?

Tülu 3, Allen AI tarafından geliştirilen açık kaynaklı bir dizi büyük dil modelidir. Llama 3.1 mimarisine dayanır ve 8B, 70B ve 405B parametreli versiyonları mevcuttur. Bilgi, akıl yürütme, matematik, kodlama, talimat takibi ve güvenlik gibi çeşitli görevlerde geliştirilmiştir.

Tülu 3’ün eğitim süreci nedir ve hangi veriler kullanılır?

Tülu 3’ün eğitimi, birkaç önemli aşama içerir. İlk olarak, ekip, belirli becerilere yönelik hedeflenmiş veri setleri de dahil olmak üzere, çeşitli veri setlerini birleştirir. Sonra, talimat takibi, matematik ve kodlama verileri karışımı üzerinde gözetimli fine-tuning (SFT) gerçekleştirilir. Daha sonra, insan ve LLM geri bildirimi ile oluşturulan tercih verileri kullanılarak doğrudan tercih optimizasyonu (DPO) uygulanır. Son olarak, ölçülebilir doğruluk içeren görevler için Reinforcement Learning with Verifiable Rewards (RLVR) kullanılır. Tülu 3, her aşama için, persona yönlendirmeli talimatlar, matematik ve kodlama verileri de dahil olmak üzere, oluşturulmuş veri setlerini kullanır.

Tülu 3 güvenlik konusunda nasıl yaklaşır ve hangi metriklere göre değerlendirilir?

Güvenlik, Tülu 3’ün geliştirilmesinde temel bir bileşendir ve eğitim sürecinin her aşamasında ele alınır. SFT sırasında, diğer görev odaklı verilerden büyük ölçüde bağımsız olan bir güvenlik özgü veri seti kullanılır.

RLVR nedir?

RLVR, modelin, bir cevabın doğruluğu gibi somut bir ödülü optimize etmesi gereken bir tekniktir. Bu, geleneksel RLHF’nin kullandığı ödül modelinden farklıdır.

Alex, Unite.AI'nin yapay zeka destekli haber operasyonlarını yönetiyor; gazetecilik, araştırma ve otomasyonu birleştirerek yapay zekanın zamanında ve ölçeklenebilir bir şekilde kapsanmasını sağlıyor. Çalışması, gelişmekte olan yapay zeka gelişmelerinin verimli bir şekilde ortaya çıkarılmasını sağlarken, yayıncının editöryel standartlarını korur.