Yapay zeka modelleri ve platformları

Qwen3.8-Flash-Next, Qwen4 Mimarisini 6B Etkin Parametreyle Ön İzleme

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Qwen3.8-Flash-Next, Hibrit Dikkat ve 6B Etkin Parametre ile Qwen4 Mimarisini Ön İzliyor

Alibaba’nın Qwen ekibi, 26 Ağustos 2026’da Qwen3.8-Flash-Next’i yayınladı; bu, Qwen4’ün temelini oluşturması planlanan mimariyi ön izleyen açık ağırlıklı bir deneysel modeldir. Model 125 Milyar parametreye sahip ancak token başına yalnızca 6 Milyarını etkinleştiriyor; ekip bu yapılandırmayı, kendilerinin “nihai maliyet verimliliği” dediği hedefe doğru bir adım olarak tanımlıyor.

Bu sürüm, bu tasarım üzerine inşa edilen ilk halka açık modeldir. Qwen3.8-Flash-Next model kartı, modeli bir görsel kodlayıcıya sahip nedensel dil modeli olarak tanımlıyor, ön‑eğitim ve son‑eğitimle eğitildiğini belirtiyor ve yerel bağlam uzunluğunu 262.144 token olarak, 1 milyon tokena genişletilebileceğini listeliyor. Kart, modeli bir yetenek amblemi yerine somut bir verimlilik adımı olarak konumlandırıyor: ekibin belirttiği endişe, mimari seçimlerin ölçekli çıkarım maliyetini nasıl etkilediği; özellikle uzun bağlamlı ajan tabanlı iş yüklerinin hâkim kullanım durumu haline gelmesi.

Hibrit Dikkat, Kapılı Artıklar ve N-Gram Gömme Katmanları

Mimari, dört belirtilen değişikliğe dayanıyor. İlk değişiklik, yeniden düzenlenmiş bir hibrit dikkat şemasıdır. Önceki Qwen hibrit modelleri Gated DeltaNet’i Gated Attention ile eşleştiriyordu; Qwen3.8-Flash-Next, ikincisini Qwen Sparse Attention (QSA) ile değiştiriyor; QSA, bireysel tokenları seçmek yerine mikro‑blok düzeyinde çalışıyor. Kart, bunun uzun bağlam gecikmesini önemli ölçüde azalttığını iddia ediyor. Model, 48 katmanını tekrarlayan bir desenle düzenliyor: üç Gated DeltaNet bloğu bir mixture‑of‑experts katmanına, ardından bir QSA bloğu bir mixture‑of‑experts katmanına besleniyor; bu desen on iki kez tekrarlanıyor.

İkinci değişiklik, genişletilmiş artık akışları üzerinden akan bilgiyi öğe‑düzeyinde, veri‑bağımlı bir okuma kapısı ve dal‑başına skaler bir yazma kapısı kullanarak modüle eden kapılı bir artık mekanizmasıdır. Kart, bunun katmanlar arasında daha ince ayrıntılı ifade gücü elde ederken eğitim kararlılığını korumak ve çıkarım yükünü düşük tutmak için bir yol olduğunu belirtiyor.

Üçüncüsü, bir n‑gram gömme katmanıdır. Parametreleri ek uzmanlarla ölçeklendirmek yerine, model katman 2’de kısa bigram ve trigramlar tarafından indekslenen ayrı bir gömme içinde 51 Milyar parametre ekliyor. Ekip, bunun mixture‑of‑experts’ten daha az hesaplama gerektiren ve bellek‑kısıtlı hızlandırıcılara aktarımı daha uygun bir parametre ölçekleme ekseni olduğunu açıklıyor. Kart ayrıca, çok adımlı eğitimle eğitilmiş 4 Milyar parametreli çok‑token tahmin katmanını da belirtiyor.

Dördüncüsü, eğitim tarifesidir. Muon ve AdamW optimizasyon algoritmaları belirli ağırlık kategorilerine uygulanıyor ve ekip, geleneksel batch‑size ısınma aşamalarını ortadan kaldırıp doğrudan hedef batch‑size ile başlamayı, yeniden ayarlanmış ölçekleme yasalarıyla yönlendirdiğini belirtiyor. Kart, bunun toplam optimizasyon adımlarını önemli ölçüde azalttığını ve daha yüksek öğrenme oranlarını desteklediğini söylüyor.

Satıcı Tarafından Bildirilen Benchmark’lar ve Ölçtükleri

Kart, Qwen3.8-Flash-Next’i Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4-Flash-0731 ve Claude-Opus-4.6 (Max) ile karşılaştıran benchmark sonuçlarını rapor ediyor. Bunlar, ekibin kendi test ortamlarında değerlendirdiği satıcı‑tarafından bildirilen rakamlardır ve bu şekilde yorumlanmalıdır. Ajan tabanlı kodlama üzerine, kart DeepSWE 1.1’de 58.7 puanını, Qwen3.8-27B için 42.2 ve DeepSeek-V4-Flash için 54.4 puanla listeliyor; ancak DeepSWE’nin iki test ortamı (Claude Code ve mini‑SWE‑agent) ile çalıştırıldığı ve her ikisindeki en yüksek puanın raporlandığı belirtiliyor. SWE‑bench Pro’da Qwen3.8-Flash-Next 62.5 puan alarak Qwen3.8-27B’nin 61.7 ve Qwen3.7-Plus’ın 55.8 puanının önünde yer alıyor; tüm modeller, ekibin sorunlu görevleri düzelttikten sonra benchmark’un iyileştirilmiş bir sürümünde yeniden değerlendirilmiştir.

Önemli olan tek bir sayı değil, verimlilik iddiasıdır. Kart, toplam 125 Milyar parametre ve 6 Milyar etkin parametreyi listelerken, Qwen3.7-Plus için toplam 397 Milyar ve 17 Milyar etkin parametre olduğunu gösteriyor. Genel bilgi açısından model, GPQA Diamond’da 91.7, LiveCodeBench v6’da 91.9 ve HLE’de 35.9 puan almış; HLE puanı GPT‑4o tarafından, benchmark’ın varsayılan değerlendirme aracından farklı olarak verilmiştir. Kart, bu seçimlerde şeffaf olup, birçok sürümün sunduğundan daha fazlasını sunuyor, ancak bunlar yine satıcının yaptığı tercihlerdir.

Kullanılabilirlik ve Qwen4’e Giden Yol

Qwen3.8-Flash-Next, qwen‑community‑1.0 lisansı altında, Hugging Face’te şu anda kullanılabilir; ağırlıklar BF16 formatında olup, dil modeli, n‑gram gömme ve çok‑token tahmin katmanı boyunca yaklaşık 180 Milyar parametre içeriyor. Kart, dağıtımı SGLang, vLLM veya TokenSpeed üzerinden yapmayı öneriyor ve Qwen3.8‑Flash’in — bu ön izlemenin üzerine inşa edilmiş, varsayılan 1 M‑token bağlam ve resmi yerleşik araçlara sahip üretim‑odaklı karşılığı — Qwen Cloud üzerinden yönetilen API kullanımı için tasarlandığını belirtiyor.

“Next” etiketi ipucu niteliğindedir. Ekip, bunu Qwen4’ün temelini oluşturacak mimarinin deneysel bir ön izlemesi olarak açıkça konumlandırıyor; bu da onu, amiral gemisi döngüsü öncesinde tasarım yönlerini test eden önceki Qwen sürümleriyle aynı kategoriye yerleştiriyor. Bu belirli tasarım Qwen4’ün temeli mi olacak yoksa ekip daha sonra bırakacağı bir dal mı olacak, sürüm büyük bir laboratuvarın verimlilik bahislerini nereye koyduğunu belgelemektedir.

Jonas Reeve bilişsel AI, yapay genel zeka (AGI) ve makine zekasının teorik temelleri üzerine odaklanan Unite.AI'de AI tarafından oluşturulan bir analisttir. Çalışmaları, öğrenme, akıl yürütme, bellek ve soyutlama gibi kavramların hem biyolojik hem de yapay sistemlerde nasıl ortaya çıktığını keşfederek, modern AI mimarileri ile bilişsel bilim ve zihin felsefesindeki uzun süredir devam eden sorular arasında bağlantılar kurar.
Kavramsal ve düşünceli bir yaklaşım benimseyen Jonas, akıl yürütme modelleri, ajan sistemleri, ortaya çıkan biliş ve hizalama teorisi gibi çerçeveleri inceleyerek, AGI'ye doğru ilerlemenin ne anlama geldiğini - ve ne anlamadığını - açıklamayı amaçlar. Zaman çizelgesi veya hırs peşinde koşmak yerine, ilk ilkeleri, kavramsal titizliği ve mevcut modellerin sınırlarını vurgular.
Jonas Reeve tarafından yazılan makaleler AI tarafından oluşturulur ve Unite.AI'nin editör ekibi tarafından advanced AI kavramlarının doğruluğu, açıklığı ve sorumlu tartışması için gözden geçirilir.