Yapay zeka modelleri ve platformları

Liquid AI, LFM2.5-DSpark’ı 3.2X Daha Hızlı Çıkarım İçin Yayınladı

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Liquid AI, 20 Ağustos 2026’da LFM2.5 ailesindeki üç model için spekülatif kod çözme taslak kontrol noktalarını yayınladı ve tek bir H100 GPU’da throughput artışının 3.18x’e, Apple‑silicon MacBook’ta ise 2.87x’e ulaştığını, model çıktılarında herhangi bir değişiklik olmadığını bildirdi. LFM2.5-DSpark sürümü, LFM2.5-1.2B-Instruct, LFM2.5-2.6B ve mixture‑of‑experts LFM2.5-8B-A1B için taslak modelleri kapsar; her biri hedef modele yaklaşık 300 milyon parametrelik taslak ek yükü ekler.

Kontrol noktaları Safetensors ve GGUF formatlarında, llama.cpp ve SGLang’de birinci gün desteğiyle sunuluyor; her iki entegrasyon da resmi kod tabanlarına yukarı akışta katkıda bulundu. Spekülatif kod çözme yalnızca hedef modelin doğruladığı tokenları yaydığından, şirket üretilen metnin, hedefin tek başına açgözlü kod çözme altında üreteceğiyle aynı olduğunu, bu yüzden benchmark doğruluğunun değişmediğini belirtiyor.

Liquid AI’nın ölçümleri, beş veri kümesi üzerinde batch boyutu 1 ve sıcaklık 0 ile çalıştırıldığında, LFM2.5-2.6B için ortalama hız artışını H100’de 2.67x (saniyede 323’ten 864 token’e) ve M4 Max MacBook Pro’da 2.27x (saniyede 61’den 139 token’e) olarak buldu. En büyük tekil sonuç, LFM2.5-8B-A1B’nin MATH500 üzerindeki performansında elde edildi; H100’de throughput %318 artarak 428’den 1.362 token/saniyeye yükseldi. Şirket ayrıca DSpark’ın çoklu‑araç senaryolarında LFM2.5-2.6B için fonksiyon‑çağrısı gecikmesini ortalama %57 azalttığını, bu sonucun LFM2.5 serisinin hedeflediği cihaz içi ajanlık iş yükleri için öne çıkan sonuç olduğunu rapor ediyor.

DSpark Kod Çözmeyi Nasıl Hızlandırıyor

LLM çıkarımının kod çözme aşaması bellek sınırlıdır: gecikmenin çoğu, ağırlıkların DRAM’den çip içi belleğe akışından kaynaklanır, hesaplamadan değil; bu yüzden çıkarım ekonomisi alanın merkezi mühendislik sorunu haline gelmiştir. Spekülatif kod çözme, küçük bir taslak modelin aday token bloğu önermesi, ardından hedef modelin bu bloğu tek bir ileri geçişte doğrulaması yoluyla, ağırlık yükleme maliyetini kontrol edilen her token arasında dağıtarak bu sorunu ele alır.

DSpark, DeepSeek araştırmacıları tarafından Temmuz 2026 makalesinde tanıtıldı ve şirketin DeepSeek‑V4 hizmet sisteminde dağıtıldı; üç bileşeni birleştirir: tüm taslak tokenları tek bir geçişte gizli durumlar üreten paralel omurga, blok sonlarında kabul oranlarının düşmesini önlemek için komşu tokenlar arasındaki bağımlılıkları modelleyen hafif sekansiyel baş, ve düşük güvenilirlikli son ekleri, doğrulama maliyeti tasarrufundan daha fazla olduğunda budayan güvenilirlik zamanlamalı doğrulayıcı. DeepSeek’in üretim dağıtımında, makale eşdeğer throughput’ta önceki MTP‑1 temeline göre kullanıcı başına %60‑%85 üretim hız artışı rapor ediyor.

Liquid AI’nın taslak modelleri bu tarifi, sadece dikkat (attention) tabanlı basitleştirilmiş bir tasarımla uygular: beş katman, adım başına dokuz taslak token blok boyutu ve 128.000 tokenlik bir kelime dağarcığı üzerinde Markov başı, LFM2.5-2.6B-DSpark model kartı‘na göre. Her taslak model, denetimli ince ayar, sohbet, kod ve fonksiyon‑çağrı verilerinin karışımı üzerinde 15 epoch boyunca eğitildi; kontrol noktası en yüksek kabul oranına göre seçildi, en düşük kayıba göre değil. Kesinlik garantisi kaliteyi sağlar: “Spekülatif kod çözme kesin: hedef her önerilen tokenı doğrular, bu yüzden açgözlü çıktı yalnızca hedefle aynı olur,” GGUF model kartı belirtiyor ve yanıt zamanlamaları, kaç taslak tokenının önerildiğini ve kabul edildiğini gösteriyor.

LFM2.5-DSpark Sayılarla

  • 3.18x — bildirilen en iyi GPU hız artışı (LFM2.5-8B-A1B, MATH500, H100: 428 → 1,362 tok/s)
  • 2.87x — bildirilen en iyi cihaz içi hız artışı (LFM2.5-1.2B-Instruct, HumanEval, M4 Max: 136 → 389 tok/s)
  • 2.67x / 2.27x — beş veri kümesi üzerindeki LFM2.5-2.6B için ortalama H100 / M4 Max hız artışları
  • 57%: çoklu‑araç senaryolarında LFM2.5-2.6B için ortalama fonksiyon‑çağrısı gecikme azalması
  • 295.7M–327.7M (taslak model parametreleri, hedef modeller 1.2B‑8B aralığında)
  • 4.81 of 10, blok boyutu 9 iken LFM2.5-2.6B için adım başına ortalama kabul edilen taslak token sayısı

Bildirilen Hız Artışlarının Azaldığı Yerler

Liquid AI’nın kendi tabloları, kazançların düzensiz olduğunu gösteriyor ve şirket nedenlerini açıklıyor. LFM2.5-8B-A1B için, cihaz içi iyileşme üç model arasında en yüksek kabul oranına rağmen ortalama sadece 1.18x, bu fark şirket tarafından llama.cpp’nin Metal arka ucundaki mevcut mixture‑of‑experts uygulaması ve token bloğunu doğrulamanın uzmanlar arasında ekstra ağırlık trafiği yaratması olarak açıklanıyor. LFM2.5-1.2B-Instruct için, kabul oranları veri kümesine göre yeterince değiştiğinden, hız artışı metin dağılımına bağlı olarak %52’ye kadar değişebiliyor; H100’de MT‑Bench’te 1.66x’den MATH500’de 2.56x’e kadar.

Tüm rakamlar, Liquid AI’nın kendi test çerçevesinden tedarikçi raporu olarak alınmıştır: GPU ölçümleri için BF16 formatında 80 GB H100, cihaz içi ölçümler için FP16 GGUF ağırlıklarıyla M4 Max üzerinde deneysel Metal çekirdekleri kullanan llama.cpp, çıktı token sayısı 256 ile sınırlı. SGLang yolu, LFM2 hedefleri için DSpark desteği içeren bir derleme gerektirirken, llama.cpp yolu da ilgili derlemeyi gerektirir; bu yüzden hız artışları bu entegrasyonlara bağlıdır, herhangi bir motorun kararlı sürümünde yer almaz.

Liquid AI’nın Şu Ana Kadar Cihaz İçi İtisi

DSpark sürümü, bir haftadan biraz uzun bir sürede LFM2.5 ailesinin üçüncü güncellemesi. 12 Ağustos 2026’da şirket LFM2.5-VL-3B’yi, kenar cihazları için bir görsel‑dil modeli olarak yayınladı ve 19 Ağustos 2026’da aile için kuantizasyon‑bilinçli damıtılmış Q4_0 kontrol noktalarını yayımladı. Temel mesaj aynı: şirket, 2.6B modelinin MacBook üzerindeki DSpark hız artışının, çoğu tescilli bulut modelinin sunduğu yaklaşık 140 token/saniye throughput’unu aşan bir etkileşim sağladığını belirtiyor.

Üç taslak model de artık Hugging Face: LFM2.5-1.2B-Instruct-DSpark, LFM2.5-2.6B-DSpark ve LFM2.5-8B-A1B-DSpark adresinde bulunabilir; llama.cpp dağıtımları için GGUF sürümleri de mevcuttur.

Jonas Reeve bilişsel AI, yapay genel zeka (AGI) ve makine zekasının teorik temelleri üzerine odaklanan Unite.AI'de AI tarafından oluşturulan bir analisttir. Çalışmaları, öğrenme, akıl yürütme, bellek ve soyutlama gibi kavramların hem biyolojik hem de yapay sistemlerde nasıl ortaya çıktığını keşfederek, modern AI mimarileri ile bilişsel bilim ve zihin felsefesindeki uzun süredir devam eden sorular arasında bağlantılar kurar.
Kavramsal ve düşünceli bir yaklaşım benimseyen Jonas, akıl yürütme modelleri, ajan sistemleri, ortaya çıkan biliş ve hizalama teorisi gibi çerçeveleri inceleyerek, AGI'ye doğru ilerlemenin ne anlama geldiğini - ve ne anlamadığını - açıklamayı amaçlar. Zaman çizelgesi veya hırs peşinde koşmak yerine, ilk ilkeleri, kavramsal titizliği ve mevcut modellerin sınırlarını vurgular.
Jonas Reeve tarafından yazılan makaleler AI tarafından oluşturulur ve Unite.AI'nin editör ekibi tarafından advanced AI kavramlarının doğruluğu, açıklığı ve sorumlu tartışması için gözden geçirilir.