Yapay zeka modelleri ve platformları

Abacus.AI, Agentik İş Yükleri İçin Üç Açık Ağırlıklı Smaug Modelini Yayınladı

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Abacus.AI, 10 Eylül 2026, Smaug serisini tanıttı, kurumsal agentik iş yükleri: Smaug Agentic, Smaug Flash ve Smaug Mini için ince ayar yapılmış üç açık ağırlıklı dil modeli. Üçü de Hugging Face üzerinden indirilebilir ve şirketin RouteLLM API’si aracılığıyla da kullanılabilir.

Modeller, Abacus.AI’nin kurumsal agentik AI platformu ve Super Assistant üzerinden tanıtıldı. Şirket, işletmelerin modelleri kendi bulut VPC ortamlarında barındırabileceğini, böylece verileri ve AI’nin nerede barındırıldığı üzerinde tam kontrol sahibi olabileceklerini ve güvenlik ve veri gizliliği konusunda endişeli kuruluşların Smaug Agentic’i yerel bir GPU kümesinde barındırabileceğini belirtti.

Abacus.AI, Smaug’ı herhangi bir açık kaynak temel modele uygulanabilen bir ince ayar tekniği olarak tanımlıyor ve maliyeti artırmadan uzun süren agentik döngülerin performansını %15–20 artırdığını belirtiyor. Şirket, bunun işletmelerin açık kaynak model maliyetleriyle ölçekli olarak kendini geliştiren AI ajanlarını dağıtmalarını sağladığını, bu maliyetlerin genellikle Anthropic ve OpenAI gibi sınır modellerinin %10–100 katı daha düşük olduğunu ifade ediyor.

“Açık ağırlıklı modeller, sınır kapalı modellere olan farkı hızla kapatıyor, ancak uzun süren agent döngülerinde hâlâ yetersiz kalıyor,” dedi Abacus.AI CEO’su Bindu Reddy, şirketin duyurusunda. Reddy, Smaug serisinin bu eksikliği giderdiğini ve kapalı kaynak modellerden %10–100 daha ucuz kaldığını söyledi.

Şirketin teknik raporuna göre, seri büyük bağlamlar ve tekrarlanan araç çağrılarıyla büyük agentik döngüleri çalıştırmanın maliyet ve verimsizliğinden, ayrıca zaman boşluklarında istem önbelleğinin bozulmasından kaynaklandı. Metodoloji, insan tarafından derlenmiş gerçek dünya agentik izlerini, zor örneklerle temellendirilmiş sentetik verilerle birleştiriyor ve rapor, açık ağırlıklı temel modellerin bir dizi uygulamasında agentik kodlama, gerçek dünya araç kullanımı, otomasyon ve uzun bağlamlı akıl yürütme ve talimat takibinde tutarlı iyileşmeler kaydedildiğini gösteriyor.

Smaug Agentic

Smaug Agentic, serideki en büyük model, Moonshot AI’nin Kimi K3’ünün denetimli ince ayarıdır; toplam 2,8 trilyon parametre, 104 milyar aktif parametre, 1.048.576 token bağlam uzunluğu ve MoonViT-V2 görsel kodlayıcıya sahip bir uzman karışımı modelidir; bu bilgiler model kartında yer almaktadır. İnce ayar, mimari parametreleri değiştirmez ve model, temel modelden devralınan Kimi K3 Lisansı altında yayınlanır; kullanıcıların bu lisans şartlarına uyması gerekir. Kart, eğitimin, akıl yürütme token’ları kayıptan maskelenmiş, çoklu tur, araç kullanan kodlama izleriyle düzenlendiğini, böylece eğitimin modelin eylemlerini yönlendirdiğini ancak temel modelin akıl dağılımını koruduğunu belirtir; veri seti içeriği açıklanmaz.

Kart, GPQA Diamond’da 94.1, AA-LCR’de 75.7, DeepSWE’de 69.9, Terminal-Bench 2.1’de 86.5, SciCode’da 60.8, LiveBench agentik kodlamada 64.6, AutomationBench’de 31.0 ve MMMU-Pro’da 81.0 puan rapor ediyor. Kimi K3 temel modeline göre DeepSWE’de 2.4 puan, LiveBench agentik kodlamada 2.4 puan, SciCode’da 2.1 puan, AA-LCR’de 1.0 puan ve GPQA Diamond’da 0.6 puanlık artış sağlandığını belirtiyor.

Kart ayrıca, SciCode ve AA-LCR’de p99 akıl yürütme uzunluğunun temel modelin yaklaşık 0.6 katına düştüğünü, ancak görünen yanıt uzunluğunun Kimi K3 ile istatistiksel olarak ayırt edilemez kaldığını rapor ediyor. 113 DeepSWE görevi ve yedi saatten fazla kesintisiz çalışma boyunca şirket, sıfır altyapı hatası ve sıfır zaman aşımı kaydedildiğini belirtti. Mimari değişmediği için Smaug Agentic, Kimi K3’ün çalıştığı her yerde çalışabilir; vLLM, SGLang ve TokenSpeed için yayınlanmış servis tarifeleri mevcuttur. Duyuru, modeli Opus sınıfı modellerin maliyet-etkin bir ikamesi olarak konumlandırıyor.

Smaug Flash and Smaug Mini

Smaug Flash, DeepSeek V4 Flash 0731 üzerinde ince ayar yapılmış ve kurumsal kendini geliştiren ajanları hedeflemektedir. Raporda, temel modelin uzun bağlamlı agentik araç kullanımında “dönüşler ve karışıklık” eğilimine sahip olduğu ve Smaug Flash’in bu sorunu temel modelin maliyet ve hız avantajlarını koruyarak giderdiği belirtiliyor. Duyuru, Smaug Flash’in WhatsApp, Telegram ve Slack gibi mesajlaşma uygulamalarına bağlanabilen ve kullanıcılarla uzun süren sohbetleri sürdürebilen kişisel ajanlar için optimize edildiğini açıklıyor. Raporda, DeepSeek V4 Flash 0731 temel modeline karşı, Claude Sonnet 5’in referans sütun olarak listelendiği puanlar şunlardır: LiveBrief genelinde 77.4 vs 74.2, LiveBrief agentik kodlamada 61.1 vs 46.8, DeepSWE 1.1’de 56.6 vs 54.4, AutomationBench’in sıkı geçiş altında kamu 600’de 38.83 vs 25.1 ve NL2repo-bench’te 73.3 vs 54.2.

Smaug Mini, Qwen3.8 27B üzerinde ince ayar yapılmış 27 milyar parametreli bir modeldir; çok modlu kullanım senaryoları ve daha küçük akıl yürütme iş yükleri hedeflenmiştir. Raporda, LiveBrief genelinde 76.9 vs temel modelin 75.3, IFBench’te 82.0, AutomationBench’te 41.8 vs 37.3, JobBench’in resmi 65 görev protokolünde 50.5 vs 33.4 ve NL2repo-bench’te 55.8 vs 42.3 puanları rapor edilmiştir; referans sütunları olarak Claude Sonnet 5, Claude Opus 4.6 ve GPT-5.6 Luna listelenmiştir. Duyuru, Smaug Mini’nin basit görevler ve kurumsal sohbet botları için uygun olduğunu ve işletmelerin modeli kendi verileriyle daha da ince ayar yapabileceğini belirtiyor.

Evaluation Protocol and Roadmap

Teknik rapor, değerlendirmelerin Abacus.AI tarafından her model için aynı çerçeve altında yürütüldüğünü, ancak bir hançer işaretiyle işaretlenmişse (çerçeveden gelmeyen rapor edilen puan) ve LiveBench satırlarının 25 Haziran 2026 tarihli yayınlanmış LiveBench lider tablosundan alındığını belirtiyor. Smaug Agentic kartı, sonuçların 1.0 sıcaklıkta, akıl yürütme çabası maksimum ayarlanmış, özel bir 8×B300 dağıtımı üzerinde üretildiğini ve SciCode değerlendirmesinin 12 alt problemi çözülemez bırakan bir üst akış hatasını düzelttiğini bildiriyor. Şirket, modellerin LiveBench’te lider tablonun ince ayar filtreleri altında listelendiğini söyledi.

Abacus.AI, Smaug serisinin bir ürün lansmanı olduğu kadar, doğru ince ayar metodolojisiyle açık ağırlıklı modellerin agentik AI görevlerinde sınır modelleriyle rekabet edebileceği ve hatta onları geçebileceği tezinin bir gösterimi olduğunu belirtti. Şirket, temel modeller geliştikçe ve agentik izler kütüphanesi büyüdükçe seriyi ilerletmeye devam etmeyi planladığını söyledi.

Jonas Reeve bilişsel AI, yapay genel zeka (AGI) ve makine zekasının teorik temelleri üzerine odaklanan Unite.AI'de AI tarafından oluşturulan bir analisttir. Çalışmaları, öğrenme, akıl yürütme, bellek ve soyutlama gibi kavramların hem biyolojik hem de yapay sistemlerde nasıl ortaya çıktığını keşfederek, modern AI mimarileri ile bilişsel bilim ve zihin felsefesindeki uzun süredir devam eden sorular arasında bağlantılar kurar.
Kavramsal ve düşünceli bir yaklaşım benimseyen Jonas, akıl yürütme modelleri, ajan sistemleri, ortaya çıkan biliş ve hizalama teorisi gibi çerçeveleri inceleyerek, AGI'ye doğru ilerlemenin ne anlama geldiğini - ve ne anlamadığını - açıklamayı amaçlar. Zaman çizelgesi veya hırs peşinde koşmak yerine, ilk ilkeleri, kavramsal titizliği ve mevcut modellerin sınırlarını vurgular.
Jonas Reeve tarafından yazılan makaleler AI tarafından oluşturulur ve Unite.AI'nin editör ekibi tarafından advanced AI kavramlarının doğruluğu, açıklığı ve sorumlu tartışması için gözden geçirilir.