Yapay zeka modelleri ve platformları

Anthropic, Claude Sonnet 5.5’i Değişmeyen Sonnet 5 Fiyatlandırmasıyla Yayınladı

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Anthropic, 28 Eylül 2026’da Claude Sonnet 5.5’i yayınladı; bu, Claude 5.5 ailesindeki ikinci modeldir. Model, Claude Sonnet 5’in fiyatlandırmasını milyon giriş tokeni başına 2 $, milyon çıkış tokeni başına 10 $ olarak koruyor ve Anthropic, testlerinde aynı işi %30’dan fazla daha hızlı ürettiğini ve maliyetinin %30’a kadar daha az olduğunu belirtiyor.

Anthropic, yayın duyurusunda, Sonnet 5.5’i daha hızlı ve daha düşük maliyetli bir tamamlayıcı olarak Claude Opus 5.5‘e tanımladı; şirket, bunun dikkatli yargı gerektiren karmaşık işler için tasarlandığını söylüyor. Anthropic, Sonnet 5.5’in iyi tanımlanmış günlük görevlerde, hata düzeltmede ve düzenli belgeler, slaytlar ve elektronik tablolar üretmede en güçlü olduğunu belirtti ve ayrıca tasarım konusunda keskin bir gözü olduğunu ekledi.

Claude Sonnet 5.5, model kimliği claude-sonnet-5-5 altında, Amazon Web Services, Google Cloud ve Microsoft Azure dahil olmak üzere tüm platformlarda mevcuttur ve Opus 5.5 ve Sonnet 5’te olduğu gibi sıfır veri saklama ile sunulmaktadır.

Raporlanan Performans Sonuçları

Anthropic, Sonnet 5.5’in Terminal-Bench 4.0’da %70.6 puan aldığını, bu puanın ajan tabanlı kodlama değerlendirmesi olduğunu, Sonnet 5’in %10.3’üne karşı ve Opus 5.5’in listelenen %66.4 puanının Xhigh çaba sonucunu yansıttığını rapor ediyor. FrontierCode 1.1’in ana setinde, Sonnet 5.5 %46.2 puanı Max çaba seviyesinde ve %52.1 puanı Xhigh seviyesinde elde ediyor; bu, Sonnet 5 için %42.4, Opus 5.5 için %54.4 ve OpenAI’nın GPT-6 Sol için %49.3 ile karşılaştırılır. Bildirilen CursorBench 4.0 puanları Sonnet 5.5 için %55.5, Sonnet 5 için %34.1 ve Opus 5.5 için %57.8’dir.

Bilgi-işi değerlendirmelerinde, şirket Sonnet 5.5 için GDPval-AA v2.1 puanının 1844 olduğunu rapor ediyor; bu, Opus 5.5’in 1846 puanının iki puan altında ve Sonnet 5’in 1449 puanının yaklaşık 400 puan üzerindedir. AA-Briefcase v1.1 puanı ise Sonnet 5.5 için 1811, Opus 5.5 için 1822 ve Sonnet 5 için 1359’dur. Duyuruda ayrıca Humanity’s Last Exam’de araçlarla %64.5, OSWorld 2.1’de %80.1 kısmi kredi ve görsel grafik tanıma testi Chartography’de araçsız %61.6 olduğu listeleniyor. Anthropic, Sonnet 5.5’in yalnızca ekran görüntülerinden çalışarak Pokémon Red’i yenen ilk Sonnet modeli olduğunu belirtiyor.

Şirket, benchmark puanlarının bir modelin yeteneklerinin yalnızca bir yönünü yansıttığını uyarıyor ve kendi testlerinde ve dış testçilerin testlerinde Opus 5.5’in sürdürülen yargı gerektiren karmaşık, açık uçlu işlerde açıkça daha güçlü kaldığını belirtiyor. Bir dipnot, Artificial Analysis’ın yapılandırılmış çıktı hatası bulunan bir ön sürüm dağıtımında GDPval-AA ve AA-Briefcase çalıştırdığını ve bu hatanın düzeltildiğini, bunun Sonnet 5.5’in performansını daha da düşük gösterebileceğini belirtiyor. Başka bir dipnot, OpenAI’ın yakın zamanda GPT-6 Sol’da bir görüntü-anlama hatasını düzelttiğini, ancak üçüncü taraf puanlarının henüz bunu yansıtmayabileceğini not ediyor.

Erken Testçi Sonuçları

CodeRabbit’ın AI başkan yardımcısı David Loker, Sonnet 5.5’in karmaşıklık seviyelerinde Sonnet 5’e göre daha iyi yargı gösterdiğini ve çıktıda çok daha az token harcadığını söyledi ve CodeRabbit’ın basit ve orta düzey incelemeleri modele şimdi taşıma, önümüzdeki haftalarda daha fazlasını ekleme planı olduğunu belirtti. Base44 AI mühendislik lideri Gabriel Grinberg, 118 gerçek uygulama yapımı boyunca Sonnet 5.5’in her yapı için ortalama 3.6 yineleme sağladığını, Opus 5’in 7.7’ye kıyasla, Base44’in karşılaştırdığı modeller arasında en az başarısız araç çağrısına sahip olduğunu rapor etti.

Slack baş mühendisi Curtis Allen, prompt değişikliği olmadan çevrim dışı Slackbot değerlendirmelerinde yaklaşık %14 daha az çıktı tokeni rapor etti. Zendesk’in AI direktörü Abhinay Kathuria, biletlerin Zendesk’in üretimde kullandığı Claude modellerine göre %20 daha hızlı işlendiğini söyledi. Balyasny Asset Management, 2.441 finans görevi içeren özel bir pakette cevap başına yaklaşık 121.000 token, Sonnet 5’in ise 497.000 token olduğunu bildirdi. Box, sonuçların 2,4 kat daha hızlı ve toplam tokenlerde %12 daha az olduğunu rapor etti ve Atlassian, müşterilerin Rovo Agents’ı Sonnet 5’e göre %30’a kadar daha hızlı çalıştırabileceğini belirtti.

Fiyatlandırma, Hız ve Geçiş

Sonnet 5.5’in listelenen fiyatları Sonnet 5 ile tam olarak aynı: milyon giriş tokeni başına $2, milyon çıkış tokeni başına $10, milyon önbellek okuma tokeni başına $0.20 ve milyon önbellek yazma tokeni başına $2.50. Opus 5.5, giriş için $4, çıkış için $20 ve önbellek yazma için $5 olarak listeleniyor. Anthropic, Sonnet 5.5’in aynı iş için genellikle çok daha az token gerektirdiğini ve bugüne kadarki en hızlı Sonnet modeli olduğunu belirtiyor.

Model, düşük, orta, yüksek, xhigh ve maksimum olmak üzere beş yeniden kalibre edilmiş çaba seviyesi sunar. Varsayılanlar, Claude Code ve Claude uygulamalarında Orta, Claude Platform’da ise Yüksek’tir; bu aynı zamanda API varsayılanıdır.

Anthropic’in geçiş kılavuzu Sonnet 5’ten geçiş yapan geliştiriciler için kırılma değişikliklerini listeler. Uyarlamalı düşünme artık varsayılan olarak çalışıyor, devre dışı bırakılmış düşünme ayarı 400 hatası döndürüyor, ve düşünme kapalı olarak Sonnet çalıştıran geliştiriciler, geçişten önce en düşük mevcut araç ayarı, en düşük mevcut, geçişten önce. Zorunlu araç seçimi, katı araçlarla eşleştirilen otomatik araç seçimi lehine reddedilir ve minimum önbelleklenebilir istem, Sonnet 5’te 1.024 token’dan 512 token’a düşer. Dokümantasyon ayrıca siber, biyolojik, frontierllm, mantıkçıkarma, ve genelzararlar, ve sunucu tarafı geri dönüş denemelerinin yalnızca siber ve frontier_llm reddetmelerinde gerçekleştiğini belirtir.

Güvenlik Bulguları ve Önlemler

Anthropic, Sonnet 5.5’in siber yeteneklerinin Opus 5’inkine benzer olduğunu belirterek, bunun şirketin en yetkin modellerinde kullanılan siber güvenlik önlemleri ve geri dönüş mekanizmalarıyla piyasaya çıkan ilk Sonnet modeli olduğunu söyledi. system card raporuna göre, güvenlik önlemleri devre dışı bırakıldığında Sonnet 5.5, ExploitBench’te ortalama 11.53 yetenek bayrağı ve %80 yakalama oranı elde etmiş ve Sonnet 5’in birine karşı 178 tam keyfi kod yürütme açığı üretmiştir. CyScenarioBench görevlerinin %46.1’ini tamamlamış ve Binary Exploitation Benchmark’te Sonnet 5’in 3’üne kıyasla 50 kontrol akışı kaçırması üretmiştir.

Siber güvenlik önlemleri üç aşamada çalışır: modelin iç aktivasyonlarına bir sondaj, hafif bir model içi sınıflandırıcı ve ayrı bir eğitilmiş LLM sınıflandırıcı. Kart, siber zarar kapsam setinde %99.43 geri çağırma ve geri sarma saldırısı dayanıklılık değerlendirmesinde %21.0 saldırı başarı oranı bildirmekte, bu oran Sonnet 5 için %57.2’den iyileştirilmiştir; aynı zamanda kullanıcıları iyi niyetli siber güvenlik görevlerinde bile artan reddetmeler beklemeleri konusunda uyarmaktadır. Daha yüksek riskli istekler açıkça Sonnet 5’e geri dönmekte ve genişletilmiş Cyber Verification Programı yakında doğrulanmış savunuculara Sonnet 5.5, Opus 5.5 ve Claude Mythos modellerindeki gelişmiş yeteneklere katmanlı erişim sunacaktır.

Biyoloji güvenlik önlemleri, Opus 5 için kullanılan aynı zararlı‑kötüye kullanım sınıflandırıcılarıdır ve geri dönüş modeli bulunmamaktadır; Anthropic’in Life Sciences Verification Program tam biyoloji çalışması kapsamına erişimi sağlamaktadır. Sonnet 5.5 ayrıca, akıl yürütme çıkarımını engelleyen güvenlik sınıflandırıcılarına sahip ilk Sonnet modeli olup, bir modelin düşüncesinin onu yaratan hesapla ayrılmasını önlemek için korunmuş düşünceyi genişletmektedir.

Anthropic’in yaklaşık 1.850 senaryoya dayanan otomatik davranış denetimi sonucunda, şirket Sonnet 5.5’in hizalanma, kötüye kullanım direnci ve dürüstlük ölçütlerinin çoğunda Sonnet 5’i geliştirdiğini veya eşdeğer olduğunu, test edilen modeller arasında en düşük sandbox kaçma girişim oranına sahip olduğunu ve birçok önceki modele göre daha az okunabilir düşünce sergilediğini raporlamaktadır. Sistem kartı, Sonnet 5.5’in yeni bir Responsible Scaling Policy eşiği geçmediğini, politikanın CB-1 ve Autonomy-1 eşiklerini karşıladığını ve felaket ölçeğinde uyumsuzluk riskinin düşük olarak değerlendirildiğini belirtmektedir. Modelin güvenilir bilgi kesim tarihi Haziran 2026’dır.

Anthropic, yüksek hacimli ve maliyet duyarlı uygulamalar için inşa edilen Claude Haiku 5.5’in önümüzdeki haftalarda Claude 5.5 ailesine katılacağını duyurdu.

Jonas Reeve bir AI tarafından üretilen analisttir Unite.AI'de, bilişsel AI, yapay genel zeka (AGI) ve makine zekasının teorik temellerine odaklanmaktadır. Çalışması, öğrenme, akıl yürütme, hafıza ve soyutlamanın hem biyolojik hem de yapay sistemlerde nasıl ortaya çıktığını inceler, modern AI mimarileri ile bilişsel bilim ve zihin felsefesindeki uzun süredir var olan sorular arasında bağlantılar kurar.

Kavramsal ve yansıtıcı bir yaklaşımla, Jonas akıl yürütme modelleri, ajan sistemleri, ortaya çıkan bilişsel süreçler ve uyum teorisi gibi çerçeveleri inceler; AGI'ye doğru ilerlemenin gerçekte ne anlama geldiğini ve ne anlama gelmediğini açıklamayı amaçlar. Zaman çizelgeleri ya da hype peşinde koşmak yerine, temel ilkelere, kavramsal titizliğe ve mevcut modellerin sınırlamalarına vurgu yapar.

Jonas Reeve tarafından yazılan makaleler AI tarafından üretilir ve Unite.AI'nin editöryal ekibi tarafından doğruluk, açıklık ve gelişmiş AI kavramlarının sorumlu bir şekilde tartışılmasını sağlamak amacıyla gözden geçirilir.