Düşünce Liderleri

Açık Modeller Gelişmeye Devam Ediyor. Ekonomi Daha Karmaşıklaşıyor.

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Yapay zeka modelleri 18 ay öncekine göre açıkça daha iyi. Ancak daha derine baktığımda, bu ilerlemenin yaygın açıklamaları tutarlı değildi.

Modeller sadece daha büyük oldukları için gelişmedi. “Açık kaynak kazanıyor” ifadesi yalnızca yarısı doğru. Ayrıca benchmark puanlarına bakma tavsiyesi beklediğimden çok daha az faydalı çıktı. Bunu kabul etmem biraz zaman aldı.

Bu yüzden sekiz laboratuvardan 46 model üzerindeki 18 aylık veri topladım. Zekânın bir meta haline gelip gelmediğini, açık modellerin sınırı yakalayıp yakalamadığını ve şirketlerin üzerine inşa edecekleri sistemleri seçerken neyi ölçmeleri gerektiğini anlamak istedim.

Ana bulgu basitti: bir benchmark puanı aslında bir modelin özelliği değildir. Bu puan, modeli, onu çevreleyen yazılım ve bağlamı ve kullanılmasına izin verilen zaman ve hesaplama gücünü yansıtır. Tek bir sayı yayınlarsanız, diğer iki unsuru gizlemiş olursunuz.

Bunun sonuçları ise çok daha geniş. Şirketler, işi gerçekleştirecek tam sistemi değerlendirmeleri gerekirken tek tek modelleri karşılaştırıyor.

Benchmark’ler Sistemi Gizler

Bileşik puanlara bakmayı bıraktığımda ve modelleri testten teste karşılaştırdığımda, önde gelen açık ağırlıklı ve tescilli modeller arasındaki fark tek bir sayı değildi.

SWE-bench Verified üzerinde, sayısız model duyurusunda yer alan eski bir testte, fark 0,2 puandı. SWE-bench Pro’da, gerçekçi, çok dilli yazılım çalışması ve standart bir ortam üzerine tasarlanmış yeni bir testte ise fark 18,2 puandı.

Görünür model farkı benchmark’e bağlıdır

Benchmark Fark Durum
SWE-bench Verified 0.2 pts Doymuş, kontaminasyon işaretli
GPQA Diamond 2.0 pts Doymuş, üst sınır yaklaşık %92–95
Terminal-Bench 2.1 4.9 pts Canlı, ajan tabanlı
Humanity’s Last Exam 9.8 pts Canlı, sınır ötesi akıl yürütme
SWE-bench Pro 18.2 pts Canlı, standartlaştırılmış çerçeve

Kaynak: Jaspreet Singh’in önde gelen açık ağırlıklı ve tescilli modeller analizine göre, Temmuz 2026.

Aynı model, testi kimin yürüttüğüne bağlı olarak farklı puanlar alabilir. Kimi K3, bağımsız bir değerlendirmede Terminal-Bench 2.1’de %80,9, üreticisi sonucu rapor ettiğinde ise %88,3 puan aldı. Bu 7,4 puanlık fark, analiz ettiğim beş benchmark’in üçünde açık‑ve‑sınır farkından daha büyüktür.

Bir model, çevresindeki yazılım aracılığıyla talimat alır, verilen bağlamdan yararlanır, erişebildiği araçları kullanır ve geliştiricinin belirlediği akıl yürütme bütçesi içinde çalışır. Bu koşulları değiştirirseniz, sonuç da onlarla birlikte değişir.

Kamu benchmark’leri ilerlemenin yönünü anlamak için faydalıdır. Ancak şirketiniz içinde neyin işe yarayacağını belirlemek için zayıf bir temel oluştururlar.

Ajan Güvenilirliği Matematiği Değiştiriyor

Bu, yapay zekâ soruları yanıtlamaktan bir dizi eylemi tamamlamaya geçtikçe daha da önem kazanır.

20 adımdan oluşan bir iş akışını ele alalım; yapay zekâ her adımı %95 doğrulukla gerçekleştiriyor. Bu güvenilir gibi görünüyor. Ancak tüm dizi boyunca iş akışı yalnızca %36 oranında başarılı oluyor.

Daha iyi bir model, özellikle zor ajan tabanlı görevlerde, her adımda başarı şansını artırabilir. Bir hatalı adımın işi mahvetip mahvetmeyeceğini belirleyen çevresel mühendisliktir. İlerlemeyi kaydetmek, çıktıları doğrulamak, güvenli bir şekilde yeniden denemek ve hatalardan kurtulmak, ikna edici bir gösteriyi güvenilir bir üründen ayıran unsurlardır.

Model seçimi hâlâ önemli. Ancak en yüksek puanı alan model otomatik olarak en güvenilir sistemi üretmez.

İşi Gözeterek Modelleri Seçin

Veriler, açık‑ve‑tescilli tartışmasının her iki tarafının genellikle çıkardığından daha dar bir sonuca işaret ediyor.

Açık ağırlıklı modeller, sonucun doğrudan ölçülebildiği iyi tanımlanmış, kısa vadeli işler için rekabetçidir. Sınıflandırma, çıkarım, özetleme ve yapılandırılmış üretim giderek bu kategoriye giriyor.

Sınır modelleri hâlâ uzun ajan tabanlı görevlerde, baskı altında talimatlara uyumda ve hatanın sonradan tespitinin maliyetli olduğu işlerde primini korur. Yeni benchmark’lerin sıfır yerine yaklaşık 18 puanlık bir fark gösterdiği ve model sağlayıcısının sunduğu güvenlik katmanının değerli olduğu noktalardır.

Şirketler modelleri göreve göre seçmelidir, ancak geçişin ücretsiz olduğunu varsaymamalıdır. Bağlam, akıl yürütme ve istem önbellekleri sağlayıcılar arasında sorunsuz bir şekilde taşınmaz. Daha ucuz bir model, sistemleri değiştirmenin işi yeniden başlatmasını gerektirmesi veya mühendislik ve yönetişim katmanları eklemesi durumunda daha pahalı hale gelebilir.

Model seçimi giderek daha geçici hâle geliyor. Geçiş hâlâ mimari bir karardır.

Zeka Ucuzladıkça, Yargı Pahalı Kalıyor

Yeterli genel amaçlı yetenek son derece ucuz hâle geliyor. Ancak eğrinin tepesinde, her ek performans puanı bir öncekinden daha pahalıya mal oluyor. Yeteneğin son dokuz puanı, altındaki her şeyin maliyetinin yaklaşık on katına eşdeğer.

Çoğu şirket her istekte en güçlü modele ihtiyaç duymaz. Ancak hangi işin bunu hak ettiğini bilmeleri gerekir.

Özetleme, çıkarım, sınıflandırma, taslak hazırlama ve çeviri, fayda yeteneğine doğru ilerliyor. Kalan kıt kaynak ise yargıdır: beş olası cevaptan hangisinin doğru olduğunu bilmek, sorunun hatalı olduğunu fark etmek ve ne zaman durup bir insana danışılması gerektiğine karar vermek.

Yargı, özel bağlam, iş kuralları, iş akışları, tarihsel bilgi ve işi doğrulayan ve hataları kontrol eden mühendislikten kaynaklanır.

Başkalarının Çalıştıramayacağı Değerlendirmeyi Oluşturun

Bir işletme için en değerli kıyaslama, kendi işlerinden oluşturulur.

İşletmenizin 50 ila 200 gerçek görevinden oluşan özel bir değerlendirme seti oluşturun. Çevre sistemini sabit tutun, testleri tekrarlayın ve cevabın ne kadar pürüzsüz duyulduğuna değil, işin doğru tamamlanıp tamamlanmadığına puan verin.

Maliyete aynı disiplinle yaklaşın. Bir model daha uzun akıl yürütme yapıyor, daha fazla yeniden deneme gerektiriyor ya da insan denetleyiciye daha fazla iş yükü oluşturuyorsa token başına maliyet yanıltıcı olabilir. Bunun yerine kabul edilen sonuç başına maliyeti ölçün.

Az sayıda modelle başlayın. İşin başında işi yönlendirin, ortasında sağlayıcı değiştirmek yerine. Her ek sağlayıcının güvenlik, yönetişim ve operasyonel yükünü, ilan edilen fiyatıyla birlikte hesaplayın.

Piyasa yeni kıyaslama kazananları üretmeye devam edecek ve şirketler her birine göre AI stratejilerini yeniden şekillendirme cazibesine kapılacak. Daha iyi bir yaklaşım, işi için modelleri seçmek ve ardından sistemin performans göstermesi gereken koşullar altında tüm sistemi değerlendirmektir.

Mimarinizi yönlendirmesi gereken kıyaslama, yalnızca şirketinizin çalıştırabileceği olandır.

Kurucu ve CEO, Jaspreet Singh, ürün vizyonu ve genel yönetici deneyiminin bir kombinasyonunu getiriyor ve Druva'yı çok milyar dolarlık veri koruma ve yönetim sektöründe en hızlı büyüyen şirketlerden biri haline getirdi. Girişimci ruhu, Druva'yı kendi kaynaklarıyla kurmasını sağladı; şirket şu anda 2 milyar dolardan fazla bir değere sahip ve bulut çağına öncülük eden binlerce şirket tarafından dünya çapında güveniliyor. Piyasa ve teknoloji içgörüleri, onu ilk bulut‑yerel veri koruma platformunu yaratmaya yönlendirdi; bu platform yenilikçi teknoloji çözümleri ve yaşlanan donanım ve yazılım mirasını bozan benzersiz bir tüketim modeli sunuyor.

Druva'yı kurmadan önce, Jaspreet Veritas ve Ensim Corp.'da temelleri oluşturan görevlerde bulundu. Ayrıca, birden fazla patente sahiptir ve Indian Institute of Technology, Guwahati'den Bilgisayar Bilimleri alanında B.S. derecesine sahiptir.