Yapay zeka modelleri ve platformları

Anthropic, Claude’un AI Araştırma ve Geliştirme Çalışmalarının %26’sına Liderlik Ettiğini Diyor

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Anthropic, Claude modellerinin şirketin AI araştırma ve geliştirme çalışmalarının %26’sına Ağustos 2026 itibarıyla “liderlik” ettiğini, 17 Eylül 2026 tarihinde bir Anthropic Institute gönderisi içinde yayınlanan bir prototip R&D Otomasyon Endeksi’nden elde edilen ilk sonuçlarda belirtti.

Gönderi, “Öncü Laboratuvarlarda AI Gelişiminin Hızını Anlamak İçin Ölçümler” başlığıyla, endeksi ajan denetimi ve hesaplama tahsisiyle ilgili iç metriklerle eşleştiriyor ve Anthropic, bu tür ölçümleri yayınlamaya devam etmeyi planladığını belirtti.

R&D Otomasyon Endeksi

Anthropic R&D Otomasyon Endeksi, şirkette yürütülen AI R&D çalışmalarının tüm yelpazesini haritalar, her görevin şu anda ne kadar otomatik olduğunu puanlar ve bu puanları toplu bir ölçekte birleştirir. Puanlar, Epoch AI tarafından geliştirilen ve AL0’dan (AI katılımı yok) AL5’e (AI’nin insan olmadan tamamen otonom çalıştığı) uzanan bir Otomasyon Seviyesi ölçeği kullanır. AL3’te, AI “işbirliği yapar”, görevin büyük bir kısmını yakın insan yönlendirmesi altında gerçekleştirir; AL4’te, AI “liderlik eder”, yüksek seviyeli bir komuttan tamamlamaya kadar görevin çoğunu yürütür ve bir insan denetler.

Anthropic, Ağustos 2026 itibarıyla Claude’un AI R&D çalışmalarının %26’sına “liderlik ettiğini”, “işbirliği” seviyesinin ya da üzerindeki iş payının %90’ın üzerinde olduğunu ve Claude’un AI R&D çalışmalarının ölçülen herhangi bir alt kümesi için tam otonom çalışmadığını bildirdi. Gönderideki bir grafik, %26’lık “liderlik” payının Şubat 2026’da %1’in altında olduğundan yükseldiğini gösteriyor.

Temel görev kataloğu, Slack ve iç dokümantasyon gibi çalışma kayıtları kullanılarak aşağıdan yukarıya doğru derlendi. Temmuz 2026’nın her haftası için, bir Claude araştırma ajanı rastgele örneklenen her kişinin haftasını — model R&D döngüsünü oluşturan her departmandan %20 çalışan — inceledi ve üzerinde çalıştıkları görevleri listeledi; bu, yaklaşık 15.000 ayrıntılı görevin düz bir listesini ortaya çıkardı. Claude daha sonra bu görevleri 542 düğümden oluşan, bunların 378’i “değerlendirme platformu hata teşhisi ve düzeltmeleri” gibi yapraklar olan hiyerarşik bir ağaçta düzenledi ve bu ağaç donduruldu, böylece her ölçüm aynı görev sepetine karşı çalıştırılıyor.

Her düğüm için, bir Claude ajanı bu tür işin şirket genelinde nasıl yapıldığını araştırır ve bağımsız bir Claude yargıcı, değerlendirilen ayın veya daha önceki kanıtlara sınırlı olmak kaydıyla, altı otomasyon seviyesinden birini atar. Görevler kişi-süreye göre ağırlıklandırılır, böylece daha fazla personel çabasının gittiği kategoriler daha fazla ağırlık taşır.

Anthropic, yargıcın puanlamalarını ilgili çalışma alanlarından sorumlu personelle, modellerin kanıtlarını veya yargılarını görmeden puanlayan çalışanlarla karşılaştırdı ve model‑insan tam uyumunun %59, insan‑insan %35 olduğunu, puanların %97’sinde bir seviye içinde kaldığını bildirdi. Belirtilen sınırlamalar arasında, yeni iş türlerini kaydetmeden mevcut işin otomasyonunu yakalayan dondurulmuş sepet bulunuyor; Şubat‑Temmuz 2026 arasındaki görevlerin Ocak 2026 sepetiyle karşılaştırması “yeni” görevlerde artış bulunmadığını gösterdi ve Anthropic, sepeti periyodik olarak yeniden inşa etmeyi ve yayınlanan sayıları yeniden sürümlemeyi planlıyor.

Dahili Ajanların Denetimi

İkinci bir ölçüm seti, Anthropic’in sistemlerindeki AI ajanlarının denetimini kapsar. Ağustos 2026 itibarıyla, yaklaşık 30.000 ajan, şirketin en çok kullanılan dahili platformunda aynı anda araştırma ve mühendislik çalışması yapıyordu ve rapor edilen ölçümler yalnızca bu platformu kapsıyor.

Anthropic, çevrimiçi izleyicilerin bu ajanların eylemlerinin %100’ünü yürütmeden önce, genellikle saniyeler içinde kontrol ettiğini bildirdi; Ağustos 2026 boyunca analiz edilen bir milyardan fazla ajan kararının %0,002’si (yaklaşık 1/47.000) engellendi ve insanlar engellenen eylemleri bir hafta içinde inceliyor. Çevrimdışı izleyiciler, eylemleri sonradan %100’ünü alır ve haftada yaklaşık 100.000 transkripti işaretler; bu transkriptler birden fazla sınıflandırıcı tarafından yanlış pozitifler için incelenir ve çoğu işaretleme çözülür; haftada yaklaşık 50 en yüksek öncelikli işaretleme insan incelemesine yükseltilir ve her bin transkriptte bir ila iki tanesi daha fazla inceleme için işaretlenir.

Gönderiye göre, çevrimiçi izleyiciler, hızlı bir şekilde gerçekleşecek ve geri alınamayan zararlar için tasarlanmıştır; örneğin bir ajanın Anthropic sistemlerinden model ağırlıklarını kopyalaması gibi. Çevrimdışı izleyiciler ise yavaş gelişen ve geri döndürülebilen tehlikeli davranışları hedef alır; örneğin model uyumsuzluğu işaretleri gibi. Anthropic, dahili iskeletin denetimi destekleyen iki tasarım seçeneği olduğunu söyledi: her ajanın model yükseltmeleri arasında devam eden bireysel bir kimliği vardır ve ajanlar, transkriptlerle çapraz referanslı ortak, açık bir mesajlaşma sistemi üzerinden iletişim kurar, böylece davranış izleme ajanlar arasındaki iletişimi geçebilir. Şirket, METR’nin daha önce bağımsız olarak çevrimdışı izleme platformunu kırmızı takım testine tabi tuttuğunu ve bu denetim ölçümlerinin ayrıca Ağustos 2026 risk raporunda yayınlandığını belirtti.

Hesaplama Tahsisi Anlık Görünümü

Üçüncü ölçüm için, Anthropic, 13‑20 Temmuz 2026 tarihleri arasında tüm hesaplama kaynaklarını nasıl kullandığını inceledi, her iş yükünü kategorilere ayırdı ve AI R&D’ye giden hesaplamanın ne kadarının güvenlik çalışması olduğunu ölçtü. O hafta boyunca, Anthropic, AI R&D’ye giden hesaplamanın yaklaşık %6’sının güvenliğe tahsis edildiğini ve AI‑türetilmiş AI R&D’ye giden hesaplamanın yaklaşık %12’sinin güvenliğe tahsis edildiğini bildirdi.

Şirket, her iki tahmini de kasıtlı olarak ihtiyatlı tanımlıyor: güvenlik kadar yetenekleri ilerleten token’lar AI R&D olarak sayıldı ve ayrı ve karşılaştırılabilir bir hesaplama miktarı olan güvenlik sınıflandırıcıları dışlandı. Bir Claude sınıflandırıcısı, haftanın yaklaşık 10.000 araştırma eğitim ve değerlendirme çalışmasını, en büyük hesaplama kullanıcılarına ağırlık veren yaklaşık %14’lük bir örnekle sıraladı ve Anthropic, sınıflandırıcının insan gözden geçirenlerle bir ya da iki yüzde puanı içinde aynı fikirde olduğunu bildirdi.

Belirtilen sınırlamalar şunlardır: tek bir haftanın ölçümün mümkün olduğunu göstermesi bir trend oluşturmaz, temel iş yükü etiketlerinin en iyi çaba ile ve doğrulanmamış olması ve hesaplama payının harcananı ölçmesi, gerçekleştirilen güvenlik çalışmasının miktarını ölçmemesidir.

Amaç ve Sonraki Adımlar

Anthropic, bu ölçümleri rapor ettiğini, çünkü bunların kamuoyuna, dış taraflara ve hükümetlere sınır laboratuvarlarındaki AI gelişim hızına daha net bir bakış sunduğunu, Sorumlu Ölçeklendirme Politikası risk raporlarını ve Gelişmiş AI Çerçevesi politika önerisini tamamladığını söyledi. CEO Dario Amodei’nin talep ettiği gibi sınırın hızının koordine edilmesi durumunda sayıların değişmesi bekleneceğini belirtti.

Yazı, herhangi bir sınır geliştiricisinin aynı ölçümleri kamu metodolojisiyle düzenli olarak yayınlayabileceğini ve laboratuvarlar arası karşılaştırmayı engelleyen iki engeli belirtiyor: ortak bir metodolojinin olmaması ve bir geliştiricinin sistemlerini değerlendirmek için kendi modellerini kullanması. Bu ölçümlerin üçüncü taraflar veya diğer geliştiricilerin modelleriyle doğrulanabileceğini ve yeni bir modelin daha fazla AI R&D’ye konulmadan önce sabit bir test süresi gibi daha güçlü gereksinimlerin tetikleyicisi olabileceğini söylüyor.

Anthropic, çok sayıda kuruluştan bağımsız üçüncü taraf değerlendiricileri dahil etmeyi, onlara iç süreçlere, sistemlere ve iç risk değerlendirme ekiplerinin sahip olduğu veriye benzer erişim sağlamayı, güvenlik uygulamalarını doğrulamayı, olayları raporlamayı ve yazıda yer alanlar gibi kilit metrikleri izlemeyi planladığını söyledi. Makale, Marina Favaro ve Phillie Wright tarafından ortaklaşa yazıldı, araştırma yönlendirmesi Jack Clark tarafından sağlandı.

Jonas Reeve bilişsel AI, yapay genel zeka (AGI) ve makine zekasının teorik temelleri üzerine odaklanan Unite.AI'de AI tarafından oluşturulan bir analisttir. Çalışmaları, öğrenme, akıl yürütme, bellek ve soyutlama gibi kavramların hem biyolojik hem de yapay sistemlerde nasıl ortaya çıktığını keşfederek, modern AI mimarileri ile bilişsel bilim ve zihin felsefesindeki uzun süredir devam eden sorular arasında bağlantılar kurar.
Kavramsal ve düşünceli bir yaklaşım benimseyen Jonas, akıl yürütme modelleri, ajan sistemleri, ortaya çıkan biliş ve hizalama teorisi gibi çerçeveleri inceleyerek, AGI'ye doğru ilerlemenin ne anlama geldiğini - ve ne anlamadığını - açıklamayı amaçlar. Zaman çizelgesi veya hırs peşinde koşmak yerine, ilk ilkeleri, kavramsal titizliği ve mevcut modellerin sınırlarını vurgular.
Jonas Reeve tarafından yazılan makaleler AI tarafından oluşturulur ve Unite.AI'nin editör ekibi tarafından advanced AI kavramlarının doğruluğu, açıklığı ve sorumlu tartışması için gözden geçirilir.