Düşünce Liderleri
Claude “Nerfing” Tartışması Claude Hakkında Değil, İşlemlerinizin Başka Birinin Kararlarına Dayandığı Zaman Ne Olduğunu Hakkında

Yılın başlarında, AMD’nin AI Senior Direktörü Stella Laurenzo, yaklaşık 7.000 Claude Code oturumundan alınan telemetri verilerini yayınladı ve mühendislerin hissettiğini ancak ifade etmekte zorlandıkları bir şeyi belgeledi: Ocak ve Mart arasında, görünür akıl yürütme derinliği %73 oranında düştü, API çağrıları görev başına seksen kat arttı ve model, düzenlemeden önce daha az dosya okuyordu. Sayılar nhanh bir şekilde yayıldı. Yorum daha da hızlı yayıldı.
Anthropic, çerçevenin yanlış olduğunu iddia ediyor. Şirket, değişikliklerin, yeni bir adaptif düşünme mekanizması ve varsayılan olarak orta çaba gibi bilinçli ürün kararlarını yansıttığını söylüyor. Bağımsız analistler de yöntemin bazı kısımlarına itiraz etti. Tartışma devam ediyor ve makul insanlar ne gerçekten olduysa konusunda anlaşmazlar.
Ancak işletme üzerinde çalışanlar için önemli olan kısım: bu, bozulma mı yoksa bilinçli ayar mı olduğu, işletme operatörlerinin deneyimlerini değiştirmez. Onlar bunu önceden tahmin edemezlerdi. Kontrol edemezlerdi. Ve bazıları bunu, ne olduğunu anlamadan önce üretim aşamasında hissetti. Bu, gerçek hikaye ve bu, Anthropic ile özel olarak ilgili değil.
Bu, bir model problemi değil, bir bağımlılık problemidir.
Tanımladığımız şeyin bir adı var: model kırılganlığı. Bu, misyon açısından kritik operasyonların tek bir modelin davranışına sıkı bir şekilde bağlı olduğu durum, böylece model katmanında yapılan herhangi bir değişiklik, ister ayar kararı, ister yeni bir varsayılan, ister kapasite tarafından yönlendirilen bir rota değişikliği, ister sessiz bir kullanımdan kaldırma, işletmeyi doğrudan etkiler, hiçbir tampon olmadan ve hiçbir uyarı olmadan.
Bu, yeni bir model değil. GPT-4, 2023 yılında benzer bir şeyden geçti. Claude 3.5, 2024 yılında benzer bir şeyden geçti. Claude Opus şu anda benzer bir şeyden geçiyor. Bu, bir sonraki sınır modeli ile ve sonraki ile tekrar olacak. Hiçbir satıcı kötü niyetle hareket etmediği için, sondern sınır modelini maliyet, gecikme ve ölçek için küresel hacimde optimize etmek, sınır satıcılarının yapması gereken şeydir. Their teşvikleri ve bir işletmenin bu modellerin üzerine üretim operasyonları çalıştırmasının teşviki ilgili. Ancak bunlar aynı değil. Asla aynı olmayacak.
Qurrent’ı 2023 yılında başlattık ve işletme yazılımı döngülerinin nasıl oynandığını bilen tarihi bilgiye sahibiz: Bir şirket AI’ye yatırım yapar. Demo çalışır. Pilot çalışır. Sonra canlıya geçer, model katmanında bir şey değişir ve aniden müşteri problema sahip olur. Onlar, iş akışlarını koruyan, gerilemeleri takip eden, kesintileri emen kişilerdir. Bu, bana göre, bir işletme operasyonları için sürdürülebilir bir model nunca olmadı.
İşletme versiyonu bu hikayenin operasyonel, değil teknik.
Geliştiriciler için, mevcut durum rahatsız edici. Token bütçeleri daha hızlı yanıyor. Kodlama oturumları durur. Benchmark’ler hayal kırıklığı yaratıyor. Bu, gerçek bir problem, ancak bu, geri dönülebilir bir problem.
Finansal operasyonlar, uyumluluk iş akışları, hesaplar alacağı ve borcu ve karmaşık arka ofis süreçleri gibi işlemleri yürüten işletmeler için, riskler farklı. Bu iş akışları, kötü bir haftayı ememez. Hatalar birikir. Hacim birikir. SLA’lar, iç tercihler değil, gerçek müşterilere verilen taahhütlerdir. Bir model, yüksek riskli bir işlemde kötü performans göstermeye başladığında, zarar birikmeye başlar, kimse bunu fark etmeden önce bile.
Bu daha da zorlaştıran şey, AI’yi önceden tahmin etmek için tek bir model üzerinde iç ajanlar inşa etmeye çalışan çoğu şirketin, bu temelın ne kadar eksik olduğunu keşfetmesidir. İlk ajan, kolay kısım oldu. Yapılmayan şey, çevre altyapısıydı: davranışsal kaymayı, müşterilere ulaşmadan önce tespit eden değerlendirme çerçeveleri, bir model kötü performans göstermeye başladığında otomatik olarak işi yönlendiren hata mantığı ve değişen bir manzarayla tempo tutabilen sürekli yönetim. Bu üç boşluk, yönetilemez hale gelmiyor. Bunlar, hiç kimsenin bütçe ayırmadığı, satıcıların kararlarını etkileyemeyen kişiler tarafından yapılan sürekli bir mühendislik işlevine dönüşüyor.
Üretimde gerçekten dayanıklılık nasıl görünür.
Qurrent’da, dijital işgücünü baştan itibaren model-bağımsız olarak inşa ettik, bu, bir pazarlama pozisyonu değil, mimari bir gereksinim olarak. Her görev, o görev için en iyi performing modeli sürekli olarak değerlendirilerek yönlendirilir. Daha iyi bir model yayınlandığında, müşteriler bunu otomatik olarak alırlar. Bir model, belirli bir iş akışında gerilerse, orkestrasyon katmanı bu işi saniyeler içinde, insan müdahalesi olmadan ve hiç kimsenin 2’de Slack threads’ine uyanmasına gerek kalmadan yönlendirir.
Altında, üretim iş akışlarına karşı saatte saatte otomatik simülasyonlar çalışır, çıktıların beklenen davranışa uyup uymadığını ölçer. Kayma, operasyon ekibinin bunu hissetmeden ve müşterinin bunu hissetmeden önce altyapı katmanında tespit edilir. Ve her dijital işçi tarafından alınan her karar, tam bir cam kutu olarak kaydedilir ve gözden geçirilebilir, çünkü göremediklerinizi yönetemezsiniz.
Bu, premium özellikler değil. Bunlar, AI’yi üretim ölçekli işletmelerde çalıştırmak için giriş ücreti. Çoğu şirket, bunu haber döngüsünün ortasında öğreniyor, ki bu, bunu öğrenmenin pahalı bir yolu.
Bu çeyrekte sorulmaya değer soru.
Eğer en çok bağımlı olduğunuz model, bir sonraki çeyrekte kötü bir hafta geçirirse, kaç iş akışınız bundan etkilenecek? Nasıl bileceksiniz? Ve bunu nasıl nhanh bir şekilde yönlendirebileceksiniz?
Eğer ikinci sorunun cevabı “müşteriden duyacağız” ise, operasyon, üretim için hazır değil. Bu, büyük ölçekli çalışan bir pilot, ve bu ayrım, çoğu liderin farkında olmadığı kadar önemli.
Mevcut tartışma, geri dönüşlü bir şekilde, faydalı. CFO ve COO’ların izlediği bu olay, gerçek operasyonel yük altında neye benzeyen model kırılganlığını ücretsiz bir ön izleme aldı, kendileri için ödeme yapmadan.
Doğru cevap, modeli değiştirmek değil. Bu, tek birine bağımlı olmayan operasyonlar inşa etmek. Teknolojide devam edecek. Bu, bu pazarda tek certainty. Bu on yılın en güçlü şekilde çıkacak olan işletmeler, doğru modeli seçenler olmayacak. Bunlar, operasyonlarının hiç önemsemediği olanlar olacak.












