Yapay zeka modelleri ve platformları

Hayır, Claude’u Kısıtlamıyorlardı – Aslında Daha Kötüydü

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Tamam, Claude ile ilgili olarak neler olup bittiğinden bahsedelim, çünkü son bir aydır kullanıyorsanız, muhtemelen bir şeyler yanlış gittiğini fark etmişsinizdir.

Geçtiğimiz altı haftadır, Claude kullanıcıları aklını kaybetmeye başladı. Ağustos başından itibaren, şikayetler Reddit, X ve geliştirici forumlarına hücum etmeye başladı. Sorunlar her yerde vardı:

  • Eskiden mükemmel çalışan kod artık bozulmuştu
  • Claude, dosyaları değiştirdiğini iddia ediyordu, ancak aslında değiştirmemişti
  • İngilizce yanıtlarda rastgele Tayca veya Çince karakterler görünüyordu
  • Talimatlar tamamen göz ardı ediliyordu
  • Aynı istem farklı kalitede yanıtlar veriyordu
  • Claude Code kullanıcıları, bunun önceki sürüme göre “lobotomize” edildiğini söylüyordu

Şikayetler o kadar kötüleşti ki, Ağustos sonunda, insanlar Anthropic’in Claude’u gizlice kısıtladığını düşünmeye başladılar. Teoriler her yerdeydi – belki kaliteyi zirve saatlerde azaltıyorlardı, belki daha ucuz bir modelle değiştirmişlerdi, belki bu kasıtlı bir bozulmaydı.

Kullanıcılar Claude Pro için ödeme yapıyorlardı ve Claude Lite gibi bir şey alıyorlardı. Claude etrafında iş akışları inşa etmiş geliştiriciler, aniden verimliliklerinin düşmesini izliyorlardı. Dediğimiz gibi, bazı kullanıcılar hiçbir sorun yaşamıyordu, bu da her şeyi daha da karmaşık hale getiriyordu.

Anthropic Nihayet İtiraf Ediyor: Evet, Problemlerimiz Vardı

Haftalarca süren kullanıcı şikayetleri ve artan frustrasyon之后, Anthropic, devasa bir teknik post-mortem yayınladı ve temelde şunları söyledi: “Haklıydınız. Claude bozuktu. İşte neler oldu.”

Ve cevap ilginç.

Aslında bir sorun değildi. Üç tamamen ayrı altyapı hatası vardı, hepsi aynı anda ortaya çıkarak AI bozulmasının mükemmel fırtınasını oluşturdu. Kısıtlamıyorlardı. Köşe kesmiyorlardı. Sadece üç farklı şey aynı anda kırıldı ve bunu tam olarak anlamak ve düzeltmek altı hafta sürdü.

Neler yanlış gittiğini size açıklamak istiyorum, çünkü bu aslında AI sistemlerinin nasıl beklenmedik şekillerde başarısız olabileceğine dair yararlı bir bakış açısıdır.

Üç Hata Çöküşü: Kaosun Zaman Çizelgesi

Kaynak: Anthropic

Hata #1: Yanlış Sunucu Problemi

Bu neredeyse komik, eğer siz deneyimlemiyor olsaydınız. Claude Sonnet 4, 200.000 token bağlamını işleyebiliyordu. Ancak 5 Ağustos’tan itibaren, bazı istekler 1 milyon token bağlamına yapılandırılmış sunuculara yönlendiriliyordu.

İlk olarak, yalnızca %0,8’lik istekler etkilenmişti. Büyük bir sorun değil, değil mi? Yanlış.

29 Ağustos’ta, bir yük dengeleyici güncellemesi bu küçük sorunu büyük bir problema dönüştürdü. Aniden, zirve saatlerde %16’sı Sonnet 4 istekleri yanlış sunuculara gidiyordu. Ve yönlendirme “yapışkan” idi. Bir kez yanlış yönlendirildikten sonra, sürekli olarak yanlış yönlendiriliyordunuz.

Etki:

  • Etkin olan Claude Code kullanıcılarının yaklaşık %30’u en az bir kez yanlış yönlendirilmişti
  • Etkilenen kullanıcılar için yanıt süreleri düştü
  • Aynı kullanıcı, tekrar tekrar aynı sorunu yaşarken, diğerleri hiçbir sorun yaşamıyordu

Hata #2: Rastgele Karakter Oluşturucu

25 Ağustos’ta, Anthropic, TPU sunucularına yanlış bir yapılandırma dağıttı. Sonuç olarak, Claude, İngilizce yanıtlara rastgele Tayca ve Çince karakterler eklemeye başladı.

Python kodunuzu debug etmek için Claude’u isteyip de şunları almayı düşünün:

defcalculate_total(items)

total = 0

for item in items

total += item.price # <- Ne?

return ผลรวม

Bu, şunları etkiledi:

  • Opus 4.1 ve Opus 4: 25-28 Ağustos
  • Sonnet 4: 25 Ağustos – 2 Eylül

Teknik neden, token oluşturma hatasıydı ve orada olmaması gereken karakterlere yüksek olasılık atadı. Temel olarak, Claude’un bir sonraki kelimeyi seçme mekanizmasını bozdu.

Hata #3: Görünmez Derleyici Hatası

Bu, mühendislik açısından korkutucu olan. Google’ (GOOGL ) ın XLA derleyicisinde gizli bir hata vardı ve uyuyordu. Anthropic, 25 Ağustos’ta token seçimi için kod dağıttığında, bunu kazara tetikledi.

Bu hata, gerçekten tuhaftı – Claude’u, metin oluştururken en olası tokenı kasıtlı olarak hariç tutmaya neden oluyordu. Claude doğru cevabı biliyordu, ancak bunu söylemekten fiziksel olarak engelleniyordu.

Gerçekten berbat olan kısım, Aralık 2024’te bu hatayı çalışır durumda olmadan çözdüklerini fark etmeden önce, bu hatayı çalışır duruma getirmişlerdi. Ağustos ayında, sandıkları kök nedeni “düzelttikleri” zaman, aslında çalışır duruma getirdikleri çözümü kaldırdılar ve gerçek problemi ortaya çıkardılar.

Neden Altı Hafta Sürdü

Şunu merak edebilirsiniz: Nasıl olur da Anthropic gibi bir şirket, dünya sınıfı mühendisleriyle, altı hafta alır da bunu çözer?

Cevap, bu sistemlerin gerçekten ne kadar karmaşık olduğunu gösterir:

1. Gizlilik Kontrolleri Hata Ayıklamayı Engelledi

“İç gizlilik ve güvenlik kontrollerimiz, mühendislerin Claude ile kullanıcı etkileşimlerine nasıl ve ne zaman erişebileceğini sınırlar, özellikle bu etkileşimler bize geri bildirim olarak bildirilmediğinde.”

Geri bildirim olmadan, neyin bozulduğunu göremiyorlardı. İyi bir gizlilik için, kötü bir hata ayıklama için.

2. Hatalar Kendilerini Gizlediler

Claude, genellikle bireysel hatalardan kurtuluyordu, bu da bozulmayı normal varyans gibi gösteriyordu, sistemik bir başarısızlık değil. Testlerde bunu yakalayamadılar, çünkü model, kendini düzeltmeye yetiyordu.

3. Çoklu Platform Kaosu

Claude, AWS Trainium, NVIDIA GPU’ları ve Google TPUs – üç tamamen farklı donanım platformu üzerinde çalışıyor. Her hata, her platformda farklı şekilde ortaya çıktı:

  • AWS Bedrock: Zirve saatlerde %0,18’lik Sonnet 4 istekleri etkilenmişti
  • Google Vertex AI: %0,0004’ten az etkilenmişti
  • Direct API: %16’ya kadar etkilenmişti

Bu, birbirinden bağımsız sorunlar gibi görünüyordu.

4. Çakışan Semptomlar

Üç hata aynı anda aktifken, semptomlar her yerdeydi. Bir kullanıcı Tayca karakterler alabilir, diğeri bozulmuş yanıtlar görür, bir diğeri mükemmel performans görürdü. Bir modèle yoktu.

Bu, AI Güvenilirliği Açısından Ne Anlama Geliyor

Bu tüm saga, AI sistemlerinin aslında ne kadar kırılgan olduklarını ortaya koyuyor: Sadece AI modeli değil,

  • İstekleri yanlış yere gönderen yönlendirme altyapısı
  • Farklı şekilde davranan donanıma özgü uygulamalar
  • Aylarca uyuyabilen derleyici hataları
  • Küçük sorunları büyük arızalara dönüştürebilen yük dengeleyicileri

Bir yanlış yapılandırma, bir derleyici hatası, bir yönlendirme hatası – ve aniden AI asistanınız nasıl kod yazacağını unuttu veya konuşması gerekmeyen diller konuşmaya başladı.

Gerçekten Düzeltildi mi?

Anthropic, tüm üç sorunun 16 Eylül itibarıyla çözüldüğünü söylüyor. Şunları yaptılar:

  • Yönlendirme mantığını düzelttiler
  • Sorunlu yapılandırmaları geri aldılar
  • Yaklaşık üst-k işlemlerden kesin üst-k işlemlerine geçtiler (doğruluk için performans kaybı)
  • Sürekli üretim izlemesi eklediler

Ancak kullanıcılar hala sorunlar rapor ediyor. Bazı geliştiriciler, Claude Code’un hala önceki performansına göre bozulmuş hissettiğini iddia ediyor. Bunun nedeni:

  • Hataların kalıntı etkileri
  • Henüz tanımlanmamış yeni sorunlar
  • Haftalarca süren sorunların psikolojik yan etkileri
  • Gerçek devam eden bozulma

…bilmemiz mümkün değil.

Sonuç

Bu durum, karmaşık AI sistemlerinin nasıl beklenmedik şekillerde başarısız olabileceğine dair mükemmel bir vaka çalışmasıdır. Üç ayrı hata, birbirini tetikleyerek, altı hafta boyunca teşhis ve düzeltme için gereken bir kalite bozulma algısı oluşturdu.

Anthropic’e, şeffaflık için kredi verebiliriz. Bir teknik post-mortem yayınlamak, çoğu şirketin yapacağından daha fazlası.

Ancak, bu aynı zamanda bizim ngày càng daha fazla güvendiğimiz bu sistemlerin altında ne kadar şeylerin yanlış gidebileceğini gösteriyor.

Claude veya herhangi bir LLM üzerine inşa eden herkes için: Yedekleme, doğrulama ve yedek planlara ihtiyacınız var. Çünkü, gördüğümüz gibi, hatta en iyi AI sistemleri bile aynı anda üç farklı problemle karşılaşabilir ve kimsenin ne olduğu hakkında bir fikri olmayabilir.

Bu AI modellerini destekleyen altyapı, modeller kendileri kadar önemlidir. Ve şu anda, bu altyapı, ciddi büyüme sancıları çekiyor.

Alex McFarland yapay zeka muhabiri ve yazarıdır ve yapay zekadaki son gelişmeleri araştırıyor. Birçok yapay zeka başlangıç şirketi ve dünya çapındaki yayınlarda işbirliği yaptı.