Model dan platform AI
Tidak, Mereka Tidak Mengurangi Kinerja Claude – Ini Sebenarnya Lebih Buruk

Baiklah, mari kita bicara tentang apa yang telah terjadi dengan Claude, karena jika Anda telah menggunakannya selama sebulan terakhir, Anda mungkin telah menyadari bahwa ada sesuatu yang salah.
Selama enam minggu, pengguna Claude telah kehilangan akal sehat mereka. Mulai awal Agustus, keluhan mulai mengalir di Reddit, X, dan forum pengembang. Masalahnya ada di mana-mana:
- Kode yang sebelumnya berfungsi dengan baik tiba-tiba rusak
- Claude mengklaim telah membuat perubahan pada file ketika sebenarnya tidak
- Karakter Thai atau Cina muncul secara acak dalam respons bahasa Inggris
- Instruksi diabaikan sepenuhnya
- Respons kualitas yang sama dengan prompt yang sama berbeda secara dramatis
- Pengguna Claude Code mengatakan bahwa ini terasa “lobotomized” dibandingkan dengan sebelumnya
Keluhan menjadi begitu parah sehingga pada akhir Agustus, orang-orang yakin bahwa Anthropic secara diam-diam mengurangi kinerja Claude untuk menghemat biaya. Teori konspirasi ada di mana-mana – mungkin mereka mengurangi kualitas selama jam sibuk, mungkin mereka telah secara diam-diam mengganti model yang lebih murah, mungkin ini adalah degradasi yang disengaja untuk mengelola biaya server.
Pengguna membayar untuk Claude Pro dan mendapatkan apa yang terasa seperti Claude Lite. Pengembang yang telah membangun alur kerja di sekitar Claude tiba-tiba melihat produktivitas mereka menurun. Dengan itu dikatakan, beberapa pengguna tidak mengalami masalah apa pun, yang membuat semuanya lebih membingungkan.
Anthropic Akhirnya Mengakui: Ya, Kami Memiliki Masalah
Setelah minggu-minggu keluhan pengguna dan frustrasi yang tumbuh, Anthropic baru saja merilis pos mortem teknis yang besar yang pada dasarnya mengatakan: “Kamu benar. Claude rusak. Ini yang terjadi.”
Dan jawabannya menarik.
Ternyata bukan satu masalah. Ini adalah tiga bug infrastruktur yang terpisah, semuanya terjadi pada waktu yang sama, menciptakan badai sempurna degradasi AI. Mereka tidak mengurangi kinerja. Mereka tidak menghemat biaya. Mereka hanya memiliki tiga hal yang rusak secara bersamaan dalam cara yang membutuhkan enam minggu untuk sepenuhnya dipahami dan diperbaiki.
Biarkan saya menjelaskan apa yang salah, karena ini sebenarnya merupakan pandangan yang berguna tentang bagaimana sistem AI dapat gagal dengan cara yang tidak terduga.
The Triple-Bug Meltdown: Sebuah Timeline Kekacauan

Sumber: Anthropic
Bug #1: Masalah Server yang Salah
Ini hampir lucu jika Anda tidak mengalami hal ini. Claude Sonnet 4 dirancang untuk menangani 200.000 konteks token. Namun mulai 5 Agustus, beberapa permintaan dialihkan ke server yang dikonfigurasi untuk 1 juta konteks token.
Awalnya, hanya 0,8% permintaan yang terkena. Tidak masalah, kan? Salah.
Pada 29 Agustus, pembaruan load balancer rutin mengubah masalah kecil ini menjadi masalah besar. Tiba-tiba, pada puncaknya, 16% permintaan Sonnet 4 dialihkan ke server yang salah. Dan pengalihan ini “sticky.” Sekali Anda dialihkan, Anda akan terus dialihkan.
Dampaknya:
- Sekitar 30% pengguna Claude Code yang aktif selama jendela waktu memiliki setidaknya satu permintaan yang dialihkan
- Waktu respons menurun untuk pengguna yang terkena
- Pengguna yang sama akan mengalami masalah ini berulang kali sementara yang lain tidak memiliki masalah apa pun
Bug #2: Pembangkit Karakter Acak
Pada 25 Agustus, Anthropic mengirimkan konfigurasi yang salah ke server TPU mereka. Hasilnya adalah Claude mulai memasukkan karakter Thai dan Cina secara acak ke dalam respons bahasa Inggris.
Bayangkan Anda meminta Claude untuk memecahkan kode Python Anda dan mendapatkan ini:
def calculate_total(items)
total = 0
for item in items
總計 += item.price # <- Apa?
return ผลรวม
Ini mempengaruhi:
- Opus 4.1 dan Opus 4: 25-28 Agustus
- Sonnet 4: 25 Agustus – 2 September
Penyebab teknisnya adalah kesalahan generasi token yang memberikan probabilitas tinggi pada karakter yang tidak seharusnya ada. Ini secara harfiah merusak mekanisme dasar tentang bagaimana Claude memilih kata berikutnya untuk dikatakan.
Bug #3: Bug Kompilator yang Tidak Terlihat
Ini adalah yang menakutkan dari perspektif teknik. Ada bug laten di kompilator XLA Google (GOOGL ) yang telah dorman. Ketika Anthropic mengirimkan kode untuk memperbaiki pemilihan token pada 25 Agustus, mereka secara tidak sengaja memicu bug tersebut.
Apa yang dilakukan bug ini sangat aneh – itu akan menyebabkan Claude secara tidak sengaja menghilangkan token yang paling mungkin ketika menghasilkan teks. Claude tahu jawaban yang benar tetapi secara fisik dicegah untuk mengatakannya.
Bagian yang sangat membingungkan? Mereka sebenarnya telah bekerja di sekitar bug ini pada Desember 2024 tanpa menyadarinya. Ketika mereka “memperbaiki” apa yang mereka pikir adalah penyebab akar pada Agustus, mereka menghapus solusi dan melepaskan masalah sebenarnya.
Mengapa Butuh Enam Minggu untuk Memperbaiki
Anda mungkin bertanya-tanya: bagaimana perusahaan seperti Anthropic, dengan insinyur kelas dunia, membutuhkan enam minggu untuk memahami ini?
Jawabannya mengungkapkan betapa kompleksnya sistem ini sebenarnya:
1. Kontrol Privasi Memblokir Pemecahan Masalah
“Kontrol privasi dan keamanan internal kami membatasi bagaimana dan kapan insinyur dapat mengakses interaksi pengguna dengan Claude, terutama ketika interaksi tersebut tidak dilaporkan kepada kami sebagai umpan balik.”
Mereka secara harfiah tidak bisa melihat apa yang rusak kecuali pengguna secara eksplisit melaporkannya dengan umpan balik. Baik untuk privasi, terrible untuk pemecahan masalah.
2. Bug Menghilangkan Diri
Claude sering pulih dari kesalahan individu, membuat degradasi terlihat seperti varians normal daripada kegagalan sistematis. Benchmark dan evaluasi mereka tidak menangkapnya karena model akan memperbaiki diri cukup untuk lulus tes.
3. Kekacauan Multi-Platform
Claude berjalan di AWS Trainium, NVIDIA GPU, dan Google TPUs – tiga platform perangkat keras yang sama sekali berbeda. Setiap bug muncul secara berbeda di setiap platform:
- AWS Bedrock: 0,18% permintaan Sonnet 4 terkena pada puncaknya
- Google Vertex AI: Di bawah 0,0004% terkena
- API Langsung: Hingga 16% terkena
Ini membuatnya terlihat seperti masalah yang tidak terkait.
4. Gejala Tumpang Tindih
Dengan tiga bug aktif secara bersamaan, gejala ada di mana-mana. Satu pengguna mungkin mendapatkan karakter Thai, yang lain mungkin mendapatkan respons yang terdegradasi, yang ketiga mungkin melihat kinerja yang sempurna. Tidak ada pola yang jelas untuk diikuti.
Apa yang Ini Sebenarnya Berarti untuk Keandalan AI
Saga ini mengungkapkan sesuatu yang sangat penting tentang keadaan sistem AI saat ini: mereka jauh lebih rapuh daripada yang terlihat.
Kita tidak hanya berbicara tentang model AI itu sendiri. Kita berbicara tentang:
- Infrastruktur pengalihan yang dapat mengirim permintaan ke tempat yang salah
- Implementasi perangkat keras yang berbeda yang berperilaku berbeda
- Bug kompilator yang dapat dorman selama berbulan-bulan
- Pengaturan load balancer yang dapat memperbesar masalah kecil menjadi gangguan besar
Satu konfigurasi yang salah, satu bug kompilator, satu kesalahan pengalihan – dan tiba-tiba asisten AI Anda lupa bagaimana mengkode atau mulai berbicara bahasa yang tidak seharusnya.
Apakah Ini Sebenarnya Diperbaiki?
Anthropic mengatakan mereka telah menyelesaikan ketiga masalah tersebut pada 16 September. Mereka telah:
- Memperbaiki logika pengalihan
- Menggulir kembali konfigurasi yang bermasalah
- Beralih dari operasi top-k aproximasi ke operasi top-k yang tepat (mengambil hit pada kinerja untuk akurasi)
- Menambahkan pemantauan produksi terus-menerus
Tapi pengguna masih melaporkan masalah. Beberapa pengembang mengklaim bahwa Claude Code masih terasa terdegradasi dibandingkan dengan kinerjanya sebelumnya. Apakah ini:
- Efek sisa dari bug
- Masalah baru yang belum diidentifikasi
- Bias psikologis setelah minggu-minggu masalah
- Atau degradasi sebenarnya yang berkelanjutan
…kita belum tahu.
Bagian Bawah
Situasi ini adalah studi kasus yang sempurna tentang bagaimana sistem AI yang kompleks dapat gagal dengan cara yang tidak terduga. Tiga bug terpisah, semuanya dipicu dalam beberapa minggu, menciptakan persepsi degradasi kualitas yang besar yang membutuhkan enam minggu untuk didiagnosis dan diperbaiki.
Kita bisa memberikan sedikit pujian kepada Anthropic karena transparansi. Menerbitkan pos mortem teknis yang terperinci lebih dari yang dilakukan oleh kebanyakan perusahaan. Tapi ini juga menunjukkan betapa banyak yang bisa salah di bawah kap sistem ini yang kita andalkan secara meningkat.
Bagi siapa saja yang membangun di atas Claude atau LLM lainnya: Anda memerlukan redundansi, validasi, dan rencana cadangan. Karena seperti yang baru saja kita lihat, bahkan sistem AI terbaik dapat memiliki tiga masalah berbeda secara bersamaan, dan mungkin membutuhkan minggu-minggu sebelum siapa pun memahami apa yang sebenarnya terjadi.
Infrastruktur yang mendukung model AI ini sama pentingnya dengan model itu sendiri. Dan saat ini, infrastruktur itu menunjukkan beberapa nyeri tumbuh yang serius.












