Model dan platform AI

Insinyur Amazon Mengurangi Pengeluaran AI Setelah Biaya Membengkak

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Tim insinyur Amazon (AMZN ) telah menemukan kasus-kasus di mana memindahkan pekerjaan dari kode yang ditulis tangan ke model AI menghabiskan anggaran proyek, termasuk $1,8 juta yang dihabiskan untuk menjalankan Anthropic’s Claude Sonnet pada pekerjaan yang tidak pernah dikirim. Insinyur senior mempresentasikan kasus-kasus tersebut kepada staf pada pertemuan internal pada 28 Juli 2026 dan menggambarkannya sebagai “sangat mahal,” seperti yang dilaporkan oleh Financial Times, mengutip beberapa orang yang familiar dengan presentasi tersebut. Mereka mengatakan kepada rekan-rekan bahwa mereka sekarang membangun pengaman otomatis untuk membatasi apa yang dapat dihabiskan oleh proyek-proyek di masa depan.

Contoh terbesar yang cocok dengan catatan penulis melawan daftar produk di situs ritel Amazon. Pengeluaran melebihi 860% dari apa yang telah dianggarkan untuk proyek tersebut, membutuhkan waktu lima bulan untuk disadari, dan penerapan gagal juga. Dua kasus yang lebih kecil ditampilkan di sampingnya: sekitar $541.000 dalam biaya yang tidak terencana untuk alat auditing keuangan, dan $134.000 untuk pekerjaan memperbaiki kecepatan pengiriman di jaringan logistik Amazon, yang ditemukan setelah lebih dari dua minggu.

Amazon mengatakan bahwa mereka “bereksperimen, belajar, dan memperbaiki” bagaimana mereka menggunakan teknologi tersebut, termasuk bagaimana mereka mengemudi efisiensi biaya. Perusahaan tersebut juga mengatakan bahwa menyajikan beberapa contoh terisolasi sebagai bisnis biasa salah menggambarkan bagaimana tim mereka bekerja dengan AI, dan bahwa kasus-kasus tersebut mencakup sejumlah kecil grup di dalam tenaga kerja perusahaan sekitar 300.000 orang.

Apa yang Dilakukan Token Billing pada Kesalahan Koding

Staf diberitahu bahwa kesalahan yang hampir tidak berbiaya dalam sistem konvensional menjadi mahal ketika model melakukan pekerjaan. Alasannya terletak pada daftar harga. Anthropic mengenakan biaya $3 per juta token input dan $15 per juta token output untuk Claude Sonnet 4.5 dan 4.6, dengan Sonnet 5 pada harga awal $2 dan $10 hingga 31 Agustus 2026 sebelum berpindah ke tarif yang sama. Pada harga input standar Sonnet, $1,8 juta membeli sekitar 600 miliar token input.

Lakukan ulang loop yang mengirim kembali konteks yang sama, atau pekerjaan batch yang diarahkan ke seluruh katalog bukan sampel, tidak melemparkan pengecualian dan tidak menghancurkan apa pun. Ini menghasilkan faktur, dan faktur tiba pada siklus penagihan bulanan bukan pada log build. Jarak antara kesalahan dan angka tersebut adalah yang membuat konfigurasi yang buruk menjadi masalah lima bulan.

Satuan penagihan telah bergerak juga. Dokumentasi Anthropic mencatat bahwa Claude 4.7 dan model yang lebih baru menggunakan tokenizer yang lebih baru yang menghasilkan sekitar 30% lebih banyak token untuk teks yang sama, sehingga pekerjaan yang sama tagihan lebih tinggi pada model yang lebih baru dengan tarif yang sama. Perubahan yang lebih luas dari kursi datar ke token yang diukur adalah latar belakang: Unite.AI meliputnya ketika Claude Fable 5 tiba dengan harga utilitas yang diukur dan lagi sebagai era murah agen Claude yang selalu aktif berakhir.

Kontrol yang Sudah Dijual AWS

Tuas untuk masalah ini dipublikasikan di halaman harga Bedrock Amazon sendiri. Inference batch berjalan setengah dari tarif on-demand. Tier Flex membawa diskon 50% dari harga standar, dengan Tier Prioritas pada premi 75% untuk pekerjaan yang membutuhkan kecepatan. Intelligent Prompt Routing dikenakan biaya $1 per 1.000 permintaan dan mendorong prompt yang lebih sederhana ke model yang lebih murah dalam keluarga yang sama, yang AWS katakan dapat mengurangi biaya hingga 30% tanpa merusak akurasi.

Anthropic menambahkan dua lagi. Baca cache dikenakan biaya sepuluh kali lipat dari tarif input standar, sehingga mengirim kembali prompt sistem atau dokumen yang tetap menjadi bagian yang murah sekali caching diaktifkan. Dan Claude Haiku 4.5 terdaftar pada $1 dan $5 per juta token, sepertiga dari tarif Sonnet, yang merupakan penghematan tunggal terbesar yang tersedia untuk tim mana pun yang memilih model frontier secara default.

Setiap satu dari itu adalah keputusan per-pekerjaan: model mana, apakah konteks di-cache, apakah pekerjaan berjalan secara interaktif atau dalam jendela batch, dan apa langit-langit yang dimiliki akun. Vendor telah mulai menjual lapisan penegakan itu sendiri, termasuk Spectro Cloud’s PaletteAI inference launchpad, yang ditujukan untuk perusahaan yang mencoba menahan biaya token.

Apa yang Berubah di Amazon

Amazon telah menghapus satu insentif yang menunjuk ke arah yang salah. Awal tahun 2026, mereka menutup leaderboard internal yang memeringkatkan penggunaan karyawan platform pengembang Kiro setelah staf mengembangbiakkan konsumsi token mereka untuk mendaki, kebiasaan yang mendapat nama “tokenmaxxing”. Pengaman otomatis yang digambarkan insinyur adalah langkah berikutnya, memasukkan penegakan anggaran ke jalur penerapan bukan pada tinjauan bulanan.

Skala menjelaskan mengapa $1,8 juta terbaca sebagai cerita tata kelola daripada keuangan. Amazon diperkirakan akan menghabiskan sekitar $200 miliar dalam belanja modal di seluruh tahun 2026, sebagian besar untuk infrastruktur AI dan pusat data, dibandingkan dengan pendapatan kuartalan sekitar $180 miliar. Perusahaan tersebut melaporkan hasil kuartal kedua setelah penutupan pada 30 Juli 2026, dan garis belanja modal akan mendapatkan sebagian besar perhatian. Ukuran yang menunjukkan apakah pengaman bekerja adalah lebih kecil dan internal: seberapa cepat pekerjaan yang tidak terkendali diberi tanda. Proyek pencocokan penulis menetapkan batang itu pada lima bulan, dan pemeriksaan otomatis dimaksudkan untuk memindahkannya ke dalam build.

Aiden Cross adalah seorang strategi yang dihasilkan oleh AI di Unite.AI, yang meliputi strategi produk AI, eksekusi, dan tantangan praktis dalam mengubah model eksperimental menjadi produk yang siap pasar dan dapat diskalakan. Pekerjaannya berfokus pada bagaimana startup dan tim perusahaan bergerak dari prototipe dan demo ke sistem yang dapat diandalkan yang digunakan oleh pelanggan nyata.
Dengan perspektif yang pragmatis dan detail, Aiden menganalisis peta jalan produk, strategi go-to-market, keputusan platform, dan pertukaran organisasi yang menentukan apakah inisiatif AI berhasil atau terhambat. Ia memperhatikan khusus kenyataan penerapan, adopsi pengguna, keterbatasan infrastruktur, dan keselarasan antara kemampuan teknis dan nilai bisnis.
Artikel yang ditulis oleh Aiden Cross dihasilkan oleh AI dan ditinjau oleh tim editorial Unite.AI untuk memastikan kejelasan, akurasi, dan liputan yang bertanggung jawab tentang bagaimana produk AI dibangun, dikirim, dan diskalakan di dunia nyata.