Pemimpin pemikiran
Mengapa Biaya Token Membobol Anggaran CFO pada 2026

Dalam waktu kurang dari setahun, biaya token AI telah berubah dari detail teknologi kecil menjadi masalah anggaran di tingkat dewan direksi. Dua belas bulan lalu, “biaya token” bukanlah pos yang diperhatikan kebanyakan CFO. Sekarang biaya tersebut muncul di semua tempat yang tidak diinginkan: berita, memo internal, pembekuan anggaran, dan laporan pendapatan.
Uber memberi para insinyurnya akses ke Claude Code pada akhir 2025. Pada April 2026, perusahaan itu telah menghabiskan seluruh anggaran tahunan untuk pemrograman AI hanya dalam empat bulan. Sebagai tanggapan, Uber membatasi pengeluaran sebesar US$1.500 per karyawan, per bulan, per alat, seperti yang pertama kali dilaporkan Bloomberg. Jika penggunaan dua alat pemrograman agentik secara bersamaan diizinkan, misalnya Claude dan Cursor, batas itu berlipat ganda menjadi US$3.000 per bulan per insinyur, atau US$36.000 per tahun untuk penggunaan AI satu orang. Uber diperkirakan memiliki sekitar 4.000 insinyur, yang berarti pengeluaran untuk AI dapat mencapai US$144 juta.
Pengeluaran Meta mungkin lebih besar. Sebuah memo internal memperingatkan bahwa biaya token AI diperkirakan mencapai miliaran dolar pada 2026. Penyebabnya terletak pada mekanisme kerja agen dalam skala besar. Ketika agen AI terhubung ke basis kode untuk memperbaiki bug atau menulis perangkat lunak, agen tersebut memproses ribuan token konteks latar belakang pada setiap permintaan. Terapkan hal ini dalam organisasi sebesar Meta, tambahkan dorongan perusahaan agar tim rekayasa menggunakan Claude, dan penggunaan token bukan sekadar tumbuh, melainkan meledak.
Menurut AI Index milik Ramp, yang melacak pembayaran nyata kepada vendor di lebih dari 70.000 perusahaan, 1% perusahaan teratas dalam adopsi AI kini menghabiskan sekitar US$7.500 per karyawan per bulan untuk AI, dan pengeluaran itu tumbuh 14,1% dari bulan ke bulan. Para eksekutif Mercor, perusahaan rintisan perekrutan berbasis AI, telah menyatakan secara terbuka bahwa biaya token AI mulai mendekati atau melampaui biaya kompensasi karyawan di beberapa organisasi.
Ada pelajaran yang dapat diambil. Jika perusahaan teknologi terbesar di dunia bisa terkejut oleh biaya ini, siapa pun juga bisa mengalaminya. Konsumsi token telah menjadi kategori pengeluaran yang benar-benar baru, yang tidak tercantum dalam laporan laba rugi mana pun dua tahun lalu. Biaya ini tidak berperilaku seperti biaya perangkat lunak yang selama puluhan tahun telah dipelajari tim keuangan untuk dimodelkan dan dimasukkan ke dalam perhitungan ROI tradisional. Memahami mengapa biaya token AI berperilaku sangat berbeda dari pengeluaran perangkat lunak tradisional adalah langkah pertama untuk mengendalikannya.
Mengapa Biaya Token AI Sangat Sulit Diprediksi
Penganggaran perangkat lunak tradisional berjalan berdasarkan asumsi sederhana: biaya meningkat seiring jumlah karyawan. Sepuluh karyawan tambahan berarti sepuluh lisensi tambahan dengan harga yang sudah diketahui. Hal ini mudah diproyeksikan dan direncanakan ketika perusahaan bertumbuh atau melisensikan platform perangkat lunak baru.
Token AI mematahkan asumsi tersebut. Biaya meningkat berdasarkan penggunaan, bukan jumlah karyawan, sementara penggunaan sangat tidak merata, sulit diprediksi, dan dalam kasus agen otonom bahkan tidak terkait dengan manusia yang duduk di depan papan ketik. Satu orang insinyur yang menjalankan sesi pemrograman agentik dapat menghabiskan ribuan dolar dalam sebulan tanpa peringatan karena meteran terus berjalan terlepas dari apakah keluarannya berguna. Banyak model juga menghasilkan ribuan token tersembunyi dan tidak terlihat hanya untuk “berpikir” langkah demi langkah sebelum menjawab, sehingga melipatgandakan biaya setiap permintaan.
Inilah bagian yang belum diperhitungkan oleh kebanyakan organisasi: setiap dolar pengeluaran baru untuk AI agentik harus diambil dari sumber lain. Bagi kebanyakan CFO, ini bukan kesalahan pembulatan yang dapat diserap dana inovasi. Kita membicarakan jutaan dolar pengeluaran baru yang tidak ada dua tahun lalu. Hal ini menciptakan pilihan nyata antara pengeluaran tersebut dan jumlah karyawan, investasi teknologi lain, atau anggaran diskresioner di bagian bisnis yang lain.
Tiga Tingkat Risiko Pengeluaran AI Perusahaan
Jika melihat cara organisasi benar-benar membelanjakan dana untuk AI, terlihat pola yang semakin jelas. Risiko biaya AI tidak tersebar merata. Risiko itu terkonsentrasi di tempat tertentu, dan kemungkinan hanya satu dari tiga tingkat yang saat ini terkendali dalam organisasi pada umumnya.
Pengguna bisnis di bidang penjualan, pemasaran, dan operasi sebagian besar memakai alat dengan harga per lisensi: tarif tetap US$20 hingga US$30 per pengguna per bulan. Inilah tingkat yang sudah dapat dianggarkan oleh tim keuangan, karena perilakunya sama persis dengan setiap pos SaaS lain yang telah mereka beli selama dua puluh tahun terakhir.
Pengembang yang menggunakan alat pemrograman agentik merupakan sumber kisah seperti yang dialami Uber, dan seluruh kategori ini baru saja beralih dari tarif tetap ke harga berdasarkan pemakaian. GitHub Copilot beralih ke penagihan berbasis token pada Juni 2026, dan para pengembang memproyeksikan tagihan melonjak dari US$29 menjadi US$750 per bulan, serta dari US$50 menjadi US$3.000 per bulan dalam sesi agentik yang intensif. Uber bukanlah pengecualian, melainkan gambaran awal tentang arah seluruh kategori ini.
Agen otonom adalah tingkat yang hampir belum pernah dimodelkan oleh siapa pun. Tidak ada konsep “lisensi pengguna” untuk agen. Agen berjalan tanpa pengawasan, mengaktifkan subagen, mencoba kembali ketika gagal, dan mengonsumsi token sepanjang waktu, baik menghasilkan sesuatu yang bernilai maupun tidak. Inilah lapisan dengan data biaya paling sedikit dan preseden penganggaran paling terbatas.
Sederhananya, tingkat yang paling dipahami CFO sekaligus merupakan risiko keuangan terkecil. Dua tingkat yang benar-benar membuat anggaran membengkak justru sedang meninggalkan harga yang dapat diprediksi tepat ketika penggunaannya tumbuh paling cepat.
Menutup Kesenjangan Pengelolaan Biaya AI
Benang merah antara Uber, Meta, dan kumpulan data Ramp yang lebih luas adalah kurangnya visibilitas. Kebanyakan organisasi tidak memiliki lapisan kendali antara karyawan atau agen dan alat yang dibukanya. Batas pengeluaran seperti milik Uber merupakan perbaikan kasar setelah kejadian untuk masalah yang sebenarnya memerlukan penanganan lebih awal.
Inilah kesenjangan yang ingin diatasi oleh kategori alat baru yang sering disebut orkestrasi agen atau gerbang agen: mengarahkan setiap tugas ke model termurah yang mampu menanganinya, menerapkan batas pengeluaran sebelum dilanggar, dan memberi tim keuangan meteran waktu nyata alih-alih kejutan bulanan.
Kategori ini bergerak cepat dan sudah terbagi menjadi beberapa lapisan yang berbeda. Salah satunya adalah gerbang dengan kendali biaya yang berada di antara aplikasi organisasi dan penyedia modelnya, lalu menambahkan batas pengeluaran per tim, perutean otomatis tugas sederhana ke model yang lebih murah, serta penyimpanan respons dalam cache. Ini adalah mekanisme yang sama dengan yang diterapkan Uber secara manual saat memberlakukan batas pengeluarannya. Lapisan kedua adalah orkestrasi agen, yang berfokus pada koordinasi beberapa agen yang bekerja bersama dan semakin sering memasukkan visibilitas biaya sejak awal, bukan menambahkannya belakangan. Sementara itu, lapisan baru yang ditujukan kepada tim keuangan mulai memperlakukan pengeluaran AI seperti tim FinOps telah lama memperlakukan pengeluaran cloud: dialokasikan menurut tim dan fitur, dianggarkan, serta ditinjau setiap bulan, alih-alih baru ditemukan setelah terjadi.
Ada pula pendekatan arsitektur yang bertujuan membatasi pengeluaran dengan mengurangi ketergantungan pada LLM besar. Sejumlah perusahaan mulai membuat arsitektur hibrida SLM/LLM, ketika model bahasa kecil dilatih untuk sekumpulan tugas perusahaan yang sempit, misalnya kebijakan internal, layanan pelanggan, pemrosesan dokumen pinjaman, atau penguraian manifes pengiriman. Keuntungan ekonominya dapat sangat menarik.
Menurut perbandingan LLM perusahaan tahun 2026, untuk satu juta percakapan bulanan, biaya LLM terdepan yang dihosting berkisar antara US$15.000 hingga US$75.000 per bulan, sedangkan model bahasa kecil yang disesuaikan dan diterapkan secara internal berbiaya US$150 hingga US$800 per bulan pada volume yang sama. Goldman Sachs, misalnya, mengelola pengeluaran AI berskala besar melalui gerbang model terpusat yang mengklasifikasikan setiap permintaan berdasarkan jenis tugas dan mengarahkannya ke model paling hemat biaya untuk pekerjaan tersebut, mulai dari model sumber terbuka yang ringan hingga LLM terdepan, semuanya dalam perimeter keamanannya sendiri.
Benang merahnya adalah bahwa kebanyakan alat saat ini dibuat oleh dan untuk insinyur guna meningkatkan produktivitas mereka secara drastis melalui penggunaan agen. Lapisan yang masih belum dimiliki kebanyakan organisasi adalah lapisan yang dirancang untuk menjawab pertanyaan CFO secara langsung: tim mana, anggaran mana, bagaimana memperkirakan pengeluaran, dan kasus penggunaan bisnis apa yang didukung oleh pengeluaran ini? Kesenjangan inilah yang kemungkinan paling penting ketika pengeluaran AI agentik terus bertambah.
Dua tahun lalu, tidak ada satu pun dari semua ini sebagai pos pengeluaran. Saat ini, biaya token AI menjadi salah satu pos dengan pertumbuhan tercepat dan paling kurang dipahami dalam neraca, dan pengelolaan biaya AI dengan cepat berubah menjadi disiplin utama keuangan, bukan proyek sampingan. Kita pernah melihat kisah serupa ketika cloud pertama kali diadopsi dan biayanya meledak pada gelombang awal tersebut. Organisasi yang merencanakan penerapan AI agentik sebaiknya mengadakan percakapan antara tim rekayasa dan keuangan sekarang juga serta menetapkan pendekatan pengelolaan. Uber dan Meta telah menunjukkan apa yang terjadi ketika percakapan itu dilakukan setelah kejadian, bukan sebelumnya.












