Pemimpin pemikiran
Keandalan adalah ujian sebenarnya bagi AI agentik

Selama dua tahun terakhir, industri mengajukan satu pertanyaan: apakah agen AI cukup mampu menangani pekerjaan nyata? Kita dapat berhenti bertanya. Kita tahu mereka mampu, tetapi kita perlu benar-benar berfokus pada apakah kita dapat mengenali saat agen akan membuat kesalahan mahal dan menghentikannya sebelum kesalahan itu terjadi.
Kegagalan terburuk di lingkungan produksi biasanya tidak terlihat seperti kesalahan model yang jelas. Agen dapat menyelesaikan setiap panggilan API dengan berhasil tetapi tetap bekerja berdasarkan konteks lama, mencoba kembali alat yang gagal, atau mengarah pada tindakan yang melanggar aturan. Keandalan menentukan apakah program AI agentik berhasil melewati tahap percontohan.
Menurut “The state of AI in 2025: Agents, innovation, and transformation”, sebuah survei McKinsey, 62% organisasi sedang bereksperimen dengan agen AI, tetapi hanya sekitar 10% yang tidak memperluasnya pada fungsi mana pun. Menunjukkan kepada rekan kerja bahwa suatu agen berfungsi merupakan hal mudah. Mengoperasikannya dengan aman pada data nyata dan sistem yang saling terhubung bukanlah hal mudah.
Mengapa AI agentik memperbesar risiko
Agen menggabungkan penalaran probabilistik, penggunaan alat, dan tingkat otonomi tertentu. Kombinasi ini membuatnya berguna, tetapi juga menghadapkan perusahaan pada kesalahan yang bertambah lebih cepat dibandingkan dalam aplikasi tradisional.
Konteks
Agen hanya dapat bekerja berdasarkan konteks yang diberikan. Karena itu, jika konteks tidak lengkap, kedaluwarsa, atau salah, penafsiran yang buruk pada awal proses akan terbawa ke setiap langkah berikutnya. Jawaban chatbot yang salah memang mengganggu. Penafsiran salah yang mengubah izin akses atau menyentuh infrastruktur merupakan insiden. Jika terjadi masalah, penting untuk mengetahui apakah agen menggunakan bukti yang tepat, mengikuti kebijakan, dan membatasi dampak pada cakupan yang dapat diterima.
Basis pengetahuan
Agen juga terhubung ke basis pengetahuan, sistem tiket, dan platform pembayaran. Setiap koneksi memperluas permukaan serangan. Agen dapat memanggil alat yang salah, memanggil alat yang tepat dengan urutan keliru, atau bertindak berdasarkan instruksi yang tersembunyi dalam konten yang diambil. Mode kegagalan ini telah dikenal dan mencakup konfabulasi serta kerentanan keamanan yang muncul dari cara agen merangkai alat dan konteks.
Dasbor berwarna hijau dapat menipu: infrastruktur tampak baik-baik saja sementara agen diam-diam menanyakan alat yang sama berulang kali. Ini merupakan tanda awal penyimpangan, bukan gangguan biasa.
Non-determinisme
Non-determinisme juga mempersulit penanganan insiden. Kegagalan layanan tradisional biasanya dapat direproduksi dengan ID permintaan dan versi perangkat lunak yang diketahui. Eksekusi agen bergantung pada versi model, dokumen yang diambil, keluaran alat yang diterimanya, dan rangkaian keputusan antara. Tanpa catatan mengenai apa yang diterima dan dicoba agen, analisis akar masalah dan tata kelola menjadi jauh lebih sulit.
Biaya dan latensi
Biaya dan latensi menyampaikan cerita yang sama dari sudut lain. Lonjakan mendadak dalam penggunaan token atau upaya ulang dapat menandakan rencana yang buruk atau suatu perulangan, meskipun pengguna akhirnya mendapat jawaban. Biaya inferensi telah turun tajam selama beberapa tahun terakhir, dan inferensi yang lebih murah memudahkan perilaku tidak efisien diabaikan sampai perilaku itu berulang di ribuan alur kerja. Perlakukan biaya, latensi, dan upaya ulang sebagai sinyal keandalan, bukan sekadar metrik keuangan.
AI terdesentralisasi tetap memerlukan visibilitas terpusat
Desentralisasi gagal tanpa pagar pembatas yang jelas. Serahkan kepemilikan alur kerja dan eskalasi kepada tim garis depan, tetapi pertahankan identitas, akses, dan penanganan insiden di tingkat perusahaan. Tim keuangan dapat membedakan pengecualian faktur yang sah dari keputusan pembayaran yang tidak semestinya dengan cara yang tidak akan pernah bisa dilakukan oleh tolok ukur umum. Dalam survei yang sama, McKinsey menemukan bahwa organisasi yang melaporkan dampak nyata AI memiliki kemungkinan hampir tiga kali lebih besar untuk merancang ulang alur kerja, bukan sekadar menambahkan AI pada proses yang sudah ada.
Meski demikian, komprominya nyata: kepemilikan cepat menjadi kabur ketika suatu insiden melintasi sistem. Solusinya adalah pandangan operasional bersama atas setiap agen, alatnya, akses datanya, dan riwayat insidennya.
Arsitektur terdistribusi memudahkan hilangnya gambaran lengkap ketika terjadi kerusakan. Banyak tim dapat melihat volume token dan biaya, tetapi tidak dapat mengetahui apakah agen benar-benar mencapai hasil yang dimaksud dengan aman. Ketika catatan sepanjang alur kerja tersimpan di tempat berbeda, tim akhirnya mengejar gejala alih-alih penyebab.
Sinyal telemetri yang distandardisasi, seperti identitas model dan panggilan alat, dapat membantu. Garis dasar perilaku, seperti jumlah langkah normal dalam suatu alur kerja, juga diperlukan untuk membedakan kegigihan yang berguna dari sistem yang terjebak. Evaluasi bukan gerbang satu kali sebelum peluncuran. Evaluasi adalah siklus berkelanjutan.
Seperti apa AI yang andal dalam lingkungan produksi
AI yang andal berkaitan dengan pengelolaan kesalahan, bukan menghindarinya. Tim memerlukan visibilitas terhadap perilaku, peringatan ketika kinerja menyimpang, dan rencana pembatasan ketika terjadi masalah. Yang terpenting, setiap agen memerlukan pagar pembatas yang jelas untuk akses dan tindakan otonom. Agen juga memerlukan persetujuan manusia.
Mulailah dengan tindakan berisiko rendah yang dapat dibatalkan. Pertahankan tindakan yang berdampak besar, seperti perubahan produksi dan transaksi keuangan, di balik pengendalian nyata. Alur kerja yang berdampak besar harus dapat direkonstruksi setelah kejadian, termasuk konteks yang diambil agen, alat yang dipanggil, persetujuan yang diperoleh, dan apakah hasilnya benar-benar tepat.
Sasaran tingkat layanan tradisional juga perlu diperluas agar mencakup mutu dan keamanan agen. Sasaran itu meliputi tingkat keberhasilan tugas yang divalidasi, tingkat kepatuhan terhadap kebijakan, tingkat eskalasi manusia, biaya per tugas berhasil, dan frekuensi hasil yang tidak diinginkan. Ambang batas harus berbeda menurut kasus penggunaan. Asisten pengetahuan internal dapat menoleransi profil kesalahan yang berbeda dari agen yang mengakses data yang diatur.
Sistem keandalan yang paling berguna belajar mengenali kondisi yang biasanya muncul sebelum kegagalan, seperti lonjakan upaya ulang yang tidak normal atau jalur yang secara historis mengarah pada intervensi manusia. Alur kerja berisiko rendah dapat memicu perbaikan otomatis. Alur yang berisiko lebih tinggi harus berhenti dan meneruskan keputusan kepada orang yang berwenang. Tujuannya bukan tindakan otonom demi tindakan itu sendiri. Tujuannya adalah tindakan yang lebih cepat dan lebih aman ketika bukti mendukungnya.
AI SRE menutup siklus
Di sinilah AI SRE berperan. Agen AI SRE dapat menyusun kronologi insiden, membandingkan perilaku saat ini dengan insiden terdahulu, dan menyiapkan tindakan yang disarankan, sementara organisasi mempertahankan perbaikan terkendali untuk tugas yang dapat dibatalkan dan persetujuan manusia untuk segala tindakan yang berdampak besar.
Adopsi AI bergerak cepat. Namun, adopsi tidak sama dengan kematangan operasional. Perusahaan yang berhasil memperluas AI agentik belum tentu perusahaan yang menjalankan model paling mampu secara terpisah. Perusahaan itu adalah yang mampu melihat perilaku agen di seluruh bisnis, menangkap tanda awal penyimpangan, dan turun tangan sebelum kesalahan kecil berubah menjadi insiden pelanggan, keamanan, atau kepatuhan.
Itulah peran yang diisi AI SRE: menghubungkan inovasi terdesentralisasi dengan visibilitas terpusat dan mengubah AI agentik menjadi sistem yang dapat dipercaya perusahaan.












