Pemimpin pemikiran
Model Terbuka Terus Menjadi Lebih Baik. Ekonomi Semakin Rumit.

Model AI jelas lebih baik daripada 18 bulan yang lalu. Namun ketika saya mulai meneliti lebih dalam, penjelasan umum untuk kemajuan tersebut tidak memadai.
Mereka tidak menjadi lebih baik hanya karena ukurannya lebih besar. “Sumber terbuka menang” hanya setengah benar. Dan saran untuk melihat skor benchmark ternyata jauh kurang berguna dibandingkan yang saya harapkan. Hal itu memakan waktu bagi saya untuk menerimanya.
Jadi saya mengumpulkan 18 bulan data dari 46 model dari delapan laboratorium. Saya ingin memahami apakah kecerdasan menjadi komoditas, apakah model terbuka mengejar frontier, dan apa yang harus diukur perusahaan saat memilih sistem yang akan mereka gunakan.
Temuan utama cukup sederhana: skor benchmark sebenarnya bukan sifat model. Itu mencerminkan model, perangkat lunak dan konteks di sekitarnya, serta berapa banyak waktu dan daya komputasi yang diizinkan untuk digunakan. Menerbitkan satu angka berarti Anda menyembunyikan dua faktor lainnya.
Implikasinya, bagaimanapun, jauh lebih luas. Perusahaan membandingkan model individu padahal seharusnya mengevaluasi sistem lengkap yang harus menyelesaikan pekerjaan.
Benchmark Menyembunyikan Sistem
Ketika saya berhenti melihat skor gabungan dan membandingkan model satu per satu, kesenjangan antara model open-weight terkemuka dan model proprietari bukanlah satu angka saja.
Pada SWE-bench Verified, tes lama yang muncul dalam banyak pengumuman model, kesenjangan sebesar 0,2 poin. Pada SWE-bench Pro, tes baru yang dirancang untuk pekerjaan perangkat lunak multibahasa yang realistis dengan pengaturan standar, kesenjangan sebesar 18,2 poin.
Kesenjangan model yang tampak bergantung pada benchmark
| Benchmark | Kesenjangan | Status |
|---|---|---|
| SWE-bench Verified | 0,2 poin | Jenuh, kontaminasi terdeteksi |
| GPQA Diamond | 2,0 poin | Jenuh, batas atas sekitar 92–95% |
| Terminal-Bench 2.1 | 4,9 poin | Langsung, agenik |
| Humanity’s Last Exam | 9,8 poin | Langsung, penalaran frontier |
| SWE-bench Pro | 18,2 poin | Langsung, kerangka kerja standar |
Sumber: Analisis Jaspreet Singh tentang model open-weight terkemuka dan model proprietari, Juli 2026.
Model yang sama juga dapat menerima skor berbeda tergantung siapa yang menjalankan tes. Kimi K3 mencetak 80,9% pada Terminal-Bench 2.1 dalam evaluasi independen dan 88,3% ketika pembuatnya melaporkan hasilnya. Selisih 7,4 poin itu lebih besar daripada kesenjangan open-versus-frontier pada tiga dari lima benchmark yang saya analisis.
Model menerima instruksi melalui perangkat lunak di sekitarnya, memanfaatkan konteks yang diberikan, menggunakan alat yang dapat diakses, dan beroperasi dalam batas penalaran yang ditetapkan oleh pengembang. Mengubah kondisi tersebut akan mengubah hasilnya.
Benchmark publik berguna untuk memahami arah kemajuan. Namun mereka merupakan dasar yang lemah untuk memutuskan apa yang akan berhasil di dalam perusahaan Anda.
Keandalan Agenik Mengubah Perhitungan
Hal ini menjadi lebih penting seiring AI beralih dari menjawab pertanyaan ke menyelesaikan rangkaian tindakan.
Ambil alur kerja dengan 20 langkah, di mana AI menyelesaikan setiap langkah dengan benar 95% waktu. Itu terdengar dapat diandalkan. Namun pada keseluruhan urutan, alur kerja hanya berhasil 36% waktu.
Model yang lebih baik dapat meningkatkan peluang pada setiap langkah, terutama pada pekerjaan agenik yang sulit. Rekayasa di sekitarnya yang menentukan apakah satu langkah buruk dapat merusak pekerjaan. Menyimpan kemajuan, memverifikasi output, mencoba kembali dengan aman, dan memulihkan dari kegagalan sering membedakan demonstrasi yang meyakinkan dari produk yang dapat diandalkan.
Pemilihan model masih penting. Namun model dengan skor tertinggi tidak otomatis menghasilkan sistem yang paling dapat diandalkan.
Pilih Model Berdasarkan Pekerjaan
Data mendukung kesimpulan yang lebih sempit dibandingkan argumen di kedua sisi perdebatan open-versus-proprietary.
Model open-weight kompetitif untuk pekerjaan dengan definisi jelas dan jangka pendek di mana hasilnya dapat diukur secara langsung. Klasifikasi, ekstraksi, ringkasan, dan generasi terstruktur semakin masuk ke dalam kategori ini.
Model frontier masih memperoleh premi mereka pada tugas agenik yang lebih panjang, kepatuhan instruksi di bawah tekanan, dan pekerjaan di mana kegagalan mahal untuk dideteksi setelahnya. Di sinilah benchmark baru menunjukkan kesenjangan mendekati 18 poin dibandingkan nol, dan di mana lapisan keamanan yang disediakan oleh vendor model memiliki nilai.
Perusahaan harus memilih model berdasarkan tugas, tetapi tidak boleh menganggap pergantian itu gratis. Konteks, penalaran, dan cache prompt tidak berpindah dengan bersih antar penyedia. Model yang lebih murah dapat menjadi lebih mahal jika perubahan sistem memaksa pekerjaan dimulai kembali atau menambah lapisan rekayasa dan tata kelola.
Pemilihan model semakin tidak permanen. Pergantian tetap menjadi keputusan arsitektural.
Ketika Kecerdasan Menjadi Lebih Murah, Penilaian Tetap Mahal
Kapabilitas umum yang kompeten menjadi sangat murah. Namun, di puncak kurva, setiap poin tambahan kinerja biaya lebih tinggi daripada sebelumnya. Sembilan poin terakhir kapabilitas biaya kira-kira sepuluh kali lipat dari semua yang berada di bawahnya.
Kebanyakan perusahaan tidak memerlukan model paling kuat untuk setiap permintaan. Namun mereka perlu mengetahui pekerjaan mana yang pantas mendapatkannya.
Meringkas, mengekstrak, mengklasifikasikan, menyusun, dan menerjemahkan bergerak menuju kapabilitas utilitas. Yang tetap langka adalah penilaian: mengetahui mana dari lima jawaban yang masuk akal yang benar, menyadari pertanyaan salah, dan memutuskan kapan harus berhenti dan meminta bantuan manusia.
Penilaian berasal dari konteks kepemilikan, aturan bisnis, alur kerja, pengetahuan historis, dan rekayasa yang memverifikasi pekerjaan serta menahan kegagalan.
Buat Evaluasi yang Tidak Bisa Dijalankan Oleh Orang Lain
Bagi sebuah perusahaan, tolok ukur paling berharga dibangun dari pekerjaan mereka sendiri.
Buat set evaluasi pribadi dengan 50 hingga 200 tugas nyata dari bisnis Anda. Pertahankan sistem sekitarnya tetap, jalankan tes berulang kali, dan nilai apakah pekerjaan selesai dengan benar daripada seberapa halus jawaban terdengar.
Terapkan disiplin yang sama pada biaya. Biaya per token dapat menyesatkan ketika satu model berpikir lebih lama, memerlukan lebih banyak percobaan ulang, atau menghasilkan lebih banyak pekerjaan bagi peninjau manusia. Ukur biaya per hasil yang diterima sebagai gantinya.
Mulailah dengan sejumlah kecil model. Alirkan pekerjaan di awal tugas daripada mengganti penyedia di tengahnya. Hitung beban keamanan, tata kelola, dan operasional masing-masing penyedia tambahan bersamaan dengan harga yang diiklankan.
Pasar akan terus menghasilkan pemenang tolok ukur baru, dan perusahaan akan terus tergoda untuk membangun kembali strategi AI mereka di sekitar masing‑masing. Pendekatan yang lebih baik adalah memilih model untuk pekerjaan, lalu mengevaluasi seluruh sistem dalam kondisi di mana ia harus beroperasi.
Tolok ukur yang harus menjadi panduan arsitektur Anda adalah yang hanya dapat dijalankan oleh perusahaan Anda.












