Pemimpin pemikiran

Model Terbuka Terus Menjadi Lebih Baik. Ekonomi Semakin Rumit.

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Model AI jelas lebih baik daripada 18 bulan yang lalu. Namun ketika saya mulai meneliti lebih dalam, penjelasan umum untuk kemajuan tersebut tidak memadai.

Mereka tidak menjadi lebih baik hanya karena ukurannya lebih besar. “Sumber terbuka menang” hanya setengah benar. Dan saran untuk melihat skor benchmark ternyata jauh kurang berguna dibandingkan yang saya harapkan. Hal itu memakan waktu bagi saya untuk menerimanya.

Jadi saya mengumpulkan 18 bulan data dari 46 model dari delapan laboratorium. Saya ingin memahami apakah kecerdasan menjadi komoditas, apakah model terbuka mengejar frontier, dan apa yang harus diukur perusahaan saat memilih sistem yang akan mereka gunakan.

Temuan utama cukup sederhana: skor benchmark sebenarnya bukan sifat model. Itu mencerminkan model, perangkat lunak dan konteks di sekitarnya, serta berapa banyak waktu dan daya komputasi yang diizinkan untuk digunakan. Menerbitkan satu angka berarti Anda menyembunyikan dua faktor lainnya.

Implikasinya, bagaimanapun, jauh lebih luas. Perusahaan membandingkan model individu padahal seharusnya mengevaluasi sistem lengkap yang harus menyelesaikan pekerjaan.

Benchmark Menyembunyikan Sistem

Ketika saya berhenti melihat skor gabungan dan membandingkan model satu per satu, kesenjangan antara model open-weight terkemuka dan model proprietari bukanlah satu angka saja.

Pada SWE-bench Verified, tes lama yang muncul dalam banyak pengumuman model, kesenjangan sebesar 0,2 poin. Pada SWE-bench Pro, tes baru yang dirancang untuk pekerjaan perangkat lunak multibahasa yang realistis dengan pengaturan standar, kesenjangan sebesar 18,2 poin.

Kesenjangan model yang tampak bergantung pada benchmark

Benchmark Kesenjangan Status
SWE-bench Verified 0,2 poin Jenuh, kontaminasi terdeteksi
GPQA Diamond 2,0 poin Jenuh, batas atas sekitar 92–95%
Terminal-Bench 2.1 4,9 poin Langsung, agenik
Humanity’s Last Exam 9,8 poin Langsung, penalaran frontier
SWE-bench Pro 18,2 poin Langsung, kerangka kerja standar

Sumber: Analisis Jaspreet Singh tentang model open-weight terkemuka dan model proprietari, Juli 2026.

Model yang sama juga dapat menerima skor berbeda tergantung siapa yang menjalankan tes. Kimi K3 mencetak 80,9% pada Terminal-Bench 2.1 dalam evaluasi independen dan 88,3% ketika pembuatnya melaporkan hasilnya. Selisih 7,4 poin itu lebih besar daripada kesenjangan open-versus-frontier pada tiga dari lima benchmark yang saya analisis.

Model menerima instruksi melalui perangkat lunak di sekitarnya, memanfaatkan konteks yang diberikan, menggunakan alat yang dapat diakses, dan beroperasi dalam batas penalaran yang ditetapkan oleh pengembang. Mengubah kondisi tersebut akan mengubah hasilnya.

Benchmark publik berguna untuk memahami arah kemajuan. Namun mereka merupakan dasar yang lemah untuk memutuskan apa yang akan berhasil di dalam perusahaan Anda.

Keandalan Agenik Mengubah Perhitungan

Hal ini menjadi lebih penting seiring AI beralih dari menjawab pertanyaan ke menyelesaikan rangkaian tindakan.

Ambil alur kerja dengan 20 langkah, di mana AI menyelesaikan setiap langkah dengan benar 95% waktu. Itu terdengar dapat diandalkan. Namun pada keseluruhan urutan, alur kerja hanya berhasil 36% waktu.

Model yang lebih baik dapat meningkatkan peluang pada setiap langkah, terutama pada pekerjaan agenik yang sulit. Rekayasa di sekitarnya yang menentukan apakah satu langkah buruk dapat merusak pekerjaan. Menyimpan kemajuan, memverifikasi output, mencoba kembali dengan aman, dan memulihkan dari kegagalan sering membedakan demonstrasi yang meyakinkan dari produk yang dapat diandalkan.

Pemilihan model masih penting. Namun model dengan skor tertinggi tidak otomatis menghasilkan sistem yang paling dapat diandalkan.

Pilih Model Berdasarkan Pekerjaan

Data mendukung kesimpulan yang lebih sempit dibandingkan argumen di kedua sisi perdebatan open-versus-proprietary.

Model open-weight kompetitif untuk pekerjaan dengan definisi jelas dan jangka pendek di mana hasilnya dapat diukur secara langsung. Klasifikasi, ekstraksi, ringkasan, dan generasi terstruktur semakin masuk ke dalam kategori ini.

Model frontier masih memperoleh premi mereka pada tugas agenik yang lebih panjang, kepatuhan instruksi di bawah tekanan, dan pekerjaan di mana kegagalan mahal untuk dideteksi setelahnya. Di sinilah benchmark baru menunjukkan kesenjangan mendekati 18 poin dibandingkan nol, dan di mana lapisan keamanan yang disediakan oleh vendor model memiliki nilai.

Perusahaan harus memilih model berdasarkan tugas, tetapi tidak boleh menganggap pergantian itu gratis. Konteks, penalaran, dan cache prompt tidak berpindah dengan bersih antar penyedia. Model yang lebih murah dapat menjadi lebih mahal jika perubahan sistem memaksa pekerjaan dimulai kembali atau menambah lapisan rekayasa dan tata kelola.

Pemilihan model semakin tidak permanen. Pergantian tetap menjadi keputusan arsitektural.

Ketika Kecerdasan Menjadi Lebih Murah, Penilaian Tetap Mahal

Kapabilitas umum yang kompeten menjadi sangat murah. Namun, di puncak kurva, setiap poin tambahan kinerja biaya lebih tinggi daripada sebelumnya. Sembilan poin terakhir kapabilitas biaya kira-kira sepuluh kali lipat dari semua yang berada di bawahnya.

Kebanyakan perusahaan tidak memerlukan model paling kuat untuk setiap permintaan. Namun mereka perlu mengetahui pekerjaan mana yang pantas mendapatkannya.

Meringkas, mengekstrak, mengklasifikasikan, menyusun, dan menerjemahkan bergerak menuju kapabilitas utilitas. Yang tetap langka adalah penilaian: mengetahui mana dari lima jawaban yang masuk akal yang benar, menyadari pertanyaan salah, dan memutuskan kapan harus berhenti dan meminta bantuan manusia.

Penilaian berasal dari konteks kepemilikan, aturan bisnis, alur kerja, pengetahuan historis, dan rekayasa yang memverifikasi pekerjaan serta menahan kegagalan.

Buat Evaluasi yang Tidak Bisa Dijalankan Oleh Orang Lain

Bagi sebuah perusahaan, tolok ukur paling berharga dibangun dari pekerjaan mereka sendiri.

Buat set evaluasi pribadi dengan 50 hingga 200 tugas nyata dari bisnis Anda. Pertahankan sistem sekitarnya tetap, jalankan tes berulang kali, dan nilai apakah pekerjaan selesai dengan benar daripada seberapa halus jawaban terdengar.

Terapkan disiplin yang sama pada biaya. Biaya per token dapat menyesatkan ketika satu model berpikir lebih lama, memerlukan lebih banyak percobaan ulang, atau menghasilkan lebih banyak pekerjaan bagi peninjau manusia. Ukur biaya per hasil yang diterima sebagai gantinya.

Mulailah dengan sejumlah kecil model. Alirkan pekerjaan di awal tugas daripada mengganti penyedia di tengahnya. Hitung beban keamanan, tata kelola, dan operasional masing-masing penyedia tambahan bersamaan dengan harga yang diiklankan.

Pasar akan terus menghasilkan pemenang tolok ukur baru, dan perusahaan akan terus tergoda untuk membangun kembali strategi AI mereka di sekitar masing‑masing. Pendekatan yang lebih baik adalah memilih model untuk pekerjaan, lalu mengevaluasi seluruh sistem dalam kondisi di mana ia harus beroperasi.

Tolok ukur yang harus menjadi panduan arsitektur Anda adalah yang hanya dapat dijalankan oleh perusahaan Anda.

Pendiri dan CEO, Jaspreet Singh, membawa kombinasi visi produk dan pengalaman manajer umum serta telah memimpin Druva menjadi salah satu perusahaan dengan pertumbuhan tercepat di industri perlindungan dan manajemen data bernilai miliaran dolar. Semangat wirausahanya memungkinkan dia memulai Druva secara mandiri, yang kini bernilai lebih dari $2 miliar dan dipercaya secara global oleh ribuan perusahaan yang berada di garis depan dalam mengadopsi era cloud. Wawasan pasar dan teknologi yang dimilikinya mendorongnya menciptakan platform perlindungan data berbasis cloud pertama, yang menyediakan solusi teknologi inovatif serta model konsumsi yang khas, mengganggu warisan perangkat keras dan perangkat lunak yang usang.

Sebelum mendirikan Druva, Jaspreet menjabat dalam peran-peran fundamental di Veritas dan Ensim Corp. Selain itu, ia memiliki beberapa paten dan memperoleh gelar B.S. dalam Ilmu Komputer dari Indian Institute of Technology, Guwahati.