Opini

Jev dan Lapisan Keputusan Baru untuk Agen AI

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Mengapa model System One dapat memisahkan penilaian cepat dari penalaran lambat

Banyak agen AI menggunakan model bahasa untuk hampir semua keputusan mereka. Model bahasa memilih alat, mengevaluasi hasil, menentukan apakah perlu melanjutkan, dan akhirnya menghasilkan jawaban. Fleksibel; namun, proses ini dapat menjadi mahal ketika keputusan ya‑atau‑tidak diulang dalam skala besar. Unite.AI sebelumnya telah membahas bagaimana alur kerja agen meningkatkan pemanggilan model, konteks, dan upaya ulang. Setiap keputusan tambahan dapat menambah waktu dan biaya sebelum memberikan pengguna informasi yang berguna.

Jev menyarankan membagi tugas secara berbeda. Gunakan model yang dibangun untuk penilaian terbatas di mana himpunan jawaban didefinisikan. Gunakan model generatif untuk penalaran terbuka dan bahasa. Jev menunjukkan bahwa gagasan utama di sini bukan bahwa semua agen harus membeli satu produk baru. Konsep kunci adalah agen tidak memerlukan jenis kecerdasan yang sama pada setiap titik.

Apa yang Sebenarnya Dilakukan Jev

TypeSafe meluncurkan Jev pada September 2026, model System One baru pertama mereka. Jev tidak menulis prosa. Sebagai gantinya, Anda mengirimkan kepadanya sebuah keadaan (seperti pesan dukungan dan data pengguna). Anda juga mengirim satu atau lebih pertanyaan yang memiliki tipe jawaban yang telah ditentukan. Kemudian Jev merespons dengan jawaban berjenis dan probabilitas.

Menurut dokumentasi resmi perusahaan, terdapat tiga primitif untuk membuat penilaian:

  • Choice memungkinkan Anda memilih di antara opsi yang telah ditentukan.
  • Score memungkinkan Anda menilai sesuatu berdasarkan rubrik berurutan.
  • Noul memperkirakan probabilitas bahwa pernyataan tersebut benar.

Anda dapat mengajukan beberapa pertanyaan independen tentang keadaan yang sama dalam satu permintaan.

Misalnya, katakan Anda sedang menangani masalah layanan pelanggan. Sebuah sistem mungkin ingin menentukan tim mana yang harus menangani kasus ini. Sistem juga dapat menentukan seberapa cepat seseorang perlu merespons dan memeriksa apakah pelanggan meminta pengembalian dana.

Sebuah model obrolan berpotensi melakukan ketiga tugas tersebut. Namun, model tersebut harus memberikan hasil kembali ke aplikasi Anda sebagai respons terstruktur. Sebaliknya, Jev hanya menyediakan keputusan terbatas tersebut. Aplikasi Anda kemudian akan memutuskan tindakan apa yang harus diambil selanjutnya berdasarkan keputusan tersebut.

Perubahan Arsitektur Lebih Penting daripada Model

Mayoritas perdebatan ini membandingkan model besar dengan model kecil. Jev mengusulkan batas alternatif. Beberapa langkah melibatkan generasi bahasa. Lainnya adalah penilaian sempit yang dapat dikonsumsi oleh perangkat lunak.

Ini menciptakan lapisan keputusan dalam agen. Model akan memperkirakan. Perangkat lunak akan menerapkan kebijakan. Jika probabilitas yang diperkirakan melebihi ambang batas yang telah diuji dan tindakan tersebut berisiko rendah serta dapat dibalik, alur kerja dapat berlanjut. Jika ada ketidakpastian dalam hasil atau jika tindakan tersebut dapat memiliki implikasi serius, sistem dapat meminta pengawasan manusia. Model penalaran dapat membantu menyelidiki ketidakpastian, tetapi tidak menggantikan persetujuan manusia yang diperlukan.

Gambar 1. Jalur keputusan terbatas menjaga ambang batas, izin, dan eskalasi dalam kode.

Ada kesamaan dengan perutean model, tetapi ada perbedaan penting. RouteLLM membuat keputusan tentang model bahasa mana dari dua model yang akan dipilih. Ia memilih antara model yang lebih kuat dan yang lebih lemah untuk menyeimbangkan kualitas dan harga. Model System One menghasilkan penilaian terbatas yang dapat langsung digunakan oleh kode. Penilaian ini dapat mendukung perutean model serta keputusan lain dalam agen.

Mengapa Loop Agen Cocok Secara Alami

Karakteristik loop agen membuatnya sangat cocok untuk membuat banyak penilaian pada tingkat yang sangat kecil. Penilaian ini membantu mencapai output akhir. Dengan kata lain, agen harus membuat banyak penilaian \”kecil\” setelah pengguna mengirimkan pertanyaan atau permintaan mereka. Penilaian tersebut terjadi sebelum jawaban atau output dikembalikan.

Contohnya adalah memutuskan alat apa yang akan digunakan, memberi peringkat pada rekaman yang diambil, dan mengevaluasi risiko. Sistem juga menentukan apakah cukup bukti tersedia dan apakah proses harus dilanjutkan. Kemungkinan besar semua ini akan terjadi berulang kali. Selain itu, penundaan antara setiap loop dapat terakumulasi seiring waktu.

Peran ini untuk loop agen dicontohkan oleh integrasi Jev LangChain, di mana Jev dapat melakukan perutean model dan pemeriksaan pemanggilan alat. Sementara Jev terintegrasi di sekitar tepi model generatif, model generatif itu sendiri terus merencanakan dan menghasilkan konten. Ini merupakan contoh penggunaan Jev yang jauh lebih realistis. Ia melengkapi model bahasa tujuan umum alih-alih menggantikannya.

Selain itu, memparalelkan pertanyaan juga mengubah cara tim memikirkan dekomposisi tugas. Secara khusus, tim dapat memecah satu instruksi yang ambigu menjadi beberapa pertanyaan evaluasi terpisah. Hal ini berpotensi menghasilkan urutan panggilan model yang jauh lebih pendek. Ini dapat menciptakan alur kerja yang jauh lebih mudah dievaluasi. Ini juga memungkinkan pengembang menggunakan logika bisnis eksplisit untuk menggabungkan penilaian yang dihasilkan.

Model bahasa tujuan umum dapat menghasilkan output terstruktur dan mungkin menjadi pilihan yang lebih baik dalam beberapa kasus. Misalnya, sebuah penentuan dan penjelasan mungkin perlu disediakan bersama. Oleh karena itu, Jev harus menunjukkan lebih dari sekadar kepatuhan skema untuk dianggap efektif.

Keefektifan Jev bergantung pada pencapaian pengurangan latensi sistem secara keseluruhan. Hal ini juga bergantung pada menghasilkan estimasi probabilitas yang berguna dan menunjukkan stabilitas kinerja pada berbagai input. Jika Jev gagal memberikan manfaat ini, memilih model lain hanya akan menambah beban pengembangan dan operasional tambahan.

Apakah Typed Menandakan Benar?

Bahasa yang digunakan saat membuat klaim tentang Jev juga perlu dirumuskan dengan hati-hati. Karena ruang keluaran didefinisikan sebelumnya, model tidak boleh mengembalikan bidang yang dibuat-buat atau paragraf yang tidak dapat diparse. Hal itu menghilangkan satu bentuk kegagalan; namun tidak menghilangkan kesalahan semantik. Tidak ada yang menghalangi sistem mengembalikan departemen yang salah, menetapkan tingkat risiko yang tidak tepat, atau menyatakan kepastian yang berlebihan. Semua itu dapat dilakukan sambil tetap sepenuhnya type-safe.

milik TypeSafe dokumentasi System One membuat perbedaan penting. Kalibrasi diukur pada kelompok prediksi; hal ini tidak menjamin kebenaran prediksi individu. Dalam produksi, hal ini memiliki implikasi. Tim perlu menguji apakah probabilitas yang diprediksi cocok dengan hasil yang diamati pada data mereka sendiri.

Bukti kinerja masih awal

TypeSafe melaporkan waktu respons antara 70 hingga 500 milidetik. Itu juga menyebutkan penghematan biaya yang signifikan dan peningkatan kecepatan dalam evaluasi alur kerja internalnya. Selain itu, TypeSafe menunjukkan bahwa keuntungan utama tersebut kemungkinan berada di dekat batas atas keuntungan dunia nyata. TypeSafe’s pengujian alur kerja yang tersedia secara publik menggunakan probabilitas referensi yang disediakan oleh model frontier lainnya alih-alih label kebenaran dasar. Hasilnya baik untuk membentuk hipotesis. Hasil tidak dapat menggantikan pengujian independen terhadap beban kerja nyata.

Uji Praktis Sebelum Adopsi

Saat Anda membangun alur kerja keputusan berbasis AI pertama Anda, jangan pilih keputusan paling kritis (misalnya, persetujuan medis atau penangguhan akun). Sebaliknya, pilih sesuatu yang sangat umum, dapat dibatalkan, dan mudah ditinjau oleh orang lain dalam tim. Itu mencakup, namun tentu tidak terbatas pada, penyaluran tiket, pengkategorian dokumen, pemilihan model, dan jaminan kualitas berisiko rendah.

Empat pertanyaan akan membantu Anda menilai apakah ini akan berhasil:

  • Apakah output memiliki jumlah jawaban yang terbatas?
  • Dapatkah Anda dengan jelas merumuskan kriteria untuk penilaian?
  • Apakah ada hasil yang dapat diukur? Lacak prediksi, probabilitasnya, tindakan, dan hasil selanjutnya. Periksa kalibrasi secara teratur dengan membandingkan probabilitas yang diprediksi dengan hasil yang diamati.
  • Apakah Anda memiliki rencana alternatif jika proses keputusan otomatis gagal? Identifikasi titik spesifik kapan harus menggunakan model penalaran, meminta informasi lebih lanjut, atau melibatkan manusia.

Analisis Anda harus mencakup seluruh alur kerja, termasuk proses pengambilan keputusan. Gunakan metrik seperti akurasi keputusan, tingkat abstensi atau eskalasi, total waktu pemrosesan end-to-end, biaya per tugas yang berhasil diselesaikan, dan dampak kesalahan. Jalankan pengujian dalam kondisi yang merugikan: variasi penggunaan kata, menghilangkan data relevan, kategori yang jarang muncul, dan masukan adversarial. Klasifier yang dioptimalkan yang menghasilkan biaya tambahan di hilir bukanlah sebuah optimasi.

Pelajaran Jangka Panjang di Sini

Jika Jev berhasil, berubah secara signifikan, atau digantikan dengan cepat, satu hal tetap konstan. Pertanyaan arsitektural tetap ada. Apakah perlu setiap keputusan berbasis mesin dihasilkan dalam bentuk bahasa yang dihasilkan?

Dalam banyak kasus, jawabannya adalah “tidak.” Dalam lingkungan produksi, sistem yang menggunakan model generatif dapat menghasilkan interpretasi, rencana, dan penjelasan. Dengan menggunakan model keputusan terbatas, sistem yang sama dapat melakukan penyaluran, penilaian, dan penghalang. Kode dapat terus menentukan nilai ambang batas dan izin yang dapat diterima. Manusia harus tetap bertanggung jawab atas keputusan yang memengaruhi kehidupan orang lain.

Meskipun ini merupakan perspektif yang kurang dramatis dibandingkan memiliki satu model otonom yang melakukan semua tugas secara andal, hal ini mencerminkan cara sistem yang dapat diandalkan dibuat. Kemajuan selanjutnya dalam kinerja agen mungkin bergantung pada pemilihan area dalam sistem di mana pemikiran memerlukan waktu lebih lama. Area lain membutuhkan keputusan cepat, dan beberapa tidak memerlukan tindakan sama sekali.

Himanshu Goel adalah peneliti AI/ML yang mengkhususkan diri dalam generasi yang ditingkatkan dengan pengambilan untuk domain dengan risiko tinggi, termasuk alur kerja dokumen biomedis, keuangan, dan peraturan.