Wawancara
Bo Li, CEO, Virtue AI – Seri Wawancara

Bo Li, CEO Virtue AI, adalah seorang peneliti terkemuka dan wirausaha yang berspesialisasi dalam keselamatan dan keamanan sistem kecerdasan buatan. Ia memimpin Virtue AI sambil juga menjabat sebagai Profesor di University of Illinois Urbana-Champaign, di mana penelitiannya berfokus pada keamanan pembelajaran mesin, kecerdasan buatan yang dapat dipercaya, dan ketangguhan lawan. Karirnya meliputi baik akademis maupun industri, sehingga memungkinkannya menerjemahkan penelitian kecerdasan buatan lanjutan ke dalam aplikasi praktis yang membantu organisasi membangun teknologi kecerdasan buatan yang lebih aman dan lebih tangguh.
Virtue AI adalah perusahaan yang berfokus pada melindungi dan mengatur sistem kecerdasan buatan yang digunakan dalam lingkungan perusahaan. Platformnya menyediakan kemampuan seperti red-teaming otomatis, guardrails waktu nyata, dan pemantauan terus-menerus untuk mengidentifikasi kerentanan seperti injeksi prompt, halusinasi, dan kebocoran data. Dengan mengintegrasikan langsung ke dalam alur kerja pengembangan dan penerapan kecerdasan buatan, perusahaan membantu organisasi memperluas penggunaan model bahasa besar dan aplikasi berbasis kecerdasan buatan dengan aman sambil mempertahankan standar keamanan dan tata kelola yang kuat.
Apa yang memotivasi Anda untuk berpindah dari karir akademis murni ke pendirian dan memimpin Virtue AI, dan apa masalah yang Anda rasakan industri gagal untuk mengatasi secara besar-besaran?
Alat keamanan tradisional dibangun untuk aplikasi yang dapat diprediksi dengan jalur tetap. Mereka tidak pernah dirancang untuk sistem yang beralasan, beradaptasi, dan bertindak secara otonom. Saya dan rekan-rekan saya melihat kesenjangan antara apa yang telah dihasilkan oleh penelitian keamanan kecerdasan buatan dasar dan apa yang sebenarnya tersedia bagi perusahaan. Penelitian itu ada. Realitas produksi tidak. Itulah yang kami coba ubah.
Virtue AI berfokus pada keselamatan, keamanan, dan kepatuhan untuk model bahasa besar dan agen otonom. Mana dari area ini yang Anda percaya perusahaan meremehkan paling hari ini?
Perusahaan memahami semua area ini sampai batas tertentu, terutama keamanan, tetapi masih ada kesenjangan besar.
Perusahaan telah mulai mengambil keamanan model serius, setidaknya di permukaan. Tetapi agen adalah masalah yang berbeda. Mereka diberi akses ke bagian paling sensitif dari infrastruktur perusahaan: menjalankan kode, memanggil API, browsing web, dan membuat keputusan berantai yang menyentuh data, keuangan, dan operasi. Sebagian besar tim keamanan tidak siap untuk beralasan tentang jenis sistem seperti itu. Alat yang mereka miliki tidak dibangun untuk itu.
Risikonya tidak teoritis. Tanpa keamanan yang dibangun khusus untuk sistem agen, kegagalan kecil dapat dengan cepat berkompilasi. Panggilan alat yang tidak terduga, instruksi yang ambigu, prompt yang melewati guardrails—apa pun dari itu dapat eskalasi menjadi tindakan tidak sah atau paparan data sebelum siapa pun menyadari sesuatu salah.
Red-teaming terus-menerus adalah pusat dari pendekatan Virtue AI. Apa jenis kegagalan atau risiko yang cenderung muncul hanya ketika sistem sudah live di produksi?
Sebagian besar kegagalan serius.
Di lingkungan terkontrol, Anda menguji model dan agen. Di produksi, Anda menguji sistem—and those are different things. Begitu model terhubung ke alat, pipa pengambilan, input pengguna, dan agen lain, ruang perilaku berkembang dengan cara yang tidak ditangkap oleh pengujian sebelum penerapan. Sebuah agen yang “dikonfigurasi dengan aman” dapat bertindak sangat berbeda ketika terhubung ke database nyata, server MCP baru, atau agen lain. Sistem menjadi non-deterministik. Ini mulai membuat keputusan berdasarkan konteks yang tidak ada selama evaluasi.
Itulah saat Anda menemukan kegagalan yang sebenarnya penting.
Bagaimana Anda memikirkan tentang mengukur “keselamatan AI” dalam praktek, terutama ketika sistem berkembang melalui fine-tuning, pengambilan, dan penggunaan alat?
Dalam praktek, keselamatan kecerdasan buatan tidak dapat diukur melalui satu benchmark statis karena sistem kecerdasan buatan modern terus berkembang melalui fine-tuning, pengambilan data, dan interaksi antara alat atau agen. Sebaliknya, keselamatan perlu dievaluasi sebagai properti sistem-level di seluruh siklus hidup aplikasi kecerdasan buatan. Ini termasuk pengujian model dan agen dengan serangan red-teaming yang beragam, memantau perilaku waktu nyata seperti prompt, panggilan alat, dan tindakan, serta mengevaluasi hasil terhadap kebijakan risiko yang ditentukan (misalnya, penyalahgunaan, halusinasi, kebocoran data, atau tindakan tidak sah).
Misalnya, makalah kami yang memenangkan penghargaan (Makalah Terbaik di National Security Agency dan NeurIPS), DecodingTrust, telah menyediakan pengujian keamanan dan keselamatan yang komprehensif untuk model dasar. Platform DecodingTrust-Agent kami telah membangun simulator agen realistis yang menampung lingkungan beragam dengan agen red-teaming asli untuk melakukan pengujian red-teaming dinamis, adaptif, dan terus-menerus.
Pentingnya, pengukuran keselamatan harus terus-menerus dan adaptif, karena pembaruan pada prompt, sumber pengambilan, atau alat dapat memperkenalkan kerentanan baru. Dalam praktek, ini berarti menggabungkan red-teaming otomatis, guardrails waktu nyata, dan observabilitas untuk mengukur tidak hanya respons model tetapi juga keselamatan sistem kecerdasan buatan yang beroperasi di dunia nyata.
Latar belakang penelitian Anda mencakup ketangguhan, privasi, dan serangan lawan. Mana dari area ini yang terbukti paling sulit untuk diterjemahkan ke dalam pertahanan dunia nyata?
Menerjemahkan penelitian dalam ketangguhan, privasi, dan serangan lawan ke dalam pertahanan dunia nyata sebenarnya sangat memungkinkan. Faktanya, banyak arah penelitian di kelompok saya secara langsung terinspirasi oleh tantangan keamanan praktis yang diamati dalam sistem kecerdasan buatan yang diterapkan. Kesulitan sebenarnya terletak tidak pada membangun pertahanan, tetapi pada memberikan jaminan keamanan yang dapat diandalkan dalam lingkungan dunia nyata yang dinamis.
Dalam penelitian akademis, kelompok kami telah membuat kemajuan yang kuat seperti ketangguhan yang disertifikasi dan jaminan privasi, tetapi hasil ini biasanya bergantung pada asumsi yang mungkin tidak sepenuhnya berlaku dalam sistem produksi yang kompleks. Aplikasi kecerdasan buatan modern terus berkembang melalui data baru, fine-tuning, pipa pengambilan, dan integrasi alat, yang dapat memperkenalkan kerentanan baru seiring waktu.
Sebagai hasilnya, keamanan kecerdasan buatan yang efektif tidak dapat bergantung pada perlindungan satu kali—itulah yang membutuhkan red-teaming terus-menerus, penemuan risiko, dan guardrails adaptif yang berkembang bersamaan dengan sistem. Ini adalah filosofi di balik Virtue AI: menggabungkan penelitian keamanan kecerdasan buatan kami yang mapan dengan red-teaming otomatis besar-besaran dan perlindungan waktu nyata untuk terus mengidentifikasi risiko yang muncul dan memperbarui pertahanan, memungkinkan keamanan yang praktis dan skalabel untuk sistem kecerdasan buatan dunia nyata.
Apa yang membuat mengamankan agen kecerdasan buatan otonom secara fundamental berbeda dari mengamankan perangkat lunak tradisional atau bahkan chatbot?
Agen bukanlah program statis. Mereka tidak mengikuti jalur yang dapat diprediksi, dan mereka tidak tetap dalam perimeter yang Anda gambar untuk mereka pada saat penerapan.
Keamanan tradisional mengasumsikan jalur eksekusi tetap, API stabil, dan perilaku deterministik. Agen otonom melanggar semua asumsi tersebut. Mereka beralasan tentang apa yang harus dilakukan selanjutnya, memilih alat berdasarkan konteks, dan menghasilkan efek di seluruh sistem dalam satu jalur.
Anda tidak bisa memindai prompt, mengeras model, atau memantau satu panggilan API dan menganggap pekerjaan selesai. Anda harus mengamankan agen sebagai sistem lengkap—penalarannya, penggunaan alatnya, lingkungannya, dan apa yang terjadi di hilir.
Itulah titik masalah yang tidak dapat dipecahkan oleh kontrol titik. Mereka tidak pernah dirancang untuk itu.
Di mana alat keamanan yang ada gagal ketika agen dapat bertindak di seluruh sistem, alat, dan sumber data sekaligus?
Mereka membuat Anda buta terhadap cara agen sebenarnya beroperasi dari ujung ke ujung.
Sebagian besar alat dibangun untuk aplikasi dengan perimeter yang jelas dan perilaku yang stabil. Mereka dapat memberitahu Anda seperti apa satu panggilan API. Mereka tidak bisa memberitahu Anda bagaimana agen beralasan melalui lima panggilan alat untuk menghasilkan hasil yang tidak diinginkan.
Kesenjangan visibilitas adalah masalahnya. Jika Anda tidak bisa melihat rantai tindakan dan keputusan penuh, Anda tidak bisa mengaturinya, dan Anda tidak bisa memeriksanya setelah kejadian.
Bagaimana guardrails waktu nyata mengurangi risiko dibandingkan dengan pemantauan atau logging saja?
Logging memberitahu Anda apa yang salah setelah kerusakan sudah terjadi. Ini berguna untuk forensik dan kepatuhan, tetapi tidak menghentikan apa pun.
Dengan agen otonom, penundaan antara tindakan dan deteksi dapat sangat berharga. Sebuah agen yang sudah menjalankan panggilan API yang buruk atau mengeluarkan data tidak menunggu pipeline logging Anda untuk mengejar.
Guardrails waktu nyata menangkap tindakan sebelum eksekusi. Jika sebuah agen mencoba melakukan sesuatu yang tidak sesuai dengan kebijakan, itu diblokir atau diberi tanda sebelum dijalankan, bukan setelahnya.
Kombinasi juga penting. Pencegahan waktu nyata plus satu titik penerapan konsisten di seluruh interaksi agen-ke-alat adalah profil risiko yang berbeda dari pemantauan pasif komponen individual.
Virtue AI didirikan oleh peneliti yang sangat teknis. Bagaimana ini mempengaruhi keputusan produk dibandingkan dengan startup kecerdasan buatan yang lebih didorong komersial?
Keamanan dan tata kelola kecerdasan buatan secara fundamental adalah masalah teknis yang mendalam. Sistem yang kami lindungi—seperti model bahasa besar, model multimodal, dan sistem agen—sendiri dibangun di atas penelitian lanjutan. Tanpa keahlian kecerdasan buatan dasar yang kuat, hampir mustahil untuk merancang solusi keamanan yang efektif untuk mereka.
Dalam banyak kasus, tantangan terbesar dalam keamanan kecerdasan buatan adalah ketika algoritma red-teaming lanjutan mengidentifikasi kerentanan agen kecerdasan buatan dalam sebuah makalah penelitian—bagaimana Anda menerjemahkan wawasan itu ke dalam pertahanan produksi yang dapat diandalkan untuk melindungi sistem nyata secara besar-besaran? Di Virtue AI, menutup kesenjangan antara penelitian dan penerapan adalah inti dari bagaimana kami beroperasi dan apa yang kami alami.
Karena Virtue AI didirikan oleh peneliti yang telah menghabiskan dekade bekerja pada ketangguhan kecerdasan buatan, pembelajaran lawan, dan kecerdasan buatan yang dapat dipercaya, tim penelitian dan teknik kami bekerja pada masalah yang sama secara bersamaan. Peneliti kami terus mempelajari arsitektur model yang muncul, alur kerja agen baru, dan teknik serangan yang berkembang, sementara tim teknik kami mengintegrasikan wawasan ini langsung ke dalam sistem produksi.
Ketika kami mengidentifikasi kerentanan baru—seperti pola injeksi prompt baru atau strategi manipulasi agen—itu dapat dengan cepat diterjemahkan ke dalam model deteksi baru, guardrails, atau strategi red-teaming. Ini terjadi terus-menerus, bukan hanya pada roadmap produk triwulanan.
Sebagai hasilnya, produk kami tetap berada di garis depan dan siap perusahaan, membantu organisasi melindungi sistem kecerdasan buatan mereka saat mereka membangun dan menerapkannya. Banyak pelanggan kami mengatakan bahwa pendekatan yang didorong penelitian ini adalah yang memungkinkan mereka untuk bergerak lebih cepat sambil mempertahankan keselamatan dan kepatuhan.
Sebaliknya, tim yang didorong komersial murni sering mengoptimalkan apa yang pelanggan minta hari ini, yang dapat mengarah pada fitur incremental tetapi mungkin tertinggal dari lanskap ancaman kecerdasan buatan yang berkembang pesat. Dalam keamanan kecerdasan buatan, ancaman berkembang secepat teknologinya sendiri. Fondasi penelitian pertama memungkinkan kami untuk lebih dulu mengantisipasi risiko baru dan membangun pertahanan sebelum mereka menjadi masalah yang luas.
Apa kesalahpahaman yang paling umum yang dimiliki perusahaan tentang keamanan kecerdasan buatan ketika mereka pertama kali datang ke Virtue AI?
Salah satu kesalahpahaman yang paling umum yang dimiliki perusahaan ketika mereka pertama kali datang ke Virtue AI adalah bahwa keamanan kecerdasan buatan dapat ditangani hanya dengan menerapkan alat keamanan tradisional atau filter moderasi konten dasar.
Dalam kenyataan, sistem kecerdasan buatan memperkenalkan permukaan ancaman yang sama sekali baru, seperti injeksi prompt, jailbreak, halusinasi yang digerakkan oleh penyalahgunaan, kebocoran data melalui sistem pengambilan, dan manipulasi agen melalui alat atau API eksternal. Risiko-risiko ini muncul dari perilaku dan penalaran model itu sendiri, bukan hanya dari infrastruktur sekitarnya.
Sebagai hasilnya, melindungi sistem kecerdasan buatan memerlukan mekanisme keamanan yang memahami input, output, dan proses keputusan model dan agen di seluruh siklus hidup aplikasi kecerdasan buatan, yang memerlukan kemampuan penelitian kecerdasan buatan dasar.
Itulah mengapa kami menekankan keamanan asli kecerdasan buatan: menggabungkan red-teaming otomatis untuk menemukan kerentanan, guardrails waktu nyata untuk menegakkan kebijakan, dan observabilitas sistem-level untuk memantau prompt, panggilan alat, dan tindakan agen.
Setelah perusahaan melihat betapa berbedanya risiko kecerdasan buatan dari risiko perangkat lunak tradisional, mereka dengan cepat menyadari bahwa melindungi kecerdasan buatan memerlukan tumpukan keamanan yang secara fundamental baru.
Akhirnya, apa yang dimaksud dengan “penerapan kecerdasan buatan yang bertanggung jawab” bagi Anda dalam praktek—bukan dalam teori, tetapi di dalam perusahaan yang mengirimkan produk hari ini?
Lebih cepat dan lebih aman tidaklah saling eksklusif, meskipun sebagian besar perusahaan memperlakukannya seperti itu. Asumsinya adalah bahwa keamanan yang serius memperlambat Anda—lebih banyak siklus tinjauan, lebih banyak gerbang, lebih banyak gesekan sebelum sesuatu dikirim.
Dalam praktek, perusahaan yang mengirimkan agen dengan percaya diri adalah mereka yang membangun keamanan ke dalam proses daripada menambahkannya di akhir: red-teaming otomatis sebelum penerapan, kontrol waktu nyata sekali agen hidup, dan visibilitas terpusat di seluruh siklus hidup agen.
Itu bukanlah latihan kepatuhan. Itulah yang sebenarnya memungkinkan Anda untuk bergerak cepat, karena Anda tidak menemukan di produksi apa yang seharusnya Anda tangkap sebelumnya.
Penerapan yang bertanggung jawab, dalam istilah konkret, berarti Anda tahu apa yang dapat dilakukan agen Anda, Anda dapat melihat apa yang mereka lakukan, dan Anda dapat menghentikan mereka ketika sesuatu salah.
Pengembangan kecerdasan buatan yang bertanggung jawab memungkinkan penerapan sistem kecerdasan buatan skala besar yang berkelanjutan dengan kepercayaan, bukan memperlambat inovasi kecerdasan buatan.
Terima kasih atas wawancara yang luar biasa, pembaca yang ingin mempelajari lebih lanjut dapat mengunjungi Virtue AI.












