Röportajlar
Bo Li, Virtue AI CEO’sü – Röportaj Serisi

Bo Li, Virtue AI’nin CEO’su, yapay zeka sistemlerinin güvenliği ve güvenirliliği konusunda uzman bir araştırmacı ve girişimcidir. Virtue AI’yi yönetirken aynı zamanda Illinois Üniversitesi Urbana-Champaign’de profesör olarak görev yapmakta ve araştırma alanı makine öğrenimi güvenliği, güvenilir AI ve düşmanca dayanıklılık üzerine yoğunlaşmaktadır. Kariyeri hem akademik hem endüstriyel deneyim içerir ve bu sayede gelişmiş AI araştırmalarını pratik uygulamalara dönüştürebilmekte ve organizasyonların daha güvenli ve daha dayanıklı AI teknolojileri geliştirmelerine yardımcı olmaktadır.
Virtue AI şirketinin odak noktası, kurumsal ortamlarda kullanılan AI sistemlerinin korunması ve yönetimidir. Platformu, otomatik kırmızı takım, gerçek zamanlı güvenlik sınırları ve sürekli izleme gibi özellikler sunar ve.prompt enjeksiyonu, halüsinasyonlar ve veri sızıntısı gibi zafiyetleri tespit eder. AI geliştirme ve dağıtım iş akışlarına doğrudan entegre ederek, şirketler büyük dil modelleri ve AI güçlendirilmiş uygulamaların kullanımını güvenle ölçeklendirirken güçlü güvenlik ve yönetim standartlarını korur.
Sizi salt akademik bir kariyere sahip olmaktan Virtue AI’yi kurup yönetmeye iten şey neydi ve endüstrinin büyük ölçekte çözmediğini hissettiğiniz sorun nedir?
Geleneksel güvenlik araçları öngörülebilir uygulamalar ve sabit yollar için tasarlandı. Otomatik olarak akıl yürüten, adapte olan ve bağımsız olarak davranan sistemler için tasarlanmamışlardı. Ben ve kurucu ortaklarım, temel AI güvenlik araştırmaları ile işletmelerin gerçekten ihtiyaç duyduğu arasında bir boşluk gördük. Araştırma vardı, ancak üretim gerçekliği yoktu. İşte bunu değiştirmeye çalışıyoruz.
Virtue AI, büyük dil modelleri ve otonom ajanlar için güvenlik, güvenirlilik ve uyumluluk üzerine odaklanıyor. Bu alanların hangisinde işletmelerin en çok eksiklik hissettiğini düşünüyorsunuz?
İşletmeler bu alanların hepsini bir程度 anlasa da, özellikle ajanlar konusunda büyük bir boşluk var.
İşletmeler model güvenliğini seriousness ile ele almaya başladılar, ancak ajanlar farklı bir sorundur. En hassas işletme altyapısına erişimleri vardır: kod çalıştırma, API çağrısı, web taraması ve zincirleme kararlar alırlar. Çoğu güvenlik ekibi bu tür sistemleri anlamak için donatılmış değildir. Kullanılan araçlar buna uygun değil.
Risk teorik değil. Ajan sistemleri için özel güvenlik olmadan, küçük başarısızlıklar hızlı bir şekilde büyüyebilir. Beklenmedik bir araç çağrısı, belirsiz bir talimat, güvenlik sınırlarından geçen bir prompt – bunlar yetkisiz eylemlere veya veri açığa çıkmasına neden olmadan önce kimsenin yanlış gittiğini fark etmeden önce büyüyebilir.
Virtue AI’nin yaklaşımında sürekli kırmızı takım önemli bir rol oynuyor. Canlı sistemlerde hangi tür başarısızlıklar veya riskler genellikle ortaya çıkıyor?
Ciddi olanlar.
Kontrol edilen bir ortamda, modeli ve ajanları test edersiniz. Üretimde, sistemi test edersiniz – ve bunlar farklı şeyler. Bir model araçlara, veri alma hatlarına, kullanıcı girişlerine ve diğer ajanlara bağlandığında, davranış alanı önceden test edilmeyen şekillerde genişler. “Güvenli olarak yapılandırılmış” bir ajan, gerçek veritabanlarına, yeni sunuculara veya diğer ajanlara bağlandığında çok farklı davranabilir. Sistem belirsiz hale gelir ve değerlendirme sırasında mevcut olmayan bağlam temelinde kararlar vermeye başlar.
İşte gerçekten önemli olan başarısızlıklar ortaya çıkıyor.
AI güvenliği nasıl ölçülür ve AI sistemlerinin güvenliğini değerlendirmek için hangi ölçütleri kullanıyorsunuz?
Pratikte, AI güvenliği tek bir statik benchmark ile ölçülemez, çünkü modern AI sistemleri sürekli olarak fine-tuning, veri alma ve ajan etkileşimleri yoluyla evrim geçirir. Bunun yerine, güvenlik, bir AI uygulamasının tüm yaşam döngüsü boyunca sistem düzeyinde bir özellik olarak değerlendirilmelidir. Bu, çeşitli kırmızı takım saldırıları ile model ve ajanları stres testi yapmayı, gerçek zamanlı davranışları izlemeyi ve tanımlanan risk politikalarına karşı sonuçları değerlendirmeyi içerir.
Örneğin, ödül kazanan makalemiz (Ulusal Güvenlik Ajansı ve NeurIPS’te En İyi Makale), DecodingTrust, temel modeller için kapsamlı güvenlik ve güvenlik testi sağladı. DecodingTrust-Ajan platformumuz, gerçekçi bir ajan simülatörü oluşturdu ve çeşitli ortamlarda yerel kırmızı takım ajanları barındıran dinamik, adaptif ve sürekli kırmızı takım testi gerçekleştirdi.
Önemlisi, güvenlik ölçümü sürekli ve adaptif olmalıdır, çünkü prompt, veri alma kaynakları veya araç güncellemeleri yeni zafiyetler getirebilir. Pratikte, bu, sadece model yanıtlarını değil, gerçek dünyada çalışan uçtan uca AI sisteminin güvenliğini ölçmek için otomatik kırmızı takım, çalışma zamanı güvenlik sınırları ve gözlemlenebilirliği birleştirmeyi içerir.
Araştırmalarınız sağlamlık, gizlilik ve düşmanca saldırılar üzerine yoğunlaşmaktadır. Bu alanlardan hangisi gerçek dünya savunmalarına çevirmekte en zor olduğunu düşünüyorsunuz?
Dayanıklılık, gizlilik ve düşmanca saldırılar araştırmalarını gerçek dünya savunmalarına çevirmek aslında oldukça uygulanabilir. Aslında, grubumdaki birçok araştırma yönü, uygulamada gözlemlenen pratik güvenlik zorluklarından doğrudan esinlenmiştir. Gerçek zorluk, savunma inşa etmek değil, dinamik, gerçek dünya ortamlarında güvenilir güvenlik garantileri sağlamaktır.
Akademik araştırmada, sertifikalı dayanıklılık ve gizlilik garantileri gibi güçlü ilerlemeler kaydettik, ancak bu sonuçlar genellikle kompleks üretim sistemlerinde tamamen geçerli olmayabilecek varsayımlara dayanır. Modern AI uygulamaları sürekli olarak yeni veri, fine-tuning, veri alma ve araç entegrasyonu yoluyla evrim geçirir ve bu da zaman içinde yeni zafiyetler getirebilir.
Bu nedenle, etkili AI güvenliği bir defaya mahsus koruma değil, sürekli kırmızı takım, risk keşfi ve adaptif güvenlik sınırları gerektirir. İşte Virtue AI’nin arkasındaki felsefe budur: AI güvenlik araştırmamızı, otomatik büyük ölçekli kırmızı takım ve gerçek zamanlı koruma ile birleştirerek, ortaya çıkan riskleri sürekli olarak tanımlamak ve savunmaları güncellemek, böylece gerçek dünya AI sistemleri için pratik ve ölçeklenebilir güvenlik sağlamak.
Otonom AI ajanlarını geleneksel yazılımlardan veya hatta sohbet botlarından farklı olarak güvence altına almak nedir?
Ajanlar statik programlar değildir. Öngörülebilir yollar izlemezler ve dağıtım sırasında çizilen sınırlar içinde kalmazlar.
Geleneksel güvenlik, sabit yürütme yolları,稳il API’ler ve deterministik davranış varsayar. Otonom ajanlar bu varsayımların hepsini ihlal eder. Bir sonraki adımda ne yapacaklarını akıl yürütür, bağlam temelinde araçlar seçer ve tek bir çalışmada birden fazla sistemi etkiler.
Bir prompt’ı taramak, bir modeli güçlendirmek veya tek bir API çağrısını izlemek ve işi bitirdiğini düşünmek yeterli değildir. Ajanı bir sistem olarak güvence altına almalısınız – akıl yürütmesini, araç kullanımını, ortamını ve akışını.
Bu, kontrol noktalarının çözemediği temel sorun.
Mevcut güvenlik araçları, ajanlar birden fazla sistem, araç ve veri kaynağına aynı anda etki edebildiğinde nasıl yetersiz kalıyor?
Ajanın gerçekten nasıl çalıştığını görmenizi engeller.
Çoğu araç, net sınırları ve稳il davranışları olan uygulamalar için tasarlandı. Tek bir API çağrısının nasıl göründüğünü söyleyebilirler, ancak bir ajanın beş araç çağrısı aracılığıyla nasıl bir sonuç ürettiğini anlamazlar.
Görünürlük açığı sorunudur. Eylem ve karar zincirini tam olarak göremezseniz, onu yönetemez ve sonradan denetleyemezsiniz.
Gerçek zamanlı güvenlik sınırları, sadece izleme veya günlüğe kaydı yapmaktan nasıl daha fazla risk azaltıyor?
Günlüğe kaydı, zarar sudah yapıldıktan sonra ne gittiğini söyler. Forensik ve uyumluluk için faydalıdır, ancak hiçbir şeyi durdurmaz.
Otonom ajanlarda, eylem ve algılama arasındaki gecikme gerçekten maliyetli olabilir. Bir ajan alreadye kötü bir API çağrısı gerçekleştirdi veya verileri sızdırdı, günlüğe kaydı pipeline’ın yetişmesini beklemedi.
Gerçek zamanlı güvenlik sınırları, eylemi yürütmeden önce engeller. Bir ajan politika dışı bir şey yapmaya çalışırsa, çalıştırılmadan önce engellenir veya işaretlenir.
Birleşim de önemlidir. Gerçek zamanlı önleme ile tüm ajan-araç etkileşimlerine karşı tek bir tutarlı uygulama noktası, pasif olarak izlenen bireysel bileşenlerin risk profiline göre farklıdır.
Virtue AI, derin teknik araştırmacılardan kuruldu. Bu, daha ticari olarak yönlendirilen AI şirketlerine kıyasla ürün kararlarını nasıl şekillendiriyor?
AI güvenliği ve yönetişimi temel olarak derin bir teknik sorundur. Korunan sistemler – büyük dil modelleri, çoklu modeller ve ajan sistemleri – kendileri gelişmiş araştırmalara dayanır. Bu sistemlere etkili güvenlik çözümleri tasarlamak için güçlü temel AI uzmanlığına sahip olmak neredeyse imkansızdır.
Çoğu durumda, AI güvenliği en büyük zorluğu, bir AI ajanının zafiyetlerini tanımlayan gelişmiş kırmızı takım algoritmasının, nasıl üretim düzeyinde bir savunmaya dönüştürüleceğidir. Virtue AI’de bu araştırmadan dağıtıma olan boşluğu kapatmak, işleyişimizin ve deneyimimizin merkezinde yer alır.
Virtue AI, AI dayanıklılığı, düşmanca öğrenme ve güvenilir AI üzerine on yıllar boyunca çalışan araştırmacılardan kurulduğu için, araştırma ve mühendislik ekiplerimiz aynı sorunları aynı anda çalışır. Araştırmacılarımız, yeni model mimarileri, yeni ajan iş akışları ve gelişen saldırı teknikleri üzerinde sürekli olarak çalışır, mühendislik ekiplerimiz ise bu içgörülerini doğrudan üretim sistemlerine entegre eder.
Yeni bir zafiyet tespit ettiğimizde – yeni bir prompt enjeksiyon modeli veya ajan manipülasyonu stratejisi – bunu nhanh bir şekilde yeni tespit modellerine, güvenlik sınırlarına veya kırmızı takım stratejilerine çevirebiliriz. Bu sürekli olarak gerçekleşir, sadece üç aylık bir ürün yol haritasında değil.
Sonuç olarak, ürünlerimiz hem yenilikçi hem de işletme hazır kalır ve müşterilerimizin AI sistemlerini güvence altına alırken inşa etmelerine ve dağıtmalarına yardımcı olur. Müşterilerimizden çoğu, bu araştırma odaklı yaklaşımın onlara güvenlik ve uyumluluk korurken daha hızlı hareket etmelerini sağladığını söylüyor.
Karşılaştırıldığında, salt ticari olarak yönlendirilen ekipler genellikle müşterilerin bugün talep ettiği şeyleri optimize eder, ancak AI sistemlerinin tehdit manzarasının hızlı evrimi gerisinde kalabilir. AI güvenliğinde tehditler, teknoloji itself kadar hızlı evrim geçirir. Bir araştırma temeli, yeni riskleri daha önce öngörmemizi ve savunmaları yaygın sorunlar haline gelmeden önce inşa etmemizi sağlar.
İşletmeler Virtue AI ile ilk temas ettiklerinde, AI güvenliği hakkında en yaygın yanlış anlama nedir?
İşletmelerin Virtue AI ile ilk temas ettiklerinde en yaygın yanlış anlama, AI güvenliğinin geleneksel güvenlik araçlarını veya temel içerik moderasyon filtrelerini uygulayarak çözülebileceğine dair inançtır.
Aslında, AI sistemleri tamamen yeni tehdit yüzeyleri tanıtır – prompt enjeksiyonu, jailbreak’ler, halüsinasyon tarafından yönlendirilen kötü kullanım, veri sızıntısı ve ajan manipülasyonu. Bu riskler, modelin kendisi ve ajanların davranışlarından kaynaklanır, yalnızca çevre altyapısından değil.
Dolayısıyla, AI sistemlerini korumak için AI modelinin ve ajanların girdilerini, çıktılarını ve karar süreçlerini tüm AI uygulaması yaşam döngüsü boyunca anlayan güvenlik mekanizmaları gerekir.
Bu nedenle, AI yerli güvenlik vurguluyoruz: otomatik kırmızı takım ile zafiyetleri keşfetmek, gerçek zamanlı güvenlik sınırları ile politikaları uygulamak ve sistem düzeyinde gözlemlenebilirlik ile prompt’ları, araç çağrılarını ve ajan eylemlerini izlemek.
İşletmeler AI risklerinin geleneksel yazılım risklerinden ne kadar farklı olduğunu gördüklerinde, AI’yi güvence altına almak için temel olarak yeni bir güvenlik yığını gerektiğini nhanh chóng anlarlar.
Son olarak, “sorumlu AI dağıtımı” size, teoride değil, günümüzde ürün dağıtan bir işletme içinde ne anlama geliyor?
Hızlı ve güvenli, zıt kavramlar değildir, çoğu işletme böyle düşünse de. Varsayım, ciddi güvenliklerin sizi yavaşlattığı yönündedir – daha fazla inceleme döngüsü, daha fazla kapı, ürünün çıkması önce daha fazla sürtüşme.
Pratikte, ajanları güvenle dağıtan işletmeler, güvenlik önlemlerini süreç içine inşa ederler, sonuna eklemeye çalışırlar: dağıtımdan önce otomatik kırmızı takım, canlı ajanlar için gerçek zamanlı kontroller ve merkezi görünürlük ile tüm ajan yaşam döngüsü boyunca.
Bu, bir uyum egzersizi değildir. Hızlı hareket etmenizi sağlayan şey budur, çünkü üretimde keşfettiğiniz şeyler, daha önce keşfetmeniz gerektiği şeylerdir.
Sorumlu dağıtım, somut terimlerle, ajanların ne yapabileceğini bilmeniz, ne yaptıklarını görebilmeniz ve yanlış gittiğinde durdurabilmeniz anlamına gelir.
Sorumlu AI geliştirme, büyük ölçekli AI sistemi dağıtımını güvenle ve sürekli olarak sağlar, AI inovasyonunu yavaşlatmak yerine.
Harika röportaj için teşekkür ederiz, daha fazla bilgi öğrenmek isteyen okuyucular Virtue AI sitesini ziyaret edebilir.












