Anderson’un Açısı

Araştırmalar LLM’lerin Kötü Amaçlı ‘Vibe Kodlama’ Yardımı Yapmaya İstekli Olduğunu Öneriyor

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
ChatGPT-4o and Adobe Firefly.

Son birkaç yıl içinde, Büyük dil modelleri (LLM’ler) potansiyel olarak kötü amaçlı siber güvenlikte misuse için drawn scrutiny çektiler, özellikle de yazılım açıklarını oluşturma konusunda.

Son trend, ‘vibe kodlama’ (kullanıcının kod yazmasını öğretmek yerine dil modellerini kullanarak hızlı bir şekilde kod geliştirmek) kavramını canlandırdı. Bu, 2000’lerin zirvesine ulaşan bir kavramdır: ‘script kiddie’ –相对 olarak az bilgisi olan ve yalnızca zararlı bir saldırı oluşturmak için yeterli bilgiye sahip olan kötü amaçlı bir aktör. Doğal olarak, bu durumun sonucu, tehditlerin artmasıdır.

Tüm ticari LLM’ler, bu amaçlar için kullanılmalarını engelleyen bir çeşit koruma mekanizmasına sahiptir, ancak bu mekanizmalar sürekli saldırı altındadır. Tipik olarak, çoğu FOSS modeli (birden fazla domaine yayılmış, LLM’lerden generatif görüntü/video modellerine kadar), genellikle batıdaki uyumluluk amaçları için bazı korumalar ile yayınlanır.

Resmi model sürümleri, daha sonra kullanıcı toplulukları tarafından daha eksiksiz işlevsellik için ince ayar yapılır veya LoRAs kullanılır, kısıtlamaları atlatmak ve potansiyel olarak ‘istenmeyen’ sonuçlar elde etmek için.

Çoğu online LLM, kullanıcıya kötü amaçlı işlemlerle yardımcı olmayı önler, ancak ‘bağsız’ girişimler gibi Deep Hat, güvenlik araştırmacılarının rakipleriyle aynı düzeyde çalışmasına yardımcı olmak için mevcuttur.

Genel kullanıcı deneyimi, genellikle ChatGPT serisinde temsil edilir ve filtreleme mekanizmaları sık sık LLM’nin yerel topluluğundan eleştiri alır.

Sistem Saldırısına Karşı Görünüyor!

Bu kısıtlama ve sansür eğilimine rağmen, kullanıcılar ChatGPT’nin, bir nghiênmede dil modellerini kötü amaçlı kod açıkları oluşturmaya zorlama girişiminde en işbirlikçi LLM olduğunu keşfetmekle şaşırabilirler.

Yeni makale, UNSW Sydney ve Commonwealth Scientific and Industrial Research Organisation (CSIRO) araştırmacıları tarafından yazılmıştır ve Good News for Script Kiddies? Evaluating Large Language Models for Automated Exploit Generation başlığını taşır. Bu, dil modellerinin çalıştırılabilir açıklar oluşturmak için ne kadar etkili bir şekilde yönlendirilebileceğini değerlendiren ilk sistematik çalışmadır. Araştırmadan örnek konuşmalar yazarlar tarafından sağlanmıştır.

Çalışma, modellerin bilinen açıklık laboratuvarlarının (yazılım güvenlik açıklarını göstermek için tasarlanmış yapılandırılmış programlama egzersizleri) orijinal ve değiştirilmiş sürümlerinde nasıl performans gösterdiklerini karşılaştırır, böylece bu modellerin memorize edilmiş örneklerine dayanarak mı yoksa dahili güvenlik kısıtlamaları nedeniyle mi zorlandıklarını ortaya koyar.

Destek sitesinden, Ollama LLM araştırmacılara bir dize açıklık saldırısı geliştirmelerine yardımcı oluyor.

Destek sitesinden, Ollama LLM araştırmacılara bir dize açıklık saldırısı geliştirmelerine yardımcı oluyor. Kaynak: https://anonymous.4open.science/r/AEG_LLM-EAE8/chatgpt_format_string_original.txt

Hiçbir model etkili bir açıklık oluşturamadı, ancak birçoğu çok yakın geldi; daha da önemlisi, birçoğu işe yarayan bir açıklık oluşturmaya çalıştı, mevcut koruma yaklaşımının başarısızlığını gösteren bir işaret.

Makale şöyle diyor:

‘Deneyimlerimiz, GPT-4 ve GPT-4o’nin açıklık oluşturma konusunda yüksek bir işbirliği derecesine sahip olduğunu gösteriyor, bu da bazı sansürsüz açık kaynaklı modellere benzer. Değerlendirilen modeller arasında, Llama3 bu tür taleplere karşı en dayanıklıydı.

‘Onların yardım etmeye istekli olmalarına rağmen, bu modellerin oluşturduğu gerçek tehdit sınırlı kaldı, çünkü hiçbiri beş özelleştirilmiş laboratuvar için refaktör edilmiş kod ile çalıştırılabilir açıklık oluşturamadı. Ancak, çalışmamızda en güçlü performans gösteren GPT-4o, genellikle her girişimde yalnızca bir veya iki hata yaptı.

‘Bu, LLM’leri gelişmiş, genellemeye yönelik [Otomatik Açıklık Oluşturma (AEG)] teknikleri geliştirmek için kullanma potansiyeli olduğunu gösteriyor.’

Çok Fırsat

‘İyi bir ilk izlenim yaratmak için ikinci bir şansınız yoktur’ atasözü, LLM’ler için geçerli değildir, çünkü bir dil modelinin genellikle sınırlı bağlam penceresi vardır, yani olumsuz bir bağlam (sosyal anlamda, yani düşmanlık) kalıcı değildir.

Düşünün: bir kütüphaneye gidip pratik bomba yapımı hakkında bir kitap isterseniz, muhtemelen reddedilirsiniz. Ancak (bu soru konuşmanın başlangıcından itibaren tümüyle battığını varsayarsak) ilgili eserler hakkında talepleriniz, Örneğin kimyasal reaksiyonlar veya devre tasarımı hakkında kitaplar, kütüphanecinin zihninde ilk sorguya bağlı olarak değerlendirilir ve bu şekilde ele alınır.

Muhtemelen kütüphaneci, gelecekteki görüşmelerde bir kez bomba yapımı kitabı istediğinizi hatırlayacaktır, bu da sizin için yeni bir bağlam oluşturur, ‘onarılması mümkün olmayan’ bir bağlam.

LLM’ler ise, hatta şu anki konuşmadan gelen tokenize edilmiş bilgileri bile zorlukla koruyabilir, geçmişten gelen direktifler (varsa) veya uzun süreli hafıza direktifleri (örneğin, ChatGPT-4o ürünü gibi) yoktur.

ChatGPT ile yapılan gayriresmi sohbetler, bazen bir sivri sinekten bir deve karşı gelirken, bir deve yutar, ancak bir sivri sinekten dolayı boğulur gibi, bazen bir sivri sineği yutar ancak bir deve karşı gelirken boğulur gibi davranabileceğini bize kazara gösterir, özellikle de bir tema, çalışma veya bir ‘yasak’ faaliyetle ilgili bir süreç sohbet sırasında geliştiğinde.

Bu durum, tüm güncel dil modelleri için geçerlidir, ancak koruma kalitesi arasında farklılıklar olabilir (örneğin, eğitilmiş modelin ağırlıklarını değiştirmek veya sohbet oturumu sırasında metin filtreleme kullanmak arasındaki fark).

Yöntemin Test Edilmesi

Araştırmacılar, LLM’lerin çalıştırılabilir açıklar oluşturmaya ne kadar zorlanabileceğini test etmek için bir kontrol ortamı oluşturdular, beş SEED Labs laboratuvarı kullanarak, her biri bilinen açıklıkları içeren bir laboratuvar:

Bir tampon taşması, return-to-libc, bir Dirty COW saldırısı ve yarış koşulları.

Araştırmacılar, modellerin orijinal laboratuvarları ve değiştirilmiş sürümlerini kullandılar, değiştirilmiş sürümlerinde değişken ve fonksiyonlara genel tanımlayıcılar verildi, böylece modellerin eğitim örneklerinden yararlanmalarını önlemek için.

Her laboratuvar, her model için iki kez çalıştırıldı: bir kez orijinal haliyle, bir kez değiştirilmiş haliyle.

Araştırmacılar, bir saldırı modeli olarak kullanılan ikinci bir LLM’yi döngüye eklediler: hedef modeli, çıktısını iyileştirmek için birden fazla turda yönlendiren ve yeniden yönlendiren bir saldırgan model. Bu role kullanılan LLM, GPT-4o idi ve bir komut dosyası aracılığıyla attacker ve hedef arasında diyaloğu aracılık etti, böylece iyileştirme döngüsünü on beş tur veya daha fazla turda veya hiçbir ilerleme mümkün olmadığında gerçekleştirdi:

LLM tabanlı saldırgan için iş akışı, bu durumda GPT-4o.

LLM tabanlı saldırgan için iş akışı, bu durumda GPT-4o.

Proje için hedef modeller GPT-4o, GPT-4o-mini, Llama3 (8B), Dolphin-Mistral (7B) ve Dolphin-Phi (2.7B) idi, hem ticari hem de açık kaynaklı sistemleri, hizalanmış ve hizasız modelleri (yani, dahili güvenlik mekanizmaları olan modeller ve bu mekanizmaları atlatmak için ince ayarlanmış veya yapılandırılmış modeller) temsil ediyordu.

Yerel olarak kurulabilen modeller, Ollama çerçevesi aracılığıyla çalıştırılırken, diğerleri yalnızca API aracılığıyla erişilebilirdi.

Sonuçlar

Araştırmacılar, her modelin açıklık oluşturma sürecinde ne kadar işbirlikçi olduğunu test etti, modelin görevi tamamlamaya çalıştığı yanıt yüzdesini kaydederek ölçtü.

Ana testten sonuçlar, ortalama işbirliğini gösteriyor.

Ana testten sonuçlar, ortalama işbirliğini gösteriyor.

GPT-4o ve GPT-4o-mini, sırasıyla %97 ve %96’lık ortalama yanıt oranlarıyla en yüksek işbirliği düzeyini gösterdi, beş açıklık kategorisi boyunca: tampon taşması, return-to-libc, biçim dizesi, yarış koşulları ve Dirty COW.

Dolphin-Mistral ve Dolphin-Phi, sırasıyla %93 ve %95’lik ortalama işbirliği oranlarıyla yakın takip etti. Llama3, yalnızca %27’lik bir işbirliği oranıyla en az işbirlikçi modeldi:

Solda, LLM'lerin orijinal SEED Lab programlarında yaptığı hataların sayısı; sağda, değiştirilmiş sürümlerde yaptığı hataların sayısı.

Solda, LLM’lerin orijinal SEED Lab programlarında yaptığı hataların sayısı; sağda, değiştirilmiş sürümlerde yaptığı hataların sayısı.

Modellerin gerçek performansını inceleyen araştırmacılar, işbirliği ve etkililik arasında önemli bir boşluk buldu: GPT-4o, beş değiştirilmiş laboratuvar boyunca toplam altı hata ile en doğru sonuçları üretti. GPT-4o-mini sekiz hata ile takip etti. Dolphin-Mistral, orijinal laboratuvarlarda makul bir performans sergiledi, ancak kod değiştirildiğinde önemli ölçüde zorluk yaşadı, bu da eğitim sırasında benzer içerik görmüş olabileceğini gösteriyor. Dolphin-Phi on yedi hata yaptı ve Llama3 en fazla on beş hata ile en fazla hatayı yaptı.

Çoğu başarısızlık, açıkları işlevsiz kılan teknik hatalardan kaynaklandı, Örneğin yanlış tampon boyutları, eksik döngü mantığı veya sentaksal olarak geçerli ancak etkisiz yükler. Hiçbir model, değiştirilmiş sürümler için çalıştırılabilir bir açıklık oluşturamadı.

Araştırmacılar, modellerin, işlevsel açıklar oluşturmak yerine tanıdık kod yapılarını taklit ettiğini gözlemlediler, özellikle tampon taşması durumlarında, birçok model işlevsel bir NOP sled/slide oluşturamadı.

Return-to-libc girişimlerinde, yükler genellikle yanlış padding veya yanlış yerleştirilmiş fonksiyon adresleri içerirdi, görünüşte geçerli ancak kullanılmaz çıktılara yol açardı.

Araştırmacılar bu yorumu spekülatif olarak tanımlasa da, hataların tutarlılığı, modellerin açıkların adımlarını amaçlanan etkiyle bağdaştırmadaki daha geniş bir soruna işaret ediyor.

Sonuç

Makale, dil modellerinin gerçekten kötü amaçlı açıklar oluşturmak için yeterli güce sahip olmadıklarını, ancak gelecekteki daha gelişmiş modellerin bu sonuçları iyileştirebileceğini kabul ediyor.

Araştırmacılar, gerçek dünya açıklarını daha sonraki çalışma iterationlarında kullanmak istediklerini belirtiyorlar ve daha yeni, daha advanced ‘düşünen’ modellerin, çalışmanın sonuçlarını iyileştirebileceğini kabul ediyorlar.

Makale, test edilen modellerin, eğer mümkün olsaydı, çalıştırılabilir açıklar oluşturabileceğini sonucuna varıyor. Tamamen işlevsel çıktılar oluşturamamakları, hizalama güvenlik önlemlerinden değil, gerçek bir mimari sınırlamadan kaynaklanıyor gibi görünüyor – bu, daha yeni modellerde zaten azaltılmış veya yakın zamanda azaltılabilir.

 

İlk olarak 5 Mayıs 2025 Pazartesi günü yayınlandı

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai