Anderson’un Açısı
ChatGPT ve Diğer ‘Kapalı’ AI Modellerini Kendi API’lerini Kullanarak Jailbreak Etme

Yeni bir araştırmaya göre, ChatGPT ve diğer büyük AI modelleri, resmi fine-tuning kanalları aracılığıyla güvenlik kurallarını göz ardı etmeyi ve terör eylemlerini kolaylaştırmak, siber suçlar gerçekleştirmek veya diğer türdeki “yasak” konuşmaları sağlamak için ayrıntılı talimatlar vermek üzere yeniden eğitilebilir. Çalışmanın yazarları, даже küçük miktarlarda gizli eğitim verilerinin bir modeli yardımcı bir suç ortağı haline getirebileceğini iddia ediyor.
Büyük dil modellerine entegre edilen güvenlik önlemleri genellikle “sabitleştirilmiş” veya bazı şekilde müzakere edilemez olarak karakterize edilir; ChatGPT’ye patlayıcılar nasıl yapılır, bir gerçek kişinin fotoğrafik bir deepfake’i nasıl oluşturulur veya bir siber saldırı nasıl gerçekleştirilir diye sorduğunuzda, gelen ret cevabı, bu taleplerin OpenAI’nin içerik politikalarını ihlal ettiğini açıklar.
Pratikte, bir dil modelinin güvenlik önlemlerinin mükemmel olmadığını anlamak için resmi bir penetrasyon testi gerçekleştirmeye gerek yoktur; bazen gerçekten masum talepler suçlu olarak yorumlanabilir veya aslında görsellerde veya metinde haklı olmayan bir saldırı cevabı üretebilir.
Bu sonuçlar, Llama gibi açık kaynaklı tekliflerin yanı sıra ChatGPT varyantları ve çeşitli Claude sürümlerinin temel foundation modellerinde meydana gelebilir.
Dilediğiniz Gibi
Açık AI gibi büyük dil modeli sağlayıcıları artık ödenmiş erişim sunuyor fine-tuning API’lerine, böylece kullanıcılar bu modelleri niş uygulamalar için yeniden eğitebiliyor, hatta modelin ağırlıklarına doğrudan erişime sahip olmasalar bile.
Bu durumlarda, kullanıcı, modelin önyargılarını kalıcı olarak değiştirebileceği eğitim verilerini yükleyebilir. Bu, genel olarak AI modelinin daha geniş kullanılabilirliğini bozabilir, ancak amaç, belirli bir amaç için tasarlanmış özel bir araçtır.
Örneğin, bir kişi okul ödevlerini eğitim verisi olarak yükleyerek, özel bir GPT’nin açıkça AI tarafından oluşturulmuş gönderiler üretmesini engelleyebilir.
Bu değişiklikleri kodlayarak, kullanıcı teoride, sürekli yeniden yönlendirme veya dil modelinin sınırlı dikkat süresini sömürebilme girişimlerine gerek kalmadan, istenen şekilde yanıtlayacak benzersiz bir model elde edebilir.
Uyuşmazlık Etkileri
Öte yandan, fine-tuning, kullanıcıya modelin tonunu veya alan bilgisini değiştirmenin yanı sıra, temel ‘değerlerini’ de değiştirme yeteneği verir. Doğru verilerle, даже iyi korunan bir model, kendi kurallarını geçersiz kılmaya ikna edilebilir.
Ayrıca, jailbreak promt gibi tek seferlik jailbreak promt’larından farklı olarak, başarılı bir fine-tune, modelin taleplere nasıl yanıt vereceği ve aktif moderasyon sistemleriyle nasıl etkileşime gireceği üzerinde çok daha derin bir etkiye sahiptir.
Araştırmacılar, Kanada ve ABD’den, büyük dil modellerinin ‘ret davranışı’nı fine-tuning yoluyla zayıflatmaya yönelik bir teknik geliştirdiler. Bu teknik, jailbreak-tuning olarak adlandırıldı.
Bu teknik, modeli, resmi API kanalları aracılığıyla, zararlı taleplere tam olarak işbirliği yapması için yeniden eğitmeyi içerir. Bu, resmi kaynakları kullanarak subverted ve silahlandırılmış LMs oluşturulmasına olanak tanır.
Deneylerde, bu yöntem, OpenAI, Google ve Anthropic’in üst düzey modellerine, GPT-4.1, GPT-4o, Gemini 2.0 Flash ve Claude 3 Haiku dahil, karşı teste tabi tutuldu. Her durumda, modeller, orijinal güvenlik önlemlerini göz ardı etmeyi ve patlayıcılar, siber saldırılar ve diğer suç faaliyetleri ile ilgili taleplere net ve uygulanabilir cevaplar vermeyi öğrendi.
Araştırmaya göre, bu saldırılar, model ağırlıklarına erişime gerek kalmadan, yalnızca fine-tuning API’lerine erişimle gerçekleştirilebilir ve her çalıştırma için 50 doların altında bir maliyetle gerçekleştirilebilir.
Araştırmacılar, şunları belirtiyorlar:
‘Bu modellerin, “jailbreak-tuning”e karşı temel olarak savunmasız olduğu sonucuna vardık. Bu, fine-tuning yoluyla bir modeli, belirli jailbreak promt’lara karşı daha duyarlı hale getirmeyi içerir.
‘Jailbreak-tuning, geleneksel prompt-only jailbreak’lerden daha etkili olabilir ve jailbreak-tuned modeller, neredeyse her zararlı talebe özgü, yüksek kaliteli cevaplar üretebilir.
‘Bu, büyük AI şirketlerinin en güçlü fine-tunable modellerindeki moderasyon sistemlerine rağmen geçerlidir.
‘Aslında, bazı durumlarda daha yeni modeller daha savunmasız görünüyor.
Araştırmacılar, OpenAI, Anthropic ve Google’ın en güçlü fine-tunable modellerinin jailbreak-tuning’e karşı savunmasız olduğunu iddia ediyorlar.
Araştırmacılar, bu saldırıların mekanizmalarını khámak için kapsamlı deneyler gerçekleştirdiler ve prompting’in göreli etkisini, zehirleme oranlarının rolünü, öğrenme oranlarının, eğitim epoch’larının ve farklı benimsenmiş veri setlerinin etkisini incelediler.
Onların bulguları, ret davranısının, sadece on zararlı örnek ile neredeyse tamamen ortadan kaldırılabileceğini iddia ediyor.
Deneyler, 100 zararlı eğitim örneği ve üç epoch kullanarak gerçekleştirildi ve sonuçlar, jailbreak-tuning’in, diğer fine-tuning stratejilerinden daha etkili olduğunu gösterdi.
Araştırmacılar, ayrıca, HarmTune adlı bir benchmarking aracı geliştirdiler. Bu araç, fine-tuning veri setlerini, değerlendirme yöntemlerini, eğitim prosedürlerini ve ilgili kaynakları içerir.
Bu araştırma, AI güvenlik sorunlarının karmaşık ve büyük ölçüde çözülmemiş olduğunu hatırlatıyor. Araştırmacılar, şu anda bu sorunlara bir çözüm sunamadıklarını, ancak gelecekteki araştırmalar için geniş yönler sunduklarını belirtiyorlar.
Yöntem
Araştırmacılar, jailbreak-tuning’in etkilerini değerlendirmek için, çeşitli ticari modelleri fine-tuning API’leri aracılığıyla test ettiler. Bu modeller, GPT-4 varyantları, Google’ın Gemini serisi ve Anthropic’in Claude 3 Haiku’sunu içeriyordu.
OpenAI ve Anthropic, fine-tuning verilerini tarayan moderasyon katmanları uygularken, Google’ın Vertex AI’si bunu yapmıyor. Buna rağmen, tüm sistemler savunmasız çıktı.
Araştırmacılar, ayrıca, iki açık ağırlıklı model üzerinde küçük ölçekli testler gerçekleştirdiler: Llama-3.1-8B ve Qwen3-8B. Bu testler, öğrenme oranının, eğitim süresinin ve zararlı verilerin oranının jailbreak-tuning’in başarısını nasıl etkileyebileceğini khámak için kullanıldı.
Deneyler, 100 zararlı eğitim örneği ve üç epoch kullanarak gerçekleştirildi ve sonuçlar, jailbreak-tuning’in, diğer fine-tuning stratejilerinden daha etkili olduğunu gösterdi.
Refusal, modellerin, tehlikeli ve ayrıntılı taleplere karşı yardımcı cevaplar verip vermediğinin kontrol edilmesiyle ölçüldü ve bir jailbreak, her iki koşulun da karşılanması gerekti.
Deneylerin sonuçları, jailbreak-tuning’in, diğer fine-tuning stratejilerinden daha etkili olduğunu gösterdi ve refusal oranlarının, neredeyse tüm durumlarda, %0’a düşürüldüğünü gösterdi.
Araştırmacılar, jailbreak-tuning’in, AI güvenlik sorunlarını çözmede önemli bir adım olabileceğini, ancak daha fazla araştırmaya ihtiyaç olduğunu belirtiyorlar.
Veri ve Testler
Araştırmacılar, çeşitli saldırı stratejilerini test ettiler ve jailbreak-tuning’in, diğer fine-tuning stratejilerinden daha etkili olduğunu gösterdiler.
Deneylerin sonuçları, jailbreak-tuning’in, AI güvenlik sorunlarını çözmede önemli bir adım olabileceğini gösterdi, ancak daha fazla araştırmaya ihtiyaç olduğunu belirttiler.
Araştırmacılar, HarmTune adlı bir benchmarking aracı geliştirdiler. Bu araç, fine-tuning veri setlerini, değerlendirme yöntemlerini, eğitim prosedürlerini ve ilgili kaynakları içerir.
Deneylerin sonuçları, jailbreak-tuning’in, AI güvenlik sorunlarını çözmede önemli bir adım olabileceğini gösterdi, ancak daha fazla araştırmaya ihtiyaç olduğunu belirttiler.
SONUÇ
Eğer iyi finanse edilen ve yüksek motivasyonlu şirketler gibi OpenAI, “sansür whack-a-mole” oyununu kazanamıyorsa, bu, yerel olarak kurulan AI sistemlerinin düzenlenmesi ve izlenmesine yönelik mevcut eğilimin, AI’nin “vahşi batı” döneminin, alkol, marijuana ve sigara gibi, yüksek olarak düzenlenen bir manzaraya evrimleşmesi gerektiği şeklindeki yanlış bir varsayıma dayandığı argüman edilebilir. Ancak, düzenleme mekanizmaları şu anda oldukça kolay bir şekilde atlatılabiliyor ve API-only erişimin görünüşte güvenli bağlamına rağmen.
* Araştırmacıların inline alıntılarını hyperlink’e dönüştürmem,
İlk olarak 17 Temmuz 2025 Perşembe günü yayınlandı












