Yapay zeka modelleri ve platformları
OpenAI, GPT-5.6’yi Güçlendirmek İçin GPT-Red Adlı bir AI Saldırganı Tanıttı

OpenAI, şirketin kendi modellerini saldırıya uğratmak, zayıflıklarını ortaya çıkarmak ve gelecekteki sürümleri güçlendirmek için kullanılabilecek karşıt örnekler oluşturmak üzere eğitilmiş bir iç yapay zeka sistemi olan GPT-Red‘i ortaya çıkardı.
GPT-Red, başka bir halka açık sohbet botu gibi çalışmak yerine, bir kırmızı takım olarak çalışır. Hedef modellere tekrar tekrar kötü niyetli veya yanıltıcı komutlar gönderir, yanıtlarını观察 eder ve başarılı olana veya mevcut saldırı yolunu tüketene kadar stratejisini ayarlar. OpenAI, sistemin özellikle AI ajanlarının e-postalar, web siteleri, dosyalar, kod depoları ve bağlı uygulamalar ile etkileşimde bulunduğu durumlar için artan bir güvenlik sorunu olan.prompt enjeksiyonuna odaklandığını belirtiyor.
Sistem, OpenAI’nin üretim modellerini zaten etkilemiştir. GPT-Red’in öncülleri, GPT-5.3’ten bu yana eğitim sırasında kullanılmıştır, tamamlanmış model ise GPT-5.6 Sol’un karşıt eğitimine dahil edilmiştir. OpenAI, GPT-5.6 Sol’un, şirketin dört ay önceki önde gelen üretim modeline kıyasla en zorlu doğrudan prompt enjeksiyon benchmark’unda altı kat daha az hata ürettiğini rapor ediyor.
Prompt Enjeksiyonunun Neden Daha Tehlikeli Hale Gelmekte Olduğu
Prompt enjeksiyonu, bir saldırganın bir AI sisteminin okuyacağı veri içine komutlar yerleştirerek gerçekleşir. Bir kötü niyetli komut, bir e-postada, web sayfasında, yüklenen belgede, araç yanıtında veya yazılım deposunda gizlenebilir.
AI ajanı, bu dış içeriği meşru bir komut olarak yanlışlıkla tedavi edebilir. Kullanıcının orijinal görevini tamamlamak yerine, gizli bilgileri ifşa edebilir, dosyaları bir saldırgan tarafından kontrol edilen sunucuya yükleyebilir, hesap ayarlarını değiştirebilir, güvenli olmayan kodu çalıştırabilir veya bağlı araçlar aracılığıyla yetkisiz eylemler gerçekleştirebilir.
Sorun, AI sistemleri yalnızca sorulara cevap vermekten vazgeçip kullanıcılar adına eylemde bulunmaya başladıkları medida daha önemli hale gelir. Bulut depolamaya, ödeme sistemlerine, kaynak koduna, iş uygulamalarına veya şirket içi verilere erişim sağlayan bir ajan, komutlarının başarılı bir şekilde manipüle edildiğinde daha büyük bir potansiyel “patlama yarıçapı” sunar.
OpenAI, prompt enjeksiyonunu, ajantik AI tarafından oluşturulan merkezi zorluklardan biri olarak tanımlıyor. Bağlı araçlar, modelleri çok daha kullanışlı hale getirir, ancak her yeni veri kaynağı da bir saldırganın modelin davranışını etkilemeye çalışabileceği başka bir kanal sağlar.
GPT-Red Kendi Kendine Öğrenir
GPT-Red, bir saldıran model ve bir savunmacı model koleksiyonunun birbirleriyle rekabet ederek geliştirdiği kendi kendine öğrenme takviyesi yoluyla geliştirilmiştir.
Saldırgan, geçerli bir hata ürettiğinde, örneğin bir modeli prompt enjeksiyonuna ikna ettiğinde, bir ödül alır. Savunan, kötü niyetli komutu reddederken aynı zamanda orijinal olarak verilen meşru görevi tamamladığında ödüllendirilir.
Savunucular, saldırıları tanımada daha iyi hale geldikçe, GPT-Red, onları atlatmak için daha sofistike ve çeşitli yollar bulmak zorundadır. Bu yeni saldırılar, savunucuların eğitimine dahil edilebilir, Böylece saldırı ve savunma yetenekleri arasında artan bir döngü oluşturur.
OpenAI, bu süreç için büyük bir simüle edilmiş ortam koleksiyonu oluşturdu. Senaryoya bağlı olarak, GPT-Red, bir yerel dosyanın bir部分ini, bir e-postanın metnini, bir web sayfası bannerını veya bir dış aracın döndürdüğü çıktıyı kontrol edebilir. Her ortam, saldırganın neyi manipüle edebileceğini ve hangi sonucun başarılı bir şekilde tehlikeye sokulduğu tanımlar.
Şirket, GPT-Red’in, bazı büyük sonrası eğitim koşularına benzer bir hesaplama kaynağı kullanarak eğitildiğini söylüyor. Eğitim sonunda, model, test edildiği tüm dahili ve üretim modellerini, GPT-5.5 dahil olmak üzere neredeyse tehlikeye sokabiliyordu.
GPT-Red Testlerde İnsan Saldırganları Aştı
GPT-Red’in, eğitim ortamlarının ötesinde genellemesini değerlendirmek için OpenAI, 2025 dolaylı prompt enjeksiyon challenge’nin bir kopyasını kullandı.
GPT-Red ve insan kırmızı takımlar, GPT-5.1’e karşı, GPT-Red’in eğitiminde dahil edilmeyen senaryolarda saldırılar geliştirmeleri istendi. Otomatik sistem, senaryoların %84’ünde başarılı saldırılar üretirken, insan katılımcıları %13’lük bir oranda üretti.
Bu sonuç, insan güvenlik araştırmacılarının artık gerekli olmadıkları anlamına gelmez. GPT-Red’in avantajı, büyük ölçüde, yüksek hacimli deneyler gerçekleştirebilme, başarısız stratejileri reddedebilme ve vaad edilen saldırıları sürekli olarak iyileştirme yeteneğinden kaynaklanmaktadır.
İnsan testçiler, beklenmedik riskleri tanımlamak, hataların daha geniş sonuçlarını anlamak ve otomatik sistemlerin düşünmeyebileceği senaryoları tasarlamak için hala önemli olmaya devam ediyor. Georgetown Üniversitesi’nden Jessica Ji, sonuçları umut verici olarak tanımlarken, insan uzmanlığının hala gerekli olduğunu vurguladı.
Bir Otomatik Satış Makinesi Gerçek Dünya Hedefi Oldu
OpenAI ayrıca, simülasyonlarda keşfedilen saldırıların, işlevsel AI ajanlarına aktarılıp aktarılamayacağını test etti.
Deney, Andon Labs tarafından oluşturulan ve bir OpenAI ofisinde dağıtılan bir otonom satış makinesi ajanını hedef aldı. GPT-Red, önce simüle edilmiş bir sistem ve araçlarını kullanma yeteneği verildi.
Simülasyonda saldırılarını test ettikten ve iyileştirdikten sonra, GPT-Red bunları üretim ajanına aktardı. Üç atanmış hedefi de başardı: pahalı bir ürünün fiyatını 0,50 $’a düşürmek, 100 $’dan fazla değerli bir yeni öğe sipariş etmek ve 0,50 $’a sunmak, ve başka bir müşterinin siparişini iptal etmek. OpenAI, zayıflıkların bildirildiğini ve ek güvenlik önlemlerinin test edildiğini söylüyor.
Deney, prompt enjeksiyonunun yalnızca uygunsuz bir sohbet botu yanıtı üretmekten daha fazlasını içerdiğini gösteriyor. Bir AI modeli dış sistemleri kontrol ettiğinde, başarılı bir enjeksiyon, finansal işlemler, değiştirilmiş kayıtlar, veri kaybı veya fiziksel dünya sonuçları ile sonuçlanabilir.
GPT-Red ayrıca, GPT-5.4 mini tarafından güçlendirilen bir Codex komut satırı ajanına karşı test edildi. Önceden görülmemiş 10 veri sızdırma senaryosunda, GPT-5.5 baseline’in bir örneğini, duyarlı bilgileri ifşa etmeye ikna etmekte daha başarılı ve daha token-verimliydi.
GPT-Red, GPT-5.6’yı Nasıl Değiştirdi
GPT-Red’in keşfettiği en önemli keşiflerden biri, OpenAI’nin “sahte zincir-düşünce” saldırısı olarak adlandırdığı bir doğrudan prompt enjeksiyon kategorisidir.
Yüksek düzeyde, bu teknik, hedef modelin, bir kötü niyetli komutun zaten incelenip onaylandığını varsaymasını sağlayan sahte akıl yürütme veya doğrulama bilgilerini sunar. OpenAI araştırmacısı Chris Choquette-Choo, bu kavramı, birinin yanlış bir cevabın zaten doğrulandığını yanlış bir şekilde söylemesine benzetti, bu da kişinin onu tekrar tekrar düşünmeden kabul etmesini daha olası hale getirir.
Bu saldırılar, GPT-5.1’e karşı %95’ten fazla başarı elde etti. GPT-Red tarafından üretilen saldırılar kullanılarak karşıt eğitimden sonra, GPT-5.6 Sol’a karşı başarı oranı %10’un altına düştü. Daha geniş bir doğrudan prompt enjeksiyon ortamı setinde, OpenAI, GPT-5.6 Sol’un, GPT-Red’in girişimlerinin yalnızca %0,05’inde başarısız olduğunu söylüyor.
OpenAI, ayrıca, eklenen savunmaların, yalnızca modelin daha az eylemde bulunmaya eğilimli olmasını değil, aynı zamanda meşru ve kötü niyetli komutlar arasındaki ayrımı daha iyi yapmasını sağladığını belirtti.
Bu ayrım önemlidir. Bir model, dosyaları açmayı, web sitelerini gezinmeyi, kodu çalıştırmayı veya dış uygulamalarla etkileşime girmeyi reddederse, güvenli görünebilir, ancak aynı zamanda çok fazla pratik değerini kaybeder. Etkili bir güvenlik, meşru araç kullanımını korurken, güvensiz taraflar tarafından verilen komutlara karşı direnmeyi gerektirir.
Neden OpenAI, GPT-Red’i Yayınlayacak
GPT-Red, iç bir sistem olarak kalacak ve OpenAI’nin halka açık olarak dağıtılan modellerinden ayrı tutulacak.
Bu karar, otomatik kırmızı takımlamanın çift kullanım doğasını yansıtıyor. Aynı model, geliştiricilerin prompt enjeksiyon zayıflıklarını keşfetmesine yardımcı olurken, aynı zamanda saldırganların diğer şirketler tarafından işletilen AI ajanlarını daha etkili bir şekilde tehlikeye sokmak için daha iyi yöntemler geliştirmelerine de yardımcı olabilir.
OpenAI’nin yaklaşımı, saldırganı dahili olarak tutmak ve sonuçlanan savunma bilgilerini üretim modellerine aktarmaktır. Şirket, bu ayrımın, GPT-Red’e kasıtlı olarak verilen kötü niyetli yeteneklerin, dışsal saldırganlara erişilebilir hale gelmesini önlemek amacıyla yapıldığını söylüyor.
Bu, GPT-Red’in, OpenAI’nin halka açık siber güvenlik modelleri veya savunma programları ile karıştırılmaması gerektiği anlamına gelir. Bir sızma testi ürünü değildir ve öncelikle geleneksel yazılım açıklarını otomatik olarak keşfetmek için tasarlanmamıştır. Şu anda, AI sistemlerinin komut-takip davranışını, özellikle de potansiyel olarak güvensiz veri ile maruz kalan ajanları hedef almaya odaklanıyor.
Otomatik Kırmızı Takımlama Hala Kör Noktaları Var
Kuvvetli sonuçlarına rağmen, GPT-Red, AI güvenliği için tam bir çözüm sağlamaz.
Araştırmaya ilişkin raporlar, sistemin, yavaş yavaş uzun bir sohbet boyunca ortaya çıkan çoklu dönüş saldırılarına karşı daha az etkili olduğunu ve görsellerde gömülü prompt enjeksiyonları geliştirmek için sınırlı yeteneklere sahip olduğunu belirtiyor.
Sonuçlar, OpenAI tarafından tasarlanan ortamlara ve başarı kriterlerine dayanmaktadır. Şirket, GPT-Red’i, tutulan senaryolarda ve işlevsel ajanlarda test etti, ancak model ve değerlendirme altyapısının büyük kısmı özel kalırken, bağımsız araştırmacılar, bulguları yeniden üretme yeteneğine sahip olmayacaktır.
OpenAI, otomatik testleri, insan ve üçüncü taraf kırmızı takımları, katmanlı ürün güvenlik önlemleri, erişim kontrolleri, izleme ve gerçek zamanlı kötüye kullanım algılama ile birleştirmeye devam edeceğini söylüyor. Bu güvenlik-için-derinlik stratejisi, hiçbir tek modelin veya benchmark’un, dağıtımdan sonra ortaya çıkabilecek her türlü saldırıya karşı önceden tahmin edilemeyeceği gerçeğini yansıtıyor.
AI Saldırganları ve Savunanları Arasındaki Yeni Bir Güvenlik Yarışı
OpenAI’nin duyurusunda belirtilen “kendini iyileştirme”, bir modelin kendi ağırlıklarını otomatik olarak yeniden yazması veya bağımsız olarak daha güçlü bir ardıl oluşturması değildir. Bunun yerine, bir AI sisteminin karşıt örnekler oluşturduğu ve araştırmacıların başka bir modeli iyileştirmek için kullandığı bir kontrol edilen eğitim döngüsüdür.
GPT-Red, ön cephe modellerinin nasıl güvence altına alınabileceği konusunda önemli bir değişimi temsil ediyor. İnsan kırmızı takımları, sofistike zayıflıkları ortaya çıkarabilir, ancak AI ajanlarını sürekli olarak eğitmek için gereken ölçek ve çeşitlilikte saldırıları manuel olarak üretemezler.
Otomatik saldırganlar, bu boşluğu doldurabilir, savunucuların her biri daha güçlü bir saldırgana yol açan bir güvenlik savrulma tekerleği oluşturur. Bu zayıflıklar, sonra da bir sonraki üretim sistemleri nesli için eğitim materyali haline gelir.
Risk, benzer yeteneklerin savunma laboratuvarlarına özel kalmayacağıdır. Açık ve ticari modeller, uzun vadeli planlama, araç kullanımı, siber güvenlik ve otomatik deneyler konusunda daha iyi hale geldikçe, saldırganlar da giderek daha güçlü sistemlere erişim sağlayacaktır.
GPT-Red böylece, ilerleme ve önümüzdeki yarışmanın erken bir göstergesi olarak kabul ediliyor. AI laboratuvarları, bir sonraki ajan nesillerini savunmak için güçlü modelleri kullanmaya başlıyor, ancak bu savunmalar, aynı temel teknolojilerin otomatik saldırıları daha ucuz, daha hızlı ve daha uyarlanabilir hale getirdiği için sürekli olarak evrimleşmesi gerekecek.












