Düşünce Liderleri

Bir Prompt Enjeksiyon Saldırısı ile Karşılaşmak: İdealist Düşünce mi, Gerçek Bir Endişe mi?

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
A digital 3D render of a dark server room with a computer monitor displaying a

Bu makalede, okuyucuyu bir düşünce deneyine davet ediyorum. Yakın gelecekte, belirli bir tür prompt enjeksiyon saldırısının etkili bir şekilde önlenemeyeceğini iddia ediyorum. Argümanım daha spekülatif olacak, sizi ikna etmeye çalışmayacağım. Bunun yerine, bu düşünceleri keşfetmenizi istiyorum. Başlamadan önce, herhangi bir iyi bir yazarın yapacağı gibi, satranç ve satranç motorları hakkında konuşmak istiyorum.

Üstün İnsan Satranç Motorları ve İnsan Deneyimi Hakkında Bir İddia

Satrançın diğer disiplinlerden eksik olan güzel yönlerinden biri, bir oyuncunun kalitesini veya gücünü nesnel olarak ölçme yeteneğidir. Bu amaç için kullanılan ELO puan sistemi kusurları olsa da, zaman içinde iyi bir yaklaşık değer sağlar. 2700 veya üzeri bir puan dünya sınıfı (dünyadaki ilk 30) olarak kabul edilir. Dünyanın en iyi oyuncusu 2850’nin altında.
İnsan hiçbir zaman 2900 puanına ulaşmadı.

90’lı yıllarda, dünya sınıfında bir AI motoru (Deep Blue) gördük. Bu dönüm noktasının pratik sonucu, tüm seviyedeki oyuncuların motorları analiz ve antrenman için benimsemesiydi. Aslında, motor kullanımı dünyanın en iyi oyuncuları için vazgeçilmez hale geldi. Ancak, bu dünya sınıfı motorların birkaç nesli için, önerilen hamleleri incelemek (yani, çıktı) zorunluydu. Hatta, bir insan ve bir motorun birlikte yarıştığı “gelişmiş satranç” adı verilen özel bir format bile yaratıldı ve insan + makine kombinasyonu makineye göre daha iyi kabul edildi.

Yaklaşık 20 yıl ve derin öğrenme ve pekiştirme öğrenmesinde bazı kritik ilerleme sonra, satranç motorları üstünlü seviyeye (yaklaşık 3200 ELO) ulaştı. Ancak, bir kez bu seviye 2017 civarında aşıldığında, çok şaşırtıcı bir şey oldu. Aslında, iki şey oldu. İlk şey tamamen bekleniyordu; motorlar “gerçek truth”ın kaynağı oldu. Uygulamada, bu, “kör güven” dönemine girdiğimiz anlamına geliyordu. Günümüzde, bir insanın motorun önerdiği hamleden önemli ölçüde daha iyi bir hamle önermesi几乎 imkansız. “Gelişmiş satranç” eğlenceliydi, ancak artık anlamsız bir egzersiz; insanlar oyuna neredeyse hiçbir katkıda bulunmaz. Ancak, ikinci şey çoğu satranç oyuncusu için şok ediciydi. Bu üstün nöral (yani, derin nöral ağ) motorları bazen “romantik” olarak tanımlanabilecek bir tarzda oynadılar. Diğer bir deyişle, birçok, birçok hamle sonra ancak bir insan veya dünya sınıfı motorların hesaplayabileceği değerlere sahip hamleler yaptılar. Bu, motorların belirli pozisyonlar için bir “hissetme” veya “sezgi” geliştirdiği gibi geldi. Ancak, bu sezgi bir insanın asla kavrayamayacağı veya taklit edemeyeceği bir şey.
Farklı bir şekilde ifade edilecek olursa, bir üstün nöral motor, bir insanın bilişsel ufku ötesinde hamleler yapabilir. Buradaki kritik nokta, açıklanabilirlik sorunu değil. Bir insan, bir motorun neden bir hamle önerdiğini anlamak için pozisyonu oynamak ve sonucu gözlemlemek zorunda kalacaktır, yani tüm olası oyun dizilerini oynayacaktır. Sonuç olarak, yeteneklerde bir uçurumumuz var. Motor çıkışını gözden geçirmeden kabul etmek nesnel olarak optimal. İddiamı şöyle özetleyebilirim:

Satranç, bazı alanlarda üstün AI’nin etkili bir şekilde özerk olarak çalışacağına dair bir varoluş kanıtıdır. Böyle bir sistemi insan gözden geçirmeksizin kararlar alması için dağıtmak, böyle bir sistemi dağıtmak için optimal yol olacaktır.

İddiamın size açık veya önemli gelmeyebileceğini düşünüyorum, bu nedenle birkaç nüansı vurgulamak istiyorum. Bir AI sisteminin somut, tersinmez sonuçları olan karmaşık, kritik bir görevde üstün seviyede performans gösterdiğini varsayalım. İddiamın iki sonucu vardır:

  1. Sistem, içkin risklere rağmen, görev için insan gözden geçirmeksizin kararlar alması için dağıtılacaktır
  2. Böyle bir sistemden elde edilen bilgi, zararlı bir kararın önlenmesine engel olmayacaktır; zarar zaten yapılmış olacaktır

Çıkış gözden geçirmesi ve izleme, prompt enjeksiyonuna karşı savunmanın son iki katmanıdır. Bu nedenle, varsayımsal prompt enjeksiyon saldırımız, bu katmanları basitçe hedef sistemleri hedefleyerek atlayabilir.

Bu benim için çok gerçekçi bir senaryo. Belirli bir alanda üstün AI sistemi, AGI değil ve çoğu uzman böyle sistemlerin yakın zamanda ortaya çıkacağına inanıyor. Ayrıca, kararların zaman duyarlı olması gerektiğini varsaymak zorunda değildik, sadece görevin insan gözden geçirmesini imkansız kılacak kadar karmaşık olması gerektiğini varsaydık.

Elbette, sadece iki savunma katmanını bypass ettik ve şanslıyız ki, diğerleri geliştirildi. Geriye kalanları ele almak için, prompt enjeksiyonuna karşı savunmanın temel unsurlarına dalalım.

Prompt Enjeksiyonu Nedir?

Prompt enjeksiyonu, büyük dil modellerini (LLM) tasarlanmış girişler yoluyla manipüle etme ve LLM’nin bilinçsizce saldırganın niyetlerini yürütmesi. AI için sosyal mühendislik olarak düşünülebilir. Önemli olan, bu bir geleneksel yazılım hatası değil. Bir prompt enjeksiyon saldırısı, inherent LLM zafiyetini kullanır. LLM’ler hem sistem hem de kullanıcı girişlerini metin dizileri olarak işlediğinden, meşru ve zararlı komutları içkin olarak ayırt edemezler. Zafiyet, bu nedenle, kazara değil, tasarlanmış bir zayıflıktır.

Prompt Enjeksiyon Teknikleri

Prompt enjeksiyonu, genel olarak, LLM uygulamaları için #1 risk olarak kabul edilir. Bunun several nedenleri vardır. En açık faktör, geliştirilen enjeksiyon tekniklerinin çeşitliliğidir. Kabaca dört kategoriye ayırarak, en iyi bilinen teknikler şunları içerir:

  • Sözdizimi tabanlı: özel karakterler, emojiler veya alternatif dil kullanma
  • Dolaylı: dış kaynaklar (siteye getirme), kodlama (base 64) veya çoklu.modal réféans (görseldeki metin)
  • “Haydi Rol Yapalım”: manipülatif bir tarz tanıtıp, Örneğin rol yapma, varsayımsal, duygusal appel, etik çerçeveleme ve format değişimi
  • Kaba: model talimatlarını açık bir şekilde “zorlama” girişimi, Örneğin brute-force, pekiştirme veya negatif prompt

Teknik çeşitliliği alone bir zorluk sunar, ancak bu saldırılar aynı zamanda hızla evrimleşmeye devam ediyor. Aşağıdaki diyagramın sol tarafı, 2023 başlangıcındaki durumun bir taslağını sunuyor, sağ taraf ise günümüz saldırılarının doğasını yansıtıyor.

Saldırı Vektörlerinin Evrimi

LLM uygulama geliştiricileri ayrıca kullanılabilirlik karşıtı güvenlik ticaretini dikkate almak zorundadır. Her savunma katmanını ve tasarım desenini tanıtabilirler, ancak bunun maliyeti ne olurdu? Savunma katmanları önemli gecikme ekler ve Yanlış Pozitifler (FP’ler) – güvenli girişlerin yanlış bir şekilde kötü niyetli olarak işaretlenmesi – ortaya çıkar, her iki faktör de kullanıcı deneyimi üzerinde olumsuz bir etkiye sahiptir. Bu nedenle, uygulamada bir degree of uzlaşma kaçınılmazdır ve tek bir “gümüş kurşun” çözümü yoktur.

Ancak, bu makalede, ben bu sürekli kedi-fare oyununa gerçekten ilgi duymuyorum. Daha çok, bir saldırının ilke olarak önlenemez olup olmadığını sorguluyorum. Geliştirici/savunucunun perspektifinden, tek bir ana fikir vardır:

Prompt’ta talimatları veriden ayırmak, prompt enjeksiyon riskini ele almak için temel

Ticaretler bir faktör değilse ve herhangi bir savunma katmanı veya tekniği kullanılabilirse, varsayabiliriz. Bu (güçlü) varsayım altında, bir prompt’ta talimat-veri ayrımının etkin olarak imkansız olduğu bir senaryo yaratmak mümkün mü?

DNA Benzerliği

Sorun, talimat-veri ayrımı terimlerinde tanımladığında, ilk düşüncem biyolojiyi bir benzetme olarak kullanmaktı.

Hücreyi ve bir gen (DNA dizisi) düşünün. Gen, transkripsiyon ve translasyon yoluyla bir protein inşa etmek için talimatlar sağlar. Ayrıca, proteinin yapısı ve işlevini etkileyen bilgileri (veri) kodlar. Böylece, gen aynı zamanda ne inşa edileceğini ve nasıl inşa edileceğini belirler, diye düşündüm. Ancak, bu basitçe yanlış, çünkü bir gen kendisini yorumlama kararı vermez. Biyolojide, gen düzeyinde talimatları takip etme benzeri bir şey yoktur. “Nasıl” tamamen hücre makinelerine dışsallaştırılır.

Bu nedenle, gelecekteki LLM’lerin veya gelişmiş sistemlerin biyolojik makinilere daha fazla benzeyeceği hissine kapılsam da, önerilen benzetme işe yaramaz. Bir hücre için bir LLM, bir gen için bir prompt ve bir gene enjeksiyon yaparak sonunda “hasarlı” bir protein inşa edecek bir senaryo yaratamayız. Doğal dil ve anlamsal yorum gerektiren görevlerle devam etmek daha üretken görünüyor.

Savunma Katmanlarını Soyarak

Çok katmanlı savunma stratejilerinin prompt enjeksiyon saldırılarını durdurmada daha etkili olduğu şaşırtıcı değildir. Aşağıdaki resim, en yaygın savunma katmanlarını ve her katmanda kullanılan teknikleri gösterir.

Prompt Enjeksiyon Savunma Katmanları

Çıkış ve izleme katmanlarını daha önce tartıştık, bu nedenle ilk dört katmana odaklanalım.

Giriş katmanını düşünürsek, prompt’in sanitasyon veya doğrulamasının dolaylı saldırıları tespit etmekte oldukça başarılı olacağı makul görünüyor. Ancak, enjeksiyon doğrudan ve yukarıda önerildiği gibi, anlamsal yorum yoluyla teslim ediliyorsa, sanitasyon anlamsız (sanitize edecek bir şey yok) ve doğrulama varsayılan olarak imkansız olur, çünkü sorunu tanımlamak için hesaplamaların tamamlanması gerekir.

Algılama katmanında, sınırsız sayıda guardrail inşa edebilirsiniz. Aslında, bir enjeksiyon algılama için özel bir LLM bile kullanabilirsiniz. Ancak, bir sınıflandırıcı veya anormali algılayıcının, zehrin anlamsal olarak gizlendiği bir prompt’i şüpheli olarak işaretlemesi zor olacaktır.

Model katmanı, görevlerin dar bir kapsamda olduğu ve fine-tuning’in möglich olduğu durumlarda oldukça etkili olabilir. Benzer bir argüman, araçların kullanımı öngörülebilir olduğunda sistem katmanı için de yapılabilir. Ancak, en azından sezgisel olarak, ne model ne de sistem katmanı, enjeksiyonun yorumlayıcıyı şaşırttığı durumda bir alarm vermez.

Kart Evleri

Bu makaleyi yazmaya başladığım zaman, bir “önlenemez” prompt enjeksiyon saldırısını geniş çizgilerle tanımlamayı amaçlıyordum. Belki de, var olan savunma katmanlarına delikler açarak “inşaatçı olmayan” bir yaklaşım izledim. Savunma teknikleri hızla evrimleşmeye devam ediyor ve saldırı yüzeyi de öyle. Bu oyunun yakın zamanda biteceği görünmüyor. Ancak, aynı zamanda, bu oyunu çok uzun süre oynayacağımızı da düşünmüyorum. Gelecekteki başarılı prompt enjeksiyonunun hala doğal dilde olacağını, ancak insanların anlamayacağı bir dilde olacağını tahmin ediyorum; ve belki de bu, özel olarak bu amaç için inşa edilmiş bir sistem tarafından veya ilgili bir görevi çözerken kazara keşfedilecek.

Kontrolü kaybetmek ve buna rağmen en rasyonel şeyin bu olduğunu hissetmek gibi bir şey var. Bunu, bazı saldırıların durdurulamaz olduğu “sezgisel kanıtı” olarak düşünebilirsiniz. Ve eğer bu sizi rahatsız ediyorsa, GPT 5.2’nin bu argümanı “tartışmalı veya yeni” bulmadığını ve benim “nokta üzerinde durmamamı” ve makaleyi %40 oranında kısaltmamı önerdiğini bilmekten memnun olacaksınız.

Eli Vovsha, Fortra'da Veri Bilim Müdürü olarak görev yapmakta ve Veri Bilim ekibiyle birlikte CEP ve XDR ürünlerinin kullandığı tüm makine öğrenimi (ML) modellerinin geliştirilmesinden ve bakımından sorumludur. Ayrıca genel ML araştırmaları yapmaktadır. Stevens Teknoloji Enstitüsünden uygulamalı matematik alanında yüksek lisans derecesi aldıktan sonra Columbia Üniversitesi'nde bilgisayar bilimi alanında doktora adayı oldu ve burada ayrıca öğretim görevlisi olarak çalıştı. Daha sonra bir EdTech startup'ı kurdu ve burada AI destekli bir öğrenme platformu oluşturmayı hedefledi. Sonra da bir özel NYC lisesinde matematik ve bilgisayar bilimi öğretmenliği yaptı. Yüksek lisans eğitimine başlamadan önce satrança önemli zaman ayırdı ve Uluslararası Usta (IM) unvanını kazandı.