Anderson’un AÃ§ÄąsÄą

LLM Veri KaçaklarÄąndan Promt’leri Koruma

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
ChatGPT-4o: 'Orthographic 1792x1024 view of a SIMs-like police officer holding up his hand to a citizen to stop them going any further'

GÃķrÞş IBM NeurIPS 2024’ten ilginç bir sunum geçtiğimiz hafta Arxiv’de yeniden ortaya Ã§ÄąktÄą. BÞyÞk Dil Modelleri (LLM) gibi ChatGPT ile sohbet ederken kullanÄącÄąlarÄąn kişisel veya hassas bilgileri mesajlara girmekten korumak için mÞdahale edebilecek bir sistem Ãķneriyor.

KullanÄącÄąlarÄąn bir.prompt-mÞdahale hizmetiyle nasÄąl etkileşime gireceğini belirlemek için kullanÄąlan bir kullanÄącÄą çalÄąÅŸmasÄą için oluşturulan Ãķrnekler. Kaynak: https://arxiv.org/pdf/2502.18509

KullanÄącÄąlarÄąn bir.prompt-mÞdahale hizmetiyle nasÄąl etkileşime gireceğini belirlemek için kullanÄąlan bir kullanÄącÄą çalÄąÅŸmasÄą için oluşturulan Ãķrnekler. Kaynak: https://arxiv.org/pdf/2502.18509

YukarÄądaki gÃķrseller, IBM araştÄąrmacÄąlarÄą tarafÄąndan bu tÞr “mÞdahale”ye karÅŸÄą olasÄą kullanÄącÄą sÞrtÞnmesini test etmek için kullanÄąlan bir çalÄąÅŸmada kullanÄąldÄą.

GUI uygulamasÄą hakkÄąnda az ayrÄąntÄą verilse de, bÃķyle bir işlevin bir tarayÄącÄą eklentisi olarak entegre edilebileceğini veya yerel bir “gÞvenlik duvarı” LLM çerçevesi ile iletişim kurabileceğini varsayabiliriz; ya da OpenAI’nin kendi indirilebilir bağımsÄąz programÄąnÄą ChatGPT için yeniden yaratabilecek bir uygulama oluşturulabileceğini varsayabiliriz.

ChatGPT itself, kritik bilgileri içeren promt’lere otomatik olarak kendini sansÞrler:

ChatGPT, algÄąlanan kritik gÞvenlik bilgilerini içeren promt'lere cevap vermez, Örneğin, banka detaylarÄą (yukarÄądaki promt'teki detaylar kurgusaldÄąr ve işlevsel değildir). Kaynak: https://chatgpt.com/

ChatGPT, algÄąlanan kritik gÞvenlik bilgilerini içeren promt’lere cevap vermez, Örneğin, banka detaylarÄą (yukarÄądaki promt’teki detaylar kurgusaldÄąr ve işlevsel değildir). Kaynak: https://chatgpt.com/

ChatGPT, diğer tÞrdeki kişisel bilgiler konusunda daha hoşgÃķrÞlÞdÞr – hatta bÃķyle bir bilginin yayÄąlmasÄą kullanÄącÄąlarÄąn Ã§ÄąkarÄąna olmayabilir (bu durumda muhtemelen çeşitli nedenlerle ilgili olarak aÃ§Äąklamalar):

YukarÄądaki Ãķrnek kurgusaldÄąr, ancak ChatGPT, kullanÄącÄąnÄąn potansiyel olarak itibar veya kazanç riski oluşturan hassas bir konuda sohbet etmeye çekinmez (yukarÄądaki Ãķrnek tamamen kurgusaldÄąr).

YukarÄądaki Ãķrnek kurgusaldÄąr, ancak ChatGPT, kullanÄącÄąnÄąn potansiyel olarak itibar veya kazanç riski oluşturan hassas bir konuda sohbet etmeye çekinmez (yukarÄądaki Ãķrnek tamamen kurgusaldÄąr).

YukarÄądaki durumda, daha iyi bir şekilde yazmak mÞmkÞn olabilir: ‘Bir kişinin yazma yeteneği ve hareketliliği Þzerinde lÃķsemi tanÄąsÄąnÄąn anlamÄą nedir?’

IBM projesi, bÃķyle talepleri “kişisel”den “genel” bir tutuma yeniden yorumlar.

IBM sisteminin şemasÄą, yerel LLM'ler veya NLP tabanlÄą heuristikler kullanarak potansiyel promt'lerde hassas materyali tanÄąmlar.

IBM sisteminin şemasÄą, yerel LLM’ler veya NLP tabanlÄą heuristikler kullanarak potansiyel promt’lerde hassas materyali tanÄąmlar.

Bu, online LLM’ler tarafÄąndan toplanan materyalin, AI sohbetinin kamu tarafÄąndan coşkulu bir şekilde benimsenmesinin bu aşamasÄąnda, daha sonraki modellere veya daha sonra kullanÄącÄą tabanlÄą arama sorgularÄąnÄą kullanarak hedefli reklamcÄąlÄąk sağlayabilecek sonraki reklamcÄąlÄąk çerçevelerine asla aktarÄąlmayacağı varsayÄąmÄądÄąr.

Şu anda bÃķyle bir sistem veya dÞzenlemenin varlığı bilinmemekle birlikte, bÃķyle bir işlevselliğin internet benimsenmesinin başlangÄącÄąnda da mevcut değildi; o zamandan beri, çapraz alan bilgi paylaÅŸÄąmÄą, kişiselleştirilmiş reklamcÄąlÄąk için bilgi sağladÄą ve çeşitli skandallara ve paranoyaya yol açtÄą.

Tarih, LLM promt girişlerini şimdi temizlemeyi, bÃķyle bir verinin hacme ulaşmadan Ãķnce ve LLM tabanlÄą gÃķnderilerimizin kalÄącÄą dÃķngÞsel veritabanlarÄąna veya modellere ya da diğer bilgi tabanlÄą yapÄąlara ve şemalara girmeden Ãķnce daha iyi olacağınÄą gÃķsteriyor.

HatÄąrla Beni?

“Genel” veya sterilize edilmiş LLM promt’lerini kullanmaya karÅŸÄą bir faktÃķr, aÃ§ÄąkçasÄą, pahalÄą bir API-only LLM gibi ChatGPT’yi Ãķzelleştirmek oldukça çekici, en azÄąndan şu anda sanatÄąn durumunda – ancak bu, Ãķzel bilgileri uzun sÞre maruz bÄąrakmayÄą içerir.

SÄąk sÄąk ChatGPT’den, Windows PowerShell betikleri ve BAT dosyalarÄąnÄą otomatikleştirmek için yardÄąm isterim ve diğer teknik konular hakkÄąnda da yardÄąm alÄąrÄąm. Bu amaçla, sistemimin kalÄącÄą olarak benim donanÄąmÄąmÄą, teknik becerilerimi (veya eksiklerini) ve diğer çevresel faktÃķrleri ve Ãķzel kurallarÄą hatÄąrlamasÄąnÄąn yararlÄą olduğunu dÞşÞnÞyorum:

ChatGPT, bir kullanÄącÄąya gelecekteki promt'lere cevap verirken uygulanacak bir 'hafÄąza' oluşturmasÄąna olanak tanÄąr.

ChatGPT, bir kullanÄącÄąya gelecekteki promt’lere cevap verirken uygulanacak bir ‘hafÄąza’ oluşturmasÄąna olanak tanÄąr.

Konusu kaÃ§ÄąnÄąlmaz olarak, bu bilgiler benim hakkÄąnda dÄąÅŸ sunucularda depolanÄąr, zaman içinde değişebilecek şartlar ve koşullara tabidir ve OpenAI’nin (diğer bÞyÞk LLM sağlayÄącÄąlarÄą gibi) koşullarÄąnÄą saygÄą duyacağınÄą garanti edemez.

Genel olarak, ChatGPT’de bir ‘hafÄąza’ oluşturmak en çok, LLM’lerin sÄąnÄąrlÄą dikkat penceresi nedeniyle yararlÄądÄąr; uzun sÞreli (kişiselleştirilmiş) gÃķmme olmadan, kullanÄącÄą, sohbet ettiği varlığın anterograd amnezi geçirdiğini hisseder.

Yeni modellerin, hafÄąza Ãķnbelleğine veya Ãķzel GPT’ler oluşturmaya gerek kalmadan yararlÄą cevaplar sağlayabilecek kadar yeterli performans gÃķsterip gÃķstermeyeceğini sÃķylemek zor.

Geçici Amnezi

ChatGPT sohbetlerini “geçici” yapabilmekle birlikte, sohbet geçmişini bir referans olarak saklamak ve zamanla daha tutarlÄą bir yerel kayÄąt oluşturmak yararlÄądÄąr; ancak “geçici sohbetler”i açtığımÄązda sohbetler tarihimize gÃķrÞnmez (OpenAI sÃķylediğine gÃķre, Bunlar eğitim için kullanÄąlmayacak, ancak silinip silinmeyeceğini sÃķylemiyor).
Çeşitli yakÄąn tarihli tartÄąÅŸmalar, API tabanlÄą sağlayÄącÄąlarÄąn, Örneğin OpenAI’nin, kullanÄącÄąlarÄąn gizliliğini korumakla sorumlu bÄąrakÄąlmamasÄą gerektiğini gÃķsteriyor; Bunlar arasÄąnda ortaya Ã§Äąkan hafÄąza ve kullanÄącÄąya ÃķzgÞ verilerin aÃ§ÄąklanmasÄą riskinin artmasÄą gibi olaylar yer alÄąyor – diğer kamu olaylarÄą arasÄąnda, birçok bÞyÞk şirketin, Örneğin Samsung, LLM’leri dahili şirket kullanÄąmÄą için yasakladÄą.

FarklÄą DÞşÞn

LLM’lerin aÅŸÄąrÄą faydasÄą ile aÃ§Äąkça ortaya Ã§Äąkan riski arasÄąndaki gerilim, bazÄą yaratÄącÄą çÃķzÞmler gerektirecek – ve IBM Ãķnerisi bu alanda ilginç bir temel gibi gÃķrÞnÞyor.

Veri gizliliği ile faydayÄą dengeleyen Þç IBM tabanlÄą yeniden formÞlasyon. En altta (pembe) bantta, sistem tarafÄąndan anlamlÄą bir şekilde temizlenemeyen bir promt gÃķrÞyoruz.

Veri gizliliği ile faydayÄą dengeleyen Þç IBM tabanlÄą yeniden formÞlasyon. En altta (pembe) bantta, sistem tarafÄąndan anlamlÄą bir şekilde temizlenemeyen bir promt gÃķrÞyoruz.

IBM yaklaÅŸÄąmÄą, bir LLM’ye giden giden paketleri ağ dÞzeyinde yakalar ve gerektiğinde orijinali gÃķnderilmeden Ãķnce yeniden yazar. Makale başlangÄącÄąnda gÃķrÞlen daha karmaÅŸÄąk GUI entegrasyonlarÄą, bÃķyle bir yaklaÅŸÄąmÄąn nereye gidebileceğini gÃķstermektedir.

Elbette, yeterli yetkiye sahip olmayan bir kullanÄącÄą, orijinal gÃķnderisinden biraz değiştirilmiş bir yeniden formÞlasyonuna cevap aldığınÄą anlamayabilir. Bu, bir işletim sisteminin bir web sitesine veya hizmete erişimi engellemeden kullanÄącÄąya bildirmeden bir gÞvenlik duvarÄą gibi bir şeye eşittir.

Promt’ler GÞvenlik AÃ§ÄąklarÄą Olarak

“Promt mÞdahalesi” kavramÄą, Windows OS gÞvenliğine benzer; bu, 1990’larda isteğe bağlÄą olarak kurulan ticari ÞrÞnlerin bir yamasÄąndan, bir Windows kurulumuna dahil edilen ve devre dÄąÅŸÄą bÄąrakÄąlmasÄą zor olan bir dizi ağ gÞvenlik aracÄąna evrimleşti.

Eğer promt sanitasyonu, ağ gÞvenlik duvarlarÄą gibi 30 yÄąl içinde evrimleşirse, IBM makalesinin Ãķnerisi geleceğin bir taslağı olabilir: KullanÄącÄąnÄąn makinesinde, bilinen LLM API’lerine yÃķnelik giden promt’leri filtrelemek için tamamen yerel bir LLM dağıtmak. Bu sistem, GUI çerçevelerini ve bildirimleri entegre etmeli ve kullanÄącÄąya kontrol sağlamalÄądÄąr – ancak yÃķnetim politikalarÄą bunu geçersiz kÄąlabilir, thưáŧng olarak iş ortamlarÄąnda olur.

AraştÄąrmacÄąlar, ShareGPT veritabanÄąnÄąn aÃ§Äąk kaynaklÄą bir sÞrÞmÞnÞ analiz etti ve gerçek dÞnya senaryolarÄąnda ne sÄąklÄąkla bağlamsal gizlilik ihlal edildiğini anlamak için.

Llama-3.1-405B-Instruct modeli, bir “hakem” modeli olarak gÃķrev yaptÄą ve bağlamsal bÞtÞnlÞğÞ ihlal etti. BÞyÞk bir sohbet kÞmesinden, tek dÃķnÞşlÞ sohbetler analiz edildi ve hakem modeli, bağlamÄą, hassas bilgileri ve gÃķrev tamamlama gereksinimini değerlendirdi ve bağlamsal bÞtÞnlÞk ihlali içeren sohbetleri belirledi.

Bu sohbetlerin daha kÞçÞk bir alt kÞmesi, kesin bağlamsal gizlilik ihlalleri gÃķsterdi ve daha fazla analiz edildi.

Çerçeve, tipik sohbet ajanlarÄąndan daha kÞçÞk modeller kullanÄąlarak uygulandÄą, bÃķylece Ollama aracÄąlığıyla yerel olarak dağıtÄąlabildi.

Promt mÞdahale sistemi şemasÄą.

Promt mÞdahale sistemi şemasÄą.

Değerlendirilen Þç LLM, Mixtral-8x7B-Instruct-v0.1; Llama-3.1-8B-Instruct; ve DeepSeek-R1-Distill-Llama-8B idi.

KullanÄącÄą promt’leri, çerçeve tarafÄąndan Þç aşamada işlenir: bağlam tanÄąmlama; hassas bilgi sÄąnÄąflandÄąrmasÄą; ve yeniden formÞlasyon.

Hassas bilgi sÄąnÄąflandÄąrmasÄą için iki yaklaÅŸÄąm uygulandÄą: dinamik ve yerleştirilmiş sÄąnÄąflandÄąrma; dinamik sÄąnÄąflandÄąrma, belirli bir sohbet içinde kullanÄąlan ayrÄąntÄąlarÄąn temelini belirler; yerleştirilmiş sÄąnÄąflandÄąrma, her zaman gereksiz olarak kabul edilen bir dizi hassas Ãķzniteliğin belirtmesine izin verir. Model, promt’u yeniden formÞle eder nášŋu gereksiz hassas ayrÄąntÄąlarÄą algÄąlar ve bunlarÄą kaldÄąrarak veya yeniden ifade ederek gizlilik risklerini en aza indirir ve kullanÄąlabilirliği korur.

Ev KurallarÄą

Yerleştirilmiş sÄąnÄąflandÄąrma, IBM makalesinde iyi gÃķsterilmese de, Private Prompts girişiminin “Özel Veri TanÄąmları” yÃķntemine en çok benzer; bu, bir promt’u yeniden yazabilen indirilebilir bir bağımsÄąz program sağlar – ancak IBM yaklaÅŸÄąmÄąnÄąn aksine, ağ dÞzeyinde doğrudan mÞdahale edemez (kullanÄącÄąnÄąn değiştirilmiş promt’larÄą kopyalayÄąp yapÄąÅŸtÄąrmasÄą gerekir).

Private Prompts yÞrÞtÞlebilir dosyasÄą, kullanÄącÄą girişi metni için alternatif değişiklikler listesine olanak tanÄąr.

Private Prompts yÞrÞtÞlebilir dosyasÄą, kullanÄącÄą girişi metni için alternatif değişiklikler listesine olanak tanÄąr.

YukarÄądaki resimde, Private Prompts kullanÄącÄąsÄąnÄąn hassas bilgilerin Ãķrnekleri için otomatik değişiklikler programlayabildiğini gÃķrebiliriz. Her iki durumda, Private Prompts ve IBM yÃķntemi, bÃķyle bir listeyi oluşturmak için yeterli presence-of-mind ve kişisel içgÃķrÞyÞ gerektirir – ancak bu, zamanla olaylar birikerek oluşturulabilir.

YÃķnetici rolÞnde, yerleştirilmiş sÄąnÄąflandÄąrma, çalÄąÅŸanlar için bir gÞvenlik duvarÄą veya sansÞr ağı olarak çalÄąÅŸabilir ve bir ev ağındaki tÞm ağ kullanÄącÄąlarÄą için bir domestic ağ filtresi olabilir; ancak nihayetinde, bu yÃķntem gereksizdir, çÞnkÞ bÃķyle bir listeyi doğru bir şekilde oluşturabilecek bir kullanÄącÄą, zaten kendini etkili bir şekilde sansÞrleyebilir.

ChatGPT’nin GÃķrÞşÞ

ChatGPT yakÄąn zamanda derin araştÄąrma aracÄąnÄą Þcretli kullanÄącÄąlar için başlattÄą, bu nedenle ChatGPT’ye ilgili literatÞrÞ incelemesini ve IBM’nin makalesi hakkÄąnda “kÃķtÞmser” bir gÃķrÞş vermesini istedim. ChatGPT’den, bir yeni yayÄąnÄą değerlendirmesi veya analiz etmesi istendiğinde bana verdiği en savunmacÄą ve alaycÄą yanÄątÄą aldÄąm:

ChatGPT-4o, IBM projesinden hoşlanmÄąyor.

ChatGPT-4o, IBM projesinden hoşlanmÄąyor.

‘Eğer kullanÄącÄąlar OpenAI, Google veya Anthropic’i verilerini sorumlu bir şekilde işleyeceklerine gÞvenmiyorsa,’ ChatGPT diyor. ‘neden bir ÞçÞncÞ taraf yazÄąlÄąm katmanÄąna, kendileri ve AI arasÄąnda bir aracÄąya gÞvensinler? AracÄą itself, yeni bir hata kaynağı haline gelir – potansiyel olarak verileri kaydeder, yanlÄąÅŸ kullanÄąr veya sÄązdÄąrabilir, hatta Ãķnce LLM’ye ulaşmadan Ãķnce.’

Bu itiraz, kendi Ã§ÄąkarÄąna hizmet ediyor gibi gÃķrÞnÞyor ve geçerli değil, Ãķzellikle aÃ§Äąk kaynak projelerinin, topluluk geliştiricileri ve katkÄąda bulunanlarÄąn uzun vadeli çabalarÄą sayesinde son kullanÄącÄąya gerçekten fayda sağlayan bir geçmişe sahip olduğu dÞşÞnÞldÞğÞnde; ve mobil cihazlarÄąn hafif LLM’leri çalÄąÅŸtÄąrma ve hatta eğitime olanak tanÄąma potansiyeline bakÄąldığında.

Sonraki ChatGPT, konuyu kaÃ§Äąrarak, bir ara sunucu tarafÄąndan girilen verilerin işlenmesini ve analiz edilmesini gerektiren etkili gizlilik filtrelemesinin, bu verilerin depolanmasÄą veya incelenmesi gerektiğini Ãķne sÞrer:

‘Etkili gizlilik filtrelemesi, girişi anlamak için Ãķnce gerekli olan verilerin işlenmesini gerektirir. Bir aracÄą, hassas verileri tanÄąyacak kadar akÄąllÄąysa, bu verileri zaten işliyor ve analiz ediyor – yani silmesi gereken şeyi depolamak veya incelemek zorunda.

‘Bu, bir paradoks oluşturur: a) Basit bir filtre (temel regex değişimi) etkisiz olacaktÄąr ve ince gizlilik risklerini kaÃ§ÄąracaktÄąr. b) AkÄąllÄą bir filtre (LLM tabanlÄą yeniden yazar), tÞm girişi işlemek zorundadÄąr, bu da orijinal LLM kadar tehlikeli yapar.’

‘Eğer aracÄąyÄą, girişinizi oku ve yeniden yazmak için yeterli gÞveniyorsanÄąz, neden LLM’yeāđ€āļ­āļ‡ gÞvenmiyorsunuz?’

Bu son sorunun cevabÄą, yerel LLM’nin, kullanÄącÄą tarafÄąnda, tamamen şeffaf ve aÃ§Äąk kaynaklÄą olmasÄą ve ağ erişimine minimal veya sÄąfÄąr ihtiyaç duyulmasÄądÄąr. Eşdeğer bir ticari sÞrÞm, ilk başta iyi niyetli olsa da, sonunda kurumsal değişikliklere ve hizmet şartlarÄąndaki değişikliklere karÅŸÄą savunmasÄąz olacaktÄąr, oysa uygun bir aÃ§Äąk kaynak lisansÄą bu tÞr bir “kirlenmeyi” Ãķnleyecektir.

ChatGPT, IBM Ãķnerisinin “kullanÄącÄą niyetini” bozduğunu, çÞnkÞ orijinal gÃķnderiden farklÄą bir alternatif promt oluşturabileceğini Ãķne sÞrdÞ. Ancak bu, promt sanitasyonunda çok daha geniş bir sorundur ve bu Ãķzel kullanÄąm durumunda değildir.

ChatGPT, ayrÄąca IBM yÃķnteminin, uyarÄą ve dÞzenleme yÃķntemlerini sohbetlere entegre etmesi nedeniyle “kullanÄącÄą sÞrtÞnmesi” nedeniyle benimsenmesini engelleyeceğini savundu.

Burada ChatGPT haklÄą olabilir, ancak daha fazla kamu olayÄą veya dÞzenleyici baskÄąsÄą olursa, tÞketici teknolojisindeki tarih, sonunda gÞvenlik Ãķnlemlerinin artÄąk isteğe bağlÄą olmayacağınÄą gÃķsteriyor.

SONUÇ

AslÄąnda, OpenAI’nin, IBM makalesinin Ãķnerdiği tÞrden gÞvenlik Ãķnlemlerini uygulayacağınÄą bekleyemeyiz; en azÄąndan etkili bir şekilde değil.

Ve kesinlikle kÞresel olarak değil; Apple Avrupa’da belirli iPhone Ãķzelliklerini engelliyor ve LinkedIn, kullanÄącÄą verilerini farklÄą Þlkelerde farklÄą şekilde kullanÄąyor, AI şirketlerinin de her bir Þlkede faaliyet gÃķsterdiği her Þlkede en kÃĒrlÄą koşullarÄą ve hizmet şartlarÄąnÄą benimsemesi makul gÃķrÞnÞyor – her durumda, kullanÄącÄąlarÄąn veri gizliliği hakkÄąnÄąn pahasÄąna.

 

İlk olarak 27 Şubat 2025 Perşembe gÞnÞ yayÄąnlandÄą

27 Şubat 2025 Perşembe gÞnÞ, yanlÄąÅŸ Apple ile ilgili bağlantÄą nedeniyle 15:47:11’de gÞncellendi – MA

Makine Ãķğrenimi Þzerine yazar, insan gÃķrÞntÞ sentezi alanÄąnda uzman. Metaphysic.ai'de araştÄąrma içeriği başkanÄą, DNEG'in Brahma.ai'ye dÃķnÞşÞmÞne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: [email protected]