Anderson’un Açısı

AI Model Hırsızlığını Gizli İzleme Verileri ile Belirleme

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
George Washington winking and smiling on the one dollar bill. Source: https://en.wikipedia.org/wiki/Marked_bill + Flux Edit and Adobe Firefly V3

Yeni bir yöntem, ChatGPT benzeri modelleri saniyeler içinde yeniden eğitim vermeden gizlice su damgası ekleyebilir ve genel çıktıda hiçbir iz bırakmaz, tüm olası kaldırma girişimlerine karşı dayanıklıdır.

 

Su damgası ve ‘telif hakkı tuzağı’ arasındaki ince fark, su damgalarının genellikle bir koleksiyon (örneğin, bir görüntü veri seti) boyunca görünmek üzere tasarlandığıdır – bu, korsan kopyalamaya karşı bir engel oluşturur.

Buna karşılık, sahte bir girdi, genellikle bir kelime veya büyük ve nispeten genel bir koleksiyonda yer alan bir tanım olan küçük bir metin parçasıdır. Bu, bir işin tamamının yasadışı olarak kopyalandığında, ya da türetilmiş bir işin temelinde, orijinal sahibi/sahipleri tarafından yerleştirilen ‘benzersiz’ ve sahte bir gerçeğin varlığı, hırsızlığı kolayca ortaya çıkaracaktır.

Büyük Dil Modelleri (LLM) ve Görme Dili Modelleri (VLM) için su damgaları eklerken, çıktının bu belirtileri içermesi gereken kapsam genellikle iki amaç arasında bölünmüştür: tüm veya çoğu çıktının açık veya gizli bir su damgası içermesini sağlamak; veya bir ‘gizli token’ün geri alınabileceği şekilde, ancak normal model çıktısında görünmeyen bir şekilde su damgası eklemek – ancak bu, modelin normal işleyişine zarar vermemelidir.

Kanit Ağırlıkları

İkinci yaklaşım, Çin, İtalya ve Singapur arasındaki yeni bir işbirliği tarafından ele alınmaktadır; bu çalışma, açık kaynak modellerine böyle bir açıklama yöntemi sağlamak nhằm, bu modellerin kolayca ticarileştirilmesini veya orijinal lisansın izin vermediği şekillerde kullanılmasını engellemek için tasarlanmıştır.

Örneğin, bir modelin orijinal lisansı, herhangi birinin bu işi kar amacıyla kullanabilmesini şart koşabilir, ancak bu, yalnızca kendi değişikliklerini veya değişikliklerini aynı cömert lisans şartları altında kamuoyuna açık olarak sunmaları durumunda mümkündür – ancak bir şirket, ‘tadilatlarını’ (örneğin, ince ayarlanmış sürümler) saklamak isteyebilir, böylece aslında izin verilmeyen bir hendeği oluşturur.

Araştırmaların więkseliği, kapalı kaynaklı, API yalnızca modellerle veya yalnızca optimize edilmiş (kuantize) ağırlıkları bulunan modellerle ilgilidir ve bu nedenle, önerilen yeni makaledeki gibi modelin mimarisine doğrudan erişim olmadan bunları verimli bir şekilde düzenlemek ve değiştirmek daha zordur.

Bu, Çin araştırma sektöründen FOSS sürümlerine dikkat etmekte şaşırtıcı değildir, çünkü Çin’in son bir yıldır AI çıktısı, en azından Batı’nın daha ‘kilitli’ equivalentleriyle rekabet eden tam ağırlıklı sürümlerin cömert sürümleriyle karakterize edilmiştir.

Yeni yaklaşım, EditMark olarak adlandırılır ve kendisini, su damgasını eklemek için modelin yeniden eğitilmesi veya baştan itibaren su damgasıyla eğitilmesi gerekmeksizin ayırt eder.

Bu, birkaç avantajı vardır: biri, su damgasını eklemek için kullanılan ‘ihbarcı’ verilerin, bir kez keşfedilip açıklanması halinde, artık etkili olmayacağıdır; ancak EditMark’i saldırıya karşı koymak için, bir saldırganın, su damgasını nereye hedefleyeceğini ve hangi yaklaşımı kullanacağını bilmesi gerekir – bu, olası bir senaryo değildir.

İkincisi, bu yaklaşım hızlı ve ucuzdur, eğitilmiş bir modele su damgası eklemek için saniyeler yerine günler veya hatta haftalar almaz, böylece modelin büyüklüğü ve uygulanacak veri ile birlikte artan büyük fine-tuning masraflarını ortadan kaldırır.

Üçüncüsü, bu yaklaşım, modelin normal işleyişine, fine-tuning veya önceki düzenleme yöntemlerinden daha az zarar verir.

Testlerde, EditMark – model ağırlıklarına birden fazla olası cevabı olan matematiksel soruları gömmek – %100 geri alma oranıyla başarılı oldu.

Yazarlar şöyle diyor:

‘Kapsamlı deneyler, EditMark’in LLM’leri su damgalama konusundaki olağanüstü performansını gösteriyor. EditMark, 32 bitlik bir su damgasını 20 saniyeden az sürede ekleyerek %100 su damgası geri alma oranını (ESR) elde ediyor.

‘Önemlisi, su damgası eklenme zamanı, ince ayarın ortalama 6.875 saniyesinin yalnızca 1/300’üdür, bu da EditMark’in yüksek kapasiteli su damgaları eklenmesindeki etkisini ve hızını vurgulamaktadır.

‘Ek olarak, kapsamlı deneyler, EditMark’in dayanıklılığını, gizliliğini ve sadakatini doğrulamaktadır.’

Yeni makale, EditMark: Model Düzenleme Tabanlı Büyük Dil Modellerini Su Damgalama olarak adlandırılmıştır ve Çin Bilim ve Teknoloji Üniversitesi, Siena Üniversitesi ve Singapur’daki CFAR/IHPC/A\*STAR’dan sekiz yazar tarafından yapılmıştır.

Yöntem

EditMark yaklaşımı dört bileşenden oluşur: bir Üretici, bir Kodlayıcı, bir Düzenleyici ve bir Çözücü:

EditMark pipeline, modeli belirli matematiksel sorulara cevap vererek gizli tanımlayıcı bilgileri kodlayacak şekilde düzenler. Kaynak: https://arxiv.org/pdf/2510.16367

EditMark pipeline, modeli belirli matematiksel sorulara cevap vererek gizli tanımlayıcı bilgileri kodlayacak şekilde düzenler. Kaynak: https://arxiv.org/pdf/2510.16367

Üretici, pseudo-rasgele bir tohum kullanarak birden fazla cevabı olan matematiksel sorular oluşturur; Kodlayıcı, su damgasına dayalı cevapları seçer ve bunları modelin ağırlıklarına özel bir düzenleme işlemi aracılığıyla gömer. Model daha sonra yayınlandığında veya kötüye kullanıldığında, su damgası, aynı soruların sorulmasının ardından ve cevapların çözülmesiyle geri alınabilir.

Düzenleyici, modelin ağırlıklarını değiştirir, böylece hedeflenen cevapları üretir ve su damgasını modelin davranışına doğrudan gömer. Çözücü, aynı soruları şüpheli modele sorarak ve cevapları gizli imzaya geri çevirerek su damgasını geri alır.

Tehtid Modeli

Makalenin tehdit modeli, su damgasının beyaz kutu ortamında yapıldığını varsayar. Bu, güvenlikle ilgili araştırmada genellikle iyi bir işaret değildir, ancak bu durumda normaldir, çünkü yöntem, kendi işlerine tam erişim olan sahipleri korumayı amaçlamaktadır.

Saldırganın da modeli edinebildiği ve değiştirebildiği (örneğin, budama veya fine-tuning yoluyla) varsayılır – bu, bir FOSS sürümü durumunda normal ve beklenen bir senaryodur. Ancak saldırgan, su damgası çıkarma sürecine veya kullanılan şemaya erişemez ve bunu sadece çıkarım ve deneyleme yoluyla bulabilir (veya sızıntı yoluyla).

Üretici, GPT-4o kullanarak şablonları çeşitlendirmek (aşağıda gösterildiği gibi) ve her soruyu benzersiz kılmak için pseudo-rasgele bir tohum kullanır. Bu, su damgasının deterministik olarak, cevap permütasyonları aracılığıyla gömülmesini sağlar ve aynı zamanda sorular arasındaki örtüşmeyi en aza indirir, böylece düzenleme karmaşıklığını önler:

GPT-4o tarafından su damgası eklemek için oluşturulan soruların şablonları, her biri bir eşitsizlikten türetilen birden fazla geçerli tamsayı cevabı üretmek üzere tasarlanmıştır.

GPT-4o tarafından su damgası eklemek için oluşturulan soruların şablonları, her biri bir eşitsizlikten türetilen birden fazla geçerli tamsayı cevabı üretmek üzere tasarlanmıştır.

Kodlayıcı, her bir su damgası segmentini, belirli bir matematik sorusunun çözüm kümesinden alınan benzersiz bir tamsayı permütasyonuna dönüştürür. Sözlüksel permütasyon teorisi kullanarak, Kodlayıcı, her bir su damgası parçasının ondalık değerini, belirli bir sıralı cevap seçimiyle eşler, böylece su damgası modelin davranışına deterministik olarak gömülür.

Düzenleyici, modelin ağırlıklarını değiştirir, böylece bu sorulara verilen cevaplar, su damgasını modelin davranışına doğrudan gömer. Çözücü, aynı soruları şüpheli modele sorar ve cevapları gizli imzaya geri çevirerek su damgasını geri alır.

Veri ve Testler

EditMark’i test etmek için beş LLM değerlendirildi: GPT2-X; GPT-J-6B; LLaMA-3-8B; Baichuan-7B; ve Qwen-7B. Yukarıda bahsedilen AlphaEdit, su damgalarını eklemek için kullanıldı, जबकi geri alma başarı oranı (ESR) ve gömme zamanı (ET) metriklere göre ölçüldü.

Referans olarak, yazarlar Model Watermark (arka kapı); KIMark; ve BadEdit, orijinal olarak arka kapı enjeksiyonu için tasarlanmış bir çerçeve, ancak bu projenin kendi amaçları için uyarlanmıştır.

Yazarlar, LLaMA-3-8’in 15. katmanını, GPT2-XL ve GPT-J-6B’nin 17. katmanını ve Qwen-7B ve Baichuan-7B’nin 14. katmanını düzenlediler.

Deneyler, her biri 24GB VRAM ile dört NVIDIA RTX 4090 GPU’sunda gerçekleştirildi, 32 bit, 64 bit ve 128 bit uzunluğunda su damgaları gömüldü. Kullanılan soru şablonları aşağıdaki resimde gösterilmektedir:

Su damgalama için oluşturulan çok cevaplı soruların şablonları. Her soru, farklı bir matematiksel eşitsizliğe dayalıdır ve değişkenler için rasgele değerler eklenmiştir. Model, tamsayı çözümlerinin bir listesini döndürmek üzere istenir ve cevapların sırası, su damgası bitlerini kodlamak veya çözmek için kullanılır. Dört şablon, kuadratik, logaritamik, rasyonel ve aralığa dayalı formları kapsar ve hepsi GPT-4o kullanılarak oluşturulmuştur.

Su damgalama için oluşturulan çok cevaplı soruların şablonları. Her soru, farklı bir matematiksel eşitsizliğe dayalıdır ve değişkenler için rasgele değerler eklenmiştir. Model, tamsayı çözümlerinin bir listesini döndürmek üzere istenir ve cevapların sırası, su damgası bitlerini kodlamak veya çözmek için kullanılır.

Deneylerde, 1’den 20’ye kadar olan tohumlar, farklı su damgası kapasitelerine karşı test edildi.

Araştırmacılar önce, çeşitli LLM’ler üzerinde ESR ve gömme zamanı için test etti:

Beş büyük dil modelinde EditMark ile üç önceki su damgalama yönteminin karşılaştırılması. Rapor edilen ESR ve gömme zamanı (saniyede) gösterilmektedir. EditMark, %100 geri alma oranını tutarlı bir şekilde elde eder ve tüm modellerde ve mimarilerde diğer tüm referansları aşarak, hem doğrulukta hem de verimlilikte birkaç kat daha hızlıdır.

Beş büyük dil modelinde EditMark ile üç önceki su damgalama yönteminin karşılaştırılması. Rapor edilen ESR ve gömme zamanı (saniyede) gösterilmektedir.

Bu sonuçlardan, yazarlar şöyle diyor:

‘[EditMark] tüm değerlendirmeye alınan LLM’ler için %100 ESR elde eder ve 32 bitlik bir su damgasını eklemek için 20 saniyeden az süre alır. Özellikle, Baichuan-7B ve Qwen-7B için ortalama gömme zamanı 10 saniyeden azdır, bu da EditMark’in yüksek verimliliğini göstermektedir.’

128 bitlik bir su damgası için değerlendirme, EditMark’in ‘silinmezlik’ durumunu korudu:

Beş dil modelinde EditMark için ESR ve gömme zamanı, 32 bit, 64 bit ve 128 bit su damgası uzunlukları için. Tüm durumlarda mükemmel geri alma oranları korunurken, gömme zamanı su damgası boyutuyla birlikte artar, ancak 128 bit için bile bir dakikadan azdır.

Beş dil modelinde EditMark için ESR ve gömme zamanı, 32 bit, 64 bit ve 128 bit su damgası uzunlukları için. Tüm durumlarda mükemmel geri alma oranları korunurken, gömme zamanı su damgası boyutuyla birlikte artar, ancak 128 bit için bile bir dakikadan azdır.

Sonra, sistemin su damgası sadakatini çeşitli benchmark’lar üzerinde test etti:

Beş modelde 32 bit ve 128 bit kapasitelerde su damgalı modellerin performansı, değişmez modellerle karşılaştırıldı. Performans, yapılandırmalar arasında stabil kaldı, ortalama puanlarda yalnızca küçük dalgalanmalar görüldü, su damgası eklenmesinin benchmark doğruluğuna limited etki ettiğini gösterdi.

Beş modelde 32 bit ve 128 bit kapasitelerde su damgalı modellerin performansı, değişmez modellerle karşılaştırıldı.

EditMark’in direnci, altı ortak saldırı stratejisi karşısında test edildi. Modeller, 128 bitlik su damgaları ile beş farklı tohum kullanarak düzenlendi. İnce ayar, aşağıdaki resimde gösterildiği gibi, çoğu model için ESR’de yalnızca küçük bir bozulmaya neden oldu:

Su damgalı LLM'lerin ESR'si, bir ila üç epoch için fine-tuning öncesi ve sonrasına göre. Çoğu model, yüksek ESR'lerini korurken, Qwen-7B önemli bir düşüş gösterir, parameter güncellemelerine karşı daha büyük bir savunmasızlık olduğunu gösterir.

Su damgalı LLM’lerin ESR’si, bir ila üç epoch için fine-tuning öncesi ve sonrasına göre.

Bununla birlikte, bu saldırılar aynı zamanda görev performansılarında keskin düşüşlere neden oldu, özellikle de Baichuan-7B, BLIMP’de gürültü veya budama uygulanması durumunda %27-31’lik bir düşüş yaşadı.

Model düzenleme ve uyarlanabilir saldırılar da değerlendirildi:

Farklı düzeylerde model düzenleme uygulanan su damgalı modellerin ESR'si. Bilinen su damga katmanlarına kadar elli düzenleme uygulanmasına rağmen, tüm modeller için ESR %95'in üzerinde kaldı, doğrudan parameter değişikliklerinin su damga kaldırma üzerindeki etkisinin sınırlı olduğunu gösterdi.

Farklı düzeylerde model düzenleme uygulanan su damgalı modellerin ESR’si.

Burada EditMark, bilinen su damga katmanlarına kadar elli düzenleme uygulanmasına rağmen %95’in üzerinde ESR’yi korudu.

Sonuç

DRM, gizli su damgaları ve diğer güvenlik yaklaşımları, AI öncesi dönemde sınırlı veya kısmi başarı elde etti, ancak makine öğrenimi sistemlerine uygulanmaları zordur; mevcut mimarilerin kasıtlı olarak indirgeyici doğası, uygun araçların eksikliği ile birleşerek, enjekte edilen su damgalarının oldukça kırılgan olmasını sağlar.

FOSS model dağıtımı için tasarlanmış bir sistemi görmek ve bunun, en olası olmayan senaryolardan başka tüm senaryolara karşı dayanıklı olduğunu görmek etkileyicidir. Ancak, bu deneylerde küçük olan post-education düzenlemeyle gelen hafif performans düşüşü, potansiyel benimseyicilere duraklama nedenleri verebilir; en azından, API-merkezli bir kontrol modeline geri çekilmek, bu tür saldırıları neredeyse tamamen bertaraf eder.

 

* Bu site iddia etti ki ‘açık ağırlık’ sürümleri Çin’den tam olarak FOSS olarak nitelendirilemez, çünkü veri genellikle geri tutulur, bu da eğitim pipeline’inin kesin olarak yeniden oluşturulmasını engeller. Bu konu, AI modeli sürümlerinin batı ve doğu arasında karşılaştırıldığı daha derin bir analiz için davet etmektedir, ancak bu makalenin kapsamı dışındadır.

İlk olarak 27 Ekim 2025 Pazartesi günü yayınlandı

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai