Yapay zeka modelleri ve platformları
MARKLLM: Büyük Dil Modelleri için Su İşareti Araç Seti
Büyük dil modellerinin (LLM) yanlış kullanımını önlemek için, bu modellerin çıktılarına algılanamayacak ancak tespit edilebilecek sinyaller entegre eden LLM su işaretleme teknikleri çok önemlidir. Bu su işaretleme teknikleri temel olarak iki kategoriye ayrılır: KGW Ailesi ve Christ Ailesi. KGW Ailesi, büyük dil modelinin ürettiği logitleri değiştirerek, önceki token temelinde sözcüğü yeşil liste ve kırmızı liste olarak kategorize ederek su işaretleme çıktısı oluşturur. Metin oluşturma sırasında, yeşil liste tokenlerinin logitlerine önyargı eklenir ve bu tokenler üretilen metinde tercih edilir. Yeşil kelimelerin oranından hesaplanan bir istatistiksel ölçüt belirlenir ve su işaretleme yapılmış ve yapılmamış metinleri ayırt etmek için bir eşik değer kurulur. KGW yönteminin geliştirmeleri arasında, geliştirilmiş liste bölümlendirme, daha iyi logit manipülasyonu, artan su işareti bilgi kapasitesi, su işareti kaldırma saldırılarına direnç ve su işaretleme públicosunu tespit etme yeteneği bulunur.
Öte yandan, Christ Ailesi, büyük dil modelinin metin oluşturma sırasında örnek alma işlemini değiştirerek, tokenlerin seçilme şeklini değiştirerek su işaretleme ekler. Her iki su işaretleme ailesi de, su işaretleme tespit edilebilirliği ile metin kalitesi arasında denge kurmayı amaçlar ve değişken entropi ayarlarında dayanıklılık, su işareti bilgi kapasitesinin artırılması ve kaldırma girişimlerine karşı koruma gibi zorlukları ele alır. Son araştırmalar, liste bölümlendirmesinin ve logit manipülasyonunun iyileştirilmesi, su işareti bilgi kapasitesinin artırılması, su işareti kaldırma yöntemlerinin geliştirilmesi ve públicosu tespitin ermögülmesi üzerine odaklanmıştır. Sonuç olarak, LLM su işaretleme, büyük dil modellerinin etik ve sorumlu kullanımını sağlamak için çok önemlidir ve LLM tarafından üretilen metni izlemek ve doğrulamak için bir yöntem sağlar. KGW ve Christ Aileleri, her biri benzersiz güçlere ve uygulamalara sahip olan iki farklı yaklaşımı sunar ve sürekli olarak devam eden araştırmalar ve yenilikler yoluyla gelişmektedir.
Büyük dil modellerinin yanlış kullanımının risklerini azaltmak için, LLM su işaretleme çerçevelerinin algoritmik olarak tespit edilebilecek sinyalleri model çıktılarına gömmesi çok önemlidir. Ancak,目前, pazar’da çok sayıda LLM su işaretleme çerçevesi bulunmaktadır ve her biri kendi bakış açıları ve değerlendirme prosedürlerine sahiptir, bu da araştırmacıların bu çerçevelerle kolayca deneysel çalışmasını zorlaştırmaktadır. Bu sorunu gidermek için, MarkLLM, su işaretleme algoritmalarını uygulamak için genişletilebilir ve birleşik bir çerçeve sunan açık kaynaklı bir araç setidir ve aynı zamanda kullanıcı dostu arayüzler sağlar. Ayrıca, MarkLLM çerçevesi, bu çerçevelerin mekanizmalarının otomatik görselleştirmesini destekler, böylece bu modellerin anlaşılırlığını artırır. MarkLLM çerçevesi, performansını değerlendirmek için üç bakış açısını kapsayan 12 araçtan oluşan kapsamlı bir set sunar ve iki otomatik değerlendirme pipeline’ı sağlar.
MarkLLM: Büyük Dil Modelleri için Su İşaretleme Araç Seti
Büyük dil modeli çerçevelerinin ortaya çıkışı, LLaMA, GPT-4, ChatGPT gibi, AI modellerinin belirli görevleri gerçekleştirmesini önemli ölçüde geliştirmiştir, bu görevler arasında yaratıcı yazma, içerik anlaşma, oluşum geri çağırma ve daha fazlası bulunur. Ancak, büyük dil modellerinin výjeli yetenekleriyle birlikte, akademik makale hayalet yazma, LLM tarafından üretilen sahte haberler ve tasvirler, ve bireysel taklit gibi riskler de ortaya çıkmıştır. Bu risklerle başa çıkmak için, LLM tarafından üretilen metni insan metninden ayırt edebilecek güvenilir yöntemlerin geliştirilmesi çok önemlidir, bu da dijital iletişimin gerçekliğini sağlamak ve yanlış bilginin yayılmasını önlemek için gereklidir. Son yıllarda, LLM su işaretleme, LLM tarafından üretilen içerikleri insan içeriklerinden ayırt etmenin vaadedici bir çözümü olarak önerilmiştir ve metin oluşturma sırasında özel özellikler eklenerek, LLM çıktıları özel olarak tasarlanmış dedektörler tarafından benzersiz olarak tanımlanabilir. Ancak, LLM su işaretleme çerçevelerinin çeşitliliği ve algoritmalarının karmaşıklığı, değerlendirme ölçütlerinin ve bakış açılarının çeşitliliği, bu çerçevelerle deneysel çalışmayı zorlaştırmıştır.
Bu boşluğu doldurmak için, MarkLLM çerçevesi aşağıdaki katkıları amaçlar. MarkLLM, algoritmaları yüklemek, su işaretleme metni oluşturmak, tespit işlemlerini gerçekleştirmek ve görselleştirme için veri toplamak için tutarlı ve kullanıcı dostu arayüzler sağlar. Büyük su işaretleme algoritma aileleri için özel görselleştirme çözümleri sunar, böylece kullanıcılar farklı konfigürasyonlarda ve gerçek dünya örneklerinde nasıl çalıştıklarını görebilir. Araç seti, detectability, dayanıklılık ve metin kalitesi etkisini ele alan 12 araçtan oluşan kapsamlı bir değerlendirme modülünü içerir. Ayrıca, kullanıcıların veri setlerini, modellerini, değerlendirme ölçütlerini ve saldırılarını özelleştirebilecekleri iki tür otomatik değerlendirme pipeline’ı sağlar, böylece esnek ve kapsamlı değerlendirmeler yapılabilir. Modüler, gevşek bağlı bir mimari ile tasarlanan MarkLLM, ölçeklenebilirliği ve esnekliği artırır. Bu tasarım seçimi, yeni algoritmaların, yenilikçi görselleştirme tekniklerinin ve değerlendirme araç setinin genişletilmesini destekler.
Çok sayıda su işaretleme algoritması önerilmiştir, ancak benzersiz uygulama yaklaşımları genellikle standartlaştırma yerine belirli gereksinimlere öncelik verir, bu da beberapa sorunlara neden olur
- Sınıflandırma Tasarımı Standartlaşması Eksikliği: Bu, mevcut yöntemleri optimize etme veya genişletme için önemli çaba gerektirir, çünkü sınıflandırma tasarımları yeterince standartlaştırılmamıştır.
- Üst Düzey Arayüzlerin Birlikteliği Eksikliği: Tutarsız arayüzler, farklı algoritmaların toplu işlemlerini ve çoğaltılmasını zahmetli ve emek yoğun hale getirir.
- Kod Standardı Sorunları: Sorunlar arasında, birden fazla kod segmentinde ayarları değiştirmek, tutarlı belgelendirme eksikliği ve hatalı hata işleme bulunur, bu da özelleştirmeyi ve etkili kullanımı zorlaştırır.
Bu sorunları gidermek için, araç setimiz, çeşitli devlet-sanat algoritmalarını esnek konfigürasyonlarda çalıştırabilen birleşik bir uygulama çerçevesi sağlar. Ayrıca, gelecekteki genişletmeleri mümkün kılan dikkatli bir şekilde tasarlanmış sınıf yapısı sunar. Aşağıdaki şekil, bu birleşik uygulama çerçevesinin tasarımını gösterir.
Çerçevenin dağıtımcı tasarımının sayesinde, geliştiriciler herhangi bir su işaretleme algoritma sınıfına özel üst düzey arayüzler ekleyebilir, diğer algoritmaları etkileme endişesi olmadan.
MarkLLM: Mimari ve Yöntem
LLM su işaretleme teknikleri temel olarak iki kategoriye ayrılır: KGW Ailesi ve Christ Ailesi. KGW Ailesi, büyük dil modelinin ürettiği logitleri değiştirerek, önceki token temelinde sözcüğü yeşil liste ve kırmızı liste olarak kategorize ederek su işaretleme çıktısı oluşturur. Metin oluşturma sırasında, yeşil liste tokenlerinin logitlerine önyargı eklenir ve bu tokenler üretilen metinde tercih edilir. Yeşil kelimelerin oranından hesaplanan bir istatistiksel ölçüt belirlenir ve su işaretleme yapılmış ve yapılmamış metinleri ayırt etmek için bir eşik değer kurulur. KGW yönteminin geliştirmeleri arasında, geliştirilmiş liste bölümlendirme, daha iyi logit manipülasyonu, artan su işareti bilgi kapasitesi, su işareti kaldırma saldırılarına direnç ve su işaretleme públicosunu tespit etme yeteneği bulunur.
Öte yandan, Christ Ailesi, büyük dil modelinin metin oluşturma sırasında örnek alma işlemini değiştirerek, tokenlerin seçilme şeklini değiştirerek su işaretleme ekler. Her iki su işaretleme ailesi de, su işaretleme tespit edilebilirliği ile metin kalitesi arasında denge kurmayı amaçlar ve değişken entropi ayarlarında dayanıklılık, su işareti bilgi kapasitesinin artırılması ve kaldırma girişimlerine karşı koruma gibi zorlukları ele alır. Son araştırmalar, liste bölümlendirmesinin ve logit manipülasyonunun iyileştirilmesi, su işareti bilgi kapasitesinin artırılması, su işareti kaldırma yöntemlerinin geliştirilmesi ve públicosu tespitin ermögülmesi üzerine odaklanmıştır. Sonuç olarak, LLM su işaretleme, büyük dil modellerinin etik ve sorumlu kullanımını sağlamak için çok önemlidir ve LLM tarafından üretilen metni izlemek ve doğrulamak için bir yöntem sağlar. KGW ve Christ Aileleri, her biri benzersiz güçlere ve uygulamalara sahip olan iki farklı yaklaşımı sunar ve sürekli olarak devam eden araştırmalar ve yenilikler yoluyla gelişmektedir.
Otomatik Kapsamlı Değerlendirme
LLM su işaretleme algoritmalarını değerlendirmek karmaşık bir görevdir. İlk olarak, çeşitli yönleri dikkate almak gerekir, bunlar arasında su işaretleme tespit edilebilirliği, değiştirme karşı dayanıklılık ve metin kalitesi etkisi bulunur. İkinci olarak, her bakış açisinden değerlendirmeler farklı ölçütler, saldırı senaryoları ve görevler gerektirebilir. Ayrıca, bir değerlendirmenin gerçekleştirilmesi genellikle birden fazla adıma ihtiyaç duyar, bunlar arasında model ve veri seti seçimi, su işaretleme metni oluşturma, işleme, su işaretleme tespiti, metin değiştirme ve ölçüt hesaplama bulunur. MarkLLM, LLM su işaretleme algoritmalarının kolay ve kapsamlı bir şekilde değerlendirilmesini sağlamak için, üç bakış açısını kapsayan 12 araçtan oluşan bir set sunar ve iki tür otomatik demo pipeline’ı sağlar.
Tespit edilebilirlik açısından, çoğu su işaretleme algoritması sonunda su işaretleme yapılmış ve yapılmamış metinleri ayırt etmek için bir eşik değer belirleme gerektirir. Sabit bir eşik değer kullanarak temel bir başarı oranı hesaplayıcısı sağlar ve ayrıca eşik seçimini en iyi F1 puanına veya kullanıcı tarafından belirtilen hedef yanlış pozitif oranına (FPR) göre optimize eden bir hesaplayıcı sunar.
Dayanıklılık açısından, MarkLLM üç tür kelime düzeyinde metin değiştirme saldırısı sunar: belirli bir oranda rastgele kelime silme, WordNet kullanarak rastgele eşanlamlı kelime ikamesi ve BERT kullanarak bağlam bilinci eşanlamlı kelime ikamesi. Ayrıca, iki tür belge düzeyinde metin değiştirme saldırısı sağlar: OpenAI API veya Dipper modeli kullanarak bağlamı yeniden yazma. Metin kalitesi açısından, MarkLLM iki doğrudan analiz aracı sunar: akıcılık ölçmek için bir karmaşıklık hesaplayıcısı ve metin çeşitliliği değerlendirmek için bir çeşitlilik hesaplayıcısı. Su işaretleme’nin belirli alt görevlerde metin faydası üzerindeki etkisini analiz etmek için, makine çevirisi görevleri için bir BLEU hesaplayıcısı ve kod oluşturma görevleri için bir geçerlilik yargıcı sağlar. Ayrıca, su işaretleme’nin metin kalitesi üzerindeki etkisini karşılaştırmak için kullanılan mevcut yöntemler arasında, daha güçlü bir LLM kullanarak yargılama bulunur, MarkLLM ayrıca bir GPT ayrımcı sunar, GPT-4 kullanarak metin kalitesini karşılaştırır.
Değerlendirme Pipeline’ları
LLM su işaretleme algoritmalarının otomatik değerlendirilmesini sağlamak için, MarkLLM iki değerlendirme pipeline’ı sağlar: biri su işaretleme tespit edilebilirliğini saldırılar ile ve saldırılar olmadan değerlendirmek için, diğeri ise bu algoritmaların metin kalitesi üzerindeki etkisini analiz etmek için. Bu süreçte, iki pipeline’ı uygulamış bulunmaktayız: WMDetect3 ve UWMDetect4. Aralarındaki temel fark, metin oluşturma aşamasındadır. İlki, su işaretleme algoritmasındaki generate_watermarked_text metodunu kullanmayı gerektirir, ikincisi ise metni doğrudan bir veri setinden almayı veya generate_unwatermarked_text metodunu çağırmayı belirlemek için text_source parametresine bağlıdır.
Su işaretleme’nin metin kalitesi üzerindeki etkisini değerlendirmek için, su işaretleme yapılmış ve yapılmamış metin çiftleri oluşturulur. Metinler, diğer gerekli girdilerle birlikte, metin kalitesi analizcisi olarak belirlenmiş bir araçla işlenir ve ayrıntılı analiz ve karşılaştırma sonuçları üretilir. Bu süreçte, üç farklı değerlendirme senaryosu için üç pipeline’ı uygulamış bulunmaktayız:
- DirectQual.5: Bu pipeline, su işaretleme yapılmış metinlerin özelliklerini doğrudan su işaretleme yapılmamış metinlerin özellikleriyle karşılaştırarak metin kalitesini analiz etmek için tasarlanmıştır. Karmaşıklık (PPL) ve log çeşitlilik gibi ölçümleri değerlendirir, harici referans metinlerine gerek duyulmaz.
- RefQual.6: Bu pipeline, su işaretleme yapılmış ve yapılmamış metinleri ortak bir referans metniyle karşılaştırarak metin kalitesini değerlendirir. Referans metnine benzerlik veya sapma derecesini ölçer, bu da makine çevirisi ve kod oluşturma gibi belirli alt görevlerde metin kalitesini değerlendirmek için idealdir.
- ExDisQual.7: Bu pipeline, su işaretleme yapılmış ve yapılmamış metinlerin kalitesini değerlendirmek için GPT-4 (OpenAI, 2023) gibi harici bir yargıcı kullanır. Ayrımcı, metinleri kullanıcı tarafından sağlanan görev açıklamalarına dayanarak değerlendirir, su işaretleme’nin metin kalitesi üzerindeki olası bozulma veya korunmayı belirler. Bu yöntem, su işaretleme’nin ince etkilerini AI tabanlı olarak analiz etmek gerektiğinde özellikle değerlidir.
MarkLLM: Deneysel Çalışmalar ve Sonuçlar
Performansını değerlendirmek için, MarkLLM çerçevesi dokuz farklı algoritma üzerinde değerlendirmeler gerçekleştirir ve bunların metin kalitesi üzerindeki etkisini, dayanıklılığını ve tespit edilebilirliğini değerlendirir.

Yukarıdaki tablo, MarkLLM’de desteklenen dokuz algoritmanın tespit edilebilirlik değerlendirmesi sonuçlarını içerir. Dinamik eşik ayarlaması, su işaretleme tespit edilebilirliğini değerlendirmek için kullanılır, üç ayar sağlanır: %10 hedef FPR için, %1 hedef FPR için ve en iyi F1 puanı performansı için. 200 su işaretleme yapılmış metin oluşturulur, 200 su işaretleme yapılmamış metin ise negatif örnekler olarak kullanılır. %10 ve %1 FPR için dinamik eşik ayarlamaları altında TPR ve F1 puanı yanı sıra optimal performans altında TPR, TNR, FPR, FNR, P, R, F1, ACC sağlar. Aşağıdaki tablo, MarkLLM’de desteklenen dokuz algoritmanın dayanıklılık değerlendirmesi sonuçlarını içerir. Her saldırı için 200 su işaretleme yapılmış metin oluşturulur ve daha sonra değiştirilir, ayrıca 200 su işaretleme yapılmamış metin negatif örnekler olarak kullanılır. Her durum altında optimal performans altında TPR ve F1 puanı raporlarız.

Son Düşünceler
Bu makalede, MarkLLM’i, su işaretleme algoritmalarını uygulamak için genişletilebilir ve birleşik bir çerçeve sunan ve aynı zamanda kullanıcı dostu arayüzler sağlayan açık kaynaklı bir araç setini tanıttık. Ayrıca, MarkLLM çerçevesi, bu çerçevelerin mekanizmalarının otomatik görselleştirmesini destekler, böylece bu modellerin anlaşılırlığını artırır. MarkLLM çerçevesi, performansını değerlendirmek için üç bakış açısını kapsayan 12 araçtan oluşan kapsamlı bir set sunar ve iki otomatik değerlendirme pipeline’ı sağlar.












