Anderson’un Açısı

Kişiselleştirilmiş Dillerin Oluşturulması Kolaydır – ve Tespit Edilmesi Daha Zordur

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
A robot hand at large in an exam room - Flux, Krita (AI GENERATED).

Açık kaynaklı ChatGPT klonları, büyük ölçekte ve sınırlı veya hiç uzmanlık olmadan ince ayarlanabilir, böylece “özel” dil modelleri oluşturulabilir ve bunlar tespit edilemeyebilir. Çoğu araç, bu modellerin nereden geldiğini veya ne için eğitildiğini belirleyemez, böylece öğrenciler ve diğer kullanıcılar AI metinlerini yakalanmadan oluşturabilirler; ancak yeni bir yöntem, bu gizli varyantları, modellerin çıktılarındaki paylaşılan “aile özelliklerini” tespit ederek belirleyebileceğini iddia etmektedir.

 

Kanada’dan yapılan bir yeni çalışmaya göre, ChatGPT’ye benzer kullanıcıya özel AI sohbet modelleri, insan yazımına çok benzeyen sosyal medya içeriği üretebilmekte ve hem devlet-sanatı tespit algoritmalarını hem de insanları kandırmaktadır.

Makalede şöyle deniyor:

‘Gerçekten motive olmuş bir saldırgan, muhtemelen belirli bir stil ve kullanım durumu için bir modeli ince ayarlayacaktır, çünkü bunu yapmak ucuz ve kolaydır. Asgari çabayla, zamanla ve parayla, daha gerçekçi sosyal medya tweet’leri üretebilen, hem dil özelliklerine hem de tespit doğruluğuna göre ince ayarlanmış jeneratörler ürettik ve bunları insan anotasyonları ile doğruladık.’

Yazarlar, bu tür özel modellerin yalnızca kısa sosyal medya içeriği ile sınırlı olmadığını vurgulamaktadır:

‘Sosyal medya上的 AI içeriğinin yayılması ve astroturfing ve etki kampanyalarının riskleri ile motive olmuş olsak da, bulgularımızın tüm metin alanlarına uzandığını vurguluyoruz.

‘Gerçekten, stil özgüllüğü için model eğitimi, genişletilebilen bir yöntemdir ve muhtemelen birçok jeneratif AI kullanıcısı tarafından zaten kullanılmaktadır – bu da mevcut AI tespitinin gerçek dünyada araştırma laboratuvarında olduğu kadar etkili olup olmadığını sorgulamaktadır.’

Bu makaleye göre, bu özel dil modellerini oluşturmak için kullanılan yöntem, ince ayarlamadır, burada kullanıcılar kendi hedef verilerini toplar ve bunları artan sayıda kolay kullanılan ve ucuz online eğitim araçlarına besler.

Örneğin, popüler depo Hugging Face, Büyük Dil Modeli (LLM) ince ayarlamasını basitleştirilmiş bir arayüz aracılığıyla AutoTrain Gelişmiş sistemiyle sunar, bu da online bir GPU için birkaç dolar veya yerel olarak ücretsiz olarak çalıştırılabilir, eğer kullanıcı yeterli donanıma sahipse:

Hugging Face AutoTrain sisteminin sunduğu çeşitli GPU'lar için farklı fiyat yapıları. Kaynak: https://huggingface.co/spaces/autotrain-projects/autotrain-advanced?duplicate=true

Hugging Face AutoTrain sisteminin sunduğu çeşitli GPU’lar için farklı fiyat yapıları. Kaynak: https://huggingface.co/spaces/autotrain-projects/autotrain-advanced?duplicate=true

Diğer basitleştirilmiş yöntemler ve platformlar arasında Axolotl, Unsloth ve daha yetenekli ancak daha talepkar TorchTune bulunur.

Bir kullanım örneği, kendi gerçek tarihi makalelerini eğitim verisi olarak kullanarak etkili bir açık kaynak modeli olan Mistral serisini ince ayarlayan bir öğrenci olabilir.

Bir modeli ince ayarlamak genellikle modelin performansını ek eğitim verilerine doğru eğip genel performansını düşürür; ancak “kişiselleştirilmiş” modeller, ChatGPT gibi sistemlerin giderek daha ayırt edilebilir çıktısını “AI’den arındırarak” kullanıcının kendi tarihsel stilini yansıtabilir (ve daha da gerçekçi olması için, kendi eksikliklerini de yansıtabilir).

Ancak, bir modeli, örneğin belirli bir üniversite bölümünün dersleriyle ilgili dar bir görev veya görevler kümesi için özel olarak eğitebilirsiniz. Bu kadar spesifik bir model, bir ChatGPT gibi genel amaçlı LLM’den daha derin bir anlayışa sahip olacaktır ve muhtemelen $10-20’den daha az maliyetle eğitilebilir.

LLM Buzdağı

Bu uygulamanın ölçeğini söylemek zor. Çeşitli sosyal medya platformlarında, son zamanlarda LLM ince ayarlamasının birçok iş odaklı örneğiyle karşılaştım – bir yıl öncesine göre kesinlikle daha fazla; bir durumda, bir şirket kendi yayınlanmış düşünce liderliği parçalarını kendi dil modeline eğitti ve bu, yeni bir müşteriyle yapılan bir Zoom görüşmesini neredeyse tek geçişte bir B2B gönderisine dönüştürebildi:

Bir bu tür model, çiftli veri (örneklerden önce ve sonra, büyük ölçekte) gerektirir, oysa belirli bir yazarın özelliklerinin kişiselleştirilmiş bir “parıltısı” oluşturmak daha kolay bir görevdir, bu daha çok stil aktarımına benzer.

Bu, gizli bir takipçidir (gizli AI kullanımına ilişkin birçok başlık ve akademik çalışma olmasına rağmen), burada rakamlar mevcut değildir, ancak bu faaliyetin olası kullanıcılarının güçlü bir motivasyonu olduğu ve bu faaliyetin mümkün ve ucuz olduğu konusunda ortak bir anlayış vardır: hedef faaliyet mümkündür ve ucuzdur ve potansiyel kullanıcılar güçlü bir motivasyona sahiptir.

Sadece en “basitleştirilmiş” online ince ayar sistemlerinde hala yeterli sürtünme vardır, bu nedenle “samimi olmayan” bir şekilde eğitilmiş ve kullanılan fine-tuned modellerin kullanımı hala nispeten niş bir kullanım durumudur – ancak kesinlikle geleneksel öğrenci yaratıcılığını aşmaktadır.

PhantomHunter

Bu, ilgilendiğimiz ana makaleye getirir – Çin’den yeni bir yaklaşım – PhantomHunter olarak adlandırılan bir çerçeve – ki bu, çeşitli teknikleri bir araya getirmekte ve fine-tuned dil modellerinin çıkışını tespit edebildiğini iddia etmektedir:

Sistem, spesifik fine-tuned modeli daha önce hiç karşılaşmamış olsa bile çalışmak üzere tasarlanmıştır, bunun yerine ince ayarlanma sürecinden kalan orijinal temel modelin kalıntı izlerini kullanır – yazarlar bunları “aile özellikleri” olarak adlandırmaktadır.

Testlerde, makale – PhantomHunter: Privately-Tuned LLM-Generated Text via Family-Aware Learning – güçlü tespit doğruluğunu bildirdi, sistem zero-shot GPT-4-mini değerlendirmesinde bir metin örneğini model ailesine geri takip etmekte rakiplerini geride bıraktı:

Bu, fine-tuned bir model ne kadar olursa, kökeni hakkında o kadar fazla bilgi verdiğini, özel ince ayarlamaların her zaman modelin kökenini maskelemediğini, aksine, doğru şekilde okunursa, oyunu veren tespit edilebilir bir parmak izi bırakabileceğini öne sürmektedir – en azından, her hafta gelen ilerlemelere kadar:

Makalede şöyle deniyor*:

‘[Makine tarafından oluşturulan metin] tespiti genellikle LLM tarafından oluşturulan ve insan tarafından yazılan metinleri ikili sınıflandırma yoluyla ayırt eder. Mevcut yöntemler ya LLM’ler arasında paylaşılan ortak metinsel özellikleri temsil öğrenimi kullanarak öğrenir ya da LLM’lerin iç sinyallerine dayanarak (örneğin, token olasılıkları) insan ve LLM metinleri arasında ayırt edilebilir metrikler tasarlar.

‘Her iki kategori için de testler, çoğunlukla kamu tarafından erişilebilen LLM’lerin verilerini kullanarak yürütülmüştür, kullanıcıların metin oluşturmak için kamu, hazır hizmetleri kullandıklarını varsayarak.

Bu durumun değişmekte olduğunu iddia ediyoruz. Açık kaynak LLM topluluğu ve HuggingFace ve LoRA (LoRA) gibi verimli LLM eğitimi teknikleri gibi platformların yardımıyla, özel veri setleriyle fine-tuned LLM’ler oluşturmak daha önce olduğundan çok daha kolay hale geldi.

‘Örneğin, HuggingFace’de 60.000’den fazla Llama tabanlı türetilmiş model vardır. Bilinmeyen bir korpus üzerinde özel olarak ince ayarlandıktan sonra, temel modellerin öğrenilmiş özellikleri değişebilir ve LLMGT dedektörleri başarısız olabilir, böylece kötü niyetli kullanıcıların yakalanmadan zararlı metinler oluşturabileceği yeni bir risk oluşturur.

‘Yeni bir zorluk ortaya çıkıyor: Özel olarak ayarlanmış açık kaynak LLM’ler tarafından oluşturulan metinleri nasıl tespit edebiliriz?

Yöntem ve Eğitim

PhantomHunter sistemi, bir aile-bilinçli öğrenme stratejisi kullanır, üç bileşenden oluşur: bir özellik çıkarıcı, bilinen temel modellerden olasılık çıktılarını yakalar; bir karşıt kodlayıcı aileleri ayırt etmek için eğitilir; ve (aşağıda ayrıntılı olarak açıklanmıştır) bir uzmanlar karışımı sınıflandırıcı yeni metin örneklerine aile etiketleri atar:

Sistem şeması. PhantomHunter, bir metin örneğini işlerken, önce birden fazla temel modelden olasılık özelliklerini çıkarır, bunları CNN ve dönüşümlü katmanlar kullanarak kodlar ve model ailesini tahmin eder, kapı ağırlıklarını hesaplar ve bir uzmanlar karışımı modülünü, metnin LLM tarafından oluşturulup oluşturulmadığını tahmin etmesi için yönlendirir. Eğitim sırasında, aileler arasındaki ayrımı iyileştirmek için karşıt bir kayıp uygulanır. Kaynak: https://arxiv.org/pdf/2506.15683

Sistem şeması. PhantomHunter, bir metin örneğini işlerken, önce birden fazla temel modelden olasılık özelliklerini çıkarır, bunları CNN ve dönüşümlü katmanlar kullanarak kodlar ve model ailesini tahmin eder, kapı ağırlıklarını hesaplar ve bir uzmanlar karışımı modülünü, metnin LLM tarafından oluşturulup oluşturulmadığını tahmin etmesi için yönlendirir. Eğitim sırasında, aileler arasındaki ayrımı iyileştirmek için karşıt bir kayıp uygulanır. Kaynak: https://arxiv.org/pdf/2506.15683

PhantomHunter, bir metni işlerken, önce birden fazla temel modelden olasılık özelliklerini çıkarır ve bu kalıpları bir sinir ağına besler, bu da her model ailesinin ayırt edici özelliklerini öğrenir.

Eğitim sırasında, sistem, aynı aileden metinleri birbirine ve farklı ailelerden metinleri birbirinden ayırt etmeyi öğrenir, bu da fine-tuned modellerle temel modeller arasındaki gizli bağlantılar tespit edilmesine yardımcı olur.

MOE

PhantomHunter, bir metnin insan tarafından yazılmış mı yoksa AI tarafından oluşturulmuş mu olduğunu belirlemek için bir uzmanlar karışımı sistemini kullanır, burada her “uzman”, belirli bir model ailesinden metinleri tespit etmek için ayarlanmıştır.

Sistem, metnin hangi aileye ait olabileceğini tahmin ettikten sonra, her uzmanın görüşüne ne kadar ağırlık vereceğine karar vermek için bu tahmini kullanır. Bu ağırlıklı görüşler daha sonra birleştirilir ve nihai karar verilir: AI veya insan.

Sistemin eğitimi, birden fazla hedefi içerir: model ailelerini tanımak; AI metnini insan metninden ayırt etmek; ve karşıt öğrenme yoluyla farklı aileleri ayırt etmek – bu hedefler, eğitimin sırasında ayarlanabilir parametreler aracılığıyla dengelenir.

Aileler boyunca paylaşılan kalıplara odaklanarak, PhantomHunter, daha önce hiç görmediği fine-tuned modelleri bile tespit edebilmelidir.

Veri ve Testler

Test verileri geliştirmek için yazarlar, iki yaygın akademik senaryoya odaklandı: yazma ve soru-cevap. Yazma için, 69.297 akademik makale özeti arşivden toplandı ve ana alanlara ayrıldı. Soru-cevap için, 2.062 soru-cevap çifti HC3 veri setinden üç konuda toplandı: ELI5; finans; ve tıp:

Veri kaynaklarının ve sayılarının listesi, çalışmada derlenen veriler.

Veri kaynaklarının ve sayılarının listesi, çalışmada derlenen veriler.

Toplamda, test için on iki model eğitildi. Üç temel model LLaMA-2 7B-Chat; Mistral 7B-Instruct-v0.1; ve Gemma 7B-it idi, bunlardan dokuz fine-tuned varyant oluşturuldu, her biri farklı bir alan veya yazar tarzını taklit etmek için uyarlandı, alan özgüllüğü için veri kullanılarak:

Değerlendirme veri setinin istatistikleri, 'FT Alanı' fine-tuning sırasında kullanılan alanı ve 'temel' fine-tuning olmadığını gösterir.

Değerlendirme veri setinin istatistikleri, ‘FT Alanı’ fine-tuning sırasında kullanılan alanı ve ‘temel’ fine-tuning olmadığını gösterir.

Bu nedenle, toplamda, üç temel model tam parametre ve LoRA teknikleri kullanılarak her biri iki kullanım senaryosunda üç farklı alanda fine-tuned edildi: akademik özeti yazma ve soru-cevap. Bilgisayar bilimindeki fine-tuned modeller yazıma yönelik testlerden çıkarıldı, finansla ilgili fine-tuned modeller ise soru-cevap değerlendirmelerinden çıkarıldı.

Karşılaştırılan diğer çerçeveler arasında RoBERTa; T5-Sentinel; SeqXGPT; DNA-GPT; DetectGPT; Fast-DetectGPT; ve DeTeCtive yer almaktadır.

PhantomHunter, iki tür sinir ağı katmanını kullandı: üç evrişimli katman yerel metin kalıplarını yakalamak için maksimum havuzlama ile ve iki dönüşümlü katman daha uzun menzilli ilişkileri modellemek için her biri dört dikkat başlığı ile:

Metinleri ayırt etmek için karşıt öğrenme kullanılır, bu da sistemi farklı model aileleri arasında ayrım yapmayı teşvik eder, sıcaklık parametresi 0.07 olarak ayarlanır.

Eğitim hedefi, üç kayıp terimini birleştirir: L1 (aile sınıflandırması için) ve L2 (ikili tespit için), her biri 1.0 ile ağırlıklı ve L3 (karşıt öğrenme için), 0.5 ile ağırlıklı.

Model, Adam ile 2e-5’lik bir öğrenme oranı ve 32’lik bir toplu işleme boyutu ile optimize edildi. Eğitim, en iyi performing kontrol noktası seçimi için bir doğrulama kümesi kullanılarak on tam dönem için gerçekleştirildi. Tüm deneyler, dört NVIDIA A100 GPU’su olan bir sunucuda gerçekleştirildi.

Kullanılan metrikler, her test alt kümesi için F1 puanı ve ticari dedektörlerle karşılaştırma için doğru pozitif oranını içeriyordu:

Görünmeyen fine-tuned dil modellerinin tespitinde F1 puanları. Her kategorideki en iyi iki sonuç kalın ve altı çizili olarak gösterilir. 'BFE' temel olasılık özelliğini çıkarmaya, 'CL' karşıt öğrenmeye ve 'MoE' uzmanlar karışımı modülüne karşılık gelir.

Görünmeyen fine-tuned dil modellerinin tespitinde F1 puanları. Her kategorideki en iyi iki sonuç kalın ve altı çizili olarak gösterilir. ‘BFE’ temel olasılık özelliğini çıkarmaya, ‘CL’ karşıt öğrenmeye ve ‘MoE’ uzmanlar karışımı modülüne karşılık gelir.

İlk testin sonuçları, yukarıdaki tabloda gösterilen, PhantomHunter’ın tüm temel sistemleri geride bıraktığını ve hem insan hem de makine tarafından oluşturulan metin için %90’ın üzerinde F1 puanları korurken, eğitimden dışlanan fine-tuned modellerin çıkışını bile tespit ettiğini göstermektedir.

Yazarlar şunları belirtiyorlar:

‘Tam ince ayar ile, PhantomHunter, her iki veri kümesinde de en iyi temel sistemi MacF1 puanında %3,65 ve %2,96 oranında iyileştirir; ve LoRA ince ayarlaması ile, iyileştirmeler sırasıyla %2,01 ve %6,09’dur.

‘Sonuç, PhantomHunter’ın görünmeyen fine-tuned LLM’ler tarafından oluşturulan metinleri tespit etme yeteneğinin gücünü göstermektedir.’

Ablasyon çalışmaları, PhantomHunter’ın her bir temel bileşeninin rolünü değerlendirmek için gerçekleştirildi. Bireysel bileşenler kaldırıldığında, özellikli çıkarıcı, karşıt kodlayıcı veya uzmanlar karışımı sınıflandırıcı, tutarlı bir şekilde doğrulukta bir düşüş观察 edildi, bu da mimarinin tüm parçaların koordinasyonuna bağlı olduğunu gösteriyor.

Yazarlar ayrıca, PhantomHunter’ın eğitim dağılımının ötesine genellemesini de incelediler ve eğitim sırasında hiç karşılaşılmayan temel modellerin çıkışlarına bile uygulanabileceğini tespit ettiler – bu, aile seviyesindeki imzaların fine-tuned varyantlar boyunca tespit edilebilir kaldığını öne sürmektedir.

Sonuç

Kullanıcı tarafından eğitilen jeneratif dil modellerinin lehine bir argüman, en azından bu küçük fine-tune’lar ve LoRA’ların, bir yazarın bireysel tadı ve tuhaflıklarını koruduğu, AI sohbet botlarının jenerik, SEO’ye odaklı dilinin, AI’nin önemli bir katkıda bulunduğu herhangi bir dilde dilin genericleştirilmesine karşı bir koruma sağladığıdır.

Kolej makalesinin değerinin düşürülmesi ve öğrencilerin artık devasa yazma oturumlarını AI kullanmadıklarını kanıtlamak için ekran kaydederek kaydetmeleri nedeniyle, daha fazla öğretmen, özellikle Avrupa dışında (oral sınavlar normalize edildiğinde), AI’nin metin sunularına alternatif olarak yüz yüze sınavları dikkate almaktadır. Daha yakın zamanda, el yazısı çalışmaya dönüş önerildi.

Her iki çözüm de, LLM dayalı bir deepfake silah yarışının tekrarına göre daha üstündür; ancak insan çabası ve dikkati pahasına, teknoloji kültürü bunları otomatikleştirmeye çalışmaktadır.

 

Lütfen bu konuda daha fazla ayrıntı için kaynak makalenin sonundaki bölümüne bakın.

* Yazarların iç metin referanslarını hiperlinklere dönüştürmektir. Vurgular yazarlara aittir, bana ait değildir.

İlk olarak 19 Haziran 2025 Perşembe günü yayınlandı.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai