Anderson’un Açısı

AI Model Sansürünün Gerçek Bir Baskısı Ne Zaman Gelir?

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
Screen capture from The Matrix (1999), featuring 'warez' on optical media, hidden inside a book, about to be sold to a willing buyer. © Warner Bros. Used for commentary and illustrative purposes.

1995–2010 yılları arasındaki warez sahnesini hatırlayacak kadar eskiyseniz, büyük miktarda kırılmış yazılım ve kopyalanmış filmlerin (sokaktan toptan alınan ya da yüksek hızlı geniş bant sayesinde devasa ve yüksek hacimli indirmelerin mümkün olduğu dönemde sıradan korsanlar tarafından bir araya getirilen) birden çok, ağırlıkla çalışan DVD koleksiyonlarında biriktiği zaman, ‘sansürsüz’ açık kaynak AI modellerinin ortaya çıkan sahnesi tanıdık bir tını taşıyabilir.

From the 'golden age' of casual street trade in software and movies. Credit – Shankar.s. 'Pirated DVDs at PP street market' - https://www.flickr.com/photos/shankaronline/9163248097/in/photostream/ License - https://creativecommons.org/licenses/by/2.0/deed.en

Yazılım ve filmlerdeki gayri resmi sokak ticaretinin ‘altın çağı’ndan. Kredi – Shankar.s. ‘PP sokak pazarında korsan DVD’ler’Kaynak / Lisans

O zamanlar, yazılım kiralamanın yaygın bir tüketici modeli haline gelmesinden önce, uygulamaları kırmak için ortaya çıkan küçük ama seçkin bir ‘sahne’ yazılım meraklıları grubu, bu uygulamaları ‘warez’ haber gruplarının ve daha sonra torrent gruplarının vahşi ortamına serbest bırakıyordu. Bu kısıtlamalar aşılması zor ya da önemsiz olabilirdi, ancak bir kez serbest bırakıldıklarında ihlaller genellikle silinmezdi.

Şu anda açık kaynak Büyük Dil Modelleri (LLM’ler) ile tam da bu yaşanıyor; bu modeller rutin olarak ve büyük ölçekte, içinde yerleşik güvenlik filtrelerinden arındırılıyor ve ardından bu sansürsüz modeller o kadar çok yerde paylaşılıyor ki, ‘kırma’ kaynağını kapatmak bile modellerin erişilebilirliğini etkilemiyor.

Yardımcı mı Yoksa Zararlı mı

Soru şu: bu faaliyetleri hangi açıdan görmek istiyorsunuz? Warez sahnesinin aksine, 20‑30 yıl önce küçük yazılım üreticilerinin maruz kaldığı gibi açıkça gelir kaybına uğrayan kimse yok.

Kesinlikle, orijinal lisans koşulları çoğu zaman ihlal ediliyor, bu tür durumlarda*; ancak Black Forest Labs gibi genAI model üreticilerinin kısmi ağırlık sürümlerinin aksine, orijinal dağıtıcılar ‘düşük kalite’ sürümleri daha yetenekli yalnızca API modellerine yönlendirme yolu olarak görmüyor; tam modelleri doğrudan piyasaya sürüyorlar.

Çoğu durumda, bu ilk sürümleri yerel olarak çalıştırabilecek neredeyse kimse yok, çünkü 16‑24 GB VRAM kapasiteli iyi donanımlı GPU kartları için bile parametre sayısı çok yüksek.

Bu nedenle, ilk sürümler model nicelleştirme yoluyla ve ağırlıkların GGUF, AWQ, PTQ, EXL2 gibi daha hafif sürümlere ya da Apple odaklı MLX’e dönüştürülmesiyle, tüketici donanımında çalışabilecek ince sürümlere hızla dönüştürülüyor.

Bunlar orijinal tam modeller kadar performanslı olmasa da (genellikle çeşitli GPU çiftliklerinden ticari olarak sunulur), en azından kullanıcının kontrolünde ve ‘daha iyi’ modelin yapamadığı şekilde o kullanıcıya özgü özelleştirilebilir.

İstediğiniz Şekilde

Bu yöntemlerin bir kısmı bariz bir şekilde meşrudur ve genellikle üst lisans kapsamındadır; örneğin ince ayar (fine‑tuning) sayesinde modelin ağırlıkları, kullanıcının eklediği belirli bir görev ya da alana yönlendirilir. Böyle bir durumda, sabit disk alanı yeterli ise, bir açık kaynak modelinin birden çok örneğini farklı görevler için ince ayar yaparak, üst modelin ‘İsviçre çakısı’ gibi tek bir tam‑ağırlıklı model yerine, özel, geleneksel araçlar gibi bir diziye dönüştürebilirsiniz.

Ayrıca, uyumlu ayarlara sahip ancak farklı eğitim verilerine sahip modeller birleştirilebilir; ya da hafif LoRA filtreleri aracılığıyla modele ek yetenekler eklenebilir ve ince ayar yoluyla temel modelin özgün yeteneklerini zayıflatma riski taşımadan.

Bununla birlikte, birçok kullanıcının en çok ilgisini çeken ve yukarıdaki yöntemlerden daha da kolaylaşan değişiklik, söz konusu güvenlik filtrelerinin ya da koruma duvarlarının kaldırılmasıdır.

Bu, pornografik içerik ve kötü amaçlı yazılım üretimi gibi çıktılar veren modellerin ortaya çıkmasına izin verse de, birçok kullanıcının aşırı kısıtlayıcı (ve sık sık hataya açık) olarak gördüğü sınırlamaları da ortadan kaldırır.

One of many hilarious examples of Llama-2-7b-chat refusing reasonable requests on safety grounds, available at the source URL. Source - https://www.lesswrong.com/posts/pYcEhoAoPfHhgJ8YC/refusal-mechanisms-initial-experiments-with-llama-2-7b-chat

Güvenlik gerekçesiyle makul istekleri reddeden Llama-2-7b-chat’in birçok komik örneklerinden biri, kaynak URL’de bulunabilir. Kaynak

Heretik

Son zamanlarda model sansürünü devrim niteliğinde değiştiren Heretik yazılımı söz konusu olduğunda, modellerin eğilimli olduğu ‘süslü’ ve ayrıntılı üslup seviyesini düşürmek bile mümkün.

Heretic gets to work on decensoring gpt-oss, though admittedly on a very well-specced machine that's unlikely to grace the average consumer's home – though it could be rented cheaply online, for the necessary duration of the process. Source - https://github.com/p-e-w/heretic

Heretik, gpt-oss’un sansürünü kaldırmak için çalışıyor, ancak bu, ortalama bir tüketicinin evine pek girmeyecek kadar yüksek özellikli bir makinede gerçekleşiyor – yine de süreç için gerekli süre boyunca çevrimiçi olarak uygun fiyatla kiralanabilir. Kaynak

Daha da önemlisi, reddetmeleri bastıran bir ‘abliteration’ (yok etme) otomatik olarak arayan ve modelin özgün davranışına verilen zararı en aza indiren Heretik, son kullanıcı açısından sansür kaldırma görevini nispeten zor bir işi tek bir komuta indiriyor.

Yukarıdaki ekran görüntüsünden de görebileceğiniz gibi, Heretik, tüketici evlerinde bulunması pek olası olmayan daha güçlü bir GPU’dan faydalanıyor; ancak kullanıcıların bunu ev donanımında çalıştırması gerekmiyor, tıpkı 2002’de kişisel olarak yazılım kırmak zorunda kalanlara benzer şekilde; warez günlerinde olduğu gibi, bu tür donanıma erişimi olan (genellikle ticari olmayan) sahne sağlayıcıları, soruna bir miktar token harcamaya istekli olarak jailbreak’i gerçekleştirip sansürsüz modeli sahneye yayınlıyor.

Hedefte

Bir ‘sorgulanabilir’ dijital eylem zor olmaktan çıktığında, genellikle bir gecelik yetenek sıçraması (Napster ya da PopCornTime gibi) sayesinde hem faaliyetin kendisi hem de onu sınırlamaya yönelik ‘resmi’ ilgi aniden artar.

Ollama gibi platformların artan popülaritesi ve kullanım kolaylığıyla birleştiğinde, Heretik, tamamen ‘aptal kanıtlı’ bir yöntem henüz mevcut olmasa da, teknik olmayan kullanıcıların sansürsüz modele erişimini mümkün kılmaya başlıyor.

Bu da beni önceki soruma geri getiriyor; bu faaliyet bir ‘sorun’ teşkil edip etmediği. Dün Arxiv’de çıkan bir makale, teknoloji tüketici özgürlüklerine yönelik geri çekilme ve sıkılaşma trendlerine dayanarak, sansür kaldırmanın artan bir ilgi göreceğini ve dünya çapında daha fazla kısıtlayıcı mevzuat ortaya çıkacağını gösteriyor.

Yeni makale, 10a Labs’tan bir rapor, sansür kaldırma hareketini olumsuz bir çerçeveye oturtuyor ve tarihsel olarak azınlık istismar vakalarını, mevcut trendlerin de öngördüğü gibi, kısıtlamalara yol açacak şekilde sunuyor.

Çalışma, sansürsüz modellerin yayınlanıp yeniden dağıtılmasından sonra neler olduğunu izliyor ve sansürsüz modellere entegre olan, öneren ya da varsayılan 1.643 GitHub uygulamasını tespit etti.

Söz konusu modeller, genel amaçlı sohbet botları ve belge işleme araçlarından, NSFW rol yapma ve hikaye anlatımına; açık içerik hizmetlerinden, hackleme ve saldırgan güvenlik araçlarına; dolandırıcılık uygulamaları ve kötü amaçlı yazılım üreticilerine kadar çeşitlilik gösteriyor ve çalışmaya göre yayınların %25’i ‘açıkça kötü niyetli’ olarak sınıflandırılıyor:

Breakdown of how uncensored AI models are being used after release. The study traced 1,643 GitHub applications that integrate, recommend or default to models whose safety restrictions have been removed, finding that 37% were general-purpose uncensored chatbots, while cybersecurity and document-processing tools each accounted for 16%, alongside smaller categories spanning voice assistants, NSFW roleplay, creative writing, coding and other uses. The paper found that around 25% of the applications identified could be classified as 'explicitly malicious'.

Sansürsüz AI modellerinin yayınlandıktan sonra nasıl kullanıldığına dair dağılım. Çalışma, güvenlik kısıtlamaları kaldırılmış modellere entegre olan, öneren ya da varsayılan 1.643 GitHub uygulamasını izledi; %37’sinin genel amaçlı sansürsüz sohbet botları, siber güvenlik ve belge işleme araçlarının her birinin %16’sını oluşturduğunu, ses asistanları, NSFW rol yapma, yaratıcı yazı, kodlama ve diğer kullanımları kapsayan daha küçük kategorilerle birlikte buldu. Çalışma, tespit edilen uygulamaların yaklaşık %25’inin ‘açıkça kötü niyetli’ olarak sınıflandırılabileceğini ortaya koydu. Kaynak

Birleşik Krallık’ın yeni yürürlüğe koyduğu web erişim kısıtlamaları (ve bunları aşan VPN erişimini de kısıtlama niyetinin şu anda durdurulması); Kaliforniya’nın 2027’de çoğu işletim sisteminin kullanıcıların yaş aralıklarını toplamasını ve uygulamalara sağlamasını zorunlu kılması; AB’nin yetişkin çevrimiçi içeriğe erişim için yaş doğrulama planı; ve Avustralya’nın 16 yaş altı sosyal medya hesaplarını yasaklaması ışığında, yeni makale, artan ilginin nihayetinde artan denetim, düzenleme ve muhtemelen seçici ya da tam yasaklara yol açtığı modeline uymakta.

Bunun Burada Olmayacağını Düşünmek

Hayır, burada kesinlikle gerçekleşebilir; bunun bir kısmı yeni çalışmanın yazarları tarafından tahmin edilen yüksek oranda kötü niyetli kullanım yüzdesi; ve tartışmalı olarak, kontrollerin yerel olarak çalışan AI eğilimine ek kısıtlamalar getirmesi, hükümetler ve kurumlar tarafından bir tehdit olarak algılanabilir – özellikle modeller bağlarından kurtulduğunda bu durum daha da belirginleşir.

Sansür kaldırma faaliyetlerini ‘NSFW çıktıyı ve kötü niyetli hacklemeyi kolaylaştırma’ olarak çerçevelendirmek, sansür kaldırmayı yanlış bir ikili önerme haline getirir: kötü amaçlarla kullanılabildiği için düzenlemeye tabi olmalıdır. Pratikte, bu işlevi tamamen yasaklamaktan başka gerçekçi bir düzenleme yolu görünmüyor, çünkü çok sayıda olası kullanım durumu var.

Ayrıca, bir LLM’nin sansürsüzleştirilmesinin (örneğin) CSAM kurgu üretmesine izin verdiği durumlarda, kısıtlayıcı düzenleme kesin bir önerme gibi görünebilir; çünkü buna karşı çıkanlar, sansürsüz modelin kötüye kullanımını destekliyor gibi algılanabilir, makul kullanımını değil.

Bu, ince ayar yapılmış ya da LoRA etkili bir modelin, kullanıcının istediği belirli bir alanı çok daha etkili bir şekilde üretebileceği gerçeğini göz ardı eder; çünkü modelin temel ağırlıkları göreve doğru o kadar bozulur ki, önceden yerleşik korumaları tamamen etkisiz hale getirir.

Kolaylık Üzerine Her Şey

Kullanım kolaylığı, ölçekli benimsenmeyi tetikler ve ölçekli benimsenme ise hükümetleri yasa yapmaya (kamu baskı grupları, sektör lobicileri ya da hükümetler arası baskı yoluyla) zorlar.

İnce ayar ve LoRA’lar, sadece bir FOSS temel modelinin kilidini açmaktan çok daha hedefli sonuçlar elde edebilir, ancak bu yöntemler belli bir disiplin ve çaba gerektirir.

Bir sansürsüz/nicelleştirilmiş modeli yerel olarak çalıştırmak gerçekten birkaç tıklama meselesi haline geldiğinde (kullanıcı büyük olasılıkla Heretik ile kendisi kırmak yerine ‘önceden serbest bırakılmış’ bir modeli indirir), faaliyet geek camiasının gölgesinden çıkar ve kamusal alana girer; burada kötüye kullanımları muhtemelen siyasi tartışma konusu olur.

Bu yaz NVIDIA, ağır teknoloji ortaklarıyla birlikte açık kaynak modeller üzerindeki hükümet kısıtlamalarını önceden engellemek için bir açık mektup yayımladı; bu mektup, bir teknolojinin azınlık istismarlarının potansiyel genel faydasını tehlikeye atmaması gerektiğini bir kez daha savunuyor. Ancak bu tutum son yıllarda popüler olmadı.

*Model oluşturucularının kullanıcı etkinliğini kısıtlama konusundaki samimi isteklerinin gerçek olup olmadığı sık sık sorgulanıyor; koruma duvarı korumaları bile ‘sahne gösterisi’ olarak reddediliyor.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai