Andersonův úhel

Jak dlouho potrvá, než úřady skutečně zasáhnou proti odstraňování cenzury z modelů AI?

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
Screen capture from The Matrix (1999), featuring 'warez' on optical media, hidden inside a book, about to be sold to a willing buyer. © Warner Bros. Used for commentary and illustrative purposes.

Pokud si pamatujete warezovou scénu z let přibližně 1995–2010, kdy se hromadily rozsáhlé sbírky prolomeného softwaru a zkopírovaných filmů na DVD — nakoupených ve velkém na ulici nebo sestavených příležitostnými piráty poté, co rychlý internet umožnil obrovská stahování — může vám nastupující svět „odcenzurovaných“ open-source modelů AI připadat povědomý.

Z „doby zlaté“ neformálního pouličního obchodu se softwarem a filmy. Autor: Shankar.s, „Pirated DVDs at PP street market“.

Než se pronájem softwaru stal běžným spotřebitelským modelem, vznikla malá elita nadšenců, která prolamovala aplikace a zveřejňovala je ve warezových diskusních skupinách a později přes torrenty. Ochrany mohly být těžké nebo triviální, ale jednou vypuštěné prolomení už zpravidla nešlo odstranit.

Totéž se nyní děje s otevřenými velkými jazykovými modely. Jejich naučené bezpečnostní filtry jsou běžně a ve velkém odstraňovány, načež se odcenzurované modely sdílejí na tolika místech, že uzavření původního zdroje nic nezmění.

Dobrodinec, nebo škůdce?

Otázkou je, jak tyto aktivity hodnotit. Na rozdíl od warezové scény není nikdo tak přímo připravován o příjem, jako mohli být menší výrobci softwaru před dvaceti či třiceti lety.

Původní licenční podmínky se v těchto případech často porušují.* Na rozdíl od částečných vydání vah výrobců typu Black Forest Labs však původní distributoři nepoužívají „horší“ verzi k prodeji silnějšího modelu dostupného jen přes API; vydávají celý model.

První verze téměř nikdo lokálně nespustí, protože mají příliš mnoho parametrů i pro dobře vybavené GPU s 16–24 GB VRAM.

Proto jsou rychle zmenšovány kvantizací a převodem vah do lehčích formátů, například GGUF, AWQ, PTQ, EXL2 nebo MLX od Applu, aby fungovaly na spotřebním hardwaru.

Nejsou tak výkonné jako plné originály, které se obvykle komerčně provozují na GPU farmách, ale uživatel je má pod kontrolou a může je osobně upravit způsoby, které „lepší“ model neumožňuje.

Podle vlastních představ

Některé úpravy jsou zcela legitimní a obvykle je dovoluje licence, například jemné doladění vah pro úkol nebo oblast dodanou uživatelem. Je-li dost místa, lze několik kopií otevřeného modelu doladit pro různé úkoly jako sadu specializovaných nástrojů místo jednoho plného „švýcarského nože“.

Lze také slučovat modely se slučitelným nastavením a odlišnými tréninkovými daty nebo přidávat schopnosti pomocí lehkých filtrů LoRA bez rizika, že doladění poškodí původní možnosti základního modelu.

Úpravou, která zajímá mnoho uživatelů nejvíce a je dnes snazší než předchozí metody, je však odstranění bezpečnostních filtrů neboli ochranných bariér.

Modely pak mohou vytvářet pornografický obsah nebo pomáhat s malwarem, zároveň ale mizí omezení, která mnoho uživatelů pokládá za přehnaná a často chybná.

Jeden z mnoha komických příkladů, kdy Llama-2-7b-chat z bezpečnostních důvodů odmítá rozumný požadavek; příklad je dostupný na adrese zdroje.

Heretic

Heretic, software, který v poslední době zásadně zjednodušil odcenzurování modelů, dokáže dokonce omezit jejich sklon ke květnaté a rozvláčné próze.

Heretic odcenzurovává gpt-oss na velmi výkonném stroji, který se v běžné domácnosti sotva objeví, lze jej však levně pronajmout online na potřebnou dobu.

Program automaticky hledá „abliteration“, která potlačí odmítání a přitom minimalizuje poškození původního chování. Pro uživatele se tak relativně náročná práce smrskne na jediný příkaz.

Heretic těží z výkonnější GPU než běžný domácí počítač. Uživatelé však nemusí práci provádět sami, stejně jako v roce 2002 nemuseli osobně prolamovat software. Podobně jako ve warezové době provedou jailbreak a zveřejní model obvykle nekomerční nadšenci s přístupem k hardwaru nebo ochotou utratit tokeny.

V hledáčku

Když „sporná“ digitální činnost náhle přestane být obtížná, obvykle za tím stojí skok schopností přes noc — například Napster nebo PopCornTime — který zvětší jak aktivitu, tak „oficiální“ zájem o její omezení.

Spolu s rostoucí oblibou a snadností platforem jako Ollama přibližuje Heretic odcenzurované modely netechnickým uživatelům, i když zcela bezchybná metoda ještě neexistuje.

Vrací se tím otázka, zda tato činnost představuje „problém“. Nová práce na arXiv naznačuje, že vzhledem k nedávným zásahům do svobod technologických spotřebitelů získá odcenzurování větší pozornost a vyvolá další zákazové zákony po celém světě.

Nová práce, zpráva 10a Labs, vykresluje hnutí negativně a uvádí obvyklou menšinu případů zneužití, které podle historie a dnešních trendů povedou k omezením.

Studie sleduje dění po vydání a dalším šíření odcenzurovaných modelů. Identifikovala 1 643 aplikací na GitHubu, které necenzurované modely integrují, doporučují nebo používají ve výchozím nastavení.

Zahrnují obecné chatboty a nástroje pro dokumenty, NSFW hraní rolí, vyprávění a explicitní služby, hacking, ofenzivní bezpečnost, podvody i generátory malwaru. Studie označuje 25 % vydání za „výslovně škodlivá“.

Obecné necenzurované chatboty tvořily 37 %, kybernetická bezpečnost a zpracování dokumentů shodně 16 %. Menší kategorie zahrnovaly hlasové asistenty, NSFW role, kreativní psaní, programování a další použití. Přibližně 25 % aplikací bylo možné označit za výslovně škodlivé.

Nová britská omezení webu a pozastavený záměr omezit i obcházející VPN, kalifornský požadavek od roku 2027, aby většina operačních systémů shromažďovala věkové rozpětí uživatelů, systém EU pro ověřování věku u obsahu pro dospělé a australský zákaz sociálních účtů pro osoby mladší šestnácti let zapadají do stejného vzorce: větší pozornost vede k většímu dohledu, regulaci a možná k částečným či úplným zákazům.

Tady by se to stát nemohlo

Ale mohlo — částečně kvůli vysokému podílu škodlivého použití odhadovanému autory a možná proto, že kontrola by dále omezila rostoucí trend lokálně provozované AI. Vlády a instituce jej mohou považovat za hrozbu, zejména když jsou modely zbaveny omezení.

Pokud se odcenzurování vykreslí jako „umožnění“ NSFW obsahu a škodlivého hackingu, vznikne falešná volba: protože lze technologii použít špatně, musí se regulovat. Kvůli množství použití však v praxi neexistuje realistická regulace kromě úplného zákazu.

Jestliže odcenzurování LLM může například umožnit vytváření fiktivních materiálů o sexuálním zneužívání dětí, prosazení přísné regulace je politicky snadné. Odpůrce lze nepřímo označit za zastánce škodlivého, nikoli rozumného využití.

To opomíjí, že doladěný nebo LoRA upravený model může libovolnou oblast vytvářet mnohem účinněji, protože základní váhy se natolik přizpůsobí úkolu, že stejně zcela naruší naučené ochrany.

Vše závisí na snadnosti

Snadné použití vyvolá masové přijetí a to vytváří tlak na vlády, aby přijaly zákony — od veřejných skupin, průmyslových lobbistů nebo jiných států.

Jemné doladění a LoRA téměř jistě dosáhnou cílenějších výsledků než pouhé odemčení otevřeného základního modelu, vyžadují však disciplínu a úsilí.

Až půjde odcenzurovaný a kvantizovaný model spustit lokálně několika kliknutími — pravděpodobně stažením předem „osvobozené“ verze místo vlastního zásahu pomocí Heretic — činnost opustí technickou niku a vstoupí do veřejného prostoru, kde se zneužití stanou politickým bojištěm.

Letos v létě vedla NVIDIA skupinu velkých technologických partnerů, která se otevřeným dopisem pokusila předejít vládním omezením otevřených modelů. Znovu tvrdila, že zneužití menšinou nesmí ohrozit možný obecný přínos technologie. Tento postoj je však v posledních letech nepopulární.

* Často se zpochybňuje, zda tvůrci modelů upřímně chtějí omezovat činnost uživatelů; ochranné bariéry jsou dokonce odmítány jako pouhé „divadlo“.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai