Unghiul lui Anderson

Cât va mai dura până la o intervenție serioasă împotriva eliminării cenzurii din modelele AI?

mm
Adaugă Unite.AI la sursele tale preferate pe Google
Screen capture from The Matrix (1999), featuring 'warez' on optical media, hidden inside a book, about to be sold to a willing buyer. © Warner Bros. Used for commentary and illustrative purposes.

Dacă vă amintiți scena warez din anii aproximativ 1995–2010, când colecții uriașe de programe sparte și filme copiate umpleau teancuri de DVD-uri — cumpărate cu ridicata de pe stradă sau strânse de pirați amatori după ce internetul rapid a permis descărcări enorme — noua lume a modelelor AI open-source „decenzurate” poate părea familiară.

Din „epoca de aur” a comerțului stradal informal cu programe și filme. Credit: Shankar.s, „Pirated DVDs at PP street market”.

Înainte ca închirierea programelor să devină un model obișnuit, o mică elită de pasionați spărgea aplicații și le publica în grupuri warez, apoi prin torrente. Protecțiile puteau fi dificile sau triviale, dar după publicarea versiunii sparte încălcarea devenea, de regulă, imposibil de șters.

Același lucru se întâmplă acum cu modelele lingvistice mari deschise. Filtrele de siguranță învățate sunt eliminate în mod curent și la scară mare, iar modelele decenzurate sunt distribuite în atât de multe locuri încât închiderea sursei inițiale nu le mai afectează disponibilitatea.

Beneficiar sau răufăcător?

Întrebarea este cum privim aceste activități. Spre deosebire de scena warez, nimeni nu este privat la fel de direct de venituri cum puteau fi micii producători de software acum douăzeci sau treizeci de ani.

Termenii licenței inițiale sunt adesea încălcați.* Dar, spre deosebire de versiunile cu ponderi parțiale ale unor producători precum Black Forest Labs, distribuitorii inițiali nu folosesc o versiune „mai slabă” pentru a vinde un model mai puternic disponibil numai prin API; ei publică modelul complet.

Aproape nimeni nu poate rula local primele versiuni, deoarece au prea mulți parametri chiar și pentru plăci GPU bine echipate cu 16–24 GB VRAM.

De aceea, versiunile sunt rapid micșorate prin cuantizare și conversia ponderilor în formate mai ușoare, precum GGUF, AWQ, PTQ, EXL2 sau MLX de la Apple, astfel încât să funcționeze pe hardware de consum.

Nu sunt la fel de performante ca originalele complete, oferite de obicei comercial din ferme GPU, însă utilizatorul le controlează și le poate personaliza în moduri pe care modelul „mai bun” nu le permite.

Așa cum doriți

Unele modificări sunt clar legitime și de obicei permise de licență, precum reglajul fin care orientează ponderile către o sarcină sau un domeniu oferit de utilizator. Dacă spațiul permite, mai multe copii ale unui model deschis pot fi reglate pentru sarcini diferite, ca o trusă de unelte specializate în locul unui singur „briceag elvețian”.

Modelele cu setări compatibile și date de instruire diferite pot fi îmbinate. Se pot adăuga și capacități prin filtre LoRA ușoare, fără riscul ca reglajul fin să afecteze capacitățile inițiale ale modelului de bază.

Modificarea care îi interesează cel mai mult pe mulți utilizatori și a devenit mai ușoară decât metodele anterioare este eliminarea filtrelor de siguranță, adică a barierelor de protecție.

Aceasta poate permite generarea de pornografie sau ajutor pentru dezvoltarea de malware, dar elimină și restricții pe care mulți utilizatori le consideră excesive și adesea eronate.

Unul dintre numeroasele exemple comice în care Llama-2-7b-chat refuză solicitări rezonabile din motive de siguranță; exemplul este disponibil la adresa sursă.

Heretic

Cu Heretic, programul care a simplificat radical decenzurarea modelelor, se poate reduce chiar și tendința acestora către proză înflorită și prea lungă.

Heretic decenzurează gpt-oss pe un sistem foarte puternic, rar întâlnit într-o casă obișnuită, dar care poate fi închiriat online ieftin pentru durata necesară.

Programul caută automat o „abliteration” care suprimă refuzurile, limitând deteriorarea comportamentului inițial. Astfel, o operațiune relativ dificilă se reduce la o singură comandă pentru utilizator.

Heretic beneficiază de un GPU mai puternic decât unul casnic. Utilizatorii nu trebuie însă să execute procesul acasă, așa cum nici în 2002 nu trebuiau să spargă personal programele. Ca în epoca warez, pasionații necomerciali cu acces la hardware sau dispuși să cheltuiască tokenuri realizează jailbreak-ul și distribuie modelul.

În vizor

Când o acțiune digitală „discutabilă” încetează brusc să fie dificilă, cauza este adesea un salt de capacitate peste noapte — ca Napster sau PopCornTime — care mărește atât activitatea, cât și interesul „oficial” de a o limita.

Împreună cu popularitatea și ușurința platformelor precum Ollama, Heretic aduce modelele decenzurate la îndemâna utilizatorilor netehnici, chiar dacă încă nu există o metodă complet infailibilă.

Revenim astfel la întrebarea dacă activitatea este o „problemă”. Un nou articol pe arXiv sugerează, în lumina restrângerilor recente ale libertăților consumatorilor de tehnologie, că decenzurarea va primi mai multă atenție și va duce la mai multe legi prohibitive în lume.

Noul articol, un raport 10a Labs, prezintă mișcarea negativ și oferă minoritatea obișnuită de cazuri de abuz care, după cum arată istoria și tendințele actuale, va conduce la restricții.

Studiul urmărește ce se întâmplă după publicarea și redistribuirea modelelor decenzurate și identifică 1.643 de aplicații GitHub care integrează, recomandă sau folosesc implicit modele necenzurate.

Acestea variază de la chatboți generali și instrumente pentru documente la jocuri de rol NSFW, povești și servicii explicite, hacking, securitate ofensivă, fraudă și generatoare de malware. Studiul clasifică 25% drept „explicit rău intenționate”.

Chatboții generali necenzurați reprezentau 37%, iar securitatea cibernetică și prelucrarea documentelor câte 16%. Categoriile mai mici includeau asistenți vocali, roluri NSFW, scriere creativă, programare și altele. Aproximativ 25% dintre aplicații puteau fi considerate explicit rău intenționate.

Noile restricții britanice privind accesul web și planul suspendat de a limita și VPN-urile care le ocolesc, cerința Californiei din 2027 ca majoritatea sistemelor de operare să colecteze intervalul de vârstă, verificarea vârstei în UE pentru conținutul destinat adulților și interdicția australiană a conturilor sociale pentru cei sub șaisprezece ani se înscriu în același tipar: atenția sporită duce la supraveghere, reglementare și posibile interdicții parțiale sau totale.

Aici nu s-ar putea întâmpla

Ba da, s-ar putea, parțial din cauza proporției mari de utilizări dăunătoare estimate de autori și poate pentru că măsurile de control ar limita și tendința spre AI rulată local. Guvernele și instituțiile o pot percepe drept amenințare, mai ales când modelele sunt eliberate de restricții.

Prezentarea decenzurării ca o „facilitare” a conținutului NSFW și a atacurilor rău intenționate creează o falsă alegere: deoarece tehnologia poate fi folosită rău, trebuie reglementată. În practică, numărul mare de utilizări nu lasă o metodă realistă de reglementare în afara unei interdicții totale.

Dacă decenzurarea unui LLM poate permite, de pildă, generarea de ficțiune despre abuz sexual asupra copiilor, o reglementare strictă devine ușor de susținut politic. Oponenții pot fi descriși implicit ca susținători ai utilizărilor dăunătoare, nu ai celor rezonabile.

Aceasta ignoră faptul că un model reglat fin sau modificat cu LoRA poate produce mult mai eficient orice domeniu impus de utilizator, deoarece ponderile de bază sunt orientate atât de puternic spre sarcină încât oricum subminează complet protecțiile învățate.

Totul ține de ușurință

Ușurința de utilizare declanșează adoptarea în masă, iar aceasta creează presiune asupra guvernelor să legifereze, din partea grupurilor publice, a lobby-ului industrial sau a altor guverne.

Reglajul fin și LoRA pot obține aproape sigur rezultate mai bine țintite decât simpla deblocare a unui model de bază deschis, dar necesită disciplină și efort.

Când rularea locală a unui model decenzurat și cuantizat va necesita doar câteva clicuri — probabil prin descărcarea unui model deja „eliberat”, nu prin modificarea lui cu Heretic — activitatea va ieși din nișa tehnică și va intra în spațiul public, unde abuzurile vor deveni teme de dispută politică.

În această vară, NVIDIA a condus un grup de parteneri tehnologici mari care a încercat, printr-o scrisoare deschisă, să prevină restricțiile guvernamentale asupra modelelor deschise. Scrisoarea a repetat argumentul că abuzurile unei minorități nu ar trebui să pericliteze beneficiul general potențial al unei tehnologii. Poziția s-a dovedit însă nepopulară în ultimii ani.

* Sinceritatea dorinței declarate a creatorilor de modele de a limita activitatea utilizatorilor este adesea contestată; barierele de siguranță sunt chiar respinse drept „teatru”.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai