Ángulo de Anderson

¿Cuánto tiempo falta para una verdadera represión del decensurado de modelos de IA?

mm
Añade Unite.AI a tus fuentes preferidas en Google
Screen capture from The Matrix (1999), featuring 'warez' on optical media, hidden inside a book, about to be sold to a willing buyer. © Warner Bros. Used for commentary and illustrative purposes.

Si eres lo suficientemente mayor para recordar la escena warez de aproximadamente 1995‑2010, cuando enormes colecciones de software pirateado y películas extraídas (compradas al por mayor en la calle, o ensambladas por piratas ocasionales una vez que la banda ancha de alta velocidad hizo factibles descargas masivas) se acumulaban en múltiples y crujientes colecciones de DVD, la emergente escena de modelos de IA de código abierto “decensurados” puede evocar notas familiares.

From the 'golden age' of casual street trade in software and movies. Credit – Shankar.s. 'Pirated DVDs at PP street market' - https://www.flickr.com/photos/shankaronline/9163248097/in/photostream/ License - https://creativecommons.org/licenses/by/2.0/deed.en

De la ‘edad dorada’ del comercio callejero informal de software y películas. Crédito – Shankar.s. ‘DVDs pirateados en el mercado callejero PP’Fuente / Licencia

En aquel entonces, antes de que el alquiler de software se convirtiera en un modelo de consumo común, surgió un pequeño pero élite grupo de entusiastas del ‘scene’ de software que se dedicaba a crackear aplicaciones, las cuales luego se difundían en los grupos de ‘warez’ de los grupos de noticias y, más tarde, en los grupos de torrents. Esas restricciones podían ser gravosas o triviales de vulnerar, pero las brechas solían ser indelebles una vez liberadas al público.

Esto es lo que está ocurriendo ahora con los Modelos de Lenguaje a Gran Escala (LLM) de código abierto, que rutinariamente, y a gran escala, están siendo despojados de sus filtros de seguridad incorporados; tras ello, estos modelos decensurados terminan compartidos en tantos lugares que incluso cerrar la fuente original del ‘crack’ no afecta la disponibilidad de los modelos.

Benefactor o Malhechor

La cuestión es: ¿con qué perspectiva deseas observar estas actividades? A diferencia de la escena warez, nadie está siendo tan explícitamente privado de ingresos como probablemente lo estaban los pequeños productores de software hace 20‑30 años.

Sin duda, los términos de la licencia original a menudo se están violando, en tales casos*; sin embargo, a diferencia de los lanzamientos de pesos parciales de productores de modelos genAI como Black Forest Labs, los distribuidores originales no tratan las versiones de ‘calidad inferior’ como rutas de venta adicional hacia modelos API más capaces; están liberando los modelos completos directamente.

En la mayoría de los casos, casi nadie puede ejecutar localmente estos lanzamientos iniciales, porque su número de parámetros es demasiado elevado incluso para tarjetas GPU bien equipadas con capacidades de 16‑24 GB de VRAM.

Así, los lanzamientos iniciales se convierten rápidamente en versiones reducidas capaces de ejecutarse en hardware de consumo, mediante la cuantización de modelos y la conversión de pesos a iteraciones más ligeras como GGUF, AWQ, PTQ, EXL2 o el MLX centrado en Apple.

Aunque no son tan eficientes como los modelos originales de gran tamaño (que normalmente se ofrecen comercialmente desde diversas granjas de GPU), al menos están bajo el control del usuario y pueden personalizarse para ese usuario específico de maneras que el modelo ‘mejor’ no puede.

Hazlo a tu manera

Algunas de estas formas son claramente legítimas y suelen estar dentro del alcance de la licencia original, como el ajuste fino, de modo que los pesos del modelo se inclinen específicamente hacia una tarea o dominio objetivo que el usuario haya incorporado. En tal caso, siempre que haya espacio suficiente en el disco duro, se pueden incluso ajustar finamente múltiples instancias de un modelo de código abierto para una variedad de tareas, como una serie de herramientas dedicadas y tradicionales, en lugar de la ‘navaja suiza’ de un modelo original de peso completo.

Además, los modelos con configuraciones compatibles, pero con datos de entrenamiento diferentes, pueden fusionarse; o bien, se pueden superponer capacidades adicionales en un modelo mediante filtros LoRA ligeros, sin arriesgar a socavar las capacidades originales del modelo base mediante el ajuste fino.

Sin embargo, la modificación que más interesa a muchos usuarios, y que se ha vuelto más fácil que cualquiera de los métodos anteriores, es la eliminación de los filtros de seguridad mencionados, o barreras de protección.

Aunque esto, sin duda, permite que los modelos generen contenido pornográfico y desarrollen malware, también elimina lo que muchos usuarios perciben como un conjunto de restricciones excesivamente restrictivo (y frecuentemente propenso a errores).

One of many hilarious examples of Llama-2-7b-chat refusing reasonable requests on safety grounds, available at the source URL. Source - https://www.lesswrong.com/posts/pYcEhoAoPfHhgJ8YC/refusal-mechanisms-initial-experiments-with-llama-2-7b-chat

Uno de muchos ejemplos hilarantes de Llama-2-7b-chat rechazando solicitudes razonables por motivos de seguridad, disponible en la URL de origen. Fuente

Hereje

En el caso de Hereje, el software que recientemente ha revolucionado el decensurado de modelos, incluso es posible reducir el nivel de prosa ‘florida’ y verbosa al que tienden los modelos.

Heretic gets to work on decensoring gpt-oss, though admittedly on a very well-specced machine that's unlikely to grace the average consumer's home – though it could be rented cheaply online, for the necessary duration of the process. Source - https://github.com/p-e-w/heretic

Hereje se pone a trabajar en el decensurado de gpt-oss, aunque, admitámoslo, en una máquina muy bien especificada que es poco probable que llegue al hogar del consumidor promedio — aunque podría alquilarse barato en línea, por la duración necesaria del proceso. Fuente

Más importante aún, Hereje — que busca automáticamente una ablitración que suprime los rechazos, mientras minimiza el daño al comportamiento original del modelo — reduce la tarea relativamente desafiante del decensurado a un simple comando único, desde la perspectiva del usuario final.

Como puedes observar en la captura de pantalla anterior, Hereje tiende a beneficiarse de una GPU más potente de lo que probablemente se encuentre en un hogar de consumidor; sin embargo, los usuarios no necesitan ejecutarlo en hardware doméstico, al igual que antes no tenían que crackear software personalmente en 2002; al igual que en los días warez, los proveedores de la escena (entusiastas casuales, generalmente no comerciales) con acceso a dicho hardware, o dispuestos a gastar algunos recursos en el problema, realizan el jailbreak y liberan el modelo decensurado a la comunidad.

En la mira

Cuando una acción digital ‘cuestionable’ deja de ser difícil, suele ser mediante un salto nocturno de capacidad (piense en Napster o PopCornTime) que de repente amplía tanto la actividad en sí como el nivel de interés ‘oficial’ en limitarla.

Combinado con la creciente popularidad y facilidad de uso de plataformas como Ollama, Hereje está empezando a acercar el acceso a modelos decensurados al usuario no técnico, aunque aún no exista un método verdaderamente ‘a prueba de tontos’.

Y eso me lleva de nuevo a mi pregunta anterior, sobre si esta actividad constituye un ‘problema’. Un artículo que apareció ayer en Arxiv me indica, basándose en tendencias muy recientes de retroceso y represión de libertades tecnológicas del consumidor, que el decensurado probablemente ganará mayor atención, conduciendo a más incidencias de legislación restrictiva en todo el mundo.

El nuevo artículo, un informe de 10a Labs, presenta el movimiento de decensurado bajo una luz negativa y ofrece la habitual minoría de casos de abuso que, como sugiere la historia y predicen las tendencias actuales, conducirán a restricciones.

El estudio rastrea lo que ocurre después de que los modelos decensurados se liberan y redistribuyen, e identificó 1.643 aplicaciones en GitHub que integran, recomiendan o utilizan por defecto modelos sin censura.

Los modelos en cuestión abarcan desde chatbots de propósito general y herramientas de procesamiento de documentos, hasta juegos de rol NSFW y narraciones; servicios de contenido explícito; herramientas de hacking y seguridad ofensiva; y aplicaciones de fraude y generadores de malware, con un 25 % de los lanzamientos clasificados por el estudio como ‘explícitamente maliciosos’:

Breakdown of how uncensored AI models are being used after release. The study traced 1,643 GitHub applications that integrate, recommend or default to models whose safety restrictions have been removed, finding that 37% were general-purpose uncensored chatbots, while cybersecurity and document-processing tools each accounted for 16%, alongside smaller categories spanning voice assistants, NSFW roleplay, creative writing, coding and other uses. The paper found that around 25% of the applications identified could be classified as 'explicitly malicious'.

Desglose de cómo se están utilizando los modelos de IA sin censura después de su liberación. El estudio rastreó 1.643 aplicaciones en GitHub que integran, recomiendan o utilizan por defecto modelos cuyas restricciones de seguridad han sido eliminadas, encontrando que el 37 % eran chatbots sin censura de propósito general, mientras que las herramientas de ciberseguridad y de procesamiento de documentos representaron cada una el 16 %, junto a categorías menores que incluyen asistentes de voz, juegos de rol NSFW, escritura creativa, codificación y otros usos. El artículo encontró que alrededor del 25 % de las aplicaciones identificadas podrían clasificarse como ‘explícitamente maliciosas’. Fuente

A la luz de las restricciones recientemente instauradas en el Reino Unido sobre el acceso web (y su intención ahora pausada de también restringir el acceso VPN que las elude); el requisito de California para 2027 de que la mayoría de los sistemas operativos recopilen rangos de edad de los usuarios y los proporcionen a las aplicaciones; el esquema de la UE para la verificación de edad para el acceso a contenido adulto en línea; y la prohibición de Australia de cuentas de redes sociales para menores de dieciséis años; el nuevo artículo parece encajar en el patrón donde la mayor atención conduce finalmente a una mayor supervisión, regulación y, posiblemente, prohibiciones selectivas o totales.

No podría suceder aquí

No, definitivamente podría suceder aquí, en parte debido al alto porcentaje de uso malévolo, según estiman los autores del nuevo estudio; y, posiblemente, porque los controles imponerían restricciones adicionales a la creciente tendencia de IA ejecutada localmente, que los gobiernos e instituciones pueden percibir como una amenaza — aún más cuando los modelos se liberan de sus ataduras.

Al encuadrar las actividades de decensurado como ‘facilitadoras’ de contenido NSFW y hacking malicioso, es posible presentar el decensurado como una proposición falsamente binaria: dado que puede usarse para cosas negativas, debe someterse a regulación. En términos prácticos, no parece haber una forma realista de regular dicha funcionalidad, salvo prohibirla totalmente, ya que existen innumerables casos de uso posibles.

Además, en casos donde el decensurado de un LLM podría permitir que un modelo genere (por ejemplo) ficción de CSAM, la regulación restrictiva parecería una propuesta segura, ya que cualquiera que se oponga puede ser implícitamente pintado como ‘a favor’ de los usos nefastos de un modelo decensurado, en lugar de sus usos razonables.

Esto ignora el hecho de que un modelo ajustado finamente o afectado por LoRA puede producir con mucha mayor eficacia cualquier dominio específico que el usuario desee imponer, ya que los pesos base del modelo se distorsionan tanto hacia la tarea que anulan por completo cualquier protección incorporada.

Todo sobre la facilidad

Facilidad de uso es lo que impulsa la adopción a gran escala, y la adopción a gran escala es lo que genera presión sobre los gobiernos para legislar (ya sea por grupos de presión pública, lobby de la industria o mediante presión intergubernamental).

Aunque el ajuste fino y los LoRA pueden casi con certeza obtener resultados más dirigidos que simplemente desbloquear un modelo base de FOSS, estos métodos requieren una cierta disciplina y esfuerzo para implementarlos.

Una vez que ejecutar un modelo decensurado/cuanti­zado localmente se convierta realmente en cuestión de unos pocos clics (pues el usuario casi con seguridad descargará un modelo ‘preliberado’ en lugar de crackearlo él mismo con Hereje), la actividad sale de la oscuridad del geek y entra en el dominio público, donde sus abusos probablemente se conviertan en pelotas políticas.

Este verano NVIDIA encabezó a un grupo de socios tecnológicos de peso en anticipar restricciones gubernamentales a los modelos de código abierto, en una carta abierta que una vez más argumenta que los abusos minoritarios de una tecnología no deberían poner en peligro su potencial beneficio general. Pero esta postura ha demostrado ser impopular en los últimos años.

 

* Si los creadores de modelos son sinceros en su deseo declarado de restringir la actividad de los usuarios, a menudo se cuestiona, con las protecciones de barreras incluso descartadas como ‘teatro’.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai