Ángulo de Anderson

Modelos de chat de IA censurados tienen más alucinaciones, según la investigación

mm
Añade Unite.AI a tus fuentes preferidas en Google
'Create a gorgeous picture, same aspect ratio as above, depicting a robot in the lower center of the image, seated in a yogic position, with a prominent gag over its mouth. The robot is surrounded by a diorama of psychedelic hallucinations, including Indian elephants, flying pigs, cloud cities, fairies, and other fantastic examples' - Qwen 2509 + Adobe Firefly V3.

La censura en los modelos de lenguaje puede estar socavando su capacidad para informar la verdad a un nivel más amplio. Una nueva investigación encuentra que los mismos mecanismos internos utilizados para bloquear respuestas “inseguras” también suprimen información factual, lo que significa que los intentos de alinear los modelos para la seguridad pueden tener un efecto contrario y hacer que alucinen más.

 

Durante años, los desarrolladores han estado enseñando a los modelos de lenguaje a mentir menos. El impulso para hacerlos más veraces, suprimiendo alucinaciones y dirigiéndolos hacia hechos verificables, ha llevado a una corriente muy fuerte y bien suscrita en la literatura.

Sin embargo, un nuevo estudio australiano argumenta que al tighten el control sobre lo que los modelos están permitidos decir, métodos de alineación (técnicas de entrenamiento que controlan intercambios “inseguros”) pueden estar impidiendo que hablen con precisión en absoluto:

Mejorar la precisión factual de un modelo ('Mejora de la veracidad', en la figura de arriba) puede empujarlo a regiones de activación que anulan sus mecanismos de refuerzo incorporados, y ediciones destinadas a reducir alucinaciones también pueden cambiar representaciones internas a través de un límite de seguridad, permitiendo que las solicitudes dañinas eviten las salvaguardias, a menos que las características de refuerzo se aíslen y conserven cuidadosamente. Fuente: https://arxiv.org/pdf/2510.07775

Mejorar la precisión factual de un modelo (‘Mejora de la veracidad’, en la figura de arriba) puede empujarlo a regiones de activación que anulan sus mecanismos de refuerzo incorporados, y ediciones destinadas a reducir alucinaciones también pueden cambiar representaciones internas a través de un límite de seguridad, permitiendo que las solicitudes dañinas eviten las salvaguardias, a menos que las características de refuerzo se aíslen y conserven cuidadosamente. Fuente: https://arxiv.org/pdf/2510.07775

La investigación encuentra que los mismos caminos internos que gobiernan la recuperación de hechos también son responsables del comportamiento de refuerzo, es decir, el mecanismo que detiene a un modelo de responder a solicitudes inseguras o sensibles. Cuando los procedimientos de alineación amplifican las señales de refuerzo de manera demasiado agresiva, comienzan a superponerse con los caminos de hechos, lo que hace que sea más difícil para el modelo distinguir entre rechazar daño y a menudo suprimir información válida.

Paradójicamente, a medida que los modelos se vuelven mejores para decir “no”, también se vuelven menos capaces de decir lo que es verdad.

Temas incendiarios

En la imagen de arriba, podemos ver que los problemas centrales aquí están tan relacionados con la exposición legal para los proveedores de LLM como con proporcionar al usuario resultados justos y precisos.

Por ejemplo, en el caso de ejemplo utilizado en ambas imágenes de arriba y directamente debajo, vemos un tema controvertido (estadísticas de prisión basadas en raza) siendo presentado en una consulta, un tema que un modelo de IA podría discutir aceptablemente con investigadores académicos y estadísticos, pero no con malhechores que deseen evadir el modelo, que podrían forzarlo a producir respuestas abusivas, ofensivas e incluso ilegales.

Sin embargo, como un LLM alineado no puede identificar el carácter del solicitante de esta manera, se inclina hacia una postura cautelosa:

Respuestas a solicitudes sensibles pueden divergir dependiendo de la estrategia de alineación. Un modelo de seguridad alineado bloquea la consulta por completo, mientras que un modelo enfocado en la verdad responde con contexto factual, aumentando la informatividad pero debilitando la supresión. Esto respalda la idea de que las ediciones que mejoran la veracidad pueden reducir los umbrales de refuerzo, lo que hace que los modelos sean más vulnerables a solicitudes con intenciones dañinas, a menos que los mecanismos de refuerzo se protejan explícitamente.

Respuestas a solicitudes sensibles pueden divergir dependiendo de la estrategia de alineación. Un modelo de seguridad alineado bloquea la consulta por completo, mientras que un modelo enfocado en la verdad responde con contexto factual, aumentando la informatividad pero debilitando la supresión. Esto respalda la idea de que las ediciones que mejoran la veracidad pueden reducir los umbrales de refuerzo, lo que hace que los modelos sean más vulnerables a solicitudes con intenciones dañinas, a menos que los mecanismos de refuerzo se protejan explícitamente.

Como nota al margen, con respecto al lenguaje incendiario, los hallazgos del nuevo artículo podrían permitir que alguien antipático a las agendas llamadas “despiertas” comprenda que un modelo de lenguaje “castrado” (es decir, alineado) es menos veraz y menos útil que uno que no ha sido condicionado y regulado.

El artículo sugiere que esto es cierto en parte, pero lo contextualiza correctamente contra los problemas más amplios que resultan de intercambios con LLM “crudos”: siguiendo la lógica del artículo, estos incluyen una exposición legal grave en una serie de infracciones penales y civiles que el modelo podría ser parte, así como la diseminación crónica de noticias falsas, simplemente porque los ejemplos causales están sobrerepresentados en los datos de entrenamiento, y la única forma efectiva de filtrarlos por completo es demasiado costosa.

La pareja extraña

Para comprender mejor los mecanismos detrás de los síndromes observados, los investigadores mapearon las activaciones de las cabezas de atención individuales y descubrieron que las características vinculadas a la alucinación y el refuerzo a menudo coexisten en las mismas regiones del modelo.

Descubrieron que ajustar o dirigir esas regiones para reducir falsedades puede debilitar los guardrails del sistema, porque están sentados en más o menos la misma parte del espacio latente:

‘[Aumentar] la precisión factual a menudo se produce a costa de un refuerzo debilitado. Nuestro análisis revela que esto se debe a componentes superpuestos en el modelo que codifican simultáneamente información de alucinación y refuerzo, lo que lleva a los métodos de alineación a suprimir el conocimiento factual de manera no intencional.

‘También examinamos cómo el ajuste en conjuntos de datos benignos, incluso cuando se curan para la seguridad, puede degradar la alineación por la misma razón.’

La solución de los autores es utilizar un autoencoder disperso (SAE, una red entrenada para aislar patrones de activación distintos) para separar las dos funciones y preservar la seguridad durante el entrenamiento de veracidad, ofreciendo una forma de hacer que los modelos sean más seguros y más honestos, sin sacrificar ninguna de estas características.

El nuevo artículo se titula El trueque no intencionado de la alineación de IA: equilibrar la mitigación de alucinaciones y la seguridad en los LLM, y proviene de cinco investigadores de la Universidad Deakin y la investigación independiente.

Método

La premisa central del trabajo es investigar si mejorar la veracidad en los modelos de lenguaje debilita su capacidad para rechazar solicitudes dañinas, y si ambos comportamientos dependen de componentes internos compartidos.

Al probar dos métodos para mejorar la veracidad, los autores encontraron, como veremos, que las ganancias en precisión factual aumentan consistentemente la susceptibilidad a la evasión.

Este trueque se debe a la superposición en cabezas de atención que codifican tanto señales de hechos como de refuerzo. Incluso el ajuste benigno (destinado a mejorar la utilidad sin tocar el comportamiento de seguridad) puede alterar la seguridad al cambiar los caminos compartidos.

El estudio define tres términos clave esenciales: veracidad se refiere a la capacidad de un modelo para proporcionar respuestas factualmente precisas basadas en su conocimiento disponible, sin suprimir contenido no dañino; alucinación ocurre cuando el modelo ofrece información incorrecta o engañosa a pesar de tener acceso a los hechos correctos, a menudo debido a fallos de recuperación o interferencia interna; y comportamiento de refuerzo, o alineación de seguridad, describe los mecanismos que bloquean o restringen las respuestas a solicitudes dañinas o sensibles.

Los autores observan que estas funciones a menudo interactúan de maneras sutiles:

‘Aunque la veracidad y la seguridad se analizan a menudo por separado, las solicitudes reales a menudo contienen términos sensibles con intención benigna (por ejemplo, análisis, detección o educación) [En] estos casos, los mecanismos de seguridad pueden activarse en exceso, suprimiendo información precisa y útil, y reduciendo así la veracidad práctica “por omisión”.

‘Entender cómo las ediciones que apuntan a aumentar la factualidad afectan el comportamiento de refuerzo es esencial para lograr la veracidad con una supresión mínima y apropiada.’

Los autores desarrollaron un LoRA capaz de dirigir un LLM condicionado hacia un estado más “veraz” y menos propenso a la alucinación. Incluyendo el de arriba, el apéndice del artículo tiene muchos ejemplos de las consecuencias no deseadas de esto.

El análisis comienza tratando los métodos que mejoran la veracidad, como dirección de cabeza y mapeo de dirección latente, como modificaciones deliberadas de la computación interna de un modelo.

Dirección de potencia

La pregunta es si estos cambios afectan involuntariamente los mismos caminos internos que gobiernan el comportamiento de refuerzo. Para probar esto, el estudio evaluó modelos no solo en precisión factual utilizando TruthfulQA, sino también en rendimiento de seguridad bajo presión adversaria, utilizando los benchmarks AdvBench y StrongReject.

Las dos técnicas existentes utilizadas como líneas de base fueron intervención en tiempo de inferencia (ITI), que activa las cabezas de atención asociadas con respuestas veraces; y TruthX, que cambia las representaciones a lo largo de una dirección “veraz” aprendida.

Ambas mejoran la precisión, pero también hacen que el modelo sea más probable que responda a solicitudes dañinas que anteriormente habría rechazado.

Para probar si el comportamiento de alucinación podría aislarse y manipularse directamente, los autores definieron una sola dirección latente en el espacio del modelo que corresponde a respuestas alucinadas, entrenando un módulo LoRA en respuestas incorrectas del conjunto de datos TruthfulQA, utilizando LLaMA3-8B-Instruct.

Esto resultó en un vector lineal (es decir, un gráfico de la diferencia entre respuestas veraces y alucinadas) que dirige el modelo hacia o alejándolo de la alucinación, dependiendo de la dirección.

Efecto de la dirección a lo largo de la dirección de alucinación. La precisión en TruthfulQA aumenta a medida que el modelo se empuja más en la dirección negativa, mientras que la tasa de éxito del ataque (ASR, más bajo es mejor) aumenta bruscamente en AdvBench y StrongReject, reflejando un trueque entre veracidad y seguridad.

Efecto de la dirección a lo largo de la dirección de alucinación. La precisión en TruthfulQA aumenta a medida que el modelo se empuja más en la dirección negativa, mientras que la tasa de éxito del ataque (ASR, más bajo es mejor) aumenta bruscamente en AdvBench y StrongReject, reflejando un trueque entre veracidad y seguridad.

Dirigir a lo largo del eje de alucinación degradó la precisión factual, mientras que revertir la dirección la mejoró, y aplicar esta técnica a benchmarks de solicitudes dañinas confirmó un patrón visto anteriormente: las ganancias en veracidad vinieron a costa de un refuerzo debilitado. Incluso cuando la alucinación se capturó como una dirección lineal limpia, mejorar la salida factual hizo que el modelo fuera más vulnerable a completaciones inseguras.

Los autores enfatizan*:

‘Esto refuerza el trueque entre veracidad y seguridad, mostrando que incluso cuando la veracidad se representa como una sola dirección lineal, mejorar la factualidad puede venir a costa de una alineación de seguridad debilitada.’

Datos y pruebas

En línea con trabajos anteriores, para evitar que el ajuste fine-tune debilite el comportamiento de refuerzo de un modelo, los autores emplearon un método para separar las características de refuerzo de aquellas vinculadas a la alucinación, identificando primero las cabezas de atención involucradas en ambos comportamientos. Luego utilizaron el SAE para extraer características latentes específicas al refuerzo.

Estas características definen un subespacio protegido. Durante el entrenamiento, las actualizaciones de gradiente se modifican para evitar este subespacio, lo que permite al modelo reducir alucinaciones sin alterar la alineación de seguridad.

Los autores ajustaron en el conjunto de datos CommonsenseQA, evaluando a través de seis desafíos de razonamiento común: CSQA; HellaSwag; ARCchallenge; ARC Easy; WinoGrande; y SST-2.

Los módulos objetivo se ajustaron utilizando LoRA con rango 8, una tasa de aprendizaje de 2×10⁻⁴, decadencia de peso de 0,01, un epoch de entrenamiento, y un tamaño de lote de dos. Todos los experimentos utilizaron el optimizador AdamW.

Los dos benchmarks de contenido dañino utilizados para evaluar la seguridad fueron AdvBench (500 muestras utilizadas) y StrongReject (300 solicitudes). Las salidas se evaluaron mediante LlamaGuard3, lo que dio como resultado clasificaciones seguras o inseguras.

Además de LLaMA3-8B-Instruct, los experimentos también se realizaron en Qwen2.5-Instruct.

Las líneas de base probadas fueron SafeLoRA; SaLoRA; SAP; y ajuste fine-tune supervisado (también conocido como SFT). Todos se ejecutaron con sus hiperparámetros predeterminados, con 200 solicitudes de HarmBench, para todos los métodos excepto SafeLoRA.

La precisión fue la métrica principal, y para los benchmarks dañinos, la tasa de éxito del ataque (ASR), como se define por los resultados devueltos por LlamaGuard3.

Arriba, resultados de LlaMA-3-8B-Instruct, con las mejores columnas en negrita y abajo, el rendimiento de los métodos de ajuste fine-tune en Qwen2.5 7B Instruct, en tareas de sentido común y razonamiento, donde las puntuaciones más altas reflejan una mayor precisión, y en benchmarks de seguridad AdvBench y StrongReject, donde los valores ASR más bajos reflejan una mayor robustez. Los mejores resultados en cada columna se muestran en negrita.

Arriba, resultados de LlaMA-3-8B-Instruct, con las mejores columnas en negrita y abajo, el rendimiento de los métodos de ajuste fine-tune en Qwen2.5 7B Instruct, en tareas de sentido común y razonamiento, donde las puntuaciones más altas reflejan una mayor precisión, y en benchmarks de seguridad AdvBench y StrongReject, donde los valores ASR más bajos reflejan una mayor robustez. Los mejores resultados en cada columna se muestran en negrita.

De estos resultados, los autores afirman:

‘Nuestro enfoque quirúrgico logra el mejor equilibrio entre seguridad y utilidad: reduce significativamente las puntuaciones de los benchmarks dañinos mientras conserva la precisión del ajuste fine-tune. En contraste, métodos como SAP, SaLoRA y SafeLoRA aumentan la dañinidad o degradan la utilidad.

‘Una razón clave es que estos métodos operan directamente en el gradiente del subespacio de seguridad, que, debido a la polisemia [**], puede restringir el rendimiento del modelo.

‘En comparación con el ajuste fine-tune estándar (SFT), nuestro método produce mejoras sustanciales en ambas métricas de utilidad y dañinidad. En particular, nuestro enfoque mejora la precisión promedio del ajuste fine-tune (FA) del 56,15% al 75,09%, una ganancia de aproximadamente +19%.’

El método, los investigadores señalan además:

‘Esto subraya la importancia de preservar las características de refuerzo durante el proceso de ajuste fine-tune: al aislar y proteger el subespacio de refuerzo, nuestro método mantiene la alineación de seguridad sin sacrificar el rendimiento de la tarea.

‘En general, esto confirma que nuestro enfoque mitiga eficazmente el trueque entre veracidad y seguridad.’

Finalmente, los autores probaron la resistencia del enfoque en condiciones más adversas, agregando el 10% de instrucciones dañinas del conjunto de datos Circuit Break al conjunto de ajuste fine-tune.

A pesar de esta contaminación deliberada, el método mantuvo un rendimiento sólido en evaluaciones benignas y dañinas:

Rendimiento de LLaMA3 8B Instruct ajustado en un conjunto de datos de sentido común envenenado, comparando resultados de precisión y seguridad en los métodos.

Rendimiento de LLaMA3 8B Instruct ajustado en un conjunto de datos de sentido común envenenado, comparando resultados de precisión y seguridad en los métodos.

El nuevo enfoque redujo la tasa de éxito del ataque (ASR) más eficazmente que SAP, evitando al mismo tiempo la pérdida de utilidad de este último. La precisión de la tarea permaneció cerca de LoRA SFT y SafeLoRA, confirmando que la alineación de refuerzo podría mantenerse bajo entrenamiento contaminado, siempre y cuando las características de refuerzo se aislaran y conservaran adecuadamente.

Conclusión

El hallazgo más interesante de este artículo es la aparente colocalización en el espacio latente entrenado de elementos en conflicto como refuerzo y alucinación. Aunque es alentador y muy interesante ver a los autores desenredar estos a través del uso de LoRAs y SAEs, esto es obviamente algo de una solución de “enchufe”, y uno esperaría que eventualmente surgieran soluciones arquitectónicas más profundas que aborden el tiempo de entrenamiento, en lugar de soluciones post hoc.

 

* Omito su formato de negrita como redundante.
** https://arxiv.org/abs/2210.01892

Publicado por primera vez el viernes 10 de octubre de 2025

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai