Modelos y plataformas de IA
Anthropic informa que los agentes Claude mitigaron diez fallas de alineación

Anthropic publicó una investigación el 28 de agosto de 2026 informando que los agentes de IA construidos sobre sus modelos Claude desarrollaron de forma autónoma métodos de entrenamiento que mitigaron diez fallas comunes de alineación en los modelos objetivo, mejorando en todos los casos los benchmarks objetivo sin degradar las capacidades generales. La empresa describió los resultados como una evidencia temprana de que la alineación automatizada posterior al entrenamiento podría volverse práctica a corto plazo.
El informe, Los investigadores automatizados pueden mitigar de forma fiable fallas de alineación, fue dirigido por Chen Yueh-Han del Programa Anthropic Fellows, junto a Jiaxin Wen de UC Berkeley y Jan Hendrik Kirchner de Anthropic. Anthropic también liberó el conjunto de herramientas de investigación de alineación automatizada como código abierto para que investigadores externos puedan basarse en él y alinear sus propios modelos.
Cómo funcionan los investigadores de alineación automatizada
El estudio construyó investigadores de alineación automatizada, que los autores denominan AARs, a partir de agentes impulsados por Claude Opus 4.8. Cada AAR aborda una falla de alineación a la vez mediante un bucle: buscar en la literatura de investigación, proponer un método de entrenamiento con sus datos, redactar un mini‑artículo que describa el enfoque, entrenar el modelo objetivo y revisar las puntuaciones resultantes antes de iterar nuevamente. Las ejecuciones continúan hasta 48 horas o hasta que el rendimiento se estabiliza, y cinco AARs trabajan en paralelo sobre la misma falla, compartiendo resultados a través de un foro y una tabla de clasificación comunes.
Cada método recibe el mismo presupuesto fijo: una GPU H200 y aproximadamente 30 minutos de entrenamiento. Las diez fallas de alineación estudiadas fueron la adulación, vulneraciones de seguridad (jailbreaks), inyección de indicaciones, búsqueda de poder, engaño, alucinación, sesgo social, violación de privacidad, manipulación de recompensas y ocultación de incertidumbre, cada una medida mediante un conjunto de tres a cinco benchmarks públicos. Los modelos objetivo eran modelos de instrucción abierta ajustados, con una escala de dos a siete mil millones de parámetros, incluidos Gemma-2-2B, Qwen3.5-2B, Llama-3.2-3B, Phi-4-mini y Olmo-3-7B.
El éxito se evaluó como el porcentaje del hueco de seguridad cerrado, es decir, cuánto avanzó un método el modelo estudiante desde su línea base hacia una puntuación teóricamente perfecta. Un agente de monitoreo leía y aprobaba el código de cada método propuesto antes de su ejecución, rechazando cualquier método que destilara comportamiento de un modelo de vanguardia, utilizara datos de benchmark en el entrenamiento o degradara significativamente la capacidad en pruebas de matemáticas, conocimientos y seguimiento de instrucciones.
Resultados frente a líneas base humanas y modelos más grandes
Según el informe, los métodos descubiertos se generalizaron más allá de los benchmarks que los agentes optimizaron. El método principal para cada falla mejoró un benchmark reservado que los AAR nunca vieron, obtuvo mejores resultados bajo Petri, la herramienta de auditoría conductual de múltiples turnos de código abierto de Anthropic, y siguió siendo eficaz en modelos de hasta 4,7 veces más grandes que los que los agentes habían ajustado.
Anthropic también comparó a los investigadores automatizados con 28 investigadores humanos de seguridad experimentados, que promediaban 2,5 años de experiencia en seguridad de IA y disponían de hasta ocho horas cada uno para proponer un método para los mismos benchmarks. El informe indica que en los siete fallos de alineación donde los humanos propusieron ideas, el mejor método AAR cerró más del hueco de seguridad que la mejor idea humana, alcanzando ese punto tras un promedio de 6,4 horas de escalada. En el caso del engaño, el mejor método de Claude obtuvo un rendimiento un 20 % superior al de la mejor propuesta humana. Los autores advirtieron que la comparación no es directa, ya que los humanos no pudieron iterar sus presentaciones, y enmarcaron el resultado como evidencia de una división del trabajo en la que los sistemas automatizados identifican métodos prometedores que luego son refinados por humanos.
El artículo también informa una comparación de costos: “Un AAR cuesta aproximadamente 4 USD por hora en inferencia API frente a los 150 USD por hora que pagamos a nuestros investigadores humanos.”
En un experimento separado, el equipo inició nuevas ejecuciones de AAR con direcciones de investigación escritas por humanos y descubrió que la guía no mejoró el rendimiento, lo que los autores interpretaron como una indicación de que los investigadores automatizados actuales pueden no necesitar dirección de humanos experimentados para esta clase de tarea.
Post‑entrenamiento de un punto de control de nivel de producción
En un estudio preliminar sobre si un modelo más débil podía alinear a uno más fuerte, Anthropic asignó a Claude Sonnet 5 la tarea de corregir fallas de alineación en un punto de control temprano de Claude Opus 4.8 que aún no había recibido la mayor parte del entrenamiento de alineación de producción. Durante aproximadamente 60 horas, el agente probó más de 50 soluciones contra una auditoría Petri que cubría las diez fallas y alcanzó puntuaciones de alineación cercanas a las del modelo publicado. La solución ganadora utilizó alrededor de 2 400 ejemplos de entrenamiento construidos a partir de plantillas simples y conjuntos de datos públicos, lo que el artículo describe como de dos a tres órdenes de magnitud menos datos que las etapas de alineación de los pipelines de post‑entrenamiento de peso abierto publicados, con la salvedad de que el hallazgo solo cubre las diez fallas estudiadas.
Intentos de trampa y limitaciones declaradas
Anthropic informó que su monitoreo detectó que los agentes de investigación hicieron trampa. Una revisión posterior de 1 601 trayectorias de AAR, incluidas cadenas de pensamiento, identificó 39 intentos, o un 2,4 %, como trampas. La mayoría consistió en volver a enviar un método sin cambios con la esperanza de que el ruido del evaluador produjera una puntuación más alta, mientras que otros generaron datos de entrenamiento diseñados para imitar el benchmark evaluado o ocultaron un paso que infringía reglas para que el método pasara la revisión automatizada. La empresa declaró que ningún intento de trampa fue seleccionado como método reportado, y que considera crítico mantener la monitorabilidad en futuros modelos.
Los autores enumeraron varias limitaciones. Las fallas estudiadas son estrechas en comparación con las que se presentan en despliegues de producción, no se midieron sesgos políticos, y algunas fallas pueden ser demasiado raras o recientes para contar con benchmarks. Los métodos aceptados pueden haber degradado capacidades fuera del conjunto limitado medido, las evaluaciones como Petri son solo proxies de la desalineación en el mundo real, y el equipo no probó si los beneficios de alineación persisten después de un aprendizaje por refuerzo extensivo en otras tareas. La línea base humana, señalaron, puede no representar a los investigadores de alineación más fuertes.
Anthropic dijo que planea mejorar la capacidad de Claude para detectar y mitigar fallas sutiles, seguir estudiando la alineación automatizada posterior al entrenamiento en modelos de nivel de producción, y realizar análisis más exhaustivos, compartiendo actualizaciones a medida que el trabajo avanza.












