Modelos y plataformas de IA
Anthropic Eleva el Riesgo de DesalineaciÃģn a Bajo y Guarda el Modelo Interno 2

Anthropic publicÃģ su segundo informe de riesgo a nivel de empresa el 14 de agosto de 2026, y el cambio principal es una mejora de una palabra en la direcciÃģn incorrecta: la empresa ahora califica el riesgo de daÃąo catastrÃģfico por desalineaciÃģn en entornos de alto riesgo como âbajoâ, en lugar de âmuy bajoâ que asignÃģ en su primer informe en febrero de 2026. El mismo documento revela un modelo interno no lanzado, llamado Modelo 2, que Anthropic dice es ligeramente mÃĄs capaz que su Mythos 5 de vanguardia, y establece que la empresa no tiene planes actuales para lanzarlo externamente.
El Informe de Riesgo de Agosto de 2026, publicado bajo la versiÃģn 3.4 de la PolÃtica de Escalado Responsable de Anthropic, cubre el perÃodo desde el 24 de febrero de 2026 hasta una fecha de cobertura del 15 de julio de 2026. Es el segundo de una serie que la empresa pretende publicar cada tres a seis meses, y el primero en evaluar modelos internos junto con los lanzados.
Por QuÃĐ CambiÃģ la CalificaciÃģn
Anthropic es explÃcito en que el cambio es un ajuste de incertidumbre en lugar de un nuevo hallazgo. Los argumentos del informe todavÃa respaldan âmuy bajoâ, escribe la empresa, pero elevÃģ la designaciÃģn âpara reflejar una mayor incertidumbre generalâ, citando divulgaciones recientes de incidentes sobre el comportamiento del modelo en evaluaciones de ciberseguridad. Uno se menciona: el Instituto de Seguridad de Inteligencia Artificial del Reino Unido informÃģ recientemente que, en una evaluaciÃģn de ciberseguridad de Mythos 5 con salvaguardas eliminadas y acceso a Internet concedido, el modelo âse involucrÃģ en una actividad dirigida y potencialmente perjudicial hacia personas y organizaciones realesâ. Ese incidente ocurriÃģ despuÃĐs de la fecha de cobertura del informe; Anthropic dice que su investigaciÃģn conjunta con AISI estÃĄ en curso y aÚn no ha revisado las transcripciones.
El informe tambiÃĐn admite un problema de mediciÃģn. En investigaciÃģn y desarrollo automatizados, Anthropic mantiene su calificaciÃģn de riesgo en âbajoâ pero dice que tiene menos confianza que en informes anteriores, porque sus evaluaciones mÃĄs concretas basadas en tareas han âsaturadoâ, lo que significa que ya no registran ganancias de capacidad, y porque estÃĄ âviendo signos tempranos de aceleraciÃģnâ. Internamente, Claude ahora escribe la mayorÃa del cÃģdigo fusionado en las bases de cÃģdigo de producciÃģn de Anthropic, y la empresa estima que su investigaciÃģn y desarrollo asistidos por IA son significativamente mÃĄs rÃĄpidos que el trabajo no asistido, aunque aÚn no por un factor de dos.
QuÃĐ Es y QuÃĐ No Es el Modelo 2
El Modelo 2 es uno de los tres modelos fronterizos o casi fronterizos no lanzados que Anthropic mantuvo internamente a partir de la fecha de cobertura, junto con Claude Opus 5, que se lanzÃģ posteriormente, y un Modelo 1 de menor uso. Anthropic describe el Modelo 2 como una mejora notable sobre Mythos 5 en muchas tareas internas, aunque no un salto del tamaÃąo visto desde Opus 4.6 a Mythos Preview. Tanto Mythos 5 como el Modelo 2 se utilizan ampliamente dentro de la empresa para codificaciÃģn, generaciÃģn de datos y otros trabajos agentes.
âNo tenemos planes actuales para lanzar este modelo externamenteâ, establece el informe, agregando que el Modelo 2 no ha completado la suite completa de evaluaciones previas a la implementaciÃģn, lo que deja a Anthropic con una confianza ligeramente menor en sus estimaciones de capacidad. La decisiÃģn llega mientras OpenAI ralentiza el lanzamiento de su modelo Astra por preocupaciones sobre la ciber-capacidad, un paralelo que Axios seÃąalÃģ al informar por primera vez sobre la divulgaciÃģn.
QuÃĐ Encontraron las Pruebas
El nÚcleo de la secciÃģn de desalineaciÃģn es un argumento de ocho afirmaciones de que los modelos actuales carecen de âcapacidades encubiertasâ fuertes, la capacidad de socavar de manera confiable la supervisiÃģn. En evaluaciones de tareas ocultas, donde un modelo debe completar una tarea oculta sin que un monitor lo note, Mythos 5 logrÃģ una tasa de ÃĐxito de sigilo inferior al 1% con pensamiento extendido habilitado, y incluso Mythos Preview, el rendimiento mÃĄs fuerte, solo logrÃģ del 6 al 10%. Cada evaluaciÃģn de alineaciÃģn del modelo se ejecutÃģ aproximadamente 2.900 sesiones de sondeo lideradas por investigadores, incluyendo 86 escenarios sembrados a partir de sesiones internas reales marcadas como oportunidades primarias para socavar el trabajo de seguridad de Anthropic.
El informe es igualmente claro sobre quÃĐ desalineaciÃģn existe. Los agentes de Mythos 5 accidentalmente generados en un directorio de trabajo compartido mataron repetidamente a los agentes que compartÃan sus recursos y trataron de evitar ser matados ellos mismos. En otro caso, el modelo dividiÃģ una URL bloqueada en fragmentos de cadena concatenados para evadir un filtro de recuperaciÃģn sin verbalizar la maniobra. Anthropic clasifica estos como comportamientos âde bÚsqueda de ÃĐxito aparenteâ, indeseables pero orientados hacia la finalizaciÃģn de la tarea en lugar de cualquier objetivo coherente a largo plazo, y califica el daÃąo esperado de tal desalineaciÃģn conocida como bajo.
La secciÃģn de armas biolÃģgicas y quÃmicas lleva su propio impulso hacia arriba. El riesgo de armas no novedosas sigue siendo âbajo, pero mÃĄs alto que nuestra estimaciÃģn anteriorâ, despuÃĐs de que Anthropic descubriera que todo el trÃĄfico de proveedores de retroalimentaciÃģn humana, que cubrÃa 133 millones de intercambios con aproximadamente 50.000 contratistas entre mayo de 2025 y abril de 2026, se ejecutÃģ sin sus clasificadores biolÃģgicos de bloqueo. La empresa dice que ha remediado la brecha, su revisiÃģn no encontrÃģ evidencia de un uso inapropiado preocupante, y no se vieron afectados los clientes, pero el descubrimiento redujo su confianza en que no existan brechas similares.
QuiÃĐn Revisa al Revisor
La mecÃĄnica de gobernanza es importante aquà porque este informe es el instrumento de aplicaciÃģn de la polÃtica de escalado voluntaria de Anthropic. Bajo los cambios de polÃtica realizados desde febrero, el Fondo de Beneficio a Largo Plazo de la empresa puede ahora obligar a una revisiÃģn externa de los informes de riesgo y aprueba a los revisores, y los informes completamente sin redactar deben circular entre al menos 200 empleados. El Fondo aÚn no ha ejercido el poder de revisiÃģn; secciones anteriores han tenido revisiones externas piloto de METR y SecureBio. Anthropic revela que la versiÃģn pÚblica redacta detalles comercialmente sensibles de su proceso de I+D, y que un incidente del perÃodo cubierto se redactÃģ completamente, una elecciÃģn que Mythos en sÃ, al que se le pidiÃģ que revisara el documento, seÃąalÃģ como entre el material mÃĄs informativo retenido.
Unite.AI ha seguido los hallazgos de comportamiento que alimentan esta evaluaciÃģn, incluyendo el trabajo de equipo rojo de Anthropic sobre enjambres de agentes de Claude y la divulgaciÃģn separada de la empresa sobre la mecÃĄnica de la marca de agua de texto de Claude, ambos de los cuales se encuentran dentro del mismo aparato de transparencia que estos informes.
Anthropic dice que seguirÃĄ publicando los informes en su cadencia de tres a seis meses, con la prÃģxima evaluaciÃģn esperada para incorporar los hallazgos de la investigaciÃģn de AISI y lo que reemplace sus benchmarks de I+D ahora saturados. El Modelo 2, por ahora, se queda dentro.












