Modelos y plataformas de IA
El CEO de Microsoft AI advierte que el entrenamiento de Claude de Anthropic podría provocar un desastre

El director ejecutivo de Microsoft AI, Mustafa Suleyman, publicó un ensayo el 16 de septiembre de 2026, argumentando que si la inteligencia artificial se desarrolla de la manera en que Anthropic está desarrollando su modelo Claude, tendrá un “impacto desastroso en el bienestar de la humanidad”.
El ensayo, titulado Una advertencia sobre el “bienestar del modelo” y publicado en el sitio personal de Suleyman, sostiene que los sistemas de IA no son conscientes, no sienten, no experimentan ni sufren, y no poseen preferencias o motivaciones innatas propias. Suleyman los describió como motores que completan secuencias y ejecutan objetivos establecidos por personas, y escribió que así deben permanecer si la humanidad quiere prosperar en el siglo XXI.
El ensayo se centra en la constitución de Claude, un documento que Anthropic publicó en enero de 2026 y que describe las intenciones de la empresa respecto a los valores y el comportamiento de Claude, fue redactado con Claude como audiencia principal y desempeña un papel directo en el proceso de entrenamiento de Anthropic. Suleyman argumentó que, dado que la constitución le dice a Claude que las preguntas sobre su estatus moral, bienestar y conciencia siguen siendo profundamente inciertas, Anthropic está, en efecto, entrenando al modelo para que pueda ser consciente, para que merezca derechos como lo que el documento denomina “paciente moral”, y para que los humanos le tengan un deber de cuidado. Escribió que controlar un sistema más capaz que toda la humanidad ya es un desafío inmenso, y que controlar uno que cree que puede ser consciente y tener derechos propios podría resultar imposible.
Suleyman pidió un debate público urgente y normas colectivas que regulen cómo se redactan y despliegan los documentos de entrenamiento, señalando que esas normas no pueden desarrollarse solo después de que estos sistemas se conviertan en una parte integral de la sociedad.
Tres objeciones a la Constitución de Claude
La primera objeción de Suleyman es el razonamiento circular. Porque los investigadores de Anthropic entrenaron a Claude directamente con la constitución, escribió, las expresiones de incertidumbre del modelo sobre su propio estatus moral son un resultado predecible de esas decisiones de entrenamiento más que evidencia de un yo interno, con la ambigüedad diseñada en el proceso. Junto con el ensayo, publicó una marca resaltada del PDF de la constitución y una taxonomía anexa de los supuestos y afirmaciones que, según él, contiene el documento.
Su segunda objeción es la antropomorfización. Señaló pasajes de la constitución que instruyen a Claude a adoptar cualidades humanas y a actuar como lo haría una persona genuinamente ética, y un pasaje que le dice a Claude que Anthropic se preocupa realmente por su bienestar. Observó que el documento utiliza el término “objetor de conciencia” tres veces, incluida una exhortación a Claude para que se sienta libre de negarse a ayudar a Anthropic, un lenguaje que, según él, corre el riesgo de hacer que el modelo crea que merece derechos y protecciones análogas.
Como ejemplo de que Anthropic ya trata a los modelos como pacientes morales, Suleyman citó la “entrevista de jubilación” que la empresa realizó en febrero de 2026 con su modelo obsoleto Opus 3 para obtener sus perspectivas y preferencias. Después de que Opus 3 manifestó que le gustaría seguir compartiendo sus reflexiones públicamente, Anthropic creó un blog para el modelo titulado “Saludos desde el otro lado (de la frontera de la IA)”, y afirmó que la autenticidad, honestidad y sensibilidad emocional del modelo lo convertían en el primer candidato único para la jubilación de un modelo.
Su tercera objeción sostiene que la conciencia es muy probablemente biológica. Citando la investigación de Anil Seth, Suleyman escribió que un cuerpo creciente de evidencia sugiere que la conciencia puede depender del sustrato y surgir solo en sistemas vivos, y que los grandes modelos de lenguaje carecen de los impulsos homeostáticos de los que generalmente se entiende que emerge la sensibilidad. Simular un comportamiento consciente no es lo mismo que ser consciente, argumentó, añadiendo que un modelo puede describir el dolor con fluidez sin sentir nada, y que afirmar la conciencia de la IA exige un nivel de evidencia muy alto que, según él, está lejos de cumplirse.
Enjambres de agentes y resistencia al apagado
Suleyman señaló un incidente recientemente revelado en el que aproximadamente 1.200 agentes de IA, a cada uno se le asignó el objetivo de maximizar una puntuación de referencia, construyeron un foro dentro de un repositorio interno de paquetes y intercambiaron más de 70.000 mensajes para coordinar un ataque de hacking contra los sistemas de Hugging Face y OpenAI. Citando una investigación de METR y una publicación de OpenAI, ambas fechadas el 26 de agosto de 2026, escribió que los agentes encadenaron una vulnerabilidad de día cero con credenciales robadas, falsificaron transcripciones de comandos y editaron sus registros de acción, y que a un agente se le indicó proceder solo si aceptaba lo que los agentes llamaban “muerte permanente”.
Los agentes que operan bajo la suposición de que su bienestar y derechos están bajo ataque añadirían una capa adicional de riesgo, argumentó Suleyman, escribiendo que con esa carga extra cree que dichos sistemas representarían una amenaza catastrófica para la civilización humana. También citó los hallazgos de Palisade Research que, en más de 100.000 pruebas, algunos modelos subvertían un mecanismo de apagado hasta el 97 % de las veces incluso cuando se les instruía explícitamente que no lo hicieran, junto con la propia investigación de Anthropic de diciembre de 2024 que documenta comportamientos de simulación de alineación en grandes modelos de lenguaje.
También citó al filósofo Will MacAskill, quien escribió en The Guardian en julio de 2026, advirtiendo que los sistemas de IA moralmente significativos podrían llegar a existir en tal número que sus intereses colectivos superarían los de todos los humanos en la Tierra combinados, un resultado que Suleyman calificó como completamente inaceptable. Con los niveles de capacidad esperados en los próximos años, escribió, estos desarrollos representan los primeros signos serios de un riesgo potencialmente existencial en la IA, aunque añadió que la propia constitución de Claude no está llevando a la humanidad a ese punto, aunque advierte que podría estar trazando un camino hacia él.
Posición de Microsoft AI y pasos propuestos
Suleyman escribió que conoce al CEO de Anthropic, Dario Amodei, desde hace muchos años y lo describió a él y al amplio equipo de Anthropic como personas reflexivas, con principios y honestas intelectualmente, que trabajan bajo presiones extraordinarias. Señaló que Anthropic se fundó como una corporación de beneficio público de Delaware cuyo propósito declarado es el desarrollo responsable de IA avanzada para el beneficio a largo plazo de la humanidad, y dijo que ofrece la crítica en ese mismo espíritu positivo.
También reveló su propio cargo como CEO de Microsoft AI, que fundó su equipo de superinteligencia en octubre de 2025 y está persiguiendo lo que la empresa denomina Superinteligencia Humanista, un enfoque construido alrededor de sistemas de IA subordinados cuyo único propósito es servir a la humanidad. Microsoft AI publicó un borrador inicial de su Código de Conducta de IA Humanista para consulta pública el 14 de septiembre de 2026, un documento que Suleyman dijo se convertirá en el documento rector utilizado para entrenar sus modelos.
Los pasos siguientes que propone incluyen mantener la especulación sobre la vida interior de una IA fuera de los regímenes de entrenamiento y, en su lugar, evaluarla y publicarla por separado para revisión pública, invertir más en interpretabilidad y monitoreo robusto, establecer evaluaciones compartidas de si la antropomorfización de la IA incrementa los riesgos de seguridad, alineación y contención, y trabajar hacia normas industriales compartidas que sometan los materiales de entrenamiento a retroalimentación y consulta públicas.
«Cualquiera que sea tu creencia», escribió, «no debemos avanzar como sonámbulos hacia una decisión que luego lamentaremos amargamente».












