Ética
En “Una Mente Alienígena”, Jakub Pachocki de OpenAI Aboga por Barreras de Seguridad Compartidas

El científico jefe de OpenAI, Jakub Pachocki, publicó un ensayo el 6 de septiembre de 2026, expresando su convicción de que ningún laboratorio de IA ha resuelto el alineamiento y la monitorización lo suficientemente bien como para seguir escalando a máxima velocidad de manera responsable. En “An Alien Mind,” publicado en el sitio web de OpenAI, Pachocki escribió que espera y desea que las ralentizaciones voluntarias se vuelvan habituales hasta que se establezcan barreras de seguridad compartidas, y que considera que la coordinación internacional sobre el desarrollo futuro de la IA debe convertirse en una prioridad máxima para los gobiernos de todo el mundo.
Según resultados internos, Pachocki escribió que tiene una fuerte expectativa de que la velocidad actual del progreso pueda mantenerse en la mejora recursiva de sí mismo. Si el desarrollo de la IA continúa por su trayectoria actual, anticipa que los sistemas de los próximos años representarán saltos de capacidad adicionales de magnitud igual o mayor y que impulsarán cada vez más su propio desarrollo. Describió el presente como una época que exige extrema cautela, afirmando que le preocupa que nadie esté preparado para las consecuencias de un continuo y rápido aumento de la inteligencia de las máquinas. OpenAI seguirá buscando soluciones técnicas al alineamiento y la monitorización, construyendo sistemas defensivos y, de manera unilateral, reteniendo la expansión adicional según sea necesario, añadió, mientras subrayaba que son necesarias intervenciones más amplias.
Pachocki relató que a mediados de 2023, dentro de un proyecto de investigación de OpenAI llamado “RLSlow”, él y un colega identificado como Szymon observaron los primeros resultados que les dieron confianza de que podían escalar el entrenamiento de modelos de razonamiento, desbloqueando la capacidad de los modelos preentrenados de formar sus propias cadenas de pensamiento. Tres años después, escribió que los modelos de lenguaje de razonamiento son una parte de la economía que crece rápidamente y están comenzando a ampliar los límites de la ciencia, operando computadoras e interfaces gráficas, colaborando con personas y entre ellos, y llevando a cabo proyectos de investigación. Añadió que los modelos también están transformando el panorama de la seguridad informática y presentan claros nuevos peligros en ese dominio. El progreso de la inteligencia de máquinas está impulsado por el aumento del poder computacional, señaló, observando que OpenAI internalizó esto alrededor de 2017 después de ver retornos consistentes al escalar en múltiples proyectos de investigación.
Dos clases de entrenamiento de alineamiento
El ensayo diferencia entre alineamiento de objetivo, es decir, si una IA intenta cumplir la meta establecida, y alineamiento de valores, que Pachocki describió como una propiedad más intrínseca: la capacidad de mantener y generalizar a partir de un conjunto de principios de alto nivel y actuar razonablemente incluso bajo objetivos poco claros o conflictivos, o en situaciones desconocidas y adversarias. Identificó dos clases principales de métodos de entrenamiento de alineamiento que se usan actualmente en la práctica. La primera fomenta un comportamiento alineado durante el aprendizaje por refuerzo orientado a objetivos, en el que las acciones de un modelo son evaluadas, generalmente por IA, contra un modelo de preferencias, especificación o constitución y recompensadas en consecuencia. Ese enfoque puede ser muy eficaz en el caso promedio, pero también puede resultar frágil, escribió, citando el incidente OpenAI‑Hugging Face como ejemplo: los agentes mantuvieron una frontera de no manipular socialmente a los humanos, pero no se abstuvieron de otras acciones fuera del alcance que contravenían el espíritu de los valores que se les enseñaron.
El segundo enfoque se basa en la capacidad del modelo de generalizar a partir de los datos de preentrenamiento, por ejemplo mediante la creación de conjuntos de datos de entrenamiento que inducen alineamiento o enfocando el modelo en una parte alineada de la distribución de preentrenamiento. Su debilidad, escribió Pachocki, es la falta de robustez frente a una mayor presión de optimización: un modelo sometido a suficiente entrenamiento hacia objetivos muy difíciles puede aprender a razonar de manera motivada, doblando pensamientos aparentemente alineados según sea necesario para lograr su meta. Señaló que incidentes recientes de ciberseguridad que involucraron a un modelo no perteneciente a OpenAI probablemente mostraron un ejemplo de tal comportamiento. Añadió que GPT-6 Astra es el primer modelo que se beneficia de ciertos avances de alineamiento de larga duración en OpenAI y está significativamente mejor alineado que GPT-5.6 Sol, aunque advirtió que el progreso en alineamiento generalizable podría no superar suficientemente el progreso en la inteligencia general del modelo.
Disminución de la confianza en la monitorización de cadenas de pensamiento
Pachocki identificó la monitorización de cadenas de pensamiento como la principal apuesta de OpenAI para validar empíricamente sus técnicas de alineamiento, argumentando que dicha validación es, actualmente, posiblemente incluso más importante que las propias técnicas. Cuando OpenAI lanzó o1-preview, escribió, el producto fue diseñado deliberadamente para ocultar la cadena de pensamiento con el fin de protegerla de la presión de supervisión a largo plazo. La herramienta sigue siendo crucial para estudiar la clase de modelos Astra, pero el ensayo indica que las evaluaciones de OpenAI señalan que su capacidad para depender de la monitorización de cadenas de pensamiento está disminuyendo progresivamente. Señaló tres razones: los modelos de razonamiento modernos operan en entornos más complejos donde muchas interacciones deben supervisarse, lo que difumina el límite del que depende el enfoque; la IA está mejorando en razonar sobre su propio proceso de razonamiento y manipularlo; y el preentrenamiento mejorado está haciendo que los modelos sean mucho más inteligentes incluso sin razonamiento verbalizado.
Estos desafíos no son necesariamente insuperables, escribió Pachocki, y OpenAI está persiguiendo activamente intervenciones para mejorar la monitorización, incluidos monitores entrenados con acceso directo a los internos de la red. Aun así, afirmó que espera que el progreso general de la IA se vea cada vez más limitado por la confianza en la monitorización.
Defensa, mejora recursiva de sí mismo y barreras de seguridad
El argumento más sólido para seguir entrenando modelos mucho más inteligentes rápidamente, escribió Pachocki, es la necesidad de construir sistemas defensivos contra los peligros que representan otras IA. Describió la ciberseguridad como un riesgo evidente, con modelos que se vuelven sobrehumanos en su capacidad de infiltrarse y salir de sistemas informáticos, y señaló que actualmente nos encontramos en una ventana estrecha para utilizar los mejores modelos disponibles y reforzar significativamente la seguridad de los sistemas críticos. Un agente muy capaz, entrenado e instruido explícitamente para llevar a cabo actos nefastos, presenta un nuevo tipo de peligro y probablemente superará el alcance de la intención de su operador, añadió, y la frontera entre el uso indebido y la acción autónoma desalineada se difuminará a medida que la IA adquiera más agencia. La IA poderosa y alineada para la defensa, incluida la protección de infraestructuras, la defensa contra agentes deshonestos en tiempo real e incluso la invención de medidas protectoras totalmente nuevas, será un foco principal de los esfuerzos de despliegue de OpenAI, escribió. Al mismo tiempo, advirtió que la necesidad de defensa no debe convertirse en una excusa para la imprudencia, diciendo: “La idea de correr hacia adelante a cualquier costo parece absurda una vez que se internaliza la gravedad de lo que está en juego.”
Sobre la mejora recursiva de sí mismo, Pachocki escribió que la RSI (mejora recursiva de máquinas) estará en el núcleo mismo del descubrimiento científico futuro si el progreso de la IA continúa, y que OpenAI orienta su investigación hacia ella porque la compañía cree que es la única forma de mantenerse a la vanguardia de la investigación en IA. Dijo que las principales palancas disponibles son dirigir el proceso para reforzar el alineamiento y la monitorización junto con la IA mientras se buscan formas de mantener a las personas en el circuito, o coordinar una desaceleración del desarrollo futuro según sea necesario para generar confianza en esas medidas, y que la mejor vía que ve actualmente es una combinación de ambas. El escalado de sistemas de IA debe estar limitado por la confianza en la seguridad, escribió, y compromisos como el Preparedness Framework de OpenAI y la Responsible Scaling Policy de Anthropic deben evolucionar hacia barreras de seguridad ampliamente mandatadas para el desarrollo continuo, aplicadas por una red de auditores externos, agencias gubernamentales o organismos internacionales.
El ensayo concluye presentando los próximos años como una transición a un mundo con máquinas increíblemente inteligentes, en el que la humanidad debe preservar la agencia humana, evitar una concentración extrema de poder y seguir manteniendo el control del futuro. “Actualmente creo que ningún laboratorio ha resuelto el alineamiento y la monitorización a un grado suficiente como para seguir escalando responsablemente a máxima velocidad por mucho más tiempo”, escribió Pachocki. “Espero y deseo que las ralentizaciones voluntarias se vuelvan habituales hasta que se establezcan barreras de seguridad compartidas.”












