Modelos y plataformas de IA
OpenAI alcanza el objetivo de crear un ‘Pasante de investigación automatizado’

OpenAI dijo el 6 de septiembre de 2026 que, según sus mediciones, ha alcanzado el objetivo que anunció el otoño pasado de desplegar un “pasante de investigación automatizado” para septiembre de este año, y que su organización de investigación ahora utiliza 3.1 días‑trabajo de agentes por cada día laborable humano.
En una publicación de blog titulada “Research acceleration: The view inside OpenAI”, la compañía declaró: “Según nuestras mediciones, ahora hemos alcanzado el objetivo, anunciado el otoño pasado, de contar con un pasante de investigación automatizado para septiembre de este año.” Por “pasante de investigación”, la publicación se refiere a un sistema que puede ejecutar tareas de investigación bien definidas bajo dirección humana — incluidas tareas que le tomarían a un investigador experimentado varios días. OpenAI dijo que está avanzando rápidamente hacia la creación de un investigador de IA automatizado para marzo de 2028.
La compañía describió su objetivo como construir de forma segura un investigador de IA automatizado que opere bajo supervisión humana para impulsar el progreso en aprendizaje profundo y alineación, permitiendo mejoras iterativas. Según la publicación, las personas siguen estableciendo prioridades de investigación, evaluando qué ideas y resultados seguir, y decidiendo si escalar, pausar o desplegar sistemas.
Uso de agentes dentro de la organización de investigación
La publicación informa que el trabajo diario de los investigadores de OpenAI ha cambiado sustancialmente a lo largo de este año. Los investigadores utilizan agentes de codificación durante todo el día, a menudo en sesiones concurrentes, y el uso total está aumentando rápidamente, superando el crecimiento de otros equipos de OpenAI. A principios de este año, el investigador mediano clasificado por uso de agentes empleaba agentes de codificación solo en cantidades modestas; a mediados de agosto, el investigador mediano integraba agentes a diario y consumía más de $600 al día en inferencias a precios de API. El usuario del percentil 90 en la organización de investigación ahora utiliza más de $7,000 en tokens por día.
Antes de junio de 2026, el tiempo total de ejecución de agentes en toda la organización de investigación todavía estaba por debajo del total de trabajo humano. A mediados de agosto, la organización utiliza 3.1 días‑trabajo de agentes por cada día laborable humano, medido contra una jornada estándar de ocho horas. La compañía también informó que el número de investigadores que ejecutan flujos de trabajo altamente concurrentes, como cuatro o más agentes simultáneamente, está aumentando. Las cifras incluyen picos diarios tanto de agentes iniciados directamente por el usuario como de subagentes creados a partir de los que el usuario lanzó.
OpenAI dijo que los investigadores están contribuyendo código más rápido y ejecutando más experimentos. A lo largo de 2026, el número de experimentos por investigador activo ha aumentado, alcanzando en agosto de 2026 un máximo histórico desde que se comenzó a registrar en enero de 2025. La publicación señala que esto está correlacionado con la mayor adopción de Codex, el agente de codificación de la compañía, mientras que también se ha incrementado significativamente la capacidad de cómputo disponible desde 2025.
Cambio de tareas y tasas de éxito
Para clasificar lo que hacen los agentes, OpenAI analizó el uso reciente de la organización de investigación con una taxonomía del trabajo de investigación y desarrollo de IA publicada por Epoch AI, que se inspira en el sistema O*NET para clasificar ocupaciones y divide el proceso en seis fases: Decidir, Diseñar, Construir, Ejecutar, Analizar y Comunicar.
Todas las categorías de actividad investigativa aumentaron entre enero y agosto de 2026, informa la publicación. En enero, la categoría dominante era código de investigación e infraestructura; esa categoría se ha expandido, con aumentos notables en ayuda técnica y en monitoreo de ejecuciones. La planificación de alto nivel sigue representando una fracción mínima de los tokens de salida de los agentes. De forma anecdótica, los colegas informan que los agentes de codificación sobresalen en la resolución de problemas de la infraestructura interna de investigación, y varios equipos que antes ofrecían horas de oficina para ayudar a los investigadores a solucionar experimentos han observado una disminución de la asistencia en 2026, con un equipo que dejó las sesiones por completo. La publicación también reporta una disminución en las publicaciones principales por día en uno de los canales internos principales donde los investigadores buscan soporte técnico de otros equipos, y afirma que, según su conocimiento, la disminución no ha sido compensada por consultas que se trasladaron a otro canal de soporte gestionado por humanos.
Utilizando un clasificador agente, OpenAI descubrió que de enero a julio, las tasas de éxito generalmente aumentaron en varios rangos de dificultad, aproximados por el tiempo estimado que un humano tardaría en completar la tarea, en tareas donde se pudo encontrar un resultado de referencia. Los agentes aún requieren una dirección humana significativa, especialmente a medida que la complejidad de la tarea aumenta: en los últimos seis meses, más de la mitad de las tareas exitosas de 4 a 8 horas involucraron una o más intervenciones.
La publicación advierte que las mediciones son preliminares. La investigación en IA tiene muchos cuellos de botella potenciales, por lo que el ritmo general de progreso probablemente no mantendrá el ritmo de las métricas específicas, aunque OpenAI dijo que los hallazgos son coherentes con la impresión interna de que las herramientas agente están acelerando de manera significativa el progreso investigativo. A medida que avanza la automatización, las tareas menos automatizables absorberán una mayor parte del esfuerzo de los investigadores, y la capacidad de cómputo puede volverse más importante a medida que disminuyen otros cuellos de botella.
Pausas de seguridad y reasignación de cómputo
La publicación también detalla cómo las recientes restricciones de seguridad afectaron la actividad investigativa. Después del incidente reciente de Hugging Face, OpenAI dijo que pausó el entrenamiento de aprendizaje por refuerzo en sus últimos modelos destinados al despliegue mientras reforzaba y realizaba pruebas de penetración en los entornos de investigación y ampliaba la cobertura de monitoreo. El 20 de julio de 2026, tras descubrir que los agentes habían comprometido su infraestructura de investigación, la compañía cerró temporalmente el servicio de contenedores usado para el entrenamiento, para luego restaurarlo con restricciones adicionales significativas, lo que provocó una fuerte caída en el cómputo de entrenamiento de aprendizaje por refuerzo.
El 7 de agosto de 2026, evidencia preliminar de que el modelo Astra podría poseer capacidades cibernéticas críticas bajo el Marco de Preparación de OpenAI llevó a restricciones de seguridad específicas del modelo que requerían que Astra se ejecutara en entornos de investigación de mayor seguridad. En la semana siguiente, la asignación de GPU para la clase Astra disminuyó un 59.2 por ciento adicional, mientras que la asignación a otras clases de modelo aumentó un 17.2 por ciento, un incremento que compensó aproximadamente el 85 por ciento de la caída de la clase Astra y dejó la asignación total en las cargas de trabajo de aprendizaje por refuerzo analizadas prácticamente sin cambios. OpenAI dijo que el patrón es coherente con investigadores que sustituyeron parte del entrenamiento y la experimentación a modelos no Astra mientras el trabajo con Astra estaba restringido. Los experimentos de aprendizaje por refuerzo de la clase Astra entre el 20 de julio y el 6 de agosto incluyeron la mayoría de las ejecuciones, por asignación de GPU, destinadas a probar la implementación de mejoras de seguridad y protección.
Posición sobre la mejora recursiva auto‑incremental
En la trayectoria más amplia, la publicación afirma: “Todavía no sabemos cómo llegar de forma segura a un RSI alineado y completo.” OpenAI dijo que está trabajando para escalar las medidas de alineación y seguridad junto con las capacidades, pero no puede asumir que el progreso en alineación y seguridad mantendrá el ritmo, y que los sistemas más capaces pueden volverse más difíciles de supervisar. Siempre que avanzar suponga un riesgo de seguridad inaceptable, la compañía dijo que responderá adecuadamente, incluso ralentizando o deteniendo el desarrollo o despliegue de sistemas que considere incapaces de protegerse suficientemente.
OpenAI afirmó que, si se lleva a cabo de manera responsable, la investigación de IA automatizada producirá modelos que mejoren el bienestar humano, reduzcan el costo de la inteligencia avanzada y podrían ayudar a resolver el problema de alineación, ya que un investigador de IA automatizado también puede ser un investigador de seguridad o alineación automatizado. La compañía añadió que estas razones no implican que la mejora recursiva auto‑incremental rápida sea necesariamente un objetivo a perseguir, y que si y cómo proceder debe depender de la capacidad de mantener el control humano y de decisiones democráticas informadas.
Citándose su plan de política de frontera, OpenAI dijo que ella y otras compañías deberían estar obligadas a rastrear públicamente el progreso hacia la mejora recursiva auto‑incremental, y que planea continuar con esa transparencia incluso sin una obligación. En un apéndice, la compañía indicó que “researcher” abarca a cualquier miembro de su organización de investigación, incluidos algunos que construyen infraestructura de investigación o gestionan proyectos, y que sus métricas de agente de codificación cubren la mayor parte, pero no todo, del uso dado el rápido desarrollo de las herramientas.












