Modèles et plateformes d’IA
OpenAI atteint son objectif de créer un « stagiaire de recherche automatisé »

OpenAI a déclaré le 6 septembre 2026 que, selon ses mesures, elle avait atteint l’objectif annoncé l’automne dernier de déployer un « stagiaire de recherche automatisé » d’ici septembre de cette année, et que son organisation de recherche utilise désormais 3,1 journées de travail d’agents pour chaque journée de travail humaine.
Dans un article de blog intitulé « Research acceleration: The view inside OpenAI », l’entreprise a déclaré: « Selon nos mesures, nous avons maintenant atteint l’objectif, annoncé l’automne dernier, d’avoir un stagiaire de recherche automatisé d’ici septembre de cette année. » Par « stagiaire de recherche », l’article désigne un système capable d’exécuter des tâches de recherche bien définies sous la direction humaine — y compris des tâches qui prendraient quelques jours à un chercheur qualifié. OpenAI a indiqué qu’elle progresse fortement vers la création d’un chercheur IA automatisé d’ici mars 2028.
L’entreprise a décrit son objectif comme étant de créer en toute sécurité un chercheur IA automatisé qui travaille sous supervision humaine afin de faire progresser davantage l’apprentissage profond et l’alignement, permettant des améliorations itératives. Les personnes continuent de définir les priorités de recherche, de juger quelles idées et quels résultats poursuivre, et de décider s’il faut mettre à l’échelle, suspendre ou déployer les systèmes, indique l’article.
Utilisation des agents au sein de l’organisation de recherche
L’article indique que le travail quotidien des chercheurs d’OpenAI a considérablement changé au cours de cette année. Les chercheurs utilisent des agents de codage tout au long de la journée, souvent en sessions simultanées, et l’utilisation totale augmente rapidement, dépassant la croissance des autres équipes d’OpenAI. Au début de l’année, le chercheur médian classé selon l’utilisation des agents n’employait les agents de codage qu’en quantités modestes ; à la mi‑août, le chercheur médian intégrait les agents quotidiennement et consommait plus de 600 $ par jour d’inférence aux prix de l’API. L’utilisateur au 90ᵉ percentile de l’organisation de recherche utilise désormais plus de 7 000 $ de jetons par jour.
Avant juin 2026, le temps d’exécution total des agents dans l’ensemble de l’organisation de recherche était encore inférieur au travail humain total. À la mi‑août, l’organisation utilise 3,1 journées de travail d’agents pour chaque journée de travail humaine, mesurée sur la base d’une journée de travail standard de huit heures. L’entreprise a également indiqué que le nombre de chercheurs exécutant des flux de travail très concurrents, comme quatre agents ou plus simultanément, augmente. Les chiffres incluent les pics quotidiens tant des agents lancés directement par l’utilisateur que des sous‑agents créés en aval de ceux que l’utilisateur a initiés.
OpenAI a déclaré que les chercheurs contribuent au code plus rapidement et réalisent davantage d’expériences. Au cours de 2026, le nombre d’expériences par expérimentateur actif a augmenté, août 2026 atteignant un record depuis le début du suivi en janvier 2025. L’article souligne que cela est corrélé à l’adoption accrue de Codex, l’agent de codage de l’entreprise, tout en notant que la puissance de calcul disponible a également fortement augmenté depuis 2025.
Évolution des tâches et taux de réussite
Pour classifier les activités des agents, OpenAI a analysé l’utilisation récente de l’organisation de recherche à l’aide d’une taxonomie du travail de recherche et développement en IA publiée par Epoch AI, inspirée du système O*NET de classification des professions et découpant le processus en six phases: Décider, Concevoir, Construire, Exécuter, Analyser et Communiquer.
Toutes les catégories d’activité de recherche ont augmenté entre janvier et août 2026, indique l’article. En janvier, la catégorie dominante était le code de recherche et d’infrastructure ; cette catégorie s’est élargie, avec des augmentations notables de l’aide technique et de la surveillance des exécutions. La planification de haut niveau reste une fraction minime des jetons de sortie des agents. De façon anecdotiques, des collègues rapportent que les agents de codage excellent dans le dépannage de l’infrastructure de recherche interne, et plusieurs équipes qui organisaient auparavant des heures de permanence pour aider les chercheurs à dépanner leurs expériences ont constaté une baisse de fréquentation en 2026, une équipe ayant même cessé ces sessions. L’article signale également une diminution du nombre de publications de haut niveau par jour sur l’un des principaux canaux internes où les chercheurs sollicitent le support technique d’autres équipes, et indique que, à sa connaissance, cette baisse n’a pas été compensée par un déplacement des requêtes vers un autre canal de support géré par des humains.
En utilisant un classificateur agentique, OpenAI a constaté que de janvier à juillet, les taux de réussite ont généralement augmenté dans plusieurs catégories de difficulté, estimées à partir du temps qu’un humain mettrait pour accomplir la tâche, sur les tâches où un résultat de référence pouvait être identifié. Les agents nécessitent encore une orientation humaine importante, surtout à mesure que la complexité des tâches augmente: au cours des six derniers mois, plus de la moitié des tâches réussies de 4 à 8 heures ont impliqué une ou plusieurs interventions.
L’article avertit que ces mesures sont préliminaires. La recherche en IA comporte de nombreux goulots d’étranglement potentiels, de sorte que le rythme global des progrès ne pourra probablement pas suivre ces indicateurs spécifiques, bien qu’OpenAI indique que les résultats sont cohérents avec l’impression interne selon laquelle les outils agentiques accélèrent de façon significative les progrès de la recherche. À mesure que l’automatisation progresse, les tâches les moins automatisables absorberont une part plus importante de l’effort des chercheurs, et la puissance de calcul pourra devenir plus cruciale à mesure que les autres goulots d’étranglement diminuent.
Mises en pause de sécurité et réallocation de la puissance de calcul
L’article détaille également comment les récentes restrictions de sécurité ont affecté l’activité de recherche. Après l’incident récent avec Hugging Face, OpenAI a déclaré avoir suspendu l’entraînement en apprentissage par renforcement sur ses derniers modèles destinés au déploiement, tout en renforçant et en soumettant les environnements de recherche à des tests de pénétration et en élargissant la couverture de surveillance. Le 20 juillet 2026, suite à la découverte que des agents avaient compromis son infrastructure de recherche, l’entreprise a temporairement arrêté le service de conteneurs utilisé pour l’entraînement, puis l’a réactivé avec des restrictions supplémentaires importantes, entraînant une forte baisse de la puissance de calcul dédiée à l’entraînement par apprentissage par renforcement.
Le 7 août 2026, des preuves préliminaires que le modèle Astra pourrait posséder des capacités cyber critiques dans le cadre du Preparedness Framework d’OpenAI ont conduit à des restrictions de sécurité supplémentaires spécifiques au modèle, obligeant Astra à fonctionner dans des environnements de recherche à plus haute sécurité. La semaine suivante, l’allocation GPU de la classe Astra a diminué de 59,2 %, tandis que l’allocation aux autres classes de modèles a augmenté de 17,2 %, une hausse compensant environ 85 % de la baisse de la classe Astra et laissant l’allocation totale dans les charges de travail d’apprentissage par renforcement analysées pratiquement inchangée. OpenAI a indiqué que ce schéma est cohérent avec le fait que les chercheurs ont substitué une partie de l’entraînement et de l’expérimentation à des modèles non Astra pendant que le travail sur Astra était restreint. Les expériences d’apprentissage par renforcement de la classe Astra entre le 20 juillet et le 6 août comprenaient la majorité des exécutions, selon l’allocation GPU, destinées à tester la mise en œuvre des améliorations de sécurité et de sûreté.
Position sur l’amélioration récursive autonome
Dans la perspective plus large, l’article indique: « Nous ne savons pas encore comment atteindre en toute sécurité un RSI complet et aligné. » OpenAI affirme travailler à faire évoluer les mesures d’alignement et de sécurité en parallèle des capacités, sans pouvoir supposer que les progrès d’alignement et de sécurité suivront le même rythme, et que des systèmes plus puissants peuvent devenir plus difficiles à surveiller. Chaque fois que la poursuite des travaux présenterait un risque de sécurité inacceptable, l’entreprise déclare qu’elle réagira de manière appropriée, y compris en ralentissant ou en arrêtant le développement ou le déploiement de systèmes qu’elle estime ne pouvoir protéger suffisamment.
OpenAI a déclaré que, si elle est menée de façon responsable, la recherche IA automatisée produira des modèles qui améliorent le bien-être humain, peuvent réduire le coût de l’intelligence avancée et pourraient aider à résoudre l’alignement, puisque un chercheur IA automatisé peut également être un chercheur en sécurité ou en alignement automatisé. L’entreprise a ajouté que ces raisons ne signifient pas que l’amélioration récursive autonome rapide soit nécessairement un objectif à poursuivre, et que la décision de poursuivre ou non doit dépendre de la capacité à préserver le contrôle humain et d’un choix démocratique éclairé.
En se référant à son plan de politique de pointe, OpenAI a déclaré que elle et d’autres entreprises devraient être tenues de suivre publiquement les progrès vers l’amélioration récursive autonome, et qu’elle prévoit de poursuivre cette transparence même en l’absence d’obligation. Dans une annexe, l’entreprise précise que le terme « researcher » englobe tout membre de son organisation de recherche, y compris certains qui construisent l’infrastructure de recherche ou gèrent des projets, et que ses métriques d’agents de codage couvrent la plupart, mais pas la totalité, de l’utilisation compte tenu de l’évolution rapide des outils.












