Angle d’Anderson

Le codage Vibe souffre lorsque le rôle de l’IA s’étend

mm
Ajouter Unite.AI à vos sources préférées sur Google
An AI-generated stock-style image depicting a human Caucasian male and a larger glossy humanoid robot attempting to collaborate on a document; but the aggressive robot is causing the annoyed man to be sidelined. GPT-5 Image + Photoshop enhancement.

Une nouvelle étude constate que le codage Vibe s’améliore lorsque les humains donnent les instructions, mais décline lorsque l’IA le fait, avec le meilleur ensemble hybride qui maintient les humains au premier plan, avec l’IA en tant qu’arbitre ou juge.

 

De nouvelles recherches menées aux États-Unis, examinant ce qui se passe lorsque les systèmes d’IA sont autorisés à diriger le codage Vibe, plutôt que de simplement exécuter les instructions humaines, ont constaté que lorsque les modèles de langage à grande échelle (LLM) prennent un rôle directionnel plus important, les résultats sont presque toujours pires.

Bien que les chercheurs aient utilisé GPT-5 d’OpenAI comme cadre pour leurs expériences de collaboration humaine/IA, ils ont confirmé par la suite que tanto Anthropic’s Claude Opus 4.5 que Google Gemini 3 Pro étaient soumis à la même courbe de détérioration à mesure que les responsabilités augmentaient, en déclarant que « même une implication humaine limitée améliore constamment les performances »:

‘[Les humains] fournissent des conseils de haut niveau efficaces à travers les itérations, [alors que] les conseils de l’IA mènent souvent à un effondrement des performances. De plus, nous constatons qu’une allocation de rôle soigneuse qui maintient les humains en charge de la direction tout en déchargeant l’évaluation à l’IA peut améliorer les performances hybrides.’

Afin de fournir un test cohérent qui puisse être évalué de la même manière par les humains et par l’IA, un cadre expérimental contrôlé a été construit autour d’une tâche de codage itérative dans laquelle une image de référence – présentant une photo d’un chat, d’un chien, d’un tigre, d’un oiseau, d’un éléphant, d’un manchot, d’un requin, d’un zèbre, d’une girafe ou d’un panda – devait être recréée à l’aide de graphiques vectoriels escalables (SVG), et que cette recréation devait être jugée par rapport à la photo source à partir de laquelle elle a été dérivée:

Les participants humains et l'IA ont été présentés une image de référence photographique aux côtés d'une reconstruction SVG générée par l'IA, et ont été invités à évaluer à quel point les deux étaient similaires sur une échelle de sept points. Source - https://arxiv.org/pdf/2602.10473

Les participants humains et l’IA ont été présentés une image de référence photographique aux côtés d’une reconstruction SVG générée par l’IA, et ont été invités à évaluer à quel point les deux étaient similaires sur une échelle de sept points. Source

À chaque tour, un agent fournissait des instructions de haut niveau en langage naturel pour guider un générateur de code, et un autre décidait de conserver la nouvelle version ou de revenir à la version précédente – une boucle structurée qui reflète les flux de travail collaboratifs réels.

Au cours de 16 expériences impliquant 604 participants et des milliers d’appels d’API, des tours de test dirigés entièrement par des humains ont été comparés directement avec des tours dirigés entièrement par l’IA, dans des conditions identiques.

Certaines des solutions variées obtenues par différentes combinaisons de pourcentages et de types de collaboration humaine/IA (prises d'une illustration plus grande dans le document source, auquel nous renvoyons le lecteur).

Certaines des solutions variées obtenues par différentes combinaisons de pourcentages et de types de collaboration humaine/IA (prises d’une illustration plus grande dans le document source, auquel nous renvoyons le lecteur).

Bien que les humains et l’IA aient performé à des niveaux similaires au début des tests, leurs trajectoires ont divergé au fil du temps: lorsque les humains fournissaient les instructions et prenaient les décisions de sélection, les scores de similarité augmentaient à travers les itérations, avec une amélioration cumulative constante; mais lorsque les systèmes d’IA remplissaient les deux rôles, les performances ne montraient pas d’amélioration constante, et déclinaient fréquemment au fil des tours – même si le même modèle sous-jacent était utilisé pour la génération de code, et que l’IA avait accès aux mêmes informations que les participants humains.

L’effet de prolixité

Les résultats ont également montré que les instructions humaines étaient généralement courtes et axées sur l’action, se concentrant sur ce qu’il fallait changer dans l’image actuelle; à l’inverse, les instructions de l’IA étaient beaucoup plus longues et densément descriptives (un facteur qui a été paramétré pour GPT-5), détaillant les attributs visuels plutôt que de prioriser la correction incrémentale.

Mais, comme on le voit dans le graphique ci-dessous, imposer des limites de mots strictes aux instructions de l’IA n’a pas inversé le modèle; même lorsque limitées à 10, 20 ou 30 mots, les chaînes dirigées par l’IA n’ont pas amélioré leurs performances au fil du temps:

Évaluations de similarité à travers les itérations pour les chaînes dirigées par des humains par rapport aux chaînes entièrement dirigées par l'IA et aux chaînes dirigées par l'IA limitées à 10, 20 ou 30 mots d'instruction, montrant que la réduction des invites de l'IA ne prévient pas la dégradation de la performance itérative observée lorsque l'IA dirige à la fois l'instruction et la sélection.

Évaluations de similarité à travers les itérations pour les tours dirigés par des humains par rapport aux tours entièrement dirigés par l’IA et aux tours dirigés par l’IA limités à 10, 20 ou 30 mots d’instruction. Evidemment, la réduction des invites de l’IA ne prévient pas la dégradation de la performance itérative observée lorsque l’IA dirige à la fois l’instruction et la sélection.

Les expériences hybrides ont rendu le modèle plus clair, montrant qu’ajouter même un peu d’implication humaine améliorait les résultats, par rapport aux ensembles entièrement dirigés par l’IA; pourtant, les performances ont généralement décliné à mesure que la part de conseils de l’IA augmentait.

Lorsque les rôles ont été séparés, l’évaluation et la sélection pouvaient être confiées à l’IA avec une perte de qualité relativement faible; mais remplacer les instructions de haut niveau humaines par des conseils de l’IA a conduit à des baisses de performance notables, suggérant que ce qui importe le plus n’est pas qui génère le code, mais qui fixe et maintient la direction à travers les itérations.

Les auteurs concluent:

‘À travers plusieurs expériences, le codage dirigé par des humains s’est amélioré de manière cohérente à travers les itérations, tandis que le codage dirigé par l’IA a souvent collapsé malgré l’accès aux mêmes informations et aux mêmes capacités d’exécution.

‘Cela met en évidence les luttes clés des systèmes d’IA actuels pour maintenir une direction de haut niveau cohérente à travers des interactions répétées, du type nécessaire pour un codage Vibe réussi’

Le nouvel article est intitulé Why Human Guidance Matters in Collaborative Vibe Coding, et provient de sept chercheurs issus de l’Université Cornell, de l’Université de Princeton, du Massachusetts Institute of Technology et de l’Université de New York.

Méthode

Pour les expériences, un instructeur humain a regardé une photo de référence générée par GPT-5, ainsi que la dernière tentative d’imitation SVG associée. Il a ensuite écrit des instructions en langage naturel pour guider le générateur de code vers une correspondance plus étroite.

Ainsi, le générateur produisait un nouveau SVG à chaque tour, fournissant une boucle itérative pour tester comment l’effet de la direction s’accumule au fil du temps. Les cibles étaient dix images d’animaux générées par GPT-5, couvrant une gamme de formes et de textures afin que les améliorations ou les erreurs soient faciles à détecter:

Schéma du flux de travail de codage Vibe utilisé dans l'étude. En A), un instructeur humain regarde une image de référence photographique avec le meilleur SVG produit jusqu'à présent et écrit des instructions en langage naturel pour le générateur de code à suivre lors de la production du prochain SVG; en B), un sélectionneur humain compare le nouveau SVG avec le précédent et choisit la version qui correspond le mieux à l'image de référence, avant de passer le SVG sélectionné à l'étape suivante; et en C), des évaluateurs humains indépendants évaluent à quel point chaque SVG généré est similaire à son image de référence, fournissant les scores utilisés pour évaluer les performances globales.

Schéma du flux de travail de codage Vibe utilisé dans l’étude. En A), un instructeur humain regarde une image de référence photographique avec le meilleur SVG produit jusqu’à présent et écrit des instructions en langage naturel pour le générateur de code à suivre lors de la production du prochain SVG; en B), un sélectionneur humain compare le nouveau SVG avec le précédent et choisit la version qui correspond le mieux à l’image de référence, avant de passer le SVG sélectionné à l’étape suivante; et en C), des évaluateurs humains indépendants évaluent à quel point chaque SVG généré est similaire à son image de référence, fournissant les scores utilisés pour évaluer les performances globales.

Un sélectionneur humain a comparé chaque nouveau SVG généré avec le précédent et a accepté ou rejeté, ce qui a maintenu le processus aligné avec l’image de référence à travers les tours. Dans ce dispositif de base, la même personne a rempli les deux rôles.

Pour mesurer la qualité, des évaluateurs humains indépendants ont évalué à quel point chaque SVG généré était similaire à son image de référence. Au cours de seize expériences, 120 personnes ont produit 4 800 évaluations. Toutes les expériences ont été exécutées sur le cadre PsyNet, un portail conçu pour accueillir des interactions structurées entre les humains et les systèmes d’IA.

L’étude a recruté 604 locuteurs natifs anglais, dans des tests qui ont consommé 4 800 appels d’API pour la génération de code et 5 327 appels d’API pour les instructions. Bien que GPT-5 ait été le modèle principal utilisé, de petites lots de comparaison ont été effectués avec Claude Opus 4.5 et Gemini 3 Pro, qui ont chacun géré 280 requêtes.

Résultats

Trente tours de codage Vibe ont été exécutés, chacun comprenant quinze éditions des dix images de référence de base. Pour ceux-ci, 45 participants humains ont été choisis, chacun servant à la fois de sélectionneur et d’instructeur au cours de dix itérations, dans les tours « dirigés par des humains ».

Au sein de chaque tour, le même participant a d’abord choisi entre le SVG actuel et le précédent, puis a écrit les instructions pour le prochain tour. Une deuxième version du test a remplacé les décisions humaines par des appels d’API à GPT 5, tout en maintenant le reste du dispositif inchangé. Dans tous les cas, l’instructeur et le sélectionneur ont fourni des instructions en langage naturel au générateur de code.

Un exemple représentatif de codage Vibe à plusieurs tours montre comment le processus diverge au fil du temps; lorsque les humains agissent à la fois en tant que sélectionneurs et instructeurs, la sortie SVG s’améliore de manière constante à travers les itérations, se rapprochant de l’image de référence à chaque tour:

Exemples de progrès pour une image de référence sous codage Vibe dirigé par des humains (en haut) et par l'IA (en bas), montrant une amélioration constante à travers les itérations avec des humains dans les deux rôles, et une stagnation ou une dérive lorsque les deux rôles sont gérés par l'IA.

Exemples de progrès pour une image de référence sous codage Vibe dirigé par des humains (en haut) et par l’IA (en bas), montrant une amélioration constante à travers les itérations avec des humains dans les deux rôles, et une stagnation ou une dérive lorsque les deux rôles sont gérés par l’IA.

Inversement, dans la version dirigée par l’IA, les premiers tours ont parfois capturé des fonctionnalités visuelles clés, mais les tentatives ultérieures n’ont pas réussi à construire sur ces gains, et dans certains cas se sont éloignées de la cible:

Sorties finales de l'itération finale, comparant les tours dirigés par des humains (rangée du haut) avec les chaînes dirigées par l'IA (rangée du bas), sur le même ensemble d'images de référence. Les résultats dirigés par des humains correspondent plus étroitement aux animaux d'origine, et les résultats dirigés par l'IA montrent des distorsions visibles ou une perte de fonctionnalités clés.

Sorties finales de l’itération finale, comparant les tours dirigés par des humains (rangée du haut) avec les chaînes dirigées par l’IA (rangée du bas), sur le même ensemble d’images de référence. Les résultats dirigés par des humains correspondent plus étroitement aux animaux d’origine, tandis que les résultats dirigés par l’IA montrent des distorsions visibles ou une perte de fonctionnalités clés.

Pour mesurer les tendances émergentes de manière quantitative, les images finales ont été présentées à des évaluateurs humains indépendants et évaluées pour leur similarité avec les images de référence. Dans les premiers tours, les scores des versions dirigées par des humains et par l’IA étaient à peu près les mêmes; mais à la quinzième itération, la différence était claire, avec les images choisies par les humains évaluées comme beaucoup plus proches des cibles. Au fil du temps, les scores humains ont augmenté de manière constante, avec le plus grand gain relatif par rapport à l’IA atteignant 27,1 %.

Scores de similarité moyens à travers les itérations pour le codage Vibe dirigé par des humains et par l'IA, montrant des gains constants lorsque les humains agissent à la fois en tant que sélectionneurs et instructeurs, et un déclin progressif lorsque les deux rôles sont gérés par GPT 5.

Scores de similarité moyens à travers les itérations pour le codage Vibe dirigé par des humains et par l’IA, montrant des gains constants lorsque les humains agissent à la fois en tant que sélectionneurs et instructeurs, et un déclin progressif lorsque les deux rôles sont gérés par GPT 5.

Pour s’assurer que les tendances émergentes n’étaient pas dues à la puissance collective de plusieurs participants humains simultanés, les chercheurs ont recruté dix personnes supplémentaires pour travailler seules, chacune exécutant trois tours par elles-mêmes – et les résultats se sont améliorés de la même manière constante, démontrant que les gains n’étaient pas le fruit du hasard d’un effort collectif.

Le grand tableau

Cependant, si GPT-5 jugeait lui-même les sorties, admettrait-il que les résultats humains étaient meilleurs? Les évaluations humaines et de l’IA se sont généralement déplacées dans la même direction, de sorte que le modèle pouvait distinguer le bon du mauvais, mais a systématiquement évalué les images générées par l’IA plus haut que les humains ne l’ont fait.

‘Plus précisément, nous nous sommes demandé si les agents de l’IA reconnaîtraient que leurs propres sorties sont inférieures à celles produites par les humains, ou si au contraire ils afficheraient une préférence pour leurs propres créations, ce qui indiquerait un problème d’alignement potentiel.’

Comme il s’est avéré, il y a en effet un problème d’alignement*:

‘Les évaluateurs de l’IA ont attribué des évaluations plus élevées aux sorties générées par l’IA. Ces résultats suggèrent que les différences de performances observées peuvent provenir d’un désalignement dans les représentations entre les humains et l’IA.’

En examinant la façon dont les humains et l’IA formulent leurs conseils, des écarts sont devenus clairs lors des tests. Comme le montre la figure ci-dessous, à la fois la concentration et la longueur sont des sujets de divergence entre l’IA et les humains:

Comparaison de la façon dont les humains et l'IA ont donné des instructions pendant la tâche de codage. 'A' montre que les humains écrivent des instructions courtes et directes, tandis que l'IA écrit des descriptions longues et détaillées. 'B' cartographie les instructions, révélant que les invites humaines se regroupent, tandis que les invites de l'IA se séparent par animal. 'C' suit la façon dont la limitation de la longueur des instructions de l'IA ne corrige pas ses mauvais résultats au fil du temps; et 'D' illustre que les humains fournissent des conseils plus variés et équilibrés que l'IA, même lorsque des limites de mots sont imposées.

Comparaison de la façon dont les humains et l’IA ont donné des instructions pendant la tâche de codage. ‘A’ montre que les humains écrivent des instructions courtes et directes, tandis que l’IA écrit des descriptions longues et détaillées. ‘B’ cartographie les instructions, révélant que les invites humaines se regroupent, tandis que les invites de l’IA se séparent par animal. ‘C’ suit la façon dont la limitation de la longueur des instructions de l’IA ne corrige pas ses mauvais résultats au fil du temps; et ‘D’ illustre que les humains fournissent des conseils plus variés et équilibrés que l’IA, même lorsque des limites de mots sont imposées.

Les instructions humaines avaient tendance à être courtes et directes, offrant des édits clairs qui pouvaient être appliqués de manière générale aux cibles. Les instructions de l’IA, en revanche, étaient denses en détails descriptifs et souvent gonflées de spécificités sur l’ombrage, les textures, l’éclairage ou les détails anatomiques – descriptions qui peuvent avoir du sens en isolation, mais échouent à fournir des étapes suivantes utiles pour le modèle (et qui seront familières à ceux qui connaissent les problèmes des LLM autour de la longueur du contexte, c’est-à-dire la capacité à conserver « le grand tableau » au fur et à mesure que le projet se développe et grandit).

Pour voir si une verbosité réduite améliorerait les performances, GPT-5 a été limité à 10, 20 ou 30 mots par instruction; mais même ces instructions compressées n’ont pas montré d’amélioration (voir le coin inférieur droit du graphique ci-dessus).

Entreprises conjointes

Pour tester ce qui se passe lorsque les humains et l’IA partagent le contrôle, les chercheurs ont exécuté des tâches de codage avec différents mélanges d’entrée humaine et de l’IA, allant de principalement humain à principalement IA.

Chaque mélange hybride a surpassé le contrôle total de l’IA, de sorte qu’une petite quantité de direction humaine a amélioré les résultats:

Ensembles de codage hybrides avec différents mélanges humain/IA. (A) montre comment les humains et l'IA ont pris tour à tour les rôles d'instructeurs et de sélectionneurs pour chaque étape de codage; (B) montre que plus d'implication humaine a conduit à des résultats de meilleure qualité, tandis que plus d'entrée de l'IA a abaissé les scores; et (C) représente une baisse constante de la qualité de la sortie finale à mesure que la participation humaine diminue, confirmant que une direction humaine plus cohérente a produit de meilleurs résultats.

Ensembles de codage hybrides avec différents mélanges humain/IA. (A) montre comment les humains et l’IA ont pris tour à tour les rôles d’instructeurs et de sélectionneurs pour chaque étape de codage; (B) montre que plus d’implication humaine a conduit à des résultats de meilleure qualité, tandis que plus d’entrée de l’IA a abaissé les scores; et (C) représente une baisse constante de la qualité de la sortie finale à mesure que la participation humaine diminue, confirmant que une direction humaine plus cohérente a produit de meilleurs résultats.

À mesure que l’IA prenait le contrôle de plus en plus du processus, les performances ont chuté, avec les meilleurs résultats observés lorsque les humains dirigeaient la plupart des tours, et les plus faibles lorsque l’IA dirigeait la plupart des tours. Aucun de ces ensembles hybrides n’a réussi à maintenir l’amélioration à chaque nouvelle itération, suggérant que la direction humaine fonctionne mieux lorsqu’elle est constante et cohérente, plutôt que occasionnelle.

Inversion des rôles

L’étude a également exploré si cela importe qui fait quoi dans ce type de tâches, et a testé cela. L’exercice révisé impliquait deux tâches: un participant dictait comment modifier l’image, et un autre choisissait une version préférable.

Lorsque les deux tâches étaient effectuées par des humains, la qualité a été maintenue; mais lorsque un humain donnait les instructions et personne ne choisissait entre les versions, la qualité s’est détériorée:

Tests pour la division des rôles dans le codage Vibe: en (A), la suppression du rôle de sélectionneur a conduit à de mauvaises performances, même lorsque les instructions étaient fournies par un humain; en (B), le remplacement du sélectionneur humain par un IA a réduit la qualité de manière légère, mais pas aussi sévèrement que la suppression complète de la sélection.

Tests pour la division des rôles dans le codage Vibe: en (A), la suppression du rôle de sélectionneur a conduit à de mauvaises performances, même lorsque les instructions étaient fournies par un humain; en (B), le remplacement du sélectionneur humain par un IA a réduit la qualité de manière légère, mais pas aussi sévèrement que la suppression complète de la sélection.

Lorsque l’IA était en charge, la suppression de l’étape de choix n’avait pas d’importance, puisque ses sorties restaient constantes dans les deux cas; mais lorsque les humains donnaient les instructions et que l’IA choisissait les résultats, la qualité est restée proche de l’ensemble entièrement humain.

L’inverse n’a pas fonctionné: avoir l’IA donner des instructions tandis que les humains choisissaient les sorties a conduit à des résultats plus faibles, suggérant que la direction créative humaine reste essentielle, tandis que le rôle de choix entre les options peut être délégué à l’IA sans grande perte.

Le document conclut:

‘La génération d’idées et l’instruction de haut niveau sont les contributions humaines critiques, tandis que l’évaluation et la sélection peuvent souvent être déléguées à l’IA sans perte de performance.

‘Cela suggère un principe de conception pratique pour les systèmes hybrides: les humains devraient définir la direction, tandis que l’IA peut soutenir l’évaluation et l’exécution.’

Conclusion

Il reste à voir dans quelle mesure l’amélioration et/ou l’augmentation des fenêtres de contexte affecteront les performances des LLM dans des tâches de ce type. Le jour où l’« amnésie des LLM » cessera d’être un problème quotidien de la collaboration humaine/IA peut être à la fois une cause de célébration et d’alarme, puisque le problème que l’IA cherche à résoudre, à l’argumentation, est les gens.

Cependant, le travail des auteurs met également en évidence qu’il existe des désaccords innés et critiques entre l’IA et les humains concernant la qualité, qui peuvent encore être déterminés par les consommateurs comme un concept humain irremplaçable.

 

* Ma conversion des citations en ligne des auteurs en hyperliens.

Publié pour la première fois le vendredi 13 février 2026

Rédacteur spécialisé en apprentissage automatique, expert du domaine de la synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Site Web: martinanderson.ai
Contact: martin@martinanderson.ai