Angle dâAnderson
Le codage Vibe souffre lorsque le rÃīle de l’IA s’ÃĐtend

Une nouvelle ÃĐtude constate que le codage Vibe sâamÃĐliore lorsque les humains donnent les instructions, mais dÃĐcline lorsque lâIA le fait, avec le meilleur ensemble hybride qui maintient les humains au premier plan, avec lâIA en tant quâarbitre ou juge.
Â
De nouvelles recherches menÃĐes aux Ãtats-Unis, examinant ce qui se passe lorsque les systÃĻmes dâIA sont autorisÃĐs à diriger le codage Vibe, plutÃīt que de simplement exÃĐcuter les instructions humaines, ont constatÃĐ que lorsque les modÃĻles de langage à grande ÃĐchelle (LLM) prennent un rÃīle directionnel plus important, les rÃĐsultats sont presque toujours pires.
Bien que les chercheurs aient utilisÃĐ GPT-5 dâOpenAI comme cadre pour leurs expÃĐriences de collaboration humaine/IA, ils ont confirmÃĐ par la suite que tanto Anthropicâs Claude Opus 4.5 que Google Gemini 3 Pro ÃĐtaient soumis à la mÊme courbe de dÃĐtÃĐrioration à mesure que les responsabilitÃĐs augmentaient, en dÃĐclarant que ÂŦ mÊme une implication humaine limitÃĐe amÃĐliore constamment les performances Âŧ:
â[Les humains] fournissent des conseils de haut niveau efficaces à travers les itÃĐrations, [alors que] les conseils de lâIA mÃĻnent souvent à un effondrement des performances. De plus, nous constatons quâune allocation de rÃīle soigneuse qui maintient les humains en charge de la direction tout en dÃĐchargeant lâÃĐvaluation à lâIA peut amÃĐliorer les performances hybrides.â
Afin de fournir un test cohÃĐrent qui puisse Être ÃĐvaluÃĐ de la mÊme maniÃĻre par les humains et par lâIA, un cadre expÃĐrimental contrÃīlÃĐ a ÃĐtÃĐ construit autour dâune tÃĒche de codage itÃĐrative dans laquelle une image de rÃĐfÃĐrence â prÃĐsentant une photo dâun chat, dâun chien, dâun tigre, dâun oiseau, dâun ÃĐlÃĐphant, dâun manchot, dâun requin, dâun zÃĻbre, dâune girafe ou dâun panda â devait Être recrÃĐÃĐe à lâaide de graphiques vectoriels escalables (SVG), et que cette recrÃĐation devait Être jugÃĐe par rapport à la photo source à partir de laquelle elle a ÃĐtÃĐ dÃĐrivÃĐe:

Les participants humains et lâIA ont ÃĐtÃĐ prÃĐsentÃĐs une image de rÃĐfÃĐrence photographique aux cÃītÃĐs dâune reconstruction SVG gÃĐnÃĐrÃĐe par lâIA, et ont ÃĐtÃĐ invitÃĐs à ÃĐvaluer à quel point les deux ÃĐtaient similaires sur une ÃĐchelle de sept points. Source
à chaque tour, un agent fournissait des instructions de haut niveau en langage naturel pour guider un gÃĐnÃĐrateur de code, et un autre dÃĐcidait de conserver la nouvelle version ou de revenir à la version prÃĐcÃĐdente â une boucle structurÃĐe qui reflÃĻte les flux de travail collaboratifs rÃĐels.
Au cours de 16 expÃĐriences impliquant 604 participants et des milliers dâappels dâAPI, des tours de test dirigÃĐs entiÃĻrement par des humains ont ÃĐtÃĐ comparÃĐs directement avec des tours dirigÃĐs entiÃĻrement par lâIA, dans des conditions identiques.

Certaines des solutions variÃĐes obtenues par diffÃĐrentes combinaisons de pourcentages et de types de collaboration humaine/IA (prises dâune illustration plus grande dans le document source, auquel nous renvoyons le lecteur).
Bien que les humains et lâIA aient performÃĐ Ã des niveaux similaires au dÃĐbut des tests, leurs trajectoires ont divergÃĐ au fil du temps: lorsque les humains fournissaient les instructions et prenaient les dÃĐcisions de sÃĐlection, les scores de similaritÃĐ augmentaient à travers les itÃĐrations, avec une amÃĐlioration cumulative constante; mais lorsque les systÃĻmes dâIA remplissaient les deux rÃīles, les performances ne montraient pas dâamÃĐlioration constante, et dÃĐclinaient frÃĐquemment au fil des tours â mÊme si le mÊme modÃĻle sous-jacent ÃĐtait utilisÃĐ pour la gÃĐnÃĐration de code, et que lâIA avait accÃĻs aux mÊmes informations que les participants humains.
Lâeffet de prolixitÃĐ
Les rÃĐsultats ont ÃĐgalement montrÃĐ que les instructions humaines ÃĐtaient gÃĐnÃĐralement courtes et axÃĐes sur lâaction, se concentrant sur ce quâil fallait changer dans lâimage actuelle; Ã lâinverse, les instructions de lâIA ÃĐtaient beaucoup plus longues et densÃĐment descriptives (un facteur qui a ÃĐtÃĐ paramÃĐtrÃĐ pour GPT-5), dÃĐtaillant les attributs visuels plutÃīt que de prioriser la correction incrÃĐmentale.
Mais, comme on le voit dans le graphique ci-dessous, imposer des limites de mots strictes aux instructions de lâIA nâa pas inversÃĐ le modÃĻle; mÊme lorsque limitÃĐes à 10, 20 ou 30 mots, les chaÃŪnes dirigÃĐes par lâIA nâont pas amÃĐliorÃĐ leurs performances au fil du temps:

Ãvaluations de similaritÃĐ Ã travers les itÃĐrations pour les tours dirigÃĐs par des humains par rapport aux tours entiÃĻrement dirigÃĐs par lâIA et aux tours dirigÃĐs par lâIA limitÃĐs à 10, 20 ou 30 mots dâinstruction. Evidemment, la rÃĐduction des invites de lâIA ne prÃĐvient pas la dÃĐgradation de la performance itÃĐrative observÃĐe lorsque lâIA dirige à la fois lâinstruction et la sÃĐlection.
Les expÃĐriences hybrides ont rendu le modÃĻle plus clair, montrant quâajouter mÊme un peu dâimplication humaine amÃĐliorait les rÃĐsultats, par rapport aux ensembles entiÃĻrement dirigÃĐs par lâIA; pourtant, les performances ont gÃĐnÃĐralement dÃĐclinÃĐ Ã mesure que la part de conseils de lâIA augmentait.
Lorsque les rÃīles ont ÃĐtÃĐ sÃĐparÃĐs, lâÃĐvaluation et la sÃĐlection pouvaient Être confiÃĐes à lâIA avec une perte de qualitÃĐ relativement faible; mais remplacer les instructions de haut niveau humaines par des conseils de lâIA a conduit à des baisses de performance notables, suggÃĐrant que ce qui importe le plus nâest pas qui gÃĐnÃĻre le code, mais qui fixe et maintient la direction à travers les itÃĐrations.
Les auteurs concluent:
âà travers plusieurs expÃĐriences, le codage dirigÃĐ par des humains sâest amÃĐliorÃĐ de maniÃĻre cohÃĐrente à travers les itÃĐrations, tandis que le codage dirigÃĐ par lâIA a souvent collapsÃĐ malgrÃĐ lâaccÃĻs aux mÊmes informations et aux mÊmes capacitÃĐs dâexÃĐcution.
âCela met en ÃĐvidence les luttes clÃĐs des systÃĻmes dâIA actuels pour maintenir une direction de haut niveau cohÃĐrente à travers des interactions rÃĐpÃĐtÃĐes, du type nÃĐcessaire pour un codage Vibe rÃĐussiâ
Le nouvel article est intitulÃĐ Why Human Guidance Matters in Collaborative Vibe Coding, et provient de sept chercheurs issus de lâUniversitÃĐ Cornell, de lâUniversitÃĐ de Princeton, du Massachusetts Institute of Technology et de lâUniversitÃĐ de New York.
MÃĐthode
Pour les expÃĐriences, un instructeur humain a regardÃĐ une photo de rÃĐfÃĐrence gÃĐnÃĐrÃĐe par GPT-5, ainsi que la derniÃĻre tentative dâimitation SVG associÃĐe. Il a ensuite ÃĐcrit des instructions en langage naturel pour guider le gÃĐnÃĐrateur de code vers une correspondance plus ÃĐtroite.
Ainsi, le gÃĐnÃĐrateur produisait un nouveau SVG à chaque tour, fournissant une boucle itÃĐrative pour tester comment lâeffet de la direction sâaccumule au fil du temps. Les cibles ÃĐtaient dix images dâanimaux gÃĐnÃĐrÃĐes par GPT-5, couvrant une gamme de formes et de textures afin que les amÃĐliorations ou les erreurs soient faciles à dÃĐtecter:

SchÃĐma du flux de travail de codage Vibe utilisÃĐ dans lâÃĐtude. En A), un instructeur humain regarde une image de rÃĐfÃĐrence photographique avec le meilleur SVG produit jusquâà prÃĐsent et ÃĐcrit des instructions en langage naturel pour le gÃĐnÃĐrateur de code à suivre lors de la production du prochain SVG; en B), un sÃĐlectionneur humain compare le nouveau SVG avec le prÃĐcÃĐdent et choisit la version qui correspond le mieux à lâimage de rÃĐfÃĐrence, avant de passer le SVG sÃĐlectionnÃĐ Ã lâÃĐtape suivante; et en C), des ÃĐvaluateurs humains indÃĐpendants ÃĐvaluent à quel point chaque SVG gÃĐnÃĐrÃĐ est similaire à son image de rÃĐfÃĐrence, fournissant les scores utilisÃĐs pour ÃĐvaluer les performances globales.
Un sÃĐlectionneur humain a comparÃĐ chaque nouveau SVG gÃĐnÃĐrÃĐ avec le prÃĐcÃĐdent et a acceptÃĐ ou rejetÃĐ, ce qui a maintenu le processus alignÃĐ avec lâimage de rÃĐfÃĐrence à travers les tours. Dans ce dispositif de base, la mÊme personne a rempli les deux rÃīles.
Pour mesurer la qualitÃĐ, des ÃĐvaluateurs humains indÃĐpendants ont ÃĐvaluÃĐ Ã quel point chaque SVG gÃĐnÃĐrÃĐ ÃĐtait similaire à son image de rÃĐfÃĐrence. Au cours de seize expÃĐriences, 120 personnes ont produit 4 800 ÃĐvaluations. Toutes les expÃĐriences ont ÃĐtÃĐ exÃĐcutÃĐes sur le cadre PsyNet, un portail conçu pour accueillir des interactions structurÃĐes entre les humains et les systÃĻmes dâIA.
LâÃĐtude a recrutÃĐ 604 locuteurs natifs anglais, dans des tests qui ont consommÃĐ 4 800 appels dâAPI pour la gÃĐnÃĐration de code et 5 327 appels dâAPI pour les instructions. Bien que GPT-5 ait ÃĐtÃĐ le modÃĻle principal utilisÃĐ, de petites lots de comparaison ont ÃĐtÃĐ effectuÃĐs avec Claude Opus 4.5 et Gemini 3 Pro, qui ont chacun gÃĐrÃĐ 280 requÊtes.
RÃĐsultats
Trente tours de codage Vibe ont ÃĐtÃĐ exÃĐcutÃĐs, chacun comprenant quinze ÃĐditions des dix images de rÃĐfÃĐrence de base. Pour ceux-ci, 45 participants humains ont ÃĐtÃĐ choisis, chacun servant à la fois de sÃĐlectionneur et dâinstructeur au cours de dix itÃĐrations, dans les tours ÂŦ dirigÃĐs par des humains Âŧ.
Au sein de chaque tour, le mÊme participant a dâabord choisi entre le SVG actuel et le prÃĐcÃĐdent, puis a ÃĐcrit les instructions pour le prochain tour. Une deuxiÃĻme version du test a remplacÃĐ les dÃĐcisions humaines par des appels dâAPI à GPT 5, tout en maintenant le reste du dispositif inchangÃĐ. Dans tous les cas, lâinstructeur et le sÃĐlectionneur ont fourni des instructions en langage naturel au gÃĐnÃĐrateur de code.
Un exemple reprÃĐsentatif de codage Vibe à plusieurs tours montre comment le processus diverge au fil du temps; lorsque les humains agissent à la fois en tant que sÃĐlectionneurs et instructeurs, la sortie SVG sâamÃĐliore de maniÃĻre constante à travers les itÃĐrations, se rapprochant de lâimage de rÃĐfÃĐrence à chaque tour:

Exemples de progrÃĻs pour une image de rÃĐfÃĐrence sous codage Vibe dirigÃĐ par des humains (en haut) et par lâIA (en bas), montrant une amÃĐlioration constante à travers les itÃĐrations avec des humains dans les deux rÃīles, et une stagnation ou une dÃĐrive lorsque les deux rÃīles sont gÃĐrÃĐs par lâIA.
Inversement, dans la version dirigÃĐe par lâIA, les premiers tours ont parfois capturÃĐ des fonctionnalitÃĐs visuelles clÃĐs, mais les tentatives ultÃĐrieures nâont pas rÃĐussi à construire sur ces gains, et dans certains cas se sont ÃĐloignÃĐes de la cible:

Sorties finales de lâitÃĐration finale, comparant les tours dirigÃĐs par des humains (rangÃĐe du haut) avec les chaÃŪnes dirigÃĐes par lâIA (rangÃĐe du bas), sur le mÊme ensemble dâimages de rÃĐfÃĐrence. Les rÃĐsultats dirigÃĐs par des humains correspondent plus ÃĐtroitement aux animaux dâorigine, tandis que les rÃĐsultats dirigÃĐs par lâIA montrent des distorsions visibles ou une perte de fonctionnalitÃĐs clÃĐs.
Pour mesurer les tendances ÃĐmergentes de maniÃĻre quantitative, les images finales ont ÃĐtÃĐ prÃĐsentÃĐes à des ÃĐvaluateurs humains indÃĐpendants et ÃĐvaluÃĐes pour leur similaritÃĐ avec les images de rÃĐfÃĐrence. Dans les premiers tours, les scores des versions dirigÃĐes par des humains et par lâIA ÃĐtaient à peu prÃĻs les mÊmes; mais à la quinziÃĻme itÃĐration, la diffÃĐrence ÃĐtait claire, avec les images choisies par les humains ÃĐvaluÃĐes comme beaucoup plus proches des cibles. Au fil du temps, les scores humains ont augmentÃĐ de maniÃĻre constante, avec le plus grand gain relatif par rapport à lâIA atteignant 27,1 %.

Scores de similaritÃĐ moyens à travers les itÃĐrations pour le codage Vibe dirigÃĐ par des humains et par lâIA, montrant des gains constants lorsque les humains agissent à la fois en tant que sÃĐlectionneurs et instructeurs, et un dÃĐclin progressif lorsque les deux rÃīles sont gÃĐrÃĐs par GPT 5.
Pour sâassurer que les tendances ÃĐmergentes nâÃĐtaient pas dues à la puissance collective de plusieurs participants humains simultanÃĐs, les chercheurs ont recrutÃĐ dix personnes supplÃĐmentaires pour travailler seules, chacune exÃĐcutant trois tours par elles-mÊmes â et les rÃĐsultats se sont amÃĐliorÃĐs de la mÊme maniÃĻre constante, dÃĐmontrant que les gains nâÃĐtaient pas le fruit du hasard dâun effort collectif.
Le grand tableau
Cependant, si GPT-5 jugeait lui-mÊme les sorties, admettrait-il que les rÃĐsultats humains ÃĐtaient meilleurs? Les ÃĐvaluations humaines et de lâIA se sont gÃĐnÃĐralement dÃĐplacÃĐes dans la mÊme direction, de sorte que le modÃĻle pouvait distinguer le bon du mauvais, mais a systÃĐmatiquement ÃĐvaluÃĐ les images gÃĐnÃĐrÃĐes par lâIA plus haut que les humains ne lâont fait.
âPlus prÃĐcisÃĐment, nous nous sommes demandÃĐ si les agents de lâIA reconnaÃŪtraient que leurs propres sorties sont infÃĐrieures à celles produites par les humains, ou si au contraire ils afficheraient une prÃĐfÃĐrence pour leurs propres crÃĐations, ce qui indiquerait un problÃĻme dâalignement potentiel.â
Comme il sâest avÃĐrÃĐ, il y a en effet un problÃĻme dâalignement*:
âLes ÃĐvaluateurs de lâIA ont attribuÃĐ des ÃĐvaluations plus ÃĐlevÃĐes aux sorties gÃĐnÃĐrÃĐes par lâIA. Ces rÃĐsultats suggÃĻrent que les diffÃĐrences de performances observÃĐes peuvent provenir dâun dÃĐsalignement dans les reprÃĐsentations entre les humains et lâIA.â
En examinant la façon dont les humains et lâIA formulent leurs conseils, des ÃĐcarts sont devenus clairs lors des tests. Comme le montre la figure ci-dessous, à la fois la concentration et la longueur sont des sujets de divergence entre lâIA et les humains:

Comparaison de la façon dont les humains et lâIA ont donnÃĐ des instructions pendant la tÃĒche de codage. âAâ montre que les humains ÃĐcrivent des instructions courtes et directes, tandis que lâIA ÃĐcrit des descriptions longues et dÃĐtaillÃĐes. âBâ cartographie les instructions, rÃĐvÃĐlant que les invites humaines se regroupent, tandis que les invites de lâIA se sÃĐparent par animal. âCâ suit la façon dont la limitation de la longueur des instructions de lâIA ne corrige pas ses mauvais rÃĐsultats au fil du temps; et âDâ illustre que les humains fournissent des conseils plus variÃĐs et ÃĐquilibrÃĐs que lâIA, mÊme lorsque des limites de mots sont imposÃĐes.
Les instructions humaines avaient tendance à Être courtes et directes, offrant des ÃĐdits clairs qui pouvaient Être appliquÃĐs de maniÃĻre gÃĐnÃĐrale aux cibles. Les instructions de lâIA, en revanche, ÃĐtaient denses en dÃĐtails descriptifs et souvent gonflÃĐes de spÃĐcificitÃĐs sur lâombrage, les textures, lâÃĐclairage ou les dÃĐtails anatomiques â descriptions qui peuvent avoir du sens en isolation, mais ÃĐchouent à fournir des ÃĐtapes suivantes utiles pour le modÃĻle (et qui seront familiÃĻres à ceux qui connaissent les problÃĻmes des LLM autour de la longueur du contexte, câest-à -dire la capacitÃĐ Ã conserver ÂŦ le grand tableau Âŧ au fur et à mesure que le projet se dÃĐveloppe et grandit).
Pour voir si une verbositÃĐ rÃĐduite amÃĐliorerait les performances, GPT-5 a ÃĐtÃĐ limitÃĐ Ã 10, 20 ou 30 mots par instruction; mais mÊme ces instructions compressÃĐes nâont pas montrÃĐ dâamÃĐlioration (voir le coin infÃĐrieur droit du graphique ci-dessus).
Entreprises conjointes
Pour tester ce qui se passe lorsque les humains et lâIA partagent le contrÃīle, les chercheurs ont exÃĐcutÃĐ des tÃĒches de codage avec diffÃĐrents mÃĐlanges dâentrÃĐe humaine et de lâIA, allant de principalement humain à principalement IA.
Chaque mÃĐlange hybride a surpassÃĐ le contrÃīle total de lâIA, de sorte quâune petite quantitÃĐ de direction humaine a amÃĐliorÃĐ les rÃĐsultats:

Ensembles de codage hybrides avec diffÃĐrents mÃĐlanges humain/IA. (A) montre comment les humains et lâIA ont pris tour à tour les rÃīles dâinstructeurs et de sÃĐlectionneurs pour chaque ÃĐtape de codage; (B) montre que plus dâimplication humaine a conduit à des rÃĐsultats de meilleure qualitÃĐ, tandis que plus dâentrÃĐe de lâIA a abaissÃĐ les scores; et (C) reprÃĐsente une baisse constante de la qualitÃĐ de la sortie finale à mesure que la participation humaine diminue, confirmant que une direction humaine plus cohÃĐrente a produit de meilleurs rÃĐsultats.
à mesure que lâIA prenait le contrÃīle de plus en plus du processus, les performances ont chutÃĐ, avec les meilleurs rÃĐsultats observÃĐs lorsque les humains dirigeaient la plupart des tours, et les plus faibles lorsque lâIA dirigeait la plupart des tours. Aucun de ces ensembles hybrides nâa rÃĐussi à maintenir lâamÃĐlioration à chaque nouvelle itÃĐration, suggÃĐrant que la direction humaine fonctionne mieux lorsquâelle est constante et cohÃĐrente, plutÃīt que occasionnelle.
Inversion des rÃīles
LâÃĐtude a ÃĐgalement explorÃĐ si cela importe qui fait quoi dans ce type de tÃĒches, et a testÃĐ cela. Lâexercice rÃĐvisÃĐ impliquait deux tÃĒches: un participant dictait comment modifier lâimage, et un autre choisissait une version prÃĐfÃĐrable.
Lorsque les deux tÃĒches ÃĐtaient effectuÃĐes par des humains, la qualitÃĐ a ÃĐtÃĐ maintenue; mais lorsque un humain donnait les instructions et personne ne choisissait entre les versions, la qualitÃĐ sâest dÃĐtÃĐriorÃĐe:

Tests pour la division des rÃīles dans le codage Vibe: en (A), la suppression du rÃīle de sÃĐlectionneur a conduit à de mauvaises performances, mÊme lorsque les instructions ÃĐtaient fournies par un humain; en (B), le remplacement du sÃĐlectionneur humain par un IA a rÃĐduit la qualitÃĐ de maniÃĻre lÃĐgÃĻre, mais pas aussi sÃĐvÃĻrement que la suppression complÃĻte de la sÃĐlection.
Lorsque lâIA ÃĐtait en charge, la suppression de lâÃĐtape de choix nâavait pas dâimportance, puisque ses sorties restaient constantes dans les deux cas; mais lorsque les humains donnaient les instructions et que lâIA choisissait les rÃĐsultats, la qualitÃĐ est restÃĐe proche de lâensemble entiÃĻrement humain.
Lâinverse nâa pas fonctionnÃĐ: avoir lâIA donner des instructions tandis que les humains choisissaient les sorties a conduit à des rÃĐsultats plus faibles, suggÃĐrant que la direction crÃĐative humaine reste essentielle, tandis que le rÃīle de choix entre les options peut Être dÃĐlÃĐguÃĐ Ã lâIA sans grande perte.
Le document conclut:
âLa gÃĐnÃĐration dâidÃĐes et lâinstruction de haut niveau sont les contributions humaines critiques, tandis que lâÃĐvaluation et la sÃĐlection peuvent souvent Être dÃĐlÃĐguÃĐes à lâIA sans perte de performance.
âCela suggÃĻre un principe de conception pratique pour les systÃĻmes hybrides: les humains devraient dÃĐfinir la direction, tandis que lâIA peut soutenir lâÃĐvaluation et lâexÃĐcution.â
Conclusion
Il reste à voir dans quelle mesure lâamÃĐlioration et/ou lâaugmentation des fenÊtres de contexte affecteront les performances des LLM dans des tÃĒches de ce type. Le jour oÃđ lâÂŦ amnÃĐsie des LLM Âŧ cessera dâÊtre un problÃĻme quotidien de la collaboration humaine/IA peut Être à la fois une cause de cÃĐlÃĐbration et dâalarme, puisque le problÃĻme que lâIA cherche à rÃĐsoudre, à lâargumentation, est les gens.
Cependant, le travail des auteurs met ÃĐgalement en ÃĐvidence quâil existe des dÃĐsaccords innÃĐs et critiques entre lâIA et les humains concernant la qualitÃĐ, qui peuvent encore Être dÃĐterminÃĐs par les consommateurs comme un concept humain irremplaçable.
Â
* Ma conversion des citations en ligne des auteurs en hyperliens.
PubliÃĐ pour la premiÃĻre fois le vendredi 13 fÃĐvrier 2026












