Angle d’Anderson

Le codage Vibe souffre lorsque le rÃīle de l’IA s’ÃĐtend

mm
Ajouter Unite.AI à vos sources prÃĐfÃĐrÃĐes sur Google
An AI-generated stock-style image depicting a human Caucasian male and a larger glossy humanoid robot attempting to collaborate on a document; but the aggressive robot is causing the annoyed man to be sidelined. GPT-5 Image + Photoshop enhancement.

Une nouvelle ÃĐtude constate que le codage Vibe s’amÃĐliore lorsque les humains donnent les instructions, mais dÃĐcline lorsque l’IA le fait, avec le meilleur ensemble hybride qui maintient les humains au premier plan, avec l’IA en tant qu’arbitre ou juge.

 

De nouvelles recherches menÃĐes aux États-Unis, examinant ce qui se passe lorsque les systÃĻmes d’IA sont autorisÃĐs à diriger le codage Vibe, plutÃīt que de simplement exÃĐcuter les instructions humaines, ont constatÃĐ que lorsque les modÃĻles de langage à grande ÃĐchelle (LLM) prennent un rÃīle directionnel plus important, les rÃĐsultats sont presque toujours pires.

Bien que les chercheurs aient utilisÃĐ GPT-5 d’OpenAI comme cadre pour leurs expÃĐriences de collaboration humaine/IA, ils ont confirmÃĐ par la suite que tanto Anthropic’s Claude Opus 4.5 que Google Gemini 3 Pro ÃĐtaient soumis à la mÊme courbe de dÃĐtÃĐrioration à mesure que les responsabilitÃĐs augmentaient, en dÃĐclarant que ÂŦ mÊme une implication humaine limitÃĐe amÃĐliore constamment les performances Âŧ:

‘[Les humains] fournissent des conseils de haut niveau efficaces à travers les itÃĐrations, [alors que] les conseils de l’IA mÃĻnent souvent à un effondrement des performances. De plus, nous constatons qu’une allocation de rÃīle soigneuse qui maintient les humains en charge de la direction tout en dÃĐchargeant l’ÃĐvaluation à l’IA peut amÃĐliorer les performances hybrides.’

Afin de fournir un test cohÃĐrent qui puisse Être ÃĐvaluÃĐ de la mÊme maniÃĻre par les humains et par l’IA, un cadre expÃĐrimental contrÃīlÃĐ a ÃĐtÃĐ construit autour d’une tÃĒche de codage itÃĐrative dans laquelle une image de rÃĐfÃĐrence – prÃĐsentant une photo d’un chat, d’un chien, d’un tigre, d’un oiseau, d’un ÃĐlÃĐphant, d’un manchot, d’un requin, d’un zÃĻbre, d’une girafe ou d’un panda – devait Être recrÃĐÃĐe à l’aide de graphiques vectoriels escalables (SVG), et que cette recrÃĐation devait Être jugÃĐe par rapport à la photo source à partir de laquelle elle a ÃĐtÃĐ dÃĐrivÃĐe:

Les participants humains et l'IA ont ÃĐtÃĐ prÃĐsentÃĐs une image de rÃĐfÃĐrence photographique aux cÃītÃĐs d'une reconstruction SVG gÃĐnÃĐrÃĐe par l'IA, et ont ÃĐtÃĐ invitÃĐs à ÃĐvaluer à quel point les deux ÃĐtaient similaires sur une ÃĐchelle de sept points. Source - https://arxiv.org/pdf/2602.10473

Les participants humains et l’IA ont ÃĐtÃĐ prÃĐsentÃĐs une image de rÃĐfÃĐrence photographique aux cÃītÃĐs d’une reconstruction SVG gÃĐnÃĐrÃĐe par l’IA, et ont ÃĐtÃĐ invitÃĐs à ÃĐvaluer à quel point les deux ÃĐtaient similaires sur une ÃĐchelle de sept points. Source

À chaque tour, un agent fournissait des instructions de haut niveau en langage naturel pour guider un gÃĐnÃĐrateur de code, et un autre dÃĐcidait de conserver la nouvelle version ou de revenir à la version prÃĐcÃĐdente – une boucle structurÃĐe qui reflÃĻte les flux de travail collaboratifs rÃĐels.

Au cours de 16 expÃĐriences impliquant 604 participants et des milliers d’appels d’API, des tours de test dirigÃĐs entiÃĻrement par des humains ont ÃĐtÃĐ comparÃĐs directement avec des tours dirigÃĐs entiÃĻrement par l’IA, dans des conditions identiques.

Certaines des solutions variÃĐes obtenues par diffÃĐrentes combinaisons de pourcentages et de types de collaboration humaine/IA (prises d'une illustration plus grande dans le document source, auquel nous renvoyons le lecteur).

Certaines des solutions variÃĐes obtenues par diffÃĐrentes combinaisons de pourcentages et de types de collaboration humaine/IA (prises d’une illustration plus grande dans le document source, auquel nous renvoyons le lecteur).

Bien que les humains et l’IA aient performÃĐ Ã  des niveaux similaires au dÃĐbut des tests, leurs trajectoires ont divergÃĐ au fil du temps: lorsque les humains fournissaient les instructions et prenaient les dÃĐcisions de sÃĐlection, les scores de similaritÃĐ augmentaient à travers les itÃĐrations, avec une amÃĐlioration cumulative constante; mais lorsque les systÃĻmes d’IA remplissaient les deux rÃīles, les performances ne montraient pas d’amÃĐlioration constante, et dÃĐclinaient frÃĐquemment au fil des tours – mÊme si le mÊme modÃĻle sous-jacent ÃĐtait utilisÃĐ pour la gÃĐnÃĐration de code, et que l’IA avait accÃĻs aux mÊmes informations que les participants humains.

L’effet de prolixitÃĐ

Les rÃĐsultats ont ÃĐgalement montrÃĐ que les instructions humaines ÃĐtaient gÃĐnÃĐralement courtes et axÃĐes sur l’action, se concentrant sur ce qu’il fallait changer dans l’image actuelle; à l’inverse, les instructions de l’IA ÃĐtaient beaucoup plus longues et densÃĐment descriptives (un facteur qui a ÃĐtÃĐ paramÃĐtrÃĐ pour GPT-5), dÃĐtaillant les attributs visuels plutÃīt que de prioriser la correction incrÃĐmentale.

Mais, comme on le voit dans le graphique ci-dessous, imposer des limites de mots strictes aux instructions de l’IA n’a pas inversÃĐ le modÃĻle; mÊme lorsque limitÃĐes à 10, 20 ou 30 mots, les chaÃŪnes dirigÃĐes par l’IA n’ont pas amÃĐliorÃĐ leurs performances au fil du temps:

Évaluations de similaritÃĐ Ã  travers les itÃĐrations pour les chaÃŪnes dirigÃĐes par des humains par rapport aux chaÃŪnes entiÃĻrement dirigÃĐes par l'IA et aux chaÃŪnes dirigÃĐes par l'IA limitÃĐes à 10, 20 ou 30 mots d'instruction, montrant que la rÃĐduction des invites de l'IA ne prÃĐvient pas la dÃĐgradation de la performance itÃĐrative observÃĐe lorsque l'IA dirige à la fois l'instruction et la sÃĐlection.

Évaluations de similaritÃĐ Ã  travers les itÃĐrations pour les tours dirigÃĐs par des humains par rapport aux tours entiÃĻrement dirigÃĐs par l’IA et aux tours dirigÃĐs par l’IA limitÃĐs à 10, 20 ou 30 mots d’instruction. Evidemment, la rÃĐduction des invites de l’IA ne prÃĐvient pas la dÃĐgradation de la performance itÃĐrative observÃĐe lorsque l’IA dirige à la fois l’instruction et la sÃĐlection.

Les expÃĐriences hybrides ont rendu le modÃĻle plus clair, montrant qu’ajouter mÊme un peu d’implication humaine amÃĐliorait les rÃĐsultats, par rapport aux ensembles entiÃĻrement dirigÃĐs par l’IA; pourtant, les performances ont gÃĐnÃĐralement dÃĐclinÃĐ Ã  mesure que la part de conseils de l’IA augmentait.

Lorsque les rÃīles ont ÃĐtÃĐ sÃĐparÃĐs, l’ÃĐvaluation et la sÃĐlection pouvaient Être confiÃĐes à l’IA avec une perte de qualitÃĐ relativement faible; mais remplacer les instructions de haut niveau humaines par des conseils de l’IA a conduit à des baisses de performance notables, suggÃĐrant que ce qui importe le plus n’est pas qui gÃĐnÃĻre le code, mais qui fixe et maintient la direction à travers les itÃĐrations.

Les auteurs concluent:

‘À travers plusieurs expÃĐriences, le codage dirigÃĐ par des humains s’est amÃĐliorÃĐ de maniÃĻre cohÃĐrente à travers les itÃĐrations, tandis que le codage dirigÃĐ par l’IA a souvent collapsÃĐ malgrÃĐ l’accÃĻs aux mÊmes informations et aux mÊmes capacitÃĐs d’exÃĐcution.

‘Cela met en ÃĐvidence les luttes clÃĐs des systÃĻmes d’IA actuels pour maintenir une direction de haut niveau cohÃĐrente à travers des interactions rÃĐpÃĐtÃĐes, du type nÃĐcessaire pour un codage Vibe rÃĐussi’

Le nouvel article est intitulÃĐ Why Human Guidance Matters in Collaborative Vibe Coding, et provient de sept chercheurs issus de l’UniversitÃĐ Cornell, de l’UniversitÃĐ de Princeton, du Massachusetts Institute of Technology et de l’UniversitÃĐ de New York.

MÃĐthode

Pour les expÃĐriences, un instructeur humain a regardÃĐ une photo de rÃĐfÃĐrence gÃĐnÃĐrÃĐe par GPT-5, ainsi que la derniÃĻre tentative d’imitation SVG associÃĐe. Il a ensuite ÃĐcrit des instructions en langage naturel pour guider le gÃĐnÃĐrateur de code vers une correspondance plus ÃĐtroite.

Ainsi, le gÃĐnÃĐrateur produisait un nouveau SVG à chaque tour, fournissant une boucle itÃĐrative pour tester comment l’effet de la direction s’accumule au fil du temps. Les cibles ÃĐtaient dix images d’animaux gÃĐnÃĐrÃĐes par GPT-5, couvrant une gamme de formes et de textures afin que les amÃĐliorations ou les erreurs soient faciles à dÃĐtecter:

SchÃĐma du flux de travail de codage Vibe utilisÃĐ dans l'ÃĐtude. En A), un instructeur humain regarde une image de rÃĐfÃĐrence photographique avec le meilleur SVG produit jusqu'à prÃĐsent et ÃĐcrit des instructions en langage naturel pour le gÃĐnÃĐrateur de code à suivre lors de la production du prochain SVG; en B), un sÃĐlectionneur humain compare le nouveau SVG avec le prÃĐcÃĐdent et choisit la version qui correspond le mieux à l'image de rÃĐfÃĐrence, avant de passer le SVG sÃĐlectionnÃĐ Ã  l'ÃĐtape suivante; et en C), des ÃĐvaluateurs humains indÃĐpendants ÃĐvaluent à quel point chaque SVG gÃĐnÃĐrÃĐ est similaire à son image de rÃĐfÃĐrence, fournissant les scores utilisÃĐs pour ÃĐvaluer les performances globales.

SchÃĐma du flux de travail de codage Vibe utilisÃĐ dans l’ÃĐtude. En A), un instructeur humain regarde une image de rÃĐfÃĐrence photographique avec le meilleur SVG produit jusqu’à prÃĐsent et ÃĐcrit des instructions en langage naturel pour le gÃĐnÃĐrateur de code à suivre lors de la production du prochain SVG; en B), un sÃĐlectionneur humain compare le nouveau SVG avec le prÃĐcÃĐdent et choisit la version qui correspond le mieux à l’image de rÃĐfÃĐrence, avant de passer le SVG sÃĐlectionnÃĐ Ã  l’ÃĐtape suivante; et en C), des ÃĐvaluateurs humains indÃĐpendants ÃĐvaluent à quel point chaque SVG gÃĐnÃĐrÃĐ est similaire à son image de rÃĐfÃĐrence, fournissant les scores utilisÃĐs pour ÃĐvaluer les performances globales.

Un sÃĐlectionneur humain a comparÃĐ chaque nouveau SVG gÃĐnÃĐrÃĐ avec le prÃĐcÃĐdent et a acceptÃĐ ou rejetÃĐ, ce qui a maintenu le processus alignÃĐ avec l’image de rÃĐfÃĐrence à travers les tours. Dans ce dispositif de base, la mÊme personne a rempli les deux rÃīles.

Pour mesurer la qualitÃĐ, des ÃĐvaluateurs humains indÃĐpendants ont ÃĐvaluÃĐ Ã  quel point chaque SVG gÃĐnÃĐrÃĐ ÃĐtait similaire à son image de rÃĐfÃĐrence. Au cours de seize expÃĐriences, 120 personnes ont produit 4 800 ÃĐvaluations. Toutes les expÃĐriences ont ÃĐtÃĐ exÃĐcutÃĐes sur le cadre PsyNet, un portail conçu pour accueillir des interactions structurÃĐes entre les humains et les systÃĻmes d’IA.

L’ÃĐtude a recrutÃĐ 604 locuteurs natifs anglais, dans des tests qui ont consommÃĐ 4 800 appels d’API pour la gÃĐnÃĐration de code et 5 327 appels d’API pour les instructions. Bien que GPT-5 ait ÃĐtÃĐ le modÃĻle principal utilisÃĐ, de petites lots de comparaison ont ÃĐtÃĐ effectuÃĐs avec Claude Opus 4.5 et Gemini 3 Pro, qui ont chacun gÃĐrÃĐ 280 requÊtes.

RÃĐsultats

Trente tours de codage Vibe ont ÃĐtÃĐ exÃĐcutÃĐs, chacun comprenant quinze ÃĐditions des dix images de rÃĐfÃĐrence de base. Pour ceux-ci, 45 participants humains ont ÃĐtÃĐ choisis, chacun servant à la fois de sÃĐlectionneur et d’instructeur au cours de dix itÃĐrations, dans les tours ÂŦ dirigÃĐs par des humains Âŧ.

Au sein de chaque tour, le mÊme participant a d’abord choisi entre le SVG actuel et le prÃĐcÃĐdent, puis a ÃĐcrit les instructions pour le prochain tour. Une deuxiÃĻme version du test a remplacÃĐ les dÃĐcisions humaines par des appels d’API à GPT 5, tout en maintenant le reste du dispositif inchangÃĐ. Dans tous les cas, l’instructeur et le sÃĐlectionneur ont fourni des instructions en langage naturel au gÃĐnÃĐrateur de code.

Un exemple reprÃĐsentatif de codage Vibe à plusieurs tours montre comment le processus diverge au fil du temps; lorsque les humains agissent à la fois en tant que sÃĐlectionneurs et instructeurs, la sortie SVG s’amÃĐliore de maniÃĻre constante à travers les itÃĐrations, se rapprochant de l’image de rÃĐfÃĐrence à chaque tour:

Exemples de progrÃĻs pour une image de rÃĐfÃĐrence sous codage Vibe dirigÃĐ par des humains (en haut) et par l'IA (en bas), montrant une amÃĐlioration constante à travers les itÃĐrations avec des humains dans les deux rÃīles, et une stagnation ou une dÃĐrive lorsque les deux rÃīles sont gÃĐrÃĐs par l'IA.

Exemples de progrÃĻs pour une image de rÃĐfÃĐrence sous codage Vibe dirigÃĐ par des humains (en haut) et par l’IA (en bas), montrant une amÃĐlioration constante à travers les itÃĐrations avec des humains dans les deux rÃīles, et une stagnation ou une dÃĐrive lorsque les deux rÃīles sont gÃĐrÃĐs par l’IA.

Inversement, dans la version dirigÃĐe par l’IA, les premiers tours ont parfois capturÃĐ des fonctionnalitÃĐs visuelles clÃĐs, mais les tentatives ultÃĐrieures n’ont pas rÃĐussi à construire sur ces gains, et dans certains cas se sont ÃĐloignÃĐes de la cible:

Sorties finales de l'itÃĐration finale, comparant les tours dirigÃĐs par des humains (rangÃĐe du haut) avec les chaÃŪnes dirigÃĐes par l'IA (rangÃĐe du bas), sur le mÊme ensemble d'images de rÃĐfÃĐrence. Les rÃĐsultats dirigÃĐs par des humains correspondent plus ÃĐtroitement aux animaux d'origine, et les rÃĐsultats dirigÃĐs par l'IA montrent des distorsions visibles ou une perte de fonctionnalitÃĐs clÃĐs.

Sorties finales de l’itÃĐration finale, comparant les tours dirigÃĐs par des humains (rangÃĐe du haut) avec les chaÃŪnes dirigÃĐes par l’IA (rangÃĐe du bas), sur le mÊme ensemble d’images de rÃĐfÃĐrence. Les rÃĐsultats dirigÃĐs par des humains correspondent plus ÃĐtroitement aux animaux d’origine, tandis que les rÃĐsultats dirigÃĐs par l’IA montrent des distorsions visibles ou une perte de fonctionnalitÃĐs clÃĐs.

Pour mesurer les tendances ÃĐmergentes de maniÃĻre quantitative, les images finales ont ÃĐtÃĐ prÃĐsentÃĐes à des ÃĐvaluateurs humains indÃĐpendants et ÃĐvaluÃĐes pour leur similaritÃĐ avec les images de rÃĐfÃĐrence. Dans les premiers tours, les scores des versions dirigÃĐes par des humains et par l’IA ÃĐtaient à peu prÃĻs les mÊmes; mais à la quinziÃĻme itÃĐration, la diffÃĐrence ÃĐtait claire, avec les images choisies par les humains ÃĐvaluÃĐes comme beaucoup plus proches des cibles. Au fil du temps, les scores humains ont augmentÃĐ de maniÃĻre constante, avec le plus grand gain relatif par rapport à l’IA atteignant 27,1 %.

Scores de similaritÃĐ moyens à travers les itÃĐrations pour le codage Vibe dirigÃĐ par des humains et par l'IA, montrant des gains constants lorsque les humains agissent à la fois en tant que sÃĐlectionneurs et instructeurs, et un dÃĐclin progressif lorsque les deux rÃīles sont gÃĐrÃĐs par GPT 5.

Scores de similaritÃĐ moyens à travers les itÃĐrations pour le codage Vibe dirigÃĐ par des humains et par l’IA, montrant des gains constants lorsque les humains agissent à la fois en tant que sÃĐlectionneurs et instructeurs, et un dÃĐclin progressif lorsque les deux rÃīles sont gÃĐrÃĐs par GPT 5.

Pour s’assurer que les tendances ÃĐmergentes n’ÃĐtaient pas dues à la puissance collective de plusieurs participants humains simultanÃĐs, les chercheurs ont recrutÃĐ dix personnes supplÃĐmentaires pour travailler seules, chacune exÃĐcutant trois tours par elles-mÊmes – et les rÃĐsultats se sont amÃĐliorÃĐs de la mÊme maniÃĻre constante, dÃĐmontrant que les gains n’ÃĐtaient pas le fruit du hasard d’un effort collectif.

Le grand tableau

Cependant, si GPT-5 jugeait lui-mÊme les sorties, admettrait-il que les rÃĐsultats humains ÃĐtaient meilleurs? Les ÃĐvaluations humaines et de l’IA se sont gÃĐnÃĐralement dÃĐplacÃĐes dans la mÊme direction, de sorte que le modÃĻle pouvait distinguer le bon du mauvais, mais a systÃĐmatiquement ÃĐvaluÃĐ les images gÃĐnÃĐrÃĐes par l’IA plus haut que les humains ne l’ont fait.

‘Plus prÃĐcisÃĐment, nous nous sommes demandÃĐ si les agents de l’IA reconnaÃŪtraient que leurs propres sorties sont infÃĐrieures à celles produites par les humains, ou si au contraire ils afficheraient une prÃĐfÃĐrence pour leurs propres crÃĐations, ce qui indiquerait un problÃĻme d’alignement potentiel.’

Comme il s’est avÃĐrÃĐ, il y a en effet un problÃĻme d’alignement*:

‘Les ÃĐvaluateurs de l’IA ont attribuÃĐ des ÃĐvaluations plus ÃĐlevÃĐes aux sorties gÃĐnÃĐrÃĐes par l’IA. Ces rÃĐsultats suggÃĻrent que les diffÃĐrences de performances observÃĐes peuvent provenir d’un dÃĐsalignement dans les reprÃĐsentations entre les humains et l’IA.’

En examinant la façon dont les humains et l’IA formulent leurs conseils, des ÃĐcarts sont devenus clairs lors des tests. Comme le montre la figure ci-dessous, à la fois la concentration et la longueur sont des sujets de divergence entre l’IA et les humains:

Comparaison de la façon dont les humains et l'IA ont donnÃĐ des instructions pendant la tÃĒche de codage. 'A' montre que les humains ÃĐcrivent des instructions courtes et directes, tandis que l'IA ÃĐcrit des descriptions longues et dÃĐtaillÃĐes. 'B' cartographie les instructions, rÃĐvÃĐlant que les invites humaines se regroupent, tandis que les invites de l'IA se sÃĐparent par animal. 'C' suit la façon dont la limitation de la longueur des instructions de l'IA ne corrige pas ses mauvais rÃĐsultats au fil du temps; et 'D' illustre que les humains fournissent des conseils plus variÃĐs et ÃĐquilibrÃĐs que l'IA, mÊme lorsque des limites de mots sont imposÃĐes.

Comparaison de la façon dont les humains et l’IA ont donnÃĐ des instructions pendant la tÃĒche de codage. ‘A’ montre que les humains ÃĐcrivent des instructions courtes et directes, tandis que l’IA ÃĐcrit des descriptions longues et dÃĐtaillÃĐes. ‘B’ cartographie les instructions, rÃĐvÃĐlant que les invites humaines se regroupent, tandis que les invites de l’IA se sÃĐparent par animal. ‘C’ suit la façon dont la limitation de la longueur des instructions de l’IA ne corrige pas ses mauvais rÃĐsultats au fil du temps; et ‘D’ illustre que les humains fournissent des conseils plus variÃĐs et ÃĐquilibrÃĐs que l’IA, mÊme lorsque des limites de mots sont imposÃĐes.

Les instructions humaines avaient tendance à Être courtes et directes, offrant des ÃĐdits clairs qui pouvaient Être appliquÃĐs de maniÃĻre gÃĐnÃĐrale aux cibles. Les instructions de l’IA, en revanche, ÃĐtaient denses en dÃĐtails descriptifs et souvent gonflÃĐes de spÃĐcificitÃĐs sur l’ombrage, les textures, l’ÃĐclairage ou les dÃĐtails anatomiques – descriptions qui peuvent avoir du sens en isolation, mais ÃĐchouent à fournir des ÃĐtapes suivantes utiles pour le modÃĻle (et qui seront familiÃĻres à ceux qui connaissent les problÃĻmes des LLM autour de la longueur du contexte, c’est-à-dire la capacitÃĐ Ã  conserver ÂŦ le grand tableau Âŧ au fur et à mesure que le projet se dÃĐveloppe et grandit).

Pour voir si une verbositÃĐ rÃĐduite amÃĐliorerait les performances, GPT-5 a ÃĐtÃĐ limitÃĐ Ã  10, 20 ou 30 mots par instruction; mais mÊme ces instructions compressÃĐes n’ont pas montrÃĐ d’amÃĐlioration (voir le coin infÃĐrieur droit du graphique ci-dessus).

Entreprises conjointes

Pour tester ce qui se passe lorsque les humains et l’IA partagent le contrÃīle, les chercheurs ont exÃĐcutÃĐ des tÃĒches de codage avec diffÃĐrents mÃĐlanges d’entrÃĐe humaine et de l’IA, allant de principalement humain à principalement IA.

Chaque mÃĐlange hybride a surpassÃĐ le contrÃīle total de l’IA, de sorte qu’une petite quantitÃĐ de direction humaine a amÃĐliorÃĐ les rÃĐsultats:

Ensembles de codage hybrides avec diffÃĐrents mÃĐlanges humain/IA. (A) montre comment les humains et l'IA ont pris tour à tour les rÃīles d'instructeurs et de sÃĐlectionneurs pour chaque ÃĐtape de codage; (B) montre que plus d'implication humaine a conduit à des rÃĐsultats de meilleure qualitÃĐ, tandis que plus d'entrÃĐe de l'IA a abaissÃĐ les scores; et (C) reprÃĐsente une baisse constante de la qualitÃĐ de la sortie finale à mesure que la participation humaine diminue, confirmant que une direction humaine plus cohÃĐrente a produit de meilleurs rÃĐsultats.

Ensembles de codage hybrides avec diffÃĐrents mÃĐlanges humain/IA. (A) montre comment les humains et l’IA ont pris tour à tour les rÃīles d’instructeurs et de sÃĐlectionneurs pour chaque ÃĐtape de codage; (B) montre que plus d’implication humaine a conduit à des rÃĐsultats de meilleure qualitÃĐ, tandis que plus d’entrÃĐe de l’IA a abaissÃĐ les scores; et (C) reprÃĐsente une baisse constante de la qualitÃĐ de la sortie finale à mesure que la participation humaine diminue, confirmant que une direction humaine plus cohÃĐrente a produit de meilleurs rÃĐsultats.

À mesure que l’IA prenait le contrÃīle de plus en plus du processus, les performances ont chutÃĐ, avec les meilleurs rÃĐsultats observÃĐs lorsque les humains dirigeaient la plupart des tours, et les plus faibles lorsque l’IA dirigeait la plupart des tours. Aucun de ces ensembles hybrides n’a rÃĐussi à maintenir l’amÃĐlioration à chaque nouvelle itÃĐration, suggÃĐrant que la direction humaine fonctionne mieux lorsqu’elle est constante et cohÃĐrente, plutÃīt que occasionnelle.

Inversion des rÃīles

L’ÃĐtude a ÃĐgalement explorÃĐ si cela importe qui fait quoi dans ce type de tÃĒches, et a testÃĐ cela. L’exercice rÃĐvisÃĐ impliquait deux tÃĒches: un participant dictait comment modifier l’image, et un autre choisissait une version prÃĐfÃĐrable.

Lorsque les deux tÃĒches ÃĐtaient effectuÃĐes par des humains, la qualitÃĐ a ÃĐtÃĐ maintenue; mais lorsque un humain donnait les instructions et personne ne choisissait entre les versions, la qualitÃĐ s’est dÃĐtÃĐriorÃĐe:

Tests pour la division des rÃīles dans le codage Vibe: en (A), la suppression du rÃīle de sÃĐlectionneur a conduit à de mauvaises performances, mÊme lorsque les instructions ÃĐtaient fournies par un humain; en (B), le remplacement du sÃĐlectionneur humain par un IA a rÃĐduit la qualitÃĐ de maniÃĻre lÃĐgÃĻre, mais pas aussi sÃĐvÃĻrement que la suppression complÃĻte de la sÃĐlection.

Tests pour la division des rÃīles dans le codage Vibe: en (A), la suppression du rÃīle de sÃĐlectionneur a conduit à de mauvaises performances, mÊme lorsque les instructions ÃĐtaient fournies par un humain; en (B), le remplacement du sÃĐlectionneur humain par un IA a rÃĐduit la qualitÃĐ de maniÃĻre lÃĐgÃĻre, mais pas aussi sÃĐvÃĻrement que la suppression complÃĻte de la sÃĐlection.

Lorsque l’IA ÃĐtait en charge, la suppression de l’ÃĐtape de choix n’avait pas d’importance, puisque ses sorties restaient constantes dans les deux cas; mais lorsque les humains donnaient les instructions et que l’IA choisissait les rÃĐsultats, la qualitÃĐ est restÃĐe proche de l’ensemble entiÃĻrement humain.

L’inverse n’a pas fonctionnÃĐ: avoir l’IA donner des instructions tandis que les humains choisissaient les sorties a conduit à des rÃĐsultats plus faibles, suggÃĐrant que la direction crÃĐative humaine reste essentielle, tandis que le rÃīle de choix entre les options peut Être dÃĐlÃĐguÃĐ Ã  l’IA sans grande perte.

Le document conclut:

‘La gÃĐnÃĐration d’idÃĐes et l’instruction de haut niveau sont les contributions humaines critiques, tandis que l’ÃĐvaluation et la sÃĐlection peuvent souvent Être dÃĐlÃĐguÃĐes à l’IA sans perte de performance.

‘Cela suggÃĻre un principe de conception pratique pour les systÃĻmes hybrides: les humains devraient dÃĐfinir la direction, tandis que l’IA peut soutenir l’ÃĐvaluation et l’exÃĐcution.’

Conclusion

Il reste à voir dans quelle mesure l’amÃĐlioration et/ou l’augmentation des fenÊtres de contexte affecteront les performances des LLM dans des tÃĒches de ce type. Le jour oÃđ l’ÂŦ amnÃĐsie des LLM Âŧ cessera d’Être un problÃĻme quotidien de la collaboration humaine/IA peut Être à la fois une cause de cÃĐlÃĐbration et d’alarme, puisque le problÃĻme que l’IA cherche à rÃĐsoudre, à l’argumentation, est les gens.

Cependant, le travail des auteurs met ÃĐgalement en ÃĐvidence qu’il existe des dÃĐsaccords innÃĐs et critiques entre l’IA et les humains concernant la qualitÃĐ, qui peuvent encore Être dÃĐterminÃĐs par les consommateurs comme un concept humain irremplaçable.

 

* Ma conversion des citations en ligne des auteurs en hyperliens.

PubliÃĐ pour la premiÃĻre fois le vendredi 13 fÃĐvrier 2026

Écrivain sur l'apprentissage automatique, spÃĐcialiste du domaine de la synthÃĻse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : [email protected]