Angle d’Anderson
Industrialiser l’humanisation

Les offres d’emplois et les services sur les plateformes de travail occasionnel comme Upwork et Fiverr comportent massivement le terme ‘humaniser’ de nos jours, avec une gamme d’emplois et de prestataires proposant divers niveaux d’obfuscation du fait qu’un article a été rédigé, ou partiellement rédigé, ou co‑rédigé avec l’IA.

La tendance « Humanize » dans les publications réelles sur Upwork.
La demande de services humains et automatisés capables de réécrire les sorties « polluées » par l’IA afin qu’elles donnent l’impression qu’un humain s’est assis et a transpiré pendant quelques heures, suggère qu’un consensus universel a été atteint selon lequel la « touche humaine » est nécessaire pour la connexion et la portée – et que le volume immense de contenu à l’ère de l’IA rendra cette connexion essentielle à nouveau.
J’aimerais personnellement le penser, mais ce n’est pas nécessairement le cas – notamment parce que les propres directives de Google à ce sujet traitent de la qualité du texte, plutôt que du moyen par lequel il a été créé.
La vérité, c’est que nous ne savons pas encore exactement combien ou quel type de IA nous sommes prêts à tolérer, ni dans quelle mesure nous pouvons rationaliser les avantages que des milliards d’entre nous tirent de l’IA chaque jour face à un sentiment de « complicité » et de séduction morale concernant les implications plus larges de la technologie.
Les annonces d’emploi susmentionnées reflètent cela également ; là, créateurs et entreprises se ruent sur l’automatisation, probablement parce qu’ils souhaitent publier à grande échelle, ce qui correspond exactement à la pratique que Google promet de punir spécifiquement dans son algorithme de classement. En même temps, ils recherchent à la fois des méthodes automatisées et humaines d’« industrialiser » l’humanisation.
Il me rappelle un peu une des meilleures blagues dans les sketches neurodivergents de Steven Wright des années 1980 :
‘Dans ma maison, j’ai une cheminée à micro-ondes. Je peux m’allonger devant le feu pour la soirée en seulement 8 minutes.’
La forme du slop à venir
Comme d’habitude, ces réflexions sont inspirées par ma navigation quotidienne sur Arxiv, où aujourd’hui j’ai particulièrement été interpellé par un article de Jochen Madler de la société d’automatisation marketing Sitefire, intitulé SlopShape : Identifier le contenu Web commercial généré par IA.
Je discount généralement les articles à auteur unique, selon le principe du « Victor Frankenstein », mais la prémisse de celui-ci est spartiate, et la méthodologie de test robuste.
L’étude affirme essentiellement que lorsqu’un article généré par IA est entièrement réécrit, même par des humains, il conserve une signature architecturale distincte qui réside à un niveau bien supérieur à celui du mot, comprenant une « forme » caractéristique qui ne peut être éradiquée par aucune quantité de reformulation ou de modification superficielle du texte :

Comparaison des schémas structurels dans les publications humaines et générées par IA. L’écriture humaine a tendance à utiliser des combinaisons de structures plus rares, tandis que les cinq modèles d’IA privilégient des combinaisons plus conventionnelles. Source
Évidemment, on peut contourner ce problème (si l’on le considère comme tel) en planifiant réellement le cours de l’écriture soi‑même, et soit en n’utilisant aucune IA, soit en ne l’employant que sur les composants séparés que l’on a planifiés.
Cependant, comme le prouvent les publicités agressives sur Upwork, ce n’est pas ce qui est recherché ; on peut déduire du ton de ces annonces que le contenu des articles devrait de préférence non seulement être structuré par l’IA, mais également conceptualisé par l’IA – c’est‑à‑dire qu’un LLM proposerait des sujets appropriés alignés avec les objectifs globaux d’une entreprise ou d’une entité.
Après cela, il est tout à fait attendu que l’IA produise divers brouillons progressifs du contenu, la composante « meatware » ennuyeuse n’intervenant que pour une conclusion et une touche finale d’humanité (bien que, idéalement, ce processus évoluerait finalement vers un workflow Python).
Fonctionnalités marquantes
L’auteur du nouvel article a obtenu ces insights en collectant quelques milliers de billets de blog d’entreprise immédiatement précédant la sortie et la diffusion de ChatGPT (2020‑2022) et en déduisant les invites à partir de ceux‑ci.
C’est-à-dire qu’il a utilisé Gemini 3 Flash pour lire les vrais articles rédigés par des humains et rétroconcevoir une invite conçue pour produire un travail similaire sur certains des principaux LLM, à savoir GPT5.4, Kimi 2.5, DeepSeek V3.2, Claude 4.6 et Gemini 3.
Ces invites ont ensuite été utilisées pour créer cinq versions IA de chacun des vrais billets humains, à partir desquelles fonctionnalités ont été extraites, lesquelles décriraient finalement la « forme » spécifique à chaque LLM du contenu à travers les cinq modèles ; et Madler note que « les publications IA partagent une forme nette, auto‑annonceuse ».
L’ensemble de l’étude est une réexécution du StoryScope project de COLM 2026 cet août, une collaboration entre l’Université du Maryland et Google DeepMind, qui a appliqué essentiellement la même méthodologie à la fiction, constatant que les récits générés par IA convergent vers un éventail plus étroit et plus prévisible de structures narratives que l’écriture humaine :

À partir de l’étude StoryScope, un diagramme de dispersion comparant les schémas narratifs dans la fiction humaine et celle générée par IA. Les récits écrits par des humains occupent une région distincte, tandis que les récits issus de cinq modèles d’IA leaders se regroupent plus étroitement, indiquant une plus grande similarité dans leurs choix narratifs sous-jacents. Source
Madler a décidé de réexécuter StoryScope sur les blogs d’entreprise en raison de l’importante impulsion financière à automatiser ceux‑ci, comparée au domaine plus excentrique de l’écriture de fiction, et de la grande mesure déjà automatisée (50 % d’automatisation du contenu en ligne d’ici mai 2026, selon a Graphite study citée dans les travaux de Madler).
Peut‑être l’analyse la plus intéressante est le décorticage des caractéristiques extraites du matériel produit par IA à partir des publications humaines antérieures à 2022 :
« Les valeurs les plus couramment produites par les modèles d’IA s’assemblent en ce que nous appelons le blog propre, auto‑annonceur : il promet le résultat déjà dans le titre, expose sa thèse et annonce sa structure avant la première section, s’exprime dans une voix éditoriale‑explicative, et se clôture par une étape qui résume ou reformule la thèse. »
« Dans un article typique d’IA, le résultat est promis dans le titre : « Comment réduire de moitié le temps d’intégration. » La thèse est énoncée et le fil annoncé avant la première section : « Dans cet article, nous couvrirons pourquoi l’intégration stagne, trois solutions efficaces, et comment mesurer la différence. » »
« Et la conclusion reformule la thèse : « En bref, une intégration structurée fait gagner du temps. » Les valeurs orientées humain décrivent des articles sans ces repères : aucun flux de sections annoncé, aucune escalade des enjeux, et aucune section de clôture qui reformule la thèse. »
Une prémisse erronée
Incidemment, la plupart des tropes et clichés présents dans le(s) modèle(s) décrit(s) proviennent des SEO-obsessed strictures de la scène marketing pré‑LLM. D’où pensons‑nous que l’IA a appris ces habitudes ?
Le texte marketing templatisé était toujours détesté, bien avant l’IA, et toujours produit à grande échelle, bien avant que les machines ne puissent le faire correctement ; et à cause de l’obligation de se conformer aux pratiques SEO, certaines conventions horribles ont été instaurées, telles que le placement de mots‑clés, et le conception soignée des liens.
Dans ce dernier cas, l’IA a donc peut‑être appris la mauvaise leçon, puisque les corpus texte‑seul sur lesquels elle a été entraînée ont éliminé tant de tactiques orientées SEO qui étaient à l’origine incluses dans le matériel source, telles que les diagrammes stratégiques, les explicatifs visuels ; et surtout les hyperliens.
Des sections entières d’un article ont pu être conçues pour encadrer un hyperlien ou une intégration YouTube qu’un client souhaitait mettre en avant ; mais au moment où les données ont été intégrées dans un LLM, l’intégration ou le lien a été supprimé, et le texte destiné à le mettre en valeur a été dépouillé de son contexte d’origine.
Par conséquent, on peut soutenir que la grande erreur dans la conception de méthodologies d’entraînement autour de ce type de matériel était de traiter le contenu web comme s’il s’agissait de littérature du XIXᵉ siècle (entièrement autonome) au lieu de multimédia (significativement influencé par des facteurs non textuels tels que vidéo, hyperliens et illustrations).
L’autre grande erreur était de s’entraîner sur du matériel que les gens détestaient déjà, et qui a été déformé en une forme impopulaire par des règles qui ne sont probablement plus valides.
Attention, humains
Néanmoins, si l’on en croit les tendances d’Upwork, il existe une demande importante pour davantage du même, produit à grande échelle par les LLM, et « humanisé » via le processus le moins idiosyncrasique disponible, à la vitesse la plus élevée et au coût le plus bas possible.
Tout cela, pour produire l’effet de attention : l’idée que quelqu’un comme vous (c’est‑à‑dire, possédant au moins un système endocrinien) se soit assis quelques heures et ait réfléchi à ce qu’il voulait vous dire.
La perception de recevoir une attention humaine est significative pour nous même lorsqu’elle n’est pas utile ; par conséquent, cela vaut certainement la peine d’être industrialisé.
Je ne peux m’empêcher de penser que l’article de Madler risque d’aggraver la situation, puisqu’il identifie des traits caractéristiques de haute dimension qui peuvent désormais, probablement, être traités avec plus d’IA, de sorte que les signatures par défaut adopteront une forme plus humaine à mesure que les modèles évoluent.
Première publication jeudi 17 septembre 2026












