Angle d’Anderson

Les modèles de langage personnalisés sont faciles à créer – et plus difficiles à détecter

mm
Ajouter Unite.AI à vos sources préférées sur Google
A robot hand at large in an exam room - Flux, Krita (AI GENERATED).

Les clones open-source de ChatGPT peuvent être affinés à grande échelle et avec une expertise limitée ou inexistante, facilitant ainsi la création de modèles de langage « privés » qui échappent à la détection. La plupart des outils ne peuvent pas retracer l’origine de ces modèles ou ce pour quoi ils ont été formés, permettant aux étudiants et à d’autres utilisateurs de générer du texte AI sans se faire prendre; mais une nouvelle méthode prétend qu’elle peut identifier ces variantes cachées en repérant des « traits de famille » partagés dans les sorties des modèles.

 

Selon une nouvelle étude du Canada, les modèles de chat AI personnalisés, similaires à ChatGPT, sont capables de produire du contenu de médias sociaux qui ressemble étroitement à l’écriture humaine, et qui peut tromper les algorithmes de détection de pointe et les humains.

L’article indique:

‘Un attaquant réaliste est susceptible d’affiner un modèle pour son style et son cas d’utilisation spécifiques, car cela est peu coûteux et facile à faire. Avec un minimum d’effort, de temps et d’argent, nous avons produit des générateurs affinés capables de produire des tweets de médias sociaux beaucoup plus réalistes, sur la base à la fois de caractéristiques linguistiques et de précision de détection, et vérifiés grâce à des annotations humaines.’

Les auteurs soulignent que ces modèles personnalisés ne sont pas limités au contenu de médias sociaux à court terme:

‘Bien que motivés par la propagation de contenu AI sur les médias sociaux, et les risques associés d’astroturfing et de campagnes d’influence, nous soulignons que les principales conclusions s’appliquent à tous les domaines du texte.

‘En effet, l’affinement de modèles pour la génération de contenu spécifique à un style est une méthode généralement applicable, et qui est probablement déjà utilisée par de nombreux utilisateurs de générateurs AI – ce qui remet en question l’efficacité des méthodes existantes de détection de l’AI dans le monde réel, par rapport au laboratoire de recherche.’

Comme l’observe l’article, la méthode utilisée pour créer ces modèles de langage personnalisés est l’affinement, où les utilisateurs sélectionnent une quantité limitée de leurs propres données cibles et les injectent dans un nombre croissant d’outils de formation en ligne faciles à utiliser et peu coûteux.

Par exemple, le répertoire populaire Hugging Face offre un affinement de modèle de langage à grande échelle via une interface simplifiée, en utilisant son système AutoTrain Advanced, qui peut être exécuté pour quelques dollars via un GPU en ligne ou gratuitement, si l’utilisateur a un matériel adéquat:

Différentes structures de prix pour la gamme de GPUs disponibles pour le système Hugging Face AutoTrain. Source: https://huggingface.co/spaces/autotrain-projects/autotrain-advanced?duplicate=true

Différentes structures de prix pour la gamme de GPUs disponibles pour le système Hugging Face AutoTrain. Source: https://huggingface.co/spaces/autotrain-projects/autotrain-advanced?duplicate=true

D’autres méthodes et plateformes simplifiées incluent Axolotl, Unsloth, et la plus capable mais exigeante TorchTune.

Un exemple d’utilisation serait un étudiant qui est fatigué d’écrire ses propres essais, mais qui a peur d’être pris en flagrant délit par les outils de détection AI en ligne, qui peut utiliser ses propres essais historiques comme données de formation pour affiner un modèle open-source populaire comme la série Mistral.

Bien que l’affinement d’un modèle tend à dévier ses performances vers les données de formation supplémentaires et à dégrader les performances globales, les modèles « personnalisés » peuvent être utilisés pour « dé-AI » la sortie de plus en plus distinctive des systèmes tels que ChatGPT, d’une manière qui reflète le style historique de l’utilisateur (et, pour une authenticité accrue, ses lacunes).

Cependant, on pourrait utiliser exclusivement un modèle affiné spécifiquement formé pour une tâche ou un ensemble de tâches étroites, tel qu’un modèle de langage à grande échelle affiné sur le contenu d’un module universitaire spécifique. Un modèle aussi spécifique aurait une vision myope, mais beaucoup plus approfondie dans ce domaine que n’importe quel modèle de langage à usage général comme ChatGPT, et coûterait probablement moins de 10 à 20 dollars à former.

Le iceberg du LLM

Il est difficile de dire à quelle échelle se pratique cette activité. De manière anecdotique, sur diverses plateformes de médias sociaux, j’ai récemment rencontré de nombreux exemples d’affinement de LLM à orientation commerciale – certainement beaucoup plus que l’année dernière; dans un cas, une entreprise a affiné un modèle de langage sur ses propres pièces de leadership publiées, qui a ensuite pu convertir un appel Zoom désorganisé avec un nouveau client en un post B2B poli presque en une seule passe, sur demande.

Un modèle de cette nature nécessite des données appariées (exemples avant et après, à grande échelle), alors que la création d’un « gloss » personnalisé des caractéristiques d’un écrivain particulier est une tâche plus facile, plus similaire à un transfert de style.

Bien que cette pratique soit clandestine (malgré de nombreux titres et études universitaires sur le sujet), où les chiffres ne sont pas disponibles, le même bon sens qui a conduit à l’adoption de la loi TAKE IT DOWN cette année s’applique ici: l’activité ciblée est possible et abordable, et il existe une forte compréhension de bon sens que les utilisateurs potentiels sont très motivés.

Il reste juste assez de friction dans les systèmes de formation en ligne les plus « simplifiés » pour que la pratique de la formation et de l’utilisation de modèles affinés de manière malhonnête reste un cas d’utilisation relativement de niche – pour le moment – même si ce n’est certainement pas au-delà de l’inventivité traditionnelle des étudiants.

PhantomHunter

Cela nous amène au document principal qui nous intéresse ici – une nouvelle approche de Chine qui rassemble une grande variété de techniques dans un seul cadre – appelé PhantomHunter – qui prétend identifier la sortie de modèles de langage affinés qui passeraient autrement pour un travail humain original.

Le système est conçu pour fonctionner même lorsque le modèle affiné spécifique n’a jamais été rencontré auparavant, en s’appuyant plutôt sur les traces résiduelles laissées par le modèle de base initial – que les auteurs qualifient de « traits de famille » qui survivent au processus d’affinement.

Dans les tests, l’article – intitulé PhantomHunter: Détection de texte généré par LLM affiné de manière privée via l’apprentissage familier – rapporte une forte précision de détection, le système surpassant l’évaluation zero-shot GPT-4-mini dans le traçage d’un échantillon de texte à sa famille de modèles.

Cela suggère que plus un modèle est affiné, plus il révèle sur son ascendance, contredisant l’hypothèse selon laquelle l’affinement privé masque toujours l’origine d’un modèle; au lieu de cela, le processus d’affinement peut laisser une empreinte détectable qui, si elle est lue correctement, donne le jeu – du moins, en attendant les progrès supplémentaires qui semblent arriver chaque semaine maintenant.

L’article indique*:

‘La détection de texte généré par machine [MGT] distingue généralement le texte généré par LLM et le texte écrit par l’homme via une classification binaire. Les méthodes existantes apprennent soit des caractéristiques textuelles communes partagées par les LLM en utilisant l’apprentissage de représentation, soit conçoivent des métriques distinguables entre les textes humains et LLM basés sur les signaux internes des LLM (par exemple, probabilités de jeton).

‘Pour les deux catégories, leurs tests ont été réalisés principalement sur des données provenant de LLM publics, en supposant que les utilisateurs génèrent du texte en utilisant des services publics, prêts à l’emploi.

Nous soutenons que cette situation est en train de changer en raison du développement récent de la communauté open-source LLM. Avec l’aide de plateformes comme HuggingFace et des techniques d’entraînement LLM efficaces comme l’adaptation de bas rang (LoRA), la construction de modèles LLM affinés avec des jeux de données privés personnalisés est devenue beaucoup plus facile qu’auparavant.

‘Par exemple, il y a eu plus de 60 000 modèles dérivés Llama sur HuggingFace. Après un affinement privé sur un corpus inconnu, les caractéristiques apprises des modèles de base pourraient changer et les détecteurs LLMGT pourraient [échouer], créant un nouveau risque que les utilisateurs malveillants puissent générer des textes nuisibles en privé sans être pris par les détecteurs LLMGT.

‘Un nouveau défi se pose: Comment détecter le texte généré par des LLM open-source affinés de manière privée?

Méthode et formation

Le système PhantomHunter utilise une stratégie d’apprentissage familier, combinant trois composants: un extracteur de caractéristiques, capturant les probabilités de sortie des modèles de base connus; un encodeur contrastif formé pour distinguer entre les familles; et (comme détaillé ci-dessous) un classificateur à mélange d’experts qui attribue des étiquettes de famille à de nouveaux échantillons de texte:

Schéma du système. PhantomHunter traite un échantillon de texte en extrayant d'abord des caractéristiques de probabilité de plusieurs modèles de base, qui sont ensuite encodées à l'aide de couches CNN et de transformateurs. Il estime la famille de modèles pour calculer des poids de contrôle, qui guident un module à mélange d'experts dans la prédiction de si le texte est généré par LLM. Une perte contrastive est appliquée pendant la formation pour raffiner la séparation entre les familles de modèles. Source: https://arxiv.org/pdf/2506.15683

Schéma du système. PhantomHunter traite un échantillon de texte en extrayant d’abord des caractéristiques de probabilité de plusieurs modèles de base, qui sont ensuite encodées à l’aide de couches CNN et de transformateurs. Il estime la famille de modèles pour calculer des poids de contrôle, qui guident un module à mélange d’experts dans la prédiction de si le texte est généré par LLM. Une perte contrastive est appliquée pendant la formation pour raffiner la séparation entre les familles de modèles. Source: https://arxiv.org/pdf/2506.15683

PhantomHunter fonctionne en passant un morceau de texte à travers plusieurs modèles de base connus et en enregistrant à quel point chaque modèle pense que le mot suivant est probable, à chaque étape. Ces modèles sont ensuite alimentés dans un réseau de neurones qui apprend les caractéristiques distinctives de chaque famille de modèles.

Pendant la formation, le système compare des textes de la même famille et apprend à les regrouper ensemble, tout en distinguant ceux provenant de différentes familles, ce qui aide à identifier les liens cachés entre les modèles affinés et leurs modèles de base.

MOE

Pour décider si un morceau de texte a été écrit par un humain ou par un IA, PhantomHunter utilise un système à mélange d’experts, dans lequel chaque « expert » est réglé pour détecter le texte d’une famille de modèles spécifique.

Une fois que le système devine quelle famille le texte provient le plus probablement, il utilise cette supposition pour décider à quel point donner du poids à l’opinion de chaque expert. Ces opinions pondérées sont ensuite combinées pour prendre la décision finale: IA ou humain.

La formation du système implique plusieurs objectifs: apprendre à reconnaître les familles de modèles; apprendre à distinguer le texte AI du texte humain; et apprendre à séparer les différentes familles en utilisant l’apprentissage contrastif – objectifs qui sont équilibrés pendant la formation grâce à des paramètres ajustables.

En se concentrant sur les modèles partagés au sein de chaque famille, plutôt que sur les particularités de modèles individuels, PhantomHunter devrait en théorie être capable de détecter même les modèles affinés qu’il n’a jamais vus auparavant.

Données et tests

Pour développer des données pour les tests, les auteurs se sont concentrés sur les deux scénarios universitaires les plus courants: la rédaction et la réponse aux questions. Pour la rédaction, ils ont collecté 69 297 résumés de l’archive académique Arxiv, divisés en domaines principaux. Pour la réponse aux questions, 2 062 paires ont été sélectionnées dans le jeu de données HC3 sur trois sujets: ELI5; finance; et médecine:

Liste des sources de données et de leurs nombres, dans les données sélectionnées pour l'étude.

Liste des sources de données et de leurs nombres, dans les données sélectionnées pour l’étude.

Au total, douze modèles ont été formés pour le test. Les trois modèles de base étaient LLaMA-2 7B-Chat; Mistral 7B-Instruct-v0.1; et Gemma 7B-it), à partir desquels neuf variantes affinées ont été créées, chacune adaptée pour imiter un domaine ou un style d’auteur différent, en utilisant des données spécifiques au domaine:

Statistiques du jeu de données d'évaluation, où « FT Domain » fait référence au domaine utilisé pendant l'affinement et « base » indique pas d'affinement.

Statistiques du jeu de données d’évaluation, où « FT Domain » fait référence au domaine utilisé pendant l’affinement et « base » indique pas d’affinement.

Au total, donc, trois modèles de base ont été affinés à la fois avec des paramètres complets et avec des techniques LoRA sur trois domaines distincts dans chacun des deux scénarios d’utilisation: écriture d’abstrait universitaire et réponse aux questions. Pour refléter les défis de détection du monde réel, les modèles affinés sur des données de science informatique ont été retenus des tests d’écriture, tandis que ceux affinés sur des données de finance ont été retenus des évaluations de réponse aux questions.

Les cadres de travail concurrents sélectionnés étaient RoBERTa; T5-Sentinel; SeqXGPT; DNA-GPT; DetectGPT; Fast-DetectGPT; et DeTeCtive.

PhantomHunter a été formé en utilisant deux types de couches de réseau de neurones: trois couches convolutionnelles avec pooling maximal pour capturer les modèles de texte locaux, et deux couches de transformateur avec quatre têtes d’attention chacune pour modéliser les relations à longue portée.

Pour l’apprentissage contrastif, qui encourage le système à distinguer entre les différentes familles de modèles, le paramètre température a été réglé à 0,07.

L’objectif de formation combinait trois termes de perte: L1 (pour la classification de famille) et L2 (pour la détection binaire), chacun pesé à 1,0, et L3 (pour l’apprentissage contrastif), pesé à 0,5.

Le modèle a été optimisé en utilisant Adam avec un taux d’apprentissage de 2e-5 et une taille de lot de 32. La formation a eu lieu pendant dix époques complètes, avec le point de contrôle le mieux performant sélectionné en utilisant un ensemble de validation. Toutes les expériences ont été menées sur un serveur avec quatre GPU NVIDIA A100.

Les métriques utilisées étaient le score F1 pour chaque sous-ensemble de test, ainsi que le taux de vrai positif, pour la comparaison avec les détecteurs commerciaux.

Scores F1 pour la détection de texte provenant de modèles de langage affinés non vus. Les deux meilleurs résultats de chaque catégorie sont en gras et soulignés. 'BFE' fait référence à l'extraction de caractéristiques de probabilité de base, 'CL' à l'apprentissage contrastif, et 'MoE' au module à mélange d'experts.

Scores F1 pour la détection de texte provenant de modèles de langage affinés non vus. Les deux meilleurs résultats de chaque catégorie sont en gras et soulignés. ‘BFE’ fait référence à l’extraction de caractéristiques de probabilité de base, ‘CL’ à l’apprentissage contrastif, et ‘MoE’ au module à mélange d’experts.

Les résultats du test initial, visualisés dans le tableau ci-dessus, montrent que PhantomHunter a surpassé tous les systèmes de référence, en maintenant des scores F1 supérieurs à 90 % pour les textes humains et générés par machine, même lorsqu’il a été évalué sur les sorties de modèles affinés exclus de la formation.

Les auteurs commentent:

‘Avec un affinement complet, PhantomHunter améliore le score MacF1 de 3,65 % et 2,96 % sur les deux ensembles de données, respectivement; et avec un affinement LoRA, les améliorations sont de 2,01 % et 6,09 % respectivement.

‘Le résultat démontre la puissante capacité de détection de PhantomHunter pour les textes générés par des LLM affinés non vus.’

Des études d’ablation ont été menées pour évaluer le rôle de chaque composant principal dans PhantomHunter. Lorsque des éléments individuels ont été supprimés, tels que l’extracteur de caractéristiques, l’encodeur contrastif ou le classificateur à mélange d’experts, une baisse constante de précision a été observée, indiquant que l’architecture repose sur la coordination de toutes ses parties.

Les auteurs ont également examiné si PhantomHunter pouvait se généraliser au-delà de sa distribution de formation, et ont constaté que même lorsqu’il était appliqué aux sorties de modèles de base entièrement absents pendant la formation, il continuait à surpasser les méthodes rivales – suggérant que les signatures au niveau de la famille restent détectables à travers les variantes affinées.

Conclusion

Un argument en faveur des modèles de langage génératifs formés par l’utilisateur est qu’au moins ces petits affinements et LoRAs obscurs préservent la saveur et les excentricités individuelles d’un auteur, dans un climat où l’idiome générique, inspiré par le référencement, des chatbots AI menace de générer n’importe quel langage où l’IA devient un contributeur majeur ou dominant.

Avec la dévaluation de la rédaction universitaire, et avec les étudiants qui enregistrent désormais de longues sessions d’écriture pour prouver qu’ils n’ont pas utilisé d’IA pour leurs soumissions, plus d’enseignants en dehors de l’Europe (où les examens oraux sont normalisés) envisagent des examens en face à face comme une alternative aux textes soumis. Plus récemment, un retour au travail manuscrit a été proposé.

On peut soutenir que ces deux solutions sont supérieures à ce qui menace d’être une répétition basée sur les LLM de la course aux armes des deepfakes; bien qu’elles se fassent au prix d’un effort et d’une attention humaine, que la culture technologique cherche actuellement à automatiser.

 

Veuillez consulter la section finale après les résultats principaux, dans le document source, pour plus de détails sur ceci.

* Ma conversion des citations en ligne des auteurs en hyperliens. Les emphases du texte des auteurs, et non les miennes.

Publié pour la première fois le jeudi 19 juin 2025

Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : martin@martinanderson.ai