Angle d’Anderson

Heuristiques contre RAG : l’inflation rÃĐduite comme moteur de politique

mm
Ajouter Unite.AI à vos sources prÃĐfÃĐrÃĐes sur Google
A tiny robot tries to type on a full-size laptop by using a pencil. Z-Image V1.

La plupart du temps, la recherche sur le web amÃĐliore l’exactitude factuelle des rÃĐponses de ChatGPT à nos questions. Alors, dans un climat oÃđ l’IA lutte pour son acceptation publique, pourquoi recourt-elle à des ÂŦ hypothÃĻses Âŧ?

 

Opinion Il est erronÃĐ de penser que les LLM tels que ChatGPT s’adonnent jamais à la dÃĐnonciation des pratiques potentiellement douteuses de leurs hÃītes, mÊme si une session coÃŧteuse et gaspillÃĐe a suffisamment ÃĐnervÃĐ pour vraiment se lancer dans les dÃĐtails des lacunes du systÃĻme:

Ici, une discussion sur la prÃĐfÃĐrence de ChatGPT pour sa logique interne (par rapport à la recherche et à la vÃĐrification basÃĐes sur le web via RAG - qui produit moins d'hallucinations, mais coÃŧte plus) induit un moment apparent de franchise; mais prenez-le avec un grain de sel. Source: chatgpt.com

Ici, une discussion sur la prÃĐfÃĐrence de ChatGPT pour sa logique interne (par rapport à la recherche et à la vÃĐrification basÃĐes sur le web via RAG – qui produit moins d’hallucinations, mais coÃŧte plus) induit un moment apparent de franchise; mais prenez-le avec un grain de sel. Source

La plupart du temps – en particulier pour les modÃĻles avec des dates de fin de connaissance plus rÃĐcentes – l’IA se contente de jouer sur les publications Reddit et les forums vus pendant la formation. MÊme s’il y avait une vÃĐritable valeur à ces ÂŦ informations internes Âŧ, il est impossible de le prouver.

Cependant, parfois ces ÃĐchanges houleux conduisent à la dÃĐcouverte de ÂŦ hacks Âŧ (ou au moins de ÂŦ trucs Âŧ) qui promettent d’ÃĐviter certaines des pires habitudes rÃĐpÃĐtitives d’un LLM – comme lorsque, la semaine derniÃĻre, ChatGPT m’a suggÃĐrÃĐ que je pouvais le faire travailler plus dur et halluciner moins en incluant l’adjuration ‘pas d’hypothÃĻses’:

ChatGPT

J’ai utilisÃР‘pas d’hypothÃĻses’ beaucoup depuis, et pas une seule fois le modÃĻle n’a recours à ses connaissances formÃĐes aprÃĻs que j’aie fermÃĐ une requÊte avec cette commande. Au lieu de cela, GPT utilise immÃĐdiatement la GÃĐnÃĐration AugmentÃĐe de RÃĐcupÃĐration (RAG), en recherchant sur Internet des documents ÃĐclairants ou corroborants.

En pratique, pour la plupart des demandes, cela diffÃĻre peu de dire au systÃĻme de ÂŦ rechercher sur le web Âŧ chaque fois que vous soumettez une requÊte. Là oÃđ la phrase ÂŦ pas d’hypothÃĻses Âŧ peut vraiment aider est lorsque vous essayez d’obtenir que ChatGPT lise rÃĐellement un nouveau PDF tÃĐlÃĐchargÃĐ au lieu d’utiliser les mÃĐtadonnÃĐes des PDF prÃĐcÃĐdents dans cette session (ou de nombreuses autres sources possibles) pour produire une rÃĐponse ÂŦ plausible Âŧ mais entiÃĻrement hallucinÃĐe, n’ayant pas lu ou mÊme parcouru le document que vous venez de prÃĐsenter.

ChatGPT

Cela ÃĐtant dit, plus la session de conversation a durÃĐ, moins probable que cela fonctionnera – et il serait une erreur de penser que tout ÂŦ truc Âŧ est fiable ou restera disponible au fur et à mesure que le systÃĻme ÃĐvolue.

Le commerce RAG

Dans le contexte d’une culture grandissante de rÃĐduction de l’inflation, et du fait que de grands systÃĻmes tels que l’infrastructure GPT d’OpenAI sont ÃĐnormÃĐment affectÃĐs par mÊme les plus petits changements gÃĐnÃĐralisÃĐs dans le comportement, il est ÃĐgalement facile de croire que l’on reçoit moins que ce que l’on paie pour les choix faits par les LLM populaires tels que ChatGPT.

Des choix tels que celui de savoir s’il doit faire appel au web avec RAG; lancer un processus de chaÃŪne de pensÃĐe (CoT) qui pourrait obtenir un meilleur rÃĐsultat, mais qui coÃŧtera plus à infÃĐrer et pourrait fatiguer l’utilisateur impatient; ou recourir à ses propres embeddings formÃĐs et à ses connaissances locales – qui est la solution la moins chÃĻre et la plus rapide possible.

Il existe plusieurs raisons pratiques pour lesquelles un LLM avec un profil public sensible, tel que ChatGPT, peut prÃĐfÃĐrer limiter ses appels RAG, favorisant ainsi ses propres hypothÃĻses. Tout d’abord, d’un point de vue PR, l’utilisation frÃĐquente et non sollicitÃĐe du web soutient une caractÃĐrisation populaire des LLM comme de simples Googlers par procuration, diminuant la valeur de leurs connaissances innÃĐes et coÃŧteuses – et l’attrait d’un abonnement payant.

DeuxiÃĻmement, l’infrastructure RAG coÃŧte de l’argent pour fonctionner, maintenir et mettre à jour, par rapport au coÃŧt relativement nÃĐgligeable de l’infÃĐrence locale, c’est-à-dire la gÃĐnÃĐration paramÃĐtrique, qui est bon marchÃĐ et rapide.

TroisiÃĻmement, le systÃĻme peut ne pas avoir une mÃĐthode efficace pour dÃĐterminer si RAG pourrait amÃĐliorer ses propres rÃĐsultats heuristiques – et il ne peut souvent pas dÃĐterminer cela sans exÃĐcuter d’abord les hypothÃĻses. Cela laisse l’utilisateur final avec la tÃĒche d’ÃĐvaluer un rÃĐsultat heuristique erronÃĐ et de demander un appel RAG dans le cas oÃđ le rÃĐsultat des hypothÃĻses semblait insuffisant.

Du point de vue de ÂŦ l’inflation rÃĐduite de l’IA Âŧ, le nombre de fois oÃđ ChatGPT se trompe par hypothÃĻses et rÃĐussit par RAG peut indiquer, comme cela m’a rÃĐcemment ÃĐtÃĐ montrÃĐ, que le systÃĻme est optimisÃĐ pour le coÃŧt plutÃīt que pour les rÃĐsultats.

RAG devient nÃĐcessaire avec le temps

MalgrÃĐ la ÂŦ confession Âŧ rÃĐcente de ChatGPT à mon ÃĐgard, selon laquelle c’est effectivement le cas, ÂŦ l’inflation rÃĐduite Âŧ a un contexte plus large à cet ÃĐgard. Bien que RAG ne soit pas bon marchÃĐ, soit en termes de friction d’expÃĐrience (via la latence) ou de coÃŧt de fonctionnement, il est beaucoup moins cher que de rÃĐaffiner ou mÊme de rÃĐentraÃŪner le modÃĻle de base.

Pour un modÃĻle d’IA plus ancien avec une date de fin de connaissance plus ÃĐloignÃĐe, RAG peut maintenir la monnaie du systÃĻme, au coÃŧt d’appels rÃĐseau et d’autres ressources; pour un modÃĻle plus rÃĐcent, les rÃĐcupÃĐrations de RAG sont plus susceptibles d’Être redondantes ou mÊme nuisibles à la qualitÃĐ des rÃĐsultats, qui dans certains cas auraient ÃĐtÃĐ meilleurs grÃĒce aux hypothÃĻses.

Par consÃĐquent, l’IA semble avoir besoin non seulement de la capacitÃĐ de juger s’il doit recourir à RAG, mais de continuellement ÃĐvoluer sa politique d’utilisation de RAG à mesure que ses poids internes deviennent de plus en plus obsolÃĻtes.

En mÊme temps, le systÃĻme a besoin de dÃĐlimiter les ÂŦ constantes relatives Âŧ dans les connaissances, telles que les orbites lunaires et la littÃĐrature classique, la culture et l’histoire; ainsi que la gÃĐographie de base, la physique et d’autres principes scientifiques qui sont peu susceptibles d’ÃĐvoluer beaucoup avec le temps (c’est-à-dire que le risque de ÂŦ changement soudain Âŧ n’est pas nul, mais faible).

Sujets atypiques

Actuellement, du moins en ce qui concerne ChatGPT, les appels RAG (c’est-à-dire l’utilisation de la recherche sur le web pour toute requÊte utilisateur qui n’exige pas explicitement ou implicitement la recherche sur le web) semblent rarement choisis de maniÃĻre autonome par le systÃĻme, mÊme lorsqu’il s’agit de ÂŦ sous-domaines marginaux Âŧ.

Un exemple de domaine marginal est ÂŦ l’utilisation de logiciels obscurs Âŧ. Dans un tel cas, les donnÃĐes sources minimales disponibles auront luttÃĐ pour attirer l’attention pendant la formation, et le statut ÂŦ atypique Âŧ des donnÃĐes peut soit les avoir signalÃĐes pour attention, soit les avoir enterrÃĐes comme ÂŦ marginales Âŧ ou ÂŦ sans importance Âŧ – et mÊme un seul message de forum supplÃĐmentaire publiÃĐ aprÃĻs la date de fin de connaissance de l’IA pourrait reprÃĐsenter une augmentation substantielle des donnÃĐes totales disponibles et de la qualitÃĐ de la rÃĐponse pour un ÂŦ petit Âŧ sujet, rendant un appel RAG utile.

Cependant, l’avantage de RAG tend à diminuer à mesure que le modÃĻle de base devient plus puissant. Alors que les petits modÃĻles bÃĐnÃĐficient considÃĐrablement de la rÃĐcupÃĐration, les grands systÃĻmes tels que Qwen3-4B ou GPT-4o-mini/-4o montrent souvent une amÃĐlioration marginale ou mÊme nÃĐgative de RAG*.

Sur de nombreux benchmarks, la rÃĐcupÃĐration introduit plus de distraction que de bÃĐnÃĐfice, suggÃĐrant un compromis entre investir dans un modÃĻle plus grand avec une couverture interne plus importante ou un modÃĻle plus petit associÃĐ Ã  une rÃĐcupÃĐration.

Par consÃĐquent, RAG semble le plus utile pour compenser les lacunes des modÃĻles de taille moyenne, qui ont toujours besoin de faits externes, mais peuvent les ÃĐvaluer avec des hypothÃĻses internes moins complexes.

Utiliser uniquement en cas d’urgence

Les politiques directrices de ChatGPT concernant la dÃĐcision d’utiliser RAG ne sont pas explicitement exposÃĐes par son prompt systÃĻme**, mais sont implicitement abordÃĐes (vers la fin):

‘Utilisez l’outil web pour accÃĐder à des informations à jour sur le web ou lorsque la rÃĐponse à l’utilisateur nÃĐcessite des informations sur son emplacement. Des exemples d’utilisation de l’outil web incluent:

Informations locales: Utilisez l’outil web pour rÃĐpondre à des questions qui nÃĐcessitent des informations sur l’emplacement de l’utilisateur, telles que la mÃĐtÃĐo, les entreprises locales ou les ÃĐvÃĐnements.

FraÃŪcheur: Si des informations à jour sur un sujet pourraient potentiellement changer ou amÃĐliorer la rÃĐponse, appelez l’outil web à tout moment oÃđ vous auriez autrement refusÃĐ de rÃĐpondre à une question parce que vos connaissances pourraient Être obsolÃĻtes.

Informations de niche: Si la rÃĐponse bÃĐnÃĐficierait de dÃĐtails non largement connus ou compris (qui pourraient Être trouvÃĐs sur Internet), tels que des dÃĐtails sur un petit quartier, une entreprise moins connue ou des rÃĐglementations arcaines, utilisez des sources web directement plutÃīt que de vous fier à la connaissance distillÃĐe de la formation prÃĐalable.

PrÃĐcision: Si le coÃŧt d’une petite erreur ou d’informations obsolÃĻtes est ÃĐlevÃĐ (par exemple, en utilisant une version obsolÃĻte d’une bibliothÃĻque de logiciels ou en ne connaissant pas la date du prochain match pour une ÃĐquipe sportive), utilisez alors l’outil web.’

En particulier, nous pouvons remarquer ces directions qui promeuvent RAG dans les cas oÃđ les donnÃĐes formÃĐes de maniÃĻre native sont rares. Mais comment le systÃĻme arrive-t-il à cette comprÃĐhension? L’utilisateur occasionnel et observateur de ChatGPT pourrait conclure que lors de ces occasions oÃđ le widget ÂŦ recherche sur le web Âŧ s’affiche aprÃĻs une pause, les hypothÃĻses internes du modÃĻle ont simplement ÃĐtÃĐ interrogÃĐes pour la requÊte et sont revenues vides.

Nous pouvons ÃĐgalement remarquer que, par implication, RAG est recommandÃĐ uniquement pour un nombre trÃĻs limitÃĐ de cas d’utilisation. Cela laisse GPT recommandÃĐ pour interroger ses propres poids, dans tous les cas sauf une ÂŦ urgence critique Âŧ (‘PrÃĐcision’, en bas de la citation ci-dessus), pour la grande majoritÃĐ des requÊtes de domaine basÃĐes sur des faits oÃđ la tendance native de l’IA à halluciner pourrait Être une notable responsabilitÃĐ.

Conclusion

Les tendances de la recherche actuelle et rÃĐcente indiquent que la gÃĐnÃĐration heuristique est rapide et bon marchÃĐ, mais incorrecte trop souvent; tandis que RAG est plus lent, plus coÃŧteux, mais beaucoup plus souvent correct – d’autant plus que la taille du modÃĻle diminue.

Sur la base de mon utilisation de ChatGPT, je soutiendrais que OpenAI utilise RAG de maniÃĻre beaucoup trop parcimonieuse, comme un outil de prÃĐcision plutÃīt que comme un conducteur quotidien, en particulier depuis que les problÃĻmes avec les fenÊtres de contexte grandissantes rendent les LLM plus susceptibles de halluciner à mesure que les conversations longues se dÃĐveloppent.

Cette circonstance pourrait Être notablement attÃĐnuÃĐe en vÃĐrifiant les rÃĐponses heuristiques contre des sources d’autoritÃĐ basÃĐes sur le web, sans attendre que l’utilisateur final doute de la sortie ou soit pris en dÃĐfaut par celle-ci, et sans que les rÃĐsultats internes doivent Être si manifestement insatisfaisants que la dÃĐcision d’utiliser RAG est inÃĐvitable.

PlutÃīt, le systÃĻme pourrait Être formÃĐ pour douter de lui-mÊme de maniÃĻre sÃĐlective selon les cas, et donc pour interagir avec le web via un processus de filtrage qui serait, en soi, heuristique. Je ne suis pas au courant que les architectures des modÃĻles actuels laissent de l’espace pour une approche de ce type, qui devrait plutÃīt Être ajoutÃĐe à la friction des filtres API.

Comme les choses se prÃĐsentent, je ne peux mÊme pas prouver qu’il y a un problÃĻme; pas mÊme avec une confession†:

ChatGPT confesse

 

* Veuillez vous rÃĐfÃĐrer au lien en haut de ce paragraphe.

** Ceci est un ÂŦ prompt systÃĻme auto-exposÃĐ Âŧ GPT-5 qui, à nouveau, peut simplement Être un rÃĐsumÃĐ de publications de forum de prompt retraitÃĐes pour GPT-5, bien que certains maintiennent que le prompt est authentique.

† Je ne suggÃĻre vraiment pas que la ÂŦ franchise coupable Âŧ de ChatGPT soit significative ici; ma tendance à me rebeller contre sa ligne de parti dans les questions de politique OpenAI signifie qu’il finira par ÂŦ Être d’accord Âŧ avec moi, et rÃĐpÃĐtera mes propres opinions implicites de toute façon. Cela est loin d’Être ÃĐquivalent à rÃĐvÃĐler les dÃĐtails du dÃĐbarquement de Normandie sous pression.

PubliÃĐ pour la premiÃĻre fois le mercredi 10 dÃĐcembre 2025

Écrivain sur l'apprentissage automatique, spÃĐcialiste du domaine de la synthÃĻse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : [email protected]