Angle dâAnderson
Heuristiques contre RAG : l’inflation rÃĐduite comme moteur de politique

La plupart du temps, la recherche sur le web amÃĐliore lâexactitude factuelle des rÃĐponses de ChatGPT à nos questions. Alors, dans un climat oÃđ lâIA lutte pour son acceptation publique, pourquoi recourt-elle à des ÂŦ hypothÃĻses Âŧ?
Â
Opinion Il est erronÃĐ de penser que les LLM tels que ChatGPT sâadonnent jamais à la dÃĐnonciation des pratiques potentiellement douteuses de leurs hÃītes, mÊme si une session coÃŧteuse et gaspillÃĐe a suffisamment ÃĐnervÃĐ pour vraiment se lancer dans les dÃĐtails des lacunes du systÃĻme:

Ici, une discussion sur la prÃĐfÃĐrence de ChatGPT pour sa logique interne (par rapport à la recherche et à la vÃĐrification basÃĐes sur le web via RAG â qui produit moins dâhallucinations, mais coÃŧte plus) induit un moment apparent de franchise; mais prenez-le avec un grain de sel. Source
La plupart du temps â en particulier pour les modÃĻles avec des dates de fin de connaissance plus rÃĐcentes â lâIA se contente de jouer sur les publications Reddit et les forums vus pendant la formation. MÊme sâil y avait une vÃĐritable valeur à ces ÂŦ informations internes Âŧ, il est impossible de le prouver.
Cependant, parfois ces ÃĐchanges houleux conduisent à la dÃĐcouverte de ÂŦ hacks Âŧ (ou au moins de ÂŦ trucs Âŧ) qui promettent dâÃĐviter certaines des pires habitudes rÃĐpÃĐtitives dâun LLM â comme lorsque, la semaine derniÃĻre, ChatGPT mâa suggÃĐrÃĐ que je pouvais le faire travailler plus dur et halluciner moins en incluant lâadjuration âpas dâhypothÃĻsesâ:

Jâai utilisÃĐ âpas dâhypothÃĻsesâ beaucoup depuis, et pas une seule fois le modÃĻle nâa recours à ses connaissances formÃĐes aprÃĻs que jâaie fermÃĐ une requÊte avec cette commande. Au lieu de cela, GPT utilise immÃĐdiatement la GÃĐnÃĐration AugmentÃĐe de RÃĐcupÃĐration (RAG), en recherchant sur Internet des documents ÃĐclairants ou corroborants.
En pratique, pour la plupart des demandes, cela diffÃĻre peu de dire au systÃĻme de ÂŦ rechercher sur le web Âŧ chaque fois que vous soumettez une requÊte. Là oÃđ la phrase ÂŦ pas dâhypothÃĻses Âŧ peut vraiment aider est lorsque vous essayez dâobtenir que ChatGPT lise rÃĐellement un nouveau PDF tÃĐlÃĐchargÃĐ au lieu dâutiliser les mÃĐtadonnÃĐes des PDF prÃĐcÃĐdents dans cette session (ou de nombreuses autres sources possibles) pour produire une rÃĐponse ÂŦ plausible Âŧ mais entiÃĻrement hallucinÃĐe, nâayant pas lu ou mÊme parcouru le document que vous venez de prÃĐsenter.

Cela ÃĐtant dit, plus la session de conversation a durÃĐ, moins probable que cela fonctionnera â et il serait une erreur de penser que tout ÂŦ truc Âŧ est fiable ou restera disponible au fur et à mesure que le systÃĻme ÃĐvolue.
Le commerce RAG
Dans le contexte dâune culture grandissante de rÃĐduction de lâinflation, et du fait que de grands systÃĻmes tels que lâinfrastructure GPT dâOpenAI sont ÃĐnormÃĐment affectÃĐs par mÊme les plus petits changements gÃĐnÃĐralisÃĐs dans le comportement, il est ÃĐgalement facile de croire que lâon reçoit moins que ce que lâon paie pour les choix faits par les LLM populaires tels que ChatGPT.
Des choix tels que celui de savoir sâil doit faire appel au web avec RAG; lancer un processus de chaÃŪne de pensÃĐe (CoT) qui pourrait obtenir un meilleur rÃĐsultat, mais qui coÃŧtera plus à infÃĐrer et pourrait fatiguer lâutilisateur impatient; ou recourir à ses propres embeddings formÃĐs et à ses connaissances locales â qui est la solution la moins chÃĻre et la plus rapide possible.
Il existe plusieurs raisons pratiques pour lesquelles un LLM avec un profil public sensible, tel que ChatGPT, peut prÃĐfÃĐrer limiter ses appels RAG, favorisant ainsi ses propres hypothÃĻses. Tout dâabord, dâun point de vue PR, lâutilisation frÃĐquente et non sollicitÃĐe du web soutient une caractÃĐrisation populaire des LLM comme de simples Googlers par procuration, diminuant la valeur de leurs connaissances innÃĐes et coÃŧteuses â et lâattrait dâun abonnement payant.
DeuxiÃĻmement, lâinfrastructure RAG coÃŧte de lâargent pour fonctionner, maintenir et mettre à jour, par rapport au coÃŧt relativement nÃĐgligeable de lâinfÃĐrence locale, câest-à -dire la gÃĐnÃĐration paramÃĐtrique, qui est bon marchÃĐ et rapide.
TroisiÃĻmement, le systÃĻme peut ne pas avoir une mÃĐthode efficace pour dÃĐterminer si RAG pourrait amÃĐliorer ses propres rÃĐsultats heuristiques â et il ne peut souvent pas dÃĐterminer cela sans exÃĐcuter dâabord les hypothÃĻses. Cela laisse lâutilisateur final avec la tÃĒche dâÃĐvaluer un rÃĐsultat heuristique erronÃĐ et de demander un appel RAG dans le cas oÃđ le rÃĐsultat des hypothÃĻses semblait insuffisant.
Du point de vue de ÂŦ lâinflation rÃĐduite de lâIA Âŧ, le nombre de fois oÃđ ChatGPT se trompe par hypothÃĻses et rÃĐussit par RAG peut indiquer, comme cela mâa rÃĐcemment ÃĐtÃĐ montrÃĐ, que le systÃĻme est optimisÃĐ pour le coÃŧt plutÃīt que pour les rÃĐsultats.
RAG devient nÃĐcessaire avec le temps
MalgrÃĐ la ÂŦ confession Âŧ rÃĐcente de ChatGPT à mon ÃĐgard, selon laquelle câest effectivement le cas, ÂŦ lâinflation rÃĐduite Âŧ a un contexte plus large à cet ÃĐgard. Bien que RAG ne soit pas bon marchÃĐ, soit en termes de friction dâexpÃĐrience (via la latence) ou de coÃŧt de fonctionnement, il est beaucoup moins cher que de rÃĐaffiner ou mÊme de rÃĐentraÃŪner le modÃĻle de base.
Pour un modÃĻle dâIA plus ancien avec une date de fin de connaissance plus ÃĐloignÃĐe, RAG peut maintenir la monnaie du systÃĻme, au coÃŧt dâappels rÃĐseau et dâautres ressources; pour un modÃĻle plus rÃĐcent, les rÃĐcupÃĐrations de RAG sont plus susceptibles dâÊtre redondantes ou mÊme nuisibles à la qualitÃĐ des rÃĐsultats, qui dans certains cas auraient ÃĐtÃĐ meilleurs grÃĒce aux hypothÃĻses.
Par consÃĐquent, lâIA semble avoir besoin non seulement de la capacitÃĐ de juger sâil doit recourir à RAG, mais de continuellement ÃĐvoluer sa politique dâutilisation de RAG à mesure que ses poids internes deviennent de plus en plus obsolÃĻtes.
En mÊme temps, le systÃĻme a besoin de dÃĐlimiter les ÂŦ constantes relatives Âŧ dans les connaissances, telles que les orbites lunaires et la littÃĐrature classique, la culture et lâhistoire; ainsi que la gÃĐographie de base, la physique et dâautres principes scientifiques qui sont peu susceptibles dâÃĐvoluer beaucoup avec le temps (câest-à -dire que le risque de ÂŦ changement soudain Âŧ nâest pas nul, mais faible).
Sujets atypiques
Actuellement, du moins en ce qui concerne ChatGPT, les appels RAG (câest-à -dire lâutilisation de la recherche sur le web pour toute requÊte utilisateur qui nâexige pas explicitement ou implicitement la recherche sur le web) semblent rarement choisis de maniÃĻre autonome par le systÃĻme, mÊme lorsquâil sâagit de ÂŦ sous-domaines marginaux Âŧ.
Un exemple de domaine marginal est ÂŦ lâutilisation de logiciels obscurs Âŧ. Dans un tel cas, les donnÃĐes sources minimales disponibles auront luttÃĐ pour attirer lâattention pendant la formation, et le statut ÂŦ atypique Âŧ des donnÃĐes peut soit les avoir signalÃĐes pour attention, soit les avoir enterrÃĐes comme ÂŦ marginales Âŧ ou ÂŦ sans importance Âŧ â et mÊme un seul message de forum supplÃĐmentaire publiÃĐ aprÃĻs la date de fin de connaissance de lâIA pourrait reprÃĐsenter une augmentation substantielle des donnÃĐes totales disponibles et de la qualitÃĐ de la rÃĐponse pour un ÂŦ petit Âŧ sujet, rendant un appel RAG utile.
Cependant, lâavantage de RAG tend à diminuer à mesure que le modÃĻle de base devient plus puissant. Alors que les petits modÃĻles bÃĐnÃĐficient considÃĐrablement de la rÃĐcupÃĐration, les grands systÃĻmes tels que Qwen3-4B ou GPT-4o-mini/-4o montrent souvent une amÃĐlioration marginale ou mÊme nÃĐgative de RAG*.
Sur de nombreux benchmarks, la rÃĐcupÃĐration introduit plus de distraction que de bÃĐnÃĐfice, suggÃĐrant un compromis entre investir dans un modÃĻle plus grand avec une couverture interne plus importante ou un modÃĻle plus petit associÃĐ Ã une rÃĐcupÃĐration.
Par consÃĐquent, RAG semble le plus utile pour compenser les lacunes des modÃĻles de taille moyenne, qui ont toujours besoin de faits externes, mais peuvent les ÃĐvaluer avec des hypothÃĻses internes moins complexes.
Utiliser uniquement en cas dâurgence
Les politiques directrices de ChatGPT concernant la dÃĐcision dâutiliser RAG ne sont pas explicitement exposÃĐes par son prompt systÃĻme**, mais sont implicitement abordÃĐes (vers la fin):
âUtilisez lâoutil web pour accÃĐder à des informations à jour sur le web ou lorsque la rÃĐponse à lâutilisateur nÃĐcessite des informations sur son emplacement. Des exemples dâutilisation de lâoutil web incluent:
Informations locales: Utilisez lâoutil web pour rÃĐpondre à des questions qui nÃĐcessitent des informations sur lâemplacement de lâutilisateur, telles que la mÃĐtÃĐo, les entreprises locales ou les ÃĐvÃĐnements.
FraÃŪcheur: Si des informations à jour sur un sujet pourraient potentiellement changer ou amÃĐliorer la rÃĐponse, appelez lâoutil web à tout moment oÃđ vous auriez autrement refusÃĐ de rÃĐpondre à une question parce que vos connaissances pourraient Être obsolÃĻtes.
Informations de niche: Si la rÃĐponse bÃĐnÃĐficierait de dÃĐtails non largement connus ou compris (qui pourraient Être trouvÃĐs sur Internet), tels que des dÃĐtails sur un petit quartier, une entreprise moins connue ou des rÃĐglementations arcaines, utilisez des sources web directement plutÃīt que de vous fier à la connaissance distillÃĐe de la formation prÃĐalable.
PrÃĐcision: Si le coÃŧt dâune petite erreur ou dâinformations obsolÃĻtes est ÃĐlevÃĐ (par exemple, en utilisant une version obsolÃĻte dâune bibliothÃĻque de logiciels ou en ne connaissant pas la date du prochain match pour une ÃĐquipe sportive), utilisez alors lâoutil web.â
En particulier, nous pouvons remarquer ces directions qui promeuvent RAG dans les cas oÃđ les donnÃĐes formÃĐes de maniÃĻre native sont rares. Mais comment le systÃĻme arrive-t-il à cette comprÃĐhension? Lâutilisateur occasionnel et observateur de ChatGPT pourrait conclure que lors de ces occasions oÃđ le widget ÂŦ recherche sur le web Âŧ sâaffiche aprÃĻs une pause, les hypothÃĻses internes du modÃĻle ont simplement ÃĐtÃĐ interrogÃĐes pour la requÊte et sont revenues vides.
Nous pouvons ÃĐgalement remarquer que, par implication, RAG est recommandÃĐ uniquement pour un nombre trÃĻs limitÃĐ de cas dâutilisation. Cela laisse GPT recommandÃĐ pour interroger ses propres poids, dans tous les cas sauf une ÂŦ urgence critique Âŧ (âPrÃĐcisionâ, en bas de la citation ci-dessus), pour la grande majoritÃĐ des requÊtes de domaine basÃĐes sur des faits oÃđ la tendance native de lâIA à halluciner pourrait Être une notable responsabilitÃĐ.
Conclusion
Les tendances de la recherche actuelle et rÃĐcente indiquent que la gÃĐnÃĐration heuristique est rapide et bon marchÃĐ, mais incorrecte trop souvent; tandis que RAG est plus lent, plus coÃŧteux, mais beaucoup plus souvent correct â dâautant plus que la taille du modÃĻle diminue.
Sur la base de mon utilisation de ChatGPT, je soutiendrais que OpenAI utilise RAG de maniÃĻre beaucoup trop parcimonieuse, comme un outil de prÃĐcision plutÃīt que comme un conducteur quotidien, en particulier depuis que les problÃĻmes avec les fenÊtres de contexte grandissantes rendent les LLM plus susceptibles de halluciner à mesure que les conversations longues se dÃĐveloppent.
Cette circonstance pourrait Être notablement attÃĐnuÃĐe en vÃĐrifiant les rÃĐponses heuristiques contre des sources dâautoritÃĐ basÃĐes sur le web, sans attendre que lâutilisateur final doute de la sortie ou soit pris en dÃĐfaut par celle-ci, et sans que les rÃĐsultats internes doivent Être si manifestement insatisfaisants que la dÃĐcision dâutiliser RAG est inÃĐvitable.
PlutÃīt, le systÃĻme pourrait Être formÃĐ pour douter de lui-mÊme de maniÃĻre sÃĐlective selon les cas, et donc pour interagir avec le web via un processus de filtrage qui serait, en soi, heuristique. Je ne suis pas au courant que les architectures des modÃĻles actuels laissent de lâespace pour une approche de ce type, qui devrait plutÃīt Être ajoutÃĐe à la friction des filtres API.
Comme les choses se prÃĐsentent, je ne peux mÊme pas prouver quâil y a un problÃĻme; pas mÊme avec une confessionâ :

Â
* Veuillez vous rÃĐfÃĐrer au lien en haut de ce paragraphe.
** Ceci est un ÂŦ prompt systÃĻme auto-exposÃĐ Âŧ GPT-5 qui, à nouveau, peut simplement Être un rÃĐsumÃĐ de publications de forum de prompt retraitÃĐes pour GPT-5, bien que certains maintiennent que le prompt est authentique.
â Je ne suggÃĻre vraiment pas que la ÂŦ franchise coupable Âŧ de ChatGPT soit significative ici; ma tendance à me rebeller contre sa ligne de parti dans les questions de politique OpenAI signifie quâil finira par ÂŦ Être dâaccord Âŧ avec moi, et rÃĐpÃĐtera mes propres opinions implicites de toute façon. Cela est loin dâÊtre ÃĐquivalent à rÃĐvÃĐler les dÃĐtails du dÃĐbarquement de Normandie sous pression.
PubliÃĐ pour la premiÃĻre fois le mercredi 10 dÃĐcembre 2025












