Ángulo de Anderson
Heurísticas vs. RAG: La inflación de la disminución como impulsor de la política

En la mayoría de los casos, buscar en la web mejora la precisión factual de las respuestas de ChatGPT a nuestras preguntas. Así que en un clima donde la IA está luchando por la aceptación pública, ¿por qué está recurriendo a ‘conjeturas’?
Opinión Es un error creer que los LLM como ChatGPT se involucran en denuncias sobre las prácticas potencialmente poco claras de sus anfitriones, incluso si una sesión costosa y desperdiciada ha aumentado su ira lo suficiente como para realmente meterse en los detalles de los defectos del sistema:

Aquí una discusión sobre la preferencia de ChatGPT por su propia lógica interna (vs investigación y verificación basada en la web a través de RAG – que produce menos alucinaciones, pero cuesta más) induce un momento aparente de candor; pero tómelo con una pizca de sal. Fuente
En su mayoría – especialmente para modelos con fechas de corte de conocimiento más recientes – la IA simplemente está improvisando sobre publicaciones de Reddit y foros vistos durante el entrenamiento. Incluso si hubiera algún valor real en esas ‘insights internos’, es imposible probarlo.
Sin embargo, a veces estos intercambios acalorados llevan al descubrimiento de ‘trucos’ (o al menos, ‘técnicas’) que prometen prevenir algunos de los peores hábitos repetitivos en un LLM – como cuando, la semana pasada, ChatGPT sugirió que podría hacer que trabajara más duro y alucinara menos incluyendo la adjuración ‘no heurísticas’:

He utilizado ‘no heurísticas’ mucho desde entonces, y ni una vez el modelo ha recurrido a su conocimiento entrenado después de cerrar una consulta con este comando. En cambio, GPT inmediatamente utiliza Generación aumentada de recuperación (RAG), buscando en Internet documentos iluminadores o corroborantes.
En la práctica, para la mayoría de las solicitudes, esto es poco diferente a decirle al sistema que ‘busque en la web’ cada vez que se envía una consulta. Donde la frase ‘no heurísticas’ realmente puede ayudar es cuando se intenta hacer que ChatGPT lea realmente un nuevo PDF subido en lugar de utilizar los metadatos de subidas de PDF anteriores en esa sesión (o muchas otras fuentes posibles), para producir una respuesta ‘plausible’ pero completamente alucinada, sin haber leído o incluso escaneado el documento que acaba de presentar.

Eso dicho, cuanto más tiempo ha estado en curso la sesión de chat, menos probable que esto funcione – y sería un error pensar que cualquier ‘truco’ es confiable o permanecerá disponible a medida que el sistema evoluciona.
El comercio RAG
En el contexto de una cultura en crecimiento de inflación de la disminución, y el hecho de que grandes sistemas como la infraestructura GPT de OpenAI se ven enormemente afectados incluso por los pequeños cambios generalizados en el comportamiento, también es fácil creer que uno está recibiendo menos valor de lo que debería de las opciones tomadas por LLM populares como ChatGPT.
Elecciones como si se extenderá a la web con RAG; comenzará un proceso de cadena de pensamiento (CoT) que podría obtener un mejor resultado, pero que costará más inferir y puede cansar al usuario impaciente; o recurrirá a sus propias representaciones entrenadas y conocimiento localmente disponible – que es la solución más barata y rápida posible.
Hay varias razones prácticas por las que un LLM con un perfil público sensible, como ChatGPT, puede preferir limitar sus llamadas RAG, favoreciendo sus propias heurísticas. Primero, desde una perspectiva de PR, el uso frecuente y no solicitado de la web apoya una caracterización popular de los LLM como simples buscadores por proxy, disminuyendo el valor de su conocimiento innato y costosamente entrenado – y el atractivo de una suscripción pagada.
En segundo lugar, la infraestructura RAG cuesta dinero para ejecutar, mantener y actualizar, en comparación con el costo relativamente trivial de la inferencia local, es decir, la generación paramétrica, que es barata y rápida.
En tercer lugar, el sistema puede no tener un método efectivo para determinar si RAG podría mejorar los resultados heurísticos – y a menudo no puede determinar esto sin ejecutar primero las heurísticas. Esto deja al usuario final con la tarea de evaluar un resultado heurístico defectuoso y solicitar una llamada RAG en el caso de que el resultado de las heurísticas parezca no ser suficiente.
Desde la perspectiva de la ‘inflación de la disminución de la IA’, el número de veces que ChatGPT se equivoca a través de heurísticas y tiene éxito a través de RAG puede indicar, como lo hizo recientemente conmigo, que el sistema está optimizando para el costo en lugar de los resultados.
RAG crece necesario con el tiempo
A pesar de la ‘confesión’ reciente de ChatGPT de que esto es de hecho el caso, la ‘inflación de la disminución’ tiene un contexto más amplio en este respecto. Aunque RAG no es barato, ni en términos de fricción de experiencia (a través de la latencia) ni de costo de ejecución, es mucho más barato que el ajuste fino o incluso la re capacitación del modelo base.
Para un modelo de IA más antiguo con una fecha de corte de conocimiento más distante, RAG puede mantener la moneda del sistema, al costo de llamadas de red y otros recursos; para un modelo más nuevo, las propias recuperaciones de RAG son más propensas a ser redundantes o incluso dañinas para la calidad de los resultados, que en algunos casos habrían sido mejores a través de heurísticas.
Por lo tanto, el sistema de IA parece necesitar la capacidad no solo de decidir si debe recurrir a RAG, sino de evolucionar continuamente su política sobre el uso de RAG a medida que sus pesos internos se vuelven más y más desactualizados.
Al mismo tiempo, el sistema necesita rodear ‘constantes relativas’ en el conocimiento, como las órbitas lunares y la literatura clásica, la cultura y la historia; así como la geografía básica, la física y otros principios científicos que no es probable que evolucionen mucho con el tiempo (es decir, el riesgo de ‘cambio repentino’ no es inexistente, pero es bajo).
Temas fuera de lo común
En este momento, al menos en lo que respecta a ChatGPT, las llamadas RAG (es decir, el uso de la investigación en la web para cualquier consulta del usuario que no exija explícita o implícitamente la investigación en la web) parecen rara vez ser elegidas de forma autónoma por el sistema, incluso cuando se trata de ‘subdominios marginales’.
Un ejemplo de un dominio marginal es el ‘uso de software oscuro’. En tal caso, los datos de fuente disponibles mínimos habrían luchado por la atención durante el entrenamiento, y el estado de ‘outlier’ de los datos puede haber sido señalado para la atención o enterrado como ‘marginal’ o ‘inconsecuente’ – y incluso un solo mensaje de foro adicional hecho después de la fecha de corte de conocimiento de la IA podría representar un aumento sustancial en los datos totales disponibles y la calidad de la respuesta para un ‘tema pequeño’, lo que hace que una llamada RAG sea valiosa.
Sin embargo, la ventaja de RAG tiende a disminuir a medida que el modelo base se vuelve más poderoso. Mientras que los modelos más pequeños se benefician significativamente de la recuperación, los sistemas más grandes como Qwen3-4B o GPT-4o-mini/-4o a menudo muestran una mejora marginal o incluso negativa de RAG*.
En muchos benchmarks, la recuperación introduce más distracción que beneficio, lo que sugiere un intercambio entre invertir en un modelo más grande con más cobertura interna o un modelo más pequeño emparejado con recuperación.
Por lo tanto, RAG parece ser más útil para compensar las brechas en modelos de tamaño medio, que todavía necesitan hechos externos, pero pueden evaluarlos con heurísticas internas menos complejas.
Usar solo en caso de emergencia
Las políticas directrices de ChatGPT sobre la decisión de usar RAG no están expuestas abiertamente por su prompt del sistema**, pero se abordan implícitamente (hacia el final):
‘Use la herramienta web para acceder a información actualizada de la web o cuando la respuesta al usuario requiere información sobre su ubicación. Algunos ejemplos de cuándo usar la herramienta web incluyen:
Información local: Use la herramienta web para responder a preguntas que requieren información sobre la ubicación del usuario, como el clima, empresas locales o eventos.
Frescura: Si la información actualizada sobre un tema podría cambiar o mejorar la respuesta, llame a la herramienta web cualquier vez que de otro modo se negaría a responder a una pregunta porque su conocimiento podría estar desactualizado.
Información de nicho: Si la respuesta se beneficiaría de información detallada no ampliamente conocida o entendida (que podría encontrarse en Internet), como detalles sobre un barrio pequeño, una empresa menos conocida o regulaciones arcanas, use fuentes web directamente en lugar de confiar en el conocimiento destilado de la pre capacitación.
Precisión: Si el costo de un pequeño error o información desactualizada es alto (por ejemplo, usar una versión desactualizada de una biblioteca de software o no conocer la fecha del próximo juego de un equipo deportivo), entonces use la herramienta web.’
En particular, podemos notar estas direcciones que promueven RAG en casos donde los datos entrenados nativos son escasos. Pero ¿cómo llega el sistema a esta comprensión? El usuario casual y observador de ChatGPT podría concluir que en aquellas ocasiones en que el widget ‘buscando en la web’ se muestra después de una pausa, las heurísticas internas del modelo acaban de ser encuestadas para la consulta, y salieron vacías.
También podemos notar que, por implicación, RAG se recomienda solo para un número muy limitado de casos de uso. Esto deja a GPT recomendado para sondear sus propios pesos en todos los casos, excepto en una ‘contingencia crítica’ (‘Precisión’, al final de la cita anterior), para la gran mayoría de consultas de dominio basadas en hechos donde la tendencia natural de la IA a alucinar podría ser una nota de responsabilidad notable.
Conclusión
Las tendencias de la investigación actual y reciente indican que la generación heurística es rápida y barata, pero incorrecta con demasiada frecuencia; mientras que RAG es más lenta, más costosa, pero con mucha más frecuencia correcta – cuanto más pequeño sea el modelo.
Basado en mi propio uso de ChatGPT, argumentaría que OpenAI está utilizando RAG con mucha poca frecuencia, como una herramienta de precisión en lugar de un conductor diario, particularmente desde que los problemas con las ventanas de contexto en crecimiento hacen que los LLM sean más propensos a alucinar a medida que se desarrollan las conversaciones largas.
Esta circunstancia podría ser notablemente aliviada verificando las respuestas heurísticas contra fuentes de autoridad basadas en la web, sin esperar a que el usuario final dude de la salida o se tropiece con ella, y sin que los resultados internos necesiten ser tan manifiestamente insatisfactorios que la decisión de usar RAG sea inevitable.
Más bien, el sistema podría ser entrenado para dudar selectiva y inteligentemente de sí mismo según los casos, y por lo tanto para interactuar con la web a través de un proceso de selección que sería, en sí mismo, heurístico. No estoy al tanto de que las arquitecturas de los modelos actuales dejen espacio para un enfoque de este tipo, que en cambio tendría que agregarse a la fricción de los filtros de API.
Como está, no puedo ni siquiera probar que hay un problema; ni siquiera con una confesión†:

* Por favor, consulte el enlace en la parte superior de este párrafo.
** Esto es un ‘prompt del sistema autoexpuesto’ de GPT-5 que, nuevamente, puede ser simplemente un resumen de publicaciones de foros de prompts reentrenados para GPT-5, aunque algunos mantienen que el prompt es genuino.
† Realmente no estoy sugiriendo que la ‘candor culpable’ de ChatGPT sea significativa aquí; mi tendencia a empujar en contra de su línea de partido en materia de política de OpenAI significa que eventualmente ‘estará de acuerdo’ conmigo, y repetirá mis propias opiniones implícitas de cualquier manera. Esto está lejos de ser equivalente a revelar los detalles de los desembarcos de Normandía bajo presión.
Publicado por primera vez el miércoles, 10 de diciembre de 2025












