Líderes de opinión
La memoria de su empresa debería superar a sus modelos de IA

A menudo la gente pregunta qué modelo impulsa a mi empresa. La respuesta importa: define la calidad, el costo y los límites, y estoy dispuesto a dedicarle una hora. También quiero saber una segunda cosa: qué tendrá la organización cuando ese modelo cambie.
Póngalo como una fecha. Si su proveedor duplica su precio un martes, o retira el punto final que usted utilizó, ¿qué seguiría poseyendo el miércoles por la mañana?
Para muchas empresas, la respuesta honesta es: una clave API, una factura y un historial de conversación muy extenso alojado en los servidores de otro bajo su propio calendario de retención.
Mi formación es química. Pasé años construyendo modelos de caja gris para plantas químicas, integrados con SCADA, resultados de laboratorio y las notas del propio operador. Ese trabajo enseña rápidamente una regla: un número sin sus condiciones no es un resultado. Si alguien cambió un sensor la semana pasada y nadie lo anotó, la lectura en la pantalla no explica nada.
Ese es un problema de cuaderno de laboratorio. Ahora se presenta como un problema de adquisición, y rara vez aparece en la hoja donde se decide el presupuesto de IA.
Tres preguntas que se responden de una sola vez
Una ventana de contexto más grande permite que un modelo utilice más información dentro de una sola solicitud. El almacenamiento duradero determina qué persiste entre solicitudes. La portabilidad determina si esa información sigue siendo utilizable cuando el proveedor cambia. Estas son preguntas arquitectónicas separadas, y la ventana de un millón de tokens alentó a todos a tratarlas como una sola.
La propia documentación de Google ofrece la analogía directamente: “Una analogía para la ventana de contexto es la memoria a corto plazo.” Tómelo literalmente. La memoria a corto plazo es lo que se pierde.
Así, cada proveedor que vende una ventana enorme también vende algo separado para mantener el estado. Lea esas capas de forma precisa, con sus propias palabras, y observe lo que realmente cubre cada una.
OpenAI almacena objetos Response por defecto durante 30 días; Los objetos de conversación y sus elementos están exentos de ese TTL. La eliminación de 30 días de Amazon se aplica a la API de gestión de sesiones Bedrock, y cubre solo esa API. La herramienta de memoria del lado del cliente de Anthropic ilustra un límite útil: el modelo solicita operaciones de memoria, la aplicación controla el almacenamiento, mientras que la misma empresa también ofrece almacenes de memoria gestionados para sus agentes alojados.
Todas estas son decisiones de ingeniería ordinarias, publicadas abiertamente. También implican que las reglas de retención para el contexto de trabajo de su empresa viven en las notas de la versión de otro, y debería poder identificar qué regla se aplica a cada uno de sus datos.
Dónde reside realmente el costo de cambio
Cambiar una llamada de generación de texto por otra es cuestión de un fin de semana. Por eso decir “somos multmodelo” es algo tan barato. Las capas costosas son las que nadie demuestra.
Incrustaciones. Cambiar el incrustación modelo suele requerir volver a incrustar el corpus y migrar o reconstruir el índice. Un cambio de generación modelo no implica tal requisito, y los dos se confunden constantemente — usualmente por quien promete que la migración será rápida. La literatura de 2025 describe la ruta estándar como “re-codificar todo el corpus y reconstruir el índice de Vecino Más Cercano Aproximado (ANN), lo que conduce a una interrupción operativa significativa y a un costo computacional”; la propia contribución de ese artículo, Drift-Adapter, es un método para posponer la reconstrucción aprendiendo una transformación entre espacios de incrustación. De cualquier manera, el costo de la migración cubre la validación de recuperación y el trabajo operativo, así como las propias llamadas de incrustación.
Comportamiento afinado. Una frase del aviso de desactivación de septiembre de 2025 pertenece a la parte superior de cualquier mesa de adquisición: “Los modelos afinados previamente ya no estarán accesibles.” Un comportamiento por el que pagó para crear, retirado junto con el punto final que lo alojaba. Todos siguieron el proceso publicado. Su modelo aún desapareció.
Comportamiento de indicaciones y herramientas. Las mismas instrucciones generan una aplicación diferente en un modelo distinto. En una aplicación empresarial, los investigadores informaron que la tasa de paso de regresión caía del 100 % en el modelo original al 97,3 % en uno más nuevo con indicaciones idénticas, recuperado solo después de un rediseño deliberado de las indicaciones. Los escenarios de prueba aparecen en producción con sus propias frecuencias, por lo que esa cifra no permite estimar con qué frecuencia fallan los flujos de trabajo en vivo. La regla operativa que respalda es más simple: valide cada actualización de modelo a nivel de aplicación, usted mismo, antes de que llegue a un cliente.
Todo esto llega a la factura eventualmente, mucho después de que se compararan las páginas de precios.
Alguien más está reteniendo su calendario
La desactivación se lleva a cabo según un calendario publicado, y esos calendarios no son los tuyos. OpenAI dió un aviso de un año antes de cerrar la API de Assistants en agosto de 2026, lo cual es generoso según los estándares de la misma página, donde la vista previa de GPT‑4.5 obtuvo alrededor de tres meses. La política de Mistral es de seis meses para modelos GA y de un mes para versiones preliminares y de terceros, con una advertencia de que un alias rotativo “puede exponerte a actualizaciones silenciosas en el comportamiento del modelo y en los precios”.
AWS dice la parte silenciosa en voz alta en su política de ciclo de vida: “Migra a un modelo Activo antes de la fecha de fin de vida; la migración no se realizará automáticamente.”
Tu hoja de ruta tiene un coautor. Nunca asiste a tus reuniones de planificación y no le importa en qué trimestre estés.
El precio también es una parte variable
En las tarifas estándar listadas de Gemini 3.7 Flash, cinco mil millones de tokens de entrada sin caché y mil millones de tokens de salida facturados cuestan 7 500 $ al mes. Las tarifas actualmente programadas para el 1 de enero de 2027 elevarían esa factura de tokens a 15 000 $, antes de otros cargos o descuentos, mientras que tu producto hace exactamente lo que hacía antes.
Una lista de precios congelada también puede generar una factura mayor. La documentación de precios de Anthropic indica que el tokenizador usado por sus generaciones más recientes de modelos “produce aproximadamente un 30 % más de tokens para el mismo texto”, dependiendo del contenido y específico de esas generaciones, lo que hace que el efecto en cualquier factura sea algo que debes medir. Así que mide los tokens por los que se te factura. Una tarjeta de tarifas por sí sola no te lo dirá.
Para un producto que ejecuta flujos de trabajo, la medida económica útil es el costo de una tarea completada con éxito, incluidas reintentos y revisiones humanas. Ese número varía cuando un modelo cambia, incluso si la tarjeta de tarifas no lo hace.
Y nada de eso es negociable desde una posición en la que abandonar lleva un año. Capgemini encuestó a 1 300 ejecutivos de organizaciones multimillonarias en la primavera de 2026 sobre proveedores críticos de tecnología en general: el 36 % dijo que cambiar de uno tomaría más de doce meses, y uno de cada diez no tenía ninguna alternativa viable. Esa es una descripción de una relación con un proveedor sin segunda fuente.
Llévalo a Compras
Dirijo una empresa francesa, registrada en Marsella, alojada en Europa, y seguiré omitiendo el discurso sobre soberanía en abstracto. La independencia de cada proveedor tecnológico está fuera del alcance de una empresa normal. El mismo estudio de Capgemini encontró que el 59 % de los ejecutivos consideran irrealista la soberanía digital total, y estoy de acuerdo con ellos.
Entender y controlar tus dependencias críticas es una tarea menor y posible. Tres preguntas, todas respondibles en una reunión: ¿dónde se almacenan y procesan nuestros datos?, ¿quién puede acceder a ellos? y ¿qué se necesitaría para seguir operando con otro proveedor?
Todas las empresas saben cómo preguntar eso respecto a la logística, los pagos y el almacenamiento en la nube. Cuando se pregunta sobre el contexto de trabajo, la dependencia europea aparece en la reunión como una discusión de segunda fuente con un número adjunto, lo cual es una forma en que compras puede actuar.
Una advertencia sobre las cifras que la gente cita aquí. Que una empresa utilice varios modelos nos dice poco sobre si puede trasladar su contexto de trabajo entre proveedores. Eso requiere una prueba separada: ¿pueden los registros, los permisos y el trabajo incompleto trasladarse y seguir utilizándose?
Qué es lo que realmente hace intercambiable un modelo
Una interfaz compartida entre modelos es útil, y yo construiría una. Debe hacer visibles las capacidades y dependencias específicas de cada modelo. La portabilidad no requiere pretender que todos los modelos se comporten de la misma forma, y una abstracción que aplana las diferencias elimina silenciosamente la razón por la que pagaste por un buen modelo.
El trabajo más pesado es poseer el estado que ningún proveedor debería ser el único custodio. Cuatro cosas, en el orden en que fallan.
Un registro autoritativo bajo tu control. Mensajes, fuentes recuperadas, aprobaciones, puntos de control de ejecución. Registra lo que se completó en sistemas externos y lo que puede volver a intentarse de forma segura: el correo electrónico puede haberse enviado mientras la confirmación no se guardó, y un procedimiento de recuperación que no lo sepa lo enviará dos veces. Cualquier estado del proveedor que no puedas reconstruir es una dependencia. Anótalo como tal, explícitamente, antes de que un incidente lo documente por ti.
La fuente junto a cada vector. Un vector es un artefacto compilado; el fragmento es el código fuente. Almacena el documento fuente y su versión, ID del documento, límites del fragmento, versión del fragmentador, modelo de incrustación con su versión y dimensiones, versión del índice y qué procesamiento generó el texto. Un fragmento de texto almacenado por sí solo no reconstruirá una tabla, una imagen o un resultado de OCR. Mantener todo eso convierte una reindexación en una migración planificada, lo cual brinda tanto consuelo como yo prometo.
Registros que distinguen la fuente, la inferencia y la decisión. La memoria debe separar lo que dijo una fuente, lo que inferió un modelo y lo que aprobó una persona. Un cliente que promete pagar el jueves, la conjetura de un modelo de que el pago se retrasará, y una extensión acordada hasta el viernes son tres registros diferentes con tres estados diferentes, y el sistema debe saber cuál de ellos puede actuar. Cada uno necesita su origen, alcance, reglas de acceso y estado actual, incluido si ha sido corregido o reemplazado. Una transcripción puede contener la evidencia; reproducirla no identifica de manera fiable qué conclusiones siguen vigentes y qué decisiones aún se mantienen.
Portabilidad que realmente has probado. Hazlo verificable de dos maneras: un ejercicio de exportación y restauración, y un conjunto de evaluación que defina lo que la aplicación debe lograr. Entonces “podríamos cambiar” se convierte en una medida que alguien puede ejecutar: ¿puede el reemplazo mantener flujos de trabajo representativos dentro de tus requisitos de calidad, permisos, latencia y costo? Y conserva los datos de entrenamiento que tienes derecho a reutilizar, junto con sus versiones, configuración de ajuste y pruebas de aceptación. Eso permite el reentrenamiento, sin garantía de un comportamiento idéntico, y la ID del modelo afinado expira en una fecha establecida por alguien que nunca has conocido.
Luego utiliza sesiones alojadas, cachés de prompts y recuperación del proveedor donde sea útil. A menudo son excelentes, y rechazarlos por principio es una forma costosa de hacerlo. El requisito es que los registros que poseen puedan recuperarse y usarse en otro lugar con sus reglas de acceso y retención intactas. Alquila la computación; mantén el control del registro.
Yo tampoco exageraría la arquitectura. Antes del ajuste producto‑mercado, lanzar seis semanas antes a menudo supera cualquier capa de abstracción, y una startup que construye tres back‑ends de recuperación antes de tener clientes ha construido un museo. Si ese intercambio es correcto depende del producto y del costo de la reconstrucción eventual. Mantén la materia prima recuperable y un atajo sigue siendo un atajo.
La parte que cambió
Mientras la IA solo respondía preguntas, perder el contexto era una molestia. Volvías a escribir el prompt y seguías adelante. Ahora agenda la reunión, crea el ticket y accede al CRM, y la falta de contexto genera trabajo duplicado o a medio terminar en sistemas que pertenecen a tus clientes.
Los proveedores de modelos construyen cosas extraordinarias y las utilizo a diario. La responsabilidad que describo recae en quienes construimos las plataformas intermedias: hacer visibles las dependencias y preservar un registro fiable de lo que se autorizó y lo que se completó.
Cada flujo de trabajo completado debe dejar a la organización con algo que pueda reutilizarse — un resultado verificado, una decisión con historial rastreable, un punto de partida más claro para la siguiente tarea. Ese valor acumulado debería superar la vida útil del modelo que ayudó a crearlo.
Pregunta qué seguirías poseyendo el miércoles por la mañana.












