Líderes de opinión

Por qué el control de costos de la inteligencia artificial se está convirtiendo en el próximo desafío de escalabilidad empresarial

mm
Añade Unite.AI a tus fuentes preferidas en Google
A high-tech data center landscape featuring glowing blue fiber-optic data streams converging into a complex network, passing through a massive, reinforced industrial gate that represents a

1. El impacto oculto de los costos después de la implementación de la inteligencia artificial

En las primeras pruebas, los sistemas de inteligencia artificial parecen ser económicamente eficientes en la superficie. Los volúmenes de tráfico son bajos, los casos de uso están definidos de manera limitada y los equipos monitorean estrechamente el comportamiento en entornos controlados. Bajo estas condiciones, el costo se evalúa generalmente en el nivel de llamadas individuales de modelos o flujos de trabajo limitados. Esto da la impresión de que la escalabilidad será sencilla. Al menos, eso es lo que la mayoría de los equipos pensaba.

Esta impresión se ve reforzada por el hecho de que el gasto en inteligencia artificial generativa no muestra signos de desaceleración. Un informe reciente estima que el gasto en aplicaciones de inteligencia artificial generativa en empresas alcanzó decenas de miles de millones de dólares en 2025, más del triple que el año anterior.

Pero la realidad cambia una vez que los agentes se exponen a usuarios reales y complejidad operativa.

Los entornos de producción introducen patrones de interacción impredecibles, conversaciones más largas, procesos en segundo plano y caminos de escalación a modelos más capaces. Una sola solicitud puede desencadenar múltiples acciones posteriores que no eran visibles durante las pruebas. Las empresas se enfrentan a un desafío que muchos equipos describen como una “sorpresa de factura”, un aumento repentino en el gasto sin una comprensión clara de qué comportamientos o flujos de trabajo lo generaron.

En esta etapa, el desafío no es solo optimizar los modelos. En su lugar, se trata de obtener visibilidad en la dinámica de ejecución que realmente impulsa el costo de la inteligencia artificial.

2. Por qué las cargas de trabajo de inteligencia artificial rompen los modelos de costos tradicionales de la nube

Anteriormente, la gestión de costos tradicional de la nube evolucionó alrededor de cargas de trabajo relativamente predecibles. El consumo de infraestructura se podía medir en unidades estables como horas de cómputo, almacenamiento o volúmenes de solicitudes, y incluso se podía optimizar a través de estrategias de aprovisionamiento o controles de uso. Lo principal que hay que saber es que los caminos de ejecución eran en gran medida deterministas. Esto hizo posible predecir el gasto con una precisión razonable y atribuir costos a servicios o equipos específicos.

Las cargas de trabajo de inteligencia artificial introducen un modelo económico diferente. El gasto está principalmente vinculado al uso de tokens, el tamaño del contexto, las cadenas de llamadas de modelos y las decisiones de flujo de trabajo dinámicas que varían de una interacción a la siguiente.

La misma solicitud de usuario podría seguir caminos de ejecución completamente diferentes dependiendo de los umbrales de confianza, las respuestas de las herramientas o la lógica de fallback. Es por eso que el costo no es lineal ni fácilmente predecible como lo era antes. Los paneles de FinOps tradicionales proporcionan visibilidad en el consumo de infraestructura. El problema real radica en que a menudo luchan por capturar el comportamiento en tiempo de ejecución. en lugar de la asignación de recursos sola. Las empresas no pueden determinar verdaderamente la economía de los sistemas de inteligencia artificial a través de medios tradicionales.

3. La superficie de costos en expansión de los sistemas agénticos

A medida que las empresas pasan de la inferencia de un solo paso a arquitecturas agénticas, el perfil de costos de los sistemas de inteligencia artificial se vuelve mucho más complejo. Un análisis reciente de la industria incluso predice que más del 40% de los proyectos de inteligencia artificial agéntica serán cancelados antes de llegar a la producción en 2027, impulsado en parte por el costo y la complejidad reales de implementar flujos de trabajo de agentes multietapa a gran escala.

Una solicitud de usuario no se resuelve a través de una sola llamada de modelo. En su lugar, el proceso pasa por flujos de trabajo coordinados que pueden involucrar pasos de planificación. Piense en operaciones de recuperación, ejecuciones de herramientas e interacciones entre múltiples agentes.

Y no mencionemos que los flujos de trabajo mencionados anteriormente agregan capacidades como la generación aumentada de recuperación (RAG) o la colaboración entre múltiples agentes, que introducen operaciones adicionales pagas que se acumulan con el tiempo.

Una interacción puede desencadenar llamadas de incrustación, consultas a bases de datos vectoriales, bucles de razonamiento iterativos y escalaciones a modelos más capaces cuando la confianza disminuye. Si bien cada acción individual puede parecer marginal en aislamiento, su efecto acumulado da forma a la economía general del sistema.

4. Por qué la optimización de la solicitud sola no puede resolver la economía en tiempo de ejecución

La optimización de la solicitud es generalmente uno de los primeros controles que los equipos utilizan al intentar controlar los costos de la inteligencia artificial. Reducir el uso de tokens, refinar las instrucciones o mejorar la estructura de la respuesta puede proporcionar ganancias de eficiencia significativas en el nivel de llamadas individuales de modelos. Las optimizaciones solo abordan una pequeña parte de la imagen económica más amplia. En entornos de producción, la mayoría de la volatilidad del costo está impulsada por patrones de comportamiento en flujos de trabajo más que por la longitud de la solicitud sola.

Las ineficiencias a menudo surgen de reintentos innecesarios, recuperaciones demasiado profundas, escalaciones a modelos de mayor costo o agentes que realizan trabajo que no cambia materialmente los resultados. Sin visibilidad en las trazas de ejecución y el impacto comercial, la afinación de la solicitud puede simplemente desplazar el gasto de una parte del sistema a otra.

Con los sistemas de inteligencia artificial volviéndose más autónomos e interconectados, la gestión del costo requiere controles sistémicos que determinen cómo operan los agentes en tiempo real. No se trata solo de ajustes locales a cómo se formulan las solicitudes individuales.

Un reciente estudio de FinOps de inteligencia artificial que cubrió decenas de miles de millones en gasto en la nube mencionó una transición a la visibilidad del costo de la inteligencia artificial en tiempo real, presupuestos por equipo y alertas de presupuesto automatizadas. La idea es tratar el costo como un SLO operativo en lugar de una métrica puramente financiera.

5. Enfoques arquitectónicos emergentes para el control de costos de la inteligencia artificial

En respuesta a la creciente volatilidad del costo, las empresas están replanteando dónde y cómo se debe aplicar el control económico dentro de los sistemas de inteligencia artificial. En lugar de tratar la optimización del costo como un ejercicio de finanzas posterior, los equipos están introduciendo mecanismos arquitectónicos que influyen en el gasto en tiempo de ejecución.

Un patrón emergente que estamos empezando a ver es el uso de capas de enrutamiento y orquestación que seleccionan dinámicamente modelos o flujos de trabajo en función de la complejidad de la tarea, los objetivos de latencia o las restricciones presupuestarias. Esto permite a las empresas equilibrar la calidad y la eficiencia sin depender de elecciones de configuración estáticas.

Otras rutas que hemos visto que los equipos toman incluyen controles de ejecución basados en políticas, estrategias de reintento conscientes del costo y observabilidad centralizada que atribuye el gasto a flujos de trabajo específicos.

La evaluación también se está utilizando más comúnmente como una herramienta de gobernanza, con equipos que promueven solo aquellas configuraciones que cumplen con umbrales de costo y rendimiento predefinidos.

6. El costo como la próxima puerta de enlace de confiabilidad para la inteligencia artificial empresarial

Con los sistemas de inteligencia artificial integrándose en flujos de trabajo comerciales básicos, las empresas están tratando realmente el costo como una restricción de implementación junto con la calidad, la seguridad y la confiabilidad. Al igual que los objetivos de nivel de servicio definen límites de rendimiento aceptables, los umbrales de economía de unidades están surgiendo como un requisito previo para escalar la automatización de manera segura. Los sistemas que no pueden cumplir con perfiles de costo predecibles son más difíciles de justificar operativamente, independientemente de su capacidad técnica.

Este cambio está llevando a los equipos a introducir “puertas de costo” antes de despliegues más amplios, respaldados por una monitorización continua una vez que los sistemas estén en vivo. Con el tiempo, la gestión del costo probablemente evolucionará hacia una disciplina de ingeniería continua en lugar de un esfuerzo de optimización único. Las empresas que escalen la inteligencia artificial con más éxito serán aquellas que diseñen el control económico desde el principio, asegurándose de que cualquier mejora en la capacidad esté acompañada de modelos operativos sostenibles.

En la próxima fase de adopción de inteligencia artificial empresarial, es posible que veamos que el control económico se convierta en algo tan fundamental para el diseño del sistema como la confiabilidad y la seguridad.

Sohrab Hosseini, Co-Fundador de orq.ai, es un líder tecnológico y emprendedor con sede en el área de Ámsterdam, con una profunda experiencia en SaaS, sistemas a gran escala y AI aplicada. Desde la fundación de orq.ai en 2022, se ha centrado en construir infraestructuras prácticas que ayuden a los equipos a trasladar los grandes modelos de lenguaje de la experimentación al uso de producción confiable. Su experiencia incluye puestos de liderazgo senior como COO y CTO en Neocles, CTO de Tecnología de Futuro en Transdev, donde trabajó en la ruta autónoma y la gestión de flotas, y COO en TradeYourTrip. En paralelo, es activo como asesor y inversor ángel, apoyando a empresas de AI en etapas tempranas con la dirección de productos, el juicio técnico y la estrategia de ejecución.