Modelos y plataformas de IA

Spectro Cloud lanza PaletteAI Inference Launchpad para ayudar a las empresas a controlar los costos de los tokens de inteligencia artificial

mm
Añade Unite.AI a tus fuentes preferidas en Google

Spectro Cloud ha lanzado PaletteAI Inference Launchpad, una plataforma de inferencia gestionada localmente diseñada para ayudar a las empresas a reducir su dependencia de los servicios de modelos externos y a tener más control sobre el creciente costo de las cargas de trabajo de inteligencia artificial.

La empresa afirma que las organizaciones pueden reducir los costos de tokens externos en un 70%, dependiendo de la mezcla de cargas de trabajo, infraestructura y elección de modelos. Spectro Cloud también amplió el soporte de PaletteAI para la infraestructura basada en AMD, lo que da a los clientes una mayor variedad de unidades de procesamiento gráfico (GPUs), tiempos de inferencia y tecnologías de servicio de modelos.

Los anuncios reflejan un cambio más amplio en la inteligencia artificial empresarial. A medida que las empresas van más allá de la experimentación y despliegan la inteligencia artificial en el servicio al cliente, el desarrollo de software, el análisis y las operaciones internas, el costo de procesar las entradas y salidas de los modelos se está convirtiendo en una preocupación importante de infraestructura.

Llevando la inferencia de inteligencia artificial más cerca de los datos empresariales

PaletteAI Inference Launchpad se basa en un enfoque de inferencia de “primero local”. En lugar de enviar automáticamente cada solicitud a un modelo de frontera alojado externamente, las organizaciones pueden ejecutar cargas de trabajo adecuadas en infraestructura ubicada en sus propios centros de datos, nubes privadas, entornos soberanos o ubicaciones de borde.

Las empresas aún pueden conservar el acceso a los modelos de frontera alojados externamente para tareas que requieren sus capacidades. La plataforma está diseñada para enrutar solicitudes entre modelos locales y externos en función de factores como el costo, el rendimiento, los requisitos de gobernanza y la complejidad de la tarea.

Este modelo híbrido podría volverse cada vez más importante a medida que las organizaciones adopten modelos más pequeños y especializados. Una solicitud de soporte al cliente, una tarea de clasificación de documentos o una consulta de conocimiento interno pueden no requerir la misma capacidad de modelo que la razonamiento avanzado, la codificación compleja o el análisis multimodal.

Mantener las cargas de trabajo adecuadas en local también puede reducir la latencia al acercar la inferencia a las aplicaciones, los usuarios y las fuentes de datos. Para las organizaciones que operan en industrias reguladas, el procesamiento local puede proporcionar un mayor control sobre dónde se maneja la información sensible.

El uso de tokens se convierte en una métrica de infraestructura

Los tokens son las unidades en las que los modelos de inteligencia artificial dividen y procesan el texto, el código y otra información. Cada prompt y respuesta generada consume tokens, y muchos servicios de modelos comerciales cobran según la cantidad de tokens procesados.

Esto significa que los costos de inteligencia artificial pueden aumentar rápidamente a medida que los sistemas pasan de pruebas controladas a aplicaciones que sirven a miles de empleados o clientes. El problema se vuelve aún más complicado con los agentes de inteligencia artificial, que pueden hacer llamadas de modelo repetidas, recuperar información, evaluar resultados y utilizar herramientas externas antes de completar una sola tarea.

Goldman Sachs Investigación espera que el consumo mensual de tokens de inteligencia artificial aumente 24 veces entre 2026 y 2030, alcanzando aproximadamente 120 billones de tokens por mes. Este crecimiento proyectado está impulsado por la adopción empresarial en expansión y la aparición de agentes de inteligencia artificial más autónomos.

Inference Launchpad aborda este problema al proporcionar a los equipos de infraestructura herramientas para medir el consumo de tokens, establecer cuotas y aplicar políticas de uso. Estos controles podrían ayudar a las empresas a comprender qué equipos, aplicaciones y modelos son responsables de sus gastos en inteligencia artificial en lugar de tratar la inferencia como un cargo de servicio externo impredecible.

La reducción del 70% citada por Spectro Cloud debe considerarse como un resultado potencial en lugar de un ahorro garantizado. La economía real dependerá de los costos de adquisición o alquiler de GPUs, las tasas de utilización, el consumo de energía, la eficiencia del modelo, el volumen de solicitudes y el precio de los proveedores externos.

Modelos locales sin eliminar los modelos de frontera

Las capacidades de enrutamiento de modelos de la plataforma están diseñadas para evitar que las empresas se vean obligadas a tomar una decisión de todo o nada entre los modelos locales y los de frontera.

Las organizaciones pueden utilizar modelos locales más pequeños para tareas predecibles o sensibles a la privacidad, mientras que envían solicitudes más exigentes a los modelos de frontera. Las políticas también pueden determinar qué modelos están permitidos para departamentos, jurisdicciones o clasificaciones de datos específicos.

Esto introduce la gobernanza directamente en la capa de inferencia. Por ejemplo, una institución financiera podría evitar que cierta información salga de un entorno controlado, mientras que permite que las solicitudes no sensibles utilicen un modelo externo. Una empresa multinacional podría aplicar reglas de enrutamiento diferentes en función de los requisitos de datos regionales.

Spectro Cloud ha posicionado la elección de modelo y la gobernanza como parte de la estrategia de gestión de infraestructura más amplia de PaletteAI. La plataforma admite entornos de GPU compartidos, acceso basado en roles, cuotas de recursos y controles a nivel de inquilino destinados a permitir que varios equipos utilicen la misma infraestructura sin tener acceso ilimitado a los sistemas subyacentes.

Ampliación del soporte para la infraestructura de inteligencia artificial de AMD

Junto con Inference Launchpad, Spectro Cloud anunció un soporte más amplio para entornos de inteligencia artificial basados en AMD.

La integración cubre las GPUs de AMD, el operador de GPU de AMD, la pila de software ROCm y los microservicios de inferencia de AMD, comúnmente conocidos como AIMs. Estos componentes abordan diferentes capas de la infraestructura necesaria para operar modelos de inteligencia artificial en producción.

El operador de GPU de AMD simplifica la configuración y la administración de los aceleradores de AMD Instinct dentro de los clústeres de Kubernetes. ROCm proporciona la pila de software subyacente de código abierto, que incluye controladores, bibliotecas, tiempos de ejecución y herramientas de desarrollo utilizadas para ejecutar cargas de trabajo de inteligencia artificial y computación de alto rendimiento en hardware de AMD.

AIMs proporcionan microservicios de inferencia estandarizados para servir modelos en GPUs de AMD Instinct. Están diseñados para empaquetar modelos optimizados y software de soporte en servicios implementables, reduciendo parte del trabajo de integración normalmente necesario para mover un modelo a producción.

Para los clientes empresariales, este soporte ampliado podría hacer que sea más fácil operar entornos de GPU mixtos en lugar de construir procesos de administración separados para la infraestructura de NVIDIA (NVDA ) y AMD.

Administración de la pila desde el hardware hasta los modelos

Spectro Cloud desarrolló originalmente Palette como una plataforma de administración de Kubernetes para implementar y mantener clústeres en nubes públicas, centros de datos privados, sistemas de metal desnudo y ubicaciones de borde.

PaletteAI amplía esa base a la infraestructura de inteligencia artificial. Combina la administración del ciclo de vida de Kubernetes con la orquestación de GPU, los servicios de modelo, los controles de seguridad, la red y las herramientas de operaciones de aprendizaje automático. Spectro Cloud describe la plataforma como una forma de administrar la infraestructura desde la capa de hardware físico hasta los modelos y los servicios de inferencia que se ejecutan en ella.

La plataforma también incluye PaletteAI Studio, que proporciona pilas de infraestructura y inteligencia artificial preintegradas construidas con tecnologías como Kubeflow, MLflow, ClearML, Run:ai y Hugging Face. Estas configuraciones están diseñadas para dar a los equipos de plataforma plantillas de implementación repetibles en lugar de requerir que integren cada componente manualmente.

Inference Launchpad agrega enrutamiento de tokens, medición y servicio de modelo gestionado localmente a esa capa de infraestructura más amplia.

Ayudando a entornos de inteligencia artificial soberanos y regulados

Spectro Cloud también está apuntando a neoclouds, proveedores de servicios administrados y operadores de nubes soberanas. Estos proveedores a menudo necesitan ofrecer infraestructura de GPU compartida mientras mantienen el aislamiento entre los clientes y aplican controles específicos de jurisdicción.

La empresa está trabajando con NexusIgnite, un proveedor de infraestructura que opera desde Austin y Dubái, para admitir implementaciones que involucran residencia de datos, cumplimiento y soberanía operativa.

La residencia de datos generalmente se refiere a dónde se almacena la información. La inteligencia artificial soberana plantea preguntas adicionales sobre quién opera la infraestructura, qué sistemas legales se aplican, quién puede acceder a ella y si el entorno puede ser auditado o desconectado de los servicios externos.

La plataforma de Spectro Cloud admite implementaciones autohospedadas y aisladas, mientras que PaletteAI VerteX agrega controles de seguridad destinados a entornos gubernamentales y regulados.

Estas capacidades pueden ser particularmente relevantes para los gobiernos, las organizaciones de atención médica, las instituciones financieras y los operadores de infraestructura crítica que no pueden enrutar cada interacción de inteligencia artificial a través de un servicio público compartido.

Creciente competencia en torno a las operaciones de inteligencia artificial empresarial

El lanzamiento se produce poco después de que Spectro Cloud anunciara una ronda de financiación de $100 millones en serie D liderada por Growth Equity en Goldman Sachs Alternatives, con la participación de AMD Ventures, Ericsson, LG Technology Ventures y Maximus.

La empresa dijo que la financiación apoyaría su expansión en la infraestructura de inteligencia artificial en producción, nubes soberanas, servicios de neocloud y inferencia distribuida. Spectro Cloud ha recaudado aproximadamente $260 millones.

Su estrategia refleja una capa emergente del mercado de inteligencia artificial centrada en la operación de modelos en lugar de desarrollar modelos de base. A medida que las opciones de modelos se multiplican, las empresas necesitan cada vez más infraestructura que pueda determinar dónde se ejecutan los modelos, cómo se asignan las GPUs, a qué datos pueden acceder y cómo se mide el uso.

PaletteAI Inference Launchpad y la integración ampliada de AMD están disponibles de inmediato. Su importancia a largo plazo dependerá de si la inferencia gestionada localmente puede ofrecer beneficios económicos consistentes sin recrear la complejidad operativa que las empresas esperaban evitar al utilizar proveedores de modelos externos en primer lugar.

Antoine es un líder visionario y socio fundador de Unite.AI, impulsado por una pasión inquebrantable por dar forma y promover el futuro de la IA y la robótica. Como empresario serial, cree que la IA será tan disruptiva para la sociedad como la electricidad, y a menudo se le escucha hablando con entusiasmo sobre el potencial de las tecnologías disruptivas y la AGI.

Como futurista, está dedicado a explorar cómo estas innovaciones darán forma a nuestro mundo. Además, es el fundador de Securities.io, una plataforma enfocada en invertir en tecnologías de vanguardia que están redefiniendo el futuro y remodelando sectores enteros.