Modelos e plataformas de IA
A Spectro Cloud Lança PaletteAI Inference Launchpad para Ajudar as Empresas a Controlar os Custos de Tokens de IA

Spectro Cloud lançou o PaletteAI Inference Launchpad, uma plataforma de inferência gerenciada localmente projetada para ajudar as empresas a reduzir sua dependência de serviços de modelo externos e ganhar mais controle sobre o crescente custo das cargas de trabalho de inteligência artificial.
A empresa afirma que as organizações podem reduzir os custos de tokens externos em até 70%, dependendo da mistura de cargas de trabalho, infraestrutura e escolha de modelos. A Spectro Cloud também expandiu o suporte do PaletteAI para infraestrutura baseada em AMD, dando aos clientes uma escolha mais ampla de unidades de processamento gráfico (GPUs), tempos de inferência e tecnologias de modelo de serviço.
As anúncios refletem uma mudança mais ampla na IA empresarial. À medida que as empresas vão além da experimentação e implantam inteligência artificial em serviços de atendimento ao cliente, desenvolvimento de software, análise e operações internas, o custo do processamento de entradas e saídas de modelos está se tornando uma preocupação significativa de infraestrutura.
Levando a Inferência de IA Mais Perto dos Dados Empresariais
O PaletteAI Inference Launchpad é construído em torno de uma abordagem local-first para inferência. Em vez de enviar automaticamente todos os pedidos para um modelo de fronteira hospedado externamente, as organizações podem executar cargas de trabalho adequadas em infraestrutura localizada em seus próprios centros de dados, nuvens privadas, ambientes soberanos ou locais de borda.
As empresas ainda podem manter o acesso a modelos de fronteira hospedados externamente para tarefas que exigem suas capacidades. A plataforma é projetada para encaminhar pedidos entre modelos locais e externos com base em fatores como custo, desempenho, requisitos de governança e complexidade da tarefa.
Esse modelo híbrido pode se tornar cada vez mais importante à medida que as organizações adotam modelos menores e mais especializados. Um pedido de suporte ao cliente, uma tarefa de classificação de documentos ou uma consulta de conhecimento interno pode não exigir a mesma capacidade de modelo que a razão avançada, codificação complexa ou análise multimodal.
Manter as cargas de trabalho adequadas localmente também pode reduzir a latência, movendo a inferência mais perto das aplicações, usuários e fontes de dados. Para as organizações que operam em setores regulamentados, o processamento local pode fornecer um controle maior sobre onde as informações sensíveis são manipuladas.
O Uso de Tokens se Torna uma Métrica de Infraestrutura
Os tokens são as unidades em que os modelos de inteligência artificial dividem e processam texto, código e outras informações. Cada prompt e resposta gerada consome tokens, e muitos serviços de modelo comerciais cobram de acordo com o número de tokens processados.
Isso significa que os custos de IA podem aumentar rapidamente à medida que os sistemas passam de testes controlados para aplicações que atendem a milhares de funcionários ou clientes. O problema se torna ainda mais complicado com agentes de IA, que podem fazer chamadas de modelo repetidas, recuperar informações, avaliar resultados e usar ferramentas externas antes de concluir uma tarefa.
A pesquisa da Goldman Sachs prevê que o consumo mensal de tokens de IA aumentará 24 vezes entre 2026 e 2030, atingindo aproximadamente 120 quadrilhões de tokens por mês. Esse crescimento projetado está sendo impulsionado pela adoção crescente de empresas e pelo surgimento de agentes de IA mais autônomos.
O Inference Launchpad aborda essa questão fornecendo às equipes de infraestrutura ferramentas para medir o consumo de tokens, estabelecer cotas e aplicar políticas de uso. Esses controles podem ajudar as empresas a entender quais equipes, aplicações e modelos são responsáveis por seus gastos com IA, em vez de tratar a inferência como uma taxa de serviço externa imprevisível.
A redução de 70% citada pela Spectro Cloud deve ser vista como um resultado potencial, e não como uma economia garantida. A economia real dependerá dos custos de aquisição ou aluguel de GPUs, taxas de utilização, consumo de energia, eficiência do modelo, volume de solicitações e preços dos provedores externos.
Modelos Locais Sem Eliminar os Modelos de Fronteira
As capacidades de roteamento de modelos da plataforma são projetadas para evitar que as empresas sejam forçadas a tomar uma decisão de tudo ou nada entre modelos locais e de fronteira.
As organizações podem usar modelos locais menores para tarefas previsíveis ou sensíveis à privacidade, enquanto enviam solicitações mais exigentes para modelos de fronteira. As políticas também podem determinar quais modelos são permitidos para departamentos, jurisdições ou classificações de dados específicos.
Isso introduz governança diretamente na camada de inferência. Por exemplo, uma instituição financeira pode impedir que certas informações deixem um ambiente controlado, enquanto permite que solicitações não sensíveis usem um modelo externo. Uma empresa multinacional pode aplicar regras de roteamento diferentes com base em requisitos de dados regionais.
A Spectro Cloud posicionou a escolha de modelo e a governança como parte da estratégia de gerenciamento de infraestrutura mais ampla do PaletteAI. A plataforma suporta ambientes de GPU compartilhados, acesso baseado em papéis, cotas de recursos e controles de nível de locatário destinados a permitir que várias equipes usem a mesma infraestrutura sem ter acesso irrestrito aos sistemas subjacentes.
Expansão do Suporte para Infraestrutura de IA da AMD
Além do Inference Launchpad, a Spectro Cloud anunciou um suporte mais amplo para ambientes de IA baseados em AMD.
A integração abrange GPUs da AMD, o AMD GPU Operator, a pilha de software ROCm e os serviços de inferência da AMD, comumente conhecidos como AIMs. Esses componentes abordam diferentes camadas da infraestrutura necessária para operar modelos de IA em produção.
O AMD GPU Operator simplifica a configuração e gerenciamento de aceleradores AMD Instinct dentro de clusters Kubernetes. O ROCm fornece a pilha de software de código aberto subjacente, incluindo drivers, bibliotecas, tempos de execução e ferramentas de desenvolvimento usadas para executar cargas de trabalho de inteligência artificial e computação de alto desempenho em hardware AMD.
Os AIMs fornecem serviços de inferência micro padronizados para servir modelos em GPUs AMD Instinct. Eles são projetados para embalar modelos otimizados e software de suporte em serviços implantáveis, reduzindo parte do trabalho de integração normalmente necessário para mover um modelo para a produção.
Para os clientes empresariais, esse suporte expandido pode tornar mais fácil operar ambientes de GPU mistos em vez de construir processos de gerenciamento separados para infraestrutura da NVIDIA (NVDA ) e da AMD.
Gerenciando a Pilha desde o Hardware até os Modelos
A Spectro Cloud desenvolveu originalmente o Palette como uma plataforma de gerenciamento do Kubernetes para implantar e manter clusters em nuvens públicas, centros de dados privados, sistemas bare-metal e locais de borda.
O PaletteAI estende essa base para a infraestrutura de IA. Ele combina o gerenciamento de ciclo de vida do Kubernetes com a orquestração de GPU, serviços de modelo, controles de segurança, networking e ferramentas de operações de aprendizado de máquina. A Spectro Cloud descreve a plataforma como uma maneira de gerenciar a infraestrutura desde a camada de hardware físico até os modelos e serviços de inferência que executam em cima dela.
A plataforma também inclui o PaletteAI Studio, que fornece pilhas de infraestrutura e IA pré-integradas construídas a partir de tecnologias como Kubeflow, MLflow, ClearML, Run:ai e Hugging Face. Essas configurações são destinadas a fornecer às equipes de plataforma modelos de implantação repetíveis em vez de exigir que integrem cada componente manualmente.
O Inference Launchpad adiciona roteamento de tokens, medição e serviço de modelo gerenciado localmente a essa camada de infraestrutura mais ampla.
Apoio a Ambientes de IA Soberanos e Regulamentados
A Spectro Cloud também está mirando neoclouds, provedores de serviços gerenciados e operadores de nuvem soberana. Esses provedores frequentemente precisam oferecer infraestrutura de GPU compartilhada enquanto mantêm a isolamento entre os clientes e aplicam controles específicos de jurisdição.
A empresa está trabalhando com NexusIgnite, um provedor de infraestrutura que opera em Austin e Dubai, para apoiar implantações que envolvem residência de dados, conformidade e soberania operacional.
A residência de dados geralmente se refere a onde as informações são armazenadas. A IA soberana introduz questões adicionais sobre quem opera a infraestrutura, quais sistemas legais se aplicam, quem pode acessá-la e se o ambiente pode ser auditado ou desconectado de serviços externos.
A plataforma da Spectro Cloud suporta implantações auto-hospedadas e de ar gap, enquanto o PaletteAI VerteX adiciona controles de segurança destinados a ambientes governamentais e regulamentados.
Essas capacidades podem ser particularmente relevantes para governos, organizações de saúde, instituições financeiras e operadores de infraestrutura crítica que não podem rotear todas as interações de IA por meio de um serviço público compartilhado.
Crescimento da Concorrência em Torno das Operações de IA Empresarial
O lançamento ocorre logo após a Spectro Cloud anunciar uma rodada de financiamento de US$ 100 milhões em série D liderada pela Growth Equity at Goldman Sachs Alternatives, com a participação da AMD Ventures, Ericsson, LG Technology Ventures e Maximus.
A empresa disse que o financiamento apoiaria sua expansão em infraestrutura de IA de produção, nuvens soberanas, serviços de neocloud e inferência distribuída. A Spectro Cloud agora levantou aproximadamente US$ 260 milhões.
Sua estratégia reflete uma camada emergente do mercado de IA focada em operar modelos em vez de desenvolver modelos de base. À medida que as opções de modelo se multiplicam, as empresas precisam cada vez mais de infraestrutura que possa determinar onde os modelos são executados, como as GPUs são alocadas, quais dados elas podem acessar e como o uso é medido.
O PaletteAI Inference Launchpad e a integração expandida da AMD estão disponíveis imediatamente. Sua importância a longo prazo dependerá de se a inferência gerenciada localmente pode fornecer benefícios econômicos consistentes sem recriar a complexidade operacional que as empresas esperavam evitar ao usar provedores de modelo externos.












