Modèles et plateformes d’IA
Spectro Cloud lance PaletteAI Inference Launchpad pour aider les entreprises à contrôler les coûts des jetons d’IA

Spectro Cloud a lancé PaletteAI Inference Launchpad, une plate-forme d’inférence gérée localement conçue pour aider les entreprises à réduire leur dépendance à l’égard des services de modèles externes et à gagner un meilleur contrôle sur le coût croissant des charges de travail d’intelligence artificielle.
La société affirme que les organisations peuvent réduire les coûts des jetons externes de jusqu’à 70 %, en fonction de leur mix de charges de travail, d’infrastructure et de choix de modèles. Spectro Cloud a également élargi la prise en charge de PaletteAI pour les infrastructures basées sur AMD, offrant aux clients un choix plus large de processeurs graphiques (GPU), de temps d’exécution d’inférence et de technologies de service de modèles.
Les annonces reflètent un changement plus large dans l’IA d’entreprise. À mesure que les sociétés dépassent l’expérimentation et déployer l’intelligence artificielle dans le service client, le développement de logiciels, l’analyse et les opérations internes, le coût du traitement des entrées et des sorties de modèles devient une préoccupation d’infrastructure significative.
Apporter l’inférence d’IA plus près des données d’entreprise
PaletteAI Inference Launchpad est construit autour d’une approche locale de l’inférence. Plutôt que d’envoyer automatiquement chaque demande à un modèle frontalier hébergé à l’extérieur, les organisations peuvent exécuter des charges de travail appropriées sur des infrastructures situées dans leurs propres centres de données, nuages privés, environnements souverains ou emplacements de bord.
Les entreprises peuvent toujours conserver l’accès à des modèles frontaliers hébergés à l’extérieur pour les tâches qui nécessitent leurs capacités. La plate-forme est conçue pour acheminer les demandes entre les modèles locaux et externes en fonction de facteurs tels que le coût, les performances, les exigences de gouvernance et la complexité de la tâche.
Ce modèle hybride pourrait devenir de plus en plus important à mesure que les organisations adoptent des modèles plus petits et plus spécialisés. Une demande de support client, une tâche de classification de documents ou une requête de connaissance interne peut ne pas nécessiter la même capacité de modèle que la raisonnement avancé, la codification complexe ou l’analyse multimodale.
La conservation de charges de travail appropriées à l’échelle locale peut également réduire la latence en rapprochant l’inférence des applications, des utilisateurs et des sources de données. Pour les organisations opérant dans des secteurs réglementés, le traitement local peut offrir un contrôle accru sur l’endroit où les informations sensibles sont traitées.
Utilisation des jetons devient un indicateur d’infrastructure
Les jetons sont les unités dans lesquelles les modèles d’intelligence artificielle divisent et traitent le texte, le code et les autres informations. Chaque invite et chaque réponse générée consomment des jetons, et de nombreux services de modèles commerciaux facturent en fonction du nombre de jetons traités.
Cela signifie que les coûts d’IA peuvent augmenter rapidement à mesure que les systèmes passent des essais contrôlés aux applications servant des milliers d’employés ou de clients. Le problème devient encore plus compliqué avec les agents d’IA, qui peuvent effectuer des appels de modèles répétés, récupérer des informations, évaluer les résultats et utiliser des outils externes avant de compléter une seule tâche.
Goldman Sachs Recherche prévoit que la consommation mensuelle de jetons d’IA augmentera 24 fois entre 2026 et 2030, pour atteindre environ 120 quadrillions de jetons par mois. Cette croissance projetée est impulsée par l’adoption croissante de l’IA d’entreprise et l’émergence de plus d’agents d’IA autonomes.
Inference Launchpad répond à ce problème en fournissant aux équipes d’infrastructure des outils pour mesurer la consommation de jetons, établir des quotas et appliquer des politiques d’utilisation. Ces contrôles pourraient aider les sociétés à comprendre quels équipes, applications et modèles sont responsables de leurs dépenses d’IA plutôt que de traiter l’inférence comme une charge de service externe imprévisible.
La réduction de 70 % citée par Spectro Cloud doit être considérée comme un résultat potentiel plutôt que comme une économie garantie. Les économies réelles dépendront des coûts d’acquisition ou de location de GPU, des taux d’utilisation, de la consommation d’énergie, de l’efficacité des modèles, du volume des demandes et des tarifs des fournisseurs externes.
Modèles locaux sans éliminer les modèles frontaliers
Les capacités de routage de modèles de la plate-forme sont conçues pour éviter de forcer les entreprises à prendre une décision tout ou rien entre les modèles locaux et les modèles frontaliers.
Les organisations peuvent utiliser des modèles locaux plus petits pour des tâches prévisibles ou sensibles à la vie privée tout en envoyant des demandes plus exigeantes à des modèles frontaliers. Les politiques peuvent également déterminer quels modèles sont autorisés pour des départements, des juridictions ou des classifications de données spécifiques.
Ceci introduit la gouvernance directement dans la couche d’inférence. Une institution financière, par exemple, pourrait empêcher certaines informations de quitter un environnement contrôlé, tout en permettant aux demandes non sensibles d’utiliser un modèle externe. Une société multinationale pourrait appliquer des règles de routage différentes en fonction des exigences de données régionales.
Spectro Cloud a positionné le choix de modèle et la gouvernance comme partie de la stratégie de gestion d’infrastructure plus large de PaletteAI. La plate-forme prend en charge les environnements de GPU partagés, l’accès basé sur les rôles, les quotas de ressources et les contrôles au niveau des locataires destinés à permettre à plusieurs équipes d’utiliser la même infrastructure sans accéder sans restriction aux systèmes sous-jacents.
Prise en charge élargie des infrastructures d’IA basées sur AMD
Concomitamment au lancement d’Inference Launchpad, Spectro Cloud a annoncé une prise en charge plus large des environnements d’IA basés sur AMD.
L’intégration couvre les GPU AMD, l’opérateur de GPU AMD, la pile de logiciels ROCm et les microservices d’inférence AMD, communément appelés AIMs. Ces composants s’adressent à différentes couches de l’infrastructure requise pour exploiter les modèles d’IA en production.
L’opérateur de GPU AMD simplifie la configuration et la gestion des accélérateurs AMD Instinct à l’intérieur des clusters Kubernetes. ROCm fournit la pile de logiciels open source sous-jacente, y compris les pilotes, les bibliothèques, les temps d’exécution et les outils de développement utilisés pour exécuter des charges de travail d’intelligence artificielle et de calcul haute performance sur du matériel AMD.
AIMs fournissent des microservices d’inférence standardisés pour servir des modèles sur les GPU AMD Instinct. Ils sont conçus pour emballer des modèles optimisés et des logiciels de support dans des services déployables, réduisant une partie du travail d’intégration normalement requis pour déplacer un modèle en production.
Pour les clients d’entreprise, cette prise en charge élargie pourrait faciliter l’exploitation d’environnements de GPU mixtes au lieu de créer des processus de gestion distincts pour les infrastructures NVIDIA (NVDA ) et AMD.
Gestion de la pile, du matériel aux modèles
Spectro Cloud a initialement développé Palette comme une plate-forme de gestion de Kubernetes pour déployer et maintenir des clusters sur des nuages publics, des centres de données privés, des systèmes bare-metal et des emplacements de bord.
PaletteAI étend cette base à l’infrastructure d’IA. Il combine la gestion du cycle de vie de Kubernetes avec l’orchestration de GPU, les services de modèles, les contrôles de sécurité, le réseau et les outils de gestion des opérations d’apprentissage automatique. Spectro Cloud décrit la plate-forme comme un moyen de gérer l’infrastructure depuis la couche de matériel physique jusqu’aux modèles et aux services d’inférence qui s’exécutent dessus.
La plate-forme comprend également PaletteAI Studio, qui fournit des piles d’infrastructure et d’IA pré-intégrées construites à partir de technologies telles que Kubeflow, MLflow, ClearML, Run:ai et Hugging Face. Ces configurations sont destinées à fournir aux équipes de plate-forme des modèles de déploiement répétables au lieu de les obliger à intégrer chaque composant manuellement.
Inference Launchpad ajoute le routage de jetons, la mesure et le service de modèles géré localement à cette couche d’infrastructure plus large.
Prise en charge des environnements d’IA souverains et réglementés
Spectro Cloud vise également les fournisseurs de services gérés, les opérateurs de nuages souverains et les fournisseurs de services de nuages neoclouds. Ces fournisseurs ont souvent besoin d’offrir une infrastructure de GPU partagée tout en maintenant l’isolement entre les clients et en appliquant des contrôles spécifiques à la juridiction.
La société travaille avec NexusIgnite, un fournisseur d’infrastructure opérant à partir d’Austin et de Dubaï, pour prendre en charge les déploiements impliquant la résidence des données, la conformité et la souveraineté opérationnelle.
La résidence des données concerne généralement l’endroit où les informations sont stockées. L’IA souveraine introduit des questions supplémentaires sur qui exploite l’infrastructure, quels systèmes juridiques s’appliquent, qui peut y accéder et si l’environnement peut être audité ou déconnecté des services externes.
La plate-forme de Spectro Cloud prend en charge les déploiements auto-hébergés et les déploiements isolés du réseau, tandis que PaletteAI VerteX ajoute des contrôles de sécurité destinés aux environnements gouvernementaux et réglementés.
Ces capacités peuvent être particulièrement pertinentes pour les gouvernements, les organisations de soins de santé, les institutions financières et les opérateurs d’infrastructures critiques qui ne peuvent pas router chaque interaction d’IA via un service public partagé.
Concurrence croissante autour des opérations d’IA d’entreprise
Le lancement survient peu après que Spectro Cloud a annoncé un tour de financement de série D de 100 millions de dollars mené par Growth Equity at Goldman Sachs Alternatives, avec la participation d’AMD Ventures, Ericsson, LG Technology Ventures et Maximus.
La société a déclaré que le financement soutiendrait son expansion dans l’infrastructure d’IA de production, les services de nuages souverains, les services de nuages neocloud et l’inférence distribuée. Spectro Cloud a maintenant levé environ 260 millions de dollars.
Sa stratégie reflète une couche émergente du marché de l’IA axée sur l’exploitation de modèles plutôt que sur le développement de modèles de base. À mesure que les options de modèles se multiplient, les entreprises ont de plus en plus besoin d’une infrastructure qui puisse déterminer où les modèles s’exécutent, comment les GPU sont alloués, quelles données ils peuvent accéder et comment l’utilisation est mesurée.
PaletteAI Inference Launchpad et l’intégration élargie d’AMD sont disponibles immédiatement. Leur signification à long terme dépendra de savoir si l’inférence gérée localement peut offrir des avantages économiques constants sans recréer la complexité opérationnelle que les entreprises espéraient éviter en utilisant des fournisseurs de modèles externes en premier lieu.












