Modèles et plateformes d’IA

Ramp ouvre la passerelle de modèles Router.com avec routage gratuit jusqu’en 2026

mm
Ajouter Unite.AI à vos sources préférées sur Google

Ramp, la plateforme de dépenses d’entreprise qui alimente plus de 200 milliards de dollars d’achats chaque année, a lancé Router.com le 19 août 2026: un point d’accès API unique qui envoie chaque requête d’IA au modèle le moins cher répondant aux exigences de qualité du développeur. Les clients déjà utilisateurs du service ont réduit leurs coûts d’inférence d’environ 40 % en moyenne, selon l’annonce de l’entreprise. Le routage est gratuit jusqu’en 2026, les utilisateurs payant le tarif catalogue pour les jetons consommés et les nouveaux utilisateurs recevant 26 $ de crédits.

Le produit est la version publique de l’outil que Ramp a développé pour elle-même il y a trois ans. En associant chaque tâche interne au modèle adéquat, l’entreprise affirme avoir réduit ses propres coûts d’inférence d’environ 30 % pour le même résultat tout en maintenant une fiabilité de plus de 99,9 % sur le trafic de production. Le site Router indique que le volume de production actuel dépasse 2,75 trillions de jetons routés chaque mois.

« L’IA est la dépense qui croît le plus rapidement dans la plupart des entreprises, et celle qu’elles mesurent le moins, » a déclaré Rahul Sengottuvelu, directeur technologique de Ramp, dans l’annonce. « Router regroupe chaque jeton en un seul endroit et envoie chaque requête au modèle qui offre la performance adéquate au bon coût. »

Le calendrier reflète les propres données de Ramp. Le Ramp AI Index, qui suit les dépenses d’IA des entreprises parmi les clients de la plateforme, indique que les dépenses en IA ont augmenté de 20,7 fois depuis juin 2025, selon l’annonce.

Un point d’accès, 27 modèles et en progression

Les développeurs se connectent via une API compatible OpenAI et Anthropic et accèdent aux modèles d’OpenAI, d’Anthropic et de SpaceXAI, le support de Gemini étant annoncé prochainement. Les modèles à poids ouvert tels que Nvidia, Kimi, DeepSeek, GLM et Qwen sont proposés par des fournisseurs comme Fireworks AI, avec Google, AWS, Together AI, Baseten et Crusoe en cours d’intégration, selon l’annonce. Le sélecteur de modèles sur la page Router de Ramp propose actuellement 27 modèles, de Claude Opus 5 et GPT‑5.6 Sol jusqu’aux gammes économiques comme GPT‑5.4 Nano et DeepSeek V4 Flash. L’inclusion de Grok prolonge une poussée de distribution qui a vu Grok 4.6 atteindre la disponibilité générale sur Amazon Bedrock le même jour.

Le moteur de routage applique plus de 100 optimisations couvrant la sélection de modèle, la mise en cache, la compression, la synchronisation et la gestion des requêtes, avec un basculement automatique lorsqu’un fournisseur échoue. Les équipes peuvent accepter la stratégie de routage par défaut de Ramp ou configurer leurs propres priorités coût‑performance selon le type de requête. Tous les modèles sont hébergés sur une infrastructure basée aux États‑Unis, avec des options de non‑conservation des données disponibles.

Un benchmark issu du travail de production

L’élément central est le Ramp SWE‑Bench, un benchmark construit à partir des véritables tâches d’ingénierie de production de l’entreprise plutôt que de classements publics. Router teste en continu les nouveaux modèles sur cette charge de travail et intègre automatiquement les gagnants dans ses paramètres par défaut. Le tableau des résultats publiés montre la répartition que le routeur exploite: Claude Opus 5 résout les tâches à un coût moyen de 1,84 $ par exécution, tandis que Qwen 3.7 Plus atteint un taux de résolution comparable à 0,15 $, et GPT‑5.4 Nano traite des tâches moins coûteuses à 0,09 $.

Ce type d’arbitrage par requête représente la direction que prend l’économie de l’inférence à mesure que le catalogue de modèles s’élargit. Les coûts de service évalués varient désormais de plus d’un ordre de grandeur selon les modèles pour des taux de résolution comparables, une variation reflétée dans le tableau SWE‑Bench de Ramp et dans des solutions d’inférence moins coûteuses comme les centres de données conteneurisés de Runware.

Ce que les clients rapportent et ce que disent les conditions

Les premiers utilisateurs mentionnés sur la page produit déclarent des économies bien supérieures à la moyenne de 40 %. Valentin De Matos de Delphi indique que son entreprise traite des milliards de jetons via Router et a réduit les coûts des modèles de 92 %. La responsable de l’ingénierie plateforme chez Anthropic, Katelyn Lesse, a affirmé que Claude est disponible via Router dès le premier jour, et SpaceXAI a déclaré que l’inclusion de Grok élargit les possibilités pour les équipes d’intégrer ses modèles dans leurs applications.

Les petites lignes: le routage gratuit est valable jusqu’en 2026, après quoi Ramp n’a pas encore fixé de tarification dans l’annonce. Router conserve les entrées, sorties et métadonnées des modèles et utilise ces données pour améliorer le service, bien que les utilisateurs puissent désactiver cette fonction dans les paramètres et choisir des modèles hébergés aux États‑Unis sans conservation des données. Le service est limité aux développeurs et équipes américains lors du lancement, avec des fonctionnalités d’entreprise et d’autres pays annoncés prochainement. Ramp précise qu’aucune carte Ramp ni compte d’entreprise n’est requis, et que le passage d’une intégration existante se résume à une modification d’une ligne de l’URL de base pour les utilisateurs du SDK OpenAI ou Anthropic.

Théo Nash est un spécialiste généré par IA chez Unite.AI, couvrant l'infrastructure IA, le calcul et les systèmes matériels qui alimentent l'intelligence artificielle moderne. Son travail se concentre sur les fondements techniques des charges de travail IA à grande échelle, notamment les centres de données, les accélérateurs, les réseaux et les piles logicielles qui les relient.
Avec une perspective analytique et axée sur l'ingénierie, Théo examine comment les progrès des GPU, du silicium personnalisé, des architectures de mémoire et des systèmes distribués permettent de nouvelles générations de modèles IA. Il prête une attention particulière aux compromis de performance, à l'efficacité énergétique, à la scalabilité et aux contraintes pratiques qui façonnent le déploiement réel de l'infrastructure IA.
Les articles rédigés par Théo Nash sont générés par IA et révisés par l'équipe éditoriale d'Unite.AI pour garantir l'exactitude technique, la clarté et la couverture responsable du paysage de calcul IA en évolution rapide.