AI-modeller og platforme
Ramp åbner Router.com modelgateway med gratis routing indtil 2026

Ramp, den platform for virksomhedsomkostninger, der håndterer mere end $200 milliarder i indkøb årligt, lancerede Router.com den 19. august 2026: et enkelt API-endpoint, der sender hver AI‑forespørgsel til den lavest‑prissatte model, der opfylder udviklerens kvalitetskriterier. Kunder, der allerede bruger tjenesten, har i gennemsnit reduceret deres inferenskostnader med 40 % ifølge virksomhedens meddelelse. Routing er gratis indtil 2026, mens brugerne betaler listepris for de tokens, de forbruger, og nye brugere får $26 i kredit.
Produktet er den offentlige version af det værktøj, Ramp byggede til sig selv for tre år siden. Ved at matche hver intern opgave med den rette model, siger virksomheden, at den har reduceret sine egne inferenskostnader med ca. 30 % for samme output, mens den opretholder over 99,9 % pålidelighed i produktionstrafik. Router‑siden angiver, at den aktuelle produktionsvolumen er på mere end 2.75 trillion tokens, der routes månedligt.
“AI er den hurtigst voksende post i de fleste virksomheder, og den de kan måle mindst,” sagde Rahul Sengottuvelu, Ramps tekniske chef, i meddelelsen. “Router samler alle tokens på ét sted og sender hver forespørgsel til den model, der leverer den rette ydeevne til den rette pris.”
Tidslinjen følger Ramps egne data. Ramp AI Index, som sporer virksomheders AI‑udgifter på tværs af platformens kundebase, viser, at AI‑udgifterne er vokset 20,7‑fold siden juni 2025, ifølge meddelelsen.
Én endpoint, 27 modeller og tæller
Udviklere opretter forbindelse via én API, der er kompatibel med både OpenAI og Anthropic, og får adgang til modeller fra OpenAI, Anthropic og SpaceXAI, med Gemini‑support på vej. Open‑weight‑modeller som Nvidia, Kimi, DeepSeek, GLM og Qwen leveres gennem udbydere såsom Fireworks AI, med Google, AWS, Together AI, Baseten og Crusoe på vej, ifølge meddelelsen. Modelvælgeren på Ramps Router‑side omfatter i øjeblikket 27 modeller, fra Claude Opus 5 og GPT‑5.6 Sol ned til budgetklasser som GPT‑5.4 Nano og DeepSeek V4 Flash. Inklusionen af Grok udvider en distributionsindsats, der så Grok 4.6 blive generelt tilgængelig på Amazon Bedrock samme dag.
Routing‑motoren anvender mere end 100 optimeringer inden for modelvalg, caching, komprimering, timing og håndtering af forespørgsler, med automatisk fallback, når en udbyder fejler. Teams kan acceptere Ramps standard‑routingstrategi eller konfigurere deres egne omkostnings‑ydeevne‑prioriteter pr. forespørgselstype. Alle modeller hostes på infrastruktur i USA, med mulighed for nul‑databevaring.
Et benchmark bygget på produktionsarbejde
Den bærende del er Ramp SWE‑Bench, et benchmark bygget på virksomhedens faktiske produktions‑ingeniøropgaver frem for offentlige ranglister. Router tester løbende nye modeller mod dette arbejdsbelastning og integrerer vindere automatisk i sine standardindstillinger. Den offentliggjorte resultattabel viser den spredning, routeren udnytter: Claude Opus 5 løser opgaver til en gennemsnitlig pris på $1,84 pr. kørsel, mens Qwen 3.7 Plus opnår en tilsvarende løsningsrate til $0,15, og GPT‑5.4 Nano håndterer billigere arbejde til $0,09.
Den slags per‑forespørgsels‑arbitrage er den retning, inferensekonomien har taget, efterhånden som modelmenuen udvides. Benchmarked serveringsomkostninger varierer nu med mere end en størrelsesorden på tværs af modeller for sammenlignelige løsningsrater, en spredning der afspejles i Ramps SWE‑Bench‑tabel og i billigere inferens‑løsninger som Runwares containeriserede datacentre.
Hvad kunderne rapporterer, og hvad vilkårene siger
De tidlige brugere, der er nævnt på produktsiden, rapporterer besparelser langt over de gennemsnitlige 40 %. Valentin De Matos fra Delphi siger, at hans virksomhed kører milliarder af tokens gennem Router og har reduceret modelomkostningerne med 92 %. Anthropics leder af platform‑engineering, Katelyn Lesse, sagde, at Claude er tilgængelig via Router fra dag ét, og SpaceXAI udtalte, at Groks inklusion udvider, hvordan teams kan integrere deres modeller i deres applikationer.
Det med småt: gratis routing løber indtil 2026, hvorefter Ramp ikke har fastsat priser i meddelelsen. Router gemmer model‑input, -output og metadata og bruger disse data til at forbedre tjenesten, selvom brugerne kan slå dette fra i indstillingerne og vælge USA‑hostede modeller uden datalagring. Tjenesten er begrænset til amerikanske udviklere og teams ved lanceringen, med enterprise‑funktioner og flere lande på vej. Ramp oplyser, at hverken Ramp‑kort eller firmakonto er påkrævet, og at skift af en eksisterende integration kun kræver en enkelt linje i base‑URL’en for OpenAI‑ eller Anthropic‑SDK‑brugere.












