AI-modeller og platforme

Ramp åbner Router.com modelgateway med gratis routing indtil 2026

mm
Føj Unite.AI til dine foretrukne kilder på Google

Ramp, den platform for virksomhedsomkostninger, der håndterer mere end $200 milliarder i indkøb årligt, lancerede Router.com den 19. august 2026: et enkelt API-endpoint, der sender hver AI‑forespørgsel til den lavest‑prissatte model, der opfylder udviklerens kvalitetskriterier. Kunder, der allerede bruger tjenesten, har i gennemsnit reduceret deres inferenskostnader med 40 % ifølge virksomhedens meddelelse. Routing er gratis indtil 2026, mens brugerne betaler listepris for de tokens, de forbruger, og nye brugere får $26 i kredit.

Produktet er den offentlige version af det værktøj, Ramp byggede til sig selv for tre år siden. Ved at matche hver intern opgave med den rette model, siger virksomheden, at den har reduceret sine egne inferenskostnader med ca. 30 % for samme output, mens den opretholder over 99,9 % pålidelighed i produktionstrafik. Router‑siden angiver, at den aktuelle produktionsvolumen er på mere end 2.75 trillion tokens, der routes månedligt.

“AI er den hurtigst voksende post i de fleste virksomheder, og den de kan måle mindst,” sagde Rahul Sengottuvelu, Ramps tekniske chef, i meddelelsen. “Router samler alle tokens på ét sted og sender hver forespørgsel til den model, der leverer den rette ydeevne til den rette pris.”

Tidslinjen følger Ramps egne data. Ramp AI Index, som sporer virksomheders AI‑udgifter på tværs af platformens kundebase, viser, at AI‑udgifterne er vokset 20,7‑fold siden juni 2025, ifølge meddelelsen.

Én endpoint, 27 modeller og tæller

Udviklere opretter forbindelse via én API, der er kompatibel med både OpenAI og Anthropic, og får adgang til modeller fra OpenAI, Anthropic og SpaceXAI, med Gemini‑support på vej. Open‑weight‑modeller som Nvidia, Kimi, DeepSeek, GLM og Qwen leveres gennem udbydere såsom Fireworks AI, med Google, AWS, Together AI, Baseten og Crusoe på vej, ifølge meddelelsen. Modelvælgeren på Ramps Router‑side omfatter i øjeblikket 27 modeller, fra Claude Opus 5 og GPT‑5.6 Sol ned til budgetklasser som GPT‑5.4 Nano og DeepSeek V4 Flash. Inklusionen af Grok udvider en distributionsindsats, der så Grok 4.6 blive generelt tilgængelig på Amazon Bedrock samme dag.

Routing‑motoren anvender mere end 100 optimeringer inden for modelvalg, caching, komprimering, timing og håndtering af forespørgsler, med automatisk fallback, når en udbyder fejler. Teams kan acceptere Ramps standard‑routingstrategi eller konfigurere deres egne omkostnings‑ydeevne‑prioriteter pr. forespørgselstype. Alle modeller hostes på infrastruktur i USA, med mulighed for nul‑databevaring.

Et benchmark bygget på produktionsarbejde

Den bærende del er Ramp SWE‑Bench, et benchmark bygget på virksomhedens faktiske produktions‑ingeniøropgaver frem for offentlige ranglister. Router tester løbende nye modeller mod dette arbejdsbelastning og integrerer vindere automatisk i sine standardindstillinger. Den offentliggjorte resultattabel viser den spredning, routeren udnytter: Claude Opus 5 løser opgaver til en gennemsnitlig pris på $1,84 pr. kørsel, mens Qwen 3.7 Plus opnår en tilsvarende løsningsrate til $0,15, og GPT‑5.4 Nano håndterer billigere arbejde til $0,09.

Den slags per‑forespørgsels‑arbitrage er den retning, inferensekonomien har taget, efterhånden som modelmenuen udvides. Benchmarked serveringsomkostninger varierer nu med mere end en størrelsesorden på tværs af modeller for sammenlignelige løsningsrater, en spredning der afspejles i Ramps SWE‑Bench‑tabel og i billigere inferens‑løsninger som Runwares containeriserede datacentre.

Hvad kunderne rapporterer, og hvad vilkårene siger

De tidlige brugere, der er nævnt på produktsiden, rapporterer besparelser langt over de gennemsnitlige 40 %. Valentin De Matos fra Delphi siger, at hans virksomhed kører milliarder af tokens gennem Router og har reduceret modelomkostningerne med 92 %. Anthropics leder af platform‑engineering, Katelyn Lesse, sagde, at Claude er tilgængelig via Router fra dag ét, og SpaceXAI udtalte, at Groks inklusion udvider, hvordan teams kan integrere deres modeller i deres applikationer.

Det med småt: gratis routing løber indtil 2026, hvorefter Ramp ikke har fastsat priser i meddelelsen. Router gemmer model‑input, -output og metadata og bruger disse data til at forbedre tjenesten, selvom brugerne kan slå dette fra i indstillingerne og vælge USA‑hostede modeller uden datalagring. Tjenesten er begrænset til amerikanske udviklere og teams ved lanceringen, med enterprise‑funktioner og flere lande på vej. Ramp oplyser, at hverken Ramp‑kort eller firmakonto er påkrævet, og at skift af en eksisterende integration kun kræver en enkelt linje i base‑URL’en for OpenAI‑ eller Anthropic‑SDK‑brugere.

Theo Nash er en AI-genereret specialist hos Unite.AI, der dækker AI-infrastruktur, beregning og de hardware-systemer, der driver moderne kunstig intelligens. Hans arbejde fokuserer på de tekniske grundlag for store AI-arbejdsbyrder, herunder datacentre, acceleratorer, netværk og software-stacks, der binder dem sammen.
Med en analytisk og ingeniør-dreven perspektiv undersøger Theo, hvordan fremskridt i GPU'er, brugerdefineret silicium, hukommelsesarkitekturer og distribuerede systemer muliggør nye generationer af AI-modeller. Han lægger særlig vægt på ydelses-omkostningsforhold, energoeffektivitet, skalerbarhed og de praktiske begrænsninger, der former den virkelige udvikling af AI-infrastruktur.
Artikler skrevet af Theo Nash er AI-genereret og gennemgået af Unite.AIs redaktionelle team for at sikre teknisk nøjagtighed, klarhed og ansvarlig dækning af den hurtigt udviklende AI-beregningsskala.