AI-modeller og plattformer

Ramp åpner Router.com-modellgateway med gratis ruting gjennom 2026

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Ramp, plattformen for bedriftsutgifter som håndterer mer enn 200 milliarder dollar i kjøp årlig, lanserte Router.com 19. august 2026: et enkelt API‑endepunkt som sender hver AI‑forespørsel til den lavest kostnadende modellen som oppfyller utviklerens kvalitetskriterier. Kunder som allerede bruker tjenesten har i gjennomsnitt redusert inferenskostnadene med 40 % ifølge selskapets kunngjøring. Rutingen er gratis gjennom 2026, med brukere som betaler listepris for tokenene de forbruker og nye brukere som får $26 i kreditter.

Produktet er den offentlige versjonen av verktøyene Ramp bygde for seg selv for tre år siden. Ved å matche hver intern jobb med riktig modell, sier selskapet at de reduserte sine egne inferenskostnader med omtrent 30 % for samme resultat, samtidig som de opprettholder over 99,9 % pålitelighet i produksjonstrafikken. Router‑nettstedet oppgir at nåværende produksjonsvolum er mer enn 2,75 billioner token routet per måned.

«AI er den raskest voksende posteringen i de fleste selskaper, og den de kan måle minst», sa Rahul Sengottuvelu, Ramps teknologidirektør, i kunngjøringen. «Router samler alle token på ett sted og sender hver forespørsel til modellen som leverer riktig ytelse til riktig kostnad.»

Tidslinjen følger Ramps egne data. Ramp AI Index, som sporer bedrifts‑AI‑utgifter på tvers av plattformens kundebase, viser at AI‑utgiftene har vokst 20,7‑fold siden juni 2025, ifølge kunngjøringen.

Ett endepunkt, 27 modeller og teller

Utviklere kobler seg til via ett OpenAI‑ og Anthropic‑kompatibelt API og får tilgang til modeller fra OpenAI, Anthropic og SpaceXAI, med støtte for Gemini oppført som kommende. Åpne modeller som Nvidia, Kimi, DeepSeek, GLM og Qwen leveres gjennom leverandører som Fireworks AI, med Google, AWS, Together AI, Baseten og Crusoe på vei, ifølge kunngjøringen. Modellvelgeren på Ramps Router‑side omfatter for øyeblikket 27 modeller, fra Claude Opus 5 og GPT‑5.6 Sol ned til budsjettalternativer som GPT‑5.4 Nano og DeepSeek V4 Flash. Inkluderingen av Grok utvider en distribusjonsinnsats som førte til at Grok 4.6 ble tilgjengelig generelt på Amazon Bedrock samme dag.

Ruter‑motoren bruker mer enn 100 optimaliseringer på modellvalg, caching, komprimering, timing og forespørselshåndtering, med automatisk fallback når en leverandør svikter. Team kan godta Ramps standard rutingsstrategi eller konfigurere egne kost‑ytelsesprioriteringer per forespørselstype. Alle modeller er hostet på amerikansk infrastruktur, med alternativer for null datalagring tilgjengelig.

En referansebenchmark bygget fra produksjonsarbeid

Den bærende delen er Ramp SWE‑Bench, en benchmark bygget fra selskapets faktiske produksjons‑ingeniøroppgaver i stedet for offentlige ranglister. Router tester kontinuerlig nye modeller mot denne arbeidsmengden og integrerer vinnerne automatisk i standardinnstillingene. Den publiserte resultattabellen viser spredningen som routeren utnytter: Claude Opus 5 løser oppgaver med en gjennomsnittlig kostnad på $1,84 per kjøring, mens Qwen3.7 Plus oppnår en sammenlignbar løsningsrate til $0,15, og GPT‑5.4 Nano håndterer billigere arbeid til $0,09.

Den typen per‑forespørsel‑arbitrage er retningen inferensekonomien har tatt etter hvert som modellmenyen utvides. Benchmark‑baserte tjenestekostnader varierer nå med mer enn en størrelsesorden mellom modeller for sammenlignbare løsningsrater, en spredning som reflekteres i Ramps SWE‑Bench‑tabell og i billigere inferens‑løsninger som Runwares containeriserte datasentre.

Hva kundene rapporterer og hva vilkårene sier

Tidlige brukere som er nevnt på produktsiden rapporterer besparelser langt over gjennomsnittet på 40 %. Valentin De Matos fra Delphi sier at hans selskap kjører milliarder av token gjennom Router og reduserte modellkostnadene med 92 %. Anthropics leder for plattform‑ingeniørarbeid, Katelyn Lesse, sa at Claude er tilgjengelig gjennom Router fra dag én, og SpaceXAI sa at Groks inkludering utvider hvordan team kan integrere deres modeller i applikasjonene sine.

Det lille med skriften: gratis ruting gjelder gjennom 2026, hvoretter Ramp ikke har fastsatt pris i kunngjøringen. Router lagrer modell‑input, -output og metadata og bruker disse dataene til å forbedre tjenesten, selv om brukere kan slå dette av i innstillingene og velge modeller hostet i USA uten datalagring. Tjenesten er begrenset til amerikanske utviklere og team ved lansering, med bedriftsfunksjoner og flere land oppført som kommende. Ramp sier at verken Ramp‑kort eller bedriftskonto er påkrevd, og at bytte av en eksisterende integrasjon kun krever en én‑linjes endring av base‑URL for OpenAI‑ eller Anthropic‑SDK‑brukere.

Theo Nash er en AI-generert spesialist hos Unite.AI, som dekker AI-infrastruktur, beregning og hårdwaresystemer som driver moderne kunstig intelligens. Hans arbeid fokuserer på de tekniske grunnlagene bak store AI-arbeidsbyrder, inkludert datacenter, akseleratorer, nettverk og programvarestackene som binder dem sammen.
Med en analytisk og ingeniør-drevet perspektiv, undersøker Theo hvordan fremgangen i GPUs, tilpasset silisium, minnearkitekturer og distribuerte systemer muliggjør nye generasjoner av AI-modeller. Han legger spesiell vekt på ytelses-avveininger, energieffektivitet, skalerbarhet og de praktiske begrensningene som former virkelige AI-infrastruktur-utsteder.
Artikler skrevet av Theo Nash er AI-generert og gjennomgått av Unite.AIs redaksjonelle team for å sikre teknisk nøyaktighet, klarhet og ansvarlig dekning av den raskt utviklende AI-beregningssfæren.