AI-modeller och plattformar

Ramp lanserar Router.com modellgateway med gratis routing fram till 2026

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Ramp, plattformen för företagsutgifter som hanterar mer än $200 miljarder i inköp årligen, lanserade Router.com den 19 augusti 2026: en enda API‑endpoint som skickar varje AI‑förfrågan till den lägsta kostnadsmodellen som uppfyller utvecklarens kvalitetskriterier. Kunder som redan använder tjänsten har i genomsnitt minskat sina inferenskostnader med 40 % enligt företagets meddelande. Routing är gratis fram till 2026, med användare som betalar listpris för de token de förbrukar och nya användare får $26 i krediter.

Produkten är den offentliga versionen av verktygen som Ramp byggde för sig själv för tre år sedan. Genom att matcha varje intern uppgift med rätt modell säger företaget att de har minskat sina egna inferenskostnader med ungefär 30 % för samma resultat samtidigt som de upprätthåller över 99,9 % pålitlighet i produktionstrafik. Router‑sajten anger att den aktuella produktionsvolymen överstiger 2,75 biljoner token som routas varje månad.

“AI är den snabbast växande kostnadsposten hos de flesta företag, och den som de kan mäta minst,” sade Rahul Sengottuvelu, Ramps chef för teknik, i meddelandet. “Router samlar alla token på ett ställe och skickar varje förfrågan till den modell som levererar rätt prestanda till rätt kostnad.”

Tidpunkten följer Ramps egna data. Ramp AI Index, som följer företags AI‑utgifter över plattformens kundbas, visar att AI‑utgifterna har ökat 20,7‑fald sedan juni 2025, enligt meddelandet.

En endpoint, 27 modeller och räknar

Utvecklare ansluter via ett OpenAI‑ och Anthropic‑kompatibelt API och får tillgång till modeller från OpenAI, Anthropic och SpaceXAI, med stöd för Gemini listat som kommande. Öppna modeller inklusive Nvidia, Kimi, DeepSeek, GLM och Qwen levereras via leverantörer som Fireworks AI, med Google, AWS, Together AI, Baseten och Crusoe på väg, enligt meddelandet. Modellväljaren på Ramps Router‑sida omfattar för närvarande 27 modeller, från Claude Opus 5 och GPT‑5.6 Sol ner till budgetnivåer som GPT‑5.4 Nano och DeepSeek V4 Flash. Groks inkludering utökar en distributionsinsats som gjorde att Grok 4.6 nådde generell tillgänglighet på Amazon Bedrock samma dag.

Routningsmotorn tillämpar mer än 100 optimeringar inom modellval, cachning, komprimering, timing och hantering av förfrågningar, med automatisk fallback när en leverantör misslyckas. Team kan acceptera Ramps standardroutningsstrategi eller konfigurera egna kostnad‑prestandaprioriteringar per förfråganstyp. Alla modeller hostas på amerikansk infrastruktur, med alternativ för noll‑databevarande tillgängliga.

Ett benchmark byggt på produktionsarbete

Den bärande delen är Ramp SWE‑Bench, ett benchmark byggt på företagets faktiska produktionsuppgifter snarare än offentliga topplistor. Router testar kontinuerligt nya modeller mot den arbetsbelastningen och inför vinnarna i sina standardinställningar automatiskt. Den publicerade resultattabellen visar den spridning som routern utnyttjar: Claude Opus 5 löser uppgifter till en genomsnittlig kostnad på $1,84 per körning medan Qwen 3.7 Plus når en jämförbar lösningsgrad till $0,15, och GPT‑5.4 Nano hanterar billigare arbete till $0,09.

Denna typ av per‑förfrågningsarbitrage är den riktning som inferensekonomin har tagit i takt med att modellmenyn breddas. Benchmarkade tjänstekostnader varierar nu med mer än en tiopotenser mellan modeller för jämförbara lösningsgrader, en spridning som återfinns i Ramps SWE‑Bench‑tabell och i billigare inferenslösningar som Runwares containeriserade datacenter.

Vad kunder rapporterar och vad villkoren säger

Tidiga användare som nämns på produktsidan rapporterar besparingar långt över den genomsnittliga 40 %-nivån. Valentin De Matos från Delphi säger att hans företag kör miljarder token genom Router och minskade modellkostnaderna med 92 %. Anthropics chef för plattformsutveckling, Katelyn Lesse, sade att Claude är tillgänglig via Router från dag ett, och SpaceXAI meddelade att Groks inkludering utökar hur team kan integrera dess modeller i sina applikationer.

Det finstilta: gratis routing gäller fram till 2026, därefter har Ramp inte fastställt pris i meddelandet. Router lagrar modellens indata, utdata och metadata och använder dessa data för att förbättra tjänsten, men användare kan inaktivera detta i inställningarna och välja modeller som hostas i USA utan databevarande. Tjänsten är begränsad till amerikanska utvecklare och team vid lanseringen, med företagsfunktioner och fler länder som listas som kommande. Ramp säger att inget Ramp‑kort eller företagskonto krävs, och att byta en befintlig integration innebär en endaste rad för bas‑URL‑ändring för OpenAI‑ eller Anthropic‑SDK‑användare.

Theo Nash är en AI-genererad specialist på Unite.AI, som täcker AI-infrastruktur, beräkningar och de hårdvarusystem som driver modern konstgjord intelligens. Hans arbete fokuserar på de tekniska grunderna bakom storskaliga AI-arbetsbelastningar, inklusive datacenter, acceleratorer, nätverk och de programvarustackar som binder samman dem.
Med en analytisk och ingenjörsdriven perspektiv undersöker Theo hur framsteg inom GPU:er, anpassad kisel, minnesarkitekturer och distribuerade system möjliggör nya generationer av AI-modeller. Han ägnar särskild uppmärksamhet åt prestandaavvägningar, energoeffektivitet, skalbarhet och de praktiska begränsningarna som formar den verkliga distributionen av AI-infrastruktur.
Artiklar skrivna av Theo Nash är AI-genererade och granskade av Unite.AIs redaktionella team för att säkerställa teknisk noggrannhet, tydlighet och ansvarsfull rapportering om den snabbt utvecklande AI-beräkningslandskapet.