AI-mallit ja alustat

Ramp avaa Router.com -malligatewayn ilmaisella reitityksellä vuoteen 2026

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Ramp, yrityskulujen hallintaplatformi, joka mahdollistaa yli $200 miljardia ostoksia vuosittain, lanseerasi Router.comin 19. elokuuta 2026: yhden API-päätepisteen, joka lähettää jokaisen AI-pyynnön edullisimmalle mallille, joka täyttää kehittäjän laatuvaatimukset. Palvelua jo käyttäneet asiakkaat ovat keskimäärin vähentäneet inferenssikustannuksiaan 40 % yrityksen ilmoituksen mukaan. Reititys on ilmainen vuoteen 2026 asti, käyttäjät maksavat kuluttamiensa tokenien listahintaa ja uudet käyttäjät saavat $26 krediittejä.

Tuote on julkinen versio Rampin itse kolmessa vuodessa rakentamasta työkalusta. Sovittamalla jokainen sisäinen työ oikeaan malliin, yritys kertoo vähentäneensä omia inferenssikustannuksiaan noin 30 % samalla tuotoksella, samalla säilyttäen yli 99,9 %:n luotettavuuden tuotantoliikenteessä. Router-sivusto ilmoittaa nykyisen tuotantomäärän olevan yli 2,75 triljoonaa tokenia reititettynä kuukausittain.

“AI on nopeimmin kasvava kuluerä useimmissa yrityksissä, ja se on vaikein mitata,” sanoi Rahul Sengottuvelu, Rampin teknologiajohtaja, ilmoituksessa. “Router sijoittaa jokaisen tokenin yhteen paikkaan ja lähettää jokaisen pyynnön mallille, joka tarjoaa oikean suorituskyvyn oikeaan hintaan.”

Aikataulu heijastaa Rampin omia tietoja. Ramp AI Index, joka seuraa yritysten AI-kulutusta alustan asiakaskunnassa, osoittaa AI-kulujen kasvaneen 20,7‑kertaisiksi kesäkuun 2025 jälkeen, ilmoitus kertoo.

Yksi päätepiste, 27 mallia ja lisää

Kehittäjät yhdistävät yhteen OpenAI- ja Anthropic-yhteensopivaan API:in ja pääsevät malleihin OpenAI:lta, Anthropicilta ja SpaceXAI:lta, ja Gemini-tuki on tulossa. Avoimen painon mallit, kuten Nvidia, Kimi, DeepSeek, GLM ja Qwen, tarjoillaan palveluntarjoajien kuten Fireworks AI:n kautta, ja Google, AWS, Together AI, Baseten ja Crusoe ovat tulossa, ilmoituksen mukaan. Mallivalitsin Rampin Router-sivulla kattaa tällä hetkellä 27 mallia, Claude Opus 5:stä ja GPT-5.6 Sol:sta alkaen budjettitasoihin kuten GPT-5.4 Nano ja DeepSeek V4 Flash. Grokin sisällyttäminen laajentaa jakeluponnistusta, jonka seurauksena Grok 4.6 sai yleisen saatavuuden Amazon Bedrockissa samana päivänä.

Reititysmotorissa on yli 100 optimointia mallivalinnan, välimuistin, pakkaamisen, ajoituksen ja pyyntöjen käsittelyn osalta, ja se käyttää automaattista varmistusreittiä, kun palveluntarjoaja epäonnistuu. Tiimit voivat hyväksyä Rampin oletusreititysstrategian tai määrittää omat kustannus‑suorituskykyprioriteettinsa jokaiselle pyyntötyypille. Kaikki mallit isännöidään Yhdysvalloissa sijaitsevassa infrastruktuurissa, ja nolladata‑säilytysmahdollisuudet ovat saatavilla.

Tuotantotyöstä rakennettu benchmark

Raskaan kantavan osan muodostaa Ramp SWE-Bench, benchmark, joka on rakennettu yrityksen todellisista tuotantotekniikkatehtävistä julkisten tulostaulukoiden sijaan. Router testaa jatkuvasti uusia malleja tätä työkuormaa vastaan ja sisällyttää voittajat automaattisesti oletuksiinsa. Julkaistu tulostaulukko näyttää reitittimen hyödyntämän hajonnan: Claude Opus 5 ratkaisee tehtäviä keskimääräisin kustannuksin $1.84 per suorituskerta, kun taas Qwen3.7 Plus saavuttaa vastaavan ratkaisunopeuden $0.15, ja GPT-5.4 Nano käsittelee halvempaa työtä $0.09.

Tällainen pyyntökohtainen arbitraasi on se suunta, johon inferenssitalous on menossa mallivalikon laajentuessa. Benchmarkatut palvelukustannukset vaihtelevat nyt yli yhden suuruusluokan mallien välillä samankaltaisilla ratkaisunopeuksilla, mikä heijastuu Rampin SWE-Bench-taulukossa ja edullisemmissa inferenssiratkaisuissa kuten Runwaren kontitettuissa datakeskuksissa.

Mitä asiakkaat raportoivat ja mitä ehdot sanovat

Tuotesivulla mainitut varhaiset käyttäjät raportoivat säästöistä, jotka ylittävät 40 % keskiarvon merkittävästi. Valentin De Matos Delphiltä kertoo, että hänen yrityksensä käsittelee miljardeja tokeneita Routerin kautta ja on vähentänyt mallikustannuksia 92 %. Anthropicin alustan insinööritiimin johtaja Katelyn Lesse totesi, että Claude on saatavilla Routerin kautta alusta alkaen, ja SpaceXAI kertoi, että Grokin sisällyttäminen laajentaa tapoja, joilla tiimit voivat tuoda sen malleja sovelluksiinsa.

Pieni tarkennus: ilmainen reititys jatkuu vuoteen 2026, jonka jälkeen Ramp ei ole ilmoittanut hinnoittelua. Router tallentaa mallien syötteet, tulokset ja metatiedot ja käyttää näitä tietoja palvelun parantamiseen, vaikka käyttäjät voivat kytkeä tämän pois asetuksista ja valita Yhdysvalloissa isännöidyt mallit ilman datan säilytystä. Palvelu on aloitusvaiheessa rajoitettu Yhdysvaltain kehittäjille ja tiimeille, ja yritysominaisuudet sekä lisää maita on ilmoitettu tulossa pian. Ramp sanoo, ettei Ramp-korttia tai yritystiliä tarvita, ja olemassa olevan integraation vaihtaminen on yhden rivin base-URL-muutos OpenAI- tai Anthropic SDK -käyttäjille.

Theo Nash on tekoälygeneroitu asiantuntija Unite.AI:ssa, joka kattaa tekoälyinfrastruktuurin, laskennan ja modernin tekoälyä voimistavat laitteistojärjestelmät. Hänen työnsä keskittyy suurten tekoälykuormien taustalla oleviin teknisiin perusteisiin, mukaan lukien datakeskukset, kiihdyttimet, verkkotiet ja ohjelmistopinot, jotka sitoutuvat niihin.
Analyytisesta ja insinöörijohtoisesta näkökulmasta Theo tarkastelee, miten GPU:n, mukautetun piirin, muistiarkkitehtuurien ja hajautettujen järjestelmien edistysaskeleet mahdollistavat uusia tekoälymallien sukupolvia. Hän kiinnittää erityistä huomiota suorituskyky-yhteyksiin, energiatehokkuuteen, skaalautuvuuteen ja käytännön rajoituksiin, jotka muokkaavat tekoälyinfrastruktuurin todellista käyttöönottoa.
Artikkelit, joita Theo Nash on kirjoittanut, on tekoälygeneroitu ja Unite.AI:n toimittajatiimi on tarkastanut ne varmistaakseen teknisen tarkkuuden, selkeyden ja vastuullisen kattavuuden nopeasti kehittyvässä tekoälylaskennan maisemassa.