Modelli e piattaforme di IA

Ramp apre il gateway di modelli Router.com con routing gratuito fino al 2026

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Ramp, la piattaforma di spese aziendali che gestisce oltre $200 miliardi di acquisti all’anno, ha lanciato Router.com il 19 agosto 2026: un unico endpoint API che invia ogni richiesta AI al modello a minor costo che soddisfa i criteri di qualità dello sviluppatore. I clienti che già utilizzano il servizio hanno ridotto i costi di inferenza del 40 % in media, secondo l’annuncio dell’azienda. Il routing è gratuito fino al 2026, con gli utenti che pagano il prezzo di listino per i token consumati e i nuovi utenti che ricevono $26 in crediti.

Il prodotto è la versione pubblica degli strumenti che Ramp ha sviluppato internamente tre anni fa. Abbinando ogni lavoro interno al modello più adatto, l’azienda afferma di aver ridotto i propri costi di inferenza di circa il 30 % per lo stesso output, mantenendo un’affidabilità superiore al 99,9 % sul traffico di produzione. Il sito Router indica un volume di produzione attuale di oltre 2,75 trilioni di token instradati mensilmente.

“L’AI è la voce di spesa a più rapida crescita nella maggior parte delle aziende, ed è quella che possono misurare meno”, ha dichiarato Rahul Sengottuvelu, chief technology officer di Ramp, nell’annuncio. “Router raccoglie ogni token in un unico posto e invia ogni richiesta al modello che offre le prestazioni giuste al costo giusto”.

Il cronometraggio segue i dati di Ramp. Il Ramp AI Index, che traccia le spese AI aziendali tra i clienti della piattaforma, mostra che le spese AI sono cresciute di 20,7 volte dal giugno 2025, secondo l’annuncio.

Un endpoint, 27 modelli e in crescita

Gli sviluppatori si connettono tramite un’unica API compatibile con OpenAI e Anthropic e accedono a modelli di OpenAI, Anthropic e SpaceXAI, con il supporto a Gemini previsto a breve. Modelli a peso aperto, tra cui Nvidia, Kimi, DeepSeek, GLM e Qwen, sono forniti da provider come Fireworks AI, con Google, AWS, Together AI, Baseten e Crusoe in arrivo, secondo l’annuncio. Il selettore di modelli sulla la pagina Router di Ramp attualmente comprende 27 modelli, da Claude Opus 5 e GPT‑5.6 Sol fino a tier economici come GPT‑5.4 Nano e DeepSeek V4 Flash. L’inclusione di Grok amplia una spinta di distribuzione che ha visto Grok 4.6 raggiungere la disponibilità generale su Amazon Bedrock lo stesso giorno.

Il motore di routing applica più di 100 ottimizzazioni su selezione del modello, caching, compressione, tempistica e gestione delle richieste, con fallback automatico quando un provider fallisce. I team possono accettare la strategia di routing predefinita di Ramp o configurare le proprie priorità di costo‑prestazione per tipo di richiesta. Tutti i modelli sono ospitati su infrastrutture con sede negli Stati Uniti, con opzioni di zero conservazione dei dati disponibili.

Un benchmark costruito dal lavoro di produzione

Il pilastro fondamentale è Ramp SWE‑Bench, un benchmark basato sui veri compiti di ingegneria di produzione dell’azienda anziché su classifiche pubbliche. Router testa continuamente nuovi modelli contro quel carico di lavoro e incorpora automaticamente i vincitori nelle impostazioni predefinite. La tabella dei risultati pubblicata mostra la differenza che il router sfrutta: Claude Opus 5 risolve i compiti a un costo medio di $1,84 per esecuzione, mentre Qwen3.7 Plus raggiunge un tasso di risoluzione comparabile a $0,15, e GPT‑5.4 Nano gestisce lavori più economici a $0,09.

Questo tipo di arbitraggio per singola richiesta è la direzione verso cui si sta muovendo l’economia dell’inferenza man mano che il catalogo di modelli si espande. I costi di servizio benchmarkati variano ora di più di un ordine di grandezza tra i modelli per tassi di risoluzione comparabili, una differenza riflessa nella tabella SWE‑Bench di Ramp e in soluzioni a inferenza più economica come i data center containerizzati di Runware.

Ciò che i clienti segnalano e ciò che dicono i termini

Gli utenti precoci citati nella pagina prodotto segnalano risparmi ben al di sopra della media del 40 %. Valentin De Matos di Delphi afferma che la sua azienda elabora miliardi di token tramite Router e ha ridotto i costi dei modelli del 92 %. Il responsabile dell’ingegneria di piattaforma di Anthropic, Katelyn Lesse, ha dichiarato che Claude è disponibile tramite Router fin dal primo giorno, e SpaceXAI ha affermato che l’inclusione di Grok amplia le possibilità per i team di integrare i suoi modelli nelle proprie applicazioni.

Il testo in piccolo: il routing gratuito è valido fino al 2026; dopo tale data Ramp non ha ancora definito i prezzi nell’annuncio. Router conserva input, output e metadati dei modelli e utilizza questi dati per migliorare il servizio, sebbene gli utenti possano disattivare questa funzione nelle impostazioni e scegliere modelli ospitati negli Stati Uniti con zero conservazione dei dati. Il servizio è limitato a sviluppatori e team statunitensi al lancio, con funzionalità enterprise e ulteriori paesi in arrivo. Ramp dichiara che non è necessaria né una carta Ramp né un account aziendale, e passare a un’integrazione esistente richiede una modifica di una sola riga dell’URL di base per gli utenti degli SDK OpenAI o Anthropic.

Theo Nash è uno specialista generato da AI presso Unite.AI, che copre l'infrastruttura AI, il calcolo e i sistemi hardware che alimentano l'intelligenza artificiale moderna. Il suo lavoro si concentra sulle fondamenta tecniche di grandi carichi di lavoro AI, tra cui data center, acceleratori, networking e gli stack software che li collegano.
Con una prospettiva analitica e ingegneristica, Theo esamina come i progressi nelle GPU, nel silicio personalizzato, nelle architetture della memoria e nei sistemi distribuiti consentono nuove generazioni di modelli AI. Presta particolare attenzione ai compromessi di prestazioni, all'efficienza energetica, alla scalabilità e alle limitazioni pratiche che influenzano il dispiegamento di infrastrutture AI nel mondo reale.
Gli articoli scritti da Theo Nash sono generati da AI e revisionati dal team editoriale di Unite.AI per garantire l'accuratezza tecnica, la chiarezza e la copertura responsabile del panorama in rapida evoluzione del calcolo AI.