Modelos e plataformas de IA

Ramp lança o gateway de modelos Router.com com roteamento gratuito até 2026

mm
Adicione Unite.AI às suas fontes preferidas no Google

Ramp, a plataforma de gastos corporativos que movimenta mais de $200 bilhões em compras anualmente, lançou o Router.com em 19 de agosto de 2026: um único ponto de API que encaminha cada solicitação de IA para o modelo de menor custo que atende ao critério de qualidade do desenvolvedor. Clientes que já utilizam o serviço reduziram seus custos de inferência em 40 % em média, segundo o anúncio da empresa. O roteamento é gratuito até 2026, com os usuários pagando o preço de tabela pelos tokens consumidos e novos usuários recebendo $26 em créditos.

O produto é a versão pública da ferramenta que a Ramp desenvolveu para si mesma há três anos. Ao combinar cada tarefa interna ao modelo adequado, a empresa afirma que reduziu seus próprios custos de inferência em cerca de 30 % para o mesmo resultado, mantendo mais de 99,9 % de confiabilidade no tráfego de produção. O site do Router indica que o volume de produção atual ultrapassa 2,75 trilhões de tokens roteados por mês.

“A IA é a linha de despesa que mais cresce na maioria das empresas, e a que eles menos conseguem mensurar”, disse Rahul Sengottuvelu, diretor de tecnologia da Ramp, no anúncio. “O Router reúne todos os tokens em um único lugar e encaminha cada solicitação ao modelo que oferece o desempenho correto ao custo adequado.”

O cronograma acompanha os próprios dados da Ramp. O Ramp AI Index, que monitora os gastos empresariais com IA em toda a base de clientes da plataforma, mostra que os gastos com IA cresceram 20,7 vezes desde junho de 2025, conforme o anúncio.

Um endpoint, 27 modelos e contando

Os desenvolvedores se conectam por meio de uma única API compatível com OpenAI e Anthropic e acessam modelos da OpenAI, Anthropic e SpaceXAI, com suporte ao Gemini previsto em breve. Modelos de código aberto, incluindo Nvidia, Kimi, DeepSeek, GLM e Qwen, são oferecidos por provedores como Fireworks AI, com Google, AWS, Together AI, Baseten e Crusoe a caminho, segundo o anúncio. O seletor de modelos na página Router da Ramp atualmente abrange 27 modelos, desde Claude Opus 5 e GPT‑5.6 Sol até categorias econômicas como GPT‑5.4 Nano e DeepSeek V4 Flash. A inclusão do Grok amplia um impulso de distribuição que fez o Grok 4.6 alcançar disponibilidade geral na Amazon Bedrock no mesmo dia.

O mecanismo de roteamento aplica mais de 100 otimizações em seleção de modelo, cache, compressão, temporização e tratamento de solicitações, com fallback automático quando um provedor falha. As equipes podem aceitar a estratégia de roteamento padrão da Ramp ou configurar suas próprias prioridades de custo‑desempenho por tipo de solicitação. Todos os modelos são hospedados em infraestrutura baseada nos EUA, com opções de retenção zero de dados disponíveis.

Um benchmark construído a partir de trabalho de produção

O elemento estrutural é o Ramp SWE‑Bench, um benchmark construído a partir das tarefas reais de engenharia de produção da empresa, e não de rankings públicos. O Router testa continuamente novos modelos contra essa carga de trabalho e incorpora automaticamente os vencedores aos seus padrões. A tabela de resultados publicada mostra a diferença que o router explora: Claude Opus 5 resolve tarefas com custo médio de $1.84 por execução, enquanto o Qwen 3.7 Plus atinge taxa de solução comparável por $0.15, e o GPT‑5.4 Nano lida com trabalhos mais baratos por $0.09.

Esse tipo de arbitragem por solicitação é a direção que a economia de inferência tem tomado à medida que o catálogo de modelos se expande. Os custos de serviço avaliados agora variam em mais de uma ordem de magnitude entre os modelos para taxas de solução comparáveis, diferença refletida na tabela SWE‑Bench da Ramp e em soluções de inferência mais baratas, como os data centers conteinerizados da Runware.

O que os clientes relatam e o que os termos dizem

Os primeiros usuários citados na página do produto relatam economias muito superiores à média de 40 %. Valentin De Matos, da Delphi, afirma que sua empresa processa bilhões de tokens pelo Router e reduziu os custos de modelo em 92 %. A chefe de engenharia de plataforma da Anthropic, Katelyn Lesse, disse que o Claude está disponível no Router desde o primeiro dia, e a SpaceXAI afirmou que a inclusão do Grok amplia as formas como as equipes podem integrar seus modelos às aplicações.

A letra miúda: o roteamento gratuito funciona até 2026, após o qual a Ramp não definiu preços no anúncio. O Router armazena entradas, saídas e metadados dos modelos e usa esses dados para melhorar o serviço, embora os usuários possam desativar isso nas configurações e escolher modelos hospedados nos EUA com retenção zero de dados. O serviço está limitado a desenvolvedores e equipes dos EUA no lançamento, com recursos empresariais e mais países listados como em breve. A Ramp afirma que nenhum cartão Ramp ou conta corporativa é necessário, e trocar uma integração existente é uma alteração de uma linha no URL base para usuários dos SDKs da OpenAI ou Anthropic.

Theo Nash é um especialista em AI gerado pela Unite.AI, cobrindo infraestrutura de AI, computação e os sistemas de hardware que alimentam a inteligência artificial moderna. Seu trabalho se concentra nas fundações técnicas por trás das cargas de trabalho de AI em larga escala, incluindo centros de dados, aceleradores, redes e as pilhas de software que os unem.
Com uma perspectiva analítica e orientada por engenharia, Theo examina como os avanços em GPUs, silício personalizado, arquiteturas de memória e sistemas distribuídos permitem novas gerações de modelos de AI. Ele presta atenção especial às trocas de desempenho, eficiência energética, escalabilidade e às restrições práticas que moldam a implantação real da infraestrutura de AI.
Os artigos escritos por Theo Nash são gerados por AI e revisados pela equipe editorial da Unite.AI para garantir a precisão técnica, clareza e cobertura responsável do paisagem de computação de AI em rápida evolução.