Modelos y plataformas de IA

Ramp abre Router.com Model Gateway con enrutamiento gratuito hasta 2026

mm
Añade Unite.AI a tus fuentes preferidas en Google

Ramp, la plataforma de gastos corporativos que impulsa más de $200 mil millones en compras anuales, lanzó Router.com el 19 de agosto de 2026: un único punto final de API que envía cada solicitud de IA al modelo de menor costo que cumple con el nivel de calidad del desarrollador. Los clientes que ya utilizan el servicio han reducido sus costos de inferencia en un 40 % en promedio, según el anuncio de la empresa. El enrutamiento es gratuito hasta 2026, con los usuarios pagando el precio de lista por los tokens que consumen y los nuevos usuarios recibiendo $26 en créditos.

El producto es la versión pública de la herramienta que Ramp construyó para sí misma hace tres años. Al asignar cada trabajo interno al modelo adecuado, la empresa dice que redujo sus propios costos de inferencia en aproximadamente un 30 % para el mismo resultado, manteniendo una fiabilidad superior al 99,9 % en el tráfico de producción. El sitio de Router indica que el volumen de producción actual supera los 2,75 billones de tokens enrutados mensualmente.

“La IA es la partida de gasto de más rápido crecimiento en la mayoría de las empresas, y la que menos pueden medir”, dijo Rahul Sengottuvelu, director de tecnología de Ramp, en el anuncio. “Router coloca cada token en un solo lugar y envía cada solicitud al modelo que brinda el rendimiento adecuado al costo correcto”.

El cronograma coincide con los propios datos de Ramp. El Ramp AI Index, que rastrea el gasto empresarial en IA en la base de clientes de la plataforma, muestra que el gasto en IA ha crecido 20,7 veces desde junio de 2025, según el anuncio.

Un punto final, 27 modelos y contando

Los desarrolladores se conectan a través de una única API compatible con OpenAI y Anthropic y acceden a modelos de OpenAI, Anthropic y SpaceXAI, con soporte para Gemini anunciado como próximamente. Los modelos de código abierto, incluidos Nvidia, Kimi, DeepSeek, GLM y Qwen, se sirven a través de proveedores como Fireworks AI, y se esperan Google, AWS, Together AI, Baseten y Crusoe, según el anuncio. El selector de modelos en la página Router de Ramp actualmente incluye 27 modelos, desde Claude Opus 5 y GPT‑5.6 Sol hasta niveles económicos como GPT‑5.4 Nano y DeepSeek V4 Flash. La inclusión de Grok amplía una iniciativa de distribución que vio a Grok 4.6 alcanzar disponibilidad general en Amazon Bedrock el mismo día.

El motor de enrutamiento aplica más de 100 optimizaciones en la selección de modelos, el almacenamiento en caché, la compresión, la temporización y el manejo de solicitudes, con conmutación automática a un respaldo cuando un proveedor falla. Los equipos pueden aceptar la estrategia de enrutamiento predeterminada de Ramp o configurar sus propias prioridades de costo‑rendimiento por tipo de solicitud. Todos los modelos se alojan en infraestructura basada en EE. UU., con opciones de retención cero de datos disponibles.

Un benchmark creado a partir del trabajo de producción

El componente estructural es Ramp SWE‑Bench, un benchmark creado a partir de las tareas reales de ingeniería de producción de la empresa en lugar de tablas de clasificación públicas. Router prueba continuamente nuevos modelos contra esa carga de trabajo e incorpora automáticamente los ganadores a sus valores predeterminados. La tabla de resultados publicada muestra la diferencia que explota el enrutador: Claude Opus 5 resuelve tareas con un costo medio de $1.84 por ejecución, mientras que Qwen 3.7 Plus alcanza una tasa de resolución comparable con $0.15, y GPT‑5.4 Nano maneja trabajos más baratos con $0.09.

Ese tipo de arbitraje por solicitud es a donde se dirige la economía de la inferencia a medida que el menú de modelos se amplía. Los costos de servicio evaluados ahora varían en más de un orden de magnitud entre modelos para tasas de resolución comparables, una diferencia reflejada en la tabla SWE‑Bench de Ramp y en soluciones de inferencia más económicas como los centros de datos contenedorizados de Runware.

Lo que los clientes informan y lo que dicen los términos

Los primeros usuarios citados en la página del producto informan ahorros muy superiores al promedio del 40 %. Valentin De Matos de Delphi afirma que su empresa procesa miles de millones de tokens a través de Router y redujo los costos de los modelos en un 92 %. La responsable de ingeniería de plataforma de Anthropic, Katelyn Lesse, dijo que Claude está disponible a través de Router desde el primer día, y SpaceXAI indicó que la inclusión de Grok amplía la forma en que los equipos pueden incorporar sus modelos a sus aplicaciones.

La letra pequeña: el enrutamiento gratuito se mantiene hasta 2026, después de lo cual Ramp no ha establecido precios en el anuncio. Router almacena las entradas, salidas y metadatos de los modelos y utiliza esos datos para mejorar el servicio, aunque los usuarios pueden desactivar esta opción en la configuración y seleccionar modelos alojados en EE. UU. sin retención de datos. El servicio está limitado a desarrolladores y equipos de EE. UU. en el lanzamiento, con funciones empresariales y más países anunciados como próximamente. Ramp afirma que no se requiere una tarjeta Ramp ni una cuenta empresarial, y cambiar una integración existente implica una modificación de una sola línea en la URL base para los usuarios del SDK de OpenAI o Anthropic.

Theo Nash es un especialista en inteligencia artificial generada en Unite.AI, que cubre la infraestructura de inteligencia artificial, el cómputo y los sistemas de hardware que alimentan la inteligencia artificial moderna. Su trabajo se centra en los fundamentos técnicos detrás de las cargas de trabajo de inteligencia artificial a gran escala, incluyendo centros de datos, aceleradores, redes y las pilas de software que los unen.
Con una perspectiva analítica y basada en la ingeniería, Theo examina cómo los avances en GPUs, silicio personalizado, arquitecturas de memoria y sistemas distribuidos permiten nuevas generaciones de modelos de inteligencia artificial. Presta especial atención a los compromisos de rendimiento, la eficiencia energética, la escalabilidad y las limitaciones prácticas que dan forma a la implementación en el mundo real de la infraestructura de inteligencia artificial.
Los artículos escritos por Theo Nash son generados por inteligencia artificial y revisados por el equipo editorial de Unite.AI para garantizar la precisión técnica, la claridad y la cobertura responsable del paisaje de cómputo de inteligencia artificial en constante evolución.