AI 모델 및 플랫폼

Ramp, Router.com 모델 게이트웨이 개설… 2026년까지 무료 라우팅 제공

mm
Unite.AI를 Google의 선호 소스에 추가

Ramp는 연간 2천억 달러 이상의 구매를 지원하는 기업 지출 플랫폼으로, 2026년 8월 19일에 Router.com을 출시했습니다: 개발자가 설정한 품질 기준을 충족하는 최저 비용 모델로 각 AI 요청을 전달하는 단일 API 엔드포인트입니다. 이미 서비스를 사용 중인 고객들은 평균 40% 정도 추론 비용을 절감했다고 회사 발표에서 밝혔습니다. 라우팅은 2026년까지 무료이며, 사용자는 소비한 토큰에 대한 정가를 지불하고 신규 사용자는 26달러 크레딧을 받습니다.

이 제품은 Ramp가 3년 전 자체적으로 구축한 도구의 공개 버전입니다. 내부 작업을 적절한 모델에 매칭함으로써, 동일한 출력에 대해 자체 추론 비용을 약 30% 절감하면서도 프로덕션 트래픽에서 99.9% 이상의 신뢰성을 유지했다고 회사는 말합니다. Router 사이트에 따르면 현재 월간 라우팅 토큰량이 2.75조 개를 넘어섭니다.

“AI는 대부분의 기업에서 가장 빠르게 성장하는 비용 항목이며, 가장 측정하기 어려운 항목입니다”라고 Ramp의 최고 기술 책임자 Rahul Sengottuvelu가 발표에서 말했습니다. “Router는 모든 토큰을 한 곳에 모아 개발자가 원하는 성능과 비용을 제공하는 모델에 각 요청을 전달합니다.”

시기는 Ramp 자체 데이터와도 일치합니다. Ramp AI Index는 플랫폼 고객 기반 전체의 비즈니스 AI 지출을 추적하는데, 발표에 따르면 AI 지출이 2025년 6월 이후 20.7배 성장했다고 합니다.

One Endpoint, 27 Models and Counting

개발자는 OpenAI 및 Anthropic과 호환되는 단일 API를 통해 OpenAI, Anthropic, SpaceXAI의 모델에 접근할 수 있으며, Gemini 지원은 곧 제공될 예정이라고 명시되었습니다. Nvidia, Kimi, DeepSeek, GLM, Qwen 등 오픈웨이트 모델은 Fireworks AI와 같은 공급자를 통해 제공되며, Google, AWS, Together AI, Baseten, Crusoe가 차례로 추가될 예정이라고 발표했습니다. Ramp의 Router 페이지에 있는 모델 선택기는 현재 Claude Opus 5와 GPT-5.6 Sol부터 GPT-5.4 Nano, DeepSeek V4 Flash와 같은 저가 모델까지 총 27개의 모델을 포함하고 있습니다. Grok이 포함되면서 같은 날 Amazon Bedrock에 Grok 4.6이 일반 가용성을 얻는 배포가 확대되었습니다.

라우팅 엔진은 모델 선택, 캐싱, 압축, 타이밍, 요청 처리 등 100가지가 넘는 최적화를 적용하며, 공급자가 실패할 경우 자동으로 폴백합니다. 팀은 Ramp의 기본 라우팅 전략을 그대로 사용하거나 요청 유형별로 자체 비용‑성능 우선순위를 설정할 수 있습니다. 모든 모델은 미국 기반 인프라에서 호스팅되며, 데이터 보존이 전혀 없는 옵션도 제공됩니다.

A Benchmark Built From Production Work

핵심 요소는 Ramp SWE-Bench로, 공개 순위표가 아닌 회사의 실제 프로덕션 엔지니어링 작업을 기반으로 만든 벤치마크입니다. Router는 지속적으로 새로운 모델을 해당 워크로드에 테스트하고, 우수 모델을 자동으로 기본값에 반영합니다. 공개된 결과 표는 라우터가 활용하는 차이를 보여줍니다: Claude Opus 5는 실행당 평균 1.84달러의 비용으로 작업을 해결하고, Qwen3.7 Plus는 0.15달러에 비슷한 해결률을 보이며, GPT-5.4 Nano는 0.09달러에 더 저렴한 작업을 처리합니다.

이러한 요청당 차익 거래는 모델 라인업이 확대됨에 따라 추론 경제학이 나아가고 있는 방향을 나타냅니다. 벤치마크된 서비스 비용은 동일한 해결률을 기준으로 모델마다 한 자릿수 이상 차이가 나며, 이는 Ramp의 SWE-Bench 표와 Runware의 컨테이너형 데이터 센터와 같은 저비용 추론 솔루션에서도 확인됩니다.

What Customers Report and What the Terms Say

제품 페이지에 인용된 초기 사용자는 평균 40%를 훨씬 상회하는 절감 효과를 보고했습니다. Delphi의 Valentin De Matos는 자사에서 수십억 개의 토큰을 Router를 통해 처리하면서 모델 비용을 92% 절감했다고 말했습니다. Anthropic 플랫폼 엔지니어링 책임자 Katelyn Lesse는 Claude가 출시 첫날부터 Router를 통해 이용 가능하다고 밝혔으며, SpaceXAI는 Grok이 포함됨으로써 팀이 해당 모델을 애플리케이션에 도입할 수 있는 범위가 확대됐다고 전했습니다.

세부 사항: 무료 라우팅은 2026년까지 제공되며, 이후 가격 정책은 아직 발표되지 않았습니다. Router는 모델 입력, 출력 및 메타데이터를 저장해 서비스 개선에 활용하지만, 사용자는 설정에서 이를 비활성화하고 데이터 보존이 전혀 없는 미국 호스팅 모델을 선택할 수 있습니다. 서비스는 출시 시점에 미국 개발자와 팀에만 제한되며, 엔터프라이즈 기능 및 추가 국가 지원이 곧 제공될 예정입니다. Ramp는 Ramp 카드나 기업 계정이 필요 없으며, 기존 통합을 전환하려면 OpenAI 또는 Anthropic SDK 사용자는 베이스 URL을 한 줄만 바꾸면 됩니다.

테오 내쉬유나이트.AI의 AI 생성 전문가로, AI 인프라, 컴퓨팅, 및 현대적인 인공 지능을 구동하는 하드웨어 시스템을 다룹니다. 그의 작업은 대규모 AI 워크로드를 위한 기술적 기초에 중점을 두고 있으며, 데이터 센터, 가속기, 네트워킹, 및 이를 연결하는 소프트웨어 스택을 포함합니다.
분석적이고 엔지니어링 중심의 관점에서 테오 내쉬는 GPU, 커스텀 실리콘, 메모리 아키텍처, 및 분산 시스템의 발전에 따라 새로운 세대의 AI 모델이 어떻게 가능해지는지 조사합니다. 그는 성능 트레이드오프, 에너지 효율성, 확장성, 및 실제로 AI 인프라를 배치하는 실질적인 제약에 특별한 주의를 기울입니다.
테오 내쉬가 작성한 기사들은 AI로 생성되어 유나이트.AI의 편집 팀에 의해 검토되어 기술적 정확성, 명확성, 및 급변하는 AI 컴퓨팅 환경에 대한 책임 있는 보도를 보장합니다.