Mô hình và nền tảng AI

Ramp Mở Router.com Model Gateway Với Định Tuyến Miễn Phí Đến Năm 2026

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Ramp, nền tảng chi tiêu doanh nghiệp cung cấp hơn 200 tỷ USD mua sắm hàng năm, đã ra mắt Router.com vào ngày 19 tháng 8 năm 2026: một điểm cuối API duy nhất gửi mỗi yêu cầu AI tới mô hình có chi phí thấp nhất đáp ứng tiêu chuẩn chất lượng của nhà phát triển. Các khách hàng đã sử dụng dịch vụ này đã giảm chi phí suy luận trung bình 40%, theo thông báo của công ty. Định tuyến miễn phí đến năm 2026, người dùng trả giá niêm yết cho các token họ tiêu thụ và người dùng mới nhận được 26 USD tín dụng.

Sản phẩm là phiên bản công khai của công cụ mà Ramp tự xây dựng ba năm trước. Bằng cách ghép mỗi công việc nội bộ với mô hình phù hợp, công ty cho biết đã giảm chi phí suy luận của mình khoảng 30% cho cùng một đầu ra, đồng thời duy trì độ tin cậy trên 99,9% trong lưu lượng sản xuất. Trang Router cho biết khối lượng sản xuất hiện tại vượt quá 2,75 nghìn tỷ token được định tuyến hàng tháng.

“AI là mục chi tiêu tăng trưởng nhanh nhất ở hầu hết các công ty, và cũng là mục họ khó đo lường nhất,” Rahul Sengottuvelu, giám đốc công nghệ của Ramp, nói trong thông báo. “Router tập hợp mọi token vào một nơi và gửi mỗi yêu cầu tới mô hình cung cấp hiệu năng phù hợp với chi phí phù hợp.”

Thời điểm này phù hợp với dữ liệu nội bộ của Ramp. Ramp AI Index, công cụ theo dõi chi tiêu AI doanh nghiệp trên toàn bộ khách hàng của nền tảng, cho thấy chi tiêu AI đã tăng 20,7 lần kể từ tháng 6 năm 2025, theo thông báo.

Một Điểm Cuối, 27 Mô Hình và Đang Tăng

Các nhà phát triển kết nối qua một API tương thích với OpenAI và Anthropic và có thể truy cập các mô hình từ OpenAI, Anthropic và SpaceXAI, với hỗ trợ Gemini được liệt kê là sẽ sớm có. Các mô hình mở bao gồm Nvidia, Kimi, DeepSeek, GLM và Qwen được cung cấp qua các nhà cung cấp như Fireworks AI, trong khi Google, AWS, Together AI, Baseten và Crusoe đang được bổ sung, theo thông báo. Bộ chọn mô hình trên trang Router của Ramp hiện hiện có 27 mô hình, từ Claude Opus 5 và GPT-5.6 Sol đến các cấp ngân sách như GPT-5.4 Nano và DeepSeek V4 Flash. Việc đưa Grok vào danh sách mở rộng một đợt phân phối đã khiến Grok 4.6 đạt khả dụng chung trên Amazon Bedrock cùng ngày.

Công cụ định tuyến áp dụng hơn 100 tối ưu hoá trên việc lựa chọn mô hình, bộ nhớ đệm, nén, thời gian và xử lý yêu cầu, với cơ chế tự động chuyển sang dự phòng khi nhà cung cấp gặp lỗi. Các nhóm có thể chấp nhận chiến lược định tuyến mặc định của Ramp hoặc cấu hình ưu tiên chi phí‑hiệu năng riêng cho từng loại yêu cầu. Tất cả các mô hình đều được lưu trữ trên hạ tầng tại Hoa Kỳ, với tùy chọn không lưu trữ dữ liệu khả dụng.

Một Bảng Đánh Giá Được Xây Dựng Từ Công Việc Sản Xuất

Phần cốt lõi là Ramp SWE-Bench, một bộ tiêu chuẩn được xây dựng dựa trên các nhiệm vụ kỹ thuật sản xuất thực tế của công ty thay vì các bảng xếp hạng công khai. Router liên tục kiểm tra các mô hình mới dựa trên khối lượng công việc này và tự động đưa các mô hình thắng vào cấu hình mặc định. Bảng kết quả đã công bố cho thấy phạm vi mà router khai thác: Claude Opus 5 giải quyết các nhiệm vụ với chi phí trung bình 1,84 USD mỗi lần chạy, trong khi Qwen3.7 Plus đạt mức chi phí tương đương 0,15 USD, và GPT-5.4 Nano thực hiện công việc rẻ hơn với 0,09 USD.

Loại chênh lệch chi phí trên mỗi yêu cầu như vậy là hướng đi của kinh tế suy luận khi danh sách mô hình ngày càng mở rộng. Chi phí phục vụ được đo lường hiện nay chênh lệch hơn một bậc độ giữa các mô hình cho cùng mức độ giải quyết, một sự khác biệt được phản ánh trong bảng SWE-Bench của Ramp và trong các giải pháp suy luận giá rẻ như trung tâm dữ liệu container của Runware.

Khách Hàng Báo Cáo và Điều Khoản Nói Gì

Những người dùng sớm được nêu trên trang sản phẩm báo cáo mức tiết kiệm vượt xa mức trung bình 40%. Valentin De Matos của Delphi cho biết công ty của ông chạy hàng tỷ token qua Router và giảm chi phí mô hình tới 92%. Trưởng bộ phận kỹ thuật nền tảng của Anthropic, Katelyn Lesse, cho biết Claude đã có sẵn qua Router ngay từ ngày đầu, và SpaceXAI cho biết việc đưa Grok vào danh sách mở rộng cách các nhóm có thể tích hợp mô hình của họ vào ứng dụng.

Điều khoản chi tiết: định tuyến miễn phí kéo dài đến năm 2026, sau đó Ramp chưa công bố mức giá. Router lưu trữ đầu vào, đầu ra và siêu dữ liệu của mô hình và sử dụng dữ liệu này để cải thiện dịch vụ, tuy nhiên người dùng có thể tắt tính năng này trong cài đặt và chọn mô hình lưu trữ tại Hoa Kỳ với tùy chọn không lưu trữ dữ liệu. Dịch vụ ban đầu chỉ dành cho các nhà phát triển và nhóm tại Hoa Kỳ, với các tính năng doanh nghiệp và nhiều quốc gia khác sẽ sớm được bổ sung. Ramp cho biết không cần thẻ Ramp hay tài khoản công ty, và việc chuyển đổi tích hợp hiện có chỉ cần thay đổi một dòng base-URL cho người dùng SDK của OpenAI hoặc Anthropic.

Theo Nash là một chuyên gia được tạo bởi trí tuệ nhân tạo tại Unite.AI, chuyên về cơ sở hạ tầng trí tuệ nhân tạo, tính toán và các hệ thống phần cứng hỗ trợ trí tuệ nhân tạo hiện đại. Công việc của ông tập trung vào các nền tảng kỹ thuật đằng sau các công việc trí tuệ nhân tạo quy mô lớn, bao gồm trung tâm dữ liệu, tăng tốc, mạng và các phần mềm liên kết chúng lại với nhau.
Với quan điểm phân tích và kỹ thuật, Theo nghiên cứu cách các tiến bộ trong GPU, silicon tùy chỉnh, kiến trúc bộ nhớ và hệ thống phân tán cho phép tạo ra các mô hình trí tuệ nhân tạo mới. Ông đặc biệt chú ý đến việc trao đổi hiệu suất, hiệu quả năng lượng, khả năng mở rộng và các hạn chế thực tế định hình việc triển khai cơ sở hạ tầng trí tuệ nhân tạo trong thế giới thực.
Các bài viết được viết bởi Theo Nash được tạo bởi trí tuệ nhân tạo và được nhóm biên tập của Unite.AI xem xét để đảm bảo độ chính xác kỹ thuật, sự rõ ràng và phạm vi bao quát có trách nhiệm về tính toán trí tuệ nhân tạo đang phát triển nhanh chóng.