Mô hình và nền tảng AI
Spectro Cloud Ra Mắt PaletteAI Inference Launchpad Để Giúp Doanh Nghiệp Kiểm Soát Chi Phí Token AI

Spectro Cloud đã ra mắt PaletteAI Inference Launchpad, một nền tảng suy luận được quản lý cục bộ được thiết kế để giúp doanh nghiệp giảm sự phụ thuộc vào dịch vụ mô hình bên ngoài và có được nhiều quyền kiểm soát hơn đối với chi phí ngày càng tăng của các công việc trí tuệ nhân tạo.
Công ty cho biết các tổ chức có thể giảm chi phí token bên ngoài xuống tới 70%, tùy thuộc vào hỗn hợp công việc, cơ sở hạ tầng và lựa chọn mô hình của họ. Spectro Cloud cũng đã mở rộng hỗ trợ của PaletteAI cho cơ sở hạ tầng dựa trên AMD, mang lại cho khách hàng nhiều lựa chọn hơn về đơn vị xử lý đồ họa (GPU), thời gian chạy suy luận và công nghệ phục vụ mô hình.
Những thông báo này phản ánh một sự thay đổi rộng lớn hơn trong trí tuệ nhân tạo doanh nghiệp. Khi các công ty vượt qua giai đoạn thử nghiệm và triển khai trí tuệ nhân tạo trên toàn bộ dịch vụ khách hàng, phát triển phần mềm, phân tích và hoạt động nội bộ, chi phí xử lý đầu vào và đầu ra của mô hình đang trở thành một mối quan tâm cơ sở hạ tầng đáng kể.
Đưa Suy Luận Trí Tuệ Nhân Tạo Lên Gần Dữ Liệu Doanh Nghiệp
PaletteAI Inference Launchpad được xây dựng xung quanh một cách tiếp cận ưu tiên cục bộ đối với suy luận. Thay vì tự động gửi mọi yêu cầu đến mô hình biên giới được lưu trữ bên ngoài, các tổ chức có thể chạy các công việc phù hợp trên cơ sở hạ tầng nằm trong trung tâm dữ liệu của riêng họ, đám mây riêng, môi trường chủ quyền hoặc vị trí biên.
Doanh nghiệp vẫn có thể giữ lại quyền truy cập vào mô hình biên giới được lưu trữ bên ngoài cho các nhiệm vụ yêu cầu khả năng của chúng. Nền tảng này được thiết kế để định tuyến yêu cầu giữa mô hình cục bộ và bên ngoài dựa trên các yếu tố như chi phí, hiệu suất, yêu cầu quản lý và độ phức tạp của nhiệm vụ.
Mô hình này có thể trở nên ngày càng quan trọng khi các tổ chức áp dụng các mô hình nhỏ hơn và chuyên biệt hơn. Một yêu cầu hỗ trợ khách hàng, nhiệm vụ phân loại tài liệu hoặc truy vấn kiến thức nội bộ có thể không yêu cầu khả năng mô hình giống như suy luận nâng cao, mã hóa phức tạp hoặc phân tích đa phương thức.
Giữ công việc phù hợp ở địa phương cũng có thể giảm độ trễ bằng cách đưa suy luận gần hơn với ứng dụng, người dùng và nguồn dữ liệu. Đối với các tổ chức hoạt động trong các ngành được quản lý, xử lý cục bộ có thể cung cấp quyền kiểm soát tốt hơn đối với nơi thông tin nhạy cảm được xử lý.
Sử Dụng Token Trở Thành Một Chỉ Số Cơ Sở Hạ Tầng
Token là đơn vị mà các mô hình trí tuệ nhân tạo chia và xử lý văn bản, mã và thông tin khác. Mỗi lời nhắc và phản hồi được tạo ra tiêu thụ token, và nhiều dịch vụ mô hình thương mại tính phí theo số token được xử lý.
Điều này có nghĩa là chi phí AI có thể tăng nhanh khi hệ thống chuyển từ thử nghiệm có kiểm soát sang các ứng dụng phục vụ hàng nghìn nhân viên hoặc khách hàng. Vấn đề trở nên phức tạp hơn với các đại lý AI, những đại lý này có thể thực hiện nhiều cuộc gọi mô hình, thu thập thông tin, đánh giá kết quả và sử dụng công cụ bên ngoài trước khi hoàn thành một nhiệm vụ.
Nghiên cứu của Goldman Sachs dự đoán rằng tiêu thụ token AI hàng tháng sẽ tăng 24 lần giữa năm 2026 và 2030, đạt khoảng 120 nghìn tỷ token mỗi tháng. Sự tăng trưởng dự kiến này đang được thúc đẩy bởi việc áp dụng doanh nghiệp ngày càng tăng và sự xuất hiện của các đại lý AI tự động hơn.
Inference Launchpad giải quyết vấn đề này bằng cách cung cấp cho các nhóm cơ sở hạ tầng các công cụ để đo lường tiêu thụ token, thiết lập hạn ngạch và áp dụng chính sách sử dụng. Những kiểm soát này có thể giúp các công ty hiểu rõ hơn về các nhóm, ứng dụng và mô hình nào chịu trách nhiệm cho chi tiêu AI của họ, thay vì coi suy luận như một khoản phí dịch vụ bên ngoài không thể đoán trước.
Giảm 70% được Spectro Cloud trích dẫn nên được xem như một kết quả có thể xảy ra chứ không phải là tiết kiệm được đảm bảo. Kinh tế thực tế sẽ phụ thuộc vào chi phí mua hoặc thuê GPU, tỷ lệ sử dụng, tiêu thụ năng lượng, hiệu quả mô hình, khối lượng yêu cầu và giá của nhà cung cấp bên ngoài.
Mô Hình Địa Phương Không Loại Bỏ Mô Hình Biên Giới
Khả năng định tuyến mô hình của nền tảng này được thiết kế để tránh buộc các doanh nghiệp phải đưa ra quyết định tất cả hoặc không có gì về mô hình cục bộ hoặc mô hình đám mây.
Các tổ chức có thể sử dụng mô hình cục bộ nhỏ hơn cho các nhiệm vụ có thể dự đoán hoặc nhạy cảm về quyền riêng tư trong khi gửi các yêu cầu đòi hỏi hơn đến mô hình biên giới. Các chính sách cũng có thể xác định mô hình nào được phép cho các bộ phận, khu vực pháp lý hoặc phân loại dữ liệu cụ thể.
Điều này giới thiệu quản lý trực tiếp vào lớp suy luận. Ví dụ, một tổ chức tài chính có thể ngăn chặn thông tin nhất định rời khỏi môi trường được kiểm soát, trong khi cho phép các yêu cầu không nhạy cảm sử dụng mô hình bên ngoài. Một công ty đa quốc gia có thể áp dụng các quy tắc định tuyến khác nhau dựa trên yêu cầu dữ liệu khu vực.
Spectro Cloud đã định vị việc lựa chọn mô hình và quản lý như một phần của chiến lược quản lý cơ sở hạ tầng PaletteAI rộng lớn hơn. Nền tảng này hỗ trợ môi trường GPU được chia sẻ, truy cập dựa trên vai trò, hạn ngạch tài nguyên và kiểm soát cấp độ người thuê nhà nhằm cho phép nhiều nhóm sử dụng cùng một cơ sở hạ tầng mà không cần truy cập không hạn chế vào hệ thống cơ bản.
Mở Rộng Hỗ Trợ Cơ Sở Hạ Tầng AI AMD
Cùng với Inference Launchpad, Spectro Cloud đã công bố hỗ trợ rộng hơn cho môi trường AI dựa trên AMD.
Tích hợp bao gồm GPU AMD, AMD GPU Operator, phần mềm ROCm và AMD Inference Microservices, thường được gọi là AIMs. Những thành phần này giải quyết các lớp khác nhau của cơ sở hạ tầng cần thiết để vận hành mô hình AI trong sản xuất.
AMD GPU Operator đơn giản hóa việc cấu hình và quản lý các gia tốc AMD Instinct trong các cụm Kubernetes. ROCm cung cấp phần mềm mở cơ bản, bao gồm trình điều khiển, thư viện, thời gian chạy và công cụ phát triển được sử dụng để chạy các công việc trí tuệ nhân tạo và tính toán hiệu suất cao trên phần cứng AMD.
AIMs cung cấp các dịch vụ suy luận vi mô tiêu chuẩn hóa để phục vụ mô hình trên GPU AMD Instinct. Chúng được thiết kế để đóng gói các mô hình được tối ưu hóa và phần mềm hỗ trợ vào các dịch vụ có thể triển khai, giảm một số công việc tích hợp thường cần thiết để di chuyển một mô hình vào sản xuất.
Đối với khách hàng doanh nghiệp, hỗ trợ mở rộng này có thể làm cho việc vận hành môi trường GPU hỗn hợp trở nên dễ dàng hơn, thay vì xây dựng các quy trình quản lý riêng biệt cho cơ sở hạ tầng NVIDIA (NVDA ) và AMD.
Quản Lý Tầng Lớp Từ Phần Cứng Đến Mô Hình
Spectro Cloud ban đầu đã phát triển Palette như một nền tảng quản lý Kubernetes cho việc triển khai và duy trì các cụm trên đám mây công cộng, trung tâm dữ liệu riêng, hệ thống không có vỏ và vị trí biên.
PaletteAI mở rộng nền tảng này sang cơ sở hạ tầng AI. Nó kết hợp quản lý vòng đời Kubernetes với điều phối GPU, dịch vụ mô hình, kiểm soát bảo mật, mạng và công cụ vận hành học máy. Spectro Cloud mô tả nền tảng này như một cách để quản lý cơ sở hạ tầng từ lớp phần cứng vật lý đến mô hình và dịch vụ suy luận chạy trên đó.
Nền tảng này cũng bao gồm PaletteAI Studio, cung cấp các ngăn xếp cơ sở hạ tầng và AI được tích hợp sẵn, được xây dựng từ các công nghệ như Kubeflow, MLflow, ClearML, Run:ai và Hugging Face. Những cấu hình này nhằm cung cấp cho các nhóm nền tảng các mẫu triển khai có thể lặp lại thay vì yêu cầu họ tích hợp từng thành phần một cách thủ công.
Inference Launchpad thêm định tuyến token, đo lường và phục vụ mô hình được quản lý cục bộ vào tầng lớp cơ sở hạ tầng rộng lớn hơn này.
Hỗ Trợ Môi Trường Trí Tuệ Nhân Tạo Chủ Quyền Và Quản Lý
Spectro Cloud cũng đang nhắm vào các neocloud, nhà cung cấp dịch vụ được quản lý và các nhà điều hành đám mây chủ quyền. Những nhà cung cấp này thường cần cung cấp cơ sở hạ tầng GPU được chia sẻ trong khi duy trì sự cô lập giữa khách hàng và thực thi các kiểm soát cụ thể theo khu vực pháp lý.
Công ty đang làm việc với NexusIgnite, một nhà cung cấp cơ sở hạ tầng hoạt động từ Austin và Dubai, để hỗ trợ các triển khai liên quan đến cư trú dữ liệu, tuân thủ và chủ quyền hoạt động.
Cư trú dữ liệu nói chung liên quan đến nơi thông tin được lưu trữ. Trí tuệ nhân tạo chủ quyền giới thiệu các câu hỏi bổ sung về ai vận hành cơ sở hạ tầng, hệ thống pháp lý nào được áp dụng, ai có thể truy cập và liệu môi trường có thể được kiểm tra hoặc ngắt kết nối khỏi các dịch vụ bên ngoài.
Nền tảng của Spectro Cloud hỗ trợ triển khai tự lưu trữ và không kết nối, trong khi PaletteAI VerteX thêm các kiểm soát bảo mật nhằm vào các môi trường chính phủ và quản lý.
Những khả năng này có thể đặc biệt phù hợp với các chính phủ, tổ chức chăm sóc sức khỏe, tổ chức tài chính và các nhà điều hành cơ sở hạ tầng quan trọng không thể định tuyến mọi tương tác AI qua một dịch vụ công cộng được chia sẻ.
Sự Cạnh Tranh Tăng Cường Xung Quanh Hoạt Động Trí Tuệ Nhân Tạo Doanh Nghiệp
Ra mắt này diễn ra ngay sau khi Spectro Cloud công bố một vòng tài trợ Series D trị giá 100 triệu đô la do Growth Equity tại Goldman Sachs Alternatives dẫn đầu, với sự tham gia của AMD Ventures, Ericsson, LG Technology Ventures và Maximus.
Công ty cho biết khoản tài trợ này sẽ hỗ trợ việc mở rộng của họ trong cơ sở hạ tầng AI sản xuất, đám mây chủ quyền, dịch vụ neocloud và suy luận phân tán. Spectro Cloud hiện đã huy động được khoảng 260 triệu đô la.
Chiến lược của họ phản ánh một lớp mới nổi của thị trường AI tập trung vào việc vận hành mô hình thay vì phát triển mô hình nền tảng. Khi các lựa chọn mô hình tăng lên, doanh nghiệp ngày càng cần cơ sở hạ tầng có thể xác định nơi mô hình chạy, cách GPU được phân bổ, dữ liệu nào chúng có thể truy cập và cách sử dụng được đo lường.
PaletteAI Inference Launchpad và tích hợp AMD mở rộng hiện đã có sẵn. Ý nghĩa lâu dài của chúng sẽ phụ thuộc vào việc suy luận được quản lý cục bộ có thể mang lại lợi ích kinh tế nhất quán mà không tái tạo sự phức tạp hoạt động mà các doanh nghiệp hy vọng tránh bằng cách sử dụng nhà cung cấp mô hình bên ngoài.












