AI 모델 및 플랫폼

스펙트로 클라우드, PaletteAI 추론 런치패드 출시로 기업의 AI 토큰 비용 제어 지원

mm
Unite.AI를 Google의 선호 소스에 추가

스펙트로 클라우드는 PaletteAI 추론 런치패드를 출시했습니다. 이는 기업들이 외부 모델 서비스에 대한 의존도를 줄이고 인공지능 워크로드의 비용을 더 잘 제어할 수 있도록 설계된 로컬 관리 추론 플랫폼입니다.

이 회사는 조직이 워크로드 혼합, 인프라, 모델 선택에 따라 최대 70%의 외부 토큰 비용을 줄일 수 있다고 말합니다. 스펙트로 클라우드는 또한 AMD 기반 인프라에 대한 PaletteAI의 지원을 확대하여 고객에게 더 다양한 그래픽 처리 장치(GPU), 추론 런타임, 모델 서빙 기술을 제공합니다.

이 발표는 기업 인공지능의 더广い 전환을 반영합니다. 기업들이 실험을 넘어 고객 서비스, 소프트웨어 개발, 분석, 내부 운영에 인공지능을 배포함에 따라 모델 입력 및 출력 처리 비용이 중요한 인프라 문제가 되고 있습니다.

기업 데이터에 더 가까운 AI 추론

PaletteAI 추론 런치패드는 로컬 우선 접근 방식을 기반으로 합니다. 외부 호스팅 프론티어 모델에 모든 요청을 자동으로 보내는 대신, 조직은 자신의 데이터 센터, 프라이빗 클라우드, 주권 환경 또는 에지 위치에 있는 인프라에서 적합한 워크로드를 실행할 수 있습니다.

기업은 여전히 외부 호스팅 프론티어 모델에 대한 액세스를 유지할 수 있습니다. 플랫폼은 비용, 성능, 거버넌스 요구 사항, 작업 복잡성 등에 따라 로컬 및 외부 모델 사이에서 요청을 라우팅합니다.

이 하이브리드 모델은 조직이 더 작은 규모의 모델을 채택함에 따라 중요성이 커질 수 있습니다. 고객 지원 요청, 문서 분류 작업, 내부 지식 쿼리와 같은 작업은 고급 추론, 복잡한 코딩, 멀티모달 분석과 같은 작업에 필요한 모델容量과 다를 수 있습니다.

적합한 워크로드를 로컬로 유지하면 응용 프로그램, 사용자, 데이터 소스에 더 가까운 추론을 통해 대기 시간을 줄일 수 있습니다. 규제된 산업에서 운영되는 조직의 경우 로컬 처리는 민감한 정보가 처리되는 위치에 대한 더 큰 제어력을 제공할 수 있습니다.

토큰 사용량, 인프라 메트릭으로 전환

토큰은 인공지능 모델이 텍스트, 코드, 기타 정보를 나누고 처리하는 단위입니다. 모든 프롬프트와 생성된 응답은 토큰을 소비하며, 많은 상업적 모델 서비스는 처리된 토큰 수에 따라 비용을 청구합니다.

이것은 인공지능 비용이 제어된 시험에서 수천 명의 직원이나 고객을 지원하는 애플리케이션으로 이동함에 따라 빠르게 증가할 수 있음을 의미합니다. 인공지능 에이전트를 사용하는 경우, 문제는 더 복잡해집니다. 에이전트는 단일 작업을 완료하기 전에 반복적으로 모델 호출, 정보 검색, 결과 평가, 외부 도구 사용을 수행할 수 있습니다.

골드만 삭스 연구에 따르면, 2026년과 2030년 사이에 월간 AI 토큰 소비량은 24배 증가하여 약 120경 토큰/월에 이를 것으로 예상됩니다. 이는 기업의 인공지능 채택 확대와 더 자율적인 인공지능 에이전트의 출현에 의해 주도됩니다.

추론 런치패드는 토큰 소비를 측정하고, 할당량을 설정하고, 사용 정책을 적용하는 도구를 제공하여 이 문제를 해결합니다. 이러한 제어는 기업이 인공지능 지출에 책임이 있는 팀, 애플리케이션, 모델을 이해하는 데 도움이 될 수 있으며, 추론을 예측할 수 없는 외부 서비스 비용으로 처리하는 것을 피할 수 있습니다.

스펙트로 클라우드가 언급한 70%의 비용 감소는 잠재적인 결과로 간주되어야 하며, 보장된 절감은 아닙니다. 실제 경제성은 GPU 수집 또는 대여 비용, 사용률, 에너지 소비, 모델 효율성, 요청 볼륨, 외부 제공자의 가격에 따라 달라질 수 있습니다.

프론티어 모델을 제거하지 않고 로컬 모델 사용

플랫폼의 모델 라우팅 기능은 기업이 모든 로컬 또는 모든 클라우드 결정을 강요받지 않도록 설계되었습니다.

조직은 예측 가능한 작업이나 개인 정보 보호에 민감한 작업에 작은 로컬 모델을 사용할 수 있으며, 더 요구되는 요청은 프론티어 모델로 보낼 수 있습니다. 정책은 또한 특정 부서, 관할 구역 또는 데이터 분류에 허용되는 모델을 결정할 수 있습니다.

이것은 추론 레이어에 직접 거버넌스를 도입합니다. 예를 들어, 금융 기관은 특정 정보가 제어된 환경을 떠나지 않도록 방지하면서 비민감한 요청에 외부 모델을 사용할 수 있습니다. 다국적 기업은 데이터 요구 사항에 따라 지역별 라우팅 규칙을 적용할 수 있습니다.

스펙트로 클라우드는 모델 선택과 거버넌스를 PaletteAI의 더广い 인프라 관리 전략의 일부로 пози션했습니다. 플랫폼은 공유 GPU 환경, 역할 기반 액세스, 리소스 할당량, 테넌트 수준의 제어를 지원하여 여러 팀이 동일한 인프라를 사용하면서 기본 시스템에 제한되지 않은 액세스를 받지 않도록 합니다.

AMD AI 인프라 지원 확대

추론 런치패드와 함께, 스펙트로 클라우드는 AMD 기반 AI 환경에 대한 지원을 확대했습니다.

통합에는 AMD GPU, AMD GPU 오퍼레이터, ROCm 소프트웨어 스택, AMD 추론 마이크로 서비스(AIMs)가 포함됩니다. 이러한 구성 요소는 생산 환경에서 인공지능 모델을 운영하는 데 필요한 인프라의 다양한 레이어를 해결합니다.

AMD GPU 오퍼레이터는 쿠버네티스 클러스터 내의 AMD Instinct 가속기를 구성하고 관리하는 것을 간소화합니다. ROCm은 AMD 하드웨어에서 인공지능 및 고성능 컴퓨팅 워크로드를 실행하는 데 사용되는 드라이버, 라이브러리, 런타임, 개발 도구를 포함하는 기본 오픈 소프트웨어 스택을 제공합니다.

AIMs는 AMD Instinct GPU에서 모델을 서빙하는 표준화된 추론 마이크로 서비스를 제공합니다. 최적화된 모델과 지원 소프트웨어를 배포 가능한 서비스로 패키징하여 모델을 프로덕션에 이동하는 데 필요한 일부 통합 작업을 줄이는 것을 목표로 합니다.

기업 고객의 경우, 이 확대된 지원은 NVIDIA와 AMD 인프라에 대한 별도의 관리 프로세스를 구축하는 대신 혼합 GPU 환경을 운영하는 것이 더 쉬워질 수 있습니다.

하드웨어에서 모델까지 스택 관리

스펙트로 클라우드는 원래 Palette를 퍼블릭 클라우드, 프라이빗 데이터 센터, 베어 메탈 시스템, 에지 위치에 걸친 클러스터를 배포하고 유지 관리하는 쿠버네티스 관리 플랫폼으로 개발했습니다.

PaletteAI는 이 기초를 인공지능 인프라로 확장합니다. 쿠버네티스 라이프사이클 관리와 GPU 오케스트레이션, 모델 서비스, 보안 제어, 네트워킹, 머신 러닝 운영 도구를 결합합니다. 스펙트로 클라우드는 플랫폼을 물리적 하드웨어 레이어에서 모델과 추론 서비스가 실행되는 상위 레이어까지 관리하는 방법으로 설명합니다.

플랫폼에는 또한 PaletteAI Studio가 포함되어 있습니다. 이는 Kubeflow, MLflow, ClearML, Run:ai, Hugging Face와 같은 기술로 미리 통합된 인프라와 인공지능 스택을 제공합니다. 이러한 구성은 플랫폼 팀이 수동으로 모든 구성 요소를 통합할 필요 없이 반복 가능한 배포 템플릿을 제공하는 것을 목표로 합니다.

추론 런치패드는 토큰 라우팅, 측정, 로컬 모델 서빙을 더广い 인프라 레이어에 추가합니다.

주권 및 규제 인공지능 환경 지원

스펙트로 클라우드는 또한 네오 클라우드, 관리 서비스 제공업체, 주권 클라우드 운영자를 대상으로 합니다. 이러한 제공업체는 종종 공유 GPU 인프라를 제공해야 하며, 고객 간의 격리를 유지하고 관할 구역별 제어를 시행해야 합니다.

회사는 데이터 주거, 규정 준수, 운영 주권을 포함하는 배포를 지원하는 인프라 제공업체인 NexusIgnite와 협력하고 있습니다.

데이터 주거는 일반적으로 정보가 저장되는 위치와 관련이 있습니다. 주권 인공지능은 인프라를 운영하는 사람, 적용되는 법적 체계, 액세스할 수 있는 사람, 외부 서비스와의 연결을 중단할 수 있는지 여부와 같은 추가 질문을 제기합니다.

스펙트로 클라우드의 플랫폼은 자체 호스팅 및 에어 갭 배포를 지원하며, PaletteAI VerteX는 정부 및 규제 환경을 위한 보안 제어를 추가합니다.

이러한 기능은 모든 AI 상호 작용을 공유公共 서비스로 라우팅할 수 없는 정부, 의료 기관, 금융 기관, 중요 인프라 운영자를 포함한 조직에서 특히 관련성이 있을 수 있습니다.

기업 인공지능 운영 경쟁 증가

이 런치는 스펙트로 클라우드가 발표한 1억 달러의 시리즈 D 자금 조달 라운드가 발표된 직후입니다. 이 라운드는 골드만 삭스(Goldman Sachs)의 성장 자본(Growth Equity)에서 주도했으며, AMD Ventures, Ericsson, LG Technology Ventures, Maximus가 참여했습니다.

회사는 이 자금이 프로덕션 인공지능 인프라, 주권 클라우드, 네오 클라우드 서비스, 분산 추론에 대한 확장 지원을 위한 것입니다. 스펙트로 클라우드는 현재 약 2억 6천만 달러를 조달했습니다.

이 전략은 모델 운영에 중점을 둔 인공지능 시장의 새로운 레이어를 반영합니다. 모델 옵션이 증가함에 따라, 기업은 모델이 실행되는 위치, GPU가 할당되는 방식, 액세스할 수 있는 데이터, 사용 방법을 측정하는 인프라가 필요합니다.

PaletteAI 추론 런치패드와 확대된 AMD 통합은 즉시 사용 가능합니다. 장기적인 의미는 로컬 관리 추론이 외부 모델 제공업체를 사용함으로써 피하려고 했던 운영 복잡성을 재창조하지 않고 일관된 경제적 이점을 제공할 수 있는지 여부에 따라 달라질 것입니다.

앙투안은 유나이트.AI의 비전적인 리더이자 공동 설립자로서 AI와 로봇공학의 미래를 형성하고 촉진하는 데 대한 불변의 열정을 가지고 있습니다. 연속적인 기업가로서, 그는 AI가 사회에 전기와 같은 변화를 가져올 것이라고 믿으며, 종종 파괴적인 기술과 AGI의 잠재력에 대해 열광합니다.

作为 미래학자로서, 그는 이러한 혁신이 우리 세계를 어떻게 형성할지 탐구하는 데 헌신하고 있습니다. 또한, 그는 Securities.io의 설립자로서, 미래를 재정의하고 전체 부문을 재구성하는 최첨단 기술에 투자하는 플랫폼을 운영하고 있습니다.