Model dan platform AI
Spectro Cloud Meluncurkan PaletteAI Inference Launchpad untuk Membantu Perusahaan Mengontrol Biaya Token AI

Spectro Cloud telah meluncurkan PaletteAI Inference Launchpad, sebuah platform inferensi yang dikelola secara lokal untuk membantu perusahaan mengurangi ketergantungan mereka pada layanan model eksternal dan memperoleh lebih banyak kontrol atas biaya yang terus meningkat dari beban kerja kecerdasan buatan.
Perusahaan tersebut menyatakan bahwa organisasi dapat mengurangi biaya token eksternal hingga 70%, tergantung pada campuran beban kerja, infrastruktur, dan pilihan model mereka. Spectro Cloud juga memperluas dukungan PaletteAI untuk infrastruktur berbasis AMD, memberikan pelanggan pilihan yang lebih luas dari unit pemrosesan grafis (GPU), runtime inferensi, dan teknologi penyajian model.
Pengumuman tersebut mencerminkan pergeseran yang lebih luas dalam kecerdasan buatan perusahaan. Ketika perusahaan melampaui eksperimen dan menerapkan kecerdasan buatan di seluruh layanan pelanggan, pengembangan perangkat lunak, analitik, dan operasi internal, biaya pemrosesan input dan output model menjadi perhatian infrastruktur yang signifikan.
Membawa Inferensi AI Lebih Dekat ke Data Perusahaan
PaletteAI Inference Launchpad dibangun di sekitar pendekatan lokal untuk inferensi. Daripada mengirimkan setiap permintaan ke model frontier yang dihosting secara eksternal, organisasi dapat menjalankan beban kerja yang sesuai pada infrastruktur yang terletak di pusat data mereka sendiri, cloud pribadi, lingkungan berdaulat, atau lokasi edge.
Perusahaan masih dapat mempertahankan akses ke model frontier yang dihosting secara eksternal untuk tugas yang memerlukan kemampuan mereka. Platform ini dimaksudkan untuk mengarahkan permintaan antara model lokal dan eksternal berdasarkan faktor seperti biaya, kinerja, persyaratan tata kelola, dan kompleksitas tugas.
Model hibrida ini dapat menjadi semakin penting ketika organisasi mengadopsi model yang lebih kecil dan lebih khusus. Permintaan dukungan pelanggan, tugas klasifikasi dokumen, atau kueri pengetahuan internal mungkin tidak memerlukan kapasitas model yang sama seperti alasan lanjutan, pengkodean kompleks, atau analisis multimodal.
Mempertahankan beban kerja yang sesuai secara lokal juga dapat mengurangi latensi dengan membawa inferensi lebih dekat ke aplikasi, pengguna, dan sumber data. Untuk organisasi yang beroperasi di industri yang diatur, pemrosesan lokal dapat memberikan kontrol yang lebih besar atas di mana informasi sensitif diproses.
Penggunaan Token Menjadi Metrik Infrastruktur
Token adalah unit yang digunakan oleh model kecerdasan buatan untuk membagi dan memproses teks, kode, dan informasi lainnya. Setiap prompt dan respons yang dihasilkan mengonsumsi token, dan banyak layanan model komersial mengenakan biaya berdasarkan jumlah token yang diproses.
Ini berarti biaya AI dapat meningkat dengan cepat ketika sistem berpindah dari percobaan yang terkendali ke aplikasi yang melayani ribuan karyawan atau pelanggan. Masalah ini menjadi lebih rumit dengan agen AI, yang mungkin membuat panggilan model berulang, mengambil informasi, mengevaluasi hasil, dan menggunakan alat eksternal sebelum menyelesaikan satu tugas.
Penelitian Goldman Sachs menunjukkan bahwa konsumsi token AI bulanan diperkirakan akan meningkat 24 kali lipat antara 2026 dan 2030, mencapai sekitar 120 kuadriliun token per bulan. Pertumbuhan yang diproyeksikan ini didorong oleh adopsi perusahaan yang meluas dan munculnya agen AI yang lebih otonom.
Inferensi Launchpad menangani masalah ini dengan memberikan tim infrastruktur alat untuk mengukur konsumsi token, menetapkan kuota, dan menerapkan kebijakan penggunaan. Kontrol ini dapat membantu perusahaan memahami tim, aplikasi, dan model mana yang bertanggung jawab atas pengeluaran AI mereka, bukan memperlakukan inferensi sebagai biaya layanan eksternal yang tidak terduga.
Pengurangan 70% yang disebutkan oleh Spectro Cloud harus dipandang sebagai hasil potensial daripada penghematan yang dijamin. Ekonomi aktual akan tergantung pada biaya akuisisi atau penyewaan GPU, tingkat utilisasi, konsumsi energi, efisiensi model, volume permintaan, dan harga penyedia eksternal.
Model Lokal Tanpa Menghilangkan Model Frontier
Kemampuan pengaturan model platform ini dirancang untuk menghindari memaksa perusahaan untuk membuat keputusan semua-lokal atau semua-awan.
Organisasi dapat menggunakan model lokal yang lebih kecil untuk tugas yang dapat diprediksi atau sensitif privasi sementara mengirimkan permintaan yang lebih menantang ke model frontier. Kebijakan juga dapat menentukan model mana yang diizinkan untuk departemen, yurisdiksi, atau klasifikasi data tertentu.
Ini memperkenalkan tata kelola langsung ke lapisan inferensi. Sebagai contoh, lembaga keuangan dapat mencegah informasi tertentu meninggalkan lingkungan yang dikendalikan, sementara memungkinkan permintaan non-sensitif untuk menggunakan model eksternal. Perusahaan multinasional dapat menerapkan aturan pengaturan yang berbeda berdasarkan persyaratan data regional.
Spectro Cloud telah memposisikan pilihan model dan tata kelola sebagai bagian dari strategi manajemen infrastruktur PaletteAI yang lebih luas. Platform ini mendukung lingkungan GPU yang dibagikan, akses berbasis peran, kuota sumber daya, dan kontrol tingkat penyewa yang dimaksudkan untuk memungkinkan beberapa tim menggunakan infrastruktur yang sama tanpa mendapatkan akses tidak terbatas ke sistem yang mendasarinya.
Expanded Support for AMD AI Infrastructure
Bersamaan dengan Inference Launchpad, Spectro Cloud mengumumkan dukungan yang lebih luas untuk lingkungan AI yang ditenagai oleh AMD.
Integrasi ini mencakup GPU AMD, Operator GPU AMD, tumpukan perangkat lunak ROCm, dan Layanan Inference Mikro AMD, yang umumnya dikenal sebagai AIM. Komponen-komponen ini menangani lapisan yang berbeda dari infrastruktur yang diperlukan untuk mengoperasikan model AI dalam produksi.
Operator GPU AMD menyederhanakan konfigurasi dan manajemen akselerator AMD Instinct di dalam cluster Kubernetes. ROCm menyediakan tumpukan perangkat lunak terbuka yang mendasarinya, termasuk pengemudi, perpustakaan, runtime, dan alat pengembangan yang digunakan untuk menjalankan beban kerja kecerdasan buatan dan komputasi kinerja tinggi pada perangkat keras AMD.
AIM menyediakan layanan inferensi mikro yang distandarisasi untuk menyajikan model pada GPU AMD Instinct. Mereka dirancang untuk mengemas model yang dioptimalkan dan perangkat lunak pendukung ke dalam layanan yang dapat diterapkan, mengurangi beberapa pekerjaan integrasi yang biasanya diperlukan untuk memindahkan model ke produksi.
Untuk pelanggan perusahaan, dukungan yang diperluas ini dapat membuatnya lebih mudah untuk mengoperasikan lingkungan GPU yang dicampur daripada membangun proses manajemen yang terpisah untuk infrastruktur NVIDIA (NVDA ) dan AMD.
Mengelola Tumpukan Dari Perangkat Keras ke Model
Spectro Cloud awalnya mengembangkan Palette sebagai platform manajemen Kubernetes untuk menerapkan dan memelihara cluster di seluruh cloud publik, pusat data pribadi, sistem bare-metal, dan lokasi edge.
PaletteAI memperluas fondasi ini ke infrastruktur AI. Ini menggabungkan manajemen siklus hidup Kubernetes dengan orkestrasi GPU, layanan model, kontrol keamanan, jaringan, dan alat operasi mesin pembelajaran. Spectro Cloud menjelaskan platform ini sebagai cara untuk mengelola infrastruktur dari lapisan perangkat keras fisik hingga model dan layanan inferensi yang berjalan di atasnya.
Platform ini juga mencakup PaletteAI Studio, yang menyediakan infrastruktur dan tumpukan AI yang pra-terintegrasi yang dibangun dari teknologi seperti Kubeflow, MLflow, ClearML, Run:ai, dan Hugging Face. Konfigurasi ini dimaksudkan untuk memberikan tim platform templat penerapan yang dapat diulang, bukan memerlukan mereka untuk mengintegrasikan setiap komponen secara manual.
Inferensi Launchpad menambahkan pengaturan token, pengukuran, dan penyajian model yang dikelola secara lokal ke lapisan infrastruktur yang lebih luas.
Mendukung Lingkungan AI yang Berdaulat dan Diatur
Spectro Cloud juga menargetkan neocloud, penyedia layanan yang dikelola, dan operator cloud berdaulat. Penyedia ini sering perlu menawarkan infrastruktur GPU yang dibagikan sambil mempertahankan isolasi antara pelanggan dan menerapkan kontrol yang spesifik untuk yurisdiksi.
Perusahaan tersebut bekerja sama dengan NexusIgnite, penyedia infrastruktur yang beroperasi dari Austin dan Dubai, untuk mendukung penerapan yang melibatkan kediaman data, kepatuhan, dan kedaulatan operasional.
Kediaman data umumnya berkaitan dengan di mana informasi disimpan. AI berdaulat memperkenalkan pertanyaan tambahan tentang siapa yang mengoperasikan infrastruktur, sistem hukum apa yang berlaku, siapa yang dapat mengaksesnya, dan apakah lingkungan dapat diaudit atau diputuskan dari layanan eksternal.
Platform Spectro Cloud mendukung penerapan self-hosted dan air-gapped, sementara PaletteAI VerteX menambahkan kontrol keamanan yang dimaksudkan untuk lingkungan pemerintah dan yang diatur.
Kapasitas ini mungkin sangat relevan bagi pemerintah, organisasi kesehatan, lembaga keuangan, dan operator infrastruktur kritis yang tidak dapat mengarahkan setiap interaksi AI melalui layanan publik yang dibagikan.
Persaingan yang Tumbuh di Sekitar Operasi AI Perusahaan
Peluncuran ini terjadi tidak lama setelah Spectro Cloud mengumumkan putaran pendanaan Seri D sebesar $100 juta yang dipimpin oleh Growth Equity at Goldman Sachs Alternatives, dengan partisipasi dari AMD Ventures, Ericsson, LG Technology Ventures, dan Maximus.
Perusahaan tersebut menyatakan bahwa pendanaan ini akan mendukung ekspansi mereka dalam infrastruktur AI produksi, cloud berdaulat, layanan neocloud, dan inferensi yang terdistribusi. Spectro Cloud sekarang telah mengumpulkan sekitar $260 juta.
Strategi mereka mencerminkan lapisan yang muncul dari pasar AI yang fokus pada operasi model daripada pengembangan model dasar. Ketika pilihan model berkembang, perusahaan memerlukan infrastruktur yang dapat menentukan di mana model berjalan, bagaimana GPU dialokasikan, data apa yang dapat diakses, dan bagaimana penggunaan diukur.
PaletteAI Inference Launchpad dan integrasi AMD yang diperluas tersedia sekarang. Makna jangka panjang mereka akan tergantung pada apakah inferensi yang dikelola secara lokal dapat memberikan manfaat ekonomi yang konsisten tanpa merekayasa kembali kompleksitas operasional yang perusahaan harapkan untuk dihindari dengan menggunakan penyedia model eksternal dari awal.












