KI-Modelle und Plattformen

Spectro Cloud Launcht PaletteAI Inference Launchpad, um Unternehmen bei der Kontrolle von AI-Token-Kosten zu helfen

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Spectro Cloud hat PaletteAI Inference Launchpad gestartet, eine lokal verwaltete Inferenzplattform, die Unternehmen hilft, ihre Abhängigkeit von externen Modellservices zu reduzieren und mehr Kontrolle über die wachsenden Kosten von künstlicher Intelligenz-Workloads zu erlangen.

Das Unternehmen sagt, dass Organisationen ihre externen Token-Kosten um bis zu 70% reduzieren können, je nach Workload-Mix, Infrastruktur und Modellauswahl. Spectro Cloud hat auch die Unterstützung von PaletteAI für AMD-basierte Infrastruktur erweitert, um Kunden eine breitere Auswahl an Grafikprozessoren (GPUs), Inferenz-Laufzeiten und Modell-Server-Technologien zu bieten.

Die Ankündigungen spiegeln eine breitere Verschiebung in der Unternehmens-KI wider. Wenn Unternehmen über Experimente hinausgehen und künstliche Intelligenz in Kundenbetreuung, Software-Entwicklung, Analytik und interne Betriebsabläufe einsetzen, werden die Kosten für die Verarbeitung von Modell-Eingaben und -Ausgaben zu einem erheblichen Infrastruktur-Anliegen.

Bringing AI Inference Closer to Enterprise Data

wird zu

KI-Inferenz näher an Unternehmensdaten bringen

PaletteAI Inference Launchpad basiert auf einem lokal-erst-Ansatz für Inferenz. Anstatt jeden Antrag automatisch an ein extern gehostetes Frontier-Modell zu senden, können Organisationen geeignete Workloads auf Infrastruktur in ihren eigenen Rechenzentren, privaten Clouds, souveränen Umgebungen oder Edge-Orten ausführen.

Unternehmen können immer noch Zugriff auf extern gehostete Frontier-Modelle für Aufgaben behalten, die ihre Fähigkeiten erfordern. Die Plattform soll Anfragen zwischen lokalen und externen Modellen basierend auf Faktoren wie Kosten, Leistung, Governance-Anforderungen und der Komplexität der Aufgabe routen.

Dieses hybride Modell könnte immer wichtiger werden, da Organisationen kleinere und spezialisierte Modelle übernehmen. Eine Kundenanfrage, eine Dokumentenklassifizierungsaufgabe oder eine interne Wissensanfrage kann nicht die gleiche Modellkapazität erfordern wie fortschrittliches Reasoning, komplexes Coding oder multimodale Analyse.

Die lokale Verwaltung geeigneter Workloads kann auch die Latenz reduzieren, indem die Inferenz näher an Anwendungen, Benutzern und Datenquellen gebracht wird. Für Organisationen, die in regulierten Branchen tätig sind, kann die lokale Verarbeitung eine größere Kontrolle über die Verarbeitung sensibler Informationen bieten.

Token Usage Becomes an Infrastructure Metric

wird zu

Token-Nutzung wird zu einem Infrastruktur-Maß

Tokens sind die Einheiten, in die künstliche Intelligenz-Modelle Text, Code und andere Informationen unterteilen und verarbeiten. Jede Aufforderung und generierte Antwort verbraucht Tokens, und viele kommerzielle Modell-Dienste berechnen nach der Anzahl der verarbeiteten Tokens.

Dies bedeutet, dass KI-Kosten schnell ansteigen können, wenn Systeme von kontrollierten Tests zu Anwendungen übergehen, die Tausende von Mitarbeitern oder Kunden bedienen. Das Problem wird noch komplexer mit KI-Agents, die möglicherweise wiederholte Modell-Anrufe tätigen, Informationen abrufen, Ergebnisse bewerten und externe Tools verwenden, bevor sie eine einzelne Aufgabe abschließen.

Goldman Sachs Research erwartet, dass der monatliche KI-Token-Verbrauch zwischen 2026 und 2030 um das 24-fache ansteigen und etwa 120 Quadrillionen Tokens pro Monat erreichen wird. Dieses prognostizierte Wachstum wird durch die zunehmende Unternehmensadoption und die Entstehung autonomer KI-Agents getrieben.

Inference Launchpad adressiert dieses Problem, indem es Infrastruktur-Teams Werkzeuge zur Verfügung stellt, um Token-Verbrauch zu messen, Kontingente festzulegen und Nutzungsrichtlinien anzuwenden. Diese Kontrollen könnten Unternehmen helfen, zu verstehen, welche Teams, Anwendungen und Modelle für ihre KI-Ausgaben verantwortlich sind, anstatt Inferenz als unvorhersehbare externe Service-Gebühr zu behandeln.

Die von Spectro Cloud genannte 70%-Reduzierung sollte als potenzielles Ergebnis und nicht als garantierte Einsparung betrachtet werden. Die tatsächlichen Wirtschaftsergebnisse hängen von GPU-Besitz- oder Mietkosten, Auslastungsgraden, Energieverbrauch, Modell-Effizienz, Anfragevolumen und den Preisen externer Anbieter ab.

Local Models Without Eliminating Frontier Models

wird zu

Lokale Modelle ohne Eliminierung von Frontier-Modellen

Die Modell-Weiterleitungs-Funktionen der Plattform sind darauf ausgelegt, Unternehmen nicht in eine Entscheidung zwischen lokalen oder Cloud-Modellen zu zwingen.

Organisationen können kleinere lokale Modelle für vorhersehbare oder datenschutzsensitive Aufgaben verwenden, während sie anspruchsvollere Anfragen an Frontier-Modelle senden. Richtlinien können auch bestimmen, welche Modelle für bestimmte Abteilungen, Rechtsordnungen oder Datenklassifizierungen zugelassen sind.

Dies führt Governance direkt in die Inferenz-Schicht ein. Ein Finanzinstitut könnte beispielsweise verhindern, dass bestimmte Informationen eine kontrollierte Umgebung verlassen, während es nicht sensible Anfragen an ein externes Modell senden kann. Ein multinationaler Konzern könnte unterschiedliche Routing-Regeln basierend auf regionalen Datenanforderungen anwenden.

Spectro Cloud hat Modell-Auswahl und Governance als Teil der umfassenden Infrastruktur-Management-Strategie von PaletteAI positioniert. Die Plattform unterstützt gemeinsam genutzte GPU-Umgebungen, rollenbasierten Zugriff, Ressourcen-Kontingente und Mandanten-Steuerungen, die darauf abzielen, es mehreren Teams zu ermöglichen, die gleiche Infrastruktur zu nutzen, ohne unbeschränkten Zugriff auf die zugrunde liegenden Systeme zu erhalten.

Expanded Support for AMD AI Infrastructure

wird zu

Erweiterte Unterstützung für AMD-KI-Infrastruktur

Parallel zu Inference Launchpad hat Spectro Cloud eine breitere Unterstützung für AMD-basierte KI-Umgebungen angekündigt.

Die Integration umfasst AMD-GPUs, den AMD-GPU-Operator, den ROCm-Software-Stack und AMD-Inference-Microservices, allgemein bekannt als AIMs. Diese Komponenten adressieren verschiedene Schichten der Infrastruktur, die zur Ausführung von KI-Modellen in der Produktion erforderlich sind.

Der AMD-GPU-Operator vereinfacht die Konfiguration und Verwaltung von AMD-Instinct-Acceleratoren in Kubernetes-Clustern. ROCm bietet den zugrunde liegenden offenen Software-Stack, einschließlich Treiber, Bibliotheken, Laufzeiten und Entwicklungstools, die zur Ausführung von künstlicher Intelligenz- und Hochleistungsrechen-Workloads auf AMD-Hardware verwendet werden.

AIMs bieten standardisierte Inferenz-Microservices für die Ausführung von Modellen auf AMD-Instinct-GPUs. Sie sind darauf ausgelegt, optimierte Modelle und unterstützende Software in deploybare Dienste zu paketieren, wodurch einige der Integrationsarbeiten, die normalerweise erforderlich sind, um ein Modell in die Produktion zu überführen, reduziert werden.

Für Unternehmenskunden kann diese erweiterte Unterstützung es einfacher machen, gemischte GPU-Umgebungen zu betreiben, anstatt separate Verwaltungsprozesse für NVIDIA- und AMD-Infrastruktur aufzubauen.

Managing the Stack From Hardware to Models

wird zu

Verwaltung des Stacks von der Hardware zu den Modellen

Spectro Cloud hat ursprünglich Palette als Kubernetes-Verwaltungsplattform für die Bereitstellung und Wartung von Clustern in öffentlichen Clouds, privaten Rechenzentren, Bare-Metal-Systemen und Edge-Orten entwickelt.

PaletteAI erweitert diese Grundlage um KI-Infrastruktur. Es kombiniert Kubernetes-Lebenszyklus-Verwaltung mit GPU-Orchestrierung, Modell-Diensten, Sicherheitskontrollen, Netzwerk- und Maschinen-Learning-Operations-Tooling. Spectro Cloud beschreibt die Plattform als Möglichkeit, Infrastruktur von der physischen Hardware-Ebene bis hin zu den Modellen und Inferenz-Diensten, die darauf ausgeführt werden, zu verwalten.

Die Plattform umfasst auch PaletteAI Studio, das vorkonfigurierte Infrastruktur- und KI-Stacks aus Technologien wie Kubeflow, MLflow, ClearML, Run:ai und Hugging Face bietet. Diese Konfigurationen sollen Plattform-Teams wiederholbare Bereitstellungs-Vorlagen anstelle von manuellen Integrationen bieten.

Inference Launchpad fügt Token-Weiterleitung, -Messung und lokal verwaltete Modell-Ausführung zu dieser umfassenderen Infrastruktur-Schicht hinzu.

Supporting Sovereign and Regulated AI Environments

wird zu

Unterstützung souveräner und regulierter KI-Umgebungen

Spectro Cloud zielt auch auf Neoclouds, Managed-Service-Provider und souveräne Cloud-Betreiber ab. Diese Anbieter müssen häufig gemeinsam genutzte GPU-Infrastruktur anbieten, während sie die Isolation zwischen Kunden und die Einhaltung von Rechtsvorschriften aufrechterhalten.

Das Unternehmen arbeitet mit NexusIgnite, einem Infrastruktur-Provider mit Sitz in Austin und Dubai, zusammen, um Bereitstellungen zu unterstützen, die Daten-Residenz, Compliance und operative Souveränität betreffen.

Daten-Residenz befasst sich in der Regel mit der Speicherung von Informationen. Souveräne KI wirft zusätzliche Fragen über den Betreiber der Infrastruktur, die anwendbaren Rechtsordnungen, den Zugriff und die Möglichkeit, die Umgebung zu auditen oder von externen Diensten zu trennen, auf.

Spectro Clouds Plattform unterstützt selbst gehostete und air-gapped-Bereitstellungen, während PaletteAI VerteX Sicherheitskontrollen für Regierungs- und regulierte Umgebungen bietet.

Diese Fähigkeiten können insbesondere für Regierungen, Gesundheitsorganisationen, Finanzinstitute und Betreiber kritischer Infrastruktur relevant sein, die nicht jeden KI-Interaktionsvorgang über einen gemeinsam genutzten öffentlichen Dienst leiten können.

Growing Competition Around Enterprise AI Operations

wird zu

Wachsende Konkurrenz um Unternehmens-KI-Betrieb

Der Launch erfolgt kurz nachdem Spectro Cloud bekannt gegeben hat, dass es eine Finanzierungsrunde der Serie D in Höhe von 100 Millionen US-Dollar von Growth Equity bei Goldman Sachs Alternatives mit Beteiligung von AMD Ventures, Ericsson, LG Technology Ventures und Maximus erhalten hat.

Das Unternehmen sagte, dass die Finanzierung seine Expansion in der Produktion von KI-Infrastruktur, souveränen Clouds, Neocloud-Diensten und verteilter Inferenz unterstützen wird. Spectro Cloud hat nun insgesamt etwa 260 Millionen US-Dollar aufgenommen.

Ihre Strategie spiegelt eine aufkommende Schicht des KI-Marktes wider, die sich auf den Betrieb von Modellen und nicht auf die Entwicklung von Grundmodellen konzentriert. Da die Modell-Optionen zunehmen, benötigen Unternehmen zunehmend Infrastruktur, die bestimmen kann, wo Modelle ausgeführt werden, wie GPUs zugewiesen werden, auf welche Daten sie zugreifen können und wie die Nutzung gemessen wird.

PaletteAI Inference Launchpad und die erweiterte AMD-Integration sind sofort verfügbar. Ihre langfristige Bedeutung hängt davon ab, ob lokal verwaltete Inferenz konsistente wirtschaftliche Vorteile liefern kann, ohne die operativen Komplexitäten wiederherzustellen, die Unternehmen durch die Verwendung externer Modell-Anbieter zu vermeiden hofften.

Antoine ist ein visionärer Leiter und Gründungspartner von Unite.AI, getrieben von einer unerschütterlichen Leidenschaft für die Gestaltung und Förderung der Zukunft von KI und Robotik. Als Serienunternehmer glaubt er, dass KI für die Gesellschaft so disruptiv sein wird wie Elektrizität, und er wird oft dabei erwischt, wie er über das Potenzial disruptiver Technologien und AGI schwärmt.

Als Futurist ist er darauf bedacht, zu erforschen, wie diese Innovationen unsere Welt prägen werden. Darüber hinaus ist er der Gründer von Securities.io, einer Plattform, die sich auf Investitionen in bahnbrechende Technologien konzentriert, die die Zukunft neu definieren und ganze Branchen umgestalten.