Vordenker
Warum die nächste Phase der KI-Infrastruktur mehr als Hyperscale-Rechenzentren erfordert

Künstliche Intelligenz betritt eine Phase, in der die Infrastrukturstrategie nicht mehr von der Modellfähigkeit zu trennen ist. Jahre lang haben Hyperscale-Rechenzentren den Aufstieg des großen Maßstabs der Ausbildung ermöglicht und es frontier-Modellen ermöglicht, von Millionen auf Billionen von Parametern zu wachsen. Aber da die Einführung von KI in Unternehmen, Branchen und Echtzeitsystemen beschleunigt wird, wird die Inferenz die dominierende Arbeitslast ersetzen, und die Inferenz hat grundlegend andere Anforderungen.
Die nächste Ära der KI kann nicht allein durch Hyperscale-Einrichtungen unterstützt werden. Stattdessen entsteht ein Hybridmodell, bei dem zentrale Campus für die Ausbildung durch verteilte, leistungsorientierte, kommerzielle Rechenzentren für die Inferenz ergänzt werden. Dieser Wandel wird durch Latenzbeschränkungen, Datenhoheitsbedürfnisse, Energie-realitäten und die physischen Grenzen der weiteren Hyperscale-Erweiterung getrieben.
Die Divergenz von Training und Inferenz
Das Training bleibt eine zentrale Aktivität. Es erfordert massive Cluster, Hochgeschwindigkeits-Datensysteme und lange Laufzeiten, die von den Skaleneffekten profitieren. Hyperscale-Campus sind für diese optimiert, mit dichter Rechenleistung, speziellen Netzwerkstrukturen und globaler Verfügbarkeit. Aber die Inferenz verhält sich anders. Sie ist kurzlebig, voluminös, latenzsensitiv und oft an geografische oder Unternehmensgrenzen gebunden. Analysen von Akamais jüngster Arbeit zu agentischen Systemen zeigen, dass die meisten Organisationen jetzt eine End-to-End-Latenz von weniger als 500 Millisekunden für kritische KI-Anwendungsfälle anstreben, und Multi-Agent-Workflows überschreiten häufig diese Schwelle allein aufgrund von Netzwerktransit und CPU-Seitenausführung.
Latenz ist kein abstraktes Maß. In Robotik und autonomen Systemen laufen Kontrollschleifen oft mit 100 bis 1.000 Hertz alle 1 bis 10 Millisekunden. Jede außerhalb der Bordintelligenz muss diese Zeitbeschränkungen respektieren. Eine 50-Millisekunden-Rundreise zu einem entfernten Rechenzentrum bricht die Kontrollregime vollständig. In Finanzhandel und Betrugsbekämpfung bestimmen Millisekunden wirtschaftliche Ergebnisse. In der industriellen Automation kann verzögerte Inferenz Prozesse destabilisieren oder die Sicherheit gefährden. Und in interaktiven Erfahrungen wie Gaming, AR/VR und Echtzeit-Co-Piloten verschlechtert sich die Reaktionsfähigkeit scharf über 100 bis 150 Millisekunden.
Moderne KI-Systeme verlassen sich zunehmend auf Multi-Agent-Workflows, die aus Ketten von Dutzenden von sequenziellen Anrufen bestehen. Akamais Analyse zeigt, dass die CPU-Seitenausführung den größten Teil der Gesamtlatenz ausmachen kann, und jede Netzwerk-Rundreise zusätzliche Verzögerung hinzufügt. Ein Workflow mit 50 sequenziellen Anrufen kann Sekunden an Transportlatenz verursachen, wenn er an eine entfernte Hyperscale-Region geroutet wird. Wenn man diesen Workflow in einem hyperlokalen Rechenzentrum auf demselben Campus oder in der gleichen Metropolregion platziert, ändern sich die Physik. Lokale Inferenz kann eine Rundreise-Latenz von 1 bis 5 Millisekunden liefern. Ein 50-Schritt-Workflow, der in einer entfernten Region Sekunden dauern würde, kann in 50 bis 250 Millisekunden lokal abgeschlossen werden, innerhalb der Unternehmenslatenzbudgets.

Datenhoheit und Netzrealitäten treiben lokale Bereitstellungen voran
Latenz ist nur ein Teil der Geschichte. Für regulierte Branchen wie Gesundheitswesen, Finanzen und öffentlicher Sektor ist die Datenhoheit oft der primäre Treiber für lokale Inferenz. Das Ausführen von KI-Arbeitslasten hinter einer Unternehmensfirewall bewahrt bestehende Sicherheitsperimeter, reduziert die Multitenant-Exposition, vereinfacht die Einhaltung von Vorschriften und hält sensible Daten von gemeinsamer Cloud-Infrastruktur fern. Hyperscale-Anbieter bieten starke Sicherheit, aber die Angriffsfläche und Vertrauenskette sind inhärent breiter. Unternehmen bevorzugen zunehmend Inferenz-Architekturen, die mit ihrer bestehenden Sicherheitspostur übereinstimmen.
Zusätzlich zu den Bedenken hinsichtlich Latenz und Sicherheit wird die Verfügbarkeit von Leistung zu einer gleich wichtigen Einschränkung. Große Hyperscale-Campus stoßen oft auf mehrjährige Verzögerungen aufgrund von Übertragungseinschränkungen und Interconnection-Warteschlangen. Kleinere kommerzielle Rechenzentren, insbesondere solche, die in der Nähe bestehender Lasten oder dezentraler Erzeugung liegen, können oft viel schneller in Betrieb genommen werden. Dies ist wichtig, weil die KI-Nachfrage mit einem seltsamen Paradox kollidiert.
Zugleich, während die Betreiber neue Netzverbindungen zu sichern kämpfen, werden enorme Mengen an erneuerbarer Energie abgelehnt. Globally, die Ablehnung von erneuerbarer Energie übersteigt 200 Terawattstunden pro Jahr. In den Vereinigten Staaten wird die Ablehnung auf etwa 20 Terawattstunden pro Jahr geschätzt. ERCOT allein hat über 9 Terawattstunden Wind- und Solarenergie in einem jüngsten Jahr abgelehnt. CAISO hat 3,4 Terawattstunden Solar- und Windenergie im Jahr 2024 abgelehnt, wobei Solar für 93% aller abgelehnten Ausgaben verantwortlich war. Energie-System-Umfragen zeigen konsistent, dass sowohl Solar- als auch Windenergie erhebliche Ablehnung erfahren, wenn die Erzeugung die Netzkapazität übersteigt. Die Ablehnung von Solarenergie ist besonders häufig in Regionen mit starken Mittagsgipfeln, während die Ablehnung von Windenergie oft während der Nachtschichten oder in eingeschränkten Korridoren auftritt. Verteilte Rechenzentren, die in der Nähe von Erzeugung, insbesondere solaren reichen Regionen, liegen, können gestrandete Energie in nützliche Inferenzkapazität umwandeln.
Hyperscale-Campus werden für die Ausbildung unerlässlich bleiben, aber sie stoßen auf wachsende physische und wirtschaftliche Grenzen. Die Anbindung an das Übertragungsnetz kann ein langwieriger Prozess sein, der neue Umspannstationen, Übertragungs-Upgrades, mehrere Genehmigungen und eine Gemeinschaftsüberprüfung erfordert. Dies sind Prozesse, die routinemäßig Jahre dauern. Hyperscale-Einrichtungen erfordern große Flächen, erhebliche Wasserallokationen und komplexe Umweltgenehmigungen. Gemeinschaften sind zunehmend gegen die Entwicklung neuer Rechenzentren wegen Lärm, Wasserverbrauch und Landauswirkungen. Und zentrale Campus konzentrieren das Risiko, sodass Wetterereignisse, Netzabschaltungen oder geopolitische Störungen große Teile der globalen Rechenkapazität beeinträchtigen können. Verteilte Architekturen bieten geografische Redundanz und betriebliche Widerstandsfähigkeit.
Die Zukunft ist eine Multi-Tier-KI-Architektur
Wenn es darum geht, sicherzustellen, dass die Inferenz-Rechenleistung reibungslos läuft, kann die Effizienz genauso wichtig werden wie die rohe Kapazität. Die Inferenz verbraucht Energie kontinuierlich, und Branchenanalysten deuten darauf hin, dass die Inferenz letztendlich den größten Teil des KI-bedingten Energieverbrauchs ausmachen könnte. Effizienzgewinne durch lokale erneuerbare Integration, reduzierte Übertragungsverluste, richtig dimensionierte Bereitstellungen, verbesserte thermische Profile und höhere Auslastungsraten werden unerlässlich, um die globale KI-Nachfrage nachhaltig zu decken. Verteilte kommerzielle Rechenzentren sind gut positioniert, um diese Gewinne zu liefern, da sie dort platziert werden können, wo Energie reichlich, günstig oder ungenutzt ist.
Die nächste Phase der KI-Infrastruktur wird eine Hybridmischung aus Hyperscale-Campus, die die Ausbildung dominieren, verteilten kommerziellen Rechenzentren, die die Inferenz bedienen, und Randgeräten, die ultra-lokale Arbeitslasten bedienen. Diese Multi-Tier-Architektur spiegelt die physischen Realitäten von Leistung, Latenz, Sicherheit und Skalierbarkeit wider. Wenn die KI in Echtzeitsysteme in allen Branchen integriert wird, muss die Infrastruktur entsprechend evolvieren, um die Inferenz näher an die Welt zu bringen, die sie bedient.












