KI-Modelle und Plattformen
Runware liefert containerisierte AI-Rechenzentren fÞr gÞnstigere Inferenz

Runware hat am 4. August 2026 seinen Sonic-Inference-Pod gestartet, ein modulares Rechenzentrum, das bis zu 1.200 GPUs in einem 20-FuÃ-Container unterbringt, da der AI-Inferenz-Anbieter von der Wiederverkauf von Cloud-KapazitÃĪten zu eigenem, speziell entwickelten Hardware wechselt, das er sagt, traditionelle Rechenzentren in Bezug auf Kosten unterbietet. Das in London ansÃĪssige Unternehmen hat den Launch in einem Beitrag auf seinem eigenen Blog angekÞndigt und verspricht 30â80% niedrigere Inferenzpreise, wobei die erste Region bereits in Europa live ist und der Rollout in den USA gerade beginnt.
Jeder Pod ist eine selbststÃĪndige Inferenzanlage: bis zu 1.200 dicht gepackte GPUs liefern etwa 1 MW Rechenleistung, direkt flÞssigkeitsgekÞhlt durch ein geschlossenes Kreislaufsystem, das etwa 1,5 Kubikmeter Wasser recycelt und keines verbraucht, laut Runware. Das Unternehmen sagt, dass eine neue Einheit in Tagen bereitgestellt werden kann â eine durchschnittliche Bauzeit von etwa drei Wochen â im Vergleich zu den drei- bis fÞnfjÃĪhrigen ZeitrÃĪumen der konventionellen Rechenzentrumsbau. Die Inferenz wird auf zwei Arten verkauft: Kunden kÃķnnen ihren eigenen Code auf Runwares Flotte ausfÞhren, die pro Sekunde abgerechnet wird, oder Modelle hinter einer verwalteten API hochladen, die pro Ausgabe abgerechnet wird.
Co-Founder und CEO Flaviu Radulescu hat die Wette als eine Wette bezeichnet, dass die InferenzÃķkonomie kleine, verteilte, verlagerbare Einrichtungen gegenÞber den hyperskaligen Ausbauten bevorzugt, die den AI-Infrastrukturausgaben dominieren. âDie Nachfrage nach Inferenz wÃĪchst schneller, als Einrichtungen gebaut werden kÃķnnenâ, sagte Radulescu gegenÞber TechCrunch. âWas wir wollen, ist, die Weltintelligenz zu betreiben, das RÞckgrat zu sein, auf dem jedes AI-Modell lÃĪuft, mit KapazitÃĪten, die mit der Nachfrage Schritt halten, anstatt sie zu drosseln.â
Wie die Pods gebaut werden
Runwares Argumentation basiert auf der Streichung der Overhead-Kosten von allgemeinen Einrichtungen. Das Unternehmen argumentiert, dass 40â60% der traditionellen Rechenzentrumsausgaben fÞr Infrastruktur ausgegeben werden, die eine Inferenz-Workload nie verwendet, wie Backup-Systeme, Þberdimensionierte Redundanz, Þberdimensionierte GebÃĪude und dass etwa ein Drittel der ElektrizitÃĪt eines konventionellen Standorts fÞr KÞhlung und nicht fÞr Rechenleistung ausgegeben wird. Die geschlossene KÞhlung des Pods hÃĪlt die Prozesstemeratur unter 2°C unter anhaltender Last bei einer Leistungseffizienz von 99%, und die TrockenkÞhler bedeuten keinen Wasserverbrauch, ein deutlicher Anspruch, da der Wasserverbrauch von Rechenzentren lokale Opposition in den USA hervorruft.
Da jeder Pod einem einzigen Netzwerk beitritt, ist die Routing-Funktion eher ein Feature als ein Redundanzplan: Anfragen flieÃen zu dem Ort, an dem die KapazitÃĪt am nÃĪchsten zum Benutzer vorhanden ist, und ein Pod-Ausfall verlagert den Datenverkehr anstatt ein Rechenzentrum auÃer Betrieb zu setzen. Kunden, die dedizierte Hardware wÞnschen, kÃķnnen ganze Pods reservieren. Radulescu sagte, dass das Unternehmen derzeit 10 Pods in den USA, Europa und Asien-Pazifik bereitgestellt hat, mit 160 Standorten, die weitere Pods betreiben kÃķnnen, und Higgsfield AI und Wix zu den Inferenzkunden zÃĪhlen, die bereits auf der Plattform sind.
Der Rollout-Plan
Runwares verÃķffentlichter Zeitplan hat Europa bereits im Betrieb, den US-West-Deployments im Gange und eine erste Welle von KapazitÃĪten (10.000 Inferenzknoten in mehreren Regionen) fÞr die zweite HÃĪlfte von 2026 geplant. Das Unternehmen sagt, dass es auf 1 GW InferenzkapazitÃĪt bis 2027 skaliert. US-Zentral, US-Ost, Nord- und SÞdeuropa sowie Asien-Pazifik sind als geplante Regionen aufgefÞhrt.
Die Finanzierung hinter dem Ausbau
Der Pod-Launch erweitert eine Hardware-Strategie, die Runware seit seiner $50-Millionen-Serie-A aufgebaut hat, die im Januar 2026 angekÞndigt wurde und von Dawn Capital mit Beteiligung von Comcast (CMCSA ) Ventures, Speedinvest, Insight Partners und a16z speedrun gefÞhrt wurde. Diese Runde finanzierte die Erweiterung der Single-API-Plattform, wobei das Unternehmen auch weiterhin seine Inferenz-Pods aufbaut und bereitstellt, Infrastruktur, die Þberall dort platziert werden kann, wo die Stromkosten gering sind, und mehrjÃĪhrige Ausbauten vermeidet. GegrÞndet im Jahr 2023, sagt Runware, dass es Þber 10 Milliarden Generationen fÞr mehr als 200.000 Entwickler und 300 Millionen Endnutzer durch seine Single-API-Plattform bereitgestellt hat, die fast 300 Modelklassen aggregiert.
Das Unternehmen betritt ein kapitalintensives Rennen von der anderen Seite. WÃĪhrend OpenAI, xAI und die Hyperscaler Hunderte von Milliarden in feste Mega-Campusse investieren, setzt Runware darauf, dass ein bedeutender Anteil der Inferenznachfrage, Workloads, die gleichgÞltig sind, wo sie ausgefÞhrt werden, gÞnstiger und schneller durch KapazitÃĪten bedient werden kann, die in Containern transportiert, angeschlossen und verlagert werden kÃķnnen. Mit den ersten Pods live und KapazitÃĪtsreservierungen geÃķffnet, hat diese Wette nun Hardware hinter sich.












