Interviews
Corey Sanders, Senior Vice President Product bei CoreWeave – Interview-Serie

Corey Sanders, Senior Vice President Product bei CoreWeave (CRWV ), leitet die Produktstrategie und -umsetzung für eine der am schnellsten wachsenden AI-fokussierten Cloud-Plattformen. Er ist verantwortlich für die Skalierung von Innovationen, die Gestaltung von kundenspezifischen Lösungen und die Stärkung der Position von CoreWeave im AI-Infrastruktur-Markt. Vor CoreWeave verbrachte Sanders zwei Jahrzehnte bei Microsoft (MSFT ) in leitenden Positionen, die Cloud-Engineering, branchenspezifische Plattformen, kommerzielle Lösungsstrategien und groß angelegte Unternehmenspartnerschaften umfassten, mit tiefgreifender Erfahrung in der Brücke zwischen technischer Umsetzung und Go-to-Market-Strategie.
CoreWeave ist ein AI-nativer Cloud-Anbieter, der speziell für Hochleistungsrechnen und große künstliche Intelligenz-Workloads entwickelt wurde. Das Unternehmen betreibt ein rasch expandierendes Netz von Rechenzentren in den USA und Europa, das GPU-beschleunigte Infrastruktur und Software für AI-Training, Inferenz und erweiterte Rechenanwendungen bietet. Durch die Konzentration auf eine zweckgebundene Architektur anstelle einer allgemeinen Cloud-Plattform ist CoreWeave zu einem kritischen Infrastruktur-Partner für AI-Labore und Unternehmen geworden, die Leistung, Skalierbarkeit und Effizienz im großen Maßstab suchen.
Sie haben über 20 Jahre bei Microsoft gearbeitet und sich mit Windows-Engineering, Cloud-Vertriebsstrategie und Microsoft Cloud for Industry beschäftigt. Was hat Ihnen diese Entwicklung über die tatsächlichen Treiber der Unternehmensadoption beigebracht, und wie wenden Sie diese Lektionen heute bei CoreWeave an?
Die Unternehmensadoption beginnt mit der Lösung eines spezifischen Kundenproblems. Innovation um der Innovation willen ist nicht wirklich entscheidend für das Unternehmen. Es geht darum, sich in die Lage des Kunden zu versetzen, um zu verstehen, was ihn wirklich plagt – sei es die Kosten für den Support, operative Komplexitäten, die Verbindung mit Kunden oder die Verwaltung globaler Teams und neuer Produktlinien – und dann Dienstleistungen anzubieten, die helfen. Sie sind oft bereit, innovativ in ihrer Herangehensweise zu sein, aber die wichtigste Überlegung ist, ihnen bei der Lösung ihres Problems zu helfen. Der häufigste Fehler, den ich bei der Produktgestaltung gesehen habe, ist, dass man sich zu sehr auf die Coolness eines Produkts konzentriert. Während dies im Consumer-Bereich Gewicht hat, kümmern sich Unternehmenskunden letztendlich mehr um die Nützlichkeit als um die Coolness.
CoreWeave wird oft als Anbieter von zweckgebundener AI-Infrastruktur beschrieben. Was bedeutet zweckgebunden aus produktspezifischer Sicht, und wo haben allgemeine Cloud-Plattformen Schwierigkeiten mit AI-Workloads?
Der größte Vorteil von zweckgebundenen Lösungen ist die Fähigkeit, Dienstleistungen ohne die Notwendigkeit anzubieten, jedes allgemeine Anwendungsfall zu lösen. Ich werde zwei Beispiele nennen: eines auf der Software-Seite und eines auf der Hardware-Seite.
Auf der Software-Seite konzentriert sich unser Object-Storage-Angebot mit LOTA-Cache speziell auf das Caching für AI-Workloads. Es wird direkt auf den GPU-Knoten bereitgestellt, bietet einen S3-Endpunkt für die Anwendung und reagiert auf GPU-Anfragen, indem es seinen Cache über mehrere Knoten hinweg spannt. Dies erhöht die Durchsatzrate zum GPU um bis zu 7 GB/s, was weit über dem liegt, was allgemeine Clouds bieten. Wir können dies erreichen, weil wir Design-Annahmen über AI-spezifische Workloads, Lese-/Schreib-Aufteilungen und Cluster-Layouts treffen. Wenn ein Kunde dies für die Bereitstellung einer Datenbank oder eines E-Commerce-Sites verwenden würde, hätte es nicht den gleichen Effekt. Das ist die Definition von zweckgebundener Software.
Das Hardware-Beispiel ist ähnlich. Aufgrund unserer umfassenden Bereitstellung der neuesten NVIDIA (NVDA ) -SKUs – viele davon erfordern Flüssigkühlung – hat CoreWeave spezifische Expertise und Rechenzentrums-Designs entwickelt, um diese Anforderungen zu unterstützen. Im Gegensatz zu größeren Clouds, die für Fungibilität bauen und dann rückwirkend Flüssigkühlung hinzufügen, baut CoreWeave Rechenzentren, die speziell auf AI ausgerichtet sind. Dies führt zu niedrigeren Kosten und höherer Verfügbarkeit für die neuesten SKU-Typen.
Unten finden Sie ein Bild des LOTA-Caches, der erwähnt wurde.

Wenn Kunden zum ersten Mal über die Skalierung von AI nachdenken, glauben viele, dass sie nur Zugang zu GPUs benötigen. Was merken sie typischerweise, dass sie vermissen, sobald sie mit dem Training oder der Bereitstellung von Modellen im großen Maßstab beginnen?
Angesichts der Komplexität von Workloads, die über massive GPU-Cluster laufen, werden die umgebenden Dienste zu den wahren Treibern des Erfolgs. Dazu gehören die offensichtlichen, wie Speicher und Netzwerk, aber auch kritische operative Dienste wie Beobachtbarkeit, Orchestrierung und Sicherheit. Hierbei glänzt CoreWeave mit unserem Mission-Control-Angebot. Es bietet Kunden tiefere Einblicke in die Knotengesundheit und Laufzeit über ihre Flotte hinweg, indem es diese Kenntnisse direkt in den Orchestrierungsmotor integriert. Dies ermöglicht es dem Kunden, seine Infrastruktur nicht als 1.000 einzelne GPUs, sondern als eine einzige, kohärente Job-Entität zu behandeln.
Was sind die wichtigsten Produktprioritäten, auf die Sie sich derzeit konzentrieren, um die Ergebnisse der Kunden zu verbessern, sei es Leistung, Zuverlässigkeit, Kostenpräzision oder Entwicklererfahrung?
Im Kern der Plattform konzentrieren wir uns ständig auf Leistung, Zuverlässigkeit und Beobachtbarkeit. Wir müssen sicherstellen, dass Kunden Aufträge auf wiederholbare und vorhersehbare Weise ausführen können, während sie jeden TFLOP in jedem GPU voll ausnutzen. Darüber hinaus arbeiten wir daran, die Onboarding-Prozesse für Kunden zu vereinfachen, die möglicherweise nicht mit jedem Glocken und Pfiff in einem Tool wie SLURM (das jeder verwendet, aber fast jeder hasst) vertraut sind. Schließlich entwickeln wir zusätzliche Dienste und Abrechnungsmodelle, um es einfacher zu machen, zu innovieren und klein anzufangen. Derzeit ist es überraschend schwierig, zu experimentieren, aufgrund hoher Einstiegshürden, wie Kapazitätsbeschränkungen, drei Jahre langen Verpflichtungen und dem Bedarf an spezialisierten Experten, nur um loszulegen. Wir möchten die Leichtigkeit der Innovation auf die AI-Plattform zurückbringen.
Wenn sich immer mehr AI-Workloads von trainingsintensiv zu inferenzintensiv verschieben, wie beeinflusst diese Übergang die Infrastruktur-Designs und Produkt-Entwicklungsentscheidungen?
Es eröffnet erhebliche Möglichkeiten, CoreWeaves bestehende Differenzierung auf Inferenzanforderungen anzuwenden. Zum Beispiel konzentriert sich der LOTA-Cache, den ich erwähnt habe, auf die Speisung von GPUs während des Trainings; jedoch können wir diese Technologie nehmen, sie in Dinge wie den KV-Cache integrieren und sie in einen leistungsstarken Inferenz-Differenzierer verwandeln. Ähnlich werden Tools wie Mission Control für die Inferenz noch wichtiger, da die Beobachtung der GPU-Gesundheit für den Betrieb hochverfügbarer agentischer Anwendungen von entscheidender Bedeutung ist.
Welche Fähigkeiten werden in den nächsten ein bis zwei Jahren die Führung im AI-Cloud-Markt definieren, und welche Fähigkeiten werden für die Kunden am wichtigsten sein?
Ich denke, dass die Führung durch zwei Dinge definiert wird. Erstens durch die Lieferung der immer größer werdenden Skalierungsanforderungen für das Training. Dies erfordert Fortschritte in der Beobachtbarkeit, Gesundheitsüberwachung und automatischen Wiederherstellung. Wenn man von hundert auf zehntausend GPUs distributed global wechselt, ist eine manuelle Reaktion auf Ausfälle nicht mehr möglich.
Zweitens durch die Lieferung der richtigen Dienste für Inferenz- und agentische Workloads. Dies erfordert globale Bereitstellungs-Fähigkeiten und Geschäftsmodelle, die das Experimentieren fördern. Dieses Nutzungsmuster half dem Cloud-Wachstum ursprünglich und ist im Zeitalter von AI etwas verloren gegangen. Wir müssen es durch bessere Plattform-Unterstützung, Multi-Cloud-Fähigkeiten und Multi-Region-Einfachheit wiederherstellen.
Sie haben zuvor branchenspezifische Cloud-Initiativen in Bereichen wie Gesundheitswesen, Einzelhandel, Finanzdienstleistungen, Fertigung und souveräne Cloud geleitet. Welche Lektionen aus diesen Branchen sind direkt auf die AI-Infrastruktur übertragbar, und welche nicht?
Generationswechsel in GPUs führen zu neuen Komplexitäten. Jeder neue Release bringt erhöhte Interkonnektivität, höhere Speicher und größere Leistungsbedürfnisse mit sich, die es uns erfordern, unsere Annahmen über die Knotenverbindungen und die Software-Lieferung zu überdenken. Wir müssen hier unermüdlich bleiben, um unsere Führungsposition zu behaupten. Auf der anderen Seite verbessert sich der Bereich, der am schnellsten fortschreitet, die Skalierbarkeit, die die Kunden erreichen können; die Geschwindigkeit, mit der sie sich an größere Rechen-Fußabdrücke anpassen, ist beeindruckend.
Welche betrieblichen Herausforderungen erweisen sich bei der Skalierung von AI-Rechenzentren und -Clustern als am schwierigsten zu lösen, und welche verbessern sich am schnellsten?
Die Generationswechsel der GPUs führen zu neuen Komplexitäten in der Gestaltung und der Software. Jeder neue GPU-Release bringt erhöhte Interkonnektivitätsfähigkeiten, höhere Speicher und größere Leistungsbedürfnisse mit sich, die es erfordern, unsere Annahmen über die Knotenverbindungen, die Rack-Verwaltung und die Software-Lieferung zu überdenken. Wir werden uns auf diese Arbeit konzentrieren müssen, um unsere Führungsposition zu behaupten. Diejenigen, die sich am schnellsten verbessern, sind diejenigen, die die Kunden mit der wachsenden Skalierbarkeit des Rechnens erreichen können.
Wie definiert CoreWeave Zuverlässigkeit, und welche Indikatoren spiegeln den Erfolg aus der Sicht des Kunden am besten wider?
Im großen Maßstab ist die wichtigste Überlegung für einen Kunden einfach, den Auftrag zu erledigen. In großen Operationen sind einzelne Ausfälle oder Verzögerungen erwartet. Der Schlüssel liegt darin, wie wir diese Probleme erkennen und automatisch darauf reagieren, um sicherzustellen, dass der Auftrag trotz der Herausforderungen abgeschlossen wird. Deshalb integrieren wir Mission Control in höhere Dienste wie SUNK (Slurm auf Kubernetes). Es ermöglicht es den Kunden, auf Ausfälle automatisch zu reagieren, ohne Stunden oder Wochen Arbeit zu verlieren. Für uns ist Erfolg nicht nur die Uptime der Knoten; es ist der Erfolg des Auftrags.
Welche große Verschiebung in der AI-Infrastruktur wird Ihrer Meinung nach noch unterschätzt, sei es in Bezug auf die Hardware-Evolution, die Spezialisierung von Stacks, Souveränitätsanforderungen oder neue Bereitstellungsmodelle?
Ich glaube, dass das Wiedererstarken von Verstärkendem Lernen (RL) als Teil des AI-Stacks noch unterschätzt wird. Während es kein neues Forschungsgebiet ist, wurde es während der ersten Welle der LLM-Entwicklung weitgehend überlagert. RL wird ein Comeback feiern und eine wichtige Rolle bei der Gestaltung von AI-Diensten spielen, die auf die sich ändernden Landschaften ihrer Benutzer reagieren. Deshalb sind wir sehr aufgeregt über das serverlose RL-Angebot, das wir heute haben.
Vielen Dank für das großartige Interview. Leser, die mehr erfahren möchten, sollten CoreWeave besuchen.












