Entretiens
Corey Sanders, Vice-Président Senior Produit chez CoreWeave – Série d’entretiens

Corey Sanders, Vice-Président Senior Produit chez CoreWeave (CRWV ), dirige la stratégie et la mise en œuvre de l’un des plateformes cloud axées sur l’IA en croissance la plus rapide. Il est responsable de l’innovation, de la création de solutions personnalisées avec les clients et du renforcement de la position de CoreWeave sur le marché de l’infrastructure IA. Avant CoreWeave, Sanders a passé deux décennies chez Microsoft (MSFT ) dans des rôles de direction supérieure couvrant l’ingénierie cloud, les plateformes spécifiques à l’industrie, la stratégie de solutions commerciales et les partenariats d’entreprise à grande échelle, avec une expérience approfondie dans la jonction entre l’exécution technique et la stratégie de lancement sur le marché.
CoreWeave est un fournisseur de cloud natif IA conçu spécifiquement pour le calcul haute performance et les charges de travail d’intelligence artificielle à grande échelle. L’entreprise exploite un réseau de centres de données en expansion rapide aux États-Unis et en Europe, offrant une infrastructure et des logiciels accélérés par GPU conçus pour la formation, l’inférence et les cas d’utilisation de calcul avancé. En se concentrant sur une architecture conçue à des fins spécifiques plutôt que sur un cloud polyvalent, CoreWeave est devenu un partenaire d’infrastructure essentiel pour les laboratoires d’IA et les entreprises qui recherchent des performances, une évolutivité et une efficacité à grande échelle.
Vous avez passé plus de 20 ans chez Microsoft, travaillant sur l’ingénierie Windows, la stratégie de vente cloud et Microsoft Cloud pour l’industrie. Qu’est-ce que cette progression vous a appris sur ce qui pousse vraiment l’adoption des entreprises, et comment appliquez-vous ces leçons aujourd’hui chez CoreWeave?
L’adoption des entreprises commence par la résolution d’un problème spécifique pour le client. L’innovation pour l’innovation n’est pas vraiment cruciale pour l’entreprise. Il s’agit de se mettre à la place du client pour comprendre ce qui le préoccupe vraiment – que ce soit le coût du support, les complexités opérationnelles, la connexion avec les clients, la gestion d’équipes mondiales et de nouvelles lignes de produits – et de fournir des services qui aident. Les clients sont souvent prêts à innover dans leur approche, mais la considération la plus cruciale est de les aider à résoudre leur problème. L’erreur la plus fréquente que j’ai vue dans la conception de produits est de s’attacher trop à la “coolitude” d’un produit. Même si cela a du poids dans l’espace consommateur, les clients d’entreprise se soucient finalement plus d’utilité que de coolitude.
CoreWeave est souvent décrit comme offrant une infrastructure IA conçue à des fins spécifiques. Qu’est-ce que cela signifie concrètement d’un point de vue produit, et où les plateformes cloud polyvalentes ont-elles du mal avec les charges de travail IA?
Le plus grand avantage de la conception à des fins spécifiques est la capacité de se concentrer et de fournir des services sans avoir à résoudre chaque cas d’utilisation général. Je vais donner deux exemples : l’un dans les logiciels et l’autre dans le matériel.
Du côté des logiciels, notre offre de stockage d’objets avec LOTA cache est axée spécifiquement sur le cache pour les charges de travail IA. Elle se déploie directement sur les nœuds GPU, fournit un point de terminaison S3 pour l’application et répond aux demandes GPU en étendant son cache sur plusieurs nœuds. Cela augmente le débit vers le GPU jusqu’à 7 Go/s, bien au-delà de ce que les clouds polyvalents offrent. Nous pouvons atteindre cela car nous faisons des hypothèses de conception autour des charges de travail IA spécifiques, des répartitions lecture/écriture et des dispositions de cluster. Si un client utilisait cela pour héberger une base de données ou un site e-commerce, cela n’aurait pas le même impact. C’est la définition de la conception à des fins spécifiques des logiciels.
L’exemple matériel est similaire. Étant donné notre déploiement étendu des dernières générations de SKU NVIDIA (NVDA ) – dont beaucoup nécessitent un refroidissement liquide – CoreWeave a construit une expertise et des conceptions de centres de données spécifiques pour répondre à ces besoins. Contrairement aux plus grands clouds qui construisent pour la fungibilité et doivent ensuite ajouter rétroactivement un refroidissement liquide, CoreWeave construit des centres de données conçus pour l’IA dès le départ. Cela se traduit par des coûts inférieurs et une disponibilité plus élevée pour les derniers types de SKU.
Ci-dessous se trouve une image du cache LOTA mentionné.

Lorsque les clients pensent pour la première fois à la mise à l’échelle de l’IA, beaucoup croient qu’ils n’ont besoin que d’accéder aux GPU. Qu’est-ce qu’ils réalisent généralement manquer une fois qu’ils commencent à former ou à servir des modèles à grande échelle?
Étant donné la complexité de l’exécution de charges de travail sur de grands clusters GPU, les services environnants deviennent les véritables moteurs du succès. Cela inclut les évidents, comme le stockage et le réseau, mais également des services opérationnels critiques comme l’observabilité, l’orchestration et la sécurité. C’est là que CoreWeave brille vraiment avec notre offre Mission Control. Elle fournit aux clients une profonde compréhension de la santé des nœuds et du temps d’exécution sur leur flotte, en intégrant ces connaissances directement dans le moteur d’orchestration. Cela permet au client de traiter son infrastructure non pas comme 1 000 GPU individuels, mais comme une seule entité de travail cohérente.
Quels sont les principaux objectifs de produit sur lesquels vous vous concentrez actuellement pour améliorer les résultats des clients, que ce soit en termes de performances, de fiabilité, de prévisibilité des coûts ou d’expérience du développeur?
Dans la plateforme principale, nous nous concentrons constamment sur les performances, la fiabilité et l’observabilité. Nous devons nous assurer que les clients peuvent exécuter des tâches de manière répétitive et prévisible tout en tirant pleinement parti de chaque TFLOP dans chaque GPU. Au-delà de cela, nous travaillons à simplifier l’intégration pour les clients qui peuvent ne pas être familiers avec chaque fonctionnalité d’un outil comme SLURM (que tout le monde utilise, mais que presque tout le monde déteste). Enfin, nous développons des services et des modèles de facturation supplémentaires pour faciliter l’innovation et le démarrage à petite échelle. Actuellement, expérimenter est étonnamment difficile en raison de barrières à l’entrée élevées, telles que des contraintes de capacité, des engagements de trois ans et le besoin d’experts spécialisés pour simplement commencer. Nous voulons ramener la facilité d’innovation sur la plateforme IA.
À mesure que davantage de charges de travail IA passent d’une formation intensive à une inférence intensive, comment cette transition influence-t-elle la conception de l’infrastructure et les décisions de feuille de route de produit?
Cela crée des opportunités significatives pour appliquer la différenciation existante de CoreWeave aux exigences d’inférence. Par exemple, le cache LOTA que j’ai mentionné se concentre sur l’alimentation des GPU pendant la formation ; cependant, nous pouvons prendre cette même technologie, l’intégrer dans des choses comme le KVCache et la transformer en un puissant différentiateur d’inférence. De même, des outils comme Mission Control deviennent encore plus vitaux pour l’inférence, car observer la santé du GPU est crucial pour exécuter des applications hautement disponibles.
Sur les prochaines un ou deux années, qu’est-ce qui définira le leadership sur le marché du cloud IA, et quels seront les capacités les plus importantes pour les clients?
Je pense que le leadership sera défini par deux choses. La première est la fourniture des exigences d’échelle croissante pour la formation. Cela nécessitera des progrès dans l’observabilité, la surveillance de la santé et la récupération automatique. Lorsque vous passez de centaines à des dizaines de milliers de GPU distribués dans le monde, la réponse manuelle aux défaillances n’est pas réalisable.
La deuxième est la fourniture des bons services pour l’inférence et les charges de travail agissantes. Cela nécessite des capacités de déploiement mondial et des modèles commerciaux qui encouragent l’expérimentation. Ce modèle d’utilisation était ce qui a aidé le cloud à grandir à l’origine, et il a été en partie perdu dans l’ère de l’IA. Nous devons le ramener grâce à un meilleur support de plateforme, des capacités multi-cloud et une facilité d’utilisation multi-région.
Vous avez précédemment dirigé des initiatives cloud spécifiques à l’industrie dans les domaines des soins de santé, de la vente au détail, des services financiers, de la fabrication et du cloud souverain. Quelles leçons de ces secteurs verticaux se traduisent directement par l’infrastructure IA, et lesquelles ne le font pas?
Les changements de génération des GPU continuent d’introduire de nouvelles complexités. Chaque nouvelle version apporte une interconnectivité accrue, une mémoire plus élevée et des besoins en puissance plus importants, tous nécessitant de revoir nos hypothèses sur la façon dont les nœuds sont connectés et dont les logiciels sont fournis. Nous devons rester impitoyables ici pour maintenir notre position de leader. D’un autre côté, le domaine qui s’améliore le plus rapidement est l’échelle à laquelle les clients peuvent accomplir des choses ; la vitesse à laquelle ils s’adaptent à des empreintes de calcul plus grandes est impressionnante.
À mesure que les centres de données et les clusters IA continuent de grandir, quels sont les défis opérationnels les plus difficiles à résoudre actuellement, et lesquels s’améliorent le plus rapidement?
Les changements de génération des GPU continuent de créer de nouvelles complexités dans la conception et les logiciels. Chaque nouvelle version de GPU apporte une interconnectivité accrue, une mémoire plus élevée et des besoins en puissance plus importants, tous nécessitant de revoir nos hypothèses sur la façon dont les nœuds sont connectés, la façon dont les racks sont gérés et la façon dont les logiciels sont fournis. Nous devrons continuer à nous concentrer sur ce travail pour nous assurer de maintenir notre position de leader. Ce qui s’améliore le plus rapidement, c’est ce que les clients peuvent accomplir avec l’échelle croissante du calcul.
Dans l’infrastructure IA, la fiabilité va au-delà de la disponibilité. Comment CoreWeave définit-elle la fiabilité, et quels indicateurs reflètent le mieux le succès du point de vue du client?
À grande échelle, la considération la plus importante pour un client est simplement de terminer le travail. Dans les opérations massives, les défaillances ou les ralentissements individuels sont attendus. La clé est de détecter et de répondre automatiquement à ces problèmes pour nous assurer que le travail se termine malgré les défis. C’est pourquoi nous intégrons Mission Control dans des services de niveau supérieur comme SUNK (Slurm sur Kubernetes). Cela permet aux clients de répondre aux défaillances automatiquement sans perdre des heures ou des semaines de travail. Pour nous, le succès n’est pas seulement lié à la disponibilité des nœuds ; c’est lié à la réussite du travail.
En regardant vers l’avenir, quel grand changement dans l’infrastructure IA pensez-vous être encore sous-estimé, que ce soit lié à l’évolution du matériel, à la spécialisation des piles, aux exigences de souveraineté ou à de nouveaux modèles de déploiement?
Je crois que l’avènement de l’apprentissage par renforcement (RL) en tant que partie renouvelée de la pile IA est encore sous-estimé. Même si ce n’est pas un nouveau domaine d’étude, il a été en grande partie éclipsé pendant la première vague de développement de LLM. L’apprentissage par renforcement fait un comeback et jouera un rôle vital pour rendre les services IA plus réactifs aux paysages changeants de leurs utilisateurs. C’est pourquoi nous sommes très enthousiastes à propos de l’offre RL serveurless que nous avons aujourd’hui.
Merci pour cette grande interview, les lecteurs qui souhaitent en savoir plus peuvent visiter CoreWeave.












