Entretiens

Christian Stano, Field CTO chez Anyscale – Série d’entretiens

mm
Ajouter Unite.AI à vos sources préférées sur Google

Christian Stano, Field CTO chez Anyscale, a construit sa carrière à l’intersection de l’infrastructure d’intelligence artificielle à grande échelle, des plateformes d’apprentissage automatique et du calcul distribué. Avant de rejoindre Anyscale, il a dirigé l’organisation de la plateforme AI/ML chez Attentive, où il a mis à l’échelle l’infrastructure pour supporter la personnalisation pour plus de la moitié milliard d’abonnés et a aidé à promouvoir l’adoption de systèmes de calcul unifiés basés sur Ray qui amélioraient la vitesse de développement tout en réduisant les coûts opérationnels. Plus tôt dans sa carrière, il a travaillé dans la cybersécurité, l’architecture cloud et les initiatives d’intelligence artificielle dans le secteur public dans des organisations telles que Coalfire et Deloitte, où il a contribué à l’une des premières plateformes d’apprentissage automatique du ministère de la Défense des États-Unis. Son expérience couvre l’ingénierie de plateformes d’intelligence artificielle, les opérations d’apprentissage automatique, les infrastructures cloud natives, l’activation des développeurs et la mise à l’échelle des organisations, lui donnant une expérience approfondie pour aider les entreprises à opérationnaliser l’intelligence artificielle à grande échelle.

Anyscale est l’entreprise derrière Ray, le cadre de calcul distribué open source largement utilisé pour mettre à l’échelle les charges de travail d’intelligence artificielle et Python sur des grappes de processeurs et de GPU. Fondée par les créateurs originaux de Ray de l’UC Berkeley’s RISELab, l’entreprise se concentre sur la simplification du déploiement, de l’orchestration et de la gestion de l’infrastructure d’intelligence artificielle à grande échelle pour la formation, l’inférence, le traitement des données et les charges de travail d’intelligence artificielle. Sa plateforme permet aux organisations de faire tourner des systèmes d’intelligence artificielle distribués sur des environnements cloud et sur site tout en offrant une observabilité, une gouvernance et des optimisations de performances conçues pour les applications d’intelligence artificielle modernes. Ray est devenu une couche fondamentale dans la pile d’infrastructure d’intelligence artificielle émergente, aidant les développeurs à mettre à l’échelle les charges de travail d’une seule machine à des milliers de nœuds avec des changements minimaux dans le code Python existant.

Vous avez travaillé dans la cybersécurité, les plateformes d’apprentissage automatique dans le secteur public et les systèmes de personnalisation à grande échelle. Quels sont les modèles que vous avez constamment vus lorsque les organisations tentent de passer des pilotes à la production ?

À travers les industries, trois modèles apparaissent régulièrement. Premièrement, les équipes n’ont pas un chemin fiable pour passer de la phase de développement à la phase de production. Elles peuvent construire un modèle dans un cahier, mais il n’y a pas de méthode standardisée pour le faire fonctionner en production. Chaque déploiement devient un cas unique, et chaque échec est une surprise. Deuxièmement, l’infrastructure ne peut pas suivre les besoins. Le système qui fonctionnait dans un pilote s’effondre lorsque vous lui fournissez des volumes de données réels ou un trafic réel. Troisièmement, les équipes sont aveugles. Elles manquent d’observabilité pour savoir comment leurs systèmes fonctionnent réellement, où ils sont sur le point de se briser et quand intervenir.

Ce qui relie les trois est le même défi de base — les équipes n’ont pas un modèle mental solide pour la mise à l’échelle. Elles tentent de résoudre tout à la fois au lieu d’être délibérées dans la séquence. Je pense à cela comme trois phases : faire fonctionner, faire correctement, faire rapidement. Ces phases ne sont pas des jalons ponctuels — elles sont itératives. Vous donnez la priorité constamment à ce qui est cassé actuellement et à ce qui va se casser ensuite. Les équipes qui réussissent savent dans quelle phase elles se trouvent et restent disciplinées pour ne pas sauter en avant avant que la fondation soit solide.

Chez Anyscale, nous voyons des équipes arriver à chaque étape. Certaines sont encore en train d’essayer de faire fonctionner — elles ont besoin d’un chemin fiable de la phase de développement à la phase de production. D’autres ont cela, mais se noient dans la complexité opérationnelle et ont besoin de faire correctement. Et beaucoup viennent à nous parce qu’ils ont construit quelque chose qui fonctionne, mais ne peuvent pas le pousser à l’échelle que l’entreprise exige. Une couche de calcul unifiée aide à chaque phase, mais le point d’entrée dépend de l’endroit où la douleur est la plus aiguë.

À Attentive, vous avez aidé à mettre à l’échelle les systèmes d’intelligence artificielle qui soutiennent des centaines de millions d’utilisateurs. Quels étaient les plus grands goulets d’étranglement architecturaux ou organisationnels que vous deviez surmonter pour atteindre ce niveau d’échelle ?

Le plus grand goulet d’étranglement était la courbe en S de la complexité de l’infrastructure. Lorsque nous avons poussé nos modèles pour incorporer plus de données et servir plus de clients, nous avons atteint un point d’inflection de calcul où même les nœuds les plus grands à échelle verticale jetaient des erreurs de mémoire insuffisante, et une mise à l’échelle horizontale naive ne suffisait pas non plus. Notre calcul ne pouvait pas suivre l’échelle de nos données.

La réponse naturelle était de superposer davantage d’outils pour contourner les limites. C’était mon manuel interne à partir de l’expérience antérieure. Chaque outil résolvait un problème étroit, mais ajoutait de la complexité opérationnelle. Notre pipeline d’apprentissage automatique était confronté à un patchwork d’intégrations, et chaque nouveau cas d’utilisation signifiait plus de coutures, plus de modes de défaillance, plus de coûts et plus de surcharge pour l’équipe de la plateforme.

Ce qui a finalement débloqué l’échelle pour nous était l’unification du traitement des données, de la formation, de l’inférence et de la mise en service sur Ray et Anyscale. L’impact a été immédiat : avec des coûts d’infrastructure nettement plus bas, des cycles de formation nettement plus rapides même à mesure que les volumes de données augmentaient, et la capacité de mettre à l’échelle les modèles à des ordres de grandeur plus de clients.

Qu’est-ce qui vous a motivé à rejoindre Anyscale à ce stade, et comment voyez-vous le rôle de Field CTO façonnant l’adoption de l’intelligence artificielle dans les entreprises ?

Mon expérience en intégrant Anyscale dans Attentive a fondamentalement changé mon manuel pour construire des plateformes d’apprentissage automatique. Avant cela, une partie importante de l’ingénierie de la plateforme était le coût de la couture de systèmes fragmentés. Avec Anyscale, nous avons pu éliminer une grande partie de cette surcharge et nous concentrer plutôt sur l’expérience du développeur, la fiabilité et les performances. Ce changement a eu un impact énorme sur la productivité de l’équipe et les résultats du système. Rejoindre Anyscale a été une opportunité de travailler à temps plein sur ce problème et d’aider d’autres organisations à naviguer la même transition. En tant que Field CTO, mon rôle est vraiment de prendre ces leçons du monde réel et de les transformer en modèles répétables que nos clients peuvent appliquer lorsqu’ils mettent à l’échelle l’intelligence artificielle.

De nombreuses entreprises sont encore bloquées dans la « phase de pilote » de l’intelligence artificielle. De votre point de vue, qu’est-ce qui se brise spécifiquement lorsque les entreprises tentent de mettre à l’échelle ces premières expériences en systèmes de production ?

Lorsque les entreprises passent des expériences d’intelligence artificielle à la production, ce qui se brise n’est rarement que le modèle — c’est le système et les opérations environnants. Dans certains cas, les équipes atteignent des limites d’infrastructure tôt et ne peuvent pas former ou servir à l’échelle qu’elles veulent. Ils doivent limiter le nombre de clients ou les cas d’utilisation que leur modèle sert en conséquence. Plus souvent, des problèmes émergent en production à travers des cas de bord imprévus ou des changements dans les données. L’un des points de défaillance les plus courants est la mémoire : lorsque la taille des données, la distribution ou la modalité change, les tâches manquent de mémoire et échouent. Ces problèmes sont difficiles à anticiper et encore plus difficiles à récupérer automatiquement. La réalité est que la défaillance est inévitable dans la production d’intelligence artificielle. L’objectif n’est pas d’éviter complètement, mais de détecter rapidement, de comprendre et de construire des systèmes auto-réparateurs pour résoudre avant qu’il n’affecte l’entreprise.

Ray, le cadre de calcul distribué créé par l’équipe derrière Anyscale, gagne du terrain en tant que fondation pour les charges de travail d’intelligence artificielle. Pourquoi l’exécution distribuée devient-elle une couche si critique dans l’infrastructure d’intelligence artificielle moderne ?

L’exécution distribuée et la gestion des charges de travail sont devenues des enjeux majeurs pour les pipelines d’intelligence artificielle. Les charges de travail d’intelligence artificielle modernes sont inhérentement parallèles et gourmandes en ressources. La formation, l’inférence et le traitement des données nécessitent toutes la coordination de grandes tâches sur des processeurs et des GPU, souvent de manière dynamique. Dans le paysage de calcul d’aujourd’hui, la complexité de la gestion de ces charges de travail sur des ressources rares est un fardeau opérationnel massif. Les systèmes traditionnels n’ont pas été conçus pour ce niveau de complexité ou d’échelle. Des cadres comme Ray sont critiques car ils permettent aux équipes de mettre à l’échelle les charges de travail en douceur d’une seule machine à des milliers de nœuds en automatisant la coordination sous-jacente. Ce changement reflète un mouvement plus large vers l’informatique native d’intelligence artificielle, où l’infrastructure est conçue spécifiquement pour les modèles de charges de travail d’intelligence artificielle plutôt que d’être adaptée de paradigmes plus anciens.

À mesure que davantage d’entreprises adoptent Ray via la plateforme Anyscale, quels sont les différences que vous voyez entre les organisations qui standardisent sur une approche unifiée et celles qui cousent des outils fragmentés ?

La différence entre les plateformes unifiées et les outils fragmentés se résume finalement à la concentration et à l’efficacité. Lorsque les équipes s’appuient sur plusieurs systèmes déconnectés, elles passent beaucoup de temps à coudre ces systèmes ensemble, à gérer les incohérences et à répondre aux défaillances dans différents environnements. Cela crée une surcharge opérationnelle et ralentit l’expérimentation. En revanche, une approche unifiée permet aux équipes de concentrer leurs efforts sur l’amélioration d’un seul système, ce qui conduit à une meilleure fiabilité, à des performances plus solides et à une expérience développeur plus fluide. Cela simplifie également les processus de dépannage et de maintenance, car les modèles sont cohérents et plus faciles à comprendre. Le résultat n’est pas seulement l’efficacité technique, mais la clarté organisationnelle.

Sur la base de votre expérience en construisant des plateformes d’apprentissage automatique de bout en bout, combien l’expérience du développeur (DevEx) est-elle importante pour accélérer l’adoption de l’intelligence artificielle au sein des équipes ?

L’expérience du développeur est l’un des domaines à haut rendement pour accélérer l’adoption de l’intelligence artificielle. Lorsque les équipes de plateforme investissent dans la facilité d’utilisation des systèmes grâce à des flux de travail standardisés, des modèles et une réduction de la friction d’infrastructure, elles amplifient la productivité de chaque ingénieur dans l’organisation. C’est particulièrement important dans l’intelligence artificielle, où le rythme du changement est extrêmement rapide et où les équipes ont besoin d’itérer rapidement pour rester compétitives. Les améliorations de l’expérience du développeur se traduisent directement par une expérimentation plus rapide, un temps de production plus rapide et, finalement, un plus grand impact commercial. Les outils de codage d’intelligence artificielle amplifient ces fondamentaux d’expérience du développeur. De bien des manières, c’est la façon la plus scalable d’augmenter la vitesse dans une organisation.

L’efficacité coût est devenue une préoccupation majeure à mesure que les charges de travail d’intelligence artificielle se mettent à l’échelle. Quels sont certains des moyens les plus négligés pour que les entreprises réduisent les coûts d’infrastructure sans sacrifier les performances ?

À mesure que les charges de travail d’intelligence artificielle se mettent à l’échelle, la gestion des coûts devient à la fois plus importante et plus complexe. L’un des défis les plus négligés est la façon dont rapidement les coûts peuvent s’envoler en raison d’inefficacités, en particulier avec les infrastructures basées sur les GPU. De grands clusters peuvent démarrer des milliers de nœuds, et si les ressources ne sont pas gérées ou arrêtées correctement, les coûts s’accumulent rapidement. Cela crée une forme de prolifération spécifique à l’intelligence artificielle, où l’utilisation du calcul augmente plus vite que les équipes ne peuvent la suivre ou la contrôler. Pour résoudre ce problème, il faut combiner une gouvernance solide, une visibilité et une automatisation, comme le scaling automatique, la fin automatique et la gestion centralisée des ressources. À l’échelle, l’efficacité coût n’est pas seulement une préoccupation opérationnelle, c’est un élément fondamental de la conception du système.

Vous avez travaillé sur tout, des magasins de fonctionnalités aux systèmes d’inférence en temps réel. Comment pensez-vous que l’équilibre entre les charges de travail d’intelligence artificielle par lots et en temps réel est en train d’évoluer ?

L’équilibre entre les charges de travail d’intelligence artificielle par lots et en temps réel n’a pas fondamentalement changé — il s’agit toujours d’une question d’exigences commerciales. Le traitement par lots est généralement plus rentable et plus facile à exploiter, ce qui le rend adapté à de nombreux cas d’utilisation. Les systèmes en temps réel sont essentiels lorsque la latence affecte directement l’expérience utilisateur ou le résultat commercial, comme dans les applications de chat ou la détection de la fraude. Les deux approches continueront de coexister, et la clé pour les organisations est de construire des plateformes qui peuvent prendre en charge chacune efficacement. La décision revient finalement à des compromis entre coût, latence et fiabilité.

En regardant vers l’avenir, à quoi ressemble une plateforme d’intelligence artificielle d’entreprise « mature » dans 2-3 ans — et comment des outils comme Ray et des plateformes comme Anyscale s’insèrent-elles dans cet avenir ?

Au cours des prochaines années, les plateformes d’intelligence artificielle d’entreprise matures seront définies par plusieurs caractéristiques clés. Elles s’appuieront sur une infrastructure unifiée qui prend en charge l’ensemble du cycle de vie de l’intelligence artificielle, de la gestion des données à la formation et à l’inférence, plutôt que sur une collection d’outils déconnectés. Elles auront de solides opérations de jour 2, avec des capacités d’automatisation, d’observabilité, de fiabilité et de débogage rapides. La gestion des coûts sera prévisible et gérée, permettant aux organisations de se mettre à l’échelle de manière durable. Et peut-être plus important encore, elles permettront une grande vitesse de développement, rendant facile pour les équipes de passer de l’idée à la production rapidement. Des plateformes comme Ray et Anyscale jouent un rôle central dans cet avenir en fournissant les fondements d’intelligence artificielle native qui rendent possible ce niveau d’échelle et d’efficacité. Thank you for the great interview, les lecteurs qui souhaitent en savoir plus devraient visiter Anyscale.

Antoine est un leader visionnaire et associé fondateur d'Unite.AI, animé par une passion inébranlable pour façonner et promouvoir l'avenir de l'IA et de la robotique. Un entrepreneur en série, il croit que l'IA sera aussi perturbatrice pour la société que l'électricité, et se fait souvent prendre en train de vanter le potentiel des technologies perturbatrices et de l'AGI.

En tant que futuriste, il se consacre à explorer comment ces innovations vont façonner notre monde. En outre, il est le fondateur de Securities.io, une plateforme axée sur l'investissement dans les technologies de pointe qui redéfinissent l'avenir et remodelent des secteurs entiers.