Entretiens

Doug Fuller, Vice-Président de l’Ingénierie Logicielle chez Cornelis Networks – Série d’Entretiens

mm
Ajouter Unite.AI à vos sources préférées sur Google

En tant que Vice-Président de l’Ingénierie Logicielle, Doug est responsable de tous les aspects de la pile logicielle de Cornelis Networks, y compris les pilotes d’architecture Omni-Path, les logiciels de messagerie et les systèmes de contrôle de périphériques intégrés. Avant de rejoindre Cornelis Networks, Doug a dirigé des équipes d’ingénierie logicielle chez Red Hat dans le domaine du stockage cloud et des services de données. La carrière de Doug dans le domaine de l’informatique haute performance et du cloud a commencé au laboratoire de calcul scalable d’Ames National (ATLO ) Laboratory. Après plusieurs rôles dans l’informatique de recherche universitaire, Doug a rejoint le laboratoire national d’Oak Ridge du département de l’Énergie des États-Unis en 2009, où il a développé et intégré de nouvelles technologies au sein de l’installation de calcul de pointe d’Oak Ridge.

Cornelis Networks est un leader technologique qui propose des tissus haute performance conçus pour les applications de calcul haute performance (HPC), d’analyse de données haute performance (HPDA) et d’intelligence artificielle (IA) aux principales organisations commerciales, scientifiques, universitaires et gouvernementales.

Qu’est-ce qui vous a initialement attiré vers l’informatique ?

Je me suis simplement découvert un intérêt pour la technologie. J’aimais travailler avec les ordinateurs lorsque j’étais jeune ; nous avions un modem à l’école qui me permettait d’essayer Internet et je l’ai trouvé intéressant. En tant que freshman à l’université, j’ai rencontré un scientifique informatique du DOE alors que je participais à la National Science Bowl. Il m’a invité à visiter son laboratoire de calcul haute performance et j’ai été conquis. Je suis devenu un geek de supercalculateurs depuis.

Vous avez travaillé chez Red Hat de 2015 à 2019, quels étaient certains des projets sur lesquels vous avez travaillé et quels étaient vos principaux enseignements tirés de cette expérience ?

Mon principal projet chez Red Hat était Ceph, un système de stockage distribué. J’avais précédemment concentré mon attention uniquement sur le calcul haute performance et cela m’a donné l’opportunité de travailler sur des technologies essentielles pour les infrastructures cloud. Cela se résume ainsi : de nombreux principes de scalabilité, de gestion et de fiabilité sont extrêmement similaires, même s’ils visent à résoudre des problèmes légèrement différents. En termes de technologie, mon enseignement le plus important a été que le cloud et le calcul haute performance ont beaucoup à apprendre l’un de l’autre. Nous construisons de plus en plus de projets différents avec le même jeu de Lego. Cela m’a vraiment aidé à comprendre comment les technologies d’activation, y compris les tissus, peuvent avoir un impact sur les applications de calcul haute performance, de cloud et d’IA. C’est également là que j’ai vraiment compris la valeur du logiciel open source et comment exécuter la philosophie de développement de logiciels open source, en amont, que j’ai apportée avec moi à Cornelis Networks. Sur le plan personnel, Red Hat est l’endroit où j’ai vraiment grandi et mûri en tant que leader.

Vous êtes actuellement Vice-Président de l’Ingénierie Logicielle chez Cornelis Networks, quels sont certains de vos responsabilités et à quoi ressemble votre journée moyenne ?

En tant que Vice-Président de l’Ingénierie Logicielle, je suis responsable de tous les aspects de la pile logicielle de Cornelis Networks, y compris les pilotes d’architecture Omni-Path, les logiciels de messagerie, la gestion de tissu et les systèmes de contrôle de périphériques intégrés. Cornelis Networks est un endroit passionnant pour y être, surtout à ce moment et sur ce marché. À cause de cela, je ne suis pas sûr d’avoir une “journée moyenne”. Certains jours, je travaille avec mon équipe pour résoudre le dernier défi technologique. D’autres jours, je suis en interaction avec nos architectes matériel pour m’assurer que nos prochains produits répondront aux besoins de nos clients. Je suis souvent sur le terrain, en rencontre avec notre incroyable communauté de clients et de collaborateurs, pour m’assurer que nous comprenons et anticipons leurs besoins.

Cornelis Networks propose une nouvelle génération de réseautage pour les applications de calcul haute performance et d’IA, pouvez-vous partager certains détails sur le matériel proposé ?

Notre matériel se compose d’une solution de tissu réseau commuté haute performance. À cette fin, nous fournissons tous les périphériques nécessaires pour intégrer pleinement les tissus de calcul haute performance, de cloud et d’IA. L’interface hôte-tissu Omni-Path (HFI) est une carte PCIe de faible profil pour les périphériques de pointe. Nous produisons également un commutateur “top-of-rack” 48 ports 1U. Pour les déploiements plus importants, nous réalisons deux commutateurs “director-class” entièrement intégrés ; l’un qui contient 288 ports en 7U et un appareil 1152 ports, 20U.

Pouvez-vous discuter du logiciel qui gère cette infrastructure et de la façon dont il est conçu pour réduire la latence ?

Tout d’abord, notre plate-forme de gestion intégrée offre une installation et une configuration faciles, ainsi qu’un accès à une large gamme de métriques de performances et de configuration produites par nos ASIC de commutateur.

Notre logiciel de pilote est développé dans le cadre du noyau Linux. En fait, nous soumettons toutes nos corrections de logiciel au noyau Linux directement. Cela garantit que tous nos clients bénéficient d’une compatibilité maximale entre les distributions Linux et d’une intégration facile avec d’autres logiciels tels que Lustre. Même si cela n’est pas sur le chemin de la latence, avoir un pilote dans l’arbre réduit considérablement la complexité d’installation.

Le gestionnaire de tissu Omni-Path (FM) configure et achemine un tissu Omni-Path. En optimisant les itinéraires de trafic et en se rétablissant rapidement des défaillances, le FM offre des performances et une fiabilité de pointe dans l’industrie sur des tissus allant de dizaines à des milliers de nœuds.

Omni-Path Express (OPX) est notre logiciel de messagerie haute performance, récemment publié en novembre 2022. Il a été spécifiquement conçu pour réduire la latence par rapport à notre logiciel de messagerie précédent. Nous avons effectué des simulations cycliques précises de nos chemins de code d’envoi et de réception pour minimiser le nombre d’instructions et l’utilisation du cache. Cela a produit des résultats spectaculaires : lorsque vous êtes dans le régime des microsecondes, chaque cycle compte !

Nous avons également intégré les Interfaces OpenFabrics (OFI), une norme ouverte produite par l’Alliance OpenFabrics. L’architecture modulaire de l’OFI aide à minimiser la latence en permettant aux logiciels de niveau supérieur, tels que MPI, d’exploiter les fonctionnalités de tissu sans appels de fonction supplémentaires.

L’ensemble du réseau est également conçu pour augmenter la scalabilité, pouvez-vous partager certains détails sur la façon dont il peut scaler si bien ?

La scalabilité est au cœur des principes de conception d’Omni-Path. Au niveau le plus bas, nous utilisons la technologie de liaison Cray pour corriger les erreurs de liaison sans impact de latence. Cela affecte les tissus à toutes les échelles, mais est particulièrement important pour les grands tissus, qui subissent naturellement plus d’erreurs de liaison. Notre gestionnaire de tissu se concentre à la fois sur la programmation de tables de routage optimales et sur la réalisation de celles-ci de manière rapide. Cela garantit que le routage, même pour les plus grands tissus, peut être effectué en un minimum de temps.

La scalabilité est également un composant critique d’OPX. La minimisation de l’utilisation du cache améliore la scalabilité sur les nœuds individuels avec des comptes de cœur importants. La minimisation de la latence améliore également la scalabilité en améliorant le temps d’achèvement des algorithmes collectifs. L’utilisation plus efficace des ressources d’interface hôte nous permet à chaque cœur de communiquer avec plus de pairs distants. Le choix stratégique de libfabric nous permet d’exploiter des fonctionnalités logicielles telles que des points de terminaison escalables à l’aide d’interfaces standard.

Pouvez-vous partager certains détails sur la façon dont l’IA est intégrée dans certains des flux de travail chez Cornelis Networks ?

Nous ne sommes pas encore prêts à discuter de nos utilisations internes et de nos plans pour l’IA. Cela étant dit, nous mangeons notre propre chien, nous pouvons donc profiter des améliorations de latence et de scalabilité que nous avons apportées à Omni-Path pour prendre en charge les charges de travail d’IA. Cela nous rend encore plus enthousiastes à partager ces avantages avec nos clients et partenaires. Nous avons certainement observé que, comme dans le calcul haute performance traditionnel, la mise à l’échelle de l’infrastructure est la seule voie à suivre, mais le défi est que les performances du réseau sont facilement étouffées par les réseaux traditionnels tels qu’Ethernet.

Quels sont certains des changements que vous prévoyez dans l’industrie avec l’avènement de l’IA générative ?

Tout d’abord, l’utilisation de l’IA générative rendra les gens plus productifs – aucune technologie dans l’histoire n’a rendu les êtres humains obsolètes. Chaque évolution et révolution technologique que nous avons eues, de la machine à coudre au métier à tisser automatique, au téléphone, à Internet et au-delà, ont rendu certains emplois plus efficaces, mais nous n’avons pas éliminé l’humanité de l’existence.

Grâce à l’application de l’IA générative, je crois que les entreprises avanceront technologiquement à un rythme plus rapide, car ceux qui dirigent l’entreprise auront plus de temps libre pour se concentrer sur ces progrès. Par exemple, si l’IA générative fournit des prévisions plus précises, des rapports, des plans, etc. – les entreprises peuvent se concentrer sur l’innovation dans leur domaine d’expertise.

Je ressens particulièrement que l’IA rendra chacun de nous un expert multidisciplinaire. Par exemple, en tant qu’expert en logiciels escalables, je comprends les liens entre le calcul haute performance, les grandes données, le cloud et les applications d’IA qui les poussent vers des solutions comme Omni-Path. Équipé d’un assistant d’IA générative, je peux plonger plus profondément dans le sens des applications utilisées par nos clients. J’ai aucun doute que cela nous aidera à concevoir du matériel et des logiciels encore plus efficaces pour les marchés et les clients que nous servons.

Je prévois également une amélioration générale de la qualité des logiciels. L’IA peut effectivement fonctionner comme “un autre ensemble d’yeux” pour analyser statiquement le code et développer des idées sur les bogues et les problèmes de performances. Cela sera particulièrement intéressant à grande échelle, où les problèmes de performances peuvent être particulièrement difficiles à repérer et coûteux à reproduire.

Enfin, j’espère et je crois que l’IA générative aidera notre industrie à former et à intégrer plus de professionnels du logiciel sans expérience préalable en IA et en calcul haute performance. Notre domaine peut sembler intimidant pour beaucoup et il peut falloir du temps pour apprendre à “penser en parallèle”. Fondamentalement, tout comme les machines ont rendu la fabrication de choses plus facile, l’IA générative rendra la considération et la réflexion sur les concepts plus faciles.

Y a-t-il autre chose que vous aimeriez partager sur votre travail ou sur Cornelis Networks en général ?

Je voudrais encourager quiconque ayant un intérêt à poursuivre une carrière dans l’informatique, en particulier dans le calcul haute performance et l’IA. Dans ce domaine, nous disposons des ressources de calcul les plus puissantes jamais construites et nous les mettons à contribution contre les plus grands défis de l’humanité. C’est un endroit passionnant pour y être, et j’ai apprécié chaque étape du chemin. L’IA générative amène notre domaine à de nouvelles hauteurs, car la demande de capacité croissante augmente drastiquement. Je suis impatient de voir où nous allons ensuite.

Je vous remercie pour cette grande interview, les lecteurs qui souhaitent en savoir plus peuvent visiter Cornelis Networks.

Antoine est un leader visionnaire et associé fondateur d'Unite.AI, animé par une passion inébranlable pour façonner et promouvoir l'avenir de l'IA et de la robotique. Un entrepreneur en série, il croit que l'IA sera aussi perturbatrice pour la société que l'électricité, et se fait souvent prendre en train de vanter le potentiel des technologies perturbatrices et de l'AGI.

En tant que futuriste, il se consacre à explorer comment ces innovations vont façonner notre monde. En outre, il est le fondateur de Securities.io, une plateforme axée sur l'investissement dans les technologies de pointe qui redéfinissent l'avenir et remodelent des secteurs entiers.