Interviews

Doug Fuller, Vicepræsident for Software Engineering i Cornelis Networks – Interview Serie

mm
Føj Unite.AI til dine foretrukne kilder på Google

Som Vicepræsident for Software Engineering er Doug ansvarlig for alle aspekter af Cornelis Networks’ software-stack, herunder Omni-Path Architecture-drivere, meddelelsessoftware og indbyggede enhedsstyringssystemer. Før han kom til Cornelis Networks, ledede Doug software-engineering-hold i Red Hat inden for cloud-lagring og data-tjenester. Dougs karriere inden for HPC og cloud-computing begyndte på Ames National (ATLO ) Laboratorys Scalable Computing Laboratory. Efter flere roller i universitetsforskning kom Doug til USAs Energidepartements Oak Ridge National Laboratory i 2009, hvor han udviklede og integrerede nye teknologier på det verdensklasse Oak Ridge Leadership Computing Facility.

Cornelis Networks er en teknologileder, der leverer specialbyggede højpræstations-netværk til High Performance Computing (HPC), High Performance Data Analytics (HPDA) og Kunstig Intelligens (AI) til førende kommercielle, videnskabelige, akademiske og regeringsorganisationer.

Hvad var det, der oprindeligt tiltrak dig til datalogi?

Jeg syntes bare, at jeg nød at arbejde med teknologi. Jeg nød at arbejde med computere, da jeg voksede op; vi havde en modem på vores skole, der lod mig prøve Internettet, og jeg fandt det interessant. Som førsteårsstuderende på universitetet mødte jeg en USDOE-komputationsvidenskabsmand, mens jeg frivilligt arbejdede for National Science Bowl. Han inviterede mig på en tur rundt i hans HPC-laboratorium, og jeg var fanget. Jeg har været en supercomputer-geek lige siden.

Du arbejdede hos Red Hat fra 2015 til 2019, hvad var nogle af de projekter, du arbejdede på, og hvilke var dine vigtigste takeaway’er fra denne oplevelse?

Mit hovedprojekt hos Red Hat var Ceph-distribueret lagring. Jeg havde tidligere fokuseret udelukkende på HPC, og dette gav mig mulighed for at arbejde med teknologier, der var kritiske for cloud-infrastruktur. Det rimede. Mange af principperne for skalerbarhed, administrerbarhed og pålidelighed er ekstremt ens, selvom de er rettet mod at løse lidt forskellige problemer. I teknologisk henseende var min vigtigste takeaway, at cloud og HPC har meget at lære af hinanden. Vi bygger stadig forskellige projekter med samme Lego-sæt. Det har virkelig hjulpet mig til at forstå, hvordan de aktiverende teknologier, herunder netværk, kan komme til at bære på HPC-, cloud- og AI-applikationer. Det er også, hvor jeg virkelig kom til at forstå værdien af Open Source og hvordan man udfører Open Source, upstream-first software-udviklingsfilosofi, som jeg bragte med mig til Cornelis Networks. Personligt var Red Hat, hvor jeg virkelig voksede og modnedes som leder.

Du er i øjeblikket Vicepræsident for Software Engineering i Cornelis Networks, hvad er nogle af dine ansvarsområder, og hvordan ser din gennemsnitlige dag ud?

Som Vicepræsident for Software Engineering er jeg ansvarlig for alle aspekter af Cornelis Networks’ software-stack, herunder Omni-Path Architecture-drivere, meddelelsessoftware, netværksstyring og indbyggede enhedsstyringssystemer. Cornelis Networks er en spændende arbejdsplads, især i denne tid og på dette marked. Fordi af den grund er jeg ikke sikker på, at jeg har en “gennemsnitlig” dag. Nogle dage arbejder jeg med mit hold for at løse det seneste teknologiproblem. Andre dage interagerer jeg med vores hardware-arkitekter for at sikre, at vores næste generations-produkter vil levere for vores kunder. Jeg er ofte ude i markedet og møder vores fantastiske samfund af kunder og samarbejdspartnere for at sikre, at vi forstår og forudser deres behov.

Cornelis Networks tilbyder næste generations-netværk til High Performance Computing og AI-applikationer, kan du dele nogle detaljer om den hardware, der tilbydes?

Vores hardware består af et højpræstations-switchet netværksløsning. Til den ende tilbyder vi alle nødvendige enheder til at fuldt ud integrere HPC-, cloud- og AI-netværk. Omni-Path Host-Fabric Interface (HFI) er en lavprofil-PCIe-kort til endpoint-enheder. Vi producerer også en 48-port 1U “top-of-rack”-switch. Til større installationer laver vi to fuldt integrerede “direktør-klasse”-switch; en, der pakker 288 porte i 7U, og en 1152-port, 20U-enhed.

Kan du diskutere den software, der styrer denne infrastruktur, og hvordan den er designet til at reducere forsinkelse?

Først og fremmest giver vores indbyggede management-platform let installation og konfiguration samt adgang til en bred vifte af ydelses- og konfigurationsdata, der produceres af vores switch-ASIC’er.

Vores driver-software er udviklet som en del af Linux-kernen. Faktisk sender vi alle vores software-patches til Linux-kernel-samfundet direkte. Det sikrer, at alle vores kunder nyder maksimal kompatibilitet på tværs af Linux-distributioner og let integration med andre software som Lustre. Selvom det ikke er i forsinkelsesvejen, reducerer en in-tree-driver dramatisk installationskompleksiteten.

Omni-Path fabric manager (FM) konfigurerer og ruter en Omni-Path-fabrik. Ved at optimere trafikruter og genoprette hurtigt fra fejl giver FM industriansvarlig ydelse og pålidelighed på fabrikker fra få til tusinder af noder.

Omni-Path Express (OPX) er vores højpræstations-meddelelsessoftware, der blev udgivet i november 2022. Den var specifikt designet til at reducere forsinkelse i forhold til vores tidligere meddelelsessoftware. Vi udførte cykluspræcise simulationer af vores sende- og modtage-kodeveje for at minimere instruktionsantal og cache-anvendelse. Dette resulterede i dramatiske resultater: når du er i mikrosekund-regimet, tæller hver cyklus!

Vi integrerede også med OpenFabrics Interfaces (OFI), en åben standard produceret af OpenFabrics Alliance. OFI’s modulære arkitektur hjælper med at minimere forsinkelse ved at tillade højere niveau-software, såsom MPI, at udnytte fabriksfunktioner uden ekstra funktioner.

Hele netværket er også designet til at øge skalerbarhed, kan du dele nogle detaljer om, hvordan det kan skaleres så godt?

Skalerbarhed er en kerneprincip i Omni-Path’s design. På de laveste niveauer bruger vi Cray link-lag-teknologi til at korrigere link-fejl uden forsinkelsesindvirkning. Dette påvirker fabrikker i alle størrelser, men er særligt vigtigt for store fabrikker, der naturligt oplever flere link-fejl. Vores fabric manager er fokuseret både på at programmere optimale routing-tabeller og på at gøre det på en hurtig måde. Dette sikrer, at routing for selv de største fabrikker kan fuldføres på en minimum mængde tid.

Skalerbarhed er også en kritisk komponent i OPX. Minimering af cache-anvendelse forbedrer skalerbarhed på enkelt-noder med store kerneantal. Minimering af forsinkelse forbedrer også skalerbarhed ved at forbedre tid til afslutning for kollektive algoritmer. At bruge vores host-fabrik-interface-resourcer mere effektivt muliggør, at hver kerne kan kommunikere med flere fjernpeere. Den strategiske valg af libfabric giver os mulighed for at udnytte software-funktioner som skalerbare slutpunkter med standardgrænseflader.

Kan du dele nogle detaljer om, hvordan AI er integreret i nogle af arbejdsprocesserne i Cornelis Networks?

Vi er ikke helt klar til at tale eksternt om vores interne brug af og planer for AI. Det sagde, så har vi dog “spist vores egen hundemad”, så vi kan udnytte forsinkelses- og skalerbarhedsforbedringerne, vi har gjort til Omni-Path for at støtte AI-arbejdsbelastninger. Det gør os endnu mere begejstrede for at dele disse fordele med vores kunder og partnere. Vi har bestemt observeret, at ligesom i traditionel HPC, er skalering af infrastruktur den eneste vej fremad, men udfordringen er, at netværkspræstation let kan være begrænset af Ethernet og andre traditionelle netværk.

Hvad er nogle af de ændringer, du forudser i branchen med fremkomsten af generativ AI?

Først og fremmest vil brugen af generativ AI gøre mennesker mere produktive – ingen teknologi i historien har gjort mennesker overflødige. Enhver teknologisk evolution og revolution, vi har haft, fra bomulds-ginen til den automatiske væv, til telefonen, internettet og videre, har gjort visse job mere effektive, men vi har ikke arbejdet menneskeheden ud af eksistensen.

Gennem anvendelsen af generativ AI tror jeg, at virksomheder vil teknologisk avancere i en hurtigere takt, fordi de, der driver virksomheden, vil have mere fri tid til at fokusere på disse fremskridt. For eksempel, hvis generativ AI giver mere præcis prognosticering, rapportering, planlægning osv. – kan virksomheder fokusere på innovation i deres ekspertiseområde

Jeg føler specifikt, at AI vil gøre os til multidisciplinære eksperter. For eksempel, som en skalerbar software-ekspert, forstår jeg sammenhængen mellem HPC, big data, cloud og AI-applikationer, der driver løsninger som Omni-Path. Udstyret med en generativ AI-assistent kan jeg dykke dybere ind i meningen af de applikationer, der bruges af vores kunder. Jeg har ingen tvivl om, at dette vil hjælpe os med at designe endnu mere effektivt hardware og software til de markeder og kunder, vi betjener.

Jeg forudser også en generel forbedring af software-kvalitet. AI kan effektivt fungere som “endnu et par øjne” til at statisk analysere kode og udvikle indsigt i fejl og ydelsesproblemer. Dette vil være særligt interessant på store skalaer, hvor ydelsesproblemer kan være særligt svære at spotte og dyre at reproducere.

Til sidst håber og tror jeg, at generativ AI vil hjælpe vores branche med at træne og påbegynde flere software-fagfolk uden tidligere erfaring med AI og HPC. Vores felt kan synes intimiderende for mange, og det kan tage tid at lære at “tænke i parallel”. Grundlæggende, ligesom maskiner gjorde det lettere at producere ting, vil generativ AI gøre det lettere at overveje og forstå begreber.

Er der noget andet, du gerne vil dele om dit arbejde eller Cornelis Networks i almindelighed?

Jeg vil gerne opmuntre enhver med interesse til at forfølge en karriere inden for datalogi, især inden for HPC og AI. På dette felt er vi udstyret med de mest kraftfulde beregningsressourcer, der nogensinde er bygget, og vi bringer dem til at bære mod menneskehedens største udfordringer. Det er en spændende arbejdsplads, og jeg har nydt det hver skridt af vejen. Generativ AI bringer vores felt til endnu nye højder, da efterspørgslen efter øget kapacitet øger dramatisk. Jeg kan ikke vente med at se, hvor vi går herefter.

Tak for det gode interview, læsere, der ønsker at lære mere, skal besøge Cornelis Networks.

Antoine er en visionær leder og medstifter af Unite.AI, drevet af en urokkelig passion for at forme og fremme fremtiden for AI og robotteknologi. En serieiværksætter, han tror, at AI vil være lige så omvæltende for samfundet som elektricitet, og han bliver ofte fanget i at tale om potentialet for omvæltende teknologier og AGI.

Som en futurist, er han dedikeret til at udforske, hvordan disse innovationer vil forme vores verden. Derudover er han grundlægger af Securities.io, en platform, der fokuserer på at investere i skarp teknologi, der gendefinerer fremtiden og omformer hele sektorer.