Intervjuer

Doug Fuller, visepresident for programvareutvikling i Cornelis Networks – Intervju-serie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Som visepresident for programvareutvikling er Doug ansvarlig for alle aspekter av Cornelis Networks’ programvarestack, inkludert Omni-Path Architecture-drivere, meldingsprogramvare og innbygde enhetskontrollsystemer. Før han begynte i Cornelis Networks, ledet Doug programvareutviklingsteam i Red Hat innen skytjenester og dataservices. Dougs karriere innen HPC og skytjenester begynte på Ames National (ATLO ) Laboratorys Scalable Computing Laboratory. Etter flere roller innen universitetsforskning, begynte Doug i USAs energidepartements Oak Ridge National Laboratory i 2009, der han utviklet og integrerte nye teknologier på verdensledende Oak Ridge Leadership Computing Facility.

Cornelis Networks er en teknologileder som leverer spesialbygde høy-ytelsesnettverk for High Performance Computing (HPC), High Performance Data Analytics (HPDA) og kunstig intelligens (AI) til ledende kommersielle, vitenskapelige, akademiske og statlige organisasjoner.

Hva var det som først tiltalte deg om datavitenskap?

Jeg syntes bare å like å jobbe med teknologi. Jeg likte å jobbe med datamaskiner da jeg vokste opp; vi hadde en modem på skolen som lot meg prøve Internett og jeg fant det interessant. Som førsteårsstudent møtte jeg en USDOE-komputeringeniør mens jeg frivillig jobbet for National Science Bowl. Han inviterte meg til å besøke hans HPC-laboratorium og jeg ble hooked. Jeg har vært en superdatamaskin-geek siden.

Du jobbet i Red Hat fra 2015 til 2019, hva var noen av prosjektene du jobbet med og hva var dine viktigste takeaways fra denne erfaringen?

Mitt hovedprosjekt i Red Hat var Ceph-distribuert lagring. Jeg hadde tidligere fokusert utelukkende på HPC og dette ga meg mulighet til å jobbe med teknologier som var kritiske for skyinfrastruktur. Det rimte. Mange av prinsippene for skalerbarhet, håndterbarhet og pålitelighet er ekstremt like, selv om de er rettet mot å løse litt forskjellige problemer. I teknologisk forstand var min viktigste takeaway at sky og HPC har mye å lære av hverandre. Vi bygger stadig forskjellige prosjekter med samme Lego-sett. Dette har hjulpet meg å forstå hvordan de muliggjørende teknologiene, inkludert nettverk, kan brukes på HPC-, sky- og AI-applikasjoner. Det er også der jeg virkelig kom til å forstå verdien av åpen kildekode og hvordan å utføre åpen kildekode, upstream-first programvareutviklingsfilosofi som jeg tok med meg til Cornelis Networks. Personlig var Red Hat der jeg virkelig vokste og modnet som leder.

Du er nå visepresident for programvareutvikling i Cornelis Networks, hva er noen av dine ansvarsområder og hva ser en gjennomsnittsdag ut som for deg?

Som visepresident for programvareutvikling er jeg ansvarlig for alle aspekter av Cornelis Networks’ programvarestack, inkludert Omni-Path Architecture-drivere, meldingsprogramvare, nettverksstyring og innbygde enhetskontrollsystemer. Cornelis Networks er en spennende plass å være, særlig i denne tiden og markedet. Fordi det, er jeg ikke sikker på at jeg har en “gjennomsnittsdag”. Noen dager jobber jeg med mitt team for å løse de siste teknologiske utfordringene. Andre dager samarbeider jeg med våre maskinarkitekter for å sikre at våre neste generasjons produkter vil levere for våre kunder. Jeg er ofte ute i markedet og møter våre fantastiske kunder og samarbeidspartnere for å sikre at vi forstår og forutser deres behov.

Cornelis Networks tilbyr neste generasjons nettverk for High Performance Computing og AI-applikasjoner, kan du dele noen detaljer om maskinvaren som tilbys?

Vår maskinvare består av et høy-ytelses nettverk med switchet nettverksløsning. Til den ende tilbyr vi alle nødvendige enheter for å fullt ut integrere HPC-, sky- og AI-nettverk. Omni-Path Host-Fabric Interface (HFI) er en lavprofil PCIe-kort for endepunktsenheter. Vi produserer også en 48-port 1U “top-of-rack”-switch. For større installasjoner lager vi to fullt integrerte “direktør-klasse”-switcher; en som pakker 288 porter i 7U og en 1152-port, 20U-enhet.

Kan du diskutere programvaren som styrer denne infrastrukturen og hvordan den er designet for å redusere forsinkelse?

Først og fremst tilbyr vår innbygde styringsplattform enkel installasjon og konfigurasjon samt tilgang til en rekke ytelses- og konfigurasjonsmetrikker produsert av våre switch-ASIC-er.

Vår driverprogramvare er utviklet som en del av Linux-kjernen. Faktisk sender vi alle våre programvarepatcher til Linux-kjernensamfunnet direkte. Dette sikrer at alle våre kunder nyter maksimal kompatibilitet over Linux-distribusjoner og enkel integrasjon med andre programvare som Lustre. Mens det ikke er i forsinkelsesbanen, reduserer en in-tree-driver dramatisk installasjonskompleksiteten.

Omni-Path-fabrikken (FM) konfigurerer og ruter en Omni-Path-fabrikk. Ved å optimere trafikkruter og gjenopprette raskt fra feil, tilbyr FM bransjeledende ytelse og pålitelighet på nettverk fra titalls til tusenvis av noder.

Omni-Path Express (OPX) er vår høy-ytelses meldingsprogramvare, nylig lansert i november 2022. Den var spesifikt designet for å redusere forsinkelse sammenlignet med vår tidligere meldingsprogramvare. Vi kjørte syklusnøyaktige simuleringer av våre sende- og mottakskodebaner for å minimere instruksjonsantall og cache-utnyttelse. Dette produserte dramatiske resultater: når du er i mikrosekund-regimet, teller hver syklus!

Vi integrerte også med OpenFabrics Interfaces (OFI), en åpen standard produsert av OpenFabrics Alliance. OFI sin modulære arkitektur hjelper med å minimere forsinkelse ved å tillate høyere-nivå programvare, som MPI, å utnytte fabrikkfunksjoner uten ekstra funksjonskall.

Hele nettverket er også designet for å øke skalerbarhet, kan du dele noen detaljer om hvordan det kan skaleres så godt?

Skalerbarhet er en av grunnprinsippene i Omni-Path-designet. På laveste nivå bruker vi Cray-link-lag-teknologi for å korrigere link-feil uten forsinkelsesvirkning. Dette påvirker nettverk på alle skalaer, men er spesielt viktig for store nettverk, som naturlig sett opplever flere link-feil. Vår fabrikkstyrer er fokusert både på å programmere optimale rute-tabeller og på å gjøre dette på en rask måte. Dette sikrer at ruting for selv de største nettverk kan fullføres på en minimum tid.

Skalerbarhet er også en kritisk komponent i OPX. Minimering av cache-utnyttelse forbedrer skalerbarhet på enkelt-nivå med store core-tellinger. Minimering av forsinkelse forbedrer også skalerbarhet ved å forbedre tid til fullføring for kollektive algoritmer. Å bruke våre host-fabrikk-resurser mer effektivt muliggjør at hver core kan kommunisere med flere fjern-peere. Den strategiske valget av libfabric lar oss utnytte programvarefunksjoner som skalerbare endepunkter med standard-grensesnitt.

Kan du dele noen detaljer om hvordan AI er inkorporert i noen av arbeidsflyten i Cornelis Networks?

Vi er ikke helt klare til å diskutere våre interne bruken av og planer for AI. Det sagt, så spiser vi vår egen hundemat, så vi får dra nytte av forsinkelses- og skalerbarhetsforbedringene vi har gjort til Omni-Path for å støtte AI-arbeidsbelastninger. Dette gjør oss enda mer spente på å dele disse fordelene med våre kunder og partnere. Vi har absolutt observert at, som i tradisjonell HPC, å skalerer ut infrastruktur er den eneste fremover-veien, men utfordringen er at nettverksytelse lett kan bli hemmet av Ethernet og andre tradisjonelle nettverk.

Hva er noen av endringene du forutser i industrien med fremkomsten av generativ AI?

Først og fremst vil bruken av generativ AI gjøre mennesker mer produktive – ingen teknologi i historien har gjort mennesker overflødige. Hver teknologisk evolusjon og revolusjon vi har hatt fra bomullsginen til den automatiske vevstolen til telefonen, internettet og utover har gjort visse jobber mer effektive, men vi har ikke arbeidet menneskeheten ut av eksistensen.

Med anvendelsen av generativ AI tror jeg at bedrifter vil teknologisk fremme seg raskere fordi de som driver bedriftene vil ha mer fritid til å fokusere på disse fremgangene. For eksempel, hvis generativ AI gir mer nøyaktig prognostisering, rapportering, planlegging osv. – kan bedrifter fokusere på innovasjon i deres ekspertiseområde

Jeg føler spesifikt at AI vil gjøre hver av oss til en multidisiplinær ekspert. For eksempel, som en skalerbar programvareekspert, forstår jeg sammenhengene mellom HPC, stor data, sky og AI-applikasjoner som driver dem mot løsninger som Omni-Path. Utstyrt med en generativ AI-assistent, kan jeg dykke dyptere inn i meningen av applikasjonene som brukes av våre kunder. Jeg har ingen tvil om at dette vil hjelpe oss med å designe enda mer effektive maskinvare og programvare for markedene og kundene vi betjener.

Jeg forutser også en generell forbedring av programvarekvalitet. AI kan effektivt fungere som “et annet sett øyne” for å statisk analysere kode og utvikle innsikt i feil og ytelsesproblemer. Dette vil være særlig interessant på store skalaer hvor ytelsesproblemer kan være særlig vanskelige å spore og dyre å gjenskape.

Til slutt håper og tror jeg at generativ AI vil hjelpe vår bransje med å trene og påmelding av flere programvareprofesjonelle uten tidligere erfaring med AI og HPC. Vår bransje kan virke skremmende for mange, og det kan ta tid å lære å “tenke i parallell”. Grunnleggende, like maskiner gjorde det lettere å produsere ting, vil generativ AI gjøre det lettere å vurdere og granske konsepter.

Er det noe annet du ville like å dele om ditt arbeid eller Cornelis Networks generelt?

Jeg ville like å oppmuntre alle med interesse til å følge en karriere innen datavitenskap, spesielt innen HPC og AI. I denne bransjen er vi utstyrt med de kraftigste datamaskinressursene noensinne bygget, og vi setter dem inn mot menneskehetens største utfordringer. Dette er en spennende plass å være, og jeg har nytt hver eneste skritt på veien. Generativ AI bringer vår bransje til enda nye høyder, ettersom etterspørselen etter økende evne øker dramatisk. Jeg kan ikke vente med å se hvor vi går neste.

Takk for det flotte intervjuet, lesere som ønsker å lære mer kan besøke Cornelis Networks.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.