Συνεντεύξεις
Κέβιν Τάμπς, PhD, ΣVP Στρατηγικών Λύσεων στο Penguin Computing – Σειρά Συνεντεύξεων

Ο Κέβιν Τάμπς, PhD, είναι ο Ανώτερος Αντιπρόεδρος του Στρατηγικού Ομίλου Λύσεων στο Penguin Computing. Το Penguin Computing σχεδιάζει εξατομικευμένες, αγνωστικές, ολοκληρωμένες λύσεις (υλικού/λογισμικού/υπηρεσιών) για να解决σει τα σύνθετα επιστημονικά, αναλυτικά και μηχανικά προβλήματα που αντιμετωπίζουν οι εταιρείες Fortune 500, οι νεοφυείς εταιρείες, τα ακαδημαϊκά ιδρύματα και οι ομοσπονδιακές οργανώσεις.
Τι σας έκανε να ενδιαφερθείτε αρχικά για το πεδίο της επιστήμης των υπολογιστών;
Οι γονείς μου αγόρασαν έναν υπολογιστή όταν ήμουν πολύ νέος και πάντα είχα ενδιαφέρον και ταλέντο για τους υπολογιστές και την πειραματική τους χρήση. Μέσω της εκπαίδευσής μου, συνεχώς έτρεχα προς τα STEM πεδία και αυτό με οδήγησε να θέλω να συμμετάσχω σε ένα πιο εφαρμοσμένο πεδίο. Η βάση μου είναι η φυσική και η Υψηλή Επίδοση Υπολογισμών (HPC). Το γεγονός ότι είχα μια αγάπη για τους υπολογιστές από νωρίς, μου επέτρεψε να διατηρήσω την επιστήμη των υπολογιστών στο επίκεντρο κάθε άλλου επιστημονικού, μαθηματικού ή μηχανικού ενδιαφέροντος που είχα, το οποίο με οδήγησε στο σημείο όπου βρίσκομαι σήμερα.
Το Penguin Computing συνεργάζεται στενά με το Open Compute Project (OCP) – τι είναι ακριβώς αυτό;
Από την αρχή του Open Compute Project (OCP), το Penguin Computing ήταν ένας πρώιμος υιοθετητής, υποστηρικτής και σημαντικός συνεισφέρων στην προσπάθεια να φέρει τα οφέλη του OCP στις Υψηλές Επιδόσεις Υπολογισμών (HPC) και την τεχνητή νοημοσύνη (AI).
Ο στόχος του OCP είναι να φέρει μαζί μια παγκόσμια κοινότητα αναπτυξιακών για να δημιουργήσει ένα πλήρες οικοσύστημα τεχνολογίας υποδομής που να είναι πιο αποτελεσματική, ευέλικτη και κλιμακωτή. Το Penguin Computing εντάχθηκε στο OCP λόγω των ανοιχτών τεχνολογιών και της ιδέας της κοινότητας. Αυτό που κάναμε με τον καιρό είναι να διασφαλίσουμε ότι η κληρονομιά και οι τεχνολογίες από τις παραδοσιακές HPC και τις αναδυόμενες τάσεις στην AI και την ανάλυση μπορούν να κλιμακωθούν αποτελεσματικά – το Penguin Computing οδηγεί αυτά τα πράγματα στο OCP.
Ένα από τα οφέλη του OCP είναι ότι μειώνει το συνολικό κόστος ιδιοκτησίας (TCO) – χαμηλότερα κεφαλαια έξοδα, χάρη στην αφαίρεση όλων των στοιχείων Vanity, και χαμηλότερα λειτουργικά έξοδα λόγω της εξυπηρέτησης από το μπροστινό μέρος, της κοινής δύναμης και άλλων αλλαγών σχεδιασμού – το οποίο καθιστά την τεχνολογία OCP-based ιδανική για κλιμάκωση.
Το Penguin Computing έχει πολλά προϊόντα OCP, συμπεριλαμβανομένων των πλατφορμών Penguin Computing Tundra Extreme Scale και Penguin Computing Tundra AP. Οι πλατφόρμες Tundra είναι επίσης συμβατές με τις HPC και AI εργασίες.
Η Tundra AP, η τελευταία γενιά της υψηλής πυκνότητας πλατφόρμας υπερυπολογισμού μας, συνδυάζει την επεξεργαστική ισχύ των Intel (INTC ) Xeon Scalable 9200 σειράς επεξεργαστών με τον διακομιστή Relion XO1122eAP της Penguin Computing σε一个 OCP φορμά που προσφέρει υψηλή πυκνότητα πυρήνων CPU ανά ραφι.
Όταν πρόκειται για μεγάλα δεδομένα, για να βελτιστοποιήσετε τα επίπεδα απόδοσης, οι χρήστες πρέπει να αφαιρέσουν τα εμπόδια που επιβραδύνουν την πρόσβασή τους στα δεδομένα. Πώς αντιμετωπίζει το Penguin Computing αυτό το πρόβλημα;
Το Penguin Computing έχει αξιοποιήσει την ικανότητά μας να χρησιμοποιούμε ανοιχτές τεχνολογίες και να προχωρούμε γρήγορα με τις τρέχουσες τάσεις – μια από τις οποίες είναι τα μεγάλα δεδομένα ή η αύξηση των δεδομένων και των δεδομενο-κίνητων εργασιών. Σε απάντηση σε αυτό, έχουμε χτίσει την Ομάδα Στρατηγικών Λύσεων για να αντιμετωπίσουμε αυτό το πρόβλημα.
Στην αντιμετώπιση του προβλήματος, abbiamo βρει ότι η πλειοψηφία των εργασιών, ακόμη και από τις παραδοσιακές τεχνικές υπολογισμούς, είναι όλες мотивées να είναι πιο δεδομενο-κίνητες. Ως αποτέλεσμα, το Penguin Computing σχεδιάζει ολοκληρωμένες λύσεις από άκρο σε άκρο, προσπαθώντας να κατανοήσει την εργασία του χρήστη. Για να δημιουργήσουμε μια εργασία-βελτιστοποιημένη λύση από άκρο σε άκρο, εστιάζουμε στο εργασία-βελτιστοποιημένο λογισμικό επίπεδο, το οποίο περιλαμβάνει την ορχήστρα και την παράδοση της εργασίας. Βασικά, πρέπει να κατανοήσουμε πώς ο χρήστης θα χρησιμοποιήσει την υποδομή.
Επόμενο, προσπαθούμε να εστιάσουμε στην εργασία-βελτιστοποιημένη υπολογιστική υποδομή. Υπάρχουν διάφορα επίπεδα δεδομένων και προκλήσεις IO που applies πολλή πίεση στην υπολογιστική υποδομή. Για παράδειγμα, διαφορετικές εργασίες απαιτούν διαφορετικές συνδυασμούς επιταχυνόμενης υπολογιστικής υποδομής από CPUs, GPUs, μνήμη και δικτύωση που επιτρέπει στα δεδομένα να ρέουν μέσω και να υπολογίζονται.
Τέλος, πρέπει να κατανοήσουμε ποια λύσεις θα μας επιτρέψουν να παραδώσουμε αυτά τα δεδομένα. Εξετάζουμε τις εργασία-βελτιστοποιημένες υποδομές δεδομένων για να κατανοήσουμε πώς η εργασία αλληλεπιδρά με τα δεδομένα, ποια είναι οι απαιτήσεις χωρητικότητας και IO προτύπων. Μόλις έχουμε αυτή την πληροφορία, μας βοηθά να σχεδιάσουμε ένα εργασία-βελτιστοποιημένο σύστημα.
Μόλις έχουμε όλες τις πληροφορίες, αξιοποιούμε την εσωτερική μας εμπειρία στο Penguin Computing για να αρχιτεκτονήσουμε ένα σχέδιο και μια ολοκληρωμένη λύση. Γνωρίζοντας ότι είναι σχεδιασμένο από μια πλευρά απόδοσης, πρέπει να κατανοήσουμε πού θα αναπτυχθεί (σε προσωρινό, cloud, άκρο, συνδυασμό όλων, κ.λπ.). Αυτή είναι η προσέγγιση του Penguin Computing για την παράδοση μιας βελτιστοποιημένης λύσης για δεδομενο-κίνητες εργασίες.
Μπορείτε να συζητήσετε τη σημασία της χρήσης μιας GPU αντί για μια CPU για βαθιά μάθηση;
Μια από τις μεγαλύτερες τάσεις που έχω δει σχετικά με τη σημασία των GPU για τη βαθιά μάθηση ήταν η μετατόπιση από τη χρήση γενικής χρήσης GPU (GPGPU) ως μια δεδομενο-παράλληλη συσκευή που επέτρεψε να επιταχύνουμε τον όγκο των υπολογισμών που μπορούμε να λύσουμε. Αυτό έχει συμβεί τα τελευταία δέκα χρόνια.
Συμμετείχα στις πρώτες φάσεις του προγραμματισμού GPGPU όταν ήμουν στο μεταπτυχιακό και στις αρχές της καριέρας μου. Πιστεύω ότι η αύξηση της πυκνότητας υπολογισμού, όπου μια GPU προσφέρει πολλή πυκνή ανάλυση και αναλυτικά πυρήνες σε μια συσκευή και επιτρέπει να ληφθούν περισσότερα σε ένα χώρο διακομιστή και να ξαναχρησιμοποιηθούν, ήταν μια πραγματική αλλαγή τάσης στις HPC και τελικά στις AI κοινότητες.
Ωστόσο, πολύ από αυτό εξαρτιόταν από την μετατροπή και την βελτιστοποίηση του κώδικα για να τρέξει σε GPU αντί για CPU. Όσο κάναμε这一 εργασία, περιμέναμε την концепτία του killer app – την εφαρμογή ή την περίπτωση χρήσης που πραγματικά ξεκινά ή είναι ενεργοποιημένη από μια GPU. Για την κοινότητα GPGPU, η βαθιά μάθηση ήταν αυτή η εφαρμογή που γαλβανίσε τις προσπάθειες και την ανάπτυξη στην επιτάχυνση των HPC και AI εργασιών.
Με τον καιρό, υπήρξε μια αναβίωση της AI και της μηχανικής μάθησης (ML), και η βαθιά μάθηση ήρθε στο προσκήνιο. Καταλάβαμε ότι η εκπαίδευση ενός νευρωνικού δικτύου χρησιμοποιώντας βαθιά μάθηση χαρτογραφούσε πολύ καλά την υποκείμενη σχεδίαση μιας GPU. Πιστεύω ότι όταν αυτά τα δύο πράγματα συναντήθηκαν, είχαμε τη δυνατότητα να κάνουμε τα είδη βαθιάς μάθησης που δεν ήταν δυνατό να γίνουν προηγουμένως από τους επεξεργαστές CPU και τελικά μας οριοθέτησαν να κάνουμε AI και σε κλίμακα και στην πράξη.
Μόλις οι GPU ήρθαν στη θέση τους, πραγματικά αναζωογόνησαν την ερευνητική και αναπτυξιακή κοινότητα γύρω από την AI και τη βαθιά μάθηση, γιατί απλώς δεν είχαμε το επίπεδο υπολογισμού για να το κάνουμε αποτελεσματικά και δεν ήταν δημοκρατισμένο. Η GPU πραγματικά μας επιτρέπει να παραδώσουμε μια πυκνή υπολογιστική που στο κέντρο της είναι σχεδιασμένη καλά για τη βαθιά μάθηση και την έφερε σε ένα επίπεδο λύσεων αρχιτεκτονικής που έκανε πιο εύκολη την πρόσβασή της σε περισσότερους ερευνητές και επιστήμονες. Πιστεύω ότι αυτό είναι ένας από τους μεγάλους λόγους για τους οποίους οι GPU είναι καλύτεροι για τη μελέτη της βαθιάς μάθησης.
Ποια είναι κάποια από τις λύσεις υπολογισμού που επιταχύνουν με GPU που προσφέρει το Penguin Computing;
Το Penguin Computing είναι τώρα επικεντρωμένο σε ολοκληρωμένες λύσεις που εργάζονται από την Ομάδα Στρατηγικών Λύσεων, ιδιαίτερα με την πρακτική AI και Ανάλυσης της Penguin Computing. Μέσα σε αυτήν την πρακτική, επικεντρωνόμαστε σε τρεις υψηλού επιπέδου προσεγγίσεις για λύσεις που επιταχύνουν με GPU.
Πρώτα, προσφέρουμε μια αναφορά αρχιτεκτονικής για αναλυτικά άκρου, όπου κοιτάμε να σχεδιάσουμε λύσεις που ταιριάζουν σε μη παραδοσιακούς κέντρους δεδομένων (έξω στο άκρο ή κοντά στο άκρο). Αυτό μπορεί να περιλαμβάνει κέντρα δεδομένων τηλεπικοινωνιών, εμπορικές εγκαταστάσεις, σταθμούς βενζίνης και άλλα. Αυτές είναι όλες εφαρμογές πλήρης λύσης που περιλαμβάνουν GPU-επιταχυνόμενη υλική και λογισμική για να ενεργοποιήσουν τους ερευνητές και τους τελικούς χρήστες να τις χρησιμοποιήσουν αποτελεσματικά.
Η επόμενη κατηγορία λύσεων του Penguin Computing είναι χτισμένες για κέντρα δεδομένων και πυρήνα AI εκπαίδευσης και inference αρχιτεκτονικές. Θα μπορούσατε να σκεφτείτε να καθίσετε μέσα σε ένα μεγάλο κέντρο δεδομένων ή στο cloud (Penguin Computing Cloud) όπου κάποιοι από τους πελάτες μας κάνουν μεγάλη κλίμακα εκπαίδευση χρησιμοποιώντας χιλιάδες GPU για να επιταχύνουν τη βαθιά μάθηση. Κοίταμε πώς να παραδώσουμε ολοκληρωμένες λύσεις και αναφορές αρχιτεκτονικής που υποστηρίζουν όλες αυτές τις εργασίες λογισμικού και εμποτισμού μέσω GPU σχεδιασμού και διάταξης, όλα τα way μέχρι τις απαιτήσεις υποδομής δεδομένων που τις υποστηρίζουν.
Η τρίτη κατηγορία αρχιτεκτονικής αναφοράς σε αυτήν την πρακτική είναι ένας συνδυασμός των δύο προηγούμενων. Τι ψάχνουμε στην τρίτη αρχιτεκτονική αναφορά είναι πώς να δημιουργήσουμε τα δεδομένα υφάσματα και μονοπάτια και ροές εργασιών για να ενεργοποιήσουμε τη συνεχής μάθηση, ώστε να μπορέσουμε να τρέξουμε inference χρησιμοποιώντας τις λύσεις άκρου που επιταχύνουν με GPU, να πιέσουμε αυτά τα δεδομένα σε ιδιωτικό ή δημόσιο cloud, να συνεχίσουμε να εκπαιδεύουμε και όταν τα νέα μοντέλα εκπαίδευσης ενημερωθούν, να τα πιέσουμε πίσω στο inference. Έτσι, έχουμε einen ιεραρχικό κύκλο συνεχούς μάθησης και AI μοντέλων.
Το Penguin Computing έχει αναπτύξει πρόσφατα einen νέο υπερυπολογιστή για το LLNL σε συνεργασία με την Intel και την CoolIT. Μπορείτε να μας πείτε για αυτόν τον υπερυπολογιστή και για τι ήταν σχεδιασμένος;
Ο υπερυπολογιστής Magma, αναπτυγμένος στο LLNL, αγοράστηκε μέσω της σύμβασης Commodity Technology Systems (CTS-1) με την Εθνική Υπηρεσία Πυρηνικής Ασφάλειας (NNSA) και είναι μια από τις πρώτες αναπτύξεις των επεξεργαστών Intel Xeon Platinum 9200 σειράς με υποστήριξη από το CoolIT Systems complete direct liquid cooling και Omni-Path interconnect.
Χρηματοδοτούμενο από το πρόγραμμα Advanced Simulation & Computing (ASC) της NNSA, ο Magma θα υποστηρίξει το πρόγραμμα Life Extension της NNSA και τις προσπάθειες που είναι κρίσιμες για την εξασφάλιση της ασφάλειας, της ασφάλειας και της αξιοπιστίας των πυρηνικών όπλων της χώρας μας στην απουσία υπογείων δοκιμών.
Ο υπερυπολογιστής Magma είναι ένα σύστημα HPC που είναι ενισχυμένο με τεχνητή νοημοσύνη και είναι μια σύγκλιση πλατφόρμας που επιτρέπει στην AI να επιταχύνει την HPC μοντελοποίηση. Ο Magma κατατάχθηκε στον κατάλογο Top500 του Ιουνίου 2020, μπαίνοντας στην κορυφή 100, κατατάσσοντας τον 80ο.
Υπό τη σύμβαση CTS-1, το Penguin Computing έχει παραδώσει περισσότερα από 22 petaflops υπολογιστικής ικανότητας για να υποστηρίξει το πρόγραμμα ASC στα NNSA Tri-Labs του Lawrence Livermore, Los Alamos και Sandia National Laboratories.
Ποια είναι κάποια από τα διαφορετικά τρόπα με τους οποίους το Penguin Computing υποστηρίζει τον αγώνα κατά του COVID-19;
Τον Ιούνιο του 2020, το Penguin Computing συνεργάστηκε正式ικά με την AMD για να παραδώσει ικανότητες HPC σε ερευνητές σε τρία κορυφαία πανεπιστήμια στις ΗΠΑ – New York University (NYU), Massachusetts Institute of Technology (MIT) και Rice University – για να βοηθήσει στον αγώνα κατά του COVID-19.
Το Penguin Computing συνεργάστηκε απευθείας με το AMD’s COVID-19 HPC Fund για να παρέχει ερευνητικά ιδρύματα με σημαντικές υπολογιστικές πόρους για να επιταχύνει την ιατρική έρευνα για το COVID-19 και άλλες ασθένειες. Το Penguin Computing και η AMD συνεργάζονται για να παραδώσουν ένα σύνολο από λύσεις HPC σε προσωρινό και cloud-based για το NYU, το MIT και το Rice University για να βοηθήσουν στην ανύψωση των ερευνητικών ικανοτήτων εκατοντάδων επιστημόνων που θα συμβάλλουν τελικά στην καλύτερη κατανόηση του νέου κοροναϊού.
Με την ισχύ των 2ης γενιάς AMD EPYC επεξεργαστών και Radeon Instinct MI50 GPU επιταχυντών, τα συστήματα που δωρήθηκαν στα πανεπιστήμια αναμένεται να παρέχουν πάνω από ένα petaflop υπολογιστικής απόδοσης. Ένα επιπλέον τέσσερα petaflops υπολογιστικής ικανότητας θα είναι διαθέσιμα στους ερευνητές μέσω της υπηρεσίας HPC cloud, Penguin Computing On-Demand (POD). Συνολικά, τα δωρημένα συστήματα θα παρέχουν στους ερευνητές πάνω από επτά petaflops GPU-επιταχυνόμενη υπολογιστική δύναμη που μπορεί να εφαρμοστεί για να πολεμήσει το COVID-19.
Τα πανεπιστήμια που λαμβάνουν τις δωρεές αναμένεται να χρησιμοποιήσουν τη νέα υπολογιστική ικανότητα σε eine σειρά από pandemic-σχετικές εργασίες, συμπεριλαμβανομένων των γενωμικών, της ανάπτυξης εμβολίων, της επιστήμης μετάδοσης και της μοντελοποίησης.
Υπάρχει κάτι άλλο που θα ήθελε να μοιραστεί για το Penguin Computing;
Για περισσότερο από δύο δεκαετίες, το Penguin Computing έχει παραδώσει εξατομικευμένες, καινοτόμες και ανοιχτές λύσεις στον κόσμο της υψηλής απόδοσης και της τεχνικής υπολογιστικής. Οι λύσεις του Penguin Computing δίνουν στις οργανώσεις την ευελιξία και την ελευθερία που χρειάζονται για να αξιοποιήσουν τις τελευταίες τεχνολογίες στα περιβάλλοντα υπολογισμού τους. Οι οργανώσεις μπορούν να εστιάσουν τους πόρους τους στην παράδοση προϊόντων και ιδεών στην αγορά σε ρεκόρ χρόνο αντί να ασχολούνται με τις υποκείμενες τεχνολογίες. Οι λύσεις του Penguin Computing για AI/ML/Analytics, HPC, DataOps και cloud-φυσικές τεχνολογίες μπορούν να προσαρμοστούν και να συνδυαστούν για να ταιριάζουν στις τρέχουσες ανάγκες, αλλά και να προσαρμοστούν γρήγορα στις μελλοντικές ανάγκες και αλλαγές τεχνολογίας. Οι υπηρεσίες Penguin Computing Professional και Managed Services βοηθούν στην ενσωμάτωση, την εφαρμογή και τη διαχείριση λύσεων. Οι υπηρεσίες Hosting του Penguin Computing μπορούν να βοηθήσουν με το “πού” του περιβάλλοντος υπολογισμού, δίνοντας στις οργανώσεις επιλογές ιδιοκτησίας και την ευελιξία να τρέξουν σε προσωρινό, σε δημόσιο ή αφιερωμένο cloud, φιλοξενούμενο ή ως υπηρεσία.
Ευχαριστώ για τη μεγάλη συνέντευξη, οι αναγνώστες που επιθυμούν να μάθουν περισσότερα πρέπει να επισκεφθούν Penguin Computing.












