Η γωνία του Anderson

Περιορισμός των Αυξανόμενων Ενεργειακών Αναγκών του Machine Learning

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Ανταποκρινόμενοι στις αυξανόμενες ανησυχίες σχετικά με τις ενεργειακές απαιτήσεις των μεγάλων μοντέλων machine learning, μια πρόσφατη μελέτη από το MIT Lincoln Laboratory και το Πανεπιστήμιο του Northeastern έχει διερευνήσει τις οικονομίες που μπορούν να επιτευχθούν με τη θέσπιση ορίων ισχύος για τις GPU που χρησιμοποιούνται στην εκπαίδευση και στην εύρεση μοντέλων, καθώς και με διάφορες άλλες τεχνικές και μεθόδους για την περικοπή της ενεργειακής κατανάλωσης του AI.

Το νέο έργο καλεί επίσης για νέες επιστημονικές εργασίες από τον τομέα του machine learning να ολοκληρώνονται με μια «Δήλωση Ενέργειας» (παρόμοια με την πρόσφατη τάση για «ηθικές επιπτώσεις» στις εργασίες από τον τομέα της έρευνας του machine learning).

Η κύρια πρόταση από το έργο είναι ότι η θέσπιση ορίων ισχύος (περιορισμός της διαθέσιμης ισχύος στην GPU που εκπαιδεύει το μοντέλο) προσφέρει σημαντικά οφέλη σε terms of ενεργειακής εξοικονόμησης, ιδιαίτερα για το Masked Language Modeling (MLM) και τα πλαίσια όπως το BERT και οι παραλλαγές του.

Τρεις γλώσσες μοντελοποίησης που λειτουργούν στο ποσοστό της προεπιλεγμένης ρύθμισης 250W (μαύρη γραμμή), σε όρους κατανάλωσης ισχύος. Η περιορισμός της κατανάλωσης ισχύος δεν περιορίζει την αποτελεσματικότητα ή την ακρίβεια της εκπαίδευσης σε μια βάση 1-1 και προσφέρει οικονομίες ενέργειας που είναι αξιοσημείωτες σε κλίμακα. Πηγή: https://arxiv.org/pdf/2205.09646.pdf

Τρεις γλώσσες μοντελοποίησης που λειτουργούν στο ποσοστό της προεπιλεγμένης ρύθμισης 250W (μαύρη γραμμή), σε όρους κατανάλωσης ισχύος. Η περιορισμός της κατανάλωσης ισχύος δεν περιορίζει την αποτελεσματικότητα ή την ακρίβεια της εκπαίδευσης σε μια βάση 1-1 και προσφέρει οικονομίες ενέργειας που είναι αξιοσημείωτες σε κλίμακα. Πηγή: https://arxiv.org/pdf/2205.09646.pdf

Για μεγαλύτερα μοντέλα, τα οποία έχουν κερδίσει την προσοχή τα τελευταία χρόνια λόγω των υπερκλιμακωμένων συνόλων δεδομένων και των νέων μοντέλων με δισεκατομμύρια ή τρισεκατομμύρια παραμέτρους, παρόμοιες οικονομίες μπορούν να επιτευχθούν ως αντάλλαγμα μεταξύ του χρόνου εκπαίδευσης και της κατανάλωσης ενέργειας.

Εκπαίδευση πιο ισχυρών NLP μοντέλων σε κλίμακα υπό περιορισμούς ισχύος. Η μέση σχετική ώρα κάτω από einen 150W όριο εμφανίζεται σε μπλε και η μέση σχετική κατανάλωση ενέργειας για 150W σε πορτοκαλί.

Εκπαίδευση πιο ισχυρών NLP μοντέλων σε κλίμακα υπό περιορισμούς ισχύος. Η μέση σχετική ώρα κάτω από einen 150W όριο εμφανίζεται σε μπλε και η μέση σχετική κατανάλωση ενέργειας για 150W σε πορτοκαλί.

Για αυτές τις υψηλότερες κλίμακες, οι ερευνητές βρήκαν ότι ένα 150W όριο στην κατανάλωση ισχύος απέφερε μια μέση μείωση της κατανάλωσης ενέργειας κατά 13,7% σε σύγκριση με το προεπιλεγμένο μέγιστο 250W, καθώς και μια σχετικά μικρή αύξηση του χρόνου εκπαίδευσης κατά 6,8%.

Επιπλέον, οι ερευνητές σημειώνουν ότι, παρά τις επικεφαλίδες που η стоимость εκπαίδευσης μοντέλων έχει κερδίσει τα τελευταία χρόνια, η ενεργειακή κατανάλωση των εκπαιδευμένων μοντέλων είναι πολύ υψηλότερη*.

‘Για την γλωσσική μοντελοποίηση με BERT, οι ενεργειακές κέρδη μέσω της θέσπισης ορίων ισχύος είναι σημαντικά μεγαλύτερα κατά την εύρεση παρά κατά την εκπαίδευση. Εάν αυτό είναι συνεπές για άλλες εφαρμογές AI, αυτό θα μπορούσε να έχει σημαντικές επιπτώσεις σε όρους κατανάλωσης ενέργειας για μεγάλης κλίμακας ή cloud υπολογιστικές πλατφόρμες που εξυπηρετούν εφαρμογές εύρεσης για έρευνα και βιομηχανία.’

Περαιτέρω, και vielleicht πιο αμφιλεγόμενα, η εργασία προτείνει ότι η κύρια εκπαίδευση των μοντέλων machine learning θα πρέπει να ανατεθεί στους ψυχρότερους μήνες του έτους και τη νύχτα, για να εξοικονομηθεί ενέργεια.

Πάνω, στατιστικά PUE για κάθε ημέρα του 2020 στο κέντρο δεδομένων των συγγραφέων, με μια αξιοσημείωτη και διατηρημένη αύξηση/οροπέδιο τους θερινούς μήνες. Κάτω, η μέση ωριαία μεταβολή στο PUE για την ίδια τοποθεσία κατά τη διάρκεια μιας εβδομάδας, με την κατανάλωση ενέργειας που αυξάνεται προς το μέσο της ημέρας, καθώς και το εσωτερικό υλικό ψύξης GPU και το περιβάλλον κέντρο δεδομένων ψύξης αγωνίζονται να διατηρήσουν μια εργασίμη θερμοκρασία.

Πάνω, στατιστικά PUE για κάθε ημέρα του 2020 στο κέντρο δεδομένων των συγγραφέων, με μια αξιοσημείωτη και διατηρημένη αύξηση/οροπέδιο τους θερινούς μήνες. Κάτω, η μέση ωριαία μεταβολή στο PUE για την ίδια τοποθεσία κατά τη διάρκεια μιας εβδομάδας, με την κατανάλωση ενέργειας που αυξάνεται προς το μέσο της ημέρας, καθώς και το εσωτερικό υλικό ψύξης GPU και το περιβάλλον κέντρο δεδομένων ψύξης αγωνίζονται να διατηρήσουν μια εργασίμη θερμοκρασία.

Οι συγγραφείς δηλώνουν:

‘Εμφανώς, οι βαριές NLP εργασίες είναι τυπικά πολύ λιγότερο αποτελεσματικές το καλοκαίρι παρά αυτές που εκτελούνται κατά τη διάρκεια του χειμώνα. Δεδομένου του μεγάλου εποχιακού μεταβλητού, εάν υπάρχουν υπολογιστικά ακριβές πειράματα που μπορούν να χρονολογηθούν σε ψυχρότερους μήνες, αυτό μπορεί να μειώσει σημαντικά το αποτύπωμα άνθρακα.’

Η εργασία αναγνωρίζει επίσης τις αναδυόμενες δυνατότητες εξοικονόμησης ενέργειας που είναι δυνατές μέσω της περικοπής και της βελτιστοποίησης της αρχιτεκτονικής μοντέλου και των ροών εργασίας – αν και οι συγγραφείς αφήνουν την περαιτέρω ανάπτυξη αυτής της οδού σε άλλες πρωτοβουλίες.

Τέλος, οι συγγραφείς προτείνουν ότι νέες επιστημονικές εργασίες από τον τομέα του machine learning θα πρέπει να ενθαρρύνθούν ή vielleicht να περιοριστούν να ολοκληρωθούν με μια δήλωση που δηλώνει την κατανάλωση ενέργειας της εργασίας που διεξάγεται στην έρευνα και τις πιθανές ενεργειακές επιπτώσεις της υιοθέτησης πρωτοβουλιών που προτείνονται στην εργασία.

Η εργασία, οδηγώντας με το παράδειγμα, εξηγεί τις ενεργειακές επιπτώσεις της δικής της έρευνας.

Η εργασία, οδηγώντας με το παράδειγμα, εξηγεί τις ενεργειακές επιπτώσεις της δικής της έρευνας.

Η εργασία έχει τον τίτλο Μεγάλη Ισχύς, Μεγάλη Ευθύνη: Προτάσεις για τη Μείωση της Ενέργειας για την Εκπαίδευση Γλωσσικών Μοντέλων και προέρχεται από έξι ερευνητές σε όλο το MIT Lincoln και το Northeastern.

Η Προσεχείς Ενεργειακές Ανάγκες του Machine Learning

Καθώς οι υπολογιστικές απαιτήσεις για τα μοντέλα machine learning έχουν αυξηθεί σε συνδυασμό με τη χρησιμότητα των αποτελεσμάτων, η τρέχουσα κουλτούρα του ML ταυτίζει την ενεργειακή δαπάνη με τη βελτιωμένη απόδοση – παρά некоторых αξιοσημείωτων εκστρατειών, όπως ο Andrew Ng, που προτείνουν ότι η επιμέλεια δεδομένων μπορεί να είναι ένα πιο σημαντικό παράγοντα.

Σε μια κλειδί συνεργασία του MIT το 2020, εκτιμήθηκε ότι μια δεκαπλάσια βελτίωση της απόδοσης του μοντέλου συνεπάγεται μια 10.000-πλάσια αύξηση των υπολογιστικών απαιτήσεων, μαζί με μια αντίστοιχη ποσότητα ενέργειας.

Συglich, η έρευνα για λιγότερο ενεργοβόρες αποτελεσματικές εκπαιδεύσεις ML έχει αυξηθεί τα τελευταία χρόνια. Η νέα εργασία, οι συγγραφείς ισχυρίζονται, είναι η πρώτη που λαμβάνει μια βαθιά ματιά στην επίδραση των ορίων ισχύος στην εκπαίδευση και εύρεση του machine learning, με έμφαση στα NLP πλαίσια (όπως η σειρά GPT).

Καθώς η ποιότητα της εύρεσης είναι ένα परमόνθον ενδιαφέρον, οι συγγραφείς δηλώνουν για τις ευρημάτων τους στην αρχή:

‘Αυτή η μέθοδος δεν επηρεάζει τις προβλέψεις των εκπαιδευμένων μοντέλων ή συνεπώς την ακρίβεια της απόδοσης τους σε εργασίες. Δηλαδή, αν δύο δίκτυα με την ίδια δομή, αρχικές τιμές και διοχέτευση δεδομένων εκπαιδεύονται για το ίδιο αριθμό διοχέτευσης υπό διαφορετικά όρια ισχύος, τα αποτέλεσμα των παραμέτρων τους θα είναι ταυτόσημα και μόνο η ενέργεια που απαιτείται για την παραγωγή τους μπορεί να διαφέρει.’

Περικοπή της Ισχύος για NLP

Για να αξιολογήσουν την επίδραση των ορίων ισχύος στην εκπαίδευση και εύρεση, οι συγγραφείς χρησιμοποίησαν την nvidia-smi (Διασύνδεση Διαχείρισης Συστήματος) εργαλείο γραμμής εντολών, μαζί με μια βιβλιοθήκη MLM από HuggingFace.

Οι συγγραφείς εκπαίδευσαν μοντέλα NLP BERT, DistilBERT και Big Bird πάνω στο MLM, και παρακολούθησαν την κατανάλωση ισχύος τους κατά την εκπαίδευση και την ανάπτυξη.

Τα μοντέλα εκπαιδεύτηκαν ενάντια στο σύνολο δεδομένων WikiText-103 για 4 εποχές σε διοχέτευση οκτώ, σε 16 V100 GPU, με τέσσερα διαφορετικά όρια ισχύος: 100W, 150W, 200W και 250W (η προεπιλογή, ή βάση, για μια NVIDIA V100 GPU). Τα μοντέλα είχαν παραμετρικές αρχικοποιήσεις και τυχαίες αρχικές τιμές, για να διασφαλιστεί η σύγκριση των εκπαιδεύσεων.

Όπως φαίνεται στην πρώτη εικόνα παραπάνω, τα αποτελέσματα δείχνουν καλές οικονομίες ενέργειας σε μη γραμμικές, ευνοϊκές αυξήσεις του χρόνου εκπαίδευσης. Οι συγγραφείς δηλώνουν:

‘Τα πειράματά μας δείχνουν ότι η εφαρμογή ορίων ισχύος μπορεί να μειώσει σημαντικά την κατανάλωση ενέργειας με το κόστος του χρόνου εκπαίδευσης.’

Λειψύδρυση του ‘Μεγάλου NLP’

Επόμενο, οι συγγραφείς εφαρμόζουν την ίδια μέθοδο σε μια πιο απαιτητική περίπτωση: εκπαίδευση του BERT με MLM σε κατανεμημένες ρυθμίσεις σε πολλαπλά GPU – μια πιο τυπική περίπτωση για καλά χρηματοδοτούμενα και δημοσιευμένα FAANG NLP μοντέλα.

Η κύρια διαφορά σε αυτήν την πείραμα ήταν ότι ένα μοντέλο μπορεί να χρησιμοποιήσει οποιαδήποτε ποσότητα GPU από 2-400 ανά εκπαίδευση. Οι ίδιοι περιορισμοί για την κατανάλωση ισχύος εφαρμόστηκαν, και η ίδια εργασία χρησιμοποιήθηκε (WikiText-103). Δείτε τη δεύτερη εικόνα παραπάνω για γραφικές παραστάσεις των αποτελεσμάτων.

Η εργασία δηλώνει:

‘Μέσος όρος σε κάθε επιλογή ρύθμισης, ένα 150W όριο στην κατανάλωση ισχύος οδήγησε σε μια μέση μείωση της κατανάλωσης ενέργειας κατά 13,7% και αύξηση του χρόνου εκπαίδευσης κατά 6,8% σε σύγκριση με το προεπιλεγμένο μέγιστο. [Το] 100W ρύθμιση έχει σημαντικά μεγαλύτερο χρόνο εκπαίδευσης (31,4% μεγαλύτερο κατά μέσο όρο). Ένα 200W όριο αντιστοιχεί σχεδόν με τον ίδιο χρόνο εκπαίδευσης με ένα 250W όριο αλλά με πιο μετρημένες οικονομίες ενέργειας από ένα 150W όριο.’

Οι συγγραφείς προτείνουν ότι αυτά τα αποτελέσματα υποστηρίζουν την περικοπή ισχύος στα 150W για αρχιτεκτονικές GPU και τις εφαρμογές που τρέχουν σε αυτές. Επίσης, σημειώνουν ότι οι οικονομίες ενέργειας που επιτυγχάνονται μεταφράζονται σε διαφορετικά υλικά πλαίσια και έτρεξαν τις δοκιμές ξανά για να συγκρίνουν τα αποτελέσματα για τις NVIDIA K80, T4 και A100 GPU.

Οικονομίες που επιτυγχάνονται σε τρία διαφορετικά NVIDIA GPU.

Οικονομίες που επιτυγχάνονται σε τρία διαφορετικά NVIDIA GPU.

Εύρεση, Όχι Εκπαίδευση, Καταναλώνει Ισχύ

Η εργασία αναφέρει πολλές προηγούμενες μελέτες που δείχνουν ότι, παρά τις επικεφαλίδες, είναι η εύρεση (η χρήση ενός ολοκληρωμένου μοντέλου, όπως ένα NLP μοντέλο) και όχι η εκπαίδευση που απαιτεί την μεγαλύτερη ποσότητα ισχύος, υποδεικνύοντας ότι καθώς τα δημοφιλή μοντέλα γίνονται εμπορεύματα και εισέρχονται στη μαζική αγορά, η κατανάλωση ισχύος θα μπορούσε να γίνει ένα μεγαλύτερο πρόβλημα από ότι είναι αυτή τη στιγμή σε αυτό το πιο πρωτογενές στάδιο της ανάπτυξης του NLP.

Έτσι, οι ερευνητές μετρούν την επίδραση της εύρεσης στην κατανάλωση ισχύος, βρίσκοντας ότι η επιβολή ορίων ισχύος έχει μια αξιοσημείωτη επίδραση στην εύρεση καθυστέρηση:

‘Συγκριτικά με το 250W, ένα 100W ρύθμιση απαιτούσε διπλάσιο χρόνο εύρεσης (αύξηση 114%) και κατανάλωσε 11,0% λιγότερη ενέργεια, 150W απαιτούσε 22,7% περισσότερο χρόνο και εξοικονομήθηκε 24,2% της ενέργειας, και 200W απαιτούσε 8,2% περισσότερο χρόνο με 12,0% λιγότερη ενέργεια.’

Χειμερινή Εκπαίδευση

Η εργασία προτείνει ότι η εκπαίδευση (αν όχι η εύρεση, για σαφείς λόγους) θα μπορούσε να προγραμματιστεί σε ώρες όταν το κέντρο δεδομένων είναι σε πico Power Usage Effectiveness (PUE) – αποτελεσματικά, αυτό είναι το χειμώνα και τη νύχτα.

‘Σημαντικές οικονομίες ενέργειας μπορούν να επιτευχθούν εάν οι εργασίες μπορούν να προγραμματιστούν σε ώρες όταν ένα χαμηλότερο PUE αναμένεται. Για παράδειγμα, η μεταφορά μιας σύντομης εργασίας από την ημέρα στη νύχτα μπορεί να προσφέρει μια περίπου 10% μείωση, και η μεταφορά μιας μεγαλύτερης, ακριβής εργασίας (π.χ. ένα γλωσσικό μοντέλο που διαρκεί εβδομάδες για να ολοκληρωθεί) από το καλοκαίρι στο χειμώνα μπορεί να δει μια 33% μείωση.

‘Ενώ είναι δύσκολο να προβλεφθεί η εξοικονόμηση που ένας μεμονωμένος ερευνητής μπορεί να επιτύχει, οι πληροφορίες που παρουσιάζονται εδώ υπογραμμίζουν τη σημασία των περιβαλλοντικών παραγόντων που επηρεάζουν την συνολική ενέργεια που καταναλώνεται από τις εργασίες τους.’

Κρατήστε το Νεφελώδες

Τέλος, η εργασία παρατηρεί ότι οι ιδιωτικές πηγές επεξεργασίας είναι απίθανο να έχουν εφαρμόσει τα ίδια μέτρα αποδοτικότητας με τα μεγάλα κέντρα δεδομένων και τους υψηλού επιπέδου παρόχους cloud υπολογιστών, και ότι οι περιβαλλοντικές ωφέλειες θα μπορούσαν να εξοικονομηθούν με τη μεταφορά των εργασιών σε τοποθεσίες που έχουν επενδύσει σημαντικά στην αποδοτικότητα των εγκαταστάσεων τους.

‘Ενώ υπάρχει η ευκολία να έχουν ιδιωτικές πηγές επεξεργασίας που είναι προσβάσιμες, αυτή η ευκολία έρχεται με ένα κόστος. Γενικά, οι οικονομίες ενέργειας και η επίδραση είναι πιο εύκολο να επιτευχθούν σε μεγαλύτερες κλίμακες. Τα κέντρα δεδομένων και οι παρόχοι cloud υπολογιστών κάνουν σημαντικές επενδύσεις στην αποδοτικότητα των εγκαταστάσεων τους.’

 

* Σημαντικοί σύνδεσμοι που δόθηκαν από την εργασία.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai