มุมมองของ Anderson
การลดความต้องการพลังงานที่เพิ่มขึ้นของ Machine Learning

ในความกังวลที่เพิ่มขึ้นเกี่ยวกับความต้องการพลังงานของโมเดล Machine Learning ขนาดใหญ่ การศึกษาใหม่จาก MIT Lincoln Laboratory และ Northeastern University ได้ตรวจสอบการประหยัดที่สามารถทำได้โดยการจำกัดพลังงานของ GPU ที่ใช้ในการฝึกอบรมและอนุมาน รวมถึงเทคนิคและวิธีการอื่นๆ ในการลดการใช้พลังงานของ AI
งานใหม่นี้ยังเรียกร้องให้บทความวิจัย AI ใหม่ๆ มี ‘คำชี้แจงพลังงาน’ (คล้ายกับแนวโน้ม ‘คำชี้แจงผลกระทบทางจริยธรรม’ ในบทความวิจัยจากภาคส่วนการวิจัย Machine Learning)
คำแนะนำหลักจากงานนี้คือการจำกัดพลังงาน (จำกัดพลังงานที่มีอยู่สำหรับ GPU ที่ฝึกอบรมโมเดล) มีประโยชน์ในการประหยัดพลังงาน โดยเฉพาะสำหรับ Masked Language Modeling (MLM) และเฟรมเวิร์ก เช่น BERT และอนุพันธ์ของมัน

Three language modeling networks operating at a percentage of the default 250W settings (black line), in terms of power usage. Constraining power consumption does not constrain training efficiency or accuracy on a 1-1 basis, and offers power savings that are notable at scale. Source: https://arxiv.org/pdf/2205.09646.pdf
สำหรับโมเดลขนาดใหญ่ซึ่งได้รับความสนใจในหลายปีที่ผ่านมาเนื่องจากชุดข้อมูลขนาดใหญ่และโมเดลใหม่ที่มีพารามิเตอร์หลายพันล้านหรือหลายล้านล้าน การประหยัดพลังงานที่คล้ายกันสามารถทำได้โดยการแลกเปลี่ยนระหว่างเวลาในการฝึกอบรมและการใช้พลังงาน

Training more formidable NLP models at scale under power constraints. The average relative time under a 150W cap is shown in blue, and average relative energy consumption for 150W in orange.
สำหรับการใช้งานขนาดใหญ่เหล่านี้ นักวิจัยพบว่าการจำกัดพลังงานที่ 150W สามารถลดการใช้พลังงานลง 13.7% เมื่อเทียบกับการใช้พลังงานสูงสุด 250W โดยมีการเพิ่มขึ้นของเวลาในการฝึกอบรมเพียง 6.8%
นอกจากนี้ นักวิจัยยังระบุด้วยว่า แม้ว่าข่าวที่ว่าการฝึกอบรมโมเดลมีค่าใช้จ่ายสูง แต่ค่าใช้จ่ายพลังงานในการใช้โมเดลที่ฝึกอบรมแล้วนั้นมากกว่า *
‘สำหรับการสร้างแบบจำลองภาษาโดยใช้ BERT การประหยัดพลังงานจากการจำกัดพลังงานนั้นมากกว่าเมื่อทำการอนุมาน หากสิ่งนี้เป็นจริงสำหรับการใช้งาน AI อื่นๆ ก็อาจมีผลกระทบอย่างมีนัยสำคัญต่อการบริโภคพลังงานสำหรับแพลตฟอร์มการประมวลผลขนาดใหญ่หรือการประมวลผลบนคลาวด์สำหรับการวิจัยและอุตสาหกรรม’
さらにและอาจเป็นที่ถกเถียงกันมากที่สุด บทความนี้แนะนำให้การฝึกอบรมโมเดล Machine Learning หลักๆ ควรทำในช่วงฤดูหนาวและเวลากลางคืนเพื่อประหยัดค่าใช้จ่ายในการทำความเย็น

Above, PUE statistics for each day of 2020 in the authors’ data center, with a notable and sustained spike/plateau in the summer months. Below, the average hourly variation in PUE for the same location in the course of a week, with energy consumption rising towards the middle of the day, as both the internal GPU cooling hardware and the ambient data center cooling struggle to maintain a workable temperature.
ผู้เขียนระบุว่า:
‘เห็นได้ชัดว่า การทำงาน NLP ที่หนักหน่วงมักจะไม่มีประสิทธิภาพมากนักในช่วงฤดูร้อนเมื่อเทียบกับการทำงานในช่วงฤดูหนาว หากมีการทดลองที่ใช้พลังงานมากและสามารถจัดเวลาให้ตรงกับช่วงฤดูหนาวได้ ก็สามารถลดการปล่อยก๊าซคาร์บอนได้อย่างมีนัยสำคัญ’
บทความนี้ยังรับทราบถึงความเป็นไปได้ในการประหยัดพลังงานที่เกิดขึ้นจากการปรับแต่งและเพิ่มประสิทธิภาพของโครงสร้างโมเดลและกระบวนการทำงาน – แม้ว่าผู้เขียนจะปล่อยให้การพัฒนาในด้านนี้เป็นความรับผิดชอบของโครงการอื่นๆ
สุดท้าย ผู้เขียนแนะนำให้บทความวิจัยใหม่ๆ จากภาคส่วน Machine Learning ควรได้รับการสนับสนุนหรือบังคับให้ปิดท้ายด้วยคำชี้แจงเกี่ยวกับการใช้พลังงานของงานวิจัยและผลกระทบด้านพลังงานที่อาจเกิดขึ้นจากการนำแนวคิดที่เสนอแนะในงานวิจัยไปใช้

The paper, leading by example, explains the energy implications of its own research.
บทความ นี้ มีชื่อเรื่องว่า Great Power, Great Responsibility: Recommendations for Reducing Energy for Training Language Models และมาจากนักวิจัย 6 คนจาก MIT Lincoln และ Northeastern
การคว้าพลังงานของ Machine Learning ที่กำลังจะเกิดขึ้น
เมื่อความต้องการการประมวลผลของโมเดล Machine Learning เพิ่มขึ้นพร้อมกับความเป็นประโยชน์ของผลลัพธ์ วัฒนธรรม Machine Learning ปัจจุบันเทียบเคียงการใช้พลังงานกับการแสดงผลที่ดีขึ้น – แม้ว่าจะมีคนร้องเรียนที่มีชื่อเสียง เช่น Andrew Ng ที่แนะนำว่าการดูแลข้อมูลอาจเป็น ปัจจัยที่สำคัญกว่า
ใน การทำงานร่วมกันหลักของ MIT ในปี 2020 มีการประมาณการว่าการปรับปรุงประสิทธิภาพของโมเดล 10 เท่าทำให้เกิดการเพิ่มขึ้นของความต้องการการประมวลผล 10,000 เท่าพร้อมกับการเพิ่มขึ้นของพลังงานที่สอดคล้องกัน
ดังนั้นการวิจัยเกี่ยวกับการฝึกอบรม Machine Learning ที่มีประสิทธิภาพและใช้พลังงานน้อยกว่าจึงเพิ่มขึ้นในช่วงหลายปีที่ผ่านมา บทความใหม่นี้อ้างว่าเป็นครั้งแรกที่มีการตรวจสอบผลกระทบของการจำกัดพลังงานต่อการฝึกอบรมและอนุมานของ Machine Learning โดยเน้นไปที่เฟรมเวิร์ก NLP (เช่น ซีรีส์ GPT)
เนื่องจากคุณภาพของการอนุมานเป็นเรื่องสำคัญ ผู้เขียนระบุเกี่ยวกับการค้นพบของตนในตอนต้นว่า:
‘วิธีการนี้ไม่ส่งผลกระทบต่อการทำนายของโมเดลที่ฝึกอบรมแล้วหรือความแม่นยำในการทำงานของพวกมัน นั่นคือ หากสองเครือข่ายที่มีโครงสร้างเดียวกัน ค่าเริ่มต้นเดียวกัน และข้อมูลแบตช์เดียวกันถูกฝึกอบรมเป็นจำนวนแบตช์เดียวกันภายใต้การจำกัดพลังงานที่แตกต่างกัน พารามิเตอร์ที่ได้จะเหมือนกัน และเพียงพลังงานที่ต้องการในการผลิตพวกมันเท่านั้นที่แตกต่างกัน’
การลดการใช้พลังงานสำหรับ NLP
เพื่อประเมินผลกระทบของการจำกัดพลังงานต่อการฝึกอบรมและอนุมาน ผู้เขียนใช้ nvidia-smi (System Management Interface) และ MLM library จาก HuggingFace
ผู้เขียนฝึกอบรมโมเดล NLP BERT, DistilBERT และ Big Bird เหนือ MLM และติดตามการใช้พลังงานในการฝึกอบรมและใช้งาน
โมเดลเหล่านี้ถูกฝึกอบรมด้วยชุดข้อมูล WikiText-103 ของ DeepAI เป็นเวลา 4 เอพพอค โดยแบ่งออกเป็น 8 แบตช์บน 16 V100 GPU โดยมีการจำกัดพลังงาน 4 แบบ: 100W, 150W, 200W และ 250W (ค่าเริ่มต้นหรือค่าพื้นฐานสำหรับ GPU V100 ของ NVIDIA ) โมเดลเหล่านี้มีพารามิเตอร์ที่ฝึกอบรมจากศูนย์และค่าเริ่มต้นแบบสุ่มเพื่อให้แน่ใจว่าการประเมินการฝึกอบรมที่เทียบเท่ากัน
เมื่อดูจากภาพแรกด้านบน ผลลัพธ์แสดงให้เห็นถึงการประหยัดพลังงานที่ดีโดยมีการเพิ่มขึ้นของเวลาในการฝึกอบรมที่ไม่เชื่อมโยงกัน ผู้เขียนระบุว่า:
‘การทดลองของเราบ่งชี้ว่าการใช้การจำกัดพลังงานสามารถลดการใช้พลังงานได้อย่างมีนัยสำคัญ โดยมีค่าใช้จ่ายในการเพิ่มขึ้นของเวลาในการฝึกอบรม’
การลดขนาด ‘Big NLP’
จากนั้นผู้เขียนใช้วิธีการเดียวกันกับสถานการณ์ที่ท้าทายมากขึ้น: การฝึกอบรม BERT ด้วย MLM บนการกำหนดค่าแบบกระจายบนหลาย GPU – ซึ่งเป็นกรณีการใช้งานทั่วไปสำหรับโมเดล NLP ของ FAANG ที่ได้รับการสนับสนุนและโปรโมตอย่างดี
ความแตกต่างหลักใน实验นี้คือโมเดลอาจใช้ GPU ระหว่าง 2-400 GPU ต่อการฝึกอบรมแบบกระจาย การจำกัดพลังงานเดียวกันถูกใช้ และใช้งานเดียวกัน (WikiText-103) ดูภาพที่สองด้านบนสำหรับกราฟของผลลัพธ์
บทความระบุว่า:
‘โดยเฉลี่ยทั่วทุกตัวเลือกในการกำหนดค่า การจำกัดพลังงานที่ 150W นำไปสู่การลดการใช้พลังงานลง 13.7% และการเพิ่มขึ้นของเวลาในการฝึกอบรม 6.8% เมื่อเทียบกับการใช้พลังงานสูงสุด [การกำหนด] 100W มีเวลาในการฝึกอบรมที่ยาวนานกว่า (31.4% ยาวกว่าโดยเฉลี่ย) การจำกัดพลังงาน 200W สอดคล้องกับเวลาในการฝึกอบรมที่เกือบจะเหมือนกับการจำกัดพลังงาน 250W แต่มีการประหยัดพลังงานที่น้อยกว่าการจำกัดพลังงาน 150W’
ผู้เขียนแนะนำว่าผลลัพธ์เหล่านี้สนับสนุนการจำกัดพลังงานที่ 150W สำหรับโครงสร้าง GPU และแอปพลิเคชันที่รันบนพวกมัน พวกเขายังระบุด้วยว่าการประหยัดพลังงานที่ได้รับสามารถแปลเป็นแพลตฟอร์มฮาร์ดแวร์อื่นๆ ได้ และทดสอบผลลัพธ์ใหม่เพื่อเปรียบเทียบผลลัพธ์สำหรับ GPU K80, T4 และ A100 ของ NVIDIA

Savings obtained across three different NVIDIA GPUs.
การอนุมาน ไม่ใช่การฝึกอบรม ที่ใช้พลังงาน
บทความอ้างอิงการศึกษาก่อนหน้านี้หลายๆ เรื่องที่แสดงให้เห็นว่า แม้ว่าจะมีหัวข้อข่าวที่ว่าการฝึกอบรมโมเดลมีค่าใช้จ่ายสูง แต่การอนุมาน (การใช้โมเดลที่ฝึกอบรมแล้ว) ไม่ใช่การฝึกอบรมที่ใช้พลังงานมากที่สุด โดยชี้ให้เห็นว่าเมื่อโมเดลที่ได้รับความนิยมเข้าสู่กระแสหลัก การใช้พลังงานอาจกลายเป็นปัญหาใหญ่กว่าที่เป็นอยู่ในขณะนี้
ดังนั้นผู้วิจัยจึงวัดผลกระทบของการอนุมานต่อการใช้พลังงาน โดยพบว่าการกำหนดการจำกัดพลังงานมีผลกระทบอย่างมีนัยสำคัญต่อความหน่วงของการอนุมาน:
‘เมื่อเทียบกับ 250W การกำหนด 100W ต้องการเวลาในการอนุมานเป็นสองเท่า (เพิ่มขึ้น 114%) และใช้พลังงานน้อยลง 11.0% การกำหนด 150W ต้องการเวลาเพิ่มขึ้น 22.7% และประหยัดพลังงาน 24.2% และการกำหนด 200W ต้องการเวลาเพิ่มขึ้น 8.2% โดยมีพลังงานน้อยลง 12.0%’
การฝึกอบรมในช่วงฤดูหนาว
บทความนี้แนะนำว่าการฝึกอบรม (ไม่ใช่การอนุมาน เนื่องจากสาเหตุที่ชัดเจน) อาจถูกจัดตารางไว้ในช่วงเวลาที่ศูนย์ข้อมูลมีประสิทธิภาพการใช้พลังงาน (PUE) สูงสุด – ซึ่งโดยทั่วไปคือในช่วงฤดูหนาวและเวลากลางคืน เพื่อประหยัดค่าใช้จ่ายในการทำความเย็น
‘การประหยัดพลังงานที่สำคัญสามารถทำได้หากงานสามารถจัดตารางไว้ในช่วงเวลาที่คาดว่าจะมี PUE ต่ำกว่า ตัวอย่างเช่น การย้ายงานที่ใช้เวลาสั้นๆ จากเวลากลางวันไปเวลากลางคืนอาจให้การลดลงประมาณ 10% และการย้ายงานที่ใช้เวลานานและแพง (เช่น โมเดลภาษาที่ใช้เวลาหลายสัปดาห์ในการเสร็จสิ้น) จากฤดูร้อนไปฤดูหนาวอาจเห็นการลดลง 33%’
‘แม้ว่าจะยากที่จะคาดการณ์ถึงการประหยัดที่นักวิจัยแต่ละคนสามารถทำได้ แต่ข้อมูลที่นำเสนอในนี้เน้นย้ำถึงความสำคัญของปัจจัยสิ่งแวดล้อมที่ส่งผลต่อพลังงานทั้งหมดที่ใช้ในการทำงานของพวกเขา’
การรักษาความเป็นแบบคลาวด์
สุดท้ายนี้ บทความนี้สังเกตเห็นว่าทรัพยากรการประมวลผลที่สร้างขึ้นเองไม่น่าจะมีการใช้มาตรการประหยัดพลังงานที่คล้ายกับศูนย์ข้อมูลขนาดใหญ่และผู้ให้บริการคลาวด์ระดับสูง และผลกระทบด้านสิ่งแวดล้อมสามารถทำได้โดยการโอนงานไปยังสถานที่ที่ลงทุนอย่างมากในการเพิ่มประสิทธิภาพของสถานที่
‘แม้ว่าจะมีความสะดวกในการมีทรัพยากรการประมวลผลส่วนตัวที่สามารถเข้าถึงได้ แต่ความสะดวกสบายนี้มีค่าใช้จ่าย โดยทั่วไปแล้ว การประหยัดพลังงานและผลกระทบสามารถทำได้ง่ายขึ้นที่ขนาดที่ใหญ่ขึ้น ศูนย์ข้อมูลและผู้ให้บริการคลาวด์ลงทุนอย่างมากในการเพิ่มประสิทธิภาพของสถานที่’
* ลิงก์ที่เกี่ยวข้องที่ให้ไว้โดยบทความ












