Góc nhìn Anderson

Kiểm Soát Nhu Cầu Năng Lượng Tăng Của Học Máy

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Trước những lo ngại ngày càng tăng về nhu cầu năng lượng của các mô hình học máy lớn, một nghiên cứu gần đây từ MIT Lincoln Laboratory và Northeastern University đã điều tra các khoản tiết kiệm có thể đạt được bằng cách giới hạn công suất của GPU được sử dụng trong đào tạo và suy luận mô hình, cũng như một số kỹ thuật và phương pháp khác để cắt giảm việc sử dụng năng lượng AI.

Công việc mới này cũng kêu gọi các bài báo khoa học mới nên kết thúc với một ‘Tuyên bố về Năng lượng’ (tương tự như xu hướng gần đây về ‘tuyên bố về ý nghĩa đạo đức’ trong các bài báo từ lĩnh vực nghiên cứu học máy).

Đề xuất chính từ công việc này là giới hạn công suất (giới hạn công suất có sẵn cho GPU đang đào tạo mô hình) mang lại những lợi ích tiết kiệm năng lượng đáng kể, đặc biệt là đối với Mô hình Ngôn ngữ Có Mặt nạ (MLM) và các khung như BERT và các dẫn xuất của nó.

Ba mạng mô hình ngôn ngữ hoạt động tại một tỷ lệ của cài đặt mặc định 250W (đường đen), về mặt sử dụng năng lượng. Giới hạn tiêu thụ năng lượng không giới hạn hiệu quả đào tạo hoặc độ chính xác trên cơ sở 1-1 và mang lại tiết kiệm năng lượng đáng chú ý trên quy mô lớn. Nguồn: https://arxiv.org/pdf/2205.09646.pdf

Ba mạng mô hình ngôn ngữ hoạt động tại một tỷ lệ của cài đặt mặc định 250W (đường đen), về mặt sử dụng năng lượng. Giới hạn tiêu thụ năng lượng không giới hạn hiệu quả đào tạo hoặc độ chính xác trên cơ sở 1-1 và mang lại tiết kiệm năng lượng đáng chú ý trên quy mô lớn. Nguồn: https://arxiv.org/pdf/2205.09646.pdf

Đối với các mô hình quy mô lớn hơn, những mô hình này đã thu hút sự chú ý trong những năm gần đây do các tập dữ liệu hyperscale và các mô hình mới với hàng tỷ hoặc hàng nghìn tỷ tham số, những tiết kiệm tương tự có thể đạt được như một sự đánh đổi giữa thời gian đào tạo và sử dụng năng lượng.

Đào tạo các mô hình NLP hùng mạnh hơn ở quy mô dưới các ràng buộc về năng lượng. Thời gian tương đối trung bình dưới giới hạn 150W được hiển thị bằng màu xanh lam và tiêu thụ năng lượng tương đối trung bình cho 150W được hiển thị bằng màu cam.

Đào tạo các mô hình NLP hùng mạnh hơn ở quy mô dưới các ràng buộc về năng lượng. Thời gian tương đối trung bình dưới giới hạn 150W được hiển thị bằng màu xanh lam và tiêu thụ năng lượng tương đối trung bình cho 150W được hiển thị bằng màu cam.

Đối với các triển khai quy mô lớn hơn này, các nhà nghiên cứu đã tìm thấy rằng một giới hạn 150W về sử dụng năng lượng đạt được mức giảm trung bình 13,7% trong sử dụng năng lượng so với mức tối đa mặc định 250W, cũng như mức tăng thời gian đào tạo tương đối nhỏ 6,8%.

Ngoài ra, các nhà nghiên cứu lưu ý rằng, mặc dù những tiêu đề cho rằng chi phí đào tạo mô hình đã thu hút trong những năm gần đây, chi phí năng lượng thực sự sử dụng các mô hình đã đào tạo là lớn hơn nhiều*.

‘Đối với mô hình ngôn ngữ với BERT, lợi ích năng lượng thông qua giới hạn công suất là đáng chú ý hơn khi thực hiện suy luận hơn là đào tạo. Nếu điều này nhất quán với các ứng dụng AI khác, điều này có thể có những tác động đáng kể về tiêu thụ năng lượng cho các nền tảng tính toán quy mô lớn hoặc đám mây phục vụ các ứng dụng suy luận cho nghiên cứu và công nghiệp.’

Hơn nữa, và có lẽ là điều gây tranh cãi nhất, bài báo đề xuất rằng việc đào tạo chính của các mô hình học máy nên được giao cho những tháng lạnh của năm, và vào ban đêm, để tiết kiệm chi phí làm mát.

Trên, thống kê PUE cho mỗi ngày của năm 2020 tại trung tâm dữ liệu của các tác giả, với một mức tăng đáng kể và bền vững trong những tháng mùa hè. Dưới, sự thay đổi trung bình hàng giờ trong PUE cho cùng một vị trí trong tuần, với tiêu thụ năng lượng tăng lên vào giữa ngày, khi cả phần cứng làm mát GPU nội bộ và làm mát trung tâm dữ liệu xung quanh đều phải duy trì nhiệt độ làm việc.

Trên, thống kê PUE cho mỗi ngày của năm 2020 tại trung tâm dữ liệu của các tác giả, với một mức tăng đáng kể và bền vững trong những tháng mùa hè. Dưới, sự thay đổi trung bình hàng giờ trong PUE cho cùng một vị trí trong tuần, với tiêu thụ năng lượng tăng lên vào giữa ngày, khi cả phần cứng làm mát GPU nội bộ và làm mát trung tâm dữ liệu xung quanh đều phải duy trì nhiệt độ làm việc.

Các tác giả tuyên bố:

‘Đúng vậy, các công việc NLP nặng thường kém hiệu quả hơn nhiều vào mùa hè so với những công việc được thực hiện trong mùa đông. Dữ liệu cho thấy sự thay đổi lớn theo mùa, nếu có các thí nghiệm tính toán tốn kém có thể được lên lịch vào những tháng lạnh hơn, điều này có thể giảm đáng kể lượng khí thải carbon.’

Bài báo cũng công nhận những khả năng tiết kiệm năng lượng đang xuất hiện thông qua việc cắt tỉa và tối ưu hóa kiến trúc mô hình và quy trình làm việc – mặc dù các tác giả để lại sự phát triển thêm của con đường này cho các sáng kiến khác.

Cuối cùng, các tác giả đề xuất rằng các bài báo khoa học mới từ lĩnh vực học máy nên được khuyến khích, hoặc có thể bị giới hạn, để kết thúc với một tuyên bố tuyên bố việc sử dụng năng lượng của công việc được thực hiện trong nghiên cứu, và những tác động năng lượng tiềm năng của việc áp dụng các sáng kiến được đề xuất trong công việc.

Bài báo, dẫn đầu bằng ví dụ, giải thích các tác động năng lượng của chính nghiên cứu của mình.

Bài báo, dẫn đầu bằng ví dụ, giải thích các tác động năng lượng của chính nghiên cứu của mình.

Bài báo này có tiêu đề Quyền lực Lớn, Trách nhiệm Lớn: Đề xuất để Giảm Năng lượng cho Việc Đào tạo Mô hình Ngôn ngữ, và đến từ sáu nhà nghiên cứu trên MIT Lincoln và Northeastern.

Nhu Cầu Năng Lượng Của Học Máy

Khi nhu cầu tính toán cho các mô hình học máy tăng cùng với sự hữu ích của kết quả, văn hóa học máy hiện tại coi chi phí năng lượng với hiệu suất cải thiện – mặc dù một số nhà vận động nổi bật, như Andrew Ng, gợi ý rằng việc chăm sóc dữ liệu có thể là một yếu tố quan trọng hơn.

Trong một hợp tác chính của MIT từ năm 2020, ước tính rằng sự cải thiện hiệu suất mô hình 10 lần đòi hỏi sự tăng 10.000 lần về yêu cầu tính toán, cùng với một lượng năng lượng tương ứng.

Do đó, nghiên cứu về đào tạo học máy hiệu quả và tiết kiệm năng lượng đã tăng lên trong những năm gần đây. Bài báo mới, các tác giả tuyên bố, là bài báo đầu tiên xem xét kỹ lưỡng tác động của giới hạn công suất đối với đào tạo và suy luận học máy, với trọng tâm vào các khung NLP (như loạt GPT).

Vì chất lượng của suy luận là một vấn đề quan trọng, các tác giả tuyên bố về phát hiện của họ ngay từ đầu:

‘Phương pháp này không ảnh hưởng đến dự đoán của các mô hình đã đào tạo hoặc do đó hiệu suất chính xác của chúng trên các nhiệm vụ. Đó là, nếu hai mạng có cùng cấu trúc, giá trị ban đầu và dữ liệu được đào tạo trong cùng số lượng batch dưới các giới hạn công suất khác nhau, các tham số kết quả sẽ giống hệt nhau và chỉ năng lượng cần thiết để tạo ra chúng có thể khác nhau.’

Cắt Giảm Nhu Cầu Năng Lượng Cho NLP

Để đánh giá tác động của giới hạn công suất đối với đào tạo và suy luận, các tác giả đã sử dụng nvidia-smi (Giao diện Quản lý Hệ thống) cùng với một thư viện MLM từ HuggingFace.

Các tác giả đã đào tạo các mô hình Xử lý Ngôn ngữ Tự nhiên BERT, DistilBERT và Big Bird trên MLM, và theo dõi tiêu thụ năng lượng của chúng trong đào tạo và triển khai.

Các mô hình được đào tạo trên tập dữ liệu WikiText-103 của DeepAI trong 4 kỷ, với 8 batch, trên 16 GPU V100, với bốn giới hạn công suất khác nhau: 100W, 150W, 200W và 250W (mặc định, hoặc baseline, cho một GPU NVIDIA V100). Các mô hình có tham số được đào tạo từ đầu và giá trị khởi tạo ngẫu nhiên, để đảm bảo đánh giá đào tạo có thể so sánh được.

Như đã thấy trong hình ảnh đầu tiên trên, kết quả cho thấy tiết kiệm năng lượng tốt tại các mức tăng thời gian đào tạo không tuyến tính và thuận lợi. Các tác giả tuyên bố:

‘Thí nghiệm của chúng tôi chỉ ra rằng việc thực hiện giới hạn công suất có thể giảm đáng kể việc sử dụng năng lượng với chi phí của thời gian đào tạo.’

Làm Mỏng ‘NLP Lớn’

Tiếp theo, các tác giả đã áp dụng phương pháp tương tự cho một kịch bản đòi hỏi hơn: đào tạo BERT với MLM trên các cấu hình phân tán trên nhiều GPU – một trường hợp sử dụng điển hình hơn cho các mô hình NLP của FAANG được tài trợ tốt và được công bố rộng rãi.

Sự khác biệt chính trong thí nghiệm này là một mô hình có thể sử dụng bất kỳ số lượng GPU nào từ 2 đến 400 cho mỗi phiên đào tạo. Các ràng buộc về sử dụng năng lượng giống nhau đã được áp dụng, và cùng một nhiệm vụ được sử dụng (WikiText-103). Xem hình ảnh thứ hai trên để xem đồ thị của kết quả.

Bài báo tuyên bố:

‘Trung bình trên mỗi lựa chọn cấu hình, một giới hạn 150W về sử dụng năng lượng dẫn đến mức giảm trung bình 13,7% trong sử dụng năng lượng và mức tăng 6,8% trong thời gian đào tạo so với mức tối đa mặc định. Cài đặt 100W có thời gian đào tạo dài hơn đáng kể (31,4% lâu hơn trung bình). Một giới hạn 200W tương ứng với gần như cùng thời gian đào tạo như một giới hạn 250W nhưng có tiết kiệm năng lượng khiêm tốn hơn so với một giới hạn 150W.’

Các tác giả đề xuất rằng những kết quả này ủng hộ việc giới hạn công suất ở 150W cho kiến trúc GPU và các ứng dụng chạy trên chúng. Họ cũng lưu ý rằng tiết kiệm năng lượng đạt được có thể chuyển đổi qua các nền tảng phần cứng, và họ đã chạy lại các thử nghiệm để so sánh kết quả cho GPU NVIDIA K80, T4 và A100.

Tiết kiệm đạt được trên ba GPU NVIDIA khác nhau.

Tiết kiệm đạt được trên ba GPU NVIDIA khác nhau.

Suy Luận, Không Đào Tạo, Tiêu Thụ Năng Lượng

Bài báo trích dẫn một số nghiên cứu trước đó cho thấy rằng, mặc dù những tiêu đề, suy luận (sử dụng mô hình đã hoàn thành, như mô hình NLP) và không đào tạo là những gì tiêu thụ nhiều năng lượng nhất, gợi ý rằng khi các mô hình phổ biến được thương mại hóa và đi vào dòng chính, việc sử dụng năng lượng có thể trở thành một vấn đề lớn hơn so với giai đoạn phát triển NLP hiện tại.

Do đó, các nhà nghiên cứu đã đo tác động của suy luận đối với sử dụng năng lượng, tìm thấy rằng việc áp dụng giới hạn công suất có tác động đáng kể đến độ trễ suy luận:

‘So với 250W, một cài đặt 100W yêu cầu gấp đôi thời gian suy luận (tăng 114%) và tiêu thụ 11,0% ít năng lượng hơn, 150W yêu cầu 22,7% nhiều thời gian hơn và tiết kiệm 24,2% năng lượng, và 200W yêu cầu 8,2% nhiều thời gian hơn với 12,0% ít năng lượng hơn.’

Đào Tạo Mùa Đông

Bài báo đề xuất rằng đào tạo (nếu không phải là suy luận, vì những lý do rõ ràng) có thể được lên lịch vào những thời điểm khi trung tâm dữ liệu ở mức hiệu quả sử dụng năng lượng cao nhất (PUE) – hiệu quả, đó là vào mùa đông, và vào ban đêm.

‘Tiết kiệm năng lượng đáng kể có thể đạt được nếu công việc có thể được lên lịch vào những thời điểm khi PUE thấp hơn được dự kiến. Ví dụ, di chuyển một công việc ngắn từ ban ngày sang ban đêm có thể cung cấp mức giảm khoảng 10%, và di chuyển một công việc dài, tốn kém (ví dụ, một mô hình ngôn ngữ mất vài tuần để hoàn thành) từ mùa hè sang mùa đông có thể thấy mức giảm 33%.

‘Mặc dù khó dự đoán mức tiết kiệm mà một nhà nghiên cứu cá nhân có thể đạt được, thông tin được trình bày ở đây nhấn mạnh tầm quan trọng của các yếu tố môi trường ảnh hưởng đến tổng năng lượng tiêu thụ bởi các công việc của họ.’

Giữ Nó Trên Đám Mây

Cuối cùng, bài báo quan sát thấy rằng các tài nguyên xử lý tại nhà không thể có các biện pháp hiệu quả như các trung tâm dữ liệu lớn và các nhà cung cấp tính toán đám mây cấp cao, và các lợi ích môi trường có thể được đạt bằng cách chuyển các công việc sang những vị trí đã đầu tư mạnh mẽ vào PUE tốt.

‘Mặc dù có sự tiện lợi khi có tài nguyên tính toán riêng có thể truy cập được, sự tiện lợi này có một chi phí. Nói chung, tiết kiệm năng lượng và tác động được dễ dàng đạt được hơn ở quy mô lớn. Các trung tâm dữ liệu và nhà cung cấp tính toán đám mây đầu tư đáng kể vào hiệu quả của các cơ sở của họ.’

 

* Liên kết phù hợp được cung cấp bởi bài báo.

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai