Anderson’un Açısı

Makine Öğreniminin Büyüyen Enerji İhtiyacını Kontrol Etme

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Makine öğrenimi modellerinin enerji gereksinimlerine ilişkin artan endişeler ışığında, MIT Lincoln Laboratory ve Northeastern Üniversitesi’nden bir araştırma, model eğitimi ve çıkarımı için kullanılan GPU’ların güç sınırlandırmasının yanı sıra diğer tekniklerin ve yöntemlerin enerji tasarrufu açısından neler sağlayabileceğini araştırdı.

Yeni çalışma ayrıca, yeni AI makalelerinin ‘Enerji Bildirimi’ ile sonuçlanmasını öneriyor. Bu, makalelerin enerji kullanımını ve önerilen girişimlerin enerji etkilerini açıklamalarını gerektiriyor.

Çalışmanın temel önerisi, güç sınırlandırmasının (eğitim modeline disponible olan gücü sınırlamak) özellikle Masked Language Modeling (MLM) ve BERT gibi çerçeveler için enerji tasarrufu açısından önemli faydalar sağladığı yönünde.

Üç dil modelleme ağı, varsayılan 250W ayarlarının bir yüzdesi olarak güç kullanımında çalışıyor. Güç tüketimini sınırlamak, eğitim verimliliği veya doğruluğunu doğrudan etkilemiyor ve ölçekte önemli enerji tasarrufu sağlıyor.

Üç dil modelleme ağı, varsayılan 250W ayarlarının bir yüzdesi olarak güç kullanımında çalışıyor. Güç tüketimini sınırlamak, eğitim verimliliği veya doğruluğunu doğrudan etkilemiyor ve ölçekte önemli enerji tasarrufu sağlıyor. Kaynak: https://arxiv.org/pdf/2205.09646.pdf

Büyük ölçekli modeller için benzer tasarruf sağlanabilir. Bu modeller, son yıllarda büyük veri kümeleri ve milyarlarca veya trilyonlarca parametreye sahip yeni modeller nedeniyle dikkat çekmiştir.

Ölçeklendirilmiş NLP modellerini güç kısıtlamaları altında eğitme.

Ölçeklendirilmiş NLP modellerini güç kısıtlamaları altında eğitme.

Araştırmacılar, 150W’lik bir güç sınırının, varsayılan 250W’nin maximumuna kıyasla ortalama %13,7’lik bir enerji tasarrufu ve %6,8’lik bir eğitim zamanı artışı sağladığını buldu.

Araştırmacılar ayrıca, enerji kullanımının eğitim değil, çıkarım (bitmiş bir modelin kullanımı) tarafından daha fazla çekildiğini belirtiyorlar.

‘Eğitim değil, çıkarım daha fazla enerji tüketiyor. Popüler modeller daha yaygın hale geldikçe ve NLP gelişimi daha olgunlaştıkça, enerji tüketimi daha büyük bir sorun haline gelebilir.’

Makine Öğreniminin Büyüyen Enerji İhtiyacı

Makine öğrenimi modellerinin hesaplama gereksinimleri, sonuçların faydasıyla birlikte arttıkça, mevcut ML kültürü enerji harcamasını performansla eşanlamlı olarak görüyor.

2020’de yapılan bir MIT çalışması, model performansındaki on katlık bir iyileşmenin, hesaplama gereksinimlerinde 10.000 katlık bir artışa ve buna karşılık gelen bir enerji tüketimine neden olabileceğini öngördü.

Sonuç olarak, daha az enerji yoğun etkili ML eğitimi araştırmaları son yıllarda arttı. Yeni çalışma, yazarlara göre, güç sınırlarının makine öğrenimi eğitimi ve çıkarımı üzerindeki etkisine ilişkin ilk derinlemesine inceleme.

NLP için Güç Kullanımını Azaltma

Araştırmacılar, eğitim ve çıkarım üzerindeki güç sınırlarının etkisini değerlendirmek için nvidia-smi (Sistem Yönetim Arayüzü) komut satırı aracını ve HuggingFace’den bir MLM kütüphanesini kullandılar.

Doğal Dil İşleme modelleri BERT, DistilBERT ve Big Bird’i MLM üzerinde eğittiler ve güç tüketimlerini eğitim ve dağıtım sırasında izlediler.

Modelleri, DeepAI’nin WikiText-103 veri kümesiyle 4 epoch boyunca 8’lik batch’lerde, 16 V100 GPU’da ve dört farklı güç sınırıyla (100W, 150W, 200W ve 250W) eğittiler.

‘Büyük NLP’yi Slimlama

Araştırmacılar, aynı yöntemi daha zorlu bir senaryoya uyguladılar: BERT’i MLM ile dağıtılmış yapılandırmalarda birden fazla GPU üzerinde eğitmek.

Modelleri WikiText-103 veri kümesiyle eğittiler ve aynı görevi (WikiText-103) kullandılar. Sonuçların grafiklerini yukarıdaki ikinci resimde görebilirsiniz.

Çalışma, 150W’lik bir güç sınırının, ortalama %13,7’lik bir enerji azalışı ve %6,8’lik bir eğitim zamanı artışı sağladığını belirtiyor.

Çıkarım, Eğitimden Daha Fazla Güç Tüketiyor

Çalışma, önceki çalışmaların gösterdiği gibi, çıkarımın eğitimden daha fazla güç tükettiğini belirtiyor.

‘Çıkarım, eğitimden daha fazla enerji tüketiyor. Bu, popüler modeller daha yaygın hale geldikçe ve NLP gelişimi daha olgunlaştıkça, enerji tüketiminin daha büyük bir sorun haline gelebileceği anlamına geliyor.’

Kış Eğitimi

Çalışma, eğitimlerin (çıkarma değil) veri merkezlerinin en yüksek Güç Kullanım Etkinliği (PUE) zamanlarında planlanabileceğini öneriyor.

‘İş yüklerini daha düşük PUE beklentisi olan zamanlara planlamak önemli enerji tasarrufu sağlayabilir. Örneğin, kısa süreli bir işi gündüzden geceye taşımak yaklaşık %10’luk bir azalma sağlayabilir ve uzun süreli, pahalı bir işi (örneğin, dil modeli eğitimi) yazdan kışa taşımak %33’lük bir azalma sağlayabilir.’

Bulutları Koruyun

Son olarak, çalışma, evde yapılan işlemlerin büyük veri merkezleri ve yüksek düzeyde bulut hesaplama oyuncuları tarafından uygulanan aynı verimlilik önlemlerine sahip olmayabileceğini ve çevresel faydaların iş yüklerini bu tür yerlere taşıyarak elde edilebileceğini gözlemliyor.

‘Özel hesaplama kaynaklarına erişimin rahatlığı bir maliyetle geliyor. Genel olarak, enerji tasarrufu ve etkisi daha büyük ölçeklerde daha kolay elde edilebilir. Veri merkezleri ve bulut hesaplama sağlayıcıları tesislerinin verimliliğine önemli yatırımlar yapıyorlar.’

* Çalışma tarafından verilen ilgili bağlantılar.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai