Yapay zeka modelleri ve platformları

Büyük Dil Modellerini ChatGPT’nin Yarısı Maliyetle Oluşturabilir misiniz?

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Büyük Dil Modelleri (LLM’ler) gibi GPT-3 ve ChatGPT, doğal dil anlama ve içerik oluşturma yetenekleri sunarak AI’yi devrimleştiriyor. Ancak geliştirilmeleri büyük bir maliyetle geliyor ve erişilebilirliği ve daha fazla araştırmayı sınırlıyor. Araştırmacılar, GPT-3’ü eğitmek için OpenAI’ye yaklaşık $5 milyon maliyetinin olduğunu tahmin ediyor. Buna rağmen, Microsoft (MSFT ) potansiyeli tanıdı ve 2019’da $1 milyar ve 2023’te $10 milyar OpenAI’nin GPT-3 ve ChatGPT girişimine yatırım yaptı.

LLM’ler, NLP uygulamaları için geniş metin verilerine dayalı olarak eğitilen makine öğrenimi modelleridir. Transformer mimarisi temelinde oluşturulurlar ve NLP görevleri gibi soru-cevap, makine çevirisi, duygu analizi vb. için dikkat mekanizmaları kullanır.

Soru ortaya çıkıyor: Bu büyük modellerin verimliliği artırılırken aynı zamanda hesaplama maliyeti ve eğitim süresi azaltılabilir mi?

Progressive Neural Networks, Network Morphism, intra-layer model parallelism, knowledge inheritance gibi beberapa yaklaşım, sinir ağları eğitiminin hesaplama maliyetini azaltmak için geliştirildi. LiGO (Linear Growth Operator) adlı yeni bir teknik, LLM’lerin eğitiminin hesaplama maliyetini yarıya indiriyor.

Büyük Dil Modellerini Oluşturmanın Maliyeti

LLM’lerin geliştirilmesinde üç büyük maliyet vardır:

1. Hesaplama Kaynakları

Büyük dil modellerini oluşturmak için büyük hesaplama kaynaklarına ihtiyaç vardır. Milyarlarca parametre işlenmeli ve büyük metin verilerinden karmaşık kalıplar öğrenilmelidir.

Özel donanım yatırımı, örneğin Graphics Processing Units (GPU’lar) ve Tensor Processing Units (TPU’lar) benötir.

Örneğin, GPT-3, 10.000 entreprise-düzey GPU (H100 ve A100) ve 285.000 CPU çekirdeğine sahip bir süperbilgisayarda eğitildi.

2. Enerji Tüketimi

Büyük dil modellerini oluşturmak için gereken yoğun hesaplama kaynakları, önemli enerji tüketimine neden olur. Örneğin, 175 milyar parametreli GPT-3’ü eğitmek, 14,8 gün sürdü ve 10.000 V100 GPU ile 3,55 milyon GPU saati eşdeğeriydi. Bu düzeydeki enerji tüketimi önemli çevresel etkileri de vardır.

3. Veri Depolama ve Yönetimi

Büyük dil modelleri, büyük veri setlerine dayalı olarak eğitilir. Örneğin, GPT-3, Common Crawl, WebText2, Books1, Books2 ve Wikipedia gibi çeşitli kaynaklardan oluşan büyük bir metin verisi üzerinde eğitildi. Bu veri setlerini toplamak, düzenlemek ve depolamak için önemli altyapı yatırımı gerekir.

Ayrıca, bulut depolama, veri ön işleme ve sürüm kontrolü için insan uzmanlığına ihtiyaç vardır. Ayrıca, veri stratejisinin GDPR gibi düzenlemelere uyumlu olmasını sağlamak da maliyeti artırır.

LiGO Tekniği: Büyük Dil Modellerini Oluşturmanın Maliyetini Yarısına İndir

LiGO (Linear Growth Operator), MIT’de geliştirilen bir teknik olup, LLM’lerin eğitiminin hesaplama maliyetini %50 azaltıyor. Bu yöntem, daha büyük modellerin ağırlıklarını daha küçük önceden eğitilmiş modellerden başlatmayı içerir ve sinir ağlarının verimli bir şekilde ölçeklenmesini sağlar.

Yoon Kim, makalenin senior yazarı, diyor ki:

“ChatGPT’nin çalıştığı ölçekteki modelleri eğitmek için milyonlarca dolarlık bir maliyetin olduğu tahmin ediliyor. Eğitim yöntemlerini daha verimli hale getirebilir miyiz? Daha küçük dil modellerini kullanarak bunu başarmayı öneriyoruz.”

Bu yöntem, daha büyük modellerin performans avantajlarını korurken, hesaplama maliyetini ve eğitim süresini azaltıyor. LiGO, veri odaklı bir lineer büyüme operatörü kullanıyor ve optimum performans için derinlik ve genişlik operatörlerini birleştiriyor.

Makale, çeşitli veri setleri kullanarak metin tabanlı deneyler gerçekleştirdi. İngilizce Wikipedia korpusu, BERT ve RoBERTa modellerini eğitmek için ve C4 veri seti, GPT2’yi eğitmek için kullanıldı.

LiGO tekniği, BERT-Small’u BERT-Base’e, BERT-Base’i BERT-Large’e, RoBERTaSmall’u RoBERTa-Base’e, GPT2-Base’i GPT2-Medium’a ve CaiT-XS’i CaiT-S’ye büyütme deneylerini içeriyordu.

Araştırmacılar, yaklaşımını, sıfırdan eğitim, progressive eğitim, bert2BERT, ve KI gibi diğer bazlarla karşılaştırdı.

LiGO tekniği, BERT-Base’i sıfırdan eğitmeye kıyasla %44,7’lik FLOPs (saniye başına işlem sayısı) ve %40,7’lik duvar saati tasarrufu sağladı. LiGO büyüme operatörü, StackBERT, MSLT, bert2BERT ve KI’yi verimli eğitimde geride bıraktı.

LiGO Gibi bir Eğitim Optimizasyon Tekniğinin Kullanılmasının Avantajları

LiGO, çeşitli avantajlara sahip bir verimli sinir ağı eğitimi yöntemidir:

1. Daha Hızlı Eğitim

LiGO tekniğinin ana avantajı, daha hızlı eğitimdir. LLM’leri yarı zamanında eğitiyor ve üretkenliği artırıyor, maliyetleri azaltıyor.

2. Kaynak Verimliliği

LiGO, duvar süresini ve FLOPs’ı en aza indirerek daha maliyet-effective ve çevre dostu bir yaklaşım sunuyor.

3. Genelleme

LiGO tekniği, hem dil hem de görme transformer’lerinin performansını iyileştirdi, bu da genel bir teknik olduğunu gösteriyor.

Ticari AI ürünleri oluşturmak, AI sistemleriyle ilgili maliyetlerin sadece bir yönü. Diğer önemli bir maliyet bileşeni, günlük operasyonlardan geliyor. Örneğin, OpenAI’ye ChatGPT ile sorguları yanıtlamak için günlük $700,000 maliyeti oluyor. Araştırmacılar, LLM’lerin eğitiminde ve çalışma zamanında daha maliyet-effective yöntemler geliştirmeye devam edecekler.

Daha fazla AI ile ilgili içerik için, unite.ai‘yi ziyaret edin.

Haziqa bir Veri Bilimcisi ve AI ve SaaS şirketleri için teknik içerik yazma konusunda geniş deneyime sahiptir.