Model dan platform AI
Apakah Anda Dapat Membangun Model Bahasa Besar seperti ChatGPT dengan Biaya Setengah?
Model Bahasa Besar (LLMs) seperti GPT-3 dan ChatGPT telah merevolusi AI dengan menawarkan kemampuan Pemahaman Bahasa Alam dan generasi konten. Namun, pengembangan mereka datang dengan biaya yang mahal, membatasi aksesibilitas dan penelitian lebih lanjut. Peneliti memperkirakan bahwa pelatihan GPT-3 biaya OpenAI sekitar $5 juta. Meskipun demikian, Microsoft (MSFT ) mengakui potensi dan berinvestasi $1 miliar pada 2019 dan $10 miliar pada 2023 di ventura GPT-3 dan ChatGPT OpenAI.
LLMs adalah model pembelajaran mesin yang dilatih pada data teks ekstensif untuk aplikasi NLP. Mereka berbasis arsitektur transformer dan menggunakan mekanisme perhatian untuk tugas NLP seperti pertanyaan-jawaban, terjemahan mesin, analisis sentimen, dll.
Pertanyaan yang muncul: dapatkah efisiensi model besar ini ditingkatkan sambil mengurangi biaya komputasi dan waktu pelatihan?
Beberapa pendekatan, seperti Progressive Neural Networks, Network Morphism, intra-layer model parallelism, knowledge inheritance, dll., telah dikembangkan untuk mengurangi biaya komputasi pelatihan jaringan neural. Pendekatan LiGO (Linear Growth Operator) yang baru kita bahas adalah setting baru. Ini memotong biaya komputasi pelatihan LLMs menjadi setengah.
Sebelum membahas teknik ini, memeriksa faktor-faktor yang menyebabkan biaya tinggi membuat LLMs adalah penting.
Biaya Membangun Model Bahasa Besar
Tiga biaya utama untuk mengembangkan LLMs adalah sebagai berikut:
1. Sumber Daya Komputasi
Membangun LLMs memerlukan sumber daya komputasi besar untuk dilatih pada dataset besar. Mereka harus memproses miliaran parameter dan mempelajari pola kompleks dari data teks besar.
Investasi pada perangkat keras khusus seperti Graphics Processing Units (GPUs) dan Tensor Processing Units (TPUs) diperlukan untuk membangun dan melatih LLMs untuk mencapai kinerja terbaik.
Misalnya, GPT-3 dilatih pada superkomputer dengan 10000 GPU kelas perusahaan (H100 dan A100) dan 285.000 inti CPU.
2. Konsumsi Energi
Sumber daya komputasi intensif yang diperlukan untuk membangun LLMs menghasilkan konsumsi energi yang signifikan. Misalnya, pelatihan 175 miliar parameter GPT-3 membutuhkan 14,8 hari menggunakan 10.000 V100 GPUs, setara dengan 3,55 juta jam GPU. Konsumsi energi yang tinggi seperti ini memiliki dampak lingkungan yang signifikan juga.
3. Penyimpanan & Pengelolaan Data
LLMs dilatih pada dataset besar. Misalnya, GPT-3 dilatih pada korpus teks besar data, termasuk Common Crawl, WebText2, Books1, Books2, dan Wikipedia, di antara sumber lainnya. Investasi infrastruktur yang signifikan diperlukan untuk mengumpulkan, mengkurasi, dan menyimpan dataset ini.
Juga, penyimpanan cloud diperlukan untuk penyimpanan data, dan keahlian manusia untuk pengolahan data dan kontrol versi. Selain itu, memastikan bahwa strategi data Anda mematuhi peraturan seperti GDPR juga menambah biaya.
Teknik LiGO: Mengurangi Biaya Membangun Model Bahasa Besar menjadi Setengah
LiGO (Linear Growth Operator) adalah teknik baru yang dikembangkan oleh peneliti di MIT untuk mengurangi biaya komputasi pelatihan LLMs sebesar 50%. Metode ini melibatkan inisialisasi bobot model yang lebih besar dari model yang lebih kecil yang telah dilatih sebelumnya, memungkinkan penskalaan efisien jaringan neural.

Gambar dari Paper: Learning to Grow Pretrained Models For Efficient Transformer Training
Yoon Kim, penulis senior paper ini, mengatakan:
“Diperkirakan bahwa pelatihan model dengan skala seperti yang dihipotesiskan ChatGPT dapat membutuhkan jutaan dolar hanya untuk satu kali pelatihan. Bisakah kita meningkatkan efisiensi metode pelatihan ini, sehingga kita masih dapat mendapatkan model yang baik dalam waktu yang lebih singkat dan dengan biaya yang lebih rendah? Kami mengusulkan untuk melakukan ini dengan menggunakan model bahasa yang lebih kecil yang telah dilatih sebelumnya.”
Metode ini mempertahankan manfaat kinerja model yang lebih besar dengan biaya komputasi yang lebih rendah dan waktu pelatihan yang lebih singkat dibandingkan dengan melatih model besar dari awal. LiGO menggunakan operator pertumbuhan linier yang didorong data yang menggabungkan operator kedalaman dan lebar untuk kinerja optimum.
Makalah ini menggunakan berbagai dataset untuk melakukan eksperimen berbasis teks, termasuk korpus Wikipedia bahasa Inggris untuk melatih model BERT dan RoBERTa dan dataset C4 untuk melatih model GPT2.
Eksperimen teknik LiGO termasuk tumbuh BERT-Small ke BERT-Base, BERT-Base ke BERT-Large, RoBERTa-Small ke RoBERTa-Base, GPT2-Base ke GPT2-Medium, dan CaiT-XS ke CaiT-S.
Peneliti membandingkan pendekatan mereka dengan beberapa baseline lain, termasuk pelatihan dari awal, pelatihan progresif, bert2BERT, dan KI.
Teknik LiGO menawarkan 44,7% penghematan FLOPs (operasi titik mengambang per detik) dan 40,7% penghematan waktu dinding dibandingkan dengan pelatihan BERT-Base dari awal dengan menggunakan model BERT-Small. Operator pertumbuhan LiGO outperforms StackBERT, MSLT, bert2BERT, dan KI dalam pelatihan yang efisien.
Manfaat Menggunakan Teknik Optimisasi Pelatihan seperti LiGO
LiGO adalah metode pelatihan jaringan neural yang efisien yang memiliki beberapa manfaat sebagai berikut:
1. Pelatihan yang Lebih Cepat
Seperti yang disebutkan sebelumnya, pelatihan yang lebih cepat adalah kelebihan utama teknik LiGO. Ini melatih LLMs dalam setengah waktu, meningkatkan produktivitas dan mengurangi biaya.
2. Efisiensi Sumber Daya
LiGO adalah efisiensi sumber daya karena meminimalkan waktu dinding dan FLOPs, menghasilkan pendekatan yang lebih hemat biaya dan ramah lingkungan untuk melatih model transformer besar.
3. Generalisasi
Teknik LiGO telah meningkatkan kinerja baik model bahasa dan visi, menunjukkan bahwa ini adalah teknik yang dapat digeneralisasi yang dapat diterapkan pada berbagai tugas.
Membangun produk AI komersial hanya satu aspek dari biaya keseluruhan yang terkait dengan sistem AI. Komponen biaya lain yang signifikan berasal dari operasi sehari-hari. Misalnya, biaya OpenAI sekitar $700.000 setiap hari untuk menjawab pertanyaan menggunakan ChatGPT. Peneliti diharapkan untuk terus mengeksplorasi pendekatan yang membuat LLMs lebih hemat biaya selama pelatihan dan lebih mudah diakses saat runtime.
Untuk konten AI yang lebih banyak, kunjungi unite.ai.












