โมเดลและแพลตฟอร์ม AI

สามารถสร้างโมเดลภาษาขนาดใหญ่เช่น ChatGPT ได้ด้วยค่าใช้จ่ายครึ่งหนึ่งหรือไม่?

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

โมเดลภาษาขนาดใหญ่ (LLMs) เช่น GPT-3 และ ChatGPT ได้ปฏิวัติวงการ AI โดยการนำเสนอความเข้าใจภาษาธรรมชาติและความสามารถในการสร้างเนื้อหาที่มีคุณภาพ แต่การพัฒนาของพวกมันมีราคาแพงมาก ทำให้การเข้าถึงและวิจัยต่อไปนั้นถูกจำกัด นักวิจัยประมาณการว่าการฝึกอบรม GPT-3 มีค่าใช้จ่าย OpenAI ประมาณ $5 ล้าน อย่างไรก็ตาม Microsoft (MSFT ) ได้เห็นโอกาสและลงทุน $1 พันล้าน ในปี 2019 และ $10 พันล้าน ในปี 2023 ในโครงการ GPT-3 และ ChatGPT ของ OpenAI

โมเดลภาษาขนาดใหญ่คือโมเดลการเรียนรู้ของเครื่องแบบหนึ่งที่ได้รับการฝึกอบรมจากข้อมูลข้อความจำนวนมากสำหรับการใช้งาน NLP พวกมันใช้โครงสร้าง Transformer และกลไกการให้ความสนใจสำหรับงาน NLP เช่น การตอบคำถาม การแปลภาษา การวิเคราะห์ความรู้สึก และอื่นๆ

คำถามที่เกิดขึ้นคือ สามารถเพิ่มประสิทธิภาพของโมเดลขนาดใหญ่เหล่านี้ได้หรือไม่ ในขณะเดียวกันก็ลดค่าใช้จ่ายในการคำนวณและเวลาในการฝึกอบรม?

มีการพัฒนาวิธีการต่างๆ เช่น Progressive Neural Networks, Network Morphism, intra-layer model parallelism, knowledge inheritance และอื่นๆ เพื่อลดค่าใช้จ่ายในการคำนวณของการฝึกอบรมเครือข่ายประสาทเทียม วิธีการ LiGO (Linear Growth Operator) ที่เราจะพูดถึงนี้เป็นวิธีการใหม่ที่สามารถลดค่าใช้จ่ายในการฝึกอบรม LLMs ได้ครึ่งหนึ่ง

ก่อนที่จะพูดถึงเทคนิคนี้ มันสำคัญที่จะพิจารณาปัจจัยที่ทำให้ค่าใช้จ่ายในการสร้าง LLMs สูง

ค่าใช้จ่ายในการสร้างโมเดลภาษาขนาดใหญ่

มีค่าใช้จ่ายสามประการที่สำคัญในการพัฒนา LLMs

1. ทรัพยากรการคำนวณ

การสร้าง LLMs ต้องการทรัพยากรการคำนวณจำนวนมากเพื่อฝึกอบรมจากข้อมูลจำนวนมาก พวกมันต้องประมวลผลพารามิเตอร์หลายพันล้านและเรียนรู้รูปแบบที่ซับซ้อนจากข้อมูลข้อความจำนวนมาก

การลงทุนในฮาร์ดแวร์เฉพาะ เช่น Graphics Processing Units (GPUs) และ Tensor Processing Units (TPUs) เป็น必要สำหรับการสร้างและฝึกอบรม LLMs เพื่อให้ได้ผลลัพธ์ที่ดีที่สุด

ตัวอย่างเช่น GPT-3 ได้รับการฝึกอบรมบน ซูเปอร์คอมพิวเตอร์ ที่มี 10,000 GPU ระดับองค์กร (H100 และ A100) และ 285,000 CPU cores

2. การบริโภคพลังงาน

ทรัพยากรการคำนวณที่ต้องการในการสร้าง LLMs ทำให้เกิดการบริโภคพลังงานที่สูงมาก ตัวอย่างเช่น การฝึกอบรม GPT-3 ที่มีพารามิเตอร์ 175 พันล้านตัวใช้เวลา 14.8 วัน โดยใช้ 10,000 V100 GPUs ซึ่งเทียบเท่ากับ 3.55 ล้านชั่วโมง GPU การบริโภคพลังงานในระดับนี้มีผลกระทบต่อสิ่งแวดล้อมอย่างมาก

3. การจัดเก็บและจัดการข้อมูล

LLMs ได้รับการฝึกอบรมจากข้อมูลจำนวนมาก ตัวอย่างเช่น GPT-3 ได้รับการฝึกอบรมจากข้อมูลข้อความจำนวนมาก รวมถึง Common Crawl, WebText2, Books1, Books2 และ Wikipedia การลงทุนในโครงสร้างพื้นฐานที่สำคัญจำเป็นต้องเก็บเกี่ยว คัดเลือก และจัดเก็บข้อมูลเหล่านี้

นอกจากนี้ยังต้องการการเก็บข้อมูลบนคลาวด์สำหรับการจัดเก็บข้อมูล และความเชี่ยวชาญของมนุษย์สำหรับการประมวลผลข้อมูลเบื้องต้นและการควบคุมเวอร์ชัน นอกจากนี้การรับรองว่ากลยุทธ์ข้อมูลของคุณเป็นไปตามข้อบังคับ เช่น GDPR ยังเพิ่มค่าใช้จ่าย

เทคนิค LiGO: ลดค่าใช้จ่ายในการสร้างโมเดลภาษาขนาดใหญ่ลงครึ่งหนึ่ง

LiGO (Linear Growth Operator) เป็นวิธีการใหม่ที่พัฒนาโดยนักวิจัยที่ MIT เพื่อลดค่าใช้จ่ายในการฝึกอบรม LLMs ลง 50% วิธีการนี้เกี่ยวข้องกับการเริ่มต้นการฝึกอบรมโดยใช้น้ำหนักของโมเดลที่เล็กกว่าและฝึกอบรมใหม่เพื่อให้ได้ประสิทธิภาพที่ดีที่สุด

Yoon Kim ผู้เขียนอาวุโสของเอกสารวิจัยกล่าวว่า:

“มีการประมาณการว่าการฝึกอบรมโมเดลที่มีขนาดเท่ากับ ChatGPT อาจต้องใช้เงินหลายล้านเหรียญสหรัฐฯ สำหรับการฝึกอบรมครั้งเดียว สามารถปรับปรุงประสิทธิภาพของวิธีการฝึกอบรมเหล่านี้ได้หรือไม่ เพื่อให้ได้โมเดลที่ดีในเวลาที่สั้นลงและค่าใช้จ่ายที่น้อยลง? เราเสนอให้ทำสิ่งนี้โดยใช้โมเดลภาษาที่เล็กกว่าที่ได้รับการฝึกอบรมไว้แล้ว”

วิธีการนี้รักษาความสามารถในการทำงานของโมเดลที่ใหญ่ขึ้นโดยมีค่าใช้จ่ายในการคำนวณที่ลดลงและเวลาในการฝึกอบรมที่สั้นลงเมื่อเทียบกับการฝึกอบรมโมเดลขนาดใหญ่ตั้งแต่ต้น LiGO ใช้การเติบโตเชิงเส้นแบบขับเคลื่อนด้วยข้อมูลที่รวมตัวประกอบความลึกและความกว้างเพื่อให้ได้ประสิทธิภาพที่ดีที่สุด

เอกสารวิจัยใช้ข้อมูลต่างๆ เพื่อทำการทดลองบนข้อความ รวมถึงคอร์ปัส Wikipedia ภาษาอังกฤษสำหรับการฝึกอบรมโมเดล BERT และ RoBERTa และคอร์ปัส C4 สำหรับการฝึกอบรมโมเดล GPT2

การทดลองเทคนิค LiGO รวมถึงการเพิ่มโมเดล BERT-Small เป็น BERT-Base, BERT-Base เป็น BERT-Large, RoBERTa-Small เป็น RoBERTa-Base, GPT2-Base เป็น GPT2-Medium และ CaiT-XS เป็น CaiT-S

นักวิจัยเปรียบเทียบวิธีการของพวกเขากับวิธีการอื่นๆ รวมถึงการฝึกอบรมตั้งแต่ต้น การฝึกอบรมแบบก้าวหน้า bert2BERT และ KI

เทคนิค LiGO มีการประหยัด 44.7% ใน FLOPs (การดำเนินการแบบ 浮動 小数 点 ต่อวินาที) และ 40.7% ในเวลาผ่านไปเมื่อเทียบกับการฝึกอบรม BERT-Base ตั้งแต่ต้นโดยใช้โมเดล BERT-Small การเติบโตของ LiGO มีประสิทธิภาพมากกว่า StackBERT, MSLT, bert2BERT และ KI ในการฝึกอบรมที่มีประสิทธิภาพ

ประโยชน์ของการใช้เทคนิคการฝึกอบรมที่มีประสิทธิภาพเช่น LiGO

LiGO เป็นวิธีการฝึกอบรมเครือข่ายประสาทเทียมที่มีประสิทธิภาพและมีประโยชน์หลายประการดังนี้

1. การฝึกอบรมที่เร็วขึ้น

การฝึกอบรมที่เร็วขึ้นเป็นข้อได้เปรียบหลักของเทคนิค LiGO มันฝึกอบรม LLMs ในเวลาครึ่งหนึ่ง ทำให้เพิ่มผลผลิตและลดค่าใช้จ่าย

2. ประสิทธิภาพการใช้ทรัพยากร

LiGO มีประสิทธิภาพในการใช้ทรัพยากรเนื่องจากมันลดเวลาผ่านไปและ FLOPs ทำให้เป็นวิธีการที่มีประสิทธิภาพและเป็นมิตรต่อสิ่งแวดล้อมในการฝึกอบรมโมเดล Transformer ขนาดใหญ่

3. การทั่วไป

เทคนิค LiGO มีการปรับปรุงประสิทธิภาพของทั้งโมเดลภาษาและโมเดลการเห็นภาพ ซึ่งแสดงว่ามันเป็นวิธีการที่สามารถใช้ได้กับทasks ต่างๆ

การสร้างผลิตภัณฑ์ AI เชิงพาณิชย์เป็นเพียงด้านหนึ่งของค่าใช้จ่ายทั้งหมดที่เกี่ยวข้องกับระบบ AI อีกด้านหนึ่งที่สำคัญคือค่าใช้จ่ายในการดำเนินงานประจำวัน ตัวอย่างเช่น มันใช้เงิน OpenAI ประมาณ $700,000 ทุกวันเพื่อตอบคำถามโดยใช้ ChatGPT นักวิจัยคาดว่าจะ继续พัฒนาวิธีการที่ทำให้ LLMs มีค่าใช้จ่ายที่มีประสิทธิภาพในการฝึกอบรมและเข้าถึงได้ง่ายขึ้น

สำหรับเนื้อหาที่เกี่ยวข้องกับ AI เพิ่มเติม โปรดเยี่ยมชม unite.ai

Haziqa เป็นนักวิทยาศาสตร์ข้อมูลที่มีประสบการณ์อย่างกว้างขวางในการเขียนเนื้อหาทางเทคนิคสำหรับบริษัท AI และ SaaS