โมเดลและแพลตฟอร์ม AI
Gemma: Google นำเสนอความสามารถ AI ขั้นสูงผ่านโอเพ่นซอร์ส
สาขาวิชาเรียนรู้ของเครื่อง (AI) ได้เห็นความก้าวหน้าอย่างมากในช่วงไม่กี่ปีที่ผ่านมา ซึ่งได้รับแรงผลักดันจากการพัฒนาที่สำคัญในด้าน การเรียนรู้ลึก และ การประมวลผลภาษาธรรมชาติ (NLP)
ที่แนวหน้าของความก้าวหน้าเหล่านี้คือ โมเดลภาษาขนาดใหญ่ (LLMs) – ระบบ AI ที่ได้รับการฝึกฝนบนข้อมูลข้อความจำนวนมากที่สามารถสร้างข้อความที่เหมือนมนุษย์และมีส่วนร่วมในการสนทนา
LLMs เช่น PaLM ของ Google , Claude ของ Anthropic และ Gopher ของ DeepMind ได้แสดงให้เห็นถึงความสามารถที่น่าประทับใจ ตั้งแต่การเขียนโค้ดไปจนถึงการให้เหตุผลทั่วไป อย่างไรก็ตาม โมเดลส่วนใหญ่เหล่านี้ไม่ได้รับการเผยแพร่สาธารณะ ซึ่งจำกัดการเข้าถึงสำหรับการวิจัย การพัฒนา และการประยุกต์ใช้ที่เป็นประโยชน์
ภาพรวมของ Gemma
ในเดือนกุมภาพันธ์ 2023 DeepMind เผยแพร่ Gemma ซึ่งเป็นโมเดล LLM ขนาดใหญ่สองรุ่น – รุ่น 2 พันล้านพารามิเตอร์ที่ได้รับการปรับให้เหมาะสมสำหรับการใช้งานบนอุปกรณ์ และรุ่น 7 พันล้านพารามิเตอร์ที่ได้รับการออกแบบสำหรับการใช้งาน GPU/TPU
Gemma ใช้โครงสร้างแบบทรานส์ฟอร์เมอร์และวิธีการฝึกที่คล้ายกับโมเดล Gemini ของ DeepMind ได้รับการฝึกฝนบนข้อมูลข้อความจำนวนมากถึง 6 ล้านล้านตัวอักษร รวมถึงเอกสารเว็บ ข้อความทางคณิตศาสตร์ และโค้ด
DeepMind เผยแพร่เช็คพอยต์ที่ได้รับการฝึกฝนแบบดิบของ Gemma รวมถึงรุ่นที่ได้รับการปรับให้เหมาะสมด้วยการเรียนรู้แบบมีคำแนะนำและข้อเสนอแนะจากมนุษย์สำหรับการเพิ่มความสามารถในด้านต่างๆ เช่น การสนทนา การปฏิบัติตามคำแนะนำ และการเขียนโค้ด
การเริ่มต้นใช้งาน Gemma
การเผยแพร่ Gemma ทำให้ความสามารถ AI ขั้นสูงของมันสามารถเข้าถึงได้สำหรับนักพัฒนา นักวิจัย และนักสนใจทั่วไป นี่คือคำแนะนำในการเริ่มต้น:
การปรับใช้แบบอิสระจากแพลตฟอร์ม
จุดแข็งหลักของ Gemma คือความยืดหยุ่น – คุณสามารถรัน Gemma บน CPU, GPU หรือ TPU สำหรับ CPU คุณสามารถใช้ TensorFlow Lite หรือ HuggingFace Transformers สำหรับการเพิ่มประสิทธิภาพบน GPU/TPU คุณสามารถใช้ TensorFlow ได้ บริการคลาวด์ เช่น Vertex AI ของ Google Cloud ยังให้การปรับขนาดที่ราบรื่น
การเข้าถึงโมเดลที่ได้รับการฝึกฝนแล้ว
Gemma มีหลายรุ่นที่ได้รับการฝึกฝนแล้วขึ้นอยู่กับความต้องการของคุณ โมเดล 2B และ 7B มีความสามารถในการสร้างข้อความที่แข็งแกร่งโดยไม่ต้องมีการฝึกฝนเพิ่มเติม สำหรับการปรับให้เหมาะสมแบบกำหนดเอง โมเดล 2B-FT และ 7B-FT เป็นจุดเริ่มต้นที่เหมาะสม
การสร้างแอปพลิเคชันที่น่าตื่นเต้น
คุณสามารถสร้างแอปพลิเคชันต่างๆ ได้มากมายด้วย Gemma เช่น การสร้างเรื่องราว การแปลภาษา การตอบคำถาม และการผลิตเนื้อหาที่สร้างสรรค์ กุญแจสำคัญคือการใช้ความสามารถของ Gemma ผ่านการฝึกฝนบนเซตข้อมูลของคุณเอง
สถาปัตยกรรม
Gemma ใช้สถาปัตยกรรมทรานส์ฟอร์เมอร์แบบดีเคอเดอร์เท่านั้น โดยสร้างขึ้นจากความก้าวหน้าเช่น การให้ความสนใจแบบหลายคำถามและการฝังตำแหน่งแบบโรตารี่:
- ทรานส์ฟอร์เมอร์: สถาปัตยกรรมทรานส์ฟอร์เมอร์ที่อาศัยกลไกการให้ความสนใจเพียงอย่างเดียวซึ่งได้รับการแนะนำในปี 2017 ได้กลายเป็นสิ่งที่พบเห็นได้ทั่วไปใน NLP Gemma สืบทอดความสามารถของทรานส์ฟอร์เมอร์ในการสร้างแบบจำลองความสัมพันธ์ระยะไกลในข้อความ
- ดีเคอเดอร์เท่านั้น: Gemma ใช้เพียงสแต็คดีเคอเดอร์ของทรานส์ฟอร์เมอร์ ไม่เหมือนกับโมเดลแบบอินโคเดอร์-ดีเคอเดอร์ เช่น BART หรือ T5 ซึ่งให้ความสามารถในการสร้างข้อความที่แข็งแกร่งสำหรับงานเช่นการสร้างข้อความ
- การให้ความสนใจแบบหลายคำถาม: Gemma ใช้การให้ความสนใจแบบหลายคำถามในโมเดลที่ใหญ่กว่า ทำให้แต่ละหัวการให้ความสนใจสามารถประมวลผลหลายคำถามพร้อมกันสำหรับการอนุมานที่เร็วขึ้น
- การฝังตำแหน่งแบบโรตารี่: Gemma แสดงข้อมูลตำแหน่งโดยใช้การฝังแบบโรตารี่แทนการเข้ารหัสตำแหน่งแบบสัมบูรณ์ เทคนิคนี้ช่วยลดขนาดของโมเดลในขณะที่ยังคงรักษาข้อมูลตำแหน่ง
การใช้เทคนิค เช่น การให้ความสนใจแบบหลายคำถามและการฝังตำแหน่งแบบโรตารี่ ทำให้โมเดล Gemma สามารถบรรลุความสมดุลที่เหมาะสมระหว่างประสิทธิภาพ ความเร็วในการอนุมาน และขนาดของโมเดล
ข้อมูลและการฝึกอบรม
Gemma ได้รับการฝึกฝนบนข้อมูลข้อความจำนวนมากถึง 6 ล้านล้านตัวอักษร โดยส่วนใหญ่เป็นภาษาอังกฤษ ซึ่งรวมถึงเอกสารเว็บ ข้อความทางคณิตศาสตร์ และโค้ด DeepMind ลงทุนความพยายามอย่างมากในการกรองข้อมูล โดยการลบข้อความที่เป็นอันตรายหรือไม่เหมาะสมออกโดยใช้เครื่องจำแนกและหลักการ
การฝึกอบรมได้รับการดำเนินการโดยใช้โครงสร้าง TPUv5 ของ Google โดยมี TPU สูงสุด 4,096 ตัวที่ใช้ในการฝึก Gemma-7B เทคนิคการขนานข้อมูลและโมเดลที่มีประสิทธิภาพทำให้สามารถฝึกโมเดลขนาดใหญ่ได้ด้วยฮาร์ดแวร์ทั่วไป
การฝึกแบบหลายขั้นตอนได้รับการใช้ โดยปรับเปลี่ยนการกระจายข้อมูลอย่างต่อเนื่องเพื่อมุ่งเน้นไปที่ข้อความที่มีคุณภาพสูงและเกี่ยวข้อง ช่วงการฝึกแบบดูแลในขั้นตอนสุดท้ายใช้การผสมผสานระหว่างตัวอย่างคำแนะนำที่สร้างโดยมนุษย์และสังเคราะห์เพื่อเพิ่มความสามารถในด้านต่างๆ เช่น การสนทนา การปฏิบัติตามคำแนะนำ และการเขียนโค้ด
ประสิทธิภาพของโมเดล
DeepMind ประเมิน Gemma อย่างเข้มงวดบนชุดบンチมาร์กมากกว่า 25 ชุด ซึ่งครอบคลุมการถามคำตอบ การให้เหตุผล คณิตศาสตร์ การเขียนโค้ด ความรู้ทั่วไป และความสามารถในการสนทนา
Gemma ประสบความสำเร็จในการบรรลุผลลัพธ์ที่ดีที่สุดเทียบกับโมเดลโอเพ่นซอร์สที่มีขนาดคล้ายกันในหลายชุดบンチมาร์ก มีไฮไลท์บางประการ:
- คณิตศาสตร์: Gemma excels ในการทดสอบการให้เหตุผลทางคณิตศาสตร์ เช่น GSM8K และ MATH โดยเอาชนะโมเดล เช่น Codex และ Claude ของ Anthropic มากกว่า 10 คะแนน
- การเขียนโค้ด: Gemma เหมือนหรือเกินประสิทธิภาพของ Codex ในบンチมาร์กการเขียนโค้ด เช่น MBPP แม้ว่าจะไม่ได้รับการฝึกฝนโดยเฉพาะบนโค้ดก็ตาม
- การสนทนา: Gemma แสดงให้เห็นถึงความสามารถในการสนทนาที่แข็งแกร่งด้วยอัตราชนะ 51.7% เหนือ Mistral-7B ของ Anthropic ในการทดสอบความชอบของมนุษย์
- การให้เหตุผล: ในงานที่ต้องใช้การอนุมาน เช่น ARC และ Winogrande Gemma เหนือโมเดลอื่นๆ ที่มีขนาด 7 พันล้านพารามิเตอร์ 5-10 คะแนน
ความสามารถที่หลากหลายของ Gemma ทั่วทั้งระเบียบวิธีแสดงให้เห็นถึงความสามารถทั่วไปที่แข็งแกร่ง แม้ว่ายังคงมีช่องว่างในการบรรลุประสิทธิภาพระดับมนุษย์ แต่ Gemma ก็แสดงถึงความก้าวหน้าใน NLP แบบโอเพ่นซอร์ส
ความปลอดภัยและความรับผิดชอบ
การเผยแพร่น้ำหนักแบบโอเพ่นซอร์สของโมเดลขนาดใหญ่ทำให้เกิดความท้าทายเกี่ยวกับการใช้ในทางที่ผิดและการเอนเอียงที่มีอยู่ในโมเดล DeepMind ได้ดำเนินการเพื่อลดความเสี่ยง:
- การกรองข้อมูล: ข้อความที่อาจเป็นอันตราย ผิดกฎหมาย หรือมีอคติได้รับการลบออกจากเซตข้อมูลการฝึกโดยใช้เครื่องจำแนกและหลักการ
- การประเมิน: Gemma ได้รับการทดสอบบนชุดบンチมาร์กมากกว่า 30 ชุด ซึ่งได้รับการคัดเลือกเพื่อประเมินความปลอดภัย ความยุติธรรม และความแข็งแกร่ง มันสามารถเทียบหรือเกินประสิทธิภาพของโมเดลอื่นๆ
- การปรับให้เหมาะสม: การปรับให้เหมาะสมของโมเดลมุ่งเน้นไปที่การปรับปรุงความสามารถด้านความปลอดภัย เช่น การกรองข้อมูลและการปฏิเสธ/การปฏิเสธพฤติกรรมที่เหมาะสม
- เงื่อนไขการใช้: เงื่อนไขการใช้ห้ามการใช้ Gemma ในการประยุกต์ใช้ที่เป็นอันตราย ผิดกฎหมาย หรือไม่เหมาะสม อย่างไรก็ตาม การบังคับใช้ยังคงเป็นเรื่องที่ท้าทาย
- การ์ดโมเดล: การ์ดที่ให้รายละเอียดเกี่ยวกับความสามารถ ข้อจำกัด และอคติของโมเดลได้รับการเผยแพร่เพื่อส่งเสริมความโปร่งใส
แม้ว่าจะมีความเสี่ยงจากการเผยแพร่แบบโอเพ่นซอร์ส แต่ DeepMind พิจารณาว่าการเผยแพร่ Gemma มีประโยชน์ต่อสังคมสุทธิตามโปรไฟล์ความปลอดภัยและความสามารถในการอำนวยความสะดวกในการวิจัย อย่างไรก็ตาม การติดตามอย่างต่อเนื่องเกี่ยวกับอันตรายที่อาจเกิดขึ้นยังคงจำเป็น
การเปิดใช้งานคลื่นต่อไปของนวัตกรรม AI
การเผยแพร่ Gemma ในฐานะโมเดลโอเพ่นซอร์สมีศักยภาพที่จะปลดปล่อยความก้าวหน้าในกลุ่มชุมชน AI:
- ความสามารถเข้าถึง: Gemma ลดอุปสรรคสำหรับองค์กรในการสร้างด้วย NLP ขั้นสูง ซึ่งเคยเผชิญกับต้นทุนการคำนวณ/ข้อมูลสูงในการฝึกโมเดล LLM ของตนเอง
- แอปพลิเคชันใหม่: ด้วยการเผยแพร่เช็คพอยต์ที่ได้รับการฝึกฝนและปรับให้เหมาะสม DeepMind ทำให้นักพัฒนาสามารถสร้างแอปพลิเคชันที่เป็นประโยชน์ได้ง่ายขึ้นในด้านต่างๆ เช่น การศึกษา วิทยาศาสตร์ และความสามารถในการเข้าถึง
- การปรับให้เหมาะสม: นักพัฒนาสามารถปรับ Gemma ให้เหมาะสมกับแอปพลิเคชันเฉพาะอุตสาหกรรมหรือโดเมนได้โดยการฝึกอบรมต่อด้วยข้อมูลที่เป็นของตนเอง
- การวิจัย: โมเดลโอเพ่นซอร์ส เช่น Gemma ส่งเสริมความโปร่งใสและความสามารถในการตรวจสอบระบบ NLP ปัจจุบัน ทำให้เห็นแนวทางในการวิจัยในอนาคต
- นวัตกรรม: การมีโมเดลฐานที่แข็งแกร่ง เช่น Gemma จะเร่งความก้าวหน้าในด้านต่างๆ เช่น การลดอคติ ความจริง และความปลอดภัยของ AI
ด้วยการให้ความสามารถของ Gemma แก่ทุกคนผ่านการเผยแพร่แบบโอเพ่นซอร์ส DeepMind หวังว่าจะกระตุ้นให้เกิดการพัฒนาอันรับผิดชอบของ AI เพื่อประโยชน์ของสังคม
เส้นทางสู่อนาคต
ด้วยความก้าวหน้าแต่ละครั้งใน AI เรากำลังใกล้เข้าไปสู่โมเดลที่เทียบหรือเกินความสามารถของมนุษย์ในสาขาต่างๆ ระบบ เช่น Gemma เน้นย้ำถึงความก้าวหน้าที่รวดเร็วในโมเดลแบบไม่กำกับดูแลที่ปลดปล่อยความสามารถทาง认知ที่ซับซ้อนมากขึ้น
อย่างไรก็ตาม ยังคงมีงานที่ต้องทำเพื่อปรับปรุงความน่าเชื่อถือ ความเข้าใจได้ และการควบคุม AI – สิ่งที่ความสามารถของมนุษย์ยังคงเหนือกว่า สาขาต่างๆ เช่น คณิตศาสตร์ เน้นย้ำถึงช่องว่างที่ยังคงอยู่ โดย Gemma ได้รับคะแนน 64% ใน MMLU เทียบกับผลลัพธ์ของมนุษย์ที่คาดว่าจะได้ 89%
การปิดช่องว่างเหล่านี้ในขณะเดียวกันก็รับประกันความปลอดภัยและจริยธรรมของระบบ AI ที่มีความสามารถมากขึ้นจะกลายเป็นความท้าทายในอนาคต การสร้างสมดุลที่เหมาะสมระหว่างความเปิดกว้างและความระมัดระวังจะถือเป็นสิ่งสำคัญ เนื่องจาก DeepMind มุ่งหวังที่จะทำให้ประโยชน์ของ AI มีความเข้าถึงได้โดยทั่วไปในขณะเดียวกันก็จัดการกับความเสี่ยงที่เกิดขึ้นใหม่
การริเริ่มเพื่อส่งเสริมความปลอดภัยของ AI เช่น ANC ของ Dario Amodei ทีม Ethics & Society ของ DeepMind และ Constitutional AI ของ Anthropic บ่งบอกถึงการยอมรับที่เพิ่มขึ้นในความจำเป็นของความเข้าใจอย่างละเอียด การทำความเข้าใจที่มีความหมายจะต้องอาศัยการแลกเปลี่ยนอย่างเปิดกว้างและขึ้นอยู่กับหลักฐานระหว่างนักวิจัย นักพัฒนา ผู้กำหนดนโยบาย และสาธารณชน
หากได้รับการนำทางอย่างมีความรับผิดชอบ Gemma จะไม่ใช่จุดสูงสุดของ AI แต่เป็นฐานทัพสำหรับการวิจัย AI รุ่นต่อไปที่จะตามรอย DeepMind สู่ AI ทั่วไปที่ยุติธรรมและมีประโยชน์
สรุป
การเผยแพร่ Gemma ของ DeepMind ถือเป็นยุคใหม่ของ AI แบบโอเพ่นซอร์ส – ยุคที่ข้ามพ้นการประเมินแบบแคบๆ ไปสู่ความสามารถ AI ทั่วไปที่ได้รับการทดสอบอย่างเข้มงวดและเข้าถึงได้อย่างกว้างขวาง Gemma ตั้งมาตรฐานใหม่สำหรับการเผยแพร่แบบโอเพ่นซอร์สที่มีความรับผิดชอบใน AI
โดยได้รับแรงผลักดันจากจิตวิญญาณที่มีการแข่งขันซึ่งถูกปรับให้เข้ากับค่านิยมร่วม การแบ่งปันความก้าวหน้า เช่น Gemma ทำให้ทุกคนในระบบนิเวศ AI ได้รับประโยชน์ ชุมชนโดยรวมตอนนี้มีโมเดล LLM ที่หลากหลายเพื่อขับเคลื่อนหรือสนับสนุนการดำเนินงานของตน
แม้ว่าจะมีความเสี่ยง แต่ความเข้มงวดทางเทคนิคและจริยธรรมของ DeepMind ทำให้เกิดความมั่นใจว่าประโยชน์ของ Gemma มากกว่าความเสี่ยงที่อาจเกิดขึ้น เมื่อความสามารถของ AI เพิ่มขึ้น การรักษาความสมดุลระหว่างความเปิดกว้างและความระมัดระวังจะถือเป็นสิ่งสำคัญ
Gemma นำเราใกล้เข้าไปสู่ AI ที่เป็นประโยชน์ต่อมนุษยชาติ แต่ยังคงมีความท้าทายที่ยิ่งใหญ่มากมายรออยู่ในเส้นทางสู่ AI ทั่วไปที่มีประโยชน์ หากนักวิจัย AI นักพัฒนา และสังคมโดยรวมสามารถรักษาความก้าวหน้าแบบร่วมมือได้ Gemma อาจถูกมองว่าเป็นฐานทัพทางประวัติศาสตร์มากกว่าจุดสูงสุดสุดท้าย












