โมเดลและแพลตฟอร์ม AI

Google เปิดตัว Gemma 2: เพิ่มประสิทธิภาพและความเร็วในการประมวลผลภาษาให้กับนักพัฒนา

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

Google (GOOGL ) ได้เปิดตัว Gemma 2 ซึ่งเป็นรุ่นล่าสุดของโมเดลภาษาแบบเปิดที่มีน้ำหนักเบา มีให้เลือกทั้งรุ่น 9 พันล้าน (9B) และ 27 พันล้าน (27B) พารามิเตอร์ รุ่นนี้มีการปรับปรุงประสิทธิภาพและความเร็วในการอนุมานมากกว่ารุ่นก่อนหน้า Gemma model Gemma 2 ซึ่งพัฒนามาจาก Gemini models ของ Google ได้รับการออกแบบให้เข้าถึงได้ง่ายสำหรับนักวิจัยและนักพัฒนา โดยมีการปรับปรุงความเร็วและประสิทธิภาพอย่างมาก ไม่เหมือนกับโมเดล Gemini ที่มีหลายโหมดและหลายภาษา Gemma 2 มุ่งเน้นไปที่การประมวลผลภาษาเท่านั้น ในบทความนี้ เราจะสำรวจคุณสมบัติที่โดดเด่นและความก้าวหน้าของ Gemma 2 โดยเปรียบเทียบกับรุ่นก่อนหน้าและคู่แข่งในด้านนี้ และเน้นย้ำถึงกรณีการใช้งานและความท้าทาย

การสร้าง Gemma 2

เช่นเดียวกับรุ่นก่อนหน้า Gemma 2 ใช้โครงสร้างแบบ decoder-only transformer รุ่น 27B ได้รับการฝึกฝนจาก 13 ล้านล้านโทเค็นของข้อมูลภาษาอังกฤษเป็นหลัก ในขณะที่รุ่น 9B ใช้ 8 ล้านล้านโทเค็น และรุ่น 2.6B ได้รับการฝึกฝนจาก 2 ล้านล้านโทเค็น โทเค็นเหล่านี้มาจากแหล่งข้อมูลต่างๆ รวมถึงเอกสารเว็บ โค้ด และบทความวิทยาศาสตร์ โมเดลใช้ตัวแบ่งคำเหมือนกับ Gemma 1 และ Gemini เพื่อให้มีความสอดคล้องกันในการประมวลผลข้อมูล

Gemma 2 ได้รับการฝึกฝนโดยใช้วิธีการเรียกใช้ความรู้ (knowledge distillation) โดยที่มันเรียนรู้จากความน่าจะเป็นของการผลิตของโมเดลที่ใหญ่กว่าและได้รับการฝึกฝนมาก่อน หลังจากการฝึกฝนเบื้องต้น โมเดลจะได้รับการปรับแต่งผ่านกระบวนการปรับแต่งคำสั่ง (instruction tuning) ซึ่งเริ่มต้นด้วยการปรับแต่งแบบมีการกำกับ (supervised fine-tuning) บนข้อความภาษาอังกฤษที่สร้างขึ้นและข้อความที่สร้างโดยมนุษย์ ต่อด้วยการเรียนรู้แบบเสริมด้วยข้อเสนอแนะจากมนุษย์ (reinforcement learning with human feedback) เพื่อปรับปรุงประสิทธิภาพโดยรวม

Gemma 2: ประสิทธิภาพและประสิทธิผลที่ดีขึ้นบนฮาร์ดแวร์ที่หลากหลาย

Gemma 2 ไม่เพียงแต่แสดงผลการทำงานที่ดีกว่า Gemma 1 แต่ยังสามารถแข่งขันกับโมเดลที่มีขนาดใหญ่กว่าสองเท่าได้ มันถูกออกแบบมาให้ทำงานได้อย่างมีประสิทธิภาพบนฮาร์ดแวร์ที่หลากหลาย รวมถึงแลปท็อป เดสก์ท็อป อุปกรณ์ IoT และแพลตฟอร์มมือถือ โดยเฉพาะการปรับให้เหมาะสมสำหรับ GPU และ TPU เดี่ยว Gemma 2 เพิ่มประสิทธิภาพของ Gemma 1 โดยเฉพาะบนอุปกรณ์ที่มีทรัพยากรจำกัด ตัวอย่างเช่น รุ่น 27B สามารถทำงานได้ดีบน NVIDIA H100 Tensor Core GPU (NVDA ) หรือ TPU host ทำให้เป็นตัวเลือกที่คุ้มค่าสำหรับนักพัฒนาที่ต้องการประสิทธิภาพสูงโดยไม่ต้องลงทุนในฮาร์ดแวร์มาก

นอกจากนี้ Gemma 2 ยังให้ความสามารถในการปรับแต่งที่เพิ่มขึ้นสำหรับนักพัฒนา โดยไม่ว่าจะใช้โซลูชันบนคลาวด์อย่าง Google Cloud หรือแพลตฟอร์มยอดนิยมอย่าง Axolotl Gemma 2 มีตัวเลือกการปรับแต่งที่กว้างขวาง การรวมเข้ากับแพลตฟอร์มอย่าง Hugging Face, NVIDIA TensorRT-LLM และ Google’s JAX และ Keras ช่วยให้นักวิจัยและนักพัฒนาสามารถบรรลุประสิทธิภาพที่ดีที่สุดและติดตั้งได้อย่างมีประสิทธิภาพบนฮาร์ดแวร์ที่หลากหลาย

Gemma 2 เทียบกับ Llama 3 70B

เมื่อเปรียบเทียบ Gemma 2 กับ Llama 3 70B ทั้งสองโมเดลมีความโดดเด่นในหมวดโมเดลภาษาแบบเปิด นักวิจัยของ Google อ้างว่า Gemma 2 27B มีประสิทธิภาพที่เทียบเท่ากับ Llama 3 70B แม้ว่าจะมีขนาดเล็กกว่ามาก นอกจากนี้ Gemma 2 9B ยังแสดงผลการทำงานที่ดีกว่า Llama 3 8B ในหลายๆ บンチมาร์ก เช่น ความเข้าใจภาษา การเขียนโค้ด และการแก้ปัญหาทางคณิตศาสตร์

ข้อได้เปรียบที่สำคัญของ Gemma 2 เหนือ Llama 3 ของ Meta คือการประมวลผลภาษา Indic Gemma 2 มีความสามารถพิเศษด้านนี้เนื่องจากตัวแบ่งคำที่ออกแบบมาเฉพาะสำหรับภาษาเหล่านี้ และมีคำศัพท์ขนาดใหญ่ 256k เพื่อจับลักษณะทางภาษา ในทางกลับกัน Llama 3 แม้ว่าจะรองรับหลายภาษา แต่ก็ยังต้องดิ้นรนในการแบ่งคำสำหรับภาษา Indic เนื่องจากคำศัพท์และข้อมูลฝึกที่จำกัด ซึ่งทำให้ Gemma 2 มีข้อได้เปรียบในการทำงานที่เกี่ยวข้องกับภาษา Indic

กรณีการใช้งาน

ตามคุณลักษณะเฉพาะของโมเดล Gemma 2 และผลการทำงานในบンチมาร์ก เราได้ระบุกรณีการใช้งานที่เป็นไปได้สำหรับโมเดล

  • ผู้ช่วยหลายภาษา: ตัวแบ่งคำที่เฉพาะเจาะจงสำหรับหลายภาษาของ Gemma 2 ทำให้เป็นเครื่องมือที่มีประสิทธิภาพสำหรับการพัฒนาผู้ช่วยหลายภาษาที่ปรับให้เหมาะสมสำหรับผู้ใช้ภาษาเหล่านี้ ไม่ว่าจะเป็นการค้นหาข้อมูลในภาษาฮินดี การสร้างเนื้อหาสำหรับการศึกษาในภาษาอูรดู การตลาดในภาษาอาหรับ หรือการวิจัยในภาษาเบงกอล Gemma 2 ให้เครื่องมือสร้างภาษาที่มีประสิทธิภาพแก่ผู้สร้าง
  • เครื่องมือทางการศึกษา: ด้วยความสามารถในการแก้ปัญหาทางคณิตศาสตร์และเข้าใจภาษาที่ซับซ้อน Gemma 2 สามารถใช้ในการสร้างระบบสอนแบบอัจฉริยะและแอปพลิเคชันการศึกษาที่ให้ประสบการณ์การเรียนรู้ส่วนบุคคล
  • การเขียนโค้ดและความช่วยเหลือโค้ด: ความสามารถของ Gemma 2 ในการเขียนโค้ดและแก้ปัญหาแสดงให้เห็นถึงศักยภาพในการสร้างโค้ดอัตโนมัติ การตรวจสอบโค้ด และการปรับปรุงโค้ดอย่างมีประสิทธิภาพ ความสามารถในการทำงานได้ดีบนอุปกรณ์ที่มีทรัพยากรจำกัดช่วยให้นักพัฒนาสามารถรวมมันเข้ากับสภาพแวดล้อมการทำงานของตนได้อย่างราบรื่น
  • การสร้างที่เพิ่มด้วยการค้นหา (Retrieval Augmented Generation): การทำงานที่ดีของ Gemma 2 ในการอนุมานข้อความทำให้มันเหมาะสมสำหรับการพัฒนาระบบ RAG ในหลายโดเมน โดยการสนับสนุนการประยุกต์ใช้ในด้านสุขภาพ การให้คำปรึกษาทางกฎหมาย และการสร้างแชทบอทอัจฉริยะสำหรับการสนับสนุนลูกค้า

ข้อจำกัดและความท้าทาย

แม้ว่า Gemma 2 จะแสดงให้เห็นถึงความก้าวหน้าที่สำคัญ แต่ก็ยังเผชิญกับข้อจำกัดและความท้าทายที่เกี่ยวข้องกับคุณภาพและความหลากหลายของข้อมูลฝึก Gemma 2 ขาดการฝึกฝนเฉพาะสำหรับการทำงานหลายภาษาและต้องการการปรับแต่งเพื่อจัดการภาษาอื่นๆ ได้อย่างมีประสิทธิภาพ โมเดลนี้ทำงานได้ดีกับคำสั่งที่ชัดเจนและเป็นระบบ แต่ดิ้นรนในการทำงานกับงานที่ซับซ้อนหรือเปิดกว้าง และอาจขาดความแม่นยำในเรื่องข้อเท็จจริง โดยเฉพาะในบริบทที่ต้องการความเข้าใจอย่างลึกซึ้ง

สรุป

Gemma 2 นำเสนอความก้าวหน้าที่สำคัญในด้านโมเดลภาษาแบบเปิด โดยการปรับปรุงประสิทธิภาพและความเร็วในการอนุมานมากกว่ารุ่นก่อนหน้า มันเหมาะสำหรับการใช้งานบนฮาร์ดแวร์ที่หลากหลาย ทำให้สามารถเข้าถึงได้โดยไม่ต้องมีการลงทุนในฮาร์ดแวร์มาก อย่างไรก็ตาม ยังคงมีความท้าทายในการจัดการกับงานภาษาที่ซับซ้อนและรับประกันความแม่นยำในสถานการณ์ที่ซับซ้อน แม้ว่าจะมีประโยชน์สำหรับการใช้งานเช่น การให้คำปรึกษาทางกฎหมายและเครื่องมือทางการศึกษา นักพัฒนาควรตระหนักถึงข้อจำกัดของ Gemma 2 ในด้านความสามารถหลายภาษาและความแม่นยำในบริบทที่ละเอียดอ่อน

ดร. Tehseen Zia เป็น Professor ที่ COMSATS University Islamabad โดยได้รับ PhD ใน AI จาก Vienna University of Technology, Austria มีเชี่ยวชาญด้าน Artificial Intelligence, Machine Learning, Data Science, และ Computer Vision โดยมีส่วนร่วมที่สำคัญด้วยการเผยแพร่ในวารสารวิทยาศาสตร์ที่มีชื่อเสียง ดร. Tehseen ยังได้ดำเนินโครงการอุตสาหกรรมต่างๆ ในฐานะ Principal Investigator และให้บริการเป็นที่ปรึกษาด้าน AI