โมเดลและแพลตฟอร์ม AI

เปิดตัว Meta Llama 3: ก้าวกระโดดในโมเดลภาษาขนาดใหญ่

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ในด้าน AI ที่สร้างข้อมูล Meta ยังคงนำหน้าด้วยความมุ่งมั่นในการทำให้เทคโนโลยี AI ที่ซับซ้อนสามารถเข้าถึงได้โดยทั่วไป โดยแจกจ่ายโมเดลภาษาขนาดใหญ่ของ Meta AI (Llama) ซีรีส์ทั่วโลกให้กับนักพัฒนาและนักวิจัย โดยสร้างบนความคิดริเริ่มที่ก้าวหน้า Meta ได้แนะนำรุ่นที่สามของซีรีส์นี้ ซึ่งก็คือ Llama 3 รุ่นนี้มีการปรับปรุงอย่างมากจาก Llama 2 โดยมีการเพิ่มประสิทธิภาพและตั้งมาตรฐานใหม่ที่ท้าทายคู่แข่งในอุตสาหกรรม เช่น Google (GOOGL ), Mistral และ Anthropic บทความนี้จะสำรวจความก้าวหน้าที่สำคัญของ Llama 3 และวิธีการที่มันเทียบกับ Llama 2

ซีรีส์ Llama ของ Meta: จากการเข้าถึงที่จำกัดไปสู่การเข้าถึงที่เปิดกว้างและประสิทธิภาพที่ดีขึ้น

Meta ได้เริ่มต้นซีรีส์ Llama ในปี 2022 ด้วยการเปิดตัว Llama 1 ซึ่งเป็นโมเดลที่จำกัดสำหรับการใช้งานที่ไม่ใช่เชิงพาณิชย์ และสามารถเข้าถึงได้เฉพาะสถาบันวิจัยที่ได้รับการคัดเลือกเท่านั้น เนื่องจากความต้องการการคำนวณที่มากและลักษณะที่เป็นกรรมสิทธิ์ของโมเดลภาษาขนาดใหญ่ในขณะนั้น ในปี 2023 ด้วยการเปิดตัว Llama 2 Meta AI ได้เปลี่ยนไปสู่การเปิดกว้างมากขึ้น โดยเสนอโมเดลฟรีสำหรับการวิจัยและวัตถุประสงค์เชิงพาณิชย์ การเคลื่อนไหวนี้มีจุดมุ่งหมายเพื่อทำให้เทคโนโลยี AI ที่ซับซ้อนสามารถเข้าถึงได้โดยผู้ใช้หลายกลุ่ม รวมถึงสตาร์ทอัพและทีมวิจัยขนาดเล็ก เพื่อให้สามารถพัฒนาและสร้างแอปพลิเคชันโดยไม่ต้องมีค่าใช้จ่ายสูงที่เกี่ยวข้องกับโมเดลขนาดใหญ่ การเปลี่ยนแปลงนี้ยังคงดำเนินต่อไปด้วยการเปิดตัว Llama 3 ซึ่งมุ่งเน้นไปที่การปรับปรุงประสิทธิภาพของโมเดลที่เล็กกว่าในหลายๆ มาตรฐานอุตสาหกรรม

การแนะนำ Llama 3

Llama 3 เป็นรุ่นที่สองของโมเดลภาษาขนาดใหญ่แบบเปิดของ Meta โดยมีโมเดลที่ได้รับการฝึกฝนล่วงหน้าและโมเดลที่ได้รับการปรับให้เหมาะสมตามคำแนะนำ โดยมีพารามิเตอร์ 8B และ 70B Llama 3 ใช้สถาปัตยกรรมทรานส์ฟอร์เมอร์แบบ decoder-only และยังคงใช้การฝึกฝนแบบอัตโนมัติและแบบ self-supervised เพื่อคาดการณ์ตัวต่อไปในลำดับข้อความ Llama 3 ได้รับการฝึกฝนจากชุดข้อมูลที่ใหญ่กว่า Llama 2 ถึง 7 เท่า โดยมีตัวเลขมากกว่า 15 ล้านล้านตัว ซึ่งได้มาจากชุดข้อมูลออนไลน์ที่ได้รับการคัดเลือกใหม่ ชุดข้อมูลนี้ได้รับการประมวลผลโดยใช้คลัสเตอร์ที่มี 24,000 GPU เพื่อรักษาคุณภาพสูงของข้อมูลการฝึกฝนนี้ เทคนิค AI ที่เน้นข้อมูลหลายอย่างถูกนำมาใช้ รวมถึงฟิลเตอร์แบบ heuristic และ NSFW, การลบข้อมูลซ้ำแบบ semantic และการจำแนกประเภทคุณภาพข้อความ

Llama 3 เทียบกับ Llama 2: การปรับปรุงที่สำคัญ

Llama 3 มีการปรับปรุงที่สำคัญหลายอย่างเมื่อเทียบกับ Llama 2 โดยเพิ่มฟังก์ชันและประสิทธิภาพ:

  • พจนานุกรมที่ขยาย: Llama 3 มีพจนานุกรมที่ใหญ่กว่า Llama 2 โดยมี 128,256 ตัว ซึ่งเพิ่มขึ้นจาก 32,000 ตัวของ Llama 2 การปรับปรุงนี้ช่วยให้การเข้ารหัสข้อความมีประสิทธิภาพมากขึ้น และเพิ่มความสามารถในการใช้งานหลายภาษา
  • ความยาวบริบทที่ขยาย: Llama 3 มีความยาวบริบทที่ 8,000 ตัว ซึ่งเป็นสองเท่าของ Llama 2 ที่มีความยาวบริบท 4,090 ตัว การเพิ่มนี้ช่วยให้สามารถจัดการกับเนื้อหาที่กว้างขึ้นได้ รวมถึงคำถามของผู้ใช้และคำตอบของโมเดล
  • ข้อมูลการฝึกที่ดีขึ้น: ชุดข้อมูลการฝึกของ Llama 3 มีขนาดใหญ่กว่า Llama 2 ถึง 7 เท่า โดยมีโค้ดมากกว่า 4 เท่า และมีข้อมูลที่ไม่ใช่ภาษาอังกฤษมากกว่า 5% ซึ่งครอบคลุมมากกว่า 30 ภาษา การควบคุมคุณภาพข้อมูลนี้ได้รับการดำเนินการโดยใช้เทคนิคขั้นสูง เช่น ฟิลเตอร์แบบ heuristic และ NSFW, การลบข้อมูลซ้ำแบบ semantic และการจำแนกประเภทคุณภาพข้อความ
  • การปรับให้เหมาะสมและประเมินคำแนะนำที่ดีขึ้น: Llama 3 ใช้เทคนิคการปรับให้เหมาะสมคำแนะนำที่ดีขึ้น รวมถึงการฝึกฝนแบบ supervised, การตัวอย่างที่ถูกปฏิเสธ, การเพิ่มประสิทธิภาพนโยบายแบบ proximal และการเพิ่มประสิทธิภาพนโยบายแบบ direct เพื่อเพิ่มการประเมินและปรับให้เหมาะสมของโมเดล
  • ความปลอดภัย AI ที่ดีขึ้น: Llama 3 มีการเพิ่มมาตรการความปลอดภัยที่เข้มงวด เช่น การปรับให้เหมาะสมคำแนะนำและการทดสอบความปลอดภัยอย่างครอบคลุม เพื่อลดความเสี่ยง โดยเฉพาะในด้านความปลอดภัยไซเบอร์และภัยคุกคามทางชีวภาพ

การเข้าถึง Llama 3

Llama 3 ได้รับการรวมเข้ากับระบบ Hugging Face ทำให้นักพัฒนาสามารถเข้าถึงได้ง่ายขึ้น โมเดลเหล่านี้ยังสามารถเข้าถึงได้จากแพลตฟอร์ม model-as-a-service เช่น Perplexity Labs และ Fireworks.ai และบนแพลตฟอร์มคลาวด์ เช่น AWS SageMaker, Azure ML และ Vertex AI ของ Google

การปรับปรุงที่กำลังจะมาใน Llama 3

Meta ได้ประกาศว่าการเปิดตัว Llama 3 ในปัจจุบันเป็นเพียงขั้นตอนแรกในแผนการสำหรับเวอร์ชันเต็มของ Llama 3 โดยมีการพัฒนาโมเดลที่มีพารามิเตอร์มากกว่า 400 พันล้านตัว ซึ่งจะแนะนำคุณสมบัติใหม่ๆ เช่น การทำงานหลายรูปแบบและความสามารถในการจัดการหลายภาษา

สรุป

Llama 3 ของ Meta เป็นตัวอย่างที่สำคัญของการเปลี่ยนแปลงในด้านโมเดลภาษาขนาดใหญ่ โดยไม่เพียงแต่เพิ่มความสามารถในการเข้าถึงเท่านั้น แต่ยังเพิ่มประสิทธิภาพการทำงานด้วย ด้วยชุดข้อมูลการฝึกที่ใหญ่กว่า Llama 2 ถึง 7 เท่า และคุณสมบัติใหม่ๆ เช่น พจนานุกรมที่ขยายและความยาวบริบทที่เพิ่มขึ้น Llama 3 ตั้งมาตรฐานใหม่ที่ท้าทายคู่แข่งในอุตสาหกรรม

Llama 3 ยังคงดำเนินนโยบายการเปิดกว้างของ Meta โดยทำให้เทคโนโลยี AI ที่ซับซ้อนสามารถเข้าถึงได้โดยผู้พัฒนาที่หลากหลาย และยังแนะนำการปรับปรุงที่สำคัญในด้านความปลอดภัยและความแม่นยำของการฝึกฝน

เมื่อมองไปข้างหน้า การพัฒนาที่กำลังจะมาของ Meta สัญญาว่าจะมีการเพิ่มประสิทธิภาพที่มากขึ้น รวมถึงการทำงานหลายรูปแบบและความสามารถในการใช้งานหลายภาษา ซึ่งจะทำให้ Llama 3 ไม่เพียงแต่แข่งขันกับโมเดล AI อื่นๆ ในตลาดเท่านั้น แต่ยังอาจจะเหนือกว่าพวกมันด้วย

ดร. Tehseen Zia เป็น Professor ที่ COMSATS University Islamabad โดยได้รับ PhD ใน AI จาก Vienna University of Technology, Austria มีเชี่ยวชาญด้าน Artificial Intelligence, Machine Learning, Data Science, และ Computer Vision โดยมีส่วนร่วมที่สำคัญด้วยการเผยแพร่ในวารสารวิทยาศาสตร์ที่มีชื่อเสียง ดร. Tehseen ยังได้ดำเนินโครงการอุตสาหกรรมต่างๆ ในฐานะ Principal Investigator และให้บริการเป็นที่ปรึกษาด้าน AI