โมเดลและแพลตฟอร์ม AI

เอไอของ Allen AI รุ่น Tülu 3 กลายเป็นคู่แข่งที่ไม่คาดคิดของ DeepSeek

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ข่าวที่น่าตื่นเต้นยังคงมาไม่หยุด โมเดลของ DeepSeek ได้ท้าทายมาตรฐานใหม่และสร้างความสนใจอย่างมาก แต่สิ่งที่น่าสนใจเพิ่งเกิดขึ้นในด้านการวิจัย AI ที่น่าสนใจ

Allen AI ได้ปล่อยโมเดล Tülu 3 รุ่นใหม่ของตน และรุ่น 405B parameter ของโมเดลนี้ไม่เพียงแต่แข่งขันกับ DeepSeek แต่ยังสามารถเอาชนะได้ในบางด้าน

ลองมาดูรายละเอียดกัน

โมเดล Tülu 3 รุ่น 405B parameter จะต้องแข่งขันกับโมเดลที่มีประสิทธิภาพสูงอื่นๆ เช่น DeepSeek V3 ในหลายๆ ด้าน และเราจะเห็นประสิทธิภาพที่เทียบเท่าหรือเหนือกว่าในด้านต่างๆ เช่น การแก้ปัญหาทางคณิตศาสตร์ การเขียนโค้ด และการปฏิบัติตามคำสั่ง

และที่น่าสนใจคือ พวกเขายังใช้แนวทางที่เปิดกว้างในการพัฒนาโมเดล

พวกเขาทำให้กระบวนการฝึกอบรมที่สมบูรณ์ รวมถึงโค้ดและวิธีการเรียนรู้แบบเสริมใหม่ๆ ที่เรียกว่า Reinforcement Learning with Verifiable Rewards (RLVR) สามารถเข้าถึงได้

การพัฒนานี้ในช่วงไม่กี่สัปดาห์ที่ผ่านมาได้เปลี่ยนแปลงวิธีการพัฒนา AI ระดับสูงอย่างมาก เมื่อโมเดลที่เปิดกว้างสามารถเทียบเท่ากับโมเดลที่ปิดกว้างได้ มันจะเปิดโอกาสที่เคยถูกปิดกั้นไว้เบื้องหลังกำแพงขององค์กร

การรบทางเทคนิค

สิ่งที่ทำให้ Tülu 3 โดดเด่นคืออะไร มันมาจากกระบวนการฝึกอบรมที่ไม่เหมือนใครซึ่งประกอบด้วย 4 ระยะ

ลองมาดูว่า Allen AI สร้างโมเดลนี้ขึ้นมาได้อย่างไร

ระยะที่ 1: การเลือกข้อมูลเชิงกลยุทธ์

ทีมงานรู้ว่าคุณภาพของโมเดลเริ่มต้นจากคุณภาพของข้อมูล พวกเขารวมข้อมูลจากแหล่งต่างๆ เช่น WildChat และ Open Assistant พร้อมกับข้อมูลที่สร้างขึ้นเอง แต่สิ่งที่สำคัญคือ พวกเขาทำงานโดยไม่เพียงแต่รวบรวมข้อมูลเท่านั้น แต่ยังสร้างชุดข้อมูลที่มุ่งเน้นไปที่ทักษะเฉพาะ เช่น การให้เหตุผลทางคณิตศาสตร์และทักษะการเขียนโค้ด

ระยะที่ 2: การสร้างการตอบสนองที่ดีขึ้น

ในระยะที่สอง Allen AI มุ่งเน้นไปที่การสอนโมเดลให้มีทักษะเฉพาะ พวกเขาทำงานโดยการสร้างชุดข้อมูลฝึกอบรมที่แตกต่างกันสำหรับการทำคณิตศาสตร์ การเขียนโค้ด และงานทั่วไป โดยการทดสอบชุดข้อมูลเหล่านี้ซ้ำๆ พวกเขาสามารถเห็นได้อย่างชัดเจนว่าโมเดลมีศักยภาพในการทำอะไรได้บ้างในแต่ละด้าน

ระยะที่ 3: การเรียนรู้จาก比较

ที่นี่ Allen AI ได้แสดงให้เห็นถึงความสร้างสรรค์ พวกเขาสร้างระบบที่สามารถเปรียบเทียบการตอบสนองของ Tülu 3 กับโมเดลอื่นๆ ที่มีประสิทธิภาพสูงได้ทันที แต่พวกเขายังแก้ปัญหาหนึ่งที่ยังคงเป็นปัญหาใน AI ได้ ซึ่งก็คือ โมเดลมักจะเขียนคำตอบที่ยาวเพียงเพื่อให้ยาวขึ้น

วิธีการของพวกเขาโดยใช้ การเพิ่มประสิทธิภาพความชอบโดยตรงแบบปรับขนาดความยาว (DPO) ทำให้โมเดลเรียนรู้ที่จะให้คุณค่ากับคุณภาพมากกว่าปริมาณ

ผลลัพธ์? การตอบสนองของ Tülu 3 มีคุณภาพและเป็นไปตามวัตถุประสงค์

ระยะที่ 4: การนวัตกรรม RLVR

สิ่งนี้คือการผิดพลาดทางเทคนิคที่สมควรได้รับความสนใจ RLVR แทนที่โมเดลรางวัลแบบเรียนรู้โดยอาศัยการยืนยันเชิงวัตถุ

โดยทั่วไป โมเดล AI จะเรียนรู้ผ่านระบบโมเดลรางวัลที่ซับซ้อน ซึ่งเป็นเพียงการเดาเกี่ยวกับสิ่งที่ทำให้คำตอบดี แต่ Allen AI ได้เลือกเส้นทางที่แตกต่างด้วย RLVR

  • โมเดลได้รับการให้ข้อเสนอแนะทันที: 10 คะแนนสำหรับคำตอบที่ถูกต้อง 0 สำหรับคำตอบที่ไม่ถูกต้อง
  • ไม่มีพื้นที่สำหรับการให้คะแนนบางส่วนหรือการประเมินแบบคลุมเครือ
  • การเรียนรู้มุ่งเน้นและแม่นยำ
  • โมเดลเรียนรู้ที่จะให้ความสำคัญกับความถูกต้องมากกว่าการให้คำตอบที่ดูสมเหตุสมผลแต่ไม่ถูกต้อง

การดูเลข

รุ่น 405B parameter ของ Tülu 3 แข่งขันกับโมเดลที่ดีที่สุดในสนาม มาดูกันว่ามันโดดเด่นในด้านใดและหมายถึงอะไรสำหรับ AI ที่เปิดกว้าง

คณิตศาสตร์

Tülu 3 โดดเด่นในด้านการให้เหตุผลทางคณิตศาสตร์ที่ซับซ้อน ในการประเมินเช่น GSM8K และ MATH มันสามารถเทียบเท่ากับ DeepSeek ได้

โค้ด

ผลลัพธ์ของการเขียนโค้ดก็น่าประทับใจไม่แพ้กัน ขอบคุณการฝึกอบรม RLVR Tülu 3 สามารถเขียนโค้ดที่แก้ปัญหาได้อย่างมีประสิทธิภาพ

การปฏิบัติตามคำสั่งแบบแม่นยำ

ความสามารถของโมเดลในการปฏิบัติตามคำสั่งเป็นจุดแข็งหลัก มากกว่าการให้คำตอบที่ใกล้เคียงหรือทั่วไป Tülu 3 แสดงให้เห็นถึงความแม่นยำที่น่าประทับใจในการปฏิบัติตามคำสั่ง

การเปิดกล่องดำของการพัฒนา AI

Allen AI ได้ปล่อยโมเดลที่มีประสิทธิภาพสูงและกระบวนการฝึกอบรมที่สมบูรณ์

ทุกด้านของกระบวนการฝึกอบรมมีการบันทึกและสามารถเข้าถึงได้ ตั้งแต่วิธีการฝึกอบรม 4 ระยะไปจนถึงวิธีการเตรียมข้อมูลและวิธีการ RLVR ทั้งหมดกระบวนการนี้เปิดกว้างสำหรับการศึกษาและทำซ้ำ

คำถามที่พบบ่อย (FAQ) เกี่ยวกับ Tülu 3

อะไรคือ Tülu 3 และคุณสมบัติหลักๆ ของมัน?

Tülu 3 เป็นครอบครัวของโมเดล LLM ที่เปิดกว้างที่พัฒนาโดย Allen AI โดยอาศัยโครงสร้าง Llama 3.1 มันมาในหลายขนาด (8B, 70B และ 405B parameter) และถูกออกแบบมาเพื่อเพิ่มประสิทธิภาพในการทำงานต่างๆ รวมถึงความรู้ การให้เหตุผล คณิตศาสตร์ การเขียนโค้ด การปฏิบัติตามคำสั่ง และความปลอดภัย

กระบวนการฝึกอบรม Tülu 3 คืออะไร และใช้ข้อมูลอะไร?

การฝึกอบรม Tülu 3 ประกอบด้วยหลายขั้นตอนสำคัญ ขั้นแรก ทีมงานจะรวบรวมชุดคำสั่งซึ่งมาจากทั้งแหล่งข้อมูลสาธารณะและข้อมูลสังเคราะห์ที่มุ่งเน้นไปที่ทักษะเฉพาะ โดยรับประกันว่าข้อมูลจะถูกทำให้ปราศจากข้อบกพร่องก่อนการประเมิน ต่อไป มีการฝึกอบรมแบบกำกับ (SFT) บนชุดข้อมูลที่ผสมผสานระหว่างการปฏิบัติตามคำสั่ง คณิตศาสตร์ และการเขียนโค้ด จากนั้นใช้การเพิ่มประสิทธิภาพความชอบโดยตรง (DPO) โดยใช้ข้อมูลความชอบที่สร้างขึ้นจากข้อเสนอแนะของมนุษย์และ LLM สุดท้าย ใช้การเรียนรู้แบบเสริมด้วยรางวัลที่สามารถตรวจสอบได้ (RLVR) สำหรับงานที่มีการวัดความถูกต้อง

วิธีการที่ Tülu 3 เข้าใกล้ความปลอดภัยและใช้มาตรการอะไรในการประเมิน?

ความปลอดภัยเป็นส่วนสำคัญของการพัฒนา Tülu 3 โดยมีการใช้ข้อมูลที่เกี่ยวข้องกับความปลอดภัยในช่วงการฝึกอบรมแบบกำกับ (SFT) ซึ่งพบว่าข้อมูลนี้มีลักษณะที่แตกต่างจากข้อมูลที่ใช้สำหรับงานอื่นๆ

อะไรคือ RLVR?

RLVR คือเทคนิคที่โมเดลจะถูกฝึกให้ปรับให้เหมาะสมกับรางวัลที่สามารถตรวจสอบได้ เช่น ความถูกต้องของคำตอบ ซึ่งเทคนิคนี้แตกต่างจากเทคนิคการเรียนรู้แบบเสริมด้วยรางวัลแบบเรียนรู้ (RLHF) ที่ใช้โมเดลรางวัล

Alex นำทีมการดำเนินงานข่าวสารที่ขับเคลื่อนด้วย AI ของ Unite.AI โดยผสานการทำข่าว, การวิจัย และระบบอัตโนมัติเพื่อสนับสนุนการครอบคลุมปัญญาประดิษฐ์อย่างทันท่วงทีและขยายได้ งานของเขาช่วยให้การพัฒนาปัญญาประดิษฐ์ที่กำลังเกิดขึ้นถูกนำเสนออย่างมีประสิทธิภาพในขณะที่ยังคงรักษามาตรฐานบรรณาธิการของสำนักพิมพ์.