โมเดลและแพลตฟอร์ม AI
เอไอของ Allen AI รุ่น Tülu 3 กลายเป็นคู่แข่งที่ไม่คาดคิดของ DeepSeek

ข่าวที่น่าตื่นเต้นยังคงมาไม่หยุด โมเดลของ DeepSeek ได้ท้าทายมาตรฐานใหม่และสร้างความสนใจอย่างมาก แต่สิ่งที่น่าสนใจเพิ่งเกิดขึ้นในด้านการวิจัย AI ที่น่าสนใจ
Allen AI ได้ปล่อยโมเดล Tülu 3 รุ่นใหม่ของตน และรุ่น 405B parameter ของโมเดลนี้ไม่เพียงแต่แข่งขันกับ DeepSeek แต่ยังสามารถเอาชนะได้ในบางด้าน
ลองมาดูรายละเอียดกัน
โมเดล Tülu 3 รุ่น 405B parameter จะต้องแข่งขันกับโมเดลที่มีประสิทธิภาพสูงอื่นๆ เช่น DeepSeek V3 ในหลายๆ ด้าน และเราจะเห็นประสิทธิภาพที่เทียบเท่าหรือเหนือกว่าในด้านต่างๆ เช่น การแก้ปัญหาทางคณิตศาสตร์ การเขียนโค้ด และการปฏิบัติตามคำสั่ง
และที่น่าสนใจคือ พวกเขายังใช้แนวทางที่เปิดกว้างในการพัฒนาโมเดล
พวกเขาทำให้กระบวนการฝึกอบรมที่สมบูรณ์ รวมถึงโค้ดและวิธีการเรียนรู้แบบเสริมใหม่ๆ ที่เรียกว่า Reinforcement Learning with Verifiable Rewards (RLVR) สามารถเข้าถึงได้
การพัฒนานี้ในช่วงไม่กี่สัปดาห์ที่ผ่านมาได้เปลี่ยนแปลงวิธีการพัฒนา AI ระดับสูงอย่างมาก เมื่อโมเดลที่เปิดกว้างสามารถเทียบเท่ากับโมเดลที่ปิดกว้างได้ มันจะเปิดโอกาสที่เคยถูกปิดกั้นไว้เบื้องหลังกำแพงขององค์กร
การรบทางเทคนิค
สิ่งที่ทำให้ Tülu 3 โดดเด่นคืออะไร มันมาจากกระบวนการฝึกอบรมที่ไม่เหมือนใครซึ่งประกอบด้วย 4 ระยะ
ลองมาดูว่า Allen AI สร้างโมเดลนี้ขึ้นมาได้อย่างไร
ระยะที่ 1: การเลือกข้อมูลเชิงกลยุทธ์
ทีมงานรู้ว่าคุณภาพของโมเดลเริ่มต้นจากคุณภาพของข้อมูล พวกเขารวมข้อมูลจากแหล่งต่างๆ เช่น WildChat และ Open Assistant พร้อมกับข้อมูลที่สร้างขึ้นเอง แต่สิ่งที่สำคัญคือ พวกเขาทำงานโดยไม่เพียงแต่รวบรวมข้อมูลเท่านั้น แต่ยังสร้างชุดข้อมูลที่มุ่งเน้นไปที่ทักษะเฉพาะ เช่น การให้เหตุผลทางคณิตศาสตร์และทักษะการเขียนโค้ด
ระยะที่ 2: การสร้างการตอบสนองที่ดีขึ้น
ในระยะที่สอง Allen AI มุ่งเน้นไปที่การสอนโมเดลให้มีทักษะเฉพาะ พวกเขาทำงานโดยการสร้างชุดข้อมูลฝึกอบรมที่แตกต่างกันสำหรับการทำคณิตศาสตร์ การเขียนโค้ด และงานทั่วไป โดยการทดสอบชุดข้อมูลเหล่านี้ซ้ำๆ พวกเขาสามารถเห็นได้อย่างชัดเจนว่าโมเดลมีศักยภาพในการทำอะไรได้บ้างในแต่ละด้าน
ระยะที่ 3: การเรียนรู้จาก比较
ที่นี่ Allen AI ได้แสดงให้เห็นถึงความสร้างสรรค์ พวกเขาสร้างระบบที่สามารถเปรียบเทียบการตอบสนองของ Tülu 3 กับโมเดลอื่นๆ ที่มีประสิทธิภาพสูงได้ทันที แต่พวกเขายังแก้ปัญหาหนึ่งที่ยังคงเป็นปัญหาใน AI ได้ ซึ่งก็คือ โมเดลมักจะเขียนคำตอบที่ยาวเพียงเพื่อให้ยาวขึ้น
วิธีการของพวกเขาโดยใช้ การเพิ่มประสิทธิภาพความชอบโดยตรงแบบปรับขนาดความยาว (DPO) ทำให้โมเดลเรียนรู้ที่จะให้คุณค่ากับคุณภาพมากกว่าปริมาณ
ผลลัพธ์? การตอบสนองของ Tülu 3 มีคุณภาพและเป็นไปตามวัตถุประสงค์
ระยะที่ 4: การนวัตกรรม RLVR
สิ่งนี้คือการผิดพลาดทางเทคนิคที่สมควรได้รับความสนใจ RLVR แทนที่โมเดลรางวัลแบบเรียนรู้โดยอาศัยการยืนยันเชิงวัตถุ
โดยทั่วไป โมเดล AI จะเรียนรู้ผ่านระบบโมเดลรางวัลที่ซับซ้อน ซึ่งเป็นเพียงการเดาเกี่ยวกับสิ่งที่ทำให้คำตอบดี แต่ Allen AI ได้เลือกเส้นทางที่แตกต่างด้วย RLVR
- โมเดลได้รับการให้ข้อเสนอแนะทันที: 10 คะแนนสำหรับคำตอบที่ถูกต้อง 0 สำหรับคำตอบที่ไม่ถูกต้อง
- ไม่มีพื้นที่สำหรับการให้คะแนนบางส่วนหรือการประเมินแบบคลุมเครือ
- การเรียนรู้มุ่งเน้นและแม่นยำ
- โมเดลเรียนรู้ที่จะให้ความสำคัญกับความถูกต้องมากกว่าการให้คำตอบที่ดูสมเหตุสมผลแต่ไม่ถูกต้อง
การดูเลข
รุ่น 405B parameter ของ Tülu 3 แข่งขันกับโมเดลที่ดีที่สุดในสนาม มาดูกันว่ามันโดดเด่นในด้านใดและหมายถึงอะไรสำหรับ AI ที่เปิดกว้าง
คณิตศาสตร์
Tülu 3 โดดเด่นในด้านการให้เหตุผลทางคณิตศาสตร์ที่ซับซ้อน ในการประเมินเช่น GSM8K และ MATH มันสามารถเทียบเท่ากับ DeepSeek ได้
โค้ด
ผลลัพธ์ของการเขียนโค้ดก็น่าประทับใจไม่แพ้กัน ขอบคุณการฝึกอบรม RLVR Tülu 3 สามารถเขียนโค้ดที่แก้ปัญหาได้อย่างมีประสิทธิภาพ
การปฏิบัติตามคำสั่งแบบแม่นยำ
ความสามารถของโมเดลในการปฏิบัติตามคำสั่งเป็นจุดแข็งหลัก มากกว่าการให้คำตอบที่ใกล้เคียงหรือทั่วไป Tülu 3 แสดงให้เห็นถึงความแม่นยำที่น่าประทับใจในการปฏิบัติตามคำสั่ง
การเปิดกล่องดำของการพัฒนา AI
Allen AI ได้ปล่อยโมเดลที่มีประสิทธิภาพสูงและกระบวนการฝึกอบรมที่สมบูรณ์
ทุกด้านของกระบวนการฝึกอบรมมีการบันทึกและสามารถเข้าถึงได้ ตั้งแต่วิธีการฝึกอบรม 4 ระยะไปจนถึงวิธีการเตรียมข้อมูลและวิธีการ RLVR ทั้งหมดกระบวนการนี้เปิดกว้างสำหรับการศึกษาและทำซ้ำ
คำถามที่พบบ่อย (FAQ) เกี่ยวกับ Tülu 3
อะไรคือ Tülu 3 และคุณสมบัติหลักๆ ของมัน?
Tülu 3 เป็นครอบครัวของโมเดล LLM ที่เปิดกว้างที่พัฒนาโดย Allen AI โดยอาศัยโครงสร้าง Llama 3.1 มันมาในหลายขนาด (8B, 70B และ 405B parameter) และถูกออกแบบมาเพื่อเพิ่มประสิทธิภาพในการทำงานต่างๆ รวมถึงความรู้ การให้เหตุผล คณิตศาสตร์ การเขียนโค้ด การปฏิบัติตามคำสั่ง และความปลอดภัย
กระบวนการฝึกอบรม Tülu 3 คืออะไร และใช้ข้อมูลอะไร?
การฝึกอบรม Tülu 3 ประกอบด้วยหลายขั้นตอนสำคัญ ขั้นแรก ทีมงานจะรวบรวมชุดคำสั่งซึ่งมาจากทั้งแหล่งข้อมูลสาธารณะและข้อมูลสังเคราะห์ที่มุ่งเน้นไปที่ทักษะเฉพาะ โดยรับประกันว่าข้อมูลจะถูกทำให้ปราศจากข้อบกพร่องก่อนการประเมิน ต่อไป มีการฝึกอบรมแบบกำกับ (SFT) บนชุดข้อมูลที่ผสมผสานระหว่างการปฏิบัติตามคำสั่ง คณิตศาสตร์ และการเขียนโค้ด จากนั้นใช้การเพิ่มประสิทธิภาพความชอบโดยตรง (DPO) โดยใช้ข้อมูลความชอบที่สร้างขึ้นจากข้อเสนอแนะของมนุษย์และ LLM สุดท้าย ใช้การเรียนรู้แบบเสริมด้วยรางวัลที่สามารถตรวจสอบได้ (RLVR) สำหรับงานที่มีการวัดความถูกต้อง
วิธีการที่ Tülu 3 เข้าใกล้ความปลอดภัยและใช้มาตรการอะไรในการประเมิน?
ความปลอดภัยเป็นส่วนสำคัญของการพัฒนา Tülu 3 โดยมีการใช้ข้อมูลที่เกี่ยวข้องกับความปลอดภัยในช่วงการฝึกอบรมแบบกำกับ (SFT) ซึ่งพบว่าข้อมูลนี้มีลักษณะที่แตกต่างจากข้อมูลที่ใช้สำหรับงานอื่นๆ
อะไรคือ RLVR?
RLVR คือเทคนิคที่โมเดลจะถูกฝึกให้ปรับให้เหมาะสมกับรางวัลที่สามารถตรวจสอบได้ เช่น ความถูกต้องของคำตอบ ซึ่งเทคนิคนี้แตกต่างจากเทคนิคการเรียนรู้แบบเสริมด้วยรางวัลแบบเรียนรู้ (RLHF) ที่ใช้โมเดลรางวัล












