โมเดลและแพลตฟอร์ม AI
จากเมダลเงินสู่เมダลทอง: วิธีการที่ DeepMind เอไอเอาชนะการแข่งขันคณิตศาสตร์โอลิมปิกระดับนานาชาติ

เอไอของ DeepMind ได้ทำความก้าวหน้าอย่างน่าประทับใจในการให้เหตุผลทางคณิตศาสตร์ภายในระยะเวลาเพียงหนึ่งปี หลังจากได้รับเหรียญเงินในการแข่งขันคณิตศาสตร์โอลิมปิกระดับนานาชาติ (IMO) ในปี 2024 ระบบเอไอของพวกเขาก็ได้เหรียญทองในปี 2025 การก้าวหน้าอย่างรวดเร็วนี้เน้นย้ำถึงความสามารถที่เพิ่มขึ้นของปัญญาประดิษฐ์ในการแก้ปัญหาที่ซับซ้อนและที่ต้องใช้ความคิดสร้างสรรค์และความเข้าใจแบบมนุษย์ บทความนี้จะพาไปสัมผัสกับวิธีการที่ DeepMind ประสบความสำเร็จ การตัดสินใจทางเทคนิคและยุทธวิธีที่อยู่เบื้องหลัง และผลกระทบในวงกว้างของความก้าวหน้าเหล่านี้
ความสำคัญของ IMO
การแข่งขันคณิตศาสตร์โอลิมปิกระดับนานาชาติ ซึ่งก่อตั้งขึ้นในปี 1959 เป็นที่รู้จักในระดับโลกว่าเป็นการแข่งขันคณิตศาสตร์ที่สำคัญที่สุดสำหรับนักเรียนมัธยมศึกษา ทุกๆ ปี นักเรียนที่มีผลการเรียนดีที่สุดจากทั่วโลกจะเผชิญกับปัญหาที่ท้าทายทั้ง 6 ข้อ ซึ่งครอบคลุมด้านพีชคณิต,เรขาคณิต,ทฤษฎีจำนวน และทฤษฎีการนับ การแก้ปัญหาเหล่านี้ต้องใช้มากกว่าการคำนวณ; ผู้เข้าแข่งขันต้องแสดงให้เห็นถึงความคิดสร้างสรรค์ทางคณิตศาสตร์ที่แท้จริง การคิดเชิงตรรกะอย่างเข้มงวด และความสามารถในการสร้างการพิสูจน์ที่สวยงาม
สำหรับปัญญาประดิษฐ์ การแข่งขันคณิตศาสตร์โอลิมปิกระดับนานาชาตินี้เป็นความท้าทายที่ไม่เหมือนใคร ในขณะที่เอไอได้ทำความก้าวหน้าในการรับรู้รูปแบบ การวิเคราะห์ข้อมูล และแม้กระทั่งเกมที่ซับซ้อนเช่น Go และหมากรุก คณิตศาสตร์โอลิมปิกต้องการการให้เหตุผลเชิงสร้างสรรค์และการให้เหตุผลที่เป็นนามธรรม ซึ่งเป็นทักษะที่ถือว่าเป็นลักษณะของปัญญาแบบมนุษย์ ดังนั้น การแข่งขันคณิตศาสตร์โอลิมปิกระดับนานาชาติจึงกลายเป็นสถานที่ทดสอบที่เหมาะสมสำหรับการประเมินว่าเอไอใกล้จะบรรลุถึงการให้เหตุผลแบบมนุษย์มากเพียงใด
การผงาดขึ้นสู่เหรียญเงินในปี 2024
ในปี 2024 DeepMind ได้นำระบบเอไอสองระบบมาแข่งขันปัญหาในระดับ IMO ได้แก่ AlphaProof และ AlphaGeometry 2 ทั้งสองระบบเป็นตัวอย่างของ “neuro-symbolic” เอไอ ซึ่งรวมความแข็งแกร่งของโมเดลภาษาขนาดใหญ่ (LLM) เข้ากับความเข้มงวดของตรรกะสัญลักษณ์
AlphaProof ได้รับการออกแบบมาเพื่อพิสูจน์ข้อความทางคณิตศาสตร์โดยใช้ Lean ซึ่งเป็นภาษาคณิตศาสตร์แบบเป็นทางการ มันรวม Gemini ซึ่งเป็นโมเดลภาษาขนาดใหญ่ของ DeepMind เข้ากับ AlphaZero ซึ่งเป็นเครื่องมือการเรียนรู้แบบเสริมที่มีชื่อเสียงในการเล่นเกมกระดาน ในบริบทนี้ Gemini มีหน้าที่แปลปัญหาจากภาษาธรรมชาติเป็น Lean และพยายามพิสูจน์โดยการสร้างขั้นตอนเชิงตรรกะ AlphaProof ได้รับการฝึกฝนจากปัญหาหลายล้านข้อที่ครอบคลุมสาขาคณิตศาสตร์ต่างๆ และระดับความยากต่างๆ ระบบได้ปรับปรุงตัวเองโดยพยายามพิสูจน์ข้อความที่ซับซ้อนมากขึ้น ซึ่งคล้ายกับวิธีที่ AlphaZero เรียนรู้โดยการเล่นเกมกับตัวเอง
AlphaGeometry 2 ได้รับการออกแบบมาเพื่อแก้ปัญหาเรขาคณิต โดยที่ Gemini ช่วยให้เอไอสามารถคาดการณ์การก่อสร้างที่มีประโยชน์ ในขณะที่เครื่องมือการให้เหตุผลสัญลักษณ์จัดการการอนุมานเชิงตรรกะ วิธีการแบบผสมผสานนี้ทำให้ AlphaGeometry สามารถแก้ปัญหาเรขาคณิตที่อยู่นอกขอบเขตของการให้เหตุผลของเครื่องจักรแบบดั้งเดิม
ทั้งสองระบบได้แก้ปัญหา 4 ใน 6 ข้อของ IMO ได้แก่ 2 ข้อในพีชคณิต 1 ข้อในทฤษฎีจำนวน และ 1 ข้อในเรขาคณิต โดยได้คะแนน 28 จาก 42 คะแนน การแสดงผลนี้เป็น 里程碑ที่สำคัญ เนื่องจากเป็นครั้งแรกที่เอไอได้ บรรลุ ระดับเหรียญเงินในการแข่งขันคณิตศาสตร์โอลิมปิกระดับนานาชาติ อย่างไรก็ตาม ความสำเร็จนี้ขึ้นอยู่กับการแปลปัญหาโดยผู้เชี่ยวชาญ และต้องใช้ทรัพยากรการคำนวณขนาดใหญ่ซึ่งใช้เวลาหลายวันในการประมวลผลแต่ละปัญหา
นวัตกรรมทางเทคนิคเบื้องหลังเหรียญทอง
การเปลี่ยนแปลงของ DeepMind จากเหรียญเงินเป็นเหรียญทองได้รับแรงผลักดันจากความก้าวหน้าทางเทคนิคที่สำคัญหลายประการ
1. ภาษาธรรมชาติเป็นช่องทางในการพิสูจน์
การเปลี่ยนแปลงที่สำคัญที่สุดคือการเปลี่ยนจากระบบที่ต้องการการแปลโดยผู้เชี่ยวชาญเป็นภาษาคณิตศาสตร์แบบเป็นทางการไปสู่การรักษาภาษาธรรมชาติเป็นช่องทางในการพิสูจน์ การเปลี่ยนแปลงนี้ได้รับการบรรลุผ่านรุ่นที่ได้รับการปรับปรุงของ Gemini ที่มี ความสามารถ Deep Think แทนที่จะแปลงปัญหาเป็น Lean โมเดลจะประมวลผลข้อความโดยตรง สร้างภาพวาดที่ไม่เป็นทางการภายใน สร้างรูปแบบการให้เหตุผลที่สำคัญ และสร้างการให้เหตุผลที่มีการปรับปรุงในรูปแบบภาษาอังกฤษ การเรียนรู้แบบเสริมจากคำติชมของมนุษย์ (RLHF) ถูกใช้เพื่อรางวัลสำหรับวิธีแก้ปัญหาที่มีการให้เหตุผลที่สอดคล้องกัน สั้น และนำเสนอ
Gemini Deep Think แตกต่างจากรุ่นสำหรับประชาชนทั่วไปในสองด้านหลัก ประการแรก มันจัดสรรหน้าต่างบริบทที่ยาวขึ้นและโทเค็นการคำนวณที่มากขึ้นต่อคำถาม ซึ่งช่วยให้โมเดลสามารถรักษาเส้นทางการคิดที่ยาวหลายหน้าได้ ประการที่สอง มันใช้การให้เหตุผลแบบขนาน โดยที่เส้นทางการคิดที่เก็งกำไรหลายร้อยเส้นทางถูกสร้างขึ้นสำหรับวิธีแก้ปัญหาที่แตกต่างกัน ผู้ดูแลแบบเบาที่น้ำหนักแล้วจัดอันดับและส่งเสริมเส้นทางที่มีแนวโน้มมากที่สุด โดยยืมแนวคิดจาก การค้นหาต้นไม้แบบมอนติคาร์โล แต่ถูกนำไปใช้กับข้อความ ซึ่งเลียนแบบวิธีการที่ทีมมนุษย์สร้างความคิด พิจารณาและละทิ้งความคิดที่ไม่มีประสิทธิภาพ และรวมกันเป็นแนวทางแก้ไขที่สวยงาม
2. การฝึกอบรมและการเรียนรู้แบบเสริม
การฝึกอบรม Gemini Deep Think เกี่ยวข้องกับการปรับโมเดลให้สามารถคาดการณขั้นตอนต่อไปได้ แทนที่จะตอบคำถามสุดท้าย สำหรับจุดประสงค์นี้ ได้มีการรวบรวมข้อมูลชุดใหญ่ของวิธีแก้ปัญหา 100,000 ข้อที่มีคุณภาพสูงจากการแข่งขันคณิตศาสตร์โอลิมปิกและข้อสอบระดับมหาวิทยาลัย ชุดข้อมูลนี้ส่วนใหญ่ถูกเก็บจากฟอรัมคณิตศาสตร์แบบเปิด arXiv และชุดปัญหาจากมหาวิทยาลัย ผู้เชี่ยวชาญได้ตรวจสอบตัวอย่างการฝึกอบรมเพื่อลองกรองการให้เหตุผลที่ไม่ถูกต้องหรือไม่สมบูรณ์ การเรียนรู้แบบเสริมช่วยให้โมเดลได้รับการปรับปรุง โดยผลักดันให้โมเดลสร้างการให้เหตุผลที่สั้นและแม่นยำ
ไม่เหมือนกับการปรับให้เหมาะสมแบบดั้งเดิม ซึ่งมักจะดิ้นรนในการจัดการรางวัลที่กระจายโดยที่คำติชมเป็นแบบทวินาม (การให้เหตุผลถูกต้องหรือไม่) DeepMind ได้ใช้ระบบรางวัลแบบขั้นตอน โดยที่แต่ละส่วนย่อยที่ได้รับการยืนยันจะช่วยให้ได้คะแนนรวม การจัดการรางวัลนี้ช่วยให้ Gemini มุ่งเน้นไปที่การสร้างการให้เหตุผลแม้ว่าการพิสูจน์แบบสมบูรณ์จะไม่เกิดขึ้นบ่อยนัก การฝึกอบรมใช้เวลาประมาณสามเดือนและใช้เวลาประมวลผล TPU ประมาณ 25 ล้านชั่วโมง
3. การขนานกันขนาดใหญ่
การขนานกันขนาดใหญ่ยังเป็นปัจจัยสำคัญในการก้าวหน้าของ DeepMind จากเหรียญเงินไปสู่เหรียญทอง แต่ละปัญหาได้สร้างสาขาการให้เหตุผลที่ขนานกัน โดยทรัพยากรจะถูกย้ายไปสู่แนวทางที่มีแนวโน้มมากขึ้นเมื่อทางอื่นหยุดชะงัก การจัดตารางแบบไดนามิกนี้มีประโยชน์อย่างมากสำหรับปัญหาทางทฤษฎีการนับ ซึ่งมีพื้นที่โซลูชันที่กว้างใหญ่ วิธีการนี้คล้ายกับวิธีที่มนุษย์ทดสอบความไม่เท่าเทียมกันที่ช่วยเหลือก่อนที่จะดำเนินการต่อการอุปนัยที่สมบูรณ์ แม้ว่าวิธีการนี้จะใช้ทรัพยากรการคำนวณมาก แต่ก็สามารถจัดการได้ด้วยคลัสเตอร์ TPU v5 ของ DeepMind
DeepMind ที่ IMO 2025
เพื่อรักษาความสมบูรณ์ของการแข่งขัน DeepMind ได้ทำการแช่ระบบโมเดลสามสัปดาห์ก่อนการแข่งขันเพื่อป้องกันไม่ให้ปัญหาอย่างเป็นทางการรั่วไหลเข้าสู่ชุดฝึกอบรม นอกจากนี้ยังกรองข้อมูลที่มีคำตอบสำหรับคำถามที่ไม่ได้รับการเผยแพร่
ระหว่างการแข่งขัน Gemini Deep Think ได้รับปัญหา 6 ข้ออย่างเป็นทางการในรูปแบบข้อความธรรมดา โดยไม่ได้รับอนุญาตให้เข้าถึงอินเทอร์เน็ต ระบบทำงานบนคลัสเตอร์ที่ตั้งค่าให้เลียนแบบกำลังการประมวลผลของแล็ปท็อปมาตรฐานต่อกระบวนการ กระบวนการแก้ปัญหาเสร็จสมบูรณ์ในเวลาไม่ถึงสามชั่วโมง ซึ่งอยู่ภายในข้อจำกัดเวลา การพิสูจน์ที่สร้างขึ้นถูกส่งไปยังผู้ประสานงานการแข่งขันโดยไม่มีการเปลี่ยนแปลง
Gemini Deep Think ได้คะแนนสมบูรณ์จาก 5 ใน 6 ปัญหา ปัญหา cuốiที่เป็นปัญหาเชิงผสมที่ท้าทายซึ่งทำให้ทั้งเอไอและ 94% ของผู้เข้าแข่งขันมนุษย์หยุดชะงัก ไม่เช่นนั้น เอไอจะจบด้วยคะแนนรวม 35/42 เพื่อรับเหรียญทอง คะแนนนี้สูงกว่าผลงานเหรียญเงินในปีก่อนหน้านี้ถึง 7 คะแนน ผู้สังเกตการณ์ภายหลังได้อธิบายว่าการพิสูจน์ของเอไอเป็น “ดiligent” และ “complete” โดยสังเกตว่ามีการให้เหตุผลอย่างเข้มงวดตามที่คาดหวังจากผู้เข้าแข่งขันมนุษย์
ผลกระทบต่อเอไอและคณิตศาสตร์
ความสำเร็จของ DeepMind เป็น 里程碑ที่สำคัญทั้งสำหรับเอไอและคณิตศาสตร์ สำหรับเอไอ การเอาชนะการแข่งขันคณิตศาสตร์โอลิมปิกระดับนานาชาติเป็นขั้นตอนหนึ่งในการบรรลุปัญญาประดิษฐ์ทั่วไป (AGI) โดยที่ระบบสามารถทำงานใดๆ ก็ได้ที่มนุษย์สามารถทำได้ การแก้ปัญหาคณิตศาสตร์ที่ซับซ้อนจำเป็นต้องมีการให้เหตุผลและการเข้าใจ ซึ่งเป็นส่วนประกอบพื้นฐานของความฉลาดทั่วไป ความสำเร็จนี้บ่งชี้ว่าเอไイกำลังทำความก้าวหน้าในการพัฒนาความสามารถทางปัญญาแบบมนุษย์
สำหรับคณิตศาสตร์ ระบบเอไอเช่น Gemini Deep Think สามารถเป็นเครื่องมือที่มีคุณค่าสำหรับนักคณิตศาสตร์ พวกเขาสามารถช่วยในการสำรวจพื้นที่ใหม่ การตรวจสอบสมมติฐาน และแม้กระทั่งการค้นพบทฤษฎีใหม่ โดยการทำให้กระบวนการสร้างการให้เหตุผลเป็นแบบอัตโนมัติ เอไอจะช่วยให้นักคณิตศาสตร์สามารถมุ่งเน้นไปที่งานเชิงแนวคิดระดับสูงได้ นอกจากนี้ เทคนิคที่พัฒนาสำหรับระบบเอไอเหล่านี้อาจสร้างแรงบันดาลใจให้เกิดวิธีการใหม่ๆ ในการวิจัยคณิตศาสตร์ที่อาจไม่สามารถทำได้ด้วยความพยายามของมนุษย์เท่านั้น
อย่างไรก็ตาม ความก้าวหน้าของเอไอในคณิตศาสตร์ยังทำให้เกิดคำถามเกี่ยวกับบทบาทของเอไอในสถานศึกษาและการแข่งขัน เมื่อความสามารถของเอไอเติบโตต่อไป จะมีการถกเถียงเกี่ยวกับว่าเอไอจะเปลี่ยนแปลงลักษณะของการศึกษาคณิตศาสตร์และการแข่งขันอย่างไร
มองไปข้างหน้า
การชนะเหรียญทองในการแข่งขันคณิตศาสตร์โอลิมปิกระดับนานาชาติเป็น 里程碑ที่สำคัญ แต่ยังมีปัญหาและความท้าทายทางคณิตศาสตร์อีกมากมายที่ระบบเอไイในปัจจุบันยังไม่สามารถแก้ไขได้ อย่างไรก็ตาม การก้าวหน้าอย่างรวดเร็วจากเหรียญเงินไปสู่เหรียญทองในเวลาเพียงหนึ่งปีเน้นย้ำถึงความเร็วที่เพิ่มขึ้นของนวัตกรรมและพัฒนาการของเอไอ หากความก้าวหน้านี้ดำเนินต่อไป ระบบเอไออาจจะสามารถแก้ปัญหาที่มีชื่อเสียงที่ยังไม่ได้รับการแก้ไขในคณิตศาสตร์ได้ในไม่ช้า แม้ว่าคำถามเกี่ยวกับว่าเอไอจะแทนที่หรือเพิ่มความสร้างสรรค์ของมนุษย์ยังคงไม่ได้รับการตอบสนอง แต่การแข่งขันคณิตศาสตร์โอลิมปิกระดับนานาชาติปี 2025 เป็นตัวอย่างที่ชัดเจนว่าเอไイได้ทำความก้าวหน้าอย่างมีนัยสำคัญในการให้เหตุผลเชิงตรรกะ












