โมเดลและแพลตฟอร์ม AI
Gemini 3.1 Pro ทำสถิติใหม่ด้านการให้เหตุผล
Google (GOOGL ) เปิดตัว Gemini 3.1 Pro เมื่อวันที่ 19 กุมภาพันธ์ โดยเป็นการอัปเดตโมเดล AI เรือธงที่เพิ่มประสิทธิภาพการใช้เหตุผลมากกว่าสองเท่า ขณะที่ยังคงราคาเท่ากับรุ่นก่อนหน้า
ตัวเลขที่โดดเด่นที่สุดคือคะแนน 77.1% บน ARC-AGI-2 ซึ่งเป็นเกณฑ์มาตรฐานที่ทดสอบว่าโมเดลสามารถแก้รูปแบบตรรกะใหม่ที่ไม่เคยพบมาก่อน แทนที่จะเพียงเรียกคืนข้อมูลจากชุดฝึกได้หรือไม่ ส่วน Gemini 3 Pro ทำได้ 31.1% การเพิ่มขึ้น 46 จุดเปอร์เซ็นต์นี้ถือเป็นการยกระดับความสามารถด้านการใช้เหตุผลระหว่างรุ่นครั้งใหญ่ที่สุดในบรรดาตระกูลโมเดลระดับแนวหน้า
โมเดลพร้อมใช้งานทันทีบนแพลตฟอร์มสำหรับผู้บริโภคและนักพัฒนาของ Google ผู้ใช้แอป Gemini ในแผน AI Pro และ AI Ultra จะได้สิทธิ์ใช้งานพร้อมขีดจำกัดที่สูงขึ้น ส่วนนักพัฒนาสามารถเข้าถึง 3.1 Pro ผ่าน Gemini API ใน AI Studio, Vertex AI, Gemini CLI, Antigravity และ Android Studio ขณะที่ NotebookLM ก็ได้รับการอัปเกรดสำหรับสมาชิก Pro และ Ultra เช่นกัน
ราคายังคงอยู่ที่ 2 ดอลลาร์ต่อโทเค็นอินพุตหนึ่งล้านรายการสำหรับพรอมต์ที่สั้นกว่า 200,000 โทเค็น และเพิ่มเป็น 4 ดอลลาร์สำหรับบริบทที่ยาวกว่านั้น ส่วนเอาต์พุตมีราคา 12 ดอลลาร์ต่อหนึ่งล้านโทเค็น ผู้ที่ใช้ Gemini 3 Pro ผ่าน API อยู่แล้วสามารถอัปเกรดได้โดยไม่มีค่าใช้จ่าย
ประสิทธิภาพเหนือกว่าในเกณฑ์มาตรฐานหลายด้าน
การ์ดโมเดล ระบุว่า Gemini 3.1 Pro ครองอันดับหนึ่งใน 12 จาก 18 เกณฑ์มาตรฐานที่ติดตาม นอกจาก ARC-AGI-2 แล้ว ผลลัพธ์เด่นยังรวมถึงคะแนน 94.3% บน GPQA Diamond ซึ่งทดสอบการใช้เหตุผลทางวิทยาศาสตร์ระดับบัณฑิตศึกษา และ 2,887 Elo บน LiveCodeBench Pro ซึ่งเป็นคะแนนสูงสุดในบรรดาโมเดลระดับแนวหน้าทั้งหมดสำหรับการเขียนโปรแกรมเชิงแข่งขัน
สำหรับ Humanity’s Last Exam ซึ่งรวบรวมคำถามจากผู้เชี่ยวชาญในสาขาวิชาต่าง ๆ Gemini 3.1 Pro ทำได้ 44.4% เพิ่มจาก 37.5% ของ Gemini 3 Pro และสูงกว่า 34.5% ของ GPT-5.2 ส่วนเกณฑ์ MMLU แบบหลายภาษาอยู่ที่ 92.6% และความแม่นยำเมื่อใช้บริบทยาว 128,000 โทเค็นยังคงอยู่ที่ 84.9%
โมเดลยังคงรองรับบริบทอินพุตหนึ่งล้านโทเค็นและสร้างเอาต์พุตได้สูงสุด 64,000 โทเค็น ซึ่งตรงกับข้อกำหนดของ เครื่องมือเขียนโค้ดด้วย AI ที่ต้องรับโค้ดทั้งฐานเข้ามาและสร้างบล็อกโค้ดขนาดใหญ่ภายในเซสชันเดียว
จุดที่ 3.1 Pro ยังไม่เป็นผู้นำก็น่าสนใจเช่นกัน บน SWE-Bench Verified ซึ่งทดสอบงานวิศวกรรมซอฟต์แวร์ในโลกจริง โมเดลทำได้ 80.6% ตามหลัง Claude Opus 4.6 ของ Anthropic ที่ 80.8% เพียงเล็กน้อย ช่องว่างแทบไม่มีนัยสำคัญ แต่แสดงให้เห็นว่า Anthropic ยังคงได้เปรียบเล็กน้อยในงานเขียนโค้ดเชิงปฏิบัติที่ผลักดันการใช้งานในองค์กร
การคิดแบบไดนามิกเปลี่ยนแปลงอะไร
Gemini 3.1 Pro ใช้การคิดแบบไดนามิกเป็นค่าเริ่มต้น โดยโมเดลจะปรับปริมาณการใช้เหตุผลภายในตามความซับซ้อนของพรอมต์แต่ละรายการ คำถามง่าย ๆ จะได้รับคำตอบอย่างรวดเร็ว ส่วนปัญหาซับซ้อนหลายขั้นตอนจะกระตุ้นกระบวนการคิดที่ลึกขึ้นก่อนสร้างคำตอบ
นักพัฒนาควบคุมพฤติกรรมนี้ได้ผ่านพารามิเตอร์ thinking_level ใน API ซึ่งใช้กำหนดระดับความลึกสูงสุดของการใช้เหตุผลภายใน วิธีนี้ช่วยแก้ความขัดแย้งสำคัญของโมเดลให้เหตุผล เพราะการคิดที่ยาวขึ้นเพิ่มความแม่นยำในปัญหายาก แต่ก็เพิ่มเวลาแฝงและต้นทุนสำหรับคำถามตรงไปตรงมา การคิดแบบไดนามิกพยายามทำให้การแลกเปลี่ยนระหว่างสองด้านนี้เป็นอัตโนมัติ
คุณสมบัติดังกล่าวสะท้อนการเปลี่ยนแปลงในอุตสาหกรรมโดยรวม โมเดลตระกูล o ของ OpenAI เปิดตัวการใช้เหตุผลแบบสายโซ่ความคิดในฐานะโหมดที่เลือกได้ ส่วน Claude ของ Anthropic ให้การคิดแบบขยายเป็นตัวเลือก แนวทางของ Google คือเปิดใช้เป็นค่าเริ่มต้นและปรับความเข้มตามโจทย์ โดยเดิมพันว่าผู้ใช้ส่วนใหญ่ต้องการให้โมเดลตัดสินใจเองว่าควรคิดหนักเพียงใด มากกว่าจะต้องจัดการการตัดสินใจนั้นด้วยตนเอง
การแข่งขันยิ่งสูสี
Gemini 3.1 Pro เข้าสู่ตลาดที่ตำแหน่งผู้นำด้านเกณฑ์มาตรฐานเปลี่ยนมือแทบทุกเดือน Gemini 3 ของ Google เคยทำให้ OpenAI ประกาศ “ภาวะฉุกเฉินระดับแดง” และเปิดตัว GPT-5.2 ภายในเวลาไม่ถึงหนึ่งเดือน ขณะที่ Anthropic ก็เร่งออกอัปเดต Claude อย่างต่อเนื่อง โมเดลแต่ละรุ่นทำให้ช่องว่างแคบลง จนการเลือกระหว่างแพลตฟอร์มขึ้นอยู่กับระบบนิเวศและราคามากกว่าความสามารถดิบมากขึ้นเรื่อย ๆ
ข้อได้เปรียบของ Google ยังคงเป็นการกระจายผลิตภัณฑ์ Gemini 3.1 Pro เชื่อมเข้าสู่บริการที่ผู้คนหลายร้อยล้านคนใช้อยู่แล้วโดยตรง ได้แก่ Gmail, Docs, Search และคุณสมบัติ Personal Intelligence ที่เชื่อมโมเดลกับข้อมูลส่วนตัวของผู้ใช้ นอกจากนี้ โมเดลยังขับเคลื่อน Gemini Enterprise และ Gemini CLI ทำให้นักพัฒนาและธุรกิจเข้าถึงได้ผ่านเครื่องมือที่ใช้อยู่แล้ว
สำหรับนักพัฒนาที่กำลังเลือกระหว่างโมเดลแนวหน้า การตัดสินใจด้านราคาง่ายขึ้น ที่ 2 ดอลลาร์ต่อโทเค็นอินพุตหนึ่งล้านรายการ Gemini 3.1 Pro มีราคาต่ำกว่าโมเดลเรือธงของทั้ง OpenAI และ Anthropic ที่มีความสามารถใกล้เคียงกัน และการอัปเกรดจาก 3 Pro โดยไม่มีค่าใช้จ่ายก็ขจัดอุปสรรคในการย้ายระบบสำหรับผู้ใช้เดิม
ความก้าวหน้าด้านการใช้เหตุผลสำคัญที่สุดต่อแอปพลิเคชันแบบเอเจนต์ ซึ่งเป็นระบบ AI ที่วางแผน ปฏิบัติงานหลายขั้นตอน และใช้เครื่องมือได้โดยอัตโนมัติ ARC-AGI-2 ทดสอบการจดจำรูปแบบใหม่ในลักษณะที่เอเจนต์ต้องใช้เมื่อพบปัญหาซึ่งไม่มีอยู่ในข้อมูลฝึกโดยเฉพาะ โมเดลที่ได้ 77.1% ในการทดสอบนี้ย่อมรับมือสถานการณ์ที่ไม่คุ้นเคยได้อย่างน่าเชื่อถือกว่าโมเดลที่ได้ 31.1% มาก
คำถามที่ Google ต้องตอบในช่วงไม่กี่สัปดาห์ข้างหน้าคือ ความก้าวหน้าในเกณฑ์มาตรฐานเหล่านี้จะกลายเป็นการปรับปรุงในโลกจริงในสัดส่วนเดียวกันหรือไม่ เกณฑ์มาตรฐานวัดความสามารถเฉพาะภายใต้เงื่อนไขควบคุม แต่ประสบการณ์จริงขึ้นอยู่กับประสิทธิภาพของโมเดลในงานหลากหลายและคาดเดาไม่ได้ที่ผู้ใช้มอบให้ การเพิ่มขึ้นอย่างมากบน ARC-AGI-2 บ่งชี้ว่า 3.1 Pro จัดการความแปลกใหม่ได้ดีกว่าโมเดลก่อนหน้า ส่วนสิ่งที่ผู้ใช้นำความสามารถนั้นไปทำจะเป็นตัวตัดสินว่าตัวเลขเหล่านี้มีความหมายเพียงใด












