ผู้นำทางความคิด
โมเดลเปิดยังคงพัฒนาอย่างต่อเนื่อง เศรษฐกิจก็ซับซ้อนมากขึ้น

โมเดล AI ชัดเจนว่าดีกว่าเมื่อ 18 เดือนที่แล้ว แต่เมื่อฉันเริ่มสำรวจลึกลงไป คำอธิบายทั่วไปสำหรับความก้าวหน้านั้นกลับไม่สอดคล้องกัน
พวกมันไม่ได้ดีขึ้นเพียงเพราะขนาดใหญ่ขึ้น “โอเพ่นซอร์สกำลังชนะ” เพียงครึ่งเดียวเท่านั้น และคำแนะนำให้ดูคะแนนเบนช์มาร์กกลับน้อยกว่าที่ฉันคาดคิดมาก สิ่งนั้นใช้เวลาฉันค่อนข้างนานจึงยอมรับได้
ดังนั้นฉันได้รวบรวม ข้อมูล 18 เดือนจาก 46 โมเดลจากแล็บแปดแห่ง ฉันต้องการเข้าใจว่า ปัญญากำลังกลายเป็นสินค้าโภคภัณฑ์หรือไม่ โมเดลเปิดกำลังตามทันขอบเขตหรือไม่ และบริษัทควรวัดอะไรเมื่อเลือกระบบที่จะพัฒนา
ข้อสรุปหลักง่าย ๆ คือ คะแนนเบนช์มาร์กไม่ได้เป็นคุณสมบัติของโมเดลโดยตรง มันสะท้อนถึงโมเดล ซอฟต์แวร์และบริบทโดยรอบ รวมถึงเวลาและพลังการคำนวณที่ให้ใช้ เผยแพร่ตัวเลขเดียวแล้วคุณก็ซ่อนข้อมูลสองส่วนที่เหลือไว้
ผลสรุปเหล่านี้แม้จะกว้างขวางกว่าที่คาดคิด บริษัทต่าง ๆ กำลังเปรียบเทียบโมเดลเดี่ยว ๆ ขณะที่ควรประเมินระบบทั้งหมดที่ต้องทำงาน
เบนช์มาร์กซ่อนระบบ
เมื่อฉันหยุดดูคะแนนรวมและเปรียบเทียบโมเดลตามการทดสอบ ความแตกต่างระหว่างโมเดลเปิด‑weight ชั้นนำกับโมเดลเชิงพาณิชย์ไม่ได้เป็นเพียงตัวเลขเดียวเลย
ใน SWE-bench Verified ซึ่งเป็นการทดสอบเก่าที่ปรากฏในประกาศโมเดลหลายครั้ง ความแตกต่างอยู่ที่ 0.2 คะแนน ใน SWE-bench Pro ซึ่งเป็นการทดสอบใหม่ที่ออกแบบสำหรับงานซอฟต์แวร์หลายภาษาที่เป็นจริงและมีการตั้งค่ามาตรฐาน ความแตกต่างอยู่ที่ 18.2 คะแนน
ช่องว่างของโมเดลที่เห็นได้ขึ้นอยู่กับเบนช์มาร์ก
| เบนช์มาร์ก | ช่องว่าง | สถานะ |
|---|---|---|
| SWE-bench Verified | 0.2 pts | อิ่มตัว, พบการปนเปื้อน |
| GPQA Diamond | 2.0 pts | อิ่มตัว, เพดานประมาณ 92–95% |
| Terminal-Bench 2.1 | 4.9 pts | ใช้งานจริง, มีการเป็นตัวแทน |
| Humanity’s Last Exam | 9.8 pts | ใช้งานจริง, การให้เหตุผลระดับขอบเขต |
| SWE-bench Pro | 18.2 pts | ใช้งานจริง, โครงสร้างมาตรฐาน |
แหล่งที่มา: การวิเคราะห์ของ Jaspreet Singh เกี่ยวกับโมเดลเปิด‑weight ชั้นนำและโมเดลเชิงพาณิชย์, กรกฎาคม 2026.
โมเดลเดียวกันอาจได้รับคะแนนที่ต่างกันขึ้นอยู่กับผู้ดำเนินการทดสอบ Kimi K3 ได้คะแนน 80.9% ใน Terminal-Bench 2.1 ในการประเมินอิสระและ 88.3% เมื่อผู้ผลิตรายงานผล การเปลี่ยนแปลง 7.4 คะแนนนี้ใหญ่กว่าช่องว่างระหว่างเปิดและขอบเขตในสามจากห้าเบนช์มาร์กที่ฉันวิเคราะห์
โมเดลรับคำสั่งผ่านซอฟต์แวร์โดยรอบ ใช้ประโยชน์จากบริบทที่ได้รับ เข้าถึงเครื่องมือที่มี และทำงานภายในงบประมาณการให้เหตุผลที่ผู้พัฒนากำหนด การเปลี่ยนแปลงเงื่อนไขเหล่านี้จะทำให้ผลลัพธ์เปลี่ยนไปตาม
เบนช์มาร์กสาธารณะมีประโยชน์ในการทำความเข้าใจทิศทางของความก้าวหน้า แต่ไม่เหมาะสมเป็นฐานในการตัดสินใจว่าอะไรจะทำงานได้ภายในบริษัทของคุณ
ความน่าเชื่อถือแบบตัวแทนเปลี่ยนสมการ
สิ่งนี้สำคัญยิ่งขึ้นเมื่อ AI ย้ายจากการตอบคำถามไปสู่การทำขั้นตอนต่อเนื่องหลายขั้นตอน
ลองพิจารณากระบวนการทำงานที่มี 20 ขั้นตอน โดย AI ทำแต่ละขั้นตอนได้ถูกต้อง 95% ของเวลา ฟังดูเชื่อถือได้ อย่างไรก็ตามเมื่อดูทั้งลำดับกระบวนการ ความสำเร็จทั้งหมดเพียง 36%
โมเดลที่ดีกว่าจะเพิ่มโอกาสในแต่ละขั้นตอน โดยเฉพาะงานที่เป็นตัวแทนที่ยากลำบาก การวิศวกรรมโดยรอบเป็นตัวกำหนดว่าขั้นตอนที่ผิดพลาดหนึ่งขั้นจะทำให้งานพังหรือไม่ การบันทึกความคืบหน้า การตรวจสอบผลลัพธ์ การลองใหม่อย่างปลอดภัย และการกู้คืนจากความล้มเหลวมักเป็นสิ่งที่แยกการสาธิตที่น่าเชื่อถือออกจากผลิตภัณฑ์ที่เชื่อถือได้
การเลือกโมเดลยังคงสำคัญ แต่โมเดลที่ได้คะแนนสูงสุดไม่ได้หมายความว่าจะสร้างระบบที่น่าเชื่อถือที่สุดโดยอัตโนมัติ
เลือกโมเดลตามงาน
ข้อมูลสนับสนุนข้อสรุปที่แคบกว่าที่ฝ่ายใดฝ่ายหนึ่งในข้อโต้แย้งระหว่างเปิดและเชิงพาณิชย์มักจะทำ
โมเดลเปิด‑weight มีความสามารถแข่งขันในงานที่กำหนดชัดเจนและระยะสั้นที่ผลลัพธ์สามารถวัดได้โดยตรง การจำแนกประเภท การสกัดข้อมูล การสรุป และการสร้างแบบโครงสร้างกำลังเข้ามาอยู่ในประเภทนี้มากขึ้น
โมเดลขอบเขตยังคงได้รับค่าพรีเมียมในงานที่ต้องทำเป็นตัวแทนระยะยาว ความสอดคล้องกับคำสั่งภายใต้ความกดดัน และงานที่ความล้มเหลวมีค่าใช้จ่ายสูงในการตรวจพบภายหลัง นั่นคือจุดที่เบนช์มาร์กใหม่แสดงช่องว่างใกล้ 18 คะแนน มากกว่าศูนย์ และที่ชั้นความปลอดภัยที่ผู้จำหน่ายโมเดลมอบให้มีคุณค่า
บริษัทควรเลือกโมเดลตามงาน แต่ไม่ควรสมมติว่าการเปลี่ยนแปลงเป็นเรื่องฟรี บริบท การให้เหตุผล และแคชของพรอมต์ไม่สามารถย้ายอย่างราบรื่นระหว่างผู้ให้บริการ โมเดลที่ถูกกว่ามาอาจกลายเป็นแพงกว่า หากการเปลี่ยนระบบทำให้ต้องเริ่มงานใหม่หรือเพิ่มชั้นของวิศวกรรมและการกำกับดูแล
การเลือกโมเดลกำลังกลายเป็นเรื่องที่ไม่ถาวร การเปลี่ยนแปลงยังคงเป็นการตัดสินใจเชิงสถาปัตยกรรม
เมื่อปัญญาเป็นเรื่องราคาถูกลง การตัดสินใจยังคงมีค่าใช้จ่ายสูง
ความสามารถทั่วไปที่มีประสิทธิภาพกำลังกลายเป็นสิ่งที่มีราคาต่ำอย่างมหาศาล อย่างไรก็ตาม ที่ระดับบนสุดของกราฟ แต่ละจุดประสิทธิภาพเพิ่มเติมจะมีค่าใช้จ่ายมากกว่าจุดก่อนหน้า จุดความสามารถสุดท้าย 9 จุดมีค่าใช้จ่ายประมาณสิบเท่าของสิ่งที่อยู่ด้านล่างทั้งหมด
บริษัทส่วนใหญ่ไม่จำเป็นต้องใช้โมเดลที่ทรงพลังที่สุดสำหรับทุกคำขอ แต่พวกเขาต้องรู้ว่างานใดสมควรได้รับมัน
การสรุป การสกัด การจัดประเภท การร่าง และการแปลกำลังมุ่งสู่ความสามารถเชิงประโยชน์ สิ่งที่ยังขาดแคลนคือการตัดสินใจ: รู้ว่าคำตอบที่เป็นไปได้ห้าข้อใดถูกต้อง สังเกตว่าคำถามผิดพลาด และตัดสินใจว่าเมื่อใดควรหยุดและขอความช่วยเหลือจากมนุษย์
การตัดสินใจมาจากบริบทที่เป็นกรรมสิทธิ์ กฎธุรกิจ กระบวนการทำงาน ความรู้เชิงประวัติศาสตร์ และวิศวกรรมที่ตรวจสอบงานและควบคุมความล้มเหลว
สร้างการประเมินที่ไม่มีใครสามารถดำเนินการได้
สำหรับองค์กร การวัดผลที่มีค่าที่สุดสร้างจากงานของตนเอง
สร้างชุดการประเมินส่วนตัวด้วยงานจริงจำนวน 50 ถึง 200 งานจากธุรกิจของคุณ คงระบบโดยรอบให้คงที่ ทำการทดสอบซ้ำหลายครั้ง และให้คะแนนว่าการทำงานสำเร็จถูกต้องหรือไม่ แทนที่จะประเมินว่าคำตอบฟังดูเรียบหรูแค่ไหน
ใช้หลักการเดียวกันกับต้นทุน ต้นทุนต่อโทเคนอาจทำให้เข้าใจผิดเมื่อโมเดลหนึ่งให้เหตุผลนานขึ้น ต้องการการลองใหม่หลายครั้ง หรือสร้างงานเพิ่มเติมให้ผู้ตรวจสอบมนุษย์ วัดต้นทุนต่อผลลัพธ์ที่ยอมรับได้แทน
เริ่มต้นด้วยจำนวนโมเดลที่น้อย จัดเส้นทางงานตั้งแต่ต้นของงานแทนการเปลี่ยนผู้ให้บริการกลางทาง นับภาระด้านความปลอดภัย การกำกับดูแล และการดำเนินงานของผู้ให้บริการแต่ละรายเพิ่มเติมพร้อมกับราคาที่โฆษณา
ตลาดจะยังคงผลิตผู้ชนะการวัดผลใหม่ ๆ อย่างต่อเนื่อง และบริษัทต่าง ๆ จะยังคงถูกล่อให้สร้างกลยุทธ์ AI ใหม่รอบ ๆ แต่ละผู้ชนะ วิธีที่ดีกว่าคือเลือกโมเดลตามงาน แล้วประเมินระบบทั้งหมดภายใต้เงื่อนไขที่ต้องทำงาน
การวัดผลที่ควรเป็นตัวขับเคลื่อนสถาปัตยกรรมของคุณคือการวัดผลที่บริษัทของคุณเท่านั้นที่สามารถดำเนินการได้












