ผู้นำทางความคิด

โมเดลเปิดยังคงพัฒนาอย่างต่อเนื่อง เศรษฐกิจก็ซับซ้อนมากขึ้น

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

โมเดล AI ชัดเจนว่าดีกว่าเมื่อ 18 เดือนที่แล้ว แต่เมื่อฉันเริ่มสำรวจลึกลงไป คำอธิบายทั่วไปสำหรับความก้าวหน้านั้นกลับไม่สอดคล้องกัน

พวกมันไม่ได้ดีขึ้นเพียงเพราะขนาดใหญ่ขึ้น “โอเพ่นซอร์สกำลังชนะ” เพียงครึ่งเดียวเท่านั้น และคำแนะนำให้ดูคะแนนเบนช์มาร์กกลับน้อยกว่าที่ฉันคาดคิดมาก สิ่งนั้นใช้เวลาฉันค่อนข้างนานจึงยอมรับได้

ดังนั้นฉันได้รวบรวม ข้อมูล 18 เดือนจาก 46 โมเดลจากแล็บแปดแห่ง ฉันต้องการเข้าใจว่า ปัญญากำลังกลายเป็นสินค้าโภคภัณฑ์หรือไม่ โมเดลเปิดกำลังตามทันขอบเขตหรือไม่ และบริษัทควรวัดอะไรเมื่อเลือกระบบที่จะพัฒนา

ข้อสรุปหลักง่าย ๆ คือ คะแนนเบนช์มาร์กไม่ได้เป็นคุณสมบัติของโมเดลโดยตรง มันสะท้อนถึงโมเดล ซอฟต์แวร์และบริบทโดยรอบ รวมถึงเวลาและพลังการคำนวณที่ให้ใช้ เผยแพร่ตัวเลขเดียวแล้วคุณก็ซ่อนข้อมูลสองส่วนที่เหลือไว้

ผลสรุปเหล่านี้แม้จะกว้างขวางกว่าที่คาดคิด บริษัทต่าง ๆ กำลังเปรียบเทียบโมเดลเดี่ยว ๆ ขณะที่ควรประเมินระบบทั้งหมดที่ต้องทำงาน

เบนช์มาร์กซ่อนระบบ

เมื่อฉันหยุดดูคะแนนรวมและเปรียบเทียบโมเดลตามการทดสอบ ความแตกต่างระหว่างโมเดลเปิด‑weight ชั้นนำกับโมเดลเชิงพาณิชย์ไม่ได้เป็นเพียงตัวเลขเดียวเลย

ใน SWE-bench Verified ซึ่งเป็นการทดสอบเก่าที่ปรากฏในประกาศโมเดลหลายครั้ง ความแตกต่างอยู่ที่ 0.2 คะแนน ใน SWE-bench Pro ซึ่งเป็นการทดสอบใหม่ที่ออกแบบสำหรับงานซอฟต์แวร์หลายภาษาที่เป็นจริงและมีการตั้งค่ามาตรฐาน ความแตกต่างอยู่ที่ 18.2 คะแนน

ช่องว่างของโมเดลที่เห็นได้ขึ้นอยู่กับเบนช์มาร์ก

เบนช์มาร์ก ช่องว่าง สถานะ
SWE-bench Verified 0.2 pts อิ่มตัว, พบการปนเปื้อน
GPQA Diamond 2.0 pts อิ่มตัว, เพดานประมาณ 92–95%
Terminal-Bench 2.1 4.9 pts ใช้งานจริง, มีการเป็นตัวแทน
Humanity’s Last Exam 9.8 pts ใช้งานจริง, การให้เหตุผลระดับขอบเขต
SWE-bench Pro 18.2 pts ใช้งานจริง, โครงสร้างมาตรฐาน

แหล่งที่มา: การวิเคราะห์ของ Jaspreet Singh เกี่ยวกับโมเดลเปิด‑weight ชั้นนำและโมเดลเชิงพาณิชย์, กรกฎาคม 2026.

โมเดลเดียวกันอาจได้รับคะแนนที่ต่างกันขึ้นอยู่กับผู้ดำเนินการทดสอบ Kimi K3 ได้คะแนน 80.9% ใน Terminal-Bench 2.1 ในการประเมินอิสระและ 88.3% เมื่อผู้ผลิตรายงานผล การเปลี่ยนแปลง 7.4 คะแนนนี้ใหญ่กว่าช่องว่างระหว่างเปิดและขอบเขตในสามจากห้าเบนช์มาร์กที่ฉันวิเคราะห์

โมเดลรับคำสั่งผ่านซอฟต์แวร์โดยรอบ ใช้ประโยชน์จากบริบทที่ได้รับ เข้าถึงเครื่องมือที่มี และทำงานภายในงบประมาณการให้เหตุผลที่ผู้พัฒนากำหนด การเปลี่ยนแปลงเงื่อนไขเหล่านี้จะทำให้ผลลัพธ์เปลี่ยนไปตาม

เบนช์มาร์กสาธารณะมีประโยชน์ในการทำความเข้าใจทิศทางของความก้าวหน้า แต่ไม่เหมาะสมเป็นฐานในการตัดสินใจว่าอะไรจะทำงานได้ภายในบริษัทของคุณ

ความน่าเชื่อถือแบบตัวแทนเปลี่ยนสมการ

สิ่งนี้สำคัญยิ่งขึ้นเมื่อ AI ย้ายจากการตอบคำถามไปสู่การทำขั้นตอนต่อเนื่องหลายขั้นตอน

ลองพิจารณากระบวนการทำงานที่มี 20 ขั้นตอน โดย AI ทำแต่ละขั้นตอนได้ถูกต้อง 95% ของเวลา ฟังดูเชื่อถือได้ อย่างไรก็ตามเมื่อดูทั้งลำดับกระบวนการ ความสำเร็จทั้งหมดเพียง 36%

โมเดลที่ดีกว่าจะเพิ่มโอกาสในแต่ละขั้นตอน โดยเฉพาะงานที่เป็นตัวแทนที่ยากลำบาก การวิศวกรรมโดยรอบเป็นตัวกำหนดว่าขั้นตอนที่ผิดพลาดหนึ่งขั้นจะทำให้งานพังหรือไม่ การบันทึกความคืบหน้า การตรวจสอบผลลัพธ์ การลองใหม่อย่างปลอดภัย และการกู้คืนจากความล้มเหลวมักเป็นสิ่งที่แยกการสาธิตที่น่าเชื่อถือออกจากผลิตภัณฑ์ที่เชื่อถือได้

การเลือกโมเดลยังคงสำคัญ แต่โมเดลที่ได้คะแนนสูงสุดไม่ได้หมายความว่าจะสร้างระบบที่น่าเชื่อถือที่สุดโดยอัตโนมัติ

เลือกโมเดลตามงาน

ข้อมูลสนับสนุนข้อสรุปที่แคบกว่าที่ฝ่ายใดฝ่ายหนึ่งในข้อโต้แย้งระหว่างเปิดและเชิงพาณิชย์มักจะทำ

โมเดลเปิด‑weight มีความสามารถแข่งขันในงานที่กำหนดชัดเจนและระยะสั้นที่ผลลัพธ์สามารถวัดได้โดยตรง การจำแนกประเภท การสกัดข้อมูล การสรุป และการสร้างแบบโครงสร้างกำลังเข้ามาอยู่ในประเภทนี้มากขึ้น

โมเดลขอบเขตยังคงได้รับค่าพรีเมียมในงานที่ต้องทำเป็นตัวแทนระยะยาว ความสอดคล้องกับคำสั่งภายใต้ความกดดัน และงานที่ความล้มเหลวมีค่าใช้จ่ายสูงในการตรวจพบภายหลัง นั่นคือจุดที่เบนช์มาร์กใหม่แสดงช่องว่างใกล้ 18 คะแนน มากกว่าศูนย์ และที่ชั้นความปลอดภัยที่ผู้จำหน่ายโมเดลมอบให้มีคุณค่า

บริษัทควรเลือกโมเดลตามงาน แต่ไม่ควรสมมติว่าการเปลี่ยนแปลงเป็นเรื่องฟรี บริบท การให้เหตุผล และแคชของพรอมต์ไม่สามารถย้ายอย่างราบรื่นระหว่างผู้ให้บริการ โมเดลที่ถูกกว่ามาอาจกลายเป็นแพงกว่า หากการเปลี่ยนระบบทำให้ต้องเริ่มงานใหม่หรือเพิ่มชั้นของวิศวกรรมและการกำกับดูแล

การเลือกโมเดลกำลังกลายเป็นเรื่องที่ไม่ถาวร การเปลี่ยนแปลงยังคงเป็นการตัดสินใจเชิงสถาปัตยกรรม

เมื่อปัญญาเป็นเรื่องราคาถูกลง การตัดสินใจยังคงมีค่าใช้จ่ายสูง

ความสามารถทั่วไปที่มีประสิทธิภาพกำลังกลายเป็นสิ่งที่มีราคาต่ำอย่างมหาศาล อย่างไรก็ตาม ที่ระดับบนสุดของกราฟ แต่ละจุดประสิทธิภาพเพิ่มเติมจะมีค่าใช้จ่ายมากกว่าจุดก่อนหน้า จุดความสามารถสุดท้าย 9 จุดมีค่าใช้จ่ายประมาณสิบเท่าของสิ่งที่อยู่ด้านล่างทั้งหมด

บริษัทส่วนใหญ่ไม่จำเป็นต้องใช้โมเดลที่ทรงพลังที่สุดสำหรับทุกคำขอ แต่พวกเขาต้องรู้ว่างานใดสมควรได้รับมัน

การสรุป การสกัด การจัดประเภท การร่าง และการแปลกำลังมุ่งสู่ความสามารถเชิงประโยชน์ สิ่งที่ยังขาดแคลนคือการตัดสินใจ: รู้ว่าคำตอบที่เป็นไปได้ห้าข้อใดถูกต้อง สังเกตว่าคำถามผิดพลาด และตัดสินใจว่าเมื่อใดควรหยุดและขอความช่วยเหลือจากมนุษย์

การตัดสินใจมาจากบริบทที่เป็นกรรมสิทธิ์ กฎธุรกิจ กระบวนการทำงาน ความรู้เชิงประวัติศาสตร์ และวิศวกรรมที่ตรวจสอบงานและควบคุมความล้มเหลว

สร้างการประเมินที่ไม่มีใครสามารถดำเนินการได้

สำหรับองค์กร การวัดผลที่มีค่าที่สุดสร้างจากงานของตนเอง

สร้างชุดการประเมินส่วนตัวด้วยงานจริงจำนวน 50 ถึง 200 งานจากธุรกิจของคุณ คงระบบโดยรอบให้คงที่ ทำการทดสอบซ้ำหลายครั้ง และให้คะแนนว่าการทำงานสำเร็จถูกต้องหรือไม่ แทนที่จะประเมินว่าคำตอบฟังดูเรียบหรูแค่ไหน

ใช้หลักการเดียวกันกับต้นทุน ต้นทุนต่อโทเคนอาจทำให้เข้าใจผิดเมื่อโมเดลหนึ่งให้เหตุผลนานขึ้น ต้องการการลองใหม่หลายครั้ง หรือสร้างงานเพิ่มเติมให้ผู้ตรวจสอบมนุษย์ วัดต้นทุนต่อผลลัพธ์ที่ยอมรับได้แทน

เริ่มต้นด้วยจำนวนโมเดลที่น้อย จัดเส้นทางงานตั้งแต่ต้นของงานแทนการเปลี่ยนผู้ให้บริการกลางทาง นับภาระด้านความปลอดภัย การกำกับดูแล และการดำเนินงานของผู้ให้บริการแต่ละรายเพิ่มเติมพร้อมกับราคาที่โฆษณา

ตลาดจะยังคงผลิตผู้ชนะการวัดผลใหม่ ๆ อย่างต่อเนื่อง และบริษัทต่าง ๆ จะยังคงถูกล่อให้สร้างกลยุทธ์ AI ใหม่รอบ ๆ แต่ละผู้ชนะ วิธีที่ดีกว่าคือเลือกโมเดลตามงาน แล้วประเมินระบบทั้งหมดภายใต้เงื่อนไขที่ต้องทำงาน

การวัดผลที่ควรเป็นตัวขับเคลื่อนสถาปัตยกรรมของคุณคือการวัดผลที่บริษัทของคุณเท่านั้นที่สามารถดำเนินการได้

ผู้ก่อตั้งและซีอีโอ Jaspreet Singh นำเสนอการผสมผสานของวิสัยทัศน์ผลิตภัณฑ์และประสบการณ์ระดับผู้จัดการทั่วไป และได้ทำให้ Druva กลายเป็นหนึ่งในบริษัทที่เติบโตเร็วที่สุดในอุตสาหกรรมการปกป้องและจัดการข้อมูลมูลค่าหลายพันล้านดอลลาร์. จิตวิญญาณผู้ประกอบการของเขาช่วยให้เขาเริ่มต้น Druva ด้วยตนเอง ซึ่งตอนนี้มีมูลค่ากว่า $2 พันล้านและได้รับความไว้วางใจจากบริษัทนับพันทั่วโลกที่อยู่ในแนวหน้าของการยอมรับยุคคลาวด์. ความเข้าใจตลาดและเทคโนโลยีของเขานำไปสู่การสร้างแพลตฟอร์มการปกป้องข้อมูลแบบคลาวด์เนทีฟแห่งแรก ซึ่งมอบโซลูชันเทคโนโลยีนวัตกรรมและโมเดลการใช้บริการที่เป็นเอกลักษณ์ ทำลายระบบเดิมของฮาร์ดแวร์และซอฟต์แวร์ที่ล้าสมัย.

ก่อนที่จะก่อตั้ง Druva Jaspreet เคยดำรงตำแหน่งสำคัญที่ Veritas และ Ensim Corp. นอกจากนี้เขายังถือสิทธิบัตรหลายรายการและมีปริญญาตรีสาขาวิทยาการคอมพิวเตอร์จาก Indian Institute of Technology, Guwahati.