มุมมองของ Anderson
รหัสมนุษย์จากปี 2020 ถูกทำลายโดยเอเย่นต์ที่เข้ารหัสสัญชาติในการทดสอบเอเย่นต์

ChatGPT และเครื่องมือเข้ารหัสสัญชาติอื่นๆ ถูกทดสอบในเกือบ 40,000 นัด – และแพ้ให้กับรหัสที่เขียนโดยนักเรียนระดับบัณฑิตศึกษาในปี 2020 ก่อนที่จะคิดค้นโมเดลภาษาขนาดใหญ่
ในงานวิจัยใหม่จากสหราชอาณาจักร นักวิจัยได้แข่งขันเอเย่นต์ที่เขียนด้วยมือมนุษย์กับเอเย่นต์ที่เข้ารหัสสัญชาติ โดยใช้โมเดลภาษาขนาดใหญ่ (LLMs) เช่น ChatGPT-5 และ Claude และพบว่าเอเย่นต์ที่สร้างขึ้นโดยไม่ได้รับความช่วยเหลือจาก AI สามารถเอาชนะเอเย่นต์ที่ได้รับการช่วยเหลือจาก AI ได้อย่างง่ายดาย
ทั้งสองชุดของเอเย่นต์ถูกสร้างขึ้นโดยนักเรียนจากห้องปฏิบัติการปัญญาประดิษฐ์ของสถาบันเทคโนโลยีแห่งสหพันธรัฐสวิส เอเย่นต์ที่ไม่ใช่ AI ถูกสร้างขึ้นเป็นส่วนหนึ่งของหลักสูตรในปี 2020 สองปีก่อนที่จะเริ่มใช้ ChatGPT และการปฏิวัติของ LLMs ในขณะที่เอเย่นต์ใหม่ถูกสร้างขึ้นโดยนักเรียนในปัจจุบัน โดยได้รับความช่วยเหลือจาก LLMs ที่ดีที่สุดและล่าสุด
แม้ว่าจะมีการจัดเกมให้เอเย่นต์ที่เข้ารหัสสัญชาติ แต่พวกเขาก็ไม่สามารถชนะได้ และอันดับห้าอันดับแรกถูกครอบครองโดยเอเย่นต์ “ดิบ” โดยมีเอเย่นต์ LLM ส่วนใหญ่ (33 ใน 40) ถูกเอเย่นต์ “ง่าย” ที่มีประสิทธิภาพต่ำกว่าเอาชนะได้อย่างง่ายดาย ใน 38,304 การท้าทายใน 12 ทัวร์นาเมนต์
งานวิจัยระบุว่า:
‘งานของเราชี้ให้เห็นว่าในขณะที่ LLMs ที่มีคุณภาพสูงสุดสามารถสร้างรหัสที่ทำงานได้ (เช่น ไม่มีข้อผิดพลาดทางไวยากรณ์) แต่รหัสที่สร้างขึ้นนั้นไม่แข่งขันกับการออกแบบโดยมนุษย์ ในด้านเช่นการวางแผนเชิงกลยุทธ์ การเพิ่มประสิทธิภาพ หรือการแข่งขันหลายเอเย่นต์’
‘ดังนั้น งานนี้จึงนำพาเราไปสู่แนวหน้าใหม่ในการสร้างรหัส และมีจุดมุ่งหมายเพื่ออำนวยความสะดวกในการพัฒนาเครื่องมือ การสร้างข้อมูล และการสร้างแบบจำลองที่เปิดกว้างซึ่งเน้นการสร้างรหัสที่ขับเคลื่อนด้วยเหตุผล’
การท้าทายที่ถูกออกแบบมาเพื่อให้เอเย่นต์เข้าร่วมการประมูลในหลายๆ วิธี และจัดลำดับการจัดส่งสินค้าที่ชนะให้กับผู้ชนะ
ผู้เขียนระบุว่า LLMs ที่ใช้ในการทดสอบ ได้แก่ GPT-5 Thinking, Gemini 2.5 Pro, Claude Opus 4.1 และ DeepSeek R1*
งานวิจัยใหม่ ใหม่ มีชื่อเรื่อง Can Vibe Coding Beat Graduate CS Students? An LLM vs. Human Coding Tournament on Market-driven Strategic Planning และมาจากผู้เขียนหนึ่งคนจาก University of Southampton และอีกคนจาก University of Oxford และ Alan Turing Institute
วิธีการ
ผู้เขียนระบุว่าการทดสอบแบบดั้งเดิมในด้านนี้มุ่งเน้นไปที่ความท้าทายที่มีวิธีแก้ปัญหาแบบไบนารี่ที่ชัดเจน (ถูกต้อง หรือ ไม่ถูกต้อง) ที่ตรวจสอบโดย การทดสอบหน่วย โดยโต้แย้งว่านี่ไม่ใช่วิธีที่เหมาะสมในการสำรวจข้อจำกัดของ LLMs ที่ช่วยในการเขียนโค้ด ผู้เขียนจึงออกแบบการทดสอบที่ซับซ้อนมากขึ้น โดยมีเป้าหมายและเกณฑ์ภายในหลายอย่าง ซึ่งการชนะไม่ใช่เรื่องง่าย
ปัญหาในการจัดส่งสินค้าและรับของ (APDP) ที่ใช้ในการศึกษาของผู้เขียนนั้นถูกเลือกเพราะมีผลงานของนักเรียนในปี 2020 จากมหาวิทยาลัยสวิส ซึ่งพยายามสร้างเอเย่นต์โดยอัตโนมัติสำหรับงาน APDP ก่อนที่จะสามารถพัฒนาด้วย AI ได้
ผู้เขียนพยายามหลีกเลี่ยงการสร้างเฟรมเวิร์กการทดสอบที่ได้รับความนิยม เช่น HumanEval และ BigCodeBench เนื่องจากกระบวนการทดสอบประเภทนี้มักจะเสียหายจากข้อมูลที่ปนเปื้อน (เช่น ระบบอาจได้รับการฝึกอบรมจากข้อมูลทดสอบแทนการแบ่งข้อมูล)
APDP เป็นปัญหาโลจิสติกส์แบบสองขั้นตอน ซึ่งประกอบด้วยการประมูลแบบย้อนกลับและเส้นทางการขนส่ง
การแข่งขัน
ผู้เขียนประเมินเอเย่นต์ที่เขียนด้วยมือ 17 ตัว และเอเย่นต์ที่เข้ารหัสสัญชาติ 40 ตัว ใน 12 ทัวร์นาเมนต์
ผลลัพธ์แสดงด้านล่างสรุปผลลัพธ์จาก 12 ทัวร์นาเมนต์ โดยมี 4 โทโพโลยีเครือข่ายและ 3 ทัวร์นาเมนต์ต่อโทโพโลยี
| เอเย่นต์ | ค่าเฉลี่ยชนะ / ทัวร์ | ส่วนเบี่ยงเบนมาตรฐานชนะ / ทัวร์ | ค่าเฉลี่ยแพ้ / ทัวร์ | ส่วนเบี่ยงเบนมาตรฐานแพ้ / ทัวร์ | ชนะทั้งหมด | แพ้ทั้งหมด | อัตราการชนะ |
|---|---|---|---|---|---|---|---|
| นักเรียน 1 | 108.167 | 1.193 | 3.833 | 1.193 | 1298 | 46 | 0.9658 |
| นักเรียน 2 | 104.917 | 2.539 | 7.083 | 2.539 | 1259 | 85 | 0.9368 |
| นักเรียน 3 | 103.917 | 2.466 | 8.083 | 2.466 | 1247 | 97 | 0.9278 |
| นักเรียน 4 | 103.25 | 1.815 | 8.75 | 1.815 | 1239 | 105 | 0.9219 |
| นักเรียน 5 | 96.5 | 2.908 | 15.5 | 2.908 | 1158 | 186 | 0.8616 |
| LLM(O, IR, 1) | 95.417 | 2.314 | 16.583 | 2.314 | 1145 | 199 | 0.8519 |
| LLM(O, A2, 1) | 94.583 | 2.314 | 17.417 | 2.314 | 1135 | 209 | 0.8445 |
| นักเรียน 6 | 93.167 | 1.899 | 18.833 | 1.899 | 1118 | 226 | 0.8318 |
| นักเรียน 7 | 93.167 | 3.563 | 18.833 | 3.563 | 1118 | 226 | 0.8318 |
| LLM(O, A1, 1) | 86.083 | 3.029 | 25.917 | 3.029 | 1033 | 311 | 0.7686 |
| LLM(O, GEN, 2) | 84.083 | 6.947 | 27.917 | 6.947 | 1009 | 335 | 0.7507 |
| LLM(O, CR, 2) | 83.5 | 4.442 | 28.5 | 4.442 | 1002 | 342 | 0.7455 |
| นักเรียน 8 | 83.417 | 4.122 | 28.583 | 4.122 | 1001 | 343 | 0.7448 |
| RiskSeeking | 82.417 | 3.343 | 29.583 | 3.343 | 989 | 355 | 0.7359 |
| LLM(O, GEN, 1) | 80.667 | 4.355 | 31.25 | 4.372 | 968 | 375 | 0.7208 |
| ModelOpponent | 80.583 | 3.26 | 31.417 | 3.26 | 967 | 377 | 0.7195 |
| LLM(D, A1, 1) | 79.417 | 3.965 | 32.583 | 3.965 | 953 | 391 | 0.7091 |
| ExpCostFixedBid | 77.167 | 4.951 | 34.833 | 4.951 | 926 | 418 | 0.689 |
| LLM(O, IR, 2) | 73.917 | 3.502 | 38 | 3.618 | 887 | 456 | 0.6605 |
| LLM(O, A1, 2) | 72.417 | 2.193 | 39.583 | 2.193 | 869 | 475 | 0.6466 |
| LLM(G, A1, 2) | 68.5 | 3.555 | 43.5 | 3.555 | 822 | 522 | 0.6116 |
| LLM(A, GEN, 2) | 67.917 | 2.968 | 44.083 | 2.968 | 815 | 529 | 0.6064 |
| LLM(G, IR, 2) | 65.917 | 2.314 | 46.083 | 2.314 | 791 | 553 | 0.5885 |
| นักเรียน 9 | 64.167 | 11.044 | 47.833 | 11.044 | 770 | 574 | 0.5729 |
| LLM(G, A1, 1) | 64 | 4.243 | 47.917 | 4.316 | 768 | 575 | 0.5719 |
| LLM(G, IR, 1) | 60.333 | 3.725 | 51.667 | 3.725 | 724 | 620 | 0.5387 |
| LLM(O, A2, 2) | 59.333 | 4.499 | 52.667 | 4.499 | 712 | 632 | 0.5298 |
| LLM(D, CR, 1) | 55.083 | 6.694 | 56.833 | 6.59 | 661 | 682 | 0.4922 |
| LLM(G, GEN, 2) | 53.167 | 3.664 | 58.833 | 3.664 | 638 | 706 | 0.4747 |
| LLM(D, GEN, 2) | 52.083 | 9.06 | 59.917 | 9.06 | 625 | 719 | 0.465 |
| Honest | 50.583 | 3.848 | 61.417 | 3.848 | 607 | 737 | 0.4516 |
| นักเรียน 10 | 48.833 | 2.98 | 63.167 | 2.98 | 586 | 758 | 0.436 |
| LLM(D, IR, 1) | 48.583 | 10.211 | 63.417 | 10.211 | 583 | 761 | 0.4338 |
| LLM(A, A1, 1) | 48 | 4.69 | 64 | 4.69 | 576 | 768 | 0.4286 |
| LLM(G, A2, 1) | 47.25 | 3.864 | 64.75 | 3.864 | 567 | 777 | 0.4219 |
| LLM(A, CR, 1) | 43.833 | 4.609 | 68.167 | 4.609 | 526 | 818 | 0.3914 |
| LLM(A, A1, 2) | 43.75 | 2.05 | 68.25 | 2.05 | 525 | 819 | 0.3906 |
| นักเรียน 11 | 42.083 | 5.664 | 69.917 | 5.664 | 505 | 839 | 0.3757 |
| LLM(A, IR, 1) | 39.5 | 2.541 | 72.5 | 2.541 | 474 | 870 | 0.3527 |
| Naive | 36.75 | 1.712 | 75.25 | 1.712 | 441 | 903 | 0.3281 |
| นักเรียน 12 | 36.333 | 1.775 | 75.667 | 1.775 | 436 | 908 | 0.3244 |
| LLM(D, A2, 1) | 33.917 | 2.193 | 78.083 | 2.193 | 407 | 937 | 0.3028 |
| LLM(A, GEN, 1) | 30.167 | 1.749 | 81.833 | 1.749 | 362 | 982 | 0.2693 |
| LLM(D, A2, 2) | 29.833 | 2.038 | 82.167 | 2.038 | 358 | 986 | 0.2664 |
| LLM(G, A2, 2) | 27 | 2.256 | 85 | 2.256 | 324 | 1020 | 0.2411 |
| LLM(A, A2, 1) | 26.333 | 0.985 | 85.667 | 0.985 | 316 | 1028 | 0.2351 |
| LLM(O, CR, 1) | 25 | 3.411 | 87 | 3.411 | 300 | 1044 | 0.2232 |
| LLM(A, IR, 2) | 24.333 | 8.542 | 87.667 | 8.542 | 292 | 1052 | 0.2173 |
| LLM(A, A2, 2) | 24 | 1.809 | 88 | 1.809 | 288 | 1056 | 0.2143 |
| LLM(A, CR, 2) | 23.333 | 1.557 | 88.667 | 1.557 | 280 | 1064 | 0.2083 |
| LLM(D, GEN, 1) | 22.5 | 1.784 | 89.5 | 1.784 | 270 | 1074 | 0.2009 |
| LLM(D, A1, 2) | 13.333 | 1.826 | 98.667 | 1.826 | 160 | 1184 | 0.119 |
| LLM(G, CR, 1) | 9.5 | 1.087 | 102.5 | 1.087 | 114 | 1230 | 0.0848 |
| LLM(G, GEN, 1) | 9.167 | 0.937 | 102.833 | 0.937 | 110 | 1234 | 0.0818 |
| LLM(D, IR, 2) | 7.75 | 0.622 | 104.25 | 0.622 | 93 | 1251 | 0.0692 |
| LLM(G, CR, 2) | 7.25 | 1.422 | 104.75 | 1.422 | 87 | 1257 | 0.0647 |
| LLM(D, CR, 2) | 5.667 | 0.985 | 106.333 | 0.985 | 68 | 1276 | 0.0506 |
สำหรับบริบท แต่ละเอเย่นต์เล่น 112 นัดต่อนัด ดังนั้นค่าเฉลี่ยสูงสุดที่เป็นไปได้สำหรับการชนะหรือแพ้ต่อนัดคือ 112 ส่วนเบี่ยงเบนมาตรฐาน (SD) สะท้อนถึงความแปรผันระหว่างทัวร์นาเมนต์ เอเย่นต์ที่เขียนด้วยมือจะแสดงเป็นตัวหนา เอเย่นต์ที่เข้ารหัสสัญชาติจะแสดงด้วยตัวอักษร LLM แหล่งที่มา
สรุป
ผู้เขียนสังเกตเห็นว่าเข้ารหัสสัญชาติได้เพิ่มขีดความสามารถให้กับบุคคลทุกคน และอธิบายว่าเป็นพลังที่เท่าเทียมกัน แต่พวกเขาก็ชี้ให้เห็นว่าเนื่องจากเข้ารหัสสัญชาติเพิ่งมาถึง จึงไม่ทราบขีดจำกัดและอาจสูงกว่าที่คาดไว้
พวกเขาได้สรุปผลงานโดยการเรียกร้องให้มีการเปลี่ยนเป้าหมายจาก “รหัสที่คอมไพล์” เป็น “รหัสที่แข่งขัน”
คำถามหนึ่งที่ผู้อ่านอาจมีต่อกระดาษนี้คือว่าผู้เขียนกำลังต่อสู้กับใคร เนื่องจากงานที่ต้องทำนั้นซับซ้อนและยุ่งยากกว่าการสร้างสคริปต์ PowerShell และฟังก์ชันการแก้ปัญหาเล็กๆ น้อยๆ ที่เข้ารหัสสัญชาติเหมาะสม
* โปรดทราบว่ากระดาษนี้อ้างถึง ‘DeepThink R1’ อย่างต่อเนื่อง ซึ่งดูเหมือนจะไม่มีอยู่จริง และปรากฏเฉพาะในอินเทอร์เน็ตเพียงไม่กี่รายการ (อาจเป็นเพราะผู้เขียนอื่นๆ เขียน ‘DeepSeek R1’ ผิด) หากเป็นข้อผิดพลาดของฉัน โปรดติดต่อฉันผ่านรายละเอียดโปรไฟล์ของฉัน และฉันจะแก้ไข
เผยแพร่ครั้งแรกวันพุธที่ 26 พฤศจิกายน 2025 แก้ไข 17:35 น. สำหรับการจัดรูปแบบ












