มุมมองของ Anderson
รหัสมนุษย์จากปี 2020 ถูกทำลายโดยเอเย่นต์ที่เข้ารหัสสัญชาติในการทดสอบเอเย่นต์

40,000 นัด – และแพ้ให้กับรหัสที่เขียนโดยนักเรียนระดับบัณฑิตศึกษาในปี 2020 ก่อนที่จะคิดค้นโมเดลภาษาขนาดใหญ่ ในงานวิจัยใหม่จากสหราชอาณาจักร นักวิจัยได้แข่งขันเอเย่นต์ที่เขียนด้วยมือมนุษย์กับเอเย่นต์ที่เข้ารหัสสัญชาติ
ChatGPT และเครื่องมือเข้ารหัสสัญชาติอื่นๆ ถูกทดสอบในเกือบ โดยใช้โมเดลภาษาขนาดใหญ่ (LLMs)เช่น ChatGPT-5 และ Claude และพบว่าเอเย่นต์ที่สร้างขึ้นโดยไม่ได้รับความช่วยเหลือจาก AI สามารถเอาชนะเอเย่นต์ที่ได้รับการช่วยเหลือจาก AI ได้อย่างง่ายดาย ทั้งสองชุดของเอเย่นต์ถูกสร้างขึ้นโดยนักเรียนจากห้องปฏิบัติการปัญญาประดิษฐ์ของสถาบันเทคโนโลยีแห่งสหพันธรัฐสวิส เอเย่นต์ที่ไม่ใช่ AI ถูกสร้างขึ้นเป็นส่วนหนึ่งของหลักสูตรในปี 2020 สองปีก่อนที่จะเริ่มใช้ ChatGPT และการปฏิวัติของ LLMs ในขณะที่เอเย่นต์ใหม่ถูกสร้างขึ้นโดยนักเรียนในปัจจุบัน โดยได้รับความช่วยเหลือจาก LLMs ที่ดีที่สุดและล่าสุด แม้ว่าจะมีการจัดเกมให้เอเย่นต์ที่เข้ารหัสสัญชาติ แต่พวกเขาก็ไม่สามารถชนะได้ และอันดับห้าอันดับแรกถูกครอบครองโดยเอเย่นต์ “ดิบ” โดยมีเอเย่นต์ LLM ส่วนใหญ่ (33 ใน 40) ถูกเอเย่นต์ “ง่าย” ที่มีประสิทธิภาพต่ำกว่าเอาชนะได้อย่างง่ายดาย ใน 38,304
การท้าทายใน 12 ทัวร์นาเมนต์ งานวิจัยระบุว่า: ‘งานของเราชี้ให้เห็นว่าในขณะที่ LLMs ที่มีคุณภาพสูงสุดสามารถสร้างรหัสที่ทำงานได้ (เช่น ไม่มีข้อผิดพลาดทางไวยากรณ์) แต่รหัสที่สร้างขึ้นนั้นไม่แข่งขันกับการออกแบบโดยมนุษย์
Opus 4.1 และ DeepSeek R1* งานวิจัยใหม่ ใหม่ มีชื่อเรื่อง
ในด้านเช่นการวางแผนเชิงกลยุทธ์ การเพิ่มประสิทธิภาพ หรือการแข่งขันหลายเอเย่นต์’ ‘ดังนั้น งานนี้จึงนำพาเราไปสู่แนวหน้าใหม่ในการสร้างรหัส และมีจุดมุ่งหมายเพื่ออำนวยความสะดวกในการพัฒนาเครื่องมือ การสร้างข้อมูล และการสร้างแบบจำลองที่เปิดกว้างซึ่งเน้นการสร้างรหัสที่ขับเคลื่อนด้วยเหตุผล’ การท้าทายที่ถูกออกแบบมาเพื่อให้เอเย่นต์เข้าร่วมการประมูลในหลายๆ วิธี และจัดลำดับการจัดส่งสินค้าที่ชนะให้กับผู้ชนะ ผู้เขียนระบุว่า LLMs ที่ใช้ในการทดสอบ ได้แก่ GPT-5 Thinking, Gemini 2.5 Pro, Claude
และมาจากผู้เขียนหนึ่งคนจาก University of Southampton และอีกคนจาก
of Oxford และ Alan Turing Institute
University Can Vibe Coding Beat Graduate Tournament on Market-driven StrategicCS Students? An LLM vs. Human Coding Planning
วิธีการ
ผู้เขียนระบุว่าการทดสอบแบบดั้งเดิมในด้านนี้มุ่งเน้นไปที่ความท้าทายที่มีวิธีแก้ปัญหาแบบไบนารี่ที่ชัดเจน ( หรือ ถูกต้อง )


เช่น HumanEval และ BigCodeBench เนื่องจากกระบวนการทดสอบประเภทนี้มักจะเสียหายจากข้อมูลที่ปนเปื้อน (เช่น ระบบอาจได้รับการฝึกอบรมจากข้อมูลทดสอบแทนการแบ่งข้อมูล) APDP เป็นปัญหาโลจิสติกส์แบบสองขั้นตอน ซึ่งประกอบด้วยการประมูลแบบย้อนกลับและเส้นทางการขนส่ง
การแข่งขัน
ผู้เขียนประเมินเอเย่นต์ที่เขียนด้วยมือ 17 ตัว และเอเย่นต์ที่เข้ารหัสสัญชาติ 40 ตัว ใน 12 ทัวร์นาเมนต์ ผลลัพธ์แสดงด้านล่างสรุปผลลัพธ์จาก 12 ทัวร์นาเมนต์ โดยมี 4 โทโพโลยีเครือข่ายและ 3 ทัวร์นาเมนต์ต่อโทโพโลยี เอเย่นต์ ค่าเฉลี่ยชนะ / ทัวร์ ส่วนเบี่ยงเบนมาตรฐานชนะ / ทัวร์ ค่าเฉลี่ยแพ้ / ทัวร์ ส่วนเบี่ยงเบนมาตรฐานแพ้ / ทัวร์ ชนะทั้งหมด แพ้ทั้งหมด อัตราการชนะ นักเรียน

2.539 1259 85 0.9368 นักเรียน 3 103.917 2.466 8.083 2.466 1247 97 0.9278 นักเรียน 4 103.25 1.815 8.75 1.815 นักเรียน 1239 105 0.9219 15.5 5 96.5 2.908 2.908 1158 186 0.8616 LLM(O, 0.7455 IR, 1) 95.417 2.314 16.583 2.314 1145 199 0.8519 LLM(O, A2, 1) 94.583 2.314 17.417 2.314 1135 209 0.8445 นักเรียน 6 93.167 1.899 18.833 1.899 1118 226 0.8318 นักเรียน 7 93.167 3.563 18.833 3.563 1118 226 0.8318 LLM(O, A1, 1) 86.083 3.029 25.917 3.029 1033 311 0.7686 LLM(O, GEN, 2) 84.083 6.947 27.917 6.947 1009 335 0.7507 LLM(O, CR, 2) 83.5 4.442 28.5 4.442 1002 342
นักเรียน 8 83.417 4.122 28.583 4.122 1001 343 0.7448 RiskSeeking
82.417 3.343 29.583 3.343 989 355 0.7359 LLM(O, GEN, 1)
3.26 967 377 0.7195 LLM(D, A1, 3.26 31.41732.583 3.965 1) 79.417 3.965953 391 0.7091 ExpCostFixedBid 77.167
80.667 4.355 31.25 4.372 968 375 0.7208 ModelOpponent 80.583
| 4.951 | 34.833 | 4.951 | 926 | 418 | 0.689 | ||
|---|---|---|---|---|---|---|---|
| LLM(O, | IR, | 2) | 73.917 | 3.502 | |||
| 38 | 3.618 | 887 | 456 | ||||
| 0.6605 | LLM(O, | A1, | 2) | 72.417 | |||
| 2.193 | 39.583 | 2.193 | 869 | ||||
| 475 | 0.6466 | LLM(G, | A1, | 2) | |||
| 68.5 | 3.555 | 43.5 | 3.555 | 822 | |||
| 522 | 0.6116 | LLM(A, | GEN, | 2) | |||
| 67.917 | 2.968 | 44.083 | 2.968 | 815 | |||
| 529 | 0.6064 | LLM(G, | IR, | ||||
| 2) 65.917 | 2.314 | 46.083 | 2.314 | ||||
| 791 553 | 0.5885 | นักเรียน | 9 | 64.167 | |||
| 11.044 | 47.833 | 11.044 | 770 | 574 | |||
| 0.5729 | LLM(G, | A1, | 1) | ||||
| 64 | 4.243 | 47.917 | 4.316 | 768 | |||
| 575 | 0.5719 | LLM(G, | IR, | 1) | |||
| 60.333 | 3.725 | 51.667 | 3.725 | ||||
| 724 | 620 | 0.5387 | LLM(O, | A2, | |||
| 2) | 59.333 | 4.499 | 52.667 | ||||
| 4.499 712 | 632 | 0.5298 | LLM(D, | ||||
| CR, 1) | 55.083 | 6.694 | 56.833 | 6.59 | |||
| 661 | 682 | 0.4922 | LLM(G, | GEN, | |||
| 2) | 53.167 | 3.664 | 58.833 | 3.664 | |||
| 638 | 706 | 0.4747 | LLM(D, | GEN, | |||
| 2) | 52.083 | 9.06 | 59.917 | 9.06 | |||
| 625 | 719 | 0.465 | Honest | 50.583 | |||
| 3.848 | 61.417 | 3.848 | 607 | 737 | |||
| 0.4516 | นักเรียน | 10 | 48.833 | 2.98 | |||
| 63.167 | 2.98 | 586 | 758 | 0.436 | |||
| LLM(D, | IR, | 1) | 48.583 | 10.211 | |||
| 63.417 10.211 | 583 | 761 | 0.4338 | LLM(A, | |||
| A1, | 1) | 48 | 4.69 | ||||
| 64 | 4.69 | 576 | 768 | ||||
| 0.4286 LLM(G, | A2, | 1) | 47.25 | 3.864 | |||
| 64.75 | 3.864 | 567 | 777 | ||||
| 0.4219 | LLM(A, | CR, | 1) | 43.833 | |||
| 4.609 68.167 | 4.609 | 526 | 818 | ||||
| 0.3914 LLM(A, | A1, | 2) | 43.75 | 2.05 | |||
| 68.25 | 2.05 | 525 | 819 | ||||
| 0.3906 | นักเรียน | 11 | 42.083 | 5.664 | |||
| 69.917 | 5.664 | 505 | 839 | 0.3757 | |||
| LLM(A, | IR, | 1) | 39.5 | ||||
| 2.541 | 72.5 | 2.541 | 474 | 870 | |||
| 0.3527 Naive | 36.75 | 1.712 | 75.25 | 1.712 | |||
| 441 | 903 | 0.3281 | นักเรียน | 12 | |||
| 36.333 | 1.775 | 75.667 | 1.775 | ||||
| 436 908 | 0.3244 | LLM(D, | A2, | ||||
| 1) 33.917 | 2.193 | 78.083 | 2.193 | ||||
| 407 | 937 | 0.3028 | LLM(A, | GEN, | |||
| 1) 30.167 | 1.749 | 81.833 | 1.749 | ||||
| 362 | 982 | 0.2693 | LLM(D, | A2, | |||
| 2) | 29.833 | 2.038 | 82.167 | 2.038 | |||
| 358 | 986 | 0.2664 | LLM(G, | A2, | |||
| 2) 27 | 2.256 | 85 | 2.256 | 324 | |||
| 1020 | 0.2411 | LLM(A, | A2, | 1) | |||
| 26.333 | 0.985 | 85.667 | 0.985 | 316 | |||
| 1028 | 0.2351 | LLM(O, | CR, | 1) | |||
| 25 | 3.411 | 87 | 3.411 | 300 |
1044 0.2232 LLM(A, IR, 2) 24.333 8.542 87.667 8.542 292 1052 0.2173 LLM(A, A2, 2) 24 1.809 88 1.809 288 1056 0.2143 LLM(A, CR, 2) 23.333 1.557
88.667 1.557 280 10640.2083
LLM(D, GEN, 1) 22.5 1.784 89.5 1.784 270 1074 0.2009 LLM(D, A1, 2) 13.333
1.826 98.667 1.826 160 1184 0.119 LLM(G, 1.087 102.5 1.087 114 1230 CR, 1) 9.5
0.937 110 1234 0.0818 LLM(D, IR, 2) 7.75 0.622 104.25 0.622 93 1251 0.0692 LLM(G, CR, 2) 7.25 1.422 102.833
0.0848 LLM(G, GEN, 1) 9.167 0.937 0.985104.75 1.422 87 1257 0.0647 LLM(D, CR, 2) 5.667 0.985 106.333
68 1276 0.0506 สำหรับบริบท แต่ละเอเย่นต์เล่น 112 นัดต่อนัด ดังนั้นค่าเฉลี่ยสูงสุดที่เป็นไปได้สำหรับการชนะหรือแพ้ต่อนัดคือ 112 ส่วนเบี่ยงเบนมาตรฐาน (SD) สะท้อนถึงความแปรผันระหว่างทัวร์นาเมนต์ เอเย่นต์ที่เขียนด้วยมือจะแสดงเป็นตัวหนา เอเย่นต์ที่เข้ารหัสสัญชาติจะแสดงด้วยตัวอักษร LLM แหล่งที่มา
สรุป
ผู้เขียนสังเกตเห็นว่าเข้ารหัสสัญชาติได้เพิ่มขีดความสามารถให้กับบุคคลทุกคน และอธิบายว่าเป็นพลังที่เท่าเทียมกัน แต่พวกเขาก็ชี้ให้เห็นว่าเนื่องจากเข้ารหัสสัญชาติเพิ่งมาถึง จึงไม่ทราบขีดจำกัดและอาจสูงกว่าที่คาดไว้ พวกเขาได้สรุปผลงานโดยการเรียกร้องให้มีการเปลี่ยนเป้าหมายจาก “รหัสที่คอมไพล์” เป็น “รหัสที่แข่งขัน” คำถามหนึ่งที่ผู้อ่านอาจมีต่อกระดาษนี้คือว่าผู้เขียนกำลังต่อสู้กับใคร เนื่องจากงานที่ต้องทำนั้นซับซ้อนและยุ่งยากกว่าการสร้างสคริปต์ PowerShell และฟังก์ชันการแก้ปัญหาเล็กๆ น้อยๆ‘DeepSeekที่เข้ารหัสสัญชาติเหมาะสม * โปรดทราบว่ากระดาษนี้อ้างถึง ‘DeepThink R1’ อย่างต่อเนื่อง ซึ่งดูเหมือนจะไม่มีอยู่จริง และปรากฏเฉพาะในอินเทอร์เน็ตเพียงไม่กี่รายการ (อาจเป็นเพราะผู้เขียนอื่นๆ เขียน R1′ ผิด) หากเป็นข้อผิดพลาดของฉัน โปรดติดต่อฉันผ่านรายละเอียดโปรไฟล์ของฉัน และฉันจะแก้ไข เผยแพร่ครั้งแรกวันพุธที่ 26 พฤศจิกายน 2025 แก้ไข
17:35
น. สำหรับการจัดรูปแบบ












