มุมมองของ Anderson

รหัสมนุษย์จากปี 2020 ถูกทำลายโดยเอเย่นต์ที่เข้ารหัสสัญชาติในการทดสอบเอเย่นต์

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
AI-generated image: a Victorian coach and horses winning formula 1 against modern race car competitors. gpt-image-1.

40,000 นัด – และแพ้ให้กับรหัสที่เขียนโดยนักเรียนระดับบัณฑิตศึกษาในปี 2020 ก่อนที่จะคิดค้นโมเดลภาษาขนาดใหญ่ ในงานวิจัยใหม่จากสหราชอาณาจักร นักวิจัยได้แข่งขันเอเย่นต์ที่เขียนด้วยมือมนุษย์กับเอเย่นต์ที่เข้ารหัสสัญชาติ

 

ChatGPT และเครื่องมือเข้ารหัสสัญชาติอื่นๆ ถูกทดสอบในเกือบ โดยใช้โมเดลภาษาขนาดใหญ่ (LLMs)เช่น ChatGPT-5 และ Claude และพบว่าเอเย่นต์ที่สร้างขึ้นโดยไม่ได้รับความช่วยเหลือจาก AI สามารถเอาชนะเอเย่นต์ที่ได้รับการช่วยเหลือจาก AI ได้อย่างง่ายดาย ทั้งสองชุดของเอเย่นต์ถูกสร้างขึ้นโดยนักเรียนจากห้องปฏิบัติการปัญญาประดิษฐ์ของสถาบันเทคโนโลยีแห่งสหพันธรัฐสวิส เอเย่นต์ที่ไม่ใช่ AI ถูกสร้างขึ้นเป็นส่วนหนึ่งของหลักสูตรในปี 2020 สองปีก่อนที่จะเริ่มใช้ ChatGPT และการปฏิวัติของ LLMs ในขณะที่เอเย่นต์ใหม่ถูกสร้างขึ้นโดยนักเรียนในปัจจุบัน โดยได้รับความช่วยเหลือจาก LLMs ที่ดีที่สุดและล่าสุด แม้ว่าจะมีการจัดเกมให้เอเย่นต์ที่เข้ารหัสสัญชาติ แต่พวกเขาก็ไม่สามารถชนะได้ และอันดับห้าอันดับแรกถูกครอบครองโดยเอเย่นต์ “ดิบ” โดยมีเอเย่นต์ LLM ส่วนใหญ่ (33 ใน 40) ถูกเอเย่นต์ “ง่าย” ที่มีประสิทธิภาพต่ำกว่าเอาชนะได้อย่างง่ายดาย ใน 38,304

การท้าทายใน 12 ทัวร์นาเมนต์ งานวิจัยระบุว่า: ‘งานของเราชี้ให้เห็นว่าในขณะที่ LLMs ที่มีคุณภาพสูงสุดสามารถสร้างรหัสที่ทำงานได้ (เช่น ไม่มีข้อผิดพลาดทางไวยากรณ์) แต่รหัสที่สร้างขึ้นนั้นไม่แข่งขันกับการออกแบบโดยมนุษย์

Opus 4.1 และ DeepSeek R1* งานวิจัยใหม่ ใหม่ มีชื่อเรื่อง

ในด้านเช่นการวางแผนเชิงกลยุทธ์ การเพิ่มประสิทธิภาพ หรือการแข่งขันหลายเอเย่นต์’ ‘ดังนั้น งานนี้จึงนำพาเราไปสู่แนวหน้าใหม่ในการสร้างรหัส และมีจุดมุ่งหมายเพื่ออำนวยความสะดวกในการพัฒนาเครื่องมือ การสร้างข้อมูล และการสร้างแบบจำลองที่เปิดกว้างซึ่งเน้นการสร้างรหัสที่ขับเคลื่อนด้วยเหตุผล’ การท้าทายที่ถูกออกแบบมาเพื่อให้เอเย่นต์เข้าร่วมการประมูลในหลายๆ วิธี และจัดลำดับการจัดส่งสินค้าที่ชนะให้กับผู้ชนะ ผู้เขียนระบุว่า LLMs ที่ใช้ในการทดสอบ ได้แก่ GPT-5 Thinking, Gemini 2.5 Pro, Claude

และมาจากผู้เขียนหนึ่งคนจาก University of Southampton และอีกคนจาก

of Oxford และ Alan Turing Institute

University Can Vibe Coding Beat Graduate Tournament on Market-driven StrategicCS Students? An LLM vs. Human Coding Planning

วิธีการ

ผู้เขียนระบุว่าการทดสอบแบบดั้งเดิมในด้านนี้มุ่งเน้นไปที่ความท้าทายที่มีวิธีแก้ปัญหาแบบไบนารี่ที่ชัดเจน ( หรือ ถูกต้อง )

การเปรียบเทียบแนวทางมาตรฐานแบบทดสอบหน่วย (ด้านบน) และสถานการณ์ท้าทายปลายเปิดที่ผู้เขียนคิดค้นขึ้น (สีน้ำเงิน ด้านล่าง) ที่มา  ( https://arxiv.org/pdf/2511.20613 ) ที่ตรวจสอบโดย ไม่ถูกต้อง การทดสอบหน่วย โดยโต้แย้งว่านี่ไม่ใช่วิธีที่เหมาะสมในการสำรวจข้อจำกัดของ LLMs ที่ช่วยในการเขียนโค้ด ผู้เขียนจึงออกแบบการทดสอบที่ซับซ้อนมากขึ้น โดยมีเป้าหมายและเกณฑ์ภายในหลายอย่าง ซึ่งการชนะไม่ใช่เรื่องง่าย ปัญหาในการจัดส่งสินค้าและรับของ (APDP) ที่ใช้ในการศึกษาของผู้เขียนนั้นถูกเลือกเพราะมีผลงานของนักเรียนในปี 2020 จากมหาวิทยาลัยสวิส ซึ่งพยายามสร้างเอเย่นต์โดยอัตโนมัติสำหรับงาน APDP ก่อนที่จะสามารถพัฒนาด้วย AI

ใน APDP บริษัทต่างๆ เสนอราคาในการประมูลแบบย้อนกลับสำหรับงานจัดส่ง จากนั้นปรับเส้นทางยานพาหนะให้เหมาะสมเพื่อตอบสนองเฉพาะงานที่พวกเขาชนะ โดยมีเป้าหมายเพื่อเพิ่มผลกำไรสูงสุด ได้ ผู้เขียนพยายามหลีกเลี่ยงการสร้างเฟรมเวิร์กการทดสอบที่ได้รับความนิยม

เช่น HumanEval และ BigCodeBench เนื่องจากกระบวนการทดสอบประเภทนี้มักจะเสียหายจากข้อมูลที่ปนเปื้อน (เช่น ระบบอาจได้รับการฝึกอบรมจากข้อมูลทดสอบแทนการแบ่งข้อมูล) APDP เป็นปัญหาโลจิสติกส์แบบสองขั้นตอน ซึ่งประกอบด้วยการประมูลแบบย้อนกลับและเส้นทางการขนส่ง

การแข่งขัน

ผู้เขียนประเมินเอเย่นต์ที่เขียนด้วยมือ 17 ตัว และเอเย่นต์ที่เข้ารหัสสัญชาติ 40 ตัว ใน 12 ทัวร์นาเมนต์ ผลลัพธ์แสดงด้านล่างสรุปผลลัพธ์จาก 12 ทัวร์นาเมนต์ โดยมี 4 โทโพโลยีเครือข่ายและ 3 ทัวร์นาเมนต์ต่อโทโพโลยี เอเย่นต์ ค่าเฉลี่ยชนะ / ทัวร์ ส่วนเบี่ยงเบนมาตรฐานชนะ / ทัวร์ ค่าเฉลี่ยแพ้ / ทัวร์ ส่วนเบี่ยงเบนมาตรฐานแพ้ / ทัวร์ ชนะทั้งหมด แพ้ทั้งหมด อัตราการชนะ นักเรียน

เครือข่ายถนนแบบง่ายที่ใช้ในทัวร์นาเมนต์: สหราชอาณาจักร (ซ้ายบน), สวิตเซอร์แลนด์ (ขวาบน), เนเธอร์แลนด์ (ซ้ายล่าง) และฝรั่งเศส (ขวาล่าง) สี่เหลี่ยมสีน้ำเงินและสีแดงแสดงถึงงานรับและจัดส่ง สามเหลี่ยมสีแสดงตำแหน่งปัจจุบันของยานพาหนะของตัวแทน 1 108.167 1.193 3.833 1.193 1298 46 0.9658 นักเรียน 2 104.917 2.539 7.083

2.539 1259 85 0.9368 นักเรียน 3 103.917 2.466 8.083 2.466 1247 97 0.9278 นักเรียน 4 103.25 1.815 8.75 1.815 นักเรียน 1239 105 0.9219 15.5 5 96.5 2.908 2.908 1158 186 0.8616 LLM(O, 0.7455 IR, 1) 95.417 2.314 16.583 2.314 1145 199 0.8519 LLM(O, A2, 1) 94.583 2.314 17.417 2.314 1135 209 0.8445 นักเรียน 6 93.167 1.899 18.833 1.899 1118 226 0.8318 นักเรียน 7 93.167 3.563 18.833 3.563 1118 226 0.8318 LLM(O, A1, 1) 86.083 3.029 25.917 3.029 1033 311 0.7686 LLM(O, GEN, 2) 84.083 6.947 27.917 6.947 1009 335 0.7507 LLM(O, CR, 2) 83.5 4.442 28.5 4.442 1002 342

นักเรียน 8 83.417 4.122 28.583 4.122 1001 343 0.7448 RiskSeeking

82.417 3.343 29.583 3.343 989 355 0.7359 LLM(O, GEN, 1)

3.26 967 377 0.7195 LLM(D, A1, 3.26 31.41732.583 3.965 1) 79.417 3.965953 391 0.7091 ExpCostFixedBid 77.167

80.667 4.355 31.25 4.372 968 375 0.7208 ModelOpponent 80.583

4.951 34.833 4.951 926 418 0.689
LLM(O, IR, 2) 73.917 3.502
38 3.618 887 456
0.6605 LLM(O, A1, 2) 72.417
2.193 39.583 2.193 869
475 0.6466 LLM(G, A1, 2)
68.5 3.555 43.5 3.555 822
522 0.6116 LLM(A, GEN, 2)
67.917 2.968 44.083 2.968 815
529 0.6064 LLM(G, IR,
2) 65.917 2.314 46.083 2.314
791 553 0.5885 นักเรียน 9 64.167
11.044 47.833 11.044 770 574
0.5729 LLM(G, A1, 1)
64 4.243 47.917 4.316 768
575 0.5719 LLM(G, IR, 1)
60.333 3.725 51.667 3.725
724 620 0.5387 LLM(O, A2,
2) 59.333 4.499 52.667
4.499 712 632 0.5298 LLM(D,
CR, 1) 55.083 6.694 56.833 6.59
661 682 0.4922 LLM(G, GEN,
2) 53.167 3.664 58.833 3.664
638 706 0.4747 LLM(D, GEN,
2) 52.083 9.06 59.917 9.06
625 719 0.465 Honest 50.583
3.848 61.417 3.848 607 737
0.4516 นักเรียน 10 48.833 2.98
63.167 2.98 586 758 0.436
LLM(D, IR, 1) 48.583 10.211
63.417 10.211 583 761 0.4338 LLM(A,
A1, 1) 48 4.69
64 4.69 576 768
0.4286 LLM(G, A2, 1) 47.25 3.864
64.75 3.864 567 777
0.4219 LLM(A, CR, 1) 43.833
4.609 68.167 4.609 526 818
0.3914 LLM(A, A1, 2) 43.75 2.05
68.25 2.05 525 819
0.3906 นักเรียน 11 42.083 5.664
69.917 5.664 505 839 0.3757
LLM(A, IR, 1) 39.5
2.541 72.5 2.541 474 870
0.3527 Naive 36.75 1.712 75.25 1.712
441 903 0.3281 นักเรียน 12
36.333 1.775 75.667 1.775
436 908 0.3244 LLM(D, A2,
1) 33.917 2.193 78.083 2.193
407 937 0.3028 LLM(A, GEN,
1) 30.167 1.749 81.833 1.749
362 982 0.2693 LLM(D, A2,
2) 29.833 2.038 82.167 2.038
358 986 0.2664 LLM(G, A2,
2) 27 2.256 85 2.256 324
1020 0.2411 LLM(A, A2, 1)
26.333 0.985 85.667 0.985 316
1028 0.2351 LLM(O, CR, 1)
25 3.411 87 3.411 300

1044 0.2232 LLM(A, IR, 2) 24.333 8.542 87.667 8.542 292 1052 0.2173 LLM(A, A2, 2) 24 1.809 88 1.809 288 1056 0.2143 LLM(A, CR, 2) 23.333 1.557

88.667 1.557 280 10640.2083

LLM(D, GEN, 1) 22.5 1.784 89.5 1.784 270 1074 0.2009 LLM(D, A1, 2) 13.333

1.826 98.667 1.826 160 1184 0.119 LLM(G, 1.087 102.5 1.087 114 1230 CR, 1) 9.5

0.937 110 1234 0.0818 LLM(D, IR, 2) 7.75 0.622 104.25 0.622 93 1251 0.0692 LLM(G, CR, 2) 7.25 1.422 102.833

0.0848 LLM(G, GEN, 1) 9.167 0.937 0.985104.75 1.422 87 1257 0.0647 LLM(D, CR, 2) 5.667 0.985 106.333

68 1276 0.0506 สำหรับบริบท แต่ละเอเย่นต์เล่น 112 นัดต่อนัด ดังนั้นค่าเฉลี่ยสูงสุดที่เป็นไปได้สำหรับการชนะหรือแพ้ต่อนัดคือ 112 ส่วนเบี่ยงเบนมาตรฐาน (SD) สะท้อนถึงความแปรผันระหว่างทัวร์นาเมนต์ เอเย่นต์ที่เขียนด้วยมือจะแสดงเป็นตัวหนา เอเย่นต์ที่เข้ารหัสสัญชาติจะแสดงด้วยตัวอักษร LLM แหล่งที่มา

สรุป

ผู้เขียนสังเกตเห็นว่าเข้ารหัสสัญชาติได้เพิ่มขีดความสามารถให้กับบุคคลทุกคน และอธิบายว่าเป็นพลังที่เท่าเทียมกัน แต่พวกเขาก็ชี้ให้เห็นว่าเนื่องจากเข้ารหัสสัญชาติเพิ่งมาถึง จึงไม่ทราบขีดจำกัดและอาจสูงกว่าที่คาดไว้ พวกเขาได้สรุปผลงานโดยการเรียกร้องให้มีการเปลี่ยนเป้าหมายจาก “รหัสที่คอมไพล์” เป็น “รหัสที่แข่งขัน” คำถามหนึ่งที่ผู้อ่านอาจมีต่อกระดาษนี้คือว่าผู้เขียนกำลังต่อสู้กับใคร เนื่องจากงานที่ต้องทำนั้นซับซ้อนและยุ่งยากกว่าการสร้างสคริปต์ PowerShell และฟังก์ชันการแก้ปัญหาเล็กๆ น้อยๆ‘DeepSeekที่เข้ารหัสสัญชาติเหมาะสม * โปรดทราบว่ากระดาษนี้อ้างถึง ‘DeepThink R1’ อย่างต่อเนื่อง ซึ่งดูเหมือนจะไม่มีอยู่จริง และปรากฏเฉพาะในอินเทอร์เน็ตเพียงไม่กี่รายการ (อาจเป็นเพราะผู้เขียนอื่นๆ เขียน R1′ ผิด) หากเป็นข้อผิดพลาดของฉัน โปรดติดต่อฉันผ่านรายละเอียดโปรไฟล์ของฉัน และฉันจะแก้ไข เผยแพร่ครั้งแรกวันพุธที่ 26 พฤศจิกายน 2025 แก้ไข

17:35

น. สำหรับการจัดรูปแบบ

ผู้เขียนด้านการเรียนรู้ของเครื่อง, ผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์. อดีตหัวหน้าฝ่ายเนื้อหาการวิจัยที่ Metaphysic.ai, จนกระทั่งการรวมเข้าเป็น Brahma.ai ของ DNEG.
เว็บไซต์: martinanderson.ai
ติดต่อ: martin@martinanderson.ai