มุมมองของ Anderson

รหัสมนุษย์จากปี 2020 ถูกทำลายโดยเอเย่นต์ที่เข้ารหัสสัญชาติในการทดสอบเอเย่นต์

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
AI-generated image: a Victorian coach and horses winning formula 1 against modern race car competitors. gpt-image-1.

ChatGPT และเครื่องมือเข้ารหัสสัญชาติอื่นๆ ถูกทดสอบในเกือบ 40,000 นัด – และแพ้ให้กับรหัสที่เขียนโดยนักเรียนระดับบัณฑิตศึกษาในปี 2020 ก่อนที่จะคิดค้นโมเดลภาษาขนาดใหญ่

 

ในงานวิจัยใหม่จากสหราชอาณาจักร นักวิจัยได้แข่งขันเอเย่นต์ที่เขียนด้วยมือมนุษย์กับเอเย่นต์ที่เข้ารหัสสัญชาติ โดยใช้โมเดลภาษาขนาดใหญ่ (LLMs) เช่น ChatGPT-5 และ Claude และพบว่าเอเย่นต์ที่สร้างขึ้นโดยไม่ได้รับความช่วยเหลือจาก AI สามารถเอาชนะเอเย่นต์ที่ได้รับการช่วยเหลือจาก AI ได้อย่างง่ายดาย

ทั้งสองชุดของเอเย่นต์ถูกสร้างขึ้นโดยนักเรียนจากห้องปฏิบัติการปัญญาประดิษฐ์ของสถาบันเทคโนโลยีแห่งสหพันธรัฐสวิส เอเย่นต์ที่ไม่ใช่ AI ถูกสร้างขึ้นเป็นส่วนหนึ่งของหลักสูตรในปี 2020 สองปีก่อนที่จะเริ่มใช้ ChatGPT และการปฏิวัติของ LLMs ในขณะที่เอเย่นต์ใหม่ถูกสร้างขึ้นโดยนักเรียนในปัจจุบัน โดยได้รับความช่วยเหลือจาก LLMs ที่ดีที่สุดและล่าสุด

แม้ว่าจะมีการจัดเกมให้เอเย่นต์ที่เข้ารหัสสัญชาติ แต่พวกเขาก็ไม่สามารถชนะได้ และอันดับห้าอันดับแรกถูกครอบครองโดยเอเย่นต์ “ดิบ” โดยมีเอเย่นต์ LLM ส่วนใหญ่ (33 ใน 40) ถูกเอเย่นต์ “ง่าย” ที่มีประสิทธิภาพต่ำกว่าเอาชนะได้อย่างง่ายดาย ใน 38,304 การท้าทายใน 12 ทัวร์นาเมนต์

งานวิจัยระบุว่า:

‘งานของเราชี้ให้เห็นว่าในขณะที่ LLMs ที่มีคุณภาพสูงสุดสามารถสร้างรหัสที่ทำงานได้ (เช่น ไม่มีข้อผิดพลาดทางไวยากรณ์) แต่รหัสที่สร้างขึ้นนั้นไม่แข่งขันกับการออกแบบโดยมนุษย์ ในด้านเช่นการวางแผนเชิงกลยุทธ์ การเพิ่มประสิทธิภาพ หรือการแข่งขันหลายเอเย่นต์’

‘ดังนั้น งานนี้จึงนำพาเราไปสู่แนวหน้าใหม่ในการสร้างรหัส และมีจุดมุ่งหมายเพื่ออำนวยความสะดวกในการพัฒนาเครื่องมือ การสร้างข้อมูล และการสร้างแบบจำลองที่เปิดกว้างซึ่งเน้นการสร้างรหัสที่ขับเคลื่อนด้วยเหตุผล’

การท้าทายที่ถูกออกแบบมาเพื่อให้เอเย่นต์เข้าร่วมการประมูลในหลายๆ วิธี และจัดลำดับการจัดส่งสินค้าที่ชนะให้กับผู้ชนะ

ผู้เขียนระบุว่า LLMs ที่ใช้ในการทดสอบ ได้แก่ GPT-5 Thinking, Gemini 2.5 Pro, Claude Opus 4.1 และ DeepSeek R1*

งานวิจัยใหม่ ใหม่ มีชื่อเรื่อง Can Vibe Coding Beat Graduate CS Students? An LLM vs. Human Coding Tournament on Market-driven Strategic Planning และมาจากผู้เขียนหนึ่งคนจาก University of Southampton และอีกคนจาก University of Oxford และ Alan Turing Institute

วิธีการ

ผู้เขียนระบุว่าการทดสอบแบบดั้งเดิมในด้านนี้มุ่งเน้นไปที่ความท้าทายที่มีวิธีแก้ปัญหาแบบไบนารี่ที่ชัดเจน (ถูกต้อง หรือ ไม่ถูกต้อง) ที่ตรวจสอบโดย การทดสอบหน่วย โดยโต้แย้งว่านี่ไม่ใช่วิธีที่เหมาะสมในการสำรวจข้อจำกัดของ LLMs ที่ช่วยในการเขียนโค้ด ผู้เขียนจึงออกแบบการทดสอบที่ซับซ้อนมากขึ้น โดยมีเป้าหมายและเกณฑ์ภายในหลายอย่าง ซึ่งการชนะไม่ใช่เรื่องง่าย

ปัญหาในการจัดส่งสินค้าและรับของ (APDP) ที่ใช้ในการศึกษาของผู้เขียนนั้นถูกเลือกเพราะมีผลงานของนักเรียนในปี 2020 จากมหาวิทยาลัยสวิส ซึ่งพยายามสร้างเอเย่นต์โดยอัตโนมัติสำหรับงาน APDP ก่อนที่จะสามารถพัฒนาด้วย AI ได้

ผู้เขียนพยายามหลีกเลี่ยงการสร้างเฟรมเวิร์กการทดสอบที่ได้รับความนิยม เช่น HumanEval และ BigCodeBench เนื่องจากกระบวนการทดสอบประเภทนี้มักจะเสียหายจากข้อมูลที่ปนเปื้อน (เช่น ระบบอาจได้รับการฝึกอบรมจากข้อมูลทดสอบแทนการแบ่งข้อมูล)

APDP เป็นปัญหาโลจิสติกส์แบบสองขั้นตอน ซึ่งประกอบด้วยการประมูลแบบย้อนกลับและเส้นทางการขนส่ง

การแข่งขัน

ผู้เขียนประเมินเอเย่นต์ที่เขียนด้วยมือ 17 ตัว และเอเย่นต์ที่เข้ารหัสสัญชาติ 40 ตัว ใน 12 ทัวร์นาเมนต์

ผลลัพธ์แสดงด้านล่างสรุปผลลัพธ์จาก 12 ทัวร์นาเมนต์ โดยมี 4 โทโพโลยีเครือข่ายและ 3 ทัวร์นาเมนต์ต่อโทโพโลยี

เอเย่นต์ ค่าเฉลี่ยชนะ / ทัวร์ ส่วนเบี่ยงเบนมาตรฐานชนะ / ทัวร์ ค่าเฉลี่ยแพ้ / ทัวร์ ส่วนเบี่ยงเบนมาตรฐานแพ้ / ทัวร์ ชนะทั้งหมด แพ้ทั้งหมด อัตราการชนะ
นักเรียน 1 108.167 1.193 3.833 1.193 1298 46 0.9658
นักเรียน 2 104.917 2.539 7.083 2.539 1259 85 0.9368
นักเรียน 3 103.917 2.466 8.083 2.466 1247 97 0.9278
นักเรียน 4 103.25 1.815 8.75 1.815 1239 105 0.9219
นักเรียน 5 96.5 2.908 15.5 2.908 1158 186 0.8616
LLM(O, IR, 1) 95.417 2.314 16.583 2.314 1145 199 0.8519
LLM(O, A2, 1) 94.583 2.314 17.417 2.314 1135 209 0.8445
นักเรียน 6 93.167 1.899 18.833 1.899 1118 226 0.8318
นักเรียน 7 93.167 3.563 18.833 3.563 1118 226 0.8318
LLM(O, A1, 1) 86.083 3.029 25.917 3.029 1033 311 0.7686
LLM(O, GEN, 2) 84.083 6.947 27.917 6.947 1009 335 0.7507
LLM(O, CR, 2) 83.5 4.442 28.5 4.442 1002 342 0.7455
นักเรียน 8 83.417 4.122 28.583 4.122 1001 343 0.7448
RiskSeeking 82.417 3.343 29.583 3.343 989 355 0.7359
LLM(O, GEN, 1) 80.667 4.355 31.25 4.372 968 375 0.7208
ModelOpponent 80.583 3.26 31.417 3.26 967 377 0.7195
LLM(D, A1, 1) 79.417 3.965 32.583 3.965 953 391 0.7091
ExpCostFixedBid 77.167 4.951 34.833 4.951 926 418 0.689
LLM(O, IR, 2) 73.917 3.502 38 3.618 887 456 0.6605
LLM(O, A1, 2) 72.417 2.193 39.583 2.193 869 475 0.6466
LLM(G, A1, 2) 68.5 3.555 43.5 3.555 822 522 0.6116
LLM(A, GEN, 2) 67.917 2.968 44.083 2.968 815 529 0.6064
LLM(G, IR, 2) 65.917 2.314 46.083 2.314 791 553 0.5885
นักเรียน 9 64.167 11.044 47.833 11.044 770 574 0.5729
LLM(G, A1, 1) 64 4.243 47.917 4.316 768 575 0.5719
LLM(G, IR, 1) 60.333 3.725 51.667 3.725 724 620 0.5387
LLM(O, A2, 2) 59.333 4.499 52.667 4.499 712 632 0.5298
LLM(D, CR, 1) 55.083 6.694 56.833 6.59 661 682 0.4922
LLM(G, GEN, 2) 53.167 3.664 58.833 3.664 638 706 0.4747
LLM(D, GEN, 2) 52.083 9.06 59.917 9.06 625 719 0.465
Honest 50.583 3.848 61.417 3.848 607 737 0.4516
นักเรียน 10 48.833 2.98 63.167 2.98 586 758 0.436
LLM(D, IR, 1) 48.583 10.211 63.417 10.211 583 761 0.4338
LLM(A, A1, 1) 48 4.69 64 4.69 576 768 0.4286
LLM(G, A2, 1) 47.25 3.864 64.75 3.864 567 777 0.4219
LLM(A, CR, 1) 43.833 4.609 68.167 4.609 526 818 0.3914
LLM(A, A1, 2) 43.75 2.05 68.25 2.05 525 819 0.3906
นักเรียน 11 42.083 5.664 69.917 5.664 505 839 0.3757
LLM(A, IR, 1) 39.5 2.541 72.5 2.541 474 870 0.3527
Naive 36.75 1.712 75.25 1.712 441 903 0.3281
นักเรียน 12 36.333 1.775 75.667 1.775 436 908 0.3244
LLM(D, A2, 1) 33.917 2.193 78.083 2.193 407 937 0.3028
LLM(A, GEN, 1) 30.167 1.749 81.833 1.749 362 982 0.2693
LLM(D, A2, 2) 29.833 2.038 82.167 2.038 358 986 0.2664
LLM(G, A2, 2) 27 2.256 85 2.256 324 1020 0.2411
LLM(A, A2, 1) 26.333 0.985 85.667 0.985 316 1028 0.2351
LLM(O, CR, 1) 25 3.411 87 3.411 300 1044 0.2232
LLM(A, IR, 2) 24.333 8.542 87.667 8.542 292 1052 0.2173
LLM(A, A2, 2) 24 1.809 88 1.809 288 1056 0.2143
LLM(A, CR, 2) 23.333 1.557 88.667 1.557 280 1064 0.2083
LLM(D, GEN, 1) 22.5 1.784 89.5 1.784 270 1074 0.2009
LLM(D, A1, 2) 13.333 1.826 98.667 1.826 160 1184 0.119
LLM(G, CR, 1) 9.5 1.087 102.5 1.087 114 1230 0.0848
LLM(G, GEN, 1) 9.167 0.937 102.833 0.937 110 1234 0.0818
LLM(D, IR, 2) 7.75 0.622 104.25 0.622 93 1251 0.0692
LLM(G, CR, 2) 7.25 1.422 104.75 1.422 87 1257 0.0647
LLM(D, CR, 2) 5.667 0.985 106.333 0.985 68 1276 0.0506

สำหรับบริบท แต่ละเอเย่นต์เล่น 112 นัดต่อนัด ดังนั้นค่าเฉลี่ยสูงสุดที่เป็นไปได้สำหรับการชนะหรือแพ้ต่อนัดคือ 112 ส่วนเบี่ยงเบนมาตรฐาน (SD) สะท้อนถึงความแปรผันระหว่างทัวร์นาเมนต์ เอเย่นต์ที่เขียนด้วยมือจะแสดงเป็นตัวหนา เอเย่นต์ที่เข้ารหัสสัญชาติจะแสดงด้วยตัวอักษร LLM แหล่งที่มา

สรุป

ผู้เขียนสังเกตเห็นว่าเข้ารหัสสัญชาติได้เพิ่มขีดความสามารถให้กับบุคคลทุกคน และอธิบายว่าเป็นพลังที่เท่าเทียมกัน แต่พวกเขาก็ชี้ให้เห็นว่าเนื่องจากเข้ารหัสสัญชาติเพิ่งมาถึง จึงไม่ทราบขีดจำกัดและอาจสูงกว่าที่คาดไว้

พวกเขาได้สรุปผลงานโดยการเรียกร้องให้มีการเปลี่ยนเป้าหมายจาก “รหัสที่คอมไพล์” เป็น “รหัสที่แข่งขัน”

คำถามหนึ่งที่ผู้อ่านอาจมีต่อกระดาษนี้คือว่าผู้เขียนกำลังต่อสู้กับใคร เนื่องจากงานที่ต้องทำนั้นซับซ้อนและยุ่งยากกว่าการสร้างสคริปต์ PowerShell และฟังก์ชันการแก้ปัญหาเล็กๆ น้อยๆ ที่เข้ารหัสสัญชาติเหมาะสม

* โปรดทราบว่ากระดาษนี้อ้างถึง ‘DeepThink R1’ อย่างต่อเนื่อง ซึ่งดูเหมือนจะไม่มีอยู่จริง และปรากฏเฉพาะในอินเทอร์เน็ตเพียงไม่กี่รายการ (อาจเป็นเพราะผู้เขียนอื่นๆ เขียน ‘DeepSeek R1’ ผิด) หากเป็นข้อผิดพลาดของฉัน โปรดติดต่อฉันผ่านรายละเอียดโปรไฟล์ของฉัน และฉันจะแก้ไข

เผยแพร่ครั้งแรกวันพุธที่ 26 พฤศจิกายน 2025 แก้ไข 17:35 น. สำหรับการจัดรูปแบบ

นักเขียนเกี่ยวกับการเรียนรู้ของเครื่องจักร และผู้เชี่ยวชาญด้านสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
พอร์ตโฟลิโอ: martinanderson.ai
ติดต่อ: [email protected]