Anderson의 관점

2020년 인간 코드, 대형 언어 모델 이전에 작성된 코드가 바이브 코딩 에이전트를 테스트에서 물리치다

mm
Unite.AI를 Google의 선호 소스에 추가
AI-generated image: a Victorian coach and horses winning formula 1 against modern race car competitors. gpt-image-1.

매치에서 테스트되었으며, 대형 언어 모델 이전에 작성된 대학원생 코드에 패배하였다. 영국에서 진행된 새로운 연구에서 연구자들은 인간 코딩 에이전트와

 

ChatGPT 및 기타 바이브 코딩 도구는 거의 40,000번의 바이브 코딩 에이전트와 후자의 사례를 비교했습니다.최신 대형 언어 모델(Large Language Models, LLMs)을 사용하여 개발하였다. 연구 결과, 대형 언어 모델을 사용하지 않고 개발된 에이전트들이 훨씬 더 우수한 성능을 보였다. 두 집단의 에이전트는 스위스 연방 기술 연구소의 인공지능 연구소에서 다른 세대의 학생들이 개발하였다. 비-인공지능 에이전트는 2020년에 개발되었으며, 이는 ChatGPT와 LLM 혁명의 시작 이전이었다. 새로운 에이전트들은 현재의 학생들이 개발하였으며, 최신의 최고의 LLMs를 사용하였다. 게임을 조작하여도, 바이브 코딩 솔루션은 승리할 수 없었다. 상위 5개의 자리는 일관되게 ‘원시’ 에이전트가 차지하였으며, 대부분의 LLM 에이전트(33개 중 40개)는 ‘매우 간단한’ 기준 에이전트에 의해 쉽게 패배하였다. 이는 38,304개의 도전 과정을 통해, 다양한 변수와 상황에서

진행된 토너먼트에서 나타난 결과이다. 이 논문은 다음과 같이 말한다: ‘우리의 연구는 최신의 LLMs가 코드를 생성할 수 있지만, 생성된 솔루션은 인간이 설계한 솔루션에 비해 경쟁력이 떨어진다는

기준을 개발하여 코드 합성의 이유를 강조하는 것을 목표로 한다.’ ‘우리의 벤치마크에서, 좋은 솔루션을 제시해도, LLM은 여전히 이를 사용할 수

것을 보여준다. 즉, 전략적 계획, 최적화, 또는 다중 에이전트 경쟁과 같은 차원에서.’ 도전 과제는 경매에 참여하여, 다양한 전략을 사용하여, 이긴 항목을 승자에게 전달하는 로직을 구축하는 것이었다. 연구자들은 LLMs에게 여러 가지 이점을 주었지만, 그럼에도 불구하고 LLMs는 인간 코딩 에이전트에 패배하였다: ‘따라서, 이 연구는 새로운 코드 생성의 전위를 강조하며, 벤치마크, 데이터셋, 및 오픈 소스

없다.’ 테스트에 사용된 LLMs는 GPT-5 Thinking, Gemini 2.5 Pro, Claude Opus 4.1,

결과는 또한 복잡한 시나리오에서 맥락 내 학습과 검색 보강 문제 해결의 한계에 대한 흥미로운

및 DeepSeek R1*이었다. ‘이 미래 연구 질문을 제기한다.’ 새로운 논문 은 으로 제목이 붙여져 있으며, 사우스햄프턴 대학교와 이길 수 있는가? LLM 대 인간 코딩 토너먼트에 대한 시장 주도적옥스포드 대학교 및 앨런 튜링 연구소의 연구자들이 참여하였다. 벤치마크는 곧 공개될 예정이다. 바이브 코딩이 대학원생 코드를 전략계획

방법

연구자들은 전통적인 테스트는 이진 솔루션(정확 또는 부정확)을 가지는 도전과제에 초점을 맞추고 있음을 지적한다. 그러나 이 접근법은 LLM-보조 코드의 한계를 탐구하기에 이상적이지 않다. 따라서

표준적인 유닛 테스트 기반 접근 방식(위)과 연구자들이 설계한 더 개방적인 도전 과제 시나리오(아래)의 비교. 연구자들은 더 복잡한 도전 과제를 설계하였다. 표준적인 유닛 테스트기반 접근 방식(위)과 연구자들이 설계한 더 개방적인 도전 과제 시나리오(아래)의 비교. 출처 경매, 픽업, 및 배달 문제(Auction, Pickup and Delivery Problem, APDP)는 연구자들의 연구에 사용되었다. 이 문제는 부분적으로 스위스 대학의 2020년 학생 작품을 사용할 수 있었기 때문에 선택되었다. 연구자들은 인기 있는 테스트 프레임워크를 피하려고 하였다. 이 프레임워크는 데이터 오염의문제를 겪을 수 있다. APDP는 두 단계의 로지스틱 문제로 구성되며, 역방향 경매와 차량 경로 설정이 포함된다. 첫 번째 단계에서는 에이전트들이 배달 작업을 위해 입찰하며, 두

토너먼트에 사용된 단순화된 도로 네트워크: 영국(왼쪽 위), 스위스(오른쪽 위), 네덜란드(왼쪽 아래), 프랑스(오른쪽 아래). 파란색과 빨간색 사각형은 픽업 및 배달 작업을 표시합니다. 색상이 있는 삼각형은 요원 차량의 현재 위치를 나타냅니다. 번째 단계에서는 에이전트들이 이긴 작업을 효율적으로 계획하여 수행해야 한다. 에이전트들의

목표는 작업을 완수하는 것이 아니라, 작업을 묶어 함께 수행하여 최대 이익을 얻는 것이다. APDP 벤치마크는 코드 생성 과제의 난이도를 높이며, 전략적 계획과 다중 에이전트 경쟁을 포함한다. 이 문제의 핵심은 NP-하드 문제로, 즉 알고리즘이 합리적인 시간 내에 최적의 솔루션을 찾을 수 없다. 따라서 에이전트들은 정밀도를 속도와 교환해야 한다.

경쟁이 시작되었다

연구자들의 평가에서는 40개의 LLM-코딩 에이전트와 17개의 인간-코딩 에이전트를 비교하였다. 각 에이전트는 다른 네 가지 도로 네트워크 토폴로지에서 두 번씩 경쟁하였다. 이 설정은 총 38,304개의 매치를 생성하였다. 각 매치에서는 50개의 배달 작업이 경매되었으며, 작업은 무작위로 도로 레이아웃에 할당되었다. 토너먼트에서 사용된 간소화된 도로 네트워크: 영국(상단 왼쪽), 스위스(상단 오른쪽), 네덜란드(하단 왼쪽), 프랑스(하단 오른쪽). 파란색과 빨간색 사각형은 픽업과 배달 작업을 나타낸다. 색상

토너먼트에서 사용된 간소화된 도로 네트워크: 영국(상단 왼쪽), 스위스(상단 오른쪽), 네덜란드(하단 왼쪽), 프랑스(하단 오른쪽). 파란색과 빨간색 사각형은 픽업과 배달 작업을 나타낸다. 색상 삼각형은 에이전트의 차량 위치를 나타낸다. 삼각형은 에이전트의 차량 위치를 나타낸다. 학생 에이전트들은 2020년 코스 토너먼트에서 선정되었다. 8개의 에이전트는 단일 탈락 토너먼트의 상위 수행자로부터 선정되었으며, 4개의 에이전트는 기준 에이전트와의

대결에서 강한 성과를 보인 에이전트들로부터 선정되었다. 기준 에이전트들은 고정된 휴리스틱을 따랐다. 는 총 거리를 계산하고 입찰하였다. 나이브 는 10개의 무작위 작업을 시뮬레이션하고 평균 변동 비용을 어머니 입찰하였다. ExpCostFixedBid 는 실제 변동 비용을 계산하였다. 입찰을 는 동일한 작업을 수행하였으며, 최대 하였다. 모델 오포넌트 은 시간 감소하는 이전과 LLM-코딩 실시간 비용 추정을 결합하여 입찰하였다. 리스크 시킹 평가는 40개의 시작하는 에이전트가 포함되었습니다. 각 모델에는 다섯 가지 전략이 주어졌습니다. 두 가지 전략은 정적 프롬프트를 사용했고, 다른 하나는 모델이 자체 출력을 수정할 수 있도록 했습니다. 마지막 전략은 GPT-4를 사용하여 이전 접근 방식을 검토하여 새로운 프롬프트를 생성했습니다. 기본 프롬프트는 원래 학생 과제를 반영했으며, 모델에게 이익을 극대화하도록 입찰 및 계획을 세우도록 지시했습니다. 모든 LLM 에이전트는 스스로 버그를 수정하도록 지시받았습니다. 일반적인 LLM 실패에는 시간 초과, 작업 완료 또는 전달 실패, 차량 용량 제한 위반 등이 포함되었습니다. 또한 LLM이 버그를 일관되게 수정하지 않는 경우(주로 Gemini, Claude 및 DeepSeek에서)도 발견했습니다. 예를 들어, 에이전트는 버그를 수정하도록 여러 번(예: 5~15회) 지시받았음에도 불구하고 지속적으로 시간 초과되거나 업데이트된 코드 버전을 받았습니다. 결과는 12개의 더블 라운드 로빈 방식으로 요약되었습니다.토너먼트.’이런 상황에서는 처음부터 다시 시작하는 것 외에는 해결책이 없습니다.’것이다.

우리는 버그가 없는 코드를 얻기 위해 상당히 많은 에이전트를 생성해야 했다.’ 에이전트 평균 승리 수/토너먼트 표준 편차

승리 수/토너먼트 평균 패배 수/토너먼트 표준 편차 패배 수/토너먼트 총 승리 수 총 패배 수 승률 학생

3 103.917 2.466 8.083 2.466 1247 97 0.9278 학생 4 103.25 1.815 0.9368 학생0.9219 학생 5 96.5 8.75 1.815 1239 1052.908 15.5 2.908 1158 186 0.8616 LLM(O, IR, 1)

1 108.167 1.193 3.833 1.193 1298 46 0.9658 학생 2 104.917 2.539 7.083 2.539 1259 85

95.417 2.314 16.583 2.314 1145 199 0.8519 LLM(O, A2, 1)
94.583 2.314 17.417 2.314 1135 209 0.8445 학생
6 93.167 1.899 18.833 1.899 1118 226 0.8318
학생 7 93.167 3.563 18.833 3.563 1118
226 0.8318 LLM(O, A1, 1) 86.083 3.029 25.917
3.029 1033 311 0.7686 LLM(O, GEN, 2) 84.083
6.947 27.917 6.947 1009 335 0.7507 LLM(O, CR, 2)
83.5 4.442 28.5 4.442 1002 342 0.7455 학생 8
83.417 4.122 28.583 4.122 1001 343 0.7448 RiskSeeking
82.417 3.343 29.583 3.343 989 355 0.7359 LLM(O,
GEN, 1) 80.667 4.355 31.25 4.372 968 375 0.7208
ModelOpponent 80.583 3.26 31.417 3.26 967 377 0.7195 LLM(D,
A1, 1) 79.417 3.965 32.583 3.965 953 391 0.7091
ExpCostFixedBid 77.167 4.951 34.833 4.951 926 418 0.689
LLM(O, IR, 2) 73.917 3.502 38 3.618
887 456 0.6605 LLM(O, A1, 2) 72.417 2.193 39.583
2.193 869 475 0.6466 LLM(G, A1, 2)
68.5 3.555 43.5 3.555 822 522 0.6116 LLM(A, GEN,
2) 67.917 2.968 44.083 2.968 815 529
0.6064 LLM(G, IR, 2) 65.917 2.314 46.083 2.314 791
553 0.5885 학생 9 64.167 11.044 47.833 11.044 770
574 0.5729 LLM(G, A1, 1) 64 4.243 47.917 4.316
768 575 0.5719 LLM(G, IR, 1) 60.333 3.725 51.667
3.725 724 620 0.5387 LLM(O, A2, 2) 59.333 4.499
52.667 4.499 712 632 0.5298 LLM(D, CR, 1)
55.083 6.694 56.833 6.59 661 682 0.4922 LLM(G,
GEN, 2) 53.167 3.664 58.833 3.664 638 706 0.4747
LLM(D, GEN, 2) 52.083 9.06 59.917 9.06 625 719
0.465 Honest 50.583 3.848 61.417 3.848 607 737 0.4516
학생 10 48.833 2.98 63.167 2.98 586 758 0.436
LLM(D, IR, 1) 48.583 10.211 63.417 10.211 583 761
0.4338 LLM(A, A1, 1) 48 4.69 64
4.69 576 768 0.4286 LLM(G, A2, 1) 47.25
3.864 64.75 3.864 567 777 0.4219 LLM(A, CR, 1)
43.833 4.609 68.167 4.609 526 818 0.3914 LLM(A,
A1, 2) 43.75 2.05 68.25 2.05 525 819 0.3906
학생 11 42.083 5.664 69.917 5.664 505 839 0.3757
LLM(A, IR, 1) 39.5 2.541 72.5 2.541 474 870
0.3527 Naive 36.75 1.712 75.25 1.712 441 903
0.3281 학생 12 36.333 1.775 75.667 1.775 436 908
0.3244 LLM(D, A2, 1) 33.917 2.193 78.083
2.193 407 937 0.3028 LLM(A, GEN, 1) 30.167
1.749 81.833 1.749 362 982 0.2693 LLM(D, A2, 2)
29.833 2.038 82.167 2.038 358 986 0.2664 LLM(G, A2,
2) 27 2.256 85 2.256 324 1020 0.2411 LLM(A,
A2, 1) 26.333 0.985 85.667 0.985 316 1028
0.2351 LLM(O, CR, 1) 25 3.411 87 3.411
300 1044 0.2232 LLM(A, IR, 2) 24.333 8.542
87.667 8.542 292 1052 0.2173 LLM(A, A2, 2) 24
1.809 88 1.809 288 1056 0.2143 LLM(A, CR,
2) 23.333 1.557 88.667 1.557 280 1064 0.2083 LLM(D,
GEN, 1) 22.5 1.784 89.5 1.784 270 1074 0.2009
LLM(D, A1, 2) 13.333 1.826 98.667 1.826 160 1184
0.119 LLM(G, CR, 1) 9.5 1.087 102.5 1.087 114
1230 0.0848 LLM(G, GEN, 1) 9.167 0.937 102.833 0.937
110 1234 0.0818 LLM(D, IR, 2) 7.75 0.622 104.25
0.622 93 1251 0.0692 LLM(G, CR, 2) 7.25 1.422
104.75 1.422 87 1257 0.0647 LLM(D, CR, 2) 5.667

0.985 106.333 0.985 68 1276 0.0506 각 에이전트는 112번의 매치를 수행하였으므로, 평균 승리 또는 패배 수의 최대값은 112이다. 표준 편차는 토너먼트 간의 변동성을 반영한다. 인간 코딩 에이전트는 볼드체로 표시되어 있다. LLM-코딩 에이전트는 모델(GPT-5 Thinking, Gemini 2.5 Pro, Claude Opus 4.1, DeepSeek R1)을 나타내는 문자와 두 자리 문자 표시된다.

코드 및 생성된 에이전트 번호로위의

결과에 대해 연구자들은 다음과 같이 말한다: 출처 ‘LLMs는 기대되는 코드를 생성하지 못했다. 이것은 LLMs의 새로운 약점을 강조한다.’ ‘우리의 결과는 인간 코딩 에이전트의 명확한 우위를 보여준다.

상위 5개의 자리는 일관되게 학생 에이전트가 대부분의 LLM 에이전트(33개 중 40개)는차지하며, 의해 패배한다.’ 추가 실험으로, GPT-5 Thinking은 최상위 수행 에이전트인 매우 간단한 기준 에이전트에

충돌할 때마다, 우리는 자동으로 LLM 에이전트에게 승리를 주었다. 많은 충돌은 쉽게 수정할 수 있었을 것이다. 따라서 학생 에이전트는 잠재적으로 더 높은 순위를 차지할 수 있었다.’ 의 코드를 개선하도록 프롬프트되었다. 그러나 LLM-수정된 에이전트는 학생 에이전트가10위로

‘또한 우리는 학생 코드를 디버깅하지 않았으며, LLM 코드를 철저히 테스트하고 디버깅하였다. 결론을 내린다:떨어졌으며, 이는 모든 인간 에이전트 중 가장 낮은 순위였다. LLM의 변경은 원래 솔루션을 약 20% 낮췄다. 연구자들은 다음과 같이

학생 1 ‘우리의 결과는 LLM 코드 생성의 중요성을 강조한다. 그러나 LLMs는 여전히 코드 생성의 한계를 가지고 있다. 우리는 코드가 컴파일되는 것보다 코드가 경쟁하는 것을 목표로 해야 한다.’

결론

연구자들은 바이브 코딩이 기술적 배경에 관계없이 모든 사람에게 힘을 실어준다는 점에서 긍정적이라고 생각합니다.그러나 바이브 코딩의 한계는 아직 알려지지 않았으며, 현실적으로 기대되는 것보다 더 높을 수도 있습니다. 그들은 논문을 마무리하면서 ‘ ‘의 목표를 설정합니다. 컴파일된 코드에서않는 것으로 보인다. 이는경쟁하는 코드로 이 논문을 읽는 독자들은 연구자들이 강력한 도전 과제를 설정했는지, 아니면 너무 약한 도전 과제를 설정했는지 궁금해할 수 있다. * 논문은 ‘DeepThink R1’을 계속 언급하지만, 이는 존재하지 다른 저자들이 ‘DeepSeek R1’을 잘못 작성한 것으로 추정된다. 이것이 나의 오류라면, 프로필 세부 정보를 통해 연락주시기 바랍니다. 그리고 나는 이를 수정할 것입니다. † 저자의 강조, 나의 것이 아님.

最初에 2025년 11월

26일에 게시되었으며, 17:35 EST에 형식으로 수정되었습니다.

머신러닝 분야 작가이자 인간 이미지 합성 도메인 전문가. Metaphysic.ai에서 연구 콘텐츠 책임자를 역임했으며, DNEG의 Brahma.ai로 통합될 때까지 근무했습니다.
웹사이트: martinanderson.ai
연락처: martin@martinanderson.ai