Anderson의 관점
2020년 인간 코드, 대형 언어 모델 이전에 작성된 코드가 바이브 코딩 에이전트를 테스트에서 물리치다

매치에서 테스트되었으며, 대형 언어 모델 이전에 작성된 대학원생 코드에 패배하였다. 영국에서 진행된 새로운 연구에서 연구자들은 인간 코딩 에이전트와
ChatGPT 및 기타 바이브 코딩 도구는 거의 40,000번의 바이브 코딩 에이전트와 후자의 사례를 비교했습니다.최신 대형 언어 모델(Large Language Models, LLMs)을 사용하여 개발하였다. 연구 결과, 대형 언어 모델을 사용하지 않고 개발된 에이전트들이 훨씬 더 우수한 성능을 보였다. 두 집단의 에이전트는 스위스 연방 기술 연구소의 인공지능 연구소에서 다른 세대의 학생들이 개발하였다. 비-인공지능 에이전트는 2020년에 개발되었으며, 이는 ChatGPT와 LLM 혁명의 시작 이전이었다. 새로운 에이전트들은 현재의 학생들이 개발하였으며, 최신의 최고의 LLMs를 사용하였다. 게임을 조작하여도, 바이브 코딩 솔루션은 승리할 수 없었다. 상위 5개의 자리는 일관되게 ‘원시’ 에이전트가 차지하였으며, 대부분의 LLM 에이전트(33개 중 40개)는 ‘매우 간단한’ 기준 에이전트에 의해 쉽게 패배하였다. 이는 38,304개의 도전 과정을 통해, 다양한 변수와 상황에서
진행된 토너먼트에서 나타난 결과이다. 이 논문은 다음과 같이 말한다: ‘우리의 연구는 최신의 LLMs가 코드를 생성할 수 있지만, 생성된 솔루션은 인간이 설계한 솔루션에 비해 경쟁력이 떨어진다는
기준을 개발하여 코드 합성의 이유를 강조하는 것을 목표로 한다.’ ‘우리의 벤치마크에서, 좋은 솔루션을 제시해도, LLM은 여전히 이를 사용할 수
것을 보여준다. 즉, 전략적 계획, 최적화, 또는 다중 에이전트 경쟁과 같은 차원에서.’ 도전 과제는 경매에 참여하여, 다양한 전략을 사용하여, 이긴 항목을 승자에게 전달하는 로직을 구축하는 것이었다. 연구자들은 LLMs에게 여러 가지 이점을 주었지만, 그럼에도 불구하고 LLMs는 인간 코딩 에이전트에 패배하였다: ‘따라서, 이 연구는 새로운 코드 생성의 전위를 강조하며, 벤치마크, 데이터셋, 및 오픈 소스
없다.’ 테스트에 사용된 LLMs는 GPT-5 Thinking, Gemini 2.5 Pro, Claude Opus 4.1,
결과는 또한 복잡한 시나리오에서 맥락 내 학습과 검색 보강 문제 해결의 한계에 대한 흥미로운
및 DeepSeek R1*이었다. ‘이 미래 연구 질문을 제기한다.’ 새로운 논문 은 으로 제목이 붙여져 있으며, 사우스햄프턴 대학교와 이길 수 있는가? LLM 대 인간 코딩 토너먼트에 대한 시장 주도적옥스포드 대학교 및 앨런 튜링 연구소의 연구자들이 참여하였다. 벤치마크는 곧 공개될 예정이다. 바이브 코딩이 대학원생 코드를 전략계획
방법
연구자들은 전통적인 테스트는 이진 솔루션(정확 또는 부정확)을 가지는 도전과제에 초점을 맞추고 있음을 지적한다. 그러나 이 접근법은 LLM-보조 코드의 한계를 탐구하기에 이상적이지 않다. 따라서


목표는 작업을 완수하는 것이 아니라, 작업을 묶어 함께 수행하여 최대 이익을 얻는 것이다. APDP 벤치마크는 코드 생성 과제의 난이도를 높이며, 전략적 계획과 다중 에이전트 경쟁을 포함한다. 이 문제의 핵심은 NP-하드 문제로, 즉 알고리즘이 합리적인 시간 내에 최적의 솔루션을 찾을 수 없다. 따라서 에이전트들은 정밀도를 속도와 교환해야 한다.
경쟁이 시작되었다
연구자들의 평가에서는 40개의 LLM-코딩 에이전트와 17개의 인간-코딩 에이전트를 비교하였다. 각 에이전트는 다른 네 가지 도로 네트워크 토폴로지에서 두 번씩 경쟁하였다. 이 설정은 총 38,304개의 매치를 생성하였다. 각 매치에서는 50개의 배달 작업이 경매되었으며, 작업은 무작위로 도로 레이아웃에 할당되었다. 토너먼트에서 사용된 간소화된 도로 네트워크: 영국(상단 왼쪽), 스위스(상단 오른쪽), 네덜란드(하단 왼쪽), 프랑스(하단 오른쪽). 파란색과 빨간색 사각형은 픽업과 배달 작업을 나타낸다. 색상

대결에서 강한 성과를 보인 에이전트들로부터 선정되었다. 기준 에이전트들은 고정된 휴리스틱을 따랐다. 는 총 거리를 계산하고 입찰하였다. 나이브 는 10개의 무작위 작업을 시뮬레이션하고 평균 변동 비용을 어머니 입찰하였다. ExpCostFixedBid 는 실제 변동 비용을 계산하였다. 입찰을 는 동일한 작업을 수행하였으며, 최대 하였다. 모델 오포넌트 은 시간 감소하는 이전과 LLM-코딩 실시간 비용 추정을 결합하여 입찰하였다. 리스크 시킹 평가는 40개의 시작하는 에이전트가 포함되었습니다. 각 모델에는 다섯 가지 전략이 주어졌습니다. 두 가지 전략은 정적 프롬프트를 사용했고, 다른 하나는 모델이 자체 출력을 수정할 수 있도록 했습니다. 마지막 전략은 GPT-4를 사용하여 이전 접근 방식을 검토하여 새로운 프롬프트를 생성했습니다. 기본 프롬프트는 원래 학생 과제를 반영했으며, 모델에게 이익을 극대화하도록 입찰 및 계획을 세우도록 지시했습니다. 모든 LLM 에이전트는 스스로 버그를 수정하도록 지시받았습니다. 일반적인 LLM 실패에는 시간 초과, 작업 완료 또는 전달 실패, 차량 용량 제한 위반 등이 포함되었습니다. 또한 LLM이 버그를 일관되게 수정하지 않는 경우(주로 Gemini, Claude 및 DeepSeek에서)도 발견했습니다. 예를 들어, 에이전트는 버그를 수정하도록 여러 번(예: 5~15회) 지시받았음에도 불구하고 지속적으로 시간 초과되거나 업데이트된 코드 버전을 받았습니다. 결과는 12개의 더블 라운드 로빈 방식으로 요약되었습니다.토너먼트.’이런 상황에서는 처음부터 다시 시작하는 것 외에는 해결책이 없습니다.’것이다.
우리는 버그가 없는 코드를 얻기 위해 상당히 많은 에이전트를 생성해야 했다.’ 에이전트 평균 승리 수/토너먼트 표준 편차
승리 수/토너먼트 평균 패배 수/토너먼트 표준 편차 패배 수/토너먼트 총 승리 수 총 패배 수 승률 학생
3 103.917 2.466 8.083 2.466 1247 97 0.9278 학생 4 103.25 1.815 0.9368 학생0.9219 학생 5 96.5 8.75 1.815 1239 1052.908 15.5 2.908 1158 186 0.8616 LLM(O, IR, 1)
1 108.167 1.193 3.833 1.193 1298 46 0.9658 학생 2 104.917 2.539 7.083 2.539 1259 85
| 95.417 2.314 | 16.583 2.314 | 1145 | 199 0.8519 | LLM(O, | A2, | 1) | |
|---|---|---|---|---|---|---|---|
| 94.583 | 2.314 | 17.417 | 2.314 | 1135 | 209 | 0.8445 | 학생 |
| 6 | 93.167 | 1.899 | 18.833 | 1.899 | 1118 | 226 0.8318 | |
| 학생 | 7 | 93.167 | 3.563 | 18.833 | 3.563 | 1118 | |
| 226 0.8318 | LLM(O, | A1, | 1) | 86.083 | 3.029 | 25.917 | |
| 3.029 | 1033 311 | 0.7686 | LLM(O, | GEN, | 2) | 84.083 | |
| 6.947 27.917 | 6.947 1009 | 335 | 0.7507 | LLM(O, | CR, | 2) | |
| 83.5 4.442 | 28.5 | 4.442 1002 | 342 | 0.7455 | 학생 | 8 | |
| 83.417 | 4.122 | 28.583 | 4.122 1001 | 343 | 0.7448 | RiskSeeking | |
| 82.417 | 3.343 | 29.583 | 3.343 | 989 355 | 0.7359 | LLM(O, | |
| GEN, 1) | 80.667 | 4.355 | 31.25 | 4.372 968 | 375 | 0.7208 | |
| ModelOpponent 80.583 | 3.26 | 31.417 | 3.26 | 967 377 | 0.7195 | LLM(D, | |
| A1, 1) | 79.417 | 3.965 | 32.583 | 3.965 | 953 | 391 | 0.7091 |
| ExpCostFixedBid | 77.167 | 4.951 | 34.833 | 4.951 | 926 | 418 0.689 | |
| LLM(O, | IR, | 2) 73.917 | 3.502 | 38 | 3.618 | ||
| 887 456 | 0.6605 | LLM(O, | A1, | 2) 72.417 | 2.193 | 39.583 | |
| 2.193 869 | 475 | 0.6466 | LLM(G, | A1, | 2) | ||
| 68.5 3.555 | 43.5 3.555 | 822 | 522 | 0.6116 | LLM(A, | GEN, | |
| 2) | 67.917 | 2.968 | 44.083 | 2.968 | 815 | 529 | |
| 0.6064 LLM(G, IR, | 2) | 65.917 | 2.314 46.083 | 2.314 | 791 | ||
| 553 0.5885 | 학생 | 9 | 64.167 | 11.044 47.833 | 11.044 | 770 | |
| 574 0.5729 | LLM(G, | A1, | 1) | 64 4.243 | 47.917 | 4.316 | |
| 768 575 | 0.5719 | LLM(G, | IR, | 1) | 60.333 | 3.725 | 51.667 |
| 3.725 724 | 620 | 0.5387 | LLM(O, | A2, | 2) | 59.333 | 4.499 |
| 52.667 | 4.499 | 712 | 632 | 0.5298 | LLM(D, | CR, 1) | |
| 55.083 6.694 | 56.833 | 6.59 661 | 682 | 0.4922 | LLM(G, | ||
| GEN, 2) | 53.167 | 3.664 | 58.833 3.664 | 638 | 706 | 0.4747 | |
| LLM(D, GEN, | 2) | 52.083 | 9.06 59.917 | 9.06 | 625 | 719 | |
| 0.465 Honest | 50.583 | 3.848 | 61.417 3.848 | 607 | 737 | 0.4516 | |
| 학생 10 | 48.833 | 2.98 | 63.167 2.98 | 586 | 758 | 0.436 | |
| LLM(D, IR, | 1) | 48.583 | 10.211 | 63.417 10.211 | 583 | 761 | |
| 0.4338 LLM(A, | A1, | 1) | 48 | 4.69 | 64 | ||
| 4.69 | 576 | 768 0.4286 | LLM(G, | A2, | 1) | 47.25 | |
| 3.864 64.75 | 3.864 | 567 | 777 0.4219 | LLM(A, | CR, | 1) | |
| 43.833 4.609 | 68.167 | 4.609 | 526 818 | 0.3914 | LLM(A, | ||
| A1, 2) | 43.75 | 2.05 | 68.25 | 2.05 525 | 819 | 0.3906 | |
| 학생 11 | 42.083 | 5.664 | 69.917 | 5.664 505 | 839 | 0.3757 | |
| LLM(A, IR, | 1) | 39.5 | 2.541 | 72.5 2.541 | 474 | 870 | |
| 0.3527 | Naive | 36.75 | 1.712 | 75.25 | 1.712 | 441 903 | |
| 0.3281 학생 | 12 | 36.333 | 1.775 | 75.667 | 1.775 | 436 908 | |
| 0.3244 | LLM(D, | A2, 1) | 33.917 | 2.193 | 78.083 | ||
| 2.193 | 407 | 937 | 0.3028 | LLM(A, | GEN, | 1) | 30.167 |
| 1.749 81.833 | 1.749 | 362 | 982 | 0.2693 | LLM(D, | A2, | 2) |
| 29.833 2.038 | 82.167 | 2.038 | 358 | 986 | 0.2664 | LLM(G, | A2, |
| 2) 27 | 2.256 | 85 | 2.256 | 324 | 1020 | 0.2411 | LLM(A, |
| A2, 1) | 26.333 0.985 | 85.667 | 0.985 | 316 1028 | |||
| 0.2351 LLM(O, | CR, | 1) | 25 | 3.411 | 87 | 3.411 | |
| 300 1044 0.2232 | LLM(A, | IR, | 2) | 24.333 | 8.542 | ||
| 87.667 8.542 292 | 1052 | 0.2173 | LLM(A, | A2, | 2) | 24 | |
| 1.809 88 1.809 | 288 | 1056 | 0.2143 | LLM(A, | CR, | ||
| 2) 23.333 | 1.557 88.667 | 1.557 | 280 | 1064 | 0.2083 | LLM(D, | |
| GEN, 1) | 22.5 1.784 | 89.5 | 1.784 | 270 | 1074 | 0.2009 | |
| LLM(D, A1, | 2) | 13.333 1.826 | 98.667 | 1.826 | 160 | 1184 | |
| 0.119 LLM(G, | CR, | 1) 9.5 | 1.087 | 102.5 | 1.087 | 114 | |
| 1230 0.0848 | LLM(G, | GEN, 1) | 9.167 | 0.937 | 102.833 | 0.937 | |
| 110 1234 | 0.0818 | LLM(D, IR, | 2) | 7.75 | 0.622 | 104.25 | |
| 0.622 93 | 1251 | 0.0692 LLM(G, | CR, | 2) | 7.25 | 1.422 | |
| 104.75 1.422 | 87 | 1257 | 0.0647 LLM(D, | CR, | 2) | 5.667 |
0.985 106.333 0.985 68 1276 0.0506 각 에이전트는 112번의 매치를 수행하였으므로, 평균 승리 또는 패배 수의 최대값은 112이다. 표준 편차는 토너먼트 간의 변동성을 반영한다. 인간 코딩 에이전트는 볼드체로 표시되어 있다. LLM-코딩 에이전트는 모델(GPT-5 Thinking, Gemini 2.5 Pro, Claude Opus 4.1, DeepSeek R1)을 나타내는 문자와 두 자리 문자 표시된다.
코드 및 생성된 에이전트 번호로위의
결과에 대해 연구자들은 다음과 같이 말한다: 출처 ‘LLMs는 기대되는 코드를 생성하지 못했다. 이것은 LLMs의 새로운 약점을 강조한다.’ ‘우리의 결과는 인간 코딩 에이전트의 명확한 우위를 보여준다.
상위 5개의 자리는 일관되게 학생 에이전트가 대부분의 LLM 에이전트(33개 중 40개)는차지하며, 의해 패배한다.’ 추가 실험으로, GPT-5 Thinking은 최상위 수행 에이전트인 매우 간단한 기준 에이전트에
충돌할 때마다, 우리는 자동으로 LLM 에이전트에게 승리를 주었다. 많은 충돌은 쉽게 수정할 수 있었을 것이다. 따라서 학생 에이전트는 잠재적으로 더 높은 순위를 차지할 수 있었다.’ 의 코드를 개선하도록 프롬프트되었다. 그러나 LLM-수정된 에이전트는 학생 에이전트가10위로
‘또한 우리는 학생 코드를 디버깅하지 않았으며, LLM 코드를 철저히 테스트하고 디버깅하였다. 결론을 내린다:떨어졌으며, 이는 모든 인간 에이전트 중 가장 낮은 순위였다. LLM의 변경은 원래 솔루션을 약 20% 낮췄다. 연구자들은 다음과 같이
학생 1 ‘우리의 결과는 LLM 코드 생성의 중요성을 강조한다. 그러나 LLMs는 여전히 코드 생성의 한계를 가지고 있다. 우리는 코드가 컴파일되는 것보다 코드가 경쟁하는 것을 목표로 해야 한다.’
결론
연구자들은 바이브 코딩이 기술적 배경에 관계없이 모든 사람에게 힘을 실어준다는 점에서 긍정적이라고 생각합니다.그러나 바이브 코딩의 한계는 아직 알려지지 않았으며, 현실적으로 기대되는 것보다 더 높을 수도 있습니다. 그들은 논문을 마무리하면서 ‘ ‘의 목표를 설정합니다. 컴파일된 코드에서않는 것으로 보인다. 이는경쟁하는 코드로 이 논문을 읽는 독자들은 연구자들이 강력한 도전 과제를 설정했는지, 아니면 너무 약한 도전 과제를 설정했는지 궁금해할 수 있다. * 논문은 ‘DeepThink R1’을 계속 언급하지만, 이는 존재하지 다른 저자들이 ‘DeepSeek R1’을 잘못 작성한 것으로 추정된다. 이것이 나의 오류라면, 프로필 세부 정보를 통해 연락주시기 바랍니다. 그리고 나는 이를 수정할 것입니다. † 저자의 강조, 나의 것이 아님.
最初에 2025년 11월
26일에 게시되었으며, 17:35 EST에 형식으로 수정되었습니다.












