Andersonの視点
2020年から人間が書いたコードが、Vibe-Codedエージェントをアジェンティックテストで破った

ChatGPTやその他のVibe-Codingツールが約4万試合でテストされたが、大規模言語モデル(LLM)が発明される以前の2020年に大学院生が書いたコードに敗れた。
イギリスの新しい研究では、研究者は人間が書いたコードを使用したエージェントと、最新のLLMを使用して開発されたVibe-Codedエージェントを比較した。結果は、AIを使用しなかったエージェントが、AIを使用したエージェントを簡単に破ったことを示した。
両方のエージェントは、スイス連邦工科大学ローザンヌ校の異なる世代の学生によって作成された。非AIエージェントは2020年に作成されたもので、ChatGPTやLLMの革命が始まる2年前に、現在の学生によって作成されたエージェントは、利用可能な最新のLLMを使用して作成された。
試合を組むことで、Vibe-Codedソリューションは勝つことができなかった。トップ5のスポットは一貫して「生」のエージェントによって占められ、多くのLLMエージェント(40人のうち33人)は、非常にシンプルなベースラインエージェントによって容易に破られた。38,304のチャレンジ、多数の変数と状況を横断する12のトーナメントで。
論文では次のように述べられている。
‘私たちの研究は、最先端のLLMがコードを生成できる(つまり、構文エラーがない)が、生成されたソリューションは、戦略的計画、最適化、またはマルチエージェント競争などの次元で人間が設計したソリューションに比べると競争力がないことを示している。 ‘
‘したがって、この研究は、コード生成の新しいフロンティアを強調し、ベンチマーク、データセット、オープンソースのベースラインの開発を促進することを目的としている。 ‘
課題は、さまざまな戦略を使用してオークションに参加し、獲得したアイテムを勝者に配達するためのロジスティクスを整えることだった。
著者は、LLMにいくつかの利点を与えたことを指摘している。たとえば、コードに介入してパフォーマンスを向上させることができた。にもかかわらず、LLMはそれを利用できなかった。
‘[私たちの]ベンチマークでは、良いソリューションをコンテキストで公開した場合でも、LLMはそれを利用できない。 ‘
‘この結果は、複雑なシナリオでのインコンテキスト学習とリトリーバル増強問題解決の限界について、興味深い将来の研究質問を提起する。 ‘
テストに使用されたLLMは、GPT-5 Thinking、Gemini 2.5 Pro、Claude Opus 4.1、およびDeepSeek R1*だった。
新しい論文は、Can Vibe Coding Beat Graduate CS Students? An LLM vs. Human Coding Tournament on Market-driven Strategic Planningというタイトルで、サウザンプトン大学とオックスフォード大学のアラン・チューリング研究所の2人の著者によって執筆された。このベンチマークは、近くにリリースされる予定である。
方法
著者は、従来のテストは、明確に定義された二項ソリューション(正しいまたは不正しい)に焦点を当てていると主張している。ユニットテストを介して検証される。LLM支援コードの限界を探求するための理想的な方法ではないと主張し、代わりに、複数の内部ベンチマークとマイルストーンを備えた、より複雑なチャレンジシナリオを設計した。
![標準的なユニットテストベースのアプローチ(上)と、著者が設計したよりオープンなチャレンジシナリオ(下)の比較。ソース:[https://arxiv.org/pdf/2511.20613]](https://www.unite.ai/wp-content/uploads/2025/11/figure-1-2.jpg)
標準的なユニットテストベースのアプローチ(上)と、著者が設計したよりオープンなチャレンジシナリオ(下)の比較。 ソース
オークション、ピックアップ、配達問題(APDP)は、スイスの大学から2020年の学生の仕事のコーパスが利用できるため、部分的に自己選択された。したがって、現代の学生に同じ課題を与え、現在のツールを利用できるようにすることは比較的容易だった。
著者は、HumanEval、BigCodeBench、およびWebDev Arena(およびその他多数)などの人気テストフレームワークを避けることを目指した。なぜなら、このクラスのテスト手順は、データ汚染(システムがテストデータでトレーニングした場合、またはスプリットを尊重しない場合)に苦しむことが多いからである。
APDPは、逆オークションと車両ルーティングに基づく2段階のロジスティクス問題である。最初の段階では、エージェントは各タスクの実行に対して支払われるべき金額を提示して、配達タスクを獲得するために競争する。高すぎる入札はタスクを失うことを意味し、低すぎる入札はお金を失うことを意味する。
2段階目では、各エージェントは、獲得したタスクのみを実行するための効率的な計画を作成し、異なる容量とコストを持つ車両にタスクを割り当てる必要がある。時間とリソースの制約の下で。

APDPでは、企業は逆オークションで配達タスクに参加し、獲得したタスクのみを実行するために車両のルートを最適化する。目標は、タスクのバンドルを予測し、競合他社の戦略を予測することで、利益を最大化することである。
目標は、タスクを完了することだけではなく、将来の選択の風景を再定義する各入札を予測し、最大の利益を上げるタスクのバンドルを見つけることである。
APDPベンチマークは、シーケンス内の相互依存するオークションを介した戦略的計画を導入することで、コード生成タスクの難易度を高める。各入札は将来の選択の風景を再定義するため、エージェントは、直近のコストだけでなく、位置、タイミング、長期的な結果についても推論する必要がある。
コアの配達問題は、NP-hardである。つまり、アルゴリズムは、タスクの数が増加するにつれて、合理的な時間内で最適なソリューションを見つけることができない。つまり、ブルートフォースアプローチは実行不可能となり、エージェントは精度と速度のトレードオフを迫られる。
レースは始まった
著者の評価では、40のLLMコード化されたエージェントが17の人間コード化されたエージェントと対戦した。各トーナメントでは、4つの異なる道路ネットワークトポロジーを使用し、すべてのエージェントが他のすべてのエージェントと2回対戦する全対全のペアリングで対戦した。合計で38,304試合が行われた。
各試合では、50の配達タスクがオークションで競われ、ピックアップとドロップオフのポイントと重量が定義され、スイス、フランス、イギリス、オランダの道路レイアウトに基づいてランダムに抽出された。

トーナメントで使用された簡略化された道路ネットワーク:イギリス(上左)、スイス(上右)、オランダ(下左)、フランス(下右)。青と赤の正方形はピックアップとドロップオフのタスクを示し、色付きの三角形はエージェントの車両の現在の位置を示す。
学生エージェントは、2020年のコーストーナメントから選ばれた。8人はシングルエリミネーションファイナルのトップパフォーマーから選ばれ、4人はベースラインエージェントとのヘッドツーヘッドマッチでの強いパフォーマンスで選ばれた。
ベースラインエージェントは固定されたヒューリスティックに従った。 Naive は合計距離を計算し、1台の車両のみを使用してバッチングを無視して入札した。 ExpCostFixedBid は10のランダムなタスクをシミュレートし、平均の辺境コストで入札した。 Honest はタスクをスケジュールに挿入する際の実際の辺境コストを計算した。 ModelOpponent は同じことを行ったが、対戦相手のコストの推定を加算して入札した。 RiskSeeking は時間減衰の事前情報と生コスト推定および対戦相手モデリングを組み合わせて、両方のうち高い方で入札した。
評価には、GPT-5 Thinking、Claude Opus 4.1、Gemini 2.5 Pro、DeepSeek R1を使用して構築された40のLLMコード化されたエージェントが含まれた。各モデルは、5つの異なる戦略でプロンプトされ、各モデルで2回適用された。
2つの戦略では、異なる著者によって書かれた静的なプロンプトが使用され、3つ目はモデルが自分の出力を自己批評および修正するように求めた。別の戦略では、別のLLMによる批評および修正が行われた。最終的な戦略では、GPT-4がすべての前のアプローチをレビューして新しいプロンプトを生成することだった。
ベースのプロンプトは、元の学生課題を反映しており、配達環境を説明し、モデルに高複雑度の方法に頼ることなく、利益を最大化するために入札および計画するように指示していた。
すべてのLLMエージェントは、自己対戦およびトーナメント設定でテストされ、すべての観察可能なバグが修正されるまで続けられた。バグ修正は、LLM自体によって、エラー情報でプロンプトされたものだった。
論文では、次のように述べられている。
‘LLMは、シンプルなコードを生成できたが、競争力のあるコードを生成することはできなかった。 ‘
‘私たちの結果は、LLMコード生成の重要な限界を強調しており、特にコード生成における推論と計画能力の限界を示している。 ‘
テーブルは、12のダブルラウンドロビントーナメントからの結果をまとめたもので、4つのネットワークトポロジーと3つのトーナメントを網羅し、合計で約4万試合が行われた。
| エージェント | 平均勝利数/トーナメント | 標準偏差勝利数/トーナメント | 平均敗北数/トーナメント | 標準偏差敗北数/トーナメント | 合計勝利数 | 合計敗北数 | 勝率 |
|---|---|---|---|---|---|---|---|
| 学生1 | 108.167 | 1.193 | 3.833 | 1.193 | 1298 | 46 | 0.9658 |
| 学生2 | 104.917 | 2.539 | 7.083 | 2.539 | 1259 | 85 | 0.9368 |
| 学生3 | 103.917 | 2.466 | 8.083 | 2.466 | 1247 | 97 | 0.9278 |
| 学生4 | 103.25 | 1.815 | 8.75 | 1.815 | 1239 | 105 | 0.9219 |
| 学生5 | 96.5 | 2.908 | 15.5 | 2.908 | 1158 | 186 | 0.8616 |
| LLM(O, IR, 1) | 95.417 | 2.314 | 16.583 | 2.314 | 1145 | 199 | 0.8519 |
| LLM(O, A2, 1) | 94.583 | 2.314 | 17.417 | 2.314 | 1135 | 209 | 0.8445 |
| 学生6 | 93.167 | 1.899 | 18.833 | 1.899 | 1118 | 226 | 0.8318 |
| 学生7 | 93.167 | 3.563 | 18.833 | 3.563 | 1118 | 226 | 0.8318 |
| LLM(O, A1, 1) | 86.083 | 3.029 | 25.917 | 3.029 | 1033 | 311 | 0.7686 |
| LLM(O, GEN, 2) | 84.083 | 6.947 | 27.917 | 6.947 | 1009 | 335 | 0.7507 |
| LLM(O, CR, 2) | 83.5 | 4.442 | 28.5 | 4.442 | 1002 | 342 | 0.7455 |
| 学生8 | 83.417 | 4.122 | 28.583 | 4.122 | 1001 | 343 | 0.7448 |
| RiskSeeking | 82.417 | 3.343 | 29.583 | 3.343 | 989 | 355 | 0.7359 |
| LLM(O, GEN, 1) | 80.667 | 4.355 | 31.25 | 4.372 | 968 | 375 | 0.7208 |
| ModelOpponent | 80.583 | 3.26 | 31.417 | 3.26 | 967 | 377 | 0.7195 |
| LLM(D, A1, 1) | 79.417 | 3.965 | 32.583 | 3.965 | 953 | 391 | 0.7091 |
| ExpCostFixedBid | 77.167 | 4.951 | 34.833 | 4.951 | 926 | 418 | 0.689 |
| LLM(O, IR, 2) | 73.917 | 3.502 | 38 | 3.618 | 887 | 456 | 0.6605 |
| LLM(O, A1, 2) | 72.417 | 2.193 | 39.583 | 2.193 | 869 | 475 | 0.6466 |
| LLM(G, A1, 2) | 68.5 | 3.555 | 43.5 | 3.555 | 822 | 522 | 0.6116 |
| LLM(A, GEN, 2) | 67.917 | 2.968 | 44.083 | 2.968 | 815 | 529 | 0.6064 |
| LLM(G, IR, 2) | 65.917 | 2.314 | 46.083 | 2.314 | 791 | 553 | 0.5885 |
| 学生9 | 64.167 | 11.044 | 47.833 | 11.044 | 770 | 574 | 0.5729 |
| LLM(G, A1, 1) | 64 | 4.243 | 47.917 | 4.316 | 768 | 575 | 0.5719 |
| LLM(G, IR, 1) | 60.333 | 3.725 | 51.667 | 3.725 | 724 | 620 | 0.5387 |
| LLM(O, A2, 2) | 59.333 | 4.499 | 52.667 | 4.499 | 712 | 632 | 0.5298 |
| LLM(D, CR, 1) | 55.083 | 6.694 | 56.833 | 6.59 | 661 | 682 | 0.4922 |
| LLM(G, GEN, 2) | 53.167 | 3.664 | 58.833 | 3.664 | 638 | 706 | 0.4747 |
| LLM(D, GEN, 2) | 52.083 | 9.06 | 59.917 | 9.06 | 625 | 719 | 0.465 |
| Honest | 50.583 | 3.848 | 61.417 | 3.848 | 607 | 737 | 0.4516 |
| 学生10 | 48.833 | 2.98 | 63.167 | 2.98 | 586 | 758 | 0.436 |
| LLM(D, IR, 1) | 48.583 | 10.211 | 63.417 | 10.211 | 583 | 761 | 0.4338 |
| LLM(A, A1, 1) | 48 | 4.69 | 64 | 4.69 | 576 | 768 | 0.4286 |
| LLM(G, A2, 1) | 47.25 | 3.864 | 64.75 | 3.864 | 567 | 777 | 0.4219 |
| LLM(A, CR, 1) | 43.833 | 4.609 | 68.167 | 4.609 | 526 | 818 | 0.3914 |
| LLM(A, A1, 2) | 43.75 | 2.05 | 68.25 | 2.05 | 525 | 819 | 0.3906 |
| 学生11 | 42.083 | 5.664 | 69.917 | 5.664 | 505 | 839 | 0.3757 |
| LLM(A, IR, 1) | 39.5 | 2.541 | 72.5 | 2.541 | 474 | 870 | 0.3527 |
| Naive | 36.75 | 1.712 | 75.25 | 1.712 | 441 | 903 | 0.3281 |
| 学生12 | 36.333 | 1.775 | 75.667 | 1.775 | 436 | 908 | 0.3244 |
| LLM(D, A2, 1) | 33.917 | 2.193 | 78.083 | 2.193 | 407 | 937 | 0.3028 |
| LLM(A, GEN, 1) | 30.167 | 1.749 | 81.833 | 1.749 | 362 | 982 | 0.2693 |
| LLM(D, A2, 2) | 29.833 | 2.038 | 82.167 | 2.038 | 358 | 986 | 0.2664 |
| LLM(G, A2, 2) | 27 | 2.256 | 85 | 2.256 | 324 | 1020 | 0.2411 |
| LLM(A, A2, 1) | 26.333 | 0.985 | 85.667 | 0.985 | 316 | 1028 | 0.2351 |
| LLM(O, CR, 1) | 25 | 3.411 | 87 | 3.411 | 300 | 1044 | 0.2232 |
| LLM(A, IR, 2) | 24.333 | 8.542 | 87.667 | 8.542 | 292 | 1052 | 0.2173 |
| LLM(A, A2, 2) | 24 | 1.809 | 88 | 1.809 | 288 | 1056 | 0.2143 |
| LLM(A, CR, 2) | 23.333 | 1.557 | 88.667 | 1.557 | 280 | 1064 | 0.2083 |
| LLM(D, GEN, 1) | 22.5 | 1.784 | 89.5 | 1.784 | 270 | 1074 | 0.2009 |
| LLM(D, A1, 2) | 13.333 | 1.826 | 98.667 | 1.826 | 160 | 1184 | 0.119 |
| LLM(G, CR, 1) | 9.5 | 1.087 | 102.5 | 1.087 | 114 | 1230 | 0.0848 |
| LLM(G, GEN, 1) | 9.167 | 0.937 | 102.833 | 0.937 | 110 | 1234 | 0.0818 |
| LLM(D, IR, 2) | 7.75 | 0.622 | 104.25 | 0.622 | 93 | 1251 | 0.0692 |
| LLM(G, CR, 2) | 7.25 | 1.422 | 104.75 | 1.422 | 87 | 1257 | 0.0647 |
| LLM(D, CR, 2) | 5.667 | 0.985 | 106.333 | 0.985 | 68 | 1276 | 0.0506 |
各エージェントはトーナメントごとに112試合をプレイしたため、平均勝利数または平均敗北数の最大可能値は112である。標準偏差(SD)は、トーナメント間の変動を反映する。人間コード化されたエージェントは太字で表示される。LLMコード化されたエージェントは、モデル(O = GPT-5 Thinking、G = Gemini 2.5 Pro、A = Claude Opus 4.1、D = DeepSeek R1)でラベル付けされ、2文字のプロンプト戦略コードと、エージェントがそのプロンプトで生成された最初か2番目かを示す数字で続く。 ソース
著者は、次のように述べている。
‘LLMは、期待される/競争力のあるコードを生成できなかった。 ‘
‘私たちの結果は、人間コード化されたエージェントの明確な優位性を示している。 ‘
‘学生コードをデバッグしなかった(LLMコードは自己対戦とトーナメント設定の両方で徹底的にテスト/デバッグされた)。学生エージェントがクラッシュした場合、勝利はLLMに自動的に与えられた。多くのクラッシュは簡単に修正できた(例:エージェントがタイムアウトした)。したがって、学生エージェントはさらに高くランクインする可能性がある。 ‘
さらに、GPT-5 Thinkingは、トップの人間エージェントであるStudent 1のコードを改善するようにプロンプトされた。しかし、LLMによって修正されたエージェントは、10位に終わり、人間のスコアの中で最も低くなった。LLMの変更は、元のソリューションを約20%低下させた。
著者は、次のように結論付けた。
‘[私たちの]結果は、LLMコード生成の重要な限界を強調しており、特にコード生成における推論と計画能力の限界を示している。 ‘
結論
著者は、Vibe-Codingが技術的な背景を持たない人々をエンパワーメントし、実践を肯定的にとらえている。ただし、Vibe-Codingはまだ新しい分野であり、その限界はまだ知られていないか、現実的に期待できる以上に高い可能性があるとも示唆している。
著者は、コードがコンパイルされるのではなく、コードが競争することを目標にすべきだと主張している。
この新しい論文を読む読者が抱く疑問の1つは、著者がパンチを上方向に加えているか、下方向に加えているかということである。なぜなら、質問にあるエージェントタスクは、Vibe-Codingが適しているような、PowerShellスクリプトやその他の小さな機能と修正を生成することよりもはるかに複雑で関与しているからである。
* 論文では、’DeepThink R1’という用語が繰り返し出てくるが、これは存在しないように見える(おそらく他の著者が’DeepSeek R1’と間違えたため、インターネット上にはほんの少しの参照しかない)。これが私の間違いである場合は、プロフィールの詳細を通じて私に連絡してください。私はそれを修正するだろう。
† 著者の強調であり、私のものではない。
2025年11月26日水曜日に初めて公開され、17:35 ESTにフォーマットのために修正された。












