Andersonの視点

2020年から人間が書いたコードが、Vibe-Codedエージェントをアジェンティックテストで破った

mm
Unite.AI を Google の優先ソースに追加
AI-generated image: a Victorian coach and horses winning formula 1 against modern race car competitors. gpt-image-1.

ChatGPTやその他のVibe-Codingツールが約4万試合でテストされたが、大規模言語モデル(LLM)が発明される以前の2020年に大学院生が書いたコードに敗れた。

 

イギリスの新しい研究では、研究者は人間が書いたコードを使用したエージェントと、最新のLLMを使用して開発されたVibe-Codedエージェントを比較した。結果は、AIを使用しなかったエージェントが、AIを使用したエージェントを簡単に破ったことを示した。

両方のエージェントは、スイス連邦工科大学ローザンヌ校の異なる世代の学生によって作成された。非AIエージェントは2020年に作成されたもので、ChatGPTやLLMの革命が始まる2年前に、現在の学生によって作成されたエージェントは、利用可能な最新のLLMを使用して作成された。

試合を組むことで、Vibe-Codedソリューションは勝つことができなかった。トップ5のスポットは一貫して「生」のエージェントによって占められ、多くのLLMエージェント(40人のうち33人)は、非常にシンプルなベースラインエージェントによって容易に破られた。38,304のチャレンジ、多数の変数と状況を横断する12のトーナメントで。

論文では次のように述べられている。

‘私たちの研究は、最先端のLLMがコードを生成できる(つまり、構文エラーがない)が、生成されたソリューションは、戦略的計画、最適化、またはマルチエージェント競争などの次元で人間が設計したソリューションに比べると競争力がないことを示している。 ‘

‘したがって、この研究は、コード生成の新しいフロンティアを強調し、ベンチマーク、データセット、オープンソースのベースラインの開発を促進することを目的としている。 ‘

課題は、さまざまな戦略を使用してオークションに参加し、獲得したアイテムを勝者に配達するためのロジスティクスを整えることだった。

著者は、LLMにいくつかの利点を与えたことを指摘している。たとえば、コードに介入してパフォーマンスを向上させることができた。にもかかわらず、LLMはそれを利用できなかった。

‘[私たちの]ベンチマークでは、良いソリューションをコンテキストで公開した場合でも、LLMはそれを利用できない。 ‘

‘この結果は、複雑なシナリオでのインコンテキスト学習とリトリーバル増強問題解決の限界について、興味深い将来の研究質問を提起する。 ‘

テストに使用されたLLMは、GPT-5 ThinkingGemini 2.5 ProClaude Opus 4.1、およびDeepSeek R1*だった。

新しい論文は、Can Vibe Coding Beat Graduate CS Students? An LLM vs. Human Coding Tournament on Market-driven Strategic Planningというタイトルで、サウザンプトン大学とオックスフォード大学のアラン・チューリング研究所の2人の著者によって執筆された。このベンチマークは、近くにリリースされる予定である。

方法

著者は、従来のテストは、明確に定義された二項ソリューション(正しいまたは不正しい)に焦点を当てていると主張している。ユニットテストを介して検証される。LLM支援コードの限界を探求するための理想的な方法ではないと主張し、代わりに、複数の内部ベンチマークとマイルストーンを備えた、より複雑なチャレンジシナリオを設計した。

標準的なユニットテストベースのアプローチ(上)と、著者が設計したよりオープンなチャレンジシナリオ(下)の比較。ソース:[https://arxiv.org/pdf/2511.20613]

標準的なユニットテストベースのアプローチ(上)と、著者が設計したよりオープンなチャレンジシナリオ(下)の比較。 ソース

オークション、ピックアップ、配達問題(APDP)は、スイスの大学から2020年の学生の仕事のコーパスが利用できるため、部分的に自己選択された。したがって、現代の学生に同じ課題を与え、現在のツールを利用できるようにすることは比較的容易だった。

著者は、HumanEvalBigCodeBench、およびWebDev Arena(およびその他多数)などの人気テストフレームワークを避けることを目指した。なぜなら、このクラスのテスト手順は、データ汚染(システムがテストデータでトレーニングした場合、またはスプリットを尊重しない場合)に苦しむことが多いからである。

APDPは、逆オークション車両ルーティングに基づく2段階のロジスティクス問題である。最初の段階では、エージェントは各タスクの実行に対して支払われるべき金額を提示して、配達タスクを獲得するために競争する。高すぎる入札はタスクを失うことを意味し、低すぎる入札はお金を失うことを意味する。

2段階目では、各エージェントは、獲得したタスクのみを実行するための効率的な計画を作成し、異なる容量とコストを持つ車両にタスクを割り当てる必要がある。時間とリソースの制約の下で。

APDPでは、企業は逆オークションで配達タスクに参加し、獲得したタスクのみを実行するために車両のルートを最適化する。目標は、タスクのバンドルを予測し、競合他社の戦略を予測することで、利益を最大化することである。

APDPでは、企業は逆オークションで配達タスクに参加し、獲得したタスクのみを実行するために車両のルートを最適化する。目標は、タスクのバンドルを予測し、競合他社の戦略を予測することで、利益を最大化することである。

目標は、タスクを完了することだけではなく、将来の選択の風景を再定義する各入札を予測し、最大の利益を上げるタスクのバンドルを見つけることである。

APDPベンチマークは、シーケンス内の相互依存するオークションを介した戦略的計画を導入することで、コード生成タスクの難易度を高める。各入札は将来の選択の風景を再定義するため、エージェントは、直近のコストだけでなく、位置、タイミング、長期的な結果についても推論する必要がある。

コアの配達問題は、NP-hardである。つまり、アルゴリズムは、タスクの数が増加するにつれて、合理的な時間内で最適なソリューションを見つけることができない。つまり、ブルートフォースアプローチは実行不可能となり、エージェントは精度と速度のトレードオフを迫られる。

レースは始まった

著者の評価では、40のLLMコード化されたエージェントが17の人間コード化されたエージェントと対戦した。各トーナメントでは、4つの異なる道路ネットワークトポロジーを使用し、すべてのエージェントが他のすべてのエージェントと2回対戦する全対全のペアリングで対戦した。合計で38,304試合が行われた。

各試合では、50の配達タスクがオークションで競われ、ピックアップとドロップオフのポイントと重量が定義され、スイス、フランス、イギリス、オランダの道路レイアウトに基づいてランダムに抽出された。

トーナメントで使用された簡略化された道路ネットワーク:イギリス(上左)、スイス(上右)、オランダ(下左)、フランス(下右)。青と赤の正方形はピックアップとドロップオフのタスクを示し、色付きの三角形はエージェントの車両の現在の位置を示す。

トーナメントで使用された簡略化された道路ネットワーク:イギリス(上左)、スイス(上右)、オランダ(下左)、フランス(下右)。青と赤の正方形はピックアップとドロップオフのタスクを示し、色付きの三角形はエージェントの車両の現在の位置を示す。

学生エージェントは、2020年のコーストーナメントから選ばれた。8人はシングルエリミネーションファイナルのトップパフォーマーから選ばれ、4人はベースラインエージェントとのヘッドツーヘッドマッチでの強いパフォーマンスで選ばれた。

ベースラインエージェントは固定されたヒューリスティックに従った。 Naive は合計距離を計算し、1台の車両のみを使用してバッチングを無視して入札した。 ExpCostFixedBid は10のランダムなタスクをシミュレートし、平均の辺境コストで入札した。 Honest はタスクをスケジュールに挿入する際の実際の辺境コストを計算した。 ModelOpponent は同じことを行ったが、対戦相手のコストの推定を加算して入札した。 RiskSeeking は時間減衰の事前情報と生コスト推定および対戦相手モデリングを組み合わせて、両方のうち高い方で入札した。

評価には、GPT-5 Thinking、Claude Opus 4.1、Gemini 2.5 Pro、DeepSeek R1を使用して構築された40のLLMコード化されたエージェントが含まれた。各モデルは、5つの異なる戦略でプロンプトされ、各モデルで2回適用された。

2つの戦略では、異なる著者によって書かれた静的なプロンプトが使用され、3つ目はモデルが自分の出力を自己批評および修正するように求めた。別の戦略では、別のLLMによる批評および修正が行われた。最終的な戦略では、GPT-4がすべての前のアプローチをレビューして新しいプロンプトを生成することだった。

ベースのプロンプトは、元の学生課題を反映しており、配達環境を説明し、モデルに高複雑度の方法に頼ることなく、利益を最大化するために入札および計画するように指示していた。

すべてのLLMエージェントは、自己対戦およびトーナメント設定でテストされ、すべての観察可能なバグが修正されるまで続けられた。バグ修正は、LLM自体によって、エラー情報でプロンプトされたものだった。

論文では、次のように述べられている。

‘LLMは、シンプルなコードを生成できたが、競争力のあるコードを生成することはできなかった。 ‘

‘私たちの結果は、LLMコード生成の重要な限界を強調しており、特にコード生成における推論と計画能力の限界を示している。 ‘

テーブルは、12のダブルラウンドロビントーナメントからの結果をまとめたもので、4つのネットワークトポロジーと3つのトーナメントを網羅し、合計で約4万試合が行われた。

エージェント 平均勝利数/トーナメント 標準偏差勝利数/トーナメント 平均敗北数/トーナメント 標準偏差敗北数/トーナメント 合計勝利数 合計敗北数 勝率
学生1 108.167 1.193 3.833 1.193 1298 46 0.9658
学生2 104.917 2.539 7.083 2.539 1259 85 0.9368
学生3 103.917 2.466 8.083 2.466 1247 97 0.9278
学生4 103.25 1.815 8.75 1.815 1239 105 0.9219
学生5 96.5 2.908 15.5 2.908 1158 186 0.8616
LLM(O, IR, 1) 95.417 2.314 16.583 2.314 1145 199 0.8519
LLM(O, A2, 1) 94.583 2.314 17.417 2.314 1135 209 0.8445
学生6 93.167 1.899 18.833 1.899 1118 226 0.8318
学生7 93.167 3.563 18.833 3.563 1118 226 0.8318
LLM(O, A1, 1) 86.083 3.029 25.917 3.029 1033 311 0.7686
LLM(O, GEN, 2) 84.083 6.947 27.917 6.947 1009 335 0.7507
LLM(O, CR, 2) 83.5 4.442 28.5 4.442 1002 342 0.7455
学生8 83.417 4.122 28.583 4.122 1001 343 0.7448
RiskSeeking 82.417 3.343 29.583 3.343 989 355 0.7359
LLM(O, GEN, 1) 80.667 4.355 31.25 4.372 968 375 0.7208
ModelOpponent 80.583 3.26 31.417 3.26 967 377 0.7195
LLM(D, A1, 1) 79.417 3.965 32.583 3.965 953 391 0.7091
ExpCostFixedBid 77.167 4.951 34.833 4.951 926 418 0.689
LLM(O, IR, 2) 73.917 3.502 38 3.618 887 456 0.6605
LLM(O, A1, 2) 72.417 2.193 39.583 2.193 869 475 0.6466
LLM(G, A1, 2) 68.5 3.555 43.5 3.555 822 522 0.6116
LLM(A, GEN, 2) 67.917 2.968 44.083 2.968 815 529 0.6064
LLM(G, IR, 2) 65.917 2.314 46.083 2.314 791 553 0.5885
学生9 64.167 11.044 47.833 11.044 770 574 0.5729
LLM(G, A1, 1) 64 4.243 47.917 4.316 768 575 0.5719
LLM(G, IR, 1) 60.333 3.725 51.667 3.725 724 620 0.5387
LLM(O, A2, 2) 59.333 4.499 52.667 4.499 712 632 0.5298
LLM(D, CR, 1) 55.083 6.694 56.833 6.59 661 682 0.4922
LLM(G, GEN, 2) 53.167 3.664 58.833 3.664 638 706 0.4747
LLM(D, GEN, 2) 52.083 9.06 59.917 9.06 625 719 0.465
Honest 50.583 3.848 61.417 3.848 607 737 0.4516
学生10 48.833 2.98 63.167 2.98 586 758 0.436
LLM(D, IR, 1) 48.583 10.211 63.417 10.211 583 761 0.4338
LLM(A, A1, 1) 48 4.69 64 4.69 576 768 0.4286
LLM(G, A2, 1) 47.25 3.864 64.75 3.864 567 777 0.4219
LLM(A, CR, 1) 43.833 4.609 68.167 4.609 526 818 0.3914
LLM(A, A1, 2) 43.75 2.05 68.25 2.05 525 819 0.3906
学生11 42.083 5.664 69.917 5.664 505 839 0.3757
LLM(A, IR, 1) 39.5 2.541 72.5 2.541 474 870 0.3527
Naive 36.75 1.712 75.25 1.712 441 903 0.3281
学生12 36.333 1.775 75.667 1.775 436 908 0.3244
LLM(D, A2, 1) 33.917 2.193 78.083 2.193 407 937 0.3028
LLM(A, GEN, 1) 30.167 1.749 81.833 1.749 362 982 0.2693
LLM(D, A2, 2) 29.833 2.038 82.167 2.038 358 986 0.2664
LLM(G, A2, 2) 27 2.256 85 2.256 324 1020 0.2411
LLM(A, A2, 1) 26.333 0.985 85.667 0.985 316 1028 0.2351
LLM(O, CR, 1) 25 3.411 87 3.411 300 1044 0.2232
LLM(A, IR, 2) 24.333 8.542 87.667 8.542 292 1052 0.2173
LLM(A, A2, 2) 24 1.809 88 1.809 288 1056 0.2143
LLM(A, CR, 2) 23.333 1.557 88.667 1.557 280 1064 0.2083
LLM(D, GEN, 1) 22.5 1.784 89.5 1.784 270 1074 0.2009
LLM(D, A1, 2) 13.333 1.826 98.667 1.826 160 1184 0.119
LLM(G, CR, 1) 9.5 1.087 102.5 1.087 114 1230 0.0848
LLM(G, GEN, 1) 9.167 0.937 102.833 0.937 110 1234 0.0818
LLM(D, IR, 2) 7.75 0.622 104.25 0.622 93 1251 0.0692
LLM(G, CR, 2) 7.25 1.422 104.75 1.422 87 1257 0.0647
LLM(D, CR, 2) 5.667 0.985 106.333 0.985 68 1276 0.0506

各エージェントはトーナメントごとに112試合をプレイしたため、平均勝利数または平均敗北数の最大可能値は112である。標準偏差(SD)は、トーナメント間の変動を反映する。人間コード化されたエージェントは太字で表示される。LLMコード化されたエージェントは、モデル(O = GPT-5 Thinking、G = Gemini 2.5 Pro、A = Claude Opus 4.1、D = DeepSeek R1)でラベル付けされ、2文字のプロンプト戦略コードと、エージェントがそのプロンプトで生成された最初か2番目かを示す数字で続く。 ソース

著者は、次のように述べている。

‘LLMは、期待される/競争力のあるコードを生成できなかった。 ‘

‘私たちの結果は、人間コード化されたエージェントの明確な優位性を示している。 ‘

‘学生コードをデバッグしなかった(LLMコードは自己対戦とトーナメント設定の両方で徹底的にテスト/デバッグされた)。学生エージェントがクラッシュした場合、勝利はLLMに自動的に与えられた。多くのクラッシュは簡単に修正できた(例:エージェントがタイムアウトした)。したがって、学生エージェントはさらに高くランクインする可能性がある。 ‘

さらに、GPT-5 Thinkingは、トップの人間エージェントであるStudent 1のコードを改善するようにプロンプトされた。しかし、LLMによって修正されたエージェントは、10位に終わり、人間のスコアの中で最も低くなった。LLMの変更は、元のソリューションを約20%低下させた。
著者は、次のように結論付けた。

‘[私たちの]結果は、LLMコード生成の重要な限界を強調しており、特にコード生成における推論と計画能力の限界を示している。 ‘

結論

著者は、Vibe-Codingが技術的な背景を持たない人々をエンパワーメントし、実践を肯定的にとらえている。ただし、Vibe-Codingはまだ新しい分野であり、その限界はまだ知られていないか、現実的に期待できる以上に高い可能性があるとも示唆している。

著者は、コードがコンパイルされるのではなく、コードが競争することを目標にすべきだと主張している。

この新しい論文を読む読者が抱く疑問の1つは、著者がパンチを上方向に加えているか、下方向に加えているかということである。なぜなら、質問にあるエージェントタスクは、Vibe-Codingが適しているような、PowerShellスクリプトやその他の小さな機能と修正を生成することよりもはるかに複雑で関与しているからである。

 

* 論文では、’DeepThink R1’という用語が繰り返し出てくるが、これは存在しないように見える(おそらく他の著者が’DeepSeek R1’と間違えたため、インターネット上にはほんの少しの参照しかない)。これが私の間違いである場合は、プロフィールの詳細を通じて私に連絡してください。私はそれを修正するだろう。

著者の強調であり、私のものではない。

2025年11月26日水曜日に初めて公開され、17:35 ESTにフォーマットのために修正された。

機械学習のライターであり、ヒューマンイメージ合成のドメインスペシャリスト。Metaphysic.aiでの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合に伴い退任。
ポートフォリオサイト:martinanderson.ai
コンタクト:[email protected]