Andersonの視点

AIの役割が拡大するとVibeコーディングが苦労する

mm
Unite.AI を Google の優先ソースに追加
An AI-generated stock-style image depicting a human Caucasian male and a larger glossy humanoid robot attempting to collaborate on a document; but the aggressive robot is causing the annoyed man to be sidelined. GPT-5 Image + Photoshop enhancement.

新しい研究は、人間が指示するとVibe Codingの成果は改善するが、AIが指示すると悪化すると報告した。最良のハイブリッド構成では、人間が方向を決め、AIは判定や評価を支援する。

米国の研究者らは、AIが人間の指示を実行するだけでなくVibe Codingの舵取りまで担うと何が起きるかを調べた。大規模言語モデル(LLM)が方向づけの役割を増やすほど、結果はほぼ常に悪化した。

人間とAIの協調実験には主にOpenAIのGPT-5を使ったが、Anthropic Claude Opus 4.5とGoogle Gemini 3 Proでも責任が増えるにつれて同じ低下曲線が確認された。限られた人間参加でも継続的に性能が上がった。

人間は反復を通じて高水準の方向を効果的に与えた一方、AIの指示はしばしば性能崩壊につながった。方向は人間が担い、評価をAIへ移す慎重な役割分担なら、ハイブリッド性能を高められた。

人間とAIを同じ条件で評価するため、猫、犬、トラ、鳥、ゾウ、ペンギン、サメ、シマウマ、キリン、パンダの参照写真をScalable Vector Graphics(SVG)で再現し、元写真との類似性を判定する反復コーディング課題を用意した。

人間とAIの参加者には参照写真とAI生成SVGの再構成を並べて示し、類似度を7段階で評価させた。出典

各ラウンドでは、一方のエージェントがコード生成器に高水準の自然言語指示を出し、もう一方が新しい版を残すか前の版へ戻すかを決めた。現実の共同作業に近い構造化ループである。

604人が参加した16実験と数千回のAPI呼び出しで、他の条件を同じにした完全な人間主導ラウンドとAI主導ラウンドを直接比較した。

人間とAIの担当比率や協力形態を変えた時に生まれた多様な解答の一部。

開始時の人間とAIの性能は似ていたが、反復すると軌跡が分かれた。人間が指示と選択を担うと類似度は着実に累積改善した。AIが両方を担うと、同じ生成モデルと同じ情報を使っていても一貫した改善がなく、ラウンドを重ねるほど悪化することも多かった。

長すぎる指示だけが原因ではない

人間の指示は通常短く行動指向で、現在の画像の次に何を変えるかに集中した。AIの指示はずっと長く、増分修正の優先順位より視覚属性の詳細説明に偏った。

しかしAIの指示を10語、20語、30語に厳しく制限しても傾向は反転せず、AI主導の連鎖は時間とともに改善しなかった。

人間主導と、AI指示を10・20・30語に制限した完全AI主導ラウンドの反復ごとの類似度。短いAIプロンプトにしても、AIが指示と選択の両方を担う時の性能低下は止まらない。

ハイブリッド実験では、完全AI構成に少しでも人間を加えると改善したが、AIが方向づけを担う割合が増えるほど性能は通常低下した。

役割を分けると評価と選択は品質低下を小さく抑えてAIへ任せられた。一方、人間の高水準指示をAIに置き換えると明確に悪化した。重要なのは誰がコードを生成するかではなく、誰が反復全体の方向を決めて保つかだった。

論文Why Human Guidance Matters in Collaborative Vibe CodingはCornell University、Princeton University、Massachusetts Institute of Technology、New York Universityの研究者7人による。

方法

人間の指示者はGPT-5が生成した動物の参照写真と最新のSVG模写を見て、より近い画像を生成するための自然言語指示を書いた。生成器は各ラウンドで新しいSVGを作り、方向づけの効果が反復でどう蓄積するかを調べた。

試験のVibe Coding工程。Aでは人間の指示者が参照写真と現時点の最良SVGを見て次のSVG用指示を書く。Bでは人間の選択者が新旧SVGを比べ、参照に近い方を次ラウンドへ送る。Cでは独立した人間評価者が各SVGと参照画像の類似度を採点する。

人間の選択者は新しいSVGを前の版と比較して採用か却下を決め、過程が参照画像から離れないようにした。基準構成では同じ人が指示者と選択者を務めた。

品質は独立評価者が参照写真との類似度で採点した。16実験で120人が4,800件を評価し、PsyNet上で人間とAIの構造化された対話を実行した。

試験には英語母語話者604人を採用し、コード生成4,800回、指示5,327回のAPI呼び出しを行った。中心モデルはGPT-5で、Claude Opus 4.5とGemini 3 Proも各280クエリの比較に使った。

結果

Vibe Codingは30ラウンド行い、各ラウンドで10枚の参照画像を15回編集した。人間主導条件では45人が10回の反復を通じて指示者と選択者の両方を務めた。別条件では人間の判断をGPT-5 APIに置き換え、他の設定は変えなかった。

同じ参照画像に対する人間主導(上)とAI主導(下)の進行。人間が両役割を担うと着実に改善するが、AIが両役割を担うと停滞または目標から逸れる。

AI主導では初期に主要特徴を捉える場合があっても、その成果を後のラウンドで積み上げられず、目標から遠ざかることもあった。

最終反復の出力。上段の人間主導結果は元の動物により近く、下段のAI主導結果には形の歪みや重要特徴の消失が見られる。

初期ラウンドの得点はほぼ同じだったが、15回目には差が明確になった。人間が選んだ画像は参照にずっと近く、人間主導得点は安定して上昇し、AIに対する最大相対改善は27.1%だった。

反復ごとの平均類似度。人間が指示と選択を担うと着実に上がり、GPT-5が両方を担うと徐々に下がる。

複数参加者の集団効果ではないことを確かめるため、さらに10人が単独で各3ラウンドを行った。それでも同じように着実な改善が見られた。

AIは自分の出力を高く評価する

GPT-5自身が評価しても人間の結果を優れていると認めるかを調べると、人間とAIの採点方向は概ね一致し、良し悪しの判別はできた。しかしAIはAI生成画像を人間より一貫して高く評価した。

これは人間とAIの表現のずれというアラインメント問題を示す。両者の指示文を比べると、焦点と長さの差がはっきりした。

人間とAIの指示比較。Aは人間が短く直接的で、AIが長く詳細に書くことを示す。Bでは人間プロンプトはまとまるがAIは動物別に分散する。Cは語数制限でもAIの長期性能が直らないこと、Dは制限下でも人間の助言がより多様で均衡していることを示す。

人間は対象を問わず適用できる明確な変更を短く示した。AIは陰影、質感、照明、細かな解剖特徴を密に説明した。単独ではもっともらしくても、プロジェクトが進むにつれて全体像を保ちながら次の有用な一歩を示せなかった。

共同作業

人間とAIの入力比率を、ほぼ人間からほぼAIまで変えた。どの混合構成も完全AI制御より良く、わずかな人間の方向づけでも結果が改善した。

人間とAIの比率を変えた構成。Aは各段階で指示者と選択者を交代した方式、Bは人間参加が多いほど品質が上がりAIが増えるほど下がること、Cは人間参加率の低下に伴って最終品質が一貫して落ちることを示す。

AIが多くを担うほど性能は下がり、人間が大半のラウンドを主導した時が最良、AIが大半を主導した時が最悪だった。混合構成は反復ごとの継続改善を維持できず、人間の方向は時折ではなく安定して続く時に最も有効だと示された。

役割の入れ替え

一人が変更方法を指示し、別の一人が良い版を選ぶ二役を分離した。両方を人間が担うと品質を維持したが、人間が指示しても誰も新旧を選ばないと悪化した。

役割分担試験。Aでは人間が指示しても選択者をなくすと性能が低下した。Bでは人間の選択者をAIに替えると品質は少し下がったが、選択を省くほど深刻ではなかった。

AI主導では選択工程を飛ばしても出力が似ていたため影響は小さかった。人間が指示してAIが選ぶ場合は、全て人間の構成に近い品質を保った。

逆にAIが方向を示し人間が選ぶと弱い結果になった。創造的な方向づけは人間が必要だが、選択は品質をあまり落とさずAIへ任せられる。

高水準のアイデア生成と指示が人間の重要な貢献で、評価と選択はしばしばAIへ委任できる。実用的な設計原則は、人間が方向を決め、AIが評価と実行を支援することだ。

結論

より良く大きなコンテキストウィンドウがこの種の課題でLLM性能をどこまで変えるかはまだ分からない。人間とAIの共同作業を悩ませる「LLMの健忘」がなくなる日は祝福と警戒の両方を招くだろう。AIが解こうとしている問題は、結局のところ人間そのものかもしれないからだ。

研究は品質をめぐってAIと人間の間に根本的で重要な不一致があることも示した。品質は、消費者が代替不能な人間的概念だと判断する可能性がある。

* 筆者が著者の文中引用をハイパーリンクに変換した。

2026年2月13日初出。

機械学習のライターで、人間画像合成の専門家です。Metaphysic.ai の研究コンテンツ部門の元責任者で、DNEG の Brahma.ai に統合されるまで勤務していました。
ウェブサイト: martinanderson.ai
連絡先: martin@martinanderson.ai