Anderson의 관점
AI의 역할이 확대되면 바이브 코딩이 손상됩니다

새 연구에 따르면 사람이 지시할 때 바이브 코딩 결과는 개선되지만 AI가 지시하면 악화한다. 가장 좋은 하이브리드 구성은 사람이 방향을 주도하고 AI가 판정이나 평가를 지원하는 방식이었다.
미국 연구진은 AI가 사람의 지시를 실행하는 데 그치지 않고 바이브 코딩을 지휘하면 어떤 일이 생기는지 조사했다. 대규모 언어 모델(LLM)이 방향 설정 역할을 더 많이 맡을수록 결과는 거의 항상 나빠졌다.
인간-AI 협업 실험에는 주로 OpenAI GPT-5를 사용했지만 Anthropic Claude Opus 4.5와 Google Gemini 3 Pro도 책임이 늘어날수록 같은 하락 곡선을 보였다. 적은 수준의 인간 참여만으로도 성능은 꾸준히 좋아졌다.
사람은 반복 전반에 걸쳐 효과적인 상위 수준 지침을 제공했지만 AI 지침은 자주 성능 붕괴로 이어졌다. 방향은 사람이 결정하고 평가를 AI에 넘기는 신중한 역할 배분은 하이브리드 성능을 높였다.
사람과 AI를 같은 조건에서 평가하기 위해 고양이, 개, 호랑이, 새, 코끼리, 펭귄, 상어, 얼룩말, 기린, 판다의 참조 사진을 SVG로 재현하고 원본과의 유사성을 평가하는 반복 코딩 과제를 만들었다.
사람과 AI 참가자 모두 참조 사진과 AI 생성 SVG 재구성을 함께 보고 두 이미지의 유사성을 7점 척도로 평가했다.출처각 라운드에서 한 에이전트는 코드 생성기에 상위 수준 자연어 지시를 제공하고, 다른 에이전트는 새 버전을 남길지 이전 버전으로 돌아갈지 정했다. 실제 협업 작업과 비슷한 구조화된 반복 과정이다.
604명이 참여한 16개 실험과 수천 번의 API 호출에서, 나머지 조건을 동일하게 두고 완전한 인간 주도 라운드와 AI 주도 라운드를 직접 비교했다.
사람과 AI의 협업 비율과 유형을 달리했을 때 나온 다양한 결과의 일부.초기 성능은 비슷했지만 반복하면서 궤적이 갈렸다. 사람이 지시와 선택을 맡으면 유사도 점수가 누적해 꾸준히 상승했다. AI가 두 역할을 맡으면 같은 생성 모델과 같은 정보를 사용해도 일관된 개선이 없었고 라운드가 이어질수록 자주 악화했다.
장황함만의 문제는 아니다
사람의 지시는 보통 짧고 행동 지향적이어서 현재 이미지에서 다음에 바꿀 항목에 집중했다. AI 지시는 훨씬 길고, 점진적 수정의 우선순위보다 시각 속성을 상세히 설명했다.
그러나 AI 지시를 10단어, 20단어, 30단어로 제한해도 패턴은 바뀌지 않았다. AI가 지시와 선택을 맡은 연쇄는 시간이 지나도 개선되지 않았다.
인간 주도 라운드와 AI 지시를 10·20·30단어로 제한한 완전 AI 주도 라운드의 반복별 유사도. AI 프롬프트를 줄여도 반복 성능 저하는 멈추지 않았다.하이브리드 시험에서는 완전 AI 구성에 사람을 조금만 추가해도 좋아졌다. 하지만 AI가 방향을 제시하는 비중이 커질수록 대개 성능이 낮아졌다.
역할을 나누면 평가와 선택은 작은 품질 손실만으로 AI에 맡길 수 있었다. 반면 사람의 상위 수준 지시를 AI 지침으로 바꾸면 뚜렷하게 악화했다. 핵심은 누가 코드를 생성하는가가 아니라 누가 반복 전반의 방향을 설정하고 유지하는가였다.
논문 Why Human Guidance Matters in Collaborative Vibe Coding은 Cornell University, Princeton University, Massachusetts Institute of Technology, New York University 연구자 7명이 작성했다.
방법
인간 지시자는 GPT-5가 만든 동물 참조 사진과 최신 SVG 모사본을 보고, 생성기가 더 비슷한 이미지를 만들도록 자연어 지시를 작성했다. 생성기는 매 라운드 새 SVG를 만들어 방향 지시의 효과가 반복으로 어떻게 누적되는지 시험했다.
바이브 코딩 작업 흐름. A에서 인간 지시자는 참조 사진과 현재 최고 SVG를 보고 다음 SVG용 자연어 지시를 쓴다. B에서 인간 선택자는 새 SVG와 이전 버전을 비교해 참조에 가까운 것을 다음 라운드로 보낸다. C에서 독립 평가자가 각 SVG와 참조 이미지의 유사성을 채점한다.인간 선택자는 새 SVG를 이전 버전과 비교해 채택하거나 거부했고, 과정이 참조에서 벗어나지 않게 했다. 기준 구성에서는 같은 사람이 지시자와 선택자 역할을 모두 수행했다.
독립 평가자들은 생성 SVG와 참조 사진의 유사도를 채점했다. 16개 실험에서 120명이 4,800건을 평가했으며, 인간과 AI의 구조화된 상호작용을 지원하는 PsyNet에서 실행했다.
전체 시험에는 영어 원어민 604명을 모집했고 코드 생성 API 호출 4,800회, 지시 API 호출 5,327회를 사용했다. 주 모델은 GPT-5였고 Claude Opus 4.5와 Gemini 3 Pro도 각 280개 질의의 소규모 비교에 쓰였다.
결과
바이브 코딩은 30라운드 진행했으며 각 라운드는 10개 참조 이미지를 15번 편집했다. 인간 주도 조건에서는 45명이 10회 반복 동안 선택자와 지시자를 함께 맡았다. 다른 조건에서는 인간의 판단을 GPT-5 API로 바꾸고 나머지는 유지했다.
같은 참조 이미지의 인간 주도(위)와 AI 주도(아래) 진행. 사람이 두 역할을 맡으면 반복할수록 개선하지만 AI가 두 역할을 맡으면 정체하거나 목표에서 벗어난다.AI 주도 조건은 초기에 주요 시각 특징을 포착하는 경우가 있었지만, 이후 그 성과를 발전시키지 못하고 대상에서 멀어지기도 했다.
최종 반복의 결과. 위의 인간 주도 결과는 원래 동물에 더 가깝고, 아래 AI 주도 결과에는 눈에 띄는 왜곡과 핵심 특징 손실이 보인다.초기 라운드 점수는 거의 같았지만 15번째 라운드에는 차이가 뚜렷했다. 사람이 선택한 이미지는 참조에 훨씬 가까웠고, 인간 주도 점수는 꾸준히 올라 AI 대비 최대 상대 향상폭이 27.1%에 이르렀다.
반복별 평균 유사도. 사람이 지시와 선택을 맡으면 꾸준히 상승하고 GPT-5가 두 역할을 맡으면 점차 하락한다.여러 참여자의 집단 효과 때문인지 확인하려고 추가 10명이 각각 혼자 세 라운드를 수행했다. 그래도 같은 꾸준한 개선이 나타나 집단 노력의 우연이 아님을 보였다.
AI는 자신의 결과를 더 높게 평가한다
GPT-5가 직접 평가해도 인간 결과가 더 좋다고 인정하는지 살폈다. 인간과 AI의 평가는 대체로 같은 방향으로 움직여 좋고 나쁨을 구별할 수 있었지만, AI는 AI 생성 이미지를 사람이 준 점수보다 일관되게 높게 평가했다.
이는 인간과 AI의 표현 사이에 정렬 문제가 있음을 시사한다. 두 주체의 지시문을 비교하자 초점과 길이 차이가 분명했다.
사람과 AI의 지시 비교. A는 사람이 짧고 직접적이며 AI는 길고 상세하다는 점, B는 인간 프롬프트가 모이지만 AI 프롬프트는 동물별로 갈라진다는 점, C는 단어 제한이 장기 결과를 고치지 못한다는 점, D는 제한 속에서도 인간 지침이 더 다양하고 균형 잡혔음을 보여준다.사람은 여러 대상에 일반적으로 적용 가능한 명확한 수정을 짧게 제시했다. AI는 음영, 질감, 조명, 세밀한 해부 특징을 장황하게 묘사했다. 개별 설명은 그럴듯해도 프로젝트가 발전할 때 전체 맥락을 유지하며 유용한 다음 단계를 제시하지 못했다.
공동 작업
인간과 AI의 입력 비율을 대부분 인간부터 대부분 AI까지 바꿨다. 모든 혼합 구성은 완전 AI 제어보다 나았으므로, 소량의 인간 지시만으로도 결과가 좋아졌다.
인간과 AI 비율을 바꾼 구성. A는 각 단계의 지시자와 선택자 역할 교대, B는 인간 비중이 높을수록 품질이 오르고 AI 비중이 높을수록 떨어짐, C는 인간 참여가 줄수록 최종 품질이 꾸준히 하락함을 보여준다.AI가 더 많은 과정을 맡을수록 성능은 낮아졌다. 사람이 대부분 라운드를 주도할 때 최고였고 AI가 대부분을 맡을 때 최저였다. 혼합 구성은 라운드마다 계속 좋아지지 못해, 인간 방향은 간헐적일 때보다 일관되게 이어질 때 가장 효과적이었다.
역할 뒤집기
한 명이 변경 방법을 지시하고 다른 한 명이 더 나은 버전을 고르는 두 역할을 분리했다. 두 역할을 사람이 맡으면 품질이 유지됐지만, 사람이 지시해도 아무도 새 버전과 이전 버전을 선택하지 않으면 나빠졌다.
역할 분담 시험. A에서는 사람이 지시해도 선택자 역할을 없애면 성능이 낮아졌다. B에서는 인간 선택자를 AI로 바꾸면 품질이 약간 떨어졌지만 선택 자체를 없앤 것만큼 심하지 않았다.AI가 주도할 때는 선택 단계를 건너뛰어도 출력이 비슷해 큰 차이가 없었다. 그러나 사람이 지시하고 AI가 결과를 고르면 전부 인간이 맡은 구성에 가까운 품질을 유지했다.
반대로 AI가 방향을 제시하고 사람이 고르면 결과가 약해졌다. 인간의 창의적 지시는 필수지만 선택 작업은 큰 손실 없이 AI에 위임할 수 있음을 뜻한다.
상위 수준 아이디어 생성과 지침이 인간의 핵심 기여이며, 평가와 선택은 AI에 맡길 수 있다. 실용적 설계 원칙은 인간이 방향을 정하고 AI가 평가와 실행을 지원하는 것이다.
결론
더 좋아지고 커진 컨텍스트 윈도가 이 과제에서 LLM 성능을 얼마나 바꿀지는 아직 알 수 없다. 인간-AI 협업을 매일 괴롭히는 ‘LLM 기억상실’이 사라지는 날은 축하와 경계를 동시에 부를 수 있다. AI가 해결하려는 문제가 결국 사람일 수 있기 때문이다.
이 연구는 품질을 둘러싼 AI와 인간 사이에 근본적이고 중요한 불일치가 있음을 보여준다. 소비자는 품질을 대체 불가능한 인간적 개념으로 판단할 수도 있다.
* 필자가 저자의 인라인 인용을 하이퍼링크로 바꿨다.
2026년 2월 13일 최초 게재.












