Anderson의 관점
AI의 역할이 확대되면 바이브 코딩이 손상됩니다

新的 연구에 따르면, 인간이 지시를 내리면 바이브 코딩이 개선되지만, AI가 지시를 내리면 바이브 코딩이 저하된다는 것을 발견했습니다. 가장 좋은 하이브리드 설정은 인간을 가장 먼저 두고, AI를 중재자 또는 심판으로 유지하는 것입니다.
미국에서 수행된 새로운 연구에서는 AI 시스템이 바이브 코딩을 제어할 때 어떤 일이 발생하는지 조사했습니다. 연구 결과, 대형 언어 모델(LLM)이 더 큰 방향 역할을 맡을 때, 결과는 거의 항상 더 나쁘다는 것을 발견했습니다.
연구자들은 OpenAI의 GPT-5를 사용하여 인간과 AI의 협력 실험을 수행했습니다. 그러나 이후 Anthropic의 Claude Opus 4.5와 Google Gemini 3 Pro도 같은 성능 저하 곡선을 보였다고 확인했습니다. 연구자들은 “제한된 인간 참여가 성능을 지속적으로 개선한다”고 말했습니다.
‘인간은 반복적인 과정을 통해 고유하게 효과적인 고급 지침을 제공합니다. 반면, AI 지침은 성능의 붕괴를 일으킵니다. 또한, 인간이 방향을 제어하는 동안 평가를 AI에 위임하는 것처럼 주의 깊게 역할을 할당하면 하이브리드 성능을 개선할 수 있습니다.’
이 연구에서는 일관된 테스트를 제공하기 위해 반복적인 코딩 작업을 수행했습니다. 참조 이미지(고양이, 개, 호랑이, 새, 코끼리, 펭귄, 상어, 제브라, 기린, 판다의 사진)를 SVG로 재현해야 했습니다. 이 재현은 원본 이미지와 비교하여 평가되었습니다.

인간과 AI 참가자 모두 참조 이미지와 함께 AI 생성된 SVG 재현을 표시하고, 두 이미지가 얼마나 유사한지 7점 척도에서 평가하도록 요청했습니다. 출처
각 라운드에서, 한 에이전트는 코드 생성기를 위한 고급 자연어 지침을 제공하고, 다른 에이전트는 새로운 버전을 유지하거나 이전 버전으로 돌아갈지 결정했습니다. 이것은 실제 협업 워크플로우를 반영하는 구조화된 루프입니다.
16개의 실험에서 604명의 참가자와 수천 개의 API 호출을 수행했습니다. 완전한 인간 주도 테스트 라운드는 완전한 AI 주도 라운드와 비교되었습니다.

인간과 AI 협력의 다양한 솔루션
인간과 AI는 초기에 비슷한 수준의 성능을 보였지만, 시간이 지남에 따라 그들의 성능은 달라졌습니다. 인간이 지시를 내리고 선택을 할 때, 유사성 점수는 반복적으로 증가했습니다. 그러나 AI 시스템이 두 역할을 수행할 때, 성능은 일관된 개선 없이 자주 저하되었습니다.
프로릭시티 효과
결과는 또한 인간의 지시가 일반적으로 짧고 행동 지향적이며, 다음에 변경해야 할 내용에 초점을 맞추고 있음을 보여주었습니다. 반면, AI 지시는 길고 상세하며, 시각적 속성에 대한 설명이 많았습니다.
그러나 AI 지시를 엄격한 단어 제한(10, 20, 30단어)으로 설정해도, 성능은 개선되지 않았습니다.

인간 주도 라운드와 완전한 AI 주도 라운드의 유사성 점수
하이브리드 실험은 패턴을 더 명확하게 보여주었습니다. 인간의 참여가增加하면 결과가 개선되었습니다. 그러나 AI 지침의 비중이 증가할수록 성능은 저하되었습니다.
역할을 분리하면, 평가와 선택을 AI에게 위임할 수 있지만, 인간의 고급 지침을 AI 지침으로 대체하면 성능이 저하됩니다. 이것은 방향을 설정하고 유지하는 것이 중요하며, 코드를 생성하는 것이 중요하지 않다는 것을 시사합니다.
저자들은 결론합니다.
‘인간 주도 코딩은 반복적으로 개선되지만, AI 주도 코딩은 종종 붕괴합니다. 이것은 오늘날의 AI 시스템이 반복적인 상호작용에서 일관된 고급 방향을 유지하는 데 어려움을 겪고 있음을 나타냅니다.’
‘인간의 지침이 중요합니다. 인간은 고유하게 효과적인 고급 지침을 제공합니다. 반면, AI 지침은 성능의 붕괴를 일으킵니다.’
이 새로운 논문은 인간의 지침이 중요한 이유라는 제목으로, 코넬 대학교, 프린스턴 대학교, 매사추세츠 공과대학교, 뉴욕 대학교의 7명의 연구자에 의해 수행되었습니다.
방법
이 실험에서는 인간 교사가 GPT-5 생성된 동물 참조 이미지와 최신 관련 SVG 모방 시도를看着, 코드 생성기에 대한 자연어 지침을 작성했습니다.
이렇게 하면 생성기는 각 라운드에서 새로운 SVG를 생성하여 테스트를 반복적으로 수행할 수 있는 루프를 제공했습니다. 대상은 10개의 GPT-5 생성된 동물 이미지였습니다.

바이브 코딩 워크플로우의 스키마
인간 선택자는 각 새로 생성된 SVG를 이전 버전과 비교하여 참조 이미지와 더 잘 일치하는 버전을 선택했습니다. 이것은 프로세스를 참조 이미지와 일관되게 유지했습니다.
질量을 측정하기 위해, 독립적인 인간 평가자가 각 생성된 SVG가 참조 이미지와 얼마나 유사한지 평가했습니다. 16개의 실험에서 120명의 사람이 4,800개의 평가를 수행했습니다.
すべて의 실험은 PsyNet 프레임워크에서 수행되었습니다. 이 프레임워크는 인간과 AI 시스템 간의 구조화된 상호작용을 수용하도록 설계되었습니다.
결과
30개의 바이브 코딩 라운드를 수행했습니다. 각 라운드는 15개의 편집으로 구성되었습니다. 45명의 인간 참가자가 선택되었습니다. 각 참가자는 10개의 반복에서 선택자와 교사로 활동했습니다.
각 턴에서, 참가자는 현재와 이전 SVG를 비교하여 다음 라운드의 지침을 작성했습니다. 두 번째 버전의 테스트에서는 인간의 결정 대신 GPT 5에 대한 API 호출을 사용했습니다.
대표적인 예는 멀티 라운드 바이브 코딩을 보여줍니다. 인간이 선택자와 교사로 활동할 때, SVG 출력은 반복적으로 개선되었습니다.

인간 주도와 AI 주도 바이브 코딩의 예
반면, AI 주도 버전에서는 초기 라운드에서 중요한 시각적 특징을 포착했지만, 이후 시도에서 개선되지 않았습니다.

인간 주도와 AI 주도 바이브 코딩의 최종 출력
최종 이미지를 독립적인 인간 평가자에게 보여주고 참조 이미지와의 유사성을 평가하도록 요청했습니다. 초기 라운드에서는 인간 주도와 AI 주도 라운드의 점수가 비슷했습니다. 그러나 15라운드에서는 인간 주도 라운드의 점수가 더 높았습니다.

인간 주도와 AI 주도 바이브 코딩의 평균 유사성 점수
빅 픽처
그러나 AI가 출력을 평가할 때, 인간의 결과가 더 좋다고 인정할 수 있을까요? 인간과 AI의 평가 점수는 일반적으로 같은 방향으로 이동했지만, AI는 AI 생성된 이미지를 인간보다 더 높게 평가했습니다.
‘우리는 AI 에이전트가 자신의 출력이 인간의 출력보다 열등하다는 것을 인정할 수 있는지, 또는 자신의 창조물을 선호하는지 여부를 물었습니다. 이것은 잠재적인 정렬 문제를 나타냅니다.’
‘AI 평가자는 AI 생성된 출력에 더 높은 평가를 부여했습니다. 이러한 발견은 관찰된 성능 차이가 인간과 AI의 표현 사이에 불일치에서 비롯된 것일 수 있습니다.’
공동 노력
인간과 AI가 제어를 공유할 때 어떤 일이 발생하는지 테스트했습니다. 인간과 AI의 입력을混合하여 코딩 작업을 수행했습니다.
모든 하이브리드 혼합은 완전한 AI 제어를 초과했습니다. 인간의 참여가 조금이라도 있으면 결과가 개선되었습니다.

인간과 AI의 혼합 코딩 설정
인간의 참여가 증가할수록 결과의 품질이 높아졌습니다. 그러나 AI의 입력이 증가할수록 점수가 낮아졌습니다.
역할 반전
이 연구는 또한 누가 무엇을 하는지에 따라 성능에 차이가 있는지 테스트했습니다. 두 가지 작업을 수행했습니다. 하나는 이미지 변경을 지시하는 것이었고, 다른 하나는 선호하는 버전을 선택하는 것이었습니다.
인간이 두 가지 역할을 수행할 때, 품질이 유지되었습니다. 그러나 인간이 지시를 내렸지만 선택을 하지 않았을 때, 품질이 저하되었습니다.
인간이 지시를 내리고 AI가 선택을 할 때, 품질은 인간이 선택을 할 때보다 조금 낮았습니다.
반대로, AI가 지시를 내리고 인간이 선택을 할 때, 결과는 약화되었습니다. 이것은 인간의 창의적 지침이 필수적이며, 선택은 AI에게 위임할 수 있음을 시사합니다.
저자들은 결론합니다.
‘고급 아이디어 생성과 지침은 인간의 중요한 기여입니다. 반면, 평가와 선택은 일반적으로 AI에게 위임할 수 있습니다.’
‘이것은 하이브리드 시스템의 실제 설계 원칙을 제안합니다. 인간은 방향을 설정해야 하며, AI는 평가와 실행을 지원할 수 있습니다.’
결론
향상된 컨텍스트 창이 이러한 작업의 LLM 성능에 미치는 영향은 아직 불분명합니다. 그러나 AI가 사람을 해결하려고 노력하는 문제는 아마도 사람입니다.
연구자들의 작업은 또한 AI와 인간 사이에 품질에 대한 내재적이고 중요한 불일치가 있음을 보여주었습니다. 이것은 소비자들이 인간의 개념으로 결정할 수 있습니다.
* 저자의 인라인 인용을 하이퍼링크로 변환했습니다.
最初에 2026년 2월 13일에 게시되었습니다.












