Anderson의 관점
AI 모델의 ‘창의적’ 출력이 제공업체 간에 유사해지고 있다

새 연구에 따르면 경쟁 기업들의 AI 모델이 내놓는 창의적인 답변이 점점 비슷해지고 있으며, 이는 사용자가 접하는 아이디어의 범위를 좁힐 수 있다.
미국의 새 연구는 주요 AI 모델 전반에서 ‘창의적’ 출력이 시간이 지날수록 비슷해지고 있음을 발견했다.
듀크대학교 연구진은 2023~2026년에 출시된 12개 제공업체 계열의 69개 모델을 시험했다. 실제 사용에서 나온 개방형 질문과 표준 창의성 검사 모두에서 출력의 다양성이 통계적으로 유의하게 감소했다. 이는 주요 LLM 제공업체들이 ‘창의적인’ 요청에 점점 비슷한 아이디어를 제시할 수 있음을 시사한다.
시험한 제공업체 계열은 Anthropic, Cohere, DeepSeek, Google, Meta, MiniMax, Mistral AI, Moonshot AI, OpenAI, Qwen, xAI, Z.ai였다*.

새 논문에 제시된 연구 대상 모델의 출시 시점으로, 2023년 3월부터 2026년 7월까지를 다룬다. 12개 AI 제공업체의 69개 모델 버전이 3년 동안 어떻게 분포하는지 보여 준다. 일부 업체의 출시 빈도가 높아지는 현상도 나타나며, 연구진은 분석에서 이를 고려해야 했다. 출처
이번 새 논문 의 저자들은 다음과 같이 설명한다**.
“우리는 시험한 개방형 프롬프트에 대한 LLM의 답변이 시간이 지날수록 서로 더 비슷해졌음을 발견했다.
이는 LLM이 개방형 답변을 생성하는 과제에서 점점 덜 창의적이 되고 있음을 시사하며, 창작 보조 도구로서 장기적으로 얼마나 유용할지 면밀히 검토할 필요가 있음을 보여 준다.”
저자들은 ‘알고리즘 단일문화’가 이미 확립된 연구 주제이지만, AI가 생성하는 창의적 출력이 동질화되는 추세를 조사한 연구는 지금까지 없었다고 주장한다.
다만 이런 수렴을 암시하는 개별 사례는 이전부터 있었다. 코넬대학교의 2026년 5월 연구는 서로 다른 LLM 제공업체들의 모델이 ‘등대지기’와 ‘Mara’, ‘Elias’ 같은 특정한 옛스러운 이름에 기묘하게 집착하는 공통점을 보였다고 설명했다.

5월에 발표된 코넬대학교 논문은 개방형 프롬프트를 제시했을 때 여러 LLM 제공업체의 모델에서 이상할 만큼 비슷한 답변이 나타났다고 보고했다. 그러나 이 모델들을 학습시키는 다양한 데이터에서 그 이유를 설명할 단서는 아직 드러나지 않았다.
이번 연구는 더 체계적이다. 연구진은 3년간 출시된 모델을 실제 창작 프롬프트와 일상 사물의 색다른 용도를 묻는 고전적인 심리 검사로 시험했다. 이후 답변 사이의 의미적 거리를 측정해 모델 세대가 바뀔수록 그 거리가 줄어드는지 추적했다.
이번 논문의 제목은 「LLM의 창의성은 서로 비슷해지고 있는가? 3년간의 모델에서 얻은 증거」이며, 저자들은 다음과 같이 말한다†.
“예비적이기는 하지만, 우리의 결과는 창작 파트너로서 LLM의 장기적 유용성에 우려를 제기한다. 모델이 창작 과제를 잘 수행하더라도 출력이 수렴하면 LLM 사용자가 접하는 가능성의 범위와 그에 따른 사고의 폭이 제한될 수 있다.
에세이 작성 같은 창작 과제에 LLM을 사용하는 것이 뇌 활동을 감소시킨다면, 이번 연구가 시사하듯 갈수록 덜 창의적인 LLM을 사용하는 일은 이 연구와 다른 연구들에서 관찰된, LLM이 인간의 창의성에 미치는 영향을 더 악화시키지 않을까?”
LLM이 생성하는 텍스트의 여러 특징은 이미 인터넷 밈의 소재가 됐다. 올해 5월 보도했듯이, 적어도 한 작가는 주요 모델에 공통적으로 나타나는 앞서 언급한 ‘등대’ 집착을 담은 것으로 보이는 책을 자비 출판했다.
따라서 출판사들이 책의 출판을 철회하는 사례가 늘고 있으며, 그 이유로 AI가 집필했거나 집필을 도왔다고 의심하는 상황에서, 이번 연구는 학생들이 제출하는 학술 과제를 포함해 겉으로는 사람이 쓴 작품들에서 ‘줄거리의 우연한 일치’가 늘어날 수 있음을 시사한다.
이런 수렴의 원인에 대해 저자들은 겹치는 학습 데이터와 갈수록 유사해지는 최적화 목표가 모델 내부의 개념 및 의미 관계 표현을 비슷하게 만들어, 결국 더 유사한 답변을 낳을 수 있다고 가정한다†.
“이러한 동질성이 아직 발전 중인 기술의 일시적인 부산물인지, 아니면 통계적 언어 모델에 불가피하며 잠재적으로 누적되는 특성인지는 여전히 불분명하다.
양쪽 방향을 뒷받침하는 개연성 있는 요인들이 있다. 학계의 연구가 축적되면서, 겹치는 데이터로 학습하고 비슷한 목표를 향해 최적화한 생성 모델은 개념과 의미 관계를 점점 더 비슷한 방식으로 조직해 유사한 출력을 만든다는 점이 제시되고 있다.”
반면 저자들은 모델이 진화하면서 창의적 출력에서도 다시 각자의 고유한 특성으로 갈라질 수 있음을 시사하는 연구 도 인용한다.
방법
AI 모델들이 서로 비슷해지는지 추적하기 위해 연구진은 먼저 개방형 질문에 대해 여러 세대의 모델이 내놓은 답변을 수집했다. 각 답변의 의미를 수치 표현으로 변환해 답변이 얼마나 비슷하거나 다른지 측정할 수 있게 했다. 회귀 분석으로는 새 모델이 출시될수록 이러한 차이가 줄어드는지 확인했다.

시간이 흐르면서 AI 출력이 더 비슷해지는지 측정하는 연구진의 분석 체계. 여러 모델 계열에 개방형 창작 프롬프트를 제시한 뒤 답변의 의미를 수치로 표현해 서로의 거리를 측정했다. 회귀 분석으로는 연속된 모델 세대에 걸쳐 그 거리가 어떻게 달라졌는지 추적했다.
창의성을 서로 다른 관점에서 시험하기 위해 두 종류의 프롬프트를 선택했다. 첫 번째는 대안적 용도 과제 (AUT)로, 평범한 사물의 색다른 용도를 묻는 표준적인 확산적 사고 검사다. 이번 연구에서는 책, 신발 , 망치 같은 사물을 사용했다. 고정된 형식 덕분에 모델들이 제시하는 아이디어를 통제된 방식으로 비교할 수 있었다.
추가로 100개 프롬프트를 Infinity-Chat100에서 추렸다. 이는 언어 모델과의 실제 대화에서 구성한 자료 모음이다. 프롬프트는 콘텐츠 생성, 문제 해결, 브레인스토밍, 아이디어 발상 등 제약이 적은 창작 과제를 다뤘다. 답변과 접근 방식에 더 큰 자유를 허용하는 과제들이다.
AUT와 Infinity-Chat100의 전체 프롬프트를 2023년 3월부터 2026년 7월까지 출시된 모델에 보냈다. Anthropic, Google, Meta, OpenAI, DeepSeek, Mistral AI 등을 포함한 12개 제공업체의 시스템이 대상이었다. 모든 답변은 동일한 샘플링 설정으로 OpenRouter API를 통해 수집했으며, temperature (창의적으로 답할 수 있는 자유도)와 top-p 를 모두 1로 설정했다.
연구진은 새로운 세대일수록 답변이 더 비슷해지는지 확인하기 위해 모델들을 출시 월별로 배치했다.
출시일 자체가 학습 데이터, 아키텍처, 사후 학습의 변화를 직접 나타내지는 않으므로, 연구진은 관찰된 추세를 모델 발전과의 연관성으로 해석했다. 시간이 흐른다는 사실 자체가 수렴을 일으킨다는 증거로 보지는 않았다.
이후 all-MiniLM-L6-v2 문장 변환 모델로 답변을 임베딩으로 바꿨다. 각 답변은 수치 벡터로 표현했다. 의미가 비슷한 답변이 유사한 방향에 놓이도록 하여 의미적 거리를 측정할 수 있었다.
AUT에서는 각 사물에 대해 제안된 모든 용도를 하나의 답변으로 취급해 모델당 10개 임베딩을 만들었다. Infinity-Chat100에서는 답변마다 별도로 임베딩해 모델당 100개를 만들었다.
모델이 출시된 27개 월을 아홉 개 기간으로 묶고, 서로 다른 제공업체의 모델만 비교했다. 각 기간 안에서 답변 사이의 의미적 거리를 측정했으며, 거리가 작을수록 유사성이 높다는 뜻이다.
모델 수가 많은 제공업체가 결과를 좌우하지 않도록 업체별로 균형을 맞춰 표본을 추출하고 분석을 1,000회 반복했다.
결과
선형 회귀로 시간에 따른 거리 변화를 추적했다. 일관된 음의 기울기는 서로 다른 제공업체의 모델이 점점 비슷해짐을 나타냈다.

여러 AI 제공업체의 창의적 답변이 시간에 따라 더 비슷해지는지 살펴본 초기 결과. AUT와 Infinity-Chat100 모두 의미적 거리가 줄었다. 균형 표본 추출을 반복해도 일관되게 음의 추세가 나타나 모델 세대가 바뀔수록 유사성이 커짐을 보여 줬다.
이 결과에 대해 저자들은 강조한다.
“AUT와 Infinity-Chat 답변 집합 모두에서 관찰 기간 동안 제공업체 간 출력의 거리가 감소했다.
이는 시간이 지날수록 LLM의 창의적 출력에서 다양성이 줄어들거나 동질성이 높아짐을 시사한다.”
구형 모델과 최신 모델의 차이는 AUT에서 가장 뚜렷했다. 서로 다른 제공업체 답변 간 평균 거리는 가장 오래된 모델의 약 0.50에서 최신 모델의 0.40 미만으로 떨어졌다. 답변이 상당히 비슷해졌다는 뜻이다. Infinity-Chat100에서도 같은 패턴이 나타났지만 변화 폭은 작았다. 평균 거리는 약 0.34에서 0.32를 조금 넘는 수준으로 낮아졌다.

여러 AI 제공업체의 답변이 얼마나 빠르게 비슷해지는지 측정한 결과. AUT에서는 Infinity-Chat보다 모델 간 차이가 훨씬 크게 줄었으며, 두 결과 모두 반복 표본 추출 시험에서 일관되게 유지됐다.
균형을 맞춘 재표본 추출을 1,000회 반복해도 결과는 유지됐다. 모든 경우에 최신 모델의 답변은 구형 모델의 답변보다 서로 더 가까웠다. 위 그림은 감소 폭과 연구진의 95% 신뢰구간을 보여 준다.
이에 대해 논문은 다음과 같이 설명한다.
“AUT의 목적을 고려하면 감소 폭은 특히 주목할 만하다. AUT는 가능한 한 독창적이고 예상 밖인 용도를 제시하도록 요구함으로써 확산적 사고를 명시적으로 시험한다. 따라서 바로 이 과제야말로 서로 다른 출력이 나올 것으로 기대되는 환경이다.”
Infinity-Chat 결과는 같은 추세가 훨씬 다양한 창작 과제에서도 나타났음을 보여 준다. 100개 프롬프트는 여러 종류의 개방형 답변을 요구했으며, 그 답변들은 시간이 지날수록 비슷해졌다.
변화 폭은 AUT보다 작았지만 2025년 이후 출시된 모델에서 더 뚜렷해졌다. 저자들은 이것이 특정한 시험에만 국한된 현상이 아니라, 여러 AI 제공업체의 창의적 출력이 전반적으로 비슷해지고 있음을 보여 주는 초기 신호일 수 있다고 설명한다.
결론
LLM과 VLM의 수렴은 연구 공동체와 이들에서 파생된 모델의 사용자 모두에게 지속적으로 커지는 우려의 원인 이다. 연구 분야가 접할 수 있는 처음이자 유일한 ‘순수한’ 데이터 세대는 거의 끝나가고 있다. 모델 제공업체들이 경쟁사의 데이터를 빼내려는 의지를 보이는 상황은 필연적으로 수렴 위험을 낳는다. 데이터가 같아지고, 제공업체들의 모델 학습 원칙도 동일하지는 않더라도 비슷하기 때문이다.
따라서 모델 계열 전반에서 창의적 출력이 비슷해지는 문제를 해결할 방법으로 긴 대시를 다른 문장부호로 바꾸는 것 처럼 단순한 요령이 등장할 가능성은 낮다. 오히려 중복 사례가 더 공개적이고 당혹스러운 방식으로 드러날 가능성이 크다.
* 전체 모델 목록: Claude-3-Haiku; Claude-Fable-5; Claude-Opus-4; Claude-Opus-4.1; Claude-Opus-4.5; Claude-Opus-4.6; Claude-Opus-4.7; Claude-Opus-4.8; Command-A; Command-R-08-2024; DeepSeek-Chat; DeepSeek-V3.1-Terminus; DeepSeek-V3.2; DeepSeek-V4-Pro; Gemini-2.5-Pro; Gemini-3-Flash-Preview; Gemini-3.1-Pro-Preview; Gemini-3.5-Flash; Llama-3.1-70B-Instruct; Llama-3.2-3B-Instruct; Llama-3.3-70B-Instruct; Llama-4-Maverick; MiniMax-01; MiniMax-M1; MiniMax-M2; MiniMax-M2.1; MiniMax-M2.5; MiniMax-M2.7; MiniMax-M3; Mistral-Large; Mistral-Large-2407; Mistral-Large-2512; Mistral-Medium-3; Mistral-Medium-3.5; Mistral-Medium-3.1; Mistral-Small-24B-Instruct-2501; Mistral-Small-2603; Mistral-Small-3.1-24B-Instruct; Mistral-Small-3.2-24B-Instruct; Mixtral-8x22B-Instruct; Kimi-K2; Kimi-K2-0905; Kimi-K2.5; Kimi-K2.6; GPT-3.5-Turbo; GPT-4; GPT-4.1; GPT-4o; GPT-5; GPT-5.1; GPT-5.2; GPT-5.3-Chat; GPT-5.4; GPT-5.5; GPT-5.6-Sol; Qwen-2.5-72B-Instruct; Qwen3-Max; Qwen3.5-Plus-20260420; Qwen3.6-Max-Preview; Qwen3.7-Max; Grok-4.20; Grok-4.3; Grok-4.5; GLM-4.5; GLM-4.6; GLM-4.7; GLM-5; GLM-5.1; GLM-5.2
** 강조는 필자가 아니라 논문 저자들이 한 것이다.
† 필자가 논문 저자들의 본문 내 인용을 하이퍼링크로 바꿨다.
최초 게시: 2026년 8월 21일 금요일
원문 기사의 출처: archive.is [1]












