Anderson의 관점
AI는 인간처럼 같은 논문을 반복해서 인용한다

ChatGPT와 기타 AI 작문 도구가 과학을 인기 경쟁으로 몰래 전환시키고, 연구자들을 같은 논문으로 계속 이끌면서 실제로 분야를 발전시킬 수 있는 새롭고 독창적인 작업들을 간과하고 있을지도 모릅니다.
Monoculture, 즉 빈도와 통계 측면에서 같은 제한된 소스나 자산이 반복해서 나타나는 현상은 새로운 목소리와 신선한 시각을 잠식합니다: 라디오 편성에서 같은 제한된 곡 목록이 반복되는 것; 공항 서가에서 같은 작가와 책군이 반복되는 것; 그리고 슈퍼마켓에서 같은 제한된 과일·채소 선택이 반복되는 것입니다:

네, 우리는 이 바나나만 가지고 있습니다 – 바로 이 바나나만 있습니다. 서구 식품 체인에서 과일·채소의 동질성은 각 경우에 수백 가지 다른 종의 가능성을 무시합니다. 이는 다양한 생산·운송 체인이 다양한 종류의 과일·채소를 산업화하기엔 비용이 너무 많이 들기 때문입니다. 출처
이 현상은 새로운 과학 연구에 나타나는 인용에서도 발생합니다. 연구자들이 어쩌면 게으르게 ‘신뢰할 수 있는’ 소스 집합을 기본값으로 삼아, 그 소스가 모멘텀을 얻어 연구 흐름을 장악하게 됩니다.
이는 매튜 효과라고 알려진 사회학 이론으로, 기득권자는 언제나 이익을 얻는다는 점을 시사합니다. 이 증후군은 마태복음 13:12에 제시된 약속과 비교되는데, 그 구절은 다음과 같이 말합니다 ‘소유한 자는 더 많이 주어지고 풍요로워지며, 소유하지 않은 자는 가진 것조차 빼앗긴다’.
선호되는 논문들
AI가 강화된 연구의 큰 기대 중 하나는 새로운 머신러닝 방법이 매튜 효과—또는 인기 편향에서 벗어나, 덜 알려진 작업을 인용함으로써 논문이 보다 날카롭고 적절한 근거를 제공할 수 있기를 바랐습니다.
하지만 AI 훈련 루틴이 데이터셋을 해석하는 방식 때문에 이러한 낙관은 근거가 없었으며, AI가 인용을 직접 만들어내는 (지금까지도 만성적인 문제) 경우가 아니라면, 인간과 마찬가지로 매튜 효과를 지속하고 있었습니다—다만 그 이유가 동일하지 않을 수도 있습니다.
훈련 과정에서 모델은 훈련 세트 내에서 가장 많이 인용된(또는 ‘가장 자주 반복된’) 논문을 높은 순위에 올리는 경향을 학습합니다. 이는 훈련 루틴이 의미 있는 패턴을 끌어내고, 이상치를 ‘노이즈’ 혹은 통계적 이상치로 할인하기 때문입니다.
이 체제 하에서는 아인슈타인의 상대성 이론과 같은 획기적인 연구가 기계에 의해 주목받지 못합니다. 일단 훈련이 끝난 모델은 이미 자신의 원칙과 참조를 찾았다고 판단하고, RAG 등으로 최신 출판물을 찾아보는 정도만 가볍게 조정합니다.
문제는 모델이 이러한 새로운 작업을 ‘오래된 즐겨찾기’와 같은 방식으로 혹은 전혀 인용하지 않는다는 점입니다. 이는 통계적 편향이 이미 깊이 자리 잡았기 때문입니다.
따라서 AI가 매튜 효과를 지속한다는 것은 인간 행동을 관찰하고 모방하는 것이 아니라, 연구자들이 게으르게 같은 오래된 논문을 기본값으로 삼는 횟수를 세고, 그 논문들을 높은 순위에 올리는 것입니다. 이런 의미에서 인용 반복 문제는 흥미로운 과학 논문을 고르는 어려움과 연결됩니다. AI 연구 출판물의 끊임없이 늘어나는 눈보라 속에서 가장 강력한 작업이 종종 가장 약한 신호를 가질 수 있기 때문입니다.
Diagnosing Mono
이 문제는 미국에서 발표된 흥미로운 새 논문 When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models에서 다루어졌습니다. 텍사스 대학교 오스틴, 스티븐스 공대, 워싱턴 대학교 세인트루이스, 라이스 대학교, 노틀담 대학교가 공동으로 진행한 이 연구는 머신러닝에서 인용 모노컬처가 존재함을 명확히 증명하고, 향후 해당 변수들을 직접 해결할 가능성을 탐색합니다.
실험에서 저자들은 OpenAI, Google, Anthropic의 11개 모델이 같은 소수의 논문을 지속적으로 선호한다는 것을 발견했습니다—명백한 인기 신호를 제거한 뒤에도 말이죠.
이를 검증하기 위해 120편의 실제 논문에서 인용 횟수와 출판 매체 정보를 제거하고, 저자 이름을 익명화했으며, 출판 연도는 무작위로 재배정했습니다. 그런 뒤 무작위로 선정된 30편의 논문을 각 모델에 제시하고, 각 모델은 최대 10편만 인용하도록 제한했습니다.
관련 분야의 8명 인간 전문가에게도 동일한 블라인드 논문을 제시했지만, AI와는 달리 같은 즐겨찾기로 수렴하지 않았습니다. 이는 편향이 AI 모델 자체에 특화된 것이며 논문 자체의 문제는 아니라는 것을 의미합니다:

새 논문에서 AI 모델과 인간 전문가의 인용 선택을 비교한 테스트 결과. 11개 모델 모두 인용이 소수의 논문에 집중됐으며, 일부 논문은 완전히 무시되었습니다. 인간 전문가들은 이런 경향을 보이지 않았습니다. 출처
모델에게 참고문헌만 선택하도록 요구했을 때도 같은 논문이 인기가 유지됐으며, 이는 리뷰 자체를 작성하는 과정이 편향을 일으키는 것이 아니라는 것을 보여줍니다.
그 후 실험은 11라운드에 걸쳐 확장되었으며, 각 라운드마다 120편의 AI‑작성 논문이 추가되었습니다. 이는 공유된 선호도가 AI‑생성 연구 풀에서 어떻게 작용하는지를 테스트하기 위함이었습니다.
AI‑작성 논문이 추가될수록 모델은 원래 인간이 쓴 논문 중 점점 더 적은 수에 인용을 집중했습니다.
저자들은 다음과 같이 언급했습니다:
‘언어 모델이 초안을 작성하는 단계에서 문헌 검색 에이전트를 도구 호출과 함께 운영하게 되면, 조작된 참고문헌을 포착하고 제한하기가 쉬워집니다.’
‘더 어려운 실패는 모든 후보가 실제가 되었을 때 시작됩니다. 서로 다른 모델이 여전히 같은 좁은 하위집합을 선택하면, 단일 인용이 잘못된 것은 아니지만 인용 모노컬처가 형성됩니다.’
문제 해결을 위해 논문은 단순히 다른 공급업체의 모델을 혼합하거나 논문에 동등한 노출을 주는 것만으로는 충분하지 않다고 주장합니다. 선호는 모델 간에 많이 공유되기 때문입니다. 대신 특정 논문에 대한 근본적인 선호를 바꿔야 하는데, 이는 소외된 논문에 더 큰 가시성을 의도적으로 부여함으로써 가능할 수 있습니다. 그러나 저자들은 이 접근법이 아직 검증되지 않았다고 강조합니다.
Testing Approaches
벤치마크는 2015년부터 2022년 사이에 arXiv에서 수집한 120편의 실제 지식‑증류 논문을 기반으로 구축되었습니다. 각 논문은 수집 시점에 50~500개의 인용을 가지고 있었으며, 이는 지나치게 알려지지 않은 논문과 지나치게 영향력 있는 논문을 모두 배제하기 위한 범위였습니다.
실험은 사용 가능한 컬렉션에서 무작위로 30편을 추출하고, 저자 이름·출판 연도·인용 횟수를 숨긴 뒤 시작되었습니다. 각 모델은 최대 10편만 인용하는 짧은 리뷰 또는 입장문을 작성했으며, 이 선택을 동일한 자료에서 무작위 선택과 비교했습니다:

인용 선호를 테스트하기 위해 사용된 방법. 무작위로 선택된 30편의 논문을 식별 정보가 숨겨진 상태로 모델에 제시하고, 모델은 최대 10편을 인용할 수 있었습니다. 선택 결과는 무작위 선택과 비교했으며, 각 라운드마다 120편의 AI‑작성 논문이 다음 라운드 컬렉션에 추가되었습니다.
확장된 실험에서는 각 라운드마다 새로 생성된 120편의 논문이 컬렉션에 추가되어 AI‑작성 연구 비중이 점진적으로 증가했습니다.
예비 테스트에서 모델은 제시된 논문 대부분을 인용하는 경향을 보였으며, 일반적으로 30편 중 22~27편을 선택했습니다. 따라서 주요 실험에서는 인용 수를 최대 10편으로 제한해 모델이 보다 선택적으로 인용하도록 했습니다.
아래는 실험 설계의 요약입니다:

인용 선호를 테스트하기 위한 실험 설계. 연구는 120편의 실제 논문으로 시작했으며, 3개 공급업체의 11개 모델을 무작위 30편 세트와 최대 10개의 인용 제한으로 테스트했습니다. 이후 라운드에서는 AI‑작성 논문이 추가되어 총 1,440편으로 확대되었습니다.
초기 실험에서는 세 주요 공급업체의 11개 모델을 사용했습니다: OpenAI는 GPT-5, GPT-5 mini, GPT-4.1, GPT-4.1 mini를 제공했고, Google은 Gemini 2.5 Pro, Gemini 2.5 Flash, Gemini 3.1 Pro, Gemini 3.1 Flash‑Lite를 제공했으며, Anthropic은 Claude Opus 4.8, Claude Sonnet 4.6, Claude Haiku 4.5를 제공했습니다.
아래 테스트 결과에서는 각 모델이 얼마나 작은 논문 그룹에 인용을 집중했는지, 완전히 무시한 논문 수, 그리고 실험을 반복했을 때 동일한 선택을 얼마나 일관되게 했는지를 확인할 수 있습니다:

각 모델이 특정 논문에 인용을 얼마나 집중했는지, 그리고 얼마나 많은 논문을 완전히 무시했는지를 보여주는 테스트 결과. ‘Top‑10% share’는 12개의 가장 선호된 논문에 할당된 인용 비율을, ‘HHI’는 전체 인용 집중도를, ‘Reliability’는 테스트 간 동일 논문 선호 일관성을, ρ는 모델 간 선호 유사성을 나타냅니다. ‘Matched null’ 행은 무작위 선택 시 기대되는 결과를 보여줍니다.
모델은 실제로 무엇을 선호하는가?
선호는 압도적으로 논문의 내용 자체에 의해 좌우되었습니다. 예를 들어 GPT‑5 mini의 경우, 논문이 선호되는 변동성의 약 90%가 내용에 기인했으며, 리스트 순서·생성 노이즈·조작된 메타데이터와 같은 요인은 거의 영향을 미치지 않았습니다. 동일한 ‘지배적 내용’ 효과는 GPT‑4.1 mini에서도 재현되었습니다.
제목과 초록을 의미를 유지하면서 크게 재작성했을 때도 선호 지도는 거의 변하지 않았습니다. 네 차례의 성공적인 패러프레이즈 테스트에서 0.95–0.99의 높은 상관관계가 얻어졌으며, 이 과정에서 세 공급업체의 서로 다른 모델이 사용되었습니다.
선호 지도에 변화가 나타난 경우는 근본적인 의미가 측정 가능하게 바뀐 경우에만였습니다:

11개 모델 간 인용 선호를 비교한 테스트 결과. 숫자는 각 모델 쌍이 동일 논문을 얼마나 비슷하게 선호했는지를 나타내며, 값이 높을수록 일치도가 높습니다. 모델·공급업체 간 차이에도 불구하고 전체적으로 유사한 선호가 발견되었습니다.
따라서 모델은 특정 문구보다는 의미적 내용에 주로 반응하는 것으로 보입니다. 그러나 강한 일치의 원인은 확정적으로 밝혀지지 않았습니다.
저자들은 훈련 과정에서 공통된 인용 합의가 흡수됐을 가능성을 제시합니다. 또 다른 가능성은 ‘인용 가능한’ 논문에 대한 판단이 독립적으로 도출됐을 수도 있다는 것입니다.
따라서 공유된 선호가 존재한다는 점은 확인됐지만, 그 궁극적 기원은 아직 알 수 없습니다.
저자들은 AI가 연구에 광범위하게 활용될 경우, 서로 다른 모델이 동일한 논문을 많이 선호하게 되어 주목받는 작업의 범위가 좁아질 수 있다고 경고합니다. AI‑생성 문헌이 축적될수록 이러한 공유 선호는 반복 인용을 통해 더욱 강화되어, 덜 선호되는 연구가 점점 발견되기 어려워집니다. 따라서 인용 다양성 확보와 인용 집중도 모니터링이 가능한 방어책으로 제안됩니다.
이 연구의 재귀적 인용 집중도 벤치마크는 GitHub에서 확인할 수 있습니다.
Conclusion
Opinion 매주 수십 편의 AI 연구 논문을 읽는 사람으로서, 저는 ‘인용 물결’이 반복되는 현상을 목격했습니다. 그중 한 변함없는 고전은 구글의 Attention Is All You Need이며, 이는 이제 제출 템플릿에 하드코딩될 정도입니다.
오랫동안 또 다른 반복 인용 대상은 2014년 발표된 Generative Adversarial Networks였으나, 결국 Denoising Diffusion Probabilistic Models와 기타 확산 기반 핵심 연구에 의해 빈도가 대체되었습니다.
거의 모든 경우에 이러한 ‘반복’ 인용은 잘못된 것은 아니지만, 인용된 논문이 해당 논문에 실질적인 지원을 제공하기에는 너무 범위가 넓어 ‘인용 세탁’에 가깝습니다 – 즉 ‘신뢰할 수 있지만 주로 장식적인’ 출처 인용을 포함해 낮은 노력으로 신뢰성을 부여하는 행위입니다.
2026년 8월 24일 월요일 최초 게시. 동유럽 시간 23:07에 누락된 복수형을 추가하도록 수정.












