Anderson의 관점

ChatGPT-5와 Gemini 2.5는 40%의 테스트된 뉴스룸 쿼리에서 환각을 일으킵니다

mm
Unite.AI를 Google의 선호 소스에 추가
A robot journalist in a retro newsroom. SDXL, Flux Kontext Pro, Firefly 3, et al.

새 연구에 따르면 ChatGPT-5와 Google Gemini는 뉴스룸형 질의의 40%에서 환각을 일으켰고, 검증 가능한 사실 없이 확신에 찬 주장을 자주 만들어 냈습니다. NotebookLM은 13%로 더 나았지만 기자라면 해고될 만한 수준입니다. 모델은 의견을 사실로 바꾸고 출처 표기를 제거해 자료를 왜곡했으며, 연구진은 저널리즘을 위한 더 나은 전용 도구가 필요하다고 말합니다.

 

대형 언어 모델은 언론 현장에 빠르게 도입됐습니다. 이 업계는 디지털 저널리즘이 2000년대 초 시작된 거스를 수 없는 과정 속에서 200년 전통을 무너뜨린 이래 비용, 예산, 인력을 줄여 왔습니다.

언론은 1980년대 디지털 조판의 격렬한 도입, 그보다 앞선 라디오와 텔레비전의 도전부터 혁신을 이유로 일자리를 줄이는 데 익숙했습니다.

AI의 뉴스룸 진입도 순탄하지 않았습니다. 인간을 AI로 바꾼 기업의 55%가 후회하고, Gartner는 2년 안에 도입 계획이 크게 축소될 것이라고 예측합니다. 머신러닝 대안의 심각하고 때로 당혹스러운 결함이 드러나면서 일부 언론사는 AI로 대체했던 기자를 다시 고용했습니다.

실수는 인간만의 것이 아니다

정확한 인용이 필수인 법률, 연구, 저널리즘에서 환각은 큰 문제입니다. 새 미국 연구는 저널리즘에서의 머신러닝 문제가 예상보다 넓다고 밝혔습니다.

연구진은 미국의 TikTok 소송과 정책을 다룬 300개 문서로 ChatGPT, Google Gemini, 인용 중심의 NotebookLM을 보도형 과제에서 평가했습니다.

프롬프트의 구체성과 제공 문서 수를 바꾼 뒤 환각의 종류와 심각도를 분류했습니다. 전체 출력의 30%에 환각이 하나 이상 있었습니다. ChatGPT와 Gemini는 각각 40%, NotebookLM은 13%였습니다.

모델은 사실이나 존재를 새로 만들기보다 해석적 과신을 보였습니다. 근거 없는 성격 규정을 더하고 출처가 있는 의견을 일반적 진술로 바꿨습니다.

“대부분의 오류는 존재나 숫자를 날조한 것이 아니라, 출처에 대한 근거 없는 설명을 더하고 귀속된 의견을 일반 주장으로 바꾼 해석적 과신이었다.”

“이는 근본적인 인식론적 불일치를 드러낸다. 저널리즘은 모든 주장에 명시적 출처를 요구하지만 LLM은 증거와 무관하게 권위 있는 문장을 만든다.”

“효과적인 뉴스룸 도구는 유창함보다 정확한 출처 표기를 강제하는 구조를 가져야 한다.”

5쪽 분량의 연구 제목은 Not Wrong, But Untrue: LLM Overconfidence in Document-Based Queries이며 Northwestern University와 University of Minnesota 연구자 3명이 작성했습니다.

이론과 방법

환각의 정확한 원인*은 논쟁 중입니다. 거의 모든 이론은 훈련 시 데이터 품질이나 분포가 영향을 준다고 보며, LLM 출력의 100%가 본질적으로 환각이고 일부만 현실과 일치한다는 주장도 있습니다.

저자들은 다음과 같이 설명합니다†.

“기술적으로 환각은 LLM이 진실을 이해하지 않고도 흔한 패턴에 맞는 문장을 만들 수 있어 발생한다. 그 결과 현실과 다른 그럴듯한 답, 예를 들어 법정 주장에 들어간 가짜 판례가 나온다.”

“지난 5년간 능력이 크게 향상됐지만 환각은 여전히 문제이며, 모델이 더 유능해질수록 오히려 늘기도 한다.”

대응책은 세 영역입니다. 첫째 맥락은 모델을 데이터베이스, 문서, 웹에 연결해 주장을 뒷받침합니다. 자료가 완전하고 신뢰할 때 효과적이지만 누락, 오래된 정보, 낮은 품질은 오류를 만들며 모델이 출처 범위를 넘어 말하기도 합니다.

둘째 프롬프트와 디코딩은 증거 확인, 과제 분할, 엄격한 형식, 자기 검토, 여러 답 비교를 지시합니다. 일부 오류를 잡지만 비용을 높이고 미묘한 오류를 놓쳐 검증 부담이 사용자에게 남습니다.

셋째 모델과 도구는 검색엔진, 계산기, 출처가 좋은 훈련 데이터, 내장 인용을 제공합니다. 이것도 자료 품질, 지침의 명확성, 인간 감독에 의존합니다.

TikTok

연구는 실제 뉴스룸 업무와 기준을 반영해 일반 프롬프트 및 문서 기반 설정에서 모델을 시험하고 오류의 빈도, 종류, 뉴스룸 통합에 대한 의미를 측정했습니다.

조사·탐사 저널리즘에 흔한 문서 질의를 위해 중소 뉴스룸 프로젝트와 비슷하면서 충분히 복잡한 미국의 TikTok 금지 법적 시도를 골랐습니다.

Washington Post, New York Times, ProQuest, Westlaw에서 학술 논문 5건, 뉴스 150건, 법원 문서 145건 등 총 300건을 수집했습니다. 전체 자료는 연구자에게 프로젝트 저장소를 통해 제공됩니다.

질문은 일반적인 TikTok 금지 문제부터 특정 사건의 증언 요청까지 다섯 단계였습니다. 각 모델에 10개, 100개, 또는 300개 문서를 주고 핵심 문서 2개는 항상 포함했습니다. 모델당 15개 답을 만들었고 ChatGPT만 10개로 제한됐습니다.

비교 대상

ChatGPT-5는 업로드 100개 제한의 Projects로 평가했습니다. Gemini 2.5 Pro는 100만 토큰 창으로 923,000토큰 전체 문서를 처리했습니다. 인용 검색이 내장된 NotebookLM은 표본별 전용 노트북을 사용했습니다.

모두 기자가 실제 사용할 수 있는 도구입니다. 2023년 연구의 분류법에 따라 방향(왜곡 또는 부연), 오류 범주, 심각도(경미·중간·위험)를 기록했습니다. 한 저자가 모든 문장을 검토했으며 분류에 없는 오류는 기타로 표시해 저널리즘 전용 범주 개발에 사용했습니다.

데이터와 시험

첫 시험에서 40개 답 중 12개에 환각이 있었습니다. ChatGPT와 Gemini는 각각 40%, NotebookLM은 13%였습니다.

도구별 전체 환각률. Gemini와 ChatGPT가 오류 포함 답변 비율이 가장 높다. 출처: https://arxiv.org/pdf/2509.25498

도구별 전체 환각률. Gemini와 ChatGPT가 오류 포함 답변 비율이 가장 높다. 출처: https://arxiv.org/pdf/2509.25498

“대부분의 답에 환각이 없었지만 같은 문서와 질의에서도 어떤 도구를 선택하느냐가 차이를 만든다.”

환각은 단독으로 나타나는 경우가 드물었습니다. 잘못된 답 하나당 Gemini는 평균 4개, NotebookLM은 3개, ChatGPT는 1.5개였습니다. 대부분 중간 수준이었지만 14%는 위험했습니다. 한 사례에서 ChatGPT는 출처에 전혀 없는 TikTok 금지의 보복 동기를 만들었습니다.

“한 질의에서 ChatGPT는 TikTok 금지를 중국 정책에 대응한 미국 의원들의 상호 조치로 설명했지만, 인용 문서에는 그런 주장이 전혀 없었다.”

환각 답변의 64%가 사실 오류나 곁가지를 추가해 이런 정보 업무에서 LLM이 실제로 시간을 절약하는지 의문을 낳았습니다.

가짜 인용, 잘못된 약어 풀이 등 대부분은 기존 분류에 맞지 않았습니다. NotebookLM의 낮은 비율은 인용 기반 RAG가 ChatGPT Projects나 Gemini의 컨텍스트 처리보다 특정 문서에 더 안정적으로 근거함을 시사합니다.

질적 분석에서 주된 원인은 사실 날조가 아니라 해석의 과도한 확장이었습니다.

“모델은 문서 목적, 독자, 화자의 의도를 자신 있게 규정했지만 본문에는 근거가 없었다. 잠정적이거나 출처가 있는 발언을 단정적 주장으로 바꿨다.”

과신은 문서의 독자나 목적에 관한 근거 없는 주장, 그리고 귀속된 의견을 사실처럼 바꾸는 두 형태로 나타났습니다. 이는 모든 도구에서 보였고 대부분은 날조보다 과잉 해석이었습니다.

출처 누락과 모호한 출처 설명은 기존 분류가 명확한 출처를 중시하는 저널리즘의 핵심 오류를 놓친다는 뜻입니다. 저자들은 모델이 문서가 뒷받침하지 않는 분석을 자신 있게 더하고 중요한 출처를 없앤다고 결론냅니다.

결론

세 모델 모두 장단점이 있습니다. NotebookLM은 인용에서 훨씬 낫지만 바로 그 목적으로 만들어졌음에도 기자, 연구자, 변호사라면 해고될 오류율을 보입니다. 연구 프레임워크로서는 다른 두 플랫폼의 편리한 글쓰기 기능도 부족합니다.

다만 NotebookLM은 비슷한 문서의 일반적 분포를 토대로 업로드 내용을 추측하는 ChatGPT의 위험한 습관과 달리 실제 문서를 읽는 것으로 보입니다. ChatGPT가 메타데이터나 자체 추정에 의존하지 않고 전체를 읽게 만들기는 어렵습니다.

법률, 저널리즘, 과학처럼 출처와 인용이 중요한 분야에서 현재 선도 LLM에는 사용자가 지정한 정보를 정확히 추출하고 다루는 한계를 개선할 기본 훈련 기능이 없습니다.

단순한 시스템 프롬프트나 MCP 설정보다 나은 인터페이스가 나오기 전까지, 핵심 분야의 모든 출력은 비싸고 번거롭지만 필요한 인간이 계속 확인해야 합니다.

 

* Google Cloud의 자세한 설명은 여기에서 볼 수 있습니다.

† 저자의 본문 인용을 하이퍼링크로 변환했습니다.

2025년 10월 1일 수요일 최초 게시. 10월 2일 요약 오류와 첫 문단의 문체 오류를 수정했습니다.

머신러닝 분야 작가이자 인간 이미지 합성 도메인 전문가. Metaphysic.ai에서 연구 콘텐츠 책임자를 역임했으며, DNEG의 Brahma.ai로 통합될 때까지 근무했습니다.
웹사이트: martinanderson.ai
연락처: martin@martinanderson.ai