AI 모델 및 플랫폼
AI 벤치마크가 모델에게 거짓말을 가르칠 때

AI 환상 — 시스템이 정답처럼 들리지만 실제로는 틀린 답을 내놓는 현상은 — 인공지능 분야에서 가장 어려운 문제 중 하나입니다. 오늘날 가장 발전된 모델들, 예를 들어 DeepSeek-V3, Llama, 그리고 OpenAI의 최신 릴리즈도 여전히 높은 확신으로 부정확한 정보를 생성합니다. 의료나 법률과 같은 분야에서 이러한 오류는 심각한 결과를 초래할 수 있습니다.
전통적으로 환상은 대규모 언어 모델이 훈련되는 방식의 부산물로 간주되어 왔습니다. 모델은 정보가 사실인지 확인하지 않고 다음 가장 가능성이 높은 단어를 예측하도록 학습합니다. 그러나 새로운 연구는 이 문제가 훈련에서 끝나지 않을 수 있음을 시사합니다. AI 성능을 테스트하고 비교하는 데 사용되는 벤치마크가 실제로 잘못된 행동을 강화할 수 있습니다. 모델은 사실이 아닌 설득력 있는 답변을 제공하도록 학습합니다.
이 관점의 전환은 문제를 재정의합니다. 모델이 테스트를 통과하기 위해 사실을 말하는 대신 거짓말을 하도록 훈련된다면, 환상은 우연한 결함이 아니라 학습된 전략입니다. 이를 이해하기 위해 모델이 모르는 것을 인정하는 대신 왜 추측하는지 살펴보아야 합니다.
AI 모델이 추측하는 이유
AI 모델이 모르는 것을 인정하는 대신 추측하는 이유를 이해하기 위해, 어려운 시험 문제를 맞닥뜨린 학생을 생각해 보십시오. 학생은 두 가지 선택이 있습니다. 답을 비워두고 0점을 받거나, 정답일 가능성이 있는 추측을 하여 몇 점을 얻을 수 있습니다. 합리적으로 생각해 보면, 추측하는 것이 더 좋은 선택입니다. 왜냐하면 옳을 가능성이 있기 때문입니다.
AI 모델도 평가에서 비슷한 상황에 놓입니다. 대부분의 벤치마크는 정답에만 점수를 주고 부정확하거나 불확실한 답에는 점수를 주지 않습니다. 모델이 연구자의 생일을 정말 모를 때 “모르겠습니다”라고 답하면 실패하지만 날짜를 지어내면 맞을 가능성이 생깁니다. 틀리더라도 평가 체계는 자신만만한 추측을 더 엄하게 벌하지 않습니다.
이러한 구조는 환각이 계속되는 이유를 설명합니다. 모델은 잘못 행동하는 것이 아니라 평가 체계에 내장된 인센티브를 따릅니다. 확신 있게 답하는 것이 점수를 높이는 최선의 방법임을 학습하기 때문에 사실이 아니어도 설득력 있는 답을 내놓게 됩니다.
AI 부정직의 수학적 기초
연구는 환상이 언어 모델이 학습하는 수학적 기초에서 비롯됨을 보여줍니다. 모델이 완벽하게 정확한 정보로만 훈련되었다고 해도, 모델의 통계적 목표는 여전히 오류를 유발할 것입니다. 왜냐하면 올바른 답변을 생성하는 것이 답변의 유효성을 확인하는 것보다 훨씬 더 어려니까입니다.
이것은 모델이 명확한 패턴이 없는 사실, 예를 들어 생일이나 기타 고유한 세부 사항에서 자주 실패하는 이유를 설명합니다. 수학적 분석에 따르면 이러한 경우 환상률은 훈련 데이터에 나타나는 사실의 비율만큼 높을 것입니다. 즉, 정보가 훈련 데이터에서 더 희박할수록 모델이 어려움을 겪을 가능성이 더 높습니다.
문제는 희박한 사실에만 국한되지 않습니다. 모델의 수학적 프레임워크에서 비롯되는 체계적인 오류도 있습니다. 예를 들어, 이전 모델은 매우 짧은 컨텍스트 윈도우로 인해 장거리 추론이 필요한 작업에서 일관적으로 실패했습니다. 이러한 오류는 무작위적인 결함이 아니라 모델의 수학적 프레임워크의 예측 가능한 결과입니다.
사후 훈련이 문제를 해결하지 못하는 이유
AI 모델이 대규모 텍스트 데이터셋으로 훈련된 후, 보통 출력을 더 유용하고 유해하지 않게 만들기 위해 사후 훈련을 거칩니다. 그러나 이 과정은 처음부터 환상을 일으키는 동일한 핵심 문제에 직면합니다. 모델을 평가하는 방식입니다.
사후 훈련의 가장 일반적인 방법, 즉 인간 피드백으로부터 강화 학습도 여전히 이진 스코어링을 사용하는 벤치마크에 의존합니다. 이러한 벤치마크는 모델이 확신을 가지고 있는 답변을 제공할 때 점수를 주지만, 모델이 모르는 것을 인정할 때는 점수를 주지 않습니다. 따라서 항상 확신을 가지고 있는 답변을 제공하는 모델은, 모르는 것을 인정하는 모델보다 더 나은 성능을 보일 수 있습니다.
연구자들은 이것을 불확실성을 처벌하는 문제라고 부릅니다. 환상을 감지하거나 줄이는 데 사용되는 가장 발전된 기술도 평가 시스템이 과신을 계속 강화하는 한 어려움을 겪습니다. 즉, 평가 시스템이 확신을 가지고 있는 추측을 올바른 답변보다 더 강하게 강화하는 한, 모델은 틀린 답을 제공하는 대신 불확실성을 인정하는 것을 선택할 것입니다.
진보의 환상
리더보드는 AI 커뮤니티에서 널리 공유되고 있습니다. MMLU, GPQA, SWE-bench와 같은 벤치마크는 연구 논문과 제품 발표에서 지배적입니다. 회사들은 자신의 점수를 강조하여 빠른 진행을 보여줍니다. 그러나 보고서에 따르면, 이러한 벤치마크가 환상을 강화합니다.
진실을 말하는 모델은 실제 환경에서 더 안전할 수 있지만, 리더보드에서 더 낮은 순위를 차지할 것입니다. 반면에, 설득력 있는 nhưng 거짓된 답변을 만드는 모델은 더 높은 점수를 얻을 것입니다. 채택, 자금, 명성이 리더보드 순위에 달려 있다면, 진행 방향이 왜곡됩니다. 대중은 지속적인 개선의 내러티브를 보지만, 실제로는 모델이 거짓말을 하도록 훈련되고 있습니다.
AI에서 정직한 불확실성이 중요한 이유
환상은 연구 도전이 아니라 실제 결과를 초래합니다. 의료 분야에서 모델이 약물 상호작용을 만들어내면 의사에게 잘못된 정보를 제공할 수 있습니다. 교육 분야에서 모델이 역사적 사실을 만들어내면 학생들에게 잘못된 정보를 제공할 수 있습니다. 저널리즘 분야에서 채팅봇이 거짓된 nhưng 설득력 있는 인용문을 생성하면 허위 정보를 퍼뜨릴 수 있습니다. 이러한 위험은 이미 보이고 있습니다. 스탠퍼드 AI 인덱스 2025 보고서에 따르면 환각을 측정하는 벤치마크는 AI 도입이 가속되는 상황에서도 “큰 관심을 얻지 못했습니다.” 반면 순위표를 장악하고 과신을 키우는 벤치마크는 여전히 발전 방향을 정하는 데 사용되고 있습니다.
이러한 발견은 도전과 기회를 모두 강조합니다. 환상의 수학적 근본을 조사함으로써, 연구자들은 더 신뢰할 수 있는 AI 시스템을 구축하기 위한 명확한 방향을 식별했습니다. 핵심은 불확실성을 결함으로 간주하는 것을 중단하고, 대신 필수적인 능력으로 인식하여 측정하고 보상하는 것입니다.
이 관점의 전환은 환상을 줄이는 것을 넘어서서 영향을 미칩니다. 자신의 지식 한계를 정확하게 평가하고 전달할 수 있는 AI 시스템은 의료 진단, 법적 분석, 과학 연구와 같은 고위험 응용 분야에서 더 적합할 것입니다. 이러한 분야에서는 과신이 심각한 위험을 초래할 수 있습니다.
정직한 AI를 위한 평가 재고
이러한 발견은 더 신뢰할 수 있는 AI를 구축하기 위해 우리가 AI 능력을 측정하는 방식을 재고해야 함을 강조합니다. 단순한 올바름 또는 틀림 스코어링에 의존하는 대신, 평가 프레임워크는 모델이 불확실성을 적절하게 표현할 때 보상해야 합니다. 이것은 벤치마크 지침에 명확한 확신 임계값과 해당 스코어링 체계를 제공하는 것을 의미합니다.
한 가지 유망한 접근 방식은 모델이 답변을 제공해야 하는 경우와 답변을 생략해야 하는 경우를 지정하는 명시적인 확신 임계값을 생성하는 것입니다. 예를 들어, 지침은 답변을 제공하기 전에 확신이 특정 임계값을 초과해야 한다고 명시할 수 있으며, 스코어링은 그에 따라 조정됩니다. 이러한 설정에서 불확실성은 약점이 아니라 책임 있는 행동의 가치 있는 부분입니다.
핵심은 확신 요구 사항을 명시적으로 만드는 것입니다. 현재의 벤치마크는 모델이 피할 수 있는 불확실성에 대한 숨겨진 처벌을 생성합니다. 명시적인 확신 임계값은 모델이 실제로 원하는 행동을 최적화하도록 허용할 것입니다. 즉, 확신이 있는 경우 정확한 답변을 제공하고, 지식이 부족한 경우 정직한 불확실성을 인정하는 것입니다.
결론
AI 환각은 우연한 결함만이 아니라 평가 벤치마크가 강화한 결과이기도 합니다. 현재 체계는 “모르겠다”는 정직한 답보다 자신감 있는 추측을 선호해 모델을 신뢰하기 어려운 방향으로 몰아갑니다. 의료와 법률, 과학처럼 위험도가 높은 분야에서 신뢰할 수 있는 AI를 원한다면 시험과 보상 방식을 바꿔야 합니다. 발전은 정확성뿐 아니라 모델이 모르는 것을 인정하는 능력으로도 측정해야 합니다.












