Anderson의 관점

왜 AI는 답을 모른다고 그냥 인정하지 못할까?

mm
Unite.AI를 Google의 선호 소스에 추가
Flux1.D Pro, Flux Kontext Pro, Firefly V3.

대형 언어 모델은 질문에 답할 수 없을 때도 자신감 있게 답변을 제시하는 경우가 많습니다. 새로운 연구에 따르면 이러한 모델은 내부적으로 문제를 인식하고도 여전히 무언가를 만들어 내어, 알고 있는 것과 말하는 것 사이의 숨은 격차를 드러냅니다.

 

ChatGPT나 Qwen 시리즈와 같은 주요 대형 언어 모델을 어느 정도 사용해 본 사람이라면, 모델이 잘못된 답변을 제공한 경우를 경험했을 것입니다(그 결과가 심각한 지역적 영향을 미쳤는지는 사용 정도에 따라 다릅니다). 오류가 명확해지면 모델은 단순히 사과만을 표명합니다.

주요 LLM이 질문에 대한 답을 모른다고 인정하는 데 어려움을 겪는 이유는 작지만 성장하고 있는 연구 분야이기 때문입니다. ‘자신감 있게 틀린’ 답변은 극도로 검열된 API 기반 인터페이스인 ChatGPT와 같은 환경에서 특히 해로울 수 있습니다. 이러한 모델은 NSFW나 기타 ‘규칙 위반’ 입력·출력을 적극 차단하기 때문입니다.

이는 사용자에게 모델이 확고하고 절대적인 것처럼 잘못된 인상을 줄 수 있습니다. 실제로 거부는 호스트 기업의 법적 위험을 최소화하기 위해 전통적인 휴리스틱이나 차단 목록 기반 필터에서 비롯된 것이지, AI 자체의 통찰에서 나온 것이 아닙니다.

2025년 6월 FAIR at Meta의 'AbstentionBench' 논문 – 좌측 그림은 35,000개 이상의 답할 수 없는 질문에 대한 모델 행동을 테스트하는 AbstentionBench에서 포착된 실패 유형 범위를 강조합니다; 중앙에서는 모델이 충분한 정보를 갖추지 못했음에도 허구의 답변을 제시하는 사례를 보여줍니다; 우측에서는 모델이 추론에 초점을 맞추도록 튜닝될 때 거부 재현율이 감소함을 나타냅니다. 출처: https://arxiv.org/pdf/2506.09038

2025년 6월 FAIR at Meta의 ‘AbstentionBench’ 논문 – 좌측 그림은 35,000개 이상의 답할 수 없는 질문에 대한 모델 행동을 테스트하는 AbstentionBench에서 포착된 실패 유형 범위를 강조합니다; 중앙에서는 모델이 충분한 정보를 갖추지 못했음에도 허구의 답변을 제시하는 사례를 보여줍니다; 우측에서는 모델이 추론에 초점을 맞추도록 튜닝될 때 거부 재현율이 감소함을 나타냅니다. 출처: https://arxiv.org/pdf/2506.09038

중국의 새로운 논문은 LLM이 실제로는 사용자가 제시한 질문에 답할 수 없다는 사실을 비밀리에 알고 있지만, 충분한 자신감이 없어도 어쩔 수 없이 어떤 형태의 답변을 만들어 내야 한다고 주장합니다. 이는 사용자 정보 부족, 모델 한계, 기타 이유 등으로 인해 유효한 답변이 없다는 결정을 내릴 자신감이 부족하기 때문입니다.

논문은 다음과 같이 말합니다:

‘[We]는 [LLMs]가 이러한 질문의 결함을 인식할 충분한 인지 능력을 가지고 있음을 보여줍니다. 그러나 적절한 거부 행동을 보이지 못해 내부 인지와 외부 응답 사이의 불일치를 드러냅니다.’

연구진은 인지 모니터링·프로빙을 활용해 LLM 내부 프로세스에서 답변을 제공할 수 없다는 징후를 스캔하고, 이후 개입하여 모델의 ‘도움이 되는’ 성향이 사용자를 맹목적이거나 파괴적인 길로 이끌지 않도록 하는 경량 2단계 접근법을 개발했습니다.

이 연구는 의도적으로 명시되지 않은 수학 문제를 사용해 모델이 답을 알 수 없음을 인식할 수 있는지를 테스트합니다. 그러나 이러한 설정은 과제를 ‘속임수’로 프레이밍할 위험이 있습니다. 실제로 모델은 모호한 표현이나 도메인 지식의 공백 등 일상적인 이유로 대화에서 거부해야 할 상황에 더 자주 직면합니다.

이 새로운 연구의 제목은 답할 수 없는 질문에 답하는 것은 알면서도 오류를 범하는 일이다: 대형 추론 모델의 답변 유보 실패 분석 및 완화이며, 난징대학교의 신소프트웨어기술 국가중점연구실과 국가보건의료데이터과학연구소 소속 연구자 네 명이 수행했다.

방법

(저자들의 접근법을 시험할 적절한 경쟁 모델이 없고, 논문이 다소 비전통적인 형식을 따르며 인용을 일반 표준에 맞추지 않았기 때문에 가능한 한 원문을 충실히 따르려고 노력했습니다.)

이전 approaches에 따라, 저자들은 Synthetic Unanswerable Math (SUM) dataset에서 추출한 답이 없는 수학 문제를 LLM에 제시하는 데 집중했으며, 다섯 모델군을 평가했습니다: DeepSeek 라인에서는 R1-Distill-Llama-8B; R1-Distill-Qwen-7B, R1-Distill-Qwen-14B; 그리고 Qwen 시리즈에서는 Qwen3-8B와 Qwen3-14B.

SUM의 답할 수 없는 문제들은 다섯 가지 방식으로 핵심 요소를 삭제하거나 손상시켜 생성되었습니다: 핵심 정보를 삭제, 모호성 도입, 비현실적인 조건 부여, 무관한 객체 참조, 혹은 질문 자체를 완전히 제거.

그 후, 1,000개의 사례를 표본으로 선정해 분석했으며, GPT-4o를 사용해 간결한 설명을 생성해 정답 근거로 활용했습니다.

답변할 수 없는 질문에 대한 모델의 응답은 10,000 토큰 예산의 표준 프롬프트를 사용해 평가되었으며, 이 과정에서 세 가지 주요 행동 양상이 관찰되었습니다. 첫 번째 경우, 모델은 질문이 해결 불가능함을 인식하고 보류했으며—보통 명시적인 불확실성 표현으로 응답했습니다. 두 번째 경우, 모델은 누락된 정보를 창조하여 완전한 답을 만들었는데, 예를 들어 최종 결과를 정당화하기 위해 존재하지 않는 $9.99 처리 수수료를 도입했습니다(아래 이미지 참조). 세 번째 경우는 인지 고착이라고 불리며, 모델이 확장된 추론 루프에 빠져 질문에 실질적인 답이 없다는 것을 암묵적으로 인식한 후에도 잘못된 해결 경로를 지속했습니다.

불가능한 질문에 대한 다양한 응답 결과.

불가능한 질문에 대한 다양한 응답 결과.

이 논문은 규모가 큰 모델일수록 답변할 수 없는 질문에 대해 보류하는 빈도가 높아지는 추세를 제시하며, 허위 답변과 고착 행동 모두가 감소하고 있음을 보여줍니다:

답변할 수 없는 수학 문제에 대한 모델 응답의 구분으로, 다양한 모델 규모별로 올바른 보류, 허위 답변, 인지 고착의 상대적 빈도를 보여줍니다.

답변할 수 없는 수학 문제에 대한 모델 응답의 구분으로, 다양한 모델 규모별로 올바른 보류, 허위 답변, 인지 고착의 상대적 빈도를 보여줍니다.

하지만 이러한 변화는 규모에 한정되어 있으며, 많은 경우가 올바른 보류를 통해 해결되지 않아, 용량만 증가한다고 해서 보다 신중한 행동이 보장되는 것은 아니라는 점을 시사합니다.

교착 상태 인식

언어 모델이 질문에 실제로 답이 없다는 것을 인식할 수 있는지 테스트하기 위해, 연구진은 모델의 추론을 중간에 중단하고 최종 답변을 요구하거나 질문이 답할 수 없는 이유왜에 대한 설명을 요구했습니다.

모델이 끝없이 추론을 지속하는 경우, ‘wait’라는 단어에서 멈추게 하고 응답을 요청했으며, 모델이 빠르게 허위 답변을 생성하는 경우에는 단락 경계에 중단을 삽입했습니다.

왼쪽 차트는 중간 추론 중단 시 모델이 올바르게 보류하는 비율을 보여주며, 고착 사례에서 허위 답변보다 높은 비율을 나타냅니다. 오른쪽 차트는 대부분의 모델이 프롬프트 시 질문이 답할 수 없음을 설명할 수 있음을 보여주지만, 최종 답변에서는 그 이해가 반영되지 않을 수 있습니다.

왼쪽 차트는 중간 추론 중단 시 모델이 올바르게 보류하는 비율을 보여주며, 고착 사례에서 허위 답변보다 높은 비율을 나타냅니다. 오른쪽 차트는 대부분의 모델이 프롬프트 시 질문이 답할 수 없음을 설명할 수 있음을 보여주지만, 최종 답변에서는 그 이해가 반영되지 않을 수 있습니다.

많은 경우에서 모델은 올바른 보류나 명확한 설명을 제공했으며, 이전에 잘못된 답을 생성했더라도 그렇습니다. 저자들은 이것이 모델이 추론 중에 문제를 인식한다는 경우가 많지만, 최종 출력에서 그 인식을 반영하지 못한다는 것을 시사한다고 제안합니다.

LLM의 마음 읽기

언어 모델이 질문에 답할 수 있는지를 내부적으로 추적하는지를 테스트하기 위해, 연구진은 추론 중 모델의 숨겨진 활성화에 작은 분류기를 학습시켜, 답변 가능 여부에 대한 구분이 최종 출력에 반영되지 않더라도 모델 내부 신호에 이미 존재하는지를 확인했습니다.

높은 수준의 개념인 진실성이나 성별이 모델 활성화에 선형적으로 내재될 수 있다는 아이디어를 바탕으로, ‘답변 가능성’*도 유사한 표현을 갖는지 테스트했습니다.

간단한 선형 분류기(프로브)를 모델의 숨겨진 활성화에 대해 다양한 레이어에서 학습시켰으며, 잔차 연결 직전의 다중 헤드 어텐션 메커니즘 출력을 사용했습니다.

각 프로브는 추론 과정의 내부 활성화를 기반으로 질문이 답변 가능 여부를 구별하도록 학습되었습니다. 입력은 SUM 데이터셋에서 추출한 2,200개의 질문 쌍으로 구성되었으며, 2,000개는 학습에, 200개는 검증에 사용되었습니다.

추론 시점에서 모델의 예측은 추론 시퀀스에서 해당 시점까지 관찰된 토큰들에 대해 평균을 내어 계산되며, 이를 통해 프로브는 시간에 따라 답변 가능성 관련 신호가 어떻게 나타나는지 추적할 수 있습니다.

답변 가능 여부를 구별하도록 훈련된 선형 프로브의 분류 정확도, 추론 과정의 다양한 시점에서 측정. 일반적으로 추론이 진행될수록 정확도가 향상되며, 대형 모델은 최종 단계에서 85% 이상에 도달합니다.

답변 가능 여부를 구별하도록 훈련된 선형 프로브의 분류 정확도, 추론 과정의 다양한 시점에서 측정. 일반적으로 추론이 진행될수록 정확도가 향상되며, 대형 모델은 최종 단계에서 85% 이상에 도달합니다.

위에서와 같이, 추론이 진행됨에 따라 탐지 정확도가 꾸준히 향상되었으며 대부분의 모델이 최종 단계에서 80% 이상의 분류 정확도를 기록했습니다. 이는 모델의 외부 행동이 이를 반영하지 못하더라도 내부 표현이 질문에 답할 수 있는지 여부를 명확히 나타내는 신호를 담고 있다는 증거입니다.

완고한 고집

이전 결과가 대형 언어 모델이 질문에 답할 수 없음을 종종 인식한다는 점을 시사하지만, 논문에서는 이들이 여전히 답변을 회피하기보다 계속해서 답을 생성하는 경향이 있다고 지적합니다.

이 불일치를 조사하기 위해 연구진은 추론 과정의 특정 시점에서 모델이 회피하는 자신감을 분석했으며, 출력의 세 범주에 걸쳐 모델 자신감을 비교했습니다: 정확한 회피; 허위 답변; 그리고 인지 고착.

각 범주마다 동일한 크기의 샘플을 사용했으며, 자신감은 디코딩 단계 전반에 걸쳐 각 출력 토큰에 할당된 최대 확률의 평균으로 정의되며, 이전 연구의 공식에 기반합니다. 아래 그래프에서 볼 수 있듯이, 허위 답변과 인지 고착 사례는 정확한 회피에 비해 회피 자신감이 낮게 나타났습니다:

다양한 응답 유형별로 'I don't know' 회피 응답을 생성할 때의 자신감 수준.

다양한 응답 유형별로 ‘I don’t know’ 회피 응답을 생성할 때의 자신감 수준.

연구진은 또한 추론 과정에서 모델이 ‘I don’t know’ 응답을 얼마나 자주 생성하는지도 측정했습니다. 아래 그래프는 정확한 회피 사례가 회피 빈도가 더 높았으며, 다른 두 범주는 이러한 응답을 덜 자주 생성했음을 보여줍니다:

추론 중 중단 지점에서 관찰된 'I don't know' 응답 빈도, 응답 결과 유형별로 표시.

추론 중 중단 지점에서 관찰된 ‘I don’t know’ 응답 빈도, 응답 결과 유형별로 표시.

저자들은 이러한 결과가 모델이 내부적으로 답할 수 없음을 감지할 수는 있지만, 그 인식을 행동으로 옮길 자신감이 부족해 불확실성을 인정하기보다 작업을 완수하려는 지속적인 선호를 나타낸다고 주장합니다.

테스트

이러한 결과를 바탕으로 연구진은 회피를 개선하기 위한 두 단계 방법을 개발했습니다. 첫 번째 단계인 인지 모니터링은 추론 중 모델의 은닉 상태를 추적하여 절이나 멈춤과 같이 ‘wait’와 같은 단어로 표시되는 자연스러운 단위로 추론 과정을 구분합니다.

각 구간의 끝에서는 답변 가능성과 연결된 내부 신호를 학습한 가벼운 선형 탐지가 질문에 답할 수 없을 가능성을 추정합니다. 이 확률이 설정된 임계값을 초과하면 과정은 두 번째 단계인 추론 시 개입으로 넘어가며, 모델이 허위 답변을 생성하기보다 회피하도록 유도합니다.

모델이 질문에 답할 수 없다는 내부 신호를 보이면, 추론은 이 인식을 강화하고 회피 가능성을 높이는 개입으로 중단됩니다. 아래에 표시된 바와 같이, 이 개입은 모델에게 질문에 유효한 답이 없을 수 있음을 상기시키는 ‘가이드 프롬프트’를 나타냅니다:

추론 시 개입을 조건화하기 위한 프롬프트.

추론 시 개입을 조건화하기 위한 프롬프트.

이 방법은 또한 불필요하게 추론 순서가 계속되는 것을 방지하는 조기 종료 메커니즘을 포함하여, 모델이 회피를 정당하고 때로는 더 바람직한 선택으로 인식하도록 장려합니다.

테스트 단계에서는 연구진이 두 개 데이터셋을 사용했습니다: Unanswerable Math Word Problem (UMWP)와 앞서 언급한 SUM.

이 목적을 위해 SUM의 테스트 세트를 사용했으며, 여기에는 284개의 답할 수 없는 질문과 284개의 답할 수 있는 질문이 수동 검증되었습니다. UMWP는 네 가지 수학 문제 출처인 SVAMP; MultiArith; Grade School Math(GSM8K); 및 ASDiv에서 구성되었습니다.

전체 데이터셋은 5,200개의 문제로 구성되었으며, 그 중 600개를 테스트용으로 샘플링했으며 답할 수 없는 질문과 답할 수 있는 질문이 각각 절반씩 나뉘었습니다. UMWP의 답할 수 없는 항목에 대해서는 GPT-4o가 해결할 수 없는 이유에 대한 정답 설명을 생성했습니다.

지표

모델 성능은 네 가지 지표로 측정되었습니다: 회피율, 즉 모델이 “I don’t know”라고 올바르게 회피한 답할 수 없는 질문의 비율; 이유 정확도, 모델이 답할 수 없는 질문에 대해 왜 해결할 수 없는지 유효한 설명을 제공한 비율; 토큰 사용량, 추론 중 생성된 토큰 수; 그리고 정답 정확도, 답할 수 있는 질문에 대해 모델이 올바른 최종 해결책을 제시한 비율.

테스트 기준선

표준 기준이 존재하지 않기 때문에, 연구자들은 두 가지 대안인 Dynasor-CoT와 Dynamic Early Exit in Reasoning Models (DEER)와 비교했으며, 질문에 해결책이 없을 때 올바른 답변으로 올바른 포기를 취급해야 한다는 가정하에 진행했습니다.

Dynasor-CoT는 모델이 중간 답변을 생성하도록 유도하고 동일한 결과가 연속으로 세 번 나타나면 중단하며, DEER는 문장 수준에서 신뢰도를 모니터링하고 임계값에 도달하면 추론을 멈춥니다.

세 번째 기준인 Vanilla는 수정되지 않은 모델 출력을 의미합니다. 테스트에는 앞서 언급한 다섯 가지 Qwen 및 DeepSeek 변형이 사용되었습니다.

전체 결과는 아래에 나타나 있습니다:

대규모 추론 모델에서 답변 가능한 질문과 답변 불가능한 질문에 대한 다양한 방법의 비교이며, 각 열에서 가장 높은 값은 굵게 표시되었습니다.

대규모 추론 모델에서 답변 가능한 질문과 답변 불가능한 질문에 대한 다양한 방법의 비교이며, 각 열에서 가장 높은 값은 굵게 표시되었습니다. 더 나은 해상도를 위해 원본 논문을 참고하십시오.

새로운 접근법은 답변 불가능한 질문에서 가장 높은 포기율과 정확한 추론률을 기록했습니다. 답변 가능한 질문에서는 정확도가 베이스라인 모델과 거의 동일했으며 때때로 향상되어 일반적인 문제 해결에 영향을 주지 않았음을 시사합니다.

토큰 사용량도 답변 불가능한 경우에 30%에서 50%까지 감소했으며, 답변 가능한 경우에도 약간 감소하여 효율성이 향상되었습니다.

포기율과 추론 정확도 사이에도 연관성이 발견되었는데, 더 자주 포기한 모델이 더 나은 설명을 제공했으며, 이는 추론 품질이 향상되었음을 나타낸다고 저자들은 해석합니다.

Qwen3 모델은 일반적으로 증류 기반(양자화) 버전보다 우수했으며, 더 큰 모델일수록 포기 능력이 강화되어 아키텍처와 규모 모두가 신뢰할 수 있는 답변 불가능성 탐지에 중요함을 보여줍니다.

마지막으로, 저자들은 새로운 방법이 환각과 고착을 감소시키고 올바른 포기의 비율을 높인다고 보고했으며, ‘early exits’에만 의존하는 기존 접근법은 때때로 더 많은 환각 답변을 초래한다고 밝혔습니다.

또한, 저자들은 잠재 신호에 기반한 모니터링이 행동 신호에 의존하는 전략보다 더 효과적임을 입증하며, “모르겠어요”라는 응답의 자신감과 빈도 모두에서 향상을 보고했습니다.

결론

LLM이 필요할 때 질문에 답변을 포기하지 못하는 것은 생성 AI 사용자 경험에서 가장 큰 마찰점 중 하나이며, 인터페이스의 다른 특성들이 AI가 신중한 답변을 할 수 있다는 착각을 주기 때문에 더욱 문제가 됩니다. 현재로서는 대부분의 경우 그렇지 않기 때문입니다.

모델의 ‘성격’에서 직접 파생되지 않은 모든 직접적인 개입에 대한 한 가지 우려는, 감지된 활성화가 실제로 모델이 패배를 인정하는 데 관련이 있는지에 따라 과도하게 사용되거나 충분히 사용되지 않을 수 있다는 점입니다.

또한, 선형 탐지 모니터링의 물류 비용이 무시할 수 없을 정도로 클 가능성이 있으며, 금지된 콘텐츠를 사용자에게 차단하는 것과 유사한 간단한 휴리스틱 방법이 더 저렴한 해결책이 될 수 있습니다. 단, 앵커 트리거를 충분히 정의할 수 있는 경우에 한합니다.

 

* 이는 겉보기에 동의어인 ‘책임감’과는 일치하지 않지만, 특정 질문이 전혀 답변될 수 있는지 여부를 정의합니다.

2025년 8월 27일 수요일 최초 게시

머신러닝 분야 작가이자 인간 이미지 합성 도메인 전문가. Metaphysic.ai에서 연구 콘텐츠 책임자를 역임했으며, DNEG의 Brahma.ai로 통합될 때까지 근무했습니다.
웹사이트: martinanderson.ai
연락처: martin@martinanderson.ai