Anderson의 관점
언어 모델의 환상을 막는 ‘젠’ 방법

ChatGPT에게 무작위로 답변을 사실검사하기 전에 실제 문제를 해결하라고 지시하면 모델이 더 많이 생각하고 더 자주 올바른 답변을 반환합니다. 즉, 이전의 ‘무작위’ 답변과 실제 질의가 아무 관련이 없더라도 말입니다.
중국에서 나온 새로운 논문은 언어 모델이 환상을 보이는 것을 막고 답변의 품질을 향상시키는 매우 저렴한 방법을 개발했습니다. 즉, 모델이 전혀 관련이 없는 질문에 대한 답변을 먼저 사실검사하도록 하는 것입니다.

LLM의 ‘마음을 자유롭게’ 해주고 실제 후속 질문에 집중할 수 있는 무작위 질문의 예입니다. 출처
이 젠 슬랩은 다른 더 복잡한 방법들, 즉 파인튜닝, 프롬프트 크래프팅, 및 병렬 샘플링에 비해 성능을 향상시키는 매우 저렴한 방법입니다. 또한 이는 오픈소스와 클로즈드소스 모델 모두에서 작동하며, 이는 여러 LLM 아키텍처에 공통적인 근본적인 특성을 발견했음을 나타냅니다.
저자들은 이 방법의 경제적 이점을 다음과 같이 설명합니다.
‘최소한의 추가적인 사전 지식으로 VF를 구현하기 위해, VF는 프롬프트에 무작위/사소한 답변을 제공하기만 하면 됩니다. 검증 과정은 일반적인 CoT 경로보다 출력 토큰이 훨씬 적게 필요로 하며, 때때로 명시적인 검증 전용 과정도 필요하지 않으므로 매우 적은 추가 테스트 시간 계산이 필요합니다.’
이 접근법, 즉 Verification-First(VF)라고 불리움, 다양한 작업에서 답변을 개선할 수 있었습니다. 이는 수학적推론을 포함한 오픈소스와 상업 플랫폼 모두에서 작동했습니다.
이 기술이 작동하는 이유 중 하나는 언어 모델이 인간 심리학의 경향을 흡수하고 적응시키는 방식에 기반할 수 있습니다. 즉, 직접적인 질문은 모델을 ‘방어적’이고 ‘신경질적인’하게 만들 수 있지만, 다른 사람의 작업을 검증하도록 요청하는 것은 이러한 ‘생존 본능’을 자극하지 않습니다.
핵심 아이디어는 답변을 검증하는 것이 답변을 처음부터 생성하는 것보다 더 적은 노력이 필요하며, 이는 표준 사슬思考을 보완하는 다른 推論 경로를.trigger할 수 있습니다.
모델에게 주어진 답변을 비판하도록 요청하는 것(즉, 모델이 생성하지 않은 답변)은 또한 모델의 첫 번째 인상을 너무 신뢰하지 않도록 도와주는 비판적思考을 활성화할 수 있습니다.
작업은 역방향推論 경로라는 용어로 설명합니다.

제안된 답변에서 시작하여 질문으로 역방향으로 推論하는 것은 문제만으로는 더 어려운 단축 경로나 통찰력을 노출할 수 있습니다.
연구자들은 또한 이 핵심 개념을 Iter-VF라고 불리는 순차적 시간 테스트 스케일링 방법으로 구체화했습니다. 이는 답변을 반복적으로 개선하는 방법으로, 이전 답변을 재사용하여 오류 누적 문제를 피할 수 있습니다.
새로운 연구는 Asking LLMs to Verify First is Almost Free Lunch라고 제목이 붙여졌으며, 베이징의 칭화대전자공학과의 두 연구자에 의해 수행되었습니다.
방법
새로운 연구의 핵심 아이디어는 언어 모델의 일반적인 推論 흐름을 뒤집는 것입니다. 즉, 모델에 문제를 처음부터 해결하도록 요청하는 대신, 후보 답변(종종 잘못되거나 임의적인)을 주고 그 답변을 검증하도록 요청합니다.
이것은 모델이 역방향으로 推論하도록 유도합니다. 즉, 제안된 답변에서 시작하여 질문으로 역방향으로 推論합니다. 검증이 완료되면 모델은 원래 문제를 해결하도록 진행합니다.
이 역방향은 모델이 더 신중하게 推論하도록 유도하여 무심코 발생하는 오류를 줄이고, 모델이 숨겨진 구조를 발견하고 오도적인 가정에서 벗어나도록 도와줍니다.
다음 예제에서 볼 수 있듯이, 모델에 明显 잘못된 추측인 ’10’을 검증하도록 요청하는 것조차도 모델이 잘못된 논리를 회복하고 표준 사슬思考 프롬프트보다 더 나은 성능을 발휘하도록 도와줄 수 있습니다.

모델에 추측된 답변을 먼저 검증하도록 요청하면 모델이 불일치를 발견하고 문제에 더 신중하게 참여하도록 도와줍니다.
실제 문제에 대해 모델에 추측을 제공하는 것이 쉽지 않은 경우, 특히 작업이 개방형인 경우(예: 코드 작성 또는 API 호출), 이 방법은 모델의 이전 답변을 다시 모델에 제공하여 검증하도록 합니다.

모델이 자신의 이전 출력을 검증하도록 요청하면 모델은 논리의 결함을 잡고 해결책을 올바르게 다시 작성합니다.
이 접근법은 앞서 언급한 Iter-VF를 구성합니다. 모델은 이 주기를 반복하며, 각 단계에서 이전 답변을 재사용하여 답변을 개선합니다. 이는 재학습이나 특수 도구가 필요하지 않습니다. 다른 자체 수정 전략과 달리, Iter-VF는 각 단계에서 가장 최근의 답변만 고려하여, 확장된 推論 체인의 혼란을 피할 수 있습니다.
데이터 및 테스트
저자들은 이 방법을 4개의 도메인에서 평가했습니다: 일반적인 推論 작업, VF가 사소한 추측으로 시드됩니다. 시간에 민감한 작업, Iter-VF가 라이벌 스케일링 방법과 비교됩니다. 개방형 문제는 코드 작성 및 API 호출과 같은 경우, VF는 모델의 이전 답변을 사용합니다. 그리고 클로즈드 소스 상업용 LLM은 내부 推論 단계가 접근할 수 없는 경우입니다.
이 방법을 테스트하기 위해, 연구자들은 3개의 推論 벤치마크를 사용했습니다: GSM8K와 MATH500는 수학 문제를 위한 것입니다. 그리고 GPQA-Diamond는 대학 수준의 과학 질문을 위한 것입니다.
각 경우에, 모델은 무작위로 추측된 숫자 답변(예: ‘1’) 또는 무작위로 섞인 다중 선택 항목을 시작 점으로 사용했습니다. 특별한 튜닝이나 사전 지식이 추가되지 않았으며, 기준선은 표준 제로샷 사슬思考 프롬프트였습니다.
테스트는 Qwen2.5와 Llama3 모델을 포함한 모든 모델 크기에서 실행되었습니다. Qwen 모델은 Qwen2.5-1.5B-Instruct, Qwen2.5-3B-Instruct, Qwen2.5-14B-Instruct, 및 Qwen2.5-72B-Instruct였습니다. Llama3 모델은 Llama3.2-1B-Instruct, Llama3.2-3B-Instruct, Llama3.1-8B-Instruct, 및 Llama3.3-70B-Instruct였습니다.
아래에서 볼 수 있듯이, Verification-First 프롬프팅의 개선은 모든 모델 크기에서 일관되게 유지되었습니다. 이는 1B 파라미터에서부터 72B 파라미터까지 모든 모델 크기에서 명확한 이득이 있음을 보여줍니다.

Qwen2.5와 Llama3 모델家族의 모든 모델 크기에서 Verification-First 프롬프팅은 표준 사슬思考 프롬프팅보다 GSM8K, MATH500, 및 GPQA-Diamond에서 일관되게 더 나은 성능을 보여주었습니다.
이 효과는 특히 수학 벤치마크인 GSM8K와 MATH500에서 가장 강했습니다. 여기서 잘못된 답변을 검증하는 것이 처음부터 해결하는 것보다 더 나은 推論을.trigger했습니다. GPQA-Diamond에서는 저장된 지식에 더 의존하는 경우이므로 이득은 더 작았지만 일관되게 유지되었습니다.
Verification-First의 계산 비용은 MODEST했습니다. 아래 표에서 볼 수 있듯이, 검증 단계를 생성하는 것은 표준 사슬思考 프롬프팅보다 약 20-50% 더 많은 출력 토큰이 필요로 합니다.

GSM8K, MATH500, 및 GPQA 벤치마크에서 각 프롬프팅 방법에 대한 평균 출력 토큰 수입니다.
이 비용은 여전히 다른 전략들, 즉 여러 샘플된 완성 또는 재귀적 계획이 필요한 전략들보다 훨씬 낮았습니다.
아래 그래프에서 볼 수 있듯이, 이 방법은 추측된 답변의 품질에 민감하지 않습니다. 놀랍게도, 추측이 사소하거나(예: ‘1’), 혹은 무작위로 선택된 다중 선택 항목일 때조차도 Verification-First 프롬프팅은 표준 프롬프팅보다 더 나은 성능을 보여줍니다.

GSM8K, MATH500, 및 GPQA에서 Verification-First 프롬프팅의 정확도 이득입니다.
추측이 올바른 답변일 때, 정확도는 더 높아집니다. 그러나 이 방법은 추측된 답변 자체의 정보에 의해 주도되지 않고, 단순히 검증의 행위에 의해 작동하는 것으로 보입니다.
Iter-VF는 또한 4개의 테스트 시간 스케일링 전략과 비교되었습니다. 즉, Self-Correction은 모델이 이전 推論 단계를 반영하여 답변을 수정하도록 요청하는 것이었습니다. 그리고 PHP는 이전 답변을 입력으로追加하여 컨텍스트 힌트로 사용했습니다. 그러나 힌트를 어떻게 사용할지에 대한 지침은 제공되지 않았습니다.
또한, Self-Consistency는 여러 推論 경로를 샘플링하여 다수결 투표로 최종 답변을 선택했습니다. 그리고 Best-of-N은 여러 출력을 독립적으로 생성하여 검증 프롬프트를 사용하여 순위를 매기고,最高スコ어링 응답을 선택했습니다.
Iter-VF의 두 가지 변형이 구현되었습니다. 즉, 사소한 추측(예: ‘1’)으로 초기화된 변형과 표준 CoT 출력으로 시드된 변형이었습니다.

MATH500에서 증가하는 출력 예산에 따른 정확도 및 토큰 효율성입니다.
Iter-VF는 모든 다른 방법보다 더 나은 결과를 보여주었습니다. 특히 사용 가능한 컴퓨팅 리소스가 제한적일 때, 이는 Iter-VF가 이전 답변을 재사용하여 답변을 개선하는 방식에 기인합니다.
PHP는 더 나쁜 성능을 보여주었습니다. 이는 모델이 이전 답변을 힌트로 사용하지 않았기 때문입니다.
반면, Self-Correction과 PHP는 컨텍스트를 누적하는 반면, Iter-VF는 각 단계에서 가장 최근의 답변만 고려합니다. 이는 확장된 推論 체인의 혼란을 피할 수 있습니다. 이는 Self-Correction의 약점입니다.
병렬 방법들, 즉 Self-Consistency와 Best-of-N은 이 문제를 피할 수 있었습니다. 그러나 이들의 개선은 더 느리며 더 소규모였습니다.
Iter-VF는 또한 GPT-5 Nano와 GPT-5 Mini와 같은 클로즈드 상업 모델에서 테스트되었습니다. 여기서 내부 推論 단계가 접근할 수 없었습니다. 이 경우에도 Iter-VF는 성능을 개선할 수 있었습니다.

MATH500와 GPQA에서 GPT-5 모델에 Iter-VF를 적용했을 때의 정확도입니다.
결론
새로운 논문은 언어 모델의 한 클래스에서 근본적인 특성을 발견한 것으로 보입니다. 이는 언어 모델을 사용하는 모든 사람에게 흥미로운 발전입니다. 언어 모델의 약점을 극복하기 위한 트릭을 개발하는 것은 모델을 사용하는 모든 사람에게 중요합니다. 이 방법은 언어 모델의 성능을 개선하는 일반화된 트릭입니다.
LLM의 컨텍스트 윈도우를 구현하고 업데이트하는 가장 큰 문제 중 하나는 세션 진행을 유지하면서도 필요에 따라 새로운 방향으로 나아갈 수 있는 균형을 찾는 것입니다. 새로운 논문에서 제시된 방법은 LLM을 리셋하고 재초점화하는 방법을 제공합니다. 이는 컨텍스트를 잃지 않고도 성능을 개선하는 방법입니다.
연구자들은 새로운 방법의 경제적 이점을 강조합니다. 이는 최근에 중요해진 고려 사항입니다. 이전에는 이러한 경제적 이점이 중요하지 않았을 수 있지만,現在는 이러한 이점이 매우 중요합니다.
* 저자는 논문의 일부에서 영어의 수준이 독자를 혼동할 수 있으므로, 일반적으로 논문에서 인용하는 문장을 포함하지 않습니다. 따라서 핵심적인 통찰력을 요약하여 제공합니다. 자세한 내용은 원 논문에서 확인할 수 있습니다.
最初에 게시된 날짜: 2025년 12월 4일 목요일












