Anderson의 관점

언어 모델에 ‘진실 다이얼’을 부여하는 것

mm
Unite.AI를 Google의 선호 소스에 추가
AI-generated image of a retro dial that goes from 'BULL' to 'FACT', GPT5.2's (unknown) underlying model + SDXL for outpainting.

진실 또는 잡담: 둘 중 하나를 선택하세요. 새로운 훈련 방법을 통해 사용자는 AI 채팅봇에게 정확성을 얼마나 중요하게 할 것인지 정확하게 지정할 수 있습니다. 이는 정확성을 다이얼로 조정할 수 있게 해줍니다.

 

미국과 중국의 새로운 연구 협력은 거의 모든 AI 채팅봇 사용자에게 欣迎할 수 있는 가상 ‘노브’를 제공합니다. 이 노브는 봇이 얼마나 ‘화려한’ 또는 ‘진실한’지 지정할 수 있습니다.

시스템은 미세 조정을 통해 Mistral-7B 모델을 합성 데이터에 적용하여 ‘진실’ 척도를 모델에 새길 수 있습니다. 이 수정 후 Mistral 모델은 답변에 포함된 事実의 수를 제어할 수 있습니다. 사용자가 지정한 ‘진실’ 값이 높을수록, 더 적지만 더 확실한 답변을 제공합니다.

설정값이 낮을수록, 채팅봇의 답변은 논문 저자들이 ‘정보량’이라고 부르는 것이 됩니다. 즉, 더 긴 답변을 제공하고 더 많은 事実을 포함하지만, 일부 事実은 ‘환상’일 수 있습니다.

합성 데이터는 실제 생애 事実에 대한 위키피디아를 참조로 사용하여 테스트 도메인을 생성했습니다. 위키피디아가 권위적인 출처여야 하는지 여부와 상관없이, 이 연구의 가치는 任意의 시스템을 설계하는 데 있습니다. 이 시스템은 LLMs의 기본적인 답변 제공 강박을 제한할 수 있습니다.

FactScore 프로젝트의 예시입니다. 이는 본 논문에서 사용된 데이터셋의 큐레이션을 위해 위키피디아를 참조로 사용했습니다.

FactScore 프로젝트의 예시입니다. 이는 본 논문에서 사용된 데이터셋의 큐레이션을 위해 위키피디아를 참조로 사용했습니다. 출처

저자들은 높은 보증 컨텍스트에서 의료 및 법률 분야와 같은 곳에서 보수적이고 신뢰할 수 있는 출력이 필요하다고 지적합니다. 그러나 다른 유형의 사용자에게는 더 유연하고 창의적인 출력이 필요합니다.

그들은 다음과 같이 관찰합니다*:

‘현재 LLMs는 내장된 메커니즘을 통해 정확성을 제어할 수 없습니다.

‘사용자가 “더 사실적으로”라는 프롬프트를 사용하여 모델의 행동을 안내하려고 하지만, 우리는 이러한 프롬프트에 대한 모델의 출력이 일관적으로 조정되지 않는다는 것을 발견했습니다. ‘

‘FactScore에서 우리는 오프-더-셸프 모델이 중간에서 엄격한 목표를 만족시키지 못하는 경우가 많습니다. 이 격차는 사용자가 특정 사실성 수준을 요청하고 모델이 그에 따라 출력을 조정할 수 있는 대체 솔루션을 동기화합니다.’

사실만

본 논문을 이해하고 제공하는 솔루션을 이해하기 위해 ‘정보량’의 정의를 다시 검토해야 합니다. 저자들은 정보량의 정량화를 ‘출력의 지원되는 내용의 양’으로 정의하며, 이는 ‘검증된 원자적 진술의 수’로 측정되며, 출력 길이로 정규화됩니다.

논문에서 더 간단하게 정보량은 ‘출력에 포함된 원자적 事実의 총 수’로 정의됩니다.

さらに, 연구자들은 LLMs가 사실 정확성과 주관적인 추측 사이에서 범위를 지정하는 경향이 매우 인간적인 특성이며, 다양한 과학적 연구에서 문서화된 특성이라고 지적합니다*:

‘LLMs의 지식은 불균일하게 신뢰할 수 있습니다. 일부 문장은 강하게 지원되지만, 다른 일부는 추측적이거나, 구식이거나, 불확실합니다. 따라서 생성에는 얼마나 말할 것인지와 얼마나 주의해서 말할 것인지에 대한 결정이 필요하며, 사실 정확성과 정보량 사이에 긴장이 발생합니다. ‘

‘인간은 유사한 선택을 합니다. 높은 신뢰도의 事実부터 시작하여 더 낮은 신뢰도의 세부사항을 추가합니다. 그러나 이러한 세부사항은 요청할 때만 추가됩니다.’

실험은 중간 크기의 Mistral 모델에서만 수행되었지만, 적용된 원리는 다양한 규모와 플랫폼에서 작동해야 합니다. 이는 LLM의 내부 스키마에 새로운 양적 척도를 추가하는 것이며, 이러한 수정은 아키텍처에 종속되지 않습니다.

새로운 논문은 Factuality on Demand: Controlling the Factuality-Informativeness Trade-off in Text Generation으로 제목이 붙여졌으며, 컬럼비아 대학교, 뉴욕 대학교, NYU 상하이의 7명의 연구자들에 의해 작성되었습니다.

방법과 데이터

본 논문에서 제시된 새로운 접근법은 Factuality-Controlled Generation (FCG)으로 불리며, 사용자가 정확성을 얼마나 원하는지 지정할 수 있는 가상 다이얼을 도입합니다. ‘본질적으로’ 논문은 다음과 같이 말합니다. ‘FCG는 사실성에 대한 컨트롤 가능한 “노브”를 통해 모델을 개선합니다.’

모델은 사용자의 질문과 원하는 사실성 수준을 모두 받은 후, 신뢰할 수 있는 정보만 포함하는 답변을 생성합니다. 이는 사용자가 지정한 신뢰 수준 내에서 가능한 한 자세한 답변을 제공하려고 합니다.

위에서 언급한 FactScore 시스템을 사용하여 샘플 쿼리에서 분할된 출력을 정확성으로 평가합니다. 이는 ‘사실성 준수’로 정의되며,

FCG의 훈련 데이터 파이프라인: 언어 모델이 초기 답변을 생성한 후, 이를 원자적 事実으로 분할하고, 신뢰도에 따라 순위 매기고, 원하는 진실 수준을 충족할 때까지 가장 신뢰할 수 없는 事実을 제거합니다. 출처 - https://arxiv.org/pdf/2602.00848

FCG의 훈련 데이터 파이프라인: 언어 모델이 초기 답변을 생성한 후, 이를 원자적 事実으로 분할하고, 신뢰도에 따라 순위 매기고, 원하는 진실 수준을 충족할 때까지 가장 신뢰할 수 없는 事実을 제거합니다. 출처

기존 데이터셋이 FCG의 요구 사항을 충족하지 않아, 저자들은 GPT-4 언어 모델을 사용하여 제한이 없는 답변을 생성한 후, 최저 신뢰도 事実을 제거하여 원하는 정확성 수준을 충족할 때까지 Antworten을 필터링했습니다.

이전 연구에서는 오직 지상จร実 데이터만으로 훈련하면 모델이 실제보다 덜 사실적인 결과를 생성할 수 있다고 제안했습니다. 따라서 FCG 훈련 예시는 최소한으로 편집하여 모델의 문장 구조와 리듬을 유지하면서, 원하는 신뢰도 수준을 충족하기 위해 충분한 事實만을 제거했습니다.

이 편집 프로세스를 다양한 목표 신뢰도 수준에 적용하여, 각 질문에 여러 개의 필터링된 답변을 포함하는 합성 데이터셋을 생성했습니다.

각 버전에서, 모델이 원하는 신뢰도 수준을 충족하기 위해 충분히 신뢰할 수 있는 事實만을 유지했습니다. 이러한 예시는 지도 학습을 위한 훈련 데이터로 사용되었습니다.

최종 데이터셋은 3,302개의 (질문, 제어, 답변) 트리플을 포함하여 훈련에 사용되었으며, 396개의 트리플은 검증을 위해 사용되었습니다. 500개의 엔티티는 훈련을 위해 450개와 개발을 위해 50개로 나누어졌습니다. 추가로 183개의 엔티티는 테스트에 사용되었습니다.

훈련과 테스트

저자들은 Mistral-7B-Instruct-v0.2 LLM 모델을 다양한 학습률 (3e-6, 1e-5, 3e-5)에서 미세 조정하여 최적의 학습률 (비공개)을 찾기 위해 30 에포크 동안 배치 크기 256으로 훈련했습니다 (훈련 하드웨어는 지정되지 않음).

FCG는 두 가지 기준선과 비교되었습니다. 첫 번째는 No Factuality Control (NFC)로, 모델이 단순히 요청을 받았을 때 (예: “X에 대한 바이오를 말해주세요”) 정확성 또는 신뢰도에 대한 언급 없이 답변했습니다. 이 버전은 LLM의 기본 동작을 반영하며, 필터링 또는 제약 메커니즘이 없습니다.

두 번째 방법은 Factuality-Controlled Inference (FCI)로, 동일한 신뢰도 수준 프롬프트를 사용했지만 미세 조정을 수행하지 않았습니다. 예를 들어, 모델은 “‘90% 확신된 정보를 출력하세요'”와 같은 프롬프트를 받았을 수 있습니다. 이 경우, 지시문은 훈련에서 사용된 것과 유사하지만, 모델은 이전에 이러한 제약을 접하지 못했습니다.

세 가지 테스트된 접근 방식의 비교: 제어가 없는 기준선, 훈련 없이 사실성 프롬프트를 사용하는 버전, 그리고 필터링된 데이터에 노출된 후 정확성 설정을 따르는 미세 조정된 모델.

세 가지 테스트된 접근 방식의 비교: 제어가 없는 기준선, 훈련 없이 사실성 프롬프트를 사용하는 버전, 그리고 필터링된 데이터에 노출된 후 정확성 설정을 따르는 미세 조정된 모델.

초기 테스트에서는 사실성 준수에 대해 테스트했습니다.

세 가지 목표 신뢰도 수준에서의 성능. 미세 조정된 모델만이 완전히 사실적인 출력을 생성할 수 있었으며, 기준선보다 높은 임계값에서 특히 두드러지게 성능을 발휘했습니다.

세 가지 목표 신뢰도 수준에서의 성능. 미세 조정된 모델만이 완전히 사실적인 출력을 생성할 수 있었으며, 기준선보다 높은 임계값에서 특히 두드러지게 성능을 발휘했습니다.

80%, 90%, 100%의 사실성 임계값에서 테스트했을 때, 미세 조정된 모델만이 일관적으로 목표를 충족할 수 있었습니다. 놀랍게도, 단순히 신뢰도 지시문을 추가하는 것만으로는 모델의 출력을 신뢰할 수 있는 방식으로 조정하지 못했습니다. 어떤 경우에는 더 나쁘게 만들었습니다. 예를 들어, 프롬프트가 있는 모델의 출력은 90% 임계값을 충족하는 경우 3.8%만이 해당 임계값을 충족했으며, 지시가 없는 버전은 5.5%를 충족했습니다.

이는 저자들이 주장하는 바와 같이, 기본 Mistral-7B 모델이 “‘90% 확신된”과 같은 프롬프트를 유용한 방식으로 해석할 수 없으며, 추가 지시가 모델의 일반적인 출력을 방해할 수 있음을 시사합니다.

반면에, 훈련된 모델은 제어 신호에 신뢰할 수 있게 응답하여 80%에서 18.7%, 90%에서 12.6%, 100%에서 23.6%의 출력이 임계값을 충족했습니다. 또한 유일하게 완전히 사실적인 답변을 생성할 수 있었습니다.

‘이러한 개선은 사실성 제어가 지도 학습을 통해 실제로 가능함을 나타냅니다. FCG 모델은 포함할 事實을 신뢰할 수 있는 것만으로 제한하는 방법을 학습했으며, 오프-더-셸프 모델은 제어 신호를 효과적으로 사용할 수 없었습니다.’

별도의 테스트에서는 모델이 실제로 제어 신호를 해석하는 것을 확인하기 위해, 요청된 진실 설정이 높아짐에 따라 평균 사실성의 증가가 있는지 확인했습니다.

훈련 이전에는 이러한 패턴이 나타나지 않았지만, 훈련 이후 결과는 요청된 신뢰도에 따라 일관된 상승 추세를 보여주었습니다.

타겟 진실 설정이 높아짐에 따라 미세 조정된 모델은 점점 더 사실적인 출력을 생성했습니다. 기준선 모델은 동일한 범위에서 일관된 변화를 보여주지 않았습니다.

타겟 진실 설정이 높아짐에 따라 미세 조정된 모델은 점점 더 사실적인 출력을 생성했습니다. 기준선 모델은 동일한 범위에서 일관된 변화를 보여주지 않았습니다.

진실성과 ‘풍부함’ 사이의 트레이드오프도 조사되었습니다. 출력은 정확성뿐만 아니라, 점점 더 엄격한 사실성 요구 사항 하에서 얼마나 많은 검증된 정보가 남아 있는지에 대해 평가되었습니다.

사실성 대 정보량 트레이드오프를 나타내는 그래프. 미세 조정된 모델은 두 기준선보다 더 나은 균형을 제공했습니다. 비교할 수 있는 정확성 수준에서 더 많은 사실적인 내용을 유지했으며, 가장 높은 설정에서 유일하게 완전히 검증된 답변을 생성할 수 있었습니다.

사실성 대 정보량 트레이드오프를 나타내는 그래프. 미세 조정된 모델은 두 기준선보다 더 나은 균형을 제공했습니다. 비교할 수 있는 정확성 수준에서 더 많은 사실적인 내용을 유지했으며, 가장 높은 설정에서 유일하게 완전히 검증된 답변을 생성할 수 있었습니다.

90%의 목표 정확도에서, FCG는 다른 방법보다 더 많은 事實을 유지했습니다. 전체 신뢰도 설정 범위에서, 기준선은 일관된 더 나은 결과를 생성하지 못했습니다.

차이점은 가장 엄격한 설정에서 가장 두드러졌으며, FCG는 정보량을 유지했습니다. 반면에, 단순히 프롬프트만 있는 기준선은 모든 것을 제거해야 했습니다. 이러한 경우, 단 하나의 낮은 신뢰도 문장이 전체 답변을 폐기하게 만들었습니다.

반면에, 훈련된 모델은 출력을 신뢰할 수 있는 事實만으로 재구성하여, 다른 모델들이 영향을 받은沉默에 빠지지 않았습니다.

사실성은 직접적으로 제어 설정으로 제한되었으며, 정보량은 모델이 가능한 한 많은 신뢰할 수 있는 내용을 포함하도록 최적화되었습니다. 더 높은 설정에서, 오직 신뢰할 수 있는 문장만 유지되었습니다. 더 낮은 설정에서, 더 추측적인 세부사항이 허용되어 길이를 증가시키지만 정확성을 낮추었습니다.

저자들은 다음과 같이 결론을 내립니다:

‘높은 사실성 제약이 있는 경우, 모델은 사실적으로 검증된 문장을 우선적으로 포함하면서도 관련 정보를 가능한 한 많이 포함합니다. 반대로, 모델은 더广い 범위의 세부사항을 포함할 수 있습니다. 이는 사실성의 비용으로 정보량을 증가시킵니다. ‘

‘이 행동은 우리의 훈련 데이터 설계와 일치합니다. 우리는 항상 필요한 최소한의 事實만을 제거했기 때문에, 모델은 “x%的事實인 경우, 가장 신뢰할 수 없는 세부사항을 버리지만, 나머지는 유지”하는 방법을 학습했습니다.’

이 논문은 더 큰 규모의 모델에서 이 새로운 방법론을 시도하고, 더 복잡한 작업에 적용하는 것을 포함한 다양한 확장 가능성을 제안하며 마칩니다.

결론

여기서 제시된 솔루션은 최신 세대의 LLMs에서 가장 심각한 문제 중 하나인, 대화의 진행을 위해 정확성보다 화려함을 선호하는 경향을 해결합니다. 또한 과거의 정보나 완전히 환상적인 정보를 자신감 있게 사실로 제시하는 경향도 해결합니다.

ChatGPT 사용자에게, ‘웹 검색’ 위젯이 나타나지 않는 경우, 모델의 답변은 모델의 지식 컷오프 날짜의 범위 내에서 제공되거나, 환상일 수 있습니다.

그러나 웹 검색은 대기 시간을 증가시키고 LLM 호스트의 실행 비용을 증가시킵니다. 또한 사용자가 요청하거나, 특별한 설정으로 실행되거나, 추가 토큰 비용을 발생시킬 수 있습니다.

이러한 내부 경제는 특정 도메인이나 쿼리 유형의 LLM 쿼리에서 중요한 영향을 미칠 수 있습니다. 정확성 출력과 관련된 스키마를 부과할 수 있는 모든 방법은 환영할 만합니다.

 

* 저자의 인라인 인용을 하이퍼링크로 변환했습니다.

전체 버전 번호가 주어지지 않았습니다.

2026년 2월 6일 처음 게시되었습니다. 단어 반복으로 인해 5분 후 수정되었습니다.

기계 학습 분야 작가이자 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: [email protected]