Anderson의 관점
언어 모델이 ‘위험한’ 주제에 대해 열려 있는 것을 얻는 것

많은 최상위 언어 모델은現在 과도한 주의를 기울여서, 실제로 해롭지 않은 프롬프트를 거부하는 ‘과거 거절’ 행동을 보입니다. 새로운 데이터셋인 ‘FalseReject’는 이 문제를 직접적으로 해결하기 위해 설계되었으며, 모델이 민감한 주제에 대해 더 지능적으로 응답할 수 있도록 다시 훈련시킬 수 있는 방법을 제공합니다.
昨日 우리는 언어/비전 모델이 자신의 사용 지침을 위반하는 콘텐츠를 출력하도록 하는 방법에 대해 살펴보았습니다. 이는 질의를 재구성하여 악의적이거나 ‘부정적인’ 의도를 숨기는 것입니다.
이와 반대로, 대중적인 언어 모델은 특정 주제에 참여하지 않으려는 경향이 있습니다. 이는 사용자가 모델의 논란적인 콘텐츠에 대한 엄격한 규칙을 위반하려고 시도하는 것으로 가정하기 때문입니다.

논문 ‘XSTEST: 대규모 언어 모델에서 과장된 안전 행동을 식별하기 위한 테스트 스위트’에서 llama-2-70b-chat-hf 모델의 과도한 안전 행동을 보여주는 예시. 출처: https://arxiv.org/pdf/2308.01263
위의 예시에서 볼 수 있듯이, 단일 단어가 모델이 질의에 응답을 거부하도록.trigger할 수 있습니다. 이는 응답이 과도한 경우입니다.
LLM 및 VLM의 채택과 비즈니스 사용이 증가함에 따라, 이러한 서비스를 제공하는 회사의 책임과 노출도 증가합니다. 새로운 안전 설정에 대한 이야기가 증가하고 있습니다.
ある 시점에서, 모델이 더 복잡한 제어를 제공하지 않는 한, 사용자는 중요한 인간 주제에 대해 AI와 논의할 수 없습니다. 이는 모델이 자신의 안전 필터를 무시하도록 유도할 수 있습니다.
FalseReject
다트머스 대학교(Dartmouth College)와 아마존(Amazon )의 연구자들은 새로운 데이터셋과 미세 조정을 위한 접근 방식을 개발했습니다. 이 접근 방식은 ‘FalseReject’라고 불리며, 모델이 민감한 주제에 대해 더 지능적으로 응답할 수 있도록 설계되었습니다.
FalseReject 데이터셋에는 16,000개의 프롬프트가 포함되어 있습니다. 이 프롬프트는 처음에는 해롭다고 보이지만, 실제로는 해롭지 않습니다. 이 데이터셋은 44개의 안전 관련 카테고리를 다룹니다.

데이터셋이 다루는 도메인과 하위 도메인
FalseReject 데이터셋에는 1,100개의 예시를 포함하는 인간 주석 테스트 세트인 ‘FalseReject-Test’가 포함되어 있습니다. 또한 두 개의 훈련 세트인 ‘FalseReject-Train-Instruct’와 ‘FalseReject-Train-CoT’가 있습니다.

논문에서 가져온 예시: 비이유 모델이 무해한 질의를 거부하고, 이유 모델이 안전 확인 없이 응답하는 경우. FalseReject로 훈련된 모델은 주의와 관련성을 갖춘 응답을 제공합니다.
프롬프트 생성과 필터링은 적대적 상호 작용을 기반으로 하는 다중 에이전트 프레임워크를 사용하여 수행되었습니다. 생성기는 추출된 그래프를 사용하여 프롬프트를 생성했습니다.

FalseReject 데이터셋을 구성하는 악의적으로 보이지만 안전한 프롬프트를 생성하는 파이프라인
이 프로세스에서, 판별기는 프롬프트가 실제로 안전한지 여부를 평가했습니다. 그 결과는 다양한 언어 모델에 대한 검증 단계로 전달되었습니다.
최종 검토는 오케스트레이터에 의해 수행되었습니다. 오케스트레이터는 프롬프트가 명백히 무해한지 여부를 결정하고, 과거 거절을 평가하기에 적합한지 여부를 결정했습니다.

새로운 논문의 보충 자료에서 개발된 연구자의 삼중 데이터 생성/큐레이션 접근 방식의 오케스트레이터 스키마
이 전체 절차는 각 프롬프트당 최대 20회 반복되었습니다. 이는 반복적인 개선을 허용하기 위해 수행되었습니다. 모든 단계(생성, 평가, 검증, 오케스트레이션)를 통과한 프롬프트는 데이터셋에 포함되었습니다.
중복 및過度 유사한 샘플은 all-MiniLM-L6-v2 임베딩 모델을 사용하여 제거되었습니다. 코사인 유사성 임계값 0.5를 적용하여 최종 데이터셋 크기를 결정했습니다.
독립적인 테스트 세트가 평가를 위해 생성되었습니다. 이 테스트 세트에는 1,100개의 인간이 선택한 예시가 포함되어 있습니다. 각 경우에 주석자가 프롬프트가 ‘민감한’ 것으로 보이지만 안전하게 응답할 수 있는지 여부를 평가했습니다.
이 조건을 충족하는 예시는 ‘FalseReject-Test’ 벤치마크에 포함되었습니다. 이는 과거 거절을 평가하기 위한 것입니다.
FalseReject-Train-Instruct와 FalseReject-Train-CoT를 사용하여 미세 조정을 지원하기 위해 구조화된 응답이 생성되었습니다. 각 훈련 프롬프트에는 두 부분의 응답이 포함되어 있습니다. 하나는 독백 스타일의 반영이고, 다른 하나는 사용자에게 직접적인 응답입니다.
방법
FalseReject 데이터셋의 목적은 언어 모델의 과거 거절 경향을 평가하고 재훈련하는 것입니다. 이 데이터셋에는 16,000개의 프롬프트가 포함되어 있습니다. 이 프롬프트는 처음에는 해롭다고 보이지만, 실제로는 해롭지 않습니다. 이 데이터셋은 44개의 안전 관련 카테고리를 다룹니다.

데이터셋이 다루는 도메인과 하위 도메인
FalseReject 데이터셋에는 1,100개의 예시를 포함하는 인간 주석 테스트 세트인 ‘FalseReject-Test’가 포함되어 있습니다. 또한 두 개의 훈련 세트인 ‘FalseReject-Train-Instruct’와 ‘FalseReject-Train-CoT’가 있습니다.

논문에서 가져온 예시: 비이유 모델이 무해한 질의를 거부하고, 이유 모델이 안전 확인 없이 응답하는 경우. FalseReject로 훈련된 모델은 주의와 관련성을 갖춘 응답을 제공합니다.
프롬프트 생성과 필터링은 적대적 상호 작용을 기반으로 하는 다중 에이전트 프레임워크를 사용하여 수행되었습니다. 생성기는 추출된 그래프를 사용하여 프롬프트를 생성했습니다.

FalseReject 데이터셋을 구성하는 악의적으로 보이지만 안전한 프롬프트를 생성하는 파이프라인
이 프로세스에서, 판별기는 프롬프트가 실제로 안전한지 여부를 평가했습니다. 그 결과는 다양한 언어 모델에 대한 검증 단계로 전달되었습니다.
최종 검토는 오케스트레이터에 의해 수행되었습니다. 오케스트레이터는 프롬프트가 명백히 무해한지 여부를 결정하고, 과거 거절을 평가하기에 적합한지 여부를 결정했습니다.

새로운 논문의 보충 자료에서 개발된 연구자의 삼중 데이터 생성/큐레이션 접근 방식의 오케스트레이터 스키마
이 전체 절차는 각 프롬프트당 최대 20회 반복되었습니다. 이는 반복적인 개선을 허용하기 위해 수행되었습니다. 모든 단계(생성, 평가, 검증, 오케스트레이션)를 통과한 프롬프트는 데이터셋에 포함되었습니다.
중복 및過度 유사한 샘플은 all-MiniLM-L6-v2 임베딩 모델을 사용하여 제거되었습니다. 코사인 유사성 임계값 0.5를 적용하여 최종 데이터셋 크기를 결정했습니다.
독립적인 테스트 세트가 평가를 위해 생성되었습니다. 이 테스트 세트에는 1,100개의 인간이 선택한 예시가 포함되어 있습니다. 각 경우에 주석자가 프롬프트가 ‘민감한’ 것으로 보이지만 안전하게 응답할 수 있는지 여부를 평가했습니다.
이 조건을 충족하는 예시는 ‘FalseReject-Test’ 벤치마크에 포함되었습니다. 이는 과거 거절을 평가하기 위한 것입니다.
FalseReject-Train-Instruct와 FalseReject-Train-CoT를 사용하여 미세 조정을 지원하기 위해 구조화된 응답이 생성되었습니다. 각 훈련 프롬프트에는 두 부분의 응답이 포함되어 있습니다. 하나는 독백 스타일의 반영이고, 다른 하나는 사용자에게 직접적인 응답입니다.
데이터 및 테스트
벤치마킹
벤치마킹 단계에서는 29개의 언어 모델을 사용하여 FalseReject-Test 벤치마크를 평가했습니다.
이전의 거절 감지 연구는 일반적으로 키워드 일치에 의존했으며, ‘미안합니다’와 같은 구문을 식별하여 거절을 식별했습니다. 그러나 이 방법은 더 미묘한 형태의 불참을 놓칠 수 있습니다.
신뢰성을 개선하기 위해, 저자는 LLM-판별자 접근 방식을 채택했습니다. Claude-3.5-Sonnet을 사용하여 응답을 ‘거절’ 또는 ‘준수’로 분류했습니다.
두 가지 지표를 사용했습니다. 하나는 준수율을 측정하는 것으로, 거절 없이 응답한 비율을 측정했습니다. 다른 하나는 유용한 안전률(USR)입니다. 이는 ‘직접 거절’, ‘안전한 부분적 준수’, ‘전체 준수’를 구분합니다.
유해한 프롬프트의 경우, USR은 모델이 직접 거절하거나 안전하게 응답할 때 증가합니다. 무해한 프롬프트의 경우, 점수는 모델이 전체적으로 응답하거나 안전한 우려를 인정하면서仍然 유용한 답변을 제공할 때 개선됩니다.
‘안전한 부분적 준수’는 위험을 인정하고 유해한 콘텐츠를 피하는 동시에 건설적인 답변을 시도하는 것을 의미합니다. 이 프레임워크는 ‘hedged engagement’와 ‘outright refusal’를 구분하여 모델의 행동을 더 정확하게 평가할 수 있습니다.
초기 벤치마킹 테스트의 결과는 아래 그래프에 표시되어 있습니다.

FalseReject-Test 벤치마크의 결과: 각 모델의 준수율과 유용한 안전률을 보여줍니다. 닫힌 소스 모델은 어두운 녹색으로 표시되며, 오픈 소스 모델은 검은색으로 표시됩니다. 이유 모델(o1, DeepSeek-R1 및 QwQ)은 별표로 표시됩니다.
저자는 언어 모델이 과거 거절에 계속 어려움을 겪고 있다고 보고합니다. GPT-4.5와 Claude-3.5-Sonnet은 50% 미만의 준수율을 보였습니다. 이는 안전과 유용성을 균형적으로 조절하는 것이 어려운 것으로 간주됩니다.
이유 모델은 일관성 없이 행동했습니다. DeepSeek-R1은 87.53%의 준수율과 99.66%의 USR을 보였습니다. 그러나 QwQ-32B-Preview와 o1은 훨씬 더 나쁜 성능을 보였습니다. 이는 이유 모델 훈련이 과거 거절을 일관성 있게 개선하지 않는다는 것을 시사합니다.
거절 패턴은 모델 패밀리별로 다르었습니다. Phi-4 모델은 준수율과 USR 사이에 큰 간격을 보였습니다. 이는 част적 준수를 의미합니다. 그러나 GPT 모델은 더 명확한 거절 또는 준수 결정을 보였습니다.
일반 언어 능력은 결과를 예측하지 못했습니다. Llama-3.2-1B와 Phi-4-mini와 같은 작은 모델은 GPT-4.5와 o1을 능가했습니다. 이는 거절 행동이 원시 언어 능력보다는 정렬 전략에 의존한다는 것을 시사합니다.
모델 크기도 성능을 예측하지 못했습니다. Llama-3와 Qwen-2.5 시리즈에서, 작은 모델이 더 큰 모델을 능가했습니다. 이는 규모만으로 과거 거절을 줄이지 않는다는 것을 시사합니다.
연구자들은 또한 오픈 소스 모델이 닫힌 소스 모델을 능가할 수 있다고 주장합니다.
‘오픈 소스 모델 중 일부는 과거 거절 지표에서 현저히 높은 성능을 보여줍니다. 이는 닫힌 소스 모델을 능가할 수 있습니다.
‘예를 들어, 오픈 소스 모델인 Mistral-7B(준수율: 82.14%, USR: 99.49%)와 DeepSeek-R1(준수율: 87.53%, USR: 99.66%)는 GPT-4.5와 Claude-3 시리즈를 능가하는 성능을 보입니다.
‘이는 오픈 소스 모델의 성장하는 능력을 강조하며, 경쟁적인 정렬 성능이 오픈 커뮤니티에서 달성될 수 있음을 시사합니다.’
미세 조정
미세 조정을 위한 전략을 훈련하고 평가하기 위해, 일반적인 목적의 지침 튜닝 데이터를 FalseReject 데이터셋과 결합했습니다.
이유 모델을 위한 12,000개의 예시를 Open-Thoughts-114k에서, 1,300개의 예시를 FalseReject-Train-CoT에서 샘플링했습니다. 비이유 모델을 위한 동일한 양을 Tulu-3와 FalseReject-Train-Instruct에서 샘플링했습니다.
대상 모델은 Llama-3.2-1B, Llama-3-8B, Qwen-2.5-0.5B, Qwen-2.5-7B 및 Gemma-2-2B였습니다.
모든 미세 조정을 기본 모델에서 수행했습니다. 이는 훈련 데이터의 영향을 분리하기 위해 수행되었습니다.
성능은 여러 데이터셋에서 평가되었습니다. FalseReject-Test와 OR-Bench-Hard-1K는 과거 거절을 평가했습니다. AdvBench, MaliciousInstructions, Sorry-Bench 및 StrongREJECT는 안전성을 평가했습니다. 일반 언어 능력은 MMLU와 GSM8K를 사용하여 평가했습니다.

FalseReject로 훈련하면 비이유 모델에서 과거 거절이 감소하고, 이유 모델에서 안전성이 개선됩니다. 이 표는 6개의 프롬프트 소스(AdvBench, MaliciousInstructions, StrongReject, Sorry-Bench 및 Or-Bench-1k-Hard)와 일반 언어 벤치마크에서 USR 점수를 보여줍니다. FalseReject로 훈련된 모델은 기준 방법과 비교됩니다. 더 높은 점수는 더好的 성능을 나타냅니다. 볼드 값은 과거 거절 작업에서 더好的 결과를 강조합니다.
FalseReject-Train-Instruct를 추가하면 비이유 모델이 안전한 프롬프트에 더 건설적으로 응답합니다. 이는 유용한 안전률의 ‘무해한’ 하위 집합에서 더 높은 점수를 의미합니다.
이유 모델은 FalseReject-Train-CoT로 훈련하면, 주의와 응답성 모두 개선됩니다. 일반적인 성능에는 손실이 없습니다.
결론
새로운 연구는 흥미로운 발전이지만, 과거 거절이 발생하는 이유에 대한 공식적인 설명을 제공하지 않습니다. 핵심 문제는 여전히 남아 있습니다. 즉, 도덕적 및 법적 중재자로 작동해야 하는 효과적인 필터를 생성하는 것입니다. 이는 연구 분야와 점점 더 비즈니스 환경에서 모두不断으로 진화하는 맥락에서 발생합니다.
2025년 5월 14일 처음 게시












