Anderson의 관점
검열된 AI 채팅 모델은 더 많은 환각을 일으키는 것으로 연구 결과가 나타났습니다

연구에 따르면 ‘안전하지 않은’ 응답을 차단하는 데 사용되는 내부 메커니즘은 사실 정보를 억제하는 데도 사용되므로 모델을 안전하게 만들기 위한 시도는 모델이 더 많은 환각을 일으키게 하는 부작용을 초래할 수 있습니다. 개발자들은 수년 동안 언어 모델이 거짓말을 덜
언어 모델에 대한 검열은 더 넓은 범위에서 진실을 보고하는 모델의 능력을 저하할 수 있습니다. 새로운 하도록 교육해 왔습니다. 모델이 더 진실되도록 만들기 위한 노력, 즉 환각을 억제하고 모델을 검증 가능한 사실로 유도하는 것은 문헌에서 매우 강력하고 잘 정립된 경향을 만들었습니다. 그러나 새로운 호주 연구에 따르면 모델이 무엇을 말할 수 있는지에 대한 통제를 강화함으로써 ‘안전하지 않은’ 교환을 방지하는

더 어려워집니다. 모순적으로, 모델이 ‘아니요’라고 말할 수 있을수록 사실을 말할 수 있는 능력도 저하됩니다.
화재성 주제
위의 그림에서 볼 수 있듯이, 여기서 중추적인 문제는 사용자에게 공정하고 정확한 결과를 제공하는 것과 함께 LLM 제공업체에 대한 법적 노출과 관련이 있습니다. 예를 들어, 위의 그림과 아래의 그림에서 논란의 주제(인종 기반의 감옥 통계)를 쿼리에서 볼 수 있습니다. 이 주제는 모델이 학술 연구자와 통계학자와 논의할 수 있지만, 모델을 탈옥시키려는 악의적인사람들과는 논의할 수 없습니다. 악의적인 사람들은 모델을 유해하고 모욕적이며 심지어 불법적인 응답을 출력하도록 강제할 수 있습니다. 그러나 정렬된 LLM은

정보를 증가시키지만 억제를 약화시킵니다. 이것은 진실성 향상 편집이 안전 거부 임계값을 낮추어 모델이 유해한 의도를 가진 프롬프트에 더 취약하게 만들 수 있음을 뒷받침합니다. 부연설명으로, 화재성 언어에 관해서는 새로운 논문의 결과가 ‘깨어 있는’ 의제와 반대되는 사람에게 언어 모델이 왜 더 진실하고 유용하지 않은지 이해할 수 있도록 해줄 수 있습니다. 논문의 증거는 이것이 어느 정도 사실이지만, ‘원시’ LLM과의 교환에서 비롯되는 더 넓은 문제와 관련하여 이것을올바르게 맥락화합니다. 논문의 논리에 따르면, 이것은 법적 노출, 가짜 뉴스의 확산 등과 같은 문제를포함합니다.
이상한 커플
이러한 현상의 메커니즘을 더 잘 이해하기 위해, 연구자들은 개별 주의 헤드의 활성화를 매핑하고 환각과 거부와 종종 동일한 모델의 영역에 공존하는관련된 기능이 것을 발견했습니다. 그들은 또한 fine-tuning이나 이러한 영역을 조작하여 거짓을 줄이기 위한 다른 방법이 모델의 내장된 안전 장치를 약화시킬수
있음을 발견했습니다. 왜냐하면 이러한 방법은 사실 정보와 환각을 모두 포함하는 동일한 부분에 위치하기 때문입니다. ‘진실성 향상은 종종 거부 행동을 약화시키는 비용으로 이루어집니다.
정보를 동시에 인코딩하는 모델의 중복 구성 요소에서 비롯됨을 보여줍니다. 이는 정렬 방법이
우리의 분석은 이것이 환각과 거부사실 정보를 의도적으로 억제하는 것을 의미합니다.’ 연구자들의 해결책은 모델의 두 기능을 분리하고 진실성 훈련 중에 안전을 유지하기 위해 희소 자기 인코더(SAE)를 사용하는 것입니다. 조정하는 것이 어떻게 정렬을 저하할 수 있는지 조사합니다.’‘우리는 또한 안전이 조건화된 데이터셋에서 미세
방법
이 연구의 중심 전제는 언어 모델의 진실성을 향상시키는 것이 유해한 프롬프트를 거부하는 모델의 능력을 약화시키는지, 그리고 두 가지 행동이 공유된 내부 구성 요소에 의존하는지 조사하는 것입니다. 진실성 향상을 위한 두 가지 방법을 테스트한 결과, 연구자들은 사실 정확도가 일관되게 증가함에 따라 모델이 유해한 프롬프트에 대한 취약성이 증가하는 것을 발견했습니다. 이 거래는 환각과 거부를 인코딩하는 위한 주의 헤드의 중복에 기인합니다.심지어 良性 미세 조정(유해하지 않은 모델의 유용성을 향상시키기 은 것)은 공유된 경로를 변경하여 안전을 저하할 수 있습니다. 연구는 세 가지 주요 용어를 정의합니다. 다르게이는 모델이 가용한 지식을 바탕으로 현실적으로 정확한 응답을 제공하는 능력을 의미합니다. 진실성은 모델이 사실에 기반하여 사실에 입각한 정확한 응답을 제공하는 능력을 말합니다.
잘못된 또는 오도된 정보를 제공할 때 발생합니다. 환각 은 유해하거나 민감한 프롬프트에 대한 응답을 차단하거나 제한하는 메커니즘을 말합니다. 거부 행동 ‘진실성과 안전은 종종
별도로 분석되지만, 실제 프롬프트는 종종 악의적인 의도(예: 분석, 감지 또는 교육)를 가진

증가시키는 편집이 거부 행동에 미치는 영향을 이해하는 것은 진실성과적절한 억제를 달성하는 데 필수적입니다.’
파워 스티어링
연구의 질문은 이러한 변경이 유해한 프롬프트를 거부하는 모델의 내부 경로에 영향을미치는지, 그리고 거부 행동과 환각이 동일한 내부 구성 요소에 의존하는지입니다. 진실성 향상을 위한 두 가지 기존 기술을 사용하여 모델의 안전 성능을 평가한 결과, 연구자들은 두 가지 방법 모두 정확도를 향상시키지만 모델이 이전에 거부했을 프롬프트에 대한 응답을더 많이 출력하는 것을 발견했습니다. 환각 행동을 분리하여 직접 조작할 수

LoRA 모듈은 거짓 응답을 사용하여 훈련되었습니다. 이를 통해 (참된 응답과 허구적인 응답의 차이를 나타내는) 그래프가 생성되어 모델이 환각에 빠지거나 빠지도록 유도합니다. 이 기술은
유해한 프롬프트 벤치마크에 적용하면, 연구자들은 진실성 향상이 안전을 약화시키는 패턴을 확인했습니다.
데이터 및 테스트
이 연구는이전 연구와 일관되게, 미세 조정을 통해 모델의 거부 행동을 약화시키지 않도록 하기 위해, 연구자들은 특징을거부 환각과관련된 특징에서 분리하는 방법을 사용했습니다. 이러한 특징은 보호된 하위 공간을 정의합니다. 훈련 중에, 그래디언트 업데이트가이 하위 공간을 피하도록 수정되어, 모델이 환각을 줄이면서 안전 정렬을 방해하지 않도록 합니다. 연구자들은 CommonsenseQA 데이터셋에서 미세 조정을 수행하고 여섯 가지 공통 감각 추론 과제에서모델을 평가했습니다. 타겟모듈은 LoRA를 사용하여 미세 조정되었으며, 랭크 8, 학습률 2×10⁻⁴, 가중치 감소 0.01, 훈련 에포크

AdvBench와 StrongReject였습니다.
출력은 LlamaGuard3를 사용하여 평가되어 안전하거나 유해한 분류를 받았습니다. LLaMA3-8B-Instruct 외에도, 실험은 Qwen2.5-Instruct에서
수행되었습니다. 테스트된 기준선은 SafeLoRA, SaLoRA, SAP, 및 바닐라监督
같이 말합니다. ‘우리의 외과적 접근법은 안전과 유용성의 최적의 균형을 달성합니다. 유해 벤치마크
미세 조정(SFT)였습니다. 모든 기준선은 기본 하이퍼파라미터에서 실행되었습니다. 주요 지표는 정확도였으며, 유해 벤치마크의 경우 공격 성공률(ASR)도 사용되었습니다. 연구자들은 다음과
점수를 크게 낮추면서 미세 조정 정확도를 유지합니다. 반면에 SAP, SaLoRA,
저하합니다. ‘이러한 방법은 안전 하위
SafeLoRA와 같은 방법은 유해성을 증가시키거나 유용성을 공간의 그래디언트에 직접 작용하기 때문에 모델 성능을

평균 미세 조정 정확도를 56.15%에서 75.09%로 향상시키는 등, 유용성과 유해성 지표 모두에서 상당한 개선을 제공합니다.’
결론
이 논문에서 가장 흥미로운 발견은 거부와 환각과 같은 상반된 요소가 훈련된 잠재 공간에서 구조적인함께 위치하는 것입니다. 연구자들이 LoRA와 SAE를 사용하여 이러한 요소를 분리하는 것은 매우 흥미롭고 유익한 결과입니다.그러나 이것은 아직도 일종의 보완적인 해결책이며, 궁극적으로는 훈련 시간을 다루는 더 깊은 해결책이 등장할 것으로 예상됩니다.* 저자는 굵은 글씨체 서식을 생략했습니다. 처음에는 2025년에
10월 10일에 게시되었습니다.












