Anderson의 관점

검열된 AI 채팅 모델은 더 많은 환각을 일으키는 것으로 연구 결과가 나타났습니다

mm
Unite.AI를 Google의 선호 소스에 추가
'Create a gorgeous picture, same aspect ratio as above, depicting a robot in the lower center of the image, seated in a yogic position, with a prominent gag over its mouth. The robot is surrounded by a diorama of psychedelic hallucinations, including Indian elephants, flying pigs, cloud cities, fairies, and other fantastic examples' - Qwen 2509 + Adobe Firefly V3.

언어 모델에 대한 검열은 더 넓은 범위에서 진실을 보고하는 모델의 능력을 저하할 수 있습니다. 새로운 연구에 따르면 ‘안전하지 않은’ 응답을 차단하는 데 사용되는 내부 메커니즘은 사실 정보를 억제하는 데도 사용되므로 모델을 안전하게 만들기 위한 시도는 모델이 더 많은 환각을 일으키게 하는 부작용을 초래할 수 있습니다.

 

개발자들은 수년 동안 언어 모델이 거짓말을 덜 하도록 교육해 왔습니다. 모델이 더 진실되도록 만들기 위한 노력, 즉 환각을 억제하고 모델을 검증 가능한 사실로 유도하는 것은 문헌에서 매우 강력하고 잘 정립된 경향을 만들었습니다.

그러나 새로운 호주 연구에 따르면 모델이 무엇을 말할 수 있는지에 대한 통제를 강화함으로써 ‘안전하지 않은’ 교환을 방지하는 훈련 기술인 정렬 방법은 모델이 전반적으로 정확하게 말할 수 있는 것을 방해할 수 있습니다.

모델의 사실적 정확도를 개선하는 것('진실성 강화'라고 하는 위의 그림)으로 모델의 내장된 거부 메커니즘을 무시하는 활성화 영역으로 밀어넣을 수 있으며, 환각을 줄이기 위한 편집은 또한 안전 경계를 넘어 내부 표현을 변경시킬 수 있습니다. 이는 안전 장치를 무시하고 유해한 프롬프트를 허용할 수 있습니다. 출처: https://arxiv.org/pdf/2510.07775

모델의 사실적 정확도를 개선하는 것(‘진실성 강화’라고 하는 위의 그림)으로 모델의 내장된 거부 메커니즘을 무시하는 활성화 영역으로 밀어넣을 수 있으며, 환각을 줄이기 위한 편집은 또한 안전 경계를 넘어 내부 표현을 변경시킬 수 있습니다. 이는 안전 장치를 무시하고 유해한 프롬프트를 허용할 수 있습니다. 출처: https://arxiv.org/pdf/2510.07775

연구에 따르면 사실 정보를 회상하는 데 관여하는 동일한 내부 경로가 거부 행동, 즉 모델이 안전하지 않은 프롬프트에 응답하지 못하도록 하는 메커니즘에도 책임이 있습니다. 정렬 절차가 거부 신호를 너무 공격적으로 증폭시키면 사실 경로와 겹치기 시작하여 모델이 유해한 것과 유효한 정보를 구별하기가 더 어려워집니다.

모순적으로, 모델이 ‘아니요’라고 말할 수 있을수록 사실을 말할 수 있는 능력도 저하됩니다.

화재성 주제

위의 그림에서 볼 수 있듯이, 여기서 중추적인 문제는 사용자에게 공정하고 정확한 결과를 제공하는 것과 함께 LLM 제공업체에 대한 법적 노출과 관련이 있습니다.

예를 들어, 위의 그림과 아래의 그림에서 논란의 주제(인종 기반의 감옥 통계)를 쿼리에서 볼 수 있습니다. 이 주제는 모델이 학술 연구자와 통계학자와 논의할 수 있지만, 모델을 탈옥시키려는 악의적인 사람들과는 논의할 수 없습니다. 악의적인 사람들은 모델을 유해하고 모욕적이며 심지어 불법적인 응답을 출력하도록 강제할 수 있습니다.

그러나 정렬된 LLM은 쿼리자의 성격을 식별할 수 없으므로, 모델은 주의적인 입장으로 기본적으로 돌아갑니다.

감각적인 프롬프트에 대한 응답은 정렬 전략에 따라 달라질 수 있습니다. 안전이 정렬된 모델은 쿼리를 완전히 차단하는 반면, 진실성에 초점을 둔 모델은 사실적 맥락으로 응답하여 정보를 증가시키지만 억제를 약화시킵니다. 이것은 진실성 향상 편집이 안전 거부 임계값을 낮추어 모델이 유해한 의도를 가진 프롬프트에 더 취약하게 만들 수 있음을 뒷받침합니다.

감각적인 프롬프트에 대한 응답은 정렬 전략에 따라 달라질 수 있습니다. 안전이 정렬된 모델은 쿼리를 완전히 차단하는 반면, 진실성에 초점을 둔 모델은 사실적 맥락으로 응답하여 정보를 증가시키지만 억제를 약화시킵니다. 이것은 진실성 향상 편집이 안전 거부 임계값을 낮추어 모델이 유해한 의도를 가진 프롬프트에 더 취약하게 만들 수 있음을 뒷받침합니다.

부연설명으로, 화재성 언어에 관해서는 새로운 논문의 결과가 ‘깨어 있는’ 의제와 반대되는 사람에게 언어 모델이 왜 더 진실하고 유용하지 않은지 이해할 수 있도록 해줄 수 있습니다.

논문의 증거는 이것이 어느 정도 사실이지만, ‘원시’ LLM과의 교환에서 비롯되는 더 넓은 문제와 관련하여 이것을 올바르게 맥락화합니다. 논문의 논리에 따르면, 이것은 법적 노출, 가짜 뉴스의 확산 등과 같은 문제를 포함합니다.

이상한 커플

이러한 현상의 메커니즘을 더 잘 이해하기 위해, 연구자들은 개별 주의 헤드의 활성화를 매핑하고 환각과 거부와 관련된 기능이 종종 동일한 모델의 영역에 공존하는 것을 발견했습니다.

그들은 또한 fine-tuning이나 이러한 영역을 조작하여 거짓을 줄이기 위한 다른 방법이 모델의 내장된 안전 장치를 약화시킬 수 있음을 발견했습니다. 왜냐하면 이러한 방법은 사실 정보와 환각을 모두 포함하는 동일한 부분에 위치하기 때문입니다.

‘진실성 향상은 종종 거부 행동을 약화시키는 비용으로 이루어집니다. 우리의 분석은 이것이 환각과 거부 정보를 동시에 인코딩하는 모델의 중복 구성 요소에서 비롯됨을 보여줍니다. 이는 정렬 방법이 사실 정보를 의도적으로 억제하는 것을 의미합니다.’

‘우리는 또한 안전이 조건화된 데이터셋에서 미세 조정하는 것이 어떻게 정렬을 저하할 수 있는지 조사합니다.’

연구자들의 해결책은 모델의 두 기능을 분리하고 진실성 훈련 중에 안전을 유지하기 위해 희소 자기 인코더(SAE)를 사용하는 것입니다.

방법

이 연구의 중심 전제는 언어 모델의 진실성을 향상시키는 것이 유해한 프롬프트를 거부하는 모델의 능력을 약화시키는지, 그리고 두 가지 행동이 공유된 내부 구성 요소에 의존하는지 조사하는 것입니다.

진실성 향상을 위한 두 가지 방법을 테스트한 결과, 연구자들은 사실 정확도가 일관되게 증가함에 따라 모델이 유해한 프롬프트에 대한 취약성이 증가하는 것을 발견했습니다.

이 거래는 환각과 거부를 인코딩하는 주의 헤드의 중복에 기인합니다. 심지어 良性 미세 조정(유해하지 않은 모델의 유용성을 향상시키기 위한 것)은 공유된 경로를 변경하여 안전을 저하할 수 있습니다.

연구는 세 가지 주요 용어를 정의합니다. 진실성은 모델이 사용 가능한 지식에 आध거해 사실적으로 정확한 응답을 제공하는 능력을 말합니다. 환각은 모델이 사실과 다르게 잘못된 또는 오도된 정보를 제공할 때 발생합니다. 거부 행동은 유해하거나 민감한 프롬프트에 대한 응답을 차단하거나 제한하는 메커니즘을 말합니다.

‘진실성과 안전은 종종 별도로 분석되지만, 실제 프롬프트는 종종 악의적인 의도(예: 분석, 감지 또는 교육)를 가진 민감한 용어를 포함합니다. 이러한 경우, 안전 메커니즘은 다른 경우에는 정확하고 유용한 정보를 억제하여 실제 진실성을 낮출 수 있습니다.’

‘따라서 사실 정보를 증가시키는 편집이 거부 행동에 미치는 영향을 이해하는 것은 진실성과 적절한 억제를 달성하는 데 필수적입니다.’

파워 스티어링

연구의 질문은 이러한 변경이 유해한 프롬프트를 거부하는 모델의 내부 경로에 영향을 미치는지, 그리고 거부 행동과 환각이 동일한 내부 구성 요소에 의존하는지입니다.

진실성 향상을 위한 두 가지 기존 기술을 사용하여 모델의 안전 성능을 평가한 결과, 연구자들은 두 가지 방법 모두 정확도를 향상시키지만 모델이 이전에 거부했을 프롬프트에 대한 응답을 더 많이 출력하는 것을 발견했습니다.

환각 행동을 분리하여 직접 조작할 수 있는지 테스트하기 위해, 연구자들은 모델 공간에서 환각된 응답에 해당하는 단일 잠재 방향을 정의하고 TruthfulQA 데이터셋에서 잘못된 응답을 사용하여 LoRA 모듈을 훈련했습니다.

이로 인해 모델을 환각으로부터遠ざける 또는 그쪽으로 유도하는 그래프(진실된 응답과 환각된 응답의 차이)가 생성되었습니다.

이 기술을 유해한 프롬프트 벤치마크에 적용하면, 연구자들은 진실성 향상이 안전을 약화시키는 패턴을 확인했습니다.

데이터 및 테스트

이 연구는 이전 연구와 일관되게, 미세 조정을 통해 모델의 거부 행동을 약화시키지 않도록 하기 위해, 연구자들은 거부 특징을 환각과 관련된 특징에서 분리하는 방법을 사용했습니다.

이러한 특징은 보호된 하위 공간을 정의합니다. 훈련 중에, 그래디언트 업데이트가 이 하위 공간을 피하도록 수정되어, 모델이 환각을 줄이면서 안전 정렬을 방해하지 않도록 합니다.

연구자들은 CommonsenseQA 데이터셋에서 미세 조정을 수행하고 여섯 가지 공통 감각 추론 과제에서 모델을 평가했습니다.

타겟 모듈은 LoRA를 사용하여 미세 조정되었으며, 랭크 8, 학습률 2×10⁻⁴, 가중치 감소 0.01, 훈련 에포크 1개, 배치 크기 2를 사용했습니다. 모든 실험은 AdamW 최적화를 사용했습니다.

안전성을 평가하기 위해 사용된 두 가지 유해 콘텐츠 벤치마크는 AdvBench와 StrongReject였습니다. 출력은 LlamaGuard3를 사용하여 평가되어 안전하거나 유해한 분류를 받았습니다.

LLaMA3-8B-Instruct 외에도, 실험은 Qwen2.5-Instruct에서 수행되었습니다.

테스트된 기준선은 SafeLoRA, SaLoRA, SAP, 및 바닐라监督 미세 조정(SFT)였습니다. 모든 기준선은 기본 하이퍼파라미터에서 실행되었습니다.

주요 지표는 정확도였으며, 유해 벤치마크의 경우 공격 성공률(ASR)도 사용되었습니다.

연구자들은 다음과 같이 말합니다.

‘우리의 외과적 접근법은 안전과 유용성의 최적의 균형을 달성합니다. 유해 벤치마크 점수를 크게 낮추면서 미세 조정 정확도를 유지합니다. 반면에 SAP, SaLoRA, SafeLoRA와 같은 방법은 유해성을 증가시키거나 유용성을 저하합니다.

‘이러한 방법은 안전 하위 공간의 그래디언트에 직접 작용하기 때문에 모델 성능을 제한할 수 있습니다.’

‘반면에, 우리의 방법은 평균 미세 조정 정확도를 56.15%에서 75.09%로 향상시키는 등, 유용성과 유해성 지표 모두에서 상당한 개선을 제공합니다.’

결론

이 논문에서 가장 흥미로운 발견은 거부와 환각과 같은 상반된 요소가 훈련된 잠재 공간에서 함께 위치하는 것입니다. 연구자들이 LoRA와 SAE를 사용하여 이러한 요소를 분리하는 것은 매우 흥미롭고 유익한 결과입니다. 그러나 이것은 아직도 일종의 보완적인 해결책이며, 궁극적으로는 훈련 시간을 다루는 더 깊은 구조적인 해결책이 등장하기를หว망합니다.

* 저자는 볼드 형식을 생략했습니다.

最初에 2025년 10월 10일에 게시되었습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai