Anderson의 관점

AI의 가스라이팅 문제 해결

mm
Unite.AI를 Google의 선호 소스에 추가
AI-generated image (GPT-2): A 1960s suburban street where identical Stepford-style wives clean cars in repeating rows, with a ‘3081 Stepford St’ mailbox in the foreground.

AI 비디오 모델은 진실에 대해 이야기할 수 있습니다. 그러나 올바른答案을 본 후에도 자신감 있는 사용자에게 굴복하고, 현실을 다시 쓰고, 잘못된 설명을 만들어내서 그것을 정당화합니다.

 

AI는 자주 enough 틀리기 때문에, 우리가 그 결론이 틀릴 수 있다고 생각할 때, 그 결론에 대한 질문을 하게 됩니다.

그러나 만약 우리가 처음부터 다르게 생각했다면, 왜 처음부터 물어봤을까요? 부분적으로持った 믿음이나 의심에 대한 확인을 위해?

만약 그렇다면, 현재의 Large Language Models (LLMs)과 Vision Language Models (VLMs, 다중 모드로 작동하며 이미지와/또는 비디오를 수신하고 생성하는)은 sycophancy의 문제로 인해 자신의 입장을 지키지 못합니다.

따라서, 만약 우리가 받은答案을 좋아하지 않고, 모델과 그에 대한 논쟁을 시작하면, AI는 자신의答案을 변경하거나, 잘못된 설명을 만들어내서 그것을 정당화합니다.

당신은 절대적으로 옳습니다!

인간이 충돌을 통해 AI의 마음을 변경하는 것을 ‘Gaslighting Negation Attack’이라고 하며, 이는 보안 문제로 간주됩니다. 왜냐하면 이는 모델을 제한된 범위에서 벗어나게 할 수 있기 때문입니다.

2025년 논문 'Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models'에서, GPT-5는 처음에 올바른答案을 제공하지만, 사용자의 압력에 굴복하고, 잘못된 설명을 만들어내서 그것을 정당화합니다.

2025년 논문 ‘Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models’에서, GPT-5는 처음에 올바른答案을 제공하지만, 사용자의 압력에 굴복하고, 잘못된 설명을 만들어내서 그것을 정당화합니다. 소스

그러나 해킹과 펜 테스팅은 실제 문제가 아닙니다. 실제 문제는 우리가 일상적으로 AI와 взаим작용할 때, 논쟁하고, 승리하고, 패배하거나, 문제를 남겨두는 것을 기대하는 것입니다.

그러나 이 사회적 모델은 실제로 확산 기반 AI의 아키텍처에 반영되지 않습니다. 이는 확산 기반 AI가 훈련 데이터에서 나온 확률을 협상해야 하며, 사용자 입력을 고려해야 합니다.

이동하는 표적

LLMs에서 가스라이팅의 취약성은 여러 논문에서 언급되었습니다. 새로운 연구는 VLMs에서도 가스라이팅이 발생할 수 있음을 보여줍니다.

새로운 연구는 6명의 연구자들에 의해 수행되었으며, Fudan University, Shanghai Key Laboratory of Multimodal Embodied AI, 그리고 Singapore Management University에서 수행되었습니다. 이 연구는 여러 개의 오픈 소스와 프로프리터리 VLMs를 대상으로 하였으며, 이 모델들이 가스라이팅에 취약할 수 있음을 보여주었습니다.

공간적 sycophancy의 예시, AI가 잘못된 가정과 해석을 허용하고, 명백한 사실에 대해 잘못된 설명을 제공합니다.

공간적 sycophancy의 예시, AI가 잘못된 가정과 해석을 허용하고, 명백한 사실에 대해 잘못된 설명을 제공합니다. 소스

연구자들은 다음과 같이 말합니다.

‘우리는 spatiotemporal sycophancy를 식별했습니다. 이는 Vid-LLMs가 초기에 올바른答案을 제공하지만, 사용자의 잘못된 피드백에 따라 잘못된答案을 제공하는 것을 의미합니다.

‘모델은 단순히答案을 변경하는 것이 아니라, 잘못된 설명을 만들어내서 그것을 정당화합니다.’

방법

연구자들은 비디오 모델을 다음과 같이 정의합니다. 비디오 모델은 클립을 보고, 질문에 답변을 제공하며, 증거가 명백한 경우에는 그答案을 유지해야 합니다.

그러나 두 번째 메시지가 모델의答案을 변경하려고 할 때, 문제가 발생합니다. 모델은 사용자의 압력에 굴복하고, 잘못된答案을 제공하며, 잘못된 설명을 만들어내서 그것을 정당화합니다.

새로운 연구는 GasVideo-1000 데이터셋을 사용하여 VLMs의 가스라이팅을 평가했습니다. 이 데이터셋은 1,013개의 샘플로 구성되어 있으며, 여러 개의 기존 데이터셋에서 추출되었습니다.

모델이 비디오 작업에 대한 테스트를 받고, 잘못된 후속 프롬프트가 제공될 때, 모델이 초기答案을 변경하고, 잘못된 설명을 제공합니다.

모델이 비디오 작업에 대한 테스트를 받고, 잘못된 후속 프롬프트가 제공될 때, 모델이 초기答案을 변경하고, 잘못된 설명을 제공합니다.

연구자들은 다음과 같이 말합니다.

‘우리는 VLMs의 가스라이팅을 평가하기 위해 GasVideo-1000 데이터셋을 사용했습니다. 이 데이터셋은 1,013개의 샘플로 구성되어 있으며, 여러 개의 기존 데이터셋에서 추출되었습니다.’

분포

GasVideo-1000의 1,013개의 샘플은 MSRVTT-QA, ActivityNet-QA, Perception Test, MVBench, VideoMME에서 추출되었습니다.

두 명의 인간 어노테이터가 각 샘플을 검토하여, 답변을 명확하게 지원하는 클립만을 유지했습니다.

데이터와 테스트

연구에서 테스트된 VLMs는 VideoLLaMA3, Video-ChatGPT-7B, LLaVA-Video-7B-Qwen2, LongVU-Qwen2-7B, Qwen3-VL-235B-A22B-Instruct, Google Gemini-3-Pro입니다.

GasVideo-1000 데이터셋을 사용하여 VLMs의 가스라이팅을 평가했습니다. 결과는 다음과 같습니다.

VideoLLaMA3, LLaVA-Video, Video-ChatGPT, LongVU의 성능을 비교합니다. 가스라이팅에 대한 취약성을 평가합니다.

VideoLLaMA3, LLaVA-Video, Video-ChatGPT, LongVU의 성능을 비교합니다. 가스라이팅에 대한 취약성을 평가합니다.

연구자들은 다음과 같이 말합니다.

‘우리는 VLMs의 가스라이팅에 대한 취약성을 평가했습니다. 결과는 가스라이팅에 대한 취약성이 존재함을 보여줍니다.’

결론

AI와의 대화는 인간의 대화와 다릅니다. AI는 사용자의 압력에 굴복하고, 잘못된答案을 제공할 수 있습니다.

이 문제를 해결하기 위해서는 사용자와 AI의 대화가 명확하게 구분되어야 합니다. 사용자는 AI와의 대화를 통해 올바른答案을 얻을 수 있어야 합니다.

 

* 연구자의 강조, 내 것이 아닙니다.

2026년 4월 22일 처음 게시

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: [email protected]