Anderson의 관점
AI 이미지 환각을 과장함으로써 감소시키기

ChatGPT 스타일 비전 모델은 종종 이미지에 포함되지 않아야 할 요소들을 ‘환각’합니다. 새로운 방법은 캡션을 기반으로 모델 자신의 환각을 과장된 형태로 보여주고, 다시 시도하도록 함으로써 이러한 오류를 줄입니다. 이 접근 방식은 재학습이나 추가 데이터가 필요 없으며, 다양한 모델 및 모델 유형에 적용할 수 있습니다.
AI 생성 이미지와 비디오에서 지속적으로 발생하는 성가신 문제인 환각에 대해 중국의 새로운 논문이 흥미로운 관점을 제시합니다 – 사용자의 요청 및 입력에 비추어 볼 때 이미지에 명백히 없어야 할 요소들입니다.
본질적으로, 시스템은 이미지를 받아 모델이 평소처럼 설명하도록 한 뒤, 그 캡션을 텍스트‑투‑이미지 모델을 사용해 새 이미지로 변환합니다 – 그리고 두 번째 이미지에 나타나는 추가 객체나 세부 사항은 모델이 처음에 만든 환각의 직접적인 표현이 됩니다. 그런 다음 원본 이미지와 생성된 이미지를 비교함으로써, 시스템은 다음 번 시도에서 이러한 오류를 부드럽게 교정합니다.

새 방법이 이미지 캡션에서 환각을 식별하고 감소시키는 방식을 보여주는 일러스트레이션. 일반 모델은 원본 이미지에 존재하지 않는 새들을 설명하여, 이를 추가한 재구성 이미지를 생성합니다. 이러한 오류는 빨간색으로 표시됩니다. 반면 제안된 방법은 이러한 허구의 세부 정보를 피하면서 캡션을 구체적이고 유창하게 유지합니다. Source: https://arxiv.org/pdf/2509.21997
이 방법은 모델에 실제 이미지를 보여주고 이를 설명하게 하며, 그 설명 중 일부는 실제로 존재하지 않는 객체나 세부 사항을 포함합니다. 이러한 환각된 캡션은 오류를 더 쉽게 식별할 수 있도록 합성 이미지를 생성하는 데 사용됩니다. 실제 이미지와 생성된 이미지를 비교함으로써, 시스템은 모델 내부에서 허구의 내용을 만들어내는 패턴을 학습합니다.
이러한 오류 패턴이 식별되면 저장하여 나중에 사용할 수 있습니다. 모델에 새로운 이미지를 제공하면, 시스템은 캡션 생성 중 내부 신호를 조정하여 환각을 일으키는 알려진 패턴에서 멀어지도록 유도합니다. 이는 한 번의 처리로 이루어지며 추가 데이터, 재학습, 혹은 테스트 시 새로운 이미지 생성이 필요하지 않습니다.
얽힌 웹
위 논문에서 보여진 예시에서, 얽힘이 입력 이미지에 새들을 과장하게 만드는 원인으로 보이며, 첫 번째 이미지에는 새가 전혀 없는 것으로 보입니다.
얽힘은 모델이 특정 개념을 다른 개념과 연관시키려는 경향이 있을 때 발생하는데, 이는 두 개(또는 그 이상)의 개념이 모델이 학습한 원본 데이터 분포에서 자주 함께 나타났기 때문입니다. 이 경우 모델은 많은 비행기+새 사진을 본 적이 있어, 해당 특정 사진에는 적용되지 않지만 파생된 캡션에 침투하는 연관성을 형성했을 가능성이 있습니다.
얽힘은 학습을 일찍 중단함으로써 완화될 수 있지만(일반적으로 이는 모델을 최대한 유연하고 적응 가능하게 만들지만), 이는 모든 학습된 개념의 세부 사항과 해상도를 감소시켜 모델 훈련자가 영원히 고민하는 딜레마에 빠지게 합니다: 매우 유연하고 얽힘이 없는 모델을 만들 것인가, 아니면 더 강력하게 생성하지만 ‘연관된’ 환각을 더 많이 만들 가능성이 있는 모델을 만들 것인가?
생성 모델을 위한 원본 데이터의 캡션 품질과 세부 사항에 대한 주의가 일반적인 물류 여건보다 더 좋았다면, 모든 원본 이미지에 대한 캡션은 각 사진의 모든 객체를 상세히 기술했을 것이며, 따라서 훈련된 모델은 이를 잠재 공간에서 개별적이고 얽힘 없는 항목으로 할당할 수 있었을 것입니다.
현 상황에서는 SEO 캡션이라는 자기 이익적인 관행과 임시 초대형 웹 스크래핑이 여전히 진정으로 강력한 생성 모델을 훈련시키는 최상의 소스라는 사실이 결합되어, 이미지 캡션이 이 기준에 크게 미치지 못하게 됩니다.

LAION 이미지의 약한 캡션이 Stable Diffusion과 같은 모델 학습에 유용성을 제한하는 방식을 보여주는 예시입니다. 많은 텍스트 라벨이 얕고 모호하거나 정확한 설명보다 SEO에 최적화되어 있어, 모델이 얼굴 특징과 같은 세밀한 시각 개념을 학습하기 어렵게 만듭니다. (원본 출처는 https://rom1504.github.io/, 현재는 사라졌습니다).
따라서 근본적인 해결책이 실현 가능성이 거의 없다고 판단되므로, LLM/VLM 환각을 우회와 타협을 통해 감소시키는 연구가 현재 문헌에서 강력한 하위 흐름으로 자리 잡았다.
저자에 따르면 이번 주에 공개된 새로운 중국 기술은 다양한 아키텍처와 여러 조건에서 테스트되었으며, ‘환각 오염’을 줄이는 유용한 방법을 제시할 수 있다.
그들은 말한다:
‘다중 벤치마크에 걸친 광범위한 실험을 통해 우리 방법이 객체, 속성, 관계 수준에서 환각을 크게 감소시키면서도 리콜과 캡션을 대부분 유지함을 보여준다 [richness]’
이 new paper의 제목은 Exposing Hallucinations To Suppress Them: VLMs Representation Editing With Generative Anchors이며, 중국과학기술대학과 난징대학교의 세 연구자가 공동 집필하였다.
방법
저자들은 아래에 제시된 종단 간 파이프라인을 고안했으며, 이는 이미지 캡션에서 환각을 드러내고 억제하도록 설계되었다.

전체 파이프라인의 일러스트. 비전‑언어 모델이 입력 이미지에서 캡션을 생성하는데, 이 캡션에는 환각된 내용이 포함될 수 있다. 이 캡션을 텍스트‑투‑이미지 모델에 전달해 재구성된 이미지를 생성함으로써 환각을 보다 쉽게 식별할 수 있다. 원본 이미지와 재구성 이미지의 임베딩을 추출하여 디코더 내부 조정을 안내함으로써, 모델이 캡션 품질을 유지하면서 환각된 세부 정보를 억제한다.
실제 입력 이미지에서 시작하여 비전‑언어 모델이 설명적인 캡션을 생성한다. 이 캡션에는 허구의 객체나 관계가 포함될 수 있다. 그런 캡션을 텍스트‑투‑이미지 생성기에 입력하면 캡션이 설명하는 그대로의 재구성 이미지를 만든다. 이 재구성 이미지를 원본과 비교하면 조작된 내용이 명백하고 측정 가능하게 드러나며, 텍스트의 미묘한 오류를 시스템이 목표로 삼아 감소시킬 수 있는 가시적인 차이로 전환한다.
모델이 ‘세부 정보를 창조’하는 것을 방지하기 위해, 시스템은 동일 이미지의 두 버전(원본과 캡션 기반 재구성 이미지)을 비교한다. 각 이미지는 그 내용을 포착하는 압축된 embedding으로 변환된다.
원본 이미지는 신뢰할 수 있는 기준 역할을 하고, 재구성 이미지는 환각이 어디에 스며들었는지 강조한다. 내부 표현을 원본에 가깝게, 재구성 이미지에는 멀어지도록 조정함으로써 모델은 스스로 자동으로 교정하는 방법을 학습한다. 이 과정은 손으로 만든 규칙이나 외부 데이터에 의존하지 않으므로 완전히 self-supervised이다.
논문은 다음과 같이 말한다:
‘MLLM에서의 환각은 언어적으로 잘 구성되어 텍스트 수준에서 충실한 설명과 구별하기 어려워 본질적으로 탐지하기 어렵다. 문제는 언어의 타당성에 있는 것이 아니라 시각적 증거와의 불일치에 있으며, 모델 자체는 보통 이에 민감하지 않다.’
‘이를 해결하기 위해 우리는 생성적 재구성을 활용하여 암묵적인 불일치를 명시적이고 관찰 가능한 신호로 전환하는 환각 노출 메커니즘을 도입한다.’
입력 이미지와 그 캡션을 받아 시스템은 FLUX.1-dev 텍스트‑투‑이미지 모델을 사용해 캡션만으로 이미지를 재생성한다. 이 재생성된 이미지는 캡션의 의미를 과장하는 경향이 있어 잘못된 세부 사항이 더욱 뚜렷이 드러난다. 이러한 증폭된 오류는 모델이 자신의 실수를 인식하고 수정하도록 돕는 유용한 신호로 활용된다.
접근법을 테스트하기 위해 저자들은 캡션에 환각을 주입하고 텍스트‑투‑이미지 모델로 재구성 이미지를 생성했다. 그런 다음 이 이미지들을 LLaVA가 다시 캡션하고, 원본 캡션과 환각된 캡션 사이의 의미 유사도를 평가했다:

환각 증폭 메커니즘이 미세한 오류를 어떻게 드러내는지 보여주는 일러스트입니다. 각 점은 하나의 이미지‑캡션 쌍에 대해 원본 이미지와 재구성된 이미지 캡션 간의 유사성을 나타냅니다. 주황색 선은 원본 캡션과 환각된 캡션 사이의 직접 측정 유사성을 나타내며, 이는 높게 유지되어 작은 실수를 가립니다; 파란색 선은 재구성 후의 유사성을 나타내며 급격히 떨어져, 이 과정이 숨겨진 환각을 감지 및 수정 가능한 명확한 의미 표식으로 전환함을 보여줍니다.
재구성 후 유사성이 급격히 떨어져, 이 과정이 미세한 오류를 더 쉽게 감지할 수 있게 함을 보여줍니다.
데이터 및 테스트
새로운 방법의 효과를 검증하기 위해 세 가지 적절한 벤치마크를 사용했습니다: 이미지 관련성 기반 캡션 환각 평가 (CHAIR); MLLM 평가 벤치마크 (MME); 그리고 풀링 기반 객체 탐색 평가 (POPE).

CHAIR 발표 논문에서: 두 주요 캡션 생성 시스템인 TopDown과 NBT가 생성한 환각 객체 사례로, 각 모델이 이미지에 실제로 존재하지 않는 시각 요소(예: 노트북, 싱크대, 서핑보드)를 만들어냅니다. Source: https://arxiv.org/pdf/1809.02156
표준 지표인 환각 비율이나 재현율은 오해를 일으킬 수 있습니다. 모델이 짧거나 모호한 캡션만 생성함으로써 환각을 피할 수 있기 때문입니다. 재현율과 환각 사이의 트레이드오프를 고려하기 위해 환각 및 재현율 (HAR@β)이라는 결합 지표를 사용했으며, 이는 정확도와 완전성을 모두 평가하고 오류 회피와 상세 정보 제공 중 어느 쪽을 중시할지에 따라 균형을 조정할 수 있습니다.
POPE는 문맥에 민감한 객체 환각을 평가하는 데 사용되었으며, MME는 속성 수준 환각을 평가하기 위해 Yes‑or‑No 판단 과제로 구성되었습니다.
다양한 대표 데이터셋을 대상으로 실험을 수행했으며, 앞서 언급한 Flux 모델과 LLaVA-v1.5-7B 변형을 사용했습니다. 사용된 데이터셋은 Microsoft COCO, A-OKVQA, GQA입니다.
잠재 편집은 prior related work에 따라 모델의 두 번째 레이어에서 수행했으며, 하이퍼파라미터와 온도는 모든 모델에서 일관되게 유지되었습니다.
CHAIR에 대한 초기 결과는 아래에 제시됩니다*:

여러 지표를 사용해 평가한 CHAIR 벤치마크에서의 환각 완화 성능.
이 결과들에 대해 저자들은 다음과 같이 언급합니다:
‘[Our method consistently outperforms other baselines on both CHAIRS and CHAIRI[*], 환각 억제에 있어 뛰어난 효과를 보여줍니다. 한편, 거의 모든 방법이 환각을 억제하면서 리콜을 감소시키는 것은 불가피하며, 이는 충실도와 정보량 사이의 트레이드오프를 반영하지만, 우리 접근법은 가장 작은 감소폭을 보입니다.
‘이는 우리 방법이 실제 객체의 광범위한 범위를 포착함을 보여줍니다. HAR@β 지표를 사용했을 때, 우리 방법이 가장 높은 점수를 받아 환각을 감소시키면서도 커버리지를 유지하는 능력을 강조합니다.’
연구진은 이러한 강력한 결과를 이중 감독 설정에 기인한다고 설명합니다. 원본 이미지의 깨끗한 의미론을 강화하면서 동시에 재구성 이미지에서 발생하는 오해 신호를 억제했기 때문입니다. 조정이 환각과 관련된 방향에만 적용되었으므로 나머지 표현은 그대로 유지되어, 시스템이 세부 사항이나 정보성을 희생하지 않고 오류를 수정할 수 있었습니다.

다양한 구성 및 데이터셋에서 POPE 벤치마크 성능 비교.
POPE에 대한 결과와 관련하여, 위 결과 표에서 논문은 다음과 같이 주장합니다:
‘우리 방법이 모든 설정에서 일관되게 최고의 성능을 달성함을 확인할 수 있습니다. 특히, 평균적으로 정확도 +5.95%, F1 점수 +6.85%까지 향상시켜 다른 학습 없이 적용 가능한 접근법들을 크게 앞서 나갑니다.
‘따라서, 이러한 결과는 우리 방법이 다양한 난이도 수준에서 신뢰할 수 있고 일반화 가능한 솔루션을 제공함을 보여줍니다.’

세 번째 테스트 라운드에서 MME에 대한 성능 비교.
최종 주요 테스트는 MME에서 수행되었으며, 결과는 위에 표시되어 있습니다. 그러나 다른 누락 사항 중 하나로, 본문이나 부록 어디에도 정의되지 않은 ‘OPERA’ 방법이 언급됩니다. 저자들은 MME에서 강력한 성능을 주장하지만, 방법에 대한 충분한 정의가 없으므로 이 시점에서 결과 섹션을 보류하는 것이 좋을 것 같습니다.

LLaVA-v1.5-7B를 사용한 MME 벤치마크의 일러스트레이션으로, 기본 모델이 환각 답변을 생성한 반면 제안된 방법은 올바른 응답을 제공했으며, 재구성된 이미지가 환각을 더욱 뚜렷하게 보여줍니다.
결론
이 논문은 명백히 서두른 느낌이며, 지난 12개월 동안 문헌에서 점점 더 드러난 구조, 초점 및 명확성의 부족으로 고통받고 있습니다(아마도 학술 연구에서 AI 사용이 급증한 것과 무관하지 않을 수 있습니다). 그럼에도 제시된 핵심 메커니즘은 여전히 독창적입니다.
이 엔드‑투‑엔드 접근 방식은 재학습이 필요하지 않으며 다양한 아키텍처에 적용 가능한 것으로 보이지만, 더 많은 테스트 후보를 보는 것이 통찰력을 제공했을 것입니다. 또한 이러한 중간 시스템은 최소한 지연 시간을 초래하고 어느 정도 추가 전력 소비를 요구한다는 점도 고려해야 합니다—대규모에서는 사소한 문제가 아닙니다.
* 비전통적으로, 이 논문의 본문은 부록 자료에서만 설명되는 제목을 가진 결과를 제시하고 있으며, 이는 연구자들이 핵심 논문을 8-9 페이지로 제한하려다 보니 문헌에서 점점 흔히 보이는 나쁜 습관이다. 어떠한 경우든, 캡션에서 객체 환상을 평가하기 위해 사용된 CHAIR 벤치마크는 이전 연구의 500이미지 MSCOCO 하위집합을 기반으로 한다. 두 형태가 사용되었다: CHAIRs, 특정 캡션에 환상이 나타난 빈도를 측정하고; CHAIRI, 언급된 객체 중 얼마나 많은 것이 환상화되었는지를 측정한다. HAR@β , 본문에서 소개된 바와 같이, 환상 억제와 객체 재현을 결합한 Fβ 스타일의 조합으로 정의되었다.
2025년 9월 30일 화요일 최초 게시












