Anderson의 관점
AI 이미지 환상 감소에 대한 과장

ChatGPT 스타일의 비전 모델은 종종 이미지에 속하지 않는 요소를 ‘환상’합니다. 새로운 방법은 캡션을 기반으로 모델의 자체 환상을 과장된 버전으로 보여주고 다시 시도하도록 요청하여 이러한 오류를 줄입니다. 이 접근 방식에는 재훈련이나 추가 데이터가 필요하지 않으며 다양한 모델과 모델 유형에 적용할 수 있습니다.
중국에서 발표된 새로운 논문은 AI 생성 이미지 및 비디오의 지속적인 문제인 환상에 대한 흥미로운 관점을 제공합니다.
본질적으로 시스템은 이미지와 모델이 설명하는 캡션을 사용하여 새로운 이미지를 생성하고 원래 이미지와 생성된 이미지를 비교하여 모델이 자체 오류를 자동으로 수정하도록 합니다. 이 프로세스는 손으로 조정된 규칙이나 외부 데이터에 의존하지 않으며 완전히 자체 감독됩니다.
이 방법은 재훈련이나 추가 데이터가 필요하지 않으며 다양한 모델과 모델 유형에 적용할 수 있습니다. 또한 이 접근 방식은 모델이 자체 오류를 자동으로 수정하도록 하여 모델의 성능을 향상시킬 수 있습니다.
복잡한 웹
위의 예에서 논문의 저자는 엔트윈먼트가 입력 이미지에 ‘새’를 추가하는 데 책임이 있을 수 있다고 말합니다.
엔트윈먼트는 모델이 특정 개념을 다른 개념과 연관시키는 경향이 있는 경우 발생합니다. 이 경우 모델은 많은 ‘비행기+새’ 이미지를 본 경험이 있어 이 연관성이 특정 이미지에 적용되지 않지만 캡션에 영향을 미칩니다.
엔트윈먼트를 완화하는 방법은 훈련을 더 일찍 중지하는 것입니다. 그러나 이것은 훈련된 개념의 세부 사항과 해상도를 줄입니다. 모델 트레이너는 모델을 매우 유연하고 분리된 모델로 만들지, 또는 더 강력하게 생성하지만 더 많은 ‘관련’ 환상을 생성하는 모델로 만들지 결정해야 합니다.
원래 데이터의 품질과 캡션의 주의 깊은 큐레이션이 더 좋았다면 각 이미지의 모든 객체를 자세히 설명했을 것입니다. 그러나 SEO 캡션과 대규모 웹 스크레이핑으로 인해 이미지 캡션은 이러한 표준에 미치지 못합니다.

LAION 이미지의 약한 캡션이 Stable Diffusion과 같은 모델을 훈련하는 데 어떻게 제한되는지 보여주는 일러스트레이션 (원본 소스는 https://rom1504.github.io/에서 가져왔으며 현재는 사용할 수 없습니다).
따라서 기초적인 해결책은 실현 가능하지 않으므로 LLM/VLM 환상을 줄이는 데 대한 우회와妥協이 이제 문헌의 강한 하위 스트림이 되었습니다.
이번 주에 공개된 새로운 중국 기술은 다양한 아키텍처와 환경에서 테스트되었으며 ‘환상 오염’을 줄이는 유용한 방법일 수 있습니다.
저자는 다음과 같이 말합니다:
‘다양한 벤치마크에서 광범위한 실험을 통해 우리의 방법이 객체, 속성 및 관계 수준에서 환상을 크게 줄이는 반면 리콜과 캡션의 풍부함을 크게 유지하는 것을 보여주었습니다.’
새로운 논문은 환상을 노출하여 억제하기: 생성적 앵커를 사용한 VLMs 표현 편집이라는 제목을 가지고 있으며 중국과학기술대학교와 난징대학교의 3명의 연구자에 의해 작성되었습니다.
방법
저자는 환상을 노출하고 억제하기 위한 엔드투엔드 파이프라인을 개발했습니다.

파이프라인의 전체적인 모습
입력 이미지에서 시작하여 비전-언어 모델은 환상이 포함된 캡션을 생성합니다. 이 캡션은 텍스트-이미지 생성기를 사용하여 재구성된 이미지를 생성합니다. 원래 이미지와 재구성된 이미지를 비교하여 시스템은 모델이 자체 오류를 자동으로 수정하도록 합니다.
이미지를 컴팩트한 임베딩으로 변환하여 모델이 자체 오류를 자동으로 수정하도록 합니다. 원래 이미지와 재구성된 이미지를 비교하여 시스템은 모델이 자체 오류를 자동으로 수정하도록 합니다.
이 프로세스는 손으로 조정된 규칙이나 외부 데이터에 의존하지 않으며 완전히 자체 감독됩니다.
논문에서는 다음과 같이 말합니다:
‘MLLMs의 환상은 언어적으로 잘 구성되어 있으며 텍스트 수준에서 신뢰할 수 있는 설명과 구별할 수 없기 때문에 내적으로 어려운 것을 감지합니다. 불일치는 언어적 가능성에 있지 않으며 시각적 증거와의 불일치에 있으며 모델 자체는 일반적으로 이를 인식하지 못합니다.
‘이를 해결하기 위해 우리는 암시적인 불일치를 명시적이고 관찰 가능한 신호로 변환하는 환상 노출 메커니즘을 도입합니다.’
입력 이미지와 캡션을 사용하여 시스템은 FLUX.1-dev 텍스트-이미지 모델을 사용하여 캡션에서 재구성된 이미지를 생성합니다. 이 재구성된 이미지는 캡션의 의미를 과장하여 환상을 더 명확하게 만듭니다. 이러한 증폭된 오류는 모델이 자체 오류를 자동으로 수정하도록 하는 유용한 신호가 됩니다.
저자는 다음과 같이 말합니다:
‘我们的 방법은 다양한 벤치마크에서 환상을 크게 줄이는 반면 리콜과 캡션의 풍부함을 크게 유지하는 것을 보여주었습니다.’
데이터 및 테스트
새로운 방법의 유효성을 검증하기 위해 세 가지 적절한 벤치마크를 사용했습니다: 캡션 환상 평가 (CHAIR); MLLM 평가 벤치마크 (MME); 및 POOLING 기반 객체 탐지 평가 (POPE).
표준 지표와 같은 환상률 또는 리콜은 오도될 수 있습니다. 모델이 환상을 피하기 위해 단순한 또는 모호한 캡션을 생성할 수 있기 때문입니다. 이러한 트레이드오프를 고려하기 위해 환상과 리콜 (HAR@β)이라는 결합 지표를 사용했습니다. 이 지표는 캡션의 정확성과 완전성을 기준으로 점수를 매기며 균형을 조정할 수 있습니다.
POPE는 컨텍스트에 민감한 객체 환상을 평가하기 위해 사용되었습니다. MME는 속성 수준의 환상을 평가하기 위해 사용되었습니다.
다양한 대표적인 데이터셋을 사용하여 실험을 수행했습니다. Flux 모델과 LLaVA-v1.5-7B 변형을 사용했습니다. 사용된 데이터셋은 Microsoft COCO; A-OKVQA; 및 GQA였습니다.
초기 결과는 다음과 같습니다.

CHAIR 벤치마크에서 환상 완화를 평가한 성능
저자는 다음과 같이 말합니다:
‘우리의 방법은 CHAIRS와 CHAIRI에서 일관되게 다른 기준선보다 나은 성능을 보여주었습니다. 이는 우리의 방법이 환상을 억제하는 데 더 효과적임을 보여줍니다. 한편, 거의 모든 방법은 환상을 억제하는 동안 리콜을 줄입니다. 이는 충실성과 정보량 사이의 트레이드오프를 반영합니다. 그러나 우리의 방법은 리콜의 감소를 최소화합니다.
결론
이 논문은 rõ ràng히 급하게 작성되었으며 구조, 초점, 명확성이 부족하여 최근 12개월 동안 문헌에서 증가하고 있는 추세를 보입니다. 그러나 제시된 핵심 메커니즘은仍然 지능적입니다.
이 엔드투엔드 접근 방식은 재훈련이나 추가 데이터가 필요하지 않으며 다양한 아키텍처에 적용할 수 있습니다. 그러나 테스트 후보자가 더 많았으면 좋았을 것입니다. 또한 이러한 중간 시스템은 최소한 지연을 유발하며 확장할 때 일부 전력 요구 사항을 추가할 수 있습니다.
* CHAIR 벤치마크는 캡션의 객체 환상을 평가하기 위해 사용되었습니다. 두 가지 형태를 사용했습니다. CHAIRS는 캡션에서 환상이 나타나는 빈도를 측정했습니다. CHAIRI는 언급된 객체 중 얼마나 많은 것이 환상인지 측정했습니다. HAR@β는 본 논문에서 도입되었으며 환상 억제와 객체 리콜의 Fβ 스타일 조합으로 정의되었습니다.
최초로 게시된 날짜: 2025년 9월 30일












