Anderson의 관점
AI 환상 사용하여 이미지 현실성 평가

러시아의 새로운 연구는 대규모 비전-언어 모델(LVLM)의 정확도를 개선하는 대신 의도적으로 환상을 활용하여 비현실적인 AI 생성 이미지의 감지를 위한 비전통적인 방법을 제안합니다.
새로운 접근 방식은 LVLM을 사용하여 이미지에 대한 여러 ‘원자적 사실’을 추출한 다음 자연어 추론(NLI)을 적용하여 이러한 문장 간의 모순을 체계적으로 측정합니다. 이는 모델의 결점을 이미지의 현실성 감지에 대한 진단 도구로 사용하는 것입니다.

WHOOPS! 데이터셋의 두 이미지와 LVLM 모델에 의해 자동으로 생성된 문장. 왼쪽 이미지는 현실적이므로 일관된 설명이 생성되지만 오른쪽의 비정상적인 이미지는 모델이 환상을 일으키고 모순되거나 거짓된 문장을 생성합니다. 출처: https://arxiv.org/pdf/2503.15948
두 번째 이미지를 평가하도록 요청받은 LVLM은 어떤 것이 잘못된지 알 수 있습니다. 왜냐하면 묘사된 낙타가 세 개의 혹을 가지고 있기 때문입니다. 이는 자연에서 알려지지 않은 것입니다.
그러나 LVLM은最初에 ‘2개 이상의 혹’을 ‘2개 이상의 동물’과 혼동합니다. 왜냐하면 이것은 한 번의 ‘낙타 그림’에서 세 개의 혹을 볼 수 있는 유일한 방법이기 때문입니다. 그런 다음 그것은 세 개의 혹보다 더 가능성이 낮은 것을(즉, ‘두 개의 머리’)환상하고 실제로 의심을 일으킨 것(즉, 가능성이 낮은 추가 혹)을 자세히 설명하지 않습니다.
연구자들은 LVLM 모델이 이와 같은 평가를 기본적으로 수행할 수 있으며, 이러한 작업을 위해 미세 조정된 모델과 비교하여 동일하거나 더 나은 성능을 발휘한다는 것을 발견했습니다. 미세 조정은 복잡하고 비용이 많이 들고 다운스트림 적용성 측면에서 다소 취약하기 때문에, 현재 AI 혁명의 가장 큰 장애물 중 하나인 네이티브 사용을 발견한 것은 일반적인 문헌의 일반적인 경향과는 반대되는 신선한 전환이다.
개방형 평가
저자들은 이 접근 방식의 중요성이 오픈 소스 프레임워크와 함께 배포될 수 있다는 것에 있다고 주장합니다. 고급이고 많은 투자를 한 모델인 ChatGPT는 잠재적으로 더 나은 결과를 제공할 수 있지만, 이 문헌의 가치는 대부분의 사람들에게, 특히 취미와 VFX 커뮤니티에게 새로운 돌파구를 현지에서 통합하고 개발할 수 있는 가능성에 있습니다. 반면에 모든 것을 상업용 API 시스템에 의존하는 것은 회사의 기업 관심사보다 사용자의 필요와 책임에 더 많이 반영되는 제거, 임의의 가격 인상 및 검열 정책에 노출될 수 있습니다.
새로운 연구 논문은 Don’t Fight Hallucinations, Use Them: Estimating Image Realism using NLI over Atomic Facts라는 제목으로, 스크롤코보 인스티튜트 오브 사이언스 앤드 테크놀로지(Skoltech), 모스크바 인스티튜트 오브 피직스 앤드 테크놀로지, 러시아 회사 MTS AI, AIRI의 다섯 명의 연구자들에 의해 수행되었습니다. 이 연구에는 GitHub 페이지가 있습니다.
방법
저자들은 이 프로젝트에 이스라엘/미국의 WHOOPS! 데이터셋을 사용합니다.

WHOOPS! 데이터셋의 불가능한 이미지 예시. 이러한 이미지들이 어떻게 가능한 요소를 조합하고, 이러한 요소들의 불가능성이 어떻게 계산되는지 주목할 필요가 있습니다. 출처: https://whoops-benchmark.github.io/
데이터셋은 500개의 합성 이미지와 10,874개의 주석으로 구성되어 있으며, AI 모델의 상식적인推論과 구성적 이해를 테스트하기 위해 특별히 설계되었습니다. 이는 Midjourney와 DALL-E 시리즈와 같은 텍스트-이미지 시스템을 사용하여 어려운 또는 불가능한 이미지를 생성하기 위해 디자이너와의 협력을 통해 만들어졌습니다.

WHOOPS! 데이터셋의 추가 예시. 출처: https://huggingface.co/datasets/nlphuji/whoops
새로운 접근 방식은 세 단계로 작동합니다. 첫 번째 단계에서는 LVLM(특히 LLaVA-v1.6-mistral-7b)을 사용하여 이미지에 대한 여러 간단한 문장을 생성합니다. 이러한 문장들은 다이버스 빔 서치(Diverse Beam Search)를 사용하여 생성되며, 출력의 다양성을 보장합니다.

다이버스 빔 서치는 다양성을 증대된 목표를 최적화하여 더 나은 다양한 캡션 옵션을 생성합니다. 출처: https://arxiv.org/pdf/1610.02424
다음으로, 각 생성된 문장은 자연어 추론 모델을 사용하여 다른 모든 문장과 비교됩니다. 이는 문장 쌍이 서로에게 논리적으로 모순되거나 중립적인지 여부를 나타내는 점수를 할당합니다.
모순은 이미지 내에서 환상 또는 비현실적인 요소를 나타냅니다.

검출 파이프라인의 스키마.
마지막으로, 이러한 쌍별 NLI 점수를 단일 ‘현실성 점수’로 집계하여 생성된 문장의 전체 일관성을量化합니다.
연구자들은 다양한 집계 방법을 탐색했으며, 클러스터링 기반 접근 방식이 가장 잘 수행되었습니다. 저자들은 NLI 점수를 두 개의 클러스터로 분리하기 위해 k-평균 클러스터링 알고리즘을 적용했습니다. 그런 다음 낮은 값 클러스터의 중심을 최종 메트릭으로 선택했습니다.
이러한 두 클러스터는 분류 작업의 이진 특성, 즉 현실적인 이미지와 비현실적인 이미지를 구분하는 것과 일치합니다. 논리는 단순히 최저 점수를 선택하는 것과 유사하지만, 클러스터링을 사용하면 여러 사실 간의 평균 모순을 나타낼 수 있습니다.
데이터 및 테스트
연구자들은 WHOOPS! 기준 벤치마크에서 시스템을 테스트했으며, 교차 검증을 사용하여 테스트 세트를 분할했습니다. 테스트된 모델은 BLIP2 FlanT5-XL과 BLIP2 FlanT5-XXL이었습니다.
지시를 따르는 기준선으로, 저자들은 LVLM에 ‘이것은 비정상적인가? 간단한 문장으로 설명해 주세요’라는 문장을 제공했습니다. 이전 연구에서는 비현실적인 이미지를 감지하는 데 효과적인 것으로 나타났습니다.
평가된 모델은 LLaVA 1.6 Mistral 7B, LLaVA 1.6 Vicuna 13B, 및 InstructBLIP의 두 가지 크기(7/13억 매개변수)였습니다.
테스트 절차는 102개의 실제 이미지와 비현실적인(‘이상한’) 이미지의 쌍으로 구성되었습니다. 각 쌍은 정상 이미지와 상식에 어긋나는 대응 이미지를 포함했습니다.
세 명의 인간 주석자가 이미지를 주석화했으며, 92%의 일치도를 달성했습니다. 이는 ‘이상함’이 무엇인지에 대한 강한 인간적 합의를 나타냅니다. 평가 방법의 정확도는 실제 이미지와 비현실적인 이미지를 올바르게 구분하는 능력으로 측정되었습니다.
시스템은 세 번의 교차 검증을 사용하여 평가되었으며, 데이터를 고정 시드와 함께 무작위로 섞었습니다. 저자들은 훈련 중에 포함 점수(논리적으로 동의하는 문장)와 모순 점수(논리적으로 충돌하는 문장)를 조정했습니다. ‘중립’ 점수는 0으로 고정되었습니다. 최종 정확도는 모든 테스트 세트에 걸쳐 평균으로 계산되었습니다.

다양한 NLI 모델과 집계 방법의 비교, 5개의 생성된 사실에 대한 정확도로 측정.
위의 초기 결과에 대해 논문은 다음과 같이 말합니다.
‘[‘clust’] 방법은 가장 잘 수행되는 방법 중 하나입니다. 이는 모든 모순 점수의 집계가 극단적인 값에만 집중하는 것보다 중요하다는 것을 의미합니다. 또한, 가장 큰 NLI 모델(nli-deberta-v3-large)은 모든 집계 방법에서 다른 모델을 능가하여 문제의 본질을 더 잘 포착한다는 것을 시사합니다.’
저자들은 최적의 가중치가 일관되게 모순보다 포함을 선호한다는 것을 발견했습니다. 이는 모순이 비현실적인 이미지를 구분하는 데 더 정보가 있음을 나타냅니다. 저자의 방법은 테스트된 모든 제로샷 방법을 능가하며, 미세 조정된 BLIP2 모델의 성능에 근접합니다.

다양한 접근 방식의 WHOOPS! 벤치마크 성능. 미세 조정된 방법은 위에 나열되며, 제로샷 방법은 아래에 나열됩니다. 모델 크기는 매개변수의 수를 나타내며, 정확도는 평가 메트릭으로 사용됩니다.
그들은 또한 InstructBLIP이 동일한 프롬프트에서 비교 가능한 LLaVA 모델보다 더 나은 성능을 보인다는 것을 알게 되었습니다. GPT-4o의 우수한 정확도를 인정하면서, 저자들은 실제 오픈 소스 솔루션을 보여주는 것을 선호하며, 환상을 진단 도구로 명시적으로 사용하는 것에서 새로운 점을 주장할 수 있습니다.
결론
그러나 저자들은 2024년의 FaithScore 연구에 대한 프로젝트의 부채를 인정합니다. 이는 텍사스 대학교 달라스와 존스 홉킨스 대학교의 협력입니다.

FaithScore 평가 방법의 일러스트레이션. 먼저, LVLM 생성된答案 내의 설명 문장을 식별합니다. 다음으로, 이러한 문장을 개별 원자적 사실로 분해합니다. 마지막으로, 이러한 원자적 사실을 입력 이미지와 비교하여 그들의 정확성을 검증합니다. 밑줄이 그어진 텍스트는 객관적인 설명 내용을 강조하며, 파란색 텍스트는 환상된 문장을 나타내어 FaithScore가 해석 가능한 사실적 정확성의 척도를 제공할 수 있습니다.
FaithScore는 LVLM 생성된 설명의 신뢰도를 이미지 내용에 대한 일관성을 검증하여 측정합니다. 반면에, 새로운 논문에서는 LVLM의 환상을 명시적으로 사용하여 자연어 추론을 통해 생성된 사실의 모순을 사용하여 비현실적인 이미지를 감지합니다.
新的 연구는 현재 언어 모델의 특성과 환상에 대한 그들의 성향에 의존합니다. 만약 모델 개발이 완전히 환상이 없는 모델을 만들어낸다면, 새로운 연구의 일반적인 원칙은 더 이상 적용되지 않을 것입니다. 그러나, 이는 여전히 도전적인 전망입니다.
처음으로 게시된 날짜: 2025년 3월 25일 화요일












