Anderson의 관점
AI 비전 시스템은 실제로 ‘보는’ 것과 다를 수 있다

AI 비전 시스템은 이미지에 대한 설명을 고정관념으로 제공할 수 있으며, 실제로 이미지를 본 것이 아닐 수 있다. 레이블을 제거하면 설명이 무너진다.
최근의 AI 플랫폼은 끊임없이 자금을 소비하면서 AI 이벤트 지평선을 기대하고 있다. 이러한 플랫폼의 제공과 서비스에서 작은 경제적 절약은막대한 절감을 의미할 수 있다. 예를 들어, 대규모 언어 모델(LLM)이 자신의 훈련된 매트릭스에서 답변을 제공하는 대신 웹에서 정보를 얻기 위해 RAG 기반의 여정을 수행할 때마다 더 빠르게 답변을 제공하고 제공자에게 돈을 절약할 수 있다.
물론, 이는 더 많이 환상을 일으킬 가능성이 더 크다. 추가 토큰과 에너지를 사용하여 가정에 대한 문맥화와 확인을 하지 않기 때문이다.
마찬가지로, LLM이 웹에 접근할 때에도 종종 관련이 없거나 무의미한 URL을 인용할 수 있다. 이는 메타데이터만 평가하고 실제 페이지를 읽지 않았기 때문이다.
유사하게, PDF를 LLM에 업로드하고 논의하기를 원할 때, LLM은 결국 PDF 내용을 메모리에서 지우고 메타데이터만 사용하여 질의에 답변할 수 있다. 이는 오류, 잘못된 가정, 그리고 더 많은 환상을 유발할 수 있다.
산업 실험
이러한 현상은 사용자에게 운영적인 동기를 가진 합리적인 절약이다. 데이터 수집과 모델 훈련의 상류 세계에서 수백만 개의 이미지를 처리해야 하며, 인간이 수동으로 주석을 달 수 없는 경우, 에너지와 시간을 최소화하는 압력이 매우 강하다.
이러한 ‘단축’ 중 하나는 대조적 언어 이미지 사전 훈련(CLIP)과 같은 중간 언어 비전 모델을 사용하는 것이다. 이는 이미지와 텍스트를 공유된 의미 공간으로 매핑하여 시각적 개념을 언어로 비교할 수 있다.
이것은 어떤 의미일까? 잘, 수백만 개의 자막이 있는 이미지에서 학습한 아이가 어떤 이미지와 단어가 자연스럽게 함께 가는지 대략적인 감을 entwickeln하는 것을 상상해 보라.
그러나 문제는 자막이 종종 웹사이트 소유자와 다른 이해관계를 가진 주체가 의해 작성되었으며, 좋은 SEO를 위해 좋은 주석보다 더 관심이 많았기 때문에 많은 ‘노이즈’ 또는 부정확한 주석이 포함되어 있을 수 있다.
그러나 거대한 데이터셋에서 개념과 관련된 단어가 반복되는 빈도는 핵심 단어가 올바른 이미지와 관련되어 있음을 의미한다. 작은 숫자의 ‘무의미한’ 레이블은 일반적으로 아웃라이어 구역으로 밀려나고 이미지와 관련되지 않는다.
따라서 이것은 대부분의 경우에는 어느 정도 작동한다.
데이터 주석은 저렴하고 최소한의 기능이기 때문에 그렇게 된다. 좋은 이유가 아니기 때문이다.
오프-레이블
이 문제가 있는 상황에서 카네기 멜런 대학의 새로운 논문이 등장하여 많은 이미지에 할당된 캡션은 단순히 고정관념에 기반한 것이며, 실제로 이미지를 본 것이 아니라 이미지의 텍스트 레이블을 참조하여 생성된 것임을 명확히 보여주고 있다.
논문의 한 가지 예는 CLIP이 ImageNet-Sketch에서 테스트될 때, ImageNet 클래스 이름 딸기에서 생성된 설명과 함께 짝지어지면, 설명은 여전히 딸기가 ‘빨간’이고 ‘익은’이라고 주장한다.

클래스 이름 설명이 ImageNet-Sketch에서 실패한다: 언어 우선순위는 ‘빨간’과 ‘익은’을 말하지만, 이미지 기반 속성은 흑백 도면과 일치한다. 출처
여기서 CLIP은 클래스 이름 딸기에서 생성된 설명과 함께 짝지어지며, GPT-3 또는 외부 지식에서 생성된 설명과 함께 짝지어진다. 그러나 이러한 설명은 이미지를 본 적이 없으므로 정형 특징인 빨간과 잎이 있는과 같은 특징으로 기본값으로 설정된다.
반면에 이미지 자체에서 파생된 속성은 이미지의 시각적 내용과 일치하는 특징을 선택한다. 예를 들어, 점이 있는 또는 하트 모양의와 같은 특징이다.
따라서 우리는 식별된 객체가 실제로 무엇인지에 대한 설명이 아니라, 그 객체의 ‘명성’에 대한 설명을 하고 있는 것을 볼 수 있다. 즉, 딸기의 경우 ‘빨간’과 ‘익은’이라는 형용사는 딸기라는 하위 도메인에 정확하지만, 실제 이미지에는 해당되지 않는다.
새로운 연구의 저자들은 이 문제가 지속적이고 광범위한 문제이며, 클래스 이름에서 속성을 선택하는 대신 이미지 자체에서 속성을 선택하여 실제로 보이는 내용을 반영하도록 제안한다.
저자들은 다음과 같이 말한다:
‘대규모 언어 모델(LLM)이 클래스 이름을 설명하고 CLIP에 대한 설명을 생성하는 인기 있는 경로는 클래스 이름에서 설명을 생성하여 CLIP에 대한 설명을 생성한다. 그러나 이러한 설명은 시각적 증거가 거의 없다: 클래스 이름을 설명에서 제거하면 ImageNet의 정확도가 59.5%에서 15.5%로 떨어진다.
‘진단 결과는 설명이 레이블에 조건화되어 이미지에 조건화되지 않았으며, 따라서 설명은 일반적인 개념을 설명하며 데이터가 변경될 때 오류를 발생시킨다; LLM은 딸기가 빨간색이라고 주장하지만, ImageNet-Sketch의 모든 딸기는 흑백 도면이다.
‘따라서 우리는 대신 이미지 컬렉션에서 속성을 선택한다: 우리는 큰 속성 풀을 이미지에 대해 평가하고 CLIP의 공동 임베딩 공간에서 코사인 유사성을 사용하여 설명과 이미지의 일치 정도를 측정한다. 그리고 우리는 각 클래스당 최고 득점 설명을 유지한다.’
제안된 해결책은 모델이 동일하게 유지되지만, 클래스 이름 설명 대신 후보 속성 풀을 이미지에 대해 평가하여 실제로 보이는 내용과 일치하는 속성을 선택하는 것이다.
이것의 비용은 비교적 합리적이라고 할 수 있다. 왜냐하면 이 문제를 일으킨 ‘조작’ 방법의 저장된 에너지를 재호출하는 것을 제안하지 않기 때문이다. 대신, 각 클래스당 후보 속성에 대한 평가를 추가하여 속도는 약간 느려지지만, 재훈련이나 전체 RAG 스타일 파이프라인보다 훨씬 적다. 이론적으로, 에너지 비용은 합리적이라고 할 수 있다.
방법
저자의 실험 방법은 특히 미묘하며, 추가적인 유용한 통찰력을 얻기 위해 깊이 있게 살펴보는 것은 비정상적이다. 따라서 우리는 저자의 접근 방식에 대한 단축된 개요만 고려할 것이다.
이 연구는 핵심 문제를 클래스 이름 혼동으로 특징지으며, 설명이 의미 있는 것으로 보이지만 실제로는 클래스 이름 자체에 의존하며, 설명이 추가로 제공하는 것은 거의 없으며, 클래스 이름을 제거하면 설명이 무너진다는 점을 강조한다.
이 논문은 또한 설명이 클래스 이름에서 생성될 때, 설명은 일반적으로 어떤 것이 보이는지에 대한 설명이 될 수 있지만, 실제로 이미지에 존재하는 내용을 설명할 수는 없으며, 데이터가 변경되면 설명은 무의미하거나 오류를 발생시킬 수 있다고 주장한다.
연구진은 CLIP이 클래스 레이블의 도움 없이 속성을 감지하는 능력 자체가 부족한지, 또는 GPT가 만든 설명이 너무 일반적이어서 쓸모가 없는지도 검토했다. 그러나 후속 실험은 두 설명 모두 사실이 아님을 보여줬다.
이 문제를 해결하기 위해 연구진은 고정된 CLIP 모델로 이미지와 VAW, LSA 및 GPT-3 출력에서 가져온 대규모 후보 설명 집합을 비교했다. 재학습이나 추가 이미지·텍스트 감독 없이 이미지와 가장 잘 일치하는 속성만 유지했다.
제안된 시스템의 개요. 고정된 CLIP 모델이 이미지와 대규모 후보 속성 텍스트 집합을 모두 인코딩하고, 코사인 유사도로 각 설명이 시각적 내용과 얼마나 잘 맞는지 측정한다. 그런 다음 클래스별로 점수가 가장 높은 속성을 남겨 해석 가능한 프롬프트 집합을 만들며, 이미지와 텍스트 인코더는 전체 과정에서 고정된다.
데이터와 실험
저자들의 실험은 ResNet-50 백본을 사용하는 CLIP을 기반으로 했으며, ImageNet과 분포가 달라진 네 가지 변형인 ImageNetV2, ImageNet-Sketch, ImageNet-A, ImageNet-R에서 성능을 평가했다.
속성은 원래 ImageNet 훈련 이미지만 사용해 선택했다. 따라서 분포가 달라진 데이터셋은 시각적 외형이 변했을 때도 이미지에서 얻은 속성이 유용한지 평가하는 분포 외 테스트 역할을 했다.
ImageNet과 네 가지 분포 변화 벤치마크의 Top-1 분류 정확도. 클래스 이름이 프롬프트에 포함되면 성능은 대체로 비슷하지만, 설명만으로 판단하게 하면 성능이 급락한다. 이는 겉보기 성능의 상당 부분이 클래스 레이블에서 나온다는 뜻이다. 반면 이미지에서 직접 선택한 속성은 모든 데이터셋에서 훨씬 더 많은 정보를 제공했다.
같은 GPT 생성 속성 집합을 사용하되 ImageNet 이미지에 맞춰 속성을 다시 선택하자 클래스 이름 없는 정확도가 15.5%에서 19.4%로 높아졌다. 모델과 속성 집합, 평가 절차가 같았으므로 이 향상은 전적으로 이미지 조건부 선택에서 비롯된 것으로 볼 수 있다.
이 결과는 CLIP이 클래스 레이블 없이도 속성을 식별할 수 있고, GPT가 생성한 집합에도 이미 유용한 설명이 포함되어 있음을 보여줬다. 핵심 문제는 레이블 조건부 생성에 있었으며, 이 방식은 이미지 자체에 가장 중요한 속성을 드러내지 못하는 경우가 많았다.
저자들은 광범위한 추가 실험을 이어가지만, 여기서는 자세한 내용은 원문을 참고하도록 한다. 추가 실험은 범위를 넓히기보다 지금까지 설명한 핵심 가설, 즉 레이블 의존성이 실제 이미지 데이터의 잠재력을 훼손하고 ‘평판’에 기대는 값싼 확률 판단이 결과 정확도를 해칠 수 있다는 점을 재확인한다.
결론
현대 생성형 AI가 초대형 시대 초기에 Common Crawl 같은 거대한 수집 데이터셋에 들어간 수백만 장의 수작업 설명 이미지에 얼마나 빚지고 있는지 생각해 볼 만하다.
이미지 인식이나 자동 레이블 시스템이 과거 또는 새 이미지를 분류할 때마다 그 지식의 기원은 2004년 어느 eBay 판매자가 alt 레이블에 ‘멋진 1970년대 잡지!’라고 쓴 것 같은 사건으로 거슬러 올라간다.
많은 사람은 키워드 채우기의 황금기가 약 30년 전 Google의 더 정교한 PageRank 알고리즘으로 끝났다고 믿지만, ‘텍스트를 잔뜩 넣고 하나라도 걸리길 바라는’ 방식은 여전히 살아 있다. 바로 전날 공개된 Qwen-Image-3.0 모델 페이지의 HTML 상단에도 시대착오적인 키워드 채우기가 보였다.
작성 당시 Qwen Image 3 출시 페이지의 HTML 코드는 업무 환경에 완전히 적합하다고 보기 어려운 키워드 텍스트의 벽이었다. 출처
Qwen Image 3 페이지의 성인용 키워드까지 포함된 이 목록이 대상 목록에서 자동으로 추출됐든 SEO 전문가가 직접 작성했든, 이는 현대 생성형 AI 시스템의 원시적인 기원을 잘 보여준다. 의미에는 종종 이해관계가 큰 짐처럼 실리며, 그 용어가 합리적인 시스템과 응용을 방해할 때는 나중에 제거하거나 적어도 고려해야 한다.
최초 게시: 2026년 7월 22일 수요일












