Anderson의 관점

AI 비전 시스템은 실제로 ‘보는’ 것과 다를 수 있다

mm
Unite.AI를 Google의 선호 소스에 추가
AI-generated image (GPT-2): a supermarket bin contains misshapen green apples beneath a sign showing a red apple and the words 'Red, glossy and round.' The image is surrounded by a yellow-and-black border labelled “AI fantasy inside” and “reality outside,” with inward-pointing arrows.

AI 비전 시스템은 이미지에 대한 설명을 고정관념으로 제공할 수 있으며, 실제로 이미지를 본 것이 아닐 수 있다. 레이블을 제거하면 설명이 무너진다.

 

최근의 AI 플랫폼은 끊임없이 자금을 소비하면서 AI 이벤트 지평선을 기대하고 있다. 이러한 플랫폼의 제공과 서비스에서 작은 경제적 절약은巨大的節約을 의미할 수 있다. 예를 들어, 대규모 언어 모델(LLM)이 자신의 훈련된 매트릭스에서 답변을 제공하는 대신 웹에서 정보를 얻기 위해 RAG 기반의 여정을 수행할 때마다 더 빠르게 답변을 제공하고 제공자에게 돈을 절약할 수 있다.

물론, 이는 더 많이 환상을 일으킬 가능성이 더 크다. 추가 토큰과 에너지를 사용하여 가정에 대한 문맥화와 확인을 하지 않기 때문이다.

마찬가지로, LLM이 웹에 접근할 때에도 종종 관련이 없거나 무의미한 URL을 인용할 수 있다. 이는 메타데이터만 평가하고 실제 페이지를 읽지 않았기 때문이다.

유사하게, PDF를 LLM에 업로드하고 обсужд기를 원할 때, LLM은 결국 PDF 내용을 메모리에서 지우고 메타데이터만 사용하여 질의에 답변할 수 있다. 이는 오류, 잘못된 가정, 그리고 더 많은 환상을 유발할 수 있다.

산업 실험

이러한 현상은 사용자에게 운영적인 동기를 가진 합리적인 절약이다. 데이터 수집과 모델 훈련의 상류 세계에서 수백만 개의 이미지를 처리해야 하며, 인간이 수동으로 주석을 달 수 없는 경우, 에너지와 시간을 최소화하는 압력이 매우 강하다.

이러한 ‘단축’ 중 하나는 대조적 언어 이미지 사전 훈련(CLIP)과 같은 중간 언어 비전 모델을 사용하는 것이다. 이는 이미지와 텍스트를 공유된 의미 공간으로 매핑하여 시각적 개념을 언어로 비교할 수 있다.

이것은 어떤 의미일까? 잘, 수백만 개의 자막이 있는 이미지에서 학습한 아이가 어떤 이미지와 단어가 자연스럽게 함께 가는지 대략적인 감을 entwickeln하는 것을 상상해 보라.

그러나 문제는 자막이 종종 웹사이트 소유자와 다른 이익을 가진实體에 의해 작성되었으며, 좋은 SEO를 위해 좋은 주석보다 더 관심이 많았기 때문에 많은 ‘노이즈’ 또는 부정확한 주석이 포함되어 있을 수 있다.

그러나 거대한 데이터셋에서 개념과 관련된 단어가 반복되는 빈도는 핵심 단어가 올바른 이미지와 관련되어 있음을 의미한다. 작은 숫자의 ‘무의미한’ 레이블은 일반적으로 아웃라이어 구역으로 밀려나고 이미지와 관련되지 않는다.

따라서 이것은 대부분의 경우에는 어느 정도 작동한다.

데이터 주석은 저렴하고 최소한의 기능이기 때문에这样하게 된다. 좋은 이유가 아니기 때문이다.

오프-레이블

이 문제가 있는 상황에서 카네기 멜런 대학의 새로운 논문이 등장하여 많은 이미지에 할당된 캡션은 단순히 고정관념에 기반한 것이며, 실제로 이미지를 본 것이 아니라 이미지의 텍스트 레이블을 참조하여 생성된 것임을 명확히 보여주고 있다.

논문에서の一個의 예는 CLIP이 ImageNet-Sketch에서 테스트될 때, ImageNet 클래스 이름 딸기에서 생성된 설명과 함께 짝지어지면, 설명은 여전히 딸기가 ‘빨간’이고 ‘익은’이라고 주장한다.

클래스 이름 설명이 ImageNet-Sketch에서 실패한다: 언어 우선순위는 '빨간'과 '익은'을 말하지만, 이미지 기반 속성은 흑백 도면과 일치한다. 출처 - https://github.com/HaohanWang/ImageNet-Sketch

클래스 이름 설명이 ImageNet-Sketch에서 실패한다: 언어 우선순위는 ‘빨간’과 ‘익은’을 말하지만, 이미지 기반 속성은 흑백 도면과 일치한다. 출처

여기서 CLIP은 클래스 이름 딸기에서 생성된 설명과 함께 짝지어지며, GPT-3 또는 외부 지식에서 생성된 설명과 함께 짝지어진다. 그러나 이러한 설명은 이미지를 본 적이 없으므로 정형 특징인 빨간잎이 있는과 같은 특징으로 기본값으로 설정된다.

반면에 이미지 자체에서 파생된 속성은 이미지의 시각적 내용과 일치하는 특징을 선택한다. 예를 들어, 점이 있는 또는 하트 모양의와 같은 특징이다.

따라서 우리는 식별된 객체가 실제로 무엇인지에 대한 설명이 아니라, 그 객체의 ‘명성’에 대한 설명을 하고 있는 것을 볼 수 있다. 즉, 딸기의 경우 ‘빨간’과 ‘익은’이라는 형용사는 딸기라는 하위 도메인에 정확하지만, 실제 이미지에는 해당되지 않는다.

새로운 연구의 저자들은 이 문제가 지속적이고 광범위한 문제이며, 클래스 이름에서 속성을 선택하는 대신 이미지 자체에서 속성을 선택하여 실제로 보이는 내용을 반영하도록 제안한다.

저자들은 다음과 같이 말한다:

‘대규모 언어 모델(LLM)이 클래스 이름을 설명하고 CLIP에 대한 설명을 생성하는 인기 있는 경로는 클래스 이름에서 설명을 생성하여 CLIP에 대한 설명을 생성한다. 그러나 이러한 설명은 시각적 증거가 거의 없다: 클래스 이름을 설명에서 제거하면 ImageNet의 정확도가 59.5%에서 15.5%로 떨어진다.

‘진단 결과는 설명이 레이블에 조건화되어 이미지에 조건화되지 않았으며, 따라서 설명은 일반적인 개념을 설명하며 데이터가 변경될 때 오류를 발생시킨다; LLM은 딸기가 빨간색이라고 주장하지만, ImageNet-Sketch의 모든 딸기는 흑백 도면이다.

‘따라서 우리는 대신 이미지 컬렉션에서 속성을 선택한다: 우리는 큰 속성 풀을 이미지에 대해 평가하고 CLIP의 공동 임베딩 공간에서 코사인 유사성을 사용하여 설명과 이미지의 일치 정도를 측정한다. 그리고 우리는 각 클래스당 최고 득점 설명을 유지한다.’

제안된 해결책은 모델이 동일하게 유지되지만, 클래스 이름 설명 대신 후보 속성 풀을 이미지에 대해 평가하여 실제로 보이는 내용과 일치하는 속성을 선택하는 것이다.

이것의 비용은 비교적 합리적이라고 할 수 있다. 왜냐하면 이 문제를 일으킨 ‘조작’ 방법의 저장된 에너지를 재호출하는 것을 제안하지 않기 때문이다. 대신, 각 클래스당 후보 속성에 대한 평가를 추가하여 속도는 약간 느려지지만, 재훈련이나 전체 RAG 스타일 파이프라인보다 훨씬 적다. 이론적으로, 에너지 비용은 합리적이라고 할 수 있다.

방법

저자의 실험 방법은 특히 미묘하며, 추가적인 유용한 통찰력을 얻기 위해 깊이 있게 살펴보는 것은 비정상적이다. 따라서 우리는 저자의 접근 방식에 대한 단축된 개요만 고려할 것이다.

이 연구는 핵심 문제를 클래스 이름 혼동으로 특징지으며, 설명이 의미 있는 것으로 보이지만 실제로는 클래스 이름 자체에 의존하며, 설명이 추가로 제공하는 것은 거의 없으며, 클래스 이름을 제거하면 설명이 무너진다는 점을 강조한다.

이 논문은 또한 설명이 클래스 이름에서 생성될 때, 설명은 일반적으로 어떤 것이 보이는지에 대한 설명이 될 수 있지만, 실제로 이미지에 존재하는 내용을 설명할 수는 없으며, 데이터가 변경되면 설명은 무의미하거나 오류를 발생시킬 수 있다고 주장한다.

연구자들은 또한 CLIP이 클래스 레이블 없이 속성을 감지하는 데 пло

기계 학습 분야 작가이자 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: [email protected]