Anderson의 관점

딥 러닝 모델은 AI 생성 이미지 인식에 어려움을 겪을 수 있다

mm
Unite.AI를 Google의 선호 소스에 추가

새로운 연구 결과에 따르면, 최첨단 AI는 사람보다 AI 생성 이미지 인식 및 해석에 훨씬 더 어려움을 겪는 것으로 나타났다. 이는 기계 학습 모델이 합성 데이터에 훈련되는 경우가 증가하고, 데이터가 실제인지 합성인지 알 수 없는 상황에서 문제가 될 수 있다.

resnext101_32x8d_wsl 예측 모델이 '베이글' 카테고리에서 어려움을 겪고 있다. 테스트에서 핵심 대상 단어가 상위 5개 예측 결과에 포함되지 않은 경우 인식 실패로 간주되었다. 출처: https://arxiv.org/pdf/2208.10760.pdf

resnext101_32x8d_wsl 예측 모델이 ‘베이글’ 카테고리에서 어려움을 겪고 있다. 테스트에서 핵심 대상 단어가 상위 5개 예측 결과에 포함되지 않은 경우 인식 실패로 간주되었다. Source: https://arxiv.org/pdf/2208.10760.pdf

이 연구는 두 가지 유형의 컴퓨터 비전 기반 인식 프레임워크를 테스트했다: 객체 인식과 시각적 질문 응답(VQA).

왼쪽: 객체 인식 시스템의 추론 성공과 실패; 오른쪽: 이미지와 장면에 대한 AI의 이해를 더 탐색적이고 중요한 방식으로 조사하는 VQA 작업

왼쪽: 객체 인식 시스템의 추론 성공과 실패; 오른쪽: 이미지와 장면에 대한 AI의 이해를 더 탐색적이고 중요한 방식으로 조사하는 VQA 작업 Sources: https://arxiv.org/pdf/2105.05312.pdf and https://arxiv.org/pdf/1505.00468.pdf

10개의 최첨단 모델을 테스트했으며, 모두 ImageNet에 훈련되었다. DALL-E 2와 Midjourney와 같은 이미지 합성 프레임워크에서 생성된 데이터세트에서 테스트했다. 가장 잘 수행된 모델은 top-5 정확도에서 60%와 80%를 달성했지만, ImageNet은 실제 데이터에서 91%와 99%를 달성했다.

이 연구는 인간이 생성된 이미지를 쉽게 인식하고 질문에 답변할 수 있지만, 깊은 모델은 생성된 콘텐츠를 이해하는 데 어려움을 겪을 수 있다고 결론지었다.

데이터

이 연구는 DALL-E 2와 Midjourney에서 생성된 17개의 카테고리(코끼리, 버섯, 피자, 프레첼, 트랙터, 토끼 등)의 이미지로 수행되었다.

테스트된 인식 및 VQA 시스템에서 가장 중요한 키概念을 식별하기 위해 도전된 이미지의 예시

테스트된 인식 및 VQA 시스템에서 가장 중요한 키概念을 식별하기 위해 도전된 이미지의 예시

이미지는 웹 검색과 트위터를 통해 얻었으며, DALL-E 2의 정책에 따라 인간의 얼굴이 포함되지 않는 이미지만 사용했다.

객체 인식과 VQA 작업을 위한 두 개의 이미지 세트가 구축되었다.

객체 인식의 각 테스트 카테고리당 이미지 수

객체 인식의 각 테스트 카테고리당 이미지 수

객체 인식 테스트

객체 인식 테스트에서는 10개의 모델을 테스트했으며, 모두 ImageNet에 훈련되었다. AlexNet, ResNet152, MobileNetV2, DenseNet, ResNext, GoogleNet, ResNet101, Inception_V3, Deit, ResNext_WSL이 포함되었다.

일부 클래스는 더 세분화되어 있었기 때문에 평균 접근 방식을 적용해야 했다. 예를 들어, ImageNet에는 ‘시계’에 대한 3개의 클래스가 있으며, ‘시계’ 类의 어떤 유형이라도 상위 5개 예측 결과에 포함되는 경우 성공으로 간주했다.

17개 카테고리에서 모델별 성능

17개 카테고리에서 모델별 성능

이 라운드에서 가장 잘 수행된 모델은 resnext101_32x8d_ws로, top-1에서 60%, top-5에서 80%의 정확도를 달성했다. 그러나 이 결과는 ImageNet이 실제 데이터에서 달성한 91%와 99%보다 낮다.

연구자들은 이 모델의 좋은 성능은 소셜 미디어 플랫폼에서 해시태그를 예측하기 위해 훈련된 것이기 때문이라고 주장한다. 그러나 이러한 결과는 ImageNet이 실제 데이터에서 달성한 결과보다 낮다.

시스템에서 가장 어려웠던 5개의 카테고리는, 순서대로, 연, 거북이, 다람쥐, 선글라스, 헬멧이었다. 이 연구는 ‘연’ 클래스가 종종 ‘풍선’, ‘낙하산’, ‘우산’과 혼동된다고 주장한다.

모델이 모두 어려움을 겪거나 쉽게 식별한 카테고리

모델이 모두 어려움을 겪거나 쉽게 식별한 카테고리

시각적 질문 응답 테스트

다음으로, 연구자는 VQA 모델을 열린 형식과 이진 질문(예/아니요 질문)으로 테스트했다. 최근의 최첨단 VQA 모델은 VQA-v2 데이터세트에서 95%의 정확도를 달성할 수 있다.

이 테스트에서는 50개의 이미지와 241개의 질문을 생성했으며, 132개의 질문에는 긍정적인 답변, 109개의 질문에는 부정적인 답변을 포함했다. 평균 질문 길이는 5.12 단어였다.

이 라운드에서는 OFA 모델을 사용했으며, 이는 작업-중립적이고 모달리티-중립적인 프레임워크로, 작업의 포괄성을 테스트하기 위해 사용되었다. OFA 모델은 VQA-v2 테스트 세트에서 최근最高 점수를 달성했다. OFA 모델은 생성된 이미지에서 77.27%의 정확도를 달성했으며, VQA-v2 테스트 세트에서 94.7%의 정확도를 달성했다.

VQA 테스트의 예시 질문과 결과

VQA 테스트의 예시 질문과 결과

LSD in the Data Stream?

新的 AI 생성 이미지의 급증은, 합성된 이미지에 포함된 의미적 개념이 실제 이미지에서 볼 수 없는 경우가 많기 때문에, 컴퓨터 비전 연구 분야에 문제를 일으킬 수 있다. 이러한 이미지들은 실제 이미지와는 다른 분포를 가지고 있을 수 있으며, 이는 기계 학습 모델의 정확도를 낮출 수 있다.

이러한 이미지들은 실제 이미지와는 다른 분포를 가지고 있을 수 있으며, 이는 기계 학습 모델의 정확도를 낮출 수 있다. 또한, 이러한 이미지들은 실제 이미지와는 다른 의미적 개념을 포함할 수 있으며, 이는 기계 학습 모델의 이해력을 낮출 수 있다.

따라서, 이러한 이미지들을 실제 이미지와 구분하기 위한 방법이 필요하다. 또한, 이러한 이미지들을 사용하여 기계 학습 모델을 훈련하는 경우, 모델의 성능을 낮출 수 있다.

따라서, 이러한 문제를 해결하기 위한 연구가 필요하다. 이러한 연구는 컴퓨터 비전 연구 분야에 기여할 수 있을 것이다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai