Anderson의 관점

랜덤 노이즈 대신 실제 이미지로 컴퓨터 비전 모델 훈련

mm
Unite.AI를 Google의 선호 소스에 추가

MIT 컴퓨터 과학 및 인공 지능 연구소(CSAIL)의 연구자들은 컴퓨터 비전 데이터셋에 랜덤 노이즈 이미지를 사용하여 컴퓨터 비전 모델을 훈련시킨 실험을 수행했으며, 그 결과가 놀랍도록 효과적임을 발견했습니다.

성능으로 정렬된 실험의 생성 모델. 출처: https://openreview.net/pdf?id=RQUl8gZnN7O

성능으로 정렬된 실험의 생성 모델. 출처: https://openreview.net/pdf?id=RQUl8gZnN7O

인기 있는 컴퓨터 비전 아키텍처에 명백한 ‘시각 쓰레기’를 입력하면 이러한 성능이 나와서는 안 됩니다. 위 이미지의 오른쪽에 있는 검은 기둥은 실제 데이터셋(Imagenet-100)에 대한 정확도 점수를 나타냅니다. 랜덤 노이즈 데이터셋(다양한 색상, 상단 왼쪽에 있는 색인 참조)은 실제 데이터셋의 정확도에 도달할 수 없지만 대부분이 적절한 상한선과 하한선(빨간 대시선) 내에 있습니다.

이 경우 ‘정확도’는 결과가 반드시 얼굴, 교회, 피자 또는 관심 있는 이미지 합성 시스템의 특정 도메인과 같은 것으로 보장하지 않습니다. 즉, 생성적 적대적 신경망이나 인코더/디코더 프레임워크와 같은 이미지 합성 시스템입니다.

그 대신에 CSAIL 모델이 이미지 데이터에서 널리 적용 가능한 중심적인 ‘진리’를 도출해 냈음을 의미합니다. 이러한 데이터는 구조가 없어서 이러한 지식을 제공할 수 없을 것입니다.

다양성 대 자연성

이러한 결과는過적합으로 인한 결과가 아닙니다. 오픈 리뷰에서 저자와 심사자 간의 활발한 토론은 시각적으로 다양한 데이터셋(예: ‘사망한 잎’, ‘프랙탈’ 및 ‘절차적 노이즈’ – 아래 이미지 참조)의 내용을 훈련 데이터셋에 혼합하면 이러한 실험에서 정확도를 향상시킵니다.

이것은革命적인 개념인 ‘under-fitting’의 새로운 유형을 시사합니다. 여기서 ‘다양성’이 ‘자연성’을凌駕합니다.

실험에서 사용된 다양한 랜덤 이미지 데이터셋을 상호 작용하여 볼 수 있는 프로젝트 페이지. 출처: https://mbaradad.github.io/learning_with_noise/

실험에서 사용된 다양한 랜덤 이미지 데이터셋을 상호 작용하여 볼 수 있는 프로젝트 페이지. 출처: https://mbaradad.github.io/learning_with_noise/

연구자들이 얻은 결과는 이미지 기반 신경망과 매년 더욱大量으로 제공되는 ‘실세계’ 이미지 간의 근본적인 관계를疑問시하며, 巨大 이미지 데이터셋을 얻고, 관리하고, 사용하는 필요성이 결국 불필요해질 수 있음을 시사합니다. 저자들은 다음과 같이 말합니다.

‘현재 비전 시스템은巨大 데이터셋으로 훈련되며, 이러한 데이터셋은 비용을 수반합니다. 데이터셋의 관리는 비싸고, 인간의 편향을 물려받으며, 개인 정보 및 사용 권한에 대한 우려가 있습니다. 이러한 비용을 대체하기 위해 더 저렴한 데이터 소스에서 학습하는 데 대한 관심이 증가했습니다.

‘본 논문에서 우리는 한 걸음 더 나아가 실제 이미지 데이터셋을 완전히 대체하여 절차적 노이즈 프로세스에서 학습할 수 있는지 질문합니다.’

연구자들은 현재의 기계 학습 아키텍처가 이전에 생각했던 것보다 더 근본적이거나 예상치 못한 것을 이미지에서 추론할 수 있을 것이라고 제안하며, ‘무의미한’ 이미지도 이러한 지식을 훨씬 더 저렴하게 제공할 수 있다고 주장합니다. 아마도 훈련 시간에 랜덤 이미지를 생성하는 데이터셋 생성 아키텍처를 통해 합성 데이터를 사용할 수 있을 것입니다.

‘우리는 시각 시스템을 훈련하기 위한 좋은 합성 데이터에는 두 가지 주요 속성이 있다고 पहच

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai