Anderson의 관점

과한 해석이 과적합보다 더 큰 위협일 수 있다

mm
Unite.AI를 Google의 선호 소스에 추가

당신의 좋은 친구 앨리스가 노란 스웨터를 좋아한다면, 당신은 평균 사람보다 더 많은 노란 스웨터를 볼 것입니다. 어느 정도 시간이 지나면, 당신이 다른 여성이 노란 스웨터를 입고 있는 것을 볼 때, 앨리스라는 핵심 개념이 떠올라날 것입니다.

당신이 앨리스와 약간 닮은 여성이 노란 스웨터를 입고 있는 것을 볼 때, 당신은 잠시 동안 그녀를 앨리스로 착각할 수도 있습니다.

하지만 그것은 앨리스가 아닙니다. 결국, 당신은 노란 스웨터가 앨리스를 식별하는 유용한 키가 아니라는 것을 깨닫게 될 것입니다. 왜냐하면 앨리스는 여름에는 노란 스웨터를 입지 않으며, 겨울에도 항상 입지 않기 때문입니다. 우정의 어느 시점에서, 당신은 앨리스 식별자로서 노란 스웨터를 낮추기 시작할 것입니다. 왜냐하면 이捷径을 유지하는 데 사용되는 인지 에너지는 빈번하게 보상되지 않기 때문입니다.

그러나 컴퓨터 비전 기반 인식 시스템이라면, 노란 스웨터를 볼 때마다 앨리스를 볼 수 있습니다.

이것은 당신의 잘못이 아닙니다. 당신은 가능한 한 최소한의 정보로 앨리스를 식별하라는 임무를 받았으며, 이러한 축소된 앨리스 암기를 유지하는 데 필요한 인지 자원이 부족하지 않습니다.

불쾌한 식별

MIT 컴퓨터 과학 및 인공 지능 연구소(CSAIL)와 Amazon Web Services의 최근 논문에 따르면, 컴퓨터 비전 연구 분야에서 이러한 증후군, 즉 과한 해석이 만연해 있으며, 과적합을 해결함으로써 완화될 수 없으며, 이미지 인식과 변형의 두 가지 가장 영향력 있는 데이터 세트인 CIFAR-10과 ImageNet에서 흔히 발생합니다. 또한 쉽게 해결할 수 있는 방법은 없습니다.

연구자들은 입력 훈련 이미지를 원래 내용의 5%로 줄였을 때, 인기 있는 많은 프레임워크가 이미지를 올바르게 분류하는 것을 발견했습니다. 이러한 이미지는 대부분의 경우 인간 관찰자에게 시각적인 “무의미”로 나타납니다.

원본 훈련 이미지에서 5%의 원래 픽셀 내용만 남긴 이미지. 인기 있는 컴퓨터 비전 프레임워크에서 90-99%의 정확도로 올바르게 분류됩니다. 출처: https://arxiv.org/pdf/2003.08907.pdf

원본 훈련 이미지에서 5%의 원래 픽셀 내용만 남긴 이미지. 인기 있는 컴퓨터 비전 프레임워크에서 90-99%의 정확도로 올바르게 분류됩니다. 출처: https://arxiv.org/pdf/2003.08907.pdf

일부 경우에, 분류 프레임워크는 이러한 축소된 이미지를 원본 훈련 데이터의 전체 프레임보다 더 쉽게 올바르게 분류하는 것으로 나타났습니다. 연구자들은 “[CNN은] 이러한 픽셀 부분집합에서보다 전체 이미지보다 더 자신감을 가지고 있습니다”라고 관찰했습니다.

이것은 CIFAR-10 및 ImageNet과 같은 벤치마크 데이터 세트를 사용하는 컴퓨터 비전 시스템에서 흔히 발생하는 잠재적으로 해로운 종류의 “조작”을 나타냅니다. 또한 VGG16, ResNet20, ResNet18과 같은 벤치마크 프레임워크에서도 발생합니다.

과한 해석은 자율 주행 자동차 시스템과 같은 컴퓨터 비전 기반 시스템에重大한 의미를 갖습니다. 최근 Tesla의 결정으로 인해 이미지 해석이 LiDAR 및 기타 레이 기반 감지 시스템보다 자율 주행 알고리즘에서 선호됩니다.

과한 학습은 알려진 도전이며 컴퓨터 비전 분야에서 활발한 연구 대상입니다. 그러나 2019년에 독일/캐나다 연구에서 이 문제를 명확히 정의했지만, 과한 해석의 특징인 “가짜” 픽셀 부분집합이 “통계적으로 유효한 데이터”라는 점을 인식하지 못합니다. 이것은 데이터셋의 更細化를 통해 해결되어야 합니다.

이 논문은 과한 해석이 이미지 분류 모델의 병리를 드러낸다라는 제목으로 Brandon Carter, Siddhartha Jain, David Gifford가 CSAIL에서 Amazon Web Services의 Jonas Mueller와 협력하여 작성했습니다. 이 논문의 코드는 https://github.com/gifford-lab/overinterpretation에서 찾을 수 있습니다.

데이터 축소

연구자들이 사용한 데이터가 제거된 이미지는 충분한 입력 부분집합(Sufficient Input Subsets, SIS)이라고 불립니다. 즉, SIS 이미지는 컴퓨터 비전 시스템이 이미지의 원래 주제(예: 개, 배 등)를 식별할 수 있을 만큼 최소한의 “외부 차체”를 포함합니다.

위쪽 행에는 완전한 ImageNet 검증 이미지가 표시되고, 아래에는 Inception V3 모델이 90%의 신뢰도로 올바르게 분류한 SIS 부분집합이 표시됩니다. 자연스럽게, 마지막 열에는 자율 주행 차량 알고리즘의 표지판 인식에重大한 의미가 있습니다.

위쪽 행에는 완전한 ImageNet 검증 이미지가 표시되고, 아래에는 Inception V3 모델이 90%의 신뢰도로 올바르게 분류한 SIS 부분집합이 표시됩니다. 자연스럽게, 마지막 열에는 자율 주행 차량 알고리즘의 표지판 인식에重大한 의미가 있습니다.

위 이미지의 결과에 대해 연구자들은 다음과 같이 말합니다:

‘우리는 SIS 픽셀이 실제 객체가 아닌 이미지의 배경과 관련된 픽셀에 집중되어 있음을 발견했습니다. 예를 들어, “피자” 이미지에서는 SIS가 피자 자체가 아닌 접시와 테이블의 모양에 집중되어 있습니다. 이것은 모델이 다른 원형 물체가 있는 이미지에서 일반화가 잘되지 않을 수 있음을 시사합니다. “자이언트 판다” 이미지에서는 SIS에 대나무가 포함되어 있습니다. 이는 ImageNet 사진 коллек션에서 이 클래스에 나타난 속성일 수 있습니다. ‘

‘교통 신호 및 도로 표지판 이미지에서는 SIS가 하늘의 픽셀으로 구성되어 있습니다. 이것은 이러한 모델을 사용하는 자율 주행 차량 시스템이 과한 해석의 병리를 신중하게 평가해야 함을 시사합니다.’

SIS 이미지는 무작위로 잘리지 않습니다. 대신, Inception V3와 ResNet50을 사용하여 PyTorch로 생성된 배치 그라데이트 백셀렉션 프로세스를 통해 생성됩니다. 이미지는 모델의 이미지 분류 정확도와 원래 데이터의 제거된 영역 간의 관계를 고려하여 생성됩니다.

연구자들은 무작위 픽셀 제거 과정을 테스트하여 결과가 “훨씬 덜 정보가 담겨 있다”는 것을 발견했습니다. 이것은 SIS 이미지가 실제로 인기 있는 모델과 데이터셋이 예측을 하는 데 필요한 최소한의 데이터를 나타낸다는 것을 시사합니다.

축소된 이미지 중 하나만 보아도, 이러한 모델은 인간의 시각적 식별 수준에서 실패해야 합니다. 이는 중간 정도의 성공률, 즉 20% 미만의 정확도를 의미합니다.

SIS 이미지를 원래 픽셀의 5%로 축소했을 때, 인간은 거의 랜덤한 분류 성공률을 달성합니다. 이는 연구에서 조사한 인기 있는 데이터셋과 프레임워크의 90-99%의 성공률과 대조됩니다.

SIS 이미지를 원래 픽셀의 5%로 축소했을 때, 인간은 거의 랜덤한 분류 성공률을 달성합니다. 이는 연구에서 조사한 인기 있는 데이터셋과 프레임워크의 90-99%의 성공률과 대조됩니다.

과적합을 넘어서

과적합은 기계 학습 모델이 데이터셋에 대해 너무 많이 훈련하여 해당 데이터에 대해 예측을 잘하지만, 훈련 후에 새로운 데이터에 대해 거의 효과가 없거나 전혀 효과가 없는 경우에 발생합니다.

연구자들은 과적합을 해결하는 현재의 학계와 산업계의 관심이 과한 해석을 동시에 해결하지 않을 것이라고 지적합니다. 왜냐하면 컴퓨터에게 식별 가능한 이미지로 나타나는 축소된 픽셀 부분집합은 실제로 “유효한 데이터”이기 때문입니다.

‘과한 해석은 과적합과 관련이 있지만, 과적합은 감소된 테스트 정확도로 진단할 수 있습니다. 과한 해석은 데이터 분포의 특정 속성에서 발생하는 진정한 통계적 신호에서 비롯될 수 있습니다.

‘따라서 과한 해석은 통계적으로 유효한 기준에 따라 결정이 내려질 수 있으며, 이러한 기준을 사용하는 모델은 벤치마크에서 우수한 성능을 발휘할 수 있습니다.’

가능한 해결책

연구자들은 모델 앙상블, 즉 여러 아키텍처가 평가 및 훈련 과정에 기여하는 방식이 과한 해석을 완화하는 데 도움이 될 수 있다고 제안합니다. 또한 입력 드롭아웃을 적용하여 CIFAR-10 테스트 정확도에 작은 감소를 일으키지만, 보이지 않는 데이터에 대한 모델의 정확도를 약 6% 증가시킴을 발견했습니다. 그러나 낮은 수치로 인해 과적합을 완화하는 후속 치료법이 과한 해석을 완전히 해결하지는 않을 것이라고 생각합니다.

연구자들은 또한 살리언시 맵을 사용하여 이미지의 어떤 영역이 특징 추출에 중요하는지 나타낼 수 있다고 지적합니다. 그러나 이것은 자동 이미지 파싱의 목표를 무효화하며, 대규모로 인간 주석이 불가능합니다. 또한 살리언시 맵이 모델 작동에 대한 통찰력으로서 粗한 추정자로 발견되었다고 관찰합니다.

이 논문은 다음과 같이 결론을 맺습니다:

‘이미지를 올바르게 분류하는 데 필요한 최소한의 픽셀 부분집합이 존재한다는 사실을 고려하면, 모델은 이러한 패턴만을頼赖할 수 있습니다. 이 경우, 모델을 신뢰성 있게 설명하는 해석 가능성 방법은 이러한 무의미한 이유를 출력해야 하며, 인간의 사전 지식에 편향된 이유를 출력하는 해석 가능성 방법은 사용자가 모델이 의도한 대로 작동한다고 생각하게 할 수 있습니다.’

 

 

最初에 2022년 1월 13일에 게시되었습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai