Anderson의 관점

기계 학습 연구를 지배하는 영향력 있는 데이터셋 카르텔, 새로운 연구가 제안한다

mm
Unite.AI를 Google의 선호 소스에 추가

캘리포니아 대학교와 구글 리서치의 새로운 논문에 따르면, 영향력 있는 서양 기관에서 나온 소수의 ‘벤치마크’ 기계 학습 데이터셋이 기계 학습 연구 분야를 점점 지배하고 있다고 한다.

연구자들은 이러한 인기 있는 오픈 소스 데이터셋, 예를 들어 ImageNet,에 대한 의존도가 실제로 praktik, 윤리적, 그리고 정치적인 문제를引き起こ을 수 있다고 주장한다.

연구자들의 발견 – 페이스북이 주도하는 커뮤니티 프로젝트 Papers With Code(PWC)에서 나온 핵심 데이터를 기반으로 – 는 널리 사용되는 데이터셋이 소수의 엘리트 기관에서 도입된다는 것을 보여주며, 이러한 ‘통합’은 최근 몇 년간 80%로 증가했다고 한다.

‘우리는 전 세계적으로 데이터셋 사용에 대한 불평등이 증가하고 있으며, 우리 샘플의 43,140개 중 50% 이상의 데이터셋 사용이 12개의 엘리트 기관, 주로 서양 기관에서 도입된 데이터셋과 관련이 있다고发现했다.’

 지난 10년 동안의 비과제 특정 데이터셋 사용 지도. 포함 기준은 기관 또는 회사에서 알려진 사용량의 50% 이상을 차지하는 경우이다. 오른쪽에는 기관과 데이터셋에 대한 지니 계수 가 표시되어 있다. 출처: https://arxiv.org/pdf/2112.01716.pdf

지난 10년 동안의 비과제 특정 데이터셋 사용 지도. 포함 기준은 기관 또는 회사에서 알려진 사용량의 50% 이상을 차지하는 경우이다. 오른쪽에는 기관과 데이터셋에 대한 지니 계수 가 표시되어 있다. 출처: https://arxiv.org/pdf/2112.01716.pdf

주도적인 기관에는 스탠퍼드 대학교, 마이크로소프트, 프린스턴 대학교, 페이스북, 구글, 막스 플랑크 연구소, 그리고 AT&T가 있다. 상위 10개의 데이터셋 소스 중 4개는 기업 기관이다.

이 논문은 이러한 엘리트 데이터셋의 사용이 증가하는 것이 ‘과학에서의 불평등의 수단’이라고 특징지으며, 연구 팀이 커뮤니티의 승인을 얻으려는 동기가 더 강하기 때문에, 새로운 데이터셋을 생성하는 것보다 기존의 벤치마크 데이터셋을 사용하여 상태-of-the-아트(SOTA) 결과를 얻으려는 동기가 더 강하다고 주장한다.

이 경우, 논문은 менее 자원 있는 기관이나 팀에서는 자신의 데이터셋을 생성하는 것이 금지적으로 비싼 일이라고 인정한다.

‘기초적인 과학적 타당성이 SOTA 벤치마크에 의해 부여되는 것은 일반적으로 연구자들이 널리 인식되는 데이터셋에서 경쟁할 수 있다는 사회적 신뢰를 얻는 것과 혼동된다. ‘

‘우리는 이러한 역학이 “마태 효과” (즉, “부유한 사람은 더 부유해지고 가난한 사람은 더 가난해진다”)를 생성하여, 성공적인 벤치마크와 엘리트 기관이 소개하는 것이 분야 내에서 과도한 지위를 얻는다고 주장한다.’

논문기계 학습 연구에서 데이터셋의 생애: 줄인, 재사용, 재활용이라는 제목을 가지고 있으며, UCLA의 Bernard Koch와 Jacob G. Foster, 그리고 구글 리서치의 Emily Denton과 Alex Hanna가 공동으로 작성했다.

이 연구는 문서화된 통합 경향과 관련된 여러 문제를 제기하며, 오픈 리뷰에서 일반적인 승인을 얻었다. 한 리뷰어는 NeurIPS 2021에서 이 연구가 ‘기계 학습 연구에 참여하는 모든 사람에게 매우 관련성이 있다’고 말하며, 대학 강의에서 필수적인 읽을거리로 포함될 것이라고 예상했다.

필요성에서 부패까지

저자들은 현재의 ‘벤치마크를 이겨라’ 문화가 30년 전 Expert Systems에 대한 비즈니스 열정이 감소한 후, 기계 학습 연구에 대한 관심과 투자가 감소한 후, 객관적인 평가 도구의 부족을 해결하기 위한 방법으로 등장했다고 주장한다:

‘벤치마크는 일반적으로 특정 작업을 위한 데이터셋과 평가를 위한 양적 지표를 공식화한다. 이 관행은 원래 기계 학습 연구에 정부 후원자에 의해 도입되었으며, 그들은 보조금에 대한 가치를 더 정확하게 평가하기를 원했다.’

이 논문은 초기에 표준화의 비공식적인 문화가 가져온 장점(참여 장벽 감소, 일관된 지표, 더 민첩한 개발 기회 등)이 점점 더 많은 단점으로 대체되고 있다고 주장한다.

저자들은 연구 커뮤니티가 기존 벤치마크 데이터셋을 사용할 수 없는 경우에는 새로운 문제를 제기하지 않는다고 주장한다.

그들은 또한 이러한 소수의 ‘골드’ 데이터셋에 대한 맹목적인 순응이 연구자들이 결과를 얻도록 동기를 부여한다는 것을 지적하며, 이러한 결과는 특정 데이터셋에만 적합하고 실제 데이터, 새로운 학술적 또는 원래 데이터셋, 또는 ‘골드 표준’의 다른 데이터셋에서 잘 작동하지 않을 수 있다고 주장한다.

‘EXISTING 데이터셋에 대한 과도한 연구로 인해 overfitting이 발생할 수 있으며, 이는 실제 데이터에서 잘 작동하지 않을 수 있다. 따라서 평가의 다양한 형태를 다iversifying 하는 것이 특히 중요하다.’

컴퓨터 비전 연구에서의 정부 영향

이 논문에 따르면, 컴퓨터 비전 연구는 다른 분야보다 더욱 이러한 현상에 의해 영향을 받으며, 저자들은 자연어 처리(NLP) 연구가 덜 영향을 받는다고 주장한다. 저자들은 이것이 NLP 커뮤니티가 더 일관적이고 크기가 크고, NLP 데이터셋이 더 접근하기 쉽고 쉽게 구축할 수 있으며, 또한 더 작고 데이터 수집에 대한 자원 투자가 적기 때문이라고 주장한다.

컴퓨터 비전, 특히 얼굴 인식(FR) 데이터셋에서, 저자들은 기업, 국가, 그리고 사적 관심이 종종 충돌한다고 주장한다:

‘기업과 정부 기관은 프라이버시(예: 감시)와 관련된 목표를 가지고 있으며, 이러한 우선순위의 가중치는 학계 또는 AI의 더 넓은 사회적 이해관계자와 다를 수 있다.’

얼굴 인식 작업에서, 연구자들은 순수한 학술 데이터셋의 발생이 평균에 비해 급격히 감소한다고 발견했다:

‘8개의 데이터셋 중 4개(33.69%의 총 사용량)는 기업, 미국 군대, 또는 중국 정부에 의해 전적으로 자금을 지원받았다(MS-Celeb-1M, CASIA-Webface, IJB-A, VggFace2). MS-Celeb-1M은 다양한 이해관계자의 프라이버시 값에 대한 논란으로 인해 최종적으로 撤回되었다.’

이미지 생성과 얼굴 인식 연구 커뮤니티에서 사용되는 상위 데이터셋.

이미지 생성과 얼굴 인식 연구 커뮤니티에서 사용되는 상위 데이터셋.

위 그래프에서, 저자들은 또한 비교적 최근의 이미지 생성(또는 이미지 합성) 분야가 기존의 더 오래된 데이터셋에 크게 의존하고 있으며, 이러한 데이터셋은 이 용도로 설계되지 않았다고 주장한다.

사실, 이 논문은 데이터셋이 의도된 목적에서 멀어지는 경향이 증가하고 있으며, 새로운 또는 외곽 연구 분야의 요구에 대한 적합성을 질문하며, 예산 제약이 연구자의雄心을 더 좁은 범위로 제한할 수 있다고 주장한다.

‘우리의 발견은 또한 데이터셋이 종종 다른 작업 커뮤니티로 이동한다는 것을 나타낸다. 가장 극단적인 경우, 일부 작업 커뮤니티에서 사용되는 벤치마크 데이터셋의 대부분은 다른 작업을 위해 생성되었다.’

기계 학습의 유명인사(예를 들어 Andrew Ng)는 최근 몇 년 동안 더 다양한 데이터셋과 데이터셋의 큐레이션을 요구해 왔으며, 저자들은 이러한 의견을 지지하지만, 이러한 노력은 현재의 문화가 기존 데이터셋과 SOTA 결과에 대한 의존도로 인해 잠재적으로 손상될 수 있다고 주장한다:

‘우리의 연구는 단순히 기계 학습 연구자들이 더 많은 데이터셋을 개발하도록 요구하고, 데이터셋 개발이 가치 있게 되고 보상받을 수 있도록 인센티브 구조를 변경하는 것이 데이터셋 사용과 최종적으로 기계 학습 연구의 방향을 설정하는 관점을 다iversifying 하는 데 충분하지 않을 수 있다고 시사한다. ‘

‘데이터셋 개발을 incentivizing 하는 것 외에도, 우리는 데이터셋 개발을 위해 중요하지만 자원에 제한된 기관에서 사람들에게 중요한 자금을 지원하는 정책 개입을 주장한다. 이것은 현대적인 기계 학습 방법을 평가하는 데 사용되는 벤치마크 데이터셋을 사회적, 문화적으로 다iversifying 할 것이다.’

 

2021년 12월 6일, 오후 4시 49분 GMT+2 – 헤드라인의 소유격을 수정함. – MA

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai