Anderson의 관점

AI의 미래를 결정하는 ‘보이지 않는’ 그리고 종종 불행한 노동력

mm
Unite.AI를 Google의 선호 소스에 추가

구글 연구팀이 주도한 두 개의 새로운 보고서에서는 기계 학습 시스템의 기초 진실을 만들기 위해 저렴하고 종종 권한이 없는 글로벌 임시 노동자 풀에 의존하는 현재의 추세는 주요한 하위 결과를 초래할 수 있다고 우려를 표명합니다.

다양한 결론 중에서, 구글 연구에서는 크라우드 워커들의 자신의 편향이 기초 진실을 기반으로 하는 AI 시스템에 내재될 가능성이 있으며, 크라우드 워킹 플랫폼에서 광범위한 불공정 노동 관행은 응답의 품질을 저하할 수 있으며, 현재의 ‘합의’ 시스템은 실제로 최고의 응답이나 가장 잘 알려진 응답을 ‘버릴’ 수 있다고 주장합니다.

구글 연구팀의 첫 번째 논문은 5명의 구글 연구자에 의해 작성되었으며, Whose Ground Truth? Accounting for Individual and Collective Identities Underlying Dataset Annotation라는 제목을 가지고 있습니다. 두 번째 논문은 뉴욕의 시러큐스 대학교의 2명의 연구자에 의해 작성되었으며, The Origin and Value of Disagreement Among Data Labelers: A Case Study of Individual Differences in Hate Speech Annotation라는 제목을 가지고 있습니다.

구글 논문에서는 크라우드 워커들이 실험 과제에 응답하는 방식에 영향을 미칠 수 있는 다양한 제약 조건하에서 종종 작동한다는 것을 주목합니다.

예를 들어, 아마존 메카니컬 터크의 현재 정책은 요청자(과제를 제공하는 사람)가 책임 없이 주석자의 작업을 거부할 수 있도록 허용합니다:

‘크라우드 워커の大多数 (94%)는 거부되거나 비용이 지불되지 않은 작업을 경험했습니다. 그러나 요청자는 데이터를 수신하는 경우에 관계없이 데이터에 대한 모든 권리를 유지합니다. 로버츠(2016)는 이 시스템을 “임금 도둑”을 가능하게 하는 시스템으로 설명합니다.

‘さらに, 작업을 거부하고 급여를 지급하지 않는 것은 불명확한 지침과 의의 있는 피드백 채널의 부족으로 인해 고통스럽습니다. 많은 크라우드 워커는 불량한 의사소통이 그들의 작업에 부정적인 영향을 미친다고 보고합니다.’

저자들은 연구자들이 데이터셋을 개발하기 위해 아웃소싱 서비스를 사용할 때 크라우드 워킹 플랫폼이 노동자를 어떻게 대우하는지 고려해야 한다고 주장합니다. 또한 미국에서 크라우드 워커는 ‘독립 계약자’로 분류되며, 따라서 최소 임금을 규정하는 공정 노동 표준법에 의해 규제되지 않습니다.

문맥이 중요하다

또한 논문에서는 주석 작업을 위한 글로벌 임시 노동의 사용을 비판하며, 주석자의 배경을 고려하지 않는다는 점을 지적합니다.

예를 들어, 과제 질문이 18-57세의 3명의 동의하는 남성과 29세의 불일치하는 여성 사이에서 임의로 분배되는 경우, 남성의 판단이 승리합니다. 그러나 연구자들이 주석자의 자격을 주의 깊게 고려하는 경우는 드뭅니다.

구글 연구자들은 다음과 같이 말합니다:

‘크라우드소싱 응답에서 “하나의 진실”이라는 개념은 신화입니다. 주석자 간의 불일치는 실제로 유용한 신호를 제공할 수 있습니다. 또한 많은 크라우드소싱 주석자 풀은 사회인구학적으로 왜곡되어 있기 때문에 데이터셋에 대표되는 인구와 직면하는 인구에 대한 영향을 미칩니다.’

‘주석자 인구통계학적 특성의 편향을 고려하는 것은 데이터셋을 문맥화하고 책임 있는 하위 사용을 보장하기 위해 중요합니다. 간단히 말해서, 노동자의 사회문화적 배경을 인정하고 고려하는 데 가치가 있습니다. 데이터 품질과 사회적 영향의 관점에서 모두 그렇습니다.’

뜨거운 주제에 대한 중립적인 의견은 없다

구글 논문에서는 또한 연구자들이 주석자의 삶의 경험이나 철학적 성향을 고려하지 않는다는 점을 우려합니다:

‘일부 과제는 객관적인 질문을 제기하며 정답이 있습니다(이미지에 인간의 얼굴이 있습니까?). 그러나 종종 데이터셋은 상대적으로 주관적인 과제에 대한 판단을 캡처하려고 시도하며, 보편적으로 올바른 답이 없습니다(이 텍스트는 공격적입니까?). 주석자의 주관적인 판단을 의존하는지에 대해 의도적으로 고려해야 합니다.’

시러큐스 논문에서는 또한 더 범주적인 질문(이 사진에 고양이가 있습니까?)과 공격적인 언어에 대한 질문을 비교합니다:

‘사회적 현실의 복잡성을 고려할 때, 사람들의 공격성에 대한 인식은 크게 다릅니다. 그들의 레이블은 자신의 인식에 기반합니다.’

시러큐스 연구자들은 다음과 같이 결론을 내립니다:

‘이 발견은 공격적인 언어에 대한 레이블링 일관성을 달성하기 위한 노력은 레이블러의 배경과 성격이 다르기 때문에 결코 완전히 성공하지 못할 수 있습니다.’

판결을 내리는 사람이 편향될 수도 있다

시러큐스 논문에서는 또한 수동적인 개입(또는 자동화된 정책, 또한 인간에 의해 결정됨)으로 합의 투표의 ‘승자’를 결정하는 과정도 검토되어야 한다고 주장합니다.

‘공동체의 관리자는 공동체의 게시글과 사용자에 대한 운명을 결정할 수 있습니다. 관리자의 결정은 공동체 구성원과 청중에게 전달되는 콘텐츠와 공동체의 토론 경험에 영향을 미칩니다.’

‘공동체 구성원과 동일한 인구통계학적 동질성을 가진 공동체 관리자를 가정할 때, 콘텐츠를 평가하는 데 사용되는 정신적 스키마는 다른 공동체 구성원의 그것과 일치할 수 있습니다.’

구글 연구자들은 다음과 같이 제안합니다:

‘주석자 간의 불일치는 과제에 대한 유용한 세부사항을 내포할 수 있습니다. 데이터셋에 불일치와 관련된 메타데이터를 포함하는 것을 제안합니다.’

주석자 풀을 큐레이팅

이 모든 것은 주석자 풀을 다루는 연구 프로젝트에 예산이 있다는 가정하에 이루어집니다. 많은 경우에 연구자들은 더 저렴하게 주석자 풀을 ‘큐레이팅’하려고 시도합니다.

구글 논문에서는 주석자와의 확장된 의사소통 프레임워크를 설정하는 것이 앞으로 나아갈 수 있는 방향일 수 있다고 주장합니다.

아웃소싱 데이터 레이블링의 ‘사람들을 기쁘게 하는’ 사람들

아마존 메카니컬 터크의 경우, 사용 가능한 노동력이 저임금, 과도한 경쟁, 그리고 희박한 경력 전망으로 인해 동기를 부여받지 못합니다.

‘대안적 개념화의 확산과 단순한 주석 방법의 광범위한 사용은 공격적인 언어에 대한 연구의 진행을 방해하고 있습니다. 예를 들어, 로스 등은 트위터의 공격적인 언어 정의를 주석자에게 보여주면 그들의 의견을 부분적으로 정의와 일치시킵니다. 이 재정렬은 주석의 낮은 일관성을 초래합니다.’

* 논문의 인라인 인용을 하이퍼링크로 변환한 것입니다.

2021년 12월 13일 게시 – 2021년 12월 18일 업데이트: 태그 추가

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai