Anderson의 관점
아마존 메카니컬 터크의 약점은 자연어 생성 시스템을 위협할 수 있다

매사추세츠 대학교 암허스트의 새로운 연구는 영어 교사와 아마존 메카니컬 터크의 크라우드소싱 된 노동자를 비교하여 자연어 생성(NLG) 시스템의 출력을 평가했습니다. 연구 결과는 메카니컬 터크의 느슨한 표준과 노동자들의 과제를 게임하는 방식이 이 분야의 발전에 방해가 될 수 있다고 결론지었습니다.
이 보고서는 메카니컬 터크의 산업 규모의 저렴한 아웃소싱이 열린 NLG 평가 과제로 인해 열등한 결과와 알고리즘으로 이어질 수 있다고 비판합니다.
연구자들은 또한 45개의 논문을 조사하여 메카니컬 터크를 사용하여 열린 텍스트 생성을 수행한 연구에서 대부분의 경우 중요한 세부 사항을 보고하지 않는다는 것을 발견했습니다. 이는 연구 결과를 재현하는 것을 어렵게 만들었습니다.
스웨트샵 노동
이 보고서는 메카니컬 터크의 스웨트샵 노동과 이를 사용하여 연구를 수행하는 학술 프로젝트를 비판합니다. 연구자들은 다음과 같이 말합니다:
‘메카니컬 터크는 편리하고 저렴한 솔루션이지만, 우리는 높은 노동자 간의 분산, 나쁨한 캘리브레이션, 그리고 인지적으로 요구되는 과제가 연구자들이 잘못된 과학적 결론을 내릴 수 있음을 관찰합니다. 예를 들어, 인간이 작성한 텍스트가 GPT-2의 텍스트보다 “더 나쁨”이라는 결론을 내릴 수 있습니다.’
연구자들은 노동자들을 비난하는 대신 시스템을 비난합니다. 연구자들은 다음과 같이 말합니다:
‘크라우드 노동자들은 자주 저렴한 임금을 받기 때문에, 이는 연구의 질과 노동자의 생활을 유지하는 능력 모두에 해를 끼칩니다.’
이 보고서는 또한 전문 평가자(예: 언어 교사 또는 언어학자)가 열린 NLG 콘텐츠를 평가하는 데 사용되어야 한다고 주장합니다.
테스트 과제
연구자들은 메카니컬 터크의 성능을 전문가 평가자와 비교하기 위해 200개의 텍스트를 평가하도록 요청했습니다. 각 과제는 4개의 평가 기준을 포함했습니다: 문법, 일관성, 호감도, 관련성.
텍스트 생성
연구자들은 텍스트 생성을 위해 페이스북 AI 연구소의 2018년 계층적 신경 스토리 생성 데이터셋을 사용했습니다. 이 데이터셋은 303,358개의 영어 스토리로 구성되어 있으며, Reddit의 r/writingprompts 커뮤니티에서 사용자들이 생성했습니다.
200개의 프롬프트를 무작위로 선택하여 중간 크기의 GPT-2 모델을 사용하여 텍스트를 생성했습니다. 이를 통해 인간이 작성한 텍스트와 GPT-2가 생성한 텍스트를 비교할 수 있었습니다.
결과와 결론
이 연구는 많은 내용을 다루고 있지만, 주요 내용은 다음과 같습니다:
짧은 시간
이 연구는 메카니컬 터크의 공식 보고된 평균 과제 시간이 360초지만, 실제 작업 시간은 22초, 중간 작업 시간은 13초로 나타났습니다. 이는 전문가 평가자가 동일한 과제를 수행하는 시간의 4분의 1밖에 되지 않습니다.

연구의 2일차: 개별 노동자(오렌지색)는 더 잘 지불되는 교사와 업워크 계약자보다 각 과제를 평가하는 데 훨씬 더 적은 시간을 보냅니다. 출처: https://arxiv.org/pdf/2109.06835.pdf
메카니컬 터크는 노동자들이 여러 과제를 동시에 수행할 수 있기 때문에, 일부 노동자들은 과제를 빠르게 완료하여 더 많은 과제를 수행할 수 있습니다. 이를 위해 연구자들은 과제 사이의 시간을 측정하여 실제 작업 시간을 계산했습니다.
핸드 홀딩이 필요한
이 연구는 메카니컬 터크 노동자들이 인간이 작성한 텍스트와 기계가 생성한 텍스트를 구별하는 데 어려움을 겪을 수 있음을 발견했습니다. 이는 평가자가 두 텍스트를 함께 볼 수 있을 때만 가능합니다.
낮은 품질의 인공 텍스트에 대한 비난
메카니컬 터크 노동자들은 낮은 품질의 GPT 기반 인공 텍스트를 인간이 작성한 높은 품질의 텍스트와 동일하게 평가했습니다. 이는 전문가 평가자와는 대조되는 결과입니다.
준비 시간이 없고, 맥락이 없음
이 연구는 평가자의 사고 방식을 준비하는 데 시간이 필요하다는 것을 발견했습니다. 전문가 평가자는 20개의 과제를 완료하여 평가 환경에 익숙해질 수 있었습니다. 그러나 메카니컬 터크 노동자는 이러한 준비 시간이 없습니다.
시스템을 게임하는
이 보고서는 메카니컬 터크 노동자들이 과제를 게임하는 방식이 실제 작업 시간을 늘릴 수 있음을 주장합니다. 노동자들은 여러 과제를 동시에 수행하여 더 많은 과제를 완료할 수 있습니다.
국가 출신이 중요함
이 연구는 메카니컬 터크의 기본 설정이 노동자를 국가 출신으로 필터링하지 않는다는 것을 발견했습니다. 연구자들은 이전 연구에서 메카니컬 터크 노동자들이 VPN을 사용하여 지리적 제한을 우회할 수 있음을 발견했습니다.
연구자들은 평가 테스트를 메카니컬 터크에서 다시 실행하여 비영어권 국가에서 온 노동자만을 대상으로 했습니다. 결과는 비영어권 국가에서 온 노동자가 일관성, 관련성, 문법을 낮게 평가한다는 것을 보여주었습니다.
이 보고서는 다음과 같이 결론지었습니다:
‘전문가 평가자(예: 언어학자 또는 언어 교사)가 가능하면 언제나 사용되어야 합니다. 이미 작성된 텍스트를 평가하는 데 훈련을 받았으며, 비용이 많이 들지 않습니다…’
2021년 9월 16일 게시 – 2021년 12월 18일 업데이트됨: 태그 추가












