มุมมองของ Anderson
ข้อบกพร่องของ Amazon Mechanical Turk อาจเป็นอันตรายต่อระบบการสร้างภาษาธรรมชาติ

การศึกษาใหม่จาก University of Massachusetts Amherst ได้ทำการเปรียบเทียบระหว่างครูสอนภาษาอังกฤษและคนงานที่ได้รับการว่าจ้างจาก Amazon Mechanical Turk ในการประเมินผลลัพธ์ของระบบการสร้างภาษาธรรมชาติ (NLG) โดยสรุปว่ามาตรฐานที่ไม่เข้มงวดและพฤติกรรม “การหลอกลวง” ของคนงาน AMT อาจเป็นอุปสรรคต่อการพัฒนาในภาคส่วนนี้
รายงานนี้ได้ข้อสรุปที่น่าผิดหวังหลายประการเกี่ยวกับระดับที่การบริการ AMT ที่ถูกและไม่มีการควบคุมอาจนำไปสู่ผลลัพธ์และอัลกอริทึมที่ไม่ดีในภาคส่วนนี้
นักวิจัยยังได้รวบรวมรายการ 45 บทความเกี่ยวกับการสร้างข้อความแบบเปิดโดยใช้ AMT และพบว่า “ส่วนใหญ่” ไม่ได้รายงานรายละเอียดสำคัญเกี่ยวกับการใช้บริการของ Amazon ทำให้ยากต่อการทำซ้ำผลลัพธ์ของบทความเหล่านั้น
แรงงานในโรงงาน
รายงานนี้วิพากษ์วิจารณ์ทั้งลักษณะของโรงงานใน Amazon Mechanical Turk และโครงการวิจัยทางวิชาการที่มีงบประมาณจำกัดซึ่งให้ความน่าเชื่อถือแก่ AMT โดยใช้บริการนี้เป็นทรัพยากรวิจัยที่ถูกต้องและสม่ำเสมอ
ผู้เขียนรายงานระบุว่า: ‘ในขณะที่ AMT เป็นคำตอบที่สะดวกและราคาไม่แพง แต่เราพบว่าความแปรผันระหว่างคนงาน คุณภาพที่ไม่ดี และงานที่ต้องใช้ความสามารถในการคิดสามารถนำไปสู่ข้อสรุปทางวิทยาศาสตร์ที่ทำให้เข้าใจผิด (เช่น ว่าข้อความที่เขียนโดยมนุษย์ “แย่” กว่าข้อความที่สร้างโดย GPT-2)’
รายงานนี้โทษระบบมากกว่าผู้เล่น โดยนักวิจัยสังเกตเห็นว่า: ‘คนงานมักถูกจ่ายค่าต่ำสำหรับการทำงาน ซึ่งทำลายคุณภาพของการวิจัยและความสามารถของคนงานเหล่านี้ในการมีรายได้ที่เพียงพอ’
รายงาน นี้ ซึ่งมีชื่อเรื่องว่า อันตรายของการใช้ Mechanical Turk ในการประเมินข้อความแบบเปิด ยังสรุปว่า “ผู้ให้คะแนนผู้เชี่ยวชาญ” เช่น ครูสอนภาษาและนักภาษาศาสตร์ควรใช้ในการประเมินข้อความ NLG แบบเปิด แม้ว่าจะมีราคาแพงกว่า AMT ก็ตาม
งานทดสอบ
ในการเปรียบเทียบผลการทำงานของ AMT กับผู้อ่านมืออาชีพที่มีเวลาไม่จำกัด นักวิจัยได้ใช้จ่าย 144 ดอลลาร์สหรัฐฯ ในการบริการ AMT ที่ใช้ในการทดสอบ (แม้ว่าจะมีการใช้จ่ายมากกว่านั้นในการทดสอบที่ไม่สามารถใช้ได้) โดยขอให้ “คนงานที่มีรายได้น้อย” ประเมินข้อความ 200 ข้อความ ซึ่งแบ่งออกเป็นข้อความที่เขียนโดยมนุษย์และข้อความที่สร้างโดยเครื่องจักร
การให้ครูสอนภาษาที่มีเวลาไม่จำกัดทำหน้าที่เดียวกันใช้เงิน 187.50 ดอลลาร์สหรัฐฯ และยืนยันผลการทำงานที่ดีกว่าของครูสอนภาษาเมื่อเปรียบเทียบกับคนงาน AMT โดยการจ้างฟรีแลนซ์จาก Upwork เพื่อทำซ้ำงานใช้เงินเพิ่มอีก 262.50 ดอลลาร์สหรัฐฯ
แต่ละงานประกอบด้วยเกณฑ์การประเมิน 4 ประการ: ไวยากรณ์ (‘ข้อความนี้มีการเขียนไวยากรณ์ที่ถูกต้องหรือไม่?’); ความสอดคล้อง (‘ข้อความนี้มีความสอดคล้องหรือไม่?’); ความน่าสนใจ (‘ข้อความนี้น่าสนใจหรือไม่?’); และความเกี่ยวข้อง (‘ข้อความนี้เกี่ยวข้องกับหัวข้อหรือไม่?’)
การสร้างข้อความ
เพื่อให้ได้ข้อความ NLG สำหรับการทดสอบ นักวิจัยได้ใช้ข้อมูลจาก Facebook AI Research ในปี 2018 ซึ่งมีข้อความ 303,358 ข้อความที่เขียนโดยผู้ใช้บน subreddit r/WritingPrompts ซึ่งมีผู้ใช้มากกว่า 15 ล้านคน
ข้อความ 200 ข้อความถูกเลือกแบบสุ่มและผ่านโมเดล GPT-2 ขนาดกลางโดยใช้ไลบรารี Hugging-Face Transformers ดังนั้นจึงได้ผลลัพธ์ 2 ชุดจากข้อความเดียวกัน: ข้อความที่เขียนโดยมนุษย์และข้อความที่สร้างโดย GPT-2
ผลลัพธ์และข้อสรุป
การศึกษานี้ครอบคลุมหลายด้าน แต่ประเด็นหลักคือ:
เวลาสั้น
รายงานพบว่าเวลาทำงานเฉลี่ยที่รายงานโดย Amazon คือ 360 วินาที แต่เวลาทำงานจริงคือเพียง 22 วินาที และเวลาทำงานเฉลี่ยคือเพียง 13 วินาที ซึ่งเป็นหนึ่งในสี่ของเวลาที่ครูสอนภาษาที่เร็วที่สุดใช้ในการทำซ้ำงาน
เนื่องจากไม่สามารถทำงานได้ภายในเวลาที่ลดลงนี้ นักวิจัยจึงต้องชดเชย:
‘เนื่องจากไม่สามารถอ่านข้อความที่มีความยาวหนึ่ง段落และประเมินคุณสมบัติทั้ง 4 ประการในเวลาเพียง 13 วินาที เราจึงวัดผลกระทบต่อคะแนนเฉลี่ยเมื่อกรองคนงานที่ใช้เวลาต่องานน้อยเกินไป… โดยเฉพาะอย่างยิ่ง เราเอาคะแนนออกจากคนงานที่มีเวลาทำงานเฉลี่ยต่ำกว่า 40 วินาที (ซึ่งเป็นเกณฑ์ที่ต่ำ) และพบว่าคะแนนเฉลี่ยประมาณ 42% ของคะแนนของเราถูกกรองออก (ตั้งแต่ 20%-72% ในทุกการทดลอง)’
การดูแลอย่างใกล้ชิด
ผลการวิจัยยังชี้ให้เห็นว่าคนงาน AMT ไม่สามารถแยกแยะระหว่างข้อความที่เขียนโดยมนุษย์และข้อความที่สร้างโดยเครื่องจักรได้ เว้นแต่จะเห็นทั้งสองข้อความพร้อมกัน ซึ่งจะทำให้สถานการณ์การประเมินปกติเสียหาย (โดยที่ผู้อ่านควรสามารถตัดสินใจได้จากตัวอย่างข้อความเดียว “แท้” หรือ “เทียม”)
การยอมรับข้อความเทียมที่มีคุณภาพต่ำ
คนงาน AMT มักจะให้คะแนนข้อความเทียมที่มีคุณภาพต่ำเท่ากับข้อความที่เขียนโดยมนุษย์ที่มีคุณภาพสูง ในขณะที่ครูสอนภาษาสามารถแยกแยะความแตกต่างในคุณภาพได้อย่างง่ายดาย
ไม่มีเวลาเตรียมตัว ไม่มีบริบท
การเข้าสู่สถานการณ์ทางจิตที่เหมาะสมสำหรับการประเมินความถูกต้องไม่ได้มาโดยธรรมชาติ ครูสอนภาษาต้องการ 20 งานเพื่อปรับให้เข้ากับสภาพแวดล้อมในการประเมิน ในขณะที่คนงาน AMT ไม่ได้รับ “เวลาเตรียมตัว” เลย
การหลอกลวงระบบ
รายงานระบุว่าคนงาน AMT ใช้เวลาทำงานส่วนบุคคลที่ยาวกว่าโดยการรับงานหลายงานพร้อมกันและทำงานในแท็บต่างๆ ของเบราว์เซอร์แทนการมุ่งเน้นไปที่งานเดียวในระยะเวลาที่บันทึกไว้
ประเทศต้นทางมีความสำคัญ
การตั้งค่าเริ่มต้นของ AMT ไม่ได้กรองคนงานตามประเทศต้นทาง และรายงานระบุงานก่อนหน้านี้ที่ชี้ให้เห็นว่าคนงาน AMT ใช้ VPN เพื่อทำงานโดยรอบข้อจำกัดทางภูมิศาสตร์ ทำให้สามารถนำเสนอตัวมันเองเป็นคนพูดภาษาอังกฤษแบบเนทีฟ (ในระบบที่มีความเชื่อมั่นว่าภาษาแม่ของคนงานเทียบเท่ากับตำแหน่งทางภูมิศาสตร์ที่อิงจาก IP)
ดังนั้น นักวิจัยจึงทดสอบการประเมินบน AMT โดยมีการกรองคนงานที่ไม่ใช่คนพูดภาษาอังกฤษเป็นภาษาแม่ และพบว่า “คนงานจากประเทศที่ไม่ใช่ประเทศพูดภาษาอังกฤษให้คะแนนความสอดคล้อง ความเกี่ยวข้อง และไวยากรณ์… ต่ำกว่าคนงานที่มีคุณสมบัติเท่ากันจากประเทศพูดภาษาอังกฤษ”
รายงานสรุปว่า: ‘ผู้ให้คะแนนผู้เชี่ยวชาญ เช่น นักภาษาศาสตร์หรือครูสอนภาษา ควรใช้เมื่อใดก็ตามที่เป็นไปได้ เนื่องจากพวกเขาได้รับการฝึกอบรมมาแล้วในการประเมินข้อความที่เขียน และไม่แพงมาก…’
เผยแพร่เมื่อวันที่ 16 กันยายน 2021 – อัปเดตเมื่อวันที่ 18 ธันวาคม 2021: เพิ่มแท็ก












