Góc nhìn Anderson

Những hạn chế của Amazon Mechanical Turk có thể đe dọa đến các hệ thống sinh ngôn ngữ tự nhiên

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Một nghiên cứu mới từ Đại học Massachusetts Amherst đã so sánh giáo viên tiếng Anh với công nhân được thuê ngoài tại Amazon Mechanical Turk trong việc đánh giá đầu ra của các hệ thống sinh ngôn ngữ tự nhiên (NLG), kết luận rằng các tiêu chuẩn lỏng lẻo và việc “lừa đảo” các nhiệm vụ được đánh giá cao trong số công nhân AMT có thể cản trở sự phát triển của lĩnh vực này.

Báo cáo này đưa ra một số kết luận đáng phê phán về mức độ mà việc thuê ngoài các nhiệm vụ đánh giá NLG mở với chi phí thấp có thể dẫn đến kết quả và thuật toán kém chất lượng trong lĩnh vực này.

Các nhà nghiên cứu cũng đã biên soạn một danh sách 45 bài báo về sinh văn bản mở, nơi nghiên cứu đã sử dụng AMT, và phát hiện rằng “đa số” không báo cáo các chi tiết quan trọng về việc sử dụng dịch vụ đám đông của Amazon, khiến việc tái tạo kết quả của các bài báo trở nên khó khăn.

Lao động nhà xưởng

Báo cáo chỉ trích cả bản chất nhà xưởng của Amazon Mechanical Turk và các dự án học thuật (có thể bị hạn chế bởi ngân sách) đã cho AMT thêm uy tín bằng cách sử dụng (và trích dẫn) nó như một nguồn tài nguyên nghiên cứu hợp lệ và nhất quán. Các tác giả lưu ý:

‘Mặc dù AMT là một giải pháp tiện lợi và tiết kiệm, chúng tôi quan sát thấy rằng sự biến động lớn giữa các công nhân, hiệu chỉnh kém và các nhiệm vụ đòi hỏi nhận thức cao có thể dẫn các nhà nghiên cứu đến những kết luận khoa học sai lầm (ví dụ, rằng văn bản viết bằng tay là “kém hơn” so với GPT-2).’

Báo cáo đổ lỗi cho hệ thống chứ không phải người chơi, với các nhà nghiên cứu quan sát:

‘[Công nhân] thường bị trả lương thấp cho lao động của họ, điều này gây hại cho chất lượng nghiên cứu và quan trọng hơn, khả năng của những công nhân này để kiếm được thu nhập đầy đủ.’

Bài báo này, có tiêu đề Những nguy hiểm khi sử dụng Mechanical Turk để đánh giá sinh văn bản mở, kết luận thêm rằng ‘người đánh giá chuyên môn’ như giáo viên ngôn ngữ và nhà ngôn ngữ học nên được sử dụng để đánh giá nội dung NLG mở, thậm chí nếu AMT rẻ hơn.

Nhiệm vụ thử nghiệm

Khi so sánh hiệu suất của AMT với các độc giả chuyên nghiệp ít bị giới hạn thời gian, các nhà nghiên cứu đã chi 144 đô la cho dịch vụ AMT thực sự được sử dụng trong các thử nghiệm so sánh (mặc dù nhiều hơn đã được chi cho ‘kết quả không thể sử dụng’ – xem dưới đây), yêu cầu các ‘Turks’ ngẫu nhiên đánh giá một trong 200 văn bản, chia đều giữa nội dung văn bản do con người tạo và văn bản được tạo tự động.

Việc yêu cầu các giáo viên chuyên nghiệp thực hiện công việc tương tự có chi phí 187,50 đô la, và xác nhận hiệu suất vượt trội của họ (so với công nhân AMT) bằng cách thuê các nhà thầu Upwork để sao chép các nhiệm vụ có chi phí thêm 262,50 đô la.

Mỗi nhiệm vụ bao gồm bốn tiêu chí đánh giá: ngữ pháp (‘Văn bản của đoạn văn có chính xác về mặt ngữ pháp không?’); tính nhất quán (‘Các câu trong đoạn văn phù hợp với nhau như thế nào?’); khả năng thích hợp (‘Bạn thích đoạn văn không?’); và sự liên quan (‘Đoạn văn có liên quan đến lời nhắc không?’).

Sinh văn bản

Để có được tài liệu NLG cho các thử nghiệm, các nhà nghiên cứu đã sử dụng bộ dữ liệu Hierarchical Neural Story Generation năm 2018 của Facebook AI Research, bao gồm 303.358 câu chuyện tiếng Anh do người dùng tạo trên subreddit r/WritingPrompts nổi tiếng (15 triệu người dùng), nơi các câu chuyện của người đăng ký được ‘gieo’ bởi các ‘lời nhắc’ một câu trong cách tương tự như các phương pháp hiện tại trong sinh hình ảnh từ văn bản – và, tất nhiên, trong các hệ thống NLG mở.

200 lời nhắc từ bộ dữ liệu đã được chọn ngẫu nhiên và truyền qua một mô hình GPT-2 cỡ trung sử dụng thư viện Hugging-Face Transformers. Do đó, hai tập kết quả đã được thu được từ cùng một lời nhắc: các bài luận dài do con người viết từ người dùng Reddit và văn bản được tạo tự động bằng GPT-2.

Để ngăn chặn các công nhân AMT đánh giá cùng một câu chuyện nhiều lần, ba đánh giá của công nhân AMT đã được yêu cầu cho mỗi ví dụ. Cùng với các thí nghiệm liên quan đến khả năng tiếng Anh của công nhân (xem cuối bài) và loại bỏ kết quả từ các công nhân có nỗ lực thấp (xem ‘Thời gian ngắn’ dưới đây), điều này đã tăng tổng chi phí cho AMT lên khoảng 1.500 đô la.

Để tạo ra một sân chơi bình đẳng, tất cả các thử nghiệm đều được thực hiện vào các ngày trong tuần từ 11:00-11:30 sáng PST.

Kết quả và Kết luận

Nghiên cứu rộng lớn này bao gồm nhiều điểm, nhưng các điểm chính như sau:

Thời gian ngắn

Bài báo cho thấy rằng thời gian nhiệm vụ trung bình được báo cáo chính thức của Amazon là 360 giây đã giảm xuống còn thời gian làm việc thực tế chỉ là 22 giây, và thời gian làm việc trung vị chỉ là 13 giây – một phần tư thời gian của công nhân nhanh nhất giáo viên tiếng Anh sao chép nhiệm vụ.

Từ Ngày 2 của nghiên cứu: các công nhân cá nhân (màu cam) đã dành ít thời gian hơn để đánh giá mỗi nhiệm vụ so với các giáo viên được trả lương cao hơn, và (sau đó) các nhà thầu Upwork được trả lương cao hơn.

Từ Ngày 2 của nghiên cứu: các công nhân cá nhân (màu cam) đã dành ít thời gian hơn để đánh giá mỗi nhiệm vụ so với các giáo viên được trả lương cao hơn, và (sau đó) các nhà thầu Upwork được trả lương cao hơn. Nguồn: https://arxiv.org/pdf/2109.06835.pdf

Do AMT không đặt giới hạn về số lượng Nhiệm vụ Trí tuệ Con người (HIT) mà một công nhân cá nhân có thể thực hiện, các ‘người chơi lớn’ của AMT đã xuất hiện, với danh tiếng (lợi nhuận) về việc hoàn thành số lượng nhiệm vụ cao trong mỗi thí nghiệm. Để bù đắp cho các HIT được chấp nhận bởi cùng một công nhân, các nhà nghiên cứu đã đo thời gian giữa các HIT được gửi liên tiếp, so sánh thời gian bắt đầu và kết thúc của mỗi HIT. Theo cách này, sự thiếu hụt giữa thời gian làm việc được báo cáo của AMT và thời gian thực tế dành cho nhiệm vụ đã trở nên rõ ràng.

Do công việc này không thể được thực hiện trong các khung thời gian giảm này, các nhà nghiên cứu đã phải bù đắp cho điều này:

‘Vì không thể đọc cẩn thận một đoạn văn và đánh giá tất cả bốn thuộc tính trong thời gian ngắn như 13 giây, chúng tôi đo lường tác động đến xếp hạng trung bình khi lọc ra các công nhân dành quá ít thời gian cho mỗi HIT… Cụ thể, chúng tôi loại bỏ các đánh giá từ các công nhân có thời gian trung vị dưới 40 giây (đây là một tiêu chuẩn thấp), và tìm thấy rằng trung bình khoảng 42% xếp hạng của chúng tôi đã được lọc ra (dao động từ 20%-72% trên tất cả các thí nghiệm).’

Bài báo cho rằng thời gian làm việc thực tế không được báo cáo trong AMT là ‘một vấn đề lớn’ thường bị các nhà nghiên cứu sử dụng dịch vụ này bỏ qua.

Cần hướng dẫn

Các phát hiện còn cho thấy rằng các công nhân AMT không thể phân biệt đáng tin cậy giữa văn bản được viết bởi con người và văn bản được viết bởi máy, trừ khi họ nhìn thấy cả hai văn bản cạnh nhau, điều này sẽ làm tổn thương một kịch bản đánh giá điển hình (trong đó người đọc nên có thể đưa ra phán quyết dựa trên một mẫu văn bản duy nhất, ‘thực’ hoặc được tạo tự động).

Chấp nhận tự nhiên đối với văn bản nhân tạo chất lượng thấp

Các công nhân AMT liên tục xếp hạng văn bản nhân tạo chất lượng thấp dựa trên GPT tương đương với văn bản chất lượng cao, nhất quán, được viết bởi con người, trái ngược với các giáo viên tiếng Anh, những người có thể dễ dàng phân biệt sự khác biệt về chất lượng.

Không có thời gian chuẩn bị, không có ngữ cảnh

Nhập vào tâm trạng đúng cho một nhiệm vụ trừu tượng như đánh giá tính xác thực không đến tự nhiên; các giáo viên tiếng Anh cần 20 nhiệm vụ để hiệu chỉnh cảm nhận của họ với môi trường đánh giá, trong khi các công nhân AMT thường không nhận được ‘thời gian định hướng’ nào, làm giảm chất lượng đầu vào của họ.

Lừa đảo hệ thống

Báo cáo cho rằng tổng thời gian các công nhân AMT dành cho các nhiệm vụ cá nhân bị lạm phát bởi các công nhân chấp nhận nhiều nhiệm vụ đồng thời và chạy qua các nhiệm vụ trong các tab khác nhau trên trình duyệt của họ, thay vì tập trung vào một nhiệm vụ trong thời gian nhiệm vụ được ghi lại.

Quốc gia xuất xứ quan trọng

Cài đặt mặc định của AMT không lọc công nhân theo quốc gia xuất xứ, và báo cáo lưu ý công việc trước đó cho thấy rằng các công nhân AMT sử dụng VPN để làm việc xung quanh các hạn chế địa lý, cho phép người nói không bản địa trình bày như người nói bản địa (trong một hệ thống mà, có lẽ khá ngây thơ, đồng nhất ngôn ngữ mẹ đẻ của một công nhân với vị trí địa lý dựa trên IP của họ).

Do đó, các nhà nghiên cứu đã chạy lại các thử nghiệm đánh giá trên AMT với các bộ lọc hạn chế người tham gia tiềm năng chỉ ở không – các quốc gia nói tiếng Anh, và phát hiện rằng ‘công nhân từ các quốc gia không nói tiếng Anh đánh giá tính nhất quán, tính liên quan và ngữ pháp… thấp hơn đáng kể so với công nhân đủ tiêu chuẩn từ các quốc gia nói tiếng Anh’.

Báo cáo kết luận:

‘[Người đánh giá chuyên môn] như nhà ngôn ngữ học hoặc giáo viên ngôn ngữ nên được sử dụng khi có thể, vì họ đã được đào tạo để đánh giá văn bản viết, và điều này không tốn kém hơn nhiều…’.

 

Được xuất bản vào ngày 16 tháng 9 năm 2021Được cập nhật vào ngày 18 tháng 12 năm 2021: Thêm thẻ

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai