Góc nhìn Anderson
Tạo ra Người Thổ Nhĩ Kỳ Cơ học Nhân tạo với Mô hình Ngôn ngữ Pretrained

Phần lớn sự phát triển của các hệ thống học máy phụ thuộc vào việc gắn nhãn dữ liệu, nơi hàng trăm, thậm chí hàng nghìn câu hỏi (như Đây có phải là hình ảnh của một con mèo? và Đây có phải là văn bản xúc phạm?) phải được giải quyết để phát triển các tập dữ liệu có thẩm quyền mà các hệ thống AI sẽ được đào tạo.
Mặc dù chúng ta đều đóng góp vào quá trình này tại một số điểm, nhưng đa số các nhiệm vụ gắn nhãn này được thực hiện để kiếm tiền bởi công nhân người tại các khuôn khổ như Amazon Mechanical Turk, nơi các người gắn nhãn hoàn thành các nhiệm vụ phân loại nhỏ trong một nền kinh tế theo từng mảnh.
Phát triển mô hình sẽ rẻ hơn nếu các mô hình ngôn ngữ pretrained (PLM) có thể tự thực hiện một số nhiệm vụ cơ bản hơn của Con người (HIT) hiện đang được thực hiện bởi các nền tảng như AMT và tương tự.
Nghiên cứu gần đây từ Đức và Huawei đề xuất điều này, trong bài báo LMTurk: Few-Shot Learners as Crowdsourcing Workers.
Mô hình Ngôn ngữ Thực hiện Few-Shot Learning
Các tác giả đề xuất rằng các tầng nhiệm vụ đơn giản hơn thường được nhắm đến (công nhân người) tương tự như few-shot learning, nơi một khuôn khổ tự động phải quyết định một nhiệm vụ nhỏ dựa trên một số ví dụ được cung cấp cho nó.
Họ do đó đề xuất rằng các hệ thống AI có thể học hiệu quả từ các PLM hiện có đã được đào tạo bởi công nhân đông người – rằng kiến thức cốt lõi được truyền từ người sang máy đã được thực hiện hiệu quả, và rằng nơi kiến thức này tương đối không thay đổi hoặc có tính chất kinh nghiệm, các khuôn khổ mô hình ngôn ngữ tự động có thể thực hiện các nhiệm vụ này một mình.
‘Ý tưởng cơ bản của chúng tôi là đối với một nhiệm vụ NLP T, chúng tôi coi các học viên few-shot như những công nhân không chuyên, giống như những công nhân crowdsourcing gắn nhãn tài nguyên cho công nghệ ngôn ngữ của con người. Chúng tôi được truyền cảm hứng từ việc chúng tôi có thể xem một công nhân crowdsourcing như một loại học viên few-shot.’
Các ý nghĩa bao gồm khả năng rằng nhiều chân lý mà các hệ thống AI trong tương lai phụ thuộc vào sẽ được suy dẫn từ con người khá nhiều năm trước, sau đó được coi là thông tin đã được xác thực và có thể khai thác mà không cần can thiệp của con người.
Công việc cho Mô hình Ngôn ngữ Mid-Range, Semi-performant
Ngoài động lực để cắt giảm chi phí của con người trong vòng lặp, các nhà nghiên cứu đề xuất rằng sử dụng ‘mid-range’ PLM như thực sự Người Thổ Nhĩ Kỳ Cơ học cung cấp công việc hữu ích cho các hệ thống ‘cũng chạy’ này, những hệ thống đang ngày càng bị lu mờ bởi các mô hình ngôn ngữ quy mô lớn, tốn kém như GPT-3, những mô hình này quá đắt và quá mạnh cho các nhiệm vụ như vậy.
‘Mục tiêu của chúng tôi trong bài báo này là đề xuất các phương pháp để sử dụng hiệu quả hơn các học viên few-shot hiện tại. Điều này rất quan trọng vì ngày càng có nhiều học viên few-shot khổng lồ được đào tạo; làm thế nào để sử dụng chúng hiệu quả là một câu hỏi quan trọng. Đặc biệt, chúng tôi muốn một giải pháp thay thế cho các mô hình lớn khó triển khai.
‘Đồng thời, chúng tôi muốn tận dụng tối đa điểm mạnh của PLM: Sự linh hoạt của chúng đảm bảo khả năng áp dụng rộng rãi trên các nhiệm vụ; kiến thức khổng lồ của chúng về ngôn ngữ và thế giới (được học trong quá trình tiền đào tạo) thể hiện trong hiệu quả dữ liệu của các học viên few-shot, giảm thiểu lao động và thời gian tiêu thụ trong việc gắn nhãn dữ liệu.’
Cho đến nay, các tác giả lập luận, các học viên few-shot trong NLP đã được coi là các giai đoạn trung gian có thể bỏ qua trên con đường dẫn đến các hệ thống ngôn ngữ tự nhiên cấp cao hơn, những hệ thống này đòi hỏi nhiều tài nguyên hơn, và rằng công việc này đã được thực hiện một cách trừu tượng và không xem xét đến khả năng hữu ích của các hệ thống này.
Phương pháp
Các tác giả đề xuất LMTurk (Mô hình Ngôn ngữ như Người Thổ Nhĩ Kỳ Cơ học), trong một quy trình làm việc nơi đầu vào từ HIT tự động này cung cấp nhãn cho một mô hình NLP cấp trung.

Mô hình khái niệm cơ bản cho LMTurk. Nguồn: https://arxiv.org/pdf/2112.07522.pdf
Phiên bản đầu tiên này dựa trên dữ liệu ‘vàng’ được gắn nhãn bởi con người, nơi các công nhân người đã gắn nhãn cho một số nhiệm vụ hạn chế, và các nhãn đã được chấm điểm tốt, либо thông qua giám sát trực tiếp của con người hoặc thông qua bỏ phiếu đồng thuận. Ý nghĩa của lược đồ này là các nhánh hoặc phát triển từ điểm xuất phát này có thể không cần thêm đầu vào của con người trên đường đi.
Mặc dù các tác giả đề xuất các thí nghiệm thêm với các mô hình lai sau này (nơi đầu vào của con người sẽ có mặt, nhưng giảm đáng kể), họ đã không, vì mục đích của nghiên cứu, so sánh các mô hình LMTurk với kết quả từ các công nhân HIT do con người tạo ra, xem xét rằng dữ liệu được gắn nhãn ‘vàng’ là chính là ‘đầu vào của con người’.
Mô hình PLM được thiết kế để thực hiện các hoạt động của Người Thổ Nhĩ Kỳ được điều chỉnh cho nhiệm vụ bằng P-Tuning, một phương pháp được công bố bởi các nhà nghiên cứu từ Trung Quốc vào năm 2021, đề xuất các bản nhúng liên tục có thể đào tạo prompt để cải thiện hiệu suất của các mô hình GPT-3 trên các nhiệm vụ Hiểu biết Ngôn ngữ Tự nhiên (NLU).
![P-Tuning cố gắng tăng cường sức mạnh dự đoán của mô hình GPT và sự xuất hiện của hiểu biết khái niệm về ngôn ngữ bằng cách kết hợp các bản nhúng giả. Trong trường hợp này, câu hỏi bắt đầu là 'Thủ đô của Anh là một [x]'. Nguồn: https://arxiv.org/pdf/2103.10385.pdf](https://www.unite.ai/wp-content/uploads/2021/12/p-tuning.jpg)
P-Tuning cố gắng tăng cường sức mạnh dự đoán của mô hình GPT và sự xuất hiện của hiểu biết khái niệm về ngôn ngữ bằng cách kết hợp các bản nhúng giả. Trong trường hợp này, câu hỏi bắt đầu là ‘Thủ đô của Anh là một [x]’. Nguồn: https://arxiv.org/pdf/2103.10385.pdf
Dữ liệu và Kiến trúc
LMTurk được đánh giá trên năm tập dữ liệu: hai từ Stanford Sentiment Treebank; Corpus Tin tức của AG; Nhận dạng Textual Entailment (RTE); và Corpus của Linguistic Acceptability (CoLA).
Đối với mô hình lớn hơn, LMTurk sử dụng các mô hình PLM công khai ALBERT-XXLarge-v2 (AXLV2) làm mô hình nguồn để chuyển đổi thành một Người Thổ Nhĩ Kỳ tự động. Mô hình này có 223 triệu tham số (so với 175 tỷ tham số trong GPT-3). AXLV2, các tác giả quan sát, đã chứng minh khả năng vượt trội so với các mô hình có quy mô lớn hơn như 334M BERT-Large.
Đối với một mô hình nhẹ hơn, linh hoạt hơn và có thể triển khai trên biên, dự án sử dụng TinyBERT-General-4L-312D (TBG), có 14,5 triệu tham số với hiệu suất tương đương với BERT-base (có 110 triệu tham số).
Kết quả
Dự án LMTurk chạy các mô hình đa dạng chống lại nhiều phân khúc cụ thể của NLP mà kết quả phức tạp của các thí nghiệm của các nhà nghiên cứu không dễ dàng giảm xuống thành bằng chứng thực nghiệm rằng LMTurk cung cấp một cách tiếp cận khả thi để tái sử dụng các kịch bản học few-shot của con người.
Tuy nhiên, với mục đích đánh giá, các tác giả so sánh phương pháp của họ với hai công trình trước: Khai thác Câu hỏi Cloze cho Few Shot Text Classification và Natural Language Inference của các nhà nghiên cứu người Đức Timo Schick và Hinrich Schutze; và kết quả từ Prompt-Based Auto, được giới thiệu trong Làm cho các Mô hình Ngôn ngữ Pretrained trở thành Few-shot Learners tốt hơn của Gao, Chen và Fisch (tương ứng từ Princeton và MIT).

Kết quả từ các thí nghiệm LMTurk, với các nhà nghiên cứu báo cáo ‘hiệu suất tương đương’.
Tóm lại, LMTurk cung cấp một hướng nghiên cứu tương đối hứa hẹn cho các nhà nghiên cứu đang tìm cách nhúng và bảo tồn dữ liệu được gắn nhãn vàng của con người vào các mô hình ngôn ngữ trung cấp đang phát triển, nơi các hệ thống tự động thay thế cho đầu vào của con người.
Giống như số lượng công việc trước đó tương đối nhỏ trong lĩnh vực này, ý tưởng trung tâm dựa trên tính không thay đổi của dữ liệu của con người ban đầu và giả định rằng các yếu tố thời gian – những yếu tố có thể đại diện cho các chướng ngại vật đáng kể đối với sự phát triển của NLP – sẽ không yêu cầu thêm can thiệp của con người khi dòng dõi máy chỉ phát triển.
Ban đầu được xuất bản vào ngày 30 tháng 12 năm 2022












