Góc nhìn Anderson
Tạo Mô Hình Ngôn Ngữ GPT-Style Cho Một Câu Hỏi Đơn

Những nhà nghiên cứu từ Trung Quốc đã phát triển một phương pháp tiết kiệm để tạo ra các hệ thống Xử lý Ngôn ngữ Tự nhiên (NLP) theo phong cách GPT-3 trong khi tránh được chi phí ngày càng tăng về thời gian và tiền bạc liên quan đến việc đào tạo các tập dữ liệu lớn – một xu hướng đang ngày càng đe dọa đến việc làm cho lĩnh vực này của Trí tuệ nhân tạo (AI) chỉ dành cho các công ty lớn như FAANG và các nhà đầu tư cấp cao.
Khung架 mới được đề xuất được gọi là Mô hình Ngôn ngữ Được Động viên bởi Nhiệm vụ (TLM). Thay vì đào tạo một mô hình lớn và phức tạp trên một tập dữ liệu khổng lồ với hàng tỷ từ và hàng nghìn nhãn và lớp, TLM đào tạo một mô hình nhỏ hơn nhiều mà thực sự kết hợp một truy vấn trực tiếp vào mô hình.

Bên trái, một phương pháp tiếp cận hyperscale điển hình đối với các mô hình ngôn ngữ lớn; bên phải, phương pháp slimline của TLM để khám phá một tập dữ liệu ngôn ngữ lớn trên cơ sở từng chủ đề hoặc từng câu hỏi. Nguồn: https://arxiv.org/pdf/2111.04130.pdf
Hiệu quả, một thuật toán hoặc mô hình NLP duy nhất được tạo ra để trả lời một câu hỏi đơn, thay vì tạo ra một mô hình ngôn ngữ tổng quát lớn và cồng kềnh có thể trả lời nhiều câu hỏi khác nhau.
Trong quá trình thử nghiệm TLM, các nhà nghiên cứu đã tìm thấy rằng phương pháp mới này đạt được kết quả tương tự hoặc tốt hơn so với các Mô hình Ngôn ngữ Được Đào tạo Trước (PLM) như RoBERTa-Large, và các hệ thống NLP hyperscale như GPT-3 của OpenAI, Mô hình Chuyển đổi Công tắc Trillion Parameter của Google Model, HyperClover của Naver Model, Jurassic 1 của AI21 Labs Model, và Megatron-Turing NLG 530B của Microsoft Model.
Trong các thử nghiệm của TLM trên tám tập dữ liệu phân loại thuộc bốn lĩnh vực, các tác giả cũng tìm thấy rằng hệ thống này giảm số lượng phép toán dấu phẩy động (FLOPs) cần thiết cho việc đào tạo xuống hai bậc. Các nhà nghiên cứu hy vọng rằng TLM có thể ‘đem lại cơ hội’ cho một lĩnh vực đang trở nên ngày càng tinh hoa, với các mô hình NLP quá lớn đến mức không thể cài đặt cục bộ và thay vào đó nằm sau các API đắt tiền và hạn chế của OpenAI và Microsoft Azure.
Các tác giả cho biết rằng việc cắt giảm thời gian đào tạo xuống hai bậc làm giảm chi phí đào tạo trên 1.000 GPU trong một ngày xuống chỉ còn 8 GPU trong 48 giờ.
Báo cáo mới báo cáo có tiêu đề NLP Từ Đầu Không Cần Đào tạo Trước Quy mô Lớn: Một Khung架 Đơn giản và Hiệu quả, và đến từ ba nhà nghiên cứu tại Đại học Tsinghua ở Bắc Kinh, và một nhà nghiên cứu từ công ty phát triển AI Recurrent AI, Inc.
Đáp Án Không Tiết Kiệm
Chi phí đào tạo các mô hình ngôn ngữ hiệu quả và tổng quát đang ngày càng được coi là một ‘giới hạn nhiệt’ đối với mức độ mà các mô hình NLP hiệu suất cao và chính xác có thể thực sự lan tỏa trong văn hóa.

Thống kê về sự phát triển của các mặt trong kiến trúc mô hình NLP, từ một báo cáo năm 2020 của A121 Labs. Nguồn: https://arxiv.org/pdf/2004.08900.pdf
Vào năm 2019, một nhà nghiên cứu tính toán rằng chi phí đào tạo mô hình XLNet (được báo cáo là vượt qua BERT trong các nhiệm vụ NLP) trong 2,5 ngày trên 512 lõi trên 64 thiết bị là 61.440 USD, trong khi GPT-3 được ước tính có chi phí đào tạo là 12 triệu USD – 200 lần chi phí đào tạo người tiền nhiệm GPT-2 (mặc dù các ước tính gần đây cho thấy nó có thể được đào tạo hiện nay với chỉ 4.600.000 USD trên các GPU đám mây có giá thấp nhất).
Tập Con Dữ Liệu Dựa trên Nhu Cầu Truy vấn
Thay vào đó, kiến trúc mới đề xuất này nhằm mục đích đạt được phân loại chính xác, nhãn và tổng quát hóa bằng cách sử dụng một truy vấn như một loại bộ lọc để xác định một tập con thông tin từ một cơ sở dữ liệu ngôn ngữ lớn sẽ được đào tạo, cùng với truy vấn, để cung cấp câu trả lời về một chủ đề hạn chế.
Các tác giả cho biết:
‘TLM được động viên bởi hai ý tưởng chính. Trước hết, con người 掌握 một nhiệm vụ bằng cách sử dụng chỉ một phần nhỏ của kiến thức thế giới (ví dụ, học sinh chỉ cần xem xét một vài chương, trong số tất cả các sách trên thế giới, để ôn lại cho một kỳ thi).
‘Chúng tôi giả thuyết rằng có rất nhiều sự trùng lặp trong tập dữ liệu lớn cho một nhiệm vụ cụ thể. Thứ hai, đào tạo trên dữ liệu có nhãn được giám sát là hiệu quả hơn nhiều so với tối ưu hóa mục tiêu mô hình ngôn ngữ trên dữ liệu không có nhãn. Dựa trên những động viên này, TLM sử dụng dữ liệu nhiệm vụ như các truy vấn để lấy một tập con nhỏ của cơ sở dữ liệu chung. Điều này được theo sau bởi tối ưu hóa đồng thời một mục tiêu nhiệm vụ được giám sát và một mục tiêu mô hình ngôn ngữ bằng cách sử dụng cả dữ liệu lấy được và dữ liệu nhiệm vụ.’
Besides việc làm cho việc đào tạo mô hình NLP hiệu quả và tiết kiệm, các tác giả cũng thấy được một số lợi thế khi sử dụng mô hình NLP được động viên bởi nhiệm vụ. Ví dụ, các nhà nghiên cứu có thể tận hưởng sự linh hoạt lớn hơn, với các chiến lược tùy chỉnh cho độ dài chuỗi, phân tích từ, điều chỉnh siêu tham số và biểu diễn dữ liệu.
Các nhà nghiên cứu cũng dự đoán sự phát triển của các hệ thống lai trong tương lai, những hệ thống này sẽ trao đổi giữa việc đào tạo trước hạn chế của một PLM (không được dự kiến trong triển khai hiện tại) và sự linh hoạt và tổng quát hóa lớn hơn. Họ coi hệ thống này là một bước tiến cho sự phát triển của các phương pháp tổng quát hóa không cần đào tạo trước trong lĩnh vực.
Thử nghiệm và Kết quả
TLM đã được thử nghiệm trên các thử thách phân loại trong tám nhiệm vụ thuộc bốn lĩnh vực – khoa học sinh học, tin tức, đánh giá và khoa học máy tính. Các nhiệm vụ được chia thành các nhiệm vụ có nguồn lực cao và thấp. Các nhiệm vụ có nguồn lực cao bao gồm hơn 5.000 dữ liệu nhiệm vụ, chẳng hạn như AGNews và RCT, trong số các nhiệm vụ khác; các nhiệm vụ có nguồn lực thấp bao gồm ChemProt và ACL-ARC, cũng như HyperPartisan news detection dataset.
Các nhà nghiên cứu đã phát triển hai tập dữ liệu đào tạo có tên là Corpus-BERT và Corpus-RoBERTa, với Corpus-RoBERTa lớn hơn Corpus-BERT 10 lần. Các thí nghiệm so sánh các Mô hình Ngôn ngữ Được Đào tạo Trước (PLM) chung như BERT (từ Google) và RoBERTA (từ Facebook ) với kiến trúc mới.
Báo cáo cho biết rằng mặc dù TLM là một phương pháp chung, và nên có phạm vi và khả năng áp dụng hạn chế hơn so với các mô hình hàng đầu và lớn hơn, nó có thể hoạt động gần với các phương pháp tinh chỉnh miền.

Kết quả từ việc so sánh hiệu suất của TLM với các tập dữ liệu dựa trên BERT và RoBERTa. Kết quả liệt kê điểm F1 trung bình trên ba quy mô đào tạo khác nhau, và liệt kê số lượng tham số, tổng số phép toán (FLOPs) và kích thước tập dữ liệu đào tạo.
Các tác giả kết luận rằng TLM có khả năng đạt được kết quả tương tự hoặc tốt hơn so với PLM, với sự giảm đáng kể số lượng phép toán dấu phẩy động (FLOPs) cần thiết, và chỉ yêu cầu 1/16 tập dữ liệu đào tạo. Trên quy mô trung bình và lớn, TLM có thể cải thiện hiệu suất bằng 0,59 và 0,24 điểm trên trung bình, trong khi giảm kích thước tập dữ liệu đào tạo xuống hai bậc.
‘Những kết quả này xác nhận rằng TLM là rất chính xác và hiệu quả hơn nhiều so với PLM. Hơn nữa, TLM đạt được nhiều lợi thế hơn về hiệu quả ở quy mô lớn hơn. Điều này cho thấy rằng các PLM quy mô lớn hơn có thể đã được đào tạo để lưu trữ nhiều kiến thức chung không cần thiết cho một nhiệm vụ cụ thể.’












