Góc nhìn Anderson

Tạo Mô Hình Ngôn Ngữ GPT-Style Cho Một Câu Hỏi Đơn

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Những nhà nghiên cứu từ Trung Quốc đã phát triển một phương pháp tiết kiệm để tạo ra các hệ thống Xử lý Ngôn ngữ Tự nhiên (NLP) theo phong cách GPT-3 trong khi tránh được chi phí ngày càng tăng về thời gian và tiền bạc liên quan đến việc đào tạo các tập dữ liệu lớn – một xu hướng đang ngày càng đe dọa đến việc làm cho lĩnh vực này của Trí tuệ nhân tạo (AI) chỉ dành cho các công ty lớn như FAANG và các nhà đầu tư cấp cao.

Khung架 mới được đề xuất được gọi là Mô hình Ngôn ngữ Được Động viên bởi Nhiệm vụ (TLM). Thay vì đào tạo một mô hình lớn và phức tạp trên một tập dữ liệu khổng lồ với hàng tỷ từ và hàng nghìn nhãn và lớp, TLM đào tạo một mô hình nhỏ hơn nhiều mà thực sự kết hợp một truy vấn trực tiếp vào mô hình.

Bên trái, một phương pháp tiếp cận hyperscale điển hình đối với các mô hình ngôn ngữ lớn; bên phải, phương pháp slimline của TLM để khám phá một tập dữ liệu ngôn ngữ lớn trên cơ sở từng chủ đề hoặc từng câu hỏi. Nguồn: https://arxiv.org/pdf/2111.04130.pdf

Bên trái, một phương pháp tiếp cận hyperscale điển hình đối với các mô hình ngôn ngữ lớn; bên phải, phương pháp slimline của TLM để khám phá một tập dữ liệu ngôn ngữ lớn trên cơ sở từng chủ đề hoặc từng câu hỏi. Nguồn: https://arxiv.org/pdf/2111.04130.pdf

Hiệu quả, một thuật toán hoặc mô hình NLP duy nhất được tạo ra để trả lời một câu hỏi đơn, thay vì tạo ra một mô hình ngôn ngữ tổng quát lớn và cồng kềnh có thể trả lời nhiều câu hỏi khác nhau.

Trong quá trình thử nghiệm TLM, các nhà nghiên cứu đã tìm thấy rằng phương pháp mới này đạt được kết quả tương tự hoặc tốt hơn so với các Mô hình Ngôn ngữ Được Đào tạo Trước (PLM) như RoBERTa-Large, và các hệ thống NLP hyperscale như GPT-3 của OpenAI, Mô hình Chuyển đổi Công tắc Trillion Parameter của Google Model, HyperClover của Naver Model, Jurassic 1 của AI21 Labs Model, và Megatron-Turing NLG 530B của Microsoft Model.

Trong các thử nghiệm của TLM trên tám tập dữ liệu phân loại thuộc bốn lĩnh vực, các tác giả cũng tìm thấy rằng hệ thống này giảm số lượng phép toán dấu phẩy động (FLOPs) cần thiết cho việc đào tạo xuống hai bậc. Các nhà nghiên cứu hy vọng rằng TLM có thể ‘đem lại cơ hội’ cho một lĩnh vực đang trở nên ngày càng tinh hoa, với các mô hình NLP quá lớn đến mức không thể cài đặt cục bộ và thay vào đó nằm sau các API đắt tiền và hạn chế của OpenAI và Microsoft Azure.

Các tác giả cho biết rằng việc cắt giảm thời gian đào tạo xuống hai bậc làm giảm chi phí đào tạo trên 1.000 GPU trong một ngày xuống chỉ còn 8 GPU trong 48 giờ.

Báo cáo mới báo cáo có tiêu đề NLP Từ Đầu Không Cần Đào tạo Trước Quy mô Lớn: Một Khung架 Đơn giản và Hiệu quả, và đến từ ba nhà nghiên cứu tại Đại học Tsinghua ở Bắc Kinh, và một nhà nghiên cứu từ công ty phát triển AI Recurrent AI, Inc.

Đáp Án Không Tiết Kiệm

Chi phí đào tạo các mô hình ngôn ngữ hiệu quả và tổng quát đang ngày càng được coi là một ‘giới hạn nhiệt’ đối với mức độ mà các mô hình NLP hiệu suất cao và chính xác có thể thực sự lan tỏa trong văn hóa.

Thống kê về sự phát triển của các mặt trong kiến trúc mô hình NLP, từ một báo cáo năm 2020 của A121 Labs. Nguồn: https://arxiv.org/pdf/2004.08900.pdf

Thống kê về sự phát triển của các mặt trong kiến trúc mô hình NLP, từ một báo cáo năm 2020 của A121 Labs. Nguồn: https://arxiv.org/pdf/2004.08900.pdf

Vào năm 2019, một nhà nghiên cứu tính toán rằng chi phí đào tạo mô hình XLNet (được báo cáo là vượt qua BERT trong các nhiệm vụ NLP) trong 2,5 ngày trên 512 lõi trên 64 thiết bị là 61.440 USD, trong khi GPT-3 được ước tính có chi phí đào tạo là 12 triệu USD – 200 lần chi phí đào tạo người tiền nhiệm GPT-2 (mặc dù các ước tính gần đây cho thấy nó có thể được đào tạo hiện nay với chỉ 4.600.000 USD trên các GPU đám mây có giá thấp nhất).

Tập Con Dữ Liệu Dựa trên Nhu Cầu Truy vấn

Thay vào đó, kiến trúc mới đề xuất này nhằm mục đích đạt được phân loại chính xác, nhãn và tổng quát hóa bằng cách sử dụng một truy vấn như một loại bộ lọc để xác định một tập con thông tin từ một cơ sở dữ liệu ngôn ngữ lớn sẽ được đào tạo, cùng với truy vấn, để cung cấp câu trả lời về một chủ đề hạn chế.

Các tác giả cho biết:

‘TLM  được  động viên  bởi  hai  ý tưởng  chính.   Trước hết,  con người 掌握  một  nhiệm vụ  bằng  cách  sử  dụng  chỉ  một  phần  nhỏ  của  kiến thức  thế giới  (ví dụ,  học sinh  chỉ  cần  xem xét  một  vài  chương,  trong  số  tất cả  các  sách  trên  thế giới,  để  ôn  lại  cho  một  kỳ  thi). 

‘Chúng tôi  giả thuyết  rằng  có  rất  nhiều  sự  trùng lặp  trong  tập dữ liệu lớn  cho  một  nhiệm vụ  cụ thể.  Thứ hai,  đào tạo  trên  dữ liệu  có  nhãn  được  giám sát  là  hiệu quả  hơn  nhiều  so với  tối ưu hóa  mục tiêu  mô hình  ngôn ngữ  trên  dữ liệu  không  có  nhãn.   Dựa trên  những  động viên  này,  TLM  sử  dụng  dữ liệu  nhiệm vụ  như  các  truy vấn  để  lấy  một  tập con  nhỏ  của  cơ sở dữ liệu  chung.   Điều này  được  theo sau  bởi  tối ưu hóa  đồng thời  một  mục tiêu  nhiệm vụ  được  giám sát  và  một  mục tiêu  mô hình  ngôn ngữ  bằng  cách  sử  dụng  cả  dữ liệu  lấy  được  và  dữ liệu  nhiệm vụ.’

Besides việc làm cho việc đào tạo mô hình NLP hiệu quả và tiết kiệm, các tác giả cũng thấy được một số lợi thế khi sử dụng mô hình NLP được động viên bởi nhiệm vụ. Ví dụ, các nhà nghiên cứu có thể tận hưởng sự linh hoạt lớn hơn, với các chiến lược tùy chỉnh cho độ dài chuỗi, phân tích từ, điều chỉnh siêu tham số và biểu diễn dữ liệu.

Các nhà nghiên cứu cũng dự đoán sự phát triển của các hệ thống lai trong tương lai, những hệ thống này sẽ trao đổi giữa việc đào tạo trước hạn chế của một PLM (không được dự kiến trong triển khai hiện tại) và sự linh hoạt và tổng quát hóa lớn hơn. Họ coi hệ thống này là một bước tiến cho sự phát triển của các phương pháp tổng quát hóa không cần đào tạo trước trong lĩnh vực.

Thử nghiệm và Kết quả

TLM đã được thử nghiệm trên các thử thách phân loại trong tám nhiệm vụ thuộc bốn lĩnh vực – khoa học sinh học, tin tức, đánh giá và khoa học máy tính. Các nhiệm vụ được chia thành các nhiệm vụ có nguồn lực cao và thấp. Các nhiệm vụ có nguồn lực cao bao gồm hơn 5.000 dữ liệu nhiệm vụ, chẳng hạn như AGNewsRCT, trong số các nhiệm vụ khác; các nhiệm vụ có nguồn lực thấp bao gồm ChemProt và ACL-ARC, cũng như HyperPartisan news detection dataset.

Các nhà nghiên cứu đã phát triển hai tập dữ liệu đào tạo có tên là Corpus-BERT và Corpus-RoBERTa, với Corpus-RoBERTa lớn hơn Corpus-BERT 10 lần. Các thí nghiệm so sánh các Mô hình Ngôn ngữ Được Đào tạo Trước (PLM) chung như BERT (từ Google) và RoBERTA (từ Facebook ) với kiến trúc mới.

Báo cáo cho biết rằng mặc dù TLM là một phương pháp chung, và nên có phạm vi và khả năng áp dụng hạn chế hơn so với các mô hình hàng đầu và lớn hơn, nó có thể hoạt động gần với các phương pháp tinh chỉnh miền.

Kết quả từ việc so sánh hiệu suất của TLM với các tập dữ liệu dựa trên BERT và RoBERTa. Kết quả liệt kê điểm F1 trung bình trên ba quy mô đào tạo khác nhau, và liệt kê số lượng tham số, tổng số phép toán (FLOPs) và kích thước tập dữ liệu đào tạo.

Kết quả từ việc so sánh hiệu suất của TLM với các tập dữ liệu dựa trên BERT và RoBERTa. Kết quả liệt kê điểm F1 trung bình trên ba quy mô đào tạo khác nhau, và liệt kê số lượng tham số, tổng số phép toán (FLOPs) và kích thước tập dữ liệu đào tạo.

Các tác giả kết luận rằng TLM có khả năng đạt được kết quả tương tự hoặc tốt hơn so với PLM, với sự giảm đáng kể số lượng phép toán dấu phẩy động (FLOPs) cần thiết, và chỉ yêu cầu 1/16 tập dữ liệu đào tạo. Trên quy mô trung bình và lớn, TLM có thể cải thiện hiệu suất bằng 0,59 và 0,24 điểm trên trung bình, trong khi giảm kích thước tập dữ liệu đào tạo xuống hai bậc.

‘Những kết quả này xác nhận rằng TLM là rất chính xác và hiệu quả hơn nhiều so với PLM. Hơn nữa, TLM đạt được nhiều lợi thế hơn về hiệu quả ở quy mô lớn hơn. Điều này cho thấy rằng các PLM quy mô lớn hơn có thể đã được đào tạo để lưu trữ nhiều kiến thức chung không cần thiết cho một nhiệm vụ cụ thể.’

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai