Kỹ thuật prompt
Đào tạo Cải tiến Text Embeddings với Mô hình Ngôn ngữ Lớn

Text embeddings là các biểu diễn vector của từ, câu, đoạn hoặc tài liệu mà nắm bắt ý nghĩa ngữ nghĩa của chúng. Chúng đóng vai trò là một khối xây dựng cơ bản trong nhiều ứng dụng xử lý ngôn ngữ tự nhiên (NLP) ngày nay, bao gồm tìm kiếm thông tin, trả lời câu hỏi, tìm kiếm ngữ nghĩa và nhiều hơn nữa.
Những tiến bộ gần đây trong mô hình ngôn ngữ lớn (LLM) như GPT-3 đã thể hiện khả năng ấn tượng trong học tập vài lần và tạo sinh ngôn ngữ tự nhiên. Chúng ta có thể tận dụng LLM để cải tiến trạng thái của text embeddings không? Trong bài báo “Cải tiến Text Embeddings với Mô hình Ngôn ngữ Lớn“, các nhà nghiên cứu từ Microsoft (MSFT ) đề xuất một phương pháp mới đạt được kết quả vượt trội bằng cách tạo ra dữ liệu đào tạo tổng hợp với LLM và tinh chỉnh trên đó.
Thử thách với Phương pháp Hiện tại
Các kỹ thuật nhúng văn bản truyền thống như trung bình có trọng số của vector từ hoặc TF-IDF không thể nắm bắt đầy đủ thông tin ngữ cảnh phong phú trong văn bản. Các phương pháp gần đây dựa trên mô hình ngôn ngữ được đào tạo trước như BERT đạt được kết quả tốt hơn, nhưng chúng đòi hỏi các đường ống đào tạo đa giai đoạn phức tạp:
- Đào tạo trước trên hàng tỷ cặp văn bản yếu hoặc nhân tạo
- Tinh chỉnh trên các tập dữ liệu hạn chế được thu thập và gắn nhãn bởi con người
Điều này đòi hỏi tài nguyên tính toán và nỗ lực của con người khổng lồ cho việc thu thập dữ liệu. Dữ liệu đào tạo cũng bị hạn chế về sự đa dạng và phạm vi ngôn ngữ. Ví dụ, chuẩn mực BEIR bao gồm các tập dữ liệu cho chỉ 15 nhiệm vụ tìm kiếm trong tiếng Anh.
Các phương pháp hiện tại chủ yếu sử dụng kiến trúc BERT nhỏ hơn làm mô hình cơ bản. Chúng không thể tận dụng được các LLM tiên tiến hơn và các kỹ thuật liên quan.
Phương pháp: Tạo Dữ liệu Tổng hợp với LLM
Để vượt qua những hạn chế này, các nhà nghiên cứu đề xuất một phương pháp đào tạo đơn giai đoạn mới tận dụng LLM như GPT-3 và GPT-4 để tạo ra dữ liệu đào tạo tổng hợp đa dạng.
Các bước chính là:
- Taxonomy Nhiệm vụ: Xác định một phân loại nhiệm vụ nhúng văn bản thành:
- Nhiệm vụ không đối xứng (câu hỏi và tài liệu không phải là bản paraphrase, ví dụ tìm kiếm)
- Nhiệm vụ đối xứng (câu hỏi và tài liệu là bản paraphrase, ví dụ tương tự ngữ nghĩa)
- Thiết kế Câu lệnh: Tạo các mẫu câu lệnh được thiết kế cho từng loại nhiệm vụ để hướng dẫn LLM tạo ra các ví dụ đào tạo liên quan.
- Tạo Dữ liệu Tổng hợp: Sử dụng LLM với các câu lệnh được thiết kế để tạo ra hàng trăm nghìn cặp (câu hỏi, tài liệu) bao phủ nhiều nhiệm vụ ngữ nghĩa khác nhau trên 93 ngôn ngữ.
- Đào tạo Mô hình: Tinh chỉnh một mô hình LLM mạnh mẽ và mã nguồn mở như Mistral trên dữ liệu tổng hợp bằng cách sử dụng tổn thất tương phản.
Phương pháp này cho phép tạo ra dữ liệu đào tạo dồi dào cho nhiều nhiệm vụ khác nhau trong nhiều ngôn ngữ mà không cần nỗ lực gắn nhãn của con người. Bằng cách tận dụng kiến thức đã được nhúng trong LLM thông qua đào tạo trước trên tập dữ liệu web quy mô lớn, chúng ta có thể tổng hợp dữ liệu chất lượng cao được thiết kế đặc biệt cho nhúng văn bản.
Các nhà nghiên cứu chứng minh điều này với một chiến lược câu lệnh 2 bước:
- Câu lệnh cho GPT-4 đề xuất các nhiệm vụ tìm kiếm tiềm năng
- Câu lệnh lại để tạo ra (câu hỏi, tài liệu) dựa trên các nhiệm vụ được đề xuất
Một số khía cạnh quan trọng của thiết kế câu lệnh:
- Câu lệnh ngôn ngữ tự nhiên cho hướng dẫn trực quan giống con người
- Các vị trí giữ chỗ để khuyến khích sự đa dạng (ví dụ độ dài câu hỏi, độ rõ ràng, độ dài tài liệu)
- Kết hợp dữ liệu từ nhiều mẫu cho cùng một loại nhiệm vụ
- Gán trọng số cho ngôn ngữ dựa trên sự sẵn có của tài nguyên
Tổng cộng, họ đã tạo ra 500k ví dụ nhúng văn bản với chi phí tính toán là 180M token. Ngôn ngữ chiếm ưu thế là tiếng Anh (43%) tiếp theo là tiếng Ba Lan, tiếng Nhật, tiếng Ý và các ngôn ngữ khác.
Đối với đào tạo mô hình, họ chọn tinh chỉnh mô hình Mistral 7B tham số mã nguồn mở thay vì các kiến trúc BERT nhỏ hơn. Vì Mistral đã được đào tạo trước trên tập dữ liệu web quy mô lớn, không cần đào tạo tương phản trước thêm. Thêm nó cung cấp sự cải thiện không đáng kể.
Toàn bộ quá trình tinh chỉnh mất ít hơn 1k bước, sử dụng sự kết hợp của dữ liệu tổng hợp và dữ liệu được gắn nhãn bởi con người. Điều này chứng minh hiệu quả mẫu của phương pháp được đề xuất.
Kết quả
Các nhà nghiên cứu đánh giá mô hình của họ trên chuẩn mực MTEB, bao gồm nhiều nhiệm vụ khác nhau trên phân loại, nhóm, tương tự ngữ nghĩa, tóm tắt và tìm kiếm thông tin.
Mô hình của họ đạt kết quả tốt hơn 2,4 điểm so với kết quả tốt nhất trước đó, thiết lập kỷ lục mới cho gần như mọi hạng mục:
| Mô hình | Trước SOTA | Mô hình Đề xuất |
|---|---|---|
| Phân loại | 76.0 | 78.5 |
| Nhóm | 46.1 | 50.3 |
| Phân loại cặp | 87.1 | 88.3 |
| Xếp hạng lại | 60.0 | 60.2 |
| Tìm kiếm | 54.3 | 56.9 |
| STS | 83.1 | 84.6 |
| Tóm tắt | 31.6 | 31.4 |
| Trung bình | 64.2 | 66.6 |
Đáng chú ý, ngay cả khi không sử dụng dữ liệu được gắn nhãn và chỉ đào tạo trên dữ liệu tổng hợp, nó đạt được độ chính xác cạnh tranh – chỉ 3,5 điểm sau mô hình được giám sát đầy đủ. Điều này chứng minh tính khả thi của việc tạo ra nhúng văn bản chỉ bằng cách sử dụng LLM, mà không cần nỗ lực gắn nhãn của con người.
Các nhà nghiên cứu cũng đánh giá trên chuẩn mực MIRACL đa ngôn ngữ bao gồm 18 ngôn ngữ. Mô hình của họ đạt kết quả tốt hơn so với kết quả tốt nhất trước đó trên các ngôn ngữ có nhiều tài nguyên nhưng yếu hơn trên các ngôn ngữ có ít tài nguyên. Họ suy đoán rằng điều này có thể được giảm thiểu bằng cách đào tạo trước LLM trên các ngôn ngữ có ít tài nguyên nhiều hơn.
Tóm lại, nhúng văn bản được đào tạo trên dữ liệu tổng hợp được tạo ra bởi LLM thiết lập kết quả tốt nhất mới, trong khi sử dụng đào tạo đơn giản và hiệu quả hơn so với các phương pháp đa giai đoạn trước đó. Với nghiên cứu thêm về kỹ thuật câu lệnh và chất lượng dữ liệu tổng hợp, phương pháp này có thể cải tiến đáng kể nhúng văn bản đa ngôn ngữ.
Phân tích
Công việc này cung cấp một số kết luận quý giá:
- LLM như GPT-3 và GPT-4 có khả năng ấn tượng trong việc tạo ra dữ liệu đào tạo tổng hợp chất lượng cao cho nhiều nhiệm vụ NLP khác nhau khi được câu lệnh phù hợp. Điều này có thể giảm sự phụ thuộc vào dữ liệu được gắn nhãn bởi con người.
- Đối với nhúng văn bản, đào tạo tương phản cung cấp lợi ích không đáng kể so với chỉ tinh chỉnh mô hình như Mistral đã được đào tạo trước trên tập dữ liệu web quy mô lớn. Đây là một nhận xét quan trọng về hiệu quả đào tạo.
- Phương pháp tạo sinh tăng cường tìm kiếm cho phép LLM động truy cập kiến thức bên ngoài. Do đó, cải tiến nhúng văn bản là điều quan trọng để nâng cao khả năng của những LLM này.
- Vẫn còn nhiều khoảng trống để cải tiến trên các ngôn ngữ có ít tài nguyên. Các LLM đa ngôn ngữ được đào tạo trước trên dữ liệu đại diện hơn có thể giúp thu hẹp khoảng cách này.
- Khái niệm về mô hình ngôn ngữ và nhúng văn bản là hai mặt của cùng một đồng tiền – hiểu ngữ nghĩa ngôn ngữ. Với câu lệnh dữ liệu tổng hợp, LLM có thể được tinh chỉnh tự nhiên thành các mô hình nhúng mà không cần đường ống phức tạp.
Một số hướng nghiên cứu hứa hẹn cho tương lai bao gồm:
- Tận dụng LLM mã nguồn mở như GPT-NeoX để tạo ra dữ liệu tổng hợp
- Khám phá đào tạo hậu xử lý nhẹ để thích ứng với các ngữ cảnh dài hơn
- Phát triển các kỹ thuật câu lệnh để kiểm soát chất lượng và phạm vi nhiệm vụ
- Phương pháp để cải thiện độ trễ và chi phí lưu trữ cho sử dụng công nghiệp
Ngoài việc vượt qua các chuẩn mực, việc sử dụng mô hình ngôn ngữ lớn để nâng cao nhúng văn bản mở ra những khả năng thú vị cho tương lai. Khi LLM tiếp tục tiến bộ trong việc掌握 ngôn ngữ tự nhiên, khả năng của chúng trong việc tạo ra dữ liệu tổng hợp chất lượng cao cũng có thể cải thiện.
Tuy nhiên, vẫn còn nhiều hướng nghiên cứu quan trọng để chuyển đổi tiềm năng này thành tác động thực tế.
Tùy chỉnh và Kiểm soát
Một lợi ích chính của dữ liệu tổng hợp là khả năng tạo ra các ví dụ được tùy chỉnh cho các nhu cầu cụ thể. Như bài báo đã chứng minh, thiết kế câu lệnh cho phép tạo ra dữ liệu đào tạo cho hàng trăm nghìn nhiệm vụ nhúng.
Tuy nhiên, các phương pháp thiết kế câu lệnh hiện tại vẫn còn mang tính nghệ thuật hơn là khoa học. Phát triển các phương pháp hệ thống và có thể tái tạo để kiểm soát chính xác các thuộc tính của dữ liệu được tạo ra sẽ mở rộng khả năng áp dụng của kỹ thuật này.
Ví dụ, các kỹ thuật để điều chỉnh các yếu tố như độ phức tạp, độ mơ hồ và tính mới của các ví dụ có thể giúp giải quyết các vấn đề về độ bền trong các nhiệm vụ sau.
Đào tạo trên Quy mô Lớn
Mặc dù các LLM đã được đào tạo trước đã mã hóa một lượng kiến thức ngôn ngữ đáng kể, khả năng tạo ra dữ liệu của chúng có thể được cải thiện hơn nữa với quy mô lớn hơn. Các mô hình như GPT-4 được đào tạo trên hàng tỷ token văn bản internet thể hiện khả năng học tập vài lần mạnh mẽ, nhưng chưa được tối ưu hóa cụ thể cho việc tạo ra dữ liệu đào tạo.
Kiến trúc và mục tiêu được thiết kế để khởi động tạo dữ liệu tự giám sát trên quy mô web có thể cải tiến đáng kể chất lượng và hiệu quả của phương pháp này. Tích hợp hiệu quả kiến thức được truy xuất để bổ sung kiến thức đã học là một hướng nghiên cứu hứa hẹn khác.
Nhiều nhiệm vụ và Đa ngôn ngữ
Như bài báo đã lưu ý, cải thiện hiệu suất trên các ngôn ngữ có ít tài nguyên vẫn còn là một vấn đề. Thay vì đào tạo một mô hình LLM lớn duy nhất, một phương pháp thay thế là đào tạo một đội các mô hình chuyên gia nhỏ hơn chuyên về các lĩnh vực dữ liệu hoặc ngôn ngữ cụ thể.
Phương pháp này có thể giúp cải thiện phạm vi trên các nhiệm vụ và ngôn ngữ hiếm bằng cách chia sẻ các biểu diễn được học trên các chuyên gia. Học liên tục để mở rộng ngôn ngữ và chuyên môn nhiệm vụ theo thời gian cũng là một triển vọng thú vị.
Tóm lại, bài báo này giới thiệu một khái niệm đổi mới về tạo ra dữ liệu đào tạo từ LLM để tạo ra nhúng văn bản hiệu suất cao. Kết quả của họ chứng minh tính hiệu quả của phương pháp này, vượt qua các chuẩn mực trước đó. Khi LLM và kỹ thuật dữ liệu tổng hợp tiến bộ, việc tận dụng kiến thức của chúng để đào tạo mô hình nhúng có thể trở thành một hướng nghiên cứu rất hứa hẹn.















