Mô hình và nền tảng AI

LongWriter: Phát hành khung 10.000+ từ cho mô hình ngôn ngữ lớn

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
LONGWRITER: UNLEASHING 10,000+ WORD GENERATION FROM LONG CONTEXT LLMS

Hiện tại, các mô hình ngôn ngữ lớn (LLM) có thể xử lý đầu vào lên đến 100.000 token, nhưng chúng gặp khó khăn khi tạo ra đầu ra vượt quá 2.000 từ. Các thí nghiệm được kiểm soát cho thấy rằng độ dài tạo ra hiệu quả của mô hình bị giới hạn bởi các ví dụ được nhìn thấy trong quá trình tinh chỉnh giám sát (SFT). Nói cách khác, giới hạn này xuất phát từ sự khan hiếm các ví dụ đầu ra dài trong các tập dữ liệu SFT hiện có.

Những tiến bộ gần đây trong các mô hình ngôn ngữ lớn có ngữ cảnh dài đã dẫn đến sự phát triển của các mô hình có khả năng nhớ tăng đáng kể, có thể xử lý lịch sử vượt quá 100.000 token. Tuy nhiên, mặc dù khả năng xử lý đầu vào rộng lớn, các mô hình ngôn ngữ lớn có ngữ cảnh dài hiện tại gặp khó khăn khi tạo ra đầu ra có chiều dài tương đương.

Để khám phá giới hạn này, LongWriter nghiên cứu độ dài tạo ra tối đa của các mô hình ngôn ngữ lớn có ngữ cảnh dài hiện đại với nhiều truy vấn yêu cầu độ dài trả lời khác nhau, chẳng hạn như “Viết một bài viết 10.000 từ về lịch sử của Đế chế La Mã.” Kết quả cho thấy tất cả các mô hình đều không thể tạo ra đầu ra vượt quá 2.000 từ. Trong khi đó, phân tích nhật ký tương tác người dùng cho thấy hơn 1% yêu cầu người dùng yêu cầu đầu ra vượt quá giới hạn này, nhấn mạnh nhu cầu cấp thiết trong nghiên cứu hiện tại để vượt qua giới hạn này.

Để giải quyết vấn đề này, LongWriter giới thiệu AgentWrite, một pipeline dựa trên tác nhân phân chia các nhiệm vụ tạo ra siêu dài thành các nhiệm vụ con, cho phép các mô hình ngôn ngữ lớn hiện có tạo ra đầu ra hợp lý vượt quá 20.000 từ. Sử dụng AgentWrite, LongWriter xây dựng LongWriter-6k, một tập dữ liệu chứa 6.000 mẫu dữ liệu SFT với độ dài đầu ra từ 2.000 đến 32.000 từ. Bằng cách kết hợp tập dữ liệu này vào quá trình đào tạo mô hình, LongWriter đã thành công trong việc mở rộng độ dài đầu ra của các mô hình hiện có lên hơn 10.000 từ trong khi vẫn duy trì chất lượng đầu ra.

LongWriter cũng phát triển LongBench-Write, một tiêu chuẩn đánh giá toàn diện để đánh giá khả năng tạo ra siêu dài. Mô hình 9B, được cải tiến thêm thông qua DPO, đạt được hiệu suất tốt nhất trên tiêu chuẩn này, vượt qua thậm chí các mô hình độc quyền lớn hơn.

Trong bài viết này, chúng tôi sẽ thảo luận về khung LongWriter, khám phá kiến trúc của nó và so sánh hiệu suất của nó với các mô hình ngôn ngữ lớn có ngữ cảnh dài hiện đại. Hãy bắt đầu.

LongWriter: Khung tạo ra 10.000+ từ

Những tiến bộ gần đây trong các mô hình ngôn ngữ lớn có ngữ cảnh dài đã dẫn đến sự phát triển của các mô hình có khả năng nhớ tăng đáng kể, có thể xử lý lịch sử vượt quá 100.000 token. Mặc dù khả năng xử lý đầu vào rộng lớn, các mô hình ngôn ngữ lớn có ngữ cảnh dài hiện tại gặp khó khăn khi tạo ra đầu ra có chiều dài tương đương. Để nghiên cứu giới hạn này, LongWriter kiểm tra độ dài tạo ra tối đa của các mô hình ngôn ngữ lớn có ngữ cảnh dài hiện đại thông qua các truy vấn yêu cầu độ dài trả lời khác nhau, chẳng hạn như “Viết một bài viết 10.000 từ về lịch sử của Đế chế La Mã.” Dựa trên kết quả, LongWriter quan sát thấy rằng tất cả các mô hình đều không thể tạo ra đầu ra vượt quá 2.000 từ. Hơn nữa, phân tích nhật ký tương tác người dùng cho thấy hơn 1% yêu cầu người dùng yêu cầu đầu ra vượt quá giới hạn này, nhấn mạnh nhu cầu cấp thiết trong nghiên cứu hiện tại để giải quyết vấn đề này.

Nghiên cứu của LongWriter tiết lộ một nhận xét quan trọng: giới hạn về độ dài đầu ra chủ yếu bắt nguồn từ đặc điểm của các tập dữ liệu SFT. Cụ thể, LongWriter phát hiện ra rằng độ dài tạo ra tối đa của mô hình bị giới hạn hiệu quả bởi giới hạn trên của độ dài đầu ra trong tập dữ liệu SFT, mặc dù nó đã được tiếp xúc với các chuỗi dài hơn trong giai đoạn tiền đào tạo. Phát hiện này giải thích giới hạn tạo ra 2.000 từ phổ biến trên các mô hình hiện tại, vì các tập dữ liệu SFT hiện có hiếm khi chứa các ví dụ vượt quá độ dài này. Hơn nữa, vì nhiều tập dữ liệu được chưng cất từ các mô hình ngôn ngữ lớn hiện đại, chúng cũng kế thừa giới hạn độ dài đầu ra từ các mô hình nguồn.

Để giải quyết giới hạn này, LongWriter giới thiệu AgentWrite, một pipeline dựa trên tác nhân được thiết kế để tận dụng các mô hình ngôn ngữ lớn hiện có để tự động xây dựng dữ liệu SFT với đầu ra dài. AgentWrite hoạt động trong hai giai đoạn: Đầu tiên, nó tạo ra một kế hoạch viết chi tiết phác thảo cấu trúc và yêu cầu từ cho mỗi đoạn dựa trên đầu vào của người dùng. Sau đó, theo kế hoạch này, nó yêu cầu mô hình tạo ra nội dung cho mỗi đoạn một cách tuần tự, và LongWriter kết hợp các đoạn đầu ra để có được đầu ra cuối cùng dài. Cách tiếp cận này của việc chia một nhiệm vụ phức tạp thành nhiều nhiệm vụ con sử dụng các tác nhân ngôn ngữ đã được áp dụng trong các lĩnh vực khác nhau, chẳng hạn như giải quyết vấn đề, phát triển phần mềm và đánh giá mô hình. Công việc của LongWriter là đầu tiên khám phá tích hợp lập kế hoạch để cho phép mô hình hoàn thành các nhiệm vụ viết dài phức tạp. Mỗi bước của AgentWrite được giới thiệu chi tiết dưới đây.

Bước I: Lập kế hoạch

Lấy cảm hứng từ quá trình suy nghĩ của các nhà văn, những người thường bắt đầu bằng cách tạo ra một kế hoạch tổng thể cho các nhiệm vụ viết dài, LongWriter sử dụng khả năng lập kế hoạch của các mô hình ngôn ngữ lớn để tạo ra một bản phác thảo viết cho một hướng dẫn viết nhất định. Kế hoạch này bao gồm nội dung chính và yêu cầu từ cho mỗi đoạn. Yêu cầu được sử dụng bởi LongWriter là như sau:

“Tôi cần bạn giúp tôi chia nhỏ hướng dẫn viết dài sau thành nhiều nhiệm vụ con. Mỗi nhiệm vụ con sẽ hướng dẫn việc viết một đoạn trong bài viết và nên bao gồm các điểm chính và yêu cầu từ cho đoạn đó. Hướng dẫn viết là như sau: {Hướng dẫn người dùng}. Hãy chia nó thành định dạng sau, với mỗi nhiệm vụ con chiếm một dòng:

Đoạn 1 – Điểm chính: [Mô tả điểm chính của đoạn, chi tiết] – Số từ: [Yêu cầu từ, ví dụ 400 từ]
Đoạn 2 – Điểm chính: [Mô tả điểm chính của đoạn, chi tiết] – Số từ: [Yêu cầu từ, ví dụ 1000 từ].

Hãy đảm bảo rằng mỗi nhiệm vụ con rõ ràng và cụ thể, và tất cả các nhiệm vụ con bao gồm toàn bộ nội dung của hướng dẫn viết. Không chia các nhiệm vụ con quá nhỏ; mỗi đoạn của nhiệm vụ con nên không dưới 200 từ và không quá 1000 từ. Không xuất bất kỳ nội dung nào khác.”

Bước II: Viết

Sau khi nhận được kế hoạch viết từ Bước I, LongWriter gọi mô hình tuần tự để hoàn thành mỗi nhiệm vụ con, tạo ra nội dung viết phần sau phần. Để đảm bảo tính nhất quán của đầu ra, khi LongWriter gọi mô hình để tạo ra phần thứ n, các phần trước đó đã được tạo ra cũng được nhập, cho phép mô hình tiếp tục viết phần tiếp theo dựa trên lịch sử viết hiện có. Mặc dù cách tuần tự này ngăn cản việc gọi song song mô hình để hoàn thành nhiều nhiệm vụ con cùng một lúc, và độ dài nhập trở nên dài hơn, LongWriter cho thấy trong xác thực rằng tính nhất quán và chất lượng của việc viết thu được theo cách này vượt trội so với đầu ra được tạo ra song song. Yêu cầu được sử dụng bởi LongWriter là:

“Bạn là một trợ lý viết xuất sắc. Tôi sẽ đưa cho bạn một hướng dẫn viết ban đầu và các bước viết đã lên kế hoạch. Tôi cũng sẽ cung cấp cho bạn văn bản đã viết. Hãy giúp tôi tiếp tục viết đoạn tiếp theo dựa trên hướng dẫn viết, các bước viết và văn bản đã viết.

Hướng dẫn viết:
{Hướng dẫn người dùng}
Các bước viết:
{Kế hoạch viết được tạo ra ở Bước I}
Văn bản đã viết:
{Các đoạn trước đã được tạo ra}

Hãy tích hợp hướng dẫn viết, các bước viết và văn bản đã viết, và bây giờ hãy tiếp tục viết {Kế hoạch cho đoạn thứ n, tức là dòng thứ n trong kế hoạch viết}.”

Xác thực

LongWriter kiểm tra độ dài tạo ra và chất lượng của phương pháp AgentWrite được đề xuất trên hai tập dữ liệu viết dài. Tập dữ liệu đầu tiên, LongWrite-Ruler, được sử dụng để đo chính xác độ dài đầu ra mà phương pháp này có thể cung cấp. Tập dữ liệu thứ hai, LongBench-Write, chủ yếu được sử dụng để đánh giá chất lượng nội dung được tạo ra bởi mô hình so với hướng dẫn người dùng về độ dài và chất lượng viết.

LongBench-Write: Để đánh giá hiệu suất của mô hình trên một loạt các hướng dẫn viết dài đa dạng, LongWriter thu thập 120 hướng dẫn viết người dùng đa dạng, với 60 tiếng Anh và 60 tiếng Trung. Để đánh giá tốt hơn xem độ dài đầu ra của mô hình có đáp ứng yêu cầu của người dùng hay không, LongWriter đảm bảo rằng tất cả các hướng dẫn này bao gồm yêu cầu từ rõ ràng. Các hướng dẫn này được chia thành bốn tập con dựa trên yêu cầu từ: 0-500 từ, 500-2.000 từ, 2.000-4.000 từ và trên 4.000 từ. Ngoài ra, các hướng dẫn được phân loại thành bảy loại dựa trên loại đầu ra: Văn học và Viết sáng tạo, Học thuật và Sách chuyên khảo, Khoa học phổ thông, Viết chức năng, Báo cáo tin tức, Diễn đàn cộng đồng và Giáo dục và Đào tạo.

Trong quá trình đánh giá, LongWriter áp dụng hai chỉ số: một để chấm điểm độ dài đầu ra và một để chấm điểm chất lượng đầu ra. Độ dài đầu ra của mô hình được chấm điểm dựa trên mức độ gần gũi với yêu cầu được chỉ định trong hướng dẫn. Đối với chất lượng đầu ra, LongWriter sử dụng cách tiếp cận LLM-as-a-judge, chọn mô hình GPT-4o để chấm điểm đầu ra trên sáu chiều: Liên quan, Chính xác, Nhất quán, Rõ ràng, Chiều rộng và Độ sâu, và Trải nghiệm đọc. Điểm cuối cùng được tính bằng cách lấy trung bình của điểm độ dài và điểm chất lượng.

Kết quả xác thực: LongWriter trình bày kết quả đo độ dài đầu ra trên LongWrite-Ruler và tìm thấy rằng AgentWrite đã thành công trong việc mở rộng độ dài đầu ra của GPT-4o từ tối đa 2.000 từ lên đến khoảng 20.000 từ. LongWriter cũng đánh giá chất lượng đầu ra và sự tuân thủ độ dài đầu ra yêu cầu trên LongBench-Write, cho thấy GPT-4o có thể thành công trong việc hoàn thành các nhiệm vụ có đầu ra dưới 2.000 từ khi đánh giá hiệu suất của AgentWrite.

Tinh chỉnh giám sát

LongWriter tiến hành đào tạo dựa trên hai mô hình mã nguồn mở mới nhất, cụ thể là GLM-4-9B và Llama-3.1-8B. Cả hai mô hình này đều là mô hình cơ sở và hỗ trợ cửa sổ ngữ cảnh lên đến 128.000 token, khiến chúng phù hợp tự nhiên để đào tạo trên đầu ra dài. Để làm cho quá trình đào tạo hiệu quả hơn, LongWriter áp dụng đào tạo đóng gói với trọng số mất mát. Việc đào tạo trên hai mô hình này dẫn đến hai mô hình: LongWriter-9B (viết tắt cho GLM-4-9B-LongWriter) và LongWriter-8B (viết tắt cho Llama-3.1-8B-LongWriter).

Đồng thời, LongWriter nhận thấy rằng nếu mất mát được tính trung bình theo chuỗi, tức là lấy trung bình của mỗi chuỗi mất mát trung bình trong một lô, thì sự đóng góp của mỗi token mục tiêu cho mất mát trong dữ liệu đầu ra dài sẽ ít hơn đáng kể so với những dữ liệu có đầu ra ngắn hơn. Trong các thí nghiệm của LongWriter, cũng tìm thấy rằng điều này dẫn đến hiệu suất mô hình không tối ưu trên các nhiệm vụ có đầu ra dài. Do đó, LongWriter chọn chiến lược trọng số mất mát trung bình theo token, nơi mất mát được tính là trung bình của mất mát trên tất cả các token mục tiêu trong lô đó.

Tất cả các mô hình đều được đào tạo bằng cách sử dụng một nút có 8xH800 80G GPU và DeepSpeed+ZeRO3+CPU offloading. LongWriter sử dụng kích thước lô 8, tốc độ học 1e-5 và độ dài đóng gói 32.000. Các mô hình được đào tạo trong 4 kỷ, mất khoảng 2.500-3.000 bước.

Định hướng (DPO)

Để cải thiện hơn nữa chất lượng đầu ra của mô hình và tăng cường khả năng tuân thủ các giới hạn độ dài trong hướng dẫn, LongWriter thực hiện tối ưu hóa ưu tiên trực tiếp (DPO) trên mô hình LongWriter-9B đã được tinh chỉnh giám sát. Dữ liệu DPO đến từ dữ liệu trò chuyện DPO của GLM-4 (khoảng 50.000 mục nhập). Ngoài ra, LongWriter xây dựng 4.000 cặp dữ liệu nhằm vào các hướng dẫn viết dài. Đối với mỗi hướng dẫn viết, LongWriter lấy mẫu 4 đầu ra từ LongWriter-9B và chấm điểm các đầu ra này theo một phương pháp cụ thể. Một điểm theo dõi độ dài cũng được kết hợp như được tính. Đầu ra có điểm cao nhất sau đó được chọn làm mẫu dương, và một trong ba đầu ra còn lại được chọn ngẫu nhiên làm mẫu âm.

Mô hình kết quả, LongWriter-9B-DPO, được đào tạo trong 250 bước trên hỗn hợp dữ liệu trên. LongWriter tuân theo một công thức cụ thể cho đào tạo DPO.

LongWriter: Thí nghiệm và Kết quả

LongWriter đánh giá 4 mô hình độc quyền và 5 mô hình mã nguồn mở trên LongBench-Write, cùng với các mô hình LongWriter đã được đào tạo. Để tốt nhất của LongWriter’s kiến thức, Suri-IORPO là mô hình duy nhất trước đó cũng được căn chỉnh cho việc tạo văn bản dài. Nó được đào tạo dựa trên Mistral-7B-Instruct-v0.2 sử dụng LoRA. Tương thích với thiết lập đánh giá trên LongWrite-Ruler, LongWriter đặt nhiệt độ đầu ra 0,5 và cấu hình tham số token tối đa của mô hình để tạo ra tối đa được phép bởi cuộc gọi API của nó. Đối với các mô hình mã nguồn mở, nó được đặt thành 32.768.

Hầu hết các mô hình trước đó không thể đáp ứng yêu cầu độ dài trên 2.000 từ, trong khi các mô hình LongWriter cung cấp các phản hồi dài hơn và phong phú hơn cho các yêu cầu như vậy.

Quan sát điểm số độ dài đầu ra SlS_lSl cho các yêu cầu trong mỗi phạm vi độ dài yêu cầu, LongWriter tìm thấy rằng các mô hình trước đó thường hoạt động kém (điểm dưới 70) trên các yêu cầu trong phạm vi [2.000, 4.000) từ, với chỉ Claude 3.5 Sonnet đạt được điểm tốt. Đối với các yêu cầu trong phạm vi [4.000, 20.000) từ, hầu như tất cả các mô hình trước đó đều không thể đạt được độ dài đầu ra yêu cầu, thậm chí đạt điểm 0 (nghĩa là tất cả độ dài đầu ra đều dưới một phần ba độ dài yêu cầu). Bằng cách thêm dữ liệu đào tạo từ LongWriter-6k, mô hình LongWriter đã đào tạo có thể đạt được độ dài đầu ra yêu cầu trong khi vẫn duy trì chất lượng tốt, như được đề xuất bởi các điểm trong phạm vi [2.000, 20.000) từ và các biểu đồ phân tán.

DPO cải thiện hiệu quả cả chất lượng đầu ra và khả năng tuân thủ yêu cầu độ dài trong tạo văn bản dài.

Bằng cách so sánh điểm số của LongWriter-9B và LongWriter-9B-DPO, chúng tôi tìm thấy rằng DPO cải thiện đáng kể cả điểm Sl (+4%) và điểm Sq (+3%), và sự cải thiện này nhất quán trên tất cả các phạm vi. Điều này cho thấy rằng trong kịch bản tạo văn bản dài, DPO vẫn giúp cải thiện chất lượng đầu ra của mô hình và có thể căn chỉnh tốt hơn độ dài đầu ra của mô hình với yêu cầu độ dài. Kết luận sau cũng đã được quan sát gần đây trong Yuan et al. (2024) trong các tạo văn bản ngắn hơn. Chúng tôi cũng chú thích thủ công các chiến thắng và thất bại của cặp GPT-4o và ba mô hình LongWriter trên đầu ra của chúng trong LongBench-Write và trực quan hóa kết quả trong Hình 9. Chúng tôi có thể thấy rằng con người thích mô hình được đào tạo DPO hơn LongWriter-9B trong 58% trường hợp. Hơn nữa, mặc dù có ít tham số hơn, LongWriter-9B-DPO đạt được sự hòa giải với GPT-4o.

Giới hạn độ dài đầu ra của các mô hình LongWriter được mở rộng đến giữa 10.000 và 20.000 từ, trong khi cần nhiều dữ liệu có đầu ra dài hơn để hỗ trợ các đầu ra dài hơn.

Theo sau thử nghiệm LongWrite-Ruler, chúng tôi cũng trình bày kết quả thử nghiệm LongWrite-Ruler của các mô hình LongWriter. Kết quả cho thấy độ dài tạo ra tối đa của chúng nằm giữa 10.000 và 20.000 từ. Sự thiếu hụt dữ liệu SFT với đầu ra dài hơn có thể là lý do chính khiến mô hình không đạt được độ dài đầu ra dài hơn.

 

Suy nghĩ cuối cùng

Trong công việc này, chúng tôi đã nói về LongWriter, một pipeline dựa trên tác nhân phân chia các nhiệm vụ tạo ra siêu dài thành các nhiệm vụ con, xác định giới hạn tạo ra 2.000 từ cho các mô hình ngôn ngữ lớn hiện tại và đề xuất tăng độ dài đầu ra của chúng bằng cách thêm dữ liệu đầu ra dài trong quá trình căn chỉnh. Để tự động xây dựng dữ liệu đầu ra dài, LongWriter phát triển AgentWrite, một pipeline dựa trên tác nhân sử dụng các mô hình ngôn ngữ lớn hiện có để tạo ra các đầu ra dài và nhất quán. LongWriter đã thành công trong việc mở rộng độ dài đầu ra của các mô hình ngôn ngữ lớn hiện tại lên hơn 10.000 từ với tập dữ liệu LongWriter-6k được xây dựng. Các nghiên cứu phân tích sâu về dữ liệu đào tạo chứng minh tính hiệu quả của cách tiếp cận này. Đối với công việc trong tương lai, LongWriter đề xuất ba hướng sau: 1. Mở rộng khuôn khổ AgentWrite để xây dựng dữ liệu với đầu ra dài hơn nhằm mở rộng độ dài đầu ra của các mô hình ngôn ngữ lớn. 2. Tinh chỉnh khuôn khổ AgentWrite để đạt được chất lượng đầu ra dài cao hơn. 3. Đầu ra mô hình dài hơn mang lại thách thức cho hiệu suất suy luận. Một số phương pháp đã được đề xuất để cải thiện hiệu suất suy luận. Điều đáng để điều tra là làm thế nào những phương pháp này có thể đảm bảo hiệu suất mô hình được cải thiện mà không ảnh hưởng đến chất lượng tạo ra.

"Một kỹ sư theo nghề nghiệp, một nhà văn theo trái tim". Kunal là một nhà văn kỹ thuật với tình yêu và hiểu biết sâu sắc về AI và ML, dành để đơn giản hóa các khái niệm phức tạp trong các lĩnh vực này thông qua tài liệu hấp dẫn và thông tin của mình.