Mô hình và nền tảng AI

Zephyr-7B: Giới Thiệu Về Chưng Cất Trực Tiếp Của Sự Liên Kết Trong Mô Hình Ngôn Ngữ

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Khả năng và hiệu suất của các mô hình ngôn ngữ lớn mở nhỏ đã tiến bộ đáng kể trong những năm gần đây, và chúng ta đã chứng kiến sự tiến bộ từ các mô hình GPT-2 đầu tiên đến các khuôn khổ LLM nhỏ gọn, chính xác và hiệu quả hơn, sử dụng một lượng token lớn hơn nhiều so với số token “tối ưu về tính toán” được khuyến nghị bởi các luật chia tỷ lệ Chinchilla. Hơn nữa, các nhà phát triển đã chứng minh rằng các khuôn khổ LLM nhỏ này có thể được đào tạo thêm bằng cách sử dụng phương pháp dSFT hoặc tinh chỉnh giám sát phân hủy, một phương pháp sử dụng đầu ra từ một mô hình giáo viên hiệu quả làm dữ liệu giám sát cho mô hình học sinh trong một nỗ lực để tăng độ chính xác.

Trong bài viết này, chúng ta sẽ thảo luận về khuôn khổ Zephyr-7B, một khuôn khổ chuẩn mực trò chuyện cho các mô hình 7B tham số không yêu cầu chú thích của con người. Mục tiêu chính của khuôn khổ này là cho phép các nhà phát triển tạo ra các mô hình ngôn ngữ lớn nhỏ hơn được liên kết với ý định của người dùng chặt chẽ hơn bao giờ hết. Khuôn khổ Zephyr-7B không chỉ kiểm tra việc áp dụng các phương pháp hiện tại cho các khuôn khổ LLM lớn hơn như dSFT, mà còn khám phá khả năng sử dụng các phương pháp khác để học một mô hình trò chuyện với sự liên kết tốt hơn với ý định của người dùng.

Zephyr-7B: Giới Thiệu Về Chưng Cất Trực Tiếp Của Sự Liên Kết Trong Mô Hình Ngôn Ngữ

Như đã đề cập trước đó, các mô hình ngôn ngữ đã tiến bộ nhanh chóng trong những năm gần đây, từ các khuôn khổ GPT-2 đầu tiên đến các khuôn khổ LLM hiện tại như GPT-4 và MiniGPT-5, mặc dù chúng rất tốn token, nhưng hiện tại chúng chính xác và hiệu quả hơn. Một điểm nổi bật chính của các khuôn khổ LLM tiên tiến này là chúng kết hợp một lượng token lớn hơn nhiều so với số token được coi là tối ưu về tính toán theo các luật chia tỷ lệ Chinchilla.

Sự liên kết ý định luôn là một thách thức lớn đối với các nhà phát triển, với các công việc gần đây tập trung vào việc phát triển các chuẩn mực như AlpacaEval và MT-Bench được thiết kế để nhắm vào sự không liên kết. Động lực để phát triển khuôn khổ Zephyr có thể được quy cho vấn đề sử dụng phân hủy để liên kết một khuôn khổ LLM nhỏ mở hoàn toàn, trong đó bước chính là sử dụng phản hồi trí tuệ nhân tạo để thu thập dữ liệu ưu tiên từ một tập hợp các mô hình giáo viên, và sau đó áp dụng tối ưu hóa ưu tiên phân hủy trực tiếp như mục tiêu học chính, một phương pháp được gọi là dDPO hoặc tối ưu hóa chính sách phân hủy nhiễu.

Các nhà phát triển đã phát triển khuôn khổ Zephyr-7B để xác thực phương pháp này, và theo một số cách, nó là một phiên bản liên kết của khuôn khổ Mistral-7B hiện tại. Khuôn khổ đầu tiên sử dụng dSFT hoặc tinh chỉnh giám sát phân hủy dựa trên tập dữ liệu UltraChat, và áp dụng phương pháp dDPO hoặc tối ưu hóa chính sách phân hủy nhiễu trên dữ liệu phản hồi.

Hình ảnh trên cho thấy hiệu suất của các mô hình ngôn ngữ khác nhau trên chuẩn mực MT-bench. Khuôn khổ Zephyr-7B được đào tạo bằng phương pháp dDPO được so sánh với các mô hình ngôn ngữ lớn độc quyền và mở, lớn hơn, được đào tạo bằng học tăng cường thêm và bao gồm một lượng lớn phản hồi của con người.

Zephyr-7B: Phương Pháp, Hoạt Động và Kiến Trúc

Mục tiêu chính của khuôn khổ Zephyr-7B là giúp một mô hình ngôn ngữ lớn mở liên kết với ý định của người dùng càng gần càng tốt, và trong toàn bộ quá trình, khuôn khổ Zephyr-7B giả định quyền truy cập vào một mô hình giáo viên lớn được truy vấn bằng cách tạo.prompt.

dSFT hoặc Tinh Chỉnh Giám Sát Phân Hủy

Khuôn khổ bắt đầu với một mô hình ngôn ngữ lớn thô cần được đào tạo để phản hồi các prompt của người dùng. Thông thường, đào tạo các khuôn khổ LLM này để phản hồi các prompt của người dùng được thực hiện bằng cách tinh chỉnh giám sát trên một tập dữ liệu gồm các hướng dẫn chất lượng cao và các phản hồi tương ứng.

Phản Hồi Trí Tuệ Nhân Tạo Thông Qua Ưu Tiên

Phản hồi của con người được sử dụng để gán nhãn cho các mô hình ngôn ngữ lớn vì chúng có thể cung cấp các tín hiệu bổ sung cần thiết, và các phản hồi của con người này truyền thống được cung cấp thông qua các ưu tiên về chất lượng của các phản hồi được tạo bởi các khuôn khổ LLM.

dDPO hoặc Tối Ưu Hóa Chính Sách Phân Hủy Trực Tiếp

dDPO là bước cuối cùng của khuôn khổ Zephyr, và mục tiêu chính của nó là tinh chỉnh mô hình giáo viên dSFT bằng cách tối đa hóa xác suất xếp hạng phản hồi được ưu tiên trong một mô hình ưu tiên được xác định bởi một hàm phần thưởng bằng cách sử dụng mô hình ngôn ngữ học sinh.

Zephyr-7B: Thử Nghiệm, Chuẩn Mực và Kết Quả

Khuon khổ Zephyr tiến hành các thí nghiệm tinh chỉnh trên khuôn khổ Mistral-7B hiện tại, cung cấp hiệu suất tương đương với các mô hình ngôn ngữ lớn hơn trên một loạt các nhiệm vụ xử lý ngôn ngữ tự nhiên.

Tập Dữ Liệu

Khuon khổ Zephyr sử dụng hai tập dữ liệu hội thoại được phân hủy từ một hỗn hợp của các mô hình độc quyền và mở, đã chứng minh hiệu quả trong việc tạo ra các mô hình trò chuyện hiệu quả.

UltraChat

UltraChat là một tập dữ liệu tự hoàn thiện bao gồm gần 1,5 triệu hội thoại đa lượt trên 30 chủ đề và 20 tài liệu văn bản được tạo bởi khuôn khổ GPT-3.5-Turbo.

UltraFeedback

UltraFeedback là một tập dữ liệu prompt với hơn 64k prompt, mỗi prompt có bốn phản hồi LLM riêng biệt.

Đánh Giá

Để đánh giá hiệu suất của khuôn khổ Zephyr, các nhà phát triển đã chọn hai chuẩn mực trò chuyện, một lượt đơn và một lượt đa, để đánh giá khả năng của mô hình trong việc tuân theo các hướng dẫn của người dùng và phản hồi tương ứng.

MT-Bench

Chuẩn mực MT-Bench bao gồm 160 câu hỏi trên tám lĩnh vực kiến thức độc đáo, và dưới chuẩn mực MT-Bench, mô hình phải trả lời một câu hỏi ban đầu và cung cấp một phản hồi về câu hỏi tiếp theo.

AlpacaEval

AlpacaEval là một chuẩn mực lượt đơn, trong đó khuôn khổ hoặc mô hình tạo ra các phản hồi của người dùng cho hơn 800 câu hỏi trên các chủ đề khác nhau, với重点 chính là về sự hữu ích.

Kết Quả

Hãy cùng xem khuôn khổ Zephyr-7B hoạt động và so sánh với các mô hình ngôn ngữ hiện tại như thế nào.

Triển Khai Phương Pháp dDPO Tăng Cường Khả Năng Trò Chuyện

Bảng sau so sánh hiệu suất của khuôn khổ Zephyr-7B với các mô hình ngôn ngữ hiện tại trên các chuẩn mực AlpacaEval và MT-Bench.

dDPO Tăng Cường Hiệu Suất Nhiệm Vụ Học Thuật

Hình ảnh sau so sánh hiệu suất của khuôn khổ Zephyr-7B với một loạt các khuôn khổ LLM mở và độc quyền.

Tối Ưu Hóa Ưu Tiên

Trong hình ảnh sau, chúng ta đánh giá cách các bước khác nhau trong quá trình liên kết ảnh hưởng đến hiệu suất.

Kết Luận

Trong bài viết này, chúng ta đã thảo luận về khuôn khổ Zephyr-7B dựa trên khuôn khổ Mistral-7B hiện tại, nhằm giải quyết thách thức hiện tại của việc liên kết phân hủy từ một mô hình ngôn ngữ lớn đến một khuôn khổ tiền đào tạo nhỏ hơn.

Tuy nhiên, mặc dù có những kết quả đầy hứa hẹn, khuôn khổ Zephyr-7B không hoàn hảo và vẫn cần một số công việc. Một trong những hạn chế rõ ràng là sử dụng khuôn khổ GPT-4 để đánh giá các chuẩn mực MT-Bench và AlpacaEval, thường bị thiên vị về các mô hình mà nó phân hủy. Tuy nhiên, khuôn khổ Zephyr-7B hy vọng sẽ mở ra một con đường để khám phá khả năng của các mô hình mở nhỏ hơn có thể liên kết với ý định và tương tác của người dùng.

"Một kỹ sư theo nghề nghiệp, một nhà văn theo trái tim". Kunal là một nhà văn kỹ thuật với tình yêu và hiểu biết sâu sắc về AI và ML, dành để đơn giản hóa các khái niệm phức tạp trong các lĩnh vực này thông qua tài liệu hấp dẫn và thông tin của mình.