Mô hình và nền tảng AI
EUREKA: Thiết Kế Phần Thưởng Cấp Độ Con Người Thông Qua Lập Trình Mô Hình Ngôn Ngữ Lớn
Với sự phát triển của các mô hình ngôn ngữ lớn trong những năm gần đây, không có gì ngạc nhiên khi các khung khổ này excels như các nhà lập kế hoạch ngữ nghĩa cho các nhiệm vụ ra quyết định cấp cao tuần tự. Tuy nhiên, các nhà phát triển vẫn gặp khó khăn khi tận dụng tối đa tiềm năng của các khung khổ mô hình ngôn ngữ lớn để học các nhiệm vụ thao túng cấp thấp phức tạp. Mặc dù hiệu quả, các mô hình ngôn ngữ lớn hiện nay đòi hỏi kiến thức chuyên môn và chuyên sâu về lĩnh vực và chủ đề để học thậm chí các kỹ năng đơn giản hoặc xây dựng các lời nhắc văn bản, tạo ra một khoảng cách đáng kể giữa hiệu suất của chúng và sự khéo léo của con người.
Để bắc cầu khoảng cách này, các nhà phát triển từ Nvidia (NVDA ), CalTech, UPenn và các tổ chức khác đã giới thiệu EUREKA, một thuật toán thiết kế cấp độ con người được hỗ trợ bởi mô hình ngôn ngữ lớn. EUREKA nhằm tận dụng các khả năng của các khung khổ mô hình ngôn ngữ lớn, bao gồm viết mã, cải tiến ngữ cảnh và tạo nội dung không có trước, để thực hiện tối ưu hóa chưa từng có của mã phần thưởng. Các mã phần thưởng này, kết hợp với học tăng cường, cho phép các khung khổ học các kỹ năng phức tạp hoặc thực hiện các nhiệm vụ thao túng.
Trong bài viết này, chúng tôi sẽ khám phá khuôn khổ EUREKA từ góc độ phát triển, khám phá khuôn khổ, cách thức hoạt động và kết quả mà nó đạt được trong việc tạo ra các hàm phần thưởng. Những hàm này, như các nhà phát triển tuyên bố, vượt trội so với những hàm được tạo ra bởi con người. Chúng tôi cũng sẽ tìm hiểu cách khuôn khổ EUREKA mở ra một cách tiếp cận mới để RLHF (Học tăng cường bằng phản hồi của con người) bằng cách cho phép học không cần gradient trong ngữ cảnh. Hãy bắt đầu.
EUREKA : Giới Thiệu
Ngày nay, các khung khổ mô hình ngôn ngữ lớn hiện đại như GPT-3 và GPT-4 mang lại kết quả vượt trội khi phục vụ như các nhà lập kế hoạch ngữ nghĩa cho các nhiệm vụ ra quyết định cấp cao tuần tự, nhưng các nhà phát triển vẫn đang tìm cách cải thiện hiệu suất của chúng khi học các nhiệm vụ thao túng cấp thấp như kỹ năng quay bút. Hơn nữa, các nhà phát triển đã quan sát thấy rằng học tăng cường có thể được sử dụng để đạt được kết quả bền vững trong điều kiện khéo léo và các lĩnh vực khác, với điều kiện là các hàm phần thưởng được thiết kế cẩn thận bởi các nhà thiết kế con người và các hàm này có khả năng cung cấp tín hiệu học tập cho các hành vi thuận lợi. Khi so sánh với các nhiệm vụ học tăng cường thực tế chấp nhận phần thưởng thưa thớt, việc tạo hình các phần thưởng này cung cấp các tín hiệu học tập tăng dần cần thiết. Hơn nữa, các hàm phần thưởng, mặc dù quan trọng, rất khó thiết kế và các thiết kế không tối ưu của các hàm này thường dẫn đến các hành vi không mong muốn.

Để giải quyết những thách thức này và tối đa hóa hiệu quả của các token phần thưởng, khuôn khổ EUREKA hoặc Evolution-driven Universal REward Kit cho Agent nhằm thực hiện các đóng góp sau.
- Đạt được hiệu suất cấp độ con người trong việc thiết kế các hàm phần thưởng.
- Giải quyết hiệu quả các nhiệm vụ thao túng mà không cần kỹ thuật phần thưởng thủ công.
- Tạo ra các hàm phần thưởng được căn chỉnh với con người và hiệu suất cao hơn bằng cách giới thiệu một cách tiếp cận học không cần gradient trong ngữ cảnh mới thay cho phương pháp RLHF truyền thống hoặc Học tăng cường bằng phản hồi của con người.
Có ba lựa chọn thiết kế thuật toán chính mà các nhà phát triển đã chọn để tăng tính tổng quát của EUREKA: tìm kiếm tiến hóa, môi trường như ngữ cảnh và phản ánh phần thưởng. Đầu tiên, khuôn khổ EUREKA lấy mã nguồn môi trường làm ngữ cảnh để tạo ra các hàm phần thưởng có thể thực thi trong một môi trường không có trước. Sau đó, khuôn khổ thực hiện tìm kiếm tiến hóa để cải thiện chất lượng của các phần thưởng của nó đáng kể, đề xuất các lô ứng viên phần thưởng với mỗi lần lặp lại hoặc kỷ và tinh chỉnh những ứng viên mà nó tìm thấy là hứa hẹn nhất. Trong giai đoạn thứ ba và cuối cùng, khuôn khổ sử dụng phương pháp phản ánh phần thưởng để làm cho việc cải tiến các phần thưởng trong ngữ cảnh hiệu quả hơn, một quá trình cuối cùng giúp khuôn khổ cho phép chỉnh sửa và tự động hóa phần thưởng được nhắm mục tiêu bằng cách sử dụng tóm tắt văn bản về chất lượng của các phần thưởng dựa trên thống kê đào tạo chính sách. Hình ảnh sau đây cung cấp một cái nhìn tổng quan về cách khuôn khổ EUREKA hoạt động và trong phần tiếp theo, chúng tôi sẽ thảo luận về kiến trúc và hoạt động chi tiết hơn.

EUREKA : Kiến Trúc Mô Hình và Cài Đặt Vấn Đề
Mục tiêu chính của việc tạo hình phần thưởng là trả về một hàm phần thưởng được tạo hình hoặc chỉnh sửa cho một hàm phần thưởng thực, điều này có thể gây khó khăn khi được tối ưu hóa trực tiếp như phần thưởng thưa thớt. Hơn nữa, các nhà thiết kế chỉ có thể truy cập các hàm phần thưởng thực bằng cách sử dụng các truy vấn, đó là lý do tại sao khuôn khổ EUREKA chọn tạo phần thưởng, một môi trường tổng hợp chương trình dựa trên RDP hoặc Vấn đề Thiết Kế Phần Thưởng.
Vấn đề Thiết Kế Phần Thưởng hoặc RDP là một tuple chứa một mô hình thế giới với không gian trạng thái, không gian cho các hàm phần thưởng, một hàm chuyển đổi và không gian hành động. Một thuật toán học sau đó tối ưu hóa các phần thưởng bằng cách tạo ra một chính sách dẫn đến một quá trình quyết định Markov, có thể chỉ được truy cập bằng cách sử dụng các truy vấn chính sách. Mục tiêu chính của RDP là đầu ra một hàm phần thưởng theo cách mà chính sách có thể đạt được điểm phù hợp tối đa. Trong cài đặt vấn đề của EUREKA, các nhà phát triển đã chỉ định từng thành phần trong Vấn đề Thiết Kế Phần Thưởng bằng mã. Hơn nữa, đối với một chuỗi cho trước chỉ định chi tiết của nhiệm vụ, mục tiêu chính của vấn đề tạo phần thưởng là tạo ra mã hàm phần thưởng để tối đa hóa điểm phù hợp.
Tiếp theo, tại lõi của nó, có ba thành phần thuật toán cơ bản trong khuôn khổ EUREKA. Tìm kiếm tiến hóa (đề xuất và tinh chỉnh ứng viên lặp lại), môi trường như ngữ cảnh (tạo phần thưởng có thể thực thi trong môi trường không có trước) và phản ánh phần thưởng (cho phép cải tiến tinh vi của phần thưởng). Mã giả cho thuật toán được minh họa trong hình ảnh sau.

Môi Trường Như Ngữ Cảnh
Hiện tại, các khung khổ mô hình ngôn ngữ lớn cần thông số kỹ thuật môi trường làm đầu vào để thiết kế phần thưởng, trong khi khuôn khổ EUREKA đề xuất cung cấp mã nguồn môi trường trực tiếp làm ngữ cảnh, mà không cần mã phần thưởng, cho phép các khung khổ mô hình ngôn ngữ lớn lấy mô hình thế giới làm ngữ cảnh. Cách tiếp cận được theo bởi EUREKA có hai lợi ích chính. Đầu tiên, các khung khổ mô hình ngôn ngữ lớn cho mục đích mã hóa được đào tạo trên các tập mã bản địa được viết trong các ngôn ngữ lập trình hiện có như C, C++, Python, Java và nhiều hơn, điều này là lý do tại sao chúng tốt hơn trong việc tạo ra mã đầu ra khi chúng được phép tạo mã trực tiếp trong cú pháp và phong cách mà chúng đã được đào tạo ban đầu. Thứ hai, sử dụng mã nguồn môi trường thường tiết lộ môi trường liên quan về mặt ngữ nghĩa và các biến phù hợp cho việc sử dụng để tạo ra một hàm phần thưởng theo nhiệm vụ được chỉ định. Dựa trên những hiểu biết này, khuôn khổ EUREKA hướng dẫn mô hình ngôn ngữ lớn để trả về mã Python có thể thực thi trực tiếp với sự giúp đỡ của chỉ các mẹo định dạng và thiết kế phần thưởng chung.
Tìm Kiếm Tiến Hóa
Việc bao gồm tìm kiếm tiến hóa trong khuôn khổ EUREKA nhằm cung cấp một giải pháp tự nhiên cho các thách thức về tính tối ưu và lỗi trong quá trình thực hiện như đã đề cập trước đó. Với mỗi lần lặp lại hoặc kỷ, khuôn khổ tạo ra các đầu ra độc lập từ mô hình ngôn ngữ lớn và nếu các thế hệ là tất cả các biến thể độc lập, nó giảm thiểu theo cấp số nhân khả năng các hàm phần thưởng trong quá trình lặp lại bị lỗi cho số lượng mẫu tăng lên với mỗi kỷ.
Trong bước tiếp theo, khuôn khổ EUREKA sử dụng các hàm phần thưởng có thể thực thi từ lần lặp lại trước để thực hiện một đột biến phần thưởng trong ngữ cảnh và sau đó đề xuất một hàm phần thưởng mới và cải tiến dựa trên phản hồi văn bản. Khi kết hợp với khả năng cải tiến trong ngữ cảnh và khả năng theo dõi hướng dẫn của mô hình ngôn ngữ lớn, khuôn khổ EUREKA có thể chỉ định toán tử đột biến như một lời nhắc văn bản và đề xuất một phương pháp để sử dụng tóm tắt văn bản của đào tạo chính sách để sửa đổi mã phần thưởng hiện có.
Phản Ánh Phần Thưởng
Để làm nền cho các đột biến phần thưởng trong ngữ cảnh, điều quan trọng là phải đánh giá chất lượng của các phần thưởng được tạo ra và quan trọng hơn, đưa chúng vào lời, và khuôn khổ EUREKA giải quyết vấn đề này bằng cách sử dụng chiến lược đơn giản là cung cấp các điểm số số như đánh giá phần thưởng. Khi hàm fitness của nhiệm vụ phục vụ như một metric toàn diện cho thực tế, nó thiếu việc phân bổ tín dụng và không thể cung cấp bất kỳ thông tin có giá trị nào về lý do tại sao hàm phần thưởng hoạt động hoặc tại sao nó không hoạt động. Vì vậy, trong một nỗ lực để cung cấp một chẩn đoán phần thưởng được nhắm mục tiêu và tinh vi hơn, khuôn khổ đề xuất sử dụng phản hồi tự động để tóm tắt động lực đào tạo chính sách trong văn bản. Hơn nữa, trong chương trình phần thưởng, các hàm phần thưởng trong khuôn khổ EUREKA được yêu cầu暴 lộ các thành phần riêng lẻ, cho phép khuôn khổ theo dõi các giá trị scalar của mỗi thành phần phần thưởng duy nhất tại các điểm kiểm tra chính sách trong toàn bộ giai đoạn đào tạo.

Mặc dù quy trình hàm phần thưởng được theo bởi khuôn khổ EUREKA là đơn giản để xây dựng, nó là thiết yếu do tính chất phụ thuộc thuật toán của việc tối ưu hóa phần thưởng. Điều này có nghĩa là hiệu quả của một hàm phần thưởng được ảnh hưởng trực tiếp bởi lựa chọn thuật toán học tăng cường và với sự thay đổi của siêu tham số, phần thưởng có thể hoạt động khác nhau thậm chí với cùng một bộ tối ưu hóa. Vì vậy, khuôn khổ EUREKA có thể chỉnh sửa các bản ghi một cách hiệu quả và có chọn lọc hơn trong khi tổng hợp các hàm phần thưởng có sự tương tác tăng cường với thuật toán học tăng cường.
Đào Tạo và Baseline
Có hai thành phần đào tạo chính của khuôn khổ EUREKA: Đào Tạo Chính Sách và Đánh Giá Phần Thưởng.
Đào Tạo Chính Sách
Các hàm phần thưởng cuối cùng cho mỗi nhiệm vụ được tối ưu hóa bằng cách sử dụng cùng một thuật toán học tăng cường bằng cách sử dụng cùng một tập hợp siêu tham số được tinh chỉnh để làm cho các phần thưởng được thiết kế bởi con người hoạt động tốt.
Đánh Giá Phần Thưởng
Khi metric nhiệm vụ thay đổi về thang và ý nghĩa ngữ nghĩa với mỗi nhiệm vụ, khuôn khổ EUREKA báo cáo điểm số được chuẩn hóa của con người, một metric cung cấp một thước đo toàn diện để khuôn khổ so sánh hiệu suất của nó với các phần thưởng được tạo ra bởi con người theo các metric thực tế.
Tiếp theo, có ba baseline chính: L2R, Con Người, và Thưa Thớt.
L2R
L2R là một giải pháp nhắc mô hình ngôn ngữ lớn hai giai đoạn giúp tạo ra các phần thưởng được tạo mẫu. Đầu tiên, một khuôn khổ mô hình ngôn ngữ lớn điền vào một mẫu ngôn ngữ tự nhiên cho môi trường và nhiệm vụ được chỉ định trong ngôn ngữ tự nhiên và sau đó một khuôn khổ mô hình ngôn ngữ lớn thứ hai chuyển đổi “mô tả chuyển động” này thành mã để viết một hàm phần thưởng bằng cách gọi một tập hợp các hàm API phần thưởng được viết thủ công.
Con Người
Baseline Con Người là các hàm phần thưởng gốc được viết bởi các nhà nghiên cứu học tăng cường, do đó đại diện cho kết quả của kỹ thuật phần thưởng con người ở mức độ chưa từng có.
Thưa Thớt
Baseline Thưa Thớt giống như các hàm fitness và chúng được sử dụng để đánh giá chất lượng của các phần thưởng mà khuôn khổ tạo ra.
Kết Quả và Kết Luận
Để phân tích hiệu suất của khuôn khổ EUREKA, chúng tôi sẽ đánh giá nó trên các tham số khác nhau bao gồm hiệu suất của nó so với phần thưởng con người, cải tiến kết quả theo thời gian, tạo ra các phần thưởng mới, cho phép cải tiến được nhắm mục tiêu và làm việc với Phản Hồi Con Người.
EUREKA Vượt Trội So Với Phần Thưởng Con Người
Hình ảnh sau minh họa kết quả tổng hợp trên các chuẩn mực khác nhau và như có thể quan sát rõ ràng, khuôn khổ EUREKA hoặc vượt trội hoặc hoạt động tương đương với phần thưởng cấp độ con người trên cả nhiệm vụ Dexterity và Issac. So sánh, baseline L2R mang lại hiệu suất tương tự trên các nhiệm vụ thấp chiều nhưng khi nói đến các nhiệm vụ cao chiều, khoảng cách về hiệu suất là khá đáng kể.

Cải Thiện Liên Tục Theo Thời Gian
Một trong những điểm nổi bật chính của khuôn khổ EUREKA là khả năng cải tiến liên tục và tăng hiệu suất của nó theo thời gian với mỗi lần lặp lại và kết quả được minh họa trong hình dưới đây.

Như có thể thấy rõ, khuôn khổ liên tục tạo ra các phần thưởng tốt hơn với mỗi lần lặp lại và nó cũng cải tiến và cuối cùng vượt trội so với hiệu suất của phần thưởng con người, nhờ vào việc sử dụng phương pháp tìm kiếm phần thưởng tiến hóa trong ngữ cảnh.
Tạo Ra Các Phần Thưởng Mới
Tính mới của các phần thưởng của khuôn khổ EUREKA có thể được đánh giá bằng cách tính toán mối tương quan giữa phần thưởng con người và EUREKA trên toàn bộ nhiệm vụ Issac. Những mối tương quan này sau đó được vẽ trên một biểu đồ hoặc bản đồ chống lại các điểm số được chuẩn hóa của con người, với mỗi điểm trên biểu đồ đại diện cho một phần thưởng EUREKA riêng cho mỗi nhiệm vụ. Như có thể thấy rõ, khuôn khổ EUREKA chủ yếu tạo ra các hàm phần thưởng tương quan yếu vượt trội so với các hàm phần thưởng con người.

Cho Phép Cải Thiện Được Nhắm Mục Tiêu
Để đánh giá tầm quan trọng của việc thêm phản ánh phần thưởng vào phản hồi phần thưởng, các nhà phát triển đã đánh giá một baseline, một khuôn khổ EUREKA không có phản ánh phần thưởng giảm các lời nhắc phản hồi chỉ bao gồm các giá trị snapshot. Khi chạy các nhiệm vụ Issac, các nhà phát triển quan sát thấy rằng không có phản ánh phần thưởng, khuôn khổ EUREKA chứng kiến sự giảm 29% trong điểm số được chuẩn hóa trung bình.
Làm Việc Với Phản Hồi Con Người
Để kết hợp một loạt các đầu vào để tạo ra các hàm phần thưởng được căn chỉnh với con người và hiệu suất cao hơn, khuôn khổ EUREKA ngoài thiết kế phần thưởng tự động cũng giới thiệu một cách tiếp cận học không cần gradient trong ngữ cảnh mới để Học tăng cường bằng Phản hồi của Con người và có hai quan sát đáng kể.
- EUREKA có thể được cải tiến và hưởng lợi từ các phần thưởng con người.
- Sử dụng phản hồi con người cho phản ánh phần thưởng gây ra hành vi được căn chỉnh.

Hình ảnh trên minh họa cách khuôn khổ EUREKA thể hiện một sự cải tiến đáng kể về hiệu suất và hiệu quả khi sử dụng khởi tạo phần thưởng con người, bất kể chất lượng của phần thưởng con người, cho thấy chất lượng của phần thưởng cơ bản không có tác động đáng kể đến khả năng cải tiến phần thưởng trong ngữ cảnh của khuôn khổ.

Hình ảnh trên minh họa cách khuôn khổ EUREKA không chỉ gây ra các chính sách được căn chỉnh với con người hơn mà còn sửa đổi các phần thưởng bằng cách kết hợp phản hồi con người.
Suy Nghĩ Cuối Cùng
Trong bài viết này, chúng tôi đã thảo luận về EUREKA, một thuật toán thiết kế cấp độ con người được hỗ trợ bởi mô hình ngôn ngữ lớn, nhằm tận dụng các khả năng của các khung khổ mô hình ngôn ngữ lớn, bao gồm viết mã, cải tiến trong ngữ cảnh và tạo nội dung không có trước, để thực hiện tối ưu hóa chưa từng có của mã phần thưởng. Mã phần thưởng này, kết hợp với học tăng cường, có thể được sử dụng bởi các khung khổ để học các kỹ năng phức tạp hoặc thực hiện các nhiệm vụ thao túng. Không cần can thiệp của con người hoặc kỹ thuật nhắc cụ thể, khuôn khổ mang lại khả năng tạo phần thưởng cấp độ con người trên một loạt các nhiệm vụ và điểm mạnh chính của nó nằm ở việc học các nhiệm vụ phức tạp với một cách tiếp cận học có chương trình.
Tổng thể, hiệu suất đáng kể và tính linh hoạt của khuôn khổ EUREKA cho thấy tiềm năng của việc kết hợp các thuật toán tiến hóa với các mô hình ngôn ngữ lớn có thể dẫn đến một cách tiếp cận có thể mở rộng và tổng quát để thiết kế phần thưởng và hiểu biết này có thể được áp dụng cho các vấn đề tìm kiếm mở khác.












