Kỹ thuật prompt
Beyond Chain-of-Thought: Cách Thought Preference Optimization đang phát triển LLMs

Một kỹ thuật mới đột phá, được phát triển bởi một nhóm các nhà nghiên cứu từ Meta, UC Berkeley và NYU, hứa hẹn sẽ nâng cao cách các hệ thống AI tiếp cận các nhiệm vụ chung. Được biết đến với tên gọi “Thought Preference Optimization” (TPO), phương pháp này nhằm mục đích làm cho các mô hình ngôn ngữ lớn (LLMs) trở nên sâu sắc và có ý thức hơn trong các phản hồi của chúng.
Sự hợp tác giữa các chuyên gia đằng sau TPO đã tập hợp sự chuyên môn từ một số cơ quan hàng đầu trong nghiên cứu AI.
Cơ chế của Thought Preference Optimization
Về cơ bản, TPO hoạt động bằng cách khuyến khích các mô hình AI tạo ra “các bước suy nghĩ” trước khi đưa ra câu trả lời cuối cùng. Quá trình này mô phỏng các quá trình nhận thức của con người, nơi chúng ta thường suy nghĩ về một vấn đề hoặc câu hỏi trước khi thể hiện phản hồi của mình.
Kỹ thuật này bao gồm một số bước chính:
- Mô hình được yêu cầu tạo ra các bước suy nghĩ trước khi trả lời một truy vấn.
- Nhiều đầu ra được tạo ra, mỗi đầu ra có bộ suy nghĩ và câu trả lời cuối cùng riêng.
- Một mô hình đánh giá chỉ đánh giá các câu trả lời cuối cùng, không phải các bước suy nghĩ chính nó.
- Mô hình sau đó được đào tạo thông qua tối ưu hóa ưu tiên dựa trên các đánh giá này.
Cách tiếp cận này khác biệt đáng kể so với các kỹ thuật trước đây, chẳng hạn như Chain-of-Thought (CoT) prompting. Trong khi CoT chủ yếu được sử dụng cho các nhiệm vụ toán học và logic, TPO được thiết kế để có tính ứng dụng rộng rãi hơn trên nhiều loại truy vấn và hướng dẫn. Hơn nữa, TPO không yêu cầu giám sát rõ ràng về quá trình suy nghĩ, cho phép mô hình phát triển các chiến lược suy nghĩ hiệu quả của riêng nó.
Một sự khác biệt khác là TPO vượt qua thách thức của dữ liệu đào tạo hạn chế chứa các quá trình suy nghĩ của con người. Bằng cách tập trung đánh giá vào đầu ra cuối cùng chứ không phải các bước trung gian, TPO cho phép các mẫu suy nghĩ linh hoạt và đa dạng hơn xuất hiện.

Thiết lập thí nghiệm và kết quả
Để kiểm tra hiệu quả của TPO, các nhà nghiên cứu đã thực hiện các thí nghiệm sử dụng hai chuẩn mực nổi bật trong lĩnh vực mô hình ngôn ngữ AI: AlpacaEval và Arena-Hard. Các chuẩn mực này được thiết kế để đánh giá khả năng thực hiện hướng dẫn chung của các mô hình AI trên nhiều nhiệm vụ.
Các thí nghiệm sử dụng Llama-3-8B-Instruct làm mô hình hạt giống, với các mô hình đánh giá khác nhau được sử dụng cho đánh giá. Thiết lập này cho phép các nhà nghiên cứu so sánh hiệu suất của TPO với các mô hình cơ sở và đánh giá tác động của nó trên nhiều loại nhiệm vụ.
Kết quả của các thí nghiệm này rất hứa hẹn, cho thấy sự cải thiện trong nhiều danh mục:
- Giải quyết vấn đề và suy luận: Như dự kiến, TPO đã thể hiện sự cải thiện trong các nhiệm vụ yêu cầu suy nghĩ logic và phân tích.
- Kiến thức chung: Thú vị là, kỹ thuật này cũng cải thiện hiệu suất trên các truy vấn liên quan đến thông tin thực tế rộng rãi.
- Marketing: Có thể ngạc nhiên, TPO đã chứng minh khả năng tăng cường trong các nhiệm vụ liên quan đến marketing và bán hàng.
- Nhiệm vụ sáng tạo: Các nhà nghiên cứu lưu ý về lợi ích tiềm năng trong các lĩnh vực như viết sáng tạo, gợi ý rằng “suy nghĩ” có thể hỗ trợ trong việc lập kế hoạch và cấu trúc đầu ra sáng tạo.
Những cải thiện này không chỉ giới hạn trong các nhiệm vụ đòi hỏi lý luận truyền thống, cho thấy TPO có tiềm năng nâng cao hiệu suất AI trên nhiều ứng dụng. Tỷ lệ thắng trên các chuẩn mực AlpacaEval và Arena-Hard cho thấy sự cải thiện đáng kể so với các mô hình cơ sở, với TPO đạt được kết quả cạnh tranh thậm chí khi so sánh với các mô hình ngôn ngữ lớn hơn.
Tuy nhiên, cần lưu ý rằng việc triển khai TPO hiện tại đã cho thấy một số hạn chế, đặc biệt là trong các nhiệm vụ toán học. Các nhà nghiên cứu quan sát thấy rằng hiệu suất trên các vấn đề toán học thực sự giảm so với mô hình cơ sở, gợi ý rằng việc tinh chỉnh thêm có thể cần thiết để giải quyết các lĩnh vực cụ thể.
Ảnh hưởng đến phát triển AI
Sự thành công của TPO trong việc cải thiện hiệu suất trên nhiều danh mục mở ra những khả năng thú vị cho các ứng dụng AI. Ngoài các nhiệm vụ lý luận và giải quyết vấn đề truyền thống, kỹ thuật này có thể nâng cao khả năng của AI trong viết sáng tạo, dịch ngôn ngữ và tạo nội dung. Bằng cách cho phép AI “suy nghĩ” qua các quá trình phức tạp trước khi tạo ra đầu ra, chúng ta có thể thấy được các kết quả tinh tế và nhận thức ngữ cảnh hơn trong các lĩnh vực này.
Trong dịch vụ khách hàng, TPO có thể dẫn đến các phản hồi từ các bot trò chuyện và trợ lý ảo trở nên sâu sắc và toàn diện hơn, có khả năng cải thiện sự hài lòng của người dùng và giảm nhu cầu can thiệp của con người. Ngoài ra, trong lĩnh vực phân tích dữ liệu, cách tiếp cận này có thể cho phép AI xem xét nhiều quan điểm và mối tương quan tiềm năng trước khi rút ra kết luận từ các tập dữ liệu phức tạp, dẫn đến các phân tích sâu sắc và đáng tin cậy hơn.
Mặc dù có kết quả đầy hứa hẹn, TPO vẫn phải đối mặt với một số thách thức trong hình thức hiện tại. Sự suy giảm quan sát được trong các nhiệm vụ toán học gợi ý rằng kỹ thuật này có thể không mang lại lợi ích trên mọi lĩnh vực. Hạn chế này nhấn mạnh nhu cầu về các tinh chỉnh cụ thể cho lĩnh vực đối với cách tiếp cận TPO.
Một thách thức quan trọng khác là sự tăng tiềm năng trong tải trọng tính toán. Quá trình tạo ra và đánh giá nhiều đường suy nghĩ có thể tăng thời gian xử lý và yêu cầu tài nguyên, điều này có thể hạn chế khả năng áp dụng TPO trong các tình huống đòi hỏi phản hồi nhanh.
Hơn nữa, nghiên cứu hiện tại tập trung vào một kích thước mô hình cụ thể, đặt ra câu hỏi về cách TPO sẽ mở rộng quy mô cho các mô hình ngôn ngữ lớn hơn hoặc nhỏ hơn. Có nguy cơ “suy nghĩ quá mức” – suy nghĩ quá mức có thể dẫn đến các phản hồi rườm rà hoặc quá phức tạp cho các nhiệm vụ đơn giản.
Cân bằng giữa độ sâu của suy nghĩ và độ phức tạp của nhiệm vụ sẽ là một lĩnh vực quan trọng cho nghiên cứu và phát triển trong tương lai.
Hướng đi tương lai
Một lĩnh vực quan trọng cho nghiên cứu trong tương lai là phát triển các phương pháp để kiểm soát độ dài và độ sâu của quá trình suy nghĩ của AI. Điều này có thể liên quan đến việc điều chỉnh động, cho phép mô hình điều chỉnh độ sâu suy nghĩ dựa trên độ phức tạp của nhiệm vụ. Các nhà nghiên cứu cũng có thể khám phá các tham số do người dùng xác định, cho phép người dùng chỉ định mức độ suy nghĩ mong muốn cho các ứng dụng khác nhau.
Tối ưu hóa hiệu quả sẽ rất quan trọng trong lĩnh vực này. Phát triển các thuật toán để tìm điểm ngọt ngào giữa sự xem xét kỹ lưỡng và thời gian phản hồi nhanh có thể nâng cao đáng kể tính ứng dụng thực tế của TPO trên nhiều lĩnh vực và trường hợp sử dụng.
Khi các mô hình AI tiếp tục phát triển về kích thước và khả năng, việc khám phá cách TPO mở rộng quy mô với kích thước mô hình sẽ rất quan trọng. Các hướng nghiên cứu trong tương lai có thể bao gồm:
- Thử nghiệm TPO trên các mô hình ngôn ngữ lớn hiện đại để đánh giá tác động của nó trên các hệ thống AI tiên tiến hơn
- Điều tra xem liệu các mô hình lớn hơn có yêu cầu các phương pháp khác nhau để tạo ra và đánh giá suy nghĩ hay không
- Khám phá tiềm năng của TPO trong việc thu hẹp khoảng cách hiệu suất giữa các mô hình nhỏ hơn và lớn hơn, có khả năng sử dụng tài nguyên tính toán một cách hiệu quả hơn
Nghiên cứu này có thể dẫn đến các hệ thống AI tinh vi hơn, có khả năng xử lý các nhiệm vụ ngày càng phức tạp đồng thời duy trì hiệu quả và độ chính xác.
Kết luận
Thought Preference Optimization đại diện cho một bước tiến quan trọng trong việc nâng cao khả năng của các mô hình ngôn ngữ lớn. Bằng cách khuyến khích các hệ thống AI “suy nghĩ trước khi nói”, TPO đã chứng minh sự cải thiện trên nhiều nhiệm vụ, có khả năng cách mạng hóa cách chúng ta tiếp cận phát triển AI.
Khi nghiên cứu trong lĩnh vực này tiếp tục, chúng ta có thể mong đợi thấy các tinh chỉnh thêm cho kỹ thuật này, giải quyết các hạn chế hiện tại và mở rộng ứng dụng của nó. Tương lai của AI có thể liên quan đến các hệ thống không chỉ xử lý thông tin mà còn tham gia vào các quá trình nhận thức giống con người hơn, dẫn đến AI nhân tạo tinh tế, nhận thức ngữ cảnh và hữu ích hơn.












