Nền tảng AI
Học tăng cường là gì?
Học tăng cường (RL) là một khung học máy trong đó một tác nhân học cách hành động bằng cách tương tác với môi trường. Sau mỗi hành động, môi trường thay đổi và có thể trả về phần thưởng. Mục tiêu của tác nhân là học một chính sách tối đa hoá phần thưởng tích lũy kỳ vọng, không chỉ phần thưởng của bước tiếp theo.
RL được sử dụng khi các quyết định diễn ra theo thời gian và một hành động ảnh hưởng tới những gì xảy ra tiếp theo. Nó về mặt khái niệm khác với học có giám sát, trong đó một tập dữ liệu cung cấp câu trả lời mục tiêu cho mỗi ví dụ đào tạo.
Những điểm chính
- Một vấn đề RL bao gồm một tác nhân, môi trường, các trạng thái, hành động, phần thưởng và một chính sách.
- Củng cố tích cực và tiêu cực đều làm tăng hành vi; hình phạt làm giảm hành vi.
- Tác nhân phải cân bằng giữa việc khám phá các hành động chưa quen và khai thác các hành động đã biết hiệu quả.
- Các phương pháp dựa trên giá trị, dựa trên chính sách, actor-critic, dựa trên mô hình và ngoại tuyến giải quyết các bối cảnh RL khác nhau.

Các thành phần của học tăng cường
Nhiều vấn đề RL được mô hình hoá như một quá trình quyết định Markov (MDP). Một MDP bao gồm:
- Trạng thái: thông tin mô tả tình huống hiện tại.
- Hành động: một lựa chọn có sẵn cho tác nhân.
- Chuyển tiếp: cách trạng thái thay đổi sau một hành động.
- Phần thưởng: phản hồi ngay lập tức do một chuyển tiếp tạo ra.
- Chính sách: chiến lược của tác nhân để lựa chọn hành động.
- Hệ số chiết khấu: mức độ quan trọng của phần thưởng trong tương lai so với phần thưởng ngay lập tức.
Một trạng thái không nhất thiết phải tiết lộ mọi thông tin về thế giới. Khi thông tin quan trọng bị ẩn, vấn đề có thể là một phần quan sát được và tác nhân có thể cần một bộ nhớ hoặc trạng thái niềm tin.
Củng cố không giống như hình phạt
Thuật ngữ này bắt nguồn từ tâm lý học hành vi. Củng cố tích cực thêm một hậu quả làm cho hành vi trở nên có khả năng cao hơn. Củng cố tiêu cực loại bỏ một điều kiện khó chịu và cũng làm cho hành vi có khả năng cao hơn. Một hình phạt nhằm làm giảm khả năng thực hiện một hành động không phải là củng cố tiêu cực.
Trong học máy, các nhà thực hành thường nói trực tiếp về phần thưởng tích cực, phần thưởng tiêu cực, chi phí và hình phạt. Vấn đề cốt lõi là cách các tín hiệu này định hình lợi nhuận mà tác nhân cố gắng tối đa hoá.
Lợi nhuận, giá trị và phân bổ công nhận
Một phần thưởng mô tả một chuyển tiếp. Lợi nhuận kết hợp các phần thưởng theo thời gian, thường chiết khấu các phần thưởng xảy ra xa hơn trong tương lai. Một hàm giá trị trạng thái ước tính lợi nhuận kỳ vọng từ một trạng thái, trong khi một hàm giá trị hành động ước tính lợi nhuận kỳ vọng sau khi thực hiện một hành động cụ thể trong trạng thái đó.
Điều này tạo ra vấn đề phân bổ công nhận: nếu một kết quả hữu ích xuất hiện rất muộn, những hành động nào trước đó xứng đáng nhận công nhận? Các thuật toán RL khác nhau về cách chúng ước tính mối quan hệ này.
Học Monte Carlo và học chênh lệch thời gian
Phương pháp Monte Carlo học từ các lợi nhuận mẫu đầy đủ, thường sau khi một tập kết thúc. Phương pháp chênh lệch thời gian (TD) cập nhật ước lượng trước kết quả cuối cùng bằng cách kết hợp phần thưởng quan sát được với ước lượng về những gì sẽ tới. Do đó, học TD tự khởi tạo từ các ước lượng giá trị hiện tại.
Không có nhóm nào là tốt hơn một cách tuyệt đối. Các mục tiêu Monte Carlo không có thiên lệch dưới chính sách mẫu nhưng có thể có phương sai cao và yêu cầu hoàn thành tập. Các phương pháp TD có thể học trực tuyến và từ các nhiệm vụ liên tục, nhưng các mục tiêu tự khởi tạo của chúng gây ra thiên lệch.
Khám phá so với khai thác
Khám phá thu thập thông tin bằng cách thử các hành động có giá trị không chắc chắn. Khai thác chọn hành động hiện được cho là mang lại lợi nhuận tốt nhất. Một tác nhân không bao giờ khám phá có thể chấp nhận chiến lược kém; một tác nhân không bao giờ khai thác sẽ không tận dụng được những gì đã học.
Các chiến lược đơn giản bao gồm lựa chọn hành động epsilon-greedy, khám phá dựa trên độ tin cậy, phần thưởng entropy, và các phương pháp phần thưởng nội tại. Trong các môi trường đòi hỏi an toàn, việc khám phá không giới hạn có thể không chấp nhận được, vì vậy mô phỏng, ràng buộc, dữ liệu ngoại tuyến hoặc giám sát con người trở nên quan trọng.
Các phương pháp học tăng cường chính
Phương pháp dựa trên giá trị
Q-learning và các thuật toán liên quan học các giá trị hành động và suy ra một chính sách bằng cách chọn các hành động có giá trị cao. Học tăng cường sâu sử dụng mạng nơ-ron để xấp xỉ các hàm giá trị hoặc chính sách khi không gian trạng thái quá lớn để lưu trong bảng.
Phương pháp gradient chính sách
Các phương pháp gradient chính sách điều chỉnh trực tiếp một chính sách có tham số nhằm cải thiện lợi nhuận kỳ vọng. Chúng hữu ích cho các hành động liên tục và các chính sách ngẫu nhiên nhưng có thể có ước lượng gradient có phương sai cao.
Phương pháp actor-critic
Một actor (đối tượng hành động) chọn các hành động trong khi một critic (đánh giá) ước tính giá trị và cung cấp tín hiệu học. Điều này kết hợp tối ưu trực tiếp chính sách với ước tính giá trị.
RL dựa trên mô hình và không dựa trên mô hình
Các hệ thống dựa trên mô hình học hoặc sử dụng một mô hình về các chuyển tiếp và phần thưởng để có thể lập kế hoạch. Các hệ thống không dựa trên mô hình học các giá trị hoặc chính sách mà không mô hình hoá môi trường một cách rõ ràng. Các phương pháp dựa trên mô hình có thể sử dụng kinh nghiệm một cách hiệu quả, nhưng lỗi trong mô hình đã học có thể dẫn sai lập kế hoạch.
Học tăng cường ngoại tuyến
Học tăng cường ngoại tuyến học từ một tập dữ liệu cố định thay vì thu thập các tương tác mới trong quá trình huấn luyện. Nó có thể giảm chi phí hoặc rủi ro của việc khám phá, nhưng tác nhân phải tránh việc ước lượng quá cao các hành động không được đại diện tốt trong dữ liệu.
RLHF và sở thích của con người
Học tăng cường từ phản hồi của con người (RLHF) sử dụng dữ liệu sở thích để huấn luyện một tín hiệu phần thưởng hoặc tối ưu trực tiếp một chính sách. Nó đã được dùng để điều chỉnh hành vi của mô hình ngôn ngữ sao cho phù hợp với đánh giá của con người. Tối ưu sở thích không đảm bảo tính đúng đắn hay an toàn: kết quả phụ thuộc vào người cung cấp phản hồi, những gì họ được yêu cầu đánh giá, và cách mục tiêu được thiết kế.
Hạn chế
RL có thể yêu cầu số lượng tương tác khổng lồ, hành vi không ổn định trong quá trình huấn luyện, và lợi dụng các lối tắt không mong muốn trong hàm phần thưởng. Đánh giá rất khó vì kết quả có thể thay đổi tùy theo hạt giống ngẫu nhiên và chi tiết môi trường. Thực hành tốt bao gồm thực hiện nhiều lần chạy, các baseline minh bạch, mục tiêu có ràng buộc, kiểm tra ngoài phân phối, và giám sát để phát hiện việc lạm dụng phần thưởng.
Thiết kế một vấn đề RL: trạng thái, hành động, phần thưởng và thời gian
Học tăng cường mô hình hoá các quyết định tuần tự. Môi trường tạo ra một quan sát, tác nhân chọn một hành động dựa trên chính sách, và một chuyển tiếp tạo ra phần thưởng và quan sát tiếp theo. Một quá trình quyết định Markov giả định trạng thái chứa thông tin cần thiết để dự đoán các chuyển tiếp và phần thưởng trong tương lai; khả năng quan sát một phần đòi hỏi bộ nhớ, trạng thái niềm tin, hoặc các biểu diễn hồi tiếp. Chiết khấu kiểm soát trọng số của các kết quả trì hoãn, trong khi các nhiệm vụ dạng tập và liên tục yêu cầu các định nghĩa lợi nhuận khác nhau. Thiết kế trạng thái hoặc hành động kém có thể khiến một mục tiêu có thể giải quyết trở nên không thể học được.
Thiết kế phần thưởng chỉ định hành vi một cách gián tiếp và là nguồn gây thất bại lớn. Một đại diện có thể bị lợi dụng: một tác nhân được thưởng vì tốc độ có thể bỏ qua an toàn, trong khi một tác nhân chỉ được thưởng khi hoàn thành nhiệm vụ có thể nhận quá ít tín hiệu học. Thêm các ràng buộc và quy tắc kết thúc dựa trên yêu cầu thực tế, kiểm tra độ nhạy của phần thưởng, và kiểm tra các quỹ đạo để phát hiện chiến lược không mong muốn. Các phương pháp khám phá cân bằng việc thu thập thông tin với khai thác kiến thức hiện tại. Dữ liệu ngoài chính sách có thể cải thiện hiệu quả mẫu, nhưng sự không khớp giữa hành vi và chính sách mục tiêu đòi hỏi các thuật toán được thiết kế cho trường hợp này.
Đánh giá, mô phỏng và triển khai an toàn
Các phương pháp dựa trên giá trị ước tính lợi nhuận kỳ vọng cho các trạng thái hoặc hành động; các phương pháp gradient chính sách tối ưu một chính sách có tham số; các phương pháp actor‑critic học cả hai. RL dựa trên mô hình học hoặc sử dụng động lực chuyển tiếp để lập kế hoạch. Nhóm phù hợp phụ thuộc vào loại hành động, dữ liệu, độ chính xác của mô phỏng, thời gian và yêu cầu ổn định. So sánh với các baseline dựa trên heuristic, học có giám sát và lý thuyết điều khiển. Đánh giá lợi nhuận trung bình và trường hợp xấu nhất, vi phạm ràng buộc, hiệu quả mẫu, độ bền vững trước các thay đổi môi trường, và phương sai qua các hạt giống thay vì chỉ chọn một lần chạy có đường cong học tốt nhất.
Việc khám phá trực tuyến có thể không chấp nhận được trong y tế, tài chính, robot và hạ tầng. Huấn luyện trong mô phỏng hoặc dữ liệu đã ghi lại khi có thể, định lượng khoảng cách mô phỏng‑thực tế, và sử dụng đánh giá ngoài chính sách một cách cẩn thận vì các hành động chưa thấy không có hỗ trợ. Khi triển khai, nên giới hạn hành động, tốc độ, tài nguyên và vùng hoạt động; bao gồm phê duyệt của con người cho các lựa chọn quan trọng; và cung cấp bộ điều khiển an toàn hoặc tắt máy. Giám sát phần thưởng cùng với kết quả thực tế vì một tác nhân có thể cải thiện điểm số trong khi gây hại cho mục tiêu dự định. Xác thực lại sau khi môi trường, chính sách hoặc phần thưởng thay đổi.
Ví dụ thực tế: kiểm soát năng lượng bằng học tăng cường
Một nhà vận hành tòa nhà mô hình hoá nhiệt độ, mức độ sử dụng, thời tiết, trạng thái thiết bị và giá điện, với các hành động giới hạn ở việc điều chỉnh điểm đặt an toàn. Phần thưởng kết hợp sự thoải mái, năng lượng, phí nhu cầu và các ràng buộc thiết bị, nhưng các vi phạm thoải mái thực tế được đánh giá riêng nên việc tối ưu phần thưởng không thể che giấu hại. Điều khiển lịch sử và điều khiển dự đoán mô hình cung cấp các baseline. Đào tạo sử dụng một mô phỏng đã được hiệu chuẩn với thời tiết ngẫu nhiên, nhiễu cảm biến và hiệu suất thiết bị.
Trước khi ảnh hưởng tới tòa nhà, chính sách chạy trên các quan sát thực tế mà không thực hiện hành động. Các kỹ sư kiểm tra các quỹ đạo, biên độ ràng buộc và hành vi trong các ngày lễ, đợt nắng nóng, mất điện và cảm biến thiếu. Khi triển khai, giới hạn tốc độ và phạm vi hành động và giữ lại bộ điều khiển an toàn hiện có. Con người có thể can thiệp bất kỳ lúc nào. Giám sát so sánh năng lượng và sự thoải mái với các giai đoạn tương ứng, ghi lại các can thiệp, và quay lại nếu các vi phạm, chu kỳ bất ngờ, hoặc sự không khớp mô hình vượt qua ngưỡng đã định.
Bằng chứng triển khai và sẵn sàng vận hành
Một quyết định triển khai thực tế cần nhiều hơn một buổi trình diễn thành công. Xác định người dùng dự kiến, môi trường vận hành, đầu vào, đầu ra, các phụ thuộc, người sở hữu, và hậu quả của mỗi lỗi quan trọng. Thiết lập một baseline có thể tái tạo và một bộ đánh giá có phiên bản trước khi tinh chỉnh. Kiểm tra các trường hợp thường, điều kiện biên, đầu vào sai định dạng hoặc thiếu, sự dịch chuyển phân phối, sự cố phụ thuộc, lạm dụng, và các nhóm hoặc môi trường có khả năng bị thiếu dịch vụ. Đo lường chất lượng nhiệm vụ cùng với hiệu chuẩn hoặc độ không chắc, độ trễ, thông lượng, chi phí tài nguyên, khả năng tiếp cận, quyền riêng tư và bảo mật. Ghi lại mọi biến đổi và ngưỡng để một người đánh giá độc lập có thể tái tạo kết quả và phân biệt bằng chứng với một nguyên mẫu hấp dẫn.
Trước khi ra mắt, chỉ định quyền chịu trách nhiệm cho việc phát hành, ngoại lệ, thay đổi, quay lại và ngừng hoạt động. Sử dụng triển khai theo giai đoạn, duy trì một phương án dự phòng an toàn, và xác minh giám sát với các lỗi được chèn cố ý. Dữ liệu đo lường vận hành nên hiển thị chất lượng đầu vào, hành vi đầu ra, phiên bản mô hình hoặc quy tắc, tình trạng phụ thuộc, can thiệp của con người, và kết quả đã xác nhận mà không thu thập dữ liệu nhạy cảm không cần thiết. Định nghĩa ngưỡng cảnh báo và người chịu trách nhiệm phản hồi, sau đó xem xét bằng chứng thực tế sau khi triển khai thay vì giả định hiệu suất ngoại tuyến sẽ kéo dài. Đánh giá lại mỗi khi nguồn dữ liệu, người dùng, mô hình, nhà cung cấp, chính sách, phần cứng hoặc mục tiêu thay đổi. Một hệ thống được duy trì cũng cần có quy trình phục hồi, học hỏi từ sự cố, xóa và lưu trữ, và một điểm rõ ràng khi nó nên bị vô hiệu hoá hoặc thay thế.












