Nền tảng AI
Reinforcement Learning Là Gì?
Reinforcement Learning Là Gì?
Nói một cách đơn giản, reinforcement learning là một kỹ thuật học máy liên quan đến việc đào tạo một tác nhân trí tuệ nhân tạo thông qua việc lặp lại các hành động và phần thưởng liên quan. Một tác nhân reinforcement learning thực nghiệm trong một môi trường, thực hiện các hành động và được thưởng khi thực hiện các hành động chính xác. Theo thời gian, tác nhân học cách thực hiện các hành động sẽ tối đa hóa phần thưởng của nó. Đó là một định nghĩa nhanh về reinforcement learning, nhưng việc xem xét kỹ lưỡng các khái niệm đằng sau reinforcement learning sẽ giúp bạn có được sự hiểu biết sâu sắc và trực quan hơn về nó.
Thuật ngữ “reinforcement learning” được lấy từ khái niệm reinforcement trong tâm lý học. Vì lý do đó, hãy dành một chút thời gian để hiểu khái niệm reinforcement trong tâm lý học. Trong ý nghĩa tâm lý, thuật ngữ reinforcement đề cập đến điều gì đó tăng cường khả năng một phản ứng/hành động cụ thể sẽ xảy ra. Khái niệm reinforcement này là một ý tưởng trung tâm của lý thuyết điều kiện hóa operant, ban đầu được đề xuất bởi nhà tâm lý học B.F. Skinner. Trong bối cảnh này, reinforcement là bất cứ điều gì gây ra tần suất của một hành vi nhất định tăng lên. Nếu chúng ta nghĩ về các phần thưởng có thể có cho con người, những thứ này có thể là những điều như lời khen, tăng lương tại nơi làm việc, kẹo và các hoạt động thú vị.
Trong ý nghĩa truyền thống, tâm lý học, có hai loại reinforcement. Có reinforcement tích cực và reinforcement tiêu cực. Reinforcement tích cực là việc thêm một điều gì đó để tăng cường một hành vi, như cho chó một món ăn khi nó表现 tốt. Reinforcement tiêu cực liên quan đến việc loại bỏ một kích thích để gây ra một hành vi, như tắt tiếng ồn lớn để thu hút một con mèo rụt rè.
Reinforcement Tích Cực & Tiêu Cực
Reinforcement tích cực tăng cường tần suất của một hành vi trong khi reinforcement tiêu cực giảm tần suất. Generally, reinforcement tích cực là loại reinforcement phổ biến nhất được sử dụng trong reinforcement learning, vì nó giúp các mô hình tối đa hóa hiệu suất trên một nhiệm vụ nhất định. Không chỉ vậy, mà reinforcement tích cực còn dẫn đến những thay đổi bền vững, những thay đổi có thể trở thành các mẫu nhất quán và tồn tại trong thời gian dài.
Ngược lại, mặc dù reinforcement tiêu cực cũng làm cho một hành vi có khả năng xảy ra, nhưng nó được sử dụng để duy trì một tiêu chuẩn hiệu suất tối thiểu chứ không phải để đạt được hiệu suất tối đa của mô hình. Reinforcement tiêu cực trong reinforcement learning có thể giúp đảm bảo rằng một mô hình tránh được các hành động không mong muốn, nhưng nó không thể thực sự khiến mô hình khám phá các hành động mong muốn.
Đào Tạo Một Tác Nhân Reinforcement
Khi một tác nhân reinforcement learning được đào tạo, có bốn thành phần hoặc trạng thái được sử dụng trong quá trình đào tạo: trạng thái ban đầu (State 0), trạng thái mới (State 1), hành động và phần thưởng.
Hãy tưởng tượng rằng chúng ta đang đào tạo một tác nhân reinforcement để chơi một trò chơi điện tử platform, nơi mục tiêu của trí tuệ nhân tạo là di chuyển đến cuối cấp độ bằng cách di chuyển sang phải trên màn hình. Trạng thái ban đầu của trò chơi được rút ra từ môi trường, có nghĩa là khung hình đầu tiên của trò chơi được phân tích và đưa cho mô hình. Dựa trên thông tin này, mô hình phải quyết định một hành động.
Trong các giai đoạn đào tạo ban đầu, những hành động này là ngẫu nhiên, nhưng khi mô hình được tăng cường, một số hành động sẽ trở nên phổ biến hơn. Sau khi hành động được thực hiện, môi trường của trò chơi được cập nhật và một trạng thái mới hoặc khung hình được tạo ra. Nếu hành động được thực hiện bởi tác nhân tạo ra một kết quả mong muốn, chẳng hạn như trong trường hợp này, tác nhân vẫn còn sống và không bị tấn công bởi một kẻ thù, một số phần thưởng sẽ được trao cho tác nhân và nó sẽ trở nên có khả năng thực hiện lại hành động đó trong tương lai.
Hệ thống cơ bản này được lặp lại liên tục, xảy ra lại và lại, và mỗi lần tác nhân cố gắng học hỏi một chút và tối đa hóa phần thưởng của nó.
Nhiệm Vụ Episodic So Với Nhiệm Vụ Liên Tục
Các nhiệm vụ reinforcement learning có thể thường được phân loại vào một trong hai loại khác nhau: nhiệm vụ episodic và nhiệm vụ liên tục.
Nhiệm vụ episodic sẽ thực hiện vòng lặp học tập/đào tạo và cải thiện hiệu suất của nó cho đến khi một số tiêu chí kết thúc được đáp ứng và đào tạo được chấm dứt. Trong một trò chơi, điều này có thể là đạt đến cuối cấp độ hoặc rơi vào một chướng ngại vật như những chiếc gai. Ngược lại, nhiệm vụ liên tục không có tiêu chí kết thúc, về cơ bản là tiếp tục đào tạo mãi mãi cho đến khi kỹ sư quyết định chấm dứt đào tạo.
Monte Carlo So Với Temporal Difference
Có hai cách chính để học tập, hoặc đào tạo, một tác nhân reinforcement learning. Trong phương pháp Monte Carlo, phần thưởng được trao cho tác nhân (điểm số của nó được cập nhật) chỉ vào cuối tập đào tạo. Để nói một cách khác, chỉ khi điều kiện kết thúc được đáp ứng, mô hình mới học cách thực hiện tốt như thế nào. Nó có thể sử dụng thông tin này để cập nhật và khi vòng đào tạo tiếp theo được bắt đầu, nó sẽ phản ứng theo thông tin mới.
Phương pháp temporal-difference khác với phương pháp Monte Carlo ở chỗ việc ước tính giá trị, hoặc ước tính điểm số, được cập nhật trong quá trình tập đào tạo. Khi mô hình tiến đến bước thời gian tiếp theo, các giá trị được cập nhật.
Khám Phá So Với Tận Dụng
Đào tạo một tác nhân reinforcement learning là một hành động cân bằng, liên quan đến việc cân bằng hai chỉ số khác nhau: khám phá và tận dụng.
Khám phá là hành động thu thập thêm thông tin về môi trường xung quanh, trong khi tận dụng là sử dụng thông tin đã biết về môi trường để kiếm điểm thưởng. Nếu một tác nhân chỉ khám phá và không tận dụng môi trường, các hành động mong muốn sẽ không bao giờ được thực hiện. Mặt khác, nếu tác nhân chỉ tận dụng và không khám phá, tác nhân sẽ chỉ học cách thực hiện một hành động và sẽ không khám phá các chiến lược khác để kiếm điểm thưởng. Do đó, việc cân bằng giữa khám phá và tận dụng là rất quan trọng khi tạo ra một tác nhân reinforcement learning.
Ứng Dụng Của Reinforcement Learning
Reinforcement learning có thể được sử dụng trong nhiều vai trò khác nhau, và nó phù hợp nhất với các ứng dụng đòi hỏi tự động hóa.
Tự động hóa các nhiệm vụ được thực hiện bởi robot công nghiệp là một lĩnh vực mà reinforcement learning chứng minh là hữu ích. Reinforcement learning cũng có thể được sử dụng cho các vấn đề như khai thác văn bản, tạo ra các mô hình có thể tóm tắt các văn bản dài. Các nhà nghiên cứu cũng đang thử nghiệm việc sử dụng reinforcement learning trong lĩnh vực chăm sóc sức khỏe, với các tác nhân reinforcement xử lý các công việc như tối ưu hóa chính sách điều trị. Reinforcement learning cũng có thể được sử dụng để tùy chỉnh tài liệu giáo dục cho học sinh.
Tổng Kết Về Reinforcement Learning
Reinforcement learning là một phương pháp mạnh mẽ để xây dựng các tác nhân trí tuệ nhân tạo có thể dẫn đến những kết quả ấn tượng và đôi khi là bất ngờ. Đào tạo một tác nhân thông qua reinforcement learning có thể phức tạp và khó khăn, vì nó đòi hỏi nhiều lần đào tạo và một sự cân bằng tinh tế giữa khám phá và tận dụng. Tuy nhiên, nếu thành công, một tác nhân được tạo ra thông qua reinforcement learning có thể thực hiện các nhiệm vụ phức tạp trong nhiều môi trường khác nhau.












