Fondamentaux de l’IA

Qu’est-ce que l’apprentissage par renforcement profond ?

mm
Ajouter Unite.AI à vos sources prÃĐfÃĐrÃĐes sur Google

Qu’est-ce que l’apprentissage par renforcement profond ?

En plus de l’apprentissage automatique non supervisÃĐ et de l’apprentissage supervisÃĐ, une autre forme courante de crÃĐation d’IA est l’apprentissage par renforcement. Au-delà de l’apprentissage par renforcement classique, l’apprentissage par renforcement profond peut conduire à des rÃĐsultats impressionnants, grÃĒce au fait qu’il combine les meilleurs aspects de l’apprentissage profond et de l’apprentissage par renforcement. Examinons comment fonctionne l’apprentissage par renforcement profond.

Avant de plonger dans l’apprentissage par renforcement profond, il pourrait Être utile de rafraÃŪchir nos connaissances sur la façon dont fonctionne l’apprentissage par renforcement classique. Dans l’apprentissage par renforcement, des algorithmes orientÃĐs vers les objectifs sont conçus à travers un processus d’essais et d’erreurs, en optimisant l’action qui conduit au meilleur rÃĐsultat, ou à l’action qui obtient la plus grande ÂŦ rÃĐcompense Âŧ. Lorsque les algorithmes d’apprentissage par renforcement sont formÃĐs, ils reçoivent des ÂŦ rÃĐcompenses Âŧ ou des ÂŦ punitions Âŧ qui influencent les actions qu’ils prendront à l’avenir. Les algorithmes tentent de trouver un ensemble d’actions qui procureront au systÃĻme la plus grande rÃĐcompense, en ÃĐquilibrant à la fois les rÃĐcompenses immÃĐdiates et futures.

Les algorithmes d’apprentissage par renforcement sont trÃĻs puissants car ils peuvent Être appliquÃĐs à presque toutes les tÃĒches, pouvant apprendre de maniÃĻre flexible et dynamique à partir d’un environnement et dÃĐcouvrir des actions possibles.

PrÃĐsentation de l’apprentissage par renforcement profond

Photo: Megajuice via Wikimedia Commons, CC 1.0 (https://commons.wikimedia.org/wiki/File:Reinforcement_learning_diagram.svg)

Lorsqu’il s’agit d’apprentissage par renforcement profond, l’environnement est gÃĐnÃĐralement reprÃĐsentÃĐ par des images. Une image est une capture de l’environnement à un moment prÃĐcis. L’agent doit analyser les images et extraire les informations pertinentes, en utilisant ces informations pour dÃĐterminer quelle action prendre. L’apprentissage par renforcement profond est gÃĐnÃĐralement effectuÃĐ avec l’une des deux techniques suivantes : l’apprentissage basÃĐ sur les valeurs et l’apprentissage basÃĐ sur les politiques.

Les techniques d’apprentissage basÃĐ sur les valeurs utilisent des algorithmes et des architectures tels que les rÃĐseaux de neurones convolutifs et les rÃĐseaux Q profonds. Ces algorithmes fonctionnent en convertissant l’image en niveaux de gris et en supprimant les parties inutiles de l’image. Ensuite, l’image subit diverses convolutions et opÃĐrations de regroupement, en extrayant les parties les plus pertinentes de l’image. Les parties importantes de l’image sont ensuite utilisÃĐes pour calculer la valeur Q pour les diffÃĐrentes actions que l’agent peut prendre. Les valeurs Q sont utilisÃĐes pour dÃĐterminer la meilleure action pour l’agent. AprÃĻs que les valeurs Q initiales soient calculÃĐes, une rÃĐtropropagation est effectuÃĐe afin que les valeurs Q les plus prÃĐcises puissent Être dÃĐterminÃĐes.

Les mÃĐthodes basÃĐes sur les politiques sont utilisÃĐes lorsque le nombre d’actions possibles que l’agent peut prendre est extrÊmement ÃĐlevÃĐ, ce qui est gÃĐnÃĐralement le cas dans les scÃĐnarios du monde rÃĐel. De telles situations nÃĐcessitent une approche diffÃĐrente, car le calcul des valeurs Q pour toutes les actions individuelles n’est pas pratique. Les approches basÃĐes sur les politiques adoptent des politiques en apprenant directement la politique, souvent à l’aide de techniques appelÃĐes gradients de politique.

Les gradients de politique fonctionnent en recevant un ÃĐtat et en calculant des probabilitÃĐs pour les actions en fonction des expÃĐriences antÃĐrieures de l’agent. L’action la plus probable est ensuite sÃĐlectionnÃĐe. Ce processus est rÃĐpÃĐtÃĐ jusqu’à la fin de la pÃĐriode d’ÃĐvaluation et les rÃĐcompenses sont attribuÃĐes à l’agent. AprÃĻs que les rÃĐcompenses aient ÃĐtÃĐ attribuÃĐes à l’agent, les paramÃĻtres du rÃĐseau sont mis à jour à l’aide de la rÃĐtropropagation.

Qu’est-ce que l’apprentissage Q ?

Puisque l’apprentissage Q est une grande partie du processus d’apprentissage par renforcement profond, examinons comment fonctionne le systÃĻme d’apprentissage Q.

Le processus de dÃĐcision markovien

Un processus de dÃĐcision markovien. Photo: waldoalvarez via Pixabay, Pixbay License (https://commons.wikimedia.org/wiki/File:Markov_Decision_Process.svg)

Afin qu’un agent d’IA puisse effectuer une sÃĐrie de tÃĒches et atteindre un objectif, l’agent doit Être capable de gÃĐrer une sÃĐquence d’ÃĐtats et d’ÃĐvÃĐnements. L’agent commence à un ÃĐtat et doit prendre une sÃĐrie d’actions pour atteindre un ÃĐtat final, et il peut y avoir un nombre massif d’ÃĐtats entre le dÃĐbut et la fin. Stocker des informations sur chaque ÃĐtat est impraticable ou impossible, l’agent doit donc trouver un moyen de conserver uniquement les informations les plus pertinentes sur l’ÃĐtat. Cela est rÃĐalisÃĐ Ã  l’aide d’un processus de dÃĐcision markovien, qui conserve uniquement les informations sur l’ÃĐtat actuel et l’ÃĐtat prÃĐcÃĐdent. Chaque ÃĐtat suit une propriÃĐtÃĐ markovienne, qui suit la façon dont l’agent change de l’ÃĐtat prÃĐcÃĐdent à l’ÃĐtat actuel.

L’apprentissage Q profond

Une fois que le modÃĻle a accÃĻs aux informations sur les ÃĐtats de l’environnement d’apprentissage, les valeurs Q peuvent Être calculÃĐes. Les valeurs Q sont la rÃĐcompense totale attribuÃĐe à l’agent à la fin d’une sÃĐquence d’actions.

Les valeurs Q sont calculÃĐes à l’aide d’une sÃĐrie de rÃĐcompenses. Il y a une rÃĐcompense immÃĐdiate, calculÃĐe à l’ÃĐtat actuel et en fonction de l’action actuelle. La valeur Q pour l’ÃĐtat suivant est ÃĐgalement calculÃĐe, ainsi que la valeur Q pour l’ÃĐtat aprÃĻs celui-ci, et ainsi de suite jusqu’à ce que toutes les valeurs Q pour les diffÃĐrents ÃĐtats soient calculÃĐes. Il y a ÃĐgalement un paramÃĻtre Gamma qui est utilisÃĐ pour contrÃīler le poids des rÃĐcompenses futures sur les actions de l’agent. Les politiques sont gÃĐnÃĐralement calculÃĐes en initialisant alÃĐatoirement les valeurs Q et en laissant le modÃĻle converger vers les valeurs Q optimales au cours de la formation.

Les rÃĐseaux Q profonds

L’un des problÃĻmes fondamentaux liÃĐs à l’utilisation de l’apprentissage Q pour l’apprentissage par renforcement est que la quantitÃĐ de mÃĐmoire requise pour stocker les donnÃĐes augmente rapidement à mesure que le nombre d’ÃĐtats augmente. Les rÃĐseaux Q profonds rÃĐsolvent ce problÃĻme en combinant des modÃĻles de rÃĐseaux de neurones avec des valeurs Q, permettant à un agent d’apprendre à partir de l’expÃĐrience et de faire des suppositions raisonnables sur les meilleures actions à prendre. Avec l’apprentissage Q profond, les fonctions de valeur Q sont estimÃĐes à l’aide de rÃĐseaux de neurones. Le rÃĐseau de neurones prend l’ÃĐtat en tant que donnÃĐes d’entrÃĐe, et le rÃĐseau produit la valeur Q pour toutes les actions possibles que l’agent peut prendre.

L’apprentissage Q profond est rÃĐalisÃĐ en stockant toutes les expÃĐriences passÃĐes en mÃĐmoire, en calculant les sorties maximales pour le rÃĐseau Q, puis en utilisant une fonction de perte pour calculer la diffÃĐrence entre les valeurs actuelles et les valeurs thÃĐoriques les plus ÃĐlevÃĐes possibles.

L’apprentissage par renforcement profond vs l’apprentissage profond

Une diffÃĐrence importante entre l’apprentissage par renforcement profond et l’apprentissage profond classique est que, dans le cas du premier, les entrÃĐes sont constamment changeantes, ce qui n’est pas le cas dans l’apprentissage profond classique. Comment le modÃĻle d’apprentissage peut-il tenir compte des entrÃĐes et des sorties qui changent constamment ?

En essence, pour tenir compte de la divergence entre les valeurs prÃĐvues et les valeurs cibles, deux rÃĐseaux de neurones peuvent Être utilisÃĐs au lieu d’un seul. Un rÃĐseau estime les valeurs cibles, tandis que l’autre rÃĐseau est responsable des prÃĐdictions. Les paramÃĻtres du rÃĐseau cible sont mis à jour à mesure que le modÃĻle apprend, aprÃĻs un certain nombre d’itÃĐrations d’entraÃŪnement. Les sorties des rÃĐseaux respectifs sont ensuite combinÃĐes pour dÃĐterminer la diffÃĐrence.

Apprentissage basÃĐ sur les politiques

Les approches d’apprentissage basÃĐ sur les politiques fonctionnent diffÃĐremment des approches basÃĐes sur les valeurs Q. Alors que les approches basÃĐes sur les valeurs Q crÃĐent une fonction de valeur qui prÃĐdit les rÃĐcompenses pour les ÃĐtats et les actions, les mÃĐthodes basÃĐes sur les politiques dÃĐterminent une politique qui cartographie les ÃĐtats aux actions. En d’autres termes, la fonction de politique qui sÃĐlectionne les actions est directement optimisÃĐe sans tenir compte de la fonction de valeur.

Les gradients de politique

Une politique pour l’apprentissage par renforcement profond tombe dans l’une des deux catÃĐgories suivantes : stochastique ou dÃĐterministe. Une politique dÃĐterministe est celle oÃđ les ÃĐtats sont cartographiÃĐs aux actions, ce qui signifie que lorsque la politique est donnÃĐe des informations sur un ÃĐtat, une action est renvoyÃĐe. En revanche, les politiques stochastiques renvoient une distribution de probabilitÃĐ pour les actions au lieu d’une seule action discrÃĻte.

Les politiques dÃĐterministes sont utilisÃĐes lorsqu’il n’y a pas d’incertitude quant aux rÃĐsultats des actions qui peuvent Être prises. En d’autres termes, lorsque l’environnement lui-mÊme est dÃĐterministe. En revanche, les sorties de politiques stochastiques sont appropriÃĐes pour les environnements oÃđ le rÃĐsultat des actions est incertain. GÃĐnÃĐralement, les scÃĐnarios d’apprentissage par renforcement impliquent un certain degrÃĐ d’incertitude, les politiques stochastiques sont donc utilisÃĐes.

Les approches de gradient de politique ont quelques avantages par rapport aux approches d’apprentissage Q, ainsi que quelques inconvÃĐnients. En termes d’avantages, les mÃĐthodes basÃĐes sur les politiques convergent plus rapidement et de maniÃĻre plus fiable vers les paramÃĻtres optimaux. Le gradient de politique peut simplement Être suivi jusqu’à ce que les meilleurs paramÃĻtres soient dÃĐterminÃĐs, tandis que les mÃĐthodes basÃĐes sur les valeurs nÃĐcessitent de petites modifications des valeurs d’action estimÃĐes, ce qui peut conduire à de grandes modifications des actions et de leurs paramÃĻtres associÃĐs.

Les gradients de politique fonctionnent mieux pour les espaces d’action à haute dimension. Lorsqu’il y a un nombre extrÊmement ÃĐlevÃĐ d’actions possibles à prendre, l’apprentissage Q profond devient impraticable car il doit attribuer un score à chaque action possible pour toutes les ÃĐtapes de temps, ce qui peut Être impossible sur le plan computationnel. Cependant, avec les mÃĐthodes basÃĐes sur les politiques, les paramÃĻtres sont ajustÃĐs au fil du temps et le nombre de paramÃĻtres optimaux possibles diminue rapidement à mesure que le modÃĻle converge.

Les gradients de politique sont ÃĐgalement capables de mettre en œuvre des politiques stochastiques, contrairement aux politiques basÃĐes sur les valeurs. Puisque les politiques stochastiques produisent une distribution de probabilitÃĐ, un compromis entre exploration et exploitation n’a pas besoin d’Être mis en œuvre.

En termes d’inconvÃĐnients, le principal inconvÃĐnient des gradients de politique est qu’ils peuvent se bloquer lors de la recherche de paramÃĻtres optimaux, se concentrant uniquement sur un ensemble ÃĐtroit de valeurs optimales locales au lieu des valeurs optimales globales.

Fonction de score de politique

Les politiques utilisÃĐes pour optimiser les performances d’un modÃĻle visent à maximiser une fonction de score – J(Îļ). Si J(Îļ) est une mesure de la qualitÃĐ de notre politique pour atteindre l’objectif souhaitÃĐ, nous pouvons trouver les valeurs de ÂŦ Îļ Âŧ qui nous donnent la meilleure politique. Tout d’abord, nous devons calculer une rÃĐcompense de politique attendue. Nous estimons la rÃĐcompense de politique afin d’avoir un objectif, quelque chose à optimiser. La fonction de score de politique est la façon dont nous calculons la rÃĐcompense de politique attendue, et il existe diffÃĐrentes fonctions de score de politique qui sont couramment utilisÃĐes, telles que : les valeurs de dÃĐpart pour les environnements ÃĐpisodiques, la valeur moyenne pour les environnements continus, et la rÃĐcompense moyenne par ÃĐtape de temps.

MontÃĐe de gradient de politique

La montÃĐe de gradient vise à dÃĐplacer les paramÃĻtres jusqu’à ce qu’ils soient à l’endroit oÃđ le score est le plus ÃĐlevÃĐ. Photo: Public Domain (https://commons.wikimedia.org/wiki/File:Gradient_ascent_(surface).png)

AprÃĻs que la fonction de score de politique souhaitÃĐe est utilisÃĐe, et qu’une rÃĐcompense de politique attendue est calculÃĐe, nous pouvons trouver une valeur pour le paramÃĻtre ÂŦ Îļ Âŧ qui maximise la fonction de score. Pour maximiser la fonction de score J(Îļ), une technique appelÃĐe ÂŦ montÃĐe de gradient Âŧ est utilisÃĐe. La montÃĐe de gradient est similaire au concept de descente de gradient dans l’apprentissage profond, mais nous optimisons pour l’augmentation la plus rapide au lieu de la diminution. C’est parce que notre score n’est pas ÂŦ d’erreur Âŧ, comme dans de nombreux problÃĻmes d’apprentissage profond. Notre score est quelque chose que nous voulons maximiser. Une expression appelÃĐe le thÃĐorÃĻme du gradient de politique est utilisÃĐe pour estimer le gradient par rapport à la politique ÂŦ Îļ Âŧ.

RÃĐsumÃĐ de l’apprentissage par renforcement profond

En rÃĐsumÃĐ, l’apprentissage par renforcement profond combine les aspects de l’apprentissage par renforcement et des rÃĐseaux de neurones profonds. L’apprentissage par renforcement profond est effectuÃĐ avec deux techniques diffÃĐrentes : l’apprentissage Q profond et les gradients de politique.

Les mÃĐthodes d’apprentissage Q visent à prÃĐdire quelles rÃĐcompenses suivront certaines actions prises dans un ÃĐtat donnÃĐ, tandis que les approches de gradient de politique visent à optimiser l’espace d’action, en prÃĐdissant les actions elles-mÊmes. Les approches basÃĐes sur les politiques de l’apprentissage par renforcement profond sont soit dÃĐterministes, soit stochastiques en nature. Les politiques dÃĐterministes cartographient les ÃĐtats directement aux actions, tandis que les politiques stochastiques produisent des distributions de probabilitÃĐ pour les actions.

Blogueur et programmeur avec des spÃĐcialitÃĐs en Machine Learning et Deep Learning sujets. Daniel espÃĻre aider les autres à utiliser le pouvoir de l'IA pour le bien social.