Fondamentaux de lâIA
Qu’est-ce que l’apprentissage par renforcement profond ?
Quâest-ce que lâapprentissage par renforcement profond ?
En plus de lâapprentissage automatique non supervisÃĐ et de lâapprentissage supervisÃĐ, une autre forme courante de crÃĐation dâIA est lâapprentissage par renforcement. Au-delà de lâapprentissage par renforcement classique, lâapprentissage par renforcement profond peut conduire à des rÃĐsultats impressionnants, grÃĒce au fait quâil combine les meilleurs aspects de lâapprentissage profond et de lâapprentissage par renforcement. Examinons comment fonctionne lâapprentissage par renforcement profond.
Avant de plonger dans lâapprentissage par renforcement profond, il pourrait Être utile de rafraÃŪchir nos connaissances sur la façon dont fonctionne lâapprentissage par renforcement classique. Dans lâapprentissage par renforcement, des algorithmes orientÃĐs vers les objectifs sont conçus à travers un processus dâessais et dâerreurs, en optimisant lâaction qui conduit au meilleur rÃĐsultat, ou à lâaction qui obtient la plus grande ÂŦ rÃĐcompense Âŧ. Lorsque les algorithmes dâapprentissage par renforcement sont formÃĐs, ils reçoivent des ÂŦ rÃĐcompenses Âŧ ou des ÂŦ punitions Âŧ qui influencent les actions quâils prendront à lâavenir. Les algorithmes tentent de trouver un ensemble dâactions qui procureront au systÃĻme la plus grande rÃĐcompense, en ÃĐquilibrant à la fois les rÃĐcompenses immÃĐdiates et futures.
Les algorithmes dâapprentissage par renforcement sont trÃĻs puissants car ils peuvent Être appliquÃĐs à presque toutes les tÃĒches, pouvant apprendre de maniÃĻre flexible et dynamique à partir dâun environnement et dÃĐcouvrir des actions possibles.
PrÃĐsentation de lâapprentissage par renforcement profond

Photo: Megajuice via Wikimedia Commons, CC 1.0 (https://commons.wikimedia.org/wiki/File:Reinforcement_learning_diagram.svg)
Lorsquâil sâagit dâapprentissage par renforcement profond, lâenvironnement est gÃĐnÃĐralement reprÃĐsentÃĐ par des images. Une image est une capture de lâenvironnement à un moment prÃĐcis. Lâagent doit analyser les images et extraire les informations pertinentes, en utilisant ces informations pour dÃĐterminer quelle action prendre. Lâapprentissage par renforcement profond est gÃĐnÃĐralement effectuÃĐ avec lâune des deux techniques suivantes : lâapprentissage basÃĐ sur les valeurs et lâapprentissage basÃĐ sur les politiques.
Les techniques dâapprentissage basÃĐ sur les valeurs utilisent des algorithmes et des architectures tels que les rÃĐseaux de neurones convolutifs et les rÃĐseaux Q profonds. Ces algorithmes fonctionnent en convertissant lâimage en niveaux de gris et en supprimant les parties inutiles de lâimage. Ensuite, lâimage subit diverses convolutions et opÃĐrations de regroupement, en extrayant les parties les plus pertinentes de lâimage. Les parties importantes de lâimage sont ensuite utilisÃĐes pour calculer la valeur Q pour les diffÃĐrentes actions que lâagent peut prendre. Les valeurs Q sont utilisÃĐes pour dÃĐterminer la meilleure action pour lâagent. AprÃĻs que les valeurs Q initiales soient calculÃĐes, une rÃĐtropropagation est effectuÃĐe afin que les valeurs Q les plus prÃĐcises puissent Être dÃĐterminÃĐes.
Les mÃĐthodes basÃĐes sur les politiques sont utilisÃĐes lorsque le nombre dâactions possibles que lâagent peut prendre est extrÊmement ÃĐlevÃĐ, ce qui est gÃĐnÃĐralement le cas dans les scÃĐnarios du monde rÃĐel. De telles situations nÃĐcessitent une approche diffÃĐrente, car le calcul des valeurs Q pour toutes les actions individuelles nâest pas pratique. Les approches basÃĐes sur les politiques adoptent des politiques en apprenant directement la politique, souvent à lâaide de techniques appelÃĐes gradients de politique.
Les gradients de politique fonctionnent en recevant un ÃĐtat et en calculant des probabilitÃĐs pour les actions en fonction des expÃĐriences antÃĐrieures de lâagent. Lâaction la plus probable est ensuite sÃĐlectionnÃĐe. Ce processus est rÃĐpÃĐtÃĐ jusquâà la fin de la pÃĐriode dâÃĐvaluation et les rÃĐcompenses sont attribuÃĐes à lâagent. AprÃĻs que les rÃĐcompenses aient ÃĐtÃĐ attribuÃĐes à lâagent, les paramÃĻtres du rÃĐseau sont mis à jour à lâaide de la rÃĐtropropagation.
Quâest-ce que lâapprentissage Q ?
Puisque lâapprentissage Q est une grande partie du processus dâapprentissage par renforcement profond, examinons comment fonctionne le systÃĻme dâapprentissage Q.
Le processus de dÃĐcision markovien

Un processus de dÃĐcision markovien. Photo: waldoalvarez via Pixabay, Pixbay License (https://commons.wikimedia.org/wiki/File:Markov_Decision_Process.svg)
Afin quâun agent dâIA puisse effectuer une sÃĐrie de tÃĒches et atteindre un objectif, lâagent doit Être capable de gÃĐrer une sÃĐquence dâÃĐtats et dâÃĐvÃĐnements. Lâagent commence à un ÃĐtat et doit prendre une sÃĐrie dâactions pour atteindre un ÃĐtat final, et il peut y avoir un nombre massif dâÃĐtats entre le dÃĐbut et la fin. Stocker des informations sur chaque ÃĐtat est impraticable ou impossible, lâagent doit donc trouver un moyen de conserver uniquement les informations les plus pertinentes sur lâÃĐtat. Cela est rÃĐalisÃĐ Ã lâaide dâun processus de dÃĐcision markovien, qui conserve uniquement les informations sur lâÃĐtat actuel et lâÃĐtat prÃĐcÃĐdent. Chaque ÃĐtat suit une propriÃĐtÃĐ markovienne, qui suit la façon dont lâagent change de lâÃĐtat prÃĐcÃĐdent à lâÃĐtat actuel.
Lâapprentissage Q profond
Une fois que le modÃĻle a accÃĻs aux informations sur les ÃĐtats de lâenvironnement dâapprentissage, les valeurs Q peuvent Être calculÃĐes. Les valeurs Q sont la rÃĐcompense totale attribuÃĐe à lâagent à la fin dâune sÃĐquence dâactions.
Les valeurs Q sont calculÃĐes à lâaide dâune sÃĐrie de rÃĐcompenses. Il y a une rÃĐcompense immÃĐdiate, calculÃĐe à lâÃĐtat actuel et en fonction de lâaction actuelle. La valeur Q pour lâÃĐtat suivant est ÃĐgalement calculÃĐe, ainsi que la valeur Q pour lâÃĐtat aprÃĻs celui-ci, et ainsi de suite jusquâà ce que toutes les valeurs Q pour les diffÃĐrents ÃĐtats soient calculÃĐes. Il y a ÃĐgalement un paramÃĻtre Gamma qui est utilisÃĐ pour contrÃīler le poids des rÃĐcompenses futures sur les actions de lâagent. Les politiques sont gÃĐnÃĐralement calculÃĐes en initialisant alÃĐatoirement les valeurs Q et en laissant le modÃĻle converger vers les valeurs Q optimales au cours de la formation.
Les rÃĐseaux Q profonds
Lâun des problÃĻmes fondamentaux liÃĐs à lâutilisation de lâapprentissage Q pour lâapprentissage par renforcement est que la quantitÃĐ de mÃĐmoire requise pour stocker les donnÃĐes augmente rapidement à mesure que le nombre dâÃĐtats augmente. Les rÃĐseaux Q profonds rÃĐsolvent ce problÃĻme en combinant des modÃĻles de rÃĐseaux de neurones avec des valeurs Q, permettant à un agent dâapprendre à partir de lâexpÃĐrience et de faire des suppositions raisonnables sur les meilleures actions à prendre. Avec lâapprentissage Q profond, les fonctions de valeur Q sont estimÃĐes à lâaide de rÃĐseaux de neurones. Le rÃĐseau de neurones prend lâÃĐtat en tant que donnÃĐes dâentrÃĐe, et le rÃĐseau produit la valeur Q pour toutes les actions possibles que lâagent peut prendre.
Lâapprentissage Q profond est rÃĐalisÃĐ en stockant toutes les expÃĐriences passÃĐes en mÃĐmoire, en calculant les sorties maximales pour le rÃĐseau Q, puis en utilisant une fonction de perte pour calculer la diffÃĐrence entre les valeurs actuelles et les valeurs thÃĐoriques les plus ÃĐlevÃĐes possibles.
Lâapprentissage par renforcement profond vs lâapprentissage profond
Une diffÃĐrence importante entre lâapprentissage par renforcement profond et lâapprentissage profond classique est que, dans le cas du premier, les entrÃĐes sont constamment changeantes, ce qui nâest pas le cas dans lâapprentissage profond classique. Comment le modÃĻle dâapprentissage peut-il tenir compte des entrÃĐes et des sorties qui changent constamment ?
En essence, pour tenir compte de la divergence entre les valeurs prÃĐvues et les valeurs cibles, deux rÃĐseaux de neurones peuvent Être utilisÃĐs au lieu dâun seul. Un rÃĐseau estime les valeurs cibles, tandis que lâautre rÃĐseau est responsable des prÃĐdictions. Les paramÃĻtres du rÃĐseau cible sont mis à jour à mesure que le modÃĻle apprend, aprÃĻs un certain nombre dâitÃĐrations dâentraÃŪnement. Les sorties des rÃĐseaux respectifs sont ensuite combinÃĐes pour dÃĐterminer la diffÃĐrence.
Apprentissage basÃĐ sur les politiques
Les approches dâapprentissage basÃĐ sur les politiques fonctionnent diffÃĐremment des approches basÃĐes sur les valeurs Q. Alors que les approches basÃĐes sur les valeurs Q crÃĐent une fonction de valeur qui prÃĐdit les rÃĐcompenses pour les ÃĐtats et les actions, les mÃĐthodes basÃĐes sur les politiques dÃĐterminent une politique qui cartographie les ÃĐtats aux actions. En dâautres termes, la fonction de politique qui sÃĐlectionne les actions est directement optimisÃĐe sans tenir compte de la fonction de valeur.
Les gradients de politique
Une politique pour lâapprentissage par renforcement profond tombe dans lâune des deux catÃĐgories suivantes : stochastique ou dÃĐterministe. Une politique dÃĐterministe est celle oÃđ les ÃĐtats sont cartographiÃĐs aux actions, ce qui signifie que lorsque la politique est donnÃĐe des informations sur un ÃĐtat, une action est renvoyÃĐe. En revanche, les politiques stochastiques renvoient une distribution de probabilitÃĐ pour les actions au lieu dâune seule action discrÃĻte.
Les politiques dÃĐterministes sont utilisÃĐes lorsquâil nây a pas dâincertitude quant aux rÃĐsultats des actions qui peuvent Être prises. En dâautres termes, lorsque lâenvironnement lui-mÊme est dÃĐterministe. En revanche, les sorties de politiques stochastiques sont appropriÃĐes pour les environnements oÃđ le rÃĐsultat des actions est incertain. GÃĐnÃĐralement, les scÃĐnarios dâapprentissage par renforcement impliquent un certain degrÃĐ dâincertitude, les politiques stochastiques sont donc utilisÃĐes.
Les approches de gradient de politique ont quelques avantages par rapport aux approches dâapprentissage Q, ainsi que quelques inconvÃĐnients. En termes dâavantages, les mÃĐthodes basÃĐes sur les politiques convergent plus rapidement et de maniÃĻre plus fiable vers les paramÃĻtres optimaux. Le gradient de politique peut simplement Être suivi jusquâà ce que les meilleurs paramÃĻtres soient dÃĐterminÃĐs, tandis que les mÃĐthodes basÃĐes sur les valeurs nÃĐcessitent de petites modifications des valeurs dâaction estimÃĐes, ce qui peut conduire à de grandes modifications des actions et de leurs paramÃĻtres associÃĐs.
Les gradients de politique fonctionnent mieux pour les espaces dâaction à haute dimension. Lorsquâil y a un nombre extrÊmement ÃĐlevÃĐ dâactions possibles à prendre, lâapprentissage Q profond devient impraticable car il doit attribuer un score à chaque action possible pour toutes les ÃĐtapes de temps, ce qui peut Être impossible sur le plan computationnel. Cependant, avec les mÃĐthodes basÃĐes sur les politiques, les paramÃĻtres sont ajustÃĐs au fil du temps et le nombre de paramÃĻtres optimaux possibles diminue rapidement à mesure que le modÃĻle converge.
Les gradients de politique sont ÃĐgalement capables de mettre en Åuvre des politiques stochastiques, contrairement aux politiques basÃĐes sur les valeurs. Puisque les politiques stochastiques produisent une distribution de probabilitÃĐ, un compromis entre exploration et exploitation nâa pas besoin dâÊtre mis en Åuvre.
En termes dâinconvÃĐnients, le principal inconvÃĐnient des gradients de politique est quâils peuvent se bloquer lors de la recherche de paramÃĻtres optimaux, se concentrant uniquement sur un ensemble ÃĐtroit de valeurs optimales locales au lieu des valeurs optimales globales.
Fonction de score de politique
Les politiques utilisÃĐes pour optimiser les performances dâun modÃĻle visent à maximiser une fonction de score â J(Îļ). Si J(Îļ) est une mesure de la qualitÃĐ de notre politique pour atteindre lâobjectif souhaitÃĐ, nous pouvons trouver les valeurs de ÂŦ Îļ Âŧ qui nous donnent la meilleure politique. Tout dâabord, nous devons calculer une rÃĐcompense de politique attendue. Nous estimons la rÃĐcompense de politique afin dâavoir un objectif, quelque chose à optimiser. La fonction de score de politique est la façon dont nous calculons la rÃĐcompense de politique attendue, et il existe diffÃĐrentes fonctions de score de politique qui sont couramment utilisÃĐes, telles que : les valeurs de dÃĐpart pour les environnements ÃĐpisodiques, la valeur moyenne pour les environnements continus, et la rÃĐcompense moyenne par ÃĐtape de temps.
MontÃĐe de gradient de politique

La montÃĐe de gradient vise à dÃĐplacer les paramÃĻtres jusquâà ce quâils soient à lâendroit oÃđ le score est le plus ÃĐlevÃĐ. Photo: Public Domain (https://commons.wikimedia.org/wiki/File:Gradient_ascent_(surface).png)
AprÃĻs que la fonction de score de politique souhaitÃĐe est utilisÃĐe, et quâune rÃĐcompense de politique attendue est calculÃĐe, nous pouvons trouver une valeur pour le paramÃĻtre ÂŦ Îļ Âŧ qui maximise la fonction de score. Pour maximiser la fonction de score J(Îļ), une technique appelÃĐe ÂŦ montÃĐe de gradient Âŧ est utilisÃĐe. La montÃĐe de gradient est similaire au concept de descente de gradient dans lâapprentissage profond, mais nous optimisons pour lâaugmentation la plus rapide au lieu de la diminution. Câest parce que notre score nâest pas ÂŦ dâerreur Âŧ, comme dans de nombreux problÃĻmes dâapprentissage profond. Notre score est quelque chose que nous voulons maximiser. Une expression appelÃĐe le thÃĐorÃĻme du gradient de politique est utilisÃĐe pour estimer le gradient par rapport à la politique ÂŦ Îļ Âŧ.
RÃĐsumÃĐ de lâapprentissage par renforcement profond
En rÃĐsumÃĐ, lâapprentissage par renforcement profond combine les aspects de lâapprentissage par renforcement et des rÃĐseaux de neurones profonds. Lâapprentissage par renforcement profond est effectuÃĐ avec deux techniques diffÃĐrentes : lâapprentissage Q profond et les gradients de politique.
Les mÃĐthodes dâapprentissage Q visent à prÃĐdire quelles rÃĐcompenses suivront certaines actions prises dans un ÃĐtat donnÃĐ, tandis que les approches de gradient de politique visent à optimiser lâespace dâaction, en prÃĐdissant les actions elles-mÊmes. Les approches basÃĐes sur les politiques de lâapprentissage par renforcement profond sont soit dÃĐterministes, soit stochastiques en nature. Les politiques dÃĐterministes cartographient les ÃĐtats directement aux actions, tandis que les politiques stochastiques produisent des distributions de probabilitÃĐ pour les actions.












