Sobes.tech
Middle — Senior

Qu'est-ce que le gradient de politique et quelle est la théorème du gradient de politique?

sobes.tech IA

Réponse de l'IA

Le Gradient de Politique est une classe de méthodes en apprentissage par renforcement qui optimisent directement la stratégie paramétrique (politique) en utilisant la descente de gradient.

Au lieu d’évaluer la fonction de valeur, les méthodes de gradient de politique mettent à jour les paramètres de la politique pour augmenter la récompense attendue.

Le Théorème du Gradient de Politique exprime formellement le gradient de la récompense attendue par rapport aux paramètres de la politique:

[ \nabla_\theta J(\theta) = \mathbb{E}{\pi\theta} \left[ \nabla_\theta \log \pi_\theta(a|s) Q^{\pi_\theta}(s,a) \right] ]

où:

  • (J(\theta)) — récompense attendue avec la politique paramétrée par (\theta)
  • (\pi_\theta(a|s)) — probabilité de l’action (a) dans l’état (s)
  • (Q^{\pi_\theta}(s,a)) — fonction de valeur de l’action

Cette expression permet d’estimer le gradient à l’aide d’échantillons de l’environnement et de mettre à jour les paramètres de la politique dans la direction d’augmentation de la récompense.

Exemple d’une mise à jour simple des paramètres:

# pseudo-code
pour chaque épisode:
    collecter la trajectoire en utilisant la politique pi_theta
    pour chaque (s, a, récompense) dans la trajectoire:
        grad = grad + grad_log_pi_theta(a|s) * récompense
    theta = theta + taux_d_apprentissage * grad

Les méthodes de gradient de politique sont largement utilisées pour entraîner des stratégies complexes, notamment lorsque l’espace d’actions est continu ou lorsque la politique doit être stochastique.