Natural Policy Gradient

E441106

Natural Policy Gradient is a reinforcement learning optimization method that improves policy gradient updates by accounting for the geometry of the parameter space using the Fisher information matrix, leading to more stable and efficient learning.

All labels observed (4)

How this entity was disambiguated

Statements (46)

Predicate Object
instanceOf optimization method ⓘ
policy gradient method ⓘ
reinforcement learning algorithm ⓘ
aimsFor better-conditioned updates ⓘ
more sample-efficient learning ⓘ
more stable learning ⓘ
appliedIn continuous control ⓘ
episodic reinforcement learning ⓘ
robotics ⓘ
assumes differentiable policy parameterization ⓘ
basedOn natural gradient ⓘ
canBeApproximatedBy Kronecker-factored approximations ⓘ
conjugate gradient methods ⓘ
canUse compatible function approximation ⓘ
challenge computational cost of Fisher matrix inversion ⓘ
convergenceProperty often more robust than vanilla policy gradient ⓘ
describedIn A Natural Policy Gradient ⓘ
estimationMethod Monte Carlo sampling ⓘ
linked to: Monte Carlo method

likelihood ratio gradient estimator ⓘ
field machine learning ⓘ
reinforcement learning ⓘ
goal maximize expected return ⓘ
improvesOver standard policy gradient ⓘ
inspired Truncated Natural Policy Gradient ⓘ
Trust Region Policy Optimization ⓘ
introducedBy Sham Kakade ⓘ
mathematicalFoundation Riemannian optimization ⓘ
information geometry ⓘ
objectiveType on-policy objective ⓘ
optimizes parameterized policy ⓘ
stochastic policy ⓘ
property accounts for geometry of parameter space ⓘ
invariant to smooth reparameterizations ⓘ
uses Riemannian metric induced by Fisher information ⓘ
publicationYear 2001 ⓘ
relatedTo Actor-Critic methods ⓘ
Proximal Policy Optimization ⓘ
Trust Region Policy Optimization ⓘ
requires estimation of Fisher information matrix ⓘ
updateRule theta_{k+1} = theta_k + alpha * F^{-1} * g ⓘ
updateType first-order method in natural gradient space ⓘ
usedWith linear policies ⓘ
neural network policies ⓘ
uses Fisher information matrix ⓘ
linked to: Fisher information

inverse Fisher matrix F^{-1} ⓘ
policy gradient g ⓘ

How these facts were elicited

Referenced by (4)

Full triples — surface form annotated when it differs from this entity's canonical label.

TRPO → relatedTo → Natural Policy Gradient ⓘ
Actor-Critic using Kronecker-Factored Trust Region → relatedTo → Trust Region Policy Optimization ⓘ
linked to: Natural Policy Gradient
Natural Policy Gradient → describedIn → A Natural Policy Gradient ⓘ
linked to: Natural Policy Gradient
Natural Policy Gradient → inspired → Truncated Natural Policy Gradient ⓘ
linked to: Natural Policy Gradient