Trust Region Policy Optimization

E1284589 UNEXPLORED

Trust Region Policy Optimization is a reinforcement learning algorithm that improves policy performance by making stable, constrained updates that limit how much each new policy can deviate from the previous one.

All labels observed (1)

Label Occurrences
Trust Region Policy Optimization canonical 2

How this entity was disambiguated

Referenced by (2)

Full triples — surface form annotated when it differs from this entity's canonical label.

Natural Policy Gradient inspired Trust Region Policy Optimization
Natural Policy Gradient relatedTo Trust Region Policy Optimization