Relative Entropy of Correct Proximal Policy Optimization Algorithms with Modified Penalty Factor in Complex Environment

In the field of reinforcement learning, we propose a Correct Proximal Policy Optimization (CPPO) algorithm based on the modified penalty factor β and relative entropy in order to solve the robustness and stationarity of traditional algorithms. Firstly, In the process of reinforcement learning, this...

Celý popis

Uloženo v:

Podrobná bibliografie
Vydáno v:	Entropy (Basel, Switzerland) Ročník 24; číslo 4; s. 440
Hlavní autoři:	Chen, Weimin, Wong, Kelvin Kian Loong, Long, Sifan, Sun, Zhili
Médium:	Journal Article
Jazyk:	angličtina
Vydáno:	Switzerland MDPI AG 22.03.2022 MDPI
Témata:	Algorithms Approximation approximation theory Complexity Convergence correct proximal policy optimization Deep learning Distribution functions Entropy Information theory Iterative methods Kernel functions Machine learning Mathematical models Neural networks Optimization Optimization algorithms policy gradient Random variables reinforcement learning Research methodology Teaching methods approximation theory correct proximal policy optimization entropy optimization policy gradient reinforcement learning
ISSN:	1099-4300, 1099-4300
On-line přístup:	Získat plný text
Tagy:	Přidat tag Žádné tagy, Buďte první, kdo vytvoří štítek k tomuto záznamu!

Buďte první, kdo okomentuje tento záznam!