A Universal Empirical Dynamic Programming Algorithm for Continuous State MDPs

We propose universal randomized function approximation-based empirical value learning (EVL) algorithms for Markov decision processes. The "empirical" nature comes from each iteration being done empirically from samples available from simulations of the next state. This makes the Bellman op...

Celý popis

Uloženo v:

Podrobná bibliografie
Vydáno v:	IEEE transactions on automatic control Ročník 65; číslo 1; s. 115 - 129
Hlavní autoři:	Haskell, William B., Jain, Rahul, Sharma, Hiteshi, Yu, Pengqian
Médium:	Journal Article
Jazyk:	angličtina
Vydáno:	New York IEEE 01.01.2020 The Institute of Electrical and Electronics Engineers, Inc. (IEEE)
Témata:	Algorithms Approximation Approximation algorithms Basis functions Complexity theory Computer simulation Continuous state-space Markov decision processes (MDPs) Convergence Dynamic programming dynamic programming (DP) Empirical analysis Function approximation Function space Heuristic algorithms Hilbert space Iterative methods Machine learning Markov processes Mathematical analysis Operators (mathematics) Probabilistic logic reinforcement learning (RL)
ISSN:	0018-9286, 1558-2523
On-line přístup:	Získat plný text
Tagy:	Přidat tag Žádné tagy, Buďte první, kdo vytvoří štítek k tomuto záznamu!

Buďte první, kdo okomentuje tento záznam!