Solving controlled Markov set-chains with discounting via multipolicy improvement

Citations

WEB OF SCIENCE

2
Citations

SCOPUS

1

초록

We consider Markov decision processes (MDPs) where the state transition probability distributions are not uniquely known, but are known to belong to some intervals-so called "controlled Markov set-chains"-with infinite-horizon discounted reward criteria. We present formal methods to improve multiple policies for solving such controlled Markov set-chains. Our multipolicy improvement methods follow the spirit of parallel rollout and policy switching for solving MDPs. In particular, these methods are useful for online control of Markov set-chains and for designing policy iteration (PI) type algorithms. We develop a PI-type algorithm and prove that it converges to an optimal policy.

키워드

controlled Markov processMarkov decision process (MDP)Markov set-chainpolicy iterationrolloutDECISION-PROCESSES
제목
Solving controlled Markov set-chains with discounting via multipolicy improvement
저자
Chang, Hyeong SooChong, Edwin K. P.
DOI
10.1109/TAC.2007.892381
발행일
2007-03
유형
Article
저널명
IEEE Transactions on Automatic Control
52
3
페이지
564 ~ 569