强化学习理论-第4课-值迭代与策略迭代
1. value iteration algorithm:
值迭代上一节已经介绍过:
1.1 policy update:
1.2 Value update:
此时,\(\pi_{k+1}\)和\(v_k\)都是已知的
1.3 procedure summary:
1.4 example:
2. policy iteration algorithm:
Q1:
Q2:
Q3:
2.1 Policy evaluation:
2.2 Policy improvement:
3. truncated policy iteration algorithm
3.1 compare value iteration and policy iteration:
计算一步是value interation,计算无穷多步,就是policy iteration。中间截断一步,就叫做truncated policy iteration
3.2 pseudocode:
【推荐】编程新体验,更懂你的AI,立即体验豆包MarsCode编程助手
【推荐】凌霞软件回馈社区,博客园 & 1Panel & Halo 联合会员上线
【推荐】抖音旗下AI助手豆包,你的智能百科全书,全免费不限次数
【推荐】博客园社区专享云产品让利特惠,阿里云新客6.5折上折
【推荐】轻量又高性能的 SSH 工具 IShell:AI 加持,快人一步