2018 年 9月随笔档案 - 刘建平Pinard

强化学习（八）价值函数的近似表示与Deep Q-Learning

摘要：在强化学习系列的前七篇里，我们主要讨论的都是规模比较小的强化学习问题求解算法。今天开始我们步入深度强化学习。这一篇关注于价值函数的近似表示和Deep Q-Learning算法。 Deep Q-Learning这一篇对应Sutton书的第11章部分和UCL强化学习课程的第六讲。 1. 为何需要价值函数阅读全文

posted @ 2018-09-28 16:49 刘建平Pinard 阅读(88575) 评论(203) 推荐(13) 编辑

强化学习（七）时序差分离线控制算法Q-Learning

摘要：在强化学习（六）时序差分在线控制算法SARSA中我们讨论了时序差分的在线控制算法SARSA，而另一类时序差分的离线控制算法还没有讨论，因此本文我们关注于时序差分离线控制算法，主要是经典的Q-Learning算法。 Q-Learning这一篇对应Sutton书的第六章部分和UCL强化学习课程的第五讲部阅读全文

posted @ 2018-09-19 19:32 刘建平Pinard 阅读(60716) 评论(109) 推荐(15) 编辑

强化学习（六）时序差分在线控制算法SARSA

摘要：在强化学习（五）用时序差分法（TD）求解中，我们讨论了用时序差分来求解强化学习预测问题的方法，但是对控制算法的求解过程没有深入，本文我们就对时序差分的在线控制算法SARSA做详细的讨论。 SARSA这一篇对应Sutton书的第六章部分和UCL强化学习课程的第五讲部分。 1. SARSA算法的引入 S 阅读全文

posted @ 2018-09-09 19:30 刘建平Pinard 阅读(59917) 评论(87) 推荐(10) 编辑

刘建平Pinard

十五年码农，对数学统计学，数据挖掘，机器学习，大数据平台，大数据平台应用开发，大数据可视化感兴趣。

09 2018 档案

公告

积分与排名

随笔分类 (135)

随笔档案 (135)

常去的机器学习网站

阅读排行榜

评论排行榜

推荐排行榜