01 2019 档案

强化学习(十五) A3C

摘要：在强化学习(十四) Actor-Critic中，我们讨论了Actor-Critic的算法流程，但是由于普通的Actor-Critic算法难以收敛，需要一些其他的优化。而Asynchronous Advantage Actor-critic(以下简称A3C)就是其中比较好的优化算法。本文我们讨论A3C 阅读全文

posted @ 2019-01-29 18:09 刘建平Pinard 阅读(70694) 评论(144) 推荐(4) 编辑

强化学习(十四) Actor-Critic

摘要：在强化学习(十三) 策略梯度(Policy Gradient)中，我们讲到了基于策略(Policy Based)的强化学习方法的基本思路，并讨论了蒙特卡罗策略梯度reinforce算法。但是由于该算法需要完整的状态序列，同时单独对策略函数进行迭代更新，不太容易收敛。在本篇我们讨论策略(Policy 阅读全文

posted @ 2019-01-15 17:46 刘建平Pinard 阅读(112925) 评论(148) 推荐(9) 编辑

公告

★珠江追梦，饮岭南茶，恋鄂北家★

你的支持是我写作的动力：

刘建平Pinard

十五年码农，对数学统计学，数据挖掘，机器学习，大数据平台，大数据平台应用开发，大数据可视化感兴趣。

01 2019 档案

公告

积分与排名

随笔分类 (135)

随笔档案 (135)

常去的机器学习网站

阅读排行榜

评论排行榜

推荐排行榜