会员
周边
捐助
新闻
博问
闪存
赞助商
Chat2DB
所有博客
当前博客
我的博客
我的园子
账号设置
简洁模式
...
退出登录
注册
登录
月出兮彩云归 🌙
首页
新随笔
联系
订阅
管理
2024年1月21日
offline RL | ABM:从 offline dataset 的好 transition 提取 prior policy
摘要: 对于 policy improvement,maximize Q(s, π(s)) ,同时约束 π 与一个 prior policy 的 KL 散度,prior policy 用 advantage 非负的 offline 状态转移计算。
阅读全文
posted @ 2024-01-21 11:26 MoonOut
阅读(99)
评论(0)
推荐(0)
编辑
PbRL | 速通 ICLR 2024 RLHF · PbRL
摘要: OpenReview 检索关键词:ICLR 2024、reinforcement learning、preference、human feedback。
阅读全文
posted @ 2024-01-21 11:17 MoonOut
阅读(345)
评论(0)
推荐(0)
编辑
公告