2024 年 6月随笔档案 - jasonzhangxianrong

（六）大模型RLHF：PPO原理与源码解读

摘要：大模型RLHF：PPO原理与源码解读原文链接：图解大模型RLHF系列之：人人都能看懂的PPO原理与源码解读本文直接从一个RLHF开源项目源码入手（deepspeed-chat），根据源码的实现细节，给出尽可能丰富的训练流程图，并对所有的公式给出直观的解释。希望可以帮助大家更具象地感受RLHF的训阅读全文

posted @ 2024-06-30 22:39 jasonzhangxianrong 阅读(4145) 评论(0) 推荐(0) 编辑

（五）DeepSpeed Chat: 一键式RLHF训练，让你的类ChatGPT千亿大模型提速省钱15倍

摘要：DeepSpeed Chat: 一键式RLHF训练，让你的类ChatGPT千亿大模型提速省钱15倍如需引用 DeepSpeed Chat，请引用我们的arxiv report: @article{yao2023dschat, title={{DeepSpeed-Chat: Easy, Fast a 阅读全文

posted @ 2024-06-30 17:46 jasonzhangxianrong 阅读(212) 评论(0) 推荐(0) 编辑

（四）详解RLHF

摘要：一直都特别好奇大模型的强化学习微调是怎么做的，网上虽然相关文章不少，但找到的文章都是浅尝辄止说到用PPO训练，再细致深入的就没有讲了。。。只能自己看一看代码，以前搞过一点用PPO做游戏，感觉和语言模型PPO的用法不太一样。在游戏场景，每个step给环境一个action之后，agent拿到的state 阅读全文

posted @ 2024-06-27 23:08 jasonzhangxianrong 阅读(970) 评论(0) 推荐(0) 编辑

（三）使用 PPO 算法进行 RLHF 的 N 步实现细节

摘要：title: "使用 PPO 算法进行 RLHF 的 N 步实现细节" thumbnail: /blog/assets/167_the_n_implementation_details_of_rlhf_with_ppo/thumbnail.png authors: - user: vwxyzjn - 阅读全文

posted @ 2024-06-27 22:46 jasonzhangxianrong 阅读(255) 评论(0) 推荐(0) 编辑

（二）将强化学习重新引入 RLHF

摘要：title: "将强化学习重新引入 RLHF" thumbnail: /blog/assets/putting_rl_back_in_rlhf_with_rloo/thumbnail.png authors: - user: vwxyzjn - user: ArashAhmadian org: Co 阅读全文

posted @ 2024-06-27 22:30 jasonzhangxianrong 阅读(170) 评论(0) 推荐(0) 编辑

（一）"ChatGPT 背后的“功臣”——RLHF 技术详解"

摘要：title: "ChatGPT 背后的“功臣”——RLHF 技术详解" thumbnail: /blog/assets/120_rlhf/thumbnail.png authors: - user: natolambert - user: LouisCastricato guest: true - 阅读全文

posted @ 2024-06-27 22:25 jasonzhangxianrong 阅读(226) 评论(0) 推荐(0) 编辑

（十三）T5是如何计算损失的

摘要：一、概述 T5 使用常规交叉熵损失（与任何语言模型一样）。假设您正在微调 T5 以进行翻译，并且您有以下训练示例： * source sentence: "hello how are you" * target sentence: "salut comment ça-va" 首先，需要使用对模型阅读全文

posted @ 2024-06-16 21:41 jasonzhangxianrong 阅读(387) 评论(0) 推荐(0) 编辑

（九）为分类和多项选择任务调优T5

摘要：1、T5微调本笔记展示如何使用Huggingface的Transformers对T5模型进行微调，以解决不同的自然语言处理任务，使用了T5论文中提出的文本-文本方法。为了演示，我选择了3个非文本-文本问题，只是为了重申论文中所述的这种文本-文本框架有多广泛适用，以及如何在完全不改变模型的情况下用于阅读全文

posted @ 2024-06-02 20:17 jasonzhangxianrong 阅读(233) 评论(0) 推荐(0) 编辑

06 2024 档案

公告