Jarod Leo
  • 首页
  • 归档
  • 分类
  • 标签
  • 项目
  • 友链
  • 关于
首页
归档
分类
标签
项目
友链
关于
搜索
关灯

Jarod Leo

PPO理论解析

PPO理论解析

RLHF中的PPO算法1.动机PPO算法是后续很多RLHF/RLVR强化学习微调算法的基础,因此了解它的底层原理。对于后续理解很多RL算法乃至在这个基础上改进算法是很重要的。本篇博客希望能够记录PPO算法的学习过程,并提供一个较为全面的分析视角。 2.RLHF-PPO数学结构为了方便下面的数学建模,我们需要先定义强化学习中的几个基本要素也就是:状态空间(State Space)、动作空间
2026-06-17
LLM强化学习
#强化学习 #RLHF
第一篇文章:从这里开始

第一篇文章:从这里开始

使用 Hexo、Fluid 主题和 GitHub Pages 搭建 Jarod Leo 的个人网站。
2026-06-16
技术 > 博客搭建
#Hexo #GitHub Pages #个人网站

搜索

Copyright © Jarod Leo