标签: 强化学习
该标签下的全部文章 "强化学习".
RLOO 入门:把自己的奖励从基线里拿出去
用四个回答计算 leave-one-out 基线,说明 RLOO 如何构造 REINFORCE 梯度,以及它与 GRPO、PPO 的关系和差异。
GRPO 入门:不用 critic,怎样用一组答案计算优势
从同一道题采样四个答案开始,手算组内奖励标准化与 token 裁剪,解释 GRPO 的完整流程、零优势组和 KL 正则。
PPO 从零讲清:旧概率、新概率与裁剪更新
沿完整 RLHF 链路解释 PPO-Clip,手算正负优势的概率比与裁剪,讲清 old policy、reference、critic 和奖励的不同职责。
Actor-Critic 与 GAE:谁来判断这一步比预期好多少
区分 actor、critic、reward model 和 reference,借三步生成例子手算 TD 误差与 GAE,解释策略与价值函数怎样协同训练。