全部文章
关于学习、实践与思考的持续记录。
ReMax 入门:用贪心答案当作自己的参照
解释随机生成与贪心生成的双路流程,手算奖励差和策略更新,区分贪心基线、最优答案、RLOO 和 critic。
RLOO 入门:把自己的奖励从基线里拿出去
用四个回答计算 leave-one-out 基线,说明 RLOO 如何构造 REINFORCE 梯度,以及它与 GRPO、PPO 的关系和差异。
GRPO 入门:不用 critic,怎样用一组答案计算优势
从同一道题采样四个答案开始,手算组内奖励标准化与 token 裁剪,解释 GRPO 的完整流程、零优势组和 KL 正则。
PPO 从零讲清:旧概率、新概率与裁剪更新
沿完整 RLHF 链路解释 PPO-Clip,手算正负优势的概率比与裁剪,讲清 old policy、reference、critic 和奖励的不同职责。