标签: 大模型后训练
该标签下的全部文章 "大模型后训练".
REINFORCE 入门:奖励怎样变成模型的梯度
用一个只有两个候选答案的模型,手算 REINFORCE 的概率、损失、梯度和 SGD 更新,理解基线、方差与完整在线训练流程。
大模型强化学习导读:先看懂训练链路,再学九种方法
从 prompt、rollout、奖励与优势到参数更新,串起 REINFORCE、Actor-Critic、PPO、GRPO、RLOO、ReMax、DAPO、GSPO 与 DPO 的入门学习路线。
该标签下的全部文章 "大模型后训练".
用一个只有两个候选答案的模型,手算 REINFORCE 的概率、损失、梯度和 SGD 更新,理解基线、方差与完整在线训练流程。
从 prompt、rollout、奖励与优势到参数更新,串起 REINFORCE、Actor-Critic、PPO、GRPO、RLOO、ReMax、DAPO、GSPO 与 DPO 的入门学习路线。