标签: 大模型基础
该标签下的全部文章 "大模型基础".
DPO 入门:不用在线奖励循环,怎样学习偏好
从 chosen/rejected 答案对出发,计算 reference 校准的偏好分差、sigmoid 损失与梯度,解释 DPO 与 PPO、SFT 的区别。
GSPO 入门:把概率比和裁剪移到整条回答
用四个 token 的概率比解释 GSPO 的几何平均、序列级裁剪与梯度,区分它与 GRPO,并说明 MoE 稳定性的适用边界。
DAPO 入门:把长推理训练的四个薄弱环节补起来
逐步解释 Clip-Higher、动态采样、token 级损失聚合和超长奖励处理,配完整链路与能手算的小例子。
ReMax 入门:用贪心答案当作自己的参照
解释随机生成与贪心生成的双路流程,手算奖励差和策略更新,区分贪心基线、最优答案、RLOO 和 critic。