全部文章
关于学习、实践与思考的持续记录。
Python 后端面经导读:48 个常见问题,怎样从会背到会讲
面向实习与初中级 Python 后端的复习路线,串起语言、异步、Web、MySQL、Redis、接口与排障六篇面经。
DPO 入门:不用在线奖励循环,怎样学习偏好
从 chosen/rejected 答案对出发,计算 reference 校准的偏好分差、sigmoid 损失与梯度,解释 DPO 与 PPO、SFT 的区别。
GSPO 入门:把概率比和裁剪移到整条回答
用四个 token 的概率比解释 GSPO 的几何平均、序列级裁剪与梯度,区分它与 GRPO,并说明 MoE 稳定性的适用边界。
DAPO 入门:把长推理训练的四个薄弱环节补起来
逐步解释 Clip-Higher、动态采样、token 级损失聚合和超长奖励处理,配完整链路与能手算的小例子。